Z.ai 在 2026 年 8 月 26 日公開 GLM-5.3-Flash,這款模型採用 320B 總參數、每 Token 約 18B active 的 MoE 架構,提供最高約 1M Context,並成為 GLM-5 系列第一款原生多模態模型。對正在做 Coding Agent、瀏覽器操作、文件處理或長程工具任務的團隊,它值得立即測試;但更合理的入口是 API Canary,而不是因為「18B active」就急著下載完整權重。
重點快讀
- GLM-5.3-Flash 有 320B 總參數、18B active,官方權重採 MIT License 公開。
- 模型加入原生多模態與約 1M Context,Function Calling、Reasoning 等 Agent 能力已在主要供應入口出現。
- 這是 GLM 系列首次結合 linear attention 與 sparse attention,主要目的在降低長 Context 推論成本。
- Z.ai 公布的 DeepSWE、AutomationBench 與 Terminal-Bench 成績明顯高於 GLM-5.2,但仍屬特定 Harness 與參數下的官方結果。
- 對一般開發者,最值得追蹤的指標是「每個真正完成且通過驗收的 Job 成本」,而不是單獨比較 Benchmark 排名。
GLM-5.3-Flash 的 18B active 代表什麼?
18B active 不代表 GLM-5.3-Flash 是一個只需要載入 18B 參數的模型。
GLM-5.3-Flash 的完整模型規模仍然是 320B。MoE 架構只是在每個 Token 推論時選擇部分 expert 參與計算,因此可以降低單 Token 的運算量,但完整 expert weights 仍需要存在於 GPU、CPU RAM 或其他可存取的記憶體層級。
這也是判斷本機部署時最容易出現的誤解。
如果你的目標只是測試 Coding Agent、視覺回讀或長 Context 工作流,直接使用 API 通常比為完整模型準備多 GPU、RAM offload 與 serving stack 更合理。
為什麼 linear attention+sparse attention 很重要?
GLM-5.3-Flash 是 GLM 系列第一次把 linear attention 與 sparse attention 放進同一套架構。
Linear attention 主要處理局部依賴與狀態;sparse attention 則透過 indexer 從較大的上下文裡找出真正需要回看的資訊。Z.ai 另外加入 IndexPool,在 1M Context 下壓縮 indexer 的 key vector,以減少記憶體與延遲負擔。
Z.ai 公布的架構比較顯示,相較 GLM-5.3,GLM-5.3-Flash 的 attention compute 約減少 3 倍,KV Cache 約縮小 4.4 倍。
這組數字需要正確理解:它是架構層級、指定計算方式下的官方比較,不等於任何 API 工作負載都會直接得到三倍速度或四倍成本下降。
對 Agent 系統而言,真正值得測的是長 Context 成長後,TTFT、每秒輸出、KV Cache 壓力與單一任務總費用是否仍能維持在可接受範圍。
GLM-5.3-Flash 的 Benchmark 到底有多強?
Z.ai 公布的結果中,幾個和 Agent Engineering 關係最大的成績如下:
| Benchmark | GLM-5.3-Flash | GLM-5.2 |
|---|---|---|
| Terminal-Bench 2.1 | 84.3 | 81.0 |
| DeepSWE v1.1 | 63.4 | 46.2 |
| AutomationBench v1.0.6 | 48.8 | 26.2 |
| Toolathlon Verified | 78.4 | 59.9 |
DeepSWE 的提升尤其明顯,但這些結果不能直接翻譯成「你的 Coding Agent 有 63.4% 成功率」。
Z.ai 在模型卡中說明,DeepSWE 使用 mini-swe-agent、400K Context 與最長 6 小時 timeout;Terminal-Bench 2.1 則是在 Claude Code 2.1.207 中執行,同樣給予最長 6 小時的任務時間。AutomationBench 使用的是 v1.0.6。
Harness、Context、工具權限、timeout、sampling 與測試版本都會改變最終結果。
因此這些 Benchmark 最合理的用途是決定「這個模型值得進入內部評測」,而不是取代你自己的評測。
為什麼我會先做 API Canary?
API Canary 的目的,是用少量但具有代表性的真實工作確認模型值不值得擴大導入。
GLM-5.3-Flash 可以先放進五類任務:
- 真實 repository 的跨檔案 Coding 任務。
- Screenshot-to-code 或前端視覺回讀。
- 長文件與大量 Context 的資訊定位。
- Function Calling、多步工具操作與失敗恢復。
- 需要長時間維持目標的 Agent 任務。
每一次執行都記錄最終任務是否真正完成、工具呼叫錯誤、人工修正時間、輸入輸出 Token、Context Cache、總延遲與實際費用。
最後比較的核心指標可以非常簡單:
Cost per Accepted Job。
如果一個價格更低的模型需要大量重試、人工修復與 Tool Call 重跑,它的實際成本可能反而更高。
相反地,如果 GLM-5.3-Flash 能用較低 API 費用完成相同工作,而且驗收通過率接近更昂貴的旗艦模型,它才真正具有「Flash」的產品價值。
Cloudflare Workers AI 已經是方便的測試入口
Cloudflare 在 2026 年 8 月 26 日同步加入 GLM-5.3-Flash,Model ID 為 @cf/zai-org/glm-5.3-flash。
Cloudflare 目前列出的 Context Window 為 1,048,576 tokens,並支援 Function Calling、Reasoning 與 Vision。
截至 2026 年 8 月 27 日,Cloudflare 標示的價格為每百萬 Token:
| 項目 | 價格 |
|---|---|
| Input | US$0.15 |
| Cached Input | US$0.03 |
| Output | US$0.50 |
這個版本需要 Workers Paid Plan 或 prepaid AI Gateway credits,因此不能把它當成 Workers Free Plan 的免費大型模型。
如果原本已經使用 Cloudflare Workers AI 或 AI Gateway,GLM-5.3-Flash 很適合直接加成一個候選 route,先讓少部分 Agent Job 進入,再和既有模型比較成功率與成本。
Reasoning 應該怎麼設定?
目前 GLM-5.3-Flash 官方開源 chat template 的 reasoning_effort 會處理 low、high 等設定,沒有有效指定時則回到 max。
因此實際測試不能只跑最高推理強度。
對簡單抽取、分類、短程 Function Call,可以測試較低 effort;對 repository 修改、長程工具任務與多模態 Coding,再使用較高 effort。
評估時要一起記錄品質、延遲與成本,才能知道額外推理 Token 是否真的換到更高的 Job 成功率。
RTX 5090 單機值得直接下載嗎?
目前不建議把 GLM-5.3-Flash 當成一般 RTX 5090 單卡模型。
320B 是完整參數規模。18B active 只描述每 Token 的計算路徑,不代表其他權重可以完全消失。
雖然官方已公開權重,也提供 vLLM、SGLang 等 serving 路線,但一般消費級單機若要運行完整模型,仍需要大量系統記憶體、量化與 CPU/GPU offload,速度和工程複雜度都會明顯增加。
除非你的目標本身就是研究本機大型 MoE serving,否則先用 API 驗證模型是否真的改善工作流,通常更有效率。
GLM-5.3-Flash 和 GLM-5.1、GLM-5V-Turbo 怎麼選?
GLM-5.1 適合當作 GLM 長程 Coding Agent 演進的比較基準;GLM-5V-Turbo 則是先前偏重視覺 Coding、GUI Agent 與多模態工作的產品線。
GLM-5.3-Flash 把這兩條能力重新拉到同一個更大的原生多模態模型上,同時把 Context 提高至約 1M,並把推論效率放到架構設計的核心位置。
因此新專案若沒有既有相容性限制,GLM-5.3-Flash 已經比單獨從 GLM-5.1 或 GLM-5V-Turbo 開始評測更合理。若要比較 Flash 路線的前一代 API 定位,也可延伸閱讀 GLM-4.7-Flash。
GLM-5.3-Flash 值得用嗎?
值得測,但目前最合理的決策仍然是 Test now via API。
它已經具備幾個足以進入正式 Canary 的條件:原生多模態、1M Context、強化的 Coding/Agent Benchmark、Function Calling、公開權重,以及低價 hosted inference。
接下來要回答的問題不再是 Benchmark 能不能贏幾分,而是它能不能在你的真實 Agent Harness 中,用更低的成本交付同樣可靠的工作。
如果答案成立,GLM-5.3-Flash 很可能會成為 Coding Agent、視覺 Agent 與長 Context 任務相當有競爭力的預設模型之一。
資料來源
KEEP READING
接著讀什麼?
從同一主題繼續閱讀,或回到 YOLO LAB 的完整文章索引,找到下一個值得投入時間的問題。


發表迴響