
Z.ai 在 2026 年 8 月 14 日發布 GLM-5.3,將重點放在 frontier coding、長程 Agent 任務和 cyber 能力。Z.ai 表示 GLM-5.3 沿用 GLM-5.2 的 base model,主要提升來自 post-training,並使用 IndexShare、SAO 長程 reinforcement learning 和 slime 等訓練工具。這次發布更像是把模型、訓練堆疊和 coding workflow 一起更新,而不是單純增加參數。
Z.ai 宣稱,GLM-5.3 在自家 Z.ai Code Bench 比 5.2 提升 50%,並在 Terminal Bench 3.0 和 Agents’ Last Exam 成為開源模型中的領先結果。其公開表格列出 Terminal Bench 2.1 為 88.2 對 81.0、DeepSWE v1.1 為 66.9 對 46.2、CyberGym 為 84.5 對 77.2、AutomationBench 為 48.2 對 26.2。這些數字來自 Z.ai 的 benchmark 報告,使用的 harness、參數和評分方式未必與其他團隊相同,應先用自己的 repository 任務重做驗證。
安全研究部分是這次發布的敏感亮點。Z.ai 表示 GLM-5.3 在 ExploitBench 得到 54.4,上一代為 24.4;在 ExploitGym 中,兩小時和六小時分別完成 105/130 和 29/39 個任務,而 5.2 的數字較低。這些結果代表模型可能更擅長處理安全測試環境,也同時提高了濫用風險。文章適合用來討論評估、權限和披露治理,不應把 benchmark 轉成可直接操作的攻擊指南。
Z.ai 另外分享一份 codebase 結果:經過 review、screening 和去重後,在 269 個項目中記錄 2,436 個漏洞,其中 1,097 個被標為 medium-high,53 個已公開,2,383 個仍在 embargo。這是供應商和合作方報告的數字,不等於全部已由獨立安全團隊確認;若要用於風險決策,仍需查看漏洞清單、CVE、重現條件和 disclosure status。
API 行為也有實際遷移影響。GLM-5.3 支援 low、high、max 的 reasoning_effort,但 thinking 不能關閉;如果現有整合使用 thinking.type: disabled,便要在升級前修改請求和成本預算。Z.ai 表示模型權重預計在約兩星期後、完成安全評估和 hardening 後發布,團隊不應把當日 API 可用性當成 open-weight 已經到位。
對 coding agent 而言,這次更新的重要處不只在 benchmark 分數,而在它能否完成 terminal、測試、修正和 review 的閉環。測試時應固定 repository、工具權限、網絡範圍和測試命令,記錄成功率、重試、token、時間、錯誤類型以及人工修改。尤其在 cyber 場景,模型輸出必須放在隔離環境,並把發現、驗證和對外披露分成不同權限。
GLM-5.3 的訊號是開源模型競爭正在由聊天品質移向可長時間執行的專業工作。這會增加模型選擇,但也要求使用者把 vendor benchmark、自己的回放任務、供應商安全政策和操作 guardrail 一起比較。最穩妥的採用順序是先做可回溯的低風險 coding pilot,再逐步開放更高權限的 agent 工具。



