Anthropic 評估 GLM-5.3:開放權重模型令前沿 cyber 能力更易擴散

Anthropic 9 月 29 日發布 Frontier Red Team 研究,評估 GLM-5.3 的自動化網絡安全能力及安全防護,指出開放權重與較弱限制會增加濫用風險;本文只整理高層結論,不轉述可直接入侵的操作細節。

Anthropic 於 2026 年 9 月 29 日發布一份 Frontier Red Team 研究,評估由 Zhipu AI(海外品牌為 Z.ai)開發的 GLM-5.3。研究焦點不是一般聊天能力,而是模型能否在受控環境中協助完成較長的 cyber 任務,以及模型公開發布後,安全限制是否足以降低濫用風險。

Anthropic 的高層結論是,GLM-5.3 在其測試中已跨過一個能力門檻:模型可以在自動化及 human-in-the-loop 工作流中處理端到端 exploit development 類型的任務,而它的 safeguard 亦較容易被繞過或移除。這是 Anthropic 的 red-team 結果,不是獨立重現或所有真實攻擊的發生率;不同模型、工具、目標、權限和測試定義不能直接互相比較。

研究同時指出,開放權重會改變 threat model。使用者可以在自己控制的環境中修改模型行為,模型供應商原本放在 API 層的拒絕政策就不再是唯一控制點。對企業和平台而言,這代表只檢查模型名稱或供應商聲稱的安全分數不足夠,還要知道實際下載的是哪個權重版本、由誰部署、是否能連接外部網絡,以及模型輸出會否直接流入工具。

Anthropic 表示,測試在隔離或 sandbox 環境進行,涵蓋 automated benchmark 和專家參與的研究流程。研究也承認 simulated environment 並不完美,不能直接等同於真實世界條件。為避免放大風險,本文不重現其 bypass 方法、exploit chain、漏洞編號或可直接執行的技術步驟,只保留對模型治理有用的高層觀察。

這份報告的另一個訊息,是能力與安全未必會同步提升。模型可能在較少人手介入下找到複雜問題,但「能否完成」和「是否應該允許完成」是兩個不同判斷。對高影響 cyber 工作,安全邊界需要位於 agent 之外,包括 sandbox、最小權限、網絡出口控制、credential 隔離、完整 audit log 和人工 approval,而不是只依賴模型自己拒絕。

企業若要管理類似風險,可以先建立模型 provenance、權重變更、工具權限和 egress policy 的清單,再以離線 target、不可回連的測試環境和可回滾的 workflow 做驗證。任何防禦性自動化都應先由安全團隊檢查,並把 production secrets、真實客戶資料和未授權目標完全排除在評估環境之外。

Anthropic 最後呼籲政府及模型開發者對足夠強的 open-weight 模型進行安全測試。無論是否接受這個政策立場,GLM-5.3 個案都說明一件事:當前沿能力從受控 API 走向可下載權重,安全責任就由單一供應商延伸到模型發布、部署、工具鏈及使用者治理的整條鏈。

MODULE.002 //

更多 Insights

分享網站、AI automation、數碼營銷、AI news 和 VMTS 公司新聞。