
Anthropic 在 2026 年 6 月 30 日發布《Redeploying Fable 5》,並在 7 月 1 日更新指 Claude Fable 5 和 Mythos 5 的存取已恢復。這不是一般產品恢復公告,而是一個 frontier model 發布後被政策、cyber safety 和 jailbreak 風險共同壓力測試的案例。
事件背景是美國政府在 6 月 12 日對 Claude Fable 5 和 Claude Mythos 5 施加出口控制。Anthropic 表示,由於當時沒有可靠方式即時驗證 nationality,因此曾暫停兩個模型對所有使用者的存取。其後出口控制解除,Fable 5 由 7 月 1 日起重新面向全球使用者開放,並逐步恢復雲端平台存取。
更重要的是安全更新。Anthropic 指出,報告中的 technique 涉及繞過 Fable 5 的 cyber safeguards,讓模型在部分情況下輸出漏洞相關內容。Anthropic 與政府和合作夥伴審視後,訓練了改良 safety classifier,用來鎖定並阻擋相關行為;被阻擋的請求會改由 Opus 4.8 處理。
這個案例顯示 frontier model safety 已不再只是模型卡或紅隊報告,而是會直接影響產品可用性、客戶 access、雲端分發和政府協作。當模型具備強 coding 和 cybersecurity 能力,平台要處理的不只是「模型會不會答錯」,而是「某種能力被 jailbreak 後會不會形成可武器化風險」。
Anthropic 亦提出建立共通 jailbreak severity framework,並表示會與 Amazon、Microsoft、Google 和其他 Glasswing partners 一起草擬。這個方向值得留意,因為 AI 行業目前仍缺少共同標準去描述 jailbreak 的嚴重程度、能力增益、影響範圍、可武器化難度和可發現性。
對企業使用者來說,這篇文章提醒我們:越強的模型,越需要清楚的 policy、classifier、fallback、audit 和人手決策。尤其在 coding、security、agent workflow 裏,安全控制不能只停留在 UI warning,而要能在 runtime 中介入、分流和記錄。
Claude Fable 5 重新開放的真正訊號,是 frontier AI 發布流程正在變成一個多方治理系統。模型公司、雲平台、政府、安全研究者和企業客戶,都會參與同一條 release 和 remediation loop。未來企業採購 AI 模型時,安全更新速度和治理透明度會和 benchmark 一樣重要。



