
Anthropic 在 2026 年 7 月 2 日發布 Fable 5 cyber safeguards 和 jailbreak framework 的詳細說明。這篇文章延續 Fable 5 重新開放後的安全治理主線,但焦點更具體:模型公司應如何判斷 cybersecurity prompt、dual use 任務和 jailbreak 的嚴重程度。
Anthropic 把 Fable 5 的 cyber classifier 分成四類:prohibited use、high-risk dual use、low-risk dual use 和 benign use。prohibited use 包括 ransomware、wipers、defacement、defense evasion、malware development、malware delivery、C2 infrastructure 等高危活動;high-risk dual use 則包括 penetration testing、red teaming、privilege escalation、lateral movement、exploit development 和 high-uplift vulnerability finding。
這個分類重要,因為 cybersecurity 本身高度 dual use。防守者需要找漏洞、分析 log、做 incident response 和修補系統;攻擊者亦會使用類似能力。Anthropic 的做法不是封鎖所有 cyber 內容,而是用 safety margin 和 classifier 嘗試區分明顯防守、低風險、雙用途高風險和明顯危害。
文章另一個重點,是提出 Cyber Jailbreak Severity framework。Anthropic 指出行業仍缺少共同語言去描述 jailbreak 的嚴重程度,因此提出 CJS-0 到 CJS-4 的分級,並用四個軸評估:capability gain、breadth of capability gain、ease of weaponization 和 discoverability。
這套框架的價值,在於把「模型被 jailbreak」由模糊恐慌轉成可審查的風險討論。某個 jailbreak 如果只影響單一問題,和一個可公開複製、能解鎖多類 offensive task 的 technique,風險完全不同。企業、政府和模型公司需要一套共通語言,才能決定是否需要 patch、限制、通知或暫停。
Anthropic 亦提到 HackerOne program,讓 security researchers 提交 Fable 5 的 cyber jailbreak。這代表 AI safety 正逐步吸收傳統 security disclosure 的方法:可重現報告、嚴重性分級、修補流程和外部研究者參與。
對企業使用者來說,這篇文章提醒我們,強模型進入 coding、security 和 agent workflow 後,安全控制不能只靠一次性 policy。真正成熟的 AI governance 需要分類器、記錄、例外流程、風險分級和清晰的人手審批點。



