Anthropic 公开 Fable 5 cyber safeguards:AI jailbreak 需要共同严重性标准

Anthropic 在 2026 年 7 月 2 日公开 Fable 5 cybersecurity classifiers 和 Cyber Jailbreak Severity framework,尝试为 AI jailbreak 风险建立可讨论的分级语言。

Anthropic 在 2026 年 7 月 2 日发布 Fable 5 cyber safeguards 和 jailbreak framework 的详细说明。这篇文章延续 Fable 5 重新开放后的安全治理主线,但焦点更具体:模型公司应如何判断 cybersecurity prompt、dual use 任务和 jailbreak 的严重程度。

Anthropic 把 Fable 5 的 cyber classifier 分成四类:prohibited use、high-risk dual use、low-risk dual use 和 benign use。prohibited use 包括 ransomware、wipers、defacement、defense evasion、malware development、malware delivery、C2 infrastructure 等高危活动;high-risk dual use 则包括 penetration testing、red teaming、privilege escalation、lateral movement、exploit development 和 high-uplift vulnerability finding。

这个分类重要,因为 cybersecurity 本身高度 dual use。防守者需要找漏洞、分析 log、做 incident response 和修补系统;攻击者也会使用类似能力。Anthropic 的做法不是封锁所有 cyber 内容,而是用 safety margin 和 classifier 尝试区分明显防守、低风险、双用途高风险和明显危害。

文章另一个重点,是提出 Cyber Jailbreak Severity framework。Anthropic 指出行业仍缺少共同语言去描述 jailbreak 的严重程度,因此提出 CJS-0 到 CJS-4 的分级,并用四个轴评估:capability gain、breadth of capability gain、ease of weaponization 和 discoverability。

这套框架的价值,在于把「模型被 jailbreak」由模糊恐慌转成可审查的风险讨论。某个 jailbreak 如果只影响单一问题,和一个可公开复制、能解锁多类 offensive task 的 technique,风险完全不同。企业、政府和模型公司需要一套共通语言,才能决定是否需要 patch、限制、通知或暂停。

Anthropic 也提到 HackerOne program,让 security researchers 提交 Fable 5 的 cyber jailbreak。这代表 AI safety 正逐步吸收传统 security disclosure 的方法:可重现报告、严重性分级、修补流程和外部研究者参与。

对企业用户来说,这篇文章提醒我们,强模型进入 coding、security 和 agent workflow 后,安全控制不能只靠一次性 policy。真正成熟的 AI governance 需要分类器、记录、例外流程、风险分级和清晰的人工审批点。

MODULE.002 //

更多 Insights

分享网站、AI automation、数码营销、AI news 和 VMTS 公司新闻。