Claude Fable 5 更新 biology safeguards:少一點誤攔截,仍保留 dual-use 邊界

Anthropic 更新 Fable 5 的 biology classifier,官方測試稱 biology-related fallback 減少約 85%;但 virology、toxicology 和 molecular design 等 dual-use 研究仍會轉交 Opus 5。

Anthropic 在 2026 年 8 月 7 日宣布更新 Claude Fable 5 的 biology safeguards。公司表示,新 classifier 在測試中令 biology-related fallback 減少約 85%,即使用者在提出生物相關問題時,較少遇到系統把要求轉交給能力較低的模型。

這個改動主要處理 false positive,而不是全面放開 biology capability。Anthropic 指,日常健康和教育問題,例如理解 lab results、了解 symptoms 或學習 biology,應該較少被誤攔截;healthcare professionals 亦會在更多 clinical tasks 上獲得 Fable 5 支援。但這些是產品方對更新效果的描述,不等同於獨立醫療評估或臨床安全保證。

對於 Anthropic 判定為 dual-use 的領域,限制仍然存在。公司明確列出 virology、toxicology 和 molecular design 等例子,表示 Fable 5 目前仍會把這類要求 fallback 到 Opus 5,因此還未能直接支援 professional biology research 和 drug development。這條線反映同一項能力可以協助研究治療,也可能被用於危險用途,單靠使用者自行聲明目的並不足夠。

Anthropic 的做法是調整 classifier 的 constitution,補充更細緻的規則,根據規則重新建立 training data,再訓練和測試新的 classifier。公司表示,更新後會放寬更多 benign biology requests,同時繼續攔截 harmful 和 dual-use research biology content。它亦強調 classifier 要面對 jailbreak 和 false negative,並不只是把攔截門檻向右移。

官方 footnote 顯示,不同產品面的總 fallback 減幅預期並不相同:Claude.ai 約 67%、Cowork 約 55%、Claude Code 約 17%、Claude Platform 約 7%。這些都是 Anthropic 的內部測試或預期數字,實際效果仍會受請求類型、版本和產品政策影響。

這次更新帶出的訊號,是 frontier model 的安全控制正在由「全部擋住」走向「更精準地分辨」。降低誤攔截可以改善正當研究和教育用途,但 safety margin 仍然會存在,而 dual-use professional research 仍要透過 trusted access pathways 逐步處理。對使用者來說,模型變得較少拒絕,不代表它已經適合在沒有專業審查、權限控管和結果驗證的情況下使用。

MODULE.002 //

更多 Insights

分享網站、AI automation、數碼營銷、AI news 和 VMTS 公司新聞。