
Anthropic 于 2026 年 8 月 7 日宣布更新 Claude Fable 5 的 biology safeguards。公司表示,新 classifier 在测试中让 biology-related fallback 减少约 85%,也就是用户提出生物相关问题时,更少遇到系统把请求转交给能力较低的模型。
这次改动主要处理 false positive,而不是全面放开 biology capability。Anthropic 指出,日常健康和教育问题,例如理解 lab results、了解 symptoms 或学习 biology,应该更少被误拦截;healthcare professionals 也会在更多 clinical tasks 上获得 Fable 5 支持。但这些是产品方对更新效果的描述,不等同于独立医疗评估或临床安全保证。
对于 Anthropic 判定为 dual-use 的领域,限制仍然存在。公司明确列出 virology、toxicology 和 molecular design 等例子,表示 Fable 5 目前仍会把这类请求 fallback 到 Opus 5,因此还不能直接支持 professional biology research 和 drug development。这条线反映同一项能力可以帮助研究治疗,也可能被用于危险用途,单靠用户自行声明目的并不足够。
Anthropic 的做法是调整 classifier 的 constitution,补充更细致的规则,根据规则重新建立 training data,再训练和测试新的 classifier。公司表示,更新后会放宽更多 benign biology requests,同时继续拦截 harmful 和 dual-use research biology content。它也强调 classifier 要面对 jailbreak 和 false negative,并不只是把拦截门槛向右移动。
官方 footnote 显示,不同产品面的总 fallback 减幅预计并不相同:Claude.ai 约 67%、Cowork 约 55%、Claude Code 约 17%、Claude Platform 约 7%。这些都是 Anthropic 的内部测试或预期数字,实际效果仍会受到请求类型、版本和产品政策影响。
这次更新带出的讯号,是 frontier model 的安全控制正在由「全部挡住」走向「更精准地分辨」。降低误拦截可以改善正当研究和教育用途,但 safety margin 仍会存在,而 dual-use professional research 仍要通过 trusted access pathways 逐步处理。对用户来说,模型更少拒绝,并不代表它已经适合在没有专业审查、权限控制和结果验证的情况下使用。



