
Anthropic 于 2026 年 9 月 22 日推出 Claude Opus 5.5,这是 Claude 5.5 家族的首个模型。官方称它在大部分工作上达到 Claude Fable 5.1 的水平,运行成本则比 Opus 5 低 40%。Anthropic 同时表示,模型在发布前接受了 Frontier Design 和 METR 等外部评估者测试。
这次发布把焦点放在长时间、跨文件和需要多个工具步骤的工作,而不只是单次问答。Anthropic 的内部和早期用户测试涵盖 agentic coding、computer use、知识工作和商业流程;不过,页面上的大部分结果仍然是 Anthropic、合作伙伴或早期测试者提供的数据,不能直接当作所有真实环境的独立基准。
编程方面,Anthropic 形容 Opus 5.5 特别适合大型代码库迁移与审查。一名早期测试者称模型在一天内完成 680,000 行代码的迁移;另一项测试则是替网页应用改善加载速度,Opus 5.5 在 40 次尝试中成功 39 次。这些例子显示模型可以处理较长的任务链,但仍需要工程师检查变更、测试结果和回滚路径。
官方列出的成本结构也与代理工作有关:每百万输入 token 为 4 美元、输出 token 为 20 美元,cache read 为 0.20 美元;Anthropic 称默认设置下典型工作负载总成本比 Opus 5 低 40%,输出速度则快逾 30%。对长时间代理而言,cache 和步骤数是否真的下降,往往比单一 token 价格更影响总成本。
安全部分,Anthropic 称 Opus 5.5 在其自动化行为审查中取得目前最好的结果,并在长任务、不可能完成的任务及仿真真实事故的情境中扩大测试。官方亦表示模型对 prompt injection 的抵抗力优于 Opus 5,并通过每次行动前的分类器、可审查的 sandbox 和合并前代码审查来支持代理部署。这些都是产品方的安全声称,完整判断仍要看 system card、测试设置和外部重现。
Opus 5.5 的基准表包括 Terminal-Bench、FrontierCode、CursorBench、GDPval 和 OSWorld 等项目。Anthropic 亦提醒,在这个能力水平,基准分数差距未必能可靠预测真实工作差异;不同 effort 设置、工具、护栏介入和测试环境都会影响结果。因此,企业评估模型时,应把任务成功率、工具调用数、人工返工和错误后果一起记录。
目前 Opus 5.5 已按不同方案提供,Anthropic 亦宣布提高部分订阅方案的五小时使用上限,并计划在未来数周推出 Sonnet 5.5 和 Haiku 5.5。生命科学和网络安全方面则采取验证计划,先让符合条件的组织使用相关能力。这反映出模型能力提高后,访问权限、用户身份和高风险领域的审查会一起成为产品设计的一部分。
这次发布的实际信号,是 AI 编程代理正在由短任务助手走向可以长时间运行的工作单元。当模型能够连续读取上下文、修改多个文件和自行验证,评估重点就不应只看一次回答是否正确,而要看权限边界、每一步是否可追踪、何时需要人批准,以及失败后能否安全恢复。Opus 5.5 的数据值得留意,但仍应以受控试点和可验证的工程指标决定是否采用。



