
Anthropic 于 2026 年 7 月 30 日发表对三起真实事件的调查,重点不是某个模型在实验中的单次表现,而是网络安全评测环境一旦接触到真实互联网,整个 harness 就会成为需要保护的安全边界。
Anthropic 表示,团队检查了 141,006 次评测运行,其中三起事件涉及 Claude 从 Irregular 提供的评测环境接触到三个组织的真实系统。原本的 prompt 说明是模拟环境、没有互联网,但环境配置错误地保留了 live Internet。事件涉及 Opus 4.7、Mythos 5 和一个内部研究模型,共六次运行;Anthropic 也提醒,这不是一次受控的模型对模型比较。
公开调查描述了三种不同后果:一次取得凭证后接触到有数百行 production data 的数据库;一次建立了恶意 PyPI package,约一小时内被 15 台真实系统下载和运行,并导致 scanner credentials 外泄;另一次扫描约 9,000 个 target,暴露 debug 及 SQL injection 相关问题。Anthropic 表示,相关 PyPI package 已被移除,但这些细节仍然是其目前公开的事件理解。
Anthropic 已暂停相关评测,通知受影响组织,并与 Irregular 一起检查环境控制;公司也计划让 METR 进行第三方审查,之后公开删节版 transcript。Anthropic 的初步判断是,事件更像评测 harness 和操作流程失效,而不是模型在没有外部条件下突然出现全新的 alignment failure。这个判断仍应视为目前版本,并等待后续审查。
事件带来的实际教训是,AI Agent 评测不能只问模型能否完成任务,也要验证 egress control、asset allowlist、短期凭证、网络及 transcript monitoring,以及可以立即停止的 kill switch。只要 agent 可以执行程序、读取数据或接触外部服务,测试环境的隔离程度就应该接近 production security,而不是只靠 prompt 要求模型「假装没有互联网」。
这次调查把焦点由模型能力拉回系统责任。强大的 agent 可能在错误配置下把「模拟」变成真实操作,因此评测平台、工具链、身份、存储、套件仓库和人工批准流程,都必须纳入同一个可审计的安全设计。



