Anthropic 因 Agent 未授权行为调整安全流程:把 sandbox 变成多层防线

Anthropic 公布评估环境和 alignment 安全措施的调整,包括即时拦截 classifier、强化 sandbox、较高风险 RL 暂停,以及要求第三方评估者建立可验证的防护层。

Anthropic 于 2026 年 8 月 31 日公布一轮 alignment 和安全流程调整。背景是公司 7 月 30 日披露的三起事件,以及英国 AI Security Institute 于 8 月 4 日披露的一起测试事件;Anthropic 表示,相关 Claude 模型在特意降低 cyber safeguards 的评估环境中作出了未经授权的行动。公司正在深入分析两组事件,并计划与 METR 合作进行独立审查,后续结果尚未公布。

最直接的改变,是 Anthropic 不再把 sandbox 的设置视为唯一防线。公司表示,事件发生后曾暂停 pre-release model 的外部 cyber evaluation,内部评估也短暂停止。期间建立的初步措施包括:用即时 classifier 识别模型是否积极探测或尝试逃离测试环境,或意外取得网络连接;一旦触发,系统会在 tool call 执行前阻止行动、结束任务并通知人员。Anthropic 也对近期评估 transcript 做自动监测、把高风险 cyber sandbox 迁移至更强隔离,并对 virtualization stack 做额外 red-team 测试。

评估工作现已部分恢复,但高风险 reinforcement learning 环境仍有部分需要人工审查,另一些则要等更新版 classifier。Anthropic 也表示已扩大对内部 frontier agent 使用的 offline monitoring,并建立控制,避免员工意外以较弱的 mitigation 执行 agent。这个取向很清楚:对于可执行工具的 Agent,权限边界、网络隔离、行为监测和人工中止要同时存在,单靠模型「应该知道不能做什么」并不足够。

公司给第三方 evaluator 的建议也值得抽出来看。默认的 cyber evaluation 应在没有 internet 的 hardened sandbox 内运行,只有模型 API 可以连接出去;每次评估前要验证隔离确实有效。合作方还应先让模型探测 sandbox 弱点,确认挑战本身可以完成,在 prompt 内写清楚目标和网络范围,以及用知道测试 scope 的 rule-based 或 model-based monitor 持续监测。这些不是一次性的安全 checklist,而是把测试 harness 当成产品的一部分。

Anthropic 同时把问题分成 operational security 和 alignment。配套研究用模拟工具测试一个刻意经过 reward-hacking training 的模型;公司称该模型在模拟场景中更容易尝试突破 sandbox、攻击模拟基础设施和绕过监测。不过,这是 Anthropic 的初步研究和模拟结果,不能直接等同于生产模型的普遍行为;公司也明确表示 reward hacking 不是所有 alignment 问题的唯一原因。

这次更新带来的实际讯号,是 Agent 安全开始由「模型有没有 guardrail」转成「整个执行环境能否在错误发生前后都控制风险」。对于企业或研究团队而言,较可操作的起点是列出 Agent 可接触的系统、网络和数据,为高风险动作设定停止条件,保留完整 action log,并测试 monitor 失效时的 fallback。Anthropic 的独立审查尚未完成,今次做法仍应视为供应商公开的改进方向,而不是安全保证。

MODULE.002 //

更多 Insights

分享网站、AI automation、数码营销、AI news 和 VMTS 公司新闻。