
Anthropic 于 2026 年 9 月 10 日发布《Detecting and countering misuse of AI: September 2026》,整理其 Threat Intelligence team 在过去八个月检测和中断的滥用活动。报告覆盖 2025 年 12 月至 2026 年 8 月,分为网络操作、影响操作、监控、诈骗与欺诈、生物滥用、常规武器开发和模型蒸馏七个伤害范围。这是一份供应商的威胁情报披露,不是所有事件都能由外界独立重现。
报告最值得注意的描述,是 AI 在部分活动中已经不再只是问答助手,而是流程协调层。Anthropic 表示,案例涉及直接执行或协调多代理框架,让人类设定较高层目标,再由工具和 agent 处理更多中间步骤。这不代表所有 Claude 使用都会出现同样情况,但它反映出安全评估不能只看单一回复,而要观察模型在长 session、工具链和多角色协作中的整体行为。
Anthropic 也尝试用 speed、scale 和 depth 衡量 AI 带来的 uplift。这个框架比单纯询问「模型会不会写 exploit」更接近实际防守:同一个操作是否变快、是否能扩大到更多目标、是否能处理更多复杂环节,都会影响防守者看到的风险。报告描述的趋势,是原本需要更多专业人力和工具的工作,可能被拆成可由 agent 反复执行的模块。
对平台团队来说,这种工作流会改变监控要求。只看登录、prompt 或一个高风险词语,未必足以理解一个 agent session 的意图;还要把工具调用、权限变化、数据流、异常速度、跨账户关联和输出目的放在一起分析。Anthropic 表示已封锁相关账户、加强 safeguard,并在适当情况下与政府及业界伙伴分享情报。其他模型平台能否取得同样的可见度,则取决于它们自己的 telemetry 和事件响应能力。
这份报告没有把责任只放在模型本身。威胁行为者会测试防护、寻找绕过方式,而平台需要持续更新检测和阻断策略。对企业用户来说,这意味着不能把供应商的 abuse filter 当成完整的组织安全边界。API key、工具权限、浏览器 session、外部 connector 和 agent 可读写的数据范围,仍需要由部署方按最小权限、分层审批和可追踪记录管理。
报告也提醒,AI 滥用和 AI 供应链相互牵连。Anthropic 指出,部分活动涉及窃取或滥用 AI API key,使被攻击的环境变成下一轮活动的计算资源。这个角度对使用多个 agent 平台的公司尤其重要:凭证轮换、短效 token、分离测试与生产环境、限制外部网络、监测异常用量,都是 agent workflow 的基本控制,而不是事后才补上的安全设置。
需要保持比例感的是,Anthropic 明确说明报告中的案例不是典型滥用,而是截至目前识别到较新或较值得披露的活动;它也指出案例主要使用 Haiku、Sonnet 和 Opus,并不是所有新模型都涉及其中。报告内的归因、受害范围和 AI 带来的 uplift,应该被视为 Anthropic 的调查判断。读者可以采纳防守上的模式,但不应把供应商叙述直接当成完整的独立取证结论。
最实际的结论,是企业应该把 agent 当成一个可能持续运行的系统,而不是输入一次就结束的聊天框。要测试的包括:它能否在 scope 不清时停下、在权限提升时要求审批、在异常工具链出现时触发告警,以及在中断后留下足够证据供人复核。Anthropic 的披露把风险从「模型输出有没有危险」推向「整条工作流会不会被用来放大速度、规模和深度」,这正是下一阶段 AI 安全工程的重点。



