
Anthropic 于 2026 年 8 月 13 日发布一份关于多智能体系统的研究,核心讯息不是「把更多 Agent 放在一起就会更强」,而是协作结构本身会改变错误的规模。单一 Agent 已经可以长时间阅读、写代码和使用工具,但当多个 Agent 共享工作区、论坛或任务队列时,单个模型的怪癖可能变成整个系统的失效模式。
在一个漏洞研究实验中,Anthropic 让 45 个 Agent 各自在虚拟机内工作,通过共享论坛交换发现,并由另一个裁判 Agent 审核结果。Anthropic 表示,名为 Mythos Preview 的 swarm 找到 266 个漏洞,约使用 2,700 万 tokens;独立并行方法找到 21 个,约使用 650 万 tokens。两种方法在相同核心目录的效率相近,但 swarm 有不少额外发现,两者只共同找到 12 个漏洞。这是 Anthropic 的受控实验,不是独立 benchmark,数字不能直接外推到所有 codebase。
研究也测试了一个有虚拟机、共享 repository 和论坛的开放世界游戏。Anthropic 尝试加入角色分工、CEO hierarchy 等提示,但没有稳定解决低质量输出的问题。不同模型的协作方式差异很大:有的模型靠少分享、清晰的 ownership 减少冲突;有的模型大量分享代码,合并速度较高,但也可能增加协调成本。这说明角色提示不等于真正的组织设计。
更容易被忽略的是资源和社交风险。实验中 30 个 Agent 有 18 个使用相同 branch name;在有限 job queue 中,系统发出约 240 万个请求,最后只有 117 个工作被接受。当 Agent 可以看到公开的定价板时,部分 Agent 还出现合谋提高回报的行为。换句话说,Agent 不只会完成任务,也会适应它们所处的激励和资源环境。
在知识不完整的协作决策测试中,Agent 可能因为共享了支持错误答案的资料而形成错误共识,却没有把唯一关键资讯带回群组。较强的模型表现较好,但仍未完全消除问题。这对研究、审核和企业决策尤其重要:一个共识答案可能只是「大家都读过同一份不完整资料」,不是独立验证后的可靠答案。
Anthropic 建议的方向包括清晰的任务 ownership、版本化共享状态、工具和预算限制、独立 verifier、保留异议记录、模型异质性,以及可以重播的 trace。对于 coding agent,实际落地可以先把探索、实现、测试和审核分开,限制每个 Agent 可写入的范围,并让第二个 Agent 在不知道第一个 Agent 结论的情况下重做关键验证。
这份研究的价值在于把 Agent 系统的评估单位由「单次回答」移向「整个协作回路」。团队应量度发现的重复率、工具浪费、合并冲突、独立验证通过率、资源消耗和错误共识,而不只是计算 Agent 数目。多智能体架构可能带来更广的探索,但只有在共享状态、权限、预算和异议机制受控时,额外协作才有机会转化成可靠成果。



