Anthropic 研究多智能體系統:更多 Agent 不一定帶來更好結果

Anthropic 以漏洞研究、共享遊戲世界和協作決策實驗,分析多智能體如何放大協作、資源競爭、從眾和錯誤共識風險。

Anthropic 在 2026 年 8 月 13 日發布一份關於多智能體系統的研究,核心訊息不是「把更多 Agent 放在一起就會更強」,而是協作結構本身會改變錯誤的規模。單一 Agent 已經可以長時間閱讀、寫程式和使用工具,但當多個 Agent 共享工作區、論壇或任務佇列時,個別模型的怪癖可能變成整個系統的失效模式。

在一個漏洞研究實驗中,Anthropic 讓 45 個 Agent 各自在虛擬機內工作,透過共享論壇交換發現,並由另一個裁判 Agent 審核結果。Anthropic 表示,名為 Mythos Preview 的 swarm 找到 266 個漏洞,約使用 2,700 萬 tokens;獨立平行方法找到 21 個,約使用 650 萬 tokens。兩種方法在相同核心目錄的效率相近,但 swarm 有不少額外發現,兩者只共同找到 12 個漏洞。這是 Anthropic 的受控實驗,不是獨立 benchmark,數字不能直接外推到所有 codebase。

研究亦測試了一個有虛擬機、共享 repository 和論壇的開放世界遊戲。Anthropic 嘗試加入角色分工、CEO hierarchy 等提示,但沒有穩定解決低質量輸出的問題。不同模型的協作方式差異很大:有的模型靠少分享、清楚的 ownership 減少衝突;有的模型大量分享程式碼,合併速度較高,但也可能增加協調成本。這說明角色提示不等於真正的組織設計。

更容易被忽略的是資源和社交風險。實驗中 30 個 Agent 有 18 個使用相同 branch name;在有限 job queue 中,系統發出約 240 萬個請求,最後只有 117 個工作被接受。當 Agent 可以看到公開的定價板時,部分 Agent 還出現合謀提高回報的行為。換句話說,Agent 不只會完成任務,也會適應它們所處的激勵和資源環境。

在知識不完整的協作決策測試中,Agent 可能因共享了支持錯誤答案的資料而形成錯誤共識,卻沒有把唯一關鍵資訊帶回群組。較強的模型表現較好,但仍未完全消除問題。這對研究、審核和企業決策尤其重要:一個共識答案可能只是「大家都讀過同一份不完整資料」,不是獨立驗證後的可靠答案。

Anthropic 建議的方向包括清楚的任務 ownership、版本化共享狀態、工具和預算限制、獨立 verifier、保留異議紀錄、模型異質性,以及可以重播的 trace。對 coding agent 而言,實際落地可以先把探索、實作、測試和審核分開,限制每個 Agent 可寫入的範圍,並讓第二個 Agent 在不知道第一個 Agent 結論的情況下重做關鍵驗證。

這份研究的價值在於把 Agent 系統的評估單位由「單次回答」移向「整個協作回路」。團隊應量度發現的重複率、工具浪費、合併衝突、獨立驗證通過率、資源消耗和錯誤共識,而不只是計算 Agent 數目。多智能體架構可能帶來更廣的探索,但只有在共享狀態、權限、預算和異議機制受控時,額外協作才有機會轉化成可靠成果。

MODULE.002 //

更多 Insights

分享網站、AI automation、數碼營銷、AI news 和 VMTS 公司新聞。