
一篇於 2026 年 8 月 7 日提交到 arXiv 的研究提出 EMAS(Evidence-guided Multi-Agent System evolution),討論如何在不更新 LLM 參數的情況下,讓多智能體系統根據過往執行經驗逐步修正。研究作者包括 Chao Fei、Qingyi Si、Kaihua Liang、Yanghua Xiao、Panos Kalnis 和 Hongcheng Guo。
EMAS 的核心不是讓一個模型自行重寫整個系統,而是把 execution traces 轉成結構化診斷。當相同問題在不同任務中反覆出現,系統才會產生候選 revision,例如調整 agent topology 或修改 prompt。候選版本要再通過 paired validation,才會被接受。這個門檻用來減少一次失敗就改動架構,令演化過程較容易追蹤和回退。
這種方法和只靠 prompt trial-and-error 有明顯分別。它把失敗經驗、問題診斷、候選變更和驗證結果分開保存,讓團隊可以知道一項改動是針對哪種 recurring diagnosis,以及改動後是否真的改善相同類型的任務。對 production workflow 而言,這些中間證據也可以接到版本控制、審批和 audit log。
論文報告在 4 個 benchmark 和 2 個 LLM 上測試,EMAS 在 8 個設定中有 6 個取得最佳或並列最佳表現。作者亦報告,在 Kimi-K2-6 和 Qwen3.6-27B 上分別取得 6.30% 和 20.10% 的相對提升;在 MBPP 的一個 Qwen3.6-27B 設定,結果由 55.09% 提升到 89.12%,token 使用量下降 62.2%。這些都是論文報告的實驗結果,並非獨立生產環境驗證。
EMAS 的實際價值不只在於分數提升,更在於它把「改良 agent workflow」變成有條件的控制迴圈。團隊可以要求每次 revision 都保留原版本、明確列出診斷、通過固定回歸集,並在成本、延遲和安全指標沒有惡化時才晉級。這比讓 agent 在沒有護欄的情況下持續自我修改更適合受監管的流程。
但 evidence-guided 不等於 evidence-complete。若 traces 本身漏記工具錯誤、租戶資訊或權限結果,診斷就可能指向錯誤原因;paired validation 也可能只覆蓋已知任務,沒有捕捉新型輸入。要在真實系統採用,仍需要資料脫敏、固定 evaluation set、灰度發布、rollback 和人手 review。
這項研究反映多智能體系統的下一個問題,可能不只是「模型是否更強」,而是「系統能否從失敗中有紀律地變好」。把 traces 轉成可驗證的修改建議,可以令 agent workflow 更接近一般軟件工程的測試、版本化和發版流程;同時也提醒團隊,系統演化本身需要權限和審計。



