Claude 完成 N=4 超楊–米爾斯九圈振幅計算:AI 科學代理開始處理前沿計算

Anthropic 9 月 25 日介紹 Claude 在 Claude Science harness 中完成 N=4 super Yang-Mills 九圈振幅計算,經物理學家 Lance Dixon 檢查;事件展示長時間科學工作流的可能性,但仍不是已通過同行評審的普遍科學能力證明。

Anthropic 於 2026 年 9 月 25 日發表一篇由物理學家及科學作家 Matt von Hippel 撰寫的文章,講述 Claude 如何處理理論粒子物理學的一個前沿計算挑戰。目標是 planar N=4 super Yang–Mills 的六粒子九圈 MHV scattering amplitude;在這類計算中,loop 數越高,代表要處理的交互作用複雜度越高。

這個題目不是用來直接解釋現實世界粒子,而是 amplitudeology 常用的 toy model。它的結構比較適合用來測試計算方法:研究者會用 bootstrap 列出符合已知規則的可能答案,再逐步排除不符合條件的結果。Anthropic 的文章把這個問題形容為一個「已知大致做法,但計算量和工程細節很容易令工作中斷」的任務。

Anthropic 的兩名物理學家在 Claude Science 中使用 Fable 5.1,先讓模型選擇較有機會完成的問題,再讓它長時間繼續工作。文章表示,Claude 用原本的 bootstrap 方法和一個間接的 form-factor 方法各做一次;以終端用戶成本估算,每種方法約需一至兩千美元,而其中一次 bootstrap 計算約用了 96 個 CPU 一星期。這些成本及流程細節是文章的回報,不是獨立的成本審計。

結果由 SLAC 及 Stanford 的物理學家 Lance Dixon 檢查,主要透過相關 form factor 驗證。文章亦提到,中國科學院的研究團隊在相近時間已得到大部分結果,並以 GPT-6 協助部分工作。這一點很重要:事件並非顯示 AI 單獨發現了新的物理定律,而是顯示模型能把既有方法、程式、運算資源和長時間任務管理串在一起,完成一個研究者原本認為太昂貴或太繁瑣的計算。

文章作者自己也作出較克制的解讀:Claude 使用的是已知方法,加上比人類過去嘗試更多的運算和可能更好的軟件工程,並沒有在這次工作中提出新的物理原理。九圈結果仍需要人類研究者發表、解釋及進一步分析;而 N=4 super Yang–Mills 只是方便測試方法的模型,不能直接代表 AI 已能處理所有真實物理問題。

對 AI 科學工作流來說,這個案例的重點是 harness 設計。任務需要模型選擇問題、寫和修改程式、使用運算資源、保持跨小時甚至跨日的狀態,最後還要由專家以獨立方法檢查。若缺少 reproducibility、成本記錄、版本固定和獨立驗證,長時間 agent 完成的漂亮結果仍然很難成為可靠研究成果。

因此,這宗新聞更適合被理解為「AI 開始可以處理一類結構清楚、驗證路徑明確的前沿計算」,而不是「AI 已取代科學家」。下一個門檻不只在於能否跑完計算,也在於能否讓其他研究者重現結果、指出限制,並把同樣的工作流安全地移植到更接近現實的科學問題。

MODULE.002 //

更多 Insights

分享網站、AI automation、數碼營銷、AI news 和 VMTS 公司新聞。