
Anthropic 于 2026 年 9 月 25 日发表一篇由物理学家及科学作家 Matt von Hippel 撰写的文章,讲述 Claude 如何处理理论粒子物理学的一个前沿计算挑战。目标是 planar N=4 super Yang–Mills 的六粒子九圈 MHV scattering amplitude;在这类计算中,loop 数越高,代表要处理的相互作用复杂度越高。
这个题目不是用来直接解释现实世界粒子,而是 amplitudeology 常用的 toy model。它的结构比较适合用来测试计算方法:研究者会用 bootstrap 列出符合已知规则的可能答案,再逐步排除不符合条件的结果。Anthropic 的文章把这个问题描述为一个「已知大致做法,但计算量和工程细节很容易令工作中断」的任务。
Anthropic 的两名物理学家在 Claude Science 中使用 Fable 5.1,先让模型选择较有机会完成的问题,再让它长时间继续工作。文章表示,Claude 用原本的 bootstrap 方法和一个间接的 form-factor 方法各做一次;以终端用户成本估算,每种方法约需一至两千美元,而其中一次 bootstrap 计算约用了 96 个 CPU 一星期。这些成本及流程细节是文章的回报,不是独立的成本审计。
结果由 SLAC 及 Stanford 的物理学家 Lance Dixon 检查,主要通过相关 form factor 验证。文章也提到,中国科学院的研究团队在相近时间已得到大部分结果,并以 GPT-6 协助部分工作。这一点很重要:事件并非显示 AI 单独发现了新的物理定律,而是显示模型能把既有方法、程序、计算资源和长时间任务管理串在一起,完成一个研究者原本认为太昂贵或太繁琐的计算。
文章作者自己也作出较克制的解读:Claude 使用的是已知方法,加上比人类过去尝试更多的运算和可能更好的软件工程,并没有在这次工作中提出新的物理原理。九圈结果仍需要人类研究者发表、解释及进一步分析;而 N=4 super Yang-Mills 只是方便测试方法的模型,不能直接代表 AI 已能处理所有真实物理问题。
对 AI 科学工作流来说,这个案例的重点是 harness 设计。任务需要模型选择问题、编写和修改程序、使用计算资源、保持跨小时甚至跨日的状态,最后还要由专家以独立方法检查。若缺少 reproducibility、成本记录、版本固定和独立验证,长时间 agent 完成的漂亮结果仍然很难成为可靠研究成果。
因此,这宗新闻更适合被理解为「AI 开始可以处理一类结构清楚、验证路径明确的前沿计算」,而不是「AI 已取代科学家」。下一个门槛不只在于能否跑完计算,也在于能否让其他研究者重现结果、指出限制,并把同样的工作流安全地移植到更接近现实的科学问题。


