
Anthropic 于 2026 年 10 月 1 日刊出物理学家 Matthew Schwartz 的客席文章,提出「Claude-shaped problems」这个概念:不是先要求模型模仿人类科学家的全部工作,而是找出当前大型语言模型特别擅长、又能够检查的问题。Schwartz 以这个方向建立 BootLoops,一套用于定量科学精确计算的开源工具及协议。
文章先指出一个现实限制:Claude 和 GPT 可以处理大量知识、代码、数学、统计、论文及数据,但不等于已经具备人类科学家的概念判断。Schwartz 把这种落差形容为 impedance mismatch。BootLoops 的做法是把模型放进一个更适合它的 harness,让它复用工具、执行计算、产生可验证的结果,再由人类研究者判断问题是否真的有科学价值。
最初的工作集中在 scattering amplitudes 和半数值 bootstrap。文章表示,Claude 把不同论文和代码整理到共同框架,端到端完成 30 个 integrals,其中 15 个重现已知结果、15 个以前未计算过。这些数字来自文章的研究叙述;它们显示工具和 agent 协作的产能,不代表每个新结果都已经获得学界独立确认。
BootLoops 之后被带到 ecology、population genetics、economics 和 linguistics。文章提到,Claude 在森林中性理论、基因变异、论文 replication package 和语言重音资料等方向找到技术上可行的连接,但技术正确不等于科学上重要。Schwartz 需要邀请不同领域专家,把模型找到的计算转成真正值得研究的问题;有些初步结果最后被专家认为不够有趣,也有些经过共同修改后才变得有意义。
这种 workflow 需要不少编排。Schwartz 描述他把多个 Claude Code session 放在 Google Cloud VM 上,分别处理计算、写作、工具建立和 adversarial review,再由 master session 协调资源及验证结果;中间产物会存成 Markdown 文件。即使有 harness,模型仍会误判完成、低估时间、反复 grind,或在长任务中丢失上下文,所以研究者要设置严格成功条件、查看图表及追问结论。
文章也披露 BootLoops 不是 Anthropic 项目,而是 Schwartz 拥有及维护的工具;他在研究期间担任 Anthropic visiting researcher。较稳妥的解读是,这是一个由科学家分享的早期案例:AI 的价值可能首先出现在「工具、计算、跨领域搜索和专家判断」组成的可验证循环,而不是一个 prompt 直接取代科学方法。



