
OpenAI 于 2026 年 9 月 8 日介绍一个由 MIT Engineering Quantum Systems Group(EQuS)完成的案例:研究人员把 GPT‑5.6 Sol 接入 Codex,再通过实验室已有软件操作和校准 superconducting qubits。相关 technical case study 的日期是 9 月 4 日。这不是在聊天窗口询问量子物理,而是让 agent 读取 live measurement parameters、programs、plots、raw data、logs 和 measurement database,再根据下一步需要的测量调整参数。
这类实验很适合用来测试 agent,因为芯片完成、封装和冷却后,很多工作都由软件控制。量子位元校准并不是一次测量,而是一串相互依赖的步骤:前一个结果会决定下一个 pulse、frequency、power 或 readout setting。芯片参数会漂移,物理信号也可能受到噪声影响;因此 agent 不只要执行固定指令,还要分析结果、判断是否合格,再决定重做还是继续。
EQuS 让 agent 使用现有的 orchestration software 和 Jupyter notebook,并提供 measurement-specific skills。每一份 skill 不只是 API 说明,还包括执行及分析的 template code、前置 calibration、参数选择提示、常见 failure 的物理原因,以及成功和失败 plot 的例子。这个细节很关键:agent 的可靠性来自 domain context、可重播的工具及结果判断规则,而不是只把一个通用模型连接到仪器上。
在案例中,agent 面对一枚从未校准过的六量子位元芯片,先发现六个 resonator 和合适的 readout pulse power,再执行 fixed-frequency qubit 的标准测量。研究人员表示,在 40 项 target measurements 中,只需要介入改善四项。对于信号清楚、分析模型明确的流程,agent 可以自行选择 measurement parameters、操作硬件、分析数据、更新 calibration settings,并把结果交给下一步。
限制同样清楚。当信号较弱或噪声较大时,GPT‑5.6 Sol 需要更长时间寻找合适参数,有时需要经验丰富的研究人员提供 guidance。这表示目前 agent 对定义清楚、行为较可预测的实验流程很有用,但在含糊的物理现象、未定义的分析目标或新型芯片上,仍不应该把判断责任完全交给模型。
这个案例也展示了 agent workflow 的一个实际结构:user 先定义 measurement type、目标 qubit 和 sweep parameters;orchestrator 负责解析 instrument ports、编译 pulse sequence、收集 signal 和 fit data;agent 在 assess results 后决定继续、调整或记录;遇到 ambiguous results 时再交回人工。换句话说,agent 是 orchestration software 之上的 decision layer,而不是直接取代实验室的整个 safety system。
对于其他科学和工程团队来说,最值得借鉴的是把专业知识写成可以测试的 skills,并为每个 action 设置数据范围、设备权限、停止条件和人工 review 点。量子实验的硬件控制可能涉及高成本、长时间或不可逆的操作;即使 agent 在一枚芯片上的 40 项测量只需要四次介入,也不能直接推论到所有装置、所有信号或真正的 autonomous discovery。
OpenAI 和 EQuS 的示范显示,AI agent 进入实验室的第一步未必是提出新理论,而是把大量有明确顺序的测量、分析和校准工作连接起来。当 workflow 有清楚的输入、可观察的中间结果、可验证的输出和安全的回退路径,模型才有机会从「会回答问题」变成「会推进实验」。最终的研究方向和高风险判断,仍然需要人类掌握。



