
OpenAI 於 2026 年 9 月 8 日介紹一個由 MIT Engineering Quantum Systems Group(EQuS)完成的案例:研究員把 GPT‑5.6 Sol 接入 Codex,再透過實驗室既有軟件去操作和校準 superconducting qubits。相關 technical case study 的日期是 9 月 4 日。這不是在聊天視窗問量子物理,而是讓 agent 讀取 live measurement parameters、programs、plots、raw data、logs 和 measurement database,再按下一步需要的測量調整參數。
這類實驗很適合用來測試 agent,因為晶片完成、封裝和冷卻後,很多工作都由軟件控制。量子位元校準並不是一次測量,而是一串互相依賴的步驟:前一個結果會決定下一個 pulse、frequency、power 或 readout setting。晶片參數會漂移,物理訊號也可能受雜訊影響;因此 agent 不只要執行固定指令,還要分析結果、判斷是否合格,再決定重做或繼續。
EQuS 讓 agent 使用現有的 orchestration software 和 Jupyter notebook,並提供 measurement-specific skills。每一份 skill 不只是 API 說明,還包括執行及分析的 template code、前置 calibration、參數選擇提示、常見 failure 的物理原因,以及成功和失敗 plot 的例子。這個細節很關鍵:agent 的可靠性來自 domain context、可重播的工具及結果判斷規則,不是只把一個通用模型接到儀器上。
在案例中,agent 面對一枚從未校準過的六量子位元晶片,先發現六個 resonator 和合適的 readout pulse power,再執行 fixed-frequency qubit 的標準測量。研究員表示,在 40 項 target measurements 中,只需要介入改善四項。對訊號清楚、分析模型明確的流程,agent 可以自行選擇 measurement parameters、操作硬件、分析資料、更新 calibration settings,並把結果留給下一個步驟。
限制同樣清楚。當訊號弱或雜訊較大時,GPT‑5.6 Sol 需要更長時間找合適參數,有時需要經驗豐富的研究員提供 guidance。這表示目前 agent 對定義清楚、行為較可預測的實驗流程很有用,但在含糊的物理現象、未定義的分析目標或新型晶片上,仍不應把判斷責任完全移交給模型。
這個案例也展示了 agent workflow 的一個實際結構:user 先定義 measurement type、目標 qubit 和 sweep parameters;orchestrator 負責解析 instrument ports、編譯 pulse sequence、收集 signal 和 fit data;agent 在 assess results 後決定繼續、調整或記錄;遇到 ambiguous results 時再交回人手。換句話說,agent 是 orchestration software 之上的 decision layer,而不是直接取代實驗室的整個 safety system。
對其他科學和工程團隊而言,最值得借鑑的是把專業知識寫成可以測試的 skills,並為每個 action 設定資料範圍、設備權限、停止條件和人工 review 點。量子實驗的硬件控制可能涉及高成本、長時間或不可逆的操作;即使 agent 在一枚晶片上的 40 項測量只需四次介入,也不能直接推論到所有裝置、所有訊號或真正的 autonomous discovery。
OpenAI 和 EQuS 的示範顯示,AI agent 進入實驗室的第一步未必是提出新理論,而是把大量有明確順序的測量、分析和校準工作接起來。當 workflow 有清楚的輸入、可觀察的中間結果、可驗證的輸出和安全的回退路徑,模型才有機會從「會回答問題」變成「會推進實驗」。最終的研究方向和高風險判斷,仍然需要人類掌握。



