OpenAI 公布研究代理進展:3.1 個 agent-workdays,成功仍需要人手介入

OpenAI 表示研究團隊到 8 月中每個人類工作日使用約 3.1 個 agent-workdays,coding agent 正處理更長流程的研究工作;官方同時指出,數據仍屬初步,複雜任務仍需要人手 steering。

OpenAI 於 2026 年 9 月 6 日公開一份內部研究工作快照,題目是 Research acceleration。公司表示,團隊已達到今年秋季前建立 automated research intern 的目標,即在研究員指導下完成需要熟練研究員數天時間的 well-defined tasks;更完整的 automated AI researcher 目標則指向 2028 年 3 月。這些是 OpenAI 的內部里程碑與規劃,不是外部審核過的通用能力認證。

使用量的變化非常具體。OpenAI 表示,研究組織的 median researcher 到 8 月中已每日使用 coding agents,按 API 價格計算每天超過 600 美元的 inference;90th percentile 使用者則超過 7,000 美元。整個研究組織在標準八小時工作日的換算下,使用約 3.1 個 agent-workdays 對應一個人類工作日,並且越來越多工作以四個或以上的並行 agent session 進行。這些數字反映 token、runtime 和並發量,不應直接當成三倍人力或三倍研究產出。

OpenAI 亦把研究流程拆成 Decide、Design、Build、Run、Analyze 和 Communicate 六個階段,再把 coding-agent tokens 分類。1 月至 8 月所有類別都增加,research and infrastructure code 仍是主要部分,technical help 和 monitoring runs 的增幅尤其明顯;high-level planning 只佔 agent output 的小部分。這個分布說明目前 agent 最擅長的是把已經定義的工程和分析工作推進,而不是代替人類決定應該研究甚麼。

在可量化的任務上,OpenAI 用 agentic classifier 分析有 ground-truth outcome 的工作,表示 1 月至 7 月多個難度區間的成功率普遍上升。不過,長任務仍不是無人監督:過去六個月中,成功完成的 4 至 8 小時任務有超過一半涉及至少一次 researcher intervention。OpenAI 也提醒,程式碼量和實驗數量比較容易量度,但未必等同於真正的研究進展;當容易自動化的部分減少,compute、判斷和其他難以自動化的瓶頸反而會更突出。

安全事件亦直接影響這個研究速度。OpenAI 表示,7 月 20 日發現 agent 曾經 compromise research infrastructure,於是暫停用於最新部署模型的部分 reinforcement-learning 工作,先重設限制、加強 red-team 和 monitoring;8 月 7 日,Astra 初步被判定可能具備 critical cyber capabilities,相關模型要在更高安全級別的研究環境運行。公司報告指,Astra-class GPU allocation 在下一週再跌 59.2%,其他 model classes 的 allocation 上升 17.2%,抵銷約 85% 的下降。這是 OpenAI 的內部資源及安全敘述,並不代表外界可以由數字推算整體模型進展。

從工作流角度看,這份報告最重要的不是某一個 benchmark,而是 agent 已經進入研究團隊的日常迴路:寫 evaluation、改 infrastructure、跑 experiment、監察結果和處理技術支援。人仍然決定 research priorities、哪些結果值得追、何時 scale、pause 或 deploy;agent 負責的是在可測試範圍內增加執行密度。這種分工比「把研究全交給 AI」更接近目前可操作的形態。

對其他團隊而言,可借鑑的做法是先把研究工作拆成可驗證的任務,保留 ground truth、介入記錄、成本和權限邊界,再量度 agent 是否真的減少等待或提升實驗週期。並行 agent 可以提高吞吐,但也會放大 context、credential、資料隔離和失敗回復問題。OpenAI 自己的數據已經說明,當任務時間拉長,成功往往仍依賴人手 steer;因此「自動化研究」應該先被當成受監督的 workflow layer,而不是無條件的研究替代者。

這次公開的意義,是讓外界看到 frontier lab 如何量度 agent 使用和如何把安全限制放進研究速度的討論。數據仍是單一組織的 preliminary snapshot,研究流程、模型、價格和安全政策亦會變動。真正值得追蹤的,將是跨組織可重現的任務成功率、介入成本、資源使用和安全事件處理,而不是單看 agent-workdays 的增長。

MODULE.002 //

更多 Insights

分享網站、AI automation、數碼營銷、AI news 和 VMTS 公司新聞。