
OpenAI 在 2026 年 6 月 25 日發布一篇新的 Economic Research 文章,主題是 agents 如何改變工作。這次焦點不是再介紹一個功能,而是用 Codex 作為樣本,研究 AI agent 在前沿知識工作裏可以承擔多少經濟價值。對企業來說,這比一般產品更新更重要,因為它把 agent 從 demo 拉回到工作量、任務時間和人類審核的現實問題。
文章的核心訊號,是 Codex 這類 agent 開始處理較長時間、較複雜、需要多步驟推理和執行的任務。過去 chatbot 主要回答問題或產生文字,價值很大但多數仍停留在即時互動。Agent 的分別在於可以接收一段較完整的工作,自己展開、調用工具、產生結果,再交給人檢查。
OpenAI 把這個方向稱為量度 Codex 在 frontier economic potential 上的能力。這種量度方式很有意思,因為它不只問「模型答得準不準」,而是問一個任務如果由有經驗的人做,需要多少時間、多少判斷、多少上下文。當 AI agent 能處理這類任務,企業採用 AI 的評估方法就會由 seat count 轉向 delegated work volume。
對工作流程的啟示很直接。Agent 不是要把每個職位立即自動化,而是先吃掉那些可以清楚描述、可驗收、可回滾的工作片段。程式修改、資料整理、法務初稿、財務核對、客戶問題分類、內部知識搜尋,都可能成為這類任務。人的角色則由每一步親手執行,變成設定目標、提供約束、審閱結果和處理例外。
這亦解釋了為甚麼 2026 年的 AI competition 會集中在 agent tooling,而不只是模型榜單。要讓 agent 真的進入工作,系統需要檔案、repo、資料庫、瀏覽器、工作票、審批、記憶和權限控制。沒有這些上下文和治理,agent 只能在沙盒裏示範;有了它們,agent 才可能變成可衡量的工作單元。
值得留意的是,OpenAI 選擇用 Codex 做這類研究,也反映 coding agent 仍然是最容易量化的早期市場。軟件任務有清楚輸入、可測試輸出、版本控制和 review 流程,所以特別適合先驗證 agent work。當這套方法成熟後,同樣的量度框架會逐步外溢到營運、財務、銷售和合規。
這篇文章的最大啟示,是企業不應只問 AI 能不能「幫手」。更實際的問題是:哪些任務可以被拆成 agent 可接收的工作包?哪些輸出可以用測試、審批或人手 review 驗收?哪些資料和權限要先整理?當答案變清楚,AI agent 才會由聊天工具變成真正的工作基礎設施。



