
OpenAI 於 2026 年 7 月 17 日發布〈A scorecard for the AI age〉,把企業評估 AI 的問題由「買了幾多席位、用了幾多 Token」轉向「AI 實際完成了幾多有用工作」。文章以 CFO 關心的投資回報為入口,提出一個名為「每美元有用智能」的衡量方向。
這個框架包括四個問題:AI 完成了多少重要工作、每項成功任務的完整成本是多少、人是否可以依賴結果,以及隨着使用量增加,每一美元是否帶來更多價值。OpenAI 認為,單看 Token 價格不足以判斷效益,因為較便宜的模型可能需要更多重試、較長等待或較多人工修正。
第一步是把指標放回真正發生工作的系統。客服團隊可以量度成功解決的個案,工程團隊可以量度通過測試及 review 的程式變更,法律團隊則可以量度準時而準確完成的合約審閱。文章建議先選一條 workflow,先定義「完成」的標準,再在原本的工作系統內記錄結果。
第二步是計算每項成功任務的完整成本。這不只包括模型及工具用量,也包括嘗試次數、延遲、員工時間、人工 review 和返工。OpenAI 以自家模型作例子,說明較高單價的模型如果能以較少次數達到品質要求,總成本未必比低價模型高;企業仍應用自己的代表性案例和品質門檻重新驗證。
可靠程度是這套方法的另一個重點。OpenAI 建議把結果分成「交付後可直接使用」、「需要修正」及「需要升級由人完成」三類,因為這比單一準確率更能反映 AI 是否真的減少了完成工作的負擔。當系統由草稿走向跨工具、處理例外和執行動作時,資料可見範圍、可使用的系統、人工批准點及權限邊界都需要先寫清楚。
最後,企業要觀察規模效益:在同一條 workflow 中,合格完成的任務是否增長得比總成本快,而且品質沒有下降。這使得 AI 投資更像一個可分階段驗證的 portfolio:先探索模型能否處理問題,再用真實案例驗證,最後才投資整合、治理、可靠性及變更管理。
這篇文章提供的是 OpenAI 的管理框架,而不是獨立的行業標準;文中對 ChatGPT Work、GPT-5.6 和計算基礎設施的描述也帶有供應商視角。對企業來說,最有用的做法是保留這四個問題,再用自己的成功定義、審批紀錄、成本資料和實際業務結果建立基線。



