
OpenAI 於 2026 年 7 月 30 日公布 GPT-5.6 的一輪價格與速度調整。今次重點不只是模型名稱更新,而是把前沿模型的使用成本、回應速度和 agent 工作流程放在同一個產品決策裏:較複雜的任務可以用 Sol,常規實作和驗證則可以轉到成本較低的 Terra 或 Luna。
按 OpenAI 公布的 API 價格,Terra 每 100 萬個 input tokens 為 $2、output tokens 為 $12;Luna 則是 $0.20 和 $1.20。OpenAI 表示,Luna 的價格比原有級別低 80%,Terra 低 20%,而 Sol 的價格維持不變。實際帳單仍會受輸入輸出比例、cache、tool call 和請求數量影響,不能只看單價判斷整個 workflow 的成本。
另一項變化是 Fast mode 取代 Priority Processing。OpenAI 表示,Fast mode 會以兩倍 Standard 價格,讓 Sol 的速度最高提升 2.5 倍;原有的 priority API 參數保持向後兼容。這種設計將「速度」變成一個可按任務選擇的資源:例如互動式除錯、即時審批可能值得付費,而夜間批量測試則未必需要。
OpenAI 以一個簡單的 agent 分工示例說明這種模型路由:先由 Sol 做規劃、處理不確定性,再由 Luna 實作、測試和評估。這個思路比「所有請求都交給最強模型」更接近實際營運,因為 agent 工作通常包含多個步驟,而且每一步對推理深度、延遲和成本的要求不同。關鍵不是固定一個模型,而是把成功條件和升級條件寫清楚。
OpenAI 同時宣稱,Luna 在一年前的 frontier-class 任務上可以用約 6 美仙完成,速度接近 9 倍;在 Agents’ Last Exam 的比較中,官方亦聲稱相對 Fable 5,每個任務成本接近低 99%。這些屬於供應商公布的 benchmark 或估算,不是獨立驗證。團隊應自行檢查任務成功率、重試率、工具成本、資料保護和人工覆核時間,否則較低 token 價格可能被更多失敗重跑抵消。
OpenAI 亦表示,Sol 協助重寫和優化 kernel 後,服務成本下降 20%,token generation efficiency 提升 15%。這同樣是官方產品敘述,值得當作方向性訊號,而不是每個 API 使用者都能直接複製的結果。模型本身、系統提示、cache 命中率、硬件和 serving 配置,均會影響實際數字。
對 AI Agent 團隊而言,今次更新最實用的地方是提醒大家把模型選擇變成 workflow policy。可以先定義任務的最低成功標準、容許延遲、每次成本上限和需要人工批准的動作,再按結果將請求路由到不同模型。這樣既可以保留強模型處理不確定性,也可避免讓高成本模型承擔大量可重複的工作。
不過,價格下調不代表部署風險同步下降。模型供應、地區可用性和 rollout 仍可能改變,OpenAI 亦表示 AWS 上的部分可用性會稍後推出。較穩妥的做法是以自己的 production traces 做小型 replay,量度成功率、延遲、token、cache、工具錯誤和人工介入,再決定是否切換,而不是只按公告中的單一 benchmark。



