
OpenAI 在 2026 年 7 月 9 日正式推出 GPT-5.6 family,包含旗艦模型 Sol、日常工作取向的 Terra,以及成本最低的 Luna。這次發布的重點不只是「更聰明」,而是把不同強度的模型放進同一條 agent workflow 裏,讓團隊可以按任務難度、成本和時限分配智能。
OpenAI 對 GPT-5.6 的定位很清楚:每一個 token 要產生更多可用工作。Sol 面向複雜推理、coding、knowledge work、cybersecurity 和 science;Terra 是較平衡的 everyday work 模型;Luna 則面向高頻、低成本、快速任務。這種三層設計對企業很實際,因為真實工作流通常不是所有任務都需要最貴模型。
最值得留意的是 agentic coding。OpenAI 指出 GPT-5.6 Sol 是其最強 coding model,並在 coding-agent、Terminal-Bench、DeepSWE 等長任務測試中有明顯提升。這代表模型能力開始更貼近真實工程場景:不只是補一段 code,而是理解 repo、使用 terminal、跑檢查、修正錯誤,並在多步驟任務裏保持方向。
GPT-5.6 亦加入 Programmatic Tool Calling。它可以寫和執行輕量程式,協調工具、處理中間結果、監控進度,再決定下一步。這對 tool-heavy workflow 很重要,因為過去很多 agent 系統會把每個工具回應都塞回模型,造成 token 浪費和上下文噪音。現在模型可以先過濾中間資料,只保留真正需要推理的部分。
另一個訊號是 max 和 ultra。max 讓模型花更長時間探索和驗證;ultra 預設協調四個 agents 並行處理複雜任務。這代表 OpenAI 正把「多 agent 協作」由開發者自己拼裝的架構,逐步拉近到模型產品層。當任務需要 research、implementation、testing、review 同時推進時,這種並行結構會比單一聊天更接近實際工作。
對企業和開發團隊來說,GPT-5.6 的啟示是不要再把模型當成單一入口。更合理的做法,是把任務拆成不同層級:高風險或高複雜度工作交給 Sol;日常分析、文件、coding assistance 交給 Terra;批量分類、初稿、格式轉換和低風險任務交給 Luna。這樣才有機會在能力和成本之間取得可持續平衡。
這次發布亦反映 AI 產品競爭正在由「模型排名」走向「工作流經濟」。真正有價值的不是某一條 benchmark,而是模型能否在長時間、多工具、多步驟、可驗證的任務中完成更多工作,同時保持成本可控。GPT-5.6 把這個方向講得很明確:frontier intelligence 要可以按需放大,也要能夠在日常 workflow 裏變得更便宜。



