
OpenAI 在 2026 年 7 月 9 日正式推出 GPT-5.6 family,包含旗舰模型 Sol、日常工作取向的 Terra,以及成本最低的 Luna。这次发布的重点不只是「更聪明」,而是把不同强度的模型放进同一条 agent workflow 里,让团队可以按任务难度、成本和时限分配智能。
OpenAI 对 GPT-5.6 的定位很清楚:每一个 token 要产生更多可用工作。Sol 面向复杂推理、coding、knowledge work、cybersecurity 和 science;Terra 是较平衡的 everyday work 模型;Luna 则面向高频、低成本、快速任务。这种三层设计对企业很实际,因为真实工作流通常不是所有任务都需要最贵模型。
最值得留意的是 agentic coding。OpenAI 指出 GPT-5.6 Sol 是其最强 coding model,并在 coding-agent、Terminal-Bench、DeepSWE 等长任务测试中有明显提升。这代表模型能力开始更贴近真实工程场景:不只是补一段 code,而是理解 repo、使用 terminal、跑检查、修正错误,并在多步骤任务里保持方向。
GPT-5.6 也加入 Programmatic Tool Calling。它可以写和执行轻量程序,协调工具、处理中间结果、监控进度,再决定下一步。这对 tool-heavy workflow 很重要,因为过去很多 agent 系统会把每个工具回应都塞回模型,造成 token 浪费和上下文噪音。现在模型可以先过滤中间资料,只保留真正需要推理的部分。
另一个讯号是 max 和 ultra。max 让模型花更长时间探索和验证;ultra 默认协调四个 agents 并行处理复杂任务。这代表 OpenAI 正把「多 agent 协作」由开发者自己拼装的架构,逐步拉近到模型产品层。当任务需要 research、implementation、testing、review 同时推进时,这种并行结构会比单一聊天更接近实际工作。
对企业和开发团队来说,GPT-5.6 的启示是不要再把模型当成单一入口。更合理的做法,是把任务拆成不同层级:高风险或高复杂度工作交给 Sol;日常分析、文件、coding assistance 交给 Terra;批量分类、初稿、格式转换和低风险任务交给 Luna。这样才有机会在能力和成本之间取得可持续平衡。
这次发布也反映 AI 产品竞争正在由「模型排名」走向「工作流经济」。真正有价值的不是某一条 benchmark,而是模型能否在长时间、多工具、多步骤、可验证的任务中完成更多工作,同时保持成本可控。GPT-5.6 把这个方向讲得很明确:frontier intelligence 要可以按需放大,也要能够在日常 workflow 里变得更便宜。



