
OpenAI 于 2026 年 7 月 30 日公布 GPT-5.6 的一轮价格与速度调整。这次重点不只是模型名称更新,而是把前沿模型的使用成本、响应速度和 agent 工作流放在同一个产品决策中:较复杂的任务可以使用 Sol,常规实现和验证则可以转到成本更低的 Terra 或 Luna。
按 OpenAI 公布的 API 价格,Terra 每 100 万个 input tokens 为 $2、output tokens 为 $12;Luna 则是 $0.20 和 $1.20。OpenAI 表示,Luna 的价格比原有级别低 80%,Terra 低 20%,而 Sol 的价格维持不变。实际账单仍会受到输入输出比例、cache、tool call 和请求数量影响,不能只看单价判断整个 workflow 的成本。
另一项变化是 Fast mode 取代 Priority Processing。OpenAI 表示,Fast mode 会以两倍 Standard 价格,让 Sol 的速度最高提升 2.5 倍;原有的 priority API 参数保持向后兼容。这种设计将「速度」变成一个可以按任务选择的资源:例如互动式除错、即时审批可能值得付费,而夜间批量测试则未必需要。
OpenAI 以一个简单的 agent 分工示例说明这种模型路由:先由 Sol 做规划、处理不确定性,再由 Luna 实现、测试和评估。这个思路比「所有请求都交给最强模型」更接近实际运营,因为 agent 工作通常包含多个步骤,而且每一步对推理深度、延迟和成本的要求不同。关键不是固定一个模型,而是把成功条件和升级条件写清楚。
OpenAI 同时宣称,Luna 在一年前的 frontier-class 任务上可以用约 6 美分完成,速度接近 9 倍;在 Agents’ Last Exam 的比较中,官方也声称相对 Fable 5,每个任务成本接近低 99%。这些属于供应商公布的 benchmark 或估算,不是独立验证。团队应自行检查任务成功率、重试率、工具成本、数据保护和人工复核时间,否则较低 token 价格可能被更多失败重跑抵消。
OpenAI 还表示,Sol 协助重写和优化 kernel 后,服务成本下降 20%,token generation efficiency 提升 15%。这同样是官方产品叙述,值得当作方向性信号,而不是每个 API 使用者都能直接复制的结果。模型本身、系统提示、cache 命中率、硬件和 serving 配置,都会影响实际数字。
对 AI Agent 团队来说,这次更新最实用的地方是提醒大家把模型选择变成 workflow policy。可以先定义任务的最低成功标准、允许延迟、每次成本上限和需要人工批准的动作,再按结果将请求路由到不同模型。这样既可以保留强模型处理不确定性,也可以避免让高成本模型承担大量可重复的工作。
不过,价格下调不代表部署风险同步下降。模型供应、地区可用性和 rollout 仍可能改变,OpenAI 也表示 AWS 上的部分可用性会稍后推出。较稳妥的做法是用自己的 production traces 做小型 replay,衡量成功率、延迟、token、cache、工具错误和人工介入,再决定是否切换,而不是只按公告中的单一 benchmark。



