
OpenAI 于 2026 年 8 月 13 日预览 GPT-5.6 Sol 的 Ultrafast mode,将它描述为一个新的速度层级。这个服务层首先在 OpenAI API 推出,由 Cerebras 提供推理硬件支持;OpenAI 表示,Ultrafast 的输出速度最高可达每秒 750 个 token,比 Standard processing 快最多 14 倍。这些是供应商公布的上限,实际速度仍会受 prompt、输出长度、工具调用和负载影响。
这次更新的重点,不是再选择一个更小、更快但能力较弱的模型,而是尝试把 frontier intelligence 放进需要即时回应的流程。OpenAI 列出的场景包括事故响应、金融研究与安全分析、实时客户支持、电商对话,以及可以在同一个工作时段反复进行的研究实验。对 agent 来说,回应变快不只改善聊天体验,也可能缩短「观察讯号、调用工具、检查结果、再作下一步」的循环。
OpenAI 特别提到 incident response:当系统发生故障,agent 可以快速阅读 logs、traces、近期代码变更及工程师报告,协助找出可能原因和准备修正方案。这个例子仍然是「协助工程师」,不是把部署权交给模型。原文也说明,工程师仍负责判断和 deployment;速度的价值在于让人更早看到足够证据,而不是取消审批。
在研究工作方面,OpenAI 表示内部团队会用 Ultrafast 快速搜索知识、查询数据、整理多个连接工具的结果。原本可能要隔夜执行、翌日才检查的实验循环,理论上可以在日间完成更多次迭代。这是 OpenAI 描述的内部使用方式和早期观察,不是独立研究结果;采用团队仍要自行测量质量、成本和错误率。
目前 Ultrafast 只向一批初始客户提供 limited preview,OpenAI 表示会随容量增加而扩大。这个 rollout 很重要,因为高速推理未必代表总成本更低,也未必能自动解决外部 API、数据权限或人工批准等瓶颈。企业若只看 tokens per second,容易忽略整条 agent workflow 的端到端延迟。
较合理的评估方式,是同时记录首 token 延迟、完成延迟、工具调用等待时间、每项任务成本、结果准确度、人工修改比例和需要重新执行的次数。对于客服、交易监察或事故处理一类流程,还要另外测试高峰负载、数据更新中途的答案稳定性和权限边界。速度只有在结果仍然可靠、可追踪和可批准时,才会转成实际工作效率。
Ultrafast 传递的更大讯号,是 AI 平台的竞争开始把「每秒完成多少有用工作」放到模型分数旁边。当模型已经能处理多步骤任务,延迟会直接影响 agent 可以尝试多少次、用户愿意等待多久,以及一个互动式产品能否保持上下文。OpenAI 的预览仍在早期,但它显示下一轮 AI workflow 竞争,会同时围绕智能、速度、成本和治理展开。



