OpenAI 預覽 GPT-5.6 Sol Ultrafast:速度成為 AI Agent 的新變數

OpenAI 預覽由 Cerebras 支援的 GPT-5.6 Sol Ultrafast,聲稱最高可達標準處理速度 14 倍及每秒 750 個輸出 token,先以有限客戶預覽方式推出。

OpenAI 在 2026 年 8 月 13 日預覽 GPT-5.6 Sol 的 Ultrafast mode,將它描述為一個新的速度層級。這個服務層首先在 OpenAI API 推出,由 Cerebras 提供推理硬件支援;OpenAI 表示,Ultrafast 的輸出速度最高可達每秒 750 個 token,較 Standard processing 快最多 14 倍。這些是供應商公布的上限,實際速度仍會受 prompt、輸出長度、工具調用和負載影響。

這次更新的重點,不是再選一個更小、更快但能力較弱的模型,而是嘗試把 frontier intelligence 放進需要即時回應的流程。OpenAI 列出的場景包括事故回應、金融研究與安全分析、即時客戶支援、電商對話,以及可以在同一個工作時段反覆進行的研究實驗。對 agent 而言,回應快不只改善聊天體驗,也可能縮短「觀察訊號、呼叫工具、檢查結果、再作下一步」的循環。

OpenAI 特別提到 incident response:當系統發生故障,agent 可以快速閱讀 logs、traces、近期程式碼變更及工程師報告,協助找出可能原因和準備修正方案。這個例子仍然是「協助工程師」,不是把部署權交給模型。原文也說明,工程師仍負責判斷和 deployment;速度的價值在於讓人更早看到足夠證據,而不是取消審批。

在研究工作方面,OpenAI 表示內部團隊會用 Ultrafast 快速搜尋知識、查詢資料、整理多個連接工具的結果。原本可能要隔夜執行、翌日才檢查的實驗迴圈,理論上可以在日間完成更多次迭代。這是 OpenAI 描述的內部使用方式和早期觀察,不是獨立研究結果;採用團隊仍要自行測量品質、成本和錯誤率。

目前 Ultrafast 只向一批初始客戶提供 limited preview,OpenAI 表示會隨容量增加而擴大。這個 rollout 很重要,因為高速推理未必代表總成本更低,也未必能自動解決外部 API、資料權限或人工批准等瓶頸。企業若只看 tokens per second,容易忽略整條 agent workflow 的端到端延遲。

較合理的評估方式,是同時記錄首 token 延遲、完成延遲、工具調用等待時間、每項任務成本、結果準確度、人工修改比例和需要重新執行的次數。對客服、交易監察或事故處理一類流程,還要另外測試高峰負載、資料更新中途的答案穩定性和權限邊界。速度只有在結果仍然可靠、可追蹤和可批准時,才會轉成實際工作效率。

Ultrafast 傳遞的更大訊號,是 AI 平台的競爭開始把「每秒完成多少有用工作」放到模型分數旁邊。當模型已能處理多步驟任務,延遲會直接影響 agent 可以嘗試多少次、使用者願意等待多久,以及一個互動式產品能否保持上下文。OpenAI 的預覽仍在早期,但它顯示下一輪 AI workflow 競爭,會同時圍繞智能、速度、成本和治理展開。

MODULE.002 //

更多 Insights

分享網站、AI automation、數碼營銷、AI news 和 VMTS 公司新聞。