
OpenAI 於 2026 年 9 月 10 日推出 GPT-Live-1 API,將 ChatGPT 的 full-duplex voice conversation 帶到開發者手上。模型可以同時聆聽和說話,處理中途打斷、停頓、背景噪音和 backchannel,並讓開發者控制語氣、速度和對話風格。這是語音代理架構的一次轉變,而不只是聲音品質更新。
傳統 voice agent 通常把 speech-to-text、reasoning model 和 text-to-speech 串成多個階段,每次 handoff 都可能增加延遲或失去上下文。GPT-Live-1 把聆聽和說話放在同一個語音層,再把較深的推理和 action delegation 給後端文字模型、工具或 agent framework。對應用團隊來說,語音互動層和業務執行層可以分開調整。
OpenAI 列出的能力包括 interruption handling、background noise 和 silence management、long-session reliability、ASR transcripts、response text、keyword biasing、turn detection 及 telephony support。這令語音代理可以更像一段自然通話,但真正的預約、訂單更新、帳戶查詢或客服處理,仍需由後端系統按權限執行。
GPT-Live-1 可以把 reasoning 和 tool calls 交給 GPT-6 Astra 或第三方模型。開發者可以讓較快的後端處理排程和訂單更新,把較複雜的客戶問題交給更深的 reasoning,再把簡短結果回到語音對話。這種拆分能平衡延遲、成本和任務難度,但也要求團隊設計好 delegation、錯誤回復、超時和人工升級。
OpenAI 表示,早期評估中 Speak 的 GPT-Live-1 語音導師把 interruption 比上一代 turn-based 系統減少接近 80%;其內部 Full Duplex Bench 結果比 GPT-Realtime-2.1 高 30 個 percentage points,配合 GPT-6 Astra medium 在 Tau3 排名第一。這些是 OpenAI 或客戶早期結果,應視為產品方披露的方向性證據,不是每個語音工作流都能重現的獨立 benchmark。
定價方面,GPT-Live-1 的前端 voice layer 為每分鐘 0.05 美元,後端模型和工具用量另計。這種價格結構令企業不能只看每分鐘聲音成本,還要把後端 reasoning、搜尋、資料庫、電話供應商、錄音保留、人工轉接和失敗重試一併計算。低延遲不一定等於低總成本。
OpenAI 亦提到 Presence 可在 GPT-Live-1 上建立企業語音工作流,讓 agent 回答問題、解決問題、使用公司系統、採取批准的 action,以及在需要時轉交人員。這個描述清楚指出語音層不是完整的安全邊界:企業仍要為身份、敏感資料、付款或帳戶變更設計明確批准和審計。
GPT-Live-1 的意義,是把自然對話和 agent execution 連成一條更短的路徑。它可以令電話客服、預約、語言學習和現場支援更接近真人對話,但真正的部署品質仍取決於後端工具權限、資料來源、人工升級、錄音私隱和任務成功定義。語音自然只是入口,工作流治理才是結果。



