OpenAI 推出 GPT-Live-1 API:全双工语音代理把对话层与后端行动分开

GPT-Live-1 把 ChatGPT 的全双工语音带到 API,可同时聆听和说话,并把深度推理及工具调用交给后端模型与 agent harness。

OpenAI 于 2026 年 9 月 10 日推出 GPT-Live-1 API,将 ChatGPT 的 full-duplex voice conversation 带给开发者。模型可以同时聆听和说话,处理中途打断、停顿、背景噪音和 backchannel,并让开发者控制语气、速度和对话风格。这是语音代理架构的一次转变,而不只是声音质量更新。

传统 voice agent 通常把 speech-to-text、reasoning model 和 text-to-speech 串成多个阶段,每次 handoff 都可能增加延迟或丢失上下文。GPT-Live-1 把聆听和说话放在同一个语音层,再把更深的推理和 action delegation 给后端文本模型、工具或 agent framework。对应用团队来说,语音互动层和业务执行层可以分开调整。

OpenAI 列出的能力包括 interruption handling、background noise 和 silence management、long-session reliability、ASR transcripts、response text、keyword biasing、turn detection 以及 telephony support。这让语音代理可以更像一段自然通话,但真正的预约、订单更新、账户查询或客服处理,仍需由后端系统按权限执行。

GPT-Live-1 可以把 reasoning 和 tool calls 交给 GPT-6 Astra 或第三方模型。开发者可以让较快的后端处理排程和订单更新,把更复杂的客户问题交给更深的 reasoning,再把简短结果返回语音对话。这种拆分能平衡延迟、成本和任务难度,但也要求团队设计好 delegation、错误恢复、超时和人工升级。

OpenAI 表示,早期评估中 Speak 的 GPT-Live-1 语音导师把 interruption 比上一代 turn-based 系统减少接近 80%;其内部 Full Duplex Bench 结果比 GPT-Realtime-2.1 高 30 个 percentage points,配合 GPT-6 Astra medium 在 Tau3 排名第一。这些是 OpenAI 或客户早期结果,应视为产品方披露的方向性证据,不是每个语音工作流都能重现的独立 benchmark。

定价方面,GPT-Live-1 的前端 voice layer 为每分钟 0.05 美元,后端模型和工具用量另计。这种价格结构意味着企业不能只看每分钟声音成本,还要把后端 reasoning、搜索、数据库、电话供应商、录音保留、人工转接和失败重试一并计算。低延迟不一定等于低总成本。

OpenAI 也提到 Presence 可在 GPT-Live-1 上建立企业语音工作流,让 agent 回答问题、解决问题、使用公司系统、采取批准的 action,并在需要时转交人员。这个描述清楚指出语音层不是完整的安全边界:企业仍要为身份、敏感数据、付款或账户变更设计明确批准和审计。

GPT-Live-1 的意义,是把自然对话和 agent execution 连接成一条更短的路径。它可以让电话客服、预约、语言学习和现场支持更接近真人对话,但真正的部署质量仍取决于后端工具权限、数据来源、人工升级、录音隐私和任务成功定义。语音自然只是入口,工作流治理才是结果。

MODULE.002 //

更多 Insights

分享网站、AI automation、数码营销、AI news 和 VMTS 公司新闻。