Google 推出 Gemini 3.8 Live with Live Avatar:视频、语音和工具调用合并到企业代理

Google 发布 Gemini 3.8 Live with Live Avatar,让企业代理在近实时对话中同时处理视频和声音、持续在后台调用工具,并支持 97 种语言的语音与唇形同步。

Google 于 2026 年 9 月 24 日公布 Gemini 3.8 Live with Live Avatar,把实时对话、流式视频和数字化身组合成企业代理体验。Google 表示,功能目前可在 Gemini Enterprise 使用,目标是让客服、互动导览和其他企业服务不只用文字或声音回应。

Live Avatar 可以同时处理视频和音频输入,并以带有表情、唇形同步和声音的视频方式回应。Google 将它描述为一种更接近真人对话的多模态互动,但企业真正采用时仍要先界定哪些场景需要视频存在感,因为更丰富的界面也会带来更高的内容、身份和可及性要求。

一个技术重点是 asynchronous tool execution。代理可以在后台调用工具、取得数据,同时保持对话不中断。Google 以酒店入住等复杂任务为例:代理可以一边与客户保持互动,一边处理外部系统数据。这种模式对工作流程有吸引力,但企业仍要清楚区分可读取数据、可执行动作和需要人工批准的步骤。

Google 表示 Live Avatar 可以在 97 种语言之间切换,并让语音、唇形和表情跟随语言变化而保持同步。这是产品宣称的支持范围,不等于每种语言在所有口音、专业术语和文化情境下都有相同效果;实际部署需要用目标市场的真实对话测试准确度和自然度。

企业可以从预设 avatar 中选择,也可以用高质量参考图片建立自定义 avatar,保留品牌风格或角色身份。Google 说,自定义 avatar 创建功能目前只向 enterprise allowlisting 开放。这意味着影像肖像权、员工或客户同意、冒充风险和内容标示,都应该在推出前纳入流程,而不只是交给产品设置。

在透明度方面,Google 表示所有由其 AI 产品生成的输出都会加上 SynthID 不可见水印,让音频和视频较容易被检测,以减少错误归因和误导。水印可以支持来源识别,但不能代替画面上的 AI 标示、人工监督、投诉渠道和对深度伪造内容的整体治理。

Gemini 3.8 Live with Live Avatar 的方向,代表企业代理开始由「回答问题」走向「持续在场并协调工具」。产品体验是否有价值,会取决于代理能否在不打断对话的情况下正确取数据、知道何时要停下来请人批准,以及在视频和多语言环境中保持可理解、可追溯和可控制。

MODULE.002 //

更多 Insights

分享网站、AI automation、数码营销、AI news 和 VMTS 公司新闻。