Google 推出 Gemini 3.8 Live with Live Avatar:視像、語音和工具呼叫合併到企業代理

Google 發布 Gemini 3.8 Live with Live Avatar,讓企業代理在近即時對話中同時處理視像和聲音、持續在背景呼叫工具,並支援 97 種語言的語音與唇形同步。

Google 於 2026 年 9 月 24 日公布 Gemini 3.8 Live with Live Avatar,把即時對話、串流視像和數碼化身組合成企業代理體驗。Google 表示,功能現時可在 Gemini Enterprise 使用,目標是令客服、互動導覽和其他企業服務不只用文字或聲音回應。

Live Avatar 可以同時處理視像和音訊輸入,並以帶有表情、唇形同步和聲音的視像方式回應。Google 把它描述為一種更接近真人對話的多模態互動,但企業真正採用時仍要先界定哪些場景需要視像存在感,因為更豐富的介面也會帶來更高的內容、身份和可及性要求。

一個技術重點是 asynchronous tool execution。代理可以在背景呼叫工具、取得資料,同時保持對話不中斷。Google 以酒店入住等複雜任務作例子:代理可以一邊與客戶保持互動,一邊處理外部系統資料。這種模式對工作流程有吸引力,但企業仍要清楚區分可讀取資料、可執行動作和需要人工批准的步驟。

Google 表示 Live Avatar 可以在 97 種語言之間切換,並讓語音、唇形和表情跟隨語言變化而保持同步。這是產品宣稱的支援範圍,不等於每種語言在所有口音、專業術語和文化情境下都有相同效果;實際部署需要用目標市場的真實對話測試準確度和自然度。

企業可以從預設 avatar 中選擇,也可以用高質素參考圖片建立自訂 avatar,保留品牌風格或角色身份。Google 說,自訂 avatar 建立功能目前只向 enterprise allowlisting 開放。這意味著影像肖像權、員工或客戶同意、冒充風險和內容標示,都應該在推出前納入流程,而不只是交給產品設定。

在透明度方面,Google 表示所有由其 AI 產品生成的輸出都會加上 SynthID 不可見水印,讓音訊和視像較容易被偵測,以減少錯誤歸因和誤導。水印可以支持來源識別,但不能代替畫面上的 AI 標示、人工監督、投訴渠道和對深偽內容的整體治理。

Gemini 3.8 Live with Live Avatar 的方向,代表企業代理開始由「回答問題」走向「持續在場並協調工具」。產品體驗是否有價值,會取決於代理能否在不打斷對話的情況下正確取資料、知道何時要停下來請人批准,以及在視像和多語言環境中保持可理解、可追溯和可控制。

MODULE.002 //

更多 Insights

分享網站、AI automation、數碼營銷、AI news 和 VMTS 公司新聞。