
Google DeepMind 於 2026 年 7 月 30 日公布 Gemini Robotics 2,將機械人研究由「看懂影像和回答問題」再推向整個身體的感知、規劃和動作控制。今次不是單一模型,而是一組按機械人形態、任務規劃和運行位置分工的模型,反映具身 AI 正逐漸採用類似 agent system 的分層架構。
第一個是 Gemini Robotics 2 VLA(vision-language-action),用來控制完整人形機械人和雙臂機械人,並處理需要手部靈巧度的動作。第二個是 Robotics-ER 2,屬於視覺語言模型及 agent,負責多步任務規劃、工具呼叫和多機械人協作。第三個是 Robotics On-Device 2,將 VLA 放在裝置本身運行,以降低延遲和對雲端連線的依賴。
Google 對 On-Device 2 的描述是,新的機械人形態可以在數小時內完成適應,通常只需要少於 200 個示範例子。這個數字是官方產品描述,實際效果仍要看機械人的感應器、關節、抓取器、控制頻率、示範品質和安全限制。把模型搬到本地也不等於所有推理或更新流程都不需要雲端。
Robotics-ER 2 的角色較接近一個具身 agent:它可以理解環境、把任務拆成多個步驟、呼叫工具,並協調不同機械人。Google 表示 ER 2 可在 Google AI Studio 使用,亦在 Gemini Enterprise Agent Platform 進行 private preview;VLA 和 On-Device 2 則先向早期合作夥伴開放。這些 availability 狀態應按帳戶、地區及合作夥伴資格理解,不能當作普遍公開產品。
今次發布也直接指出具身智能的難點仍然存在。Google 特別提到多指靈巧操作仍然很具挑戰,意味「模型能夠描述一個動作」與「機械人能在真實環境可靠完成動作」之間仍有很大距離。地面摩擦、物件變形、遮擋、碰撞、電量和人機共處,都不是只靠語言模型就能消除的問題。
對機械人團隊而言,這種三層模型設計提供一個清楚的工程思路:高層 ER 2 可以處理任務理解和協作,中層 VLA 負責視覺到動作的控制,而 On-Device 2 則處理需要低延遲的本地反應。可是,實際系統仍要在模型之外加入 deterministic constraints、急停、人手接管、權限邊界和可重現的測試場景,否則 agent 的靈活性可能變成不可預測的行為。
Google 亦為 Gemini Robotics 2 提供安全框架和安全報告,但安全文件的範圍不應被理解為任何實體機械人的認證。部署前仍需要針對實際硬件做碰撞、負載、失效、通訊中斷和人員安全驗證,並保留由人直接停止或接管的路徑。具身 AI 的安全,最終是模型、控制器、硬件和現場流程共同構成的系統問題。
這次更新的主要訊號,是 Google 正把 Gemini 的 agent 能力延伸到需要身體行動的環境,而不是只在數碼介面中執行工具。對企業來說,值得先驗證的並非「機械人是否像人」,而是某個明確任務能否在限制條件下穩定完成:成功率、重試率、延遲、能耗、人手接管次數和安全事件,會比一次示範更能說明部署價值。



