Google DeepMind 推出 Gemini Robotics 2:从机器人控制走向具身 Agent

Gemini Robotics 2 分为控制人形及双臂机器人的 VLA、负责规划与工具协作的 ER 2,以及可在本地运行的 On-Device 2,并按不同硬件和部署场景提供。

Google DeepMind 于 2026 年 7 月 30 日公布 Gemini Robotics 2,将机器人研究从「看懂影像和回答问题」进一步推向整个身体的感知、规划和动作控制。这次不是单一模型,而是一组按照机器人形态、任务规划和运行位置分工的模型,反映具身 AI 正逐渐采用类似 agent system 的分层架构。

第一个是 Gemini Robotics 2 VLA(vision-language-action),用于控制完整人形机器人和双臂机器人,并处理需要手部灵巧度的动作。第二个是 Robotics-ER 2,属于视觉语言模型及 agent,负责多步任务规划、工具调用和多机器人协作。第三个是 Robotics On-Device 2,将 VLA 放在设备本身运行,以降低延迟和对云端连接的依赖。

Google 对 On-Device 2 的描述是,新的机器人形态可以在数小时内完成适应,通常只需要少于 200 个示范例子。这个数字是官方产品描述,实际效果仍取决于机器人的传感器、关节、抓取器、控制频率、示范质量和安全限制。把模型放到本地也不代表所有推理或更新流程都不需要云端。

Robotics-ER 2 的角色更接近一个具身 agent:它可以理解环境、把任务拆成多个步骤、调用工具,并协调不同机器人。Google 表示 ER 2 可在 Google AI Studio 使用,也在 Gemini Enterprise Agent Platform 进行 private preview;VLA 和 On-Device 2 则先向早期合作伙伴开放。这些 availability 状态应按帐户、地区及合作伙伴资格理解,不能当作普遍公开产品。

这次发布也直接指出具身智能的难点仍然存在。Google 特别提到多指灵巧操作仍然很具挑战,意味着「模型能够描述一个动作」与「机器人能在真实环境可靠完成动作」之间仍有很大距离。地面摩擦、物件变形、遮挡、碰撞、电量和人机共处,都不是只靠语言模型就能消除的问题。

对机器人团队来说,这种三层模型设计提供一个清楚的工程思路:高层 ER 2 可以处理任务理解和协作,中层 VLA 负责视觉到动作的控制,而 On-Device 2 则处理需要低延迟的本地反应。但是,实际系统仍要在模型之外加入 deterministic constraints、急停、人工接管、权限边界和可重复的测试场景,否则 agent 的灵活性可能变成不可预测的行为。

Google 也为 Gemini Robotics 2 提供安全框架和安全报告,但安全文件的范围不应被理解为任何实体机器人的认证。部署前仍需要针对实际硬件做碰撞、负载、失效、通信中断和人员安全验证,并保留由人直接停止或接管的路径。具身 AI 的安全,最终是模型、控制器、硬件和现场流程共同构成的系统问题。

这次更新的主要信号,是 Google 正把 Gemini 的 agent 能力延伸到需要身体行动的环境,而不是只在数字界面中执行工具。对企业来说,值得先验证的并非「机器人是否像人」,而是某个明确任务能否在限制条件下稳定完成:成功率、重试率、延迟、能耗、人工接管次数和安全事件,会比一次演示更能说明部署价值。

MODULE.002 //

更多 Insights

分享网站、AI automation、数码营销、AI news 和 VMTS 公司新闻。