Gemini Robotics 2 发布|人形机器人终于能从脚趾尖到手指尖都「想」着动了
2026 年 7 月 30 日,Google DeepMind 正式发布了 Gemini Robotics 2。不是一次小版本迭代——它把机器人从「只能干桌面活」推到了「能蹲、能伸、能两手配合、能和其他机器人搭伙干活」的阶段。
上一代 Gemini Robotics 的演示里,机器人主要控制上半身做桌面操作。手臂能干活,腿基本是摆设。Gemini Robotics 2 最大的变化就一句话:从脚趾尖到手指尖,模型开始控制全身了。
它用同一个模型 checkpoint 控制了三套完全不同的硬件——Apptronik Apollo 2(配两种手:SharpaWave 五指手和 Inspire 手),以及 Franka Duo 双臂平台(配两指平行夹爪)。同一个模型,没针对每种机器人单独训练,直接上手。
这意味着可以让一个人形机器人去「把洒水壶放到底层架子的绿色箱子里」——它自己走过去、弯腰、捡起来、走到架子前、放进去。整个过程不是预制动作序列,而是模型实时推理出来的。
三个模型,分了三层活
Gemini Robotics 2 不是一个模型,而是三个:
- Gemini Robotics 2(VLA):视觉-语言-动作模型,直接输出电机控制信号。它控制全身,从走路到手指精细操作。
- Gemini Robotics ER 2(Embodied Reasoning):负责「动脑子」的模型——看环境、拆任务、做计划、跟人沟通、自我纠错。能执行持续几分钟、涉及上百个决策的复杂任务序列。
- Gemini Robotics On-Device 2(VLA):本地运行的轻量版,不需要联网。关键能力是快速适应新机器人——几个小时的适配时间,通常只需要不到 200 个示例数据,就能让模型在完全不同的机器人上干活,哪怕传感器、自由度、外形都不一样。
第三个能力挺核心的。现实世界的机器人硬件五花八门,一个模型能用 200 条数据、花几小时就适应一套新硬件,规模化部署的门槛会低很多。
精细操作:拧灯泡、系垃圾袋、封保鲜袋
多指灵巧操作是机器人领域的老大难。这次 DeepMind 放出了具体数据:
Apollo 配 SharpaWave 五指手,在多指灵巧任务上:拧下灯泡 92%、拧上灯泡 36%、系垃圾袋 44%、用簸箕 32%、封保鲜袋 40%。除了拧下灯泡,其他都在 30%-44% 之间,离可靠商用还有距离。
两指夹爪的表现好很多。Franka Duo 平台上,通用拿放 74.2%、多样工具套装 78.9%、精密插入 89.6%。在夹爪场景下,这个模型已经接近可用了。
全身操控方面:桌上捡物 68.4%、地上捡物 45.7%、架子上捡物 76.3%。地上捡物最难——要弯腰、找角度、保持平衡,不到 50% 说明模型在复杂地面场景仍然吃力。
多机器人协作,不再是演示噱头
这次真正新增的能力是多机器人协作。Gemini Robotics ER 2 可以让不同类型的机器人互相通信、协作完成单个机器人搞不定的任务。以前大多是 Demo 里秀一下就过去了,这次 DeepMind 明确把它作为一个关键更新列出来。
ER 2 模型已经可以在 Google AI Studio 上直接使用,也可以申请 Gemini Enterprise Agent Platform 的私有预览。做机器人的团队可以拿这个模型去规划任务、做环境理解、做人与机器人之间的对话交互。VLA 和 On-Device 模型则需要申请早期合作伙伴计划。
安全:ASIMOV-Agentic 基准
伴随发布还有一个安全基准叫 ASIMOV-Agentic,专门衡量具身推理智能体在安全方面的表现——比如是否能在不确定时拒绝不安全的工具调用、能否判断任务是否可能完成、需不需要主动请求人工介入。ER 2 据称是 DeepMind 在安全约束遵循和人机距离感知方面表现最好的机器人模型,能检测人靠近并触发安全停止。
尾巴
Gemini Robotics 2 有意思的地方不是某个 benchmark 特别高,而是它展示了机器人 AI 正在从「给固定动作编程」转向「模型自己推理怎么动」。拧灯泡成功率不高、地上捡东西不到一半——这些数字说明离真正进家庭和工厂还有距离。但同一个模型能同时控制五指手和两指夹爪,花几小时就能适应一台没见过的机器人,这个趋势本身就值得关注。
ER 2 模型已经在 AI Studio 里了,想试的可以上去跑跑看。VLA 和 On-Device 入口还没全开,但合作申请已经开放了。
相关链接: