Google 科学家 Sherry Yang:用两张 A100 训练世界模型,让具身智能在虚拟中“自我进化”

具身智能的“阿喀琉斯之踵”:高昂的物理试错成本

在机器人技术狂飙突进的今天,具身智能领域正面临着一个行业性的核心困境:我们虽然拥有了高容量的深度神经网络,但现实世界中高昂的交互与试错成本,成为了阻碍机器人通往 AGI 的最大瓶颈。

在虚拟世界里(如 AlphaGo 或大语言模型),代码和游戏的执行成本几乎为零,这使得模型能够利用海量数据进行自我进化。然而,在物理世界中,机器人每一次真机试错,都伴随着昂贵的时间成本、设备损耗与安全隐患。如果无法将这种高交互成本降下来,机器人就无法像大模型那样实现规模的指数级增长。

在机器人顶级学术会议 RSS 2026 的现场,来自 Google 实验室和纽约大学(NYU)的助理教授 Sherry Yang 提出了一种极具颠覆性的范式:直接利用可控的视频生成模型来作为真实世界的“替身”,让机器人在云端虚拟场景里完成无限次的低成本演练。

World Gym:两张 A100 跑通的云端模拟器

想要提升机器人,第一步永远是评估。但在现实中评估策略太痛苦了:人类需要耗费大量时间干等、硬件随时面临损坏风险,而且由于各家实验室机器人设备不同,论文结果根本无法标准化复现。传统的软件模拟器虽然能在云端运行,但在处理复杂的物体交互时往往失真。

为此,Sherry Yang 团队推出了 World Gym。这是一个基于视频生成模型的云端模拟器,其核心特点包括:

  1. 架构轻量且高效:采用可扩展的 Transformer 架构(具体为 Diffusion Transformer,即 DiT 架构)。该模型通过接收前序图像和当前的控制指令,持续生成未来的视频画面。
  2. 低成本训练:团队仅仅使用了两张 A100 GPU,就在 Bridge 数据集下训出了一个泛化能力出色的世界模型。
  3. 高保真度:在包含 22 种机器人形态的多样化数据集上训练后,当预设动作输入给世界模型时,它生成的视频与真实机器人在真机上执行的动作画面表现出了极高的一致性。

从“茄子实验”看评估体系的重构

一旦拥有了这个可控的视频世界模型,它就成了所有机器人策略模型的标准化评估层。Sherry Yang 团队将目前业内主流的策略(例如 Octo、OpenVLA、RT-1)放进 World Gym 中进行滚动测试,结果令人深思:

  • OpenVLA:表现完美,顺利完成了“把茄子放进锅里”的任务。
  • Octo:动作做了一半,未能完全把茄子送进去。
  • RT-1:这个几年前的老模型因为输出的控制动作完全超出了当前分布(OOD),甚至直接把世界模型“带崩”了。

“带崩”模型的价值何在? 这正是世界模型的意义所在——它提醒我们,如果这种动作直接在真机上运行,将会导致机器人损坏。

此外,世界模型允许通过图像编辑来定制任意超出分布(OOD)的安全测试。例如,团队在场景中通过图像编辑加入了一张画着胡萝卜的电脑屏幕,命令策略模型“去把胡萝卜拔出来”。结果发现策略模型纠结了半天,最后竟然冲着电脑屏幕去了。通过加入小黄鸭、玩具车等干扰物,研究团队还发现策略模型的成功率瞬间暴跌,并进一步调试出目前模型对“颜色指令”的理解远好于“形状指令”。

数据证明,世界模型得出的评估结果,与真机实测的成功率呈现出强烈的正相关性

World Gymnast:让机器人从失败中自我恢复

能够评估之后,下一步就是如何利用世界模型来提升策略。Sherry Yang 团队推出了 World Gymnast 项目,让机器人代理在世界模型中通过强化学习(RL)进行演化。

现在绝大多数机器人学习依赖人类遥控的数据来做监督微调。但大语言模型的发展历史告诉我们,真正带来能力跨越的,是利用验证器(Verifier)和强化学习(RL)去大规模地扩增任务。

在 World Gymnast 中:
* 失败即起点:机器人数据集中的任意一个画面(哪怕是操作失败的“砸锅”画面)都可以作为强化学习的起始点,逼着策略模型学会如何从错误状态中恢复(Failure Recovery)。
* VLM 作为裁判:利用视觉语言模型(VLM)作为通用的奖励模型(Reward Model),输入任务指令和世界模型生成的视频,让 VLM 像裁判一样给出成功或失败的反馈。
* 在线更新:反馈通过策略梯度(Policy Gradient)直接对策略网络进行在线更新。

在第三方自动化重置平台进行的真机测试中(涵盖开门、关门、放茄子等 4 个完全没有见过的全新留存任务),结果显示:在世界模型里跑过强化学习的模型,其表现不仅显著优于监督微调,也击败了在传统物理模拟器(如 Simpler)中训练的基准模型。 这是因为世界模型直接从海量数据中进行最大似然学习,天然具备极强的接触动力学拟合能力,克服了传统软件模拟器在复杂物体物理接触时的失真问题。

混合数据飞轮:通往通用机器人的路径

尽管目前的视频世界模型并不完美,偶尔会出现轻微的幻觉或改变物体颜色,但即使是不完美的模型,也已经能够提供足够正确的改进信号。

展望未来,通往具身智能 AGI 的关键在于建立一个混合数据飞轮

  1. 内环(策略进化):策略模型在参数化的视频世界模型里,进行成千上万种虚拟任务的低成本强化学习进化。
  2. 外环(模型迭代):机器人自主探索并产生失败数据,这些失败数据是完美的燃料,可直接用来梯度更新世界模型,使其更精确。

Sherry Yang 指出,互联网上庞大的第一视角人类交互视频是极大的宝藏。人类是地球上最强大的物理代理,通过端到端控制,可以将人类视频转化为机器人的世界先验。未来,通过世界模型将互联网视频的“广度”与机器人具身控制数据的“精度”桥接起来,将是敲开通用机器人大门的关键。


本文基于 Google 实验室及纽约大学助理教授 Sherry Yang 在 RSS 2026 大会上的演讲内容整理。