李飞飞参与新作:把动作「画」给视频世界模型,实现跨本体双向推演

让机器人“看”见动作:斯坦福、哈佛等团队提出 Masked Visual Actions 新范式

在机器人学习领域,如何让机器理解“我动一下,世界会怎样变化”是一个核心难题。传统方法往往依赖复杂的数值计算和物理仿真,而最新的研究正在尝试一种更直观、更接近人类认知的方式——让视频模型直接“看”懂机器人的动作

由 Hadi Alzayer 担任第一作者,李飞飞(Fei-Fei Li)、吴佳俊(Jiajun Wu)、张吕敏(Lvmin Zhang)等知名学者参与的斯坦福大学、马里兰大学帕克分校及哈佛大学联合研究团队,在最新论文《Masked Visual Actions for Unified World Modeling》中提出了一种创新方案:Masked Visual Actions(掩码视觉动作)

这项研究不仅统一了动作表示,还实现了跨本体泛化和双向推演,为机器人世界模型带来了全新的视角。


一、从“枯燥数字”到“直观画面”:动作表示的革命

传统方法的困境

长期以来,视频世界模型(Video World Models)在处理机器人动作时,通常采用以下流程:
1. 输入当前环境画面。
2. 输入机器人的数值型动作(如关节角度、末端执行器位姿等)。
3. 生成未来帧的视频预测。

这种方法存在两个显著缺陷:
* 模态鸿沟:视觉模型天生擅长处理像素信息,而数值动作与画面之间的映射关系需要模型额外学习,效率低下。
* 数据依赖:这种表示方式高度依赖特定机器人的训练数据,难以泛化到其他形态的机器人上。

Masked Visual Actions 的新思路

研究团队提出了一种颠覆性的转换:将机器人的候选动作直接渲染成像素级的运动轨迹掩码(Mask)

具体而言,他们通过以下方式构建训练数据:
1. 真实视频分割:直接从真实机器人操作视频中分割出机械臂。
2. 物理渲染:根据机器人状态、URDF 模型(机器人描述格式)和相机参数,渲染出机械臂的运动轨迹。

相比稀疏的运动坐标,完整掩码(Full Mask) 包含了丰富的视觉信息:
* 机器人的形状与轮廓。
* 机器人在空间中的占用情况。
* 机器人对环境的遮挡关系。
* 潜在的接触边界。

这使得视频世界模型能够直接“看到”动作的过程,就像人类观察机器人操作一样直观,无需在数值和像素之间进行复杂的转译。


二、跨本体泛化与双向推演:从“单向预测”到“双向思考”

强大的跨本体泛化能力

实验结果表明,基于像素的动作表示赋予了模型显著的跨本体泛化(Cross-Embodiment Generalization)能力。

当测试对象换成未见过的自定义夹爪或双臂机器人时:
* 基于完整掩码的方法:能够稳定地保留机器人的形态特征,并准确预测其与环境的交互结果。
* 对比方法:如末端点、骨架甚至直接输入原始动作状态的 Ctrl-World 等方法,则容易出现形态扭曲、肢体断裂或生成损坏的画面。

这证明,视觉模型通过“看”动作的形状和空间关系,比通过“读”数值更能理解机器人的本质特性。

正向预测与逆向生成的统一

Masked Visual Actions 的最大亮点之一,是实现了正向预测逆向生成的统一:

  1. 正向预测(Forward Prediction)
    * 输入:机器人怎么动(动作掩码)。
    * 输出:环境如何变化(未来视频)。
    * 用途:预判动作后果,辅助规划。

  2. 逆向生成(Inverse Generation)
    * 输入:目标物体怎么动(目标轨迹)。
    * 输出:机器人可能采取的行为(动作掩码)。
    * 用途:从零样本转向逆向建模,提出可能的动作方案。

在 RoboCasa 复杂任务场景中,这种“填空题”式的推理展现了巨大潜力。模型只需接收目标物体的预期轨迹,即可自动生成机器人可能采取的对应动作,无需额外的逆动力学模型训练。


三、高效微调与卓越实验结果

低成本高效微调

研究团队基于 Wan-Fun-Control 2.2 14B 基础视频模型进行 LoRA 微调,仅使用了约 15 小时 的机器人交互数据:
* 数据来源:包含 DROID 真实视频数据和 RoboCasa 仿真环境数据。
* 关键技巧:特别引入了失败轨迹数据。这些数据对于防止模型对候选轨迹产生盲目乐观的预测至关重要,提升了模型的鲁棒性。

三大核心实验成果

1. 辅助规划:成功率显著提升

在微波炉操作、抽屉开合等任务中,引入视频模型进行预演后,机器人任务的成功率提升了 7 至 26 个百分点。这表明,让机器人在执行前“看”一遍未来,能有效避免错误。

2. 策略评估:高相关性筛查工具

视频模型预测的成功率与真实仿真环境中的成功率相关系数高达 0.982。尽管模型存在一定的乐观倾向,但其作为低成本、快速的策略筛查工具的价值不容忽视。

3. 逆向提取:优于主流基线

在 CoffeeServeMug 任务中,结合逆动力学模型从视频预测中提取可执行动作,取得了 90% 的成功率。这一表现优于 Diffusion Policy、ACT 和 SmolVLA 等当前主流方法。


四、局限与展望:明确分工,协同进化

尽管成果显著,研究团队也客观指出了当前的局限性:

  • 物理约束缺失:目前模型学习的是交互的相关性,而非严格的因果性与物理定律。因此,可能出现无接触运动、物体瞬移等违反物理常识的现象。
  • 实时性挑战:视频生成的速度和计算成本较高,限制了其在实时闭环控制中的应用。

未来的机器人系统架构

研究清晰地勾勒出了视频模型在机器人系统中的新分工:

模块 职责
策略模型 提出候选动作
视频世界模型 预演动作后果,生成未来画面
视觉语言模型 (VLM) 评价视频结果,判断是否成功
控制器 执行最优动作

这种模块化、协同化的架构,有望推动机器人智能从“感知-反应”向“想象-规划-执行”的高级认知阶段演进。


结语

Masked Visual Actions 研究通过将被动的数值动作转化为主动的视觉信号,打通了视频模型与机器人控制之间的壁垒。它不仅提升了机器人操作的准确性和泛化能力,更为构建通用、智能的机器人世界模型提供了一条清晰且富有前景的技术路径。

随着基础视频模型能力的不断提升和物理约束的引入,我们有理由期待,未来的机器人将像人类一样,在行动之前先在脑海中“预演”一遍未来。