解构组合式世界模型:用因子图与时间注意力跨越"视行断层"
核心事件:RSS 2026(Robotics: Science and Systems 2026)
主讲人:徐丹飞(Danfei Xu),佐治亚理工学院助理教授、NVIDIA研究员
演讲主题:《Compositional World Models》(组合式世界模型)
导语:被高保真视频掩盖的认知误区
随着以 Sora 为代表的高保真视频生成技术走向成熟,模型已经能够为机器人构建出极其逼真的未来画面,让人感觉 AGI 似乎触手可及。但回到真实的物理世界,一个令人困惑的现象出现了:即便模型能够预测出完美的未来画面,机械臂在实际落地执行时依然频频失效。
这暴露出了行业内长期被忽视的一个核心矛盾——能够"生成"成功的结果,绝不等同于拥有真正的"规划能力"。 面对未曾见过的长流程任务与复杂的物理约束,机器人陷入了"看得懂画面,做不出动作"的瓶颈。
在近期召开的 RSS 2026 大会上,佐治亚理工学院助理教授、NVIDIA 研究员徐丹飞直击这一症结,提出了一套利用模块化与因子图(Factor Graphs)的解法,主张让机器人像搭积木一样,在测试阶段动态拼装基础技能;同时,他也首次深刻剖析了视频预测与真实控制之间的"视频-动作跨越断层(Video-Action Gap)"。
一、别被"脑补画面"骗了:视觉生成并不等于物理规划
世界模型(World Models)是当下整个机器人领域最受关注的技术路线之一。从早年结合线性动力学进行视频控制,到如今扩散模型带来的高保真视频生成,研究者的目标都是构建出一个"通用规划器"——让机器人先在脑海中预演成功的未来,然后照此执行。
但这其中隐藏着一个根本性的认知误区:高保真的画面生成,并不等同于物理意义上的规划。
一个具体案例
假设我们给机器人设定一个复合任务——"把重物放进冰箱"。在已有的训练数据中,模型可能分别掌握了"双手抱重物"、"打开冰箱门"以及"高位摆放"这几个独立技能。但如果让它面对一个从未组合过的全新场景呢?
如果完全依赖生成模型,它或许能基于数据分布合成出一段看似合理的"预测视频",但在真实物理执行时,往往会违背最基本的物理约束——例如尝试在双手紧抱重物的同时去拉开冰箱门,甚至在冰箱门尚未开启时就试图将物体放入。
生成 vs 规划的本质区别
| 维度 | 生成(Generation) | 规划(Planning) |
|---|---|---|
| 机制 | 在已有数据分布中提取高概率的预测结果 | 在测试阶段针对新的长流程与物理限制,实时构造出数据集中从未存在过的"有效解" |
| 依赖 | 训练数据的统计规律 | 物理约束与逻辑推理 |
| 适用场景 | 熟悉场景的复现 | 未见过的组合任务 |
要打破这一局限,需要两项核心要素:
1. 具备泛化能力的先验表达
2. 目标导向的测试期组合机制(Goal-directed Test-time Composition)
二、像搭积木一样拼技能:用因子图破解长流程难题
受 AI 先驱马文·明斯基(Marvin Minsky)思想的启发,核心思路在于:将复杂的系统解耦为多个简单的模块化组件,并在测试阶段进行动态组合。
技能衔接的"契约"
当我们需要按顺序执行两个技能时,逻辑类似于接力赛——前一个技能终止时的状态分布,必须精准覆盖后一个技能能够成功启动的起始状态区间。这个重叠的状态交集,就是技能之间能否实现顺畅衔接的"契约"。
从线性链到因子图
如果仅采用传统的单线串联方式(Linear Chaining),信息的传递效率会极其低下。假设第 10 步的抓握方式直接决定了第 1 步的准备姿态,信息就需要在整条链路上进行多轮震荡与迭代。
为此,研究团队将这种链式结构扩展为了因子图(Factor Graphs)。借助因子图,可以在时空维度上自由定义各种约束条件:
- 空间维度:精确约束机械臂末端与目标物体之间的相对姿态
- 时间维度:确保物体在移动过程中与机械臂保持物理同步
- 多臂协同:过去需要专门采集大量的双手协同数据,而现在只需训练好单臂技能,在测试时通过因子图将两个单臂模型进行约束组合即可
实际效果
在这种机制下,机器人能够顺利完成单臂难以应对的复杂任务——例如双手协同抬起沉重的双耳锅并旋转角度,或者左手递出锤子、右手精准接住并敲击钉子。
三、为什么眼会了手还是不会?揭秘"视频与动作"的断层
在研究深入的过程中,遇到了一个极其关键的工程瓶颈:即便世界模型预测出了一段完美无瑕的未来视频,机器人的真实动作依然可能无法跟随这一预测。
断层的本质原因
这一现象背后的本质原因在于——目前的视频大模型吸收了全网极高量级的视觉数据,具备了极强的泛化能力;而机器人底层的动作(Action)数据却极其匮乏。这就导致视频生成模型已经成功泛化到了新场景,但动作控制模型却出现了泛化滞后。
时间注意力比例(Temporal Ratio)指标
为了量化这一断层现象,提出了一个全新的测量指标——时间注意力比例(Temporal Ratio),用以诊断模型在实时控制过程中,究竟将注意力权重分配给了"预测的未来"还是"眼前的当下"。
通过这一指标,发现了具身控制中的一个重要规律:
| 任务阶段 | Temporal Ratio 特征 | 主导因素 |
|---|---|---|
| 接近目标(Reaching)阶段 | 显著偏高 | 高度依赖对未来的轨迹预测 |
| 物理接触与抓取(Grasping)阶段 | 显著降低 | 由实时的触觉与视觉微调主导 |
策略引导(Policy Guidance)
基于这一洞察,可以在测试期引入策略引导(Policy Guidance):在接近目标时强化模型对未来的前瞻注意力,在接触物体的瞬间拉回注意力关注当下。这套方法显著提升了模型在面对分布外(OOD)复杂任务时的真实执行成功率。
四、深度问答:关于数据、世界模型与策略模型的思考
Q1:如何看待训练数据中的"失败样本"?
问题背景:目前的论文和产业实践大多聚焦于利用"成功的轨迹"进行预测,将失败数据引入扩散模型训练具有怎样的学术或工程价值?
徐丹飞的回答:
目前大家普遍偏好成功数据,核心原因在于在测试阶段尚缺乏一个足够高效的规划器去消化和利用"失败视频"。一旦构建出能够深刻理解物理约束的规划算法,预测"某种动作会导致失败"的价值绝不亚于预测成功。
另一方面,现有的视频大模型几乎全部基于人类日常成功的活动数据进行训练,数据集中缺乏天然的失败案例。未来如果有意识地去捕获那些边缘与失败轨迹,对于拓展世界模型的安全边界将带来质的飞跃。
Q2:世界模型应该与策略模型融合还是分立?
问题背景:在圆桌辩论环节,针对"世界模型(World Model)应该与策略模型(Policy)融合成单一模型,还是保持分立"这一争议,核心立场是什么?
徐丹飞的回答:
倾向于保持两者的分立与独立性,主要基于两点考虑:
-
模型目前依然处于严重的欠拟合(Underfitting)状态。面对互联网极其庞大的视频与具身数据集,现有的模型容量远未饱和。如果在一个本就在努力拟合物理世界规律的模型中强行引入 Policy 的控制目标,会大幅增加预训练的收敛难度。
-
两者对数据利用方式的本质差异。Policy 的终极目标是输出精准的控制指令,天然偏好高质量的成功数据(更适合 SFT 或强化学习精调);而世界模型则需要吞下海量的失败与异常数据,才能完整构建对物理世界全貌的认知。将两者解耦、各司其职地进行优化,是当前更为稳妥且高效的工程路径。
结语
规划的本质,远不止于"预测出合理的未来视觉"。要推动具身智能真正迈向落地,必须攻克"在测试阶段确定组合对象(What to compose)与组合机制(How to compose)"的底层难题。
只有当机器人的真实动作能够精准对齐并执行那些预演的视觉未来时,世界模型的潜能才算得到了真正的释放。
本文根据 RSS 2026 大会演讲内容整理,来源:AI科技评论