AI到底是「想错了」还是「判错了」?组合式世界模型让具身策略自我纠偏

解耦「预测」与「评估」:组合式世界模型如何驱散具身智能的黑盒幻觉?

摘要:当自动驾驶或机器人策略出错时,开发者往往难以精准定位原因——究竟是「想错了」(对物理世界的预测不对),还是「判错了」(对结果好坏的评估有误)?2026 年 7 月 17 日,源策未来(Archon Robotics)的陈立在 RSS 2026 Workshop 上提出了解决方案:把预测与评估拆开。本文基于其演讲内容,系统梳理了「组合性世界模型」的核心思想、四项实践工作及未来方向。


一、问题背景:「黑盒幻觉」与「想」和「判」的缠绕

在具身智能通往通用人工智能的征途中,一个幽灵般的威胁正在浮现——「黑盒幻觉」

当自动驾驶汽车或机器人策略出错时,开发者往往难以精准定位原因。因为「预测未来」和「评估好坏」这两个功能在庞大的联合网络中被紧紧绑在一起。一旦发生事故,你根本分不清它是「想错了」(对物理世界的预测不对),还是「判错了」(对结果好坏的评估有误)。

这种「想」与「判」的缠绕,正成为阻碍具身策略走向更高安全级和可检查性的最大绊脚石。

2026 年 7 月 17 日,在 RSS 2026 Workshop 现场,源策未来(Archon Robotics)的陈立给出了他的答案:把预测与评估拆开


二、组合性原则:让「想」和「判」各司其职

陈立在题为「Improving Embodied Policies with Compositional World Models」的演讲中,提出了「组合性」(Compositionality)原则

这一原则的核心思想很直接:将世界模型的「预测」组件和「价值评估」组件彻底拆开,让它们各自独立、专业运作。

  • 预测组件只负责像沙盘一样推演「做动作后会发生什么」
  • 评估组件则只负责判断「推演出来的后果是好是坏」

这种功能上的解耦,让 AI 的决策过程变得清晰可追溯。

陈立在演讲中指出:「预测能告诉我们某个动作可能带来什么后果,但仅凭预测本身,并不能告诉我们这个后果是否有用。」

为什么必须解耦?

两者的目标截然不同:

维度 预测组件 评估组件
输出形式 高维的未来观测(视频、潜状态等) 奖励、进度或优势值
建模重点 动力学预测、高维生成 任务条件下的评估与失败检测
归纳偏置 保持视觉连贯性 敏锐检测细微的失败

虽然理论上一个单一的联合网络可以同时服务于这两者,但它会极大地耦合标签、模型容量和更新调度。采用组合式框架,确保这些选择在保持可能性的同时,更加独立和可靠。

这种独立性赋予了系统一种诊断能力——当一个决策错误发生时,我们可以追问:究竟是模型预测了错误的后果,还是价值模型做出了错误的判断?


三、四项实践:从选择到修正,再到后训练

基于组合性原则,陈立团队展示了四项层层递进的系统性工作。它们在利用世界模型的方式上各有侧重,风险等级也逐步提升。

1. ReSim:自动驾驶的可靠世界模拟

解决的问题:预测可靠性

真实世界的数据集(如 nuScenes)虽然提供了极大的视觉多样性,但其中的大多数动作都来自于极其谨慎的人类驾驶员。这意味着其动作分布非常狭窄且偏向安全,诸如偏离道路等非正常行为的数据极为稀少。

在这些数据上训练出来的世界模型,很容易忽略异常的动作输入,从而生成看似正常的画面。比如,当我们给模型输入一个不安全的控制信号时,它却无法生成相应的危险后果。这对于策略评估是致命的——如果想象中的未来永远是一片祥和,奖励信号就无法区分动作的优劣。

解决方案

  • 将来自 CARLA 模拟器的非专家动作与来自 YouTube 及 nuScenes 的真实数据相结合
  • 真实世界数据提供丰富的场景和交通标注
  • 仿真数据补充不安全行为的后果
  • 结合能零样本迁移到真实世界的 Video2Reward 模型

成果:在 NAVSIM 测试中,利用 ReSim 提供的奖励信号,规划得分达到了 74.1 分

2. Generation-then-Revise:操控任务的价值引导生成

解决的问题:价值能否在决策完成之前就直接影响动作的生成?

以往的工作中,价值推断通常只考虑单条想象轨迹,并且无论初始提议是否正确都会执行串行修正,效率较低。

新方法

  • 引入期望优势评论器与多束搜索
  • 策略首先提出一个动作序列
  • 由一个轻量级的两层触发器快速决定是直接执行还是进行修正
  • 如果触发修正,扩散模型会展开多个候选路径,并通过快速评论器估算每条路径的优势值来择优选择
  • 「早退出」机制大幅减少不必要的推理时间

3. World Engine:自动驾驶后训练的基础设施

解决的问题:如何让生成的经验直接作为策略改进的环境

针对长尾事件,该项目利用 3D 高斯泼溅(3DGS)将真实场景重建为逼真的交互式环境。

技术架构

  • 行为世界模型是一个基于多智能体轨迹的扩散模型
  • 可以设定特定的目标点,并根据地图拓扑生成周围车辆多样化的未来轨迹
  • 行为模型预测运动,3DGS 渲染器则生成对应的传感器观测
  • 两者结合,成功将一次真实的记录转化为多次闭环的交互强化训练

成果:实验表明,这种闭环后训练大幅提升了策略在处理真实长尾事件时的成功率。

4. RISE:机器人策略的自我改进

相关链接https://github.com/OpenDriveLab/RISE

解决的问题:真实世界机器人强化学习面临的物理成本高、安全监控难、硬件易损等多重困境

在 RISE 中,以少量的真实演示和物理推演作为锚点,而将大部分的交互训练转移到了世界模型的想象空间中。

实现细节

  • 动力学模型:基于通用视频生成基座进行了轻量化定制,能在两秒内快速生成 25 帧画面
  • 价值模型:基于预训练的机器人大模型(如 π0.5)进行微调,结合了进度回归和时序差分(TD)双重目标,既能提供平滑的进度信号,又对失败动作极其敏感

关键优势

  1. 动力学模型和价值模型仅在训练期间发挥作用,部署在机器人上的策略完全不承担世界模型的推理开销
  2. 接口是完全可检查的,当系统表现不佳时,可以清晰地诊断出是动力学模型的预测出了偏差,还是价值模型的信用分配出现了失误
  3. 通过限制推演的步数,并始终以真实数据作为支撑,防止世界模型产生幻觉

成果:在动态分拣和物体操控等任务上,RISE 均取得了显著的性能提升,且最终部署的策略依然保持着极高的执行效率。


四、总结与展望

陈立团队系列工作的核心在于:使预测和评估专业化,用不同数据进行监督,独立扩展各个组件,并在信任生成经验之前对其进行审视。

展望未来,有三个关键方向值得重点突破:

  1. 基础设施建设:世界模型的训练、推理和具身环境必须变得更加高效
  2. 泛化能力:尤其是开发通用的价值模型
  3. 世界模型的探索:例如 Cosmos Token 等新技术在未来的应用

在这个过程中,挑战在于如何在实现系统整合的同时,不失去组件的专业化与可检查性——而这正是组合式方法的价值所在。


五、Q&A 精选

Q:特定的进度价值模型如何在不重新训练的情况下泛化到未见过的任务中?

陈立:目前来看,价值模型本质上依然是任务特定的。做法是利用一些域内数据,在预训练基座(如 π0.5)上进行微调,从目前的反馈来看,这种方式是有效的。

Q:价值模型在未见过的数据点上有多可靠?其偏差大概有多大?

陈立:对于全新的任务,价值模型确实无法直接泛化。但是对于域内的泛化(例如光照、位置的改变等常见的泛化测试),价值模型的泛化能力可以与策略模型本身的表现相媲美。因为它们共享了相同的预训练基座,在论文中,我们也使用了相同的数据并结合了 TD 损失来进行训练。


本文基于陈立在 RSS 2026 大会上的演讲内容整理编辑。