用世界模型给VLA当教练:原力灵机发布DW0.5,把RL搬进虚拟世界

用世界模型给 VLA 当教练:原力灵机发布 DW0.5,把 RL 搬进虚拟世界

一、核心事件

本月,原力灵机(Dexmal)正式发布了旗下首款具身世界模型 DW0.5,并将其接入世界模型驱动的具身智能后训练框架 DFOL2.0

简单来说,DW0.5 的定位是基础策略模型 DM0.5 的"后训练环境"。它像一个虚拟教练,能够预演动作的后果并提供价值反馈。这个基模支持多模态输入——任务指令、图片和视频,还可以选择特定机器人类型,基于历史动作预测后续的视频状态。

官方披露的数据显示,这一流程使后训练中真机数据需求下降 60%,整体训练成本下降 40%

  • GitHub: https://github.com/dexmal/opendw
  • Hugging Face: https://huggingface.co/Dexmal/DW05-Base

二、行业痛点:具身智能为何缺少低成本反馈闭环

代码 Agent 的进步得益于天然的超闭环特性:自动执行、自动验证、自动反馈,奖励信号清晰。但具身智能(物理 AI)缺乏同等条件。

VLA(视觉 - 语言 - 动作模型)作为具身智能的主流技术路线,面临物理理解缺失、泛化能力弱、长时序与规划能力不足等瓶颈。其后训练飞轮难以跑通,原因在于:

数据源 成本/瓶颈
真机 Rollout 占用机器人、场地和人工;失败直接中断任务;试错成本高
人工反馈 接近真实判断,但难以高频覆盖中间状态
传统仿真 成本低,但难以复刻接触、遮挡、反光、形变与不确定性

原力灵机提出的解决路径为:在真机、人工反馈与传统仿真之间,构建一个足够便宜、支持高频探索、更接近真实操作的训练环境。

具体循环逻辑:

用真实 Rollout 数据校准世界模型 → 世界模型支持低成本大规模环境与数据生产 → 新 Policy 回到真实环境验证并收集数据


三、技术方案:DW0.5 的三大专家模块

DW0.5 以 Video Expert、Action Expert、Value Expert 三大模块构成能力链路,分别负责动作后果预演与价值评估。

3.1 设计一:Action 是强先验,而非软提示

部分世界模型将动作信息作为附带条件输入,DW0.5 则将 Action 视为结构性强先验。

  • 通过结构化的帧级对齐强制绑定动作与视频生成
  • 在 MoT(Mixture of Tokens)注意力中,动作序列与视频序列拼接
  • 使用 group-diagonal attention mask 切断视频帧与非对应动作之间的信息通路

从结构上,向左推与向右推的动作从一开始即走向完全不同的计算路径。

3.2 设计二:能模拟失败,才配称为"仿真器"

仅用成功轨迹训练的模型易形成过强的成功偏置,无法识别错误动作,更无法为强化学习提供惩罚信号。DW0.5 明确要求能够生成"做砸了"的视觉轨迹。

四类数据源:
1. 具身公开数据与自采机器人数据(含遮挡、接触、延迟等真机噪声)
2. 互联网视频数据(补充开放世界动态)
3. Egocentric 第一视角人类活动数据(迁移真实物理交互后果)
4. 真机与仿真 Rollout 数据(覆盖偏离、卡住、恢复等中间状态)

3.3 设计三:Value Expert 把未来变成可训练的反馈

Value Expert 对当前状态、候选轨迹或整段 Rollout 给出成功概率或任务价值评估,将稀疏的任务结果信号转化为可在每一步使用的中间反馈。

  • Value-Order Correlation 达到 95% 以上
  • 应用场景:候选动作筛选、RL 后训练 Reward 信号、部署时在线监测

DW0.5 在 VLA 的训练与部署中扮演三种角色:离线数据增强与偏好构造、RL 后训练环境、部署时规划与安全评估。


四、实测数据与基准表现

4.1 复杂任务成功率提升(SFT vs DFOL2.0)

任务 步骤 SFT 基线成功率 DFOL2.0 成功率
打气球 给气球打气 10% 90%
打气球 气筒插入气球 10% 100%
晾衣服 成功挂上衣架 50% 100%
晾衣服 衣架塞入衣服 60% 90%
叠纸盒 叠右侧纸盒 35% 55%
叠纸盒 叠左侧纸盒 35% 50%

4.2 基准测试(数据截至 7 月 9 日)

  • EWMBench: 4.73(SOTA)
  • WorldArena: 73.54(SOTA)

4.3 泛化能力表现

  • 高阶指令与多步动作跟随(如 "Pick up the hammer, lift it into the air, and hold it steady")
  • 跨环境、跨任务、跨构型的多维连续泛化
  • 前视、左腕、右腕等多相机流的视角强一致性
  • 人类双手操作视频到机械臂操作轨迹的等效生成

五、落地路径与平台接入

5.1 闭环架构

DM0.5(基础策略模型)生成初始动作
    ↓
DW0.5(世界模型)在虚拟环境中预演未来,批量生成成功/失败轨迹
    ↓
CFG-RL(强化学习教练员)对每条轨迹打分
    ↓
奖励回传更新权重 → 输出更强的 DM0.5

该循环中大部分数据由 DW0.5 在线生成,减少对高成本真机的依赖。

5.2 DexDev MaaS 平台

DW0.5 已接入原力灵机推出的 DexDev MaaS(Model As a Service) 平台。对于特定具身场景中零样本泛化能力不足的模型,可通过后训练补足能力,并接回平台服务。

目前 DW0.5 已在内部跑通具身后训练闭环流程 DFOL 2.0,开始承担数据生成、价值评估和策略迭代工作。


六、关键限制与真机数据价值

原力灵机联合创始人汪天才强调:

"我觉得特别愚蠢的一件事情是在「技术路线」上给自己贴标签。这件事情是特别蠢的。应该以目标导向。你要解决什么问题,挑选对应的方法去解决它。"

同时明确指出:

"我们只是用世界模型降低成本,真机数据还是很重要的。在技术演进上,世界模型目前仍需真机校准。"

随着视觉模型能力提升,现场人员可借助 Ego 相机采集操作数据,减少对专业真机采集和复杂后训练团队的依赖,降低现场后训练门槛。


本文所有事实、数据、引语及链接均源自公开报道材料,未引入材料外信息。