Faster-WAM 解读|世界动作模型需要那么深的动作头吗?
做机器人动作预测经常碰上一个问题:推理延迟。模型在仿真里精度看着还行,一上真机,延迟一大,整个控制循环就跟不上了。动作还没算完,环境已经变了。这时候自然想问——动作模块真的需要堆那么深吗?
最近 arXiv 上挂了一篇论文,标题就问得很直接:Faster-WAM: Do World Action Models Need Deep Action Modules? 作者的回答也很干脆——不需要。
他们提出的架构叫 Dock of Transformer(DoT),设计思路是「以视频为中心」——把一个预训练的视频 Transformer 当作表示枢纽,通过 docking 接口连接轻量级的输出头。动作头可以做得非常浅,同时还能直接获取视频骨干所有层的表示。
基于 DoT 实现的 Faster-WAM,动作头只有 1 层 Transformer,视频骨干是 30 层。在 LIBERO 和 RoboTwin 2.0 这两个机器人操作 benchmark 上,性能与之前方案持平甚至更好,在 LIBERO-Plus 上也展现了分布外泛化能力。延迟方面,单次推理 66.5 毫秒,比 Fast-WAM 快了 3.2 倍。
66.5 毫秒刚好压在机器人控制的一个关键窗口上——很多真实系统的控制周期在 50–100 毫秒之间。推理能压进这个窗口,意味着动作预测可以不再是瓶颈。之前可能要为一次推理等大半拍,现在有更多余量做规划、滤波或安全检查。
Faster-WAM 没有做额外的 embodied 预训练,直接用了现成的视频预训练权重。对于不想从头训整套模型的团队来说,这是一个很务实的路径。
LIBERO 和 RoboTwin 都是仿真环境,真机部署还有 sim-to-real 的 gap 要填。但这个工作的核心贡献在于提出了一个问题——我们是不是默认把动作模块堆得太深了?
在很多现有设计里,动作模块的深度是跟着视频骨干走的——骨干 30 层,动作头也来个 20 层。DoT 的实验表明,动作预测可能不需要那么深的专用模块,一个高质量的视频表示加上一层动作映射已经够用。
论文目前挂在 arXiv 上(2608.02365),PDF 和 HTML 版本都可以直接看。docking 接口的具体做法是融合所有视频层的 K/V,再做 RoPE 重对齐。这个技巧有一定通用性,做视觉-动作模型的团队可以试试移植。
一个动作头到底需要多深?Faster-WAM 的实验答案是一层就够了。这个结论能不能在更大模型、更复杂任务上站住脚,还需要更多验证,但至少给出了一个值得尝试的方向。
相关链接
- 论文页面:https://arxiv.org/abs/2608.02365
- PDF:https://arxiv.org/pdf/2608.02365
- HTML(实验性):https://arxiv.org/html/2608.02365v1