世界模型跑不动实机?这篇新论文把 WAM 量化到 29% 显存,精度只掉零点几个点
做机器人操作的同行应该都有这个体感:世界动作模型(World Action Model,WAM)效果好是真效果好——它同时预测下一帧视觉和下一步动作,闭环跑起来比开环模型稳得多。代价也很实在:显存吃掉一大块,推理速度上不去,往实机部署的时候经常卡在「跑得动但塞不进」的尴尬位置。
后训练量化(PTQ)是常规解法,但对 WAM 不太灵。现有 PTQ 方法大多假设模型是开环调用、各层同质、校准数据跟实际部署分布一致——这几个假设在 WAM 上全不成立。WAM 是迭代去噪加闭环执行,每步输出都会影响下一步的输入,量化误差会在闭环里被放大。
今天 arXiv 上挂出来一篇新论文,正好在搞这个事。标题是 QuantWAMs: Calibrating at the Right Granularity for World Action Models,七个作者,来自高校。核心思路:量化决策的粒度要对,别一刀切。
QuantWAMs 做了三件事。
共享基异常校准。只在坐标兼容的模块之间共享激活统计信息,不跨不兼容的结构做 pooling。听起来像常识,但很多 PTQ 工具为了省事会把所有层混在一起算 outlier,结果某些模块被污染。
联合训练目标显著性。从视频和动作的联合梯度里算 empirical-Fisher 分数,然后在「校准稳定」的层粒度上去分配精度:哪些层对最终输出更敏感,就给更高精度;不敏感的层可以多压一点。粒度不是整个模型一致,也不是逐层都单独算——它找的是一个在部署时也能稳定保持的层级颗粒度。
固定干预 rollout 审计。在不改变精度预算的前提下,用闭环中实际可达的状态来修正去噪步的保护策略。不是靠开环推演来决定哪些步要保护,而是让模型在闭环里真正跑一遍,看哪些地方容易崩,再调整量化保护。
效果呢?
论文在 Fast-WAM 和 LingBot-VA 两个模型上做了验证,仿真环境用了 RoboTwin 2.0 和 LIBERO,还在一台 AgiBot G2 上跑了实机操作。在 W4A4(权重 4-bit、激活 4-bit)设定下,仿真指标跟 FP16 的差距只有 0.2 到 0.7 个百分点。峰值权重-激活内存降到了 FP16 的约 29%,block 级别的推理速度提升 1.4 到 1.6 倍。
这个数据意味着:如果你现在在机器人上跑一个 WAM 模型,显存占用如果能直接砍到原来的三分之一不到,精度基本没掉,就有余量把更大的模型塞进去,或者在同一个卡上跑更多并行实例。对于做实机部署的团队来说,这是账面上算得过来的优化。
当然也要说清楚边界。这篇是 PTQ 框架论文,不是新模型或新数据集。它解决的是「用 PTQ 量化 WAM 时怎么不崩」的问题,不是「WAM 本身的问题」。W4A4 能保住精度,但要压到 2-bit 或更激进,目前还没有结论。另外论文使用的模型(Fast-WAM、LingBot-VA)相对较新,框架在不同骨干上的泛化能力还需要更多验证。
但方向是对的。QuantWAMs 没有重新发明量化算子,而是重新做了校准决策的分配逻辑——在哪个粒度做校准、哪层给多少精度、哪一步需要保护。这些细节在 WAM 这种闭环、迭代、异构的结构里,差别很大。
一个比较实际的结论:如果你正在把 WAM 往实机上搬,可以用这套策略重新跑一遍量化校准,不需要改模型结构,也不需要换推理框架。效果看论文数据是稳的。
最后说一句跟论文无关的。2026 年了,机器人模型部署的问题越来越不只是「更大更好的模型」,而是「能不能跑在预算内、跑在实机上」。QuantWAMs 这类工作,某种意义上比发一个新 SOTA 模型更解渴。