扩散模型也能「从左到右」并行生成了,这篇论文找到了关键

做 LLM 推理的人应该熟悉这个纠结:想要生成质量,就老老实实自回归,一个 token 一个 token 地等;想要速度,就上扩散模型或者并行解码,但生成顺序是乱的,质量经常打折扣。这种取舍在扩散语言模型上尤其明显——早期 masked diffusion models(MDMs)允许任意顺序生成,听着很灵活,但实际用起来,模型对生成顺序几乎无感,效果并不稳定。

最近 arXiv 上挂出来一篇论文,来自 Kai Syun Hou 和 James Kwok,标题叫 Rethinking the Generation Order of Block Diffusion Language Models,正好卡在这个问题上。文章不长,20 页、15 张图、6 张表,但结论挺直接:块扩散语言模型(BDLM)和早期 MDM 不一样,它天然更适合从左到右生成。

作者从实验和分析两个方向都做了验证,证明 BDLM 内部的依赖结构本身就更接近自回归模型的因果顺序,而不是 MDM 那种各位置相对独立的设定。用 BDLM 做从左到右解码,比拿 MDM 做同样的事要自然得多。

基于这个观察,他们提了一个叫 PARD 的方法,全称是 Parallel Autoregressive Decoding。名字有点绕,但思路很简单——保持从左到右的 unmasking 顺序,但允许在同一个步骤里并行提交多个 token。这样做的好处是,既保留了自回归解码那种「前面决定后面」的结构优势,又能在每一步并发出多个 token,从流程上缩短生成步数。

而且 PARD 不需要重新训练模型,直接套在已有的 BDLM 上就能用。这对做推理部署的人来说是加分项——不需要重新训一个模型,只需要改解码策略。

从论文的描述来看,PARD 在生成质量上 consistently outperforms 已有的并行采样方法,同时对比纯自回归解码,速度提升明显,质量差距很小。这里的「很小」具体多少,论文里有表格,感兴趣可以直接翻。

这个方向的信号在于:扩散语言模型和自回归生成之间,可能不是非此即彼的关系。 BDLM 的结构已经提供了有序依赖的条件,PARD 只是把这个条件兑现了。如果后续工作能在更大的模型和更多任务上验证这个结论,那推理加速里又多了一条不需要动模型架构的路子。

目前论文已经在 arXiv 上公开,采用 CC-BY 4.0 许可。还没有看到代码仓库或者开源实现,可能还需要等作者进一步放出。不过思路可以先读——对于正在做扩散模型推理加速的人来说,这篇值得放进待读列表。


相关链接:
- 论文 arXiv 页面
- PDF 全文