AURORA-LM 发布|文本终于跑进连续潜空间,而且没被压缩
这三年生成模型的技术路径出现了一个有意思的断层:图像、视频、音频都已经大规模迁移到连续潜空间(continuous latent space)里做扩散或者 flow matching 了,唯独文本生成还死死抱着离散 token 不放。这很不合理——文字的结构复杂度明明不亚于图像,为什么就它还在用老范式?
不是没人试过把文本塞进连续空间。过去这类尝试基本走了两条路:要么直接把现成的 embedding 空间拿来用,但那玩意儿本来就不是为生成和解码设计的;要么先用 autoencoder 把文本 latent 狠狠压缩一遍,变小了再扔给扩散模型,但压缩那一步就已经丢了 token 级别的精度。两种做法其实是同一个思路——让表示去适应生成模型,能省事就省事。
AURORA-LM 把这套逻辑倒过来了。它保留了一个高容量、可解码的文本 latent,然后让扩散模型自己去学这个复杂分布的 shape。论文的全称是 Autoencoding Unified Representation for Continuous-Latent Diffusion Language Modeling——搞一个统一的连续 latent,别为了迁就生成器而阉割它。
它用一个 Query-based Encoder-Decoder 把文本组织成前缀对齐的 latent 序列,然后通过一个 Block-causal Diffusion Transformer 做 flow matching——按块从左到右生成,每个块内的位置并行去噪。因为 latent 容量大、分布复杂,扩散模型直接学会很吃力,所以 AURORA-LM 做了一个不对称设计:只对噪声输入路径做限制,完整 clean-latent 预测目标保留下来,解码器的容量不受影响。同时校准了噪声级别分布来匹配 latent 宽度,还引入了一个自轨迹一致性机制来弥合训练时采样的噪声和推理时逐步去噪之间的 gap。其中不少组件在 diffusion LM 论文里出现过,不是全新造的,但组合起来指向一个明确主张:别为了省事压缩文本 latent,让生成模型自己扛复杂度。
论文报告它在 OpenWebText 自由生成和 XSum 摘要任务上跑赢了所有参评的连续语言模型和基于扩散的语言模型。参数量推到 1B,总算力约 1500 EFLOPs,性能超过了此前公开发布的一个更大的 latent-diffusion 语言模型(在同口径评估下)。所有实验都在 Ascend NPU 上完成——这意味着国产算力栈已经能支撑这种级别的创新模型研发了。
这还是一篇 arXiv 预印本,40 页、17 张表,信息量很大,但还需要时间被社区复现和验证。它的核心贡献在于把「用连续 latent 做文本生成」这条路往前推了一步,而且选了一条更难的路——在保留表示质量的前提下升级生成器。对文本 tokenization 范式感到疲惫、或者正在做生成模型的开发者,这篇论文值得花时间读。方向对错要靠更多实验说话,但至少它拿出了一套不妥协的解法:让模型适应数据,而不是反过来。
相关链接
- 论文:arXiv:2608.02602
- 项目主页:https://aurora-lm-project.github.io/