把思考折叠进序列:WeLM 617B MoE的隐式Scaling路径
大模型的能力突破,长期以来被两条路径所主导:一是不断堆砌参数规模,二是通过延长思维链来换取更深的推理。然而,微信WeLM团队最近提出了一条“第三条路”——隐式序列缩放(Hidden Decoding)。
7月14日,WeLM团队发布了关于Hidden Decoding的最新进展,首次展示了该技术在总参数量高达617B的MoE模型上的落地效果。这一成果不仅标志着该技术已跨越前沿规模的门槛,更揭示了一种在不增加主干参数的情况下,通过重新分配算力来提升模型智能的新范式。
隐式思考:把算力藏进序列里
如果说传统的自回归模型是“走一步看一步”,那么Hidden Decoding就像是让模型在开口说话前,先在脑海里进行了一场并行的“深思熟虑”。
其核心逻辑非常巧妙:在不动参数的前提下,把额外算力折叠进序列维度。 具体而言,它将每个token在序列上展开成多条并行的“流”(Streams)。同一套Transformer权重在一次前向传播中,就能完成多步隐式的推理过程。
在这个过程中,前面的流相当于在为最后一条流“打草稿”,逐步精炼表征并保留更宽的候选集合;而训练时,模型只在序列的最后一条流上计算损失并输出预测。这种设计让模型在输出下一个token之前,先在自己的序列内部完成了一段不为人见的思考。
工程奇迹:如何驯服算力的怪兽?
将序列长度从 $L$ 扩展到 $nL$,理论上会带来序列长度平方级的算力膨胀(例如 $n=4$ 时,成本可能增加16倍),这对于大模型训练来说是不可接受的。WeLM团队通过两项关键工程优化解决了这一难题:
1. Stream-Factorized Attention
团队提出了一种新型注意力机制,将计算成本从平方级压到了接近线性:
* 流内注意力层: 仅关注同一条流中更早的位置。
* 跨流注意力层: 在特定层启用跨流关注,但并非所有层都参与,从而避免了全量的复杂度爆炸。
通过复用基座中原有的局部注意力和少量全注意力层,团队成功控制了新增的注意力成本。实测数据显示,当 $n=4$ 时,有效序列的训练时间膨胀系数仅为5.1倍(80B)到4.4倍(617B),远低于理论上的16倍。
2. KV-mirror 的极致利用
依托WeLM主干已有的KV-mirror设计(后段层复用前段层的键值缓存),团队进一步优化了显存和计算效率。由于只有最后一条流被监督,只需让最后一条流通过镜像层,这使得在80B、32k训练设置下单步时间提升了约20%。
数据说话:全面超越基线
在相同的训练配方的短指令微调下,不涉及复杂的强化学习,Hidden Decoding在两个规模上均实现了显著的性能提升:
- 性能增益: 80B模型平均提升约0.99个百分点,617B模型提升约1.03个百分点。值得注意的是,提升主要集中在SuperGPQA、MMLU-Pro等高难度的推理与知识任务上。
- 增量续训的高效性: Hidden Decoding并非从零开始,而是在已有自回归基座上做增量续训(CPT)。在617B模型上,仅使用5.3%的训练量,就实现了9个评测指标全面超越基线。
解码“黑盒”:中间流真的在思考吗?
为了探究中间流是否真正起到了“思考”的作用,团队进行了深入的探针分析,发现了一些有趣的现象:
- 分化与收敛: 同一token的不同流在Transformer中间层会显著分化,但在临近输出层时又会部分靠拢。
- 读取通路: 最终流会向其他中间流分配可观的注意力,形成了一条从“中间思考”到“最终预测”的信息读取通路。
- 候选集合: 中间流的最优预测往往与最终结果不同,且不确定性更高。这表明中间流确实在保留并精炼一个更宽的候选分布,而非简单的冗余计算。
此外,消融实验显示,仅需少数几层(如1-4层)的全注意力跨流配置,即可恢复大部分性能收益。这意味着,“思考”并不需要无处不在,关键在于关键节点的深度处理。
展望:资源效率的终极追求
对于拥有超大规模用户基数的微信而言,技术突破必须兼顾性能与效率。回顾WeLM近期的路线,从构建高效稀疏MoE模型以“服务更多用户”,到Hidden Decoding以“有限资源解决更难的问题”,团队始终围绕极致的资源效率展开探索。
虽然在大Batch推理场景下,Hidden Decoding因并行计算特性可能会带来一定的吞吐损失,但在受显存带宽限制的小Batch场景下,其性能损失极小,展现了良好的实际部署潜力。
未来,WeLM团队计划将Hidden Decoding与强化学习进一步结合,并采用更高质量的数据进行后训练。这不仅是一次技术的迭代,更是通往更高智能的一条隐秘而坚实的路径。
参考资料:
* Hidden Decoding博客原文
* 首篇博客
* 论文PDF
* GitHub仓库