Less Experts, Faster Decoding: Cost-Aware Speculative Decoding for Mixture-of-Experts

Less Experts, Faster Decoding: Cost-Aware Speculative Decoding for Mixture-of-Experts

核心事件

2026年7月14日,Jincheng Xie、Runheng Liu、Heyan Huang 等七位作者向 arXiv 提交了一篇题为 《Less Experts, Faster Decoding: Cost-Aware Speculative Decoding for Mixture-of-Experts》 的论文(arXiv:2607.12696)。该研究提出了一种名为 EcoSpec 的成本感知推测解码框架,旨在解决大规模稀疏混合专家(MoE)模型在推理过程中的效率瓶颈问题。


技术背景与问题洞察

1. MoE 模型的扩展性与效率挑战

稀疏混合专家(Mixture-of-Experts, MoE)模型已成为扩展大语言模型(LLMs)规模的重要方法。然而,MoE 模型的推理效率高度依赖于专家激活模式。在每次生成步骤中,只有部分被选中的"专家"网络会被激活处理输入,这种设计在增加模型容量的同时,也带来了复杂的内存访问和计算调度问题。

2. 推测解码(Speculative Decoding, SD)的局限

推测解码是一种通过并行验证多个草稿标记(draft tokens)来加速自回归生成的技术。现有的草稿选择策略主要优化接受概率(acceptance likelihood),即优先选择更可能被目标模型接受的标记路径。

3. "专家散射"(Expert Scattering)现象

论文作者观察到一个关键问题:置信度驱动的推测解码可能引入"专家散射"。在高概率草稿标记的选择过程中,这些标记可能路由到互不重叠的专家集合。这意味着:

  • 验证阶段需要激活更多不同的专家
  • 导致专家权重内存流量显著增加
  • 削弱了推测解码本应带来的加速效果

这一发现揭示了在 MoE 架构下,仅以接受概率为目标的草稿选择策略存在根本性缺陷——它忽略了非均匀内存成本结构


EcoSpec 框架设计

针对上述问题,论文提出了 EcoSpec 框架,其核心思想是将预测的边缘专家激活成本纳入草稿选择过程。

关键组件

组件 功能描述
轻量级专家预测器 预测不同草稿路径所需的专家激活成本
动态专家缓冲区 缓存当前验证集中已覆盖的专家权重,减少重复加载
成本感知的草稿树选择 在保持高接受概率的同时,优先复用已有专家覆盖路径

设计原则

EcoSpec 的核心创新在于:

  1. 不修改目标模型的验证规则——完全兼容现有 MoE 推理流程
  2. 联合优化两个目标——既要高接受率,又要低专家激活成本
  3. 动态适配——根据当前验证集覆盖的专家集合,实时调整草稿选择策略

实验评估

评估对象

论文在三个大规模 MoE 模型上进行了评估:

模型名称 参数量
DeepSeek-V3.1 671B
Qwen3-235B-A22B 235B(激活 22B)
GPT-OSS-120B 120B

评估基准

覆盖了四类典型任务:

  • 推理(Reasoning)
  • 代码生成(Coding)
  • 问答(Question-Answering)
  • 对话(Dialogue)

核心结果

  • 始终减少活跃专家足迹——EcoSpec 在所有测试场景中降低了同时激活的专家数量
  • 端到端解码速度提升——最高实现 1.62× 的加速比
  • 结果表明,在大规模 MoE 模型中考虑专家激活成本对于高效的推测解码至关重要

对 AI 从业者的启示

1. 推理优化的新视角

随着 MoE 架构在工业界的大规模部署,仅关注计算量或接受率的优化策略可能不够充分。内存访问模式专家调度成本成为新的瓶颈维度。

2. 推测解码的适配需求

传统推测解码方法假设所有 token 的处理成本近似相同。但在 MoE 场景下,不同 token 路由到的专家集合差异可能导致巨大的性能波动。未来的解码加速框架需要原生支持异构成本建模

3. 轻量级辅助模块的价值

EcoSpec 通过引入轻量级预测器和动态缓冲区实现了显著改进,而未改动目标模型本身。这为现有 MoE 系统的效率升级提供了一条低侵入性的技术路径。


文献信息