Less Experts, Faster Decoding: Cost-Aware Speculative Decoding for Mixture-of-Experts
核心事件
2026年7月14日,Jincheng Xie、Runheng Liu、Heyan Huang 等七位作者向 arXiv 提交了一篇题为 《Less Experts, Faster Decoding: Cost-Aware Speculative Decoding for Mixture-of-Experts》 的论文(arXiv:2607.12696)。该研究提出了一种名为 EcoSpec 的成本感知推测解码框架,旨在解决大规模稀疏混合专家(MoE)模型在推理过程中的效率瓶颈问题。
技术背景与问题洞察
1. MoE 模型的扩展性与效率挑战
稀疏混合专家(Mixture-of-Experts, MoE)模型已成为扩展大语言模型(LLMs)规模的重要方法。然而,MoE 模型的推理效率高度依赖于专家激活模式。在每次生成步骤中,只有部分被选中的"专家"网络会被激活处理输入,这种设计在增加模型容量的同时,也带来了复杂的内存访问和计算调度问题。
2. 推测解码(Speculative Decoding, SD)的局限
推测解码是一种通过并行验证多个草稿标记(draft tokens)来加速自回归生成的技术。现有的草稿选择策略主要优化接受概率(acceptance likelihood),即优先选择更可能被目标模型接受的标记路径。
3. "专家散射"(Expert Scattering)现象
论文作者观察到一个关键问题:置信度驱动的推测解码可能引入"专家散射"。在高概率草稿标记的选择过程中,这些标记可能路由到互不重叠的专家集合。这意味着:
- 验证阶段需要激活更多不同的专家
- 导致专家权重内存流量显著增加
- 削弱了推测解码本应带来的加速效果
这一发现揭示了在 MoE 架构下,仅以接受概率为目标的草稿选择策略存在根本性缺陷——它忽略了非均匀内存成本结构。
EcoSpec 框架设计
针对上述问题,论文提出了 EcoSpec 框架,其核心思想是将预测的边缘专家激活成本纳入草稿选择过程。
关键组件
| 组件 | 功能描述 |
|---|---|
| 轻量级专家预测器 | 预测不同草稿路径所需的专家激活成本 |
| 动态专家缓冲区 | 缓存当前验证集中已覆盖的专家权重,减少重复加载 |
| 成本感知的草稿树选择 | 在保持高接受概率的同时,优先复用已有专家覆盖路径 |
设计原则
EcoSpec 的核心创新在于:
- 不修改目标模型的验证规则——完全兼容现有 MoE 推理流程
- 联合优化两个目标——既要高接受率,又要低专家激活成本
- 动态适配——根据当前验证集覆盖的专家集合,实时调整草稿选择策略
实验评估
评估对象
论文在三个大规模 MoE 模型上进行了评估:
| 模型名称 | 参数量 |
|---|---|
| DeepSeek-V3.1 | 671B |
| Qwen3-235B-A22B | 235B(激活 22B) |
| GPT-OSS-120B | 120B |
评估基准
覆盖了四类典型任务:
- 推理(Reasoning)
- 代码生成(Coding)
- 问答(Question-Answering)
- 对话(Dialogue)
核心结果
- 始终减少活跃专家足迹——EcoSpec 在所有测试场景中降低了同时激活的专家数量
- 端到端解码速度提升——最高实现 1.62× 的加速比
- 结果表明,在大规模 MoE 模型中考虑专家激活成本对于高效的推测解码至关重要
对 AI 从业者的启示
1. 推理优化的新视角
随着 MoE 架构在工业界的大规模部署,仅关注计算量或接受率的优化策略可能不够充分。内存访问模式和专家调度成本成为新的瓶颈维度。
2. 推测解码的适配需求
传统推测解码方法假设所有 token 的处理成本近似相同。但在 MoE 场景下,不同 token 路由到的专家集合差异可能导致巨大的性能波动。未来的解码加速框架需要原生支持异构成本建模。
3. 轻量级辅助模块的价值
EcoSpec 通过引入轻量级预测器和动态缓冲区实现了显著改进,而未改动目标模型本身。这为现有 MoE 系统的效率升级提供了一条低侵入性的技术路径。
文献信息
- 标题: Less Experts, Faster Decoding: Cost-Aware Speculative Decoding for Mixture-of-Experts
- 作者: Jincheng Xie, Runheng Liu, Heyan Huang, Yawen Ling, Hanbin Dai, Yu Zheng, Wen Hu
- arXiv ID: 2607.12696
- 提交日期: 2026年7月14日
- 学科分类: Computation and Language (cs.CL); Artificial Intelligence (cs.AI); Distributed, Parallel, and Cluster Computing (cs.DC)
- PDF链接: https://arxiv.org/pdf/2607.12696
- HTML版本: https://arxiv.org/html/2607.12696v1
- DOI: https://doi.org/10.48550/arXiv.2607.12696