无需重新训练,AdaDSF实现大模型推理加速:基于层间相似性的动态稀疏化

无需重新训练,AdaDSF实现大模型推理加速:基于层间相似性的动态稀疏化

在大语言模型(LLM)应用迅速扩张的当下,如何降低推理成本并保持模型性能,始终是业界关注的核心痛点。7月23日,一篇题为《Adaptive Depth Sparse Framework: Similarity-Driven Resource Allocation for Pre-Trained LLMs》(arXiv:2607.21291)的新论文提出了一种名为 AdaDSF 的新框架,旨在通过深度稀疏化技术,在无需对预训练模型进行全量重训练的前提下,显著降低计算开销。

该研究由Yidu Wu、Xiang Wang、Kejie Zhao等6位作者共同完成,目前已被ICIC 2026接收。

现有方案的局限:适配成本高,通用性受限

尽管Transformer架构的大模型在生成和推理任务上表现强劲,但其高昂的推理成本一直制约着规模化部署。目前的模型加速方法大多依赖于针对特定任务的微调(fine-tuning)或从头开始训练(training from scratch)。

这种方案存在两个主要问题:
1. 适配成本高:每次面对新任务都需要投入大量的算力和时间进行训练。
2. 跨任务可用性差:难以在不同任务间复用加速后的模型结构。

核心洞察:层贡献不均与余弦相似度

AdaDSF的核心创新在于其“无需全量重训练”的特性。研究团队发现,Transformer网络中的不同层在表示变换(representation transformation)过程中的贡献是不均等的。

为了量化这种差异,作者提出了一个关键指标:层输入隐藏状态与层输出隐藏状态之间的余弦相似度(cosine similarity)。基于这一统计特征,AdaDSF能够智能地分配资源,而非采用固定的剪枝策略。

AdaDSF 技术架构解析

根据论文摘要,AdaDSF 框架主要包含以下三个关键技术组件:

  1. 基于相似度的层保留率分配:利用层输入输出的余弦相似度统计数据,为每一层分配不同的Token保留比例。
  2. 轻量级路由器(Lightweight Router):在每个层级中,使用一个轻量级路由器来筛选出最具信息量的Token,从而实现动态稀疏化。
  3. 特征保持对齐目标(Feature-preserving alignment objective):引入一种对齐机制,确保稀疏模型在中间层和最终层的表示与稠密模型保持一致,从而最大限度地减少精度损失。

实验结果:在保持性能的同时大幅降低FLOPs

研究团队在 GPT-NeoXQwen2.5 两大主流模型上,针对语言建模和常识推理任务进行了评估。主要结论如下:

  • 计算效率提升:AdaDSF 大幅降低了推理所需的浮点运算次数(FLOPs)。
  • 性能接近稠密模型:在降低算力的同时,模型性能保持在接近原始稠密模型的水平。
  • 优于基线方法:在相同的稀疏度下,AdaDSF 造成的精度下降幅度明显小于现有的强基线方法,包括 MoD、D-LLM 和 DLO。

意义与展望

这篇论文(共12页,含2个图表和4个数据表)展示了一种更具经济效用的大模型加速路径。对于AI从业者和开发者而言,AdaDSF 提供了一种在不牺牲太多性能、且无需昂贵重训成本的情况下,优化预训练LLM推理效率的新思路。

随着大模型向端侧部署和多场景应用延伸,类似这种基于“相似度驱动资源分配”的动态稀疏化框架,可能成为未来模型加速领域的一个重要研究方向。


参考文献:

  • Paper Title: Adaptive Depth Sparse Framework: Similarity-Driven Resource Allocation for Pre-Trained LLMs
  • Authors: Yidu Wu, Xiang Wang, Kejie Zhao, Zhangchi Wang, Qinghai Guo, Xiaoying Tang
  • Published: arXiv:2607.21291 (cs.CL) on 23 Jul 2026
  • Link: https://arxiv.org/abs/2607.21291
  • Conference: Accepted by ICIC 2026