SLAI T-Rex:在Ascend SuperPOD上完成DeepSeek-V4全系列参数后训练,OR任务零样本Pass@1达71.81%

突破万亿参数瓶颈:在 Ascend NPU 上实现 DeepSeek-V4 高效后训练与运筹学领域适配

2026 年 7 月 22 日,由 Dongfang Li 领衔的 65 人研究团队在 arXiv 发表了一篇具有里程碑意义的论文 arXiv:2607.20145。该研究详细展示了如何在华为 Ascend NPU SuperPOD 基础设施上,针对万亿参数规模的 DeepSeek-V4 系列混合专家(MoE)模型,实施全参数后训练(Full-parameter Post-training)的系统优化与领域适配。

这项工作不仅提出了一套名为 SLAI T-Rex 的端到端优化框架,将模型 FLOPs 利用率(MFU)提升至惊人的 34.22%,更通过专项训练,在复杂的运筹学(Operations Research, OR)任务中实现了显著的零样本性能突破。

一、 背景与挑战:万亿参数 MoE 的后训练难题

随着大语言模型向万亿参数(Trillion-parameter-scale)和混合专家(MoE)架构演进,全参数微调面临着前所未有的系统级挑战。传统基于 GPU 集群的训练范式难以直接迁移至其他算力平台,而 Ascend NPU 生态下的全参数后训练主要受制于以下三大瓶颈:

  1. 严重的内存压力:全参数更新需要存储海量的梯度状态和优化器状态,对显存带宽和管理提出了极高要求。
  2. 通信开销无法重叠:在分布式训练中,参数同步往往成为吞吐量的瓶颈,且难以与计算过程有效并行化。
  3. 内核执行效率低:现有算子在非 GPU 平台上的执行效率低下,导致硬件资源闲置。

尽管目前大规模 LLM 训练主要依赖 GPU 集群,但该报告证明了通过深层系统优化,Ascend NPU 同样具备高效处理万亿参数 MoE 模型的潜力。

二、 系统优化:SLAI T-Rex 框架

为了在 Ascend 平台上高效运行 DeepSeek-V4 系列模型,研究团队开发了一个分层优化框架 SLAI T-Rex,主要从三个层面进行突破:

  • 模型级并行优化:针对超大规模 MoE 模型的参数分布特性,设计了高效的并行策略。
  • 计算-通信编排:精细优化算子执行顺序,最大化掩盖通信延迟,提升硬件利用率。
  • 底层内核调优:针对 Ascend NPU 的硬件特性,对底层算子进行深度优化。

关键性能指标

  • MFU 达到 34.22%:这一指标反映了硬件算力的高效利用程度。
  • 性能提升 2.93 倍:相比开源基线食谱(open-source baseline recipe),训练吞吐量获得了近三倍的提升。
  • 训练稳定性:在大规模分布式环境下,成功保持了训练过程的长期稳定。

三、 领域适配:面向运筹学(OR)的专项训练

在构建起高效的底层训练基础设施后,团队进一步聚焦于高难度的 运筹学(Operations Research) 领域,构建了针对复杂数学建模与优化的 CPT(继续预训练)和 SFT(监督微调)工作流。

1. 数据流水线构建

  • 目标模型:以 DeepSeek-V4-Flash 作为基础 workload。
  • 数据来源:结合领域专用资源与 Solver-verified(求解器验证的)合成优化文档,确保数据的准确性和逻辑严密性。
  • 数据集规模:精心构建了包含 10K 高质量 SFT 样本的数据集。
  • 覆盖范围:涵盖 4 类任务类别3 种问题表示形式,全面覆盖运筹学核心场景。

2. 性能评估结果

在复杂的数学建模与运筹学任务中,经过专项训练的模型表现优异:

  • 零样本 Pass@1 得分:高达 71.81%
  • 对比优势显著
    • GPT-5.4-Mini 高出 3.98 个百分点。
    • 比基座模型 DeepSeek-V4-Flash 高出 11.27 个百分点。
  • 行业地位:在被评估的所有模型中,该专用模型取得了最高的平均零样本 Pass@1 分数,证明了 solver-grounded 数据训练的有效性。

四、 意义与影响

这项工作展示了一条从 高效万亿参数模型后训练领域专用 Flash 模型 的全栈路径,其核心价值体现在三个方面:

  1. 验证了 Ascend NPU 处理超大模型的能力:证明了在非 GPU 生态下,通过深层系统优化,同样可以实现万亿参数 MoE 模型的高效全参数训练,为 AI 基础设施多样化提供了有力证据。
  2. 推动了 solver-grounded 数学建模的发展:通过引入求解器验证的合成数据,显著提升了模型在复杂逻辑和数学推理任务上的能力,为垂直领域的模型定制提供了新范式。
  3. 为异构算力训练提供参考:为开发者提供了在 Ascend 等异构算力上进行大规模分布式训练优化的具体实践案例,具有重要的工程参考价值。

五、 关键事实速查

项目 详情
论文标题 SLAI T-Rex: Full-Parameter Post-training of the DeepSeek-V4 Family on Ascend SuperPOD
arXiv ID 2607.20145
提交日期 2026年7月22日
作者数量 65人 (Dongfang Li 等 64 位共同作者)
页数/图表 73页, 22个图表, 20个表格
目标模型 DeepSeek-V4 系列 (以 DeepSeek-V4-Flash 为例)
算力平台 Ascend NPU SuperPOD
MFU 34.22%
优化倍数 较开源基线提升 2.93x
SFT 数据量 10K 高质量样本
OR 任务得分 Zero-shot Pass@1: 71.81%
对比模型 优于 GPT-5.4-Mini (+3.98%) 和 Base DeepSeek-V4-Flash (+11.27%)
原文链接 https://arxiv.org/abs/2607.20145

本文内容严格基于 arXiv:2607.20145 公开材料整理,旨在呈现该研究在系统优化与领域适配方面的核心成果。