SLAI T-Rex:在Ascend SuperPOD上完成DeepSeek-V4全系列参数后训练,OR任务零样本Pass@1达71.81%
2026 年 7 月 22 日,由 Dongfang Li 领衔的 65 人研究团队在 arXiv 发表了一篇具有里程碑意义的论文 arXiv:2607.20145。该研究详细展示了如何在华为 Ascend NPU SuperPOD 基础设施上,针对万亿参数规模的 DeepSeek-V4 系列混合专家(MoE)模型,实施全参数后训练(Full-parameter Post-training)的系统优化与领域适配。
这项工作不仅提出了一套名为 SLAI T-Rex 的端到端优化框架,将模型 FLOPs 利用率(MFU)提升至惊人的 34.22%,更通过专项训练,在复杂的运筹学(Operations Research, OR)任务中实现了显著的零样本性能突破。
一、 背景与挑战:万亿参数 MoE 的后训练难题
随着大语言模型向万亿参数(Trillion-parameter-scale)和混合专家(MoE)架构演进,全参数微调面临着前所未有的系统级挑战。传统基于 GPU 集群的训练范式难以直接迁移至其他算力平台,而 Ascend NPU 生态下的全参数后训练主要受制于以下三大瓶颈:
- 严重的内存压力:全参数更新需要存储海量的梯度状态和优化器状态,对显存带宽和管理提出了极高要求。
- 通信开销无法重叠:在分布式训练中,参数同步往往成为吞吐量的瓶颈,且难以与计算过程有效并行化。
- 内核执行效率低:现有算子在非 GPU 平台上的执行效率低下,导致硬件资源闲置。
尽管目前大规模 LLM 训练主要依赖 GPU 集群,但该报告证明了通过深层系统优化,Ascend NPU 同样具备高效处理万亿参数 MoE 模型的潜力。
二、 系统优化:SLAI T-Rex 框架
为了在 Ascend 平台上高效运行 DeepSeek-V4 系列模型,研究团队开发了一个分层优化框架 SLAI T-Rex,主要从三个层面进行突破:
- 模型级并行优化:针对超大规模 MoE 模型的参数分布特性,设计了高效的并行策略。
- 计算-通信编排:精细优化算子执行顺序,最大化掩盖通信延迟,提升硬件利用率。
- 底层内核调优:针对 Ascend NPU 的硬件特性,对底层算子进行深度优化。
关键性能指标
- MFU 达到 34.22%:这一指标反映了硬件算力的高效利用程度。
- 性能提升 2.93 倍:相比开源基线食谱(open-source baseline recipe),训练吞吐量获得了近三倍的提升。
- 训练稳定性:在大规模分布式环境下,成功保持了训练过程的长期稳定。
三、 领域适配:面向运筹学(OR)的专项训练
在构建起高效的底层训练基础设施后,团队进一步聚焦于高难度的 运筹学(Operations Research) 领域,构建了针对复杂数学建模与优化的 CPT(继续预训练)和 SFT(监督微调)工作流。
1. 数据流水线构建
- 目标模型:以 DeepSeek-V4-Flash 作为基础 workload。
- 数据来源:结合领域专用资源与 Solver-verified(求解器验证的)合成优化文档,确保数据的准确性和逻辑严密性。
- 数据集规模:精心构建了包含 10K 高质量 SFT 样本的数据集。
- 覆盖范围:涵盖 4 类任务类别 和 3 种问题表示形式,全面覆盖运筹学核心场景。
2. 性能评估结果
在复杂的数学建模与运筹学任务中,经过专项训练的模型表现优异:
- 零样本 Pass@1 得分:高达 71.81%。
- 对比优势显著:
- 比 GPT-5.4-Mini 高出 3.98 个百分点。
- 比基座模型 DeepSeek-V4-Flash 高出 11.27 个百分点。
- 行业地位:在被评估的所有模型中,该专用模型取得了最高的平均零样本 Pass@1 分数,证明了 solver-grounded 数据训练的有效性。
四、 意义与影响
这项工作展示了一条从 高效万亿参数模型后训练 到 领域专用 Flash 模型 的全栈路径,其核心价值体现在三个方面:
- 验证了 Ascend NPU 处理超大模型的能力:证明了在非 GPU 生态下,通过深层系统优化,同样可以实现万亿参数 MoE 模型的高效全参数训练,为 AI 基础设施多样化提供了有力证据。
- 推动了 solver-grounded 数学建模的发展:通过引入求解器验证的合成数据,显著提升了模型在复杂逻辑和数学推理任务上的能力,为垂直领域的模型定制提供了新范式。
- 为异构算力训练提供参考:为开发者提供了在 Ascend 等异构算力上进行大规模分布式训练优化的具体实践案例,具有重要的工程参考价值。
五、 关键事实速查
| 项目 | 详情 |
|---|---|
| 论文标题 | SLAI T-Rex: Full-Parameter Post-training of the DeepSeek-V4 Family on Ascend SuperPOD |
| arXiv ID | 2607.20145 |
| 提交日期 | 2026年7月22日 |
| 作者数量 | 65人 (Dongfang Li 等 64 位共同作者) |
| 页数/图表 | 73页, 22个图表, 20个表格 |
| 目标模型 | DeepSeek-V4 系列 (以 DeepSeek-V4-Flash 为例) |
| 算力平台 | Ascend NPU SuperPOD |
| MFU | 34.22% |
| 优化倍数 | 较开源基线提升 2.93x |
| SFT 数据量 | 10K 高质量样本 |
| OR 任务得分 | Zero-shot Pass@1: 71.81% |
| 对比模型 | 优于 GPT-5.4-Mini (+3.98%) 和 Base DeepSeek-V4-Flash (+11.27%) |
| 原文链接 | https://arxiv.org/abs/2607.20145 |
本文内容严格基于 arXiv:2607.20145 公开材料整理,旨在呈现该研究在系统优化与领域适配方面的核心成果。