从Kimi K3与Qwen3.8-Max都上2T+参数,看国产大模型架构演变
核心事件: 2025年X月X日,月之暗面发布Kimi K3(2.8T参数);X月X日,阿里上线Qwen3.8-Max-Preview(2.4T参数)。一周之内,国产旗舰参数上限被抬升两级,且两家均宣称将开源。
引言:万亿级开源模型的时代加速
2020年,GPT-3的175B参数还被称为"天文数字"。五年过去,在先进算力进口长期受限的背景下,国产厂商已将参数规模推至GPT-3的16倍——达到万亿级(2T+)。
这一跃迁并非简单的"大力出奇迹",而是四年架构演变的结晶。本文基于对国内八家主要厂商论文及HuggingFace配置文件的系统梳理,从三条技术主线解析国产大模型架构的演进路径。
一、参数与计算解耦:MoE路线的全面成熟
Dense模型的瓶颈
传统Dense模型中,参数与计算是绑定的。以GPT-3为例,每生成一个token,1750亿参数全部参与计算。若直接堆叠至2.8T,训练与推理成本将呈灾难性增长。
MoE:解绑的关键钥匙
Mixture-of-Experts(混合专家)架构将网络参数拆分为多个"专家",每个token仅激活部分专家,使容量与计算成为两个独立变量。
谷歌2021年的Switch Transformer率先将参数推至1.6T,但面临路由复杂、通信昂贵、训练不稳等挑战。DeepMind 2022年的Scaling Law研究为MoE提供了理论背书:参数量和计算量是两条独立轴,各自增加均可换取性能提升。
国产MoE的演进轨迹
| 模型 | 总参数 | 激活参数 | 激活比例 |
|---|---|---|---|
| DeepSeek-V3 | 671B | 37B | ~5.5% |
| Kimi K2 | 1T | 32B | 3.2% |
| Qwen3-Next | - | - | 512专家中每次激活10个 |
| Kimi K3 | 2.8T | - | 896专家中每次激活16个 |
关键趋势: 总参数翻几十倍,单token的计算量几乎未涨。DeepSeek通过以下技术创新推动MoE成为国产标配:
- 2024年1月 DeepSeekMoE: 细化专家切分,隔离共享专家存储通用知识,解决专家分工不清问题
- 2024年2月 Scaling Law 论文: 从理论上证明固定计算预算下,更细的专家颗粒度通常更优
二、注意力是道墙:跨出1M上下文的技术路径
MoE解决了参数规模问题,但注意力的计算量与KV Cache随上下文长度线性增长。当前旗舰模型均标配1M上下文,这堵"墙"必须跨越。
早期路线:KV瘦身
从MHA → GQA → MLA,核心思路是给KV Cache瘦身:
- GQA: 多查询头共享一份KV
- DeepSeek-V2 MLA: 将KV压成潜向量,Cache直接削减93.3%
2025年底的分岔:稀疏 vs 线性
路线A:稀疏注意力
不让每个token查看完整上下文:
- DeepSeek DSA
- GLM-5.2 DSA
- MiniMax M3 MSA
- 小米滑窗混合机制
- 阶跃MFA
路线B:线性替换(K3与Qwen3.8的选择)
两条路线的共同祖师爷是2024年底的 Gated Delta Networks 论文,该工作将两种机制融合:
1. 线性注意力: 将上下文压缩为固定大小的记忆状态
2. Delta Rule: 决定新token到来时如何修改记忆
3. 门控机制: 控制旧记忆的遗忘速率
具体实现:
- Qwen3.8: 从Qwen3-Next起采用Gated DeltaNet + 高稀疏MoE
- Kimi K3: 采用KDA(Kimi Delta Attention),是其精细门控改良版本,从研究件Kimi-Linear演进而来
K3的混合结构: 3层线性KDA + 1层Gated MLA循环堆叠,剩余1/4为稠密全注意力层,确保每个token都能看到完整上下文。
三、训练与推理:万亿MoE的工程攻坚
即使计算解耦、注意力跨墙,万亿参数MoE仍面临两大天敌:
1. 路由坍塌(Route Collapse)
Token过度集中在少数专家上,其他专家闲置。
解决方案:
- 2024年8月 Loss-Free Balancing 论文: DeepSeek提出不引入干扰梯度的均衡策略
- 在DeepSeek-V3(671B)上规模化落地
2. Loss Spike(训练震荡)
训练曲线毫无征兆地爆炸,规模越大重跑代价越高。
解决方案:
- Muon优化器: 由社区研究者提出,月之暗面改造为可扩展版本
- 论文报告:固定算力下样本效率约为AdamW的两倍
- K2的MuonClip + QK-clip: 15.5T token训练全程零loss spike
- K3的Per-Head Muon: 按注意力头独立调节
精度优化:FP8 → FP4
| 模型 | 精度方案 |
|---|---|
| DeepSeek-V3 | FP8训练(671B规模验证),正式训练run使用278.8万H800 GPU小时 |
| Kimi K3 | SFT阶段即开始MXFP4权重量化感知训练 |
| DeepSeek V4 Preview | 专家权重FP4,注意力保持FP8 |
关键认知: 每个参数占的比特减半,同一预算的参数购买力翻倍。
注: 流传的557万美元仅为DeepSeek-V3正式训练run的算力租赁折算,不包含前期研究与失败实验成本,不可与其他项目总成本直接对比。
推理工程:投机解码与部署优化
- MTP(Multi-Token Prediction): 被V3规模化后兼职投机解码(先低成本预测多个token,再一次性验证),各家跟进
- K3的特殊处理: KDA对传统Prefix Cache不友好,K3团队向vLLM社区提交配套实现,官方建议64卡以上超节点部署
2.8T模型能开出有竞争力的token价格,依赖的正是这些"不上发布会头图"的工程优化。
结语:2T+将成为上桌吃饭的标配
从Kimi K3(2.8T)到Qwen3.8-Max(2.4T),万亿级参数不再是少数玩家的玩具,而是四年架构演变的自然结果。
值得注意的是,智谱GLM-5.2参数量仅753B(不足K3的1/3),但效果拔群。这提示我们:参数规模并非唯一维度,架构效率同样关键。
可以预见,未来一段时间内,2T+参数将成为国产大模型上桌吃饭的标配规模。
参考文献
- Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity, Fedus et al. (Google), https://arxiv.org/abs/2101.03961
- Unified Scaling Laws for Routed Language Models, Clark et al. (DeepMind), https://arxiv.org/abs/2202.01169
- DeepSeekMoE: Towards Ultimate Expert Specialization in Mixture-of-Experts Language Models, DeepSeek-AI, https://arxiv.org/abs/2401.06066
- Scaling Laws for Fine-Grained Mixture of Experts, Krajewski et al., https://arxiv.org/abs/2402.07871
- DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model, DeepSeek-AI, https://arxiv.org/abs/2405.04434
- Auxiliary-Loss-Free Load Balancing Strategy for Mixture-of-Experts, Wang et al. (DeepSeek), https://arxiv.org/abs/2408.15664
- Gated Delta Networks: Improving Mamba2 with Delta Rule, Yang et al., https://arxiv.org/abs/2412.06464
- DeepSeek-V3 Technical Report, DeepSeek-AI, https://arxiv.org/abs/2412.19437
- Muon is Scalable for LLM Training, Moonshot AI, https://arxiv.org/abs/2502.16982
- Kimi Linear: An Expressive, Efficient Attention Architecture, Moonshot AI, https://arxiv.org/abs/2510.26692
- Kimi K3官方技术博客, https://www.kimi.com/blog/kimi-k3