Kimi K3 开源|2.8 万亿参数、稀疏度 56x,没披露算力账单,协议留了一手

月之暗面今天放出了 Kimi K3 的权重和技术报告。参数量 2.8 万亿,实际激活 1040 亿,稀疏度 56 倍,支持 100 万 token 上下文,带原生视觉能力。这是目前公开的第一个迈入 3 万亿参数级别的开源模型。

定位上报告自己说得挺清楚:综合能力还落后 Claude Fable 5 和 GPT-5.6 Sol,但已经超过 Claude Opus 4.8、GPT-5.5 和 GLM-5.2。跟现在 Top 级闭源模型还有差距,但放在开源阵营里,这是独一档的存在。

不过报告里有一个细节绕开了:团队没有透露 K3 和视觉编码器到底用了多少训练 token 和多少算力。对于一个 2.8T 参数、56 倍稀疏度的模型,算力账单和 token 消耗量才是衡量"这个方案到底划不划算"的核心指标。报告绕开了这个问题,只能等后续或者社区自己推算了。

架构上最值得看的几个改动

K3 在注意力上做了混合。每个模块里 3 层 Kimi Delta Attention(KDA,一种线性注意力)配 1 层全局注意力(Gated MLA),其中全局注意力层改成了不带位置编码(NoPE)的版本,位置信息完全靠 KDA 的门控衰减机制隐式传递。这可能是第一个把线性注意力和 NoPE 结合在一起的混合架构,此前同类模型的全局注意力层通常还保留着 RoPE。团队还改了 KDA 里的衰减机制,把原来可能数值溢出的设计换成有下界的版本,让计算可以完全用张量核心加速。

另一个有意思的设计是 Attention Residuals——每一层除了接收上一层的输出,还能有选择性地回看更早层的信息,不把所有历史压缩成一个状态往下传。为了控制开销,93 层网络被分成 8 个块,只在块间做全量跨层注意力。这个机制本身也是不带位置编码的,所以位置编码在这种跨层回看场景下到底多重要,目前还没定论。

MoE 部分变动也大。专家数从 K2 的 384 个涨到 896 个,每个 token 激活的专家从 8 个提到 16 个。稀疏度越高模型理论容量越大,但实操中瓶颈其实不在模型能力上限,而在显存容量。专家一多数值容易爆炸,负载也难均衡。团队为此搞了两个方案:新激活函数 SiTU-GLU 把数值幅度框在安全范围内,Quantile Balancing(QB)做负载均衡——沿用了 DeepSeek 归一化处理的思路,用上一批数据来估计当前批次阈值,保证因果性。配套的直方图估计方法能在数百万 token 规模上快速算分位数,是个很实在的工程解法。不过训练早期估计可能比较嘈杂,估计得有预热机制兜底。

视觉方面,图像编码器 MoonViT-V2 是从零开始用 next-token 预测训练的,没有像上一代那样借助对比学习做初始化。团队发现这样训练反而更稳定,梯度尖峰更少,效果也没打折扣。大模型时代对比预训练可能不再是必需品了。

训练效率 2.5 倍,基建也开了源

综合架构改动加上数据和训练方法的优化,K3 相对 K2 训练效率提升了约 2.5 倍,训练上下文从 128K 拉到了 100 万 token,通过四阶段课程学习逐步扩展窗口,同时用专门合成的超长文本数据防止模型退化成只看局部。

后训练走的是 SFT → RL(三路九专家)→ 多教师同策略蒸馏的路线,在通用、通用智能体、编程智能体三个大类上各分三档推理强度训练出九个专家模型,再合并进统一模型。RL 基础设施延续了 co-located 方案,能在几百张 GPU 上跑百万 token 级别的强化学习,业内很少在这个参数规模下还坚持用这套方案。为了降部署成本,后训练阶段就开始用 MXFP4 低精度训练专家权重,训练和推理用量化方案一致,避免了效果不一致的坑。

基建方面,团队专门给 KDA 开发了融合内核 FlashKDA,跨设备上下文并行解决了超长序列切分时的状态依赖丢失。针对专家负载不均衡做的 MoonEP 已经开源,和 DeepSeek 的 DeepEP v2 对比,MoonEP 通信耗时几乎不受负载不均衡影响,而 DeepEP v2 会随不均衡加剧持续变慢,高不均衡场景下直接训练崩溃。MoonEP 还在适配国产芯片阿里的真武 PPU,这是报告里少数直接指向国产硬件生态落地的信息。

协议留了一手,配套还发了个基准

K3 的开源协议附带商用条件:模型即服务业务年收入超过 2000 万美元需要单独找月之暗面授权;产品月活超 1 亿或月收入超 2000 万美元,需要在界面上展示 Kimi K3 的字样。对于大部分创业团队和中小企业来说,这个门槛短期内够不着,所以等于免费商用。但对于跑起来了的大流量产品,这是一个需要持续盯着的变量。

除了模型,团队还开源了一个新的视觉评测基准 PerceptionBench,专门测多模态模型最基础的原子级视觉感知能力——计数、深度、定位、细粒度识别、幻觉等。16 个主流多模态模型没有一个准确率超过 60%,感知类幻觉是所有模型平均表现最差的一项。这个结果挺诚实——视觉感知这个坎,所有模型都还没迈过去。

几个实测案例也能看出 K3 的 Agent 能力定位:一个注意力残差内核优化任务,K3 在 24 小时内把延迟从 283.6 毫秒降到 114.4 毫秒,和 Claude Fable 5 持平。还独立搞了个类似 Triton 的编译器 MiniTriton,从设计到代码生成全流程自主完成。芯片设计测试,48 小时内自主完成推理芯片原型的设计优化和验证全流程,最终解码吞吐 8700 token/s,代码已经开源。还有两小时复现一篇天体物理论文的完整数值流程这种案例——正常研究者需要一到两周。

K3 在开源模型里算是一个阶段性标杆——参数规模、训练效率、Agent 能力都有值得同行细读的设计。但没披露算力账单这件事始终是个缺口,协议条件也为商用埋了一个需要持续盯着的变量。能做到什么程度,还要看社区能不能把它跑起来、用出去。


相关链接