Kimi K3 发布|2.8T 参数完全开源,技术报告罕见地承认「打不过最强的」

月之暗面昨天在 arXiv 丢了一份技术报告,标题叫「Kimi K3: Open Frontier Intelligence」。扫了一眼作者列表——400 多人,比很多创业公司全公司人都多。再看摘要,参数规模确实不小,报告写得也挺实在,没硬吹。

Kimi K3 是一个 2.8T 参数的 MoE 模型,每 token 激活 104B 参数,原生支持视觉,上下文窗口 1M token。架构上用了「Kimi Delta Attention」和「Attention Residuals」,论文说它能改善信息在序列长度和模型深度上的流动。MoE 部分用的是 Stable LatentMoE,每 token 从 896 个 routed expert 里激活 16 个。相比去年上半年的 Kimi K2,整体 scaling efficiency 提升了大约 2.5 倍。

这几个数字放在一起,意思很直接:Kimi 没有在基座模型竞赛里掉队,而且这次把完整权重全部开源了——2.8T,不是 demo 版,不是蒸馏版,也不是「部分开源部分保留」。有集群、有耐心、有推理优化能力的团队,可以在自己的环境里跑这个模型。这对做长程 coding agent、多模态 RAG、或者需要大 context window 的工程团队来说,是个真正可用的选项。

后训练部分重点提了多领域 RL——general、agentic、coding,以及多级推理 effort。这也符合行业共识:基座模型是地基,真正让人用得舒服是靠后训练把行为磨出来。1M context 配上 agentic RL 的持续 rollout,理论上能做不少以前需要多次调用的串联任务。

但最让我多看两眼的,是摘要里这句话:

「While its overall performance still trails the most powerful proprietary models, namely Claude Fable 5 and GPT-5.6 Sol」

直接在技术报告里写「我们不如 Claude Fable 5 和 GPT-5.6 Sol」,这在 AI 圈不太常见。很多团队的路线是挑自己擅长的 benchmark 列一排,把总体比较模糊掉,或者用一句「达到前沿水平」带过去。Kimi 的写法是:我们在长程编码、agentic、知识、推理、视觉上达到了 frontier-level,但跟最强闭源比还是有差距。同时补了一句——在所有其他开放和闭源模型评测中,K3 是 consistently outperforms 的。

这个定位很精准。2.8T 全部开源,给社区和开发者提供了一个真正可用、可部署、可研究的前沿级基座。开源这件事的分量,比在某些 benchmark 上高零点几个点更重。

开源是一回事,跑起来是另一回事。2.8T 总参数、104B 激活,推理成本不会低。需要有足够好的量化、足够的 GPU,或者等到社区把各种 inference optimization 方案适配上去,才能真正用顺手。不过 MoE 架构本身对推理部署相对友好——每 token 只激活 12% 不到的参数(16/896),实际计算量跟一个 100B 左右的 dense 模型相当,但知识容量大得多。

K3 有完整的视觉能力,这跟 K2 时代的方向一致。多模态是月之暗面一直押注的线,从产品端也能看出来。加上 1M 上下文窗口,这个组合可以直接对接长文档、长视频、代码仓库级别的 agent 任务。

报告本身的风格也值得提一句。400 多个作者、八十多页(根据 PDF 大小估算),从 attention 机制到训练配方到部署优化都讲了。信息密度够,边界也交代得清楚。该放的 benchmark 放了,该承认的差距也承认了。

这种「开放前沿」的姿态,比那些只放个 demo 页面就号称「开源」的,真诚太多。

相关链接