K3 权重开源,但 90% 的团队没必要本地部署

昨晚 11 点多,Kimi K3 的完整权重在 HuggingFace 上更新了。上周官方承诺 7 月 27 日前放出,算是踩着点兑现。我去扫了一眼仓库,96 个模型分片,每个约 17GB,合计 1.56TB,光下载就得跑一整天。

同步放出的还有一份 47 页的技术报告,比上周的网页版详细得多,有兴趣的可以细看。权重一放出来,本地部署的动作就开始了。X 上已经有团队拿 80 张 RTX 5090 跑起了完整版 K3,零 HBM,普通以太网互联,单流 20 tok/s,首日未调优。

K3 的参数规模是 2.8T,激活 104B 每 token,896 个路由专家每 token 激活 16 个。架构上影响部署成本的改动集中在三个维度。序列维是混合注意力,每 block 用 3 层 KDA 线性注意力配 1 层全局 Gated MLA;深度维是 Attention Residuals,每层可以按需取回更早层的表示;宽度维是 Stable LatentMoE,路由计算挪进减半的潜空间。官方说这套组合加新数据配方,scaling 效率比 K2 提升了约 2.5 倍。

但对要本地部署的人来说,最关键的设计是 MXFP4 是原生的。

1.56TB 对 2.8T 参数来说小得反常,平均每个参数只占 4.5 bit。技术报告 4.1.4 节给了答案:从 SFT 阶段起就做量化感知训练,MoE 专家权重按 MXFP4 格式训,激活走 MXFP8,RL 阶段的 rollout 和评估也用同一套量化方案。4bit 不是社区事后裁剪出来的,是这个模型出厂就长这样。

80 张 5090 那个案例特意强调用的是官方 MXFP4 权重、没做任何重量化。显存需求的上限已经被官方压到底了,但别指望再等一个体积减半的社区量化版——2.8T 的参数规模,怎么压都是 TB 级。

真正省显存的地方在 KV cache。跑过本地模型的朋友知道,长上下文场景吃显存的大头往往不是权重,是随对话长度膨胀的 KV cache。K3 的 93 层里只有 24 层是带全局注意力的 MLA,需要按 token 存缓存;其余 69 层是 KDA 线性注意力,无论上下文多长,状态都是固定大小的一小块。1M 窗口敢开这么大,架构上是有托底能力的。全局层用了 NoPE,位置感完全交给 KDA 层,部署时又少一个要调的东西。

技术报告第 5 章 Infrastructure 部分写得比很多模型报告写架构还长。KDA 状态和 MLA 缓存塞进同一个分页池管理,前缀缓存做到 512 token 粒度,预训练留下的 MTP 层被微调成 EAGLE-3 风格的草稿模型做投机解码,集群层面还有缓存亲和调度。报告给的例子很具体:一个典型的 1M 上下文编码请求,前缀 40 万 token,新增只有 4000 token,前缀缓存命中与否,成本差几个数量级。官方给 vLLM 和 SGLang 都提交了适配,但自己起服务要调到官方 API 的效率水平,烧的不只是卡的钱。

现在来看本地化部署到底要花多少钱。三种方案,一条条算。

消费卡方案。 80 张 5090,今年 7 月美国零售均价约 4329 美元,光卡就 34.6 万美元,约 250 万人民币。再加十来台八卡主机、电源、交换机、机柜,落地怎么也是 400–500 万级。功耗单卡 575W,80 张满载 46kW,整机房奔 60kW,按工业电价粗算,一年电费 40 万上下。80 张卡共 2560 GB 显存,权重占掉六成,剩约 1 TB 给缓存和通信。每 token 只激活 16 个专家,专家并行摊到 80 张卡上,每张卡每步只算一小块,卡间不需要 NVLink 级带宽,普通以太网也能凑合。放一年前不可想象。

专业卡方案。 官方 SGLang cookbook 列的支持硬件是 H100、H200、B200、B300 和 AMD MI350X,给生产环境的建议是 64 卡以上的超节点。按最省成本算:一台 8 卡 B200 有 1536 GB 显存,连 1561 GB 的权重都装不下;换 H200 得两台 8 卡整机起步(2256 GB),2026 年一台 8 卡 HGX H200 整机价格到三四百万,两台就是七八百万,关键还买不到。而这只是最低配置,离官方建议还差 4 倍卡数。真走这条路线,成本直奔三千万。

API 方案。 K3 定价是缓存命中 0.3 美元/百万 token、未命中 3 美元,输出 15 美元。250 万人民币的卡钱全换成输出 token 能买 230 亿,一个重度使用的小团队按每天烧 5000 万输出 token 算,能用一年多,电费、运维、折旧全都不用操心。

结论:本地化部署 K3 这种三万亿参数规模的模型,90% 的团队都没这个必要。偶尔有刚需的,先看 80 张 5090 那条路能不能走通,剩下的不如老实蹲 Kimi 的 token plan。

X 上那个团队上周刚在同一批卡上把 GLM-5.2 从 30 tok/s 调到 110,所以 20 tok/s 这个速率还有不少优化空间,不然只能拿来聊天,干不了实际活。