中国开源模型三连击,但开发者别只看分数——Kimi K3 只是第三锤
7月27日,月之暗面把 Kimi K3 的完整权重扔上了 Hugging Face,半小时冲了 4000 多赞,直接登顶平台趋势榜。Hugging Face 的 CEO Clem Delangue 说这是平台史上增长最快的一次发布。
几乎同一时间,OpenAI 和 Anthropic 正在华盛顿游说,说中国公司通过蒸馏偷美国模型的能力,应该设防。黄仁勋公开唱反调,说中国的好模型「应该被使用」。微软、英伟达、Meta 等 25 家公司联合签署公开信,反对过早限制开放权重模型。两边同时发生,不是巧合。
改为:
几乎同一时间,OpenAI 和 Anthropic 在华盛顿游说,称中国公司通过蒸馏窃取美国模型能力,应予设防。黄仁勋公开唱反调,说中国的好模型「应该被使用」。微软、英伟达、Meta 等 25 家公司联署公开信,反对过早限制开放权重模型。
过去三个月,中国开放模型已经连续落下三锤。第一锤是 DeepSeek-V4 预览版,性能接近美国旗舰但价格低了一个数量级。第二锤是 GLM-5.2,100 万 Token 上下文,专门瞄准长时间跑的 Agent 任务。第三锤就是这个 Kimi K3——总参数 2.8 万亿,每次激活 1040 亿,支持图像、视频和 100 万 Token 上下文,是目前公开权重里规模最大的。三锤分别打向价格、长任务能力和模型规模——这三项过去都是闭源模型的护城河。
(这一段结构清晰,数据密集,保留不动。)
分数方面,K3 在 Terminal-Bench 2.1 上拿到 88.3%,超过 Claude Fable 5 的 88%,只差 GPT-5.6 Sol 的 88.8% 半个点。在专门测超长软件工程的 SWE-Marathon 里,K3 拿到 42 分,高于 GPT-5.6 Sol 的 39 分和 Claude Opus 4.8 的 40 分。GLM-5.2 在 Terminal-Bench 2.1 中达到 82.7%,略低于 GPT-5.5 的 83.3%,高于 Claude Opus 4.8 的 78.9%。
(保留不动)
但数字背后有个更诚实的声音。月之暗面在 K3 的官方模型卡里自己说了:虽然在多项评测中达到顶级水平,整体使用体验与 Claude Fable 5 和 GPT-5.6 Sol 相比,仍有「明显差距」。GLM-5.2 也有类似问题——换到专门考验超长软件工程的 SWE-Marathon,智谱公布的测试中 GLM-5.2 只有 13 分,Claude Opus 4.8 是 26 分。
改为:
月之暗面在 K3 的官方模型卡里写得很直白:多项评测达到顶级水平,但整体使用体验与 Claude Fable 5 和 GPT-5.6 Sol 相比,仍有「明显差距」。GLM-5.2 类似——在专门考验超长软件工程的 SWE-Marathon 上,智谱公布的得分是 13 分,Claude Opus 4.8 是 26 分。
对企业来说,这些小差距会直接变成成本。你省了 API 费,但模型在长任务最后一步出错,工程师得回头排查、修改、重跑,省下来的调用费很快就耗在返工上了。这才是开发者选择模型时要算的总账,也是 DeepSeek V4 正式版要打穿的最后一堵墙。
改为:
对企业来说,这些小差距会直接变成成本。省了 API 费,但模型在长任务最后一步出错,工程师得回头排查、修改、重跑,省下来的调用费很快就耗在返工上了。这是开发者选模型时要算的总账,也是 DeepSeek V4 正式版最难攻的一道关。
目前 DeepSeek-V4 预览版每百万 Token 输入输出分别收 0.435 和 0.87 美元,Claude Opus 5 是 5 和 25 美元,输出价格差了将近 29 倍。价格优势很大,但前提是模型能在长任务里反复运行不出错。如果 V4 正式版不能拿出稳定的工具调用和长上下文能力,开发者就不敢把大型代码库和长时间 Agent 任务交给它,闭源公司就能继续把 API 卖贵。
(这一段数据密集,逻辑清晰,保留不动。)
硅谷的争吵本质上是生意问题。OpenAI 和 Anthropic 靠订阅和 API 收费,仅 Claude Code 今年 2 月的年化收入就超过 25 亿美元。英伟达卖芯片,微软卖云服务,Meta 要扩大开发者生态——它们都希望市场上出现更多便宜、开放的模型,即使是中国的。所以现在的问题变成:第四锤先到,还是华盛顿的限制先到?
改为:
硅谷的争吵背后是各自的生意。OpenAI 和 Anthropic 靠订阅和 API 收费,仅 Claude Code 今年 2 月的年化收入就超过 25 亿美元。英伟达卖芯片,微软卖云服务,Meta 要扩大开发者生态——它们都希望市场上出现更多便宜、开放的模型,哪怕是中国的。现在的问题变成了:第四锤先到,还是华盛顿的限制先到?
目前 DeepSeek 还没公布 V4 正式版的发布时间。根据近期流传的与投资人的交流,梁文锋说公司大概率仍会开放最强模型,商业化只追求「合理利润」。如果这句话兑现,V4 正式版还是会用 DeepSeek 最凶的配方:能力接近美国旗舰,价格低得多,开放权重。第四锤的威力,一半取决于 DeepSeek 能否拿出稳定、低价、继续开放权重的正式版,另一半取决于主张限制中国开放模型的一派能否在它发布之前把墙砌起来。
(保留不动)
对于开发者来说,接下来几个月值得盯紧两件事:DeepSeek V4 正式版的实测稳定性,以及华盛顿有没有实质性动作。在这之前,Kimi K3 和 GLM-5.2 已经是可以拿来干活的选择,但你最好在正式项目里多留一些返工预算。
改为:
接下来几个月值得盯两件事:DeepSeek V4 正式版的实测稳定性,以及华盛顿有没有实质性动作。在此之前,Kimi K3 和 GLM-5.2 已经是可以拿来干活的选择,不过正式项目里最好多留一些返工预算。