inclusionAI 发布原生混合线性模型 Ling-3.0-flash:124B 参数只激活 5.1B,专为 Agent 工作流设计
title: InclusionAI 发布 124B 混合线性推理模型,Agent 部署成本再压低
InclusionAI 发布 124B 混合线性推理模型,Agent 部署成本再压低inclusionAI 在 Hugging Face 上公开了 Ling-3.0-flash,一个自称「原生混合线性推理模型」的新架构。参数规模 124B,但每次推理只激活 5.1B,激活比例不到 5%。放在当前模型军备竞赛里体量不算突出,定位却明确——不卷峰值能力,把 Agent 工作流的生产部署成本往下压。
架构上的取舍
Ling-3.0 从预训练一开始就用了混合线性注意力,Kimi Delta Attention(KDA)和 MLA 以 5:1 交替堆叠,共 35 层 KDA + 7 层 Gated MLA。配合 1/64 稀疏 MoE,总共 512 个专家,每次路由激活 8 个。这种设计在长上下文场景里能减少冗余计算,官方数据说 HiCache + Mooncake 分层缓存方案能让长输入场景的 TTFT 降低 60% 到 80%。
参数量对比之前团队推出的 Ring-2.6-1T 旗舰,Ling-3.0-flash 的总参数只有它的约 12.4%,激活参数约 8.1%。同样的 GPU 集群能跑更多并发,或者用更便宜的卡顶上去。跑 Agent 的应用里,Token 成本差一两个数量级,账单完全不一样。
Agent 能力是重点
这个模型从训练阶段就围绕 Agent 场景做优化。官方用了 10,000+ 交互式训练环境,Coding、通用任务、Deep Research Agent 都有覆盖。评测数据里 SWE-Bench Pro 56.6,SWE-Bench Multilingual 72.4,AIME 2026 93.2。激活参数规模摆在这里,代码和推理方向上没掉队。
Agent 工作流的难点不在单次推理,而在长交互链路的稳定性和成本。Ling-3.0-flash 的 HiCache + Mooncake 缓存方案直接解决了长输入场景下的重复计算问题。频繁调用工具链、多轮对话的 Agent,这个优化会直接体现在延迟和账单上。
部署入口
模型已在 Hugging Face、ModelScope 和 OpenRouter 上线。支持 SGLang 和 vLLM 两条路径。
SGLang 的部署文档在官方 CookBook 里,支持 BF16/FP8 量化。推荐在 4 张 141GB 级 GPU(如 H20-3e)或 4 卡 Blackwell 节点上以低延迟模式运行,使用 NEXTN 推测解码,上下文长度支持 256K。vLLM 分支也在 GitHub 上,启用 MTP 推测配置后延迟更低。
Thinking 模式默认开启,通过 ling3 reasoning parser 处理。关闭时在请求里加 {"chat_template_kwargs": {"enable_thinking": false}}。采样参数推荐 temperature=0.6、top_p=0.95、top_k=20。
模型定位
当前赛道有两股力量在拉锯:一股往上堆参数、堆算力,追求绝对能力的天花板;另一股往下压成本、优化效率,让模型真正能用、用得便宜。Ling-3.0-flash 属于后者。
价值不在 Benchmark 刷新记录,而在给 Agent 开发者提供一个部署门槛更低的选择。124B 总参数、5.1B 激活,配上 256K 上下文和成熟的 SGLang/vLLM 支持,需要跑长链路 Agent 的团队可以认真考虑。
模型链接:https://huggingface.co/inclusionAI/Ling-3.0-flash
SGLang 部署文档:https://docs.sglang.io/cookbook/autoregressive/InclusionAI/Ling-3.0-flash
vLLM 分支:https://github.com/inclusionAI/vllm-ling-v3