蚂蚁发布 Ling-3.0-flash:「越级对标」不是口号,是算力压榨的硬活
模型发得勤了以后,圈里其实养成了一种挺偷懒的审美:参数越大越好,上下文越长越好,推理越复杂越好。每次发布会一开,大家就盯着榜单上的数字往上蹿,好像我们每天上班遇到的最大困难是办公室里缺一个能证黎曼猜想的同事。
绝大多数生产任务不是智力极限挑战——它们数量多、流程固定、边界清楚,就是需要模型反应快、听得懂指令、稳定执行,还不能太贵。蚂蚁百灵在 7 月 24 日放出的 Ling-3.0-flash,就是冲着这个空档去的。
Ling-3.0-flash 总参数 124B,激活参数只有 5.1B——对比上一代旗舰 Ring-2.6-1T(1T 总参、约 63B 激活),大概只用了旗舰 1/8 的总参数、1/12 的激活参数,官方口径说已经在多数基准上做到了「对标甚至超越」。上下文原生支持 256K,能扩到 1M。
这肯定不是又一个「小而美」的故事。它讲的是怎么把每一寸算力压榨干净。
架构上做了三件事
原生混合线性注意力。Ling-3.0 从预训练阶段就没走回头路,不像上一代先迁移架构再继续训,而是直接从零搭了 KDA(Kimi Delta Attention)加 MLA 的混合架构,5:1 的比例交替堆叠。KDA 是 Moonshot 在 Kimi Linear 里提的线性注意力机制,核心是在 Delta Rule 的状态更新里加了细粒度对角门控——读长文档、大代码库的时候,不同信息通道各自管理自己的记忆丢掉还是保留,不会一锅粥地混在一起。
MoE 稀疏度进一步压低。前代是每 Token 激活 1/32 的专家,Ling-3.0 压到了 1/64。124B 总参里每次推理只点亮很小一组。这个取向来自百灵自己提出的效率杠杆理论——在同等性能下,激活比例越低,算力效率越高。
为 Agent 长程任务做了专门的工程优化。一个是集群级分层缓存,基于 SGLang HiCache 和 Mooncake 把缓存从实例私有升级成集群共享。长输入场景下,命中的话可以把首 Token 延迟降低 60%-80%。另一个是 Ling Multi-Agent 的多智能体协同架构,让不同 Agent 交叉验证、协同纠错,降低单一推理路径的漂移风险。
实测:边界清楚的任务,它很能打
趁免费 API 窗口(截至 8 月 3 日 23:00,OpenRouter 也能直接白嫖)测了几把,工具用的是 OpenCode,拿过来就是默认选项,不用额外配置。
构建一个模拟太阳系。3 分钟搞定,太阳和八大行星的位置关系对了,还主动用不同颜色和行星环做了视觉区分。不废话,直接出活。
又试了一个包豪斯风格的「Less is More」精选作品集网站,全程不能用任何图片素材。成品精准还原了纯 CSS/SVG 的无图美学,三原色、几何构成、非对称网格都在。这个场景下说「对标旗舰」不是虚的。
还接了真实工作流——让它安装机器之心自产的行业数据 Skills。配好 API key 之后,对话框里提问就能直接查全部行业数据。我们让它检索蚂蚁百灵发布过的所有模型和技术文章,24 篇相关文章利落地梳理出了一条从基础设施到 MoE 架构突破再到全模态与智能体集成的主线。
短板也很清楚。让它独立做一个 3D 物理台球沙箱(Vite + TypeScript + Three.js + cannon-es),没有跑通。不意外——它就是用来执行规划好的步骤的,做不到一句话端到端拿下复杂工程。先由人或大模型搭好骨架,再让它逐轮填充落地,才是顺手的用法。
又便宜又能打,然后呢?
Ling-3.0-flash 踩中了一个正在成型的行业共识:一套 Agent 系统里,大推理模型负责深思熟虑,轻量模型负责高频落地。2026 年不少企业已经在做这个取舍——与其让昂贵的大模型端到端包揽一切,不如用动态路由把任务分一分,让轻量模型承接执行环节。
它的局限也需要说清楚。广度知识储备和多语言稳定性还有空间,长对话高压下可能出现中英文混杂。没有原生多模态。极度冷门、需要庞大世界知识硬背的研究任务,或者「一句话帮我做完整工程」的 one-shot 期待,交给更大的推理模型更合适。
MiniAppBench 提供了一个参照:16 个主流模型平均通过率约 17%,Ling-3.0-flash 做到 25.3%,与参数规模约它两倍的开源 SOTA 持平。
官方说免费体验期结束后会正式开源权重。模型权重开源之后,能省多少部署成本,能不能在社区里长出更多好的 Agent 工作流,才是 Ling-3.0-flash 真正要回答的问题。「越级对标」喊出来容易,进到生产里每一轮调用的延迟和账单不会骗人。