跑通2.4万亿参数Qwen3.8,国产超节点迎来新里程碑
核心事件: 阿里云宣布由64张真武M890芯片组成的超节点已跑通并上线2.4万亿参数的Qwen3.8模型,通过百炼平台提供推理服务。这是国内首个运行超2万亿参数大模型的超节点,标志着国产超节点算力对前沿模型的承载能力已通过生产级场景验证。
背景:参数规模迈向“超2万亿”时代
自2020年GPT-3将大模型参数推至1750亿以来,Scaling law成为行业第一性原理。今年7月,月之暗面发布2.8万亿参数的Kimi K3,阿里推出2.4万亿参数的旗舰模型Qwen3.8。
随着参数规模从千亿跨越到万亿,再到如今的超2万亿,硬件基础设施面临严峻挑战:
* 千亿参数时代: 八卡服务器即可应付;
* 万亿参数时代: 单机柜开始吃紧;
* 超2万亿参数时代: 模型权重本身超过1TB。
据花旗报告测算,Kimi K3在MXFP4精度下的原始权重约1.4TB,官方建议部署起点为64卡以上的超节点。单卡容量不足、单机柜带宽受限、普通AI集群通信瓶颈,使得高吞吐、低延迟、高并发成为部署难题。
技术突破:真武M890超节点的硬实力
7月23日,阿里云披露关键进展:由64张真武M890芯片组成的超节点成功运行Qwen3.8,并上线百炼平台。该超节点具备以下核心指标:
* 显存规模: 9TB,可独立支撑2万亿参数MoE模型的专家并行;
* 互联带宽: 达到800GB/s;
* 性能优化: 通过算子优化和软硬件架构协同,在Agentic推理场景中实现最多1.5倍的推理性能提升。
真武M890是平头哥新一代训推一体AI芯片,原生支持FP32到FP4多种数据精度,可在同一颗芯片上完成高精度训练及低/超低精度推理。其配套的ICN Switch 1.0互联芯片实现了64张芯片的高速互联。
行业趋势:算力竞争延伸至系统能力
1. 从单芯片到超节点系统方案
摩根大通在WAIC2026考察纪要中指出,等效Hopper级别的单芯片性能已成为行业门槛,覆盖数十至数千张卡的超节点是部署万亿参数模型的重要系统方案。预填充和解码分离已从实验进入规模部署阶段,通过对两类负载分别配置资源以降低推理成本。
2. Agent场景带来新挑战
通用Agent的长链推理、工具调用和超长上下文记忆,对显存容量、卡间通信和响应延迟的要求全面高于传统单次问答。智能体消耗token的速度远超人类用户,需求曲线呈指数级增长。超节点因此被视为通用Agent爆发的最佳底座,9TB显存池也为长链任务不掉速提供了保障。
3. 国内竞争格局分化
WAIC2026上,阿里、华为、壁仞、摩尔线程等公司均展示了超节点方案,中国AI算力厂商正从单芯片竞争走向系统扩展。目前:
* 阿里: 同时握有自研AI芯片、自研互联芯片、云平台和前沿大模型四张牌,是国内唯一一家;
* 华为: 拥有芯片和超节点,但模型不在第一梯队;
* 月之暗面: 模型参数达2.8万亿,但算力依托外部。
4. 效率与商业化的长期胜负手
瑞银报告认为,Kimi K3在Artificial Analysis智能指数上排名全球第三,Qwen3.8同样瞄准全球最前沿水平。当模型差距收窄后,决定竞争力的变量转为推理效率、算力储备和服务稳定性。
受杰文斯悖论影响,模型效率越高,单位token成本越低,用户越多,算力总消耗反而越大。数据显示,中国日均token消耗在2026年3月突破140万亿,较2024年初增长超1400倍。需求传导至价格端,阿里云于4月18日起对AI计算产品提价5%到34%,AI存储提价30%。花旗预计阿里AI相关收入在FY2026至FY2031年的复合增速可达90%。
截至今年4月,平头哥自研AI芯片累计出货已达56万片,服务20多个行业400多家客户。真武M890超节点上线百炼,意味着国产芯片超节点的推理服务直接站到了商业化一线。
结语
Scaling law走到2.8万亿参数,下一个节点可能是5万亿或10万亿。参数每上一个台阶,能跑通它的系统就要重新迭代。谁的系统先跑通下一代模型,谁就拿到下一轮竞争的入场券。