十万卡满载背后:中国算力进入"系统效率"时代
这篇文章详细报道了中国首个全国产十万卡AI超集群“曙光8000”的上线及其深远影响。以下是对该事件的核心总结与分析:
1. 里程碑事件:首周即满载
- 正式运行:7月9日,中科曙光“曙光8000”(登峰)正式运行,这是中国首个全国产十万卡AI超集群。
- 高负载表现:上线首周日均处理作业15万个,单日峰值突破50万个,近千项应用涵盖大模型训练、推理及科学计算。
- 行业认可:在WAIC期间获得“镇馆之宝”称号,展示了其技术实力。
2. 核心技术突破:从万卡到十万卡的跨越
- 可靠性挑战:集群包含约30亿个部件,可靠性要求从99.9%提升至99.99%以上,以应对大规模抖动风险。
- 能效与散热:采用浸没相变液冷技术,PUE低至1.04,全年自然冷却,极大降低了能耗。
- 超智融合架构:打破传统超算与AI算力分离的模式,同一硬件底座支持从FP64双精度科学计算到INT8推理的全场景应用。
- 全链路国产自研:
- 芯片:6款核心芯片全部国产,单机柜算力密度提升20倍。
- 网络:自研scaleFabric无损高速网络,端到端延迟<1微秒,支持11.4万张卡同时通信。
- 存储:ParaStor分布式全闪存储,IO500榜单双料全球第一。
- 管理:Gridview 7.0统一调度算力、网络、存储和液冷。
3. 产业逻辑变迁:从“卖卡”到“卖系统”
- 价值转移:算力竞争核心从“单卡峰值”转向“系统效率”。网络、液冷、电力等基建投入占比首次超过GPU采购本身。
- 商业模式升级:从一次性硬件销售(毛利率15%-25%)转向持续的算力运营和服务(毛利率可达40%+),客户群体大幅扩展。
- 世界级水平:标志着中国在超大规模集群建设能力上已达到世界级水平。
4. 应用生态与开发者启示
- 科学计算成就:完成多项世界纪录级模拟(如414.7亿原子DFT精度模拟、蛋白质折叠全流程模拟等),覆盖气象、量子计算、油气勘探等领域。
- 国家超算互联网节点:接入后平台日均作业处理量从29万跳至45万以上,注册用户超140万。
- 降低开发门槛:推出OneScience科学大模型平台,支持自然语言描述需求自动调度资源,并提供三大生态计划(算力补贴、智能体招募、伙伴合作)。
5. 结语:算力普惠化
曙光8000不仅支撑国家战略性工程,其算力已间接服务于普通用户的手机APP后端服务。随着大模型能力的基础化,国产十万卡集群正成为推动AI普及和科学创新的关键基础设施。