英伟达GB200能效三个月翻4倍,Rubin平台加速落地

英伟达软件优化狂飙:Blackwell算力吞吐4个月提升4倍,Rubin平台已启动全球部署

在AI基础设施竞争日益激烈的当下,英伟达再次展示了其超越硬件性能的“软实力”。最新数据显示,英伟达在Blackwell平台的软件优化上取得了突破性进展——仅用三个月时间,便将GB200 NVL72在运行DeepSeek R1模型时的每兆瓦算力吞吐量(TPS/MW)提升了4倍。

这一惊人的效率跃升并非偶然,而是建立在四个月内完成的38项重大优化迭代、超过25万次模拟配置筛选以及累计140万GPU小时的实测验证之上。更关键的是,英伟达指出其中逾90%的优化成果可跨模型复用。这意味着,现有数据中心客户无需更换硬件,即可通过软件升级获得显著的能效收益,这对于算力成本高度敏感的超大规模云厂商而言,具有直接的经济价值。

与此同时,英伟达并未停下脚步。其下一代Vera Rubin平台已进入全球部署阶段,据报在同等功耗下,其Token吞吐量相较Blackwell实现了约10倍的大幅提升。从Blackwell的持续挖掘到Rubin的加速落地,英伟达正通过双线并进的策略,逐步构筑起竞争对手难以在短期内逾越的软件护城河。

GB200能效突破:软件定义算力的新标杆

在AI大模型训练与推理中,能效比(Performance per Watt)是衡量数据中心经济效益的核心指标。英伟达针对GB200 NVL72平台推出的系列优化,正是围绕这一核心痛点展开。

以运行DeepSeek R1 0528模型(1K输入/1K输出配置)为例,GB200 NVL72在三个月内实现了每兆瓦算力吞吐量4倍的增长。支撑这一成果的,是英伟达背后庞大的工程投入:

  • 38项重大优化迭代:涵盖内核优化、通信协议改进及内存管理等多个层面。
  • 25万次模拟配置测试:通过高精度的仿真环境,快速筛选出最优的参数组合。
  • 140万GPU小时实测验证:确保每一项优化在实际负载下的稳定性与有效性。

英伟达特别强调,这些优化并非专为单一任务量身定制,而是具备高度的通用性。逾90%的优化成果可以无缝迁移至其AI产品组合中的其他模型。这种“一次优化,广泛受益”的策略,极大地延长了现有硬件的投资回报周期,也强化了客户对英伟达生态的黏性。对于企业客户而言,这意味着他们可以在不增加巨额硬件资本支出(CapEx)的前提下,通过软件升级获得接近新一代硬件的性能提升。

GB300刷新训练纪录:六个月性能提升1.5倍

如果说GB200的优化侧重于推理与能效,那么其在AI训练侧的旗舰产品GB300 NVL72则展现了纯粹的性能爆发力。

在256卡规模下,基于Megatron Core框架对DeepSeek-V3 671B超大模型进行预训练,GB300 NVL72实现了每GPU 1648 TFLOPs的吞吐量。这一数字不仅较此前GB200的606 TFLOPs提升了约3倍,更创下了该任务的全球最高纪录。

然而,这并非静态的硬件极限。数据揭示了一个更具说服力的趋势:GB300 NVL72在Megatron Core框架下的表现,已从2025年11月的1088 TFLOPs/GPU,稳步增长至2026年6月的1648 TFLOPs/GPU。在短短六个月内,通过持续的软件栈优化,其训练性能累计提升了约1.5倍。

主流框架协同:PyTorch与JAX的显著增益

在AI训练领域,框架的效率直接决定了硬件的利用率。英伟达与PyTorch及JAX社区的深度合作,带来了令人瞩目的性能跃升:

  1. TorchTitan(PyTorch原生训练栈)
    在对DeepSeek-V3 671B模型的训练中,GB300 NVL72的性能相较未优化基线配置提升了6倍,从199 TFLOPs/GPU跃升至1197 TFLOPs/GPU。

  2. JAX框架
    提升幅度更为惊人。截至2026年7月,每GPU吞吐量达到4082 Tokens/s(对应1025 TFLOPs/GPU),较2026年1月的418 Tokens/s提升了约10倍

这些数据表明,英伟达的竞争优势已不再仅仅依赖于GPU架构本身的迭代,更在于其与主流开源生态的深度绑定与联合优化能力。

扩展效率逼近理论上限:800 Gb/s网络的关键作用

大规模集群训练面临的最大挑战之一,是如何在多机多卡环境下保持高效的扩展率。通信开销往往成为制约整体性能的瓶颈。

英伟达披露,在256至1024卡的扩展区间内,GB300 NVL72在三大主流框架下均维持了接近理论上限的扩展效率:
* Megatron Core:98.5%
* TorchTitan:97%
* JAX:97%

英伟达将这一卓越的扩展表现归因于NVL72机架内置的800 Gb/s Scale-Out网络芯片。高速互联直接降低了多机训练中的数据同步延迟,从而大幅减少了通信开销。这一网络能力被视为支撑上述跨框架高效率表现的核心基础设施组件,也进一步巩固了英伟达在端到端解决方案上的壁垒。

Rubin平台加速落地:双线并进的生态战略

在Blackwell平台优化持续深化的同时,英伟达的下一代架构Vera Rubin也已正式登场。据报道,Vera Rubin NVL72在Token吞吐量上相较Blackwell实现了约10倍的整体提升:
* GB200 NVL72:约 80,000 Tokens/s
* Vera Rubin NVL72:在同等150MW功耗下可达 800,000 Tokens/s

这一代际跨越不仅体现在硬件算力的提升,更伴随着全新的架构设计以适应未来更大规模模型的训练需求。

然而,英伟达的策略与此前Hopper世代如出一辙:在新平台推进全球部署的同时,持续通过软件优化挖掘已部署硬件的潜力。 这种做法具有双重战略意义:
1. 延长投资回报:确保现有客户的硬件资产在新一代产品发布后仍能保持竞争力。
2. 强化生态黏性:通过深厚的软件优化能力,让客户难以轻易迁移至其他平台。

结语:软件定义的AI基础设施新范式

英伟达在Blackwell与Rubin双线并进的格局下,正重新定义AI基础设施的竞争维度。从GB200的四个月4倍能效提升,到GB300的六个月1.5倍训练性能增长,再到Rubin平台十倍级的吞吐量跨越,英伟达展示的不仅是硬件迭代的速度,更是软件优化的深度。

对于市场而言,这意味着AI算力的获取方式正在发生深刻变化。硬件不再是唯一的决胜点,软件栈的成熟度、框架的协同效率以及网络的扩展能力,共同构筑起一道难以逾越的护城河。英伟达正通过这种“软硬兼施”的策略,逐步确立其在AI基础设施领域长期且稳固的领导地位。