Qwen3.8登顶英伟达GPU算子优化榜单,展现闭环自我改进潜力
2024年7月22日,据智东西报道,阿里巴巴千问团队最新发布的Qwen3.8预览版模型在英伟达推出的SOL-ExecBench基准评测中表现惊艳,成功登顶FlashInfer-Bench子集排行榜。这一成绩不仅超过了腾讯混元、美国AI初创公司DoubleAI的智能体系统,更超越了人类顶级开发者以及AI编程独角兽Cursor。
什么是SOL-ExecBench?为何含金量极高?
要理解这一成就的分量,首先需要了解评测背景。SOL-ExecBench是英伟达于今年3月推出的GPU CUDA Kernel内核优化基准评测套件,专门面向最新的Blackwell B200架构设计。其核心目标是评估AI智能体、编译器及自动内核生成工具所编写的GPU算子性能。
该榜单采用的SOL(Speed-of-Light,光速)得分,是一个衡量理论性能极限的关键指标。它由GPU的峰值算力与HBM(高带宽内存)带宽共同决定。SOL得分越接近1,代表算子的生成和优化能力越接近硬件的理论极限。
这意味着,模型无需人类标注,仅通过与真实硬件环境的交互,就能自主产生训练信号、评估自身输出质量并持续改进。
榜单排名一览(FlashInfer-Bench子集)
- 第1名:阿里千问 Qwen3.8-Preview
- 第2名:腾讯混元 Hyra
- 第4名:人类开发者 Amir M. Mir
- 第6名:DoubleAI 全自动GPU内核生成智能体系统
- 第10名:AI编程独角兽 Cursor
此次Qwen3.8夺冠的子集为FlashInfer-Bench,专门用于测试和优化大语言模型推理系统中的GPU算子。该子集包含26个来源于Llama-3.1-8B、Qwen3-30B-A3B、DeepSeek-V3/R1等主流模型的问题,覆盖BF16与FP8精度格式,并针对真实生产场景提供了7-48个动态形状输入配置,典型任务包括融合注意力(Fused Attention)、FP8 MoE和RMSNorm等推理关键算子。
所有提交内容均在真实的NVIDIA B200 GPU上隔离执行,且GPU时钟锁定以保证结果的可复现性。
从124个模型中提取235项优化任务
英伟达开发的SOL-ExecBench基准套件共有235项CUDA内核优化任务,这些任务提取自124个商用及前沿人工智能模型,覆盖大语言模型、扩散模型、计算机视觉、音频、视频以及混合架构。
与传统基准只看重相对软件基线的加速比不同,SOL-ExecBench关注的是内核执行方案本身贴近硬件最优效率的程度。在现代数据中心中,未能充分利用硬件的Kernel意味着算力与能源的双重浪费。
英伟达开发的SOLAR工具能够从FLOP数量、字节数、GPU峰值吞吐量以及带宽等方面,分析出基于硬件的SOL界限,并结合预先定义的评分基准得出SOL评分:
* 评分0.5:表示性能与基准值相当。
* 评分1.0:表示达到了硬件上的SOL界限(即理论极限)。
为保证可靠性,该套件还包含一个沙盒评估工具,并能基于其开发的智能优化算法,在相同评估协议下改进提供的PyTorch参考实现,同时识别并防止试图操纵评估器的行为。
排名靠前意味着什么?具备闭环自我改进潜力
Kernel优化是少数几个能提供清晰、客观、可量化反馈信号的真实工程任务。反馈明确(运行时间、吞吐量、带宽利用率可精确测量),标准客观(距离硬件理论极限无歧义),迭代自然(每一轮优化都可作为下一轮起点)。
因此,能在SOL-ExecBench上表现靠前的模型,意味着其在以下核心能力上具有显著优势:
- 长程因果推理:优化决策之间存在复杂依赖链,局部改动会影响全局性能,模型需要跨越长上下文进行一致性推理。
- 工具使用与环境交互中的策略规划:面对多轮工具调用,模型需根据每次执行反馈动态调整策略,而非机械执行预设步骤。
- 稀疏反馈下的探索能力:性能提升往往非线性,模型需在大量“看似合理但实际无效”的方向中,识别真正有价值的优化路径。
- 系统级抽象与具体实现之间的双向翻译:既能从高层算法语义映射到底层硬件指令,又能从硬件反馈反推优化方向。这种能力在科学计算、编译器设计、芯片设计等领域均有直接迁移价值。
简而言之,Qwen3.8的登顶表明其具备在客观物理约束下进行闭环自我改进的能力。
阿里千问的技术揭秘:训练侧搭建真实GPU环境,推理侧引入智能体框架
据智东西从千问团队获悉,团队在训练和推理两个环节均针对Kernel Self-Evolving(内核自进化)进行了深度优化。
训练侧:构建大规模强化学习体系
为了让模型真正具备Kernel优化能力,而非仅仅学习表面的代码模式,研究人员构建了基于真实GPU环境的大规模强化学习体系:
- 搭建基于沙盒的真实GPU训练环境:为模型提供丰富的硬件文档与可交互的Workspace,使模型能够通过真实编译、执行与性能测量获取来自硬件的奖励信号,确保每一个训练信号都有真实的物理意义。
- 以真实Kernel仓库作为训练数据:系统性收集大规模真实的工程级Kernel优化代码,以这些真实世界的Kernel作为训练Query。相比合成数据,真实反馈覆盖了更广泛的优化模式、硬件适配策略与工程取舍。
- RL基础设施的针对性优化:针对Kernel优化任务需要超长工具调用序列(单次优化可能涉及数十乃至数百轮编译-执行-分析循环)的特点,对强化学习训练基础设施进行了专项优化,支持高效处理超长多轮工具调用的训练。
推理侧:Atrex Kernel Agent框架
在推理侧,研究人员使用阿里巴巴Atrex Kernel Agent框架来承载算子优化的完整分析迭代流程与经验沉淀机制。
在SOL-ExecBench FlashInfer-Bench子集的评测中,该模型完成了平均29,354轮工具调用的持续迭代。在每一轮循环中,它对Kernel实现进行编译、执行、性能分析与策略调整,将性能逐步推向硬件理论极限。这意味着,模型在数万轮的迭代过程中可以保持方向一致性、持续产出有效优化、不陷入局部震荡,这正是长程持续优化能力区别于普通代码生成能力的核心所在。
结语:自动化算子生成的新上限
随着AI智能体生成与优化GPU内核的能力持续增强,Qwen3.8此次登顶刷新了自动化算子生成的能力上限。它意味着模型有能力承担底层算力优化的复杂工程任务,进一步压缩人工介入算子开发的工作环节,形成从算子生成到性能调优的自动化闭环。
7月19日,阿里千问大模型团队曾宣布将很快发布并开源Qwen3.8。据悉,该模型参数高达2.4T,可能是除了Fable 5外最强大的模型。昨晚,Qwen3.8-Max-Preview更新后,前端(WebDev)表现更佳。
展望未来,自动化GPU算子生成赛道的长期竞争,将取决于大模型理解硬件架构、推演访存瓶颈、自主迭代调参的综合智能水平。伴随大模型能力升级,模型侧与编译层在算力优化方面将形成持续双向反馈,硬件规格、算子实现、模型架构三者的协同演进或将成为常态。