
作者 | 程茜
编辑 | 云鹏
智东西 7 月 22 日报道,昨日,阿里千问最新发布的Qwen3.8 预览版模型在英伟达评估 AI 进行算子优化的榜单上登顶,排名超过腾讯混元、人类开发者、Cursor。
榜单中 SOL 得分指的是 GPU 的峰值算力与 HBM 带宽共同决定的理论性能极限。模型这一分数越接近 1,代表其生成和优化 GPU 算子能力越接近理论极限,可以在无需人类标注的情况下,通过与真实硬件环境的交互,自主产生训练信号、评估自身输出质量并持续改进算子。
这一榜单中排名第二的是腾讯混元 Hyra、排名第四的是人类开发者 Amir M. Mir、排名第六的是美国 AI 创企 doubleAI 的全自动 GPU 内核生成智能体系统、排名第十的是 AI 编程独角兽 Cursor,其他项目暂未找到公开打榜记录。

7 月 19 日,阿里千问大模型团队宣布将很快发布并开源 Qwen3.8。该模型参数 2.4T,可能是除了Fable 5外最强大的模型。昨晚,Qwen3.8-Max-Preview 更新,前端(WebDev)表现更好。
一、从 124 个模型中提取,共 235 项 CUDA 内核优化任务
随着 AI 智能体生成与优化 GPU 内核的能力持续增强,现有基准评测的一大局限暴露,其只看重相对软件基线的加速比,而非内核执行方案本身贴近硬件最优效率的程度。而在现代数据中心中,未能充分利用硬件的 kernel 意味着算力与能源的双重浪费。
基于此,英伟达提出了 SOL-ExecBench 基准套件。这一套件共有235 项CUDA 内核优化任务,提取自124 个商用及前沿人工智能模型,覆盖大语言模型、扩散模型、计算机视觉、音频、视频以及混合架构,目标硬件为英伟达 Blackwell 系列 GPU,涵盖 BF16、FP8、NVFP4 精度下的前向与反向计算负载。

英伟达开发的 SOLAR 工具能够从 FLOP 数量、字节数、GPU 峰值吞吐量以及带宽等方面,分析出这些基于硬件的 SOL 界限,然后将这些界限与预先定义的评分基准相结合,从而得出 SOL 评分。
具体来说,评分为 0.5 表示与基准值相当,评分为 1.0 表示达到了硬件上的 SOL 界限。因此,这个评分不仅反映了相对于基准值的改进程度,还体现了与最大可实现硬件性能相比所剩余的优化空间。

此次 Qwen3.8 拿下第一的是FlashInfer-Bench 子集,专门用于测试和优化大语言模型推理系统中的 GPU 算子。
该子集包含 26 个来源于 Llama-3.1-8B、Qwen3-30B-A3B、DeepSeek-V3/R1 的问题。
该子集覆盖的精度格式为 BF16 与 FP8,每个问题提供 7-48 个动态形状的输入配置,覆盖真实生产场景,典型任务包括融合注意力(Fused Attention)、FP8 MoE 和 RMSNorm 等推理关键算子。
根据官方披露,该测试套件中所有提交内容均在真实 NVIDIA B200 GPU 上隔离执行,GPU 时钟锁定在 1500 MHz 以保证可复现性。
二、榜单排名靠前,意味模型具备闭环自我改进潜力
Kernel 优化是少数几个可以提供清晰、客观、可量化反馈信号的真实工程任务之一:
反馈明确:运行时间、吞吐量、带宽利用率可以精确测量;
标准客观:距离硬件理论极限还有多远,没有歧义;
迭代自然:每一轮优化都可以作为下一轮的起点。
这意味着模型可以在无需人类标注的情况下,通过与真实硬件环境的交互,自主产生训练信号、评估自身输出质量并持续改进。
在 SOL-ExecBench FlashInfer-Bench 子集上表现靠前,就意味着模型在下面几项能力上具有优势:
长程因果推理:优化决策之间存在复杂依赖链,局部改动会影响全局性能,模型需要跨越长上下文进行一致性推理。
工具使用与环境交互中的策略规划:现实世界智能体任务面对多轮工具调用,模型需要根据每次执行反馈动态调整策略,而非机械执行预设步骤。
稀疏反馈下的探索能力:性能提升往往不是线性的,模型需要在大量 " 看似合理但实际无效 " 的方向中识别真正有价值的优化路径。
系统级抽象与具体实现之间的双向翻译:从高层算法语义映射到底层硬件指令,再从硬件反馈反推优化方向,这种双向能力在科学计算、编译器设计、芯片设计等领域均有直接迁移价值。
这也意味着,能在 SOL-ExecBench 上持续进化的模型,具备在客观物理约束下进行闭环自我改进的能力。
三、训练侧搭建真实 GPU 环境,推理侧引入阿里智能体框架
智东西从千问团队获悉,在训练、推理方面,千问团队均针对 Kernel Self-Evolving 进行了优化。
首先在训练侧,为了让模型真正具备 kernel 优化能力,而非仅仅学习表面的代码模式,其构建了一套基于真实 GPU 环境的大规模强化学习体系。
1、研究人员搭建了基于沙盒的真实 GPU 训练环境:
为模型提供丰富的硬件文档与可交互的 Workspace,使模型能够通过真实编译、执行与性能测量获取来自硬件的奖励信号,而非依赖代理指标或模拟器。这可以确保每一个训练信号都有真实的物理意义。
2、真实 Kernel 仓库作为训练数据
研究人员系统性收集了大规模真实的工程级 kernel 优化代码,以这些真实世界的 kernel 作为训练 query。相比合成数据,真实反馈覆盖了更广泛的优化模式、硬件适配策略与工程取舍,为模型提供了更接近生产场景的学习信号。
3、RL 基础设施的针对性优化
Kernel 优化任务的一个显著特点是需要超长的工具调用序列,单次优化过程可能涉及数十乃至数百轮的编译 - 执行 - 分析循环。
为此,研究人员对强化学习训练基础设施进行了专项优化,使其能够高效支持超长多轮工具调用的训练,从而让模型真正学会跨越长序列的持续优化策略。
在推理侧,研究人员使用阿里巴巴 Atrex Kernel Agent 框架来承载算子优化的完整分析迭代流程与经验沉淀机制。

在 SOL-ExecBench FlashInfer-Bench 子集的评测中,该模型完成了平均 29354 轮工具调用的持续迭代,在每一轮循环中对 kernel 实现进行编译、执行、性能分析与策略调整,将性能逐步推向硬件理论极限。
这意味着,模型在数万轮的迭代过程中可以保持方向一致性、持续产出有效优化、不陷入局部震荡,正是长程持续优化能力区别于普通代码生成能力的核心所在。
结语:从手写算子到 AI 生成、调优,Qwen3.8 刷新自动化算子生成能力上限
Qwen3.8 此次登顶,意味着其有能力承担底层算力优化的复杂工程任务,并进一步压缩人工介入算子开发的工作环节,其能直接对接真实硬件环境采集运行反馈,形成从算子生成到性能调优的自动化闭环。
自动化 GPU 算子生成赛道的长期竞争,未来或取决于大模型理解硬件架构、推演访存瓶颈、自主迭代调参的综合智能水平。长远来看,伴随大模型能力升级,模型侧与编译层在算力优化方面将形成持续双向反馈,硬件规格、算子实现、模型架构三者协同演进可能会成为常态。


登录后才可以发布评论哦
打开小程序可以发布评论哦