快科技 7 月 23 日消息,英伟达官方发布了 Rubin GPU 架构技术详解,这也是英伟达即将推出的 Vera Rubin 平台的核心计算单元。
根据官方公布的数据,在单位能耗下,Rubin NVL72+Vera CPU 的 Agentic AI 推理吞吐量,相比 Blackwell NVL72+x86 CPU 提升最高可达 10 倍。
Vera Rubin 平台相比 Blackwell 的 10 倍智能体推理性能提升
完整的 Vera Rubin NVL72 机架由 36 个 Vera CPU 和 72 个 Rubin GPU 组成,有关 Vera CPU 我们已经介绍过,今天的重点是 Rubin GPU。
整体来看,Rubin GPU 采用台积电 3nm N3P 制程工艺,由两颗计算芯粒组成,通过 NVIDIA 高速片间互联接口 NV-HBI 统一在单个封装上。
整颗芯片集成 3360 亿个晶体管,拥有 224 个 SM 流处理器和 896 个 Tensor Core 张量核心,搭载第三代 Transformer 引擎,可提供最高 50 PF 的 NVFP4 推理性能。
Rubin GPU 芯片架构框图
显存方面,Rubin 集成最高 288GB HBM4,共配置 8 组 12-Hi 堆叠,峰值带宽达 22TB/s,相比 Blackwell 和 Blackwell Ultra 提升 2.8 倍。
Rubin 内存带宽相比 Blackwell 提升 2.8 倍
此外,第六代 NVLink 提供 3600GB/s 扩展带宽用于 GPU 间全互联通信,NVLink-C2C 提供 1800GB/s 用于 CPU-GPU 一致性通信,PCIe Gen6 x16 提供 256GB/s 主机连接。
针对当前主流 MoE(混合专家)模型的扩展瓶颈,Rubin 增强了 Tensor Memory Accelerator(TMA),通过优化描述符管理机制,可更高效地定位和调度专家权重,减少数据搬运开销。
多个内核还可为共享相同布局的张量保留统一描述符,在运行时直接通过 TMA 指令覆盖内存指针和步长等字段,减少元数据管理和数据搬运开销,让更多 GPU 时间用于实际推理计算。
Rubin 简化 MoE 描述符管理机制,右为 Rubin 架构
Rubin 另一项核心升级是 Tensor Core,每时钟周期的 K 维度吞吐量翻倍,意味着更少的循环迭代次数,Blackwell 需要 4 次 K 迭代的 GEMM 运算,Rubin 只需 2 次即可完成,减少了循环开销并提高了 Tensor Core 利用率。
左为 Blackwell,右为 Rubin
长上下文注意力加速是 Rubin 的另一大升级,Rubin 将激活稀疏化与自适应压缩结合,将中间数据加载为 2:4 稀疏格式,仅保存非零数据及对应元数据。
后续 softmax 和第二注意力 GEMM 均可基于非零值运算,同时保持最终输出仍为标准 Dense 格式,在不改变模型接口的前提下减少计算量和数据搬运。
此外,Rubin 还提升了 Softmax 及指数运算性能,FP32 吞吐达到 GB300 水平,是 GB200 的 2 倍;BF16/FP16 吞吐相比 GB200 提升 4 倍,相比 GB300 提升 2 倍。
Rubin 自适应压缩稀疏化
在内核间依赖调度方面,Rubin 实现了比 Blackwell 更精细的协调,Blackwell 启动允许 Kernel 更早开始工作,但仍需等待激活数据可用。
而 Rubin 支持瓦片级触发,允许后续 Kernel 在所需输入数据准备完成后即可提前启动,不用等待更大范围的工作完成,从而压缩 GPU 时间线中的空闲间隙。
上为 Blackwell 批量触发,下为 Rubin 瓦片级触发
GPU 间通信方面,Rubin 引入了计数写入(Counted Writes)机制用于设备发起的 NVLink 通信。传统 GPU 间数据传输需要额外的协调和同步步骤,计数写入则允许接收端 GPU 更高效地跟踪传输完成状态,减少同步延迟,让计算不必等待同步操作。
通过计数写入加速 NVLink 通信,左为 Blackwell,右为 Rubin
在机架级能效管理上,Vera Rubin NVL72 将计算、网络、液冷、功率调节和智能功率平滑整合为单一执行域。系统通过集成储能模块,可吸收 GPU 瞬时功率波动,平均功耗降低约 10%,50 毫秒峰值功耗降低约 20%。
英伟达还推出 DSX OS 操作系统,其中集成 DSX MaxLPS,可统一管理 GPU、机柜、液冷系统以及 AI 工作负载,可在相同功率预算下多部署最多 40% 的 GPU。
【本文结束】如需转载请务必注明出处:快科技
责任编辑:黑白


登录后才可以发布评论哦
打开小程序可以发布评论哦