英伟达RubinGPU细节曝光:NVFP4推理达50PFLOPS

博主:fm5i0dxdb2j0考研资深辅导 2026年07月22日 10:03:21

英伟达RubinGPU细节曝光:NVFP4推理达50PFLOPS

英伟达(Nvidia)透露,其 Vera Rubin 平台将于今年秋季正式交付。随着 AI 行业重心从前沿模型训练转向大规模 Agent AI 推理,该平台旨在解决生成 Token 的高需求与低成本交付之间的平衡问题。除了此前披露的 Vera CPU 性能数据外,英伟达今日进一步公布了 Rubin 架构在提升 GPU 级至数据中心级推理效率方面的新特性。

完整的 Vera Rubin NVL72 机架系统包含 36 颗 Vera CPU 和 72 颗 Rubin GPU。Rubin GPU 通过高带宽接口将两个计算芯片封装在一起,拥有 224 个流多处理器(SM)、896 个 Tensor Core,配备 288GB HBM4 内存,带宽高达 22 TB/s。作为专注推理的加速器,其在稀疏精度下的 NVFP4 推理吞吐量达到 50 PFLOPS。

优化 MoE 模型管理与矩阵运算

针对混合专家(MoE)架构日益普及的趋势,Rubin 改进了张量内存加速器(TMA)。相比 Blackwell 需在内存中维护单独的 MoE 描述符,Rubin 支持在运行时直接在 TMA 指令中维护统一的 MoE 描述符,降低了元数据计算开销和数据移动成本,从而释放更多 GPU 周期用于推理计算。

在矩阵运算方面,Rubin 使 Tensor Core 在 K 维度(矩阵共享内维)上的执行效率翻倍。原本在 Blackwell 上需四次循环迭代完成的计算,在 Rubin 上仅需两次。这一改进显著提升了吞吐量受限、内存受限及延迟受限内核的性能,尤其利好推理过程中的上下文处理和解码阶段。

Softmax 吞吐量大幅提升

为应对长达百万 Token 的上下文长度带来的注意力计算压力,Rubin 大幅提升了特殊功能单元(SFU)中的 Softmax 吞吐量。数据显示,Rubin 在 FP32 指数吞吐量上保持 Blackwell Ultra 的 2 倍优势,而在 BF16/FP16 指数计算吞吐量上较 Blackwell Ultra 再翻一倍,即相比初代 Blackwell 提升了 4 倍,有效消除了低精度数据类型推理的瓶颈。

细粒度依赖管理与通信优化

Rubin 引入了更细粒度的内核间依赖解析机制。消费者内核无需等待整个批次的生产者内核数据就绪,即可在每个线程块输出可用时立即执行。这种机制提高了 Tensor Core 占用率,降低了内核间延迟,进而提升每秒生成的 Token 数。

在机架级通信方面,Rubin 引入 " 计数写入 "(counted writes)功能,取代了 Blackwell 系统中繁琐的数据存储、内存屏障和原子标志操作。通过接收端 GPU 上的单个写入计数器更新,减少了 NVLink fabric 上的同步流量和延迟,提升了跨 GPU 数据共享的效率。

结合 Vera CPU 在单线程任务上的高性能,以及 Rubin GPU 在推理操作和数据移动能效上的改进,Vera Rubin 系统有望在降低每 Token 推理成本的同时,显著提升机架级和数据中心级的整体性能。

【星途科讯 图文丨欧阳布布 首发于 ZAKER 科技,转载请注明出处】

The End