星途科讯 7小时前
英伟达Rubin GPU细节曝光:NVFP4推理达50 PFLOPS
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

英伟达(Nvidia)透露,其 Vera Rubin 平台将于今年秋季正式交付。随着 AI 行业重心从前沿模型训练转向大规模 Agent AI 推理,该平台旨在解决生成 Token 的高需求与低成本交付之间的平衡问题。除了此前披露的 Vera CPU 性能数据外,英伟达今日进一步公布了 Rubin 架构在提升 GPU 级至数据中心级推理效率方面的新特性。

完整的 Vera Rubin NVL72 机架系统包含 36 颗 Vera CPU 和 72 颗 Rubin GPU。Rubin GPU 通过高带宽接口将两个计算芯片封装在一起,拥有 224 个流多处理器(SM)、896 个 Tensor Core,配备 288GB HBM4 内存,带宽高达 22 TB/s。作为专注推理的加速器,其在稀疏精度下的 NVFP4 推理吞吐量达到 50 PFLOPS。

优化 MoE 模型管理与矩阵运算

针对混合专家(MoE)架构日益普及的趋势,Rubin 改进了张量内存加速器(TMA)。相比 Blackwell 需在内存中维护单独的 MoE 描述符,Rubin 支持在运行时直接在 TMA 指令中维护统一的 MoE 描述符,降低了元数据计算开销和数据移动成本,从而释放更多 GPU 周期用于推理计算。

在矩阵运算方面,Rubin 使 Tensor Core 在 K 维度(矩阵共享内维)上的执行效率翻倍。原本在 Blackwell 上需四次循环迭代完成的计算,在 Rubin 上仅需两次。这一改进显著提升了吞吐量受限、内存受限及延迟受限内核的性能,尤其利好推理过程中的上下文处理和解码阶段。

Softmax 吞吐量大幅提升

为应对长达百万 Token 的上下文长度带来的注意力计算压力,Rubin 大幅提升了特殊功能单元(SFU)中的 Softmax 吞吐量。数据显示,Rubin 在 FP32 指数吞吐量上保持 Blackwell Ultra 的 2 倍优势,而在 BF16/FP16 指数计算吞吐量上较 Blackwell Ultra 再翻一倍,即相比初代 Blackwell 提升了 4 倍,有效消除了低精度数据类型推理的瓶颈。

细粒度依赖管理与通信优化

Rubin 引入了更细粒度的内核间依赖解析机制。消费者内核无需等待整个批次的生产者内核数据就绪,即可在每个线程块输出可用时立即执行。这种机制提高了 Tensor Core 占用率,降低了内核间延迟,进而提升每秒生成的 Token 数。

在机架级通信方面,Rubin 引入 " 计数写入 "(counted writes)功能,取代了 Blackwell 系统中繁琐的数据存储、内存屏障和原子标志操作。通过接收端 GPU 上的单个写入计数器更新,减少了 NVLink fabric 上的同步流量和延迟,提升了跨 GPU 数据共享的效率。

结合 Vera CPU 在单线程任务上的高性能,以及 Rubin GPU 在推理操作和数据移动能效上的改进,Vera Rubin 系统有望在降低每 Token 推理成本的同时,显著提升机架级和数据中心级的整体性能。

【星途科讯 图文丨欧阳布布 首发于 ZAKER 科技,转载请注明出处】

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

gpu 英伟达 吞吐量 ai 芯片
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论