深度解析英伟达“Rubin”架构:全方位揭秘新一代GPU技术细节与Die注释
8 小时前

英伟达近日深入解析了其最新的Rubin GPU架构,该架构在多机架、多系统及数据中心层面实现了大规模计算的重大突破。作为英伟达技术演进的重要里程碑,Rubin GPU在稀疏NVFP4运算下,计算能力高达50 PetaFLOPS。该架构通过高带宽接口封装两个计算芯片,拥有224个流多处理器和896个Tensor Core,配备288GB HBM4内存,带宽高达22 TB/s。此外,Rubin GPU还改进了张量内存加速器,降低了元数据计算开销和数据移动成本,提升了矩阵运算效率,并大幅提升了特殊功能单元中的Softmax吞吐量,有效消除了低精度数据类型推理的瓶颈。