NVIDIA Blackwell GPU架构和RTX 50系列性能改进的技术分析。
英伟达在2025年CES期间的编辑日活动上推介了即将推出的RTX 50系列GPU所采用的Blackwell GPU架构,在七场会议中提供了关于核心功能的详细信息。该公司为Blackwell制定了四个主要目标:优化新的神经网络工作负载、降低内存占用、引入新的服务质量功能以及改进能效。尽管许多升级重点关注人工智能和神经渲染技术,但总体架构相比RTX 40系列Ada Lovelace代产品展现出显著但增量式的改进,RTX 5090除外,其GPU芯片面积为744 mm²,相比RTX 4090的608 mm²大幅增加。
虽然性能改进是有意义的,但与以往的代际跃升相比更为温和。RTX 5090提供"高达4,000个AI TOPS"(每秒万亿次操作),而旗舰消费级卡的性能为3,400 TOPS(准确值为3,352)。在相同规格对比中,RTX 5090的FP8性能达到1,676 TFLOPS,相比RTX 4090的1,321 TFLOPS FP8,提升27%。类似地,RTX 5090的FP32性能最高为104.8 TFLOPS,而RTX 4090为82.6 TFLOPS FP32,同样提升27%。这与RTX 4090从RTX 3090升级形成对比,后者的GPU TFLOPS增幅为132%。5090芯片面积大22%,晶体管数量增加21%,两者均采用相同的TSMC 4N工艺节点制造。
从架构角度看,Blackwell引入了多项值得注意的增强。第四代RT核心现在具备Ada两倍的光线三角形相交速率,并支持Mega Geometry,为未来虚幻引擎5游戏的改进提供潜力。英伟达使Blackwell中的所有着色器核心完全兼容FP32/INT32,这与Ada形成对比——后者仅有一半的核心支持INT32操作。GPU着色器已增强以支持神经着色器,允许着色器与张量核心操作更好地混合,着色器执行重新排序(SER)在Blackwell上的速度是Ada上的两倍。Blackwell还标志着首个支持DisplayPort 2.1 UHBR20(80 Gbps)和PCIe 5.0的消费级GPU系列,而视频编码和解码已增强以支持4:2:2视频流。
内存代表着一条重要的升级路径,Blackwell从Ada代的GDDR6和GDDR6X过渡到完整的GDDR7——这是自2018年RTX 20系列以来首次重大内存更新,当时该系列引入了时钟频率为14 Gbps的GDDR6。大多数Blackwell RTX 50系列GPU运行GDDR7的频率为28 Gbps,是原始GDDR6芯片速度的两倍,但仅比高端RTX 40系列GPU中使用的21 Gbps GDDR6X芯片快33%。RTX 5080获得了30 Gbps GDDR7的速度提升,几乎是2080 Super上15.5 Gbps内存速度的两倍。证据表明这种GDDR7过渡可能在整个产品线中是通用的,甚至RTX 5070笔记本电脑GPU也配备了8GB GDDR7。