2026年9月15日星期二
AI 基础设施 · 新闻与分析
首页芯片与硬件报道
芯片与硬件 · 报道

Nvidia的Blackwell B200在MLPerf基准测试中使用FP4精度比H100性能提升4倍。

展示GPU性能的重大代际进步,使基础设施每单位占地面积能承载更密集的AI工作负载。
行业媒体Slicast · 2024年8月28日 UTC 12:00 · 全球 · 来源: tomshardware.com
重要度 85

Nvidia 发布了其 Blackwell B200 处理器的首批 MLPerf 4.1 结果,展示单个 Blackwell GPU 的性能可达其基于 Hopper 架构的 H100 前代产品的四倍。根据 Nvidia 的结果,B200 在单个 GPU 的服务器推理测试中达到每秒 10,755 个 token,在离线参考测试中达到每秒 11,264 个 token。公开的 MLPerf Llama 2 70B 基准测试结果显示,4 路 Hopper H100 机器的性能相似,支持了 Nvidia 的说法,即单个 Blackwell 处理器比单个 Hopper H100 GPU 快约 3.7X–4X。然而,多个重要的注意事项影响了这一比较的有效性。

两个处理器之间的性能差异源于多个技术因素。最重要的是,Nvidia 的 Blackwell 处理器在其第五代 Tensor Core 中使用 FP4 精度,而基于 Hopper 架构的 H100 仅支持并使用 FP8。尽管 MLPerf 指南允许这些不同的格式,但 Blackwell 中的 FP4 性能是其 FP8 吞吐量的两倍,代表了比较中的根本性优势。此外,Nvidia 将单个 B200 与四个 H100 GPU 进行了比较,这种配对在某种程度上不公平,因为扩展永远不能完美,单个 GPU 的结果往往代表了单 GPU 性能的最佳情况。

架构差异还延伸到内存规格和容量。测试的 B200 GPU 配有 180GB 的 HBM3E 内存,而 H100 SXM 拥有 80GB 的 HBM(某些配置中高达 96GB),H200 拥有 96GB 到 144GB 的 HBM3E 内存。在测试配有 96GB HBM3 内存的单个 H200 时,它在离线模式下仅实现每秒 3,114 个 token,而配有更大内存的单个 H200 实现了每秒 4,488 个 token。这意味着 B200 相比 H200 仅快 2.5 倍,比 Nvidia 的标题宣称有更为温和的提升。

配有 141GB HBM3E 内存的 H200 不仅在采用 Llama 2 70B 的生成式 AI 基准测试中表现出色,而且在数据中心类别中的每项测试中都表现出色,在利用更大内存容量的测试中获益匪浅。值得注意的是,Nvidia 仅在 MLPerf 4.1 中分享了 B200 针对 Llama 2 70B 生成式 AI 基准测试的性能数据,而 MLPerf 4.1 总共包含九个核心学科。这种有限的披露是否反映了正在进行的调优工作或其他因素仍不清楚,但 Blackwell B200 在其他八个测试类别中的完整能力仍然未知。

阅读原文
Nvidia的Blackwell… · Slicast