英伟达在MLPerf 6.1中凭借Blackwell及其首次提交的Vera Rubin保持强劲地位,AMD则对512个MI355X GPU集群进行了基准测试,英特尔也提交了Arc Pro和Xeon。
MLCommons 发布了 MLPerf Inference v6.1,其工作流套件与当前人工智能行业趋势保持一致。按照惯例,AMD、NVIDIA 和 Intel 提交了其最新硬件架构的测试结果,在多项基准测试中展示了具有竞争力的性能表现。
在 DeepSeek R1 工作负载方面,AMD 提交了其有史以来规模最大的集群配置,使用了 512 块 Instinct MI355X GPU。该设置在离线(offline)和服务器(server)用例中均领先性能。NVIDIA 的 GB300 和 GB200 架构以 288-GPU 配置进行评估,其中 GB300 的性能与 MI355X 平台 closely matching(紧密匹配)。值得注意的是,这是 NVIDIA Vera Rubin (VR200) 架构首次出现在基准测试套件中,分别以 72-GPU 和 36-GPU 配置进行了测试。72-GPU Vera Rubin 设置的吞吐量比同等规模的 72-GPU GB300 配置高出高达 95%,而 36-GPU 变体则优于 72-GPU GB200 设置。这些早期预览结果表明性能有显著提升,随着部署范围的扩大,预计将提供更多关于 Vera Rubin 的数据。
在 GPT-OSS 120B 方面,AMD 再次部署了其 512-GPU MI355X 集群,在离线和服务器场景中均占据领先地位。NVIDIA 的 GB300 “Grace Blackwell Ultra” 配置在 72-GPU 和 8-GPU 细分市场中领先。AMD 较新的 MI350P 架构在 8-GPU 设置中也显示出相比 MI300X 的性能提升。Intel 凭借 Arc Pro B70 取得了显著进展,同时 NVIDIA 的 RTX PRO 系列也在 8-GPU 和 4-GPU 配置下接受了评估。
在 Llama 2 70B 基准测试中,NVIDIA 的 Blackwell GPU 主导了 72-GPU 细分市场。GB300 在 8-GPU 配置中也超越了 AMD 的 MI355X,尽管 Instinct 平台仍快于 GB200 Blackwell 解决方案。工作站级硬件持续获得关注,AMD 的 MI350P、NVIDIA 的 RTX PRO 系列以及 Intel 的 Arc Pro 均表现出色,凸显了非数据中心平台在 AI 推理工作负载中日益重要的地位。对于 Llama 3.1-8B,NVIDIA GB300(8-GPU)配置的速度比 AMD MI355X(8-GPU)设置快高达 17%。其他结果突出了在不同 GPU 数量和架构之间的竞争性扩展,包括 Intel Xeon 6 处理器在多插槽配置中的表现。
基准测试发布后,各厂商分享了其提交结果的关键要点:
NVIDIA 表示:“Vera Rubin NVL72 系统首发即展现领先性能:在其首次 MLPerf Inference 预览提交中,NVIDIA Vera Rubin NVL72 的吞吐量比 GB300 NVL72 高出高达 3.7 倍。”他们补充道:“GB300 NVL72 实现领先的扩展效率:跨越四个 GB300 NVL72 机架的 288-GPU 提交实现了 99% 的扩展效率,吞吐量从单机架基线几乎呈线性增长。”关于软件,NVIDIA 指出:“持续的软件优化推动性能提升:NVIDIA 在 MLPerf Inference v6.1 提交中的软件优化带来了比 v6.0 高出高达 1.6 倍的性能。v6.1 提交后的优化仍在继续,带来了进一步的性能提升。”
AMD 强调:“相同的 AMD Instinct MI355X GPU 硬件带来更高性能:在一个 MLPerf 周期内,持续的 AMD ROCm 软件优化提高了 8-GPU GPT-OSS-120B 的吞吐量,降低了 Wan-2.2 的延迟,并用更少的 GPU 提升了集群吞吐量。”他们还报告称:“AMD Instinct MI355X 和 MI350P GPU 实现领先性能:在 8 个 GPU 规模下,AMD Instinct MI355X GPU 在 GPT-OSS-120B 结果中领先于 NVIDIA B200 和 B300,在 72 个 GPU 规模下领先于 NVIDIA GB200 结果。在其首次 MLPerf 轮次中,AMD Instinct MI350P GPU 在选定的 NVIDIA RTX PRO 6000 Server Edition 和 H200 NVL 结果中领先。”在扩展性方面,AMD 指出:“创纪录的令牌吞吐量和生产级推理具备高效扩展能力:在 72 个 GPU 规模下,AMD Instinct MI355X GPU 在 GPT-OSS-120B 上实现了 95% 的扩展效率。此外,Crusoe 在 512 个 GPU 规模下达成了创纪录的聚合令牌吞吐量,在 GPT-OSS-120B 上达到每秒 575 万离线令牌,在 DeepSeek-R1 上达到每秒 290 万。”
Intel 概述道:“关于 Intel Xeon 6 的结果:Intel 将 Xeon 参与 MLPerf v6.1 的范围从 v6.0 中的两个经过基准测试的 Xeon 6 SKU 扩大到五个,使 CPU 推理结果的数量从 24 增加到 35。Intel Xeon 仍然是 MLPerf Inference 提交中唯一代表的独立服务器 CPU。”关于其加速器,Intel 表示:“关于 Intel Arc Pro B70 的结果:Intel Arc Pro B70 的提交扩展了软件改进如何在一系列 AI 模型中延伸性能的方式。一个配置为四块 Intel Arc Pro B70 GPU 的单节点提供 128GB VRAM,并支持在 Llama 3.1 8B、Llama 2 70B、gpt-oss-120B、Whisper 以及端到端检索增强生成(E2E-RAG)方面的提交。在与 v6.0 使用的相同四 GPU 系统中,gpt-oss-120B 服务器性能提升了 36%,离线性能提升了 27%,反映了 Intel 软件栈的持续成熟。”
MLPerf Inference v6.1 描绘了一个高度竞争且快速演变的格局,而非明确的赢家。AMD 的 512-GPU MI355X 集群在极端规模下为 DeepSeek R1 和 GPT-OSS 120B 设定了节奏,而 NVIDIA 的首次 Vera Rubin 预览信号表明了一次巨大的飞跃:72-GPU VR200 系统的吞吐量几乎翻了一番,甚至 36-GPU 配置也超过了 72-GPU GB200。在更常规的 8-GPU 和 72-GPU 规模下,性能各不相同——GB300 经常在 Llama 2 70B 和 Llama 3.1 8B 中领先,AMD 在部分 GPT-OSS 运行中保持竞争力或处于领先地位,而 MI350P alongside RTX PRO 和 Intel Arc Pro B70 证实工作站硬件现在可以直接在企业 AI 推理中竞争。Intel 进一步巩固了 Xeon 作为该套件中唯一独立 CPU 选项的地位。
然而,潜在的核心叙事集中在由软件驱动的加速上。NVIDIA 报告称,自 v6.0 以来通过堆栈优化获得了高达 1.6 倍的性能提升;AMD 在一个基准周期内从相同的 MI355X 硅片中提取了额外的吞吐量;Intel 则在相同硬件上提升了 Arc Pro 的结果。这些数据代表的是快照,而非上限。随着 Vera Rubin 进入生产阶段,以及 ROCm 和 CUDA 生态系统的持续成熟,后续的 MLPerf 轮次不可避免地反映出新基准——这一轨迹完全符合行业预期。
Hassan Mujtaba 是一名受过软件工程师训练的技术爱好者,担任 Wccftech 的高级硬件编辑。凭借丰富的行业经验,他专注于下一代 CPU 和 GPU 架构、主板及散热解决方案的深度技术分析。他的报道涵盖突发科技新闻、动手评测以及全面的基准测试。请在 Google News 上关注 Wccftech 以获取持续报道。