2026年9月17日星期四
AI 基础设施 · 新闻与分析
首页芯片与硬件报道
芯片与硬件 · 报道

英伟达Vera Rubin NVL72系统在MLPerf Inference v6.1基准测试中首次亮相即取得领先性能,凸显了高效的基础设施扩展与持续的软件优化。

这验证了Vera Rubin架构的推理经济效益,并为超大规模企业和新云GPU集群树立了新的性能基准。
官方披露Slicast · 2026年9月16日 UTC 15:00 · 美国 · 来源: NVIDIA Blog
重要度 85

统性能、高效的基础设施扩展以及持续的软件优化是决定 AI 推理经济性的关键杠杆。更高的系统性能意味着生成更多的 token,从而带来更高的收入。高效的扩展确保吞吐量随新增硬件成比例增长,从而最大限度地降低大规模服务用户的资源需求。持续的优化则最大化了基础设施投资的回报。

支撑这三大因素的是平台的通用性:单一基础设施可以运行任何模型或工作负载——从训练到推理,从推荐系统到推理模型,从语言模型到视频模型——从而保持利用率始终处于高位。

NVIDIA 平台专为在这三个方面实现优化而设计,这一点通过今天发布的 MLPerf Inference v6.1 结果得到证实:

**NVIDIA Vera Rubin NVL72 以领先性能首次亮相:** 在首次提交 MLPerf Inference 预览结果中,Vera Rubin NVL72 的吞吐量比 GB300 NVL72 高出高达 3.7 倍。

**NVIDIA GB300 NVL72 以领先效率实现扩展:** 一项涵盖四个 GB300 NVL72 机架(共 288 个 GPU)的提交实现了 99% 的扩展效率,吞吐量从单机架基线开始几乎呈线性增长。

**持续的软件优化推动性能提升:** 与 v6.0 相比,NVIDIA 在 MLPerf Inference v6.1 提交中的软件增强功能带来了高达 1.6 倍的性能提升。这些优化超出了 v6.1 的提交截止日期,带来了额外的性能增益。

对于正在评估 AI 基础设施的组织而言,性能、扩展效率和软件迭代速度是决定长期推理经济性的关键因素。

**Vera Rubin NVL72 以领先性能首次亮相 MLPerf Inference**

NVIDIA 在 MLPerf Inference v6.1 套件中最具挑战性的两个基准测试中提交了 Vera Rubin NVL72 的预览结果:DeepSeek-R1 和 Qwen3-VL。

在 Qwen3-VL 基准测试中,借助采用 NVIDIA Dynamo 开源推理框架的 vLLM,Vera Rubin NVL72 在离线、服务器和交互场景中实现的吞吐量比 GB300 NVL72 高出高达 3.7 倍。在利用 NVIDIA TensorRT-LLM 库的 DeepSeek-R1 基准测试中,其吞吐量比 GB300 NVL72 高出高达 2.5 倍。这些初步结果凸显了 NVIDIA 加速的创新周期,并展示了持续的软件优化如何进一步提升性能。

MLPerf Inference v6.1,封闭组。结果于 2026 年 9 月 16 日从 www.mlcommons.org 获取。NVIDIA 平台结果来自以下条目:6.1-0106 和 6.1-0074。MLPerf 名称和标志是 MLCommons Association 在美国和其他国家的注册和非注册商标。保留所有权利。严禁未经授权使用。有关更多信息,请访问 www.mlcommons.org。

这转化为切实的业务成果:每个 Vera Rubin NVL72 机架相比 GB300 NVL72 机架能交付显著更多的 token,服务更多用户,并产生更高收入,同时降低了每个 token 的成本。

这些结果反映了硬件和软件的全栈协同设计。Vera Rubin 增强的 Tensor Cores 和 Transformer Engine 加速了推理的预填充(prefill)和解码(decode)阶段。此外,NVFP4 精度减少了模型权重、注意力机制和 KV 缓存的内存占用,在几乎不影响输出质量的情况下提升了吞吐量。

Vera Rubin 的提交大量采用了分离式服务(disaggregated serving),将预填充和解码工作负载解耦,并结合大规模专家并行(expert parallelism)。这种方法最大限度地提高了为 DeepSeek-R1 和 Qwen3-VL 等模型提供动力的混合专家(MoE)层的效率。

NVL72 的规模扩展域提供了使这些技术在机架规模上有效的互连基础。由第六代 NVIDIA NVLink 和 NVLink Switch 驱动,其数据包速率比现成以太网高 10 倍,延迟低 3 倍。

这种协同设计理念延伸至 NVIDIA 的合作伙伴生态系统;Nebius 也提交了 Vera Rubin NVL72 的预览结果,展现了强劲的性能。

AI 智能体——能够在多个步骤中进行推理、规划和执行——正在重塑对推理性能的衡量方式。在设计用于捕捉这一演变的基准测试中,如 SemiAnalysis AgentX,Vera Rubin NVL72 在预览测试期间比 GB300 NVL72 提供了 30 倍更好的性能。此外,即将推出的 MLPerf Endpoints 基准测试将为智能体推理工作负载引入标准化测量,将评估范围扩展到传统的吞吐量指标之外。

**NVIDIA GB300 NVL72 以领先效率实现扩展**

扩展效率——即额外 GPU 转化为吞吐量增益的有效性——是 AI 基础设施生产力的关键指标。NVIDIA 通过在单个机架内实现高带宽、低延迟的规模扩展互连,在机架之间实现高带宽网络,并在节点间高效编排请求来实现这一目标。

在其 DeepSeek-R1 (DSR1) 提交中,NVIDIA 从一个 GB300 NVL72 机架(72 个 GPU)扩展到四个机架(288 个 GPU),在离线场景中实现了 99% 的扩展效率。吞吐量增加与新增硬件几乎成正比。

MLPerf Inference v6.1,封闭组。结果于 2026 年 9 月 16 日从 www.mlcommons.org 获取。NVIDIA 平台结果来自以下条目:6.1-0073 和 6.1-0074。MLPerf 名称和标志是 MLCommons Association 在美国和其他国家的注册和非注册商标。保留所有权利。严禁未经授权使用。有关更多信息,请访问 www.mlcommons.org。

扩展效率至关重要,因为增加 GPU 数量并不会自动带来成比例的吞吐量增益。如果 GPU 数量翻倍仅带来个位数的性能提升,基础设施成本将远远超过性能回报。因此,架构、互连和软件必须同步扩展。

GB300 NVL72 在 WAN 2.2 文本到视频基准测试中也展现了机架规模的效率,每秒生成 0.65 个 720p 视频,每个视频耗时 5.7 秒。与单个节点相比,这代表了 9 倍的吞吐量和 7.5 倍的延迟降低。

**软件优化推动持续增益**

NVIDIA 平台 undergoes 持续的软件开发, consistently 提供性能和功能增强。

在 v6.1 中,与 v6.0 的结果相比,GB300 NVL72 在 Qwen3-VL 上的性能提升了高达 1.6 倍。这些增益得益于更低的 KV 缓存精度、扩展的内核融合、优化的内核以及通过 vLLM 和 NVIDIA Dynamo 实现的分离式服务。

软件优化工作超出了 v6.1 的提交截止日期。GPT-OSS-120B 和 DLRMv3 的未验证提交后结果显示了额外的性能增益。

**全规模的 AI 推理**

除了 Grace Blackwell 和 Vera Rubin NVL72 平台结果外,NVIDIA 还提交了 Jetson AGX Thor 的性能数据。在新推出的 Edge-Agentic 基准测试中使用 Qwen3.6-27B 和 NVIDIA TensorRT Edge-LLM,该边缘设备展现了强大的能力。

NVIDIA 合作伙伴生态系统广泛参与,19 家合作伙伴——其中八家运营多节点 Blackwell NVL72 系统——展现了强劲的性能。参与的合作伙伴包括 ASUS、Azure、Cisco、CoreWeave、Crusoe、Dell Technologies、Fujitsu、Giga Computing、HPE、Inventec、Lambda、MiTAC Computing、Nebius、Oracle Cloud Infrastructure、Quanta Cloud Technology、Red Hat、ScitiX、Supermicro 和 Wiwynn。

从紧凑的边缘设备到最大的 AI 工厂,NVIDIA 继续在整个技术堆栈中推进性能。这一进展由每年新平台架构的节奏、不断演进的软件以及旨在规模化交付解决方案的生态系统所驱动。

了解更多关于 NVIDIA Vera Rubin 平台的信息。

阅读原文
英伟达Vera Rubin NVL72系统在MLPerf Inference… · Slicast