2026年9月18日星期五
AI 基础设施 · 新闻与分析
首页头条报道
头条 · 报道

NVIDIA Vera Rubin NVL72系统在首次提交MLPerf Inference v6.1测试时,推理吞吐量较NVIDIA GB300 NVL72提升高达3.7倍。

这一性能飞跃验证了英伟达下一代硅片路线图,并为超大规模企业的推理集群采购规格设定了新基准。
行业媒体Slicast · 2026年9月17日 UTC 13:17 · 全球 · 来源: HPCwire
重要度 85

2026年9月17日——系统性能、高效的基础设施扩展以及持续的软件优化是决定AI推理经济性的主要杠杆。更高的系统性能意味着生成更多的令牌(tokens),这直接转化为更高的收入。高效的扩展确保随着硬件的增加,吞吐量成比例增长,从而最大限度地减少大规模服务用户所需的资源。持续的优化则最大化了基础设施投资所提取的价值。支撑这三者的基础是平台的通用性:同一基础设施可以运行任何模型和工作负载——涵盖从训练到推理、推荐系统到推理、语言到视频等领域——从而保持高利用率。

NVIDIA平台专为在这些维度上进行优化而设计,这一点通过今天发布的MLPerf Inference v6.1结果得到证明。在首次提交MLPerf Inference预览结果中,NVIDIA Vera Rubin NVL72的吞吐量比GB300 NVL72高出高达3.7倍。与此同时,由四个GB300 NVL72机架组成的288个GPU提交方案实现了99%的扩展效率,其吞吐量从单机架基线开始几乎呈线性增长。此外,NVIDIA在MLPerf Inference v6.1提交中的软件优化带来了比v6.0高出高达1.6倍的性能提升,且在提交后还实现了进一步的增益。对于做出AI基础设施决策的组织而言,性能、扩展效率和软件速度仍然是塑造长期推理经济性的关键考量因素。

NVIDIA在MLPerf Inference v6.1套件中最具挑战性的两个基准测试中提交了Vera Rubin NVL72的预览结果:DeepSeek-R1和Qwen3-VL。在Qwen3-VL测试中,使用vLLM结合NVIDIA Dynamo开源推理框架,Vera Rubin NVL72在离线、服务器和交互场景下的吞吐量比GB300 NVL72高出高达3.7倍。在DeepSeek-R1测试中,利用NVIDIA TensorRT-LLM库,吞吐量比GB300 NVL72高出高达2.5倍。这些早期结果凸显了NVIDIA加速创新的步伐,并展示了如何通过持续的软件优化不断提升性能。因此,每个Vera Rubin NVL72机架相比GB300 NVL72机架能生成更多令牌、服务更多用户并产生更高收入,同时降低每令牌的成本。

这一性能反映了硬件与软件的全栈协同设计。Vera Rubin增强的Tensor Cores和Transformer Engine加速了推理的预填充(prefill)和解码(decode)阶段,而NVFP4精度减少了模型权重、注意力机制和KV缓存的内存占用,在输出质量损失极小的情况下提高了吞吐量。Vera Rubin的提交大量利用了分离式服务(disaggregated serving),将预填充和解码分离,并结合大规模专家并行技术,以最大化对驱动DeepSeek-R1和Qwen3-VL等模型的混合专家(MoE)层的效率。由第六代NVIDIA NVLink和NVLink Switch支持的NVL72规模扩展域,提供了比现成以太网高10倍的包速率和低3倍的延迟,为这些技术在机架规模下有效运作提供了互连基础。这种协同设计延伸至NVIDIA的合作伙伴生态系统;Nebius也提交了Vera Rubin NVL72的预览结果,并展示了卓越的性能。

AI代理能够在多个步骤中进行推理、规划和行动,正在重塑推理性能的衡量方式。在旨在捕捉这一转变的基准测试中,如SemiAnalysis AgentX,Vera Rubin NVL72在预览测试中比GB300 NVL72表现出30倍更好的性能。此外,即将推出的MLPerf Endpoints基准测试将为代理推理工作负载引入标准化测量,超越传统吞吐量基准所能捕捉的范围。

扩展效率——即额外的GPU转化为吞吐量增益的有效性——是衡量AI基础设施生产力的关键指标。NVIDIA通过在单个机架内实现高带宽、低延迟的规模扩展互连,在机架之间实现高带宽网络,并在节点间高效协调请求来实现这一目标。NVIDIA的DeepSeek-R1(DSR1)提交方案从一个GB300 NVL72机架(72个GPU)扩展到四个机架(288个GPU),在离线场景中实现了99%的扩展效率。吞吐量几乎与增加的硬件成比例增长。扩展效率至关重要,因为增加更多GPU并不自动带来成比例的吞吐量增益。如果GPU数量翻倍仅带来个位数的性能提升,基础设施成本将远远超过性能回报。架构、互连和软件必须同步扩展。GB300 NVL72在WAN 2.2文本到视频基准测试中也展示了机架规模的效率,达到每秒0.65个720p视频,每个视频耗时5.7秒,相比单个节点实现了9倍更高的吞吐量和7.5倍更低的延迟。

NVIDIA平台 undergoes continuous software development, delivering ongoing performance and feature improvements. 在v6.1版本中,GB300 NVL72在Qwen3-VL上的性能相比v6.0的结果提升了高达1.6倍。这些增益是通过降低KV缓存精度、增加内核融合、优化内核以及与vLLM和NVIDIA Dynamo结合的分离式服务实现的。软件优化在v6.1提交截止日期之后仍在继续。提交后的结果(尚未获得MLCommons验证)显示,在GPT-OSS-120B和DLRMv3上进一步提升了性能。

除了NVIDIA Grace Blackwell和Vera Rubin NVL72平台的结果外,NVIDIA还在新推出的Edge-Agentic基准测试中使用Qwen3.6-27B和NVIDIA TensorRT Edge-LLM提交了Jetson AGX Thor的结果。NVIDIA合作伙伴生态系统广泛参与,19家合作伙伴——其中八家在多节点Blackwell NVL72系统上——展示了卓越的性能。其中包括ASUS、Azure、Cisco、CoreWeave、Crusoe、Dell Technologies、Fujitsu、Giga Computing、HPE、Inventec、Lambda、MiTAC Computing、Nebius、Oracle Cloud Infrastructure、Quanta Cloud Technology、Red Hat、ScitiX、Supermicro和Wiwynn。从紧凑型边缘设备到最大的AI工厂,NVIDIA继续通过每年更新的平台架构、持续改进的软件以及旨在规模化交付的生态系统,在全技术栈范围内推进性能。

阅读原文
NVIDIA Vera Rubin NVL72系统在首次提交MLPerf Inference… · Slicast