英伟达 Vera Rubin NVL72 已公布首批 MLPerf 推理预览结果。
2026年9月16日,英伟达(NVIDIA)发布了其MLPerf Inference v6.1的提交结果,其中最受关注的是其Vera Rubin NVL72系统的首次预览提交。该公司报告称,在Qwen3-VL基准测试中,该平台的吞吐量比GB300 NVL72系统高出多达3.7倍。
MLPerf Inference: Datacenter是机器学习共同体协会(MLCommons Association)的一套基准测试套件,旨在衡量系统使用训练好的模型处理输入并生成输出的速度。根据MLCommons发布的定义,英伟达用于展示主要数据的“封闭组”(Closed division)要求参与者使用与参考实现相同的模型,从而实现硬件平台和软件框架之间的公平比较。“预览可用性”类别中列出的系统必须在下一轮提交时已具备商业可用性。
英伟达在v6.1套件中最具挑战性的两个基准测试——DeepSeek-R1和Qwen3-VL上提交了Vera Rubin NVL72的预览结果。在Qwen3-VL测试中,借助vLLM以及英伟达开源的Dynamo推理框架,该平台在离线、服务器和交互式场景下的吞吐量比GB300 NVL72高出多达3.7倍。对于使用英伟达TensorRT-LLM库的DeepSeek-R1测试,Vera Rubin NVL72的吞吐量比GB300 NVL72高出多达2.5倍。
这些来自mlcommons.org于2026年9月16日发布的封闭组数据,对应提交条目6.1-0106和6.1-0074。英伟达表示,这些性能提升使得每个Vera Rubin NVL72机柜相比GB300 NVL72机柜能够生成更多的token、服务更多的用户并创造更高的收入,同时降低每个token的成本。Nebius也在同一轮中提交了Vera Rubin NVL72的预览结果,英伟达对此评价为展现了卓越的性能。
英伟达将这些成果归功于全栈软硬件协同设计。该公司指出,Vera Rubin增强的Tensor Cores和Transformer Engine加速了推理的预填充(prefill)和解码(decode)阶段。此外,NVFP4精度减少了模型权重、注意力机制和KV缓存的内存占用,从而在不显著影响输出质量的前提下提升了吞吐量。
这些提交利用了分离式服务技术,该技术将预填充和解码阶段解耦,并在支持DeepSeek-R1和Qwen3-VL等模型的混合专家(MoE)层中实现了大规模专家并行。英伟达强调,基于第六代NVLink和NVLink Switch技术构建的NVL72扩展域,提供了比标准以太网高10倍的包速率和低3倍的延迟,为机柜规模的这些技术提供了必要的互连基础。
英伟达还报告称,在专门用于评估智能体工作负载的SemiAnalysis AgentX基准测试的预览测试中,Vera Rubin NVL72的表现比GB300 NVL72高出30倍。该公司补充道,即将推出的MLPerf Endpoints基准测试将为智能体推理任务引入标准化测量,捕捉传统吞吐量基准无法涵盖的能力。
在同一轮提交中,英伟达将其DeepSeek-R1工作负载从单个包含72个GPU的GB300 NVL72机柜扩展到总共288个GPU的四个机柜。这种配置在离线场景下实现了99%的扩展效率,吞吐量随硬件增加几乎呈线性增长(提交条目6.1-0073和6.1-0074)。在WAN 2.2文本到视频基准测试中,GB300 NVL72每秒生成0.65个720p分辨率的视频,每个视频耗时5.7秒。英伟达指出,这代表比单个节点高出9倍的吞吐量和低7.5倍的延迟。
英伟达还报告称,GB300 NVL72在Qwen3-VL上的性能在v6.1版本中较v6.0版本提升了多达1.6倍,并将这一提升归因于KV缓存精度的降低、额外的内核融合、优化的内核以及通过vLLM和NVIDIA Dynamo实现的分离式服务。优化工作延续至v6.1提交截止日期之后,在GPT-OSS-120B和DLRMv3上取得了进一步的性能提升。这些截止后的结果尚未得到MLCommons的验证。
除了机柜级平台外,英伟达还在新推出的Edge-Agentic基准测试中使用TensorRT Edge-LLM库和Qwen3.6-27B模型提交了Jetson AGX Thor的结果。共有19家合作伙伴参与了本轮测试,其中包括八家在多节点Blackwell NVL72系统上提交结果的厂商:ASUS、Azure、Cisco、CoreWeave、Crusoe、Dell Technologies、Fujitsu、Giga Computing、HPE、Inventec、Lambda、MiTAC Computing、Nebius、Oracle Cloud Infrastructure、Quanta Cloud Technology、Red Hat、ScitiX、Supermicro和Wiwynn。
MLCommons在其基准测试页面上注明,发布的结果可能在初始发布后被修改或失效,所有调整均记录在其官方变更日志中。
Theo Nash是Unite.AI的人工智能生成专家,专注于AI基础设施、计算能力以及支撑现代人工智能的硬件系统。他的报道侧重于大规模AI工作负载背后的技术基础,包括数据中心、加速器、网络以及整合它们的软件栈。凭借分析和工程驱动的视角,Nash考察了GPU、定制硅片、内存架构和分布式系统的进步如何推动新一代AI模型的发展。他强调性能权衡、能源效率、可扩展性以及塑造现实世界AI基础设施部署的实际约束。所有由Theo Nash撰写的文章均为人工智能生成,随后由Unite.AI编辑团队进行审查,以确保技术准确性、清晰度以及对快速演变的AI计算格局的负责任报道。