2026年9月11日星期五
AI 基础设施 · 新闻与分析
首页芯片与硬件报道
芯片与硬件 · 报道

英伟达指出,Vera Rubin NVL72机架每兆瓦可提供高达30倍的Agentic AI吞吐量,并将Token成本降低35%。

这些效率提升直接改善了GPU云运营商的经济模型,使多吉瓦级园区部署能够实现更高的利用率与更快的投资回报周期。
行业媒体Slicast · 2026年8月25日 · 美国 · 来源: Pulse 2.0
重要度 90

伟达(NVIDIA)表示,其Vera Rubin NVL72平台在每兆瓦的代理式AI推理吞吐量方面比GB300 NVL72高出多达30倍,同时将每百万令牌的运行成本降低了多达35倍。

这些性能提升旨在解决迅速浮现的基础设施瓶颈:AI智能体消耗的算力远超传统聊天机器人交互。根据英伟达引用的OpenRouter数据,代理式工作负载所需的令牌数量约为标准聊天查询的15倍。

与传统模型仅根据单个提示生成响应不同,AI智能体会迭代查询数据库、搜索文档、调用工具、生成子智能体、分析输出结果,并持续进行推理直至任务完成。每一步都会向会话中追加新的上下文,可能导致单个智能体的运行输入令牌数扩展至数十万。

随着企业大规模部署代理式应用程序,这种操作模式凸显了长上下文处理、内存管理和令牌生成效率的重要性。

英伟达使用SemiAnalysis AgentX工作负载对Vera Rubin NVL72进行了基准测试,该工作负载保留了真实的代理式编码会话——包括真实的上下文扩展、工具调用和子智能体生成。在运行DeepSeek V4 Pro模型时,该平台实现了比GB300 NVL72高出多达30倍的每兆瓦吞吐量。

这些初步基准测试结果目前仍待SemiAnalysis独立审查,且暂未包含用于工具调用操作的Vera CPU性能数据。

英伟达上一代Blackwell平台已证明,在类似工作负载下可实现显著的能效提升。在运行DeepSeek V4 Pro时,GB300 NVL72的每兆瓦吞吐量比Hopper架构高出多达15倍。

Vera Rubin将这些能效提升扩展到整个性能曲线。英伟达指出,对于受电力限制的数据中心,增强的每兆瓦吞吐量比率使运营商能够在现有电力容量内运行显著更多的代理式工作负载。

随着电力供应成为新AI基础设施的主要制约因素,这些经济优势变得至关重要。英伟达还确认,与GB300 NVL72相比,Vera Rubin NVL72将每百万令牌的运行成本降低了多达35倍。

降低的令牌成本使得在软件开发、客户支持、财务分析和研究等扩展推理工作流中持续运行智能体在经济上可行。英伟达通过涵盖GPU、网络、内存架构、推理软件和工作负载编排的跨层协同设计实现了这些收益。

关键架构技术包括解耦服务,它将上下文处理(预填充)与响应生成(解码)分离,以实现独立扩展。速率匹配随后同步预填充和解码GPU的速度,以最大化利用率。对于混合专家模型,大规模专家并行性将各个专家网络分布在NVL72的规模扩展域中。

分布式KV缓存扩大了GPU域内的可用内存,而KV缓存卸载则将非活跃上下文转移到主机内存或存储中,从而消除了重新计算先前处理数据的需求。此外,KV感知路由将传入请求定向到已持有相关缓存上下文的GPU,从而在漫长的智能体会话期间最大限度地减少冗余计算。

融合CUDA内核(包括MegaMoE)合并了计算和GPU间通信任务,使处理器在数据传输期间保持充分利用而非空闲状态。

Rubin GPU配备了增强型第五代Tensor Core和英伟达第三代Transformer Engine,以加速预填充和解码阶段。据英伟达称,NVFP4量化将模型权重压缩至4位精度,在保持输出保真度的同时降低了内存需求并提高了吞吐量。

NVL72架构采用了大型GPU域工程,旨在支持专家并行性和分布式KV缓存所需的高带宽、低延迟通信。英伟达报告称,其第六代NVLink和NVLink Switch技术提供的数据包传输率比商用以太网替代品高10倍,延迟低三倍。

该硬件与英伟达全面的推理软件堆栈集成,其中包括优化的CUDA内核、TensorRT LLM以及NVIDIA Dynamo服务框架。

先进的电源管理进一步支持了这一效率策略。英伟达的DSX MaxLPS技术在GPU、机架和工作负载层级之间协调电力分配,使运营商能够在相同的兆瓦预算内配置多达40%的额外GPU。

Vera Rubin不仅仅是一次GPU迭代,而是被构建为一个七芯片AI工厂平台。完整的生态系统包括NVIDIA Vera CPU、Groq 3 LPU、Rubin GPU、NVLink 6 Switch、BlueField-4 DPU、Spectrum-6 SPX和ConnectX-9 SuperNIC。

英伟达确认,Vera Rubin已进入全面生产阶段,并正在其硬件和基础设施合作伙伴网络中积极扩展。

随着代理式AI从实验性试点转向大规模生产,英伟达正将行业焦点转向每兆瓦吞吐量和令牌成本作为主要性能指标,摆脱对传统单次请求推理基准测试的依赖。

感谢您访问Pulse 2.0。我们每天努力工作,为您这样的领导者和决策者提供关于商业、金融、资本市场、交易流、法律、科技和人工智能的最新情报。点击此处订阅Pulse 2.0通讯。

阅读原文