2026年9月11日星期五
AI 基础设施 · 新闻与分析
首页芯片与硬件报道
芯片与硬件 · 报道

英伟达开发者平台指出,Vera Rubin和Blackwell平台为Agentic AI工作负载确立了新的每瓦性能基准。

更高的能效指标将使运营商能够在现有电力包络内部署更多推理任务,推迟对电网升级的迫切需求。
行业媒体Slicast · 2026年8月25日 · 美国 · 来源: NVIDIA Developer
重要度 68

AI智能体已将推理从单轮交互扩展至多步工作流,能够进行推理、调用工具、协调子代理,并在多轮对话中携带日益增长的上下文。这一转变现已体现在原始消耗数据中:在100万亿个真实世界使用token中,OpenRouter的《AI现状报告》发现,每次请求的平均提示词(prompt)token数量增长了约四倍,而单个智能体请求消耗的token量是普通聊天的15倍。为这种负载正确表征硬件性能带来了新的挑战。一个有用的基准测试必须捕捉长上下文预填充、KV缓存复用、交互式解码、工具调用间隙以及在现实并发下的分布式混合专家(MoE)执行。它还必须量化AI工厂的电力预算中有多少转化为有用的智能体吞吐量,同时保持可接受的用户体验。

为解决这一问题,我们考察了SemiAnalysis AgentX,这是InferenceX套件中的一个开源基准测试,它通过重放生产风格会话来评估用于智能体编码推理的AI基础设施。智能体会话本质上具有长生命周期、状态依赖性和可变性,它们将模型调用、工具使用和不断扩展的上下文链接起来,而不是遵循固定的“提示-响应”模式。AgentX衡量平台是否能以响应式方式服务重放的智能体流量、高效复用先前处理的上下文,并最大化每兆瓦配置的智能体吞吐量。与遗留的静态序列长度场景不同——由于其对生产流量的代表性有限,这些场景在InferenceX中已被降级为维护模式——AgentX通过变化并发度来映射吞吐量与交互性之间的权衡。在早期使用DeepSeek-R1-0528(输入序列长度8K,输出序列长度1K)进行的静态基准测试中,GB300 NVL72每兆瓦的token产出比H200高出多达40倍,这展示了强大的基线效率,但未能捕捉实时智能体流量的动态性质。

AgentX评估了在预录制的Claude Code会话中的服务性能,这些会话包含交错的推理和工具使用。每个会话都使用AIPerf客户端逐轮重放,确保每个系统接收相同的记录流量,从而使观察到的差异反映的是服务堆栈而非特定于基准测试的调整。重放保留了每个会话的上下文以及输入/输出序列长度,以及原始的推理时间和工具调用延迟。这些间隔保持了原始轨迹的时间顺序,准确再现了真实基准测试必须捕捉的KV缓存容量压力。AI工厂的主要指标是每兆瓦token数,针对四个用户体验阈值报告:端到端标准化交互性、标准交互性、端到端延迟和首Token时间(TTFT)。这些指标为如何最好地利用每个阈值进行生产部署提供了清晰的指导。

NVIDIA使用SemiAnalysis AgentX工作量测量的最新预览结果——尚待SemiAnalysis审核——突显了显著的效率提升。在AgentX DeepSeek V4-Pro工作量上,NVIDIA Vera Rubin NVL72在每位用户160 token/秒的目标下,其每兆瓦AI工厂吞吐量比GB300 NVL72高出多达30倍。这表明在保持相同交互式服务目标的同时,智能体推理能力大幅增加。与此同时,GB300 NVL72延续了其相对于先前架构的多代优势。在与H200 NVL8的对比中,GB300 NVL72在AgentX工作量上为DeepSeek V4 Pro 1.6T提供了高达15倍的每兆瓦AI工厂吞吐量,在相同的电力预算内维持了更具响应性的智能体推理。

这些吞吐量优势直接转化为单位经济效益。GB300 NVL72每百万token的成本比H200 NVL8低多达10倍,这意味着运营商可以在固定的电力和基础设施预算下支持实质更多的交互式智能体容量,或者以更低的运营成本提供等效容量。随着模型规模的增加,这种优势变得更加明显。对于像Kimi K3 2.8T这样的大型MoE模型,GB300 NVL72在可比交互性下实现了比H200 NVL8高约80倍的每兆瓦吞吐量。此外,它将交互性前沿扩展至每位用户约215 token/秒,远远超出了H200 NVL8达到的操作范围。

这些性能提升源于涵盖服务运行时、模型内核和扩缩容总线的全面系统级优化。关键推动因素包括MoE服务运行时(如SGLang、TensorRT-LLM和vLLM)、基于DeepGEMM的内核、MXFP4和MXFP8等混合精度格式、NVIDIA Dynamo会话感知服务堆栈,以及连接72个GPU以实现协调机架级推理的高带宽NVIDIA NVLink扩缩容总线。这些层级共同作用,使大型MoE模型能够在智能体会话积累上下文、并发规模扩大和解码需求加剧时,维持响应式的吞吐量。

Vera Rubin NVL72展示了当机架级系统明确针对智能体推理的长上下文、交互式和分布式执行模式进行调优时所能实现的性能。更广泛的Vera Rubin平台将整个工作流程扩展到这一方法:Rubin GPU高效处理大上下文和解码,Vera CPU处理工具执行和KV缓存卸载,而Groq 3 LPX解锁超快交互性。在整个AI工厂中,NVLink 6、ConnectX-9、BlueField-4和Spectrum-X在资源之间移动token、上下文和工具结果。软件协调由Dynamo、Attention-FFN解聚、NVFP4、TensorRT-LLM WideEP和投机解码处理,将执行分布在最合适的处理器上。目标依然简单明了:减少重新计算和等待,随着智能体会话的增长维持交互性能,并将更多固定的电力预算转化为有用的智能体输出。

本分析得益于Xin Li、Ankur Singh、Anthony Casagrande、Jonas Li、Po-Han Huang、Xiaoming Chen以及众多其他才华横溢的NVIDIA工程师的专业知识和工程贡献。

阅读原文