2026年9月16日星期三
AI 基础设施 · 新闻与分析
首页芯片与硬件报道
芯片与硬件 · 报道

NVIDIA在AI基础设施峰会报告Vera Rubin和DSX平台的每瓦特令牌优化进展,强调功率效率作为竞争指标。

将效率(每瓦特令牌数)作为公开指标表明数据中心密度受功率约束而非计算约束;影响设施规划。
通讯社Slicast · 2026年9月15日 UTC 17:01 · 美国 · 来源: NVIDIA Blog
重要度 75

伟达超大规模和高性能计算副总裁伊恩·巴克在圣克拉拉召开的AI基础设施峰会上介绍了AI工厂的效率问题。本次峰会参加人数从去年的3,500人增至今年的8,000人以上。巴克重点介绍了推进AI基础设施能源效率的新型平台合作和伙伴关系。

亚马逊旗下Annapurna Labs正在与英伟达合作开发NVHBM定制高带宽存储技术。d-Matrix正在集成NVLink Fusion,将英伟达Vera CPU与d-Matrix Raptor XPU配对,以实现超低延迟的大规模推理。Emerald AI与英伟达联合演示了与硅谷电力公司的商业AI工厂灵活负载程序。Lambda利用英伟达DSX MaxLPS将每瓦性能提高了23%。Pinterest正在部署英伟达Blackwell平台,配合英伟达Dynamo推理软件,为视觉发现添加对话式AI功能。

为应对代理AI工作负载的日益增长需求,英伟达推出了一个全栈平台,包括Vera Rubin系统、Dynamo推理软件、NeMo库和英伟达网络产品——其中包括用于扩展计算的NVLink、Spectrum-X以太网、用于数千节点部署的ConnectX SuperNIC、由BlueField支持的上下文存储和用于基础设施安全的BlueField DPU。

行业的性能指标正在从峰值性能转向经过验证的代理令牌每兆瓦,这要求AI工厂从芯片到电网进行协同设计。英伟达DSX MaxLPS通过工厂级电源优化,每兆瓦可交付多达1.4倍的令牌,而NVLink将大规模加速计算统一为单一高性能系统——使客户能够生成更多令牌、提高效率,并从每兆瓦部署中提取最大价值。

硅谷电力公司的灵活负载互联互通计划使AI工厂能够支持电网灵活性。与英伟达合作的Emerald AI演示了在保护工作负载性能的同时自动降低负载、响应数百个需求信号的能力。利用英伟达DSX Flex,Emerald AI的Conductor电网响应式电源管理软件根据实时电网信号和混合能源来源动态调整能源消耗。DSX Flex接收负载脱落请求、需求响应事件和定价信号,然后在预定义的工作负载层次结构内自动执行——保护关键任务,同时临时暂停低优先级任务,然后恢复。这使设施能够在参与电网效率的同时在需要时降低需求,并为增长释放额外产能。

Lambda发布了英伟达DSX MaxLPS在Blackwell服务器上的验证结果。该软件持续监控GPU和机架的电源消耗,动态转移可用电源,回收静态配置留下的未使用容量。Lambda在通常分配给16个满功率节点的电源预算内运行19个节点,将集群范围的令牌吞吐量提高了24%——从大约400万增至500万令牌/秒——同时每瓦性能提高了23%。对于下一代英伟达Vera Rubin NVL72部署,DSX MaxLPS在适宜的环境中可以在相同的兆瓦预算内实现多达40%的GPU容量增加,允许运营商在现有电源包络内扩展AI容量和令牌吞吐量。

电力代表AI工厂的主要制约,使得每兆瓦的令牌成为关键的效率指标。英伟达基于Vera Rubin NVL72的全栈AI工厂整合了系统、网络、软件和电源管理。在工厂级别,DSX MaxLPS随着需求波动而动态转移电力跨机架。在每个机架内,智能功率平滑软件和扩展的能量缓冲吸收短暂尖峰,让系统更接近持续需求运行,并将搁浅的余量转换为生产性计算。结果包括在相同的现场电源包络内增加多达40%的GPU,以及无需新增电力线路的最多35%更高的令牌吞吐量。

对于代理AI——其中代理链接推理步骤和工具调用——延迟和上下文长度迅速增加。英伟达Groq 3 LPX为Vera Rubin添加了确定性超低延迟推理,补充了DSX MaxLPS。对于2万亿多参数模型在长上下文处理中,组合平台比GB200 NVL72的每兆瓦令牌吞吐量高达35倍。在100K上下文的Qwen 3.8 27B工作负载上,Groq 3 LPX实现了每用户2,529个输出令牌/秒——即使工作负载扩展,也能在相同的响应预算内为代理运行更多推理步骤和工具调用提供余量。

SemiAnalysis AgentX在记录的真实代理编码会话上测量推理,保留实际的上下文增长、工具调用延迟和子代理衍生,而不是依赖单个请求基准。英伟达Vera Rubin NVL72结果现已在AgentX仪表板上实时显示。在DeepSeek V4 Pro模型上,Vera Rubin NVL72相比GB300 NVL72的每兆瓦吞吐量高达30倍。代理工作负载与传统的请求-响应推理有根本不同:单个会话积累数十万个输入令牌,因为代理进行推理、调用工具和衍生子代理——大约是简单聊天令牌量的15倍——输入和输出长度差异很大。AgentX捕捉了这种端到端行为,补充了MLPerf Inference等标准化套件。每兆瓦30倍的吞吐量增益意味着以相同能源足迹做30倍更多的代理工作;AgentX结果显示每百万令牌成本降低最多45倍。在受电力限制的部署中,每兆瓦吞吐量决定收入生成,每百万令牌成本决定利润。这种性能源于极端协同设计:NVL72扩展域、第六代NVLink、第五代张量核心上的NVFP4精度,以及涵盖TensorRT LLM和Dynamo的推理堆栈。Vera Rubin处于全面生产阶段,并在整个生态系统中扩展,性能通过软件优化不断改进。

初创企业正在验证英伟达Vera CPU在代理工作负载和要求苛刻应用中的性能。Perplexity为其新的SPACE安全沙箱平台针对代理AI对Vera CPU进行了基准测试,报告沙箱启动速度提升1.9倍。Daytona在代理工作负载上测试了Vera CPU,称其为"代理执行的重大收益"。

阅读原文
NVIDIA在AI基础设施峰会报告Vera… · Slicast