NVIDIA宣布AI基础设施评估方式从峰值性能转变
英伟达副总裁伊恩·巴克(Ian Buck)于9月15日在圣克拉拉AI基础设施峰会上向超过8000名与会者发表讲话,讨论AI基础设施如何围绕电力效率和智能体工作负载进行重新设计。该公司介绍了新的合作关系和产品公告,这些公告共同展示了用于评估数据中心性能的指标的根本性转变。
亚马逊的Annapurna Labs正在与英伟达合作开发NVHBM自定义高带宽内存技术。D-Matrix正在将英伟达的NVLink Fusion平台与其Raptor XPU整合。在商业领域,Emerald AI和英伟达演示了与硅谷电力公司合作的AI工厂灵活负载项目,Lambda通过英伟达DSX MaxLPS实现了每瓦性能提高23%,Pinterest正在使用英伟达Blackwell平台和Dynamo推理软件进行对话式视觉发现。
驱动力是智能体AI,它要求新的基础设施设计。英伟达的全栈平台涵盖Vera Rubin系统、Dynamo推理软件、NeMo库和全面的网络解决方案,包括用于纵向扩展计算的NVLink、Spectrum-X以太网和ConnectX SuperNIC。该公司正在推动从测量峰值性能到测量经过验证的每兆瓦智能体令牌的转变。DSX MaxLPS通过工厂范围的优化每兆瓦提供高达1.4倍的更多令牌,而NVLink使大规模加速计算能够作为单个系统运行。
硅谷电力公司运营一个灵活负载互联项目,Emerald AI演示了自动负载削减,同时保护工作负载性能。该系统响应来自公用事业公司的数百个需求信号。Emerald AI计划使用其Conductor电网响应型电力管理软件部署DSX Flex,该软件根据实时电网信号动态调整能源消耗。DSX Flex接收负载削减请求、需求响应事件和定价信号,然后自动暂停较低优先级的作业,同时保持关键工作负载。这使AI工厂能够充当灵活的电网资源。
Lambda发布了英伟达Blackwell服务器上使用DSX MaxLPS的结果,在通常分配给16个满功率节点的电力预算内运行19个节点。Lambda实现了集群范围内令牌吞吐量增加24%,从大约每秒400万个令牌增加到每秒500万个令牌,同时性能功耗比提高23%。对于下一代Vera Rubin NVL72工厂,DSX MaxLPS可以在相同的兆瓦预算内实现多达40%的GPU容量增加。
在电力受限的环境中,英伟达演示了Vera Rubin NVL72与Groq 3 LPX的结合,对于超过2万亿参数的模型在长上下文长度下,每兆瓦令牌吞吐量比GB200 NVL72高达35倍。在100,000令牌上下文的Qwen 3.8 27B工作负载上,Groq 3 LPX实现了每用户每秒2,529个输出令牌。Vera Rubin平台包括智能电源平滑软件和扩展能源缓冲,以吸收电源尖峰并更接近持续需求运行。
英伟达发布了SemiAnalysis AgentX基准测试的性能结果,该基准测试衡量实际真实世界智能体编码会话的推理,包括实际的上下文增长、工具调用延迟和子智能体生成。Vera Rubin NVL72在DeepSeek V4 Pro模型上提供比英伟达GB300 NVL72高达30倍的每兆瓦吞吐量。该公司强调,智能体工作负载与单一请求任务从根本上不同,会话在智能体推理、调用工具和生成子智能体时累积数十万个输入令牌。效率提升转化为业务影响:相同能耗下智能体工作多达30倍,每百万令牌成本低达45倍。在电力受限的部署中,每兆瓦吞吐量决定了AI工厂能产生多少收益。