Lambda的GPU云集群已达到每秒500万令牌的吞吐量,利用英伟达DSX MaxLPS技术在每兆瓦令牌效率上实现了40%的提升。
人工智能需求的持续增长对全球能源基础设施造成了巨大压力。为应对这一挑战,英伟达(NVIDIA)正在其全栈AI工厂平台部署一系列全面的能效优化措施。该生态系统涵盖Vera Rubin系统、Dynamo推理软件、NeMo库,以及先进的网络解决方案,包括用于扩展计算的NVLink、用于以太网的Spectrum-X、用于连接数千个节点的ConnectX超级网卡、由BlueField驱动上下文内存存储,以及用于基础设施安全的BlueField DPU。
在AI基础设施峰会上,英伟达展示了其DSX MaxLPS技术如何使Vera Rubin平台的每兆瓦令牌吞吐量提高高达40%。该软件已通过Emerald AI的Conductor平台投入运营,展示了DSX的电网编排能力。借助DSX Flex,Conductor能够根据实时电网状况动态调整数据中心的功耗。该系统旨在电网受限期间降低电力需求,同时确保关键AI工作负载零中断。迄今为止,该平台已完美处理了200次电网状况信号,且无需任何用户干预。
服务客户超过1万家、涵盖从原生AI初创公司到超大规模云服务商的云提供商Lambda,最近验证了该平台的性能。测试在一个包含5个机架、19个节点的集群上进行。通过将全部19个节点运行在原先分配给16个满功率节点的相同功耗预算内,Lambda实现了集群整体令牌吞吐量24%的增长——从每秒约400万令牌提升至500万令牌。每瓦性能提升了23%,证实了该平台能够在固定功耗预算下提供更高的吞吐量。
这些效率提升直接转化为Vera Rubin和Groq 3 LPX机架配置性能的增强。设施现在可以在相同的站点供电范围内容纳多达40%更多的GPU,并在无需新增线路的情况下实现高达35%的更高令牌吞吐量。在实际测试中,Groq 3 LPX上的100K上下文Qwen 3.8 27B工作负载为用户提供了每秒2,529个输出令牌。这种额外的余量使得AI代理能够在相同的响应预算内执行更多的推理步骤和工具调用,即使在工作负载扩展时也是如此。
除了GPU优化外,来自全球初创公司的早期反馈表明,英伟达的Vera CPU带来了显著的性能提升。独立基准测试报告显示,整体性能提高了高达1.9倍,延迟大幅降低,吞吐量提高了73%,查询任务的吞吐量增加了3.3倍,优于竞争对手的处理器。Perplexity为其专为Agentic AI设计的新SPACE安全沙箱平台评估了Vera CPU,记录到沙箱初始化时间加快了1.9倍。Daytona报告称“Agentic执行取得了重大进展”,而ClickHouse在其ClickBench分析数据库基准测试中指出,Vera CPU是其团队测量过的最快的机器,称其为“CPU性能在数据密集型工作负载方面未来前景的有力信号”。
进一步的验证来自DeepInfra,其发现Vera CPU在所有测试指标上均优于竞争对手,包括编排步骤延迟降低了2.2倍。Prime Intellect观察到,该架构在并行工作负载下保持高带宽和持续的低内存延迟——这是可预测的Agentic AI性能的关键要求。Redpanda记录到与其他CPU相比,延迟降低了5.5倍,吞吐量提高了73%;Starburst展示了3倍的更快查询吞吐量;Kinetica实现了比传统处理器快2.7倍的分析查询性能。
英伟达及其生态合作伙伴正在从根本上重新定义数据中心为协同设计的AI工厂,将行业标准从峰值FLOPS转向经过验证的每兆瓦令牌数。这一转型由多项创新推动,包括Annapurna的NVHBM工作、d-Matrix的NVLink Fusion集成、Emerald AI与Silicon Valley Power合作的电网灵活负载计划、Lambda通过DSX MaxLPS实现的23%每瓦性能增益、Pinterest的Blackwell加Dynamo视觉AI管道、Vera Rubin NVL72的30倍AgentX吞吐量、Groq 3 LPX的极端低延迟优势、不断扩大的Vera CPU验证浪潮,以及NVLink 6的工厂级韧性。核心信息始终如一:跨越硅片、软件和电网基础设施的集成系统能够提取更多的令牌产出,保护优先工作负载,并最大化每一兆瓦的价值。通过将受限的电力转化为扩展的能力,这些进步正在降低每个令牌的成本,并为下一代AI基础设施带来持续的经济价值。