NVIDIA主张能效是AI工厂的决定性约束
电力是AI基础设施不可回避的约束。AI工厂在固定功率预算内能生成的token数量决定了其收入和盈利能力。每瓦性能(一个无法作弊只能通过真实结果获得的指标)是AI工厂的基础。随着智能体AI推高token需求,组织今天做出的基础设施决策将决定在功率受限的世界中谁能扩展,谁不能。
当今几乎每个前沿AI模型都采用混合专家(MoE)架构。要高效地服务这些大规模模型,GPU域大小——通过超高速扩展互连连接的GPU数量——至关重要,规模越大越好。虽然NVIDIA Hopper一代以8-GPU域设立了标准,但当今前沿AI的规模已经超越了这一点。以72-GPU域服务MoE需要全栈协同设计和在真实生产负载下运行这些模型所获得的运营经验。
借助NVIDIA Blackwell NVL72平台,这一基础已经搭建并得到验证,提供最高的每瓦性能以最大化收入,和最低的token成本以最大化利润率。NVIDIA Vera Rubin平台在此基础上进一步提升机架级能效。在最新一代领先的开源模型中,NVIDIA GB300 NVL72相比NVIDIA Hopper一代提供高达25倍的每瓦性能,展示了从8-GPU到72-GPU域大小时MoE性能的改进。
不同的工作负载需要不同的操作点:有些优化延迟,有些优化吞吐量和成本,大多数需要在两者之间切换。NVIDIA不是展示单一数字,而是为每个模型呈现帕累托曲线,并提供如DynoSim等工具来帮助团队在花费GPU-小时进行验证前找到帕累托前沿上的最优点。
NVIDIA Blackwell提供的每瓦性能来自极端协同设计,其中从硅到软件的机架级系统的每个部件都设计在一起以最大化AI推理工作负载的token吞吐量。NVIDIA NVLink交换机在Vera Rubin平台中已发展到第六代,专为解锁大规模GPU域而设计,并包括专为AI工作负载(如SHARP)而设计的功能,SHARP直接在交换机中执行网络内计算。NVIDIA的推理软件栈包括NVIDIA Dynamo、TensorRT LLM、SGLang和vLLM,运行从NVFP4量化到KV缓存卸载的全部优化。在DeepSeek V4上,每瓦性能仅通过软件改进就在一个月内提高了高达5倍。
在AI工厂中,冷却和机架级低效造成的功率损耗意味着从电网拉取的电力中只有约60%转化为有用的AI工作。NVIDIA DSX MaxLPS是NVIDIA DSX平台中的功率和效率软件,通过实时在GPU和机架之间转移功率并使用功率管理等技术来榨取更多性能,缩小了这一差距。这使得操作员能够在相同功率预算内运行多达40%更多的GPU。
在AI工厂规模下实现机架级可靠性需要付出巨大代价,这引入了单节点部署从未遇到的故障模式。NVIDIA Blackwell NVL72系统在不同模型和生产用例中继续设立标准。包括Anthropic、OpenAI和SpaceXAI在内的领先AI实验室、推理服务提供商以及在生产中部署开源模型的AI原生企业都使用NVIDIA Blackwell NVL72系统运行推理。CoreWeave已在NVIDIA GB300 NVL72上部署Kimi K2.6,结合NVFP4量化和EAGLE3投机性解码。Perplexity在NVIDIA GB200 NVL72上运行Qwen3 235B和经过后训练的Qwen3.5-397B-A17B用于其AI智能体平台,日服务数百万查询。Fireworks AI在NVIDIA Blackwell平台上为包括Cursor和Factory AI在内的客户部署GLM 5.2。这些在前沿模型和真实部署中积累的生产经验为NVIDIA Vera Rubin奠定了基础。