在Hot Chips 2026大会上,英伟达介绍了针对Rubin GPU的DSX MaxLPS站点电源管理架构,展示了如何在固定数据中心电力包络内提取更多算力密度。
尽管在围绕机架级人工智能系统的讨论中,单个CPU、GPU和芯片的性能往往占据主导地位,但最终的制约因素仍然是能够输送到设施并分配到各机架的电力总量。高效管理和分配这些电力,已成为最大化下一代数据中心安装生产力的主要关注点。在英伟达(Nvidia)于Hot Chips 2026大会上对Rubin GPU的介绍中,公司强调了这一硬性容量限制,并突出了在100兆瓦(MW)的固定设施电力预算内,Vera Rubin NVL72系统能够提供多少计算能力。
据英伟达称,将Vera Rubin的内部电源管理技术与其DSX MaxLPS(Land, Power, Shell,即土地、电力、外壳)套件中的设计和站点级动态电源管理工具相结合,将使运营商能够在该100兆瓦的电力范围内配置约40,000个下一代GPU——或大约40个Rubin DGX SuperPOD集群。英伟达预计,这些硬件在NVFP4推理任务中可提供高达2泽斯卡弗洛普斯(ZFLOPS)的性能,在NVFP4训练任务中可提供高达1.4 ZFLOPS的性能。基于公开可用的Rubin规格,这些性能数据应被视为估算值而非实测基准;由于各种运营因素,实际工作负载实现的浮点运算次数可能会更低。尽管如此,其基本前提依然成立:要从受限的电力预算中提取最大计算能力,需要比简单地将粗略估计的峰值功耗应用于每个电气组件更为精细的规划、监控和设施管理。
历史上,数据中心运营商一直依赖静态电力配置,基于每个机架固定的最坏情况功率峰值做出假设。这种方法往往会夸大电力预算,导致那些很少甚至从未达到理论极限的机架中分配的容量被闲置。在静态方案下,电力无法重新路由以解决机架间的应用负载差异。因此,利用率不足的机架让电力处于空闲状态,而高负载系统仍受限于保守的安全裕度,从而限制了整个集群的性能。
DSX MaxLPS方法通过实施一种智能的动态电力分配方案来解决这些局限性,该方案持续监控芯片、机架和机架组级别的用电情况。英伟达的动态电源软件控制回路识别由工作负载特性或空闲资源导致的未使用容量,并将其重新分配给任何给定时刻最需要的系统。这最大限度地提高了可安装系统的数量以及整个设施生命周期内的每瓦整体性能。
在使用当前GB300机架的测量示例中,英伟达展示了这种转变的实际影响。在540千瓦(kW)的电力预算下,采用静态配置时,运营商通常可以通过针对峰值功耗而非实际工作负载测量进行配置来安装四个135千瓦的系统。然而在实践中,由于机架利用率不均,该预算中多达170千瓦往往处于未使用状态。借助英伟达NVL72等现代机架级架构,这些回收的容量可以安全地容纳额外的系统。在五个动态配置的系统之间,为峰值余量预留的备用电力可以显著减少。
在机架层面,DSX MaxLPS通过特定工作负载的电力配置文件引入了进一步的灵活性。类似于客户端PC上的静音、平衡和高性能模式,英伟达开发了针对特定任务(如推理、训练以及一般的内存绑定或计算绑定工作负载)量身定制的机架级配置文件。虽然英伟达没有发布测得的Rubin功耗或每瓦性能结果,但它使用上一代硬件验证了MaxLPS概念。对于运行DeepSeek-R1的Grace Blackwell GB300系统,传统的固定峰值制度假设GPU总图形功耗(TGP)为1,400瓦,预估机架功耗为136千瓦。应用MaxLPS后,典型GPU TGP降至1,000瓦,总机架功耗降至101千瓦,且不影响交付的性能。这种更紧凑的运行环境直接转化为更高的每瓦性能、相同占地面积内更大的机架密度,以及为数据中心运营商和租户增加的令牌输出量。
从一开始就利用MaxLPS设计设施还提供了长期的运营灵活性。最初作为专注于训练的设施部署并配备尖端硬件的站点,自然会要求每个机架占用更大比例的站点电力。因此,运营商可能选择不会立即填满所有可用楼层空间。随着训练工作负载迁移到更新的硬件世代,旧系统过渡到推理角色,每个GPU和每个机架的电力需求都会下降。配备动态电力配置的设施随后可以利用释放的容量,在同一占地面积内部署额外硬件,从而提高产生收入的吞吐量。
对于部署Vera Rubin硬件的数据中心而言,MaxLPS的另一个关键组成部分是采用更高的液冷冷却剂温度。 exclusively液冷的Rubin NVL72机架设计为在45摄氏度(°C)的入口冷却剂温度下运行,这比之前的液冷世代有了显著提高。这种“干冷”策略之所以重要,是因为在非蒸发系统中用于散发废热的机械冷水机组传统上会消耗站点电力预算的很大一部分——据英伟达称,在过去的一些安装中高达40%。与服务器电力配置类似,冷水机组历来是为最坏情况的热场景过度设计的,即使它们在一年中的大部分时间都在远低于容量的情况下运行。闲置这种容量会阻止在有利条件下将电力动态重新分配给计算工作负载。虽然冷水机组在环境温度峰值期间仍然必要,但较高的冷却剂温度通常能使更多的站点电力流向 productive computation(有效计算),从而改善标准操作条件下的设施电源使用效率(PUE)。
AI数据中心的电力可用性——无论是来自公共电网还是表后发电——在可预见的未来仍将是至关重要的约束之一,这一点在Hot Chips大会上的多位演讲者中也得到了呼应。英伟达的DSX MaxLPS框架提供了动态分配这一稀缺资源的基本构建模块,使运营商能够从基于Rubin的设施中提取最大的每瓦性能。随着电力消耗的持续增长,设施电力管理与可实现计算性能之间的相互作用将在战略重要性上日益凸显。