NVIDIA展示AI工厂可根据电网需求动态调整负载
在硅谷的一个八月傍晚,随着空调在高温高峰期的负荷飙升,硅谷电力公司向一家AI工厂发送了一个调整其电力消耗的信号。Varun Sivaram通过Zoom观看,约有四十人参与——他的团队在旧金山的Emerald AI公司会议室里、数据中心的工程师,以及来自公用事业公司本身的人员。没有人触碰任何东西。来自NVIDIA合作伙伴Emerald AI的Emerald AI Conductor平台是一个电网编排系统,接收了关于电网状况的信号,并调整了数据中心的灵活计算工作负载。可以延后的工作被减速或重新安排,而更高优先级的服务继续运行。目标是在电网受限时减少用电需求,但不中断关键AI工作负载——这正是硅谷电力公司所需的。当减量显示在屏幕上时,所有人都欢呼起来。Sivaram说:"我们屏息以待地观看。这是我们第一次在数千个NVIDIA GPU上进行部署。"他的产品负责人Mansi Shah激动地说:"这感觉有点像SpaceX火箭发射。"
硅谷电力公司随后向该AI工厂发送了超过200个需求信号,每次都成功了。当信号到达时,工厂的电力从四兆瓦自动降至三兆瓦,而每个高优先级工作都继续运行。
这指向了一个更大的机遇:一条在无需等待十年建设新输电线路的情况下释放美国AI工厂所需电力的道路。在AI基础设施峰会上,NVIDIA超大规模和高性能计算副总裁Ian Buck将AI工厂效率置于其基础设施主旨演讲的中心。云提供商Lambda在同一天发布的首次验证结果量化了这一点:在智能管理下,固定电力预算可以支持24%更多的令牌吞吐量。Lambda云服务总裁Dave Ward表示:"通过我们的概念验证,我们相信我们已经突破了固定电力预算的限制。NVIDIA DSX MaxLPS为回收搁浅的容量并将其转化为实际使用铺平了道路,在相同的占地面积内实现了显著更高的计算密度。"
当硅谷电力公司在那个八月傍晚发出信号时,Conductor根据预先定义的工作负载优先级执行:最低优先级工作被暂停,高优先级推理继续运行,电力从四兆瓦降至三。完全自动化。无需操作员干预。
在AI工厂经济中,电力是约束条件。每吉瓦的工作量是衡量指标。NVIDIA DSX将效率纪律扩展到AI工作负载本身。更智能的机架配置将电力投放到工作负载真正需要的地方。运营智能——更紧凑的调度、更快的重启、更精益的检查点——使GPU保持运行而非闲置。NVIDIA创始人兼首席执行官Jensen Huang曾说过:"一个一吉瓦的工厂永远不会成为一个两吉瓦的工厂。"
Lambda在一个五机架、19节点的集群上运行了NVIDIA的DSX MaxLPS软件。通过在与16个节点全功率相同的电力预算内运行19个节点,Lambda实现了集群范围令牌吞吐量增加24%——从大约每秒400万令牌增加到500万。每瓦性能提高了23%。NVIDIA预计DSX MaxLPS可在合适的部署环境中,为下一代Vera Rubin NVL72 AI工厂在相同的兆瓦电力预算内提供高达40%的GPU容量增加。
NVIDIA的Eos AI工厂正在运行Emerald AI Conductor,作为硅谷电力公司柔性负荷互联计划的参与者,这是首个专为将AI工厂视为可调度资源而设计的商用电网公用事业计划。当硅谷电力公司发送信号时,Conductor在一分钟内响应。首个专用DSX Flex商业部署将是位于弗吉尼亚州马纳萨斯的设施:NVIDIA AI工厂研究中心的96兆瓦Vera Rubin AI工厂。
NVIDIA的800V直流电源架构旨在降低转换复杂度、提高电源传输效率并支持更密集的加速计算机架。DSX正在将800V直流纳入其参考设计。
没有单个组件能独立优化AI工厂。更快的GPU仍需等待网络。不当配置会导致电力闲置。提高每兆瓦令牌数的唯一可靠途径是使用DSX Sim、DSX OS、DSX Exchange和DSX参考设计来优化整个工厂。根本问题仍然存在:工厂每兆瓦消耗产生多少有用的工作?通过NVIDIA DSX,这是AI工厂应该做什么的基准。