行业指导产生关于为AI工作负载和GPU集群的巨大功耗需求准备数据中心的方案。
随着人工智能在企业环境中应用的加速,数据中心的功耗正成为一项关键挑战。据数据中心组织AFCOM的数据,运行典型企业应用的数据中心中,机架的平均功耗约为7千瓦,而AI应用通常每个机架消耗超过30千瓦。这种巨大差异源于AI对处理器利用率的更高要求,特别是耗电量很大的GPU——例如,英伟达GPU的运行速度可能比CPU快好几个数量级,但每个芯片的功耗是CPU的两倍。这一挑战因许多数据中心已经面临电力限制而加剧,AI导向的服务器需要更高的处理器密度,芯片数量更多且运行温度更高,这增加了冷却需求,同时也提高了利用率。
液冷代表了一项重要解决方案,可用于突破传统风冷极限的设施。据企业液冷产品制造商CoolIT Systems称,风冷通常在机架功耗超过15千瓦后失去效果,但水的热容量是空气的3000倍。数据中心开发商和运营商Sabey的数据中心运营高级副总裁约翰·萨瑟解释道:"液冷绝对是高密度负载的一个很好的选择。它消除了复杂的气流问题。水比空气能散出更多热量,你可以通过管道来引导它。很多高性能计算(HPC)都是用液冷完成的。"虽然液冷需要资本投资,萨瑟指出它"对于这些工作来说可能是一个更明智的解决方案,尤其是如果公司决定朝向AI方向发展的话。"
除了硬件解决方案,计算方法可以降低功耗。Hyperion Research的高级研究副总裁史蒂夫·康威指出,许多工作负载可以使用半精度或四分之一精度运行,而不是64位双精度。康威说:"对于某些问题,半精度就足够了。以较低的分辨率运行,用更少的数据。或者用更少的科学成分。"双精度计算主要用于分子级别的科学研究,而AI训练和深度学习模型推理通常不需要这种精度水平——英伟达甚至在深度神经网络中倡导单精度和半精度计算。
实际实施需要战略性基础设施规划。建造和运营数据中心的Five 9s Digital合伙人道格·霍利奇建议新设施只分配一部分用于高功耗使用,指出"你不会把所有设施都用于高密度,因为还有其他应用耗电量较低。"第一步是评估建筑物的能源供应,以确保电力供应商可以增加容量。数据中心建造商QTS的首席创新官大卫·麦卡尔建议将AI系统分散在多个机架中,而不是集中在一起,允许一个异构环境,其中大多数应用运行功耗为8到10千瓦到15千瓦,与更高密度的AI工作负载并行,使整体机架功耗接近12-15千瓦——一个风冷可以管理的范围。霍利奇强调:"很难给出万能的解决方案,因为所有数据中心都不同,"强调了工程评估的重要性,以确定设施的哪些部分最适合根据具体工作负载要求提供高密度能力。