直接液冷却对数据中心部署运行NVIDIA Blackwell等高功率AI加速器已成关键规范。
AI 基础设施的现实已经到来:NVIDIA Blackwell 等功耗巨大的芯片已使传统空气冷却方案过时。随着机架密度从 20 千瓦上升至超过 140 千瓦,百万瓦特里程碑即将到来,行业正在从投机性规划转向紧迫的、高风险的部署阶段。直接液冷(DLC)已成为整个 IT 行业在极端芯片功率密度下的首选冷却方法。
直接液冷系统的规范设计需要在液冷 IT 需求与特定数据中心条件之间找到平衡。液冷 IT 与传统热排放系统的结合呈现出独特的挑战。成功的 DLC 实施始于严格的规范设计——以下是运营商面临的五个常见障碍。
**材料不兼容性和电腐蚀。** 当两种具有不同电化学电位的金属在流体环境中相连时,可能发生电腐蚀,导致材料降解并产生碎屑,这些碎屑会堵塞冷板并损害服务器。当 CDU 与连接组件之间的材料存在差异时,这种风险会加剧。
为了最小化风险,需要在所有与液体接触的表面上保持阴极指数差异较小。严格遵循 IT 制造商指南,并查阅开放计算项目(OCP)或美国采暖、制冷与空调工程师学会(ASHRAE)等机构的可接受材料清单。维护全面的材料登记册,除非使用适当的抑制剂否则避免使用铝材,并在不同 IT 厂商的冷板材料存在差异时考虑采用独立冷却回路。
**液冷与空冷的经济学竞争。** 液冷允许比空冷更高的冷却水温度,可以带来显著的效率收益:冷却水温度每上升 0.6°C(1°F),冷机效率上升 1-2%——变频冷机的效率提升为 2-4%。额外的节省来自经济器运行时段,当冷机在部分负载下运行或循环停止时,这种优势在气候较冷的地区特别明显。
要最大化这些节省,通常需要投资建立专门为液冷负载服务的独立高温冷机系统,同时为空冷设备保持现有低温冷机。另一种选择是运营商可以接受通过单一低温冷机共享两种负载而带来的能源节省减少。最优选择取决于基于当地气候条件的 10 年总拥有成本(TCO)分析:较炎热地区由于经济器可用时间增加,通常更需要专用高温冷机,而气候较冷的地区则倾向于采用共享低温冷机。
**服务器与冷却基础设施之间的直接耦合。** 与空冷不同——空冷中风管可能将气流引导至单个机架,但与各个服务器之间的耦合较为松散——DLC 系统将冷却剂分配管道直接连接到 IT 设备。这种紧密耦合在空间、泄漏风险和特定冷却剂流量需求方面引入了新的变量。
分配管道必须将 CDU 连接到每台服务器的冷板。需与 IT 和基础设施供应商密切合作,规范兼容的快速接头,并为每个服务器型号专用单一冷却回路以防止冷却分布不均。虽然液冷的效能优于空冷,但它存在灾难性泄漏的风险。应通过直接和间接泄漏检测系统(如电缆检测器和浊度传感器)来缓解这一风险——由集中控制系统实时监控。
液冷服务器依赖集中式 CDU 泵和控制系统,需要精确校准 TCS 设计以符合每台服务器的具体规格。应通过恒定差压控制结合节能阀来管理流阻,以稳定跨机架的压力。
**CDU 效率标准的缺失。** 由于缺乏标准化测试协议,供应商在评定 CDU 效率或容量时各自制定关于液体类型、流量、液体温度和环境温度的变量。这使得供应商能够在有利条件下声称最优性能,同时使不同 CDU 之间的有意义比较几乎不可能。
空冷受益于既定标准,而液冷则没有。在 ASHRAE 最终确定液冷正式测试标准之前,应要求供应商基于草案测试点提供性能等级。从设计角度考虑,应将 CDU 容量限制在液冷服务器数量的 10-20% 以内(每个回路),以最小化故障发生时的影响范围。
**为未知液冷 IT 设备的配置。** 数据中心运营方通常必须在不知道最终将部署何种具体硬件的情况下为液冷设备预留 IT 空间——这对于准备迎接新租户的共置服务提供商而言是常见情景。与空冷不同,DLC 将冷却剂供应直接耦合到每台服务器,意味着每个 CDU 及其 TCS 回路必须同时支持最低密度下的最大机架数量和最高密度下的最小机架数量。宽泛的密度范围会导致管道过度配置或冷却容量闲置的风险。
可通过将主回路管道直径调整为 CDU 总容量,并使管道长度足以容纳最低密度下的最大机架数量来缓解此问题。但分支管道和配管应按最高潜在机架密度进行调整。或者,可为不同功率密度指定不同的数据中心区域,或制定针对两个或三个液冷"单元"的参考设计方案,待确认具体 IT 设备后再最终确定。
从概念验证阶段向强大的生产就绪型液冷环境转变,需要在进行安装和运维之前仔细关注规范设计中的各类挑战。凭借纪律严明的规范实践和合适的技术合作伙伴,运营商可以有效缓解高密度冷却的固有风险,并为可持续的、高性能的 AI 增长奠定坚实基础。