数据中心 · 报道
AWS为Nvidia GPU集群部署定制的IRHX冷却解决方案,替代第三方冷却厂商。
超大规模云计算公司正在垂直整合基础设施组件以降低成本,并在规模上优化GPU性能。
行业媒体Slicast · 2025年7月12日 UTC 12:00 · 全球 · 来源: techradar.com
重要度 85亚马逊网络服务公司(Amazon Web Services)开发了一个专有冷却系统,名为行内热交换器(In-Row Heat Exchanger, IRHX),用于处理英伟达(Nvidia)最新GPU架构的热管理需求。根据AWS计算和机器学习服务副总裁Dave Brown的说法,现有的液冷解决方案无法满足该公司的需求。"它们会占用太多的数据中心地面空间,仍然需要对数据中心进行重大改造,或者大幅增加用水量,"Brown在一次演讲中表示。他补充道:"虽然这些解决方案中的一些可能对其他提供商的较低规模有效,但它们根本无法提供足够的液冷容量来支持我们的规模。"
IRHX系统由泵送单元、配水柜和风扇盘管组成,这些部件协同工作来冷却AWS的硬件。液体通过由AWS和Nvidia共同设计的冷板来冷却芯片,然后循环回IRHX,在那里液体被冷却并释放。这种设计使AWS能够维持热管理,而无需重新设计现有的数据中心基础设施。
该系统为AWS最强大的EC2实例P6e UltraServer提供动力,其中包括英伟达GB200 NVL72。根据Brown的说法,这个配置"使72个英伟达Blackwell GPU能够充当一个巨大的单个GPU"。IRHX符合现有的AWS机架尺寸和基础设施,使其可以在全球数据中心部署,而无需修改现有设施。正如Brown解释的那样:"使用IRHX,我们不需要围绕机架设计数据中心。"
虽然目前与英伟达基于Blackwell的系统配对使用,但如果冷却需求在未来增加,IRHX可能会与亚马逊自己的Graviton芯片一起使用。这种定制冷却解决方案延续了AWS既定的战略,即构建专有硬件——包括芯片和网络系统——来支持其大规模基础设施,满足对性能和计算能力都有要求的人工智能工作负载。