2026年9月30日星期三
AI 基础设施 · 新闻与分析
首页 › 电力与能源 › 报道
电力与能源 · 报道

深度学习加速推动数据中心功率密度前所未有增加,需要基础设施重新设计

创造功率和冷却瓶颈,需要设施升级、新型散热方案和电网容量扩展
行业媒体Slicast · 2017年3月27日 UTC 12:00 · 全球 · 来源: datacenterknowledge.com
重要度 80

英伟达加速计算部首席平台架构师罗布·奥伯(Rob Ober)监督特斯拉的设计工作,特斯拉是目前市场上用于机器学习的最强大GPU。正如奥伯所指出的,为人工智能建设计算机系统是"一个非常困难的工程问题,要为深度学习训练构建一个GPU系统。这真的非常困难。甚至像Facebook和微软这样的大公司都曾感到困难。"GPU即图形处理单元,原本为图形设计,已成为深度学习的必要处理器。这是谷歌用于投放定向广告和亚马逊Alexa用于即时回答语音查询的AI类型。

深度学习涉及两类计算工作负载:训练和推理。训练是指从现有数据教导深度神经网络一种新能力——例如,通过反复查看带标签的图像来教导神经网络识别照片中的狗。推理是指神经网络将其知识应用于新数据的过程,例如识别它以前没见过的图像中的狗。数据中心的训练特别困难,因为它需要极其密集的GPU集群,每台服务器包含最多8个互联GPU。一个这样的机柜很容易需要30千瓦或更多的电力——这是大多数非超级计算机领域的数据中心无法支持的功率密度。大约20个这样的机柜所需的电力相当于达拉斯牛仔队在AT&T体育场的超大屏幕所需的电力,该屏幕是世界上最大的1080p视频显示屏,包含3000万个灯泡。

工程挑战不仅限于原始功耗。"进行深度学习训练时,你通常希望创建尽可能密集的计算池,这会变得极其功率密集,这是一个真正的挑战,"奥伯解释道。另一个关键问题是控制电压,因为GPU计算会产生显著的电源瞬变——突然的电压尖峰,这"很难处理"。网络也带来一个主要障碍。"取决于你的训练数据来自哪里,它可能对数据中心网络造成令人难以置信的负载,"奥伯说,"你可能会造成一个真正强烈的热点。"根据奥伯的说法,功率密度和网络是"数据中心深度学习系统中可能是两个最大的设计挑战"。

像Facebook和微软这样的超大规模运营商通常通过将深度学习集群分布在许多机柜上来应对功率密度挑战,尽管有些企业"试验"液体冷却或液体辅助冷却方案。液体冷却直接向主板上的芯片供应冷却水(这是一种常见的超级计算机方法),而液体辅助冷却是将冷却水引入热交换器,该热交换器冷却通过服务器的气流。专业高密度数据中心提供商缺乏超大规模运营商拥有的数十万平方英尺空间的便利,已越来越多地采用液体辅助冷却,并最近看到需求激增。

需求的激增反映了企业对机器学习更广泛的兴趣。"目前,启用GPU的工作负载是我们看到增长最多的工作负载,绝对来自企业部门,"高密度数据中心提供商ScaleMatrix的联合创始人克里斯·奥兰多(Chris Orlando)表示。"企业数据中心无法为此做好准备。"奥兰多指出,ScaleMatrix的增长呈曲棍球棍形,拐点大约在去年年中。除了一般机器学习外,需求还由生命科学和基因组学计算驱动——J. Craig Venter Institute是ScaleMatrix圣地亚哥数据中心的最大客户之一——以及地理空间研究和大数据分析。

阅读原文
深度学习加速推动数据中心功率密度前所未有增加,需要基础设施重新设计 · Slicast