AI数据中心运营商正采用比特币矿企首创的模块化核能与废弃能源策略,以确保可靠的基荷电力。
应对人工智能电力问题最有希望的方案之一,始于一个对科技行业而言近乎异端的理念:有时计算机应该只是等待。
人工智能聊天机器人的每一次回复都由电力驱动。虽然输出结果瞬间显示在用户屏幕上,但计算过程发生在远程设施中,这些设施密集地堆满了处理芯片。这些芯片消耗大量电力,传输海量数据,并产生显著热量,因此需要人工智能数据中心内配备强大的冷却系统。
当扩展到数百万条提示词、图像生成请求和企业工作负载时,人们就会明白,看似毫不费力的查询为何会转化为对发电和输电基础设施的切实压力。
公用事业公司现在被要求以巨大且集中的区块来满足这一需求。一个典型的大型数据中心园区消耗的电力相当于一个小城市,然而开发商规划和建设这些设施的速度远快于公用事业公司升级电网以支持它们的速度。
电网运营商还必须为高峰需求时段预留容量,即使这些基础设施在非高峰时段处于闲置状态。因此,数据中心往往需要在电网能够可靠供电之前就要求具备电力可用性。
建设新的发电设施是一种选择,但这是一个资本密集、耗时漫长的过程,通常需要数十亿美元和数年时间才能投入运营。
另一种方法是将某些计算工作负载转移到不同的时间窗口。
虽然实时聊天机器人回复需要立即执行,但内部实验或夜间视频处理队列等后台任务可以容忍延迟。智能调度软件可以在电网压力期间限制非紧急工作负载,并在容量恢复后加速运行。
德克萨斯州最近的一项试点项目展示了这种模式在实践中如何运作。
起源于比特币挖矿的公司Luxor Energy与动态管理芯片功耗的软件开发商Bentaus合作。他们共同协调了一台Nvidia B200处理器,这是一种专为人工智能工作负载设计的高性能处理器。
在进行推理任务——即经过训练的人工智能模型生成回复——时,控制软件指示芯片降低其功耗。
据两家公司称,芯片的功耗在半秒内降至基线水平的约25%,导致请求吞吐量暂时减少。
Luxor的首席运营官Ethan Vera告诉CryptoSlate,没有任务失败,也没有进行中的工作丢失。一旦限电期结束,芯片便恢复了全速运行。
Luxor和Bentaus表示,他们的公开演示“未造成中断”,尽管这一说法需要细微的区分。从运营商的角度来看,工作负载成功完成,并在之后恢复了正常性能。
然而,最终用户可能会经历稍长的响应时间,因为在限电窗口期内芯片处理的请求较少。扩展这种灵活性的最终关键在于延迟的频率、受影响的用户群以及最初承诺的服务水平协议。
虽然试点取得了成功,但它仅在一颗芯片上运行。现代数据中心拥有数以万计的处理器,以及复杂的服务器机架、冷却基础设施、存储阵列和网络硬件。
这项测试阐明了一个更广泛的操作概念:人工智能数据中心可以根据紧迫性优先处理工作负载,并在需求高峰期暂时减少电网消耗。
德克萨斯州最清晰地说明了当数据中心发展速度快于电力基础设施扩张时产生的摩擦。
德克萨斯电力可靠性委员会(ERCOT)负责管理该州大部分地区的电网。7月22日,全州用电量达到91,089兆瓦的初步纪录——在最终核实之前,这一数字仍属非官方。
ERCOT估计,一兆瓦电力在高峰时段大约可以为250个家庭客户供电。按照这一标准,创纪录的用电量相当于超过2,200万个家庭的同步需求。
8月,州长格雷格·阿博特宣布,ERCOT正在评估超过474吉瓦新负荷的连接请求,其中约90%来自数据中心。由于一吉瓦等于1,000兆瓦,排队等候的项目理论上需要的电力是ERCOT峰值记录消耗量的五倍以上。
阿博特指示州监管机构在批准之前审计这些项目。
7月28日的初步评估显示,约有205吉瓦拥有足够的文件进入初步研究阶段——不到474吉瓦总管道的一半。随后,州长的审计暂停了该评估。
监管机构在8月20日延长了ERCOT的时间表,该机构承诺在8月31日前发布有条件资格认定。与此同时,开发商继续提交重叠的方案,为未资助的项目保留名额,或为一个未来的园区申请多个站点的电力分配。
德克萨斯州进行审计是因为连接队列已与现实的电网规划参数越来越脱节。
即使考虑到投机性条目,474吉瓦的数字也凸显了对拥有丰富电力供应的土地的激烈竞争。提议的硬件数量远远超过了当前输电线路的容量。
劳伦斯伯克利国家实验室今年发布的一份报告预测,到2030年,数据中心可能消耗美国11.8%的电力,低估为9.5%,高估为15.3%。国际能源署预计,数据中心将推动该国电力需求增长的一半左右,直至本十年末。
尽管有这种预期的需求,但在发达经济体中,输电线路的建设通常需要四到八年。此外,变压器和电缆等关键组件的交货期在过去三年中翻了一番。
虽然人工智能公司以芯片来构想规模,但电气基础设施必须在市政层面进行规划。单个B200处理器的功耗可达1,000瓦。Nvidia规定,完全配置的八GPU DGX B200服务器的最大功耗约为14.3千瓦。鉴于一兆瓦等于1,000千瓦,德克萨斯州对超大电力消费者的监管门槛始于75兆瓦。
使用ERCOT的家庭等效指标,这75兆瓦的门槛在高峰时段大约可以为18,750个客户供电。在原始计算能力方面,它可以支持75,000个一千瓦的GPU,不包括主机处理器、冷却、网络、备用电池和系统效率低下所需的额外电力。
掌握在单芯片级别调节和限制功耗的能力仅仅是迈向管理整个数据中心能源分配的第一步。
现代设施的庞大软件和硬件复杂性正是电网规划者将数据中心归类为“刚性负荷”的原因——这需要保证按需的电力可用性。
运营商努力让昂贵的GPU持续运行,因为每一分钟的停机都会延误可计费的客户工作负载。执行单一大型人工智能任务的数千个处理器在紧密的相互依赖下运行。
在各个阶段,特定的计算集群必须等待其他集群完成才能继续。限制一个部分可能会在整个互联硬件中引发连锁延迟。
并非所有计算任务都需要立即执行或峰值性能。虽然有些工作负载严格受时间限制,但其他工作负载可以容忍延迟或速度降低,影响甚微。某些任务还可以迁移到电力更易获取的替代设施。
每个调度决策都涉及权衡,但都为暂时减少设施从当地电网的瞬时抽取提供了途径。
这种方法借鉴了德克萨斯州电网上的比特币挖矿先例。矿工通过连续运行计算密集型硬件来争夺区块奖励,这意味着任何关机都会导致收入立即损失。
然而,一旦电力恢复,运营几乎可以立即恢复。与交互式服务不同,挖矿不涉及等待的用户或需要保护的脆弱、进行中的计算状态。
德克萨斯州长期以来一直利用一种称为需求响应的机制:激励大型消费者在电力稀缺或昂贵时减少使用。
比特币矿工被证明非常适合这种模式。他们可以在批发价格飙升期间停止运营,因在紧急情况下削减负荷而获得补偿,并通过在关键的夏季高峰期间退出运营来降低传输费用。
ERCOT在4月的一份审查确定,加密货币矿工是其其中一个紧急计划中主要的价格响应参与者。对于矿工来说,经济计算很简单:当节省的一兆瓦的价值超过潜在的比特币收入时,机器就会关闭。
Luxor为比特币矿工提供软件、能源管理服务金融产品,使其对可中断计算有着固有的理解。德克萨斯州的实验测试了面向客户的人工智能基础设施是否能采用类似的电力价格信号响应能力。
随着挖矿业务将电力丰富的站点重新改造为人工智能园区,这个问题变得越来越紧迫。如果电网用可以即时关闭的比特币矿场交换全天候运行的数据中心,它就有失去宝贵应急资源的风险。