AI 전력 급증이 핵심 데이터센터 장비를 손상시키고 지역 전역에 걸쳐 전력망 안정성을 흔들고 있습니다.
AI 데이터센터의 전력 수요가 급격히 변동하면서 핵심 장비에 부담을 가중시키고 있으며, 이로 인해 배터리, 발전기 및 냉각 시스템이 예상보다 훨씬 빠르게 고장 나거나 마모되고 있다. AI 붐이 가속화됨에 따라 이러한 기술적 문제는 추가 비용과 예측 불가능한 신뢰성 문제를 초래하며, 가동 중단 시간이 몇 분만 발생해도 데이터센터 개발사의 수익에 직격탄이 된다. 이는 투자자와 대출 기관들이 이미 하이퍼스케일러들의 수천억 달러 규모 지출에 대해 우려를 표명하고 있는 시점과 맞물려 발생하고 있으며, 이러한 시설이 추정치보다 훨씬 빠르게 감가상각될 수 있다는 우려도 커지고 있다.
이러한 문제들은 이미 전력을 공급하는 데 어려움을 겪고 있는 광범위한 전력망에서 더 큰 불안정성의 원인이 될 잠재력을 가지고 있다.
"AI는 매우 특이한 전력 수요를 창출합니다." 영국 업타임 인스티튜트(Uptime Institute)의 수석 컨설턴트인 암버 빌레가스-윌리엄슨(Amber Villegas-Williamson)은 전기 공급업체와 데이터센터에 대한 표준 및 신뢰성에 자문을 제공하는 이 기관의 입장을 대변하며 이렇게 말했다. "이는 일정한 속도를 유지할 때보다 엔진을 과회전시킬 때 엔진이 더 빨리 마모되는 것과 같습니다."
데이터센터는 수십 년간 존재해 왔으며, 스트리밍 서비스부터 온라인 식료품 주문까지 모든 것이 원활하게 작동하도록 보장하는 동안 막대한 전력을 소비해 왔다. 그러나 AI 컴퓨팅을 위해 설계된 시설은 그 수요가 매우 크고 변동 폭이 훨씬 더 극심하다는 점에서 다르다. 공장, 도시 또는 심지어 도시에 해당하는 소비량에 버금가는 전력 증감이 몇 초 안에 나타나고 사라지며, 연결된 장비가 흡수하기 어려운 반복적인 충격을 생성한다.
마인스프링 에너지(Mainspring Energy Inc.)의 창립자이자 사장이며 산업용 및 데이터센터 고객을 위한 마이크로그리드 프로젝트에 종사하는 섀넌 밀러(Shannon Miller)는 1기가와트(GW) 규모의 데이터센터는 보스턴(Boston) 크기의 도시와 동일하며, 그 중 절반이 몇 초마다 깜빡이며 켜졌다 꺼질 수 있다고 말했다. 텍사스, 미드웨스트 및 기타 주에서 계획 중인 일부 AI 캠퍼스는 이보다 5배 이상 크며, 평균적으로 뉴욕시(New York City)와 거의 동일한 양의 전력을 소비한다.
새로운 모델을 학습(training)할 때 AI 데이터센터는 전력 공급에 특히 큰 부담을 준다. 이 과정에서는 모든 그래픽 처리 장치(GPU)가 일제히 동원된다. 벌떼가 무리를 짓거나 물고기 떼가 방향을 전환하는 디지털 equivalents처럼, 수십만 개의 GPU가 밀리초 단위로 전원 공급이 끊겼다 이어졌다 한다.
때때로 AI의 전력 사용량은 설계 용량의 최대 50%까지 치솟는다. "따라서 1기가와트 규모의 시설은 잠시 동안 1.5기가와트를 사용할 수 있습니다."라고 테슬라(Tesla) 전 임원이자 2027년 출시 예정인 엔비디아(Nvidia)의 차세대 서버용 더욱 에너지 집약적인 장비의 전력 변동을 관리하기 위한 장비를 개발 중인 헤론 파워 일렉트로닉스(Heron Power Electronics Co.)의 설립자 드루 바글리노(Drew Baglino)는 말했다.
대부분의 장비는 이러한 대규모 전력 소비 변동을 고려하여 설계되지 않았다. 에너지 저장 솔루션 개발사 테라플로우 에너지(Terraflow Energy)의 최고경영자(CEO) 존 파라렐라(Jon Parrella)는 이를 페라리(Ferrari)를 운전하면서 6단 기어에서 바로 1단 기어로 변속하는 것에 비유했다. "그렇게 빠르게 변속할 수는 없습니다,"라고 그는 말했다.
본 보도는 미국과 유럽의 30여 명 이상의 전력 전문가들을 대상으로 한 인터뷰를 바탕으로 작성되었으며, 여기에는 발전기 및 기타 전력 공급업체, 데이터센터 개발사, 그리드 운영사, 유틸리티 기업, 투자자, 표준 개발사, 보험사 및 규제 당국이 포함되었다. 이들 대부분은 시설에 가해지는 물리적 스트레스가 명확하게 드러나고 있다고 밝혔다.
소형 천연가스 내연기관을 사용하여 데이터센터에서 전력을 생산하는 크랭크축이 부러진 사례가 여러 건 보고되었다. 테네시주 멤피스에 위치한 xAI의 콜로서스(Colossus) 컴퓨팅 시설에서는 가스 터빈에 균열이 발생한 것으로 알려졌다. 해당 시설에 정통한 한 사람에 따르면, 전력 변동을 완화하고 회전식 터빈에 가해지는 부담을 줄이기 위해 시스템 내에 배터리를 설치했다. xAI의 모회사인 스페이스X(SpaceX)는 코멘트 요청에 응답하지 않았다.
영국에서도 훨씬 작은 규모의 데이터센터에서 터빈 균열 문제가 발생했다고, 일부 사이트에서 전력 흐름을 안정화하기 위해 연료전지용 수소를 공급하는 지오푸라(GeoPura Ltd.)의 CEO 앤드류 커닝햄(Andrew Cunningham)은 말했다.
UL Solutions Inc.의 CEO인 제니퍼 스캔런(Jennifer Scanlon)은 균열이나 장비 마찰이 전기 아크 플래시(도체 사이를 전류가 점프하는 현상)를 유발할 수 있으며, 이는 잠재적으로 AI 칩을 손상시킬 수 있다고 지적했다.
배터리, 커패시터, 변압기 및 플라이휠 등 일련의 장비는 전력 흐름을 안정화하는 데 도움이 될 수 있다. 그러나 전문가들은 AI 컴퓨팅 용량을 신속하게 확보하려는 경쟁 속에서 새로운 데이터센터에 이러한 기술이 충분히 활용되지 않고 있다고 밝혔다. 업타임 인스티튜트 및 운영사와 협력하는 다른 관계자에 따르면, 이러한 목적으로 설치된 배터리가 높은 하중으로 인해 수개월甚至 수주 만에 교체되어야 했던 경우도 있었다. 이러한 문제는 중동과 아프리카, 유럽, 미국 등 전 세계 데이터센터에서 관찰되고 있다고 빌레가스-윌리엄슨은 말했다.
이러한 문제들은 이미 일부 AI 컴퓨팅 시설의 지연이나 운영 축소, 따라서 수익 감소로 이어지고 있다. 웨스트텍사스(West Texas)에 계획된 2.67기가와트 규모의 AI 캠퍼스가 마이크로소프트(Microsoft)가 요구하는 99.999%의 신뢰성을 달성할 수 있도록 하기 위해, 에너지 거인 체이브론(Chevron Corp.)과 함께 해당 시설을 개발 중인 저울런트(Joulent Inc.)의 CEO 크리스 제임스(Chris James)는 엔지니어링 기간을 일정표에 추가로 반영했다고 밝혔다. 그는 전력 공급 시작 시기가 2027년이 아닌 2028年为로 연기될 것이라고 말했다.
필수 장비가 조기에 고장 날 경우, "재정적 영향은 펌프나 차단기 또는 일부 전력 구성 요소의 교체 비용이 아닙니다. 그것은 오프라인 상태이기 때문에 수익을 창출하지 못하는 비싼 컴퓨팅 용량의 가치 손실입니다."라고 데이터센터 건설 및 운영사 스위치(Switch)의 최고전략책임자(CSO) 제이슨 호프먼(Jason Hoffman)은 말했다.
손실된 수익 측면에서의 다운타임 비용은 시설 유형과 워크로드에 따라 분당 수천 달러에서 수십만 달러까지 광범위하게 다양하다. 이러한 시설의 자금 조달에 관여한 한 사람은 데이터센터가 온라인으로 전환되면 1년 365일 내내 24시간 운영될 것이라는 가정하에 구축된다고 말했다. 실제로 일부 시설은 가동률이 80% 수준에 머물고 있으며, 이것이 해결되지 않으면 특정 프로젝트의 투자자들에게 향후 12~24개월 내에 타격을 줄 수 있다고 이 사람은 덧붙였다.
신뢰성과 관련된 어떠한 문제들도 수천억 달러 규모의 계획된 AI 투자에서 기대되는 수익에 대한 광범위한 우려를 가중시킨다. 데이터센터의 또 다른 중요한 장비인 GPU 랙 자체의 감가상각율이 높아지면서, 해당 산업이 약속한 만큼 수익성이 있을지에 대한 의문이 제기되고 있다.
이러한 신뢰성 문제는 또한 광범위한 전력망을 불안정하게 만들 잠재력을 가지고 있다. 고전압 라인, 변압기 및 발전기로 이루어진 이 방대한 네트워크는 지속적인 교정이 필요하지만, 노후화된 장비, 증가하는 수요 및 극단적인 날씨로 인해 매년 더 어려워지고 있다. 시간별 공급량이 크게 변동하는 간헐적인 풍력 및 태양광 발전의 확대는 이미 불안정 요인으로 작용하고 있다. AI 데이터센터는 이러한 변동성을 더욱 증폭시킬 수 있다.
"이러한 부하는 매우 역동적이거나 변동성이 커서 그리드 불안정성을 초래하며, 수정되지 않을 경우 잠재적인 정전이나 전력 장애로 이어질 수 있습니다."라고 테네시주 내슈빌에 위치한 슈나이더 일렉트릭(Schneider Electric)의 전력 품질 전문가이자 글로벌 오너 매니저인 스리만트 로이(Sreemant Roy)는 말했다. 그는 특히 데이터센터가 전력 흐름에서 아동기 진동(sub-synchronous oscillations)을 유발하여 네트워크의 다른 부분에 연결된 장비를 손상시킬 수 있는 능력이 우려된다고 강조했다.
"그것이 전 세계 유틸리티 회사들을 매우 걱정하게 만들고 있습니다,"라고 로이는 말했다.
지난 2년 동안, 조명 유지라는 목표를 가진 기준을 설정하는 미국의 최상위 규제 기관인 북미전기신뢰성공사(North American Electric Reliability Corp., NERC)는 데이터센터가 그리드 안정성에 있어 가장 큰 위험 중 하나라고 경고하고 경고를 발령해 왔다. NERC는 9월 보고서에서 미국 내 운영 중인 데이터센터 33기가와트(GW) 이상의 데이터를 평가했으며, 부하 모델의 약 4분의 3이 "데이터센터의 동적 거동을 나타내기에는 불충분하다"고 밝혔다. 올해 초, 해당 기관은 대형 데이터센터가 이러한 즉각적인 위험을 해소하고 8월 3일까지 대응 방안을 제출하도록 요구하는 희귀한 레벨3 경고를 발령했다.
최고층부터 최하층까지 AI 산업은 이러한 문제들을 인지하고 적극적으로 해결책을 모색하고 있다. 칩 제조사인 엔비디아(Nvidia)는 2024년 처음 출시되어 데이터센터 전반에 널리 퍼진 블랙웰(Blackwell) GPU를 개발할 때 전력 전문가들과 더 긴밀히 협력하기 시작했다고, 하이퍼스케일 인프라 솔루션 담당 수석 이사 디온 해리스(Dion Harris)는 말했다. "우리는 칩과 프로세서를 구축하고 있지만, 또한 [원문에서 텍스트가 잘린 것으로 보임]."