AI 워크로드 및 GPU 클러스터의 대규모 전력 소비 수요에 대비하기 위해 데이터센터를 준비하는 방법에 대한 업계 지침이 제시되었습니다.
엔터프라이즈 환경에서 인공지능(AI)이 급속히 확산됨에 따라 데이터센터의 전력 사용량이 중대한 과제로 대두되고 있습니다. AFCOM의 데이터센터 조직에 따르면, 일반적인 엔터프라이즈 애플리케이션을 실행하는 데이터센터의 랙당 평균 전력 소비량은 약 7kW이지만, AI 애플리케이션은 일반적으로 랙당 30kW 이상의 전력을 사용합니다. 이러한 극적인 차이는 특히 전력 소모가 큰 GPU와 같이 프로세서 가동률을 훨씬 더 높여야 하는 AI의 요구사항에서 기인합니다. 예를 들어 Nvidia GPU는 CPU보다 수배수에서 수십 배 빠른 속도로 작동할 수 있지만, 칩당 전력 소비량은 두 배에 달합니다. 이 문제는 많은 데이터센터가 이미 전력 공급에 제약이 있다는 사실로 인해 더욱 복잡해집니다. 또한 AI 전용 서버는 더 많은 칩이 매우 높은 온도에서 작동하므로 처리 밀도를 높여야 하며, 이는 가동률 증가와 함께 냉각 수요를 더욱 증대시킵니다.
액체 냉각(Liquid cooling)은 전통적인 공기 냉각의 한계를 넘어선 시설을 위한 중요한 해결책으로 부상하고 있습니다. 팬 기반 냉각은 일반적으로 랙의 전력 소비가 15kW를 초과하면 실용성이 떨어지지만, 기업용 액체 냉각 제품 제조사 CoolIT Systems에 따르면 물은 공기보다 열 용량이 3,000배 더 큽니다. 데이터센터 개발 및 운영사인 Sabey의 데이터센터 운영 담당 부사장 John Sasser는 "액체 냉각은 고밀도 부하에 대해 확실히 매우 좋은 옵션입니다. 이는 복잡한 공기 흐름 문제를 제거해 줍니다. 물은 공기보다 훨씬 많은 열을 제거하며 파이프를 통해 직접 전달할 수 있습니다. 고성능 컴퓨팅(HPC) 작업의 상당 부분이 액체 냉각으로 수행됩니다."라고 설명했습니다. 액체 냉각에는 자본 투자가 필요하지만, Sasser는 "특히 기업이 AI 방향으로 나아가기로 결정한다면 이러한 노력에 대해 훨씬 더 현명한 솔루션이 될 수 있다"고 언급했습니다.
하드웨어 솔루션 외에도 계산적 접근 방식을 통해 전력 수요를 줄일 수 있습니다. Hyperion Research의 수석 연구 부사장 Steve Conway는 많은 워크로드가 64비트 더블 정밀도 대신 절반 또는 분의 일 정밀도로 작동할 수 있다고 지적합니다. Conway는 "일부 문제의 경우 절반 정밀도면 충분하다"며 "더 낮은 해상도와 적은 데이터로 실행하거나, 과학적 연산을 줄여서 처리할 수 있습니다"라고 말했습니다. 더블 정밀도 계산은 주로 분자 수준의 과학 연구에 필요하며, 딥러닝 모델의 AI 학습 및 추론에는 일반적으로 이러한 수준의 정밀도가 필요하지 않습니다. 심지어 Nvidia조차도 심층 신경망에서 싱글 정밀도 및 절반 정밀도 계산을 권장하고 있습니다.
실무 구현에는 전략적인 인프라 계획이 필요합니다. 데이터센터를 구축 및 운영하는 Five 9s Digital의 파트너 Doug Hollidge는 새로운 시설에 대해 높은 전력 사용을 허용하는 부분에 일부만 할당할 것을 조언하며, "다른 앱들은 전력 소모가 낮기 때문에 모든 시설을 고밀도로 전환할 수는 없습니다"라고 말했습니다. 첫 번째 단계는 건물의 에너지 공급을 평가하여 전력 공급 업체가 용량을 늘릴 수 있는지 확인하는 것입니다. 데이터센터 건설사 QTS의 최고혁신책임자(CIO) David McCall은 AI 시스템을 특정 랙에 집중시키기보다는 여러 랙에 분산시켜, 대부분의 애플리케이션이 8~10kW에서 최대 15kW 수준에서 작동하는 반면 더 밀도 높은 AI 워크로드와 함께 전체 랙 전력 소비량이 12~15kW 범위로 유지되도록 하는 이종 환경을 구성할 것을 권장합니다. 이 범위라면 공기 냉각으로도 관리가 가능합니다. Hollidge는 "모든 데이터센터가 서로 다르기 때문에 만능 해결책을 제시하기는 어렵습니다"라고 강조하며, 특정 워크로드 요구사항에 기반하여 시설의 어느 부분이 고밀도 기능을 가장 잘 수용할 수 있는지 결정하기 위한 엔지니어링 평가의 중요성을 강조했습니다.