Friday, September 11, 2026
AI 인프라 · 뉴스 & 분석
반도체·하드웨어리포트
반도체·하드웨어 · 리포트

Hot Chips 2026에서 엔비디아는 루빈 GPU용 DSX MaxLPS 사이트 전력 관리 아키텍처를 강조하며, 고정된 데이터센터 전력 한도 내에서 추가 컴퓨트 밀도를 어떻게 확보하는지 시연했다.

이 열 및 전기 최적화는 AI 클러스터 확장에서 주요 병목 현상을 직접 해결하여 즉각적인 그리드 용량 증설 없이도 GPU 활용도를 높일 수 있게 합니다.
업계 전문지Slicast · August 27, 2026 · 글로벌 · 출처: Tom's Hardware
중요도 88

별 CPU, GPU 및 칩 성능이 랙 규모 AI 시스템에 관한 논의에서 종종 주를 이루지만, 궁극적인 제약 조건은 여전히 시설로 공급되고 그 랙들에 분배될 수 있는 전력의 양입니다. 이러한 전력을 효율적으로 관리하고 할당하는 것은 이제 차세대 데이터 센터 설치에서 생산성을 극대화하기 위한 주요 관심사가 되었습니다. Nvidia의 Hot Chips 2026 발표에서 Rubin GPU와 관련하여 회사는 이 같은 하드 용량 한계를 강조하며, 고정된 시설 전력 예산인 100 MW 내에서 Vera Rubin NVL72 시스템이 제공할 수 있는 컴퓨팅 성능이 얼마나 되는지 부각했습니다.

Nvidia에 따르면, Vera Rubin의 내부 전력 관리 기술과 DSX MaxLPS(Land, Power, Shell) 설계 및 사이트 수준의 동적 전력 관리 도구 세트를 결합하면 운영자가 해당 100 MW 범위 내에서 약 40,000개의 차세대 GPU 또는 약 40개의 Rubin DGX SuperPOD를 프로비저닝할 수 있습니다. Nvidia는 이 하드웨어가 NVFP4 추론을 위해 최대 2 zettaFLOPS(ZFLOPS), NVFP4 학습을 위해 최대 1.4 ZFLOPS를 제공하기를 기대합니다. 공개적으로 이용 가능한 Rubin 사양을 기준으로 볼 때, 이러한 성능 수치는 측정된 벤치마크보다는 추정치로 간주해야 합니다. 다양한 운영 요인으로 인해 실제 워크로드에서는 FLOPS가 낮게 나타날 가능성이 높습니다. 그럼에도 불구하고 기본 전제는 유효합니다. 제한된 전력 예산에서 최대 컴퓨팅 성능을 추출하려면 모든 전기 구성 요소에 대략적인 피크 전력 소비량을 단순히 적용하는 것보다 훨씬 정교한 계획, 모니터링 및 시설 관리가 필요합니다.

역사적으로 데이터 센터 운영자는 정적 전력 프로비저닝에 의존해 왔으며, 이는 랙당 고정된 최악의 경우 전력 피크를 기반으로 한 가정들을 바탕으로 했습니다. 이러한 접근 방식은 종종 전력 예산을 불필요하게 늘리고 이론적 한계에 거의 도달하지 않거나 전혀 도달하지 않는 랙에 할당된 용량이 방치되게 만듭니다. 정적 체계 하에서는 랙 간 애플리케이션 부하 차이를 해결하기 위해 전력을 재라우팅할 수 없습니다. 결과적으로 저이용 랙은 전력이 유휴 상태로 남는 반면, 고부하 시스템은 여전히 보수적인 가드 밴드에 부딪혀 클러스터 전체 성능이 제한됩니다.

DSX MaxLPS 접근 방식은 칩, 랙 및 랙 그룹 수준에서 사용량을 지속적으로 모니터링하는 지능형 동적 전력 할당_scheme_을 구현함으로써 이러한 한계를 해결합니다. Nvidia의 Dynamic Power Software 제어 루프는 워크로드 특성이나 유휴 리소스로 인해 발생한 미사용 용량을 식별하고, 특정 시점에 가장 필요한 시스템으로 이를 재배포합니다. 이를 통해 시설의 수명 주기 동안 설치 가능한 시스템 수와 와트당 전반적인 성능을 모두 극대화할 수 있습니다.

현재 GB300 랙을 사용한 측정 예시에서 Nvidia는 이러한 전환의 실질적인 영향을 입증했습니다. 540 kW의 전력 예산과 정적 프로비저닝 환경下에서 운영자는 일반적으로 실제 워크로드 측정치가 아닌 피크 소비량을 기준으로 프로비저닝하여 135 kW 시스템 4대를 설치할 수 있습니다. 그러나 실제로는 랙 활용도의 불균형으로 인해 해당 예산 중 최대 170 kW가 종종 미사용 상태로 남아 있습니다. Nvidia의 NVL72와 같은 현대식 랙 규모 아키텍처를 사용하면 이렇게 회수된 용량을 안전하게 추가 시스템 수용에 활용할 수 있습니다. 5대의 동적으로 프로비저닝된 시스템에 걸쳐 피크 여유분을 위해 할당된 예비 전력을 크게 줄일 수 있습니다.

랙 수준에서 DSX MaxLPS는 워크로드별 전력 프로필을 통해 추가적인 유연성을 도입합니다. 클라이언트 PC의 조용함, 균형, 고성능 모드와 유사하게 Nvidia는 추론, 학습, 일반 메모리 바운드 또는 컴퓨팅 바운드 워크로드 등 특정 작업에 맞춰 개발된 랙별 프로필을 만들었습니다. Nvidia는 측정된 Rubin 전력 또는 와트당 성능 결과를 게시하지 않았지만, 이전 세대 하드웨어를 사용하여 MaxLPS 개념을 검증했습니다. DeepSeek-R1을 실행하는 Grace Blackwell GB300 시스템의 경우, 기존 고정 피크 체제에서는 GPU TGP를 1,400 W, 추정 랙 전력 소비량을 136 kW로 가정했습니다. MaxLPS를 적용하면 전달된 성능에 영향을 주지 않으면서 일반적인 GPU TGP를 1,000 W, 총 랙 전력 소비량을 101 kW로 줄였습니다. 이러한 더 좁은 작동 범위는 직접적으로 와트당 높은 성능, 동일한 공간 내 더 높은 랙 밀도, 그리고 데이터 센터 운영자 및_tenants_의 토큰 출력 증가로 이어집니다.

MaxLPS를 처음부터 고려하여 시설을 설계하면 장기적인 운영 유연성도 제공됩니다. 최첨단 하드웨어를 갖춘 학습 중심 시설로 초기에 배포된 사이트는 자연스럽게 랙당 사이트 전력의 더 큰 비중을 요구하게 됩니다. 따라서 운영자는 즉시 사용 가능한 모든 바닥 공간을 채우지 않을 수도 있습니다. 학습 워크로드가 새로운 하드웨어 세대로 마이그레이션되고 구형 시스템이 추론 역할로 전환됨에 따라 GPU당 및 랙당 전력 요구량은 감소합니다. 동적 전력 프로비저닝이 가능한 시설은 그러면 해방된 용량을 활용하여 동일한 공간 내에서 추가 하드웨어를 배포하여 수익 창출 처리량을 높일 수 있습니다.

Vera Rubin 하드웨어를 도입하는 데이터 센터를 위한 MaxLPS의 또 다른 중요한 구성 요소는 더 높은 액체 냉각제 온도의 채택입니다. 전액체 냉각 방식인 Rubin NVL72 랙은 이전 액체 냉각 세대보다 현저히 높은 45 °C의 입구 냉각제 온도에서 작동하도록 설계되었습니다. 이 '건조 냉각' 전략이 중요한 이유는 증발되지 않는 시스템에서 폐열을 배출하는 데 사용되는 기계식 냉각기가 전통적으로 사이트 전력 예산의 상당 부분을 차지해 왔기 때문입니다. Nvidia에 따르면 과거 설치 사례에서는 최대 40%까지 소모되기도 했습니다. 서버 전력 프로비저닝과 마찬가지로 냉각기는 연중 대부분의 시간 동안 용량 이하로 운영되더라도 최악의 열 시나리오를 위해 과대 평가되는 경향이 있었습니다. 이러한 용량을 방치하면 유리한 조건 동안 컴퓨팅 워크로드에 대해 동적으로 재할당하는 것이 불가능해집니다. 냉각기는 최고 외부 기온 동안 여전히 필요하지만, 더 높은 냉각제 온도는 일반적으로 더 많은 사이트 전력을 생산적인 연산에 배분할 수 있게 하여 표준 운영 조건에서 시설의 전력 사용 효과(PUE)를 개선합니다.

공공 유틸리티로부터 공급되거나 계기 후측(back-of-the-meter)에서 생성되는 AI 데이터 센터용 전력 가용성은 당분간 가장 중요한 제약 조건 중 하나로 남을 것이며, 이는 Hot Chips의 여러 발표자들이 공통으로 제기한 우려입니다. Nvidia의 DSX MaxLPS 프레임워크는 이러한 희소한 자원을 동적으로 할당하기 위한 필수 구성 요소를 제공하여, 운영자가 Rubin 기반 시설에서 와트당 최대 성능을 추출할 수 있도록 합니다. 전력 소비가 계속 확대됨에 따라 시설 전력 관리와 달성 가능한 컴퓨팅 성능 간의 상호 작용은 전략적 중요성에서 더욱 커질 것입니다.

원문 보기