Friday, September 11, 2026
AI 인프라 · 뉴스 & 분석
반도체·하드웨어리포트
반도체·하드웨어 · 리포트

NVIDIA는 전력 효율(와트당 성능으로 측정됨)이 AI 팩토리의 결정적인 제약이라고 주장하며, po

NVIDIA 공식 — 로드맵/제품 직접 확인
공식 공시Slicast · July 28, 2026 · 미국 · 출처: NVIDIA Blog

력은 AI 인프라의 피할 수 없는 제약 조건입니다. 고정된 전력 예산 내에서 AI 공장이 생성할 수 있는 토큰 수는 수익성과 수익성을 결정합니다. 실제 운영 결과를 통해 입증될 뿐, 조작할 수 없는 지표인 와트당 성능은 AI 공장의 기반이 됩니다. 에이전틱 AI가 토큰 수요를 증가시킴에 따라, 조직들이 오늘 내리는 인프라 결정은 전력 제약 환경에서 누가 확장하고 누가 그렇지 않을지를 결정하게 될 것입니다.

현재 거의 모든 최첨단 AI 모델은 전문가 혼합(Mixture-of-Experts, MoE) 아키텍처 위에서 구동됩니다. 이러한 대규모 모델을 효율적으로 서빙하려면 GPU 도메인 크기—초고속 스케일업 인터커넥트를 통해 연결된 GPU의 수—가 중요하며, 더 큰 것이 더 좋습니다. NVIDIA Hopper 세대가 8개 GPU 도메인으로 기준을 정립했지만, 현재 최첨단 AI의 규모는 이를 넘어섰습니다. 72개 GPU 도메인으로 MoE를 서빙하려면 풀스택 코드사이닝과 실제 프로덕션 부하 하에서 이러한 모델을 운영함으로써 얻어진 운영 깊이가 요구됩니다.

NVIDIA Blackwell NVL72 플랫폼에서는 이러한 기반이 이미 구축되고 검증되었으며, 최대 수익을 위한 최고 와트당 성능과 최대 마진 향상을 위한 최저 토큰 비용을 제공합니다. NVIDIA Vera Rubin 플랫폼은 이 기반 위에 추가로 랙 규모 에너지 효율성을 한층 높입니다. 최신 세대 주요 오픈 모델 전반에 걸쳐 NVIDIA GB300 NVL72는 NVIDIA Hopper 세대에 비해 와트당 성능이 최대 25배 향상되어, 8개 GPU 도메인에서 72개 GPU 도메인으로 이동할 때 MoE 성능이 개선됨을 보여줍니다.

다양한 워크로드는 서로 다른 작동 지점을 요구합니다: 일부는 지연 시간 최적화에, 다른 일부는 처리량과 비용 최적화에 중점을 두며, 대부분의 경우 두 가지 사이를 오갑니다. 단일 수치만 제시하는 대신, NVIDIA는 각 모델에 대해 파레토 곡선을 제공하며, GPU 시간을 검증에 사용하기 전에 팀이 파레토 프론티어 상의 최적 지점을 찾을 수 있도록 DynoSim과 같은 도구를 제공합니다.

NVIDIA Blackwell이 제공하는 와트당 성능 결과는 랙 규모 시스템의 실리콘부터 소프트웨어에 이르기까지 모든 구성 요소가 AI 추론 워크로드의 토큰 처리량을 극대화하도록 함께 설계된 극한의 코드사이닝에서 비롯됩니다. Vera Rubin 플랫폼으로 여섯 번째 세대를 맞이한 NVIDIA NVLink Switch는 방대한 스케일업 GPU 도메인을 해제하기 위해 특별히 설계되었으며, 스위치 내에서 직접 네트워크 컴퓨팅을 수행하는 SHARP와 같이 AI 워크로드에 특화된 기능을 포함합니다. NVIDIA Dynamo, TensorRT LLM, SGLang, vLLM을 포함한 NVIDIA 추론 소프트웨어 스택은 NVFP4 양자화부터 KV 캐시 오프로딩에 이르기까지 광범위한 최적화를 실행합니다. DeepSeek V4의 경우, 소프트웨어 개선만으로 단 한 달 만에 와트당 성능이 최대 5배 향상되었습니다.

AI 공장에서는 냉각 및 랙 수준의 비효율성으로 인해 손실되는 전력이 있으므로, 그리드에서 끌어온 전기의 약 60%만 유용한 AI 작업으로 전환됩니다. NVIDIA DSX 플랫폼의 전력 및 효율성 소프트웨어인 NVIDIA DSX MaxLPS는 GPU와 랙 간 실시간 전력 전환 및 파워 스티어링(Power Steering)과 같은 기법을 활용하여 추가 성능을 끌어냄으로써 이러한 격차를 해소합니다. 이를 통해 운영자는 동일한 전력 예산 내에서 최대 40% 더 많은 GPU를 가동할 수 있습니다.

AI 공장 규모의 랙 규모 신뢰성은 쉽게 달성되지 않으며, 단일 노드 배포에서는 결코 마주치지 않는 고장 모드를 도입합니다. NVIDIA Blackwell NVL72 시스템은 다양한 모델과 프로덕션 사용 사례 전반에 걸쳐 기준을 계속 설정하고 있습니다. Anthropic, OpenAI, SpaceXAI를 비롯한 선도적인 AI 연구소들은 추론 서비스를 제공하는 기업들과 오픈 모델을 프로덕션에 배포하는 AI 네이티브 기업들과 함께 NVIDIA Blackwell NVL72 시스템을 사용하여 추론을 실행합니다. CoreWeave는 NVFP4 양자화와 EAGLE3 예측 디코딩을 결합하여 Kimi K2.6을 NVIDIA GB300 NVL72에 배포했습니다. Perplexity는 매일 수백만 건의 쿼리를 서빙하는 자체 AI 에이전트 플랫폼을 위해 Qwen3 235B와 사후 훈련된 Qwen3.5-397B-A17B를 NVIDIA GB200 NVL72에서 실행합니다. Fireworks AI는 Cursor와 Factory AI를 포함한 고객들을 위해 GLM 5.2를 NVIDIA Blackwell 플랫폼에 배포합니다. 최첨단 모델과 실제 세계 배포 전반에 걸친 이러한 축적된 프로덕션 경험은 NVIDIA Vera Rubin의 기반이 됩니다.

원문 보기