Friday, September 18, 2026
AI 인프라 · 뉴스 & 분석
헤드라인리포트
헤드라인 · 리포트

엔비디아 베라 루빈 NVL72 시스템은 MLPerf Inference v6.1 데뷔 제출에서 엔비디아 GB300 NVL72 대비 추론 처리량 최대 3.7배 향상 달성

이러한 성능 도약은 엔비디아의 차세대 실리콘 로드맵을 입증하며, 하이퍼스케일러 추론 클러스터 조달 사양에 새로운 기준을 제시한다.
업계 전문지Slicast · 2026년 9월 17일 13:17 UTC · 글로벌 · 출처: HPCwire
중요도 85

2026년 9월 17일 — 시스템 성능, 효율적인 인프라 확장, 그리고 지속적인 소프트웨어 최적화는 AI 추론 경제학을 결정하는 주요 레버리지입니다. 더 높은 시스템 성능은 더 많은 생성 토큰을 의미하며, 이는 곧 더 높은 수익으로 직결됩니다. 효율적인 확장은 하드웨어 추가 시 처리량이 비례하여 증가하도록 보장하여 대규모 사용자 제공에 필요한 자원을 최소화합니다. 지속적인 최적화는 인프라 투자에서 추출할 수 있는 가치를 극대화합니다. 이 세 가지 모두를 뒷받침하는 것은 플랫폼의 상호 운용성입니다: 동일한 인프라로 학습부터 추론, 추천 시스템부터 추론, 언어 모델부터 비디오 모델에 이르기까지 모든 모델과 워크로드를 실행할 수 있어 가동률을 높게 유지할 수 있습니다.

NVIDIA 플랫폼은 이러한 차원 전반에서 최적화를 위해 특별히 설계되었으며, 오늘 공개된 MLPerf Inference v6.1 결과를 통해 입증되었습니다. 첫 MLPerf Inference 미리보기 제출에서 NVIDIA Vera Rubin NVL72는 GB300 NVL72 대비 최대 3.7배 향상된 처리량을 달성했습니다. 한편, 네 대의 GB300 NVL72 랙에 걸쳐 288개 GPU를 사용한 제출에서는 단일 랙 기준선 대비 처리량이 거의 선형적으로 증가하며 99%의 확장 효율성을 달성했습니다. 또한 NVIDIA의 MLPerf Inference v6.1 제출에 포함된 소프트웨어 최적화는 v6.0 대비 최대 1.6배 더 높은 성능을 제공했으며, 제출 이후에도 추가적인 개선이 이루어졌습니다. AI 인프라 결정을 내리는 조직에게 성능, 확장 효율성, 소프트웨어 개발 속도는 장기적인 추론 경제학을 형성하는 데 중요한 고려 사항으로 남아 있습니다.

NVIDIA는 MLPerf Inference v6.1 스위트 중 가장 요구 사항이厳しい 두 가지 벤치마크인 DeepSeek-R1과 Qwen3-VL에 대해 Vera Rubin NVL72 미리보기 결과를 제출했습니다. Qwen3-VL의 경우, NVIDIA Dynamo 오픈소스 추론 프레임워크와 함께 vLLM을 사용할 때 Vera Rubin NVL72는 오프라인, 서버, 인터랙티브 시나리오 전반에 걸쳐 GB300 NVL72 대비 최대 3.7배 더 높은 처리량을 제공합니다. DeepSeek-RL의 경우, NVIDIA TensorRT-LLM 라이브러리를 활용하여 처리량이 GB300 NVL72 대비 최대 2.5배 더 높습니다. 이러한 초기 결과는 NVIDIA의 가속화된 혁신 속도를 강조하며, 지속적인 소프트웨어 최적화를 통해 성능이 계속 향상될 것임을 보여줍니다. 결과적으로 각 Vera Rubin NVL72 랙은 GB300 NVL72 랙보다 훨씬 더 많은 토큰을 생성하고, 더 많은 사용자를 서비스하며, 더 많은 수익을 발생시키면서도 토큰당 비용은 낮춥니다.

이러한 성능은 하드웨어와 소프트웨어 간의 풀스택 공동 설계의 반영입니다. Vera Rubin의 강화된 Tensor Cores와 Transformer Engine은 추론의 프리필(prefill) 및 디코드(decode) 단계를 모두 가속화하며, NVFP4 정밀도는 모델 가중치, 어텐션 메커니즘, KV 캐시 전반의 메모리_footprint_를 줄여 출력 품질의 최소 손실로 처리량을 증가시킵니다. Vera Rubin 제출은 disaggregated serving(분산 서비스)을 적극 활용했으며, 프리필과 디코드를 분리하고 대규모 전문가 병렬 처리(expert parallelism)를 결합하여 DeepSeek-R1 및 Qwen3-VL 같은 모델을 구동하는 mixture-of-experts 계층 전반의 효율성을 극대화했습니다. 6세대 NVIDIA NVLink 및 NVLink Switch로 구동되는 NVL72 스케일업 도메인은 상용 이더넷 대비 10배 더 높은 패킷률과 3배 더 낮은 지연 시간을 제공하여, 랙 규모에서 이러한 기법이 효과적이도록 하는 인터커넥트 기반을 마련합니다. 이러한 공동 설계는 NVIDIA 파트너 생태계로도 확장됩니다. Nebius 역시 Vera Rubin NVL72 미리보기 결과를 제출하여 우수한 성능을 입증했습니다.

여러 단계에 걸쳐 추론, 계획, 행동을 수행하는 AI 에이전트는 추론 성능 측정 방식을 재편하고 있습니다. 이러한 변화를 포착하기 위해 설계된 SemiAnalysis AgentX와 같은 벤치마크에서 Vera Rubin NVL72는 미리보기 테스트 중 GB300 NVL72 대비 30배 더 나은 성능을 보여주었습니다. furthermore, 다가오는 MLPerf Endpoints 벤치마크는 전통적인 처리량 벤치마크가 포착하는 범위를 넘어 에이전틱 추론 워크로드에 대한 표준화된 측정을 도입할 예정입니다.

확장 효율성—추가 GPU가 처리량 향상으로 얼마나 효과적으로 전환되는지—is AI 인프라 생산성의 핵심 척도입니다. NVIDIA는 각 랙 내의 고대역폭 저지연 스케일업 인터커넥트, 랙 간 고대역폭 네트워킹, 그리고 노드 간 효율적인 요청 오케스트레이션을 통해 이를 달성합니다. NVIDIA의 DeepSeek-R1(DSR1) 제출은 단일 GB300 NVL72 랙(72개 GPU)에서 네 대의 랙(288개 GPU)으로 확장되며, 오프라인 시나리오에서 99%의 확장 효율성을 달성했습니다. 처리량은 추가된 하드웨어에 거의 비례하여 성장했습니다. 확장 효율성이 중요한 이유는 더 많은 GPU를 추가한다고 해서 자동으로 비례하는 처리량 향상이 이루어지지 않기 때문입니다. GPU 수를 두 배로 늘렸을 때 한 자리 숫자 퍼센트의 향상만 얻는다면 인프라 비용이 성능 수익을 크게 앞지를 것입니다. 아키텍처, 인터커넥트, 소프트웨어는 함께 확장되어야 합니다. GB300 NVL72는 WAN 2.2 텍스트-비디오 변환 벤치마크에서도 랙 규모의 효율성을 입증했으며, 초당 0.65개의 720p 비디오(비디오당 5.7초)를 생성하여 단일 노드 대비 9배 더 높은 처리량과 7.5배 더 낮은 지연 시간을 기록했습니다.

NVIDIA 플랫폼은 지속적인 소프트웨어 개발을 통해 성능과 기능 개선을 지속적으로 제공합니다. v6.1에서 GB300 NVL72의 Qwen3-VL 성능은 v6.0 결과 대비 최대 1.6배 향상되었습니다. 이러한 개선은 KV 캐시 정밀도 축소, 추가 커널 퓨전, 최적화된 커널, 그리고 vLLM 및 NVIDIA Dynamo와의 disaggregated serving을 통해 달성되었습니다. 소프트웨어 최적화는 v6.1 제출 마감 이후에도 계속되었습니다. 아직 MLCommons의 검증을 받지 않은 제출 후 GPT-OSS-120B 및 DLRMv3에 대한 결과는 추가적인 성능 향상을 보여줍니다.

NVIDIA Grace Blackwell 및 Vera Rubin NVL72 플랫폼 결과 외에도 NVIDIA는 새로 도입된 Edge-Agentic 벤치마크에서 Qwen3.6-27B를 사용하여 NVIDIA TensorRT Edge-LLM으로 Jetson AGX Thor 결과를 제출했습니다. NVIDIA 파트너 생태계는 광범위하게 참여했으며, 19개 파트너(그중 8곳은 멀티노드 Blackwell NVL72 시스템)가 우수한 성능을 입증했습니다. 여기에는 ASUS, Azure, Cisco, CoreWeave, Crusoe, Dell Technologies, Fujitsu, Giga Computing, HPE, Inventec, Lambda, MiTAC Computing, Nebius, Oracle Cloud Infrastructure, Quanta Cloud Technology, Red Hat, ScitiX, Supermicro, Wiwynn이 포함됩니다. 컴팩트한 엣지 장치부터 최대 규모의 AI 팩토리에 이르기까지 NVIDIA는 플랫폼 아키텍처의 연간 주기, 지속적인 소프트웨어 개선, 그리고 규모에 맞게 이를 제공할 수 있도록 구축된 생태계를 통해 전체 기술 스택 전반의 성능을 지속적으로 발전시키고 있습니다.

원문 보기
엔비디아 베라 루빈 NVL72 시스템은 MLPerf Inference v6.1 데뷔… · Slicast