엔비디아는 베라 루빈 NVL72 랙이 이전 세대 대비 메가와트당 에이전틱 AI 처리량을 최대 30배 향상시키고 토큰 비용을 35% 절감한다고 밝혔다.
NVIDIA는 Vera Rubin NVL72 플랫폼이 GB300 NVL72 대비 메가와트당 에이전틱 AI 추론 처리량이 최대 30배 향상되고, 토큰 백만 개당 비용이 최대 35배 절감된다고 밝혔다.
이러한 성능 향상은 급속히 대두되는 인프라 병목 현상을 해소한다. AI 에이전트는 기존 채팅봇 상호작용보다 훨씬 더 많은 컴퓨팅 자원을 소모한다. NVIDIA가 인용한 OpenRouter 데이터에 따르면, 에이전틱 워크로드는 표준 채팅 쿼리보다 약 15배 더 많은 토큰을 필요로 한다.
단일 프롬프트에서 응답을 생성하는 전통적인 모델과 달리, AI 에이전트는 데이터베이스를 반복적으로 쿼리하고, 문서를 검색하며, 도구를 호출하고, 하위 에이전트를 생성하며, 출력을 분석하고, 작업이 완료될 때까지 추론을 지속한다. 각 단계마다 세션에 새로운 컨텍스트가 추가되어 개별 에이전트 실행 시 입력 토큰이 수십만 개까지 확장될 수 있다.
이러한 운영 패턴은 기업들이 에이전틱 애플리케이션을 대규모로 배포함에 따라 긴 컨텍스트 처리, 메모리 관리, 토큰 생성 효율성의 중요성을 높인다.
NVIDIA는 SemiAnalysis AgentX 워크로드를 사용하여 Vera Rubin NVL72를 벤치마킹했으며, 이는 실제 에이전틱 코딩 세션의 맥락 확장, 도구 호출, 하위 에이전트 생성 등을 그대로 반영한다. DeepSeek V4 Pro 모델을 실행한 결과, 이 플랫폼은 GB300 NVL72 대비 메가와트당 처리량이 최대 30배 더 높은 성과를 기록했다.
이 초기 벤치마크 결과는 아직 SemiAnalysis의 독립적인 검토를 기다리고 있으며, 현재 도구 호출 작업을 위한 Vera CPU 성능은 제외되어 있다.
NVIDIA의 이전 세대 Blackwell 플랫폼도 유사한 워크로드에서 상당한 효율성 향상을 입증했다. GB300 NVL72는 DeepSeek V4 Pro 실행 시 Hopper 아키텍처 대비 메가와트당 처리량이 최대 15배 더 높다.
Vera Rubin은 전체 성능 곡선 전반에 걸쳐 이러한 효율성 향상을 확장한다. 전력 제약이 있는 데이터 센터의 경우, NVIDIA는 향상된 메가와트당 처리량 비율로 인해 운영자가 기존 전력 용량 내에서 훨씬 더 많은 에이전틱 워크로드를 실행할 수 있다고 지적했다.
전력 가용성이 새로운 AI 인프라의 주요 제약 조건으로 확고해짐에 따라 이러한 경제적 이점은 점점 더 중요해지고 있다. NVIDIA는 또한 Vera Rubin NVL72가 GB300 NVL72 대비 토큰 백만 개당 비용을 최대 35배 절감한다고 확인했다.
낮아진 토큰 비용은 소프트웨어 개발, 고객 지원, 금융 분석, 연구와 같은 장기 추론 워크로드 전반에 걸쳐 지속적인 에이전트 운영을 경제적으로 실현 가능하게 만든다. NVIDIA는 GPU, 네트워킹, 메모리 아키텍처, 추론 소프트웨어, 워크로드 오케스트레이션을 아우르는 크로스 레이어 공동 설계를 통해 이러한 성과를 달성했다.
주요 아키텍처 기법으로는 컨텍스트 처리(prefill)와 응답 생성(decode)을 분리하여 독립적인 스케일링을 가능하게 하는 disaggregated serving이 있다. Rate matching은 이후 prefill과 decode GPU 속도를 동기화하여 활용률을 극대화한다. mixture-of-experts 모델의 경우, 대규모 expert parallelism을 통해 개별 expert 네트워크를 NVL72 스케일업 도메인 전반에 분산한다.
분산 KV 캐싱은 GPU 도메인 전반에 사용 가능한 메모리를 확장하며, KV-cache 오프로딩은 비활성 컨텍스트를 호스트 메모리나 스토리지로 이동시켜 이전에 처리된 데이터를 다시 계산할 필요가 없도록 한다. 또한 KV-aware 라우팅은 들어오는 요청을 관련 캐시된 컨텍스트를 이미 보유한 GPU로 유도하여 장기 에이전트 세션 동안 중복 계산을 최소화한다.
MegaMoE를 포함한 fused CUDA 커널은 연산과 GPU 간 통신 작업을 통합하여 데이터 전송 중 프로세서가 대기 상태가 아닌 완전히 활용되도록 한다.
Rubin GPU는 enhanced fifth-generation Tensor Cores와 NVIDIA의 third-generation Transformer Engine을 탑재하여 prefill과 decode 단계를 모두 가속화한다. NVFP4 양자화는 모델 가중치를 4비트 정밀도로 압축하여 메모리 요구 사항을 줄이고 처리량을 높이며 출력 충실도는 유지한다고 NVIDIA는 설명했다.
NVL72 아키텍처는 expert parallelism과 분산 KV 캐싱에 필수적인 고대역폭 저지연 통신을 지원하도록 설계된 대규모 GPU 도메인을 특징으로 한다. NVIDIA는 sixth-generation NVLink 및 NVLink Switch 기술이 상용 이더넷 대안 대비 패킷률이 10배 높고 지연시간이 3배 낮다고 보고했다.
이 하드웨어는 최적화된 CUDA 커널, TensorRT LLM, NVIDIA Dynamo 서빙 프레임워크를 갖춘 NVIDIA의 포괄적인 추론 소프트웨어 스택과 통합된다.
고급 전원 관리 역시 효율성 전략을 뒷받침한다. NVIDIA의 DSX MaxLPS 기술은 GPU, 랙, 워크로드 계층 전반에 걸친 전력 배분을 오케스트레이션하여, 운영자가 동일한 메가와트 예산 내에서 최대 40%까지 추가 GPU를 프로비저닝할 수 있도록 한다.
Vera Rubin은 단순한 GPU 세대가 아니라 7개 칩으로 구성된 AI 팩토리 플랫폼으로 설계되었다. 전체 생태계에는 NVIDIA Vera CPU, Groq 3 LPU, Rubin GPU, NVLink 6 Switch, BlueField-4 DPU, Spectrum-6 SPX, ConnectX-9 SuperNIC이 포함된다.
NVIDIA는 Vera Rubin이 본격 생산에 진입했으며 하드웨어 및 인프라 파트너 네트워크 전반에서 적극적으로 확장 중이라고 확인했다.
에이전틱 AI가 실험적 파일럿에서 대규모 생산으로 전환됨에 따라 NVIDIA는 업계의 초점을 전통적인 단일 요청 추론 벤치마크에 대한 의존에서 벗어나 메가와트당 처리량과 토큰 비용을 주요 성능 지표로 이동시키고 있다.
Pulse 2.0을 방문해 주셔서 감사합니다. 당사는 비즈니스, 금융, 자본 시장, 딜 플로우, 법률, 테크, AI 분야에 관한 최신 인텔리전스를 리더들과 의사 결정권자 여러분께 전달하기 위해 매일 노력하고 있습니다. Pulse 2.0 뉴스레터를 구독하려면 여기를 클릭하십시오.