Nvidia가 Vera Rubin NVL72 AI 슈퍼컴퓨터를 출시했으며, Blackwell 대비 5배 추론 성능과 토큰당 10배 낮은 비용으로 2H 2026에 도입됩니다.
2026년 CES에서 Nvidia CEO Jensen Huang은 회사의 차세대 AI 데이터센터 랙 규모 아키텍처인 Vera Rubin을 공식 출시했다. 이는 로봇공학, 자율주행차, 광범위한 물리 세계로 기술이 확대됨에 따라 Nvidia를 AI 혁명의 최전선에 유지하도록 설계되었다. Vera Rubin은 Nvidia가 "극단적 공동 설계"라고 부르는 여섯 가지 유형의 칩으로 이루어져 있다: Vera CPU, Rubin GPU, NVLink 6 스위치, ConnectX-9 SuperNIC, BlueField-4 데이터 처리 장치, Spectrum-6 이더넷 스위치. 이러한 구성 요소들은 결합되어 Vera Rubin NVL72 랙을 만들며, 이는 AI 컴퓨팅 전달의 획기적인 도약을 나타낸다.
Rubin GPU는 Blackwell 대비 뛰어난 성능 향상을 제공한다. NVFP4 데이터 타입으로 50 PFLOPS의 추론 성능을 제공하며, 이는 Blackwell GB200의 5배이다. NVFP4 훈련 성능은 35 PFLOPS이며, 이는 Blackwell의 3.5배이다. 이러한 대규모 컴퓨팅을 지원하기 위해 각 Rubin GPU 패키지에는 8개의 HBM4 메모리 스택이 포함되어 있으며, 288GB의 용량과 22 TB/s의 대역폭을 제공한다. Vera CPU는 88개의 맞춤형 Olympus Arm 코어를 구현하며, 공간 다중 스레딩으로 최대 176개의 스레드를 동시에 처리할 수 있다. NVLink C2C 상호연결은 대역폭이 1.8 TB/s로 두 배로 증가했다. 각 Vera CPU는 최대 1.5 TB의 SOCAMM LPDDR5X 메모리를 처리할 수 있으며, 메모리 대역폭은 최대 1.2 TB/s이다.
Vera Rubin은 전문가 혼합 아키텍처의 통신 수요를 처리하고 여러 랙을 아우르기 위해 스케일업 네트워킹용 NVLink 6을 도입한다. GPU당 패브릭 대역폭을 3.6 TB/s(양방향)로 증가시킨다. 각 NVLink 6 스위치는 28 TB/s의 대역폭을 자랑하며, 각 Vera Rubin NVL72 랙에는 이러한 스위치 9개가 포함되어 총 260 TB/s의 스케일업 대역폭을 제공한다. 8개 랙으로 구성된 DGX SuperPods로 확장하기 위해 Nvidia는 Spectrum-6 칩으로 구축된 공동 포장 광학을 갖춘 Spectrum-X 이더넷 스위치를 도입한다. SN688은 512개의 800G 이더넷 포트 또는 2048개의 200G 포트를 위한 409.6 Tb/s의 대역폭을 자랑한다. SN6810은 128개의 800G 포트 또는 512개의 200G 이더넷 포트로 102.4 Tb/s의 대역폭을 제공한다. 두 스위치 모두 액체 냉각식이며 개선된 전력 효율성, 신뢰성, 가동 시간을 제공한다.
컨텍스트 윈도우가 수백만 개의 토큰으로 증가함에 따라 Nvidia는 차세대 BlueField-4 DPU를 사용하는 추론 컨텍스트 메모리 저장소 플랫폼을 도입한다. 이는 AI 인프라 전반에서 키-값 캐시 데이터의 효율적인 공유 및 재사용을 가능하게 하는 새로운 메모리 계층을 만들어 더 나은 응답성과 처리량을 제공한다. Vera Rubin은 처음으로 Nvidia의 신뢰할 수 있는 실행 환경을 전체 랙으로 확장한다. 칩, 패브릭, 네트워크 수준에서 보안을 확보하여 AI 최전선 연구소의 최첨단 모델에 대한 기밀성과 보안을 보장한다. 각 Vera Rubin NVL72 랙은 3.6 exaFLOPS의 NVFP4 추론 성능, 2.5 exaFLOPS의 NVFP4 훈련 성능, Vera CPU에 연결된 54 TB의 LPDDR5X 메모리, 1.6 PB/s의 대역폭을 제공하는 20.7 TB의 HBM4를 제공한다.
Nvidia는 더 빠른 구성 요소 교체를 위한 케이블 불필요 모듈식 트레이 설계, 다운타임 없는 유지보수를 허용하는 개선된 NVLink 복원력, 다운타임 없는 상태 확인을 가능하게 하는 2세대 RAS 엔진을 포함한 신뢰성, 가용성, 관리성 개선 사항을 구현했다. NVL72 랙당 최대 $8.8백만의 가격으로 Nvidia는 이 시스템이 Blackwell에 비해 전문가 혼합 모델 훈련에 필요한 GPU 수의 1/4만 필요하다고 주장한다. 또한 Rubin은 광범위한 모델 범위에서 MoE 추론의 토큰당 비용을 최대 10배까지 줄일 수 있다고 주장한다.