Nvidia는 336B 트랜지스터와 50 페타플롭 AI 성능을 갖춘 Rubin 칩을 출시합니다.
Nvidia Corp.는 오늘 Blackwell보다 5배의 추론 성능을 제공하는 새로운 플래그십 그래픽 처리 장치 Rubin을 발표했습니다. 이 GPU는 CES에서 다른 5개의 데이터센터 칩과 함께 공개되었습니다. Rubin은 336억 개의 트랜지스터를 포함하며 NVFP4 데이터를 처리할 때 50 petaflops의 성능을 제공합니다. Blackwell은 최대 10 petaflops를 제공합니다. Rubin의 훈련 속도는 35 petaflops에서 250% 더 빠릅니다. 칩의 컴퓨팅 파워에는 Transformer Engine이라는 모듈이 포함되어 있으며, 이는 Blackwell과도 함께 제공되었습니다. Nvidia에 따르면 Rubin의 Transformer Engine은 하드웨어 가속 적응형 압축이라는 성능 향상 기능을 갖춘 더 새로운 설계를 기반으로 합니다. 이 기능은 파일이 포함하는 비트 수를 줄이고 AI 모델이 처리해야 하는 데이터의 양을 감소시킵니다. Nvidia의 최고경영자 Jensen Huang은 "Rubin은 정확한 시점에 나타났습니다. AI 컴퓨팅 수요가 훈련과 추론 모두에서 급증하고 있기 때문입니다. 우리는 매년 새로운 세대의 AI 슈퍼컴퓨터를 출시하고 6개의 새로운 칩 전반의 심화된 협력설계를 통해 Rubin으로 AI의 다음 경계를 향한 거대한 도약을 이루고 있습니다"라고 말했습니다.
Nvidia는 Rubin을 Vera Rubin NVL72라는 어플라이언스의 일부로 출시할 계획입니다. 이 어플라이언스는 72개의 Rubin 칩과 CES에서 공개된 회사의 새로운 Vera 중앙 처리 장치 36개를 결합합니다. Vera는 Olympus라는 커스텀 설계를 기반으로 한 88개의 코어를 포함하며 Arm Holdings plc의 CPU 명령어 집합 아키텍처의 널리 사용되는 버전인 Armv9.2와 호환됩니다. Vera Rubin NVL72는 케이블 없는 설계의 트레이 모듈에 칩을 수용하며, 이러한 설계는 Blackwell 기반 어플라이언스와 비교해 조립 및 서비스 시간을 최대 18배까지 단축합니다. RAS Engine이라는 자동화된 유지보수 서브시스템은 업그레이드되어 결함 허용 기능을 제공하고 하드웨어가 예상대로 작동하는지를 확인하기 위해 실시간 상태 점검을 수행합니다. Vera Rubin NVL72는 초당 260테라비트의 대역폭을 제공하며, 이는 전체 인터넷보다 큽니다. 시스템 전체에는 220조 개의 트랜지스터가 있습니다.
3개의 새로운 네트워킹 칩은 시스템 내 및 시스템 간 데이터 교환을 용이하게 합니다. NVLink 6 Switch는 Vera Rubin NVL72 랙 내의 여러 GPU가 동시에 데이터를 교환하여 분산 AI 모델을 조정할 수 있도록 합니다. Spectrum-6은 다른 랙에 설치된 GPU들 간의 연결을 용이하게 하는 Ethernet 스위치입니다. ConnectX-9는 SuperNIC이며, 서버가 데이터센터 네트워크에 액세스하면서 CPU에서 수행하던 네트워킹 작업을 수행할 수 있게 하는 하드웨어 인터페이스입니다. 이를 통해 AI 워크로드를 위한 더 많은 처리 용량이 확보됩니다. 추가로 BlueField-4는 데이터 처리 장치이며, 네트워킹, 사이버보안 및 스토리지 관리 작업에서 서버의 주 프로세서로부터의 작업을 오프로드합니다. 또한 대규모 언어 모델의 키-값 캐시를 최적화하도록 설계된 새로운 Inference Context Memory Storage Platform을 지원합니다.
Vera Rubin NVL72는 72개 대신 8개의 Rubin GPU를 포함하는 더 작은 어플라이언스인 DGX Rubin NVL8과 함께 출시될 것입니다. 두 시스템은 AI 클러스터를 구축하기 위한 참조 아키텍처인 DGX SuperPOD의 기초를 형성합니다. 이는 Nvidia의 최신 칩을 AI 인프라를 관리하기 위한 소프트웨어 플랫폼인 Mission Control과 결합합니다. Rubin 기반 시스템은 2026년 하반기부터 출시를 시작할 것입니다.