Nvidia는 Blackwell 서버 설치가 생산 중임을 입증하고 2026년에 도입되는 Blackwell Ultra, Vera CPUs, Rubin GPUs를 포함한 로드맵을 발표합니다.
Hot Chips 2024 트레이드쇼 이전에 Nvidia는 Blackwell 플랫폼의 여러 요소를 선보였습니다. 여기에는 설치 및 구성 중인 서버, 기존 Hopper H200 솔루션, Quasar Quantization System을 활용한 FP4 LLM 최적화, 데이터센터용 온수 액체냉각, 그리고 더 나은 칩을 설계하기 위한 AI 도구들이 포함되었습니다. Nvidia는 Blackwell이 단순한 GPU가 아니라 완전한 플랫폼이자 생태계라는 점을 다시 강조했습니다. Nvidia가 발표한 내용의 대부분은 이미 알려져 있었습니다. 여기에는 내년 출시될 Blackwell Ultra, 2026년의 Vera CPU와 Rubin GPU, 그리고 2027년의 Vera Ultra를 포함한 데이터센터 및 AI 로드맵이 포함되었으며, 이러한 세부 정보들은 6월 Computex에서 처음 확인되었습니다.
Blackwell이 3개월 지연된 것으로 보도되었지만, Nvidia는 이 정보를 확인하거나 부인하지 않았습니다. 대신 설치 중인 Blackwell 시스템의 이미지와 Blackwell GB200 랙 및 NVLink 스위치의 내부 하드웨어 사진 및 렌더링을 제공했습니다. 이 하드웨어는 강력한 냉각 기능으로 상당한 전력을 소비할 수 있어 보이지만, 매우 비싼 것으로 보입니다.
Nvidia는 기존 H200의 성능 결과를 시연했습니다. NVSwitch와 함께 Llama 3.1 70B 파라미터 모델을 사용할 때 포인트-투-포인트 설계에 비해 추론 워크로드의 성능이 최대 1.5배 높을 수 있음을 보여주었습니다. Blackwell은 NVLink 대역폭을 두 배로 늘려 추가적인 개선을 제공하며, NVLink Switch Tray는 총 14.4 TB/s의 집계 대역폭을 제공합니다. 증가하는 데이터센터 전력 요구사항을 해결하기 위해, Nvidia는 파트너들과 협력하여 온수 냉각 기술을 개발하고 있습니다. 가열된 물을 난방을 위해 재순환시켜 비용을 더욱 절감할 수 있습니다. 회사는 이 기술을 사용하여 데이터센터 전력 사용량을 최대 28% 감소시킬 수 있다고 주장합니다.
Blackwell의 기본 FP4 지원을 준비하기 위해, Nvidia는 최신 소프트웨어가 정확도를 훼손하지 않으면서 새로운 하드웨어 기능의 이점을 누리도록 보장했습니다. Quasar Quantization System을 사용하여 워크로드 결과를 튜닝함으로써, Nvidia는 대역폭의 4분의 1만 사용하면서도 FP16과 거의 동일한 품질을 제공할 수 있습니다. 또한 Nvidia는 Verilog의 회로 설명에 대한 설계, 디버깅, 분석 및 최적화를 가속화하기 위해 내부 LLM을 개발했습니다. 이는 2,080억 트랜지스터 Blackwell B200 GPU를 만드는 핵심 요소입니다. 이 도구는 차세대 Rubin GPU 및 그 이상을 위한 더욱 우수한 모델을 만드는 데 사용될 것입니다.