NVIDIA 로드맵 공개는 무어의 법칙이 종료되었음을 확인하며, 향후 성능 향상은 밀도 확장이 아닌 아키텍처 개선에서 옵니다.
Nvidia는 AI 컴퓨팅 성장을 가속화하는 데 여러 상호 연결된 도전에 직면해 있으며, 이번 달 GTC에서 Jensen Huang이 차세대 Blackwell Ultra 프로세서뿐만 아니라 향후 플랫폼에 대한 자세한 로드맵(600kW 랙 규모 시스템으로 576개의 GPU를 탑재하고, 2028년 도착할 Richard Feynman의 이름을 딴 새로운 GPU 제품군 포함)을 발표했습니다. 근본적인 제약은 최근 몇 년간 공정 기술 진전이 거의 멈췄다는 것이며, 이로 인해 Nvidia는 조정할 수 있는 변수가 점점 더 제한적이 되고 있습니다. 이를 보완하기 위해 Nvidia의 전략은 각 컴퓨팅 노드의 실리콘 양을 최대한 확장하는 것이며, 현재 72개의 GPU를 고속 1.8TB/s NVLink 패브릭을 사용하여 단일 컴퓨팅 도메인으로 상호 연결하는 가장 조밀한 시스템에서 랙당 144개, 그리고 결국 576개의 GPU로 확장됩니다.
이러한 스케일링 전략의 전력 요구 사항은 막대합니다. Blackwell 가속기는 Hopper보다 500와트 더 많은 전력이 필요했으며 다이 개수도 두 배가 필요했지만, FP16으로 정규화했을 때 약 1.25배의 성능만 제공했습니다 — 1,250 dense teraFLOPS 대 GH100의 989. 2027년까지 Nvidia는 Rubin Ultra NVL576의 출시로 랙이 600kW로 급증할 것으로 예상하며, 이는 두 개의 레티클 제한 다이에서 네 개로 확장되면서 TSMC 2nm 공정 기술에서 대략 20% 효율 개선을 유지합니다. 이러한 이득에도 불구하고 Huang이 보도 Q&A에서 언급한 것처럼, "랙의 실질적 한계는 공급할 수 있는 전력의 양"이며, 현재 데이터센터 용량은 "250메가와트"이고 잠재적 미래 한계는 "랙당 1기가와트"에 도달할 수 있습니다.
컴퓨팅 스케일링을 넘어 Nvidia는 메모리 아키텍처를 극적으로 확장하고 있습니다. Rubin Ultra는 Rubin의 패키지당 288GB에서 1TB로 증가할 것이며, 대략 절반은 더 빠르고 용량이 큰 메모리 모듈에서 나오고, 다른 절반은 Blackwell 및 Rubin의 8개 모듈에서 Rubin Ultra의 16개 모듈로 메모리 전용 실리콘의 양을 두 배로 늘린 것에서 나옵니다. 이를 통해 단일 패키지에 FP4로 약 2조 개의 파라미터를 맞추거나 개별 다이당 5,000억 개를 맞출 수 있습니다. HBM4e는 HBM3e에 비해 메모리 대역폭을 효과적으로 두 배로 증가시킬 것으로 예상되며, 대역폭은 Blackwell 다이당 약 4TB/s에서 Rubin Ultra의 약 8TB/s로 향상됩니다.
공정 개선의 제한된 이득을 상쇄하기 위해 Nvidia는 16비트에서 8비트 정밀도로 내려가는 정밀도 감소를 적극적으로 추구하고 있으며, 이는 처리량을 효과적으로 두 배로 늘리면서 메모리 요구 사항을 절반으로 줄입니다. Hopper에서 Blackwell로, Nvidia는 4비트를 내려뜨리고 실리콘을 두 배로 늘렸으며 5배의 부동소수점 이득을 주장했습니다. 회사는 이 방향을 계속 탐색하고 있으며, 정확도를 유지하면서 1.58비트만큼 낮은 슈퍼 저정밀도 양자화에 대한 연구가 진행 중이지만, 4비트 이하의 정밀도에서는 LLM 추론이 빠르게 상승하는 혼란도로 인해 문제가 됩니다. Blackwell Ultra에서 Nvidia는 칩의 배정밀도(FP64) 텐서 코어 성능을 제한하는 대신 50% 더 많은 4비트 FLOPS를 확보하여 컴퓨팅 밀집 워크로드에 우선순위를 두었으며, 이는 전문화된 정밀도 최적화가 GPU 설계의 중심이 되고 있음을 나타냅니다.
이러한 추세의 누적 효과 — 더 큰 다이 개수, 더 높은 전력 밀도, 확장된 메모리 계층 구조, 정밀도 최적화 — 는 Nvidia의 컴퓨팅 플랫폼이 계속해서 더 커지고, 더 조밀해지고, 더 뜨거워지고, 더 많은 전력을 소비하게 될 것을 의미합니다. Cray, Eviden, Lenovo와 같은 벤더들이 극도로 조밀한 대규모 컴퓨팅을 냉각해본 것이 새로운 것은 아니지만, 규모와 빈도는 극적으로 변했으며, 매년 소수의 부티크 컴퓨팅 클러스터에서 수십 개의 점점 더 까다로운 구성으로 이동했습니다. 이는 전력 공급, 열 분산 및 인프라 비용을 관리하는 데이터센터 운영자들에게 상당한 도전을 제시합니다.