Nvidia는 AI 워크로드를 위한 높은 메모리 대역폭을 결합하는 Grace-Hopper 하이브리드 CPU-GPU 시스템을 발표했습니다.
Nvidia는 Grace Arm 기반 CPU와 관련 슈퍼칩 제품들을 대규모 시스템에만 출시하고 있으며, 현재 제공되는 DGX-A100 또는 DGX-H100 시스템과 비교 가능한 더 작은 1U 또는 2U 랙 서버 구성은 제공하지 않습니다. Grace-Grace 슈퍼칩은 두 개의 CPU를 NVLink 4.0 칩-칩 링크와 결합하고, Grace-Hopper GH200 슈퍼칩은 Grace CPU를 Hopper GH100 GPU 가속기와 쌍을 이룹니다. DGX GH200 시스템은 256개의 Grace-Hopper 슈퍼칩을 단일 공유 메모리 GPU 클러스터로 결합하며, 32, 64, 128, 256 GPU 구성으로 제공됩니다. 이러한 슈퍼칩들과 함께 MGX라는 참조 설계가 제안되었지만, 수요가 공급을 훨씬 초과할 것으로 예상되므로 Nvidia는 초기 출하량의 대부분이 더 큰 DGX 시스템으로 갈 것으로 예상합니다.
Nvidia의 Jensen Huang은 대만 타이페이에서 열린 Computex의 기조연설에서 Grace CPU의 일반 가용성을 발표했으며, 이는 아시아 지역에서 월요일 아침에 개최되었습니다. 회사는 아직 Grace CPU 또는 Grace-Grace 슈퍼칩의 공식 제품명을 공개하지 않았지만, GPU에 "G"를, 제품 코드명의 첫 글자를, 등급 지정에 "X00"을 사용하는 Nvidia의 명명 규칙에 따르면, 단일 Grace CPU의 경우 "CG100"이, Grace-Grace 슈퍼칩의 경우 "CG200"이 논리적으로 해당 이름이 될 것입니다. 기사 발행 당시 Nvidia는 Grace 디바이스에 대한 완전한 사양 또는 성능 지표를 공개하지 않았지만, Grace 칩과 새로운 DGX GH200 시스템 모두에 대한 백서가 준비 중이었습니다.
DGX GH200은 단순한 제품 제공이 아니라 Google, Meta Platforms, Microsoft가 "1 trillion 매개변수 대규모 언어 모델과 대규모 추천 시스템"을 처리할 수 있는 AI 학습 인프라를 개발할 때 그 위에 구축하기로 계획하는 참조 아키텍처입니다. Nvidia가 자체 CPU를 만들기로 한 결정은 데이터센터에서의 오랜 전략적 확장의 역사에서 비롯되었습니다. 2011년 1월에 발표된 회사의 야심찬 "Project Denver" 계획은 강력한 CPU 및 GPU 용량을 결합하여 X86 프로세서의 완전한 대체품으로 기능할 Arm 기반 CPU 개발을 제안했습니다. 그 노력은 결국 공개적 설명 없이 중단되었습니다. 수십 년 후, 다른 회사들이 서버급 Arm CPU 개발에 반복적으로 실패한 가운데, Nvidia는 특히 IBM의 Power10 칩이 Nvidia가 필요로 하는 NVLink 4.0 프로토콜을 효과적으로 지원할 수 없었기 때문에 CPU 개발을 재시작했습니다. 딥러닝 추천 모델과 대규모 언어 모델이 GPU 고대역폭 메모리만으로는 제공할 수 있는 것보다 훨씬 더 많은 메모리를 필요로 함에 따라, Nvidia는 하드웨어 스택에 대한 직접적인 제어와 PCI-Express보다 빠르게 고용량 메모리를 연결할 수 있는 능력이 필요하다고 판단했습니다.
Grace CPU의 핵심 특징은 노트북에서 찾을 수 있는 LPDDR5 메모리의 사용이며, 이는 Nvidia가 32개 채널을 통해 최대 512 GB 메모리에 546 GB/sec 대역폭을 제공할 수 있도록 합니다. 이 구성은 HBM2e 메모리의 8X 용량을 약 1/3의 대역폭과 1/3의 GB당 비용으로 제공하며, DDR5 주 메모리의 가격과 동일하면서 DDR5 대비 4X의 채널, 1/8의 용량, 1.5X의 대역폭을 제공합니다. 이러한 메모리 용량과 대역폭의 조합은 Grace CPU를 전통적인 HPC 시뮬레이션 및 모델링뿐만 아니라 대규모 언어 모델 및 추천 시스템에 대한 AI 학습에도 적합하게 합니다.