Nvidia는 데이터센터 AI 워크로드를 위한 최적화된 슈퍼칩인 Grace-Blackwell 변종을 출시하며, Blackwell 제품군을 확장합니다.
Nvidia는 Project Digits를 발표했습니다. 이는 새로운 GB10 Grace-Blackwell 슈퍼칩으로 구동되고 128GB 메모리로 장착된 $3,000 데스크톱 시스템으로, AI 개발자, 연구자, 학생들이 데스크톱에서 대규모 모델을 실행할 수 있도록 설계되었습니다. MediaTek과의 협력으로 개발되었으며 CEO Jensen Huang이 라스베이거스의 CES에서 공개한 이 시스템은 단일 SoC에 통합되는 것으로 보이는 Arm 기반 Grace CPU와 Blackwell GPU를 특징으로 합니다. 이 시스템은 하드웨어를 최대한 활용하도록 사전 구성된 특별 Ubuntu Linux 빌드와 함께 출시됩니다. Intel NUC 미니 PC 크기와 유사한 Project Digits는 전체 1 petaFLOP의 AI 성능을 제공하지만, 이 측정은 희소 4비트 부동소수점 워크로드를 기반으로 합니다.
사양에 따르면 GB10은 20코어 Grace CPU와 Nvidia의 GB200 AI 서버에서 사용되는 듀얼 Blackwell GPU의 1/40 성능을 제공하는 GPU를 특징으로 합니다. 이 시스템은 Intel, AMD, Qualcomm의 AI PC보다 더 강력하지만, 희소 FP/INT8 성능에서 1.45 petaFLOPS를 자랑하는 Nvidia의 RTX 6000 Ada로 장착된 워크스테이션과의 경쟁에서는 어려움을 겪을 것입니다 — Project Digits가 해당 정밀도에서 제공할 것으로 예상되는 약 500 teraFLOPS의 대략 3배입니다. 128GB의 LPDDR5x 메모리는 Nvidia의 엔터프라이즈 플랫폼 제품 마케팅 이사인 Allen Bourgoyne에 따르면 대규모 AI 모델로 작업하기를 더 접근 가능하게 하기 위해 의도적으로 선택되었습니다.
Nvidia는 Project Digits가 4비트로 압축될 경우 200억 개의 파라미터까지 모델을 지원할 것이라고 주장합니다. 두 장치는 온보드 ConnectX 네트워킹을 통해 연결되어 405억 개의 파라미터까지 모델을 실행할 수 있으며, Meta의 Llama 3.1 405B에 도달할 수 있게 합니다 — 다시 4비트에서입니다. 참고로, 기존 워크스테이션 하드웨어에서 동일한 모델을 실행하려면 최소 5개의 48GB GPU가 필요합니다. 6개의 LPDDR5x 모듈을 보여주는 렌더링을 기반으로 하고 8,800 MT/s의 메모리 속도를 가정하면, 시스템은 약 825GB/s의 대역폭을 제공할 것이며, RTX 6000 Ada의 960GB/s과 크게 차이나지 않으며, 이는 200억 개 파라미터 모델에 대해 초당 약 8개의 토큰으로 변환될 수 있습니다 — 발표 당시 전체 사양을 사용할 수 없었지만.
AI 추론을 넘어서, Nvidia는 Project Digits가 모델 실험, 미세 조정, 데이터 과학, 에지 애플리케이션에 적합할 것으로 예상합니다. 이 시스템은 4TB의 NVMe 저장소를 포함하며, 대부분의 오픈 모델, 특히 4비트로 양자화된 모델에 충분한 용량입니다. Project Digits는 5월부터 사용 가능하며 Nvidia의 Jetson 개발 키트의 성숙한 버전을 나타내며, 이 회사는 수년 동안 제공해왔고 최근 2024년 12월에 Orin Nano Super로 새로 고쳤습니다. 현재 형태로, 이 머신은 GB200 및 GB200 NVL4와 같은 Nvidia의 더 강력한 Grace-Blackwell 슈퍼칩으로 사용자를 익숙하게 하기 위해 목표로 하는 것으로 보이지만, Nvidia는 GB10을 다른 PC 제조업체에 라이센스할지 여부를 공개하지 않았습니다.