NVIDIA가 Blackwell GPU 아키텍처 및 Ethernet 기술을 Meta의 Open Compute Project 컨소시엄에 기여
Nvidia는 특히 CUDA와 관련하여 폐쇄된 생태계를 유지하는 것으로 자주 인식되고 있으며, Nvidia는 "새로운 하드웨어를 위해 최적화된 소프트웨어 추상화를 개발하기 위해" CUDA를 폐쇄된 상태로 유지해야 한다고 주장합니다. 그러나 AI 인프라가 개별 프로세서 성능을 넘어 전체 시스템 문제로 진화함에 따라, Nvidia는 비용과 에너지 비효율을 야기하는 다음 세대의 병목 현상을 해결하기 위해 Open Compute Program에 기술을 점점 더 많이 기여하고 있습니다. 이 회사는 10년 이상 전에 Facebook이 시작한 OCP에 대한 오랜 공약을 유지해왔으며, HGX-H100 Baseboard와 같은 참조 설계를 제공해왔으며, 이는 현재 대부분의 AI 설치에서 사용되고 있습니다.
Nvidia의 가장 중요한 최근 기여는 Blackwell GPU 아키텍처와 이를 지원하는 네트워킹 인프라에 중심을 두고 있습니다. NVSwitch와 NVLink는 Nvidia의 소프트웨어와 함께 이 회사의 주요 차별화 요소를 나타냅니다. NVSwitch는 72개의 GPU를 GPU 패브릭으로 연결하여 소프트웨어와 AI 모델이 하나의 거대한 GPU로 작동할 수 있게 하며, 성능을 향상시키고 개발을 단순화합니다. Open Compute Program 정상회담에서 Nvidia는 이러한 기술이 더 광범위한 생태계 내에서 Blackwell의 잠재력을 어떻게 활용하는지를 강조했습니다.
Supermicro, Dell, HPE 및 Lenovo와 같은 OEM이 NVL72 DGX 클래스 시스템을 제공할 수 있도록 하기 위해, Nvidia는 NVL72 랙, MGX 컴퓨팅 트레이 및 Nvidia Switch 트레이를 오픈소스화했습니다—NVL72 랙의 복잡성을 감안하면 상당한 기여입니다. 이 설계는 5,000개의 구리 와이어를 포함하며, 1,400 암페어에서 120 KW의 전력을 소비하고, 혼잡 제어를 위해 원격 측정이 가능한 스위치를 통합하며, 최대 27조 개의 매개변수를 지원할 수 있습니다. 열린 시스템 역학을 실제로 보여주면서, Meta는 NVL72 사양을 채택하여 자신의 구체적인 데이터센터 요구사항에 맞게 수정한 후, Catalina라고 불리는 결과물을 더 광범위한 사용을 위해 OCP 커뮤니티에 기여했습니다.
Blackwell은 완전 생산에 진입했으며, Nvidia는 4분기에 250,000~300,000개 유닛이 50억~100억 달러의 수익을 창출할 것으로 전망하고 있으며, 1분기에는 750,000~800,000개 유닛이 예상됩니다. Nvidia는 DGX B200 8-way 서버를 각각 약 50만 달러에 판매할 것으로 예상하고 있습니다. Nvidia의 생태계 규모는 이제 수백만 명의 개발자, 과학자 및 연구 기관과 함께 Nvidia 하드웨어 및 소프트웨어를 배포하여 AI 인프라 발전을 추진하는 수많은 OEM, ODM 및 데이터센터 인프라 제공업체를 포함합니다.