Meta가 Nvidia H100 GPU 24,000개 이상을 포함한 2개의 신규 내부 AI 데이터센터 운영을 발표했습니다.
Meta는 2024년 말까지 350,000개의 NVIDIA H100 GPU를 배포할 계획을 발표하며 AI 인프라 확대를 위한 야심찬 계획을 공개했습니다. Meta가 "GenAI Infrastructure" 로드맵이라고 설명하는 계획의 일환으로, Meta는 현재 및 차세대 AI 모델, 연구 개발을 지원하도록 설계된 두 개의 "24,576 GPU 데이터 센터 규모 클러스터"를 공개했습니다. 이러한 상당한 투자는 Microsoft, Google, Amazon의 유사한 노력과 함께 AI 시장에서의 선도권을 놓고 경쟁하려는 Meta의 결의를 반영합니다.
두 클러스터 각각은 400Gbps 상호연결 기능으로 구성된 24,000개 이상의 NVIDIA Tensor Core H100 GPU를 포함합니다. 클러스터는 서로 다른 네트워킹 접근 방식을 채용합니다: 하나는 Arista 7800을 기반으로 하는 Meta의 자체 네트워크 패브릭 솔루션을 사용하며, Wedge400 및 Minipack2 OCP 랙 스위치가 특징이고, 다른 하나는 NVIDIA의 보다 고급 Quantum2 패브릭을 배포합니다. 이는 2022년 16,000개의 NVIDIA A100 GPU를 보유했던 Meta의 AI Research SuperCluster(RSC)에 비해 상당한 업그레이드입니다.
Meta는 성명을 통해 새 인프라의 성능 이점을 강조하며 다음과 같이 설명했습니다: "이 클러스터들 내 고성능 네트워크 패브릭의 효율성, 주요 스토리지 결정들, 그리고 각각의 24,576개 NVIDIA Tensor Core H100 GPU와 결합하면, 두 클러스터 버전 모두 RSC에서 지원 가능했던 것보다 더 크고 복잡한 모델을 지원할 수 있으며, GenAI 제품 개발 및 AI 연구 발전의 길을 열어줍니다."
이 회사는 하드웨어 투자를 경쟁 전략의 기초라고 설명하며 "AI 개발에서 선도하려면 하드웨어 인프라 투자에서 선도해야 합니다"라고 명시했습니다. Meta는 인공일반지능(AGI)을 중심으로 한 더 폭넓은 비전을 제시하며, "Meta의 장기 비전은 개방적이고 책임감 있게 구축되어 누구나 이로부터 혜택을 받을 수 있는 인공일반지능(AGI)을 구축하는 것입니다"라고 선언했습니다.
향후 Meta는 인프라의 지속적인 진화를 위한 약속을 표시했습니다. 이 회사는 "우리는 물리적 및 가상 계층에서 소프트웨어 계층 및 그 이상까지 인프라의 모든 측면을 지속적으로 평가하고 개선하고 있습니다. 우리의 목표는 빠르게 진화하는 새로운 모델과 연구를 지원하기 위해 유연하고 신뢰할 수 있는 시스템을 구축하는 것입니다"라고 명시했습니다.