Elon Musk의 xAI가 19일 만에 100,000개의 Nvidia H200 GPU를 설치하여 전형적인 4년 배포 기대치를 훨씬 초과합니다.
일론 머스크의 xAI 팀은 100,000개의 엔비디아 H200 GPU를 단 19일 만에 설치했습니다. 이는 엔비디아의 CEO인 Jensen Huang이 데이터센터 프로젝트에서 일반적으로 4년이 소요된다고 말한 것과 대비됩니다. 2주 조금 넘는 기간 내에 xAI 팀은 엔비디아와 호환되는 "개념"에서 "장비" 상태로의 전환을 완료했으며, 새로 구축된 슈퍼컴퓨터에서 처음 AI를 학습했습니다. Jensen Huang은 Tesla Owners Silicon Valley와 이 성취를 공유하며 머스크의 성과를 "초인적"이라고 표현했습니다.
전체 절차는 GPU를 수용하기 위한 거대한 X 팩토리 건설로 시작되었고, 그 뒤에 200,000개의 GPU가 모두 제대로 작동할 수 있도록 전체 시설에 전기와 액체 냉각 시스템이 설치되었습니다. 하드웨어 및 인프라를 정확하고 조율된 방식으로 공급하고 설치하기 위해서는 엔비디아와 일론 머스크의 조직의 엔지니어링 팀 간 광범위한 협력이 필요했습니다.
Huang에 따르면, 일반적인 데이터센터는 xAI 팀이 19일 만에 완료한 작업을 완성하기 위해 4년이 필요합니다. 처음 3년은 계획 수립에 할당되고, 마지막 1년은 배송, 설치 및 모든 것을 가동하는 데 소요됩니다. Huang은 엔비디아 하드웨어의 네트워킹의 복잡한 성질을 상세히 설명하며, "한 노드에 들어가는 와이어의 수...컴퓨터 뒷부분은 모두 와이어입니다"라고 언급합니다. 그는 엔비디아 장비의 네트워킹이 데이터센터의 일반 서버 네트워킹과 동일하지 않다는 점을 강조합니다.
다른 기업이 100,000개의 H200 GPU의 이러한 통합을 현재로부터 꽤 오랜 시간 동안 복제할 가능성은 낮습니다. Jensen Huang에 따르면 이것은 "이전에 수행된 적이 없는" 것입니다.