Tuesday, September 15, 2026
AI 인프라 · 뉴스 & 분석
데이터센터리포트
데이터센터 · 리포트

Elon Musk의 xAI가 Colossus 슈퍼클러스터를 200,000개의 Nvidia Hopper GPU로 두 배 확장하고 있으며, 향후 300,000개까지 확대할 계획입니다.

대규모 민간 GPU 클러스터 구축은 하이퍼스케일 인프라의 자본 투입 속도를 입증하며 Nvidia GPU 공급 할당 경쟁을 심화시킵니다.
업계 전문지Slicast · 2024년 10월 29일 12:00 UTC · 글로벌 · 출처: tomshardware.com
중요도 88

만장자 Elon Musk가 X를 통해 자신의 xAI 데이터 센터의 성능이 곧 두 배로 증가할 것이라고 발표했다. 이는 최근 유튜버 ServeTheHome이 공개한 영상에 이어진 것으로, xAI Colossus AI 슈퍼컴퓨터를 선보였으며, 이는 최첨단 Nvidia 엔터프라이즈 GPU 100,000개로 가득 찬 Supermicro 서버들의 반짝거리는 열을 특징으로 한다. Musk에 따르면 Colossus는 곧 "단일 건물에서 200k H100/H200 훈련 클러스터"가 될 것이라고 했다. 100,000 GPU 버전은 약 2주 전에 AI 훈련을 시작했을 뿐이지만, Musk의 과거 기술 약속 지연 사례—Tesla의 완전 자율주행, Hyperloop 지연, SolarCity 어려움—은 그의 미래 지향적 주장에 대해 신중해야 함을 시사한다.

xAI Colossus는 공학적 경이로 불려왔으며, 칭찬은 Musk의 일반적인 원을 넘어 확대되고 있다. Nvidia CEO Jensen Huang은 이 슈퍼컴퓨터 프로젝트를 "초인적인" 성취이며 "이전에 해본 적 없는" 것이라고 표현했다. xAI 엔지니어들은 19일 만에 슈퍼컴퓨터를 구성하는 놀라운 성과를 달성했으며, 이 규모와 복잡도의 프로젝트는 일반적으로 4년이 소요된다.

200,000개의 전력 집약적 H100/H200 GPU는 Grok 3 같은 AI 모델과 챗봇 훈련에 사용될 것으로 보인다. 이 확장은 xAI Colossus의 최종 하드웨어 목표가 아니며, Musk는 이전에 300,000개의 Nvidia H200 GPU를 갖춘 Colossus를 언급한 바 있다. 현재 속도라면, Musk는 2024년 말 전에 이 300,000개 목표 달성에 대해 트윗할 수 있을 것이다.

이러한 야심 찬 목표 달성에는 여러 기술적 장애물이 있다. Colossus 1의 비효율적인 혼합 아키텍처 설계는 Grok 훈련에 부적합했기 때문에 Anthropic은 이를 추론에 사용하고 있다. 한편 SpaceX는 220,000개의 Nvidia GPU와 300 메가와트의 AI 컴퓨팅 성능에 대한 액세스를 임대했으며, Anthropic과 경쟁하기 위해 우주 기반 데이터 센터용 제조 시설인 1,100만 평방피트 규모의 Gigasat 공장을 공개하고 있다. GPU 공급 제약 및 인프라 문제로 인한 잠재적 지연은 단계 1 이상에 필요한 현장 전력 생성 업그레이드와 복잡한 액체 냉각 및 네트워킹 하드웨어 요구사항으로 인해 발생할 수 있다.

원문 보기
Elon Musk의 xAI가 Colossus 슈퍼클러스터를 200,000개의… · Slicast