NVIDIA CEO Jensen Huang credits Elon Musk with completing xAI's Colossus datacenter facility in 19 days, an unusually fast construction pace.
NVIDIA 최고경영자 젠슨 황이 BG2 팟캐스트에서 엘론 머스크가 통상 1년이 소요되는 작업을 19일 만에 완료했다고 언급했으며, 이를 놀랍다고 표현했다. 이 성과는 xAI의 멤피스 Colossus 훈련 클러스터 건설과 관련된 것이다.
황은 일반적인 슈퍼컴퓨터 배포의 표준 일정을 설명했다. 3년의 계획 단계에 이어 설치, 전원 공급, 첫 훈련 실행 전 디버깅까지 1년이 추가로 소요된다. 그는 이를 xAI의 대폭 단축된 일정과 대비시켰는데, xAI의 일정은 초기 개념부터 액체 냉각 시설 승인, 장비 전원 공급, NVIDIA 통합, 첫 훈련 실행까지 모든 과정이 19일에 압축되었다. 황에 따르면 이러한 속도는 머스크의 리더십 하에서만 가능했다.
Colossus 클러스터는 100,000개의 NVIDIA H100 GPU로 구성되며, 황은 이를 당시 단일 클러스터 구성에서 가장 빠른 슈퍼컴퓨터로 꼽았다. 그는 xAI의 엔지니어링, 소프트웨어, 네트워킹, 인프라 팀의 역량을 인정했으며, 이들이 19일간의 집중 기간에 거의 수면을 취하지 못했을 가능성을 언급했다. NVIDIA는 네트워크 측면의 지원을 제공했는데, 이는 그들의 장비가 표준 데이터 센터 서버보다 훨씬 복잡한 설치를 요구하기 때문이다.
여러 일정에 대한 명확한 구분이 필요하다. 머스크는 조던 피터슨에게 하드웨어 설치부터 훈련 시작까지가 19일 소요되었으며 이는 알려진 가장 빠른 배포라고 말했다. 별도의 진술에서 머스크는 시스템이 온라인으로 전환되어 성공적으로 운영되기까지의 기간을 122일이라 언급했다. 19일은 토지 취득부터 훈련 시작까지의 전체 기간을 포함하지 않는다.
xAI는 2023년에 설립되었으며 Colossus 건설 이전에 이미 Grok-2를 출시했다. 황은 이러한 예외적인 실행 속도를 칩 사양이 아닌 엔지니어링, 건설, 대규모 시스템 관리, 자원 스케줄링에 대한 머스크의 이해에 귀속시켰다.
속도상의 이점은 허가, 전력 인프라, 액체 냉각 시스템, 칩 할당 등의 병렬 동원에서 비롯된다. 이는 현재 시장 입지를 결정하는 핵심 역량이다. 전통적인 클라우드 공급업체들은 3년의 계획과 1년의 디버깅 사이클 속에서 운영한다. 시스템에 즉시 전력을 공급할 수 있는 모델 회사와 칩 공급업체들은 훈련상의 이점을 얻게 되지만, 재래식 일정으로 진행되는 데이터 센터 프로젝트들은 구조적 지연에 직면하게 된다. 이러한 변화는 설계 회사와 연간 자본 배분에서 허가, 전력, 냉각, 칩 배송을 동시에 조율할 수 있는 조직들로 가격 결정력을 이전시킨다.
중요한 점은, 19일이라는 기간은 토지 취득이 아니라 하드웨어가 현장에 도착한 이후부터 시작된다는 것이다. 122일은 시스템 전원 공급부터 훈련 성공까지의 기간을 나타낸다. 네트워크 통합에서 NVIDIA가 담당한 역할은 속도가 구매자의 실행 능력과 공급업체의 통합 역량 모두에 달려 있음을 보여준다. 이제 공급망 통제가 경쟁의 승패를 결정한다. 칩에 먼저 전력을 공급하는 자가 먼저 훈련을 시작한다. 3년짜리 프로젝트들이 자금을 못 받는 이유는 수요 부족이 아니라 제품 사이클 지연 때문이다. 다음 클러스터 구축이 전력과 허가로 제약받는다면 표준 일정이 다시 우위를 점할 것이다. 만약 이러한 속도가 재현 가능하다면, 모델 회사들은 공개 발표 날짜가 아니라 전원 공급 날짜로 순위가 매겨질 것이다.