SpaceX, Stargate 이니셔티브 일환으로 AI 컴퓨팅 용량 10 GW 추진 중, Elon Musk이 xAI/Colossus 인프라 확장을 위한 '편안함' 영역 진입 언급
동일한 1기가와트(GW)의 AI 컴퓨팅 파워를 기준으로 하더라도, 한 비즈니스 모델은 연간 수십억 달러의 수익만 창출할 수 있는 반면, 다른 모델은 1,000억 달러를 초과할 수도 있습니다. 이는 무엇을 의미할까요?
이 답변은 전체 AI 인프라 산업에 있어 완전한 게임 체인저가 될 수 있습니다.
지난 2년 동안 시장은 GPU 대수와 훈련 클러스터 규모를 통해 AI 군비 경쟁을 측정해 왔습니다. 더 많은 H100과 GB200을 보유하고, 더 큰 훈련 클러스터를 운영하는 기업이 더 강력한 AI 인프라를 갖춘 것으로 간주되었습니다. 하지만 SemiAnalysis의 최신 보고서에서는 더욱 근본적인 프레임워크를 제시합니다. 미래에 진정으로 중요한 것은 당신이 보유한 GPU의 수가 아니라, 전력 1메가와트(MW)당 최종적으로 생산할 수 있는 판매 가능한 토큰의 양과 그것이 창출하는 수익이라는 것입니다.
Tokenomics Model 및 Inference Simulator에 따르면, 최첨단 모델, GB300 클러스터, 실제 Agentic Coding 워크로드, API 가격 등에 대한 특정 가정 하에서 OpenAI와 Anthropic의 추론 컴퓨팅 1기가와트당 잠재적 연간 수익은 1,000억 달러를 초과할 수 있습니다. 비교하자면, 보고서는 동일한 GB300 클러스터 리스의 연간 비용을 약 120억 달러로 추정합니다. 이러한 수치는 모델 수요, 토큰 가격, 가동률, 지연 시간 요구 사항, 소프트웨어 및 하드웨어 효율성에 크게 의존하며 공격적이지만, 왜 모든 주요 기술 기업들이 갑자기 이처럼 치열하게 전력을 확보하기 위해 쫓고 있는지 설명해 주는 점점 더 현실적인 질문을 제기합니다.
이 예측이 맞다면 SpaceX의 야망은 로켓 건설, 위성 발사, 스타링크 판매를 훨씬 넘어설 것입니다. SpaceX는 세계 최대의 AI 컴퓨팅 공급업체 중 하나가 되기를 목표로 합니다. 또한 컴퓨팅 용량을 몇 달 또는 심지어 1년 전에 확보하는 것이 막대한 경제적 가치를 생성하기 시작함에 따라, AI 인프라의 희소성은 칩에 대한 경쟁에서 전력, 엔지니어링, 그리고 시간에 대한 산업 전쟁으로 이동하고 있습니다. 복잡한 엔지니어링을 한계까지 압축하는 것은 머스크가 가장 잘 아는 게임입니다.
SemiAnalysis 보고서의 가장 중요한 기여는 Revenue/MW(수익/메가와트) 방정식의 새로운 계산입니다. 동일한 GB300 클러스터에서 GPU가 전통적인 모델을 통해 단순히 임대되는 경우, 경제적 가치는 주로 장비 비용, 감가상각, 리스 가격에 의해 결정됩니다. 그러나 이러한 GPU가 궁극적으로 가장 진보된 최첨단 모델을 서비스하고, API를 통해 추론 토큰을 직접 판매하며, Coding Agents, Copilots 및 유사한 제품을 제공하는 경우, 메가와트당 수익 능력은 완전히 다른 차원의 규모가 될 수 있습니다.
SemiAnalysis는 GB300 클러스터에서 최첨단 모델 API 추론을 실행할 때 OpenAI와 Anthropic의 잠재적 수익이 메가와트당 연간 1억 달러를 초과하여 기가와트당 연간 1,000억 달러에 달할 수 있다고 계산합니다. 이 계산에는 모델 아키텍처, 메모리 대역폭, 서빙 구성, 처리량, 첫 번째 토큰까지의 시간(TTFT), 입력 토큰, 캐시 읽기, 캐시 쓰기, 출력 토큰 등의 변수가 포함되며, 실제 Agentic Coding 워크로드에서 유도된 트레이스도 사용됩니다.
이는 AI 인프라 평가 방식의 명확한 전환을 시사합니다. 초기 단계에서 시장은 GPU 대수를 비교했고, 그 다음에는 FLOPS와 훈련 클러스터 규모를 비교했습니다. 대규모 추론 시대에 더 중요한 지표는 점차 초당 토큰 수, 와트당 토큰 수, 달러당 토큰 수, 메가와트당 토큰 수, 그리고 궁극적으로 Revenue/MW가 될 가능성이 높습니다.
이것이 바로 GB300의 중요성이 단순히 "GB200보다 빠르다"는 것을 넘어선 이유입니다. 보고서의 모델에 따르면, 동일한 Fable 5 추론 시나리오에서 GB200 NVL72는 메가와트당 연간 약 7,340만 달러의 잠재적 수익에 해당하는 반면, GB300 NVL72는 이를 약 9,970만 달러로 증가시킬 수 있습니다. 이는 차세대 하드웨어가 창출하는 진정한 가치가 동일한 전력 예산 내에서 더 많은 고부가가치 토큰을 생산하는 데 있다는 것을 의미합니다.
NVIDIA 자체도 비슷한 언어로 AI 인프라를 재정의하고 있습니다. 올해 5월 출시된 DSX 플랫폼은 이미 칩, 네트워킹, 소프트웨어에서 전력, 냉각, 데이터센터 운영에 이르기까지 AI 팩토리의 핵심 지표 중 하나로 '메가와트당 토큰 성능'을 확립했습니다. 추론 수요가 일반적인 채팅에서 Agentic Coding, AI Workers, 다중 에이전트 협업, 지속적으로 실행되는 작업으로 확장됨에 따라 이러한 변화는 더욱 두드러질 것입니다.
훈련은 일반적으로 정의된 단계와 주기를 갖는 반면, 추론 수요는 "사용자 수 × 에이전트 수 × 작업당 토큰 소비량 × 실행 시간"에 더 가깝습니다. 에이전트가 "질문에 답하는" 단계에서 "지속적으로 작업하는" 단계로 이동하면 토큰 소비량의 상한선이 확대됩니다. 이러한 관점에서 볼 때, 다음 단계의 AI 컴퓨팅 전쟁에서 주목해야 할 가장 중요한 변수는 훈련 클러스터가 얼마나 커질 수 있는지가 아니라, 이러한 컴퓨팅 자원이 최종적으로 얼마나 많은 토큰을 생산할 수 있는지일 것입니다.