36Kr는 AI 분야가 투자 회수(엑시트)를 위한 인수자가 심각하게 부족한 상황에 직면해 있다고 보도했다.
최근 바이트댄스는 296억 달러 규모의 신디케이트 대출을 확보했고, 알리바바는 800억 홍콩달러 규모의 주식 배정(placement)을 완료했습니다. 몇 달 전에는 구글과 아마존이 합계 8,000억 달러가 넘는 자금을 조달했고, 엔비디아는 5,000억 달러 규모의 "대형 계획"을 발표했습니다. 전 세계 주요 기술 기업들이 자본 확보에 분주한 가운데, 이들이 자금을 쏟아붓는 주된 방향은 하나입니다. 바로 AI 인프라입니다.
거시적 관점에서 보면, 현대 역사에서 산업 지형을 바꾼 기반 기회는 본질적으로 최상위 수준의 인프라 업그레이드였습니다. 19세기 미국 서부의 철도 열풍과 골드러시, 중국의 부동산 도시화 추진, 그리고 현재 전 세계적인 AI 인프라 붐이 모두 이 패턴에 들어맞습니다. 대규모 자본 투입에는 시장 분쟁과 거품이 따르기 마련이지만, 그 과정에서 남겨진 인프라는 향후 수십 년간 산업 발전의 든든한 토대가 될 것입니다.
그러나 이전의 인프라 물결과 비교하면, 이번 AI 인프라 물결은 적용 범위가 더 넓고, 자본 투자 규모가 전례 없으며, 산업 내 반복 속도가 훨씬 빠르고, 논쟁도 더 많습니다.
7월에는 자본 시장이 AI 인프라에 대한 막대한 투자와 그것이 창출할 수 있는 수익 사이의 격차에 의문을 제기하기 시작하면서 AI 인프라가 급격한 변동을 겪었습니다. 무분별하게 GPU를 쌓고 클러스터를 무리하게 확장하던 시대가 끝난 것은 아니지만, 시장은 컴퓨팅 파워에 수조 달러를 투자한 뒤 기업이 실제로 이익을 낼 수 있는지 묻기 시작했습니다.
이는 자본 측면과 산업 측면 모두에서 변화를 알리는 신호입니다. 올해가 작년과 구별되는 점은 일반 사용자들이 데스크톱 에이전트를 정기적으로 사용하기 시작했다는 것입니다. AI는 더 이상 단순한 채팅 도구가 아니라, 주기적으로 자동 실행되며 작업을 수행할 수 있는 에이전트가 되었습니다. 올해는 진정한 에이전트의 첫해입니다.
소비자 대상(C-end) 에이전트의 광범위한 보급은 토큰 소비량도 예상을 넘어서게 만들었습니다. 올해 3월 중국의 일평균 토큰 호출량은 140조 개를 넘었으며, 이는 2024년 초 수준의 1,000배가 넘습니다.
그런데 어색한 문제가 있습니다. 모두가 GPU 부족을 이야기하며 컴퓨팅 파워를 놓고 경쟁하지만, 매일 상당수의 GPU가 아무 일 없이 유휴 상태로 놓여 있습니다. 카네기멜런대학교는 756개의 GPU를 31일 동안 연속 가동한 결과, 클러스터 시간의 약 20%가 "대기"에 소요된다는 사실을 발견했습니다.
OpenAI의 추론 사업에서는 전체 에너지 소비의 절반 이상이 유휴 상태로 낭비되고 있습니다. 국내 지능형 컴퓨팅 센터의 상황은 더욱 극단적이어서, GPU 평균 가동률이 30% 미만입니다. 지난 몇 년간 AI 인프라는 무분별하게 성장했고, 급속한 확장이 효율 문제를 가려 왔을 수 있습니다. 이제 수익을 거둘 시기가 다가오면서, 경쟁의 초점은 누가 토큰 비용을 낮추고 컴퓨팅 파워 가동률을 높이느냐로 옮겨 가고 있습니다.
효율성은 AI 인프라의 새로운 성공 열쇠가 되었습니다. 시급한 과제는 유휴 컴퓨팅 파워를 되살리는 방법과 추론 비용을 낮추는 방법입니다. AI 인프라 시장이 깊은 물속으로 들어서면서 업계의 잡음도 커지고 있습니다.
AI 분야는 지나치게 넓게 확장되어 칩, 전력, 하드웨어, 소프트웨어, 모델, 응용이 겹겹이 쌓여 있습니다. 새로운 자금 조달, 스토리, 개념이 매일 등장하고, 각 참여자는 자신의 이익에 맞는 자기 일관적인 이야기를 들려줍니다. 책 *신호와 소음(The Signal and the Noise)*이 지적하듯, 정보가 폭발하는 시대에 소음은 언제나 신호보다 더 풍부하고 더 빠릅니다.
AI 산업이 바로 이런 상태에 놓여 있습니다. 모두가 열광적인 장기 스토리를 말하지만, 단기에 대해 확신을 갖는 사람은 없습니다. 인프라에 투자된 수천억 달러를 두고, 장기적 배당과 단기적 거품의 비율은 얼마나 될까요? AI 인프라에는 진정한 진입장벽이 있는가? 냉각되는 시장 심리가 1차 시장의 자금 조달과 엑시트에 영향을 미칠 것인가? AI 인프라에서 중국과 미국의 차이와 격차는 무엇이며, 곡선을 추월할 기회는 어디에 있는가? 이러한 질문에 답하려면 "소음"을 걸러내고 진짜 "신호"를 찾아야 합니다. 이러한 흐름과 질문을 염두에 두고, 차이나벤처(ChinaVenture)는 중관촌과학성그룹(Zhongguancun Science City Corporation), 중관촌벤처스트리트와 공동으로 "에이전트의 첫해: AI 인프라의 새로운 동력 재구성"이라는 주제의 심층 비공개 살롱을 개최했습니다.
**7대 자매는 뭉치고, 중국 시장은 분산되어 있다**
이번 AI 인프라 살롱에서 지우장윈지(Jiuzhang Yunji), Terminus, 컨버전트 인텔리전스(Convergent Intelligence)는 모두 중국의 핵심 직접 토큰 공급업체로 소개되었습니다. 자체 개발한 스케줄링, 이기종 통합, 전 과정 최적화 역량을 바탕으로, 이들은 각각 GPU 유휴, 낮은 컴퓨팅 파워 가동률, 높은 추론 비용 문제에 대한 자신만의 접근법을 가지고 있습니다.
에이전트가 대규모로 확산되고 네트워크 전반의 토큰 수요가 급증하면서, 효율을 높이고 비용을 낮추며 안정적인 컴퓨팅 파워 공급을 보장할 수 있는 기업들이 AI 인프라의 정교한 고도화를 떠받치는 핵심 기반이 되었습니다.
지우장윈지는 중국 전역에 12개의 지능형 컴퓨팅 센터 노드를 배치했고 동남아시아 시장으로도 진출했습니다. 사업 영역은 신규 지능형 컴퓨팅 클라우드, 학습 팩토리, 토큰 팩토리의 세 가지 주요 분야를 포괄합니다.
지우장윈지의 공동 창업자이자 COO인 상밍둥(Shang Mingdong)은 한 가지 흐름을 관찰했습니다. 미국 시장에서는 컴퓨팅 파워 공급이 고도로 집중되어 있어, 주요 클라우드 벤더와 AI 인프라 기업들이 긴밀한 생태계 협력을 형성하고 있습니다. 반면 중국 시장은 실제 수요에 의해 더 많이 움직이며, 보다 분산되고 산업 현장에 밀착된 특징을 보입니다.
컨버전트 인텔리전스의 핵심 팀원들은 칭화대학교 컴퓨터과학과 고성능컴퓨팅연구소에서 과학 연구와 엔지니어링 배경을 갖추고 있습니다. 회사는 이 팀이 10여 년간 쌓아 온 기술 역량을 이어받고 있으며, 핵심 R&D 인력 대부분이 칭화대 출신입니다. 2023년 말 "백 가지 모델 전쟁"이 한창이던 시기에 설립된 컨버전트 인텔리전스는 대규모 모델 추론에 명확히 집중하는 선택을 했는데, 당시 스타트업으로서는 드문 선택이었습니다.
컨버전트 인텔리전스의 사장 겸 CFO인 우원제(Wu Wenjie)는 3년 전 업계의 투자자이자 연구자였으며 현재는 기업가입니다. 그녀는 이렇게 관찰했습니다. "실제 기업가와 실무자들은 국산 GPU와 해외 고성능 GPU 사이에 여전히 큰 격차가 있다는 것을 깊이 인식하고 있으며, 해외 GPU를 구하는 것은 점점 더 어려워지고 있습니다."
Terminus의 AI 인프라 사업 총괄인 리위에(Liu Yue)는 시나리오 측면에 집중하고 있습니다. Terminus는 2015년 충칭에서 설립되었습니다. AIoT 시나리오에서 출발해 AI-IoT 유니콘으로 성장했습니다. 주주로는 국유 중앙기업, IDG Capital과 AL Capital 같은 유명 투자사, 그리고 JD, 아이플라이텍(iFLYTEK), 상탕(SenseTime) 같은 선도적 산업 투자자가 있습니다. 현재 제품은 전 세계 170여 개 도시에 배치되어 있으며 900여 개 고객사에 서비스를 제공합니다.
리우의 핵심 견해는 Terminus가 수직적 시나리오를 활용해 AI 인프라와 에이전트의 제품 반복을 이끈다는 것입니다. 이는 일반 토큰 서비스와 컴퓨팅 파워 임대에 집중하는 주류 시장 경로와는 다릅니다. "미국 벤더들은 인프라와 상위 계층의 범용 모델에 더 집중되어 있습니다. 국내 시장은 다릅니다. 시나리오 밀도가 높고, 산업 분류가 완비되어 있으며, 응용 계층이 번성하고 있습니다."
칩 수준의 격차는 또 다른 형태로 나타납니다. 하이쏭캐피털(Haisong Capital)의 총괄이사 리천(Liu Chen)이 사례를 들었습니다. 일부 신생 기업은 추론 칩을 전문으로 하며, 심지어 특정 모델 기업의 아키텍처를 칩에 직접 새겨 넣기도 합니다. 이는 사실상 특정 모델 전용 칩이며, 기존 솔루션보다 100배 높은 동작 효율을 가집니다. 명백한 대가는 고객이 다른 모델로 바꾸거나 모델이 반복 개선되면 해당 칩을 더 이상 사용할 수 없다는 점입니다.
리천은 절대적 범용성과 절대적 효율성 사이에는 수많은 중간 지대가 있으며, 각 칩은 그중 한 지대 안의 특정 시나리오만 해결한다고 설명했습니다. "한 기업이나 한 제품으로 모든 문제를 해결하기는 어렵습니다." 대기업은 스타트업 전체를 인수할 수 없기 때문에, 인재를 영입합니다