AI 연구소들은 이제 모델을 학습시키는 데 드는 연산 자원보다 모델이 추론하도록 가르치는 데 더 많은 연산 자원을 쓰고 있다고 Startup Fortune이 보도했다.
프런티어 AI 연구소들은 이제 단순히 더 거대한 사전학습(pretraining) 작업에만 컴퓨팅 자원을 쏟아붓는 것이 아니라, 사후학습(post-training)과 추론 시점의 추론(inference-time reasoning)에도 점점 더 많은 자원을 투입하고 있습니다. 사전학습 규모가 극적으로 커지지 않는 상황에서도 엔비디아의 수주 잔고가 계속 늘어나는 이유가 바로 이 변화에 있습니다.
컴퓨팅 이야기는 더 이상 다음 기반 모델의 사전학습 규모를 키우는 것에만 국한되지 않습니다. Epoch AI의 공개 모델 추적 자료와 이후 GPT-5에 대한 분석은 과거 패턴과의 단절을 보여줍니다. 과거에는 OpenAI의 새로운 플래그십 모델이 등장할 때마다 이전 모델보다 훨씬 많은 학습 컴퓨팅을 소모했습니다. 사전학습은 인터넷 데이터를 모델에 먹이고 규모만으로 지능이 생기기를 기대하는 과정으로, 한때 프런티어 학습 예산의 대부분을 차지했습니다. 이제는 자금이 다른 곳으로 옮겨가고 있습니다. 이미 많은 지식을 갖춘 모델에게 답변하기 전에 문제를 단계적으로 추론하는 법을 가르치는 데 투자가 몰리고 있는 것입니다.
OpenAI 자체의 모델 이력이 이 전환점을 보여줍니다. Epoch AI의 분석에 따르면 2025년 8월 출시된 GPT-5는 OpenAI의 이전 "가장 크고 가장 많이 아는" 모델이었던 GPT-4.5보다 적은 학습 컴퓨팅을 사용한 것으로 추정됩니다. 이는 자금이 부족한 회사의 모습이 아닙니다. 다른 지렛대를 찾아낸 회사의 모습입니다. 두 모델의 전체 학습 예산은 여전히 공개되지 않았지만, 방향은 분명합니다. 새로운 성능 향상은 단순히 더 큰 사전학습 작업에서 나오는 것이 아니라, 사전학습, 사후학습, 추론 시점의 추론이 혼합된 방식에서 나오고 있습니다.
이 전환의 대략적인 시작 시점이 있습니다. 2024년 9월 무렵, OpenAI와 다른 곳의 연구자들은 추론 사슬에 대한 강화학습을 대규모로 작동하게 만드는 기법들을 발표하기 시작했습니다. 단순히 모델의 답변을 더 세련되게 만드는 수준이 아니었습니다. OpenAI의 o 시리즈 모델이 이러한 흐름의 첫 가시적인 결과물이었습니다. 2025년 1월, DeepSeek은 R1을 출시하고 그 방법을 공개했습니다. 검증 가능한 보상(verifiable rewards)을 이용한 강화학습 학습법으로, 수학과 코딩 문제에서 모델이 단순한 정답 신호를 받고 시행착오를 통해 학습하는 방식이었습니다. 대규모 인간 라벨링 데이터셋은 필요하지 않았습니다. DeepSeek의 논문은 DeepSeek-R1-Zero가 "아하 모멘트"를 보였다고 설명했습니다. 답변 도중 멈추고 자신의 논리를 다시 점검하는 행동으로, 누구도 명시적으로 학습시키지 않았던 행동이었습니다.
이 점이 중요했던 이유는 이 접근법이 저렴하고 쉽게 복제 가능했기 때문입니다. 2025년 내내 이 분야를 추적한 여러 AI 연구자들에 따르면, 연구자 세바스찬 라슈카(Sebastian Raschka)의 널리 읽힌 "State of LLMs" 요약을 포함해, 오픈 웨이트와 클로즈드 모델을 가리지 않고 거의 모든 주요 연구소가 R1 출시 후 몇 달 안에 플래그십 모델의 추론 변형 버전을 내놓았습니다. Anthropic의 Claude 모델은 확장 추론 모드를 갖추었고, Google은 Gemini에 추론 기능을 내장했습니다. DeepSeek이 프런티어 연구소의 울타리 밖에서도 이 방법이 통한다는 것을 보여준 뒤, 이를 건너뛸 이유가 있는 곳은 거의 없었습니다.
이는 사전학습 FLOPs만으로 AI 인프라 수요를 모델링하는 사람들에게 특히 중요합니다. 추론 모델은 단지 다르게 학습하는 것이 아니라 다르게 실행됩니다. 질문에 답할 때마다 보이는 응답을 내놓기 전에 숨겨진 추론 토큰의 사슬을 생성합니다. 인프라 연구 전반에서 인용되는 업계 추정치에 따르면, 같은 작업을 수행하는 비추론 모델에 비해 쿼리당 토큰이 10배에서 100배 더 많습니다. 이 컴퓨팅 비용은 학습 중에 한 번 지불되는 것이 아닙니다. 사용자가 전송 버튼을 누를 때마다 발생합니다.
이것이 컴퓨팅 자원 배분의 변화와 마이크론의 재무 실적을 잇는 고리입니다. 마이크론은 9월 30일 회계연도 4분기 매출이 542억 3천만 달러로 사상 최고를 기록했다고 발표했으며, 연간 매출은 1,331억 9천만 달러에 달했습니다. 회사와 애널리스트들은 이 수치를 AI 추론 클러스터에 데이터를 공급하는 고대역폭 메모리(HBM) 수요 급증과 직접 연결하고 있습니다. 대만 기반 리서치 기관 TrendForce는 2026년 상위 9개 클라우드 사업자의 자본지출이 8,867억 달러를 넘어설 것으로 추정합니다. 이 지출은 GPU를 넘어 AI 서버, 액체 냉각, 첨단 패키징, 고속 상호연결, 전력 인프라, 메모리까지 확대되고 있습니다. 한편 Counterpoint Research는 맞춤형 AI 프로세서용 HBM 수요가 2024년부터 2028년 사이 35배 성장할 것으로 전망합니다.
이는 채권 투자자와 반도체 애널리스트들이 벌여온 AI 자본지출 논쟁의 틀을 바꿉니다. 그동안의 우려는 사전학습 규모 확대가 수확 체감에 부딪히고 있어서 결국 GPU 주문이 멈출 것이라는 데 있었습니다. 이 우려는 GPU가 주로 학습용이라는 전제를 깔고 있었습니다. 그러나 GPU는 점점 더 학습 후 모델을 구동하는 데 쓰이고 있습니다. 답변당 토큰을 약 50배 소모하는 추론 모델은 다음 사전학습 작업이 두 배로 커지든 거의 그대로이든 그 추론 용량을 필요로 합니다. 엔비디아 CEO 젠슨 황은 사전학습 규모 확대가 둔화되더라도 추론 모델이 GPU 수요를 계속 끌어올릴 것이라고 공개적으로 주장해 왔으며, 이 주장은 Computer Weekly 등에서도 다뤄졌습니다.
두 번째 파급 효과도 있습니다. 다음 벤치마크 라운드에서 누가 이기느냐에 관한 것입니다. 병목이 "누가 가장 큰 사전학습 클러스터를 감당할 수 있는가"에서 "누가 더 나은 강화학습 기법을 가졌는가"로 옮겨갔다면, 경쟁의 셈법이 달라집니다. 강력한 강화학습 접근법을 가진 중간 규모 모델이 사전학습 규모에만 기대는 훨씬 큰 모델보다 추론에서 앞설 수 있습니다. DeepSeek은 다른 시장이 연구할 수 있는 학습 기법과 함께 경쟁력 있는 오픈 웨이트 추론 모델을 공개함으로써 이 주장을 강화했습니다. 그래서 OpenAI, Anthropic, Google이 이제 파라미터 수가 아니라 추론 벤치마크에서 경쟁하고 있으며, AI 역량의 다음 도약은 더 큰 데이터센터 기공식보다 학습 기법 논문에서 나타날 가능성이 높아진 것입니다.
이것이 사전학습이 사라진다는 뜻은 아닙니다. 추론 기법이 덧입혀질 기반 모델은 여전히 누군가가 만들어야 합니다. 그러나 컴퓨팅의 계산 구조는 뒤집혔고, 그 위에 세워진 칩 수요 이야기는 이제 사전학습이 다시 확대되는지 여부에 훨씬 덜 의존합니다.