포스트 트레이닝은 에이전틱 AI 시스템의 일회성 마무리 단계가 아니라 지속적이고 핵심적인 작업 부하가 되었다.
엘리트 선수들이 경기 사이사이에 지속적으로 기술을 연마하듯, 에이전트형 AI 모델도 환경이 변화하고, 예외 사례가 발생하며, 도구가 변경됨에 따라 지속적으로 적응해야 합니다. 프롬프트에 응답하는 생성형 모델과 달리, 에이전트형 모델은 계획을 수립하고 다양한 도구를 사용하며, 실행 중 마주치는 문제에 대해 복구할 수 있어야 합니다.
원시 데이터에 대한 초기 학습 이후 모델을 정제하는 단계인 사후 학습(Post-training)은 더 이상 일회성 마무리 작업이 아닙니다. 에이전트형 모델이 작동하는 환경이 빠르게 변하기 때문에 이는 지속적인 과정입니다. 에이전트가 사용하는 도구는 주 단위로 변경될 수 있으며, 테스트 세트가 예상하지 못한 예외 사례가 프로덕션 환경에서 나타납니다. 각 배포는 고유한 코드베이스, 정책 및 환경을 가져옵니다. 사후 학습은 새로운 문제가 표면화되면서 프로덕션으로부터 다시 루프를 돌며, 실행이 중단되지 않는 새로운 컴퓨팅 패턴을 만들어냅니다. 컴퓨팅 발자국이 커지는 이유는 단일 실행의 크기가 커서가 아니라, 실행이 지속적이기 때문입니다.
사후 학습의 목표는 지속적인 학습 주기 내에서 모든 순전파(Forward pass)와 역전파(Backward pass)의 산출량을 극대화하여 달러당 지능(Intelligence per dollar)을 최대화하는 것입니다. 순전파, 즉 추론(Inference)은 토큰당 비용으로 측정됩니다. 지능이 구축되는 곳은 바로 사후 학습입니다. 사전 학습(Pretraining)에서는 모델이 다음 토큰을 예측하는 방법을 배우며, 이는 유창성은 제공하지만 지능은 제공하지 않습니다. 사후 학습에서는 코드를 작성하고, 다단계 작업을 계획하며, 검색 도구를 사용하고, 문제가 발생했을 때 복구하는 방법을 배웁니다. 암기할 정답 키가 없고 보상만 존재하므로, 모델은 강화 학습 기법을 통해 학습합니다. 과제가 주어지면 모델은 시도를 작성하고, 이에 대한 점수가 매겨지며, 이 교훈이 수백만 번의 시도 동안 모델의 가중치를 업데이트하여 지능이 성장하도록 합니다.
토큰당 비용은 운영 효율성을 측정하는 반면, 달러당 지능은 모델 지능에 대한 투자가 성과를 내고 있는지 여부를 측정합니다. 이 두 개념은 경쟁 관계가 아니라 서로 중첩되어 있습니다. 토큰당 비용을 낮추는 AI 인프라는 모델에 구축되는 모든 지능 포인트의 비용도 낮추며, 구축된 모든 지능 포인트는 추론 공장이 제공하는 모든 토큰의 가치를 높입니다.
오픈 웨이트 기반 5,500억 파라미터 혼합 전문가(Mixture-of-Experts) 모델인 NVIDIA Nemotron 3 Ultra는 검증 가능한 벤치마크와 완전히 공개된 사후 학습 레시피를 제공합니다. SWE-bench verified라는 표준 실제 세계 코딩 벤치마크에서 71.7%의 점수를 기록했으며, 여기서는 오픈 소스 프로젝트의 실제 소프트웨어 버그 약 10개 중 7개에 대해 프로젝트 자체 테스트로 검증된 작동 가능한 수정 코드를 생성했습니다.
NVIDIA Blackwell 플랫폼은 실행당 비용을 낮추고 에이전트 시대가 요구하는 빈번한 사후 학습을 경제적으로 실현 가능하게 만듭니다. NVIDIA Vera Rubin 플랫폼은 이를 한층 더 확장하여, Blackwell 세대의 4분의 1 GPU만으로 가장 큰 모델을 훈련합니다. Vera Rubin은 에이전트 사후 학습 부하에 대해 달러당 지능을 극대화하도록 공동 설계되었으며, 실행당 더 많은 롤아웃(Rollouts), 더 많은 활성화된 환경, 그리고 중단 없는 사후 학습 주기를 지원합니다.
Prime Intellect는 NVIDIA Blackwell 위에서 최첨단 오픈 모델을 지속적으로 사후 학습하며, 추론 오케스트레이션을 위해 NVIDIA Dynamo를 사용합니다. Prime Intellect는 Vera Rubin을 사용하여 강화 학습 환경을 확장하고, 훈련에서 추론으로의 반복 루프 속도를 가속화할 계획입니다. Prime Intellect는 샌드박스 인프라를 최적화하여 NVIDIA Vera CPU와 통합함으로써, 대체 x86 아키텍처 대비 CPU 당 평균 처리량이 30% 이상 향상되었음을 입증했습니다.
Perplexity의 강화 학습 사후 학습 스택은 RDMA 기반 가중치 전송 엔진을 활용하여 수백 개의 NVIDIA GPU 위에서 비동기식으로 실행되며, 훈련 및 추론 컴퓨팅 노드 간에 트릴리언 파라미터 모델을 2초 이내에 동기화합니다. Together AI는 AI Native Cloud 플랫폼에서 지도 미세 조정(Supervised Fine-tuning), 강화 학습, 직접 선호도 최적화(Direct Preference Optimization)를 포함한 사후 학습 서비스를 제공하며, Vera Rubin 플랫폼을 활용할 계획입니다.