Friday, September 11, 2026
AI 인프라 · 뉴스 & 분석
반도체·하드웨어리포트
반도체·하드웨어 · 리포트

NVIDIA는 Vera Rubin을 저렴한 agentic AI를 위한 비용 최적화 학습 GPU로 홍보했으며, 원본 모델 학습보다 포스트트레이닝과 파인튜닝을 강조했다.

NVIDIA가 Vera를 플래그십 트레이너가 아닌 사후학습 워크홀로 재포지셔닝하며, 모델 규모 학습에서 배포 비용 최적화로의 시장 전환을 인정한다.
업계 전문지Slicast · July 18, 2026 · 미국 · 출처: Techgenyz
중요도 67

이전트 AI는 기존 생성형 AI와 근본적으로 다른 모델 개발 접근 방식이 필요합니다. 단일 프롬프트에 응답하는 모델과 달리, 에이전트 시스템은 목표를 추구하고, 환경이 변함에 따라 지속적으로 적응하며, 여러 도구를 활용하고, 실행 중 발생하는 장애에서 복구해야 합니다. 이러한 지속적인 적응으로 인해 사전학습 이후 모델을 최적화하는 단계인 후학습은 더 이상 일회성 마무리 단계가 아니라 지속적인 작업이 되었습니다. 도구가 매주 변경되고 프로덕션 엣지 케이스가 등장함에 따라, 후학습 사이클은 실시간 피드백으로부터 지속적으로 공급되어 에이전트 시대의 중추적 계산 수요가 됩니다.

NVIDIA의 접근 방식은 전통적인 토큰당 비용 지표보다 상위에 있는 달러당 지능을 최대화하는 데 중점을 둡니다. 토큰당 비용이 운영 효율성을 반영하는 반면, 달러당 지능은 더 광범위한 질문을 다룹니다. 즉, 제공할 가치가 있는 모델을 구축하고 지속적으로 유지하는 데 드는 비용은 얼마인가 하는 것입니다. 토큰당 비용을 개선하면 달러당 지능이 직접 개선되며, 모델 기능의 모든 향상도 마찬가지입니다.

후학습은 일반적으로 강화학습을 기반으로 하며, 이 과정에서 모델은 작업에 대한 시도(순전파)를 생성하고, 보상 점수를 받으며, 역전파를 통해 가중치를 업데이트합니다. 수백만 건의 병렬 시도에 걸쳐 이 프로세스는 사전학습만으로는 제공할 수 없는 코딩 능력, 다단계 계획 수립, 도구 사용, 오류 복구와 같은 진정한 지능을 개발합니다. 규모 측면에서 이는 수천 개의 병렬 환경을 조율하고, 보상을 검증하고, 가속기 전체에서 업데이트된 가중치를 동기화해야 합니다.

NVIDIA의 Nemotron 3 Ultra는 이러한 접근 방식으로 달성할 수 있는 결과를 보여줍니다. 이 공개 가중치 5,500억 매개변수 전문가 혼합 모델은 감독 학습 미세조정, 강화학습, 증류 방법을 사용하여 학습되었습니다. 실제 코딩 벤치마크인 SWE-bench에서 71.7%를 달성했으며, 오픈 소스 프로젝트의 정상적인 소프트웨어 버그 10개 중 약 7개에 대한 수정안을 성공적으로 생성했으며, 각각은 프로젝트 자체의 테스트 스위트에 대해 검증되었습니다.

Vera Rubin 플랫폼은 이를 한 단계 더 발전시켜 이전 Blackwell 세대의 GPU 수의 1/4로 최대 규모 모델을 학습합니다. 이는 에이전트 후학습을 위한 달러당 지능을 최적화하기 위해 end-to-end로 설계되었습니다. 즉, 반복당 더 많은 롤아웃, 확대된 병렬 환경, 그리고 끝나지 않는 지속적인 후학습 사이클입니다.

초기 도입자들은 구체적인 이점을 보여줍니다. Prime Intellect의 Lab은 NVIDIA Blackwell에서 최신 모델을 지속적으로 후학습시키고 있으며 낮은 지연 시간과 에너지 효율적인 강화학습을 위해 Vera CPU를 통합했습니다. 실제 RL 샌드박스 워크로드에서 Prime Intellect는 Vera가 다른 x86 아키텍처 대비 CPU당 약 30% 높은 처리량을 제공하는 것을 확인했습니다. Perplexity는 RDMA 기반 가중치 전송으로 수백 개의 GPU에 걸쳐 비동기 RL 후학습 스택을 운영하며, 이는 학습 노드와 추론 노드 간의 조 단위 매개변수 모델을 2초 이내에 동기화합니다. 이미 NVIDIA GB200 NVL72 시스템에 후학습된 Qwen3 235B 모델을 배포했습니다. Collective AI는 후학습을 서비스로 제공합니다. 감독 학습 미세조정, 강화학습, 직접 선호도 최적화를 포함하며, AI Native Cloud 플랫폼의 API 및 SDK를 통해 제공되고 있으며, 현재 Vera Rubin 플랫폼 도입을 준비하고 있습니다.

원문 보기