NVIDIA는 추론 및 장문맥 AI 워크로드에 최적화된 Rubin CPX GPU 아키텍처를 미리 공개합니다.
Nvidia는 AI 데이터센터 시장에서 중대한 변화를 준비하고 있으며, 전통적인 학습 워크로드 지배에서 더욱 다양한 추론 분야로 전환하고 있습니다. 지난 화요일 캘리포니아 산타클라라 본사의 GPU 제조업체는 대규모 컨텍스트 처리를 처리하도록 특별히 설계된 새로운 GPU 클래스인 Rubin CPX를 공개했으며, 이를 통해 AI 시스템은 백만 토큰 소프트웨어 코딩 및 생성형 비디오 애플리케이션을 처리할 수 있습니다. 새로운 유닛은 추론 작업을 위한 에너지 효율성과 높은 성능을 제공하며, $100 million당 $5 billion의 토큰 수익을 창출하고, Nvidia의 Vera Rubin NVL 144 CPX 플랫폼 내에서 동작합니다.
시장 분석에 따르면 이러한 전략적 변화는 빠르게 성장하는 기회에 부응합니다. 글로벌 AI 추론 시장은 2025년에 $106 billion으로 추정되었으며, 2030년까지 $255 billion으로 성장할 것으로 예상됩니다(Markets and Markets 보고서). Blackwell Ultra와 향후 출시될 Vera Rubin GPU로 구동되는 Nvidia의 신규 추론 데이터센터 플랫폼은 특히 "AI 팩토리"를 주도하는 Mixture of Experts(MoE) LLM 아키텍처를 활용하는 가장 까다로운 워크로드를 처리하도록 설계되었습니다.
Moor Insights & Strategy의 부사장이자 수석 분석가인 Matt Kimball은 Data Center Knowledge에 Nvidia의 추론 중심 전략을 지지하면서 "Rubin은 정말 뛰어난 칩입니다... Blackwell이 Hopper에 비해 뛰어났던 것처럼요. 더 빠르고 더 큰 추론을 가능하게 하고 있으며, 토큰 윈도우를 확대하고 있습니다"라고 말했습니다. 다만 Kimball은 Rubin CPX가 평균적인 기업을 대상으로 하지 않는다고 지적하면서 "이것은 Rubin을 활용해 정말 고급 사용 사례를 겨냥한 특수 추론 칩을 만든 것입니다"라고 언급했으며, 하이퍼스케일러와 대규모 기업이 고객의 대다수를 차지할 가능성이 높습니다.
Nvidia의 AI 및 데이터센터 GPU 마케팅 이사인 Shar Narasimhan은 Rubin CPX의 시장 포지셔닝을 강조하면서 "[Rubin CPX]는 지능형 코딩 시스템과 비디오 생성 같은 새로운 프리미엄 사용 사례 계층을 열어줍니다"라고 말했으며, "AI 팩토리의 생산성과 성능을 획기적으로 향상시킬 것입니다"라고 덧붙였습니다.
지난 화요일 Nvidia는 GB300 NVL72 랙 규모 시스템의 벤치마크 결과를 통해 Blackwell Ultra 아키텍처의 성능을 입증했으며, 이는 이전 세대에 비해 1.4배 우수한 DeepSeek-R1 추론 성능을 보여주었고 MLPerf Inference v5.1 스위트에 추가된 모든 새로운 데이터센터 벤치마크에서 기록을 수립했습니다(Llama 3.1 405B Interactive, Llama 3.1 8B, Whisper 포함). Nvidia의 가속 컴퓨팅 제품 이사인 Dave Salvatore는 "이 수치들에 매우 만족합니다. 그리고 Blackwell Ultra 소프트웨어 스택을 계속 최적화하면서 이 수치들이 시간이 지남에 따라 더욱 향상될 것으로 예상합니다"라고 말했습니다. Nvidia에 따르면 이러한 벤치마크 결과는 Blackwell Ultra가 AI 팩토리의 생산성을 향상시키면서 동시에 수익을 증대하고 소유 비용을 절감할 수 있는 잠재력을 보여줍니다.