NVIDIA의 풀스택 추론 소프트웨어가 Blackwell에서 DeepSeek V4의 토큰 비용을 한 달 만에 최대 5배까지 감소시켰습니다.
조직들이 AI 파일럿에서 프로덕션 AI 팩토리로 전환하면서 인프라 결정이 피크 칩 사양에서 토큰당 비용으로 이동했습니다. 즉, 달러당, 와트당, 필요한 지연시간 범위 내에서 얼마나 많은 유용한 토큰을 제공할 수 있는지입니다.
NVIDIA GPU, CPU, 네트워킹 및 시스템과 공동으로 설계되고 광범위한 오픈소스 생태계로 강화된 NVIDIA의 풀스택 추론 소프트웨어는 하드웨어 성능을 지속적으로 개선합니다. NVIDIA Blackwell 플랫폼에서 소프트웨어 스택은 단 1개월 만에 DeepSeek V4 모델의 토큰 비용을 최대 5배 감소시켰습니다.
선도적인 기업과 추론 제공업체들은 이미 Blackwell에서 NVIDIA 추론 소프트웨어 스택의 복합적 가치를 보고 있습니다. 기존의 웹, 검색 및 SaaS 워크로드는 사용자가 유사한 소프트웨어 경로를 통해 페이지를 로드하거나 레코드를 업데이트하는 방식으로 비교적 예측 가능했습니다. 하지만 에이전트는 추론하고, 계획하고, 도구를 호출하며, 전문 서브에이전트를 구성하고 다중 턴 워크플로우 전반에 걸쳐 대규모 컨텍스트를 관리할 수 있으며, 단일 요청을 수백 개의 서브에이전트, 수천 개의 작업, 그리고 GPU, CPU, DPU 및 스토리지 시스템에 걸쳐 실행되는 여러 대형 언어 모델을 포함하는 분산 컴퓨팅 문제로 변환할 수 있습니다. 소프트웨어 스택은 그 복잡성이 낭비된 용량으로 변환되는지 아니면 토큰당 더 낮은 비용으로 변환되는지를 결정합니다.
토큰당 비용 절감은 개별 최적화를 시스템 레벨 성능으로 변환함으로써 달성됩니다. NVIDIA의 추론 소프트웨어 스택은 세 계층을 연결하여 하나의 시스템으로 작동하게 하며, 개별 최적화가 복합적으로 작용합니다. 분산 서빙, NVIDIA NVLink 상호 연결 기술을 통한 대규모 전문가 병렬화, NVFP4 정밀도 및 멀티토큰 예측은 각각 자체적으로 의미 있는 성능 향상을 제공합니다. 이를 결합하면 처리량을 최대 20배까지 증가시킵니다. 프로덕션에서 이러한 성능 향상을 실현하려면 프로덕션 운영 및 모델 런타임에서 커널, 통신 라이브러리 및 하드웨어 액세스에 이르기까지 전체 추론 스택 전반에 걸쳐 조율이 필요합니다.
동일한 풀스택 기반은 오픈소스 생태계에 의해 증폭됩니다. 2016년에 기본 CUDA 지원과 함께 출시된 PyTorch는 NVIDIA의 아키텍처와 함께 진화하여 개발자에게 익숙한 프레임워크를 통해 Tensor Cores, Transformer Engine 및 NVFP4와 같은 혁신에 직접 접근할 수 있도록 합니다. DFlash speculative decode(기존 하드웨어에서 최대 15배의 처리량 향상) 또는 FastVideo(5초 미만에 1080p 비디오 생성)와 같은 돌파구가 PyTorch에 도입되면 NVIDIA에서 즉시 실행됩니다.
DeepSeek V4와 같은 최첨단 오픈 모델이 출시될 때, vLLM 및 SGLang과 같은 선도적인 추론 프레임워크는 NVIDIA Blackwell 아키텍처에 대한 제로 데이 배포 방식을 갖추고 있어 모델을 수백만 개의 Blackwell GPU에 걸쳐 사용 가능하게 합니다. vLLM 및 SGLang 프레임워크 전반에 걸쳐 약 1개월 내에 Blackwell에서 DeepSeek V4의 성능이 최대 5배 향상되었으며, 토큰 비용을 이전 수준의 약 5분의 1로 절감했습니다. 이 오픈소스 플라이휠은 더 많은 개발자가 CUDA 네이티브 추론 경로를 최적화하고, 더 많은 프로덕션 배포가 생태계로 피드백되며, 각 소프트웨어 개선이 시간 경과에 따라 제공되는 토큰 출력을 증가시키면서 토큰당 비용을 지속적으로 낮춘다는 의미입니다.