AgentPerf, 에이전트 AI 워크로드를 위해 특별히 설계된 업계 최초의 벤치마크는 NVIDIA의 Blackwell platf를 보여줌.
에이전트형 AI는 전통적인 대화형 AI와 근본적으로 다른 워크로드를 나타냅니다. 채팅 완료가 하나의 대형 언어 모델 호출과 하나의 응답으로 구성된 단일 스프린트라면, 에이전트는 목표를 여러 단계로 분할하고 완료를 위해 계속 작동하는 릴레이와 같습니다. 이로 인해 수십에서 수백 개의 LLM 호출이 체이닝되며, 각 호출은 다음 호출로 증가하는 컨텍스트를 전달합니다. 코드 컴파일, 실행, 데이터베이스 검색 및 웹 브라우징과 같은 도구 호출은 모든 핸드오프 시점에서 발생합니다. 복잡성은 가법적이지 않고 승법적으로 증가합니다.
이러한 구별은 성능 측정에서 매우 중요합니다. 기존 AI 추론 벤치마크는 단일 LLM 호출—모델이 얼마나 빠르게 응답하는지, 시스템이 동시에 얼마나 많은 요청을 처리하는지—을 측정합니다. 이러한 벤치마크는 체이닝된 LLM 호출, 도구 지연 및 확장되는 컨텍스트가 컴퓨팅 시스템에 근본적으로 다른 방식으로 부하를 주는 에이전트 워크로드를 위해 설계되지 않았습니다. 대규모로 에이전트를 구축하고 배포하는 기업에게는 에이전트 반응성, 동시 배포 용량, 그리고 투자된 달러와 와트당 AI 인프라가 제공하는 생산적 작업을 이해하는 것이 필수적입니다.
AgentPerf의 첫 번째 라운드는 오늘날 가장 강력한 에이전트를 구동하는 프론티어 모델 클래스를 대표하는 대형 혼합 전문가(MoE) 모델인 DeepSeek V4 Pro를 사용하여 에이전트 성능을 측정합니다. 이 워크로드에서 NVIDIA GB300 NVL72는 벤치마크에서 최고 성능을 발휘하며, NVIDIA HGX H200 시스템 대비 메가와트당 최대 20배 더 많은 에이전트를 실행합니다. 이 성능 우위는 전체 스택에 걸친 극단적인 코드사이드(코드사이드)에서 비롯됩니다. GB300 NVL72는 72개의 GPU를 단일 랙 규모 시스템으로 연결하여 DeepSeek V4 Pro와 같은 대형 MoE 모델이 대규모로 모델 실행을 효율적으로 분산할 수 있게 합니다. CUDA 커널은 통신과 연산을 중첩시켜 전문가 간 조정에 따른 비용을 흡수함으로써 지연 시간을 추가하지 않고 이를 가속화합니다. NVIDIA TensorRT LLM은 동시 에이전트 세션이 확장됨에 따라 효율성을 유지합니다. 예를 들어, 입력 처리와 출력 생성을 분리하여 각각 독립적으로 최적화할 수 있습니다.
이러한 결과는 에이전트 AI가 프로덕션 환경에서 작동하는 방식을 반영하도록 처음부터 구축된 벤치마크 방법론에 기반합니다. AgentPerf는 에이전트가 작업을 받고 파일을 읽고, 코드를 작성 및 편집하며, 명령을 실행하고 결과를 기반으로 반복하는 실제 코딩 에이전트 트래젝토리에서 구축되었습니다. 이는 12개 이상의 프로그래밍 언어에 걸쳐 있는 실제 공개 코드 저장소에서 추출된 것입니다. 긴 시퀀스 길이, 도구 호출 패턴 및 지연 시간은 모두 현실 세계의 코딩 워크플로우를 대표합니다. 그런 다음 AgentPerf는 정의된 반응성 및 출력 토큰 속도 임계값을 충족하면서 플랫폼이 동시에 지원할 수 있는 에이전트 작업의 수를 측정합니다. 도구 호출은 실행되지 않으며 대표적인 CPU 처리 시간을 사용하여 시뮬레이션되므로, 결과 차이는 가속화된 컴퓨팅 성능만을 반영합니다.
이러한 결과는 직접적으로 인프라 결정으로 이어집니다: 가속기당 및 메가와트의 전력당 몇 개의 동시 에이전트 작업을 실행할 수 있는지. 대규모로 AI 에이전트를 배포하는 기업에게 이러한 수치는 특정 인프라 투자가 실제로 제공할 수 있는 생산적 작업의 양을 결정합니다. Baseten, DeepInfra, Together AI를 포함한 주요 추론 제공업체들은 이미 NVIDIA Blackwell 위에서 DeepSeek V4 Pro와 같은 프론티어 모델로 에이전트 워크로드를 제공하고 있으며, 프로덕션 에이전트 애플리케이션을 구동하고 있습니다. Together AI는 NVIDIA Blackwell 위에서 Cursor라는 AI 기반 에이전트 코딩 플랫폼의 실시간 추론을 지원하며, 여기서 Cursor의 에이전트는 개발자가 작업을 계속하는 동안 문제를 디버깅하고 기능을 생성하며 리팩토링을 실행합니다. DeepInfra는 자동차 딜러십을 위한 AI 인력 플랫폼인 Pam.ai를 지원하며, 이는 에이전트를 배치하여 서비스 예약, 전화 응대 및 외부 영업 캠페인을 entirely NVIDIA Blackwell 위에서 수행합니다.
NVIDIA와 오픈 소스 생태계가 추론 소프트웨어를 지속적으로 최적화함에 따라, 에이전트 워크로드에서의 성능과 효율성은 더욱 향상될 것입니다. NVIDIA Vera Rubin 아키텍처는 이제 본격적인 프로덕션에 진입하여, 대규모 에이전트 AI의 증가하는 요구를 충족하기 위한 차세대 인프라 용량을 제공합니다.