AgentPerf是业界首个专为智能体AI工作负载设计的基准测试,展示NVIDIA Blackwell平台
代理型AI代表了与传统对话型AI根本不同的工作负载。对话补全是单个冲刺,由一次大型语言模型调用和一个响应组成,而代理则像一个接力器,将目标分解为多个步骤并继续到完成。这导致数十到数百个LLM调用链接在一起,每个调用将不断增长的上下文传递给下一个。工具调用(如代码编译、执行、数据库搜索和网络浏览)在每个交接处发生。复杂性变为乘法而非加法。
这种区别对性能测量至关重要。现有的AI推理基准测试测量单个LLM调用——模型响应速度有多快以及系统处理多少并发请求。这些基准测试不是为代理型工作负载设计的,其中链接的LLM调用、工具延迟和扩展的上下文以根本不同的方式对计算系统施加压力。对于大规模构建和部署代理的公司,理解代理响应能力、并发部署容量和AI基础设施每美元和每瓦投入所提供的生产性工作至关重要。
AgentPerf的第一轮使用DeepSeek V4 Pro测量代理型性能,这是一个大型混合专家模型,代表了为当今最有能力的代理提供动力的前沿模型类别。在这个工作负载上,NVIDIA GB300 NVL72在基准测试中提供了最高性能,每兆瓦运行的代理数量是NVIDIA HGX H200系统的高达20倍。性能优势来自整个堆栈的极端共同设计。GB300 NVL72将72个GPU连接成单个机架规模系统,使DeepSeek V4 Pro等大型MoE模型能够在规模上高效分配模型执行。CUDA内核通过重叠通信和计算来进一步加速这一过程,吸收跨专家协调的成本而不是增加延迟。NVIDIA TensorRT LLM随着并发代理会话扩展而保持效率。例如,它将输入处理与输出生成分离,以便每个都可以独立优化。
这些结果以从头开始构建的基准方法为基础,以反映代理型AI在生产中的工作方式。AgentPerf由真实的编码代理轨迹构建,其中代理接收任务、读取文件、编写和编辑代码、执行命令并根据结果迭代,所有这些都来自12种或更多编程语言的真实公共代码库。长序列长度、工具调用模式和延迟都代表了现实世界编码工作流。AgentPerf随后测量平台在满足响应能力和输出令牌率的定义性能阈值的同时能够同时支持多少代理型任务。工具调用不被执行而是使用代表性CPU处理时间进行模拟,因此结果中的差异仅反映加速计算性能。
这些结果直接转化为基础设施决策:每个加速器和每兆瓦功率可以运行多少并发代理任务。对于大规模部署AI代理的企业,这些数字决定了给定的基础设施投资实际能够提供多少生产性工作。包括Baseten、DeepInfra和Together AI在内的领先推理提供商已经在NVIDIA Blackwell上为DeepSeek V4 Pro等前沿模型上的代理型工作负载提供服务,并为今天的生产代理型应用提供动力。Together AI在NVIDIA Blackwell上为Cursor(一个由AI驱动的代理型编码平台)提供实时推理支持,其中Cursor的代理调试问题、生成功能和执行重构,而开发人员继续工作。DeepInfra为Pam.ai提供支持,这是一个为汽车经销商提供的AI劳动力平台,它部署代理来预约服务、处理电话和运行出站销售活动,完全在NVIDIA Blackwell上。
随着NVIDIA和开源生态系统继续优化推理软件,代理型工作负载上的性能和效率只会改进。NVIDIA Vera Rubin架构现在处于全面生产中,为满足代理型AI大规模不断增长的需求带来了下一代基础设施容量。