NVIDIA的Vera Rubin NVL72 GPU比GB300 NVL72每瓦吞吐量提高30倍、token成本降低35倍
代理型AI工作负载需要与传统聊天或摘要任务根本不同的基础设施。虽然简单请求在1K到8K令牌范围内运行,但代理型会话会在多个步骤中累积上下文,可以达到数十万个输入令牌。一个为投资决策研究公司的AI代理可能会查询金融数据库、搜索新闻和申报文件、调用子代理进行对等比较和估值,然后将发现综合成一个建议。每个步骤的累积令牌成为下一个步骤的输入,使长上下文处理成为性能的中心。这种模式在从软件开发到客户服务再到深度研究的各种用例中重复出现。
使用SemiAnalysis AgentX工作负载的性能测量(该工作负载由记录的真实世界代理型编码会话组成,保留了实际上下文增长、工具调用和子代理生成),表明Vera Rubin NVL72在代理型工作负载上的每兆瓦吞吐量比GB300 NVL72高达30倍。Blackwell平台在包括Kimi K3、MiniMax M3、GLM5.3、Qwen 3.5和DeepSeek V4 Pro在内的多个代理型模型中处于领先地位。GB300 NVL72本身在DeepSeek V4 Pro上的每兆瓦吞吐量比Hopper架构好达15倍。对于功率受限的AI工厂,每兆瓦吞吐量直接转化为更多的代理型工作(每能量足迹)。令牌成本比GB300 NVL72低35倍,使大规模代理连续运行成为可能,并决定AI工厂收入的利润率。
Vera Rubin通过极端共设计实现这些收益,包括分散服务(将上下文处理与响应生成分开)、速率匹配(同步预填充和解码GPU速度)、大规模专家并行性(分布式混合专家模型)、分布式KV缓存(在GPU域中扩展内存,可选卸载到主机和存储)、KV感知路由(将请求导向持有相关缓存上下文的GPU)以及融合CUDA内核(将计算和通信组合为单个执行过程)。增强的第五代张量核心和第三代Transformer引擎加速了预填充和解码阶段。NVFP4量化将模型权重压缩为4位精度。具有第六代NVLink和NVLink交换机的NVL72扩展域提供10倍更高的数据包速率和3倍更低的延迟,相比现成以太网。NVIDIA的软件堆栈(包括TensorRT LLM和Dynamo)与硬件共设计,以启用这些优化。
完整的Vera Rubin平台是一个七芯片架构,包括Vera CPU、Groq 3 LPU、NVLink 6交换机、BlueField-4 DPU、Spectrum-6 SPX和ConnectX-9 SuperNIC,全部为大规模部署代理的AI工厂量身定制。Vera Rubin正在全面生产并在整个生态系统中扩展。