2026年9月11日星期五
AI 基础设施 · 新闻与分析
首页芯片与硬件报道
芯片与硬件 · 报道

英伟达确认Groq 3 LPX加速器进入全面量产阶段,同时强调Vera Rubin在推理效率上的数倍提升。

量产将加速智能体AI部署周期,并在超大规模客户需求到来前验证下一代推理架构。
行业媒体Slicast · 2026年8月25日 · 美国 · 来源: Moomoo
重要度 92

伟达(NVIDIA)宣布全面量产推出 Groq 3 LPX,用于交互式 AI 推理,并将其定位为 Vera Rubin 平台的关键组件。Groq 3 LPX 旨在强调超低延迟的令牌生成,其目标并非用专用推理芯片取代 GPU,而是通过增强传统 GPU 在低延迟令牌交付方面的能力,来补充 Vera Rubin 架构。周一(东部时间24日),英伟达披露,在 Artificial Analysis 的测试中,使用拥有 10 万令牌上下文窗口的 Gemma 4 31B 模型,Groq 3 LPX 实现了每秒 3,400 个令牌的输出速率,为该模型树立了新的基准。对于代理编程等低延迟工作负载,其响应速度比近期竞争对手平台快多达四倍。

与此同时,英伟达发布了 Vera Rubin NVL72 在实际代理工作负载下的新性能数据。借助 SemiAnalysis 的 AgentX 工作负载和 DeepSeek V4 Pro 模型,Vera Rubin 平台的每兆瓦吞吐量比上一代 GB300 NVL72 高出多达 30 倍,同时将每个令牌的成本降低多达 35 倍。英伟达强调,代理任务与传统聊天或摘要工作流程存在根本差异。由于任务上下文在数百个步骤中不断累积——可能达到数十万个令牌——每一步的令牌生成速度直接决定了完成任务所需的总时间。代理程序通常会读取文件、调用工具、执行代码、验证输出,并经历数百甚至数千次推理循环。因此,代理式 AI 带来了两个截然不同的计算挑战:一是高效处理日益庞大的上下文,二是持续以超低延迟生成令牌。Vera Rubin NVL72 侧重于更广泛的训练、推理和上下文处理,而 Groq 3 LPX 则专门针对单用户交互速度进行优化,以最大化令牌生成率。

向这些指标的转变标志着 AI 基础设施竞争的战略演变。英伟达正将行业焦点从传统的模型训练和推理基准,重新转向代理式 AI 的令牌生成速度、能耗和成本效率。虽然每秒 3,400 个令牌这样的单一维度指标依然引人注目,但英伟达指出,每兆瓦吞吐量和每个令牌成本是衡量现实世界价值更关键的指标。报告的每兆瓦吞吐量提升 30 倍反映了整体 AI 推理效率的显著改善,而非芯片原始速度的简单 30 倍提升。鉴于传统大模型服务优先考虑单个请求的延迟和吞吐量,而代理工作负载则持续消耗令牌,这一区别至关重要。英伟达引用 OpenRouter 的数据指出,AI 代理工作负载消耗的令牌数量可达简单聊天请求的 15 倍。一个代理可能会查询数据库、搜索文档、调用子代理进行分析、执行代码并反复验证结果,且上下文在整个过程中不断扩展。随着电力和数据中心资源日益制约 AI 扩张,最大化单位电力生成的令牌数比单纯提升峰值算力具有更重要的意义。

在商业方面,AI 云服务提供商 Nebius 将成为首家采用 Groq 3 LPX 的厂商,计划将其部署在 Nebius Token Factory 生产推理平台上。Groq 自身也打算成为最早的采用者之一。此次推出表明,英伟达此前收购 Groq 技术所获得的能力,现已完全整合到 Vera Rubin 数据中心产品组合中。

除了地面部署之外,英伟达还宣布 SpaceXAI 将采用 Vera CPU 以加速下一代代理式 AI 应用,并将其基于 Vera Rubin 的计算基础设施扩展至数吉瓦规模。此外,SpaceXAI 计划在轨道上部署经过优化的 Vera Rubin NVL72 版本,用于其第一代 Starmind AI 卫星。从架构角度来看,

阅读原文