2026年9月11日星期五
AI 基础设施 · 新闻与分析
首页芯片与硬件报道
芯片与硬件 · 报道

Groq发布了3 LPX加速器,旨在加速代理式AI推理工作负载。

丰富了非英伟达加速器在专用推理任务中的选择,为超大规模企业和AI初创公司提供了更具成本效益的模型部署替代架构。
行业媒体Slicast · 2026年9月9日 · 美国 · 来源: Jon Peddie Research
重要度 75

伟达已将 Groq 3 LPX 投入全面量产,作为一种专为代理式 AI(Agentic AI)解码阶段优化的推理加速器。该架构集成了 256 个 LP30 处理器、机架级 SRAM 以及编译器调度的片间通信,旨在以极小的批次大小驱动令牌生成。Artificial Analysis 在 Gemma 4 31B 模型上记录到超过每秒 3,400 个输出令牌的吞吐量,上下文长度为 100K。英伟达计划将 LPX 与 Vera Rubin NVL72 搭配使用,以处理长上下文、高交互性的推理工作负载。

代理式 AI 对延迟提出了前所未有的压力。与传统模型生成单一响应后即停止不同,代理系统会持续检查文件、调用工具、编写和测试代码、评估结果,并重复这些序列数百或数千次。每次迭代都会向上下文窗口添加令牌,要求后续的推理步骤处理不断扩展的历史记录。因此,令牌生成延迟成为限制代理执行有意义任务速度的直接瓶颈。

英伟达的 Groq 3 LPX 针对这一特定约束进行了优化。在收购 Groq 的技术后,英伟达将 LPX 定位为 Vera Rubin 平台的延伸,为其 AI 工厂架构配备了专为交互式推理设计的处理器。Nebius 计划通过其 Token Factory 生产推理平台成为首家部署 Groq 3 LPX 的 AI 云提供商。

在基准测试中,Artificial Analysis 测得 Groq 3 LPX 在执行 Gemma 4 31B 时,输入上下文为 100,000 个令牌的情况下,输出速度达到每秒 3,431 个令牌。在 10K 上下文中,中位吞吐量达到每秒 3,382 个令牌。英伟达还报告称,在专注于编码的 Speed-Bench 工作负载上,中位速度为每秒 4,767 个令牌,其中 20% 的任务速度超过每秒 5,500 个令牌。

这些数据之所以重要,是因为代理式工作负载比传统的高批量推理场景更优先考虑单个用户的响应速度。在每秒 3,431 个令牌的速度下,生成 5,000 个令牌大约需要 1.5 秒。而在每秒 100 个令牌的速度下,同样的操作需要 50 秒。当这种速度乘以一个代理执行的数十或数百个顺序推理和工具使用步骤时,解码速度从根本上改变了应用程序的行为。

**张量并行性与首比特延迟**

Groq 3 LPX 通过张量并行性(TP)来解决这一挑战,即将计算分布在多个处理器上并聚合其输出。虽然 TP 显著提高了吞吐量,但小批量推理引入了通信瓶颈。处理器之间交换的张量保持最小,导致固定的通信开销主导了性能。

其底层关系遵循以下公式:

传输时间 = A + N/B

其中 A 表示固定的首比特延迟,N 代表传输的数据量,B 表示链路带宽。随着 N 的减少,增加带宽的收益递减,因为 A 占总传输时间的比例越来越大。

这一动态阐明了 Groq 的架构方法。LPX 并不主要依赖巨大的链路带宽,而是专注于最小化每次数据传输之前的协调延迟。

单个 Groq 3 LPX 机架包含 256 个由总计 128 GB SRAM 支持的 LP30 LPU。每个芯片拥有 96 个以 112 Gb/s 运行的片间链路。关键在于,编译器在执行前完全掌握计算单元、内存资源和网络拓扑,从而生成针对工作负载量身定制的时钟级调度方案。

这种确定性框架消除了处理器交换数据时通常所需的实时仲裁。通过预先确定数据路径并为发送方和接收方安排精确的传输窗口,LPU 可以在分配的时钟周期到达时精确发送数据,完全绕过动态协商。

**计算与通信重叠**

Groq 将确定性调度直接扩展到计算流水线中。编译器以 320 字节向量的粒度编排计算和通信。在矩阵乘法期间,LPU 可以计算输出的一部分并立即开始传输,而不是等到整个矩阵运算结束才停滞不前。

这种重叠缩短了通常跟随计算之后的通信尾部。它还保持了 TP 在交互式推理所需的小批量大小下的有效性,否则通信开销会抵消通过并行执行实现的计算增益。

对于硅工程团队来说,这凸显了一种故意的架构权衡。传统的加速器将大量资源分配给灵活执行、缓存、路由和动态工作负载适应。Groq 牺牲了一定程度的灵活性,以换取确定性调度。由于编译器事先了解硬件和工作负载,它将它们作为一个统一系统进行协调。

对于独立软件供应商(ISV),关键指标从孤立的加速器吞吐量转变为端到端的完成时间。一个生成数千个令牌、执行工具、评估输出并启动另一次推理传递的代理,依赖于每个操作阶段持续的低延迟。

**LPX 加入 Vera Rubin**

英伟达并未将 LPX 定位为 Vera Rubin NVL72 的替代品。现有文档概述了几种互补配置,用于在这两种架构之间划分推理工作负载。

图 1. Groq 3 LPX 加速大规模代理推理。(来源:英伟达)

在标准的预填充-解码分离模式下,Vera Rubin 管理预填充阶段,并在每次交互中转移键值(KV)缓存。随后,LPX 使用驻留在 SRAM 中的模型权重处理解码操作。替代配置将注意力机制和 KV 缓存管理分配给 Vera Rubin,而 LPX 处理前馈网络层。英伟达还提出了一种投机解码设置,其中 LPX 执行较小的草稿模型,而 Vera Rubin 验证提出的令牌。

随着 AI 工厂逐渐不再将推理视为单一的工作负载,这种分工的重要性可能会增加。预填充侧重于高效处理广泛的上下文,而解码强调快速、顺序的令牌生成。将这些不同的任务分配给专门的架构,使英伟达能够针对更窄的计算配置文件优化每个处理器。

Groq 3 LPX 为英伟达提供了一种以确定性执行、SRAM 和紧密协调的片间通信为中心的专用推理架构。其更广泛的战略价值在于英伟达如何将其与 Vera Rubin 集成。该公司不必让代理式工作负载的每个阶段都通过单一的处理器架构,而是可以根据计算特征划分推理,并将每个阶段引导至为该特定功能设计的硬件。

**我们的观点**

Groq 3 LPX 为英伟达提供了另一个关键的架构杠杆,在一个日益由延迟和代理响应能力主导的推理市场中。其确定性编译器和以 SRAM 为中心的设计直接解决了小批量张量并行性固有的通信挑战。超过 3,400 个令牌的绩效数据值得认真关注,特别是在 100K 上下文下持续运行时。真正的验证将来自部署经济学、模型生态系统支持、硬件利用率以及与 Vera Rubin 在生产规模上的无缝集成。

**转折点。** Groq 3 LPX 表明,AI 基础设施可能正达到一个临界点,即异构加速器将成为 AI 工厂的标准配置。训练、预填充、注意力和解码施加了根本不同的计算需求,这种分歧被代理式 AI 极大地放大。英伟达将 Vera Rubin 与 LPX 耦合的策略反映了对统一平台内特定工作负载计算的果断转变。如果代理式工作负载继续推动推理扩张,令牌延迟和处理器专业化可能会像聚合加速器吞吐量一样,决定性地塑造系统架构。

喜欢吗?我们还有很多更多内容。告诉所有你知道的人。我们很乐意听到你和他们的声音。

阅读原文