2026年9月11日星期五
AI 基础设施 · 新闻与分析
首页芯片与硬件报道
芯片与硬件 · 报道

基准测试显示,英伟达Groq 3 LPX加速器在Vera Rubin平台上运行可实现每秒3,431次交易处理。

可量化的延迟指标验证了该芯片在高频率智能体工作负载中的定位,为竞争推理硅片设定性能基线。
行业媒体Slicast · 2026年8月25日 · 美国 · 来源: blockchain.news
重要度 86

伟达(NVIDIA)的 Groq 3 LPX 在 AI 推理领域树立了新的性能标杆,在 10 万(100K)上下文基准测试中实现了每秒 3,431 个令牌(TPS)的处理速度。根据 2026 年 8 月 24 日发布的官方博客文章,这一成就重新定义了高交互性和长上下文 AI 工作负载的能力上限。该基准测试由 Artificial Analysis 使用 Gemma 4 31B 模型进行,展示了该系统在英伟达先进的 Vera Rubin 平台上处理高难度任务的能力。

Groq 3 LPX 以英伟达 LP30 加速器为核心,采用机架级架构设计,提供 315 PFLOPS 的 FP8 推理算力以及 128 GB 的 SRAM。其设计优先考虑确定性执行、低延迟令牌生成和细粒度调度,从而在多轮智能体会话和交互式工作流中实现卓越性能,在这些场景中,随着每次用户交互的进行,上下文会显著扩展。传统模型在处理此类规模的任务时往往难以保持响应能力,尤其是在处理冗长的输入上下文时更是如此。

在测试过程中,Artificial Analysis 使用 10 万(100K)的输入上下文长度来评估系统的输出生成速度。这种能力对于智能体 AI 应用至关重要,例如编码或复杂推理工作流,这些应用需要处理大量累积的上下文数据。英伟达报告称,凭借这些速度,系统仅需 1.5 秒即可生成 5,000 个令牌,而在 100 TPS 的速度下则需要 50 秒——效率提升了数量级。在 1 万(10K)上下文基准测试中,该系统实现了 3,382 TPS 的处理速度,且延迟波动极小。此外,英伟达针对编码任务的 SPEED-Bench 测试记录到的中位吞吐量为每秒 4,767 个输出令牌,其中 20% 的任务超过 5,500 TPS,突显了 LPX 在不同用例中的多功能性。

作为英伟达 Vera Rubin 平台的基础组件,Groq 3 LPX 专为需要高交互性服务层级的 AI 工厂而设计。它能够在维持低延迟的同时管理超过 10 万(100K)个上下文令牌,这有望改变依赖复杂多轮 AI 交互的行业,包括客户服务自动化、大规模编码助手和实时决策系统。推动这一性能的关键因素在于 LPX 的编译器调度工作负载规划,它将 256 个互联 LPU 之间的通信开销降至最低。通过在细粒度层面重叠计算与通信,该架构即使在传统张量并行技术通常表现不佳的小批量场景下,也能实现无与伦比的效率。

此次发布正值英伟达巩固其在 AI 硬件领域领导地位的关键时刻。虽然 Groq 3 LPX 并非面向加密货币的产品,但其对 AI 驱动型行业的影响巨大。得益于 Groq 3 LPX 的增强,Vera Rubin 平台使英伟达能够主导高需求的 AI 工作负载,涵盖从实时推理到生成式 AI 应用的各个领域。在金融市场上,英伟达(NVDA)股价近期交易于 210.18 美元,较前 24 小时下跌 2.11%,反映出整体市场的疲软。尽管如此,AI 推理技术的进步继续支持该公司的长期增长轨迹,特别是在高利润的企业解决方案领域。另外,英伟达已正式否认了关于特定中国版 LPU 产品的近期传闻,澄清不存在此类路线图——这一发展可能缓解投资者的地缘政治担忧。

Groq 3 LPX 所展示的性能为需要极致速度和广阔上下文处理能力的新 AI 应用铺平了道路。英伟达表示,即使面对数十万个令牌的上下文,也计划维持这些吞吐量水平,这可能进一步彻底改变智能体 AI 的用例。鉴于其强劲的性能指标以及与 Vera Rubin 架构的战略整合,Groq 3 LPX 有望在未来几年内为高交互性 AI 系统设定基准。

阅读原文