在Hot Chips 2026大会上,英伟达展示了Groq 3 LPX架构,并发布了基于LP30机架的首个第三方基准测试数据,该设备已投入生产。
在2026年Hot Chips大会上,英伟达硬件副总裁、前Groq首席架构师Igor Arsovski发布了Groq 3 LPX推理机架的架构,并公布了该芯片的首个第三方基准测试结果。Artificial Analysis在对100K上下文的Gemma 4 31B推理工作负载进行测试时,测得该系统每秒输出3,431个token,约为次快公共端点记录的870个token/秒的四倍。Arsovski确认该机架已进入生产阶段,其核心是英伟达在2025年12月以200亿美元收购Groq时获得的LP30芯片——这笔交易同时导致Rubin CPX从英伟达的产品路线图中被移除。
Artificial Analysis的测试运行在一个通过Google Cloud提供的私有预发布版Gemma 4 31B端点上,计算的是并发度为1的情况下50个顺序客户端请求的中位数。相比之下,被评估的公共提供商运营的是共享的生产环境无服务器端点。一次仅服务单个请求可使硬件达到最高的单用户token吞吐量,但这与其他端点所遵循的多租户条件并不直接可比。在演示过程中,Arsovski还展示了一个更高的英伟达内部数据:在同一31B模型上达到每秒10,996个token,他将其标记为“自我报告”,随后强调公司目标是获得“你们可以信任的、经第三方验证的独立基准”。他指出,Gemma 4 31B是一个稠密模型,足够小以至于可以容纳在单个LPX机架内,而万亿参数规模的混合专家(MoE)模型——其中内存容量成为主要限制因素——则未被涵盖。
每个LP30芯片携带约500MB的片上SRAM,并完全消除了HBM。一个包含256个芯片的完整LPX机架提供128GB内存、40 PB/s的聚合带宽以及315 PFLOPS的FP8算力,芯片间延迟为350纳秒。该系统运行在与Vera Rubin兼容的MGX液冷机箱中,可扩展至超过1,000个LPU。通过将模型权重驻留在SRAM中而不是从HBM流式传输,该架构消除了通常主导单token解码过程的内存访问延迟。它通过摒弃缓存、分支预测和乱序执行,转而采用由编译器以时钟周期粒度进行调度的完全确定性流水线来实现这一目标。该设计直接追溯到大卫·罗斯(Jonathan Ross,前谷歌TPU工程师,Groq创始人)在2020年ISCA论文《Think Fast》中描述的Tensor Streaming Processor,Arsovski和Raghavan在他们的Hot Chips演示中也沿用了这一标题。
作为参考,一块Rubin GPU拥有288GB的HBM4,大约是单个LP30内存容量的576倍。因此,一个FP8格式的310亿参数模型大约需要62个LPU来承载其权重,而大型混合专家模型则需要跨多个机架使用四位数的芯片数量。这种容量权衡凸显了为何英伟达将LPU定位为专门用于解码而非通用GPU替代品。确定性执行还使编译器能够逐周期预测功耗,允许英伟达在需求产生之前预先向机架调节器订购电流。与未补偿负载相比,这种方法使电压跌落减少了60%以上,过冲减少了70%以上。同样,按块调度使热量均匀分布在芯片上,而不是节流到最热的图块,从而在固定的热限制下带来约10%至11%的额外性能。“通过这样做,我们实际上可以在相同的热限制下获得更高的芯片利用率,”Arsovski解释道,“所以我们可以再次在相同的热限制下获得大约10%到11%的更多性能。这是确定性执行的另一个好处。”
在机架之间,英伟达使用其所谓的伪同步网络将芯片同步到一个虚拟时钟。每个芯片既充当处理器又充当路由器,无需自适应路由或拥塞感知,而时钟漂移则在芯片间链路处直接得到补偿。在问答环节被问及工作中途芯片故障的影响时,Arsovski表示用户“将经历与行业内任何其他硬件完全相同的情况”,并且“只需检查点保存或重新配置硬件”。
英伟达正将LPX机架营销为与Vera Rubin NVL72集成的解码协处理器,其中Rubin GPU管理计算密集型的预填充阶段和KV缓存构建,而LPU生成输出token。该公司展示了三种工作负载分区策略:解耦的预填充和解码;注意力-FFN解耦,即将注意力及其缓存保留在GPU HBM中,而LPU执行前馈层;以及外部草稿投机解码,其中LPU上的紧凑模型提出token,GPU并行验证这些token,仅有草稿token穿过互连。FPGA桥接了同步的LPU域与主机I/O和GPU交接的非异步环境,由英伟达的Dynamo运行时和CUDA的LPU扩展进行编排。英伟达报告称,在具有400K token缓存上下文的两万亿参数工作负载上,这些配置比单独使用Rubin提升了三到五倍,这些数据由公司内部审计测量。
在同一场Hot Chips会议上,Cerebras展示了其CS4晶圆级系统。首席系统架构师Jean-Philippe Fricker报告称,该平台的速度比GPU快多达30倍,token速率是其前身CS3的两倍,并提供十倍于前的token容量。每个CS4机架将三个晶圆级引擎集成到一个模块化Nexus平台中,该平台围绕可插拔计算“背包”构建,隔离电源、计算和I/O。Fricker将其内存带宽指定为43 PB/s,指出这“比英伟达下一代Rubin芯片的内存带宽高出2,000倍”。Cerebras也已就预填充工作负载达成合作,于今年七月同意将AMD Helios GPU用于预填充,并将其晶圆级引擎用于解码——这种分工类似于英伟达内部的Groq整合。
战略层面,英伟达撤回了基于GDDR7的长上下文加速器Rubin CPX,以优先在今年推出LPU,这一举措由副总裁Ian Buck在GTC 2026上概述。这笔200亿美元的Groq交易被构成为非独家IP许可,并结合招聘Ross、总裁Sunny Madra以及Groq大部分工程人员,这种配置旨在规避正式合并审查。Arsovski在演讲开始时称这是“对现已并入英伟达集团的Groq团队来说的一个难以置信的时刻”。与此同时,监管审查仍在继续:参议员伊丽莎白·沃伦(Elizabeth Warren)和理查德·布卢门撒尔(Richard Blumenthal)在2026年初致函FTC和英伟达,认为该安排实质上是在“名不副实”地收购Groq。截至8月下旬,尚未确认任何正式的、针对该交易的调查。