NVIDIA收购Groq用于低延迟解码加速,采用类似Mellanox的集成模式。
NVIDIA与Groq达成的200亿美元非授权协议在圣诞夜公布,代表该公司最大的投资,旨在将其影响力扩展到GPU训练之外。在2026年第四季度财报电话会议上,NVIDIA首席执行官黄仁勋被问及公司对Groq的LPU(低延迟解码器)单元的计划,他以战略愿景做出回应,并承诺在GTC大会上详细说明。"关于我们如何看待Groq和低延迟解码器,我有一些很棒的想法想在GTC与各位分享,"他表示,并补充道NVIDIA将"以与我们用美光(Mellanox)扩展NVIDIA架构非常相似的方式,使用Groq作为加速器来扩展我们的架构。"
该收购针对NVIDIA产品组合中的一个关键空缺。虽然该公司以Hopper和Blackwell处理器在训练领域占主导地位,但推理代表了NVIDIA尚未巩固其领先地位的领域—特别是在延迟敏感型工作负载中,其中代理AI应用需要超快速响应。Groq的LPU单元利用芯片内SRAM提供每秒数十TB的内部带宽,这一方法已被Cerebras(采用WSE-3)和微软(采用Maia 300)等竞争对手采纳。对于代理AI工作负载,解码性能至关重要,它允许代理在几秒内完成复杂推理步骤,而行业正在朝着相互依赖的AI代理群体的方向发展。
NVIDIA的方法与其美光收购类似,后者解决了网络挑战并建立了"极端共设计"原则,加强了公司的数据中心战略。根据GF证券的分析,NVIDIA可能在今年的GTC大会上推出一款"LPX机柜",在单个单元中配备256个LPU单元。正在探索两种主要集成策略:机柜级产品中的混合计算节点,配备多个通过统一互连连接的LPU,或通过混合键合集成在Feynman GPU中的片上LPU单元。如果采用机柜级方案,LPU间连接很可能使用本地plesiosynchronous芯片到芯片协议,而LPU与GPU之间的通信可能采用NVLink Fusion来处理预填充阶段期间GPU的大规模KV缓存卸载。
NVIDIA的混合架构将解码用的LPU与预填充阶段的现有GPU能力相结合—利用Vera Rubin的注意力加速引擎和NVFP4计算—使该公司成为推理性能的领导者。黄仁勋最近披露,NVIDIA的计算增长和收入增长现在正以1:1的比例同步扩展,这由AI应用层的积极演进所驱动。随着正式公告预计在今年GTC大会期间发布,NVIDIA对Groq技术的整合有望为公司提供决定性优势,以应对已成为计算提供商根本瓶颈的延迟问题。