2026年9月16日星期三
AI 基础设施 · 新闻与分析
首页芯片与硬件报道
芯片与硬件 · 报道

NVIDIA投资200亿美元收购Groq,效仿谷歌收购专业化AI芯片设计和IP能力的策略。

加速NVIDIA在AI芯片的纵向一体化;整合人才和IP;预示从无晶圆厂向设计中心转变的可能。
行业媒体Slicast · 2026年3月29日 UTC 12:00 · 全球 · 来源: forbes.com
重要度 90

Nvidia在2025年12月以200亿美元的价格获得了Groq的推理技术许可,并在2026年圣何塞GTC大会上推出了由此产生的Groq 3语言处理单元。这笔交易是Nvidia有史以来最大的一笔,使Groq创始人Jonathan Ross和资深领导者加入Nvidia,同时获得了对Groq专利组合和软件栈的永久许可。Groq继续在新任CEO Simon Edwards的领导下独立运营,但该技术现在位于Nvidia推理路线图的核心。这一举措代表了这家全球主导的AI芯片制造商迄今为止最明确的承认——图形处理单元,无论多么强大,并非每种AI工作负载的正确工具。

AI计算大体分为两个阶段:训练,通过处理大规模数据集花费数周或数月来构建模型;推理,运行已训练的模型以实时生成响应、图像和决策。虽然Nvidia的GPU因其原始并行处理能力而在训练中占据主导地位,但推理呈现出根本不同的计算特征。推理过程中的瓶颈不是浮点运算,而是内存带宽——处理器通过芯片移动模型权重和中间数据的速度。Nvidia即将推出的Rubin GPU提供288GB的高带宽内存,带宽为22TB/秒,而Groq 3 LPU仅包含500MB的片上SRAM,但提供150TB/秒的带宽,约为Rubin数值的七倍。这种精简、速度优先的设计使LPU在生成具有可预测低延迟的令牌方面表现出色。

Nvidia并未将LPU定位为GPU的替代品,而是构建了一个异构架构,其中两个处理器处理推理管道的不同阶段。Vera Rubin NVL72机架系统将72个Rubin GPU与新的Groq 3 LPX机架配对,该机架容纳256个互联的LPU,Nvidia的Dynamo软件层实时编排两个处理器之间的工作负载。这一举措出现在竞争加剧的背景下:Google已运行定制张量处理单元超过十年,最近推出了Ironwood,这是其第七代TPU,专为推理工作负载设计,同时也完全在TPU上训练Gemini 3,以证明定制硅可以匹配或超过基于GPU的训练管道。Amazon已在其数据中心部署了数十万个Trainium芯片,用于训练和推理。这种趋势是明显的——三大云服务提供商都在构建异构计算环境,其中专门的硅处理专门的任务。

在GTC大会上,Jensen Huang预计到2027年Blackwell和Vera Rubin系统将获得1万亿美元的订单,并主张代理AI将推动计算需求的根本转变。相比仅GPU部署,Nvidia声称其GPU加LPU的组合架构每瓦推理吞吐量高达35倍,为万亿参数模型提供高达10倍的收入机会。但这些性能声明值得审视:35倍吞吐量提升和10倍收入增长仅适用于特定的解码密集型工作负载,而不是所有推理场景,Nvidia自己的部署指导建议向数据中心总容量的大约25%添加Groq LPU。LPU的500MB SRAM容量意味着大型模型权重必须分布在机架中的所有256个芯片上,需要紧密的芯片间协调,该架构是否能在Nvidia控制的基准之外经济地扩展仍未得到证实。

Nvidia为这笔交易支付了接近Groq 2025年9月估值69亿美元的三倍,对于技术上是非独占许可协议而非完全收购的交易来说,这是一个高额溢价。由Samsung制造的Groq 3 LPX机架将在2026年下半年发货,AMD预计将在6月Computex大会上发表自己的推理重点公告。对于评估AI基础设施的首席执行官,Nvidia-Groq组合表明采购决策变得更加复杂:问题不再是简单地购买多少GPU,而是如何组建一个异构计算环境,以最合适的成本将正确的处理器与正确的工作负载相匹配。

阅读原文
NVIDIA投资200亿美元收购Groq,效仿谷歌收购专业化AI芯片设计和IP能力的策略。 · Slicast