Groq LPU集成至NVIDIA Vera Rubin平台,标志专用推理加速器的主流认可。
当AI从训练时代向推理时代转变时,单一通用架构开始碰撞效率边界。变革随之而至——"仅用GPU征服一切"的叙事变得难以为继,专业化分工逐渐成为芯片行业的共识。
谷歌在新一代TPU中推进训练推理分离;Anthropic下注内存计算架构;SambaNova推出"CPU+GPU+RDU"系统解决方案;Cerebras选择用晶圆级芯片挑战传统GPU集群。
随着Groq的LPU(语言处理单元)被纳入NVIDIA的Vera Rubin平台,这个曾被视为"小众路线"的LPU首次进入了主流AI基础设施。对行业而言,这不仅意味着对新型芯片类型的认可,更标志着一个拐点:推理时代正在拥抱"不同芯片处理不同任务"的逻辑。
中国本土市场也在感受这一转变。围绕数据流架构、高带宽SRAM存储等推理加速方案,各种新型解决方案不断涌现,希望讲述自己LPU故事的玩家纷纷登场。
随着AI芯片专业化趋势日益清晰,LPU究竟是周期性热点还是推理时代的永久新工种?而当赛道愈发拥挤,或许LPU确实解决了真实需求——但独立的LPU公司是否是可行的生意呢?
NVIDIA最新方案采用25%的Groq LPU配合75%的Vera Rubin来处理源源不断的高价值token生成需求。
这一做法的背后,是Agent时代规则的改写:AI应用不再是一次性的问答对话,连续推理工作流引爆了token洪流。基础设施竞争从单芯片性能对比升级到了系统级效率优化。
首先澄清的是Prefill和Decode的区分——一个更侧重计算密度,一个更依赖响应速度和系统吞吐能力。
但行业很快发现,即便在Decode内部,不同工作负载的最大需求也各不相同:Attention忙于运输和读取巨大的KV Cache,而许多token生成任务落在FFN(前馈神经网络)上。
差异一旦被认识,差异化协作的需求就变得更加迫切。不同类型的芯片正在进入推理系统,各自处理它们最擅长的工作。
Groq的LPU正是在这样的背景下重新进入市场视野,作为Vera Rubin平台中的新组件,以LPX系统形式针对FFN相关工作负载。
"超低延迟推理等GPU处理不适合的极端场景,可以交给LPU处理,"架构工程师Xiaofang解释道,"就像开辟了一条专门的快速通道来服务客户。"
其实LPU并非凭空出现。Groq成立于2016年,其核心架构设计也诞生于上一个AI时代。但之后很长时间里,这些专业芯片始终未能进入主流市场。
据悉,NVIDIA在2025年初首次向合作伙伴开放NVLink互连生态后,Groq主动寻求接入机会,希望获得原本为GPU对GPU通信设计的协议支持。
随着GPU与LPU协作运行的可行性得到验证,双方合作获得了现实基础。而NVIDIA自身战略的变化带来了更大的想象空间。
AI系统架构师Xu观察到,更多专为Transformer推理设计的新型芯片将涌现。"用单一芯片实现领先的窗口在收窄,"他表示,"但通过系统级架构创新,NVIDIA的领先优势可以从数月延伸到1-2年。"
换句话说,对NVIDIA而言,引入LPU并非为了替代GPU,而是为特定推理任务找到更合适的角色。
专业化为LPU带来了新机遇,但将机遇转化为市场是另一回事。随着更多公司涌入LPU赛道,一个更现实的问题浮出水面:LPU被寄予的技术优势的真实内核是什么?
"单芯片确定性延迟并非LPU独有——所有ASIC都能实现,"一位专家表示,"真正困难的是跨多芯片、机架和集群的精确编排。"在她看来,这是LPU最深的护城河,也是国内非头部公司难以跨越的壁垒。
但曾在某大型科技公司主导芯片软件栈设计的Tim持更保留的态度,认为编译器能力价值与模型形态紧密关联。
CNN时代,模型结构多样、算子众多,给编译器充足的发挥空间。但随着Transformer成为行业标准,大模型核心算子不断收敛,许多层结构高度重复。
同时,MoE(混合专家)等动态架构的兴起正在蚕食全静态系统的优势。
"几乎所有顶级模型现在都有MoE结构,"Tim表示,"推理过程中的动态特性对全静态系统并不友好。"
他进一步解释,不同请求在推理时会激活不同的专家组合,而这些信息在编译时是无法知道的。
Mark表达了类似观点。他的非GPU芯片初创公司已获得多家一线美元基金投资。
"为了保证系统按既定节奏运行,编译器只能按照最坏情况进行规划,"他指出,"僵化的硬件侧也需要保留一定冗余来维持整体同步,这导致一些理论优势被抵消。"
关于LPU软件能力,业界尚未达成共识。相比之下,另一张存储"王牌"——SRAM——似乎更容易量化。许多实践者认为这是LPU的核心竞争力。
NVIDIA公布的数据显示,单个Groq 3 LPU的SRAM带宽达150 TB/s,大约是H100 HBM3的45倍。在256个LPU的LPX机柜中,总带宽进一步被推高至40 PB/s(注:1 PB/s = 1000 TB/s)。
除了高带宽能力,芯片行业资深人士Yang还看到这条路在规避HBM供应链和先进封装约束上的优势。
在当前AI芯片成本结构中,存储的影响力持续上升。Epoch AI数据显示,HBM在AI芯片元器件成本中的占比已从2024年初的52%增长到2025年底的63%。
随着HBM消耗成本增加,市场正在重新评估SRAM的价值,虽然分歧依然存在。
资深芯片产品经理Gu直言:"SRAM其实是LPU的巨大缺陷。"她认为SRAM最大的优点是速度,但代价是容量小、单位成本高。
然而IO Capital创始人Zhao并不完全同意。他认为单纯比较存储单位价格缺乏意义。
"虽然SRAM只有数百MB对比HBM的数十GB甚至百GB,但即便SRAM的单位价格高于HBM,面对容量差距,HBM的总成本最终可能更高。"
SRAM也有自己的容量焦虑。拥有十余年经验的芯片计算架构专家Xiaodong指出,SRAM直接集成在芯片内,必须与计算单元共享同一硅面积。这意味着面积分配始终是个难题。
"一个DRAM存储单元只需1个晶体管和1个电容,而SRAM需要6个晶体管,"他补充道,"在同样面积下,SRAM天然存储的数据更少。"
公开数据显示,Groq 3 LPU集成了约500MB SRAM,TPU 8i约384MB。虽然Cerebras的WSE-3通过晶圆级集成将容量提升到44GB,但代价是良率和成本的双重打击。
关于SRAM便宜还是昂贵的讨论有不同视角。但更值得反思的是:在推理时代,应该用什么指标衡量价值?
Mark认为是tokens。在他看来,从"系统成本"向"token成本"评估指标的转变正在发生。
过去多年,业界习惯了讨论"部署一个模型需要多少张卡"。因此许多厂商都强调用更少的GPU完成部署。
他举例说,有些方案可以用8张GPU部署模型,但推理成本未必最低。自从DeepSeek公开采用144张卡来构建推理集群后,业界意识到了另一种可能性。
"虽然整体系统成本大幅增加,但更大的集群规模带来了更高的带宽、更高的token吞吐,以及更低的单token成本,"Mark分析。
分歧并未消散,LPU的优势确实伴随着真实成本。但至少有一点形成了共识:LPU已经获得了进入推理系统的入场券。
接下来它必须回答市场不断追问的一个持久的现实问题——这是一门能持续产生收入的生意吗?
在获得NVIDIA背书之前,Groq已经凭借独立的端到端推理部署能力,赢得了沙特阿拉伯的推理基础设施项目,在欧洲部署了大规模计算中心,并进入了Meta的Llama生态。
"下注这条赛道的企业必须有目标客户,"Zhao解释说,"因为无论软件编译、优化最终都是针对特定应用的。"
换句话说,LPU的商业化挑战不仅仅是技术实现,而是是否有人愿意付费。但有一个无法忽视的问题:最需要LPU的往往恰好是自主开发能力最强的。
Xu观察到大模型公司和科技巨头已经开始行动。"相比GPU,LPU简单得多——用一两年就能造一个。"
但客户成为竞争对手不是最坏的消息。"初创公司不能仅靠LPU存活,它们需要找到'大众'。NVIDIA是在已经拥有'大众'的基础上又加了一台'法拉利'——这是锦上添花,"Gu直言。
Mark指出这样的专业化分工还会继续深化。"Attention和FFN之间的解耦程度很高,它们之间的通信带宽需求并不高。因此异构系统不会带来外人想象的那种巨大成本。"
Tim也认为未来推理解决方案可能将以异构形态存在。"当每一次优化都能带来数亿美元的回报时,研发成本很容易被摊销。"
据Zhao的观察,许多企业已经在探索类似路径——采用大容量SRAM和分布式存储来完成推理工作负载。"现在就叫LPU了,"他一语切中。
Xiaofang回忆起DPU的发展轨迹。大约在2020年前后,DPU概念出现时,众多初创公司涌入赛道;多年后,许多进行了转向。在她看来,LPU可能会重演类似剧本,部分原因在于市场培育周期漫长。
Zhao解释说,任何新的计算架构都需要时间来沉淀,就像NVIDIA的GPU花了十年才实现大规模采用一样。
但对初创公司而言,这是最致命的风险。作为高度专业化的ASIC,LPU天然依赖当前主流的模型架构。如果基础模型发生根本变化,相关优化价值可能被重新评估。
对此,Mark从另一个角度作出回应:"这其实给初创公司机会,因为大公司可能不想承担这么高的风险。"
与此同时,Xiaodong相对乐观。他指出,自CNN时代的AlexNet激发现代深度学习浪潮以来,虽然过去十年AI范式不断演进,但基础逻辑并未发生根本改变。未来的新架构更可能是Transformer Plus。
Tim给出了类似判断:"只要模型需要从海量知识中过滤、调用和组合信息,对高带宽的需求就不会消失。基于这一需求设计芯片,即便Transformer被替代,芯片本身也不会过时。"
市场从不缺新芯片故事。真正决定LPU公司是否存活的,不一定是架构有多先进,而是能否在市场成熟之前找到客户、场景和生态。
毕竟,推理时代或许真的需要越来越多的"法拉利"。但对大多数初创公司而言,比造出一台法拉利更难的是,找到愿意持续买"大众加法拉利"组合的人。