Positron AI融资8.75亿美元,旨在用商用DRAM在推理应用中击败HBM。
一家位于雷诺的人工智能硬件初创公司最近提出了针对英伟达内存架构在推理时代最为明确的论证:问题不在于加速器能达到多高的带宽峰值,而在于实际利用了多少带宽——商用内存经过专门优化用于推理解码,在实际应用中能匹配高带宽内存(HBM)的效果,即使在规格表上无法相比。
Positron AI于周三宣布完成8.75亿美元的C轮融资,融后估值达50亿美元——相比该公司在2026年2月完成2.3亿美元B轮融资后超过10亿美元的估值,增长约五倍。此轮融资公布两天前,高通和亚马逊刚刚披露了一项多代基于LPDDR芯片的推理合作,采购规模高达600亿美元——这笔交易独立验证了Positron所押注的架构理论。
该融资将支持Asimov芯片的流片,这是Positron基于台积电N3P工艺的定制推理ASIC,目标在2026年末流片,生产计划在2027年下半年。Asimov的核心特征是采用LPDDR5X——这是在智能手机和笔记本中使用的同一类商用DRAM——而非高带宽内存(HBM),即英伟达H100、H200和Rubin系列加速器所采用的3D堆叠专用内存。
## 推理支出刚刚超过训练——内存成为关键竞争点
时间点至关重要。2026年8月,Gartner报告显示,推理支出今年首次超过了训练支出,全球AI推理支出达到233亿美元,而训练支出为190亿美元——这是一个重要的结构性转折点,该研究机构将其归因于AI从模型开发向持续、实时部署的转变。AI优化基础设施的整体支出同比增长96%,达到423亿美元。AI基础设施曾经意味着"我该去哪里训练模型"的时代已经结束;现在的问题是"我该如何在规模上持续服务"。
这个问题直接碰上了供应链难题。高带宽内存是一种堆叠DRAM技术,提供英伟达GPU所需的每秒数太字节级的带宽,但仅由少数供应商生产,需要通过一种名为CoWoS(晶片-晶圆-基板)的先进工艺进行封装,全球只有少数代工厂能执行。HBM需求每年增长约60%,但产能跟不上增长。这个问题甚至影响到了英伟达自己的路线图:正如Positron的投资者NEA公司的Forest Baskett在融资公告中所指出的,Rubin Ultra GPU据报道从原计划的1TB HBM4E内存缩减到了约192GB,原因是供应根本跟不上。
## 为什么带宽利用率比原始带宽更重要——以及为什么这个说法仍未被验证
Positron的核心论证是,基于峰值带宽数字的HBM和LPDDR5X对比忽视了AI推理实际运作的方式。
现代大型语言模型推理分为两个阶段:前填充(prefill),模型用密集矩阵计算并行处理输入提示词;后解码(decode),模型逐个顺序生成输出token,每一步都从存储的键值对(KV)缓存中读取数据。前填充受计算能力限制,会饱和GPU张量核心。后解码受内存限制——它为每个生成的token读取整个KV缓存,但是顺序而非并行执行,这意味着瓶颈不是硬件理论上能有多快的速度,而是硬件能有多高效地移动已有的数据。
这就是Positron要利用的间隙。GPU推理部署最初是为需要大规模并行带宽的训练工作负载设计的,根据Positron自己的说法,在推理解码阶段通常仅能利用可用内存带宽的不到30%。Positron声称其以内存为中心的架构能达到90%以上的利用率。如果这些数字在生产工作负载上成立,即使原始峰值数字不相同,交付给模型的有效带宽也是可比的。
这是一个重要的架构主张,但目前仅由公司自己声称,尚未得到独立第三方的验证。Tom's Hardware在2025年7月指出,Positron的Atlas与英伟达H200 DGX的性能对比"需要第三方验证"。更直接地说,The Register今年早前的分析计算出,Asimov的设计目标是约2.76太字节/秒的可实现带宽,而英伟达Rubin加速器的峰值HBM带宽约为22太字节/秒。即使在GPU利用率30%的情况下,Rubin的内存系统仍会快约2.4倍。Positron的反驳——推理工作负载在GPU硬件上不会接近那种利用率水平——尚未通过已发表的Asimov第三方测试得到证实,而Asimov尚未流片。Asimov的所有性能数据都是设计目标,而非硅的实际结果。
## 架构内部:LPDDR5X的可能性
除了带宽利用率的论证之外,LPDDR5X的实际应用案例归结为供应链和规模问题。
Positron的Asimov芯片使用有机基材而非CoWoS封装所需的硅中介层——正是硅中介层使HBM成为可能,也是它稀缺的原因所在。LPDDR5X由SK海力士、三星和美光等多家供应商以商用规模生产;无需专门的先进封装;其单位成本远低于HBM。Asimov设计可搭载每芯片288GB至2304GB的内存,其上限通过CXL(计算快速链接)扩展实现——这是一种内存池化协议,允许芯片访问封装之外的额外内存容量。Titan是围绕4到8个Asimov芯片构建的系统,设计用于在单个节点上服务超过16万亿参数的模型,支持超过1000万token的上下文窗口。
作为参考:英伟达H100配备80GB HBM3内存;H200配备141GB HBM3e内存;即将推出的Rubin架构目标为288GB HBM4——这个数字看起来已从最初公布的1TB缩减,原因是供应限制。Asimov的低端配置(288GB)与Rubin的缩减HBM4目标相匹配;其可扩展的高端配置(2.3TB)在当前GPU配置中没有直接对标。
Titan还被设计为可在风冷和液冷数据中心以各种机架密度运行。这不是小事:许多企业设施无法满足密集液冷GPU集群的散热和功率供应需求,这意味着Positron可以针对英伟达最高密度配置在结构上无法覆盖的基础设施。
## Atlas正在出货——Oracle部署是概念验证
Positron并不仅仅在推销未来的硅芯片。其第一代Atlas推理系统已经部署在Oracle云基础设施中,占用超过50个机架,推理服务Parasail也在为自己的客户利用这一容量。Jump Trading和i3d.net也是确认的Atlas生产用户。
Cloudflare在2025年测试了Atlas硬件,Tom's Hardware的报道记录表明,该系统在2000瓦功率预算内的Llama 3.1 8B基准测试上达到每用户280 token/秒,而八路英伟达DGX H200服务器约为每用户180 token/秒。如Tom's Hardware所指出的,这个对比需要第三方验证,且涉及Atlas而非Asimov——当前的出货产品,而非针对2027年的定制ASIC。
CEO Mitesh Agrawal将Oracle部署描述为Asimov的主要工程输入:"大规模部署Atlas让我们深入了解推理客户的真实需求,我们已将这些经验直接融入Asimov和Titan中。"
## 融资轮次:谁在投资以及为什么这不仅仅代表资金
融资分为两部分进行。第一部分是3.75亿美元的C轮融资,融前估值为35亿美元,由NEA、Andra Capital、Atreides Management、Valor Equity Partners和Dylan Patel的SemiAnalysis Capital联合领投。第二部分是由NEA和Jim Clark领投的最高5亿美元的C-1轮融资——Jim Clark是1982年创立Silicon Graphics的工程师,也是1994年为网络浏览器商业化而共同创立Netscape的创始人。其他投资者包括DFJ Growth、卡塔尔投资局、Resilience Reserve、思科投资部、Hudson River Trading、Naver Ventures和Liberty Global Tech Ventures。
Clark的参与具有特定的模式识别共鸣:Silicon Graphics在当时通用硬件无法有效处理特定计算工作负载(3D渲染)的时代,围绕专为该特定工作负载设计的专用硅芯片构建了其业务——这正是Positron在推理领域所追求的架构理论。