OpenAI的定制Jalapeño加速器据报道在每令牌成本和速度指标上均优于英伟达GPU,这是第三方芯片制造商的首次突破。
OpenAI的首款定制推理芯片Jalapeño实现了此前没有任何非Nvidia加速器做到的成就:在性能曲线的每一个点上,其吞吐量和延迟均优于Nvidia的系统。SemiAnalysis发布的一份详细分析中,分析师Myron Xie与主持人Jordan Nanos深入剖析了这款芯片的奥秘——尽管其纸面规格客观上落后于对手(功耗仅为三分之一,原始算力更少,系统级HBM容量减半),但它每兆瓦生成的token数量约为Nvidia GB300的两倍,并在DeepSeek、Kimi K2.5和GPT-OSS基准测试中击败了更新一代的Vera Rubin。秘密不仅在于硅片本身,更在于一种受TPU启发的架构,该架构采用了刻意设计的较小脉动阵列(systolic arrays)、三星出乎意料地更具优势的HBM4供应,以及最关键的一点:一个由AI驱动的设计与内核编程流水线,将开发周期压缩至九个月,并生成了长达3万行的汇编内核代码,甚至连OpenAI自己的工程师也无法完全解释其每一行代码的含义。总体拥有成本(TCO)的计算结果 stark(鲜明/严峻):假设Jalapeño系统的内部成本为每小时1.56美元,而GB300为279美元,Vera Rubin为361美元,OpenAI有望消除Nvidia几乎所有的利润空间,转而支付Broadcom的ASIC费用。目前悬而未决的问题是,OpenAI能否将从基准测试中的胜利扩展到生产环境中的兆瓦级规模——这一挑战连Cerebras仍在解决——但前进的方向已经明确。CUDA护城河并未消亡,但第一次出现了一个可信的、有基准数据支持的挑战者,它不仅仅是在承诺击败Nvidia,而是已经公布了数据。
在Hot Chips 2026大会的最后一天,OpenAI公布了一组十八个月前还难以想象的数据。其首款自研推理芯片Jalapeño在绘制每兆瓦token吞吐量与每位用户延迟关系的性能曲线上,全面击败了Nvidia的系统——并非仅在某个选定的工作点上胜出,而是在整条曲线上都占据优势。对于任何关注过过去十年AI加速器初创公司选择一个有利基准便宣布胜利的人来说,这种结果形态本身就是故事的核心。
“我们从未见过任何人发布这样的图表,显示一条曲线表明他们在曲线的每一个点上都能击败Nvidia,并且是经过了真实测试,”Myron Xie在与主持人Jordan Nanos及分析师Bryan Shan进行的SemiAnalysis播客访谈中表示。Xie对数据显示内容的总结直截了当:“他们基本上在曲线的两端都赢了。既快又便宜的token。”
这种双重胜利在AI硬件领域代表了罕见的组合。通常,芯片可以针对高吞吐量进行优化——即在接受较高延迟的同时,尽可能多地服务每个瓦特功率下的用户;或者针对低延迟进行优化——以牺牲计算资源为代价,即时响应单个用户。Nvidia自身的产品线就体现了这种张力。而Jalapeño似乎打破了这一局限。
在每位用户每秒100个token的固定交互率下,OpenAI的芯片每兆瓦生成的token数量大约是GB300系统的两倍。将负载推向曲线最右端,即在小批次大小和最大响应速度下,Jalapeño能达到每位用户每秒700个token,而竞争对手的上限约为350个。在一个电力而非芯片供应成为瓶颈的数据中心中——正如黄仁勋在Computex 2026上所强调的那样——这直接转化为收入能力的提升。
这里存在着一个让那些认为更大的数据表数字自动等同于更好性能的人感到不适的现实。从纸面上看,Jalapeño似乎是Nvidia Vera Rubin的重大倒退。它的原始算力更少,系统级HBM容量更低,热设计功耗包络也更小。然而,它在实际推理中却取得了胜利。根据分析,原因在于设计理念。对于大规模token生成而言,峰值FLOPS并不是关键,每瓦特的内存带宽才是。在该指标上,Jalapeño在700W封装内挤出了15.4 TB/s的带宽,使其效率约为Vera Rubin的两倍,即使在Rubin的低功耗设置下也是如此。
该架构强化了这一赌注。Jalapeño采用了一种受TPU启发的微架构,但与Google TPU或Amazon Trainium中发现的单块模块不同,它使用了刻意设计的较小脉动阵列。当矩阵维度较小时(这在混合专家模型和低并发推理场景中很常见),大阵列往往会遭遇效率断崖,而小阵列则避免了这一问题。该芯片还包含L1缓存,这是AI加速器中罕见的功能,后者通常依赖更简单的暂存器内存(scratchpad memory)。这使得芯片更难推理,但在实践中更加灵活。
这种灵活性的证明略显荒谬:该芯片能以每秒36帧的速度运行《毁灭战士》(Doom)。这对于大型语言模型(LLM)推理来说并不是一个重要的基准测试。重要的是,它证明了Jalapeño是一个真正的通用推理平台,而不是一个硬连线、单一模型的解决方案。“他们可以拿出一款芯片,而他们的竞争对手做不到,”Xie指出,“这是未来趋势的一个信号。”
Jalapeño开发中最引人注目的方面不是硅片本身,而是谁——或者说是什么——编写了软件。
OpenAI构建了Gluon,这是一种建立在Triton之上的低级内核编程语言。驱动Jalapeño性能的内核,用分析师的话说,本质上是AI生成的汇编代码。当SemiAnalysis团队在现场与OpenAI工程师一起审查用于DeepSeek的3万行多头注意力(MLA)内核时,工程师们无法逐行解释代码的作用。但生成该代码的模型可以。
“这 literally(字面上)就是AI生成的汇编代码,基本上是用Gluon吐出来的,”Xie说道。“那些与我们一起浏览这段代码的家伙,很明显他们对硬件了解很多……但他们对我们展示的用于DeepSeek的这个MLA内核实际上做什么一无所知。”
这代表了Jalapeño故事中第二个不太明显的革命。第一个是在芯片设计本身中使用AI——OpenAI声称其模型在设计阶段利用早于GPT-5的模型,使SIMD面积减少了8%,矩阵引擎面积减少了10%。但在内核编程阶段,这种方法变得真正激进。
内核优化本质上是一个强化学习问题。你向模型提供一段代码、一个验证脚本和一组测试用例,然后让它迭代。目标函数很明确:让内核运行得更快,或者让它匹配参考输出。成功是可衡量的,失败的模拟成本很低。正如主持人Jordan Nanos所说:“你应该能够给模型一个任务,比如改进内核的性能,或者让内核在某些测试用例和验证脚本面前功能正确。然后就让模型放手去试,让它尽情发挥。”
这种能力——而非芯片本身——可能是OpenAI最持久的护城河。前沿实验室拥有比其硬件竞争对手可用的任何东西都更智能的模型。Anthropic、Google和Meta都在构建定制硅片项目。只有OpenAI已经证明,其模型可以设计和编程一款击败Nvidia最佳产品的芯片。“颇具讽刺意味的是,正是Nvidia的硬件使得摆脱Nvidia的硬件成为可能,”主持人们观察到。
隐藏在Jalapeño的胜利背后还有第二个故事:三星已悄然超越HBM竞争。
对于HBM4代,三星使用了更先进的1C DRAM工艺,而其竞争对手使用的是1B工艺;同时在基础芯片上使用4nm逻辑工艺,相比之下,SK海力士和美光分别使用台积电的12nm工艺和自身的DRAM工艺。结果是10 Gb/s的引脚速度,领先于Nvidia Rubin预计的大约9.6 Gb/s。
历史背景使这一点尤为显著。SK海力士曾与AMD合作发明了用于游戏GPU的HBM。三星的HBM3E被广泛认为 inferior(较差),而Broadcom传统上偏好三星内存,在那一代产品中曾被视为劣势。随着HBM4的到来,这种偏好变成了资产——部分靠技能,部分靠运气,正如主持人们所指出的那样。
带宽与容量的平衡也在发生变化。由于HBM晶圆供应有限且日益昂贵,较低的堆叠高度正变得更具吸引力。带宽不会随堆叠高度变化——四层堆叠的速度与十二层堆叠相同。为不需要的容量付费会恶化单位带宽的成本。这与行业向机架级架构的整体转变相一致,在这些架构中,总内存容量不再像以前那样构成主要约束。
总体拥有成本(TCO)的比较之处,正是对Nvidia的战略压力变得不可否认的地方。