OpenAI自主研发的Jalapeño加速器在推理基准测试中表现强劲,验证了其定制硅片设计符合行业标准。
OpenAI的首款定制AI加速器Jalapeño已进入公开基准测试阶段,为业界提供了迄今为止最清晰的视角,以了解该公司如何降低大规模模型推理的成本和延迟。然而,这款专为大型语言模型(LLM)推理设计的初代芯片的主要性能对比数据,仍与SemiAnalysis测试的工作负载及系统配置紧密相关。
Jalapeño由OpenAI与博通(Broadcom)合作开发,Celestica提供主板、机架及系统集成方面的专业知识,于6月作为计划于2026年底部署的多代计算平台的首款产品正式亮相。SemiAnalysis的InferenceX基准测试得出的最新结果,将Jalapeño与运行GPT-OSS 120B、DeepSeek R1 670B以及Kimi K2.5 1T的商业加速系统进行了对比。据OpenAI称,该芯片在每千瓦峰值混合令牌吞吐量方面表现更高,且降低了令牌生成延迟。
爱范儿(ifanr)在报告中复现了详细的数据和图表。在DeepSeek R1的一项测试中,输入8K个令牌,输出1K个令牌,端到端延迟从对比系统的5.99秒降至Jalapeño上的1.65秒。同样,生成的令牌间最小间隔也从5.90毫秒缩短至1.43毫秒。
这些发现不应被过度推断为表明Jalapeño在所有工作负载下均优于所有GPU。推理性能会根据模型架构、批处理大小、量化方式、延迟目标、软件栈、机架设计及电源计量方法而波动。SemiAnalysis是在OpenAI工程师的协助下进行测试的,这意味着对比结果严格反映了基准测试所披露的特定硬件和配置。OpenAI对测量结果的自身分析也体现了这种谨慎态度,仅强调在测试模型上提升了吞吐量和延迟表现,而未做出无限制的性能声明。
与专注于训练的芯片不同,Jalapeño专用于推理。LLM推理通常在计算密集型的预填充阶段(处理初始提示词)和解码阶段之间循环,后者在生成令牌时不断移动模型权重和键值缓存数据。为解决这一问题,OpenAI设计了该架构以最大限度地减少数据移动,并优化计算、内存和网络资源之间的平衡,旨在在实际部署中捕获更多芯片的理论性能。SemiAnalysis报告称,该芯片配备216GiB HBM4内存和15.4TB/s的内存带宽,尽管这些详细规格源自这家研究公司,而非OpenAI的初始发布材料。
该架构将计算和内存资源分区,使模型数据尽可能靠近处理它的核心,仅在数据必须跨越不同区域时才依赖高速互连。这一设计理念优先考虑减少传统上在计算单元、内存和相邻加速器之间传输数据所消耗的能源和时间。SemiAnalysis报告的功耗指标显示,其标称封装功率为700W,测试期间的持续功耗保持在550W以下。读者应注意,每瓦性能的比较取决于是在芯片、主板、服务器还是设施层面测量电力;评估基准测试图表时需遵循其所述的“全口径公用事业”方法论。
OpenAI表示,Jalapeño从初步设计到制造流片仅用了九个月时间。该公司将此加速时间表归功于软硬件紧密协同开发、博通的实施专长,以及在设计探索、验证和优化的一些阶段内部使用OpenAI模型。需要澄清的是,这九个月的时间窗口仅涵盖设计到流片的阶段,不包括后续的制造、封装、上线、验证、软件启用和生产认证等阶段。
根据爱范儿的時間线重建,OpenAI于2026年收到首批硅片,并花了数月时间进行硬件上线和模型适配。该出版物指出,Codex和一个未发布的内部模型被用于将工作负载移植到加速器原始启用范围之外。这些具体的时间和工具细节应被视为超出OpenAI官方沟通范围的第三方报道。
这一合作框架明确了各方职责:OpenAI提供加速器架构和对模型服务工作负载的深厚专业知识;博通负责硅片实现、网络及连接技术,包括Tomahawk网络组件;Celestica则推动主板、机架及完整系统的工业化。这一伙伴关系支持着一个更广泛的倡议,即扩展至10吉瓦的OpenAI设计加速器和网络基础设施。根据博通2025年的公告,首批机架部署计划于2026年下半年开始,并持续至2029年。
在战略层面,Jalapeño使OpenAI对推理堆栈拥有更大的垂直控制权。一款针对其特定服务模式定制的处理器有望降低ChatGPT、Codex及开发者API等服务的运营成本,扩大容量并加快响应速度。然而,要实现这些优势,取决于生产良率、系统可靠性、软件成熟度,以及受控基准测试结果转化为实时规模化部署的程度。
因此,Jalapeño的早期基准测试结果意义重大但并非定论。它们证明了初代定制加速器能够在严格的推理场景中竞争。更广泛的行业结论最终将取决于在更广泛的模型、延迟目标和完全集成的数据中心环境中进行的可重复测试。
来源:OpenAI关于Jalapeño的公告;OpenAI基准测试评论;SemiAnalysis InferenceX;博通;以及爱范儿。