2026年9月11日星期五
AI 基础设施 · 新闻与分析
首页芯片与硬件报道
芯片与硬件 · 报道

OpenAI发布了其专有Jalapeño芯片,声称其推理速度显著提升且能效优于竞争对手加速器。

OpenAI部署Jalapeño等定制ASIC的计划加剧了对标准GPU供应商的竞争压力,标志着大规模AI训练与推理向厂商专属硅片转型。
行业媒体Slicast · 2026年8月26日 · 美国 · 来源: Livemint
重要度 88

OpenAI发布了其首款定制推理芯片Jalapeño的最新性能结果。该芯片旨在提高每瓦特处理的AI工作量,同时显著缩短响应时间。与传统将处理器视为独立硬件的方法不同,OpenAI将Jalapeño设计为一个集成系统的一部分,该系统结合了芯片、内存、网络和软件。这款加速器专为AI推理阶段(即训练后的模型生成输出的阶段)而打造,而非用于开发这些模型的训练阶段。

OpenAI使用三个公开模型对Jalapeño进行了测试,其中包括被评估的最大模型Kimi K2.5 1T。公司报告称,在峰值吞吐量下,Jalapeño的每瓦特AI工作量比参考系统高出1.5至1.9倍,端到端延迟降低了1.7至3.6倍,对于高度交互式工作负载的性能提高了2.1至4.1倍。特别是在Kimi K2.5 1T上,Jalapeño实现了约1.5倍的每瓦特峰值性能提升和3.4倍的端到端延迟降低。OpenAI指出,这些是专有基准测试结果,并建议在其特定的测试方法和比较系统的背景下解读这些数据。

该芯片的架构解决了AI推理中不同的阶段和瓶颈问题。在前缀(prefill)阶段,系统通过相对计算密集的操作处理用户提示。解码(decode)阶段逐令牌生成响应,主要受限于内存带宽。第三个挑战涉及通信开销,其中处理单元经常在等待数据在不同处理器或内存资源之间移动时处于空闲状态。为了缓解这些问题,Jalapeño将关键模型信息(包括KV缓存)物理上保持在靠近所需位置的地方。OpenAI强调,网络层是架构的重要组成部分,使工作负载能够保留在一个紧密连接的系统中,从而最大限度地减少不必要的数据移动。这种方法产生了一种更平衡的加速器,能够高效地处理前缀和解码任务,这对于包含数百亿甚至数万亿参数的大型AI模型尤为重要,因为这些参数需要分布在多个芯片上。

对于传统的聊天机器人来说,更快的推理速度直接转化为更快的响应时间。然而,效率的提升预计将对执行多个顺序操作的AI代理产生更大的影响。通过围绕现代语言模型和AI代理的具体特性优化硬件,OpenAI希望以更少的电力消耗和更短的用户等待时间生成更有用的AI输出。

值得注意的是,OpenAI声称人工智能在设计处理器本身方面发挥了直接作用。AI工具协助工程师探索替代实现方案,压缩设计和验证周期,并优化算术电路。这种加速的工作流程使团队能够在短短九个月内从初始设计过渡到流片(tapeout),即芯片设计最终确定并提交制造的最后阶段。在完成硬件后,还利用AI优化了配套的软件栈。

尽管Jalapeño具备强大的能力,但OpenAI明确表示,它将继续部署来自Nvidia和其他合作伙伴的加速器,用于训练和推理。因此,Jalapeño应被视为OpenAI计算能力的增量补充,而不是商业GPU的即时替代品。然而,从战略角度来看,该芯片赋予了OpenAI对其基础设施堆栈中一部分的更大控制权,使得未来的硬件可以更紧密地量身定制为其专有模型和工作负载服务。Jalapeño代表了多代硬件路线图的第一代,第二代和第三代芯片已经在开发中。在大规模部署之前,OpenAI计划于2026年底开始内部推广,同时继续进行生产资格认证、软件开发以及针对其他模型的性能测试。

阅读原文