2026年9月11日星期五
AI 基础设施 · 新闻与分析
首页算力与云报道
算力与云 · 报道

TechInsights深入剖析了OpenAI的Jalapeño推理系统背后的架构决策及其效率提升路径。

揭示了头部实验室如何优化推理工作负载,为GPU云利用率和定制芯片设计树立了标杆。
行业媒体Slicast · 2026年9月4日 · 美国 · 来源: TechInsights
重要度 80

Jalapeño是OpenAI首款定制硅推理芯片,由OpenAI与Broadcom联合开发,并采用台积电(TSMC)3纳米工艺制造。该芯片在2026年Hot Chips大会正式亮相前两个月就已公布,但最初仅向公众提供了有限的架构细节及其在每瓦推理性能方面所宣称的突破信息。

基准测试结果引起了广泛关注,而审视其底层设计选择对于解读这一性能表现至关重要。本文基于TechInsights的观点,对Hot Chips大会上披露的架构决策进行分析。

图1 – OpenAI Jalapeño头条新闻(来源:OpenAI HotChips 2026)

借鉴OpenAI的专利,Jalapeño采用了权重驻留脉动阵列(weight-stationary systolic array),使其与谷歌TPU更广泛的架构家族保持一致。在这种配置中,模型的 learned parameters(即权重)被加载一次并保持静止,而输入数据则流经阵列。这种方法最大限度地减少了能耗巨大的数据移动,这对于推理工作负载而言是一个关键优势,因为在这些场景中,相同的参数会被查询数十亿次。

为了进一步优化本地数据访问,Jalapeño采用了基于切片(slice-based)的内存架构。每个核心切片都对其专用的HBM切片保持低延迟的直接视图,确保KV缓存和权重都保持高度局部化。这带来了一个更简单、更可预测的内存层次结构。专用的内存切片管理本地数据访问,而通用片上网络(network-on-chip)则处理更广泛的通信,并且可以与计算任务并发运行。

这种架构引入了一个新的要求:高效的硬件预取。虽然软件管理的直接内存访问(DMA)提供了更高的确定性,但硬件预取必须准确预测数据需求。OpenAI通过利用Codex分析内核实现,并在不同的张量形状之间映射预取模式来解决这一问题,从而有效地应用人工智能来自动化和优化内核调整过程。

与硬件相辅相成的是Gluon,这是一个建立在OpenAI Triton框架之上的自定义编程模型。Gluon实现了一种空间架构,其中每个物理核心都被编程为一个线程块,配备了专用张量引擎、SIMD引擎和标量引擎,这些引擎围绕高速本地内存排列。其最具创新性的功能是一种数学抽象机制,将硬件资源(如寄存器和warp)直接映射到张量元素上。通过OpenAI开发并发布的一种称为“线性布局”(Linear Layouts)的布局代数形式化,Gluon确保计算操作在物理上绑定到核心,而不是纯粹通过逻辑调度进行管理。

在Gluon中,每个程序都映射到一个持久线程,允许开发人员显式地将工作分配给计算块,而不是完全依赖硬件调度器。内核支持手工调优的汇编风格代码,可与NVIDIA的PTX相媲美。虽然专门的集体操作管理频繁的核心间通信,但通用片上网络仍可用于较少见的流量。通过将完整的推理循环直接嵌入内核,该架构大幅降低了CPU开销,并消除了不必要的编排步骤。

Jalapeño专为推理设计,并以封闭硅(captive silicon)的形式运作,这意味着它并非旨在成为NVIDIA的直接竞争对手。目前的软件栈仍然是发展的瓶颈;然而,OpenAI正在积极使用其专有编码工具和AI模型迭代优化内核并移植第三方模型,从而扩大芯片的实际效用。预计OpenAI将继续依赖NVIDIA的基础设施来处理训练工作负载。这种分工符合两家公司最近宣布的战略伙伴关系,该协议可能涉及高达6000亿美元的算力承诺(至2030年),并由NVIDIA为OpenAI的投资提供担保。

虽然Jalapeño并不旨在取代NVIDIA,但它为OpenAI提供了一条降低推理成本并加强与NVIDIA及其他供应商谈判地位的关键途径。OpenAI的模型组合涵盖了不同的价格点、能力、延迟特征和使用场景。通过API集成的企业客户通常会锁定特定模型,并围绕其构建运营工作流,从而形成稳定的依赖性:成熟模型需要持久的基础设施。因此,OpenAI的策略并不是用Jalapeño替代NVIDIA。相反,该公司计划将在经济优势明显的情况下,将新模型或高吞吐量模型路由到Jalapeño上,同时在其他地方维持遗留部署,并利用多供应商生态系统为不同客户群体提供定制的性能层级和定价。

阅读原文