2026年9月11日星期五
AI 基础设施 · 新闻与分析
首页芯片与硬件报道
芯片与硬件 · 报道

OpenAI定制版Jalapeño推理加速器通过显著降低单Token推理成本,正在重塑单位经济效益。

专有硅片的成功部署降低了大型科技公司对Nvidia硬件的依赖,并对第三方GPU云利润率构成压力。
行业媒体Slicast · 2026年8月26日 · 美国 · 来源: OpenTools
重要度 80

OpenAI 发布了其定制推理芯片 Jalapeño 的首批实测结果。在三个开源权重模型上,该公司报告称,Jalapeño 在峰值吞吐量下每瓦特产生的 AI 工作量比参考系统高出 1.5 至 1.9 倍,端到端延迟降低了 1.7 至 3.6 倍。独立报道证实了这些主要数据,同时强调了两个重要的注意事项:基准测试是针对目前可用的硬件运行的,且 Jalapeño 专为推理设计,而非训练。

该基准测试侧重于工作流中面向用户的部分:即推理过程,包括处理提示词和生成响应。OpenAI 使用 SemiAnalysis 的公开 InferenceX 框架对 Jalapeño 进行了评估,该工具旨在测量完整的模型服务管道,而非孤立的算术峰值。通过同时捕获延迟、吞吐量和功耗,这种方法提供了更贴近现实世界性能的画面——特别是对于依赖大量顺序模型调用的 AI 智能体而言。

据 OpenAI 称,Jalapeño 在 GPT-OSS 120B、DeepSeek R1 670B 和 Kimi K2.5 1T 上实现了吞吐量与延迟的优越平衡。具体而言,与对比系统相比,该芯片在 Kimi K2.5 1T 上的峰值每瓦性能高出约 1.5 倍,端到端延迟低 3.4 倍。真正的价值超越了基准排名:它在于能够在相同的功耗限制下服务更高数量的请求。

TechCrunch 指出,对比基线包括一套 Nvidia Blackwell 系统,同时也警告称,在 Jalapeño 广泛部署之前,竞争硬件可能会发生显著变化。OpenAI 尚未披露客户定价、机队分配或用户可能看到可衡量产品级改进的时间表。因此,买家应将这些数据视为可信的技术验证,而非立即降低成本的信号。

垂直整合具有独特的优势。当模型提供商控制整个服务堆栈时,它可以针对实际工作负载优化内存放置、网络和数据软件。OpenAI 表示,Jalapeño 在本地维护模型状态,并战略性地平衡计算密集型的预填充阶段与内存受限的解码阶段。如果这些架构优势在生产部署中得到保持,OpenAI 将对延迟、容量规划和利润率获得更大的控制权,从而减少对更广泛的通用加速器市场的依赖。

正如 Axios 和 TechCrunch 所强调的那样,Jalapeño 专为推理而设计,不用于训练前沿模型。两家媒体均将该芯片描述为一种战略举措,旨在部分抵消 OpenAI 对 Nvidia 的依赖,而非完全消除这种依赖。对于评估供应链集中度的组织而言,区分用于训练模型的硅片与用于提供服务所需的基础设施仍然至关重要。

阅读原文