2026年9月11日星期五
AI 基础设施 · 新闻与分析
首页芯片与硬件报道
芯片与硬件 · 报道

OpenAI发布自研Jalapeño定制加速器,声称其AI推理速度更快且功耗低于旗舰GPU。

标志着顶级实验室向专有硅片战略转变,以降低对第三方代工的依赖并优化推理经济模型。
行业媒体Slicast · 2026年8月27日 · 美国 · 来源: Techgenyz
重要度 85

OpenAI发布了其定制AI推理芯片Jalapeño的首批详细性能结果,将其直接定位为与NVIDIA最新高端系统相抗衡的产品。据该公司称,Jalapeño在每瓦特功耗下提供更高的AI处理能力,并显著降低了响应延迟——随着AI工作负载从简单的提示转向始终在线的智能体,这两项指标至关重要。然而,OpenAI澄清,Jalapeño并非旨在取代NVIDIA在整个AI基础设施栈中的地位。相反,它作为一个专注于推理的加速器,为OpenAI在与现有NVIDIA和第三方系统并存的同时,提供了额外的硬件选择。

为了评估性能,OpenAI使用了InferenceX,这是一个由SemiAnalysis开发的公开基准测试,旨在衡量现实推理条件下的AI服务表现。该公司测试了涉及GPT-OSS 120B、DeepSeek R1和Kimi K2.5 1T的工作负载。在这些运行点中,与商业参考系统相比,Jalapeño每千瓦的峰值吞吐量提高了1.5–1.9倍,端到端延迟降低了1.7–3.6倍。对于通常需要每个任务多次调用模型的AI智能体而言,这些延迟降低可以累积成明显更快的交互体验。这些数据反映了OpenAI的内部测量结果,而非独立的行业广泛基准测试。

除了原始性能外,Jalapeño背后的架构方法也值得关注。OpenAI将芯片、内存子系统、网络结构和推理软件设计为一个集成堆栈,允许围绕现代语言模型进行精确调优。这种架构最大限度地减少了不必要的数据移动,并将关键模型状态保持在更接近计算资源的位置,专门针对LLM推理进行了优化,而不是从通用硬件重新利用而来。该加速器是与Broadcom和Celestica合作开发的,作为更广泛的多代基础设施平台的一部分。

在直接比较中,OpenAI将Jalapeño与基于NVIDIA的GB200和GB300加速器的商业系统进行了对比。在Kimi K2.5工作负载上,Jalapeño记录了每千瓦18,195个混合令牌每秒的性能,优于基于GB300系统的11,862,同时将端到端延迟从5.31秒缩短至1.56秒。尽管取得了这些进展,OpenAI强调,Jalapeño并不意味着背离NVIDIA。该公司计划保持多样化的硬件策略,根据特定工作负载需求选择加速器,而不是依赖单一供应商。

Jalapeño专供OpenAI内部基础设施使用,不会商业化销售。第一代加速器代表了多代计算平台的初始阶段,预计部署时间为2026年底,并随时间扩展至吉瓦级容量。值得注意的是,OpenAI在大约九个月内完成了芯片从初步设计到制造流片的全过程,利用自身的AI模型加速了部分设计和优化流程。该公司报告称,用于注意力机制和混合专家(MoE)工作负载的AI生成实现比之前的人工编写版本快1.5–1.8倍,尽管这些改进仅适用于特定组件,而非完整模型。

通过开发自己的加速器,OpenAI获得了对延迟、能效、内存带宽和推理经济性的更紧密控制,使硬件与其日常运营中的模型、推理软件和产品直接对齐。对用户而言,这可能转化为更快的ChatGPT响应、加速的Codex工作流程以及降低的API推理成本。从战略角度来看,这一举措确保了基础设施的灵活性,因为对AI智能体和实时推理的需求持续增长。虽然Jalapeño的初步基准测试结果在定制硅片领域奠定了坚实基础——特别是在推理效率和延迟方面——但真正的验证将在这些优势从受控测试环境过渡到大规模生产时发生。

阅读原文