2026年10月4日星期日
AI 基础设施 · 新闻与分析
首页 › 头条 › 报道
头条 · 报道

OpenAI的Jalapeño架构部署采用AMD的EPYC Turin处理器而非英伟达Vera Rubin加速器进行推理。

将一项重要的内部工作负载从英伟达转向AMD,表明顶级AI实验室向AMD数据中心CPU和定制芯片策略的转向。
行业媒体Slicast · 2026年10月3日 UTC 04:48 · 美国 · 来源: remio
重要度 85

OpenAI的Jalapeño ASIC部署将其新推理芯片与AMD EPYC Turin主机配对,尽管该公司与Nvidia有深厚的基础设施合作关系。每个主机配备两个Turin级处理器和1.5TB的DRAM。Nvidia的新型Vera CPU未被纳入首个生产设计中。

这个选择不仅仅是组件互换。OpenAI将Jalapeño设计为针对语言模型推理优化的应用专用集成电路,但在周围主机层的构建中采用了成熟的x86服务器平台,而不是Nvidia专门开发的Arm CPU。OpenAI副总裁兼硬件主管Richard Ho将Turin的选择描述为"务实的",他告诉Tom's Hardware,Vera在所需的成熟度等级上仍然"略有落后"。这个表态将部署的确定性置于对计算堆栈更紧密的控制权之前。OpenAI在其他地方仍然严重依赖Nvidia加速器,而Jalapeño仍然是一个内部平台,其早期性能声称需要更广泛的验证。即便如此,这个主机选择展示了超大规模数据中心运营商如何能够有选择地挑战Nvidia,而不是完全放弃其硬件。

OpenAI将Jalapeño从芯片发布会转变为围绕独立的AMD主机和自定义加速器层构建的机架设计。该架构在一个Jalapeño ASIC机架旁边配置了一个CPU主机机架。每个Katsu CPU托盘包含两个AMD EPYC Turin级CPU和1.5TB的DRAM,以及本地存储和400G前端网络。八条外部PCIe电缆将每个CPU托盘连接到其对应的Vindaloo加速器托盘。相邻机架跨16个加速器托盘配置了128个Jalapeño芯片,八个Chana交换机托盘连接这些加速器,用于机架内部和更大规模安装中的互联。已发布的机架架构可以在16个机架上扩展其横向扩展网络,通过铜缆和光纤链路连接多达2,048个Jalapeño加速器。

主机处理器不会替代推理ASIC;它们处理为加速器工作负载供电、协调、调度和管理所需的支持CPU工作。生产推理需要分词、请求处理、存储访问、网络、模型编排、安全服务和其他CPU密集型操作。代理应用增加了这些需求——代理可以在模型推理、Python执行、检索、数据库访问和外部工具之间切换。主机性能不佳可能导致昂贵的加速器在等待这些阶段完成时空闲。因此,OpenAI需要的不仅仅是快速推理芯片:需要一个具有足够内存容量、网络支持、软件兼容性和运营历史的主机平台。

功耗说明了系统级别的挑战。主机机架在生产中使用约31千瓦,而加速器机架耗费约130千瓦。总体而言,配对系统消耗约160千瓦。这些数据表明为什么Jalapeño不能仅通过芯片规格来评估——机架网络、主机利用率、冷却、软件和工作负载放置都会影响安装所提供的有用工作。同样的原则适用于OpenAI的基准声称:加速器的有利结果只有在完整系统能够在生产流量下重复时才重要。选择已建立的主机平台减少了该转变期间的一个不确定来源。

AMD EPYC Turin主机为OpenAI提供了一个已知的平台,同时该公司尝试了异常压缩的加速器开发计划。OpenAI和Broadcom表示,Jalapeño从初始设计到制造流片仅用了九个月。这个计划描述的是一个几乎没有空间容纳可避免集成问题的项目。OpenAI设计了加速器架构,而Broadcom贡献了硅芯片实现、网络和连接专业知识。Celestica从事主板、机架和完整系统设计。Ho表示,团队希望实现激进的性能和成本目标,但不接受不必要的风险。Turin满足了项目的要求,OpenAI的合作伙伴已经拥有该平台的相关经验。

新的CPU架构将扩大验证范围。指令集、编译器行为、管理工具和应用兼容性的差异即使在底层处理器性能良好时也可能造成延迟。Turin属于AMD第五代EPYC服务器系列,使用已建立的x86指令集,每个插槽支持12个内存通道,为系统设计人员提供了充足的内存带宽和容量。OpenAI的机架设计在每对处理器旁边放置1.5TB的DRAM,以保留应用状态、准备请求、管理数据并支持推理周围的CPU端服务。

OpenAI还必须为一个没有现有开发者生态系统的加速器准备软件。Nvidia受益于多年的CUDA应用、优化库、部署工具和运营人员熟悉度。Jalapeño开始时没有这样的安装基础。OpenAI可以控制其内部软件环境,但其工程师仍然必须为新平台构建编译器、内核、监控系统和调度逻辑。使用熟悉的主机硬件使这项工作集中在自定义加速器上,让团队将Jalapeño特定的缺陷与由额外CPU转换造成的问题分开。

这个决定反映的是时间表纪律,而不是对x86和Arm的笼统判断。OpenAI选择了为这一代降低集成风险的组件。Ho没有辩称Turin将为OpenAI的每个未来系统保持最佳主机地位;他说它满足了直接项目的需求和成熟度要求。因此,第一代Jalapeño是一个混合策略:OpenAI在专业化承诺带来有意义的推理收益的地方承担架构风险,同时在成熟度提供更大价值的地方保留商用服务器技术。

直接的压力落在Nvidia尝试让Vera成为下一代AI基础设施默认CPU的计划上。Nvidia将Vera定位为为代理周围的CPU工作而设计的处理器——Python运行时、沙盒代码、编排、分析和其他发生在加速器调用之间的任务。该处理器使用88个自定义Olympus核心和一个LPDDR5X内存子系统,可提供高达每秒1.2TB的带宽。Vera还通过NVLink-C2C连接到Rubin GPU,在CPU和GPU之间提供高达每秒1.8TB的相干带宽。这种紧密耦合支持Nvidia的更大销售论点:客户可以作为一个协调的平台购买CPU、GPU、网络、互连、库和机架系统。Nvidia表示Vera系统将在2026年秋季通过系统制造商和云合作伙伴提供。OpenAI的选择暴露了该策略内部的时机问题:Vera可能提供有吸引力的规格,但Jalapeño需要一个合作伙伴可以按照加速器计划交付的主机平台。

阅读原文
OpenAI的Jalapeño架构部署采用AMD的EPYC… · Slicast