据报道,苹果正在评估采用英伟达NVLink互连技术来加速其定制M8 Ultra AI服务器,旨在尽管存在历史竞争关系的情况下于2029年协同推进数据中心业务。
据《信息》报道,苹果正在开发基于其自有 M 系列处理器的 AI 服务器,并评估英伟达的 NVLink Fusion 技术用于系统互连。这些机器预计将搭载 M8 Ultra 处理器,并于 2029 年上市。虽然苹果和英伟达均未确认是否会采用 NVLink Fusion,但相较于其他解决方案,该技术的采用可能带来远超单纯硬件采购决策的市场影响。
据报道,苹果正在权衡至少两种服务器配置:一种紧凑型型号配备两颗 M8 Ultra 处理器,另一种高端变体则采用四颗 M8 Ultra 系统级芯片(SoC)。尽管苹果利用其专有的 UltraFusion 技术无缝连接两颗高端 SoC,但目前缺乏强大的方案来实现处理器在规模扩展(scale-up)和横向扩展(scale-out)方面的互连。正是在这一空白领域,英伟达的 NVLink 生态系统变得相关。报道称,苹果打算利用完整的 NVLink 基础设施——包括互连协议、交换机、专用芯片组以及相关的软件栈——来构建其服务器架构。该计划据称由当时领导苹果硬件工程组织的约翰·特努斯(John Ternus)主导,大约一年前启动。
苹果已为其 Private Cloud Compute 平台制造定制服务器,该平台处理的 AI 工作负载强度过大,无法在 iPhone 和 Mac 上本地执行。这些系统目前依赖苹果内部开发的连接技术,据报道,这些技术在大规模商业部署中速度过慢且成本高昂,促使公司探索外部替代方案。
《信息》强调了苹果对适用于大规模部署的连接技术的需求,但未指定具体的架构实现方式。如果目标是将多台服务器链接成更大的集群,这通常属于以太网或 InfiniBand 等横向扩展协议的范畴,而非像 NVLink 这样的纵向扩展互连结构。英伟达最初设计 NVLink 是为了在其加速器之间扩展性能,优化其用于加速器之间的通信,使一排 GPU 能够作为一个紧密耦合的计算域运行。单独的 NVLink-C2C 实现提供了一种相干的芯片到芯片接口,用于连接 CPU 与加速器以及 CPU 与 CPU。
现代苹果 M Pro 和 M Ultra 处理器采用封装内系统(SiP)架构,通过台积电的 SoIC-mH 技术将 CPU 芯片组和 GPU/神经引擎芯片组键合在一起。如果苹果为 M8 Ultra 保持这一设计——这极有可能——那么该处理器将同时作为 CPU 和集成加速器发挥作用。这就引发了一个问题:苹果计划如何将 M8 Ultra 芯片整合到 NVLink 域中,以及哪些 SiP 组件会参与其中。一种可能性是,苹果可以通过 NVLink Fusion 芯片组暴露 M8 Ultra 的加速器部分给 NVLink,从而有效地将其视为纵向扩展集群中的加速器。或者,苹果可能正在为其服务器开发一种独立的加速器架构,例如将 GPU/NPU 芯片组放置在带有专用内存的单独基板或中介层上。然而,目前没有证据支持这种旨在用于多年后才发布产品的设计。
另一个需要考虑的因素是苹果是 UALink 联盟的成员,该联盟负责制定 UALink 的行业标准,这是一种支持多达 1,024 个加速器的加速器间互连标准。虽然目前的交换机选项有限,但预计到 2029 年将提供具有不同性能等级的行业标准 UALink 交换机。这一时间线使得苹果看似倾向于将英伟达的 NVLink 作为纵向扩展互连结构显得有些意外。
一个合理的解释是,苹果感兴趣的不仅仅是 NVLink 协议本身。NVLink Fusion 是英伟达更广泛的机架规模和数据中心基础设施架构的一部分,能够将 NVLink 纵向扩展连接与英伟达的 Spectrum-X 以太网或 Quantum-X InfiniBand 横向扩展网络(包括采用共封装光学的交换机)集成。通过采用英伟达的生态系统,苹果可以在不自行开发整个数据中心网络堆栈的情况下,确保统一的纵向扩展和横向扩展连接。虽然这只是推测,但这种战略意味着苹果将在英伟达数据中心架构的重大元素周围构建 AI 服务器,同时保留其自己的处理器并避免使用英伟达的加速器。如果实现,这一安排将凸显英伟达在确立 AI 数据中心基础设施事实标准方面日益增长的作用,无论底层 CPU 或加速器供应商是谁。
鉴于英伟达作为领先的数据中心硬件供应商的地位,如果报道属实,合作似乎是合乎逻辑的。
然而,历史上苹果和英伟达的关系一直紧张。摩擦可以追溯到 2000 年代初,当时史蒂夫·乔布斯指控英伟达侵犯皮克斯的专利。英伟达回应称,它拥有的图形知识产权比皮克斯更多,因此可以采取法律行动。随后的争议围绕为苹果提供的组件进行 GPU 设计决策展开。在“Bumpgate”(2007–2008 年)期间,关系进一步恶化,当时英伟达向苹果和其他 PC 制造商提供了有缺陷的 GPU。英伟达最初拒绝承认这一缺陷,并抵制全额赔偿维修费用,严重损害了企业间的关系。苹果继续使用英伟达 GPU 直到 2014 或 2015 年,之后转向 AMD 的 Radeon 系列,最终完全放弃了独立的第三方 GPU。
近年来,苹果重新开始使用英伟达硬件。Siri 最新的 AI 功能主要由苹果与谷歌合作开发的、基于 Gemini 技术的苹果基础模型驱动。这些模型的服务器端推理通过苹果的 Private Cloud Compute 架构运行,许多工作负载托管在谷歌云内的英伟达 Blackwell GPU 上。尽管如此,在第三方云环境中依赖英伟达硬件与正式采用英伟达专有的互连和基础设施技术用于苹果自己的服务器平台有着显著区别。