在 Hot Chips 2026 大会上,Intel 详细介绍了基于 Xe3P 架构的 Crescent Island AI 加速器,该芯片采用液冷设计以最大化 AI FLOPS 每瓦能效。
在 Hot Chips 2026 研讨会上,英特尔深入介绍了其基于 Xe3P 架构打造的 Crescent Island AI 加速器的架构细节。与英伟达的 Rubin 和 AMD 的 MI455X GPU——这些是高功耗、仅支持液冷、依赖海量 HBM4 内存池以在 AI 训练和推理负载中提供峰值性能的芯片——不同,Crescent Island 瞄准的是 AI 加速器市场中低功耗、推理优先的细分领域。该芯片设计为一款 350W 风冷 PCIe 卡,最多可支持 480 GB LPDDR5X 内存,使其能够在传统服务器环境中部署,而无需特殊的供电或冷却基础设施。
Crescent Island 由四个 Xe3P 切片构成,每个切片包含八个 Xe 核心,共计 32 个 Xe 核心。每个 Xe 核心集成了八个 Xe 向量引擎和八个 XMX 矩阵加速器,因此整个芯片共有 256 个向量引擎和 256 个 XMX 单元。为了支撑这些计算资源,英特尔大幅扩展了缓存层次结构。每个 Xe 核心现在拥有 1 MB 的通用寄存器文件空间,是 Battlemage 和 Xe2 架构中 512 KB 容量的两倍。此外,Xe3P 为每个 Xe 核心提供 512 KB 的 L1 缓存或共享本地内存,高于 Battlemage 的 256 KB,较 Panther Lake 的 Xe3 GPU 增加了约 1.33 倍。该芯片还包含一个 32 MB 的共享 L2 缓存,所有这些设计旨在高效地为芯片更大的矩阵加速器提供数据。
一项关键的架构进步在于 XMX 引擎,它们采用了 16 级脉动阵列设计。这使得芯片能够处理比 Xe2 和 Xe3 中采用的四级脉动阵列大得多的矩阵块。虽然英伟达并未公开披露其 Tensor Core 的可比架构细节,但这种增加的并行性为 AI 推理期间的并发矩阵乘法操作带来了显著的能力提升。英特尔还优先考虑广泛的数据类型支持,范围从带有微缩放(MXFP4)的 FP4 格式到通过每个 Xe 核心的 64 个 FP64 FMA 单元实现的全速双精度计算。尽管 FP64 在标准 AI 负载中很少使用,但英特尔表示,全速支持使 Crescent Island 成为高性能计算和 AI 应用的可行融合平台。每个 Xe 核心还支持 sigmoid 和 tanh 超越函数,这对于 softmax 等操作至关重要,这与 AMD 和 Nvidia 在其各自 AI 专用架构中最近强调的功能相一致。
Crescent Island 包含一个媒体编解码器模块,具备四个编码器和解码器,以协助多模态 AI 模型进行视频处理。然而,该芯片刻意省略了光线追踪核心等图形特定功能,以最大化用于计算功能的芯片面积,这意味着它不会作为未来消费级 Arc 图形产品的基础。作为数据中心级组件,它包含了全面的可靠性、可用性和可服务性功能,包括跨芯片的 ECC 和奇偶校验保护以及各种内存可靠性机制。
英特尔特别强调,专家混合模型配合投机性解码是其主要的目标工作负载。投机性解码采用轻量级机制生成草稿令牌,主模型随后接受或拒绝这些令牌,从而提高整体解码效率。就像 CPU 中的投机执行一样,这种方法即使并非所有草稿令牌都被批准,也能从原本闲置的资源中提取有用的计算。随着模型服务策略采用更激进的草稿技术,生成这些草稿的计算需求增加,使得传统上主要受限于内存带宽的解码操作转变为计算密集型操作。由于 Crescent Island 依赖 LPDDR5X 而非 HBM,它缺乏竞争对手加速器在传统自回归解码中所拥有的极端带宽。因此,利用投机性解码对于最大化吞吐量变得至关重要。
英特尔强调,Crescent Island 专为高每瓦特浮点运算次数设计,并针对 AI 推理中计算密集型的阶段进行了优化,特别是预填充操作,如提示处理和 KV 缓存构建。这种定位表明它与更适合解码密集型负载的 HBM 支持加速器形成互补角色。这种解耦方法可能有利于与 SambaNova 等合作伙伴的关系,SambaNova 的 SN50 推理加速器明确设计为利用 GPU 驱动的预填充处理。SN50 机架和 Crescent Island 均定位为可在现有数据中心部署的低功耗、风冷系统,无需重大基础设施升级,从而创造了强大的生态系统协同效应。虽然英特尔尚未披露具体的理论浮点运算次数或内存带宽数据,但其将数据保持在靠近计算引擎并在狭窄功耗范围内处理更大批次的架构策略,在公司经历一系列高调产品失败和取消后试图重塑其 AI 雄心的过程中,显得具有战略合理性。Crescent Island 计划于 2026 年下半年发布,行业观察人士正等待发布时的最终规格和早期客户采用指标。