2026年9月11日星期五
AI 基础设施 · 新闻与分析
首页芯片与硬件报道
芯片与硬件 · 报道

Panmnesia与Meta共同提出一种旨在覆盖整个AI数据中心的下一代CXL互连架构。

这种互连标准有望显著改善分布式AI训练集群的内存带宽和延迟,减少对传统PCIe瓶颈的依赖。
行业媒体Slicast · 2026年9月10日 · 全球 · 来源: HPCwire
重要度 80

国大田,2026年9月9日——无晶圆厂半导体公司Panmnesia与全球超大规模云服务商Meta联合提出了一种下一代人工智能数据中心架构,该架构使整个设施像单个芯片一样运行。该提案以特邀综述的形式发表在《自然》旗下期刊《自然评论电气工程》(Nature Reviews Electrical Engineering, NREE)上。

随着人工智能模型扩展至万亿参数规模,单次训练步骤可能需要数百至数千个加速器交换太字节的数据。由于整体进度由最慢的参与者决定,增加加速器虽然提高了计算能力,但也使系统更容易受到因瓶颈效应导致的频繁延迟和故障的影响。当一个组件响应滞后时,其余组件必须等待。延迟差异越宽,预测作业完成时间就越困难。缩小这种差异——从而创建一个更大、更稳定的执行单元——是整个行业面临的挑战。在机架内部,设备已通过专用高速链路紧密耦合。下一个障碍在于机架之外,即机架间连接,这些连接目前仍主要依赖以太网或InfiniBand等通用网络。在这些环境中,每个请求都必须经过网络接口和基于软件的协调层,这两者都会扩大延迟差异。本研究旨在为跨机架部分带来更高的可预测性。

该方法的基础是Compute Express Link(CXL),这是一个由半导体公司和基础设施公司共同开发的开放行业标准。由于CLEX具有厂商中立性,它可以在整个行业中采用,而无需将运营商锁定在单一生态系统中。Panmnesia和Meta提出的架构利用CXL来最小化机架外的延迟波动,目标是打造一个具有单芯片般可预测性的数据中心。

基于CXL的设计核心包含三个硬件元素:高扇出非阻塞交换机、链路加速单元(LAU)和Fabric控制器,它们用于限制延迟波动。CPU、加速器和内存被置于同一个CXL域中,将缓存一致性从机架内部扩展到整个数据中心。资源的布局遵循与芯片内部块放置相同的原则。为了克服电信号物理传输距离的限制,该综述还概述了如何通过光链路(CXL-over-optics)扩展Fabric的范围(详细信息见附录)。

为了评估该架构的影响,该综述使用传统的机架级配置——一个CPU耦合两个加速器——作为基线。与该参考点相比,单个CPU协调的加速器数量增加了八倍,从两个增加到十六个。作为一个单一单元运行的相干域扩展到多达960个加速器,约为参考平台的13倍。曾经离开机架穿越网络的内存访问现在遵循固定路径,往返延迟从微秒级降低到几百纳秒,低了一个数量级。此外,故障后的替换单元从整个服务器缩小到单个设备。在此规模上将设备耦合到一个功能上相当于单一执行环境的状态,将使超大单个AI模型的连续训练成为可能,或者允许多个服务在共享基础设施上并发运行而不会相互停滞。

NREE仅通过邀请发表综述文章,委托来自各自领域领先的研究人员或机构进行工作。《自然》选择Panmnesia作为这一基于CXL的数据中心架构的共同作者,反映了业界对其技术代表性的认可。Panmnesia是全球首家领导NREE综述的半导体初创公司,这篇文章也是该期刊首次涉及CXL技术和AI数据中心架构的综述。

“随着人工智能系统的持续扩展,快速高效地连接大量加速器和内存设备的能力,正变得与单个加速器的性能同样重要,”Panmnesia首席执行官Jung Myoungsoo表示,“这项研究勾勒出了下一代人工智能基础设施的方向,其中CXL使整个数据中心能够作为一个单一的计算机系统运行。” Panmnesia已在硅片上实现了该架构的核心组件,完成了验证,并正在准备将其投入商业供应。完整综述可在 https://www.nature.com/articles/s44287-026-00315-5 获取。

阅读原文