在超大规模数据中心中,电力供应和分配已成为主要性能瓶颈,超越GPU部署成为最大限制因素。
在超大规模数据中心中,限制因素不再是可以部署多少个加速器,而是可以输送、分配和有效利用多少能量。在许多环境中,瓶颈不是由芯片密度决定的,而是由系统和设施能够维持的电力决定的。
根据国际能源机构的数据,全球数据中心电力消耗预计到2030年将达到945太瓦时,大约是当今水平的两倍,主要由AI工作负载推动。因此,系统设计越来越多地不是由理论计算能力决定的,而是由可用电力如何有效转化为可用性能决定的。
这个规模上的AI性能不再由单个组件决定。它由系统行为定义。数千个计算元素并发运行,在复杂的互连和内存层级中共享数据。重要的不仅是任何一个引擎能运行多快,而是整个系统在负载下如何高效地移动、优先级处理和交付数据。挑战正在从添加计算转向编排计算——而这一转变的中心是互连。
数据中心代表了最极端的AI部署形式。系统旨在跨异构计算的大规模集群(CPU、GPU、NPU和专门的AI加速器)最大化吞吐量——所有这些都在共享数据集上并发运行。与受固定电力和热预算限制的边缘系统不同,数据中心在可用能量的极限处运行。问题不仅是可以部署多少计算,而是可用电力如何有效转化为有用的工作。用于低效数据移动的电力减少了可用于计算的能量,随着AI系统的扩展,低效数据移动越来越多地消耗该预算。互连效率已成为数据中心AI系统设计的核心——单位能量移动更多数据直接转化为更高的有效系统性能。
行业讨论通常聚焦于片外带宽,如高带宽内存(HBM),或使用CXL和PCIe的扩展和内存池化实现,这些对于内存容量和外部带宽是关键约束的训练工作负载仍然至关重要。然而,在许多现代架构中,瓶颈越来越分散在片上和片外数据移动中,需要跨整个系统的协调优化。
随着AI加速器变得越来越复杂,它们集成了越来越多的计算引擎——多核NPU、脉动阵列和向量单元——所有这些都同时生成和消费数据。片上互连现在必须处理高带宽流数据流、延迟敏感的控制流量和一致性驱动的内存访问模式。缓存层次变得越来越关键;当数据重用率高时,本地缓存可以提供比外部内存显著更高的有效带宽,但它们也引入了必须高效协调的额外流量模式。即使是最快的外部内存系统也无法完全补偿无法跟上的内部结构。AI性能越来越多地由数据在系统内如何移动、重用和优先级处理决定,而不仅仅是由从外部获取数据的速度决定。
现代AI系统本质上是异构的。GPU和NPU在非常宽的多线程数据流上驱动高吞吐量、流式工作负载;CPU引入突发、延迟敏感的流量;加速器可能需要紧密同步的、一致性感知的通信。支持这种多样性需要可以同时管理多个流量类、强制优先级处理并在负载下保持可预测延迟的互连架构。服务质量(QoS)、流量隔离和一致性域管理对于管理争用和优先级处理至关重要。维护共享内存域中的数据一致性引入了同步开销,必须谨慎管理以避免性能降低。没有智能仲裁和调度,争用会迅速削弱额外计算的好处。互连在真实工作负载下管理系统行为,塑造的不仅是数据移动,还有整体性能和效率。
为了继续扩展AI计算,行业正在迅速采用芯粒化架构。通过将大型SoC分割成多个芯片,设计人员可以提高良率、降低成本并扩展系统超越光刻限制。但这种架构转变并不是消除数据移动挑战,而是重新分配它们。在芯粒内,本地化通信可以通过更短的导线、更高的带宽和更低的延迟来优化,而内存和计算可以放在更靠近的位置。然而,芯粒之间的通信引入了新的约束。与片上互连相比,芯粒间接口通常在带宽密度、延迟和电力效率方面受到更多限制,在需要连续、高容量数据交换的AI工作负载下可以快速成为瓶颈。芯粒增加了对跨芯粒QoS和优先级处理、高效调度芯粒间流量以及仔细分配工作负载以最小化不必要数据移动的需求。它们既解决了问题又产生了问题——启用了可扩展的系统设计,同时使系统级数据移动架构变得更加关键。
随着AI系统的规模和复杂性增长,互连设计的传统方法正在崩溃。手工制作的互连在范围紧密的设计中是有效的,但不能有效地扩展到具有数百个计算元素、多个内存层次和复杂流量交互的系统。挑战从建筑意图的层面开始。手动指定数据应如何在系统中移动是耗时的、容易出错的,并且难以优化。转变是朝向系统级建模和探索、自动互连生成以及更抽象、可编程的架构描述方式。目标不仅是更快地构建互连,而是从概念到实现保持建筑意图,并确保性能、电力和可扩展性目标可预测地实现。
历史上,互连设计通常被视为次要关注点,在计算和内存决策之后处理。在现代AI系统中,互连是系统性能、效率和可扩展性的主要决定因素。数据中心中AI扩展的下一阶段正在由数据在可用电力限制内如何有效传送到计算来定义。这意味着在设计过程早期优先考虑数据移动,将互连视为一流的架构元素,并采用将高性能结构与系统级自动化相结合的解决方案。性能不再仅由机架中的加速器数量决定,而是由这些加速器能够保持多么一致地忙碌决定。这需要可以在负载下可预测地优先级处理、平衡和交付数据的系统。下一代AI基础设施将不仅由更多计算定义,而是由从一开始就设计为高效移动数据并处理数据的系统定义。
*Andy Nightingale是Arteris公司产品管理与营销副总裁,在高科技行业拥有40多年的从业经验。他是英国计算机学会和营销学会特许会员,在Arm公司担任了23年的产品营销团队负责人,专门从事系统IP产品(包括网络互连、内存和中断控制器以及系统MMU)。在Arteris,他监督Magillem片上系统部署工具以及FlexNoC和Ncore片上网络产品。*