布尔击败HPE获得下一代Lumi AI超级计算机合同。
欧洲在生成式人工智能基础设施方面的方法仍明显比美国更为传统。虽然欧洲各国的超级计算中心已开发出能够同时进行传统高性能计算(HPC)模拟和建模的系统,但对生成式AI和传统机器学习模型进行微调的工作主要集中在这些国家实验室内部,而非私营AI模型开发者之间。这种差异的主要原因是领先的AI模型构建公司总部设在美国和中国。尽管如此,随着国家实验室在欧洲牵头推进HPC和生成式AI倡议,由政府资助的科学研究正在由经验丰富的研究人员推动,他们同时为开发AI模型并利用HPC工具进行产品设计的欧洲企业分配计算资源。
与商业数据中心不同,欧洲的国家实验室不由私募股权、GPU加速器制造商或主要云提供商资助。因此,它们的预算显著更紧,计算资源也较少——通常少两到三个数量级。尽管存在这些限制,这些设施正以前所未有的规模获取更大的计算能力,使它们能够追求具有明确机构使命且对科学和社会有益的项目。
这一背景构成了下一代Lumi-AI超级计算机的开发框架,该系统是行业合作伙伴所称的“Lumi AI工厂”的关键组成部分——这一术语最初由英伟达(NVIDIA)普及。该系统由EuroHPC联合企业资助,将部署在芬兰卡亚尼的科学计算中心(CSC)设施中。“Lumi”在芬兰语中意为“地上的雪”,尽管该系统的吉祥物是一只白狼; alternatively,它本可以命名为“susi”,即芬兰语中的狼。
2020年10月揭幕的原版Lumi混合超级计算机集群结合了仅CPU节点、CPU-GPU节点、高内存CPU节点、对象存储、Lustre并行文件系统和闪存节点。其设计旨在提供约552 petaflops的FP64精度聚合计算能力。以CPU为主的Lumi-C分区包含基于AMD EPYC处理器的超过20万个核心,预计可提供约2 petaflops的FP64性能;而以GPU为中心的Lumi-G分区围绕AMD Instinct处理器构建,预计可提供约550 petaflops的双精度浮点吞吐量。更广泛的集群架构包括30 petabytes的Ceph对象存储、80 petabytes的Lustre存储和7 petabytes的闪存存储。所有节点和分区均通过“Rosetta”200 Gb/s Slingshot-10网络连接,惠普企业(Hewlett Packard Enterprise)担任主要系统承包商。
EuroHPC为初始部署分配了2.37亿美元预算,相当于每petaflop约431美元。Lumi-C分区于2021年夏季交付,随后Lumi-G GPU分区于2021年底交付。两者均在2022年6月全面投入运营。即使在初始部署四年后,Lumi-G分区仍保持在6月Top500榜单的第11位,显示出持续的竞争相关性。
Lumi-C分区由1,536个节点组成,每个节点配备双路64核AMD EPYC 7763 “Milan”处理器,运行频率为2.45 GHz,总计精确为196,860个核心。在6月Top500榜单中排名第262位,其峰值理论性能为7.29 petaflops,持续LINPACK性能为6.3 petaflops。这在1.22兆瓦的功耗范围内代表了82.6%的计算效率,能效为每瓦特5.18 gigaflops。Lumi-C分区内的节点通信由200 Gb/s Slingshot-11互连技术促进。
Lumi-G分区由2,978个节点组成,每个节点配备单路64核AMD EPYC 7A53 “Trento”定制处理器,搭配四个AMD Instinct MI250X “Aldebaran” GPU加速器。Trento芯片最初是为橡树岭国家实验室的Frontier超级计算机设计的,在商业化之前提供了AMD CPU和GPU之间的统一内存一致性。总共,该分区拥有2,978个Trento CPU(190,592个核心)和11,912个Aldebaran GPU(262万个计算单元和1.677亿个流处理器)。通过200 Gb/s Slingshot-11网络连接,Lumi-G分区实现了531.5 petaflops的FP64峰值性能和379.7 petaflops的LINPACK评级,反映了71.4%的计算效率。在7.1兆瓦的功耗范围内,它在LINPACK上提供每瓦特53.43 gigaflops——比纯CPU分区的能效高出十倍以上。
即将到来的Lumi-AI分区是对Lumi-G架构的直接升级。鉴于AMD GPU组合的持久价值以及全球GPU产能的限制,现有的Lumi-G分区预计将与新系统一起保持运行。Lumi-AI升级预计将在AI工作负载上提供十倍的性能,并在FP64 HPC任务上提供“大约两倍”的性能。
超越MI250X的AI性能将是直截了当的。Aldebaran架构支持INT4、INT8和FP16数据格式,但在所有三种格式中提供相同的吞吐量,这意味着INT4和INT8是在FP16之上模拟的,而不是原生处理的——在当时是一个合理的妥协。较新的基于Altair的MI430X GPU专为HPC和AI工作负载设计(不同于针对AI推理和训练优化的更高端MI455X),引入了原生的FP4和FP8处理。这种架构转变随着精度的降低产生乘法性能增益:预计十倍AI性能增加中的四倍直接源于原生FP4执行。剩余的2.5倍改进反映了Altair架构相对于Aldebaran平台的原始FP16性能优势。
因此,尽管单个加速器消耗更多电力并产生更大的热输出,Lumi-AI分区将需要显著减少节点数量。计算目标节点数需要检查底层硬件规格。MI250X在向量单元上提供47.9 teraflops,在矩阵单元上提供95.7 teraflops。MI430X在FP64工作负载上达到288 teraflops的峰值,AMD指定此性能同样适用于向量和矩阵操作。分析Lumi-G分区的报告指标表明,CSC芬兰使用向量FP64吞吐量计算峰值性能:47.9 teraflops × 每个节点4个GPU × 2,978个节点等于570.6 petaflops。与公布的531.5 petaflops LINPACK Rpeak的差异仍未得到解释。
为了实现Lumi-AI的FP64向量性能翻倍,仅需3,962个MI430X GPU,相当于991个节点——节点数量减少了66.7%。这种配置以1.14 exaflops的峰值性能超越了exascale阈值,这是一个具有重大心理和营销价值的里程碑。然而,每个节点的功耗将大约翻倍:Venice-Altair 1×4板卡耗电5千瓦,而Trento-Aldebaran 1×4板卡耗电2.5千瓦。在991个节点的情况下,Lumi-AI分区将消耗约5兆瓦,相对于Lumi-G分区的总功耗减少了33%。有趣的是,将此节点数扩展以计算AI性能仅产生八倍的增加。为了在4位精度下实现所述的十倍AI性能提升,需要配备四个MI430X GPU的1,240个节点。这种差异表明CSC芬兰最终可能获得比最初沟通的多出约25%的FP64向量性能。
基于这些计算,最可能的配置由1,240个节点组成,容纳4,960个MI430X GPU。这代表与GPU分区相比节点数量减少了58.4%,估计系统功耗为6.2兆瓦。主要承包商Bull和CSC芬兰明确表示,Lumi-AI分区将提供10倍的AI性能,HPC性能将“大约两倍”。这些预测中固有的不精确性仍然令人困惑,尤其是对于传统上优先考虑精确性的机构而言。
利用256核AMD EPYC 9006 “Venice”处理器,Lumi-AI分区将拥有317,440个CPU核心。这一大幅增加提供了充足的计算资源来协调GPU加速器,并且与现有的Lumi-G分区相比,核心密度增长了66.7%。
Lumi-AI分区的预计预算为3.878亿欧元——相当于4.451亿美元——峰值FP64性能为1.43 exaflops,系统在峰值时的成本约为每petaflop 312美元。与2021年部署的原始Lumi集群每petaflop 431美元的峰值成本相比,这代表了每petaflop成本降低了27.6%。目前尚不清楚现有的纯CPU分区及相关存储集群是否会与新部署整合或逐步淘汰。