阿贡国家实验室高性能计算设施已将 Aurora 超级计算机的 DAOS 分布式存储系统扩展至 800 台服务器,为数千个计算节点的 AI 和科学工作负载搭建数据管道。
在全球最快的存储系统中,DAOS跨数千个Aurora节点提供高性能,支持从大规模模拟到AI模型训练等数据密集型工作负载。
在全球最强大的超级计算机之一上运行模拟和AI工作负载,需要能够跟上步伐的存储系统。在ALCF的Aurora百亿亿次系统上,分布式异步对象存储(DAOS)提供了移动和管理大规模科学应用产生的海量数据所需的高性能存储。ALCF的Intel-HPE百亿亿次超级计算机将DAOS与其计算结构完全集成,支持数据密集型科学应用的I/O和检查点功能。
ALCF最近完成了对DAOS的重大扩展,将其从最初的128个存储服务器扩展到中间阶段的370个,现在达到最终配置的800个。广泛的测试表明,DAOS具有稳定性、高性能,并能够有效扩展到数千个Aurora计算节点。
DAOS已经确立了自己在全球最快存储系统中的地位。Aurora在ISC26 IO500生产名单上排名第1,基于2023年提交的基准测试结果,该结果使用了早期DAOS配置,单次测试的带宽超过20TB/秒。ALCF团队最近使用全部800个服务器对扩展后的系统进行了基准测试,使用2048、4096和8192个Aurora计算节点,实现了高达30TB/秒的数据传输速率。测试表明性能扩展有效,在极端客户端数量下不会出现崩溃。
"我们投入了大量工作来扩展DAOS,并确保它能够提供用户所需的性能和可靠性,"ALCF-4技术总监Kevin Harms表示。"最新的结果表明,当应用程序跨数千个Aurora节点进行扩展时,DAOS能够维持高性能,为研究人员提供了支持数据密集型科学研究的强大资源。"
DAOS在AI工作负载方面也展示了强劲性能。在2025年MLPerf存储基准测试中,Aurora DAOS系统的128服务器子集实现了接近1TB/秒的写吞吐量和600GB/秒的读吞吐量,使Meta的Llama 3 405B模型的模拟检查点在10秒内完成。这些结果突出了DAOS支持大规模AI训练密集型I/O需求的能力。
DAOS是一个开源对象存储,专门为高度并行计算环境设计。在Aurora上,它直接连接到超级计算机的高速网络,允许应用程序在扩展到机器更大部分时以非常高的速率访问存储。其分布式架构将数据和元数据分散在存储服务器之间,提供高带宽和低延迟,而无需依赖集中式元数据服务器。它还支持科学应用程序使用的熟悉界面,包括POSIX和MPI-I/O。
研究人员已经在实际应用中展示了这些能力。由阿贡国家实验室领导的团队最近使用硬件/混合加速宇宙学代码(HACC)完成了有史以来规模最大的两项宇宙学模拟。每次运行在8100个Aurora节点上演化了超过13万亿个粒子。这两项模拟通过DAOS写入了超过85PB的数据,主要是重启检查点,使研究人员能够在中断时恢复计算,而无需重新开始。约8PB的数据被保留用于科学分析。
"在那样的规模下,I/O本身就是一个重大的计算挑战,DAOS为我们提供了执行这些大规模模拟所需的性能,"阿贡国家实验室计算科学家、HACC团队成员、Aurora模拟活动的领导者Nicholas Frontiere表示。
早期的HACC测试已经在较小的存储配置上展示了DAOS超过5TB/秒的写入速度。最近的活动演示了这种能力如何在Aurora的规模上转化为生产科学应用。
凭借其扩展的容量、已证明的性能以及在模拟和AI工作负载中日益增长的良好记录,DAOS为Aurora用户提供了一个高性能选项,用于满足存储需求密集的应用程序。