Argonne's Leadership Computing Facility has expanded Aurora supercomputer's DAOS distributed storage system to 800 servers, architecting data pipelines for thousands of compute nodes across AI and scientific workloads.
세계에서 가장 빠른 저장소 시스템 중 하나인 DAOS는 수천 개의 Aurora 노드에 걸쳐 높은 성능을 제공하며, 대규모 시뮬레이션에서 인공지능 모델 훈련까지 다양한 데이터 집약적 작업을 지원합니다.
세계에서 가장 강력한 슈퍼컴퓨터 중 하나에서 시뮬레이션과 인공지능 작업을 실행하려면 이에 맞춰질 수 있는 저장소가 필요합니다. ALCF의 Aurora 엑사스케일 시스템에서 Distributed Asynchronous Object Store(DAOS)는 대규모 과학 애플리케이션으로 생성되는 방대한 양의 데이터를 이동하고 관리하는 데 필요한 고성능 저장소를 제공합니다. ALCF의 Intel-HPE 엑사스케일 슈퍼컴퓨터는 DAOS를 계산 구조에 완전히 통합하여 데이터 집약적 과학 애플리케이션을 위한 입출력 및 체크포인팅을 지원합니다.
ALCF는 최근 DAOS의 대규모 확장을 완료했으며, 초기에 128개의 저장소 서버에서 중간 단계에 370개로 확장했고, 이제 최종 구성에서는 800개로 확장했습니다. 광범위한 테스트를 통해 DAOS가 안정적이며 매우 우수한 성능을 제공하며 수천 개의 Aurora 계산 노드에 걸쳐 효과적으로 확장할 수 있음이 입증되었습니다.
DAOS는 세계에서 가장 빠른 저장소 시스템 중 하나로 자리잡았습니다. Aurora는 2023년에 제출된 벤치마크 결과를 기반으로 ISC26 IO500 Production 목록에서 1위를 차지했으며, 개별 테스트에서 초당 20테라바이트를 초과하는 대역폭을 입증한 이전 DAOS 구성을 사용했습니다. ALCF 팀은 최근 800개의 서버를 모두 사용하여 확장된 시스템을 벤치마킹했으며, 2,048개, 4,096개, 8,192개의 Aurora 계산 노드를 사용하여 초당 최대 30테라바이트의 데이터 전송 속도를 달성했습니다. 테스트 결과 성능이 효과적으로 확장되며 극단적인 클라이언트 수 하에서 붕괴되지 않음을 보여줍니다.
"DAOS를 확장하고 사용자가 필요한 성능과 안정성을 제공할 수 있도록 많은 작업을 해왔습니다"라고 ALCF-4 기술 이사 Kevin Harms는 말했습니다. "최신 결과는 DAOS가 애플리케이션이 수천 개의 Aurora 노드에 걸쳐 확장됨에 따라 높은 성능을 유지할 수 있으며, 연구자들에게 데이터 집약적 과학을 지원할 수 있는 강력한 자원을 제공함을 보여줍니다."
DAOS는 인공지능 작업에서도 강력한 성능을 입증했습니다. 2025 MLPerf Storage 벤치마크에서 Aurora의 DAOS 시스템의 128개 서버 부분집합은 초당 거의 1테라바이트의 쓰기 처리량과 초당 600기가바이트의 읽기 처리량에 도달했으며, Meta의 Llama 3 405B 모델의 시뮬레이션된 체크포인트를 10초 이내에 가능하게 했습니다. 이 결과는 DAOS가 대규모 인공지능 훈련의 집약적인 입출력 요구 사항을 지원할 수 있는 능력을 강조합니다.
DAOS는 고도로 병렬 처리된 컴퓨팅 환경을 위해 특별히 설계된 오픈소스 객체 저장소입니다. Aurora에서는 슈퍼컴퓨터의 고속 네트워크에 직접 연결되어, 애플리케이션이 기계의 더 큰 부분으로 확장함에 따라 매우 높은 속도로 저장소에 접근할 수 있게 해줍니다. 분산형 아키텍처는 데이터와 메타데이터를 저장소 서버에 걸쳐 전파하여 중앙 집중식 메타데이터 서버에 의존하지 않으면서도 높은 대역폭과 낮은 지연 시간을 제공합니다. 또한 POSIX 및 MPI-I/O를 포함한 과학 애플리케이션이 사용하는 친숙한 인터페이스를 지원합니다.
연구자들은 이미 프로덕션 환경에서 이러한 기능들을 입증하고 있습니다. Argonne이 주도한 팀은 최근 Hardware/Hybrid Accelerated Cosmology Code(HACC)를 사용하여 지금까지 수행된 가장 큰 우주론적 시뮬레이션 2개를 완료했습니다. 각 실행은 8,100개의 Aurora 노드에 걸쳐 13조 개 이상의 입자를 진화시켰습니다. 두 시뮬레이션은 DAOS를 통해 85페타바이트 이상의 데이터를 작성했으며, 대부분은 연구자들이 처음부터 시작하지 않고 중단 시 계산을 재개할 수 있게 해주는 재시작 체크포인트였습니다. 약 8페타바이트는 과학 분석을 위해 보존되었습니다.
"그 규모에서 입출력은 그 자체로 주요 계산 과제이며, DAOS는 이러한 대규모 시뮬레이션을 수행하는 데 필요한 성능을 제공했습니다"라고 Aurora의 시뮬레이션 캠페인을 주도한 HACC 팀의 멤버이자 Argonne의 전산 과학자인 Nicholas Frontiere는 말했습니다.
이전 HACC 테스트는 이미 더 작은 저장소 구성에서 초당 5테라바이트를 초과하는 DAOS 쓰기 속도를 입증했습니다. 최근 캠페인은 그 기능이 Aurora의 규모에서 프로덕션 과학으로 어떻게 변환되는지를 보여줍니다.
확장된 용량, 입증된 성능, 그리고 시뮬레이션 및 인공지능 작업에 걸친 증가하는 기록을 통해, DAOS는 Aurora 사용자들에게 집약적인 저장소 요구 사항이 있는 애플리케이션에 대한 고성능 옵션을 제공합니다.