GPU 가속 슈퍼컴퓨터가 TOP500 최고 성능 컴퓨터 세계 순위를 재편
역사상 처음으로 TOP500 목록에 추가된 플롭의 56%가 CPU 대신 GPU에서 나왔으며, 이러한 변화는 세 개의 새로운 시스템으로 대표됩니다: 93-petaflop Sunway TaihuLight를 제치고 Linpack 점수 122.3 petaflops로 1위가 된 Summit; Linpack 71.6 petaflops로 현재 3위인 Sierra; 그리고 Linpack 19.9 petaflops로 5위인 일본의 AI Bridging Cloud Infrastructure(ABCI)입니다.
Summit은 각각 2개의 Power9 CPU와 6개의 V100 GPU로 장착된 IBM 서버로 구동되며, 27,686개의 GPU가 시스템의 187.7 petaflops 피크 성능의 95%를 제공합니다. Sierra는 dual-socket Power9 노드당 4개의 V100 GPU를 갖춘 유사한 아키텍처를 사용하며, 17,280개의 GPU가 시스템 성능의 대부분을 차지합니다. ABCI는 서버당 2개의 Intel Xeon Gold CPU와 4개의 V100 GPU를 함께 사용하며, 4,352개의 V100이 19.9 Linpack petaflops의 대부분을 제공합니다.
56% 수치는 HPC 시장에서의 GPU 채택을 과소평가할 가능성이 높습니다. NVIDIA의 Accelerated Computing 사업부 부사장인 Ian Buck에 따르면, HPC/AI/데이터 분석 영역에 판매되는 Tesla GPU의 절반 이상이 TOP500에 시스템을 제출하지 않는 고객들에게 구매되는데, 이는 순위에 관심이 없거나 경쟁사에 하드웨어 구매 습관을 광고하고 싶지 않기 때문입니다. 이 세 개의 새로운 시스템은 AI와 HPC 수렴의 중요한 이정표를 나타내며, V100 GPU의 Tensor Cores는 전문화된 16-bit 행렬 연산 기능을 갖춰 전례 없는 딥러닝 잠재력을 제공합니다. Summit 단독으로도 3 exaflops 이상의 피크 딥러닝 성능을 자랑하며, Sierra는 약 2 exaflops, ABCI는 약 0.5 exaflop의 성능을 가집니다—함께 TOP500 목록의 다른 497개 시스템을 합친 것보다 더 많은 딥러닝 기능을 나타냅니다. TOP500 저자이자 University of Tennessee와 Oak Ridge National Lab의 교수인 Jack Dongarra가 관찰한 바와 같이, "올해 TOP500 목록은 HPC와 AI 컴퓨팅을 모두 지원하는 시스템으로의 명확한 변화를 나타냅니다."
Intel, Google, Fujitsu, Wave Computing, Graphcore 같은 회사들이 전문화된 딥러닝 가속기를 개발 중인 반면, NVIDIA의 Tesla GPU 라인에 대한 통합 AI-HPC 설계는 기계 학습이 날씨 예측, 금융 분석, 유전체학, 석유 및 가스 탐사 등 전통적인 HPC 응용 프로그램을 점점 더 가속화함에 따라 그 장점이 입증되고 있습니다. Buck은 전통적인 HPC 모델링과 기계 학습 간의 상호작용이 아직 초기 단계에 있다는 점을 인정하지만, "점점 더 얽혀만 갈 것이라"고 주장하며, 같은 칩에서 64-bit HPC, 기계 학습, 시각화를 지원하는 것의 이점이 단일 목적 가속기의 이점을 훨씬 능가한다고 주장합니다. 554개의 코드가 V100으로 포팅되었으며—상위 15개 HPC 응용 프로그램이 모두 포함되어 있음—V100이 기존 슈퍼컴퓨팅을 위해 7 double-precision teraflops를 제공할 수 있으므로, 혼합 워크로드 시스템이 이제 일상화되고 있습니다. Barcelona Supercomputing Centre의 MareNostrum이 Power9/V100 노드 3개 랙을 추가하는 것부터 Pawsey Supercomputing Centre의 Nimbus가 12개의 V100 GPU를 추가하는 것까지.