Bull이 HPE를 앞서 차세대 Lumi AI 슈퍼컴퓨터 계약을 확보했다.
유럽의 생성형 AI 인프라 접근 방식은 미국의 그것보다 훨씬 전통적인 양상을 보인다. 유럽의 국가 슈퍼컴퓨팅 센터는 전통적인 고성능 컴퓨팅(HPC) 시뮬레이션 및 모델링을 수행할 수 있는 시스템을 구축해 왔으나, 생성형 AI와 전통적인 머신러닝 모델을 파인튜닝하는 노력은 이러한 국가 연구소 내부에 집중되어 있으며, 민간 AI 모델 개발자들 사이에서는 덜 이루어지고 있다. 이러한 격차는 주로 선도적인 AI 모델 빌더들이 미국과 중국에 본사를 두고 있기 때문에 존재한다. 그럼에도 불구하고 국가 연구소들이 유럽 전역에서 HPC와 생성형 AI 이니셔티브를 주도함에 따라, 정부 자금 지원 과학 연구는 유럽 기업들에게 컴퓨팅 자원을 할당하여 AI 모델을 개발하고 제품 설계에 HPC 도구를 활용하는 경험豊富な 연구자들에 의해 추진되고 있다.
상업용 데이터센터와는 달리, 유럽의 국가 연구소는 사적 자본, GPU 가속제조사, 또는 주요 클라우드 제공업체로부터 자금을 지원하지 않는다. 결과적으로 이들은 훨씬 더 제한된 예산과 감소된 컴퓨팅 자원—종종 두세 단계(order of magnitude) 정도 적음—로 운영된다. 이러한 제약에도 불구하고 이러한 시설들은 이전보다 더 많은 컴퓨팅 용량에 접근하고 있어, 명확한 기관적 의무를 가진 과학적이고 사회적으로 유익한 프로젝트를 추구할 수 있게 되었다.
이러한 맥락은 차세대 Lumi-AI 슈퍼컴퓨터의 개발을 둘러싸고 있는데, 이는 업계 파트너들이 “Lumi AI Factory”라고 부르는 것의 핵심 구성 요소이다. 이 용어는 원래 NVIDIA가 대중화했다. EuroHPC Joint Undertaking의 자금 지원을 받는 이 시스템은 핀란드 카야니의 Center for Scientific Computation(CSC) 시설에 배치될 예정이다. “Lumi”라는 이름은 핀란드어로 “땅 위의 눈”을 의미하지만, 시스템의 마스코트는 흰 늑대이다. 혹은 늑대를 뜻하는 핀란드어 “susi”로 명명되었을 수도 있었다.
2020년 10월 공개된 초기 Lumi 하이브리드 슈퍼컴퓨터 클러스터는 CPU 전용, CPU-GPU, 고메모리 CPU, 오브젝트 스토리지, Lustre 병렬 파일 시스템 및 플래시 스토리지 노드를 결합했다. 이 시스템은 FP64 정밀도에서 약 552 petaflops의 집합 컴퓨팅 성능을 제공하는 것을 목표로 했다. AMD EPYC 프로세서 기반의 20만 개 이상의 코어로 구성된 CPU 중심 Lumi-C 파티션은 대략 2 petaflops의 FP64 성능을 제공할 것으로 예상되었으며, AMD Instinct 프로세서를 중심으로 구축된 GPU 중심 Lumi-G 파티션은 약 550 petaflops의 배정밀도 부동소수점 처리량을 제공할 것으로 기대되었다. 광범위한 클러스터 아키텍처에는 30 petabytes의 Ceph 오브젝트 스토리지, 80 petabytes의 Lustre 스토리지 및 7 petabytes의 플래시 스토리지가 포함되었다. 모든 노드와 파티션은 Hewlett Packard Enterprise가 주요 시스템 계약사로 참여한 “Rosetta” 200 Gb/s Slingshot-10 네트워크를 통해 상호 연결되었다.
EuroHPC는 초기 배치를 위해 2억 3,700만 달러의 예산을 할당했으며, 이는 teraflop당 약 431달러에 해당한다. Lumi-C 파티션은 2021년 여름에 인도되었고, 이어 Lumi-G GPU 파티션은 2021년 말에 인도되었다. 둘 다 2022년 6월에 완전히 가동되었다. 초기 배포 이후 4년이 지났음에도 불구하고, Lumi-G 파티션은 6월 Top500 목록에서 11위를 유지하며 지속적인 경쟁력을 입증했다.
Lumi-C 파티션은 각각 2.45 GHz에서 작동하는 듀얼 64코어 AMD EPYC 7763 “Milan” 프로세서를 탑재한 1,536개의 노드로 구성되어 있으며, 총 코어 수는 정확히 196,860개이다. 6월 Top500 목록에서 262위에 등재된 이 파티션은 7.29 petaflops의 이론상 최대 성능과 6.3 petaflops의 지속 LINPACK 성능을 제공한다. 이는 1.22 메가와트의 전력 한도 내에서 82.6%의 컴퓨팅 효율성을 나타내며, 와트당 5.18 gigaflops의 에너지 효율성을 산출한다. Lumi-C 파티션 내 노드 간 통신은 200 Gb/s Slingshot-11 인터커넥트에 의해 지원된다.
Lumi-G 파티션은 각각 단일 64코어 AMD EPYC 7A53 “Trento” 커스텀 프로세서와 네 개의 AMD Instinct MI250X “Aldebaran” GPU 가속기를 특징으로 하는 2,978개의 노드로 구성된다. Trento 칩은 원래 Oak Ridge National Laboratory의 Frontier 슈퍼컴퓨터를 위해 설계되었으며, 상용화 이전에 AMD CPU와 GPU 간의 통합 메모리 일관성을 제공했다. 총괄적으로 이 파티션에는 2,978개의 Trento CPU(190,592 코어)와 11,912개의 Aldebaran GPU(262만 개의 연산 단위 및 1억 6,770만 개의 스트림 프로세서)가 housed되어 있다. 200 Gb/s Slingshot-11 네트워크로 상호 연결된 Lumi-G 파티션은 531.5 petaflops의 FP64 최대 성능과 379.7 petaflops의 LINPACK 등급을 달성하여 71.4%의 컴퓨팅 효율성을 반영한다. 7.1 메가와트의 전력 한도 내에서 운영되며, LINPACK 기준 와트당 53.43 gigaflops를 제공하여 CPU 전용 파티션보다 전력 효율성이 10배 이상 높다.
향후 Lumi-AI 파티션은 Lumi-G 아키텍처에 대한 직접적인 업그레이드를 나타낸다. AMD의 GPU 포트폴리오의 지속적인 가치와 글로벌 GPU 용량 제약으로 인해 기존 Lumi-G 파티션은 새로운 시스템과 함께 운영될 것으로 예상된다. Lumi-AI 업그레이드는 AI 워크로드에서 10배의 성능과 FP64 HPC 작업에서 “약 2배”의 성능을 제공할 것으로 예상된다.
MI250X의 AI 성능을 초과하는 것은 간단할 것이다. Aldebaran 아키텍처는 INT4, INT8 및 FP16 데이터 형식을 지원했지만 세 가지 모두에 대해 동일한 처리량을 제공했으므로, INT4와 INT8은 FP16 위에서 에뮬레이션되는 것이 아니라 원천적으로 처리되었다는 점은 당시에는 합리적인 타협이었다. HPC와 AI 워크로드 모두를 위해 설계된 최신 Altair 기반 MI430X GPU는(AI 추론 및 훈련용으로 최적화된 상위 엔드 MI455X와 구별됨) 네이티브 FP4 및 FP8 처리를 도입한다. 이러한 아키텍처 변화는 정밀도가 낮아질수록 승수적 성능 향상을 가져오는데, 예측된 10배의 AI 성능 증가 중 4배는 직접적으로 네이티브 FP4 실행에서 기인한다. 나머지 2.5배 향상은 Altair 아키텍처가 Aldebaran 플랫폼 대비 갖는 순수 FP16 성능 우위를 반영한다.
결과적으로 개별 가속기가 더 많은 전력을 소비하고 더 큰 열 출력을 발생시킴에도 불구하고, Lumi-AI 파티션은 현저히 적은 수의 노드를 필요로 할 것이다. 목표 노드 수를 계산하려면 기본 하드웨어 사양을 검토해야 한다. MI250X는 벡터 유닛에서 47.9 teraflops, 매트릭스 유닛에서 95.7 teraflops를 제공한다. MI430X는 FP64 워크로드에 대해 288 teraflops의 피크를 달성하며, AMD는 이 성능이 벡터 및 매트릭스 연산 모두에 동일하게 적용된다고 명시했다. Lumi-G 파티션의 보고된 지표를 분석하면 CSC Finland가 벡터 FP64 처리량을 사용하여 최대 성능을 계산했다고 제안한다: 47.9 teraflops × 노드당 4 GPU × 2,978 노드는 570.6 petaflops이다. 발표된 531.5 petaflops LINPACK Rpeak와의 불일치는 설명되지 않은 채 남아있다.
Lumi-AI의 FP64 벡터 성능을 2배 증가시키기 위해서는 단지 3,962개의 MI430X GPU가 필요하며, 이는 991개의 노드에 해당한다. 이는 노드 수를 66.7% 줄이는 것이다. 이 구성은 1.14 exaflops의 최대 성능으로 엑사스케일 임계값을 초과하는데, 이는 심리적 및 마케팅적 가치가 상당한 이정표이다. 그러나 노드당 전력 소비는 약 두 배가 될 것이다. Venice-Altair 1×4 보드는 Trento-Aldebaran 1×4 보드의 2.5킬로와트에 비해 5킬로와트를 소비한다. 991개의 노드에서 Lumi-AI 파티션은 약 5 메가와트를 소비할 것이며, 이는 Lumi-G 파티션 대비 총 전력 소모가 33% 감소함을 의미한다. 흥미롭게도 이 노드 수를 확장하여 AI 성능을 계산하면 8배 증가에 불과하다. 4비트 정밀도에서 stated된 10배의 AI 성능 부스트를 달성하려면 각기 네 개의 MI430X GPU를 갖춘 1,240개의 노드가 필요하다. 이러한 불일치는 CSC Finland가 최종적으로 처음 communicated된 것보다 약 25% 더 많은 FP64 벡터 성능을 확보할 가능성이 있음을 시사한다.
이러한 계산을 바탕으로, 가장 가능성 높은 구성은 4,960개의 MI430X GPU를 수용하는 1,240개의 노드로 구성된다. 이는 GPU 파티션 대비 노드 수를 58.4% 줄이며, 추정 시스템 전력 소모는 6.2 메가와트이다. 주요 계약사 Bull과 CSC Finland는 명시적으로 Lumi-AI 파티션이 10배의 AI 성능과 HPC 성능이 “약 2배”가 될 것이라고 밝혔다. 이러한 예측의 내재된 부정확성은 특히 전통적으로 정확성을 우선시하는 기관들에게는 여전히 의문스럽다.
256코어 AMD EPYC 9006 “Venice” 프로세서를 활용하여, Lumi-AI 파티션은 317,440개의 CPU 코어를 갖추게 된다. 이 상당한 증가는 GPU 가속기를 조정하기 위한 충분한 컴퓨팅 자원을 제공하며, 기존 Lumi-G 파티션 대비 코어 밀도가 66.7% 성장했음을 나타낸다.
Lumi-AI 파티션을 위한 projected 예산이 €387.8백만($445.1백만 상당)이고 FP64 최대 성능이 1.43 exaflops라면, 이 시스템은 최대 성능 기준으로 teraflop당 약 312달러가 될 것이다. 이는 2021년에 배치된 초기 Lumi 클러스터의 teraflop당 $431의 최대 비용 대비 27.6% 비용 절감을 의미한다. 기존 CPU 전용 파티션 및 관련 스토리지 클러스터가 새로운 배치와 함께 통합되거나 단계적으로 폐지될지는 아직 알려지지 않았다.