중국의 LineShine 슈퍼컴퓨터가 커스텀 ARM 코어로 엑사스케일(2+ exaflops) 달성, Nvidia/AMD 컴포넌트 제로
중국은 Nvidia나 AMD 가속기 없이 CPU 전용 슈퍼컴퓨팅이 엑사스케일 성능에 도달할 수 있음을 입증했지만, 초기 주장은 검증된 능력을 과장했습니다. 주목할 만한 시스템은 LineShine으로, 중국 국가슈퍼컴퓨팅센터가 배포한 CPU 전용 머신으로 20,480개의 컴퓨팅 노드와 40,960개의 커스텀 Armv9 기반 LX2 프로세서를 갖추고 있습니다. 각 프로세서는 304개의 코어를 포함하고 있어 전체 시스템은 약 245만 개의 CPU 코어를 갖추게 됩니다.
이는 상당한 규모의 머신이지만 미국의 El Capitan 시스템을 명확하게 능가하는 TOP500 인증 슈퍼컴퓨터는 아닙니다. LineShine의 보고된 성능은 1.54 엑사플롭스의 BF16 학습 성능이며, 63억 파라미터 지구 관측 생성형 압축 모델 학습 중 2.16 엑사플롭스의 최고 성능을 기록했습니다. 이에 반해 El Capitan은 TOP500 목록에서 1.809 엑사플롭스의 측정된 Linpack 결과를 달성했습니다. 이들은 서로 다른 벤치마크, 서로 다른 워크로드, 그리고 근본적으로 다른 주장을 나타냅니다.
이 구분은 매우 중요합니다. 중국의 성과는 LineShine이 세계에서 가장 빠른 범용 슈퍼컴퓨터라는 것을 증명하는 데 있지 않고, 중국 센터가 Nvidia GPU나 AMD 가속기에 의존하지 않고 대규모 AI 및 HPC 시스템을 배포할 수 있음을 입증하는 데 있습니다. LX2 프로세서는 Arm Scalable Vector Extension과 Scalable Matrix Extension 유닛을 갖추고 있으며, 각각 32GB의 온패키지 고대역폭 메모리와 최대 256GB의 오프패키지 DDR5 메모리를 결합합니다. 이는 데이터 이동과 행렬 집약적 워크로드를 위해 특별히 설계된 하드웨어이지, 고성능 컴퓨팅을 위해 용도를 변경한 소비자용 CPU가 아닙니다.
또 다른 프로젝트가 이 주제에 대한 보도를 혼란스럽게 만들었습니다. 2026년 4월 선전에서 발표된 별도의 CPU 전용 엑사스케일 시스템인 Lingsheng은 LineShine과 독립적으로 운영됩니다. Lingsheng은 92개의 컴퓨팅 캐비닛, 백만 포트 인터커넥트, 계획 중인 650 페타바이트의 스토리지로 구성되어 있으며, 약 47,000개의 프로세서로 2 엑사플롭스 이상을 목표로 하고 있습니다. 결정적인 구분점은 Lingsheng이 계획 단계에 있으며 El Capitan에 대한 주장을 검증할 수 있는 공개된 Linpack 결과가 없다는 것입니다.
이에 반해 LineShine은 운영 중입니다. TechRadar는 2026년 5월에 이 시스템이 모두 CPU로만 구성되어 있으며 AI 학습 및 고성능 컴퓨팅 워크로드를 위해 설계되었다고 보도했습니다. LX2 프로세서의 정확한 출처는 여전히 불명확합니다. Jon Peddie Research는 이를 Huawei LX2로 식별했으나, 다른 보도는 선전 센터 또는 다른 정부 지원 중국 개발사를 포함한 공동 설계를 제안합니다. 투자자와 창업자들에게 이러한 불투명성은 중요한 의미를 갖습니다. 하드웨어가 국내에 남아 있다고 해서 공급망이 자동으로 투명해지는 것은 아닙니다.
수출 통제 전략은 간단했습니다. 중국의 Nvidia 최신 AI 칩에 대한 접근을 제한하고, 최첨단 모델 학습을 지연시키며, 미국의 계산상 이점을 유지하는 것입니다. LineShine은 이 접근법의 한계를 보여줍니다. 수출 규제는 선호된 경로를 막을 수 있지만, 규제된 당사자가 개발을 완전히 포기하도록 강요할 수 없습니다. 대신 중국은 자신이 통제할 수 있는 구성 요소를 중심으로 시스템을 구축하고 필요한 경우 효율성 트레이드오프를 수용하며, 국가 연구소 및 국내 칩 설계자들을 통합 솔루션 방향으로 추진하고 있습니다.
이것이 CPU 전용 슈퍼컴퓨팅을 Nvidia GPU 클러스터의 즉각적인 대체제로 만들지는 않습니다. 대규모 AI 학습의 경우 GPU는 더 강력한 소프트웨어 생태계를 유지하고 있으며, CUDA는 Nvidia의 결정적인 이점 중 하나입니다. LineShine의 아키텍처는 커널 최적화에서 HBM과 DDR5 전체 메모리 배치에 이르기까지 GPU 시스템이 이미 해결한 문제들을 해결해야 합니다. 다르다고 해서 자동으로 더 우수하다는 의미는 아닙니다.
GPU 가용성에 의존하는 기업들에게 LineShine은 컴퓨팅 부족에 대한 가정에 도전해야 합니다. 중국은 Nvidia 할당 슬롯을 수동적으로 기다리지 않고 있습니다. 국내에서 이용 가능한 구성 요소를 중심으로 시스템을 설계하고, 국가 연구소 및 칩 설계자들을 풀스택 개발 방향으로 지도하며, 수출 규제가 억제하려던 노력들을 가속화하고 있습니다.
더욱 시급한 질문은 이러한 CPU 집약적 시스템이 벤치마크 결과를 넘어 확장되는 AI 능력을 생산할 수 있는가 하는 것입니다. LineShine의 지구 관측 모델은 단순한 상징적 수치가 아닌 실제 워크로드를 나타내지만, GPU 클러스터가 최첨단 언어 모델을 학습하는 것과 광범위한 동등성을 확립하지는 못합니다. 과학 시뮬레이션, 지리공간 분석, 기상 모델링, 생명과학, 및 정부 워크로드가 먼저 이러한 시스템을 채택할 수 있습니다. 민간 AI 부문은 소프트웨어 성숙도와 효율성 지표가 상당히 개선되어야만 뒤따를 것입니다.
중국은 수년 전부터 많은 주요 시스템을 TOP500 순위에 제출하는 것을 중단했으며, 외부 관찰자들에게 단편적인 데이터를 비교하도록 남겼습니다: 컨퍼런스 발표, 벤더 사양, 학술 논문, 번역된 현지 보도. 이는 불만족스럽지만 불가피합니다. 솔직한 평가는 부풀린 주장보다 더 의미 있습니다. LineShine은 중국이 모든 서방 슈퍼컴퓨터를 능가했음을 증명하지 않습니다. 그것은 중국이 더 이상 다음 슈퍼컴퓨터의 궤적을 정의하기 위해 서방 가속기를 기다리지 않음을 증명합니다.