Tuesday, September 15, 2026
AI 인프라 · 뉴스 & 분석
반도체·하드웨어리포트
반도체·하드웨어 · 리포트

Meta의 16,384-H100 Llama 3 훈련 클러스터가 결함 있는 H100 GPU 및 HBM3 메모리로 인해 약 50%의 장애율을 경험했으며, 평균 3시간마다 한 건의 장애가 발생했습니다.

Nvidia의 H100 생산 품질의 심각한 신뢰성 격차를 드러내며, 대규모 훈련 인프라에 대한 하드웨어 내구성의 심각한 우려를 제기합니다.
업계 전문지Slicast · 2024년 7월 27일 12:00 UTC · 글로벌 · 출처: tomshardware.com
중요도 75

Meta는 최근 16,384대의 Nvidia H100 80GB GPU로 구성된 클러스터에서 54일 동안 Llama 3 405B 모델의 훈련을 수행한 연구 결과를 공개했다. 해당 기간 동안 클러스터는 419건의 예기치 않은 구성 요소 고장을 겪었으며, 이는 평균적으로 3시간마다 한 번씩 발생한 것이다. 오래된 슈퍼컴퓨팅 격언이 있듯이, 대규모 시스템에서 유일한 확실성은 고장 발생이다. 슈퍼컴퓨터는 수만 개의 프로세서와 수십만 개의 기타 칩, 그리고 수백 마일의 케이블을 사용하는 극도로 복잡한 장치다. 정교한 슈퍼컴퓨터에서는 몇 시간마다 무언가 고장 나는 것이 정상이며, 개발자들의 주요 과제는 이러한 국소적 고장이 발생하더라도 시스템이 계속 작동하도록 보장하는 것이다. Llama 3 팀은 이러한 도전 과제에도 불구하고 90% 이상의 유효 훈련 시간을 유지했다.

54일간의 사전 훈련 스냅샷 동안 총 466건의 작업 중단이 발생했으며, 이 중 47건은 계획된 중단, 419건은 예상치 못한 중단이었다. 계획된 중단은 자동화된 유지보수로 인해 발생했고, 예상치 못한 중단은 주로 하드웨어 문제로 인한 것이었다. GPU 문제는 예상치 못한 중단 중 가장 큰 비중(58.7%)을 차지했다. 419건의 예상치 못한 중단 중 148건(30.1%)은 NVLink 실패를 포함한 다양한 GPU 고장으로 인해 발생했고, 72건(17.2%)은 HBM3 메모리 고장으로 인해 발생했다. Nvidia의 H100 GPU가 약 700W의 전력을 소모하며 많은 열 스트레스를 받는다는 점을 고려하면 이는 그리 놀라운 일이 아니다. 흥미롭게도 54일 동안 CPU는 단 두 대만 고장났다. 나머지 41.3%의 예상치 못한 중단은 소프트웨어 버그, 네트워크 케이블, 네트워크 어댑터 등 다양한 요인으로 인해 발생했다.

효율성을 높이기 위해 Meta의 팀은 작업 시작 및 체크포인트 시간을 단축하고 자체 진단 도구를 개발했다. PyTorch의 NCCL 비행 기록기는 특히 NCCLX 관련 문제와 관련하여 멈춤 현상과 성능 문제를 신속하게 진단하고 해결하기 위해 광범위하게 사용되었다. 이 도구는 집단 메타데이터와 스택 트레이스를 캡처하여 빠른 문제 해결을 돕는다. NCCLX는 NVLink 및 RoCE 관련 문제를 포함하여 장애 감지 및 위치 파악에 중요한 역할을 했다. PyTorch와의 통합을 통해 NVLink 실패로 인한 통신 지연을 모니터링하고 자동으로 타임아웃 처리할 수 있었다. 또한 수천 개의 다른 GPU 속도를 늦출 수 있는 느린 GPU(straggling GPUs)를 식별하기 위한 전용 도구도 사용되었으며, 이를 통해 느린 GPU를 효과적으로 감지하고 시기적절하게 해결할 수 있었다.

환경 요인도 추가적인 도전 과제를 제시했는데, 정오 무렵의 온도 변동으로 인해 처리량에 1~2%의 변동을 초래하며 훈련 성능에 영향을 미쳤다. GPU의 동적 전압 및 주파수 스케일링(DVFS)은 이러한 온도 변화의 영향을 받았다. 팀이 경험한 또 다른 도전 과제는 수만 개의 GPU가 동시에 전력 소비량을 변경하는 것으로, 이는 데이터 센터의 전력 그리드에 부하를 준다. 때로는 수십 MW에 달하는 이러한 변동은 그리드의 한계를 시험했으며, 이는 Meta가 데이터 센터에 충분한 전력이 확보되어 있음을 보장해야 함을 의미한다.

16,384개 GPU 클러스터가 54일 동안 419건의 고장(24시간 기준 7.76회, 즉 3시간마다 한 번)을 겪었다는 사실을 고려할 때, 더 대규모 클러스터에 대한 시사점은 매우 크다. 100,000개의 H100 GPU를 보유한 xAI의 클러스터는 고장 날 수 있는 구성 요소의 수가 6배 증가함을 나타내며, 이러한 시스템에서 훨씬 더 높은 고장률을 시사한다.

원문 보기
Meta의 16,384-H100 Llama 3 훈련 클러스터가 결함 있는 H100… · Slicast