ApexData가 텔레메트리를 사용하여 GPU 학습 실행의 장애를 식별하는 AI 진단 플랫폼 RidgeScope를 발표했습니다.
ApexData Inc.는 2026년 7월 20일 GPU 학습 실행의 텔레메트리를 분석하여 어떤 부분이 왜 실패했는지, 그리고 이에 대해 어떻게 대응해야 하는지를 판단하는 AI 기반 진단 플랫폼인 RidgeScope의 일반 출시를 발표했습니다. 이번 발표는 하이퍼스케일러들이 올해 AI 인프라에 약 4,500억 달러를 지출하고 있는 시점에 이루어졌습니다.
업계는 자체적으로 'MFU 격차'라고 부르는 문제를 직면해 있습니다. 이는 구매된 컴퓨팅 성능과 실제 사용된 컴퓨팅 성능 사이의 부족분을 의미합니다. 모델 FLOPs 활용률(MFU)은 GPU의 이론적 컴퓨팅 성능 중 실제로 모델을 발전시키는 비율을 나타내며, 일반적으로 30~40% 사이에서 형성되지만, 플릿 연구에서는 평균이 20% 근처로 측정됩니다. GPU 컴퓨팅에 지출되는 모든 달러의 절반 이상은 느린 칩, 데이터 파이프라인의 기아 상태, 통신 대기, 하드웨어 결함, 학습 없이 깔끔하게 종료되는 실행 등으로 인해 손실됩니다.
GPU 시간당 약 $3.26의 비용으로, 128개 GPU H100 클러스터의 온디맨드 일일 비용은 약 $10,000이며 연간 비용은 약 $365만 달러에 달합니다. MFU가 20%일 경우, 동일한 하드웨어가 40% MFU를 달성할 때 제공하는 학습 작업량의 절반만 수행하게 됩니다. 잘 튜닝된 실행은 40% MFU에 도달합니다. 이 연간 비용 중 약 $180만 달러는 더 나은 엔지니어링으로 회복할 수 없는 부분에 쓰이고 있습니다. MFU를 20%에서 40%로 높이면 추가적인 GPU를 구매하지 않고도 동일한 하드웨어의 생산성 출력을 두 배로 늘릴 수 있습니다.
"업계는 GPU를 완전히 생산적인 자산인 것처럼 자금 조달하고 있지만, 대부분의 클러스터는 스펙 시트가 약속한 것의 절반 미만을 제공합니다."라고 ApexData의 공동 창립자이자 CEO인 Evgeny Potapov은 말했습니다. "이는 네오클라우드(neocloud)만의 문제가 아닙니다. 모델을 학습하는 모든 조직에 적용되는 문제입니다. 볼 수 없는 격차는 좁힐 수 없으며, 오늘날 거의 아무도 이를 보지 못하고 있습니다."
각 서버의 경량 에이전트는 각 학습 실행마다 12,000개 이상의 신호를 수집합니다: GPU 동작, 인터커넥트 트래픽, 작업 로그 및 스케줄러 기록입니다. AI 엔진은 이러한 증거를 20개 이상의 알려진 고장 패턴과 비교하여 각각의 패턴을 포함하거나 제외합니다. 모든 사례는 결론(판정)으로 마무리됩니다: 데이터가 무엇을 보여주며, 그것이 시사하는 바는 무엇인지, 그리고 무엇을 결정할 수 없는지에 대한 결론으로, 각 주장은 해당 측정에 근거합니다.
"GPU 낭비는 조용히 발생합니다."라고 ApexData의 공동 창립자이자 CTO인 Andrey Shamakhov은 말했습니다. "느린 칩 하나가 127개의 정상적인 칩을 저하시키고, 작업이 진행 상황을 자주 저장하여 결국 아무것도 저장하지 못하며, 다른 작업은 비싼 하드웨어 위에서 아무것도 계산하지 않은 채 앉아 있고, 모든 대시보드는 녹색 상태를 유지합니다. 우리는 고장을 특정하고, 증거를 제시하며, 그 비용을 명시합니다. 또한 데이터가 어떤 질문에 답할 수 없을 때는 추측 대신 판정이 그렇게 밝힙니다."
GPU 클라우드 운영자에게 RidgeScope은 모든 지원 티켓 뒤의 질문, 즉 문제가 고객 코드에서 비롯된 것인지 클러스터 하드웨어에서 비롯된 것인지에 대한 의문을 해결해 줍니다.
RidgeScope은 Hugging Face Transformers, Megatron-LM, PyTorch Lightning 및 Keras/TensorFlow를 인식합니다. 대부분의 팀에게 학습 데이터는 회사에서 가장 가치 있는 지적 재산입니다. RidgeScope은 시스템 텔레메트리와 스케줄러 메타데이터만 읽으며, 데이터셋, 소스 코드 또는 모델 가중치는 절대 읽지 않습니다. 또한 로컬 LLM 모델, 테넌트별 격리, SSO/SAML, GDPR 및 PCI DSS 등급 암호화를 갖추고 있어 온프레미스 또는 에어갭 환경에서 고객의 네트워크 내부에서만 완전히 실행될 수 있습니다.
오늘날 일반적으로 출시된 RidgeScope은 Slurm 및 Kubernetes에서 몇 분 만에 설치되며, 30분 이내에 첫 번째 판정을 반환합니다. 공개된 고장 카탈로그와 증거 인덱스는 모든 고장 모드와 판정이 인용할 수 있는 모든 신호를 나열합니다. 데모는 https://ridgescope.ai에서 실시간으로 제공됩니다.