ApexData发布RidgeScope平台诊断GPU训练失败
ApexData公司于2026年7月20日宣布了RidgeScope的正式发布,这是一个由AI驱动的诊断平台,可以读取GPU训练运行的遥测数据,并确定失败了什么、原因是什么以及应该如何处理。该公告发布之际,超大规模云服务商今年在AI基础设施上的支出约为4500亿美元。
业界面临所谓的MFU差距——即购买的计算量与实际使用的计算量之间的差额。模型浮点运算利用率(Model FLOPs utilization),即GPU理论计算中实际推进模型的部分,通常在30%至40%之间,尽管舰队研究测得的平均值更接近20%。GPU计算支出中超过一半的资金被浪费在芯片速度缓慢、数据管道饥饿、通信阻滞、硬件故障以及完成而未学到任何东西的运行上。
按每GPU小时约3.26美元计算,一个128-GPU H100集群按需成本约为每天1万美元,即每年约365万美元。在20%的MFU下,其完成的训练工作只有同样硬件在40% MFU(良好调优的运行可以达到)下工作量的一半。该年度账单中的约180万美元所购买的东西完全可以通过更好的工程实践恢复。将MFU从20%提高到40%可以使相同硬件的生产性输出增加一倍,而无需购买任何额外的GPU。
ApexData联合创始人兼首席执行官Evgeny Potapov表示:"业界融资购买GPU时仿佛它们是完全高效的资产,但大多数集群的性能远低于规格说明书承诺的一半。这不仅是新兴云服务商的问题。它适用于每个训练模型的组织。你无法弥补你看不到的差距,而今天几乎没有人能看到它。"
每台服务器上的一个轻量级代理在每次训练运行中收集超过12,000个信号:GPU行为、互连流量、作业日志和调度器记录。一个AI引擎针对20多种已知的故障模式对证据进行权衡,逐一排除或确认。每个案例都以判定结束:数据显示的内容、其含义以及数据无法决定的内容,每个声明都与其背后的测量相关联。
ApexData联合创始人兼首席技术官Andrey Shamakhov表示:"GPU浪费是无声的。一个慢芯片会拖累127个健康芯片,一个作业保存进度太频繁以至于无法继续,另一个在昂贵硬件上计算什么都不做,而每个仪表板都保持绿色。我们命名故障,展示证据并说出其代价。当数据无法回答某些问题时,判定会说出来,而不是猜测。"
对于GPU云服务提供商,RidgeScope解决了每张支持票后面的问题:问题是源于客户代码还是集群硬件。
RidgeScope支持Hugging Face Transformers、Megatron-LM、PyTorch Lightning和Keras/TensorFlow。对于大多数团队来说,训练数据是公司最有价值的知识产权。RidgeScope仅读取系统遥测和调度器元数据——从不读取数据集、源代码或模型权重——并可以完全在客户自己的网络内运行:本地部署或气隙网络,使用本地LLM模型、按租户隔离、SSO/SAML和GDPR及PCI DSS级别的加密。
RidgeScope现已正式发布,可在Slurm和Kubernetes上在数分钟内安装,并在30分钟内返回初步判定。公开的失败目录和证据索引列出了每种故障模式和判定可能引用的每个信号。演示在https://ridgescope.ai进行现场运行。