2026年9月15日星期二
AI 基础设施 · 新闻与分析
首页芯片与硬件报道
芯片与硬件 · 报道

Meta的16,384块H100处理器Llama 3训练集群因H100 GPU和HBM3内存缺陷经历约50%故障率,平均每三小时一次故障。

暴露英伟达H100生产质量的严重可靠性问题,对大规模训练基础设施硬件耐久性提出质疑。
行业媒体Slicast · 2024年7月27日 UTC 12:00 · 全球 · 来源: tomshardware.com
重要度 75

Meta最近发布了一项研究,详细介绍了其Llama 3 405B模型在包含16,384块Nvidia H100 80GB GPU的集群上进行的54天训练过程。该集群在此期间遭遇了419次意外组件故障,平均每三小时发生一次故障。正如古老的超级计算机谚语所说,大规模系统唯一的确定性就是故障。超级计算机是极其复杂的设备,使用数万个处理器、数十万个其他芯片和数百英里的电缆。在先进的超级计算机中,每隔几小时就会出现故障是正常的,开发者的主要技巧是确保系统无论发生何种局部故障都能保持运作。尽管面临这些挑战,Llama 3团队保持了超过90%的有效训练时间。

在54天的预训练期间,共发生了466次工作中断,其中47次是计划中的,419次是意外的。计划中的中断是由自动化维护引起的,而意外中断主要源于硬件问题。GPU问题是最大的类别,占意外中断的58.7%。在419次意外中断中,其中148次(占30.1%)是由包括NVLink故障在内的各种GPU故障引起的,而72次(占17.2%)是由HBM3内存故障引起的。考虑到Nvidia的H100 GPU消耗约700W的功率并承受大量热应力,这并不令人惊讶。有趣的是,54天内只有两个CPU故障。剩余的41.3%的意外中断是由众多因素引起的,包括软件漏洞、网络电缆和网络适配器。

为了提高效率,Meta的团队减少了工作启动和检查点时间,并开发了专有诊断工具。PyTorch的NCCL飞行记录器被广泛使用,用以快速诊断和解决挂起和性能问题,特别是与NCCLX相关的问题。该工具捕获集合元数据和堆栈跟踪,有助于快速解决问题。NCCLX在故障检测和定位中发挥了至关重要的作用,特别是对于NVLink和RoCE相关的问题。与PyTorch的集成允许监控和自动超时由NVLink故障引起的通信停顿。专门工具也被用来识别落后的GPU,这些GPU可能会减慢数千个其他GPU的速度,使得能够有效检测和及时解决落后者。

环境因素带来了额外的挑战,因为白天温度波动通过导致吞吐量1-2%的变化来影响训练性能。GPU的动态电压和频率缩放受到这些温度变化的影响。团队遭遇的另一个挑战是数万个GPU同时的功耗变化,这给数据中心的电网带来了压力。这些波动有时达到数十兆瓦,超过了电网的限制,这意味着Meta必须确保其数据中心有足够的电力。

考虑到一个16,384 GPU集群在54天内经历了419次故障(每24小时7.76次,或每三小时一次故障),这对更大集群的影响是显著的。xAI的包含100,000块H100 GPU的集群代表了可能出现故障的组件数量增加了六倍,这预示着这类系统的故障率会显著更高。

阅读原文
Meta的16,384块H100处理器Llama 3训练集群因H100… · Slicast