数据中心 · 报道
Elon Musk的xAI部署Colossus超级计算机,配备10万颗H100 NVIDIA GPU,仅用三个月时间建成并上线,计划升级至H200。
展示了数据中心建设速度和规模的显著加快;确立了xAI作为主要AI基础设施竞争者的地位。
行业媒体Slicast · 2024年9月4日 UTC 12:00 · 全球 · 来源: wccftech.com
重要度 85埃隆·马斯克旗下的xAI公司在劳动节将其Colossus超级计算机投入运行,从开始到完成仅耗时122天。据马斯克称,Colossus是"世界上最强大的AI训练系统",配备100,000个NVIDIA H100数据中心GPU,使其成为使用如此大量H100的最大训练集群。
马斯克宣布,通过增加50,000个H200 GPU,Colossus将在几个月内规模翻倍至200,000个GPU。H200是采用Hopper架构的旗舰数据中心GPU。H200的性能明显强于H100,在特定生成式AI和HPC应用中的计算性能提高近45%。
xAI Colossus项目于6月在孟菲斯启动,训练于7月开始。该超级计算机旨在为GROK 3的12月交付做准备,替代GROK 2。这个新的超级集群出现在xAI结束与Oracle的服务器租赁协议之后,Colossus现在提供的性能超过Oracle所能提供的,并将通过增加50,000个H200 GPU在几个月内性能翻倍。
H200相比H100提供了近61GB更高的内存,内存带宽显著更高,达到4.8TB/s,而H100为3.35TB/s。但H200消耗300W更多的功率,并且需要液体冷却,类似于Colossus中已部署的H100。目前,Colossus是唯一达到100,000个NVIDIA GPU的超级计算机,其次是Google AI的90,000个GPU,OpenAI的80,000个H100 GPU,Meta AI的70,000个GPU,以及Microsoft AI的60,000个GPU。