埃隆·马斯克的xAI将Colossus超级集群扩大至20万块英伟达Hopper GPU,计划达到30万块。
亿万富翁埃隆·马斯克在X平台宣布,他的xAI数据中心即将在"不久后"将其算力翻倍。这是继TechTuber ServeTheHome最近发布的一段视频之后,该视频展示了xAI Colossus人工智能超级计算机,其配备了闪亮的Supermicro服务器行列,装有100,000个最先进的英伟达企业GPU。根据马斯克的说法,Colossus计划"很快在单一建筑内成为拥有200k个H100/H200的训练集群"。这个100,000个GPU的版本仅在大约两周前开始进行人工智能训练,不过考虑到马斯克之前的技术承诺跳票历史——包括特斯拉完全自动驾驶、超级高铁延迟和太阳城项目困难——我们应该对他的前瞻性声明保持谨慎。
xAI Colossus被誉为工程奇迹,赞誉甚至超出了马斯克的常规圈子。英伟达首席执行官黄仁勋将这个超级计算机项目描述为一项"超人类的"壮举,是"前所未有的"。xAI工程师通过在19天内建立起这个超级计算机取得了非凡成就,而这种规模和复杂性的项目通常需要四年才能完成。
这200,000个耗电的H100/H200 GPU很可能被用于训练人工智能模型和聊天机器人,例如Grok 3。这种扩展远非xAI Colossus硬件的终极目标,因为马斯克之前曾吹嘘计划拥有300,000个英伟达H200 GPU的Colossus。按照目前的速度,马斯克可能会在2024年年底前发推文宣布达到300,000的目标。
实现这些宏大目标的道路面临着多个技术障碍。Colossus 1的低效混合架构设计被证明不适合训练Grok,因此Anthropic将其用于推理任务。同时,SpaceX获得了对其220,000个英伟达GPU和300兆瓦人工智能计算能力的访问权限以与Anthropic竞争,并正在推出一家1,100万平方英尺的Gigasat工厂,作为基于空间的数据中心的新制造设施。潜在的延迟可能源于GPU供应约束和基础设施挑战,包括即使第一阶段也需要进行的现场发电升级,以及复杂的液体冷却和网络硬件需求。