2026年9月22日星期二
AI 基础设施 · 新闻与分析
首页算力与云报道
算力与云 · 报道

Meta宣布运营包含24000余块英伟达H100 GPU的两个新内部AI数据中心。

量化超大规模云自建基础设施规模;验证大规模H100需求和数据流需求。
行业媒体Slicast · 2024年3月14日 UTC 12:00 · 全球 · 来源: tweaktown.com
重要度 80

Meta宣布了其人工智能基础设施的雄心勃勃的扩展计划,计划到2024年底部署350,000个NVIDIA H100 GPU。作为该公司描述的"生成式AI基础设施"路线图的一部分,Meta推出了两个"24,576 GPU数据中心规模集群",旨在支持当前和下一代AI模型、研究和开发。这笔巨大投资反映了Meta在竞争激烈的AI市场中处于领导地位的决心,与Microsoft、Google和Amazon的类似努力相当。

这两个集群中的每一个都包含超过24,000个NVIDIA Tensor Core H100 GPU,配备400Gbps互联能力。这些集群采用不同的网络方案:一个使用Meta自己的基于Arista 7800的网络架构解决方案,采用Wedge400和Minipack2 OCP机架交换机,另一个部署NVIDIA更先进的Quantum2架构。这代表了从Meta 2022年的AI研究超级集群(RSC)的重大升级,后者拥有16,000个NVIDIA A100 GPU。

Meta在一份声明中强调了其新基础设施的性能优势,解释道:"这些集群内高性能网络架构的效率、一些关键的存储决策,结合每个集群中的24,576个NVIDIA Tensor Core H100 GPU,使两个集群版本都能够支持比RSC支持的更大、更复杂的模型,并为生成式AI产品开发和AI研究的进展铺平道路。"

该公司将其硬件投资视为其竞争战略的基础,声称:"在AI开发中处于领导地位意味着在硬件基础设施投资中处于领导地位。"Meta阐述了以人工通用智能为中心的更广泛的愿景,宣称"Meta的长期愿景是构建开放的、负责任构建的人工通用智能(AGI),使其能够广泛供所有人受益。"

展望未来,Meta表示致力于基础设施的持续演进。该公司表示:"我们不断评估和改进基础设施的各个方面,从物理层和虚拟层到软件层及以后。我们的目标是创建灵活可靠的系统,以支持快速演进的新模型和研究。"

阅读原文
Meta宣布运营包含24000余块英伟达H100 GPU的两个新内部AI数据中心。 · Slicast