Meta公开其Catalina AI pod架构,搭载Nvidia Blackwell GB200 NVL72 GPU、Open Rack v3和液冷系统。
Meta分享了其Catalina AI系统的构成要素,该系统基于NVIDIA的GB200 NVL72解决方案,采用Open Rack v3及液冷技术。Meta早期与NVIDIA启动Catalina项目,利用其NVL72 GPU解决方案作为基线,虽然后来改为NVL36x2配置。Meta与NVIDIA合作定制系统以满足其需求,两家公司均将MGX和NVL72参考设计贡献给开源社区,Catalina已在Open Compute网站上公开可用。
Meta的GPU集群需求随时间大幅增长。2022年,Meta主要关注约6,000个GPU的集群,专用于传统排名和推荐模型,运行跨度为128-512个GPU的工作负载。一年后,受GenAI和LLM发展推动,集群规模扩展至16-24K个GPU——增长4倍。去年,Meta运行100,000个GPU,并继续扩容。作为具有Llama等模型的软件推动者,Meta预计未来数年内集群规模将增加10倍。
在Catalina中,Meta将每个系统称为"pod",通过复制扩展规模。每个pod由两个IT机架组成,每个机架均包含一个由72个GPU组成、配置相同的纵向扩展域。每个IT机架含有18个计算托盘,分布于上下两层,每个机架内左右两侧各有9个NV交换机。机架左右两侧的大型液气混合冷却装置(ALC)使Meta能够在美国及全球各地现有数据中心中部署液冷、高功率密度的机架。
Meta的双机架配置增加了单机架内的CPU数量和总内存,从17 TB LPDDR内存增至34 TB,使得GPU与CPU在单个机架内可实现48 TB的总缓存一致性内存。电源转换器(PSU)将480伏或277伏单相电源转换为48伏直流电,通过母线分配至各服务器刀片、NV交换机和网络设备。Meta的高功率OpenRack v3机架版本母线支持高达94 kW的功率(600A),可支持配备设施液冷系统的新型建筑。机架管理控制器(RMC)持续监测机架组件的泄漏情况,并管理液气混合冷却系统和设施级阀门系统。
为将多个pod连接成更大规模集群,Meta使用自研的分解式调度网络结构,支持在单个数据中心建筑或套房内连接多个pod,跨越多个建筑,乃至更大规模地提供大规模集群。该网络结构针对AI优化,提供灵活性和高速率,本质上使所有GPU能够在整个系统中相互通信。