Supermicro添加英伟达Vera Rubin NVL4服务器蓝图用于收敛HPC和AI。
超微公司推出了基于NVIDIA Vera Rubin NVL4平台的新型数据中心构建块解决方案(DCBBS)HPC蓝图。该公告将公司的DCBBS架构战略从企业AI部署扩展到科学计算环境,为部署大规模HPC和AI基础设施提供了参考框架。
这个新蓝图遵循今年早些时候发布的NVIDIA Vera Rubin NVL72和NVIDIA HGX Rubin NVL8 DCBBS设计,并将相同的集成方法应用于研究机构、国家实验室和超级计算中心。超微的DCBBS框架将计算、网络、液体冷却、配电和设施基础设施整合成预先设计的部署模型,降低了实施复杂性并加快了集群部署。
超微总裁兼首席执行官Charles Liang表示,AI正在成为现代科学研究的基本组成部分。他指出:"能够迅速部署先进基础设施的组织将能够推动未来发现",并强调了该公司构建大规模液冷GPU集群的经验是新蓝图背后的关键因素。
该蓝图应对了传统HPC模拟和AI加速计算日益融合的趋势。研究机构越来越多地将双精度模拟工作负载与机器学习和AI模型相结合,以缩短开发周期并加快气候建模、药物发现、材料科学和能源研究的科学发现。超微将NVIDIA Vera Rubin NVL4平台定位为这些混合工作负载的基础,将大规模GPU加速与CPU资源和高性能网络相结合,并利用构建包含超过100,000个GPU的液冷超级计算集群的部署经验。
DCBBS蓝图概述了超微对大规模液冷基础设施项目的部署流程。项目首先进行现场设施评估,评估装货码头通道、数据大厅尺寸、地板承载能力以及现有的电源和冷却基础设施。系统集成在超微制造工厂中进行,在发货前完成,包括机架组装、布线以及系统级(L10)和集群级(L11)验证测试。交付后,部署服务包括机架安装、网络集成、电源和冷却连接、调试和运行验证。超微还提供持续支持服务,包括针对关键任务研究和生产环境的现场响应选项。
该蓝图围绕可重复的NVIDIA Vera Rubin NVL4可扩展单元进行组织,可以复制以创建从约3.2MW部署到接近吉瓦级的设施的集群。每个可扩展单元由八个液冷计算机架组成,使用定制的52U机箱,支持288个NVIDIA Vera Rubin NVL4节点,包含最多1,152个NVIDIA Rubin GPU和576个NVIDIA Vera CPU,单个机架在362kW功率包络内运行。
冷却通过超微的DLC-2直接液体冷却架构提供。每个可扩展单元包括三个行内冷却分配单元,每个单元在2+1冗余配置中额定功率高达1.8MW。冷却设计包含直接接触芯片的冷板、垂直冷却液分配歧管和超微的PG25-A冷却液配方。网络基于NVIDIA Quantum-X800 InfiniBand基础设施,为分布式HPC和AI工作负载提供所需的低延迟、高带宽互连,也可提供液冷网络配置。电源分配由每个计算机架的八个72kW电源架处理,而双顶部机架管理交换机提供带外监控和控制。
超微还为寻求近期部署选项的组织提供基于NVIDIA GB200 NVL4的配置。该公告反映了行业继续向集成机架级基础设施设计转变,这些设计将计算、网络、电源、冷却和管理整合为预先验证的部署模型。随着AI和HPC工作负载的融合,供应商越来越多地关注降低部署复杂性,同时支持更高的机架密度和液冷环境。