2026年9月15日星期二
AI 基础设施 · 新闻与分析
首页芯片与硬件报道
芯片与硬件 · 报道

英伟达推出NVLink Switch以支持更高密度的GPU互连,用于AI计算系统规模扩展。

支持更大规模高效GPU集群;多节点AI训练大规模部署的关键技术。
行业媒体Slicast · 2024年10月31日 UTC 12:00 · 全球 · 来源: forbes.com
重要度 80

据中心是人工智能时代的核心,但要满足性能的指数级增长,需要采用整体设计方案来克服功耗和散热限制。创新涵盖计算架构、内存、电源、电力分配和冷却解决方案。然而,网络将对性能和延迟产生最重大的影响,同时可能改变计算工作负载处理的性质。今年推出的最重要的创新之一是英伟达为GB200 NVL72超大规模机柜计算机系统开发的NVLink交换机。

NVLink交换机是一种交叉矩阵网络交换机架构,允许所有端口通过NVLink直接相互通信,NVLink是一种高速高效的计算互连。最初的NVLink交换机在DGX-2平台中支持50吉字节每秒(GB/s)的双向无阻塞通信链路。英伟达持续增强NVLink和NVLink交换机技术。对于当前Blackwell代GPU和GB200 NVL72系统,第五代NVLink提供100GB/s的链路速率。一个具有18个端口的Blackwell GPU相当于每个GPU 1.8太字节每秒(TB/s)的带宽。GB200 NVL72系统机柜拥有18个NVLink交换机,连接36个英伟达Grace CPU和72个Blackwell GPU,总系统无阻塞通信带宽达130 TB/s。利用NVLink交换机跨节点连接的能力允许扩展至576个GPU。

这些增强措施结合广泛的系统设计,实现了最高密度的服务器配置之一,从而获得更高的整体性能和效率。虽然由于更高的功耗和复杂的基础设施需求(特别是液冷),现有数据中心无法替换所有机柜,但现有数据中心可以在更小的空间内处理更多的AI和高性能计算工作负载。新的AI和高性能计算数据中心可以考虑这种空间效率进行设计,以减小占地面积或为全规模数据中心的独特基础设施需求做出规划。

真正的价值在于满足对AI和高性能计算工作负载持续增长的需求。据英伟达介绍,GB200 NVL72可以支持27万亿参数的模型规模,超过了当前最大生成式AI(GenAI)大语言模型(LLM)的规模,如GPT-4和4o。虽然有推动将这些大模型用作基础模型来开发更小、更优化的模型,但最大的模型将继续增长,用于科学分析等应用以及朝向人工通用智能(AGI)的努力。GB200 NVL72的资源也可以被分配来支持多个工作负载,为AI训练和推理处理提供更高的效率。NVLink交换机代表了一项至关重要的创新,它能够扩展AI工作负载并提高数据中心的效率,使AI更具成本效益。

阅读原文
英伟达推出NVLink Switch以支持更高密度的GPU互连,用于AI计算系统规模扩展。 · Slicast