2026年9月30日星期三
AI 基础设施 · 新闻与分析
首页 › 数据中心 › 报道
数据中心 · 报道

英伟达开发节省空间和电源的深度学习系统降低AI集群物理占用。

支持在资源受限环境中部署AI基础设施,扩展超越无电源约束超大规模设施的市场。
行业媒体Slicast · 2018年3月27日 UTC 12:00 · 全球 · 来源: datacenterknowledge.com
重要度 70

在周二的年度硅谷大会上,Nvidia推出了据称是全球首款单服务器系统,具备足以提供两个petaflops性能的计算能力,这种性能级别通常需要由数百台服务器组成的集群才能实现。DGX-2系统主要面向深度学习应用,根据这家芯片制造商的说法,其性能比前一代产品DGX-1(仅在9月发布)的Volta GPU版本强大10倍。Nvidia通过在DGX-2中配置两倍数量的GPU、将每个GPU的内存升级为原来的两倍、采用全新的GPU互连技术以及改进Nvidia深度学习软件,实现了这一性能水平。总部位于加州圣克拉拉的Nvidia是GPU的领先制造商,GPU不仅能加速计算机图形处理,还用于训练神经网络的机器内部——这种计算系统能够通过分析大量数据实现自我学习,是推动AI繁荣发展的动力。

DGX-2是首款采用Nvidia新型GPU互连技术NVSwitch的系统,该技术也在圣何塞的GTC峰会上发布。NVSwitch通过将机箱内的16个GPU彼此互联,改进了之前存在的GPU架构NVLink。根据Nvidia的说法,它提供的带宽是市面上最顶级PCIe交换机的5倍。Nvidia创始人兼首席执行官黄仁勋在其GTC主旨演讲中表示:"每一个GPU都能以PCI Express带宽的20倍速度与其他每一个GPU进行通信。"该交换机的传输速率为每秒300GB。在峰会上,该公司还宣布其顶级数据中心GPU Tesla V100现在配备了两倍的内存——32GB——为这款机箱中的新型超级计算机提供支持。

Nvidia将DGX-2的定价定为399,000美元,并将其定位为数据中心的重大成本和空间节省方案。据Nvidia深度学习系统副总裁兼总经理Jim McHugh介绍,单台DGX-2的性能相当于"300台英特尔Skylake服务器"。McHugh指出,300台Skylake服务器代表"基本上是15个机架的服务器,这将大幅节省"数据中心的空间和电力消耗。黄仁勋指出,等效的Skylake集群成本将"轻松达到300万美元"。

GPU销售为Nvidia带来了可观的收入,在公司2018财年,GPU为其带来了81.4亿美元的收入。其中,19.3亿美元来自销往数据中心的GPU,用于深度学习和更传统的高性能计算工作负载——同比增长133%。亚马逊网络服务、微软Azure和谷歌云平台等云巨头是Nvidia数据中心GPU收入的主要来源,所有顶级云服务提供商都在部署其GPU来驱动自己的AI应用并以服务形式提供GPU计算能力。

阅读原文
英伟达开发节省空间和电源的深度学习系统降低AI集群物理占用。 · Slicast