Nvidia发布Turing架构GPU,用于数据中心AI推理应用。
机器学习的演进已将重点从神经网络训练转向推理——即在新数据上使用已训练模型来创建有用应用的过程。Nvidia虽然在训练基础设施中处于主导地位,但自至少2015年11月以来一直在开发推理解决方案,当时它发布了基于Maxwell GPU的Tesla M4和M40加速器。Tesla M4提供2.2 TFLOPS的单精度性能,配备1,024个CUDA核心和8GB GDDR5内存,内存带宽为每秒88GB,功耗在50瓦至75瓦之间。虽然这相比CPU推理有显著改进,但数据中心主要仍将推理工作负载运行在现有的Xeon服务器上。
两年前,Nvidia推出Tesla P4和P40加速器,标志着对推理领域更认真的进军。在同一时期还引入了后来被称为Buck定律的概念,由Nvidia Tesla数据中心业务部门副总裁兼总经理Ian Buck提出。Buck定律认为"世界上创建的每一比特数据在其生命周期内都需要十亿次浮点运算"——这一观察反映了超大规模计算企业和各类企业所需的计算规模。Facebook每天通过机器学习推荐引擎处理超过10亿个视频浏览,Google和Bing每天通过语音识别驱动超过10亿次搜索,这些活动共同驱动每天超过1万亿个广告展示,所有这些都需要高效的推理基础设施。
Tesla P4显著推进了GPU推理能力,配备2,560个核心,提供5.5 TFLOPS的单精度性能,使用业界标准INT8八位整数格式时可达22 TOPS。该加速器配备8GB GDDR5内存,内存带宽为每秒192GB——是Tesla M4带宽的两倍多,与其计算能力增加一倍多相匹配。据Buck介绍,虽然他无法披露P4的具体收入,但推理工作负载的分布如下:视频识别占业务的一半,语音处理约占四分之一,搜索占据另一个重要部分,推理收入已成为"业务的重要组成部分"。
Nvidia在日本GPU技术大会上宣布推出Tesla T4加速器,代表了推理加速的下一代变革。这一进步出现在机器学习推理机遇加速的时期,该可寻址市场在未来五年内代表200亿美元的基础设施销售。值得注意的是,在T4推出的两年前,95%的机器学习推理仍运行在标准X86服务器而非专用加速器上,但现在需要高效推理处理的数据量——无论是在边缘设备、网络系统还是数据中心应用中——都需要根本上更高效的方法。