Forbes分析Google TPU在AI推理中的性能是否证实自研芯片可替代NVIDIA GPU
自Google张量处理单元(TPU)推出近一年后,Google发布了其自主开发AI芯片的详细性能和功耗指标。该芯片的开发旨在解决一个根本性挑战:Google预见到其计算需求将发生戏剧性转变,转向支持计算密集型的机器学习工作负载。继续使用Intel CPU在经济上不可行,且无法满足Google对数百万并发用户和查询快速响应时间的需求。Google一直使用NVIDIA GPU来训练底层神经网络,这些网络允许机器识别数据中的模式,并使用x86 CPU来执行这些神经网络的查询(称为推理)。该公司决定开发一款能够以更低成本、更高性能且功耗远低的芯片来处理推理。
Google发布了广泛的架构细节和性能数据,将TPU与当时其设施中使用的Intel和NVIDIA芯片进行了对比——已推出3代的Intel Haswell和2009年架构的NVIDIA Kepler(远在任何人将GPU用于机器学习之前)。NVIDIA首席执行官黄仁勋基于NVIDIA最新一代PASCAL芯片提供了更新的对比数据,结果大相径庭。虽然NVIDIA最初的性能差距看起来只有TPU的1/13,但比较当代芯片显示NVIDIA具有2倍的优势,尽管功耗是其3倍。TPU的运行速度达到90万亿次操作/秒,几乎是GPU的两倍,功耗仅为其1/3。P40具有强大的浮点运算能力,适合训练和更大的内存带宽,而TPU的设计目标是极其擅长一件事:并行乘法张量(整数矩阵),这些矩阵用于表示机器学习中AI所用的深度神经网络。
最重要的是证明了任何AI领域的严肃工作都需要认真的加速——无论是通过GPU、FPGA、ASIC还是多核CPU——如果AI要实现成本可承受和响应及时,所有这些都必须至少比传统Intel至强服务器CPU快2个数量级。Google对定制硅的投资表明,机器学习处理是一项足够大且至关重要的工作负载,足以证明对其数据中心进行机器学习优化的合理性。
Google机器学习服务的用户直接受益于更多服务迁移到TPU上运行。Google已将选定服务的价格降低了最多6倍,并直接将节省归功于TPU。Google通过拥有更具竞争力的内部使用平台和云机器学习服务平台获胜,同时在其庞大数据中心的资本支出和功耗上实现节省。
TPU并不代表对Intel和NVIDIA等硅芯片制造商的直接或迫在眉睫的风险。目前大多数推理工作由数据中心中的Intel至强CPU和边缘端的ARM CPU完成,部署规模远低于Google的规模。Google仍在使用NVIDIA GPU来训练其神经网络,因此TPU尚未从NVIDIA的业务中分走显著份额。此外,TPU仅可供Google的内部数据科学家和Google AI云服务用户使用。Google Cloud在亚马逊网络服务和Microsoft Azure中排名靠后(两者都在其云服务中为机器学习应用提供NVIDIA GPU)。全球最大的数据中心——亚马逊、阿里巴巴、百度、Facebook、Microsoft和腾讯——将继续购买GPU和FPGA用于其加速工作负载。