谷歌推出商用Cloud TPU服务上市,将定制AI加速器引入云计算市场。
Google最近宣布,Google Cloud TPU(首次在前一年5月宣布)现在在Google Cloud Platform(GCP)上以有限数量的beta版本提供,用于运行基于TensorFlow的AI应用。这家搜索巨头声称该设备将大幅减少其数据中心的占地面积和成本支出。然而,该公司的4芯片设备配备64 GB昂贵的高带宽内存(HBM),其单位性能成本比NVIDIA已面世1年的单芯片Tesla V100 GPU加速器高约33%。
Google在NVIDIA 2017年GTC大会后一周推出了其TensorFlow Processing Unit,图形芯片制造商在该大会上展示了其庞大的Volta GPU。为机器学习专门设计的ASIC(应用专用集成电路)的概念有明显的吸引力。从原始性能角度看,芯片对芯片,Cloud TPU芯片本身提供45万亿次操作每秒(TOPS)——是NVIDIA Pascal GPU加速器性能的两倍多。然而,NVIDIA的Volta GPU提供125 TOPS,使其快近3倍(125 vs. 45 TOPS),这在一定程度上归功于其TensorCore功能,可以在单个时钟周期内执行4x4矩阵乘法——前提是模型能够利用这一功能。
价格对比非常鲜明:4芯片的Google Cloud TPU成本是Amazon AWS云上NVIDIA Volta GPU的两倍多,但基于ResNet50神经网络的训练时间,性能提高约67%。最终结果是:Google的产品完成相同工作的成本约高33%。4芯片的Cloud TPU虽然能更快完成训练,但比AWS上的4个GPU实例慢超过2倍。高成本被认为部分是由HBM2内存芯片驱动的,每个TPU芯片的估计成本超过$300——比Volta所需的16GB多$900。
Google还宣布其TPU Pods(相互连接的TPU形成大规模计算集群)将在该年晚些时候准备好。该公司已宣布,一个1000个TPU的Pod(称为TensorFlow Research Cloud)将免费提供给"世界顶级研究人员",以帮助推动基于TensorFlow的AI模型的创新。TPU硅片仅支持TensorFlow(Google的开源机器学习框架),而NVIDIA的GPU支持几乎所有机器学习软件包。Google的TPU硬件仅作为服务从Google提供。
自初始公告以来的九个月后,TPU才成为"有限数量"的beta服务推出。真正令人失望的是定价策略:为什么有人会支付更高的费用来完成相同的工作?即使考虑到HBM2内存差异,Google正在以制造成本获得ASIC,因此更高的定价不能完全由组件成本单独解释。由于先进芯片设计困难重重——即使你是Google——希望一旦Google解决了限制产量的各种问题,这些价格能够下降。