Google的TPU v2(张量处理单元第二代)旨在加速AI训练和推理工作负载,性能明显优于v1。
Google在2017年Hot Chips大会上分享了其原始TPU(张量处理器)和Cloud TPU(也称为TPU v2)的详细信息。该公司在对处理器开发速度放缓感到沮丧后,以黑项目方式设计了自己的ASIC。Google认为摩尔定律要么在放缓,要么即将终结,由于丹纳德缩放早在2006年左右就因电流泄漏增加而失效,该公司不再寄望于新处理器获得大幅的时钟频率提升。由于用户基数日益增长,而市场上缺乏价格大幅下降和性能大幅提升的产品,Google进入处理器设计领域以避免数据中心占地面积扩大。
第一代TPU设计用于仅执行推理任务,采用单核架构,配备256x256x8b混合乘法单元(MXU),可提供高达45 TFLOPS的性能。设计过程始于2013年,主题为"快速行动、勇于创新",十四个月后,TPU在部署一年后首次在Google数据中心亮相并公开披露。该TPU采用28nm ASIC工艺,在满负荷运行时功耗为40W,主频为700MHz。工程师通过将TPU设计成可安装在标准3.5英寸服务器HDD插槽中,并通过自定义PCIe 3.0 x16连接器连接到背板,从而保持了与现有基础设施的向后兼容性。该ASIC通过不配备自己的分支处理器来最小化代码,而是依靠主机提供指令。TPU仅支持11条指令,其中仅5条用于执行工作负载,其256x256矩阵乘法单元每个时钟周期可处理数十万次运算。
Google的Cloud TPU代表了重大进展,支持训练和推理工作负载,采用双核架构,每个核心配备一个128x128x32b MXU。每个Cloud TPU板由单个主板上的四个ASIC组成,配有64GB的HBM,提供2,400 GBps的内存带宽,每块板卡可生成高达180 TFLOPS的性能。Google将64个Cloud TPU部署到单个"pod"中,可生成高达11.5 petaFLOPS的计算能力,并配有4 TB的HBM。这些ASIC安装在配有大型散热片的主板上,板边缘有八个网络连接器,普遍认为这是Intel的Omni-Path和IBM的BlueLink。
Google通过其Google Cloud Platform开始向公众提供Cloud TPU服务,每个虚拟机实例配有一个TPU。该公司还向顶级研究人员捐赠了一千台这样的设备。Cloud TPU可以使用TensorFlow进行编程,这有助于加快采用。Google声称这些处理器比第一代型号提供了50%的性能提升,尽管该公司尚未提供效率测量数据。