分析表明云计算和基础设施提供商越来越多地构建专有定制芯片和系统,而不是依赖现成供应商。
现代数据中心的运作方式很像一种电器设备,特别是对于超大规模云提供商和最大的公有云建设者而言。自六十年前大型机出现以来,垂直整合和最佳专业组件一直是数据中心设计中的对立力量。随着平台变得紧密集成、创新放缓,公司又开始转向最佳专业组件解决方案,在两种方法之间不断摇摆。要理解垂直整合在公有云中如何演进,论点很直接:第一,AWS旨在重塑其公有云中的高性能计算(HPC)基础设施,这是四大公有云提供商都有的目标;第二,SmartNIC(具有计算引擎以扩展处理能力的网络接口卡)在四大公有云中的三个上启用了HPC;第三,AWS Outposts演示了如何通过"Nitro" SmartNIC正确部署本地公有云,使得SmartNIC新兴企业Pensando相比之下特别值得关注。
最大的公有云不仅仅是部署SmartNIC,而是设计他们自己的片上系统(SoC)架构作为创新和竞争差异化平台。阿里巴巴云的X-Dragon、AWS的Nitro和Azure的Catapult是各自云提供商内部设计的SmartNIC,用于从计算资源中卸载网络软件栈和管理。AWS的Nitro现在已是第三代,基于由Annapurna Labs设计的内部SoC,卸载了虚拟机监控器功能,并默认为通过的所有数据(包括网络和本地存储流量)提供线速加密和解密。Nitro提供引导和运行时硬件信任根,据推测没有使用行业标准的受信平台模块(TPM),客户应用程序在任何时候都无法修改Nitro或服务器非易失性内存。AWS首席技术官Werner Vogels称Nitro为AWS的"创新之根",将其归功于使AWS的Firecracker轻量级虚拟机监控器成为可能,进而使Lambda和Fargate等无服务器产品,以及AWS Outposts成为可能。Vogels这样描述AWS的高层安全性:"Nitro是可信的,因为Nitro是可信的,所以网络是可信的——但服务器永远不是可信的。"AWS报告称在6年内使用Nitro获得了超过20倍的性能改进,以截面集群带宽的总体改进来衡量,网络延迟从12微秒改进到7微秒。
微软Azure的Catapult SmartNIC现在已是第三代,包括v3的"Dragontail Peak"中板和"Longs Peak" PCI Express板,尽管微软尚未发布详细的Catapult规范。Azure在2012年在其WCS云存储中部署了Catapult v1("Mount Granite"),从2015年开始在Bing和Azure的所有新服务器购置中部署了Catapult v2("Pikes Peak"中板和"Story Peak" PCI Express板),并在2017年部署了Catapult v3以加速深度神经网络并将Bing中的网络速度提高到50 Gb/秒。Catapult v3似乎使用了Mellanox ConnectX-3 Pro芯片以及英特尔的Arria 10 FPGA,ConnectX-3 Pro芯片首次出现在2014年的OCP网络中板设计中。微软的BrainWave测试版深度学习服务从Catapult v3分叉而来,以启用深度神经网络的第三方FPGA服务,在2019年12月部署了这一能力作为Azure PBS实例类型投入生产,仍然基于英特尔Arria 10 FPGA。Azure将其FPGA选择定位为定制设计ASIC迁移路径上的一个点,期望当云需求变得足够稳定以实现四到五年的有效使用寿命而无需彻底重编程时迁移到定制设计逻辑。
阿里巴巴云的X-Dragon SmartNIC现在已是第二代(X-Dragon II),在2017年宣布第一代之后。第二代芯片使得阿里巴巴的轻量级内部Dragonfly虚拟机监控器成为可能,在精神上类似于Firecracker,并具有SR-IOV以及实时迁移应用程序的能力。因为X-Dragon II,阿里巴巴云声称其意外服务器故障率已下降了10倍。