Amazon Web Services宣布在代理AI需求激增中加强CPU使用限制执行,工程师面临减少EC2浪费的压力。
Amazon Web Services正在打击其工程师内部使用EC2实例的情况。据《The Information》报道,该公司在5月份召集工程师,要求他们减少CPU浪费,以确保AWS有足够的CPU容量满足客户需求。该指令反映了数据中心经济学的前所未有的转变:传统的GPU与CPU比例从8:1或4:1正在向平价靠拢。
曾经只需几小时的事情现在要花费数天。工程师们报告称,获得EC2实例的访问权限现在需要等待数天,而之前可以在几小时内配置。一名工程师告诉《The Information》,即使在亚马逊工作多年,他也从未经历过如此长的等待时间。
EC2实例支撑着现代互联网的大部分应用,并用于云端和私有部署。传统上,AWS工程师利用Web基础设施相对较低的CPU利用率为开发环境快速启动多个虚拟机。内部的资源紧张局面反映出前所未有的外部需求。
亚马逊在EC2中部署了多种CPU架构,包括AMD、Intel和其较新的Graviton5芯片——该公司迄今为止最强大的CPU,采用基于Arm的架构,类似于Nvidia的Vera CPU和Arm自身的AGI。
CPU短缺是由生成式智能体AI工作负载的爆炸性增长驱动的。与传统的GPU加速推理不同,智能体AI涉及在CPU上运行的复杂协调和工具调用。这颠覆了之前CPU主要用于为GPU供应的模型。需求如此之大,以至于Intel、AMD等厂商报告称客户将接受任何可用的容量。
问题的规模从最近的事件中可见一斑。亚马逊的一个编码智能体上个月消耗了180万美元的token成本,超出其开发预算860%。AMD通过推出其面向数据中心的Zen 6"Venice"CPU做出了回应——这是AMD数十年来首次在客户市场之前为数据中心推出新架构。Nvidia也类似地将其信息传递从加速器转向其新的Vera CPU,以抢占智能体AI基础设施市场机遇。
短缺似乎集中在现货实例上。一名顾问告诉《The Information》,合约容量未曾经历有意义的短缺,这表明亚马逊的内部紧张源于需求峰值而非绝对供应约束。
发布后,AWS发言人声称:"对AWS服务(包括EC2)的需求异常强劲且不断增长。即使面临如此巨大的需求,我们仍继续满足内部和外部客户的绝大多数计算需求。我们与内部团队紧密合作,以满足他们的计算需求,同时确保他们尽可能有效地使用EC2资源,例如回收空闲实例、调整规模和根据需求变化进行扩缩容——就像我们一直以来做的那样。这些效率措施帮助我们为内部和外部客户管理容量,任何暗示这些长期存在的措施反映新的容量约束的建议都是完全错误的。这个前提被夸大了。节俭是我们从第一天起DNA的一部分。我们一直鼓励团队高效运作。我们还与外部客户分享关于如何优化资源的最佳实践。这不是新指令,鼓励资源的有效使用也不是亚马逊独有的。"