Intel和AMD发布ACE CPU扩展,为x86增加AI优化指令集,矩阵运算效率提升
在我们网站上通过链接购买时,我们可能会获得联盟佣金。工作原理如下。
(图片来源:Getty Images)
在x86 CPU上运行AI模型变得越来越容易和快速
你听到的关于"运行AI模型"的大多数讨论都涉及某种GPU,但并非所有AI任务都适合在该硬件上进行。较小的模型或单用户延迟敏感的操作可以从在CPU上运行中受益,因为这避免了将数据来回传输到GPU的开销。还有许多情况根本没有GPU可用,或者只能用性能有限的集成芯片。Intel和AMD最近发布了完整的ACE CPU扩展规范,使在x86处理器上运行这些AI任务变得更容易、更节能。
ACE通过提供一项技术标准来实现这一点,该标准利用现有的AVX10寄存器,但增加了专用于矩阵乘法的硅片。这带来了多项优势,但主要优点是更好的功率效率、更简便的开发和优化,以及利用AVX的512位输入。后者通过无需特定于ACE的输入,使与现有设计的集成变得容易。
矩阵乘法是AI工作负载的基石:取一个数字表,并在整个表上运行乘加循环。这在大多数CPU上一直都是可能的,尽管速度有限。即使在今天,运行这些循环也消耗大量电力,即使利用x86的AVX10乘加指令时也是如此——从技术上讲这是一个变通方案,因为AVX在设计时并未考虑2D矩阵乘法运算。
对于相同数量的输入向量,与AVX10相比,ACE可以执行16倍多的操作。注意这并不一定意味着速度提升16倍,因为这取决于具体的实现,但合理预期Intel和AMD会在未来的设计中为这项任务分配更多硅片以提高性能。此外,由于每条ACE指令执行的工作量比其等效的AVX10循环更多,所以CPU指令开销更少,RAM带宽使用也可能更高效。
好处远不止于为同样的任务使用更少的指令。ACE旨在与实现无关,这意味着ML框架及其底层库(PyTorch、TensorFlow)只需编写一条代码路径,而不是根据底层硬件及其AVX支持程度维护多个变体。
数据中心CPU需求激增,AI代理是责任方 报告称Arm芯片将在2029年为90%的AI服务器供电,基于定制处理器 AI工作负载的CPU要求不断增加,导致供应短缺和价格上涨
ACE原生支持ML操作中使用的几乎所有数据类型(包括但不限于INT8、INT32、FP8、FP16、FP32、BF16),但它也可以原生使用开放计算项目的MX块缩放格式,这是AVX10所不提供的。开发者还能够在需要快速完成某些工作时,将一些NPU特定的工作负载移回CPU。在这些情况下,不必处理每个NPU都不同这一事实也是一个巨大优势,因为ACE在x86硬件中提供了一致的目标。
在Google新闻上关注Tom's Hardware,或将我们添加为首选来源,以在您的订阅源中获取我们最新的新闻、分析和评测。
获取Tom's Hardware的最新新闻和深度评测,直接送入您的收件箱。
Bruno Ferreira 社交链接导航 撰稿人
Bruno Ferreira是Tom's Hardware的撰稿人。他拥有数十年的PC硬件及相关领域的经验,同时从事开发工作。他痴迷于细节,喜欢就他喜爱的话题滔滔不绝。在不这样做的时候,他通常在玩游戏或参加现场音乐演出和音乐节。