AMD收购AI推理优化初创公司Taalas,以构建其推理硅和软件堆栈。
AMD已达成最终协议,将收购Taalas,这是一家位于多伦多的AI芯片公司,代表了最激进的推理专用化方法之一。与其构建可编程加速器并将模型加载到其上不同,Taalas是围绕模型本身构建硬件。AMD于8月6日宣布了该协议,财务条款未披露。该交易仍需满足常规交割条件并获得监管批准。
AMD计划将Taalas技术整合到其加速器路线图中,并开发将其与AMD Instinct GPU相结合的系统级解决方案。关键的是,AMD并未将Taalas作为Instinct的替代品,而是作为一个日益广泛的AI平台内的另一种计算引擎,该平台涵盖Instinct加速器、Epyc CPU、ROCm软件、网络和Helios机架级架构。
"Taalas的技术和世界一流的工程团队通过提供差异化的推理性能和效率来加强我们的AI组合,"AMD人工智能集团高级副总裁Vamsi Boppana表示。Taalas首席执行官兼联合创始人Ljubisa Bajic表示,加入AMD为公司提供了"规模、工程资源和全球覆盖"来加快其工作。
Taalas成立于2023年,由具有深厚AI芯片经验的团队创立,包括Tenstorrent、AMD和Nvidia的校友。在AMD交易前,该公司已筹集了约2.19亿美元,其中包括今年早些时候宣布的1.69亿美元融资。
从本质上讲,Taalas将训练好的大型语言模型直接固定在硅中,并消除了使通用处理器成为通用处理器所需的大部分机制。这种用效率换取灵活性的权衡定义了公司的方法。
其首个技术演示器HC1运行Meta的Llama 3.1-8B模型。这款6纳米设备,面积为815平方毫米,拥有53亿个晶体管,每个用户每秒可交付约17,000个token。Taalas声称相比软件可编程替代方案,在性能、成本和功耗方面具有大约一个数量级的优势,尽管这些比较来自该公司,应该相应对待。
现代加速器在内存和计算单元之间反复移动模型参数。Taalas则寻求通过在设备中直接表示模型的大部分来合并存储和计算。这可以消除HBM、先进封装、高速内存接口和大量数据移动——代价是使产生的硅对工作负载范围更窄。这一远离HBM的举动似乎是当今高成本内存环境中更广泛趋势的一部分;Semidynamics正尝试使用其Gazzillion Misses内存处理技术做类似的事情。
Taalas辩称,一个新模型可以在大约两个月内转化为定制硅。第一代实现使用激进的3比特和6比特量化,公司承认这引入了相比GPU实现的一些质量下降。第二代平台转向标准化的4比特浮点格式,旨在支持相当大的模型。
这次收购代表了与简单地增加另一个GPU设计团队完全不同的东西。AMD购买的是一种方法,它挑战了加速器市场的一个基本假设:处理器的价值部分在于其执行任何到来的模型的能力。
简单的解释是AMD买了一个非常快的推理加速器——可能是错的。Taalas之所以有趣,恰恰是因为其架构在GPU所擅长的事情上表现差劲:改变策略。HC1将一个模型固定到硅中,移除HBM、大量权重移动和可编程性所需的相当多的控制机制。结果是一个与其构建的模型相关联的芯片,如果作为与Instinct或Nvidia GPU直接竞争的通用加速器来评判,这似乎是不利的。作为AMD的一部分,它看起来相当有吸引力得多。
单独来看,Taalas必须选择正确的模型、完成硅的构建、找到足够的客户来证明其合理性,并希望当芯片到达时模型仍然相关。AMD处于更好的位置。它可以为需要灵活性的工作负载保留Instinct,而在模型或其一部分足够稳定且有价值以值得专用化时使用Taalas风格的硅。
中国产业评论家姚锦鑫提出了一个有趣的可能性,即将Taalas风格的硬件用于混合专家模型的固定权重部分。一个MoE模型包含大量专家权重集合,对于任何单个token只激活其中的一个子集。一旦训练,这些权重保持基本静态。可编程加速器可以处理注意力、KV缓存管理、协调和动态元素,而模型特定引擎处理权重固定且重复访问的专家计算。这将使Taalas不是Instinct的竞争者,而是有用的伙伴。
具体的分割可能会有所不同,但原则是健全的。AMD已经熟悉异构系统,具有CPU、GPU、自适应计算、网络和越来越完整的AI平台。没有固有的理由为什么AI工作负载的每个部分应该在同一处理器类型上运行,仅仅因为这是系统传统上的构建方式。
AMD还带来了Taalas永远无法独立轻易创建的东西:获得非常大客户的途径。一个超大规模云服务提供商可能会犹豫购买只运行一个模型的芯片,但可能会舒适地购买AMD系统,其中大多数工作负载保留在可编程硬件上,而特别重要和稳定的部分获得优化硅。此时,"这个芯片只运行一个模型"听起来不太像一个缺陷,更像一个设计选择。
更引人注目的点是,Taalas对AMD而言作为一个工艺流程可能比作为成品更有价值。HC1证明了这个概念,但真正的奖品可能是将训练好的模型转化为硅的能力,耗时大约两个月。如果AMD能够使这个过程可重复,并将其与自己的设计、封装、软件、制造关系和客户获取相结合,它就获得了比单个不寻常加速器更有用的东西。
在训练期间,通用性是非常有价值的。模型变化太快,实验太重要了。在非常大的推理量下,计算会改变。如果相同的权重被读取数十亿或数万亿次,为保持灵活性所需的硬件开销变得越来越昂贵。
代理工作负载进一步推进了这个论点。面向人类的聊天在一定程度上受限于人们消费答案的速度。机器对机器的代理工作负载则不然,任务速度变成了金钱。
这为Taalas、Groq和Cerebras等架构提供了在不完全替代GPU的情况下攻击推理问题部分的空间。Taalas仍然必须证明声称的性能转化为生产工作负载。其第一个设备使用激进的量化,实际部署涉及很少能整齐地符合标题token每秒数字的约束。据推测,AMD仔细检查了这项技术,足以让自己确信值得购买什么,使Taalas的信誉远远超过它作为一个小型独立公司所拥有的信誉。
基本的经济问题仍然存在:一个模型必须保持稳定多久才能使将其转化为硅变得值得?Taalas表示它可以在大约两个月内从模型转到硅。如果AMD能够使这个过程工业化,答案可能是"远没有我们假设的那么长"。