AMD收购AI推理芯片初创Taalas,将AI模型硬连接到硅中,达到17000 token/秒吞吐量。
AMD已收购多伦多AI芯片初创公司Taalas,这是其挑战英伟达AI硬件主导地位的最新举措。该公司开发了一种激进的推理方法,将模型权重直接蚀刻到硅中,创建针对特定模型的集成电路,承诺将性能提升一个数量级或以上。
该交易于周四收市时宣布,与英伟达2020年12月与Groq的200亿美元许可协议相似,两项收购都旨在为代码助手和AI代理等高性能AI服务提供更快、更便宜的推理。虽然AMD未披露财务条款,但该交易代表完整收购而非聘用收购。
与Groq和Cerebras等竞争对手使用的传统GPU或数据流架构不同,Taalas芯片不依赖HBM存储模型权重。相反,权重直接蚀刻到硅中,使每个芯片本质上都是为特定模型定制的。
这项技术已被证实可行。今年2月,Taalas推出首款测试芯片HC1,采用台积电6纳米工艺制造。在运行Meta的Llama 3.1 8B模型时,该芯片实现了每秒16,960个令牌的吞吐量——比英伟达GPU快48倍,比Cerebras加速器快8.5倍。
虽然Llama 3.1已相对陈旧(于2024年中推出),但这款晶圆尺寸芯片主要用于验证该方案的可行性。Taalas对实现细节守口如瓶,但芯片包含两个主要组成部分:一个掩模ROM结构用于蚀刻权重,以及一个SRAM结构用于存储KV缓存和微调适配器。
即将推出的第二代HC2芯片定于今夏发布,将支持高达200亿个参数。虽然对单个芯片来说规模适中,但这种设计通过管道并行化能够高效扩展——50个加速器足以处理万亿参数模型,充分利用AMD现有的机架级计算平台和系统设计专业能力。
这种效率优势意义重大。英伟达最近宣布的LPX系统需要数十个GPU和至少2,000个Groq LPU才能处理等效规模的模型。AMD计划在解耦架构中将基于Instinct的Helios机架与Taalas加速器配合使用,GPU负责计算密集的提示处理,而令牌生成则转移到Taalas芯片。
客户可能会采取"滴答-滴答"式的推进方式:先在Instinct加速器上部署和验证模型,验证完毕后再过渡到Taalas加速器。AMD AI事业部高级副总裁Vamsi Boppana表示:"AMD正在构建一个完整的AI平台堆栈,让客户能够灵活地为每个AI工作负载选择合适的计算解决方案。"
但这项技术存在重大权衡。芯片一旦部署就被锁定到特定模型。任何超出LoRA适配器级别的修改都需要完整重新设计——既昂贵又耗时。由于新的前沿模型几乎每月推出一个,客户在将模型承诺到硅之前需要有极高的把握。
不过,Taalas表示这种情况是可以接受的。模型更新无需从头开始;只需修改两个金属层,大幅降低成本和周期时间。该公司声称,将模型权重蚀刻到硅中的成本大约比从头训练一个前沿模型便宜100倍。
AMD拥有良好的地位来变现这一优势。OpenAI、Anthropic和Meta都是Instinct的主要客户,模型开发者与芯片设计师之间的紧密协作关系表明,在Taalas和Instinct加速器的组合方案上部署GPT或Claude是完全可能的。
这项技术还对模型开发产生了影响。测试时推理扩展——允许模型在响应前进行更长时间的思考——可以减少幻觉,但需要消耗更多令牌,增加成本和延迟。如果Taalas能将单个令牌的成本降低10至20倍并显著提升输出速度,开发者可能会进一步延长推理时间,这对代码助手、聊天机器人和AI代理能带来直接收益。
在获得监管批准的前提下,该收购预计将在第四季度完成。