AMD收购Taalas,一家将AI模型权重硬编码到推理芯片的初创公司,演示芯片实现每用户每秒16K+令牌吞吐。
# GTC 2026年会上,英伟达CEO詹森·黄揭示了一个关键限制:寻求代理AI应用低延迟推理的企业无法仅使用GPU架构实现目标。为在各种延迟配置中提供最佳性能,黄演示了企业必须将AI推理工作负载分为两个阶段:预填充(输入令牌在GPU集群上处理,这是GPU的强项),以及解码(模型生成响应的阶段),这一阶段需要大规模并行、确定性的SRAM密集型矩阵数学引擎,如Grok、SambaNova Systems和Cerebras提供的那样。
根本问题很简单:GPU是优秀的高带宽并行处理器,但在推理的解码阶段性能不理想。黄的GTC演示表明,结合英伟达Grace CG100 CPU和Hopper H100 GPU的系统在性能下降前每用户每秒可处理约100个令牌——他称之为"中层"性能。配备18个Grace CPU和36个Blackwell B300 GPU的NVL72混合平台提供3.5倍更好的性能,在100 TPS交互能力(按每百万瓦特令牌数衡量)。即将推出的配备Vera CV100 CPU和Rubin R200 GPU的NVL72系统将提供约2倍于Grace-Blackwell配置的TPS/MW,相当于Grace-Hopper系统性能的7倍。
Grace-Hopper设置无法超过这个交互阈值,尽管Grace-Blackwell系统可达到"高层",在合理吞吐量下支持每用户200 TPS,而Vera-Rubin NVL72可实现3倍的更好结果。在"高端层"——400 TPS交互能力——Grace-Blackwell系统的TPS/MW接近零,而Vera-Rubin可在合理效率下提供10倍更好的性能。
这些结果在预填充和解码中都使用了GPU。但当黄将推理负载分开,将预填充置于GPU,解码置于当代Grok LP30加速器上时,一个全新的"超级层"出现了,提供每用户1000多TPS——这可能是代理工作负载的基线要求。更引人注目的是:Vera-Rubin NVL72加Grok的高端层实现了不具Grok加速的Grace-Blackwell NVL72系统性能的35倍,相比之下仅用GPU加速器只能实现10倍的改进。仅GPU加速器无法在合理系统吞吐量下维持超过每用户400 TPS。
当然,Grok集群在解码端有其自身的扩展限制——你无法无限链接数百万设备以驱动任意高的交互能力——但架构优势明显。这些发现解释了英伟达在12月对Grok团队的200亿美元收购,以及AMD为何走自己的路:与Cerebras合作进行分布式推理,同时本周收购AI推理初创公司Taalas。AMD的GPU面临与英伟达相同的推理解码限制。
Cerebras合作惠及双方,将Cerebras预期的第四代晶圆级计算引擎(WSE-4)与AMD的Helios集群——采用Verano Epyc CPU和Altair MI455X GPU——定位为提供与英伟达未来Vera-Rubin-LPU组合相当的分布式推理。挑战在于:AMD无法控制Cerebras技术。经过大量融资和最近的IPO,Cerebras市值达509亿美元;对AMD来说,收购它可能花费超过600亿美元,尽管季度收入不足2亿美元——这是300倍收入倍数,在通常按10倍溢价估值的市场中风险重大。
目前,AMD与Cerebras合作——这是其唯一可行选择,因为Graphcore被软银(Arm所有者)收购,英伟达实际上收购了Grok,而SambaNova与英特尔合作。该公司目前正寻求用于未来路线图的推理加速替代方法。
新收购的初创公司Taalas由Tenstorrent工程师创建,基于创新原理运营:将AI推理模型及其权重直接嵌入ROM电路,与大规模SRAM块相连,作为片上KV缓存。当前HC1代可存储80亿参数的模型;下一代HC2支持200亿参数。数十个互连芯片理论上可容纳跨越万亿参数的推理模型。初始基准测试表明极低延迟和显著降低的单令牌成本,相比英伟达Blackwell B200 GPU。
Taalas的方法需要特定模型的芯片变体:SRAM架构保持不变,但编码模型和权重的两个金属层必须针对每个模型进行改变。不过Taalas声称,定制HC芯片并采购合理数量——估计为数十万单位——的成本大约比从头训练新的生成AI模型低100倍。
AMD对其Taalas计划的披露有限,仅表示将"将该技术集成到其加速器路线图中,并与AMD Instinct GPU开发系统级解决方案"。随之而来的是一个特定模型架构的新时代。