2026年9月15日星期二
AI 基础设施 · 新闻与分析
首页芯片与硬件报道
芯片与硬件 · 报道

AMD宣布收购Taalas,一家多伦多初创公司,该公司将AI模型权重直接蚀刻到硅片中用于推理加速。

AMD强化AI推理芯片竞争优势,推进模型特定硅加速器,实现AI芯片供应链多元化。
行业媒体Slicast · 2026年8月6日 UTC 23:20 · 全球 · 来源: ServeTheHome
重要度 90

AMD宣布收购Taalas公司,该公司开发模型特定的AI推理芯片——这是一种与通用加速器根本不同的方法。Taalas创建针对各个模型的专用硅芯,而不是使用可通过软件配置运行多个模型的可编程硬件。部署不同的模型需要替换物理芯片,因为每个芯片都是为单个模型的架构和计算需求专门设计的。

Taalas的核心创新用一种替代方案取代了典型的内存密集型方法:Taalas不是从高带宽内存加载模型权重并使用可编程计算来处理特定模型的操作,而是将模型权重直接烧入CMOS中。这种模型参数的物理嵌入消除了内存访问开销,相比更灵活的解决方案产生了显著的性能提升。

根据Taalas自己的测量,该公司当前的技术演示产品HC1运行Llama 3.1 8B,每个用户可达到每秒17,000个token。HC1采用台积电6nm工艺制造,芯片面积815平方毫米,包含530亿个晶体管。Taalas将其与NVIDIA的H200和B200加速器以及Groq、SambaNova和Cerebras等竞争对手进行基准测试。

更大的现代模型可能需要多个光罩尺寸的芯片来容纳整个模型——尤其是更大的架构。这引入了制造和运营复杂性:制造、封装和测试数十种不同的芯片变体;管理供应链依赖关系,其中单个延迟的组件可能导致多批货物停滞;以及协调软件以将多个不同的芯片集成到一个连贯的系统中。然而,这种方法承诺更快的推理速度和可能更低的成本。

Taalas通过在改变模型权重、矩阵维度和其他参数时限制对两个掩膜层的修改来解决制造约束。即使每个模型需要多个芯片,相比重新设计完全独立的GPU架构,这个约束也显著减少了所需的昂贵光掩膜数量。

这种特定模型的方法用效率换取灵活性。专业化将计算工作负载压缩到简化的数据流中,消除了通用设计固有的内存和计算开销。代价是:围绕某一模型构建的机架在该模型改变时无法轻易调整。这使得该方法最适合稳定的、大规模推理——正是AMD认定为市场增长最快的领域。

"当一个模型被快速采用、工作流围绕它构建、因此基础负载在一段时间内持续存在时,这也很有帮助——就像GPT-3 20B和120B被广泛采用并且尽管在其大小范围内远落后于最先进水平,但至今仍在使用一样。模型特定芯片使用的时间越长,用专用硬件加速模型的商业案例就越容易成立,"AMD表示。

AMD计划将Taalas的技术集成到其加速器路线图中,并开发围绕Instinct加速器的系统级产品。该收购加强了AMD的全栈AI平台,该平台包括Helios机架级系统、EPYC CPU和ROCm软件。通过内部模型特定推理引擎,AMD为客户提供了一个专用选项,可在稳定模型的情况下实现最大效率,补充其现有的通用Instinct加速器。关键问题仍然是:Taalas演示产品转换为生产硅的速度有多快,以及模型特定芯片是否能够捕获足够的工作负载,以与更广泛市场提供的灵活加速器竞争。

阅读原文
AMD宣布收购Taalas,一家多伦多初创公司,该公司将AI模型权重直接蚀刻到硅片中用于推理加… · Slicast