2026年10月2日星期五
AI 基础设施 · 新闻与分析
首页 › 芯片与硬件 › 报道
芯片与硬件 · 报道

Cerebras通过其分解型芯片架构演示AI推理实现5倍吞吐量提升。

通过分解设计改进推理效率可能降低单位推理计算成本并加速替代芯片架构采用。
行业媒体Slicast · 2026年10月1日 UTC 20:19 · 美国 · 来源: Unite.AI
重要度 70

Cerebras系统公司宣布,截至2026年10月1日,通过分解——将推理拆分为独立硬件池——实现了推理吞吐量5倍的提升,同时不损失令牌生成速度,也无需额外部署Cerebras系统。该公司在题为《从零开始的分解推理》的博客文章中发表了研究成果,该文章由Isaac Tai和Zhenwei Gao撰写,开启了关于该技术的系列规划探讨。

这篇文章为已接触到这一概念但寻求实际应用基础的读者阐述了分解,特别是关于预填充是计算密集型而解码是内存密集型的论断。文章从第一性原理开始逐步阐述,首先介绍加速器如何在算术运算与数据移动之间取得平衡。

**预填充与解码对硬件的不同需求**

算术强度——浮点运算数与内存和计算单元之间传输的字节数之比——在推理的不同阶段差异显著。两个矩阵相加每移动6字节执行1次浮点运算,得到每字节0.167次浮点运算;这个比率随矩阵规模扩大而保持不变。矩阵乘法本质上有所不同:每个输出值来自一个输入矩阵的整行和另一个输入矩阵的整列,因此已加载的值会对多个输出有贡献,算术强度随输入规模增长而增加。

推理由固定模型权重与输入令牌之间的链式矩阵乘法组成,分为两个不同阶段执行,具有不同的强度特征。预填充将整个提示并行处理为大型矩阵运算——实际应用中的提示可跨越数千或数十万个令牌。解码逐次生成令牌,依赖于键值缓存,其存储为早期令牌计算的键和值,以避免重新计算。

两个阶段都必须为每个生成的令牌将完整的模型权重——可能为数百GB或TB——移动到计算单元。在预填充之后,内存移动保持近乎恒定而算术强度下降,这个差距解释了为何仅增加原始计算能力不一定能加速解码阶段的令牌生成。

**分解将推理拆分为独立的硬件池**

在生产环境中,推理服务器并发处理许多请求,当预填充和解码在共享硬件上运行时,计算密集型的预填充可能会延缓活跃的解码请求。调度器必须平衡竞争的优先级:快速向新请求传递第一个令牌、维持流畅的响应流和最大化总吞吐量。批处理让并发请求共享读取模型权重的工作,但较大的批次会延长每个解码步骤,提高总吞吐量的同时降低单个用户令牌传递的速度。

分解是一种系统设计模式,在独立的硬件池中运行预填充和解码。一旦分离,运营商可以分配硬件、设置批处理策略,并独立优化每个阶段的延迟或吞吐量:针对严格首令牌时间要求的系统可以预留更多的预填充容量,而为流畅流传输设计的系统可以专用更大或计划更紧凑的解码池。每个池可以单独扩展。

分离引入了运营复杂性。预填充建立键值缓存后,该请求特定的状态必须传输到解码池并在恢复生成前加载到内存;模型权重已在两个池中加载。交接产生网络和协调开销,如果容量与需求不匹配,任一池都可能闲置,额外延迟取决于缓存是在同地机器间还是跨区域移动。分解在大规模应用中最具吸引力,其中独立调整和调度池的收益超过传输和运营成本,并根本改变了服务系统的控制接口,而不仅仅是平滑流传输。

**异构硬件与早期成果**

Cerebras正在引领异构分解的开发,在一个推理系统中结合多种芯片类型,并将内存密集型或计算密集型的任务分配给相应的硬件。该公司将其晶圆级设计(在整个晶圆上分布SRAM和计算)与GPU进行对比,后者将模型数据从高带宽内存通过较小的芯片内缓存进行暂存。

一份日期为2026年9月10日的峰值内存带宽图表列出了Cerebras WSE-3芯片内SRAM达每个晶圆21,000 TB/s,一个未命名的芯片内SRAM加速器为150 TB/s,以及HBM4 GPU分别为23.3和22 TB/s。该图表指出,SRAM数据总和是处理器中的本地内存带宽,而HBM数据测量的是芯片外流量,描述的是不同的内存层级,而非直接的令牌速度比较。

一份来自2026年9月10日的独立基准测试以10,000个输入令牌的高推理对GPT-oss-120B进行了测试。结果显示Cerebras为每秒1,669个输出令牌,SambaNova为708,Groq为475,Microsoft Azure为319,Nebius为294,Baseten为293。

Cerebras报告称,在传统的聚合系统中,容量增益需要部署额外的硬件。通过与加速器合作处理提示处理,它在早期测试中使用相同的WSE占地面积实现了5倍容量增加。该公司已宣布与多个硬件合作伙伴建立合作关系以加速令牌传递;一个图表显示AWS Trainium和AMD Helios Instinct GPU系统是馈送到Cerebras解码池的预填充选项。

代理应用代表了一个有吸引力的分解用例,考虑到它们对长、多轮工作流的依赖,其中上下文在模型调用中增长,每一步的延迟都会累积。Cerebras将在后续的文章中涵盖涉及的硬件和软件堆栈,以及大规模部署分解推理的经济权衡。

阅读原文
Cerebras通过其分解型芯片架构演示AI推理实现5倍吞吐量提升。 · Slicast