2026年9月29日星期二
AI 基础设施 · 新闻与分析
首页 › 头条 › 报道
头条 · 报道

Cerebras对其WSE-3晶圆级引擎实施超频,在新发布的“Nexus”架构CS-4机架系统中大幅提升推理吞吐量。

该操作在未增加晶圆代工产能的条件下直接释放更多可用推理算力,进一步收紧短期高端加速器供应格局。
行业媒体Slicast · 2026年8月19日 UTC 04:39 · 全球 · 来源: The Next Platform
重要度 88

Cerebras Systems,这家在AI计算领域与英伟达(Nvidia)直接竞争多年的第二代AI硬件初创公司,计划于今年夏季推出其最新平台CS-4,代号为“Nexus”。在分析该公司2025年10月完成的11亿美元融资轮次时——当时该公司尚未公开上市,且2026年的IPO尚未确认——我预测其发布时间窗口为2026年8月。这一预测已被证实是准确的。

虽然CS-4引入了新的系统架构和包裹其外围的新型机架设计,为未来多代产品奠定了基础,但它并未搭载下一代WSE-4计算引擎。相反,CS-4采用了现有WSE-3晶圆级引擎的超频变体,命名为WSE-3 Turbo。它保留了相同的90万核心和44 GB片上SRAM,采用台积电(TSMC)的5纳米工艺制造。鉴于N5节点在2026年比Cerebras于2024年3月首次交付WSE-3引擎时要成熟得多,台积电很可能正在使用N5家族的增强版迭代工艺,这将使Cerebras及其企业客户双方受益。

WSE-3 Turbo通过将时钟频率从标准的1.4 GHz提升至2.8 GHz,使其计算吞吐量达到前代产品的两倍。这就引出了一个问题:为什么Cerebras早在两年前没有实施这样的超频?最合理的解释是,所需的供电和热管理基础设施在当时尚不可行。在CS-4配置中,计算晶圆本身基本保持不变,但通过封装接收双倍的电力输入,同时冷却能力略高于双倍,以在不牺牲可靠性的情况下维持2倍的时钟频率提升。

回顾Cerebras四代CS平台的历史性能指标,可以看出该平台的演变过程。去年,我曾对CS-4生态系统内未来WSE-4引擎的可能规格进行建模,提出后续的CS-4 Plus或CS-5可能会引入一种根本不同的硅芯片。我的评估依然认为,晶圆级引擎最终受限于SRAM容量,这此前导致运行前沿模型推理需要数十套CS-2和CS-3系统——这一需求可能变得更大。在我更新的预测中,我纳入了一个“WSE-4 Harder”场景:时钟频率推高至2.8 GHz,I/O带宽翻倍以更好地平衡100万核心与320 GB SRAM之间的关系,聚合带宽达到每秒248 PB。这种架构将显著优于当前的基于HBM的解决方案,因为在那些方案中,内存距离计算单元较远。

正如联合创始人兼首席执行官Andrew Feldman和联合创始人兼首席技术官Sean Lie所展示的战略路线图所反映的那样,Cerebras在其工程团队、管理层和客户群体中保持着极高的期望。根据这些预测,Nexus机架架构将支持至少三代系统,Cerebras承诺到2029年实现每年2倍的吞吐量增长。这一速度远超传统的摩尔定律轨迹。这种改进可能针对的是有效性能而非峰值理论指标,主要通过增加相对于计算密度的SRAM容量来缓解核心饥饿问题——这是GPU架构中常见的瓶颈。我强烈怀疑原始的WSE-3核心从未完全饱和其SRAM带宽,即使在使用WSE-3 Turbo的情况下,这一限制依然存在。为了将内存容量与计算扩展对齐,Cerebras最终需要采用3D SRAM堆叠技术。在保持晶圆级SRAM容量的同时减少核心数量在商业上是不可行的,因为这实际上等于承认为了推动单位销量而故意低估内存配置——这一做法也在英伟达和AMD等GPU加速器供应商中有所观察。

CS-4的真正创新在于其Nexus机架架构。虽然通过提高时钟速度实现2倍的性能跃升是一种有效的短期策略,但进一步的增益需要架构上的转变,因为时钟速度不能无限期地超过这一新上限。重新设计的计算节点将WSE晶圆及其主机AMD Epyc CPU与电源和网络接口分离开来。这种拆分使得每个子系统可以独立升级。至关重要的是,网络接口卡(NIC)的模块化允许OpenAI和亚马逊云科技(Amazon Web Services)等合作伙伴集成他们首选的网络接口卡,从而促进Cerebras WSE引擎与用于预填充操作和GenAI模型训练的GPU或XPU之间的连接。

在物理结构上,Nexus机架的前部设有三个电源架,后部安装有三个垂直方向、模块化的CS-4计算背包。这些背包直接插入电源架。Cerebras报告称,新机器的设计融入了60%更高的制造自动化程度。与CS-1至CS-3平台相比——后者每个机架容纳一个包含单个WSE及其主机CPU的16U机箱——Nexus每机架的计算密度提高了三倍。历史上,运营商理论上可以在每个机架中安装两个旧式机箱以适应扩展网络存储,前提是热约束允许。

据Lie介绍,Nexus机架专为大规模部署而优化,使用的组件减少了50%,部署速度比之前的Cerebras系统快多达3倍。架构的爆炸视图显示,背包从后部机箱延伸出来。尽管外观如此,这些单元并非弹簧加载;每个计算复合体重约100磅,不会强力弹出。Lie解释说,Cerebras计划首先向客户交付机架和电源基础设施,待现场准备工作完成后,再交付WSE背包。这种分阶段交付优化了供应链物流并加快了部署时间表。

CS-4背包的详细分解显示,底部是电源模块,上面是WSE-3 Turbo模块,并由一组螺丝固定的冷板固定。两个网络接口卡位于组件的顶部和底部。根据引用“新型高速晶圆链路”的规格,晶圆I/O模块配备六个以每秒200 Gb速率运行的以太网端口。与早期CS-1至CS-3系统中使用的每秒100 Gb I/O模块(使用单或双以太网 fabric 接口)相比,每端口带宽翻了一番。关于先前I/O配置的文档和演示文稿一直含糊不清。

NIC基数增加2倍理论上应使Cerebras能够超越之前单数据并行集群的2,048个节点限制,实现互连性的扩展。然而,行业分析表明,无论拓扑结构或基数如何改进,Cerebras可能会维持2,048个节点的上限。试图向Cerebras核实这些网络细节的努力尚未得到回应。

更新后的网络设备支持可编程的低延迟数据包流水线,并启用晶圆到晶圆的直接链路。这些互连的确切可配置性仍未指定。通过与伦敦交换机制造商Arista Networks的合作,实现了扩展CS-4集群的扩展网络以及连接用户和存储的前端网络。

部分客户目前已获得CS-4系统的早期访问权限,一般可用性定于2026年第三季度晚些时候发布。有关CS-4平台的详细性能基准测试和工作负载分析将在单独报告中公布。

阅读原文
Cerebras对其WSE-3晶圆级引擎实施超频,在新发布的“Nexus”架构CS-4机架系统… · Slicast