Cerebras声称其CS-4服务器在AI聊天机器人查询工作负载上的性能比英伟达GPU快30倍。
Cerebras Systems(股票代码:CBRS)于周二发布了其下一代CS-4服务器机柜,声称在运行大型语言模型时,新硬件每用户每秒生成的令牌数量比图形处理器(GPU)高出多达30倍。这一公告标志着该公司积极进军AI推理市场,位于加利福尼亚州森尼韦尔的公司正将其晶圆级架构定位为比当今数据中心主导的GPU集群更快、更高效的替代方案。
CS-4是一个机架级系统,由三颗WSE-3 Turbo处理器驱动,该公司称这些芯片是有史以来制造的最大AI半导体,每颗芯片集成了4万亿个晶体管。Cerebras表示,该系统在GPT-OSS-120B模型上每用户每秒可生成超过4,400个令牌,速度约为其前代产品CS-3的两倍,同时每瓦特吞吐量高达10倍。首批CS-4发货计划在本季度开始,芯片采用台积电5纳米制造工艺生产。
该系统围绕公司的Nexus服务器架构构建,该架构使用可插拔模块来容纳芯片。Cerebras表示,与上一代相比,该设计所需的组件减少了50%,首席技术官Sean Lie表示,这一变化将加速数据中心的建设时间表。该机架还包括新的网络组件,旨在加快芯片之间的数据传输速度。
首席执行官Andrew Feldman在一份声明中表示:“历史上,快速推理意味着使用更小、能力较弱的模型。Cerebras CS-4在最前沿的大型模型上提供了行业领先的速度,从根本上改变了范式。”“设计的每一个方面都经过优化,以提供最高速度和巨大吞吐量。有了CS-4,AI的速度之快从根本上重塑了产品体验。”
Feldman在旧金山的一场简报会上告诉记者,工程工作集中在提高数据吞吐量上。“从现在到2027年底,我们将实现四倍的速度提升,并将获得20倍的吞吐量。”该公司预计到2027年底将提供价值600兆瓦的计算能力,并计划在那一年推出另一代芯片和服务器硬件。
这些性能主张基于根本性的架构差异。Cerebras处理器使用静态随机存取存储器(SRAM),而不是传统GPU系统中使用的动态随机存取存储器。SRAM速度快得多,但也更复杂、更昂贵,因此对于标准尺寸的芯片来说并不实用。Cerebras认为,其餐盘大小的晶圆提供了足够的物理空间,可以有效利用SRAM。与Nvidia(NVDA)或AMD的多芯片GPU集群相比,单芯片设计也减少了数据必须传输的距离,后者必须在离散处理器之间传递信息。
Cerebras表示,这种优势对于推理工作负载特别相关——即Anthropic的Claude等AI聊天机器人生成响应的计算过程。除了销售硬件外,该公司还运营自己的AI云服务,出租在其芯片上运行的系统的访问权限。更广泛的竞争格局仍然充满挑战。Nvidia继续通过其H100和Blackwell产品线主导AI加速器市场,主要云提供商已围绕基于GPU的系统构建了广泛的基础设施。Cerebras押注的是,推理——这是部署AI模型日常成本的主要组成部分——为其晶圆级方法提供了一个突破口。
此次产品发布正值Cerebras股价波动时期。该公司于5月以每股185美元的价格上市,并以350美元开盘交易,但此后股价下跌超过35%,截至周二中午左右交易价格约为218美元。上周,Cerebras报告第二季度销售额为1.801亿美元,调整后亏损为690万美元。每股收益亏损为2.98美元,而去年同期则为盈利1.91美元。尽管给出了优于预期的第三季度指引,但结果未能令华尔街满意。在CS-4公告后,股票在盘前交易中几乎持平,表明投资者仍关注这些性能主张是否能转化为商业采用。
这场赌注是否会有回报,将取决于该公司将技术指标转化为持续客户需求的能力,特别是在企业权衡功耗和基础设施成本以扩大AI部署的背景下。