Cerebras晶圆级芯片进入生产推理竞技场:OpenAI Ultrafast模式落地,但盈利路径仍存争议
OpenAI将GPT-5.6 Sol以每秒750 token部署于Cerebras WSE-3硬件,是晶圆级架构作为英伟达GPU集群替代方案迄今最具说服力的生产规模验证,但利润率压力与客户集中风险令Cerebras的投资逻辑仍显复杂。
OpenAI选择以Cerebras WSE-3芯片而非英伟达GPU驱动其新推出的Ultrafast推理层级,这一消息近日经多家媒体证实,是这家圣克拉拉初创公司迄今获得的最具曝光度的商业部署。GPT-5.6 Sol在Ultrafast模式下以每秒750 token运行,吞吐量是标准推理层的14倍,而且不是在受控基准测试中,而是在面向前沿模型的生产规模上验证了晶圆级架构的可行性。对于一个争论了多年专用推理加速器能否挑战英伟达生态主导地位的行业而言,这是一个有实质分量的数据点。
Cerebras速度优势的技术基础具有结构性。传统GPU集群通过高速但有限的互联连接多颗芯粒,形成内存访问瓶颈,这在Transformer推理逐token生成的节奏下尤为突出。Cerebras的晶圆级引擎占据整片硅晶圆,以前所未有的规模集成片上SRAM,消除了拖慢多GPU系统的片外内存延迟。这一架构可追溯至2019年的CS-1,彼时普遍被视为工程展示而非商业命题。2022年11月,Andromeda超级计算机将其扩展至1350万核心。2024年3月与高通联合推出的WSE-3,则将该架构延伸至当前商业机遇集中的推理工作负载领域。
进入2026年,业务轨迹明显加速。Cerebras公布第一季度营收1.934亿美元,同比增长92%,并披露了一份与OpenAI签订的多年期协议,多家来源引用的合同规模为200亿美元;公司完成IPO,融资64亿美元,早于六月份财报发布。第二季度,管理层表示快速推理云业务规模近乎翻了四倍。合作版图也在持续扩展:7月24日,AMD与Cerebras宣布推出分解式推理平台,将Cerebras晶圆级引擎与AMD Helios EPYC机架基础设施相结合;7月23日,CrowdStrike披露部署CS-2处理器用于实时AI威胁检测。Cerebras还于7月30日与CleanCore Solutions在明尼苏达州签订十年数据中心托管协议,并承诺于2027年底前在欧洲布局200兆瓦算力;Flex则于7月14日宣布扩大合作,承担更多CS-3加速器的本土制造。
然而风险真实存在,市场已以相当力度作出定价反应。此前,随着大型合同结构条款浮出水面,Cerebras股价下跌28.2%,分析师指出云端推理服务——OpenAI合同实质上要求的商业模式——毛利率低于直接硬件销售。公司目前仍处于亏损状态:一份盈利预告指出,尽管营收增长88%,第二季度净亏损预期依然存在。第一季度财报本身也释放出复杂信号——92%的营收增幅超出预期,但股价当日仍下跌9%,投资者聚焦于被观察人士描述为低于AI芯片同行的利润率水平。客户集中风险在市场评论中被简洁概括:一则广受引用的分析指出,200亿美元OpenAI合同是集中度的转移而非降低。7月19日,一篇Seeking Alpha分析将Cerebras定位为推理竞赛领跑者,同时以估值和风险为由明确表示不建议买入。
三个信号将决定这一推理优势能否转化为可持续的商业模式。其一是利润率走势:公司必须证明规模化云推理能够产生足够的经营杠杆以缩小盈利缺口,第三季度财报将是首个有实质意义的读数。其二是客户多元化进展:AMD合作与CrowdStrike部署代表着真实进展,但高度集中于单一超大型客户的营收格局所带来的对手方风险,不是任何硬件合作协议能够单独化解的。其三是竞争格局的演变:英伟达Blackwell架构瞄准的正是Cerebras建立优势的推理延迟细分领域;据报道,Groq LPU被整合入英伟达Vera Rubin平台,则暗示大型在位者正在内化专业推理能力,而非将阵地拱手相让。每秒750 token究竟会成为每家供应商都将达到的行业基准线,还是Cerebras独能守护的持续上限,将比任何单一合作声明更清晰地揭示晶圆级架构在成熟AI基础设施格局中的长远价值。