2026年10月2日星期五
AI 基础设施 · 新闻与分析
首页 › 算力与云 › 报道
算力与云 · 报道

两家云计算商在一周内选择Cerebras多芯片推理解决方案,标志其晶圆级计算架构被快速采用。

Cerebras在同行转向替代性架构进行推理时获得关注;验证其生产环境大规模推理的软件栈成熟度。
行业媒体Slicast · 2026年10月1日 UTC 15:14 · 美国 · 来源: futurumgroup.com
重要度 76

吉姆雷特实验室和Cerebras系统公司于9月28日宣布展开合作,通过吉姆雷特云(Gimlet Cloud)提供超快速AI推理能力。该云平台是专门构建的分解式推理云,跨越数据中心基础设施到开发者API。两家公司计划为要求苛刻的智能体和实时应用提供最高3000个令牌/秒的速度,首个由Cerebras驱动的吉姆雷特云数据中心预计将在2026年末上线。吉姆雷特是Cerebras CS-4的发布合作伙伴,计划部署100兆瓦的Cerebras驱动推理能力,并预期在2027年获得CS-4的使用权。

吉姆雷特实验室联合创始人兼首席执行官扎因·阿斯卡尔(Zain Asgar)表示:"推理速度很重要。它决定了AI能有多高效。快速推理能创造神奇的用户体验并开启新的市场。"

这一宣布为平行举措奠定了基础。通用计算公司(General Compute)与Cerebras达成多年协议,部署用于智能体编码工作负载的超快推理能力,预计在2027年第一季度推出,由Upper90提供的4亿美元债务融资支撑建设。通用计算公司联合创始人兼首席执行官芬恩·普克劳斯基(Finn Puklowski)表示:"智能体编码是最清晰的案例。智能体会进行数千次顺序调用,延迟会叠加成实际耗时。"由Andreessen Horowitz和Menlo Ventures支持的吉姆雷特实验室计划在软件、API、开发者工具和生产运维方面扩展合作。

两家云服务商在一周内都选择Cerebras,代表了多硅推理能否在生产规模上击败同构GPU云在速度方面的首次商业测试。吉姆雷特的技术方法体现了更详细的承诺。吉姆雷特云将Cerebras晶圆级引擎与GPU集成在一个统一解决方案中,使用推理分解技术在最适合的硅上运行模型执行的各个阶段。据Artificial Analysis报道,Cerebras已在GPT-OSS-120B上实现每个用户4400个令牌/秒,但该低并发下的单用户基准测试几乎无法说明为数千个并发智能体服务前沿模型的情况。

吉姆雷特的答案是分解:在SRAM上保持解码,在GPU上进行预填充,并从一开始就围绕这种分割构建数据中心。企业需求为这种架构提供了正当理由。根据ETR在2026年9月的AI产品系列调查,69.9%的受访者将性能列为评估基础模型时最重要的因素(n=511),超过了成本的68.7%,并高于2025年3月的63.8%。在另一个受访群体中,78.8%的人将效率改进命名为评判自身AI应用的主要关键绩效指标(n=600)。这些数据表明,推理速度正在从基准测试类别升级为拥有专属目的构建云的独立市场。

CS-4提供了缺失的基础设施。在2026年Hot Chips大会上,每支主要芯片团队都汇聚于内存效率和同步惩罚消除这一核心设计战场。CS-4的机架级创新——晶圆级功率传输翻倍、直接液冷却和网络大修——使吉姆雷特的模型可以实现。在架构细节上,CS-4将晶圆外带宽翻倍至每晶圆2.4 Tb/s、每系统7.2 Tb/s,支持标准RoCE v2 RDMA以太网协议,并添加了直接晶圆链接,实现晶圆间2微秒的连接。Arista Networks Etherlink交换机跨机架扩展光纤矩阵。这种标准以太网方法允许拥有NVIDIA GPU、AMD硬件和其他加速器的新云服务商将晶圆级解码层集成到单一编排层中,而无需专有互联孤岛。

3000个令牌/秒的目标需要在硬件层面堆叠分解技术。预填充-解码分解在GPU上运行提示处理,将令牌生成交给Cerebras晶圆,其每块晶圆44 GB的片上SRAM在CS-4机架中三个WSE-3 Turbo处理器间以43.2 PB/s的速率传输数据,消除了限制GPU解码速度的HBM瓶颈。注意力-FFN分解在每个模型层内进行分割,将注意力放在GPU上,将专家激活放在SRAM中心芯片上,以牺牲部分延迟来换取更高的吞吐量。推测解码在SRAM硬件上以极高速度运行草稿模型,同时GPU高效验证大批量令牌。CS-4在超过10万亿参数的模型上已经实现超过1000个令牌/秒,当草稿模型运行足够快时,推测解码可以将有效解码速度提升2到3倍。吉姆雷特声称这种组合方法在给定吞吐量目标下可实现3到10倍更高的交互性,或在给定交互性下每瓦特3到10倍的吞吐量。3000个令牌/秒的数字仍然是前瞻性计划而非测量结果,在架构上可行但需要生产验证。

细粒度分解需要同一建筑物内异构硬件在一个结构上互相寻址。注意力-FFN分解在每层GPU和晶圆间往返,使跨数据中心链接无法使用,即使预填充-解码分割在距离上也会衰减。CS-4的以太网光纤矩阵使这成为可能。Cerebras放弃专有隔离而选择以太网互操作性的决定产生了其首批专属目的构建云客户。

规模承诺与速度声明值得同等审视。吉姆雷特计划部署100兆瓦的Cerebras驱动推理能力,意味着大约700到800个机架——这对一家披露优先级包括OpenAI、G42和AWS的供应商来说是材料分配。Cerebras在2026年签约的制造扩张超过10倍,跨越三家代工厂商,并在第二季度报告了254亿美元的剩余履约义务,表明纸面上存在产能。风险投资支持的新云服务商是否能够在2027年获得CS-4配额与主协议客户相当,这是供应链问题而非软件问题。时间顺序也揭示了一个差距:首个由Cerebras驱动的吉姆雷特云数据中心预计在2026年末上线,而CS-4使用权在2027年到达,表明初期部署将以低于头条目标的上限运行现代系统。对于Cerebras而言,该交易分散了其披露显示较窄的客户群浓度风险,并将CS-4的以太网开放性转化为分销渠道。

阅读原文
两家云计算商在一周内选择Cerebras多芯片推理解决方案,标志其晶圆级计算架构被快速采用。 · Slicast