Cerebras和OpenAI发布GPT-5.6 Sol Ultrafast Mode,采用Cerebras硬件在生产规模实现每秒750 tokens推理。
Cerebras现在以任何GPU云都未曾公开达到的速度运行OpenAI的旗舰模型。2026年8月13日,这家晶圆级芯片制造商宣布,它为OpenAI的新服务层级Ultrafast支持GPT-5.6 Sol,可实现每秒最多750个输出token,根据OpenAI的说法,运行速度比Standard处理快14倍。Ultrafast首先在OpenAI API中以有限预览的形式推出,面向选定的客户群体,访问权限将随着容量增长而扩大。
核心主张直截了当:前沿智能,无需速度代价。GPT-5.6 Sol是OpenAI最强大的模型,在Cerebras芯片上它能以足够快的速度生成token,用于实时产品,而非隔夜批处理作业。两家公司将该服务层级定位为消除了模型对高风险工作足够智能与对使用中的工作足够迅速之间的权衡。
每秒750个输出token的数字占据新闻头条,但Cerebras发布的逐项对比揭示了更多内容。根据Artificial Analysis报告的输出速度,该公司声称Ultrafast上的GPT-5.6 Sol比Claude Fable 5快11倍,比Fast模式下的Opus 4.8快5倍。
Cerebras用《人类最后考试》(Humanity's Last Exam)对该服务层级进行了测试,这是一个包含2,500道题目、难度相当于博士级别的基准。Ultrafast上的GPT-5.6 Sol在11小时11分钟内回答了全部2,500道题目,而Claude Fable 5需要78小时27分钟才能得出可比的结论——根据Cerebras的测量,几乎慢7倍。在GDP-Val(经济价值知识工作基准)上,该公司报告相比Standard处理获得了5.6倍的端到端加速,质量没有降级。
这些都是供应商进行的评估。《人类最后考试》的对比由Cerebras在2026年7月10日和7月13-15日进行基准测试,GDP-Val数据来自其2026年7月31日的测试。应将其视为该公司自身的测量结果,而非独立的结果。
这一机制解释了为什么一家相对较小的芯片制造商能以GPU现有厂商未能匹敌的速度为OpenAI最大的模型提供服务。大模型的快速推理在根本上是一个数据移动问题:在GPU上,为了生成每个后续token,模型权重在芯片上内存和芯片外存储之间反复往返,内存带宽成为瓶颈。
Cerebras消除了这种移动。其晶圆级引擎(Wafer-Scale Engine)在单个晶圆大小的芯片上集成了44 GB的SRAM,将模型权重保持在芯片上,使得token在跨晶圆管道化的各层中无间断地流动。因为权重永不离开硅,这种方法随模型规模而扩展——该公司主张速度优势会随着前沿模型的增长而保持。对于推理经济学而言,这是决定性的:提供模型的成本和延迟由向计算供应权重的速度所主导,而将44 GB保持在单个晶圆上直接解决了这一问题。
Ultrafast是数月来逐步建立的合作关系中最显著的产品。OpenAI在2026年早些时候与Cerebras达成100亿美元的低延迟计算协议,此次推出将这一容量用于该公司的顶级模型,而非较小或专门用途的模型。OpenAI将Ultrafast描述为合作关系中为其平台带来超低延迟推理的"下一步"。
对于Cerebras而言,这个定位是重要的。这家初创公司长期以来主张其晶圆级架构是推理的适当方案,尽管市场重心仍坐在GPU供应商一侧——这是加速器业务中展开的竞争,现有厂商正在向其硅中直接嵌入模型转变。获得OpenAI旗舰模型的服务层为Cerebras提供了市场顶端的生产参考账户。该模型本身锚定了OpenAI推出的GPT-5.6系列,Sol作为旗舰与平衡的Terra和成本高效的Luna并肩,因此Ultrafast将Cerebras置于该阵容的前列。
OpenAI将该服务层级定位于时间敏感、高风险的工作:活跃宕机期间的事件响应、随市场条件变化的财务研究、实时客户支持和语音、商务,以及之前需要隔夜运行的实时研究循环。早期访问权已提供给包括Jane Street、Podium、Basis和Rogo在内的编码、商务和金融领域的公司。
"Cerebras带来的速度提升令人印象深刻,"Jane Street的AI助手部门John Crepezzi在OpenAI的声明中表示。"它使得使用模型的不同方式成为可能,使开发者能够以更聚焦和高效的方式与之协作。"
OpenAI有意保持推出范围较窄。该公司表示正在利用预览期来了解数量级速度变化在何处产生最大价值,并将随容量增长而扩大访问权限。两家公司都在接受注册,以便在预览扩展时获取更新。
短期成功取决于容量,而非能力。Ultrafast是一个有限的预览,两家公司将更广泛的可用性与容量增长相关联,而非固定日期——因此需要关注的是扩展的步伐。更长期的问题是Cerebras的片上内存优势是否会随OpenAI模型的扩展而保持,这正是晶圆级架构所建立的赌注。