2026年9月15日星期二
AI 基础设施 · 新闻与分析
首页算力与云报道
算力与云 · 报道

Cerebras 驱动 OpenAI GPT-5.6 Sol 推理引擎,吞吐量 750 tokens/秒,11 小时处理 2,500 个问题

证实Cerebras为生产级推理加速器;OpenAI采用昭示自研芯片正与GPU在真实工作负载竞争
行业媒体Slicast · 2026年8月13日 UTC 17:10 · 美国 · 来源: quiverquant.com
重要度 91

Cerebras Systems宣布推出Ultrafast(超快速)模式,这是OpenAI GPT-5.6 Sol的新服务层级,能够实现每秒最多750个token的处理速度——比标准处理速度快14倍。该模式目前仅限于OpenAI选定客户的有限预览,Ultrafast在显著降低延迟的同时提供对GPT-5.6 Sol全部智能的访问。

根据首席执行官Andrew Feldman的说法,实现这样的速度对AI的更广泛采用至关重要。Feldman表示:"每次重大计算转变都由速度跃升来解锁。PC时代需要从千赫兹跳跃到吉赫兹,互联网需要从拨号上网转向宽带才能惠及大众。AI也不例外。既然前沿模型已被证明具有能力,采用的下一个制约因素就是它们的运行速度。"

OpenAI计算战略与GPT基础设施副总裁Sachin Katti指出,该合作正在探索当客户能够以显著更低的延迟访问前沿模型的智能时如何获益。他表示:"我们从小规模客户群体开始,了解速度在哪里能创造有意义的价值,并利用这些学习来指导我们如何随时间推移扩展服务。"

Ultrafast层级解决了一个根本约束:企业历来必须在更大模型的能力与更小模型的更快响应时间之间做出选择。根据人工智能分析报告的输出速度数据,Ultrafast比Claude Opus 4.8的快速模式快5倍,比Claude Fable 5快11倍,将前沿智能与前所未有的速度相结合。

基准测试结果展示了实际影响。在"人类最后的考试"——一个涵盖2500道问题、跨越研究生级化学、经济学和文学的基准测试——上,GPT-5.6 Sol Ultrafast在刚刚超过11小时内完成全部问题集,而Claude Fable 5需要超过三天的连续计算,达到可比准确性时速度快近7倍。在GDP-Val基准测试上(包含法律简报、财务模型和工程报告等具有经济价值的工作任务),Ultrafast实现了5.6倍的端到端加速,质量无损耗。

Ultrafast的速度源自Cerebras的晶圆级引擎架构,该架构将模型权重保存在芯片上——每个晶圆级芯片上配置44GB SRAM——而非如基于GPU的推理那样在片上和片外存储间往复传输。这一方案消除了制约传统硬件上前沿模型推理速度的内存带宽瓶颈。Cerebras计划根据初期反馈和使用情况,向更多客户扩展Ultrafast容量。

阅读原文
Cerebras 驱动 OpenAI GPT-5.6 Sol 推理引擎,吞吐量 750… · Slicast