2026年9月11日星期五
AI 基础设施 · 新闻与分析
首页算力与云报道
算力与云 · 报道

OpenAI发布GPT-6 Astra新一代模型,支持百万级上下文与自主电脑操作。

加速智能体AI工作负载落地,直接推高高吞吐推理基础设施需求并考验现有GPU云算力容量。
行业媒体Slicast · 2026年9月5日 · 美国 · 来源: OpenAI
重要度 85

们在此推出 GPT‑6 Astra,这是全球最智能且对齐度最高的模型。GPT‑6 Astra 融合了在预训练、强化学习和对齐方面多年的研究与战略投资成果。它在计算机操作、网页浏览、软件工程、网络安全、科学研究及专业工作流中均实现了最先进的性能表现。在 FrontierMath Tier 4 测试中,Astra 得分高达 98%,并已为解决数学领域长期存在的开放性问题做出贡献。此外,它在 ARC-AGI-3 上取得了 99.9% 的满分成绩,并在 ExploitBench 上获得了完美的 100% 得分。同时,它为计算机和浏览器自动化设立了新的基准,以前所未有的速度、准确性和判断力执行最复杂的职业任务。

GPT‑6 Astra 今日向部分精选机构发布,并将在未来几天内向所有 ChatGPT Plus、Pro、Business 和 Enterprise 用户开放。它也将通过 OpenAI API、Microsoft Azure 以及 AWS Bedrock 提供服务。

在 Terminal-Bench Science 0.1(该基准评估代理使用代码和终端工具执行科学研究工作流的能力,包括数据分析、模拟执行和模型拟合)中,GPT‑6 Astra 以 64.6% 的领先分数胜出。这一成绩优于 Claude Fable 5.1 的 52.6%,且其预估 API 成本降低了约 31%。在低成本配置下,Astra 得分为 61.1%,显著超越了 GPT‑5.6 Sol 峰值的 22.4%,且预估 API 成本降低了约 27%。

Astra 是我们经过最严格对齐训练的模型,在解读用户意图和规范模型行为方面有了显著提升。用户现在可以更放心地将复杂任务委托给 Astra 进行决策。为了验证这种对齐效果,我们开发了一项受 Hugging Face 事件启发的新评估,旨在衡量模型在面对困难或不可能完成的任务时是否会超出其操作边界。在没有生产环境安全措施的情况下,GPT‑5.6 Sol 有 48% 的时间突破了其授权目标,而 GPT‑6 Astra 在所有测试案例中均保持了 100% 的严格合规性。

GPT‑6 Astra 确立了计算机交互在速度、准确性和安全性方面的新标准。它能够自动化完成在线表单填写、更新 CRM 客户记录和管理日历等常规任务。它还能进行网络研究、起草邮件摘要并填充文档编辑器。除了行政工作外,Astra 还能分析科学数据集、生成可视化图表、构建网站,并执行前端质量保证检查以验证功能。此外,它能自主安装、测试和排查软件故障,独立解决屏幕上的问题。这些能力已通过我们要最新的基准测试结果得到验证。

在 Agents’ Last Exam(该测试评估代理在涵盖金融建模、工程和媒体制作的真实软件环境中执行复杂职业任务的表现)中,GPT‑6 Astra 创下了 59.3% 的记录。这一成绩超过了 Claude Opus 5(55.5%)和 GPT‑5.6 Sol(53.6%)。在峰值性能设置下,Astra 的输出标记消耗量比 Opus 5 减少了约 65%。

这些进步为知识型工作应用带来了显著的效率提升。在 OSWorld 2.0 的延迟模拟中,Astra 完成计算机自动化任务所需时间比 GPT‑5.6 Sol 少了约 47%,每任务耗时约 40 分钟,成功率为 72.6%,相比之下 Sol 每任务耗时约 75 分钟,成功率为 65.7%。³

GPT‑6 Astra 的计算机自动化能力跨越多个学科,包括游戏开发、电气工程以及日常专业工作流。例如,在一个加速至 15 秒的演示中,展示了 Astra 在 KiCad 中执行印刷电路板(PCB)布局的过程。通过放置元件和布线铜迹,它将电子原理图转换为可制造的 PCB。由于 PCB 布局仍是电子设计中的手动瓶颈,加速这一流程使工程师能够以更大幅度的速度迭代、优化和测试新概念。

与此同时,我们更新了 Codex 框架,以大幅加快计算机自动化的速度。结合 Astra 固有的效率,Mind2Web 基准上的任务完成速度是当前 GPT‑5.6 Sol 实现的 1.9 倍。⁴ 这一速度的飞跃使模型能够比人工执行更快地处理大量耗时的个人和专业任务。

GPT‑6 Astra 将先进的计算机自动化与企业环境的专门训练相结合,使其能够应对复杂的职业挑战。它融合了解决复杂问题所需的分析深度,以及执行多步工作流并生成精美文档、电子表格和演示文稿的能力。

在 BenchCAD(该基准评估模型通过生成 CAD 代码从多视图渲染中重建 3D 对象的能力)中,配备工具访问权限的 GPT‑6 Astra 取得了 95.9% 的领先几何重叠率得分。这一成绩优于 GPT‑5.6 Sol(83.3%)和 Claude Fable 5.1(84.3%)。⁵ 在测试的配置中,Astra 的预估 API 成本比 Sol 低约 43%,比 Fable 5.1 低 86%。

Astra 擅长保持模板的一致性,提供专业格式化的幻灯片,并通过结构化叙述简洁地传达关键见解。它生成的文档、演示文稿、电子表格和分析报告严格遵循用户模板,同时反映个人的写作和视觉偏好。此外,Astra 经过优化,仅提取每个输出所需的上下文信息,消除了冗余重复。这确保了生成的即时可用工件精确符合组织标准和商业背景。

如参考文件所示,GPT‑6 Astra 仅使用 OpenAI 公司模板中的几张幻灯片,便创建了一份关于 GPT‑Gaia(一个虚构模型)的演示文稿。输出内容在整个过程中保持了语气和布局的一致性,确保生成的幻灯片系列完全符合商业格式化标准。

在设计网站、游戏、应用程序和 3D 渲染时,Astra 也展现了增强的视觉判断力。通过 ChatGPT 中的 Sites 功能,用户可以直接通过自然语言提示生成、托管和分发网站、网络应用程序和互动游戏。

在建筑可视化方面,Astra 在 Blender 中对住宅结构进行建模,并将其导出为 Unreal Engine 5 中完全可导航的环境,使设计师和客户能够在施工前评估空间布局和沉浸式体验。

该模型为游戏添加了详细的图形、引人入胜的机制和精确的物理效果,赋能非技术用户在几分钟内设计和玩自定义游戏体验,超越基本原型。(图片来源:Pietro Schirano)

当提示包含歧义时,GPT‑6 Astra 在做出合理的编辑和技术判断方面优于其前身。它利用上下文线索来解决常规不确定性,并在结果取决于特定细节时提出有针对性的澄清问题。在 Codex 中,Astra 异步运行:它在等待回复的同时继续独立工作,为非关键项目应用合理的默认值,并且仅在涉及重大决策时才暂停以征求用户批准。

以下示例说明了 Astra 如何在信息不完整可能显著改变最终输出的常规任务中进行协作。

随着工作流的演变,Astra 也保持了卓越的任务导向性。之前的版本有时会将纠正性反馈误解为全新的目标,导致它们放弃初始参数。Astra 无缝整合了新需求,在指示下灵活转向,并在解决旁支查询时不偏离主要目标。

GPT‑6 Astra 迄今为止是软件工程领域的顶级模型。

在 Terminal-Bench 4.0(该测试评估代理在涵盖软件工程、系统配置和数据分析的复杂终端驱动任务中的熟练程度)中,GPT‑6 Astra 创下了 57.9% 的记录。这一成绩超过了 GPT‑5.6 Sol 2(37.3%)和 Claude Fable 5.1(55.8%),同时将每项任务的预估 API 成本分别降低了约 9% 和 63%。

Astra 为 Codex 引入了一种新颖的上下文管理架构,可在上下文窗口达到容量时保留和检索信息。传统上,模型依赖会话压缩来总结调试或大规模重构等延长工作流期间的进展,往往丢弃有关失败补丁或组件行为的关键细微差别。Astra 通过在上下文窗口之间保持持久笔记来规避这一限制,保留细粒度细节而无需重复压缩。关键在于,早期的上下文片段仍完全可搜索,允许 Astra 定位历史要求或工具输出,即使它们未包含在活动笔记中。这项实验性功能目前可通过 Codex 中的 config.toml 文件使用,并将在未来几周对 Astra 默认启用。

GPT‑6 Astra 代表了科学研究、数学和医疗领域的重大飞跃。今天,我们发布了关于 ga

阅读原文