OpenAI完成了GPT-6 Astra的10万块GPU训练运行,代表前沿模型训练规模的重大进展。
OpenAI在2026年9月3日发布了GPT-6 Astra,其中有一个细节穿透了常见的基准测试噪音:据OpenAI总裁格雷格·布罗克曼说,该模型在一次运行中使用超过100,000个GPU进行训练。英伟达首席执行官黄仁勋抓住这个里程碑,宣称"AGI已经到来"。这一声明立即引发了反对。独立基准测试跟踪器显示,Astra在几项指标上与Anthropic的Claude Fable 5.1打平,而不是超越,而硬件分析师质疑英伟达是在宣布真正的技术突破还是在营销自己的GPU。现实更加复杂:Astra代表了一个真实的基础设施里程碑,但其能力还没有达到围绕它的炒作。
**100,000个GPU训练运行内幕**
布罗克曼在9月4日于Stratechery与本·汤普森的采访中详细说明了规模:"这是我们首次在超过100,000个GPU上进行训练,这是一个容易说出的数字,但请想想这个规模。"这项成就不仅仅是平行运行更多芯片;而是在六位数的加速器上协调一个单一的训练工作,而不是在较小的集群之间分割工作。
OpenAI训练研究副总裁艾丹·克拉克解释了这一工程转变:数据中心网络、推理内核和模型架构从一开始就是为了这种规模而一起设计的,而不是后来改装的。据报道,Astra也是第一个OpenAI模型,其早期版本有意义地对训练管道本身做出贡献——这是从纯粹人工策划数据向模型帮助构建下一代的转变。
这个基础设施飞跃是真实的。在一个工作上协调超过100,000个GPU需要网络、冷却和容错工程,大多数人工智能实验室之前没有公开展示过。但它不会自动转化为更广泛的能力领导。
**黄仁勋的"AGI已到来"时刻**
黄仁勋毫不犹豫地将英伟达的品牌附加到这个里程碑上。在一篇公开文章中,他写道:"GPT-6 Astra,在~100K+ NVIDIA Grace Blackwell NVLink72上训练。AGI已经到来。"他将这一飞跃描述为"从ChatGPT到o1再到Astra在4年内"的快速进展,并指出OpenAI已经计划为下一次训练运行带来400,000个GPU上线——增加四倍。
所涉及的硬件是英伟达的Grace Blackwell NVLink72机架,其在机架规模系统中配对Blackwell GPU与Grace CPU,专为协调的多机架训练而设计。对于英伟达来说,将"AGI已到来"与其自身硬件品牌联系起来是一个营销胜利,不论AGI辩论如何解决。关于Astra的每个标题都放大了关于其底层芯片的标题,评论家直接指出了这一动态。TechRadar将黄仁勋的声明描述为更像是对下一代英伟达GPU的推介,而不是中立的技术评估。
**Astra训练地点:Stargate Abilene内部**
训练运行发生在Stargate Abilene,OpenAI在德克萨斯州的旗舰Stargate基础设施校园,由Oracle构建。根据Tom's Hardware,Oracle正在该地点部署英伟达的GB200芯片,每个芯片将两个Blackwell B200 GPU与一个Grace CPU结合在一起。Oracle计划在15年租赁协议下安装超过450,000个GB200 GPU。该地点在2026年中期仍在扩展,更多建筑物上线。
Stargate本身是OpenAI在2025年1月与Oracle和软银宣布的更广泛的5000亿美元多年基础设施计划,目标是在多个美国地点提供大约10吉瓦的人工智能计算能力。Abilene是首个上线的校园,也是OpenAI首次公开承认用超过100,000个GPU同时训练模型的地点。这不是一个理论上的容量计划——这是一个在德克萨斯州今天存在的硬件上运行的真实训练工作,在一个活跃的租赁下。
**GPT-6 Astra的基准分数解读**
OpenAI的系统卡报告Astra饱和了其几项最难的内部评估。该模型在ARC-AGI-3(抽象视觉推理测试)上获得99.9%的分数,在FrontierMath Tier 4(设计用于抵抗记忆的数学问题)上获得97.6%的分数。在ExploitBench(进攻性网络安全能力的内部测量)上,Astra获得100%。在OSWorld 2.0(自主计算机使用的基准)上,Astra获得72.6%的分数,平均完成任务约需40分钟,而GPT-5.6 Sol则为65.7%,每项任务约需75分钟。
独立评估者呈现了一幅更加混杂的图景。在Artificial Analysis Intelligence Index(第三方推理、知识和编码分数的汇总)上,Astra达到61.2,大致与GPT-5.6 Sol的60.9相当,落后于Claude Fable 5.1的65.7。在Deep SWE(软件工程基准)上,Astra的结果约在74.1%,领先于Sol的72.7%,但在可比较的Gemini Flash模型的73.8%范围内。模式:Astra在数学和网络能力上明显获胜,在一般编码上大致相当,而不是全面领导。
| 基准测试 | GPT-6 Astra | 最接近的比较 | 比较模型 |
|---|---|---|---|
| ARC-AGI-3(抽象推理) | 99.9% | 竞争对手尚未发布 | — |
| FrontierMath Tier 4(数学) | 97.6% | 竞争对手尚未发布 | — |
| ExploitBench(进攻性网络安全) | 100% | 竞争对手尚未发布 | — |
| OSWorld 2.0(计算机使用) | 72.6%(约40分钟/任务) | 65.7%(约75分钟/任务) | GPT-5.6 Sol |
| Deep SWE(编码) | ~74.1% | 73.8% | Gemini Flash层级模型 |
| Terminal-Bench 4.0 | 57.7% | 55.8% | Claude Fable 5.1 |
| Artificial Analysis Intelligence Index | 61.2 | 65.7(领先) | Claude Fable 5.1 |
**首个"关键"网络能力评级**
Astra的基准表附带了警告标签。根据OpenAI的准备框架,Astra是第一个达到网络安全能力"关键"等级的OpenAI模型,这意味着使用正确的工具和访问权限,它可以找到之前未知的安全漏洞并开发新的[源文章文本在此处被截断]