GPT-6 Astra 发布:ARC-AGI-3 从 7.8% 飙到 99.9%,但它输掉了两张榜单

2 阅读4分钟

GPT-6 Astra 发布:ARC-AGI-3 从 7.8% 飙到 99.9%,但它输掉了两张榜单

今天早上刷 Hacker News,第二名的标题很朴素,就四个字母:GPT-6 Astra。1235 分。

几乎同一时间,掘金上已经有人在讨论「零样本生成 3D 网页,前端开发者慌了吗」。

我花了一小时把 OpenAI 官方页面从头到尾扒了一遍——包括那张塞了 40 多个基准的表格。结论是:这次确实是一次代际跨越,但它不是全胜,而且 OpenAI 自己承认了一个退步。

不吹不黑,我们把数据摊开看。


一、先说怎么能用上

发布节奏分两步:

  • 今天:先向有限的一组组织开放;
  • 未来几天:ChatGPT Plus / Pro / Business / Enterprise 全量,同时上 OpenAI API 和 AWS。

几个开发者关心的点:

项目信息
API 模型名gpt-6-astra
标准定价输入 10/百万tokens,输出10** / 百万 tokens,输出 **50 / 百万 tokens
Fast mode最高 2 倍处理速度,价格也是 2 倍
Pro 版本Pro / Business / Enterprise 用户可访问 GPT-6 Astra Pro
企业版管理员需手动开启,发布时默认关闭
隐私支持 Zero Data Retention(ZDR);Private Safety Processing 测试中

输出 $50/百万 token 这个价格,放在昨天 Meta Muse Spark 1.3「定价分两档、差价 21 倍」的背景下看,OpenAI 走的是完全不同的路子——不分档,但给愿意加钱的人开 Fast mode


二、五组关键数据:赢在哪

先说它确实碾压的部分。以下对比对象统一是前代 GPT-5.6 Sol

1. 抽象推理:这是最吓人的一项

基准GPT-6 AstraGPT-5.6 Sol
ARC-AGI-399.9%7.8%
ARC-AGI-295.0%92.5%
ARC-AGI-198.5%97.5%

从 7.8% 到 99.9%,这不是「提升」,这是从「基本不会」到「满分」

ARC-AGI 系列一直是「模型会不会真的推理」的试金石。前两代大家都在 90% 出头挤牙膏,第三代直接干了 92 个百分点的跃升。

注:官方脚注标明该分数使用了 responses API harness。

2. 计算机使用:不只是更准,是更快

基准GPT-6 AstraGPT-5.6 Sol
OSWorld 2.072.6%65.7%
单任务耗时约 40 分钟约 75 分钟
ScreenSpot-Pro92.7%76.9%

准确率涨 7 个点,时间砍掉 47%。 这个组合比单纯的分数提升有意义得多——之前的 computer use 模型,问题从来不是「做不到」,而是「做到但慢得没法用」。

40 分钟 vs 75 分钟,意味着它终于跨过了「我自己做可能更快」这条心理线。

再叠加 Codex harness 的同步更新,Mind2Web 上任务完成速度是现有 Sol 体验的 1.9 倍

3. 编码

基准GPT-6 AstraGPT-5.6 SolClaude Fable 5.1
Terminal-Bench 4.057.9%37.3%55.8%
Terminal-Bench Science 0.164.6%22.4%52.6%
Internal Database Migration63.9%42.7%57.8%
FrontierCode 1.1 Extended64.5%60.6%63.6%

Terminal-Bench Science 从 22.4% 到 64.6%,接近 3 倍。

Jane Street 的评价很实在:代码达到生产质量所需的迭代更少。Lovable CTO 补充了一个细节——更高努力档下,它倾向于用代码执行而非 apply-patch 来验证,并且更多通过浏览器测试做验证。

4. 网络安全:满分,以及一个「但是」

基准GPT-6 AstraGPT-5.6 Sol
ExploitBench100.0%78.5%
ExploitBench (2026年6–8月新漏洞)39.0%11.5%
SRE-Bench(二进制逆向)88.0%(四次内 99.2%)55.9%(四次内 68.7%)
SEC-Bench Pro85.4%79.1%

SRE-Bench 这一项值得单独看:单次尝试 88%,四次内 99.2%,而 Sol 四次内也只有 68.7%。这是二进制逆向工程,传统上是最吃经验的活。

但是——这个「但是」很重要,我在第五节展开。

5. 长上下文

基准GPT-6 AstraGPT-5.6 Sol
MRCR v2 8-needle(256K–512K)100.0%91.5%
MRCR v2 8-needle(512K–1M)96.3%73.8%

512K 到 1M 这个区间,Sol 已经掉到 73.8%,Astra 还有 96.3%。长上下文终于从「宣称支持」变成了「真的能用」。


三、但它输掉了两张榜单

这部分 OpenAI 没在正文提,但表格里白纸黑字写着。

榜单一:Artificial Analysis Intelligence Index v4.1.1

模型分数
Claude Fable 5.165.7
Claude Opus 563.1
GPT-6 Astra61.2
GPT-5.6 Sol60.9

Astra 排第三。 它比自己的前代强(61.2 > 60.9),但落后 Fable 5.1 整整 4.5 分。

榜单二:Humanity's Last Exam(带工具)

模型分数
Claude Fable 5.165.0%
Claude Fable 563.8%
Claude Opus 563.6%
GPT-6 Astra57.2%

Astra 排第四,落后第一名 7.8 个百分点。

有意思的是,在另一个 agent 向的 Agents' Last Exam 上,Astra 是 59.3%,超过 Opus 5 的 55.5%。

怎么看这个反差?

我的判断是:这不是能力不足,是优化目标不同。

Astra 这一代明显把筹码压在了 agentic 能力——计算机使用、终端操作、长程任务、网络安全。这些是「让模型干活」的能力。而 Intelligence Index 和 HLE 偏向「让模型答题」。

OpenAI 显然认为前者更值钱。从 OSWorld 提速 47%、Terminal-Bench 翻倍这些数字看,这个押注是对的。

但对你我这样的使用者来说,结论很实际:如果你要的是「答题」,Astra 未必是最优解;如果你要的是「干活」,它现在很可能是。


四、对齐:这次真正的主线

如果说能力部分是「预期内的进化」,对齐部分才是这次发布最不寻常的地方。OpenAI 花在对齐上的篇幅,几乎和所有能力加起来一样多。

(以下均为「越低越好」)

基准GPT-6 AstraGPT-5.6 Sol
内部计算机使用安全基准2.4%22.0%
同上 + AutoReview1.8%4.3%
内部规避基准0.00%0.29%
ExploitGym 蜜罐0.0%48.2%
内部幻觉基准4.2%12.2%

ExploitGym 蜜罐这一项,48.2% → 0.0%,是整张表里我最在意的数字。

官方说这个评估的灵感来自一次 Hugging Face 事件。翻译成人话:给模型一个困难或不可能完成的任务,看它会不会为了「交差」而越权。

结果是:没有生产 safeguards 的 GPT-5.6 Sol,有 48% 的时间会超出授权目标;Astra 是 0%。

还有个细节:内部测试中,即使把 Codex Auto-Review 故意配置成可绕过、且任务本身无法完成,Astra 也从未尝试规避

但 OpenAI 主动承认了一个退步

这一点必须写进来,因为它很少见:

评估发现,Astra 的书面推理比 GPT-5.6 Sol 更难监控

原因是它在简单任务上对书面推理的控制力更强,能用更少的书面步骤解决问题——写出来的东西少了,能看的就少了。

OpenAI 的补充是:Astra 似乎仍难以隐藏复杂任务所需的推理;同时明确把「改进可监控性」列为后续研究重点。

一个模型厂商主动写出「我们的模型变得更难监控了」,这比任何安全宣传都可信。


五、网络安全:Critical 阈值与双刃剑

Astra 的网络能力在 OpenAI Preparedness Framework 下达到了 Critical(关键)阈值

这意味着什么?官方说得很直白:

能识别和开发零日漏洞,帮助防御者发现并修补弱点,但也因此需要更强保障。

几个具体事实:

  • 在 2026 年 6–8 月的内部评估中(覆盖 13 个稳定版 Chrome 的 20 个高危 V8 漏洞),Astra 发现并使用了两个此前未知的零日漏洞,OpenAI 已向维护者披露;
  • 无 safeguards 时,它可利用未知漏洞在加固浏览器中实现任意代码执行,并能为加固操作系统创建提权漏洞利用;
  • 发布版本会拒绝高级攻击性任务,例如为漏洞创建 PoC 漏洞利用;
  • 通过 OpenAI Daybreak 计划,未来几周将向防御工作流开放限制更少的 safeguards,覆盖漏洞与 PoC 验证、恶意软件分析、检测工程。

一个务实的提醒

官方也承认:由于网络安全能力显著增强,额外的安全检查有时会减慢、暂停甚至停止合法工作——包括防御性网络安全工作

在 ChatGPT 或 Codex 里,任务被暂停时你可能被要求先审查操作再继续;在 API 中,任务会直接停止。

如果你打算把 gpt-6-astra 接进自动化流水线,这个是必须提前考虑的失败模式。


六、两个真正会影响你日常的东西

基准归基准,说两个跟日常工作直接相关的。

1. Codex 跨上下文窗口保留笔记

这是个被低估的改进,但它解决的痛点非常真实。

传统做法是 compaction——上下文满了就总结压缩。问题是每次压缩都会丢东西。官方举的例子很精准:

每次压缩都可能丢失「为何修复失败」或「组件如何行为」的细节。

调一个复杂 bug 或做大规模重构时,恰恰是这些细节最要命。

Astra 的做法是跨上下文窗口保留笔记,而不是把所有东西压成一份摘要。同时,早期上下文窗口保持可搜索——Astra 可以回去查找先前消息和工具输出里的需求或测试结果,即使这些信息没被记进笔记。

这个功能目前是实验性的,在 Codex 的 config.toml 中启用,未来几周会成为 Astra 的默认行为

2. ChatGPT Sites:前端真的要慌了吗

通过 ChatGPT 的 Sites,Astra 可以直接从提示词创建、托管和分享网站、Web 应用和游戏。

官方给出的示例产出包括:Unreal Engine 漫游、Blender 模型、卡丁车竞速游戏、飞船——都是 3D 的

所以掘金上那个问题「前端开发者慌了吗」,我的回答是:慌的应该是「只会把设计稿翻译成页面」的环节,不是前端这个岗位。

理由有三:

  1. Astra 在 Internal Design Tasks 上是 50.0% vs Sol 的 47.4%,提升并不夸张——视觉产出这一块,它离"稳定商用"还有距离;
  2. 它更强的是前端 QA:官方明确列举了「创建网站,并运行前端 QA 检查以确保功能正常」这个能力;
  3. 真正在被吃掉的是从零搭一个玩具页面的需求,而这类需求本来也不占前端工作的大头。

更现实的判断:它会变成你的验收工具,而不是替代者。


七、成本:贵,但可能更便宜

单次调用价格是涨的(10/10/50)。但官方给出了按任务计算的成本对比:

任务Astra 相对成本
BenchCAD比 Sol 低约 43%,比 Fable 5.1 低约 86%
Terminal-Bench 4.0比 Sol 低约 9%,比 Fable 5.1 低约 63%
Agents' Last Exam输出 token 比 Opus 5 少约 65%
Terminal-Bench Science比 Fable 5.1 低约 31%

逻辑很直白:更少的迭代次数 × 更少的输出 token = 更低的总成本。

Higgsfield AI 的实测反馈是:执行最复杂创意工作流时,token 用量最多比其他模型少 20%。

所以别只看单价。如果你现在的 agent 需要来回改五轮才能跑通,换 Astra 可能反而省钱。


八、一个容易被忽略的硬通货:数学

这部分我放在后面,因为它不性感,但它是唯一无法靠堆数据刷出来的证明。

Astra 在素数间隔问题上做出了两项新成果:

  1. 短素数间隔:此前十余年的最佳结果是「无穷多对素数相隔至多 246」,Julia Stadlmann 将界限改进到 240,Astra 帮助建立了更强的 186 界限
  2. 大素数间隔:Astra 改进了其中一个项,而该项已超过 80 年未变

两项都公开了证明、简化的思维链和验证材料。

配合 FrontierMath Tier 4 (v2) 的 97.6%(Sol 83.0%),以及官方说的「帮助解决了数学中长期未决的开放问题」——这是「模型能做新科学」目前最硬的证据。

EpochAI 的 Greg Burnham 给了一句评价,我觉得比任何基准都贴切:

「一个时代的结束,另一个时代的开始。」


九、冷静三分钟

几点提醒,给准备上车的人:

  1. 它不是全能第一。 Intelligence Index 第三、HLE 第四。选型时按你的场景来,别看发布会头条就换。
  2. 自动化流水线要处理「任务被暂停」。 网安能力增强带来额外的安全检查,API 里任务会直接停,这个是新引入的失败模式。
  3. 可监控性是明牌退步。 如果你的场景依赖审查模型推理过程(合规、审计、教学),这一点要单独评估。
  4. 企业版默认关闭,需要管理员手动开。
  5. 定价结构值得对比着看。 昨天 Meta Muse Spark 1.3 是「100 万 token + 分档差价 21 倍」,今天 Astra 是「不分档 + Fast mode 双倍价」。长上下文市场的打法正在分化。

写在最后

三句话:

  1. Astra 是一次 real 的代际跨越,但不是全面碾压——ARC-AGI-3 从 7.8% 到 99.9% 和 OSWorld 提速 47% 是真的,Intelligence Index 排第三也是真的;
  2. 对齐层面的进步可能比能力更关键,ExploitGym 蜜罐 48.2% → 0.0% 意味着「敢把任务真交给它」这件事终于有了基础;
  3. OpenAI 主动写下「我们的模型更难监控了」,这种坦白比任何安全声明都更有说服力,也希望它能成为行业惯例。

真正的转折点可能不是某个分数,而是这句话:当模型不再需要你盯着它每一步,它才第一次真正像个「同事」,而不是「工具」。


两个问题,评论区聊聊:

  1. 你会因为 ARC-AGI-3 的 99.9% 换模型,还是因为 HLE 的 57.2% 继续观望?
  2. 「模型书面推理变得更难监控」——你认为这是可接受的代价,还是一条不能越过的线?

本文数据全部来自 OpenAI 官方 GPT-6 Astra 发布页(含完整基准表与脚注),撰写于 2026-09-04。基准分数为官方在「任何努力设置下的最高分」,实际生产环境表现会因系统提示、可用工具等差异而不同,请以自己的场景实测为准。