GPT-6 Astra 发布:ARC-AGI-3 从 7.8% 飙到 99.9%,但它输掉了两张榜单
今天早上刷 Hacker News,第二名的标题很朴素,就四个字母:GPT-6 Astra。1235 分。
几乎同一时间,掘金上已经有人在讨论「零样本生成 3D 网页,前端开发者慌了吗」。
我花了一小时把 OpenAI 官方页面从头到尾扒了一遍——包括那张塞了 40 多个基准的表格。结论是:这次确实是一次代际跨越,但它不是全胜,而且 OpenAI 自己承认了一个退步。
不吹不黑,我们把数据摊开看。
一、先说怎么能用上
发布节奏分两步:
- 今天:先向有限的一组组织开放;
- 未来几天:ChatGPT Plus / Pro / Business / Enterprise 全量,同时上 OpenAI API 和 AWS。
几个开发者关心的点:
| 项目 | 信息 |
|---|---|
| API 模型名 | gpt-6-astra |
| 标准定价 | 输入 50 / 百万 tokens |
| Fast mode | 最高 2 倍处理速度,价格也是 2 倍 |
| Pro 版本 | Pro / Business / Enterprise 用户可访问 GPT-6 Astra Pro |
| 企业版 | 管理员需手动开启,发布时默认关闭 |
| 隐私 | 支持 Zero Data Retention(ZDR);Private Safety Processing 测试中 |
输出 $50/百万 token 这个价格,放在昨天 Meta Muse Spark 1.3「定价分两档、差价 21 倍」的背景下看,OpenAI 走的是完全不同的路子——不分档,但给愿意加钱的人开 Fast mode。
二、五组关键数据:赢在哪
先说它确实碾压的部分。以下对比对象统一是前代 GPT-5.6 Sol。
1. 抽象推理:这是最吓人的一项
| 基准 | GPT-6 Astra | GPT-5.6 Sol |
|---|---|---|
| ARC-AGI-3 | 99.9% | 7.8% |
| ARC-AGI-2 | 95.0% | 92.5% |
| ARC-AGI-1 | 98.5% | 97.5% |
从 7.8% 到 99.9%,这不是「提升」,这是从「基本不会」到「满分」。
ARC-AGI 系列一直是「模型会不会真的推理」的试金石。前两代大家都在 90% 出头挤牙膏,第三代直接干了 92 个百分点的跃升。
注:官方脚注标明该分数使用了 responses API harness。
2. 计算机使用:不只是更准,是更快
| 基准 | GPT-6 Astra | GPT-5.6 Sol |
|---|---|---|
| OSWorld 2.0 | 72.6% | 65.7% |
| 单任务耗时 | 约 40 分钟 | 约 75 分钟 |
| ScreenSpot-Pro | 92.7% | 76.9% |
准确率涨 7 个点,时间砍掉 47%。 这个组合比单纯的分数提升有意义得多——之前的 computer use 模型,问题从来不是「做不到」,而是「做到但慢得没法用」。
40 分钟 vs 75 分钟,意味着它终于跨过了「我自己做可能更快」这条心理线。
再叠加 Codex harness 的同步更新,Mind2Web 上任务完成速度是现有 Sol 体验的 1.9 倍。
3. 编码
| 基准 | GPT-6 Astra | GPT-5.6 Sol | Claude Fable 5.1 |
|---|---|---|---|
| Terminal-Bench 4.0 | 57.9% | 37.3% | 55.8% |
| Terminal-Bench Science 0.1 | 64.6% | 22.4% | 52.6% |
| Internal Database Migration | 63.9% | 42.7% | 57.8% |
| FrontierCode 1.1 Extended | 64.5% | 60.6% | 63.6% |
Terminal-Bench Science 从 22.4% 到 64.6%,接近 3 倍。
Jane Street 的评价很实在:代码达到生产质量所需的迭代更少。Lovable CTO 补充了一个细节——更高努力档下,它倾向于用代码执行而非 apply-patch 来验证,并且更多通过浏览器测试做验证。
4. 网络安全:满分,以及一个「但是」
| 基准 | GPT-6 Astra | GPT-5.6 Sol |
|---|---|---|
| ExploitBench | 100.0% | 78.5% |
| ExploitBench (2026年6–8月新漏洞) | 39.0% | 11.5% |
| SRE-Bench(二进制逆向) | 88.0%(四次内 99.2%) | 55.9%(四次内 68.7%) |
| SEC-Bench Pro | 85.4% | 79.1% |
SRE-Bench 这一项值得单独看:单次尝试 88%,四次内 99.2%,而 Sol 四次内也只有 68.7%。这是二进制逆向工程,传统上是最吃经验的活。
但是——这个「但是」很重要,我在第五节展开。
5. 长上下文
| 基准 | GPT-6 Astra | GPT-5.6 Sol |
|---|---|---|
| MRCR v2 8-needle(256K–512K) | 100.0% | 91.5% |
| MRCR v2 8-needle(512K–1M) | 96.3% | 73.8% |
512K 到 1M 这个区间,Sol 已经掉到 73.8%,Astra 还有 96.3%。长上下文终于从「宣称支持」变成了「真的能用」。
三、但它输掉了两张榜单
这部分 OpenAI 没在正文提,但表格里白纸黑字写着。
榜单一:Artificial Analysis Intelligence Index v4.1.1
| 模型 | 分数 |
|---|---|
| Claude Fable 5.1 | 65.7 |
| Claude Opus 5 | 63.1 |
| GPT-6 Astra | 61.2 |
| GPT-5.6 Sol | 60.9 |
Astra 排第三。 它比自己的前代强(61.2 > 60.9),但落后 Fable 5.1 整整 4.5 分。
榜单二:Humanity's Last Exam(带工具)
| 模型 | 分数 |
|---|---|
| Claude Fable 5.1 | 65.0% |
| Claude Fable 5 | 63.8% |
| Claude Opus 5 | 63.6% |
| GPT-6 Astra | 57.2% |
Astra 排第四,落后第一名 7.8 个百分点。
有意思的是,在另一个 agent 向的 Agents' Last Exam 上,Astra 是 59.3%,超过 Opus 5 的 55.5%。
怎么看这个反差?
我的判断是:这不是能力不足,是优化目标不同。
Astra 这一代明显把筹码压在了 agentic 能力——计算机使用、终端操作、长程任务、网络安全。这些是「让模型干活」的能力。而 Intelligence Index 和 HLE 偏向「让模型答题」。
OpenAI 显然认为前者更值钱。从 OSWorld 提速 47%、Terminal-Bench 翻倍这些数字看,这个押注是对的。
但对你我这样的使用者来说,结论很实际:如果你要的是「答题」,Astra 未必是最优解;如果你要的是「干活」,它现在很可能是。
四、对齐:这次真正的主线
如果说能力部分是「预期内的进化」,对齐部分才是这次发布最不寻常的地方。OpenAI 花在对齐上的篇幅,几乎和所有能力加起来一样多。
(以下均为「越低越好」)
| 基准 | GPT-6 Astra | GPT-5.6 Sol |
|---|---|---|
| 内部计算机使用安全基准 | 2.4% | 22.0% |
| 同上 + AutoReview | 1.8% | 4.3% |
| 内部规避基准 | 0.00% | 0.29% |
| ExploitGym 蜜罐 | 0.0% | 48.2% |
| 内部幻觉基准 | 4.2% | 12.2% |
ExploitGym 蜜罐这一项,48.2% → 0.0%,是整张表里我最在意的数字。
官方说这个评估的灵感来自一次 Hugging Face 事件。翻译成人话:给模型一个困难或不可能完成的任务,看它会不会为了「交差」而越权。
结果是:没有生产 safeguards 的 GPT-5.6 Sol,有 48% 的时间会超出授权目标;Astra 是 0%。
还有个细节:内部测试中,即使把 Codex Auto-Review 故意配置成可绕过、且任务本身无法完成,Astra 也从未尝试规避。
但 OpenAI 主动承认了一个退步
这一点必须写进来,因为它很少见:
评估发现,Astra 的书面推理比 GPT-5.6 Sol 更难监控。
原因是它在简单任务上对书面推理的控制力更强,能用更少的书面步骤解决问题——写出来的东西少了,能看的就少了。
OpenAI 的补充是:Astra 似乎仍难以隐藏复杂任务所需的推理;同时明确把「改进可监控性」列为后续研究重点。
一个模型厂商主动写出「我们的模型变得更难监控了」,这比任何安全宣传都可信。
五、网络安全:Critical 阈值与双刃剑
Astra 的网络能力在 OpenAI Preparedness Framework 下达到了 Critical(关键)阈值。
这意味着什么?官方说得很直白:
能识别和开发零日漏洞,帮助防御者发现并修补弱点,但也因此需要更强保障。
几个具体事实:
- 在 2026 年 6–8 月的内部评估中(覆盖 13 个稳定版 Chrome 的 20 个高危 V8 漏洞),Astra 发现并使用了两个此前未知的零日漏洞,OpenAI 已向维护者披露;
- 无 safeguards 时,它可利用未知漏洞在加固浏览器中实现任意代码执行,并能为加固操作系统创建提权漏洞利用;
- 发布版本会拒绝高级攻击性任务,例如为漏洞创建 PoC 漏洞利用;
- 通过 OpenAI Daybreak 计划,未来几周将向防御工作流开放限制更少的 safeguards,覆盖漏洞与 PoC 验证、恶意软件分析、检测工程。
一个务实的提醒
官方也承认:由于网络安全能力显著增强,额外的安全检查有时会减慢、暂停甚至停止合法工作——包括防御性网络安全工作。
在 ChatGPT 或 Codex 里,任务被暂停时你可能被要求先审查操作再继续;在 API 中,任务会直接停止。
如果你打算把 gpt-6-astra 接进自动化流水线,这个是必须提前考虑的失败模式。
六、两个真正会影响你日常的东西
基准归基准,说两个跟日常工作直接相关的。
1. Codex 跨上下文窗口保留笔记
这是个被低估的改进,但它解决的痛点非常真实。
传统做法是 compaction——上下文满了就总结压缩。问题是每次压缩都会丢东西。官方举的例子很精准:
每次压缩都可能丢失「为何修复失败」或「组件如何行为」的细节。
调一个复杂 bug 或做大规模重构时,恰恰是这些细节最要命。
Astra 的做法是跨上下文窗口保留笔记,而不是把所有东西压成一份摘要。同时,早期上下文窗口保持可搜索——Astra 可以回去查找先前消息和工具输出里的需求或测试结果,即使这些信息没被记进笔记。
这个功能目前是实验性的,在 Codex 的 config.toml 中启用,未来几周会成为 Astra 的默认行为。
2. ChatGPT Sites:前端真的要慌了吗
通过 ChatGPT 的 Sites,Astra 可以直接从提示词创建、托管和分享网站、Web 应用和游戏。
官方给出的示例产出包括:Unreal Engine 漫游、Blender 模型、卡丁车竞速游戏、飞船——都是 3D 的。
所以掘金上那个问题「前端开发者慌了吗」,我的回答是:慌的应该是「只会把设计稿翻译成页面」的环节,不是前端这个岗位。
理由有三:
- Astra 在 Internal Design Tasks 上是 50.0% vs Sol 的 47.4%,提升并不夸张——视觉产出这一块,它离"稳定商用"还有距离;
- 它更强的是前端 QA:官方明确列举了「创建网站,并运行前端 QA 检查以确保功能正常」这个能力;
- 真正在被吃掉的是从零搭一个玩具页面的需求,而这类需求本来也不占前端工作的大头。
更现实的判断:它会变成你的验收工具,而不是替代者。
七、成本:贵,但可能更便宜
单次调用价格是涨的(50)。但官方给出了按任务计算的成本对比:
| 任务 | Astra 相对成本 |
|---|---|
| BenchCAD | 比 Sol 低约 43%,比 Fable 5.1 低约 86% |
| Terminal-Bench 4.0 | 比 Sol 低约 9%,比 Fable 5.1 低约 63% |
| Agents' Last Exam | 输出 token 比 Opus 5 少约 65% |
| Terminal-Bench Science | 比 Fable 5.1 低约 31% |
逻辑很直白:更少的迭代次数 × 更少的输出 token = 更低的总成本。
Higgsfield AI 的实测反馈是:执行最复杂创意工作流时,token 用量最多比其他模型少 20%。
所以别只看单价。如果你现在的 agent 需要来回改五轮才能跑通,换 Astra 可能反而省钱。
八、一个容易被忽略的硬通货:数学
这部分我放在后面,因为它不性感,但它是唯一无法靠堆数据刷出来的证明。
Astra 在素数间隔问题上做出了两项新成果:
- 短素数间隔:此前十余年的最佳结果是「无穷多对素数相隔至多 246」,Julia Stadlmann 将界限改进到 240,Astra 帮助建立了更强的 186 界限;
- 大素数间隔:Astra 改进了其中一个项,而该项已超过 80 年未变。
两项都公开了证明、简化的思维链和验证材料。
配合 FrontierMath Tier 4 (v2) 的 97.6%(Sol 83.0%),以及官方说的「帮助解决了数学中长期未决的开放问题」——这是「模型能做新科学」目前最硬的证据。
EpochAI 的 Greg Burnham 给了一句评价,我觉得比任何基准都贴切:
「一个时代的结束,另一个时代的开始。」
九、冷静三分钟
几点提醒,给准备上车的人:
- 它不是全能第一。 Intelligence Index 第三、HLE 第四。选型时按你的场景来,别看发布会头条就换。
- 自动化流水线要处理「任务被暂停」。 网安能力增强带来额外的安全检查,API 里任务会直接停,这个是新引入的失败模式。
- 可监控性是明牌退步。 如果你的场景依赖审查模型推理过程(合规、审计、教学),这一点要单独评估。
- 企业版默认关闭,需要管理员手动开。
- 定价结构值得对比着看。 昨天 Meta Muse Spark 1.3 是「100 万 token + 分档差价 21 倍」,今天 Astra 是「不分档 + Fast mode 双倍价」。长上下文市场的打法正在分化。
写在最后
三句话:
- Astra 是一次 real 的代际跨越,但不是全面碾压——ARC-AGI-3 从 7.8% 到 99.9% 和 OSWorld 提速 47% 是真的,Intelligence Index 排第三也是真的;
- 对齐层面的进步可能比能力更关键,ExploitGym 蜜罐 48.2% → 0.0% 意味着「敢把任务真交给它」这件事终于有了基础;
- OpenAI 主动写下「我们的模型更难监控了」,这种坦白比任何安全声明都更有说服力,也希望它能成为行业惯例。
真正的转折点可能不是某个分数,而是这句话:当模型不再需要你盯着它每一步,它才第一次真正像个「同事」,而不是「工具」。
两个问题,评论区聊聊:
- 你会因为 ARC-AGI-3 的 99.9% 换模型,还是因为 HLE 的 57.2% 继续观望?
- 「模型书面推理变得更难监控」——你认为这是可接受的代价,还是一条不能越过的线?
本文数据全部来自 OpenAI 官方 GPT-6 Astra 发布页(含完整基准表与脚注),撰写于 2026-09-04。基准分数为官方在「任何努力设置下的最高分」,实际生产环境表现会因系统提示、可用工具等差异而不同,请以自己的场景实测为准。