GPT-6 Astra 这次已经不像一次常规升级。
它在 ARC-AGI-3 上拿到 99.9%,离满分只差 0.1%。GPT-6 Astra 在 96% 的关卡行动中的效率超过人类水平。
OpenAI 则把它称最聪明、最对齐的模型,几乎接近 AGI。
GPT-6 三张成绩单,几乎都到顶
ARC-AGI-3 不是知识问答,而是让模型进入陌生环境,自己探索规则、判断目标并完成任务。GPT-5.6 Sol 得分只有 7.8%,而 GPT-5.6 Astra 则达到 99.9%。
这里有个关键前提:99.9% 是在 Provider Adapter harness 下取得的,这套测试会保留模型的隐式推理状态,并通过上下文压缩延续任务。
FrontierMath Tier 4 得分 97.6%,ExploitBench 为 100%。
在另一项覆盖 2026 年 6 月至 8 月新漏洞的内部评测中,它还发现并利用了两个此前未知的零日漏洞,OpenAI 称正在向维护方披露。
跑分之外,GPT-6 自己干活更丝滑
Astra 能直接操作浏览器和软件,填在线表单、更新 CRM、整理日历,也能按照现有模板制作文档、表格和演示文稿。
在 OSWorld 2.0 的延迟模拟中,Astra 每项任务约用 40 分钟。而 GPT-5.6 Sol 约用 75 分钟,同比耗时减少约 47%。
可见 GPT-5.6 Astra 也更擅长处理中途追加的新要求,同时保留原任务的约束和方向。
GPT-6 Astra 首批只向少量组织开放,不对个人开放。
Plus、Pro、Business、Enterprise 和 API 用户会在随后几天陆续获得。暂时看不到很正常,没必要购买所谓的“抢先账号”。
为了不错过 GPT、Claude、Gemini、Grok、DeepSeek 和 AI 工具的重要更新与实用教程,请关注👆
你觉得这是 AGI 真要来了,还是一次被测试条件放大的高分?
欢迎在评论区留下你的判断,也给其他读者一个参考。