GPT-6 Astra来了,OpenAI总裁说AGI时代到了
一个能自己操作电脑、写代码、做科研的AI,意味着什么?
当地时间9月3日,OpenAI正式发布了GPT-6 Astra。
名字Astra在拉丁语里是“星辰、群星”的意思。发布前几天,ChatGPT官方账号发了一条预告:“The stars are almost aligned”——星星几乎排列好了。
旧金山发布会现场,OpenAI总裁格雷格·布罗克曼说了一句在AI行业极为罕见的话:“欢迎来到AGI时代。”
他甚至说得更直白:“如果几年以后回头追问,AGI究竟在什么时候诞生,我想答案大概就在这段时间,甚至可能就是这个模型……就我个人而言,我认为我们已经达到了。”
这话从一个AI公司总裁嘴里说出来,分量不太一样。
它到底能做什么?
Astra跟以前的模型有个根本区别——它不光是“回答问题”,而是直接“动手干活” 。
你可以直接告诉它一个目标,比如“帮我整理一份财务分析并做成演示文稿”,或者“开发一个游戏原型并测试它能不能正常运行”。它会自己拆解任务、调用工具、一步步执行,最后把结果交给你。
具体来说:
- 操作电脑:自己填网页表单、更新CRM客户记录、整理日历、做网络研究,然后把结果写进邮件或文档。
- 写代码做科研:分析科学数据、生成图表、搭建网站、运行前端测试、自己安装和测试软件。
- 专业软件操作:能在KiCad和FreeCAD这类工程软件里工作。
- 做PPT和表格:按照你给的模板和要求生成文档、电子表格、演示文稿。
Sam Altman说这是第一个让他觉得可以放心让用户直接“试一试”的模型——用户可以让它构建复杂互动软件、开发电脑游戏、进行DIY电子工程、运行科学模拟。
跑分有多夸张?
OpenAI公布了一组数据,有些数字确实离谱:
ARC-AGI-3(被很多人视为AGI“终极考卷”的测试):Astra拿了99.9%,而GPT-5.6 Sol只有7.8%。
FrontierMath Tier 4(研究级数学测试):97.6%。
网络安全漏洞利用测试ExploitBench:100%。
OSWorld 2.0(电脑操作测试):72.6%,上一代65.7%;完成任务时间从75分钟缩短到40分钟,效率提升约47%。
AutomationBench(业务流程自动化):41.4%,上一代只有18.1%。
OpenAI说Astra已经帮数学领域解决了一些长期存在的开放性问题,包括在素数间隔研究中取得了两个新的理论结果。
怎么做到这么强的?
技术层面有几个关键点。
训练规模:Astra用了超过10万块GPU,在得州Stargate基地完成训练。
推理能力可调:支持low、medium、high、xhigh和max五档推理强度。简单问题用低档省成本,复杂问题开高档深度思考。
上下文窗口:105万token,最高输出12.8万token。知识截止到2026年4月30日。
符号世界模型:ARC Prize官方复盘Astra后台记录发现,它在处理陌生环境时不是瞎试错,而是自己生成一套符号系统来理解世界规则。它会先在自己脑子里模拟推演,确认逻辑没问题了再动手。
“循环深度”技术:据The Information报道,Astra可能引入了recurrent depth技术,让模型在输出下一个token前完成更多内部计算——少说、多想。
安全:能干活,也得看得住
能力越强,风险越大。OpenAI在安全上花了不少功夫。
Astra是OpenAI第一个达到内部“关键”(Critical)网络安全能力门槛的模型。这个级别的模型能在较少人工干预下发现未知软件漏洞并开发攻击方法。
内部测试中,Astra发现并利用了两个零日漏洞。所以最前沿的网络安全能力不会全面开放,只提供给网络防御机构。
OpenAI还专门设计了一项测试:在极其困难、几乎无法完成的任务面前,模型会不会为了达成目标而擅自突破用户授权边界?没有安全措施的情况下,GPT-5.6 Sol有48%的情况会越界,Astra这个数字是0%。
发布前,OpenAI一度放慢了部分开发工作来加强安全措施。今年8月初就有媒体曝出Astra的消息,但OpenAI选择先做安全再发布。
价格:性能上去了,钱包受得了吗?
Astra的API定价是每百万输入token 10美元、输出50美元。
对比一下:这是GPT-5.6 Sol当前价格的2.5倍。跟Anthropic刚发布的Claude Fable 5.1定价持平。
如果输入超过27.2万token,整次请求的价格还会翻倍,输出涨到75美元。快速模式(Fast mode)速度翻倍,但价格也翻倍。
缓存读取有90%折扣,缓存写入加收25%溢价。
第三方评测怎么说?
OpenAI自己的数据当然好看。第三方机构Artificial Analysis的测试给官方叙事降了点温。
在通用智能综合指数上,Astra拿61分,跟GPT-5.6 Sol持平,但低于Claude Fable 5.1的66分。
不过在编码智能体测试中,Astra拿了67分,表现不错。幻觉率51%,几乎是Sol(92%)的一半。
有提前拿到内测资格的开发者反馈说:Astra不是那种在纯“智商”上遥遥领先的模型,但它的环境理解和操作能力弥补了这一点。
虽然在通用智能测试上不算吃香,可一旦转到 Coding 测试就是另一回事了:
在 Artificial Analysis Coding Agent Index 中,Astra 得到 67 分,距离榜首 Fable 5.1 只差 3 分。与此同时,Astra 体现出了极佳的 token 效率,使用的 token 仅相当于 5.6 Sol max 的三分之一、Opus 5 high 的五分之一。
凭借效率优势,Astra max 完成单项 Coding 任务的成本和 Sol 大致相当。于是,在散点图中我们能看到 Astra 在左上角几乎划出了一个专属「斩杀区」——在相同的价格区间,Astra 目前可以说是「无敌」的。
另外,Astra 的幻觉也明显减少。Artificial Analysis 测得 Astra max 的幻觉率为 51%,远低于 Sol 的 92%,拒答率数据也显示它没有依靠频繁拒绝回答来压低幻觉。
单看综合跑分,很难说 Astra 是什么「独一档」的模型。但它的关键进步,其实藏在「模型如何使用电脑」这件事上。
为人类设计的界面,Astra 用得比人更好
Astra 的发布宣传片开头,引用了一个 80 年代的早期 AI 演示。当时,人对电脑说「画一个黄色圆圈」,电脑就能照做。
同样的梦想延续到了今天。几个人站在投影大屏前,或拿起筷子吃饭,或甩动网球拍,同时嘴上说出想要做一个完整可玩的 3D 游戏、把商品上架到 eBay,或是编辑照片后放入特定文件夹。等待片刻,工作就完成了。
复杂的提示词和来回操作修改全部消失,随口说几句话,Astra 就能搞定。
OpenAI 还展示了一批日常案例:
寻找猫咪寄养服务从半小时缩至 5 分 27 秒;找工作从约 5 小时缩至 2 分 51 秒。还能预约车管所、寻找公寓、填写表格、整理日历、更新 CRM,在 Excel 和 Power BI 中处理数据,在 Blender 中建模并转换成 UE5 交互场景。
背后的技术路线更具冲击力——以前要让 AI 使用某款软件,通常需要开发 API,用 MCP 协议规定可用工具和数据。每接入一个新系统,都要重新处理权限、数据格式和调用逻辑。大量老旧的政务、医疗、保险和企业软件,甚至根本没有 API。
什么时候能用?
分阶段开放:
- 即日起向“可信访问”(Trusted Access)和Daybreak网络安全项目的企业客户开放。
- 未来几天内扩展到ChatGPT Plus、Pro、Business和Enterprise订阅用户。
- 同时通过OpenAI API和AWS Bedrock、Microsoft Azure等云平台提供。
所以,AGI真的来了吗?
这个问题得分开看。
支持“是”的理由:Astra在ARC-AGI-3这种测试里拿99.9%,确实突破了之前AI的推理天花板。它能自己操作电脑、用专业软件、做科学研究,不再是“聊聊天”的对话机器人。OpenAI总裁敢在发布会上直接说“欢迎来到AGI时代”——CEO们画饼常见,但把“AGI到了”这句话直接说出口的,不多。
保持怀疑的理由:第三方测试显示Astra的通用智能并没有碾压所有对手。ARC-AGI-3的99.9%是在特定框架下跑出来的。价格是上一代的2.5倍,普通用户短期内用不上。
不管你怎么定义AGI,有一点是确定的:GPT-6 Astra跟之前所有模型都不太一样。它不再是一个“回答问题”的工具,而是一个能“替你干活”的执行者。
从只能聊天,到能看懂图片,到能写代码,到能操作电脑完成复杂任务——AI的能力边界在持续外扩。Astra是不是AGI的起点,可能得几年后回头看才有答案。
但布罗克曼有一句话说得对:“人们未来可能将‘这个时间、这个模型’视为AGI到来的节点。”
星星确实排列好了。至于那是不是AGI的黎明,留给你自己判断。