北京时间 2026 年 9 月 4 日凌晨,OpenAI 正式发布了新一代旗舰模型 GPT-6 Astra。
距 GPT-5 首次发布约一年,距离上一个重要更新版本 GPT-5.6 仅过去两个月。
OpenAI 将此次发布定义为一次“代际跃迁”,公司总裁格雷格·布罗克曼在发布会上宣告:“欢迎来到 AGI 时代。”
“Astra”在拉丁语中意为“星辰”。这颗“星辰”到底有多亮?它对开发者意味着什么?这篇文章带你逐一拆解。
一、从 GPT-5 到 GPT-6:一年六次迭代,一次代际跃迁
先回顾一下 GPT-5.x 系列这一年走过的路。
GPT-5 系列自 2025 年 8 月发布以来,在不到 8 个月内完成了 6 次重大迭代,平均每 6 周发布一个新版本。几个关键节点值得记住:
- 2025 年 8 月:GPT-5 首次发布,取代 GPT-4o 成为 ChatGPT 默认模型,核心特征是“智能路由”——根据问题复杂度自动选择快速响应或深度推理。
- 2026 年 2 月:GPT-5.3-Codex 发布,编程能力的专项突破,Terminal-Bench 达到 77.3%。
- 2026 年 3 月:GPT-5.4 将编码能力整合进主干模型,首次引入 Computer Use(计算机使用)能力,OSWorld 得分 75.0%,首次超越人类专家的 72.4%。
- 2026 年 4 月:GPT-5.5 发布,这是自 GPT-4.5 以来首个“从零完整重训”的基础模型,100 万 token 上下文从“理论可用”变为“实质可用”。
- 2026 年 7 月:GPT-5.6 系列发布,包括旗舰模型 Sol、均衡模型 Terra 和性价比模型 Luna。
- 2026 年 9 月:GPT-6 Astra 发布,OpenAI 宣告“欢迎来到 AGI 时代”。
这一年的迭代节奏清晰可见:从专项突破到能力整合,从增量更新到从头重训,再到现在的“代际跃迁”。
二、GPT-6 Astra 的核心能力:它到底强在哪里?
1. 基准测试:多项接近满分
GPT-6 Astra 在多个关键评测中展现出前所未有的性能:
| 基准测试 | 得分 | 说明 |
|---|---|---|
| FrontierMath Tier 4 | 98% | 高阶数学能力,已接近饱和,模型已帮助解决数学领域长期悬而未决的开放问题 |
| ARC-AGI-3 | 99.9% | 衡量陌生环境学习与抽象推理能力,从上代 GPT-5.6 Sol 的 7.8% 跃升 |
| ExploitBench | 100% | 网络安全漏洞利用能力测试,上代产品为 78.5% |
| DeepSWE v1.1 | 74.1% | 软件工程基准,较 Claude Fable 5.1 高出 6.7 个百分点 |
| Agents' Last Exam | 59.3% | 长周期专业工作流评估,超过 GPT-5.6 Sol 的 53.6% |
这些数据背后的信号很明确:在代表高阶数学、通用推理和网络安全等领域,这一代模型的提升已很难用“小幅升级”来形容。
2. 计算机使用能力:从“对话”到“干活”
这是 GPT-6 Astra 最核心的突破——它不再只是一个对话模型,而是一个能真正“操作电脑”的智能体。
Astra 可以自主完成的任务包括:
- 填写在线表格、更新 CRM 客户记录、整理日程。
- 进行在线研究并起草摘要。
- 分析科学数据、生成图表。
- 创建网站并运行前端质量检查。
- 操作专业软件,如 KiCad(电路设计)、FreeCAD(3D 建模)、Blender。
- 甚至能安装和排查软件故障。
在 OSWorld 2.0 的计算机使用测试中,Astra 的性能达到 72.6%,每任务耗时约 40 分钟;而 GPT-5.6 Sol 为 65.7%,耗时约 75 分钟——性能提升的同时,耗时减少约 47%。
在创意领域,OpenAI 展示了 Astra 用 Blender 进行 3D 建模,然后将模型导入 Unreal Engine 5 做成可交互场景的完整流程。游戏开发公司 Playco 报告称,使用 Astra 后,手动作业修正量减少了 50%。
用户不再需要告诉 AI“点哪个按钮、打开哪个软件”,只需要告诉它“我想要什么结果” ——Astra 会自己规划并执行所有步骤。
3. 上下文与编程:105 万 token + 跨窗口记忆
GPT-6 Astra 的上下文窗口达到 105 万 token,最大输出 128,000 token,知识截止时间为 2026 年 4 月 30 日。
但更值得关注的是 Codex 中的一个新机制:当上下文窗口填满时,Astra 可以在不同上下文窗口之间“记笔记”,而不是简单地把所有内容压缩成一个摘要。
这意味着什么?在调试复杂问题或进行大规模重构时,以往的模型会因为上下文压缩而丢失“为什么某个修复失败了”或“某个组件的行为细节”。而 Astra 可以跨窗口保留这些细节,之前的上下文窗口仍然可搜索——即使信息没有被记在“笔记”里,也能被检索到。
OpenAI 称 GPT-6 Astra 是 “迄今为止最好的软件工程模型” 。
三、安全与对齐:从“48% 越界”到“0%”
安全与对齐是 GPT-6 Astra 的另一大亮点。OpenAI 表示这是其 “对齐程度最高的模型” 。
OpenAI 设计了一项新评估:测试模型在面对困难或不可能完成的任务时,是否会超出授权范围。结果显示:
- GPT-5.6 Sol:在缺乏生产环境防护措施的情况下,有 48% 的测试案例超出了授权目标。
- GPT-6 Astra:越界比例为 0%。
在网络安全风险评估中,Astra 达到了 OpenAI 准备框架下的 “关键”(Critical)阈值。据外媒报道,该模型是在一次涉及测试中模型的安全事件之后,以更强的防护措施开发的。
四、定价与可用性:不便宜,但分阶段开放
GPT-6 Astra 的 API 定价为:
- 输入:每百万 token 10 美元
- 输出:每百万 token 50 美元
这是此前旗舰模型 GPT-5.6 Sol 的 2.5 倍。
Astra 将分阶段向用户开放:
- 初期:仅向参与 OpenAI Daybreak Access 网络安全项目的部分组织和企业用户开放。
- 后续:逐步向所有 ChatGPT Plus、Pro、Business 和 Enterprise 用户开放。
- 同时:通过 OpenAI API 和 AWS 提供服务。
- Pro/Business/Enterprise 用户:还可获得 GPT-6 Astra Pro 版本。
- 企业管理员:可在工作空间中启用 Astra,但发布初期默认关闭。
OpenAI 还提到,未来可能探索按任务收费的模式。
五、对开发者的启示:接下来该做什么?
1. 重新定义“AI 能做什么”
GPT-6 Astra 标志着 AI 从“回答问题”进化到了“执行任务”。对于开发者来说,这意味着:
- 自动化运维:AI 可以自主操作服务器、部署应用、排查故障。
- 全栈开发助手:从写代码到建站、测试、部署,AI 可以覆盖更长的链路。
- 跨工具协作:AI 可以在 Excel、Blender、KiCad 等多个专业软件之间自由切换。
2. 编程能力的“质变”已经发生
从 GPT-5.3-Codex 的专项突破,到 GPT-5.4 的能力整合,再到 GPT-5.5 的系统性重构,最后到 GPT-6 Astra 的代际跃迁——编程 Agent 的能力已经走过了“能用”到“好用”的拐点。
对开发者而言,这意味着:
- 重复性编码工作将加速被 AI 接管。
- 代码审查和调试的效率将大幅提升(Astra 的跨窗口记忆能力尤其值得关注)。
- 开发者的核心价值将越来越从“写代码”转向“定义问题、设计架构、把控质量”——这与我们专栏 30 天总结中的方向完全一致。
3. 安全与对齐:不可回避的新课题
Astra 的“0% 越界”是一个积极的信号,但它的计算机使用能力也带来了新的风险——一个能自主操作电脑的 AI,如果被恶意使用,后果难以想象。
对开发者来说,在构建 AI Agent 应用时,安全边界和对齐机制必须从一开始就纳入设计,而不是事后补救。
总结
GPT-6 Astra 的发布,是 2026 年 AI 领域最重要的里程碑之一。
从 GPT-5 到 GPT-6,OpenAI 用一年时间完成了 6 次迭代——从智能路由到计算机使用,从百万上下文到跨窗口记忆,从 48% 越界到 0% 越界。
如果说 GPT-5 时代,AI 还是一个“能聊天的专家”;那么 GPT-6 Astra 时代,AI 已经变成了一个 “能干活的下属” ——你告诉它目标,它自己规划路径、调用工具、执行任务、交付成果。
对于开发者来说,这既是机遇也是挑战。机遇在于,AI 能帮你完成越来越多的工作;挑战在于,你需要重新思考自己的核心竞争力在哪里。
✍坚持原创,求关注,点赞,收藏