上周技术面试,面试官看了我简历上写的「熟练使用 AI 编程工具」,笑了笑问:"那你用过 Codex 吧?你觉得它和 Cursor 最大的区别在哪?"
我当时心里一紧,本来张嘴就想答「都是 AI 写代码的工具呗」,还好咽回去了——上次面试就是因为把 Cursor Rules 听成了 Cursor 弱势,当场社死。
没事,不明白咱可以学。面试完我花了三天时间,把 Codex 和它背后的 GPT-6 Astra 扒了个底朝天。今天整理成一篇,分享给大家。
什么是 Codex
简单说,Codex 是 OpenAI 推出的 AI 编程智能体(Coding Agent),而且它不是一个单一工具,而是一整套编程解决方案。
它和 Cursor、Claude Code 这些工具定位类似,但有个本质区别:Codex 不是让你在编辑器里按 Tab 补全代码的"增强版 Copilot",而是一个能独立完成完整工程任务的智能体。什么意思?
就是你给它一个需求,它能自己读代码库、自己改文件、自己跑测试、自己提 PR,你只需要最后 Review 一下就行。
目前 Codex 有三种使用形态:
| 形态 | 使用场景 | 入口 |
|---|---|---|
| ChatGPT 中的 Codex | 桌面端完整智能体体验,多项目并行、后台任务 | ChatGPT 桌面应用 |
| Codex IDE 扩展 | 在 VS Code / JetBrains 里直接用,边写边辅助 | IDE 插件市场 |
| Codex CLI | 终端里的编程 Agent,适合重度命令行用户 | npm i -g @openai/codex |
三种形态用的是同一个 ChatGPT 账号,上下文互通。你在 CLI 里起的任务,切到桌面端也能接着看进度。
Codex 的核心能力:不止是写代码
很多人第一次用 Codex,以为就是个"更聪明的代码补全"。用了一周之后你会发现,它真正厉害的地方根本不是补全,而是下面这几个能力。
1. 端到端的工程任务支持
这是 Codex 和传统 AI 编程工具最大的区别。
以前用 AI 写代码,你得一段一段喂:"帮我写个登录组件""帮我写个接口""帮我写个测试用例"。你是总指挥,AI 是打字员。
用 Codex 不一样,你直接说:"把这个用户管理模块从 Vue2 迁移到 Vue3,连带着单元测试一起改了。"然后它就自己开工了:
- 先通读整个模块的代码结构
- 规划迁移步骤和风险点
- 逐个文件改写
- 自己跑测试,失败了自己修
- 完事儿给你提一个 PR
从功能开发到复杂重构,再到技术栈迁移,它都能端到端搞定。参考链接
2. 多智能体工作流
这是 Codex 今年的大招——多 Agent 并行工作。
ChatGPT 里的 Codex 相当于一个指挥中心,它可以同时派出多个子智能体,每个子智能体负责不同的任务,各自在独立的工作树和云端环境里跑。
举个例子:你要做一个新功能,涉及前端页面、后端接口、数据库迁移三份工作。以前你得自己串行安排,或者找三个人并行。现在你跟 Codex 说一声,它直接派三个子 Agent 同时开工,各自在沙箱环境里写自己的代码,最后统一汇总。
OpenAI 官网上说"把数周的开发周期缩短到数天",我觉得这个描述一点不夸张。参考链接
3. Skills(技能)机制
这是我觉得最实用的一个功能,相当于 Cursor Rules 的升级版。
你可以给 Codex 配置一组"技能"——每个技能是一套可复用的指令包(还可以带脚本和资源文件),告诉 Codex 在特定场景下应该怎么做。
比如你可以做一个 $code-review 的技能,里面定义好你们团队的代码审查标准:哪些写法必须改、哪些安全漏洞不能放过、注释要写到什么程度。以后只要触发这个技能,Codex 就会严格按照你们团队的标准来审查代码。
再比如 $deploy 技能,封装你们的发布流程和规范,Codex 执行部署时就会自动遵守。
Skills 在 CLI 和 IDE 扩展里都能用,调用方式是在对话里输入 $技能名。参考链接
4. 后台长时间运行
这个功能真的是"上班摸鱼神器"——不对,是"效率倍增器"。
Codex 可以安排后台任务,你下班前给它一个需求,它自己在云端沙箱里跑一晚上,第二天早上你上班,PR 已经摆在那等你 Review 了。
适合后台跑的任务包括:
- Issue 分诊(自动给新 issue 打标签、分配负责人)
- 告警监控和自动排查
- CI/CD 流水线的自动修复
- 大规模代码重构
- 技术债批量清理
它的工作原理是这样的:你分配任务后,Codex 会启动一个沙箱化的云端环境,把你的代码库 clone 进去,然后 Agent 在里面读文件、跑测试、装依赖、跨文件修改,完成后自动创建 GitHub PR,给你发通知。参考链接
5. 代码审查能力
这一点必须单独拿出来说。
Codex 的 PR 审查能力在业界口碑非常好。Duolingo 的高级软件工程师 Aaron Wang 说过:"Codex 是唯一能发现棘手的向后兼容性问题的工具,总能找出其他机器人遗漏的核心漏洞。"参考链接
Ramp 的 AI 开发者体验负责人也说,Codex 的 PR 审查能发现团队容易忽略的漏洞。
为什么它审查代码比其他工具强?我个人理解是:因为 Codex 不是只看改动的那几行,它会通读整个相关模块,理解上下文之后再做判断——这跟资深工程师做 Code Review 的思路是一样的。
6. 迁移工具:一键从 Cursor / Claude Code 搬家
如果你之前用 Cursor 或 Claude Code,现在想试试 Codex,不用手动搬配置。
Codex CLI v0.145 版本之后,/import 命令支持一键迁移 Cursor 和 Claude Code 的配置,覆盖六个方面:设置项、MCP 服务器、插件、会话历史、自定义命令、项目级记忆。参考链接
这个功能对想尝鲜的人太友好了,零成本切换。
背后的大脑:GPT-6 Astra 有多强
聊 Codex 就不能不提它背后的模型——GPT-6 Astra。这是 OpenAI 在 2026 年 9 月刚发布的最新推理模型,也是 Codex 当前的核心引擎。参考链接
Astra 的定位很直接:"你在电脑上能做的任何事,Astra 都能替你做。" 参考链接
核心参数
| 参数 | 数值 |
|---|---|
| 总上下文窗口 | 1,050,000 tokens(约 78 万字) |
| 最大输出 | 128,000 tokens |
| 知识截止时间 | 2026 年 4 月 30 日 |
| 核心能力 | 编程、研究、计算机操作、复杂多步推理 |
105 万 token 的上下文是什么概念?你可以把整个中型代码库扔进去,它都能记住。参考链接
而且更厉害的是,Codex 里的 Astra 有个跨窗口记忆机制——当上下文窗口填满时,它能在不同窗口之间"记住"之前的信息,不会像其他模型那样一换新窗口就失忆。参考链接
六大工具能力(首日全可用)
GPT-6 Astra 发布当天,以下工具能力就全部开放了:
| 工具 | 功能 |
|---|---|
| computer_use | 直接操作电脑——看屏幕、移动鼠标、敲键盘,像人一样用任何软件 |
| hosted_shell | 托管 Shell 环境,执行命令、跑脚本、管理进程 |
| apply_patch | 精准应用代码补丁,支持多文件修改 |
| skills | 技能系统,可复用的指令包(前面讲过的 Codex Skills 就靠它) |
| mcp | 支持 MCP 协议,连接各种外部工具和服务 |
| 浏览与连接器 | 网页浏览 + 第三方服务连接器 |
这里面最炸裂的是 computer_use。它不是调用 API 来操作软件,而是像人一样直接看屏幕像素、移动鼠标、敲击键盘。这意味着什么?意味着任何你在电脑上能做的操作,理论上 Astra 都能替你做——不管是最新的设计软件,还是老掉牙的企业内部系统,只要有界面就能操作。参考链接
编程能力到底有多强
Jane Street 负责 AI 助手的 John Crepezzi 评价说:"GPT-6 Astra 在我们的内部编程基准测试中达到了当前领先水平,用于 Agent 编程时,它的沟通方式更便于开发者理解,生成的代码也只需更少轮次的迭代就能达到生产环境要求的质量。"参考链接
翻译成人话就是:它写的代码更像人写的,而且一次到位率更高,不用你反复调教。
在 OSWorld 2.0 基准测试上,Astra 的计算机操作能力也大幅领先前代模型。参考链接
我自己常用的几个 Codex 用法
光说功能太空了,给大家几个我日常用的场景,感受一下差距。
场景一:快速开发一个新功能
# 我对 Codex 说:
给用户中心加一个"账号安全"页面,包含:
1. 修改密码功能(旧密码 + 新密码 + 确认密码)
2. 登录设备管理(显示当前登录设备,支持下线)
3. 两步验证开关(用 TOTP)
后端用 NestJS,前端用 React + TypeScript,数据库是 PostgreSQL。
写完顺便把单元测试也补上。
然后我就去开会了。半小时后回来,Codex 已经:
- 创建了前端页面组件和路由
- 写了后端 Controller、Service、DTO
- 加了数据库 migration
- 生成了前后端的单元测试
- 提了一个 PR,附带变更说明
我只需要 Review 代码、跑一下测试、合入主干。以前这活至少得两天。
场景二:代码审查
# 我对 Codex 说:
$code-review 这个 PR,重点看:
1. 有没有 SQL 注入风险
2. 并发场景下有没有竞态条件
3. 异常处理是否完整
4. 有没有违反我们团队的编码规范
几分钟后,Codex 给我一份详细的审查报告,标了几个需要修改的点,还附了建议的修复代码。其中有一个并发竞态问题,说实话我自己看不一定能发现。
场景三:后台跑重构
下班前给 Codex 留个活儿:
# 我对 Codex 说:
把 src/services 目录下所有的回调风格代码改成 async/await,
确保所有错误处理都迁移到位,测试全部跑通。
完成后提 PR,有问题在评论里 @我。
第二天早上来,PR 已经躺在那了,27 个文件全改完了,测试全绿。我花了半小时 Review 就合入了。
写在最后
说实话,面试完去研究 Codex 和 GPT-6 Astra 的时候,我越研究越觉得震撼。
不是震撼于"AI 写代码好快"——这个我们已经习惯了。真正让我震撼的是:AI 已经从"辅助工具"进化成了"独立执行者"。
以前的 AI 编程工具,你是司机,它是副驾驶。现在的 Codex + GPT-6 Astra,你更像一个项目经理——你分配任务、设定标准、验收成果,中间的具体执行它自己搞定。
这对我们程序员来说意味着什么?我觉得是:
- 纯执行类的工作会越来越少:CRUD、模板代码、简单重构这些,以后基本不用人写了。
- 判断和决策的价值会越来越高:需求怎么拆、方案怎么选、风险怎么控——这些 AI 替不了你。
- 学习新工具的速度很重要:Codex 不是终点,后面还会有更强的工具。与其焦虑被取代,不如先把这些工具用起来,让自己成为"会用 AI 的那批人"。
回到面试时面试官的那个问题——Codex 和 Cursor 最大的区别在哪?
我的答案是:Cursor 是一个更聪明的编辑器,而 Codex 是一个能独立干活的程序员、能完成各种调研分析数据统计的工作、能完成图片实视频的创作。前者帮你提升编码效率,后者直接改变了工作方式。
你们觉得呢?欢迎留言聊聊你们用 Codex 或者 GPT-6 Astra 的体验。
标签: AI 编程 Codex GPT-6 Astra 开发工具 程序员