写在前面:我在编程行业和量化领域混了不到十年,前几年写交易系统,这两年主要在做因子研究和策略工程化。这篇不是”AI 让你月入百万”的爽文,而是一份我自己在用、也推荐给身边非科班朋友的操作手册。信息截至 2026 年 8 月,涉及产品参数的部分请以官方页面当天的说法为准。
一、先说结论:门槛塌了一半,但塌的是你以为的那一半
三年前我劝退过很多想做量化的朋友,理由很实在:你有想法,但你写不出能跑的代码;你写得出代码,但你写不出能跑三年不出事的代码。
现在这条理由失效了一半。
2026 年 4 月,OpenAI 给 Codex 做了一次大版本更新,它可以在后台操作你的电脑——用自己的光标去看、去点、去输入,接入你日常使用的更多工具和应用,还能记住你的偏好、从过往操作中学习,并承接重复性的长期任务;桌面端也补上了 PR 审查、多文件多终端视图、通过 SSH 连远程开发机、以及用于快速迭代前端界面的内置浏览器。到 6 月,Codex 的周活已经超过 500 万人,其中分析师、市场、运营、设计、研究员、投资人、银行家这类非开发者约占整体用户的 20%,而且增速是开发者群体的三倍以上;同时上线了按角色适配的插件、可就地修改结果的批注功能,以及生成可分享网页与应用的预览能力。
这两条信息合在一起,对量化领域的含义很清楚:Codex 已经不只是”帮你写函数”的补全工具,而是一个能端到端跑完”拉数据 → 算因子 → 回测 → 出报告”这条流水线的执行体。而且它现在的主要增量用户,恰恰就是”懂业务、不太会写代码”的那批人——也就是本文标题里的”普通人”。
但塌掉的只是工程实现的门槛。没塌的那一半是:你凭什么认为你找到的这个信号是真的?这半边墙,后面第六节会专门砸给你看。
考虑到国内订阅codex确实有点困难,可以参考一下这里:chatgptpro.shop
二、先划清边界:Codex 能吃掉你哪部分工作
我把一条策略从零到实盘的完整流程拆成六段,用我自己近一年的项目工时记录做了个粗糙对照:
几个我认为值得划重点的观察:
1)数据接入与清洗的压缩比最高(约 4-5 倍)。 这一段本质是脏活:处理复权、停牌、退市、涨跌停、成分股变更、交易日历、财报公告日与实际可用日的错位。这些逻辑高度模式化,Codex 写得又快又准,而且你可以要求它把每一条清洗规则都写成带断言的测试。
2)回测框架搭建从 30 小时压到 7 小时。 注意,这里我说的不是”让它从零写一个回测引擎”——那是自杀。是让它把 vectorbt / backtrader 这类成熟框架按你的口径包一层:你的手续费模型、你的滑点假设、你的调仓时点、你的绩效口径。
3)实盘接入与风控只压缩了不到一半,这是刻意的。 这一段我不接受 Codex 的默认方案。下单接口、持仓对账、断线重连、风控熔断——每一行我都要自己读一遍。原因很简单:回测写错了你损失时间,实盘写错了你损失钱,而且是在你睡觉的时候。
一句话总结这张图:Codex 帮你把”从想法到可验证结论”的周期从两周压到三天,但它不会替你承担开仓的责任。
三、预算怎么花:先算清楚你一个月要烧多少
普通人最容易犯的错误是一上来就买最贵的档。我建议先看清楚账:
按 2026 年 7 月的定价快照,Codex 是打包进每个 ChatGPT 订阅档里的,没有独立的 Codex 订阅:Free 免费、Go 每月 8 美元、Plus 每月 20 美元、Pro 从每月 100 美元起(对应 5 倍与 20 倍两档速率)、Business 每人每月 20 美元。用量有两道闸:一个 5 小时滚动窗口,外加一道叠在上面的周额度。Plus 档在 5 小时窗口内,GPT-5.6 Sol 大约 15–90 条、Terra 20–110 条、Luna 50–280 条,Pro 档在此基础上乘 5 或乘 20。如果直接用 API key,则绕开这两道闸、按 token 计费:gpt-5.6-luna 输入每百万 token 1 美元、输出 6 美元,Terra 是 2.5/15,Sol 是 5⁄30。
这些数字是估算区间而不是固定条数,因为额度底层是按 token 折算的,会话开头加载上下文本身就吃掉一部分配额。想知道自己还剩多少,去 Codex 设置里的 Usage 看,或者在 CLI 会话里跑 /status。
我的实际建议,按人群分:
你是谁
建议档位
理由
完全新手,想先验证自己是不是真感兴趣
Free / Go
前两周你主要在读文档和跑别人的示例,用不掉多少额度
有明确策略想法,每周能投入 10 小时以上
**Plus(20)** | 性价比拐点。够你每周完整跑通 1–2 个研究循环 |
| 已经有实盘,需要长时间跑批量参数扫描和夜间任务 | Pro 5x(100)
主要买的是”不被限流打断”,而不是买更强的模型
团队协作、要共享插件和规范
Business
权限和工作区管理比额度更值钱
一个很多人没意识到的省钱技巧:模型选型比订阅档位更影响你的额度消耗。日常的数据处理、代码格式化、写测试,用 Luna 这种快模型完全够用,额度还宽松得多;只有在设计因子逻辑、排查回测里的未来函数这种真需要推理的时候,才切到 Sol。我自己的比例大概是 Luna 70% / Terra 25% / Sol 5%,一个月 20 美元的 Plus 从来没被限流卡死过。
四、不要造轮子:2026 年你可以直接站上去的开源底座
新手最典型的时间黑洞,是花三个月自己写一个”完美的回测引擎”,然后发现它有三个致命 bug,而这三个 bug 五年前就被开源社区修完了。
结合 2026 年上半年的生态热度和我自己的使用体验,给一条明确的选型路径:
数据层。 A 股用 akshare(免费、覆盖广、接口更新勤),加密货币用 ccxt,美股用 yfinance 起步。这几个基本是社区默认选择,pip 一行就能装。数据层的关键不是选哪个库,而是你必须自己落一份本地存档——接口会变、会限流、会静默改口径,你的回测结果如果依赖每次现拉的数据,就永远不可复现。
回测层。 先用 vectorbt 建立直觉,它把整个回测抽象成矩阵运算,靠 NumPy 的广播机制并行计算,单次回测可以并行处理百万级参数组合,内置了夏普、最大回撤、卡玛、欧米茄等 50 多个绩效指标。但也要知道它的短板:“持仓超过 3 天且波动率突增则平仓”这类带时序依赖的条件,向量化框架很难表达。等你的策略复杂到这一步,再切 backtrader 这类事件驱动框架。一个我很认同的说法是:没有完美的框架,只有适合当前阶段的工具,保持代码模块化,确保任何组件都能在两周内被替换掉。
因子/AI 层。 微软的 qlib 是这一层的事实标准,把机器学习流程和量化投研流程接在了一起。除非你确定要做 ML 因子,否则先别碰——它的学习曲线会吃掉你本该用来理解市场的时间。
实盘层。 A 股和期货用 vnpy,加密货币用 freqtrade。这两个都是跑了很多年、被真金白银验证过的项目。
一个反直觉的建议:图 3 里那几个 40k+ star 的 “AI Agent 自动交易” 项目,作为学习材料很好,作为交易系统请慎用。 它们大多在展示”LLM 能读新闻并做决策”这件事的可能性,而不是在展示一个经过样本外检验的可交易系统。你要抄的是它们的工程结构,不是它们的信号。
五、真正的用法:把 Codex 当成”有纪律的初级研究员”
这是全文最实操的一节。普通人用 Codex 效果差,几乎都不是因为模型不行,而是因为把它当搜索框用——一句话丢过去,拿回一段代码,跑不通再丢一句。这样你永远在原地打转。
正确的姿势是把它接进一个有约束的工程环境。三件事:
1)先写 AGENTS.md,把你的口径钉死
在项目根目录放一个 AGENTS.md,Codex 每次开工都会读它。这个文件应该写的不是”你是一个专业的量化助手”这种废话,而是你的硬性口径:
# 项目约定## 数据- 所有 A 股价格数据一律使用前复权(qfq),禁止混用后复权- 交易日历以 data/calendar.csv 为准,禁止用 pandas 的 bdate_range- 财报数据必须使用 announce_date 而非 report_date 作为可用时点## 回测- 信号在 T 日收盘后生成,T+1 开盘成交,禁止用当日收盘价成交- 手续费:双边万分之三,卖出加千分之一印花税- 滑点:按当日振幅的 10% 计,不接受零滑点回测## 代码- 任何新增因子必须同时提交一个 tests/ 下的未来函数检查用例- 禁止在回测代码里出现 .shift(-n) 这类前视操作,除非有注释说明理由
这个文件我改了大半年,现在有一百多行。它的价值在于:你把自己踩过的每一个坑,都变成了对 AI 的永久约束。而且当 Codex 违反其中任何一条时,你审代码的时候一眼就能看见。
2)用”三段式”提问,而不是一句话许愿
差的提法:「帮我写一个动量策略回测。」
好的提法,分三段:
第一段(背景与口径):读一下 AGENTS.md。我们要检验的假设是:A 股中证 500 成分股中,过去 20 日收益率排名前 10% 的股票,在未来 5 日是否存在超额收益。
第二段(明确的交付物):请分三个文件交付:data/loader.py负责取数并落 parquet 本地缓存;factors/momentum.py只算因子值、不做任何交易决策;research/run_backtest.py用 vectorbt 跑分组回测,输出十分组的净值曲线和 IC 序列。
第三段(验收标准):跑完后请自己检查三件事并把结论写在输出里——(a) 因子值的计算是否用到了 T 日之后的信息;(b) 分组回测的每组样本数是否稳定在 40 只以上;© 换手率是多少,扣掉我们约定的手续费后,多空组合的年化还剩多少。
第三段是分水岭。你要求它自我验收,它就会自我验收;你不要求,它就会给你一条漂亮的净值曲线然后闭嘴。
3)让它跑批,让你做判断
这是 2026 年的 Codex 相比两年前最大的增量:它能在后台承接长时间的重复性任务。所以合理的分工是:
- 夜里:让 Codex 批量跑参数扫描、跑滚动窗口的样本外检验、跑不同市场环境下的分段表现,把结果写成一份 markdown 报告。
- 早上:你花 30 分钟读报告,只做一件事——决定哪个假设该被杀掉。
你的稀缺资源不是写代码的时间,是判断力。把判断力用在”杀假设”上,而不是”调参数”上。
六、最大的坑:产能放大 100 倍,过拟合也放大 100 倍
这一节如果你只读一段,请读这一节。
以前你手工试 20 组参数,累得半死。现在 Codex 一个晚上能帮你试十万组。听起来很爽,但统计学不会因为你换了工具就对你网开一面:
图里那条虚线是关键。你搜索的次数越多,”随机噪声碰巧长得像 alpha”的概率就越高,因此判定一个结果是否显著所需要的门槛也必须跟着抬高。当你试了十万组参数还只找到样本内夏普 2.0 的策略时,它大概率什么都不是——因为在纯随机数据上试十万次,你也能找到夏普 2.0 的东西。
这就是为什么 AI 时代的量化,纪律比产能重要得多。我自己现在强制执行三条:
第一,先切数据,再看数据。 拿到数据的第一天,把最后 20% 的时间段物理隔离出去——不是”我不去看”,是Codex 的工作目录里根本没有这份文件。所有研究在前 80% 上做完,最终候选策略只允许在隔离数据上跑一次。跑完不管结果如何,这份数据就作废了,因为你已经”看过”它了。
第二,记录你的搜索次数。 建一个 experiments.log,让 Codex 每跑一次回测就追加一行。月底看一眼这个数字,它会让你对自己的”发现”清醒很多。
第三,先问经济学理由,再问统计显著性。 在 Codex 跑任何回测之前,你先用一句人话回答:这个信号背后,是谁在什么约束下、被迫做了什么不划算的交易,从而把钱留给了你? 答不上来,就不要开始。这个问题 AI 帮不了你,因为它不知道你所在市场的参与者结构。
顺便说一句,前面提到 Codex 的非开发者用户增速是开发者的三倍以上——这意味着未来两年会有大量”懂业务但缺乏统计训练”的人涌进这个领域。他们会用 AI 生产出海量的、样本内极其漂亮的策略。别人跑得快不代表方向对;在这个行业里,跑错方向的速度越快,亏得越快。
七、一份四周的起步路线图
给真正的零基础朋友一个可执行的时间表。这是我带过几个转行朋友之后收敛出来的版本:
第 1 周|先把管道打通,别碰策略。 目标:能用 akshare 拉 300 只股票的三年日线,落成本地 parquet,并且第二次运行时走缓存不重复请求。让 Codex 写,你的任务是逐行读懂并且能自己复述每一步在干什么。这一周不许提”策略”两个字。
第 2 周|跑通一个你明知道不赚钱的策略。 双均线,就用双均线。目的不是赚钱,是让你亲眼看到手续费和滑点怎么把一条漂亮的净值曲线吃平。让 Codex 分别跑”零成本”和”按真实成本”两版,把差距画在一张图上。这一周你会获得本文最重要的一课:成本假设比信号更能决定策略生死。
第 3 周|写你的第一版 AGENTS.md,然后重跑第 2 周的东西。 把前两周踩的坑全部写成约定。然后让 Codex 在这份约定下重新实现一遍双均线。对比两版代码的差异——那个差异,就是你这两周真正学到的东西。
第 4 周|提出一个有经济学理由的假设,做一次完整研究。 从提假设、切样本、跑回测、到写结论报告,完整走一遍。结论是”这个假设不成立”也算成功,而且大概率就是不成立——这很正常,专业机构的假设否决率也在 90% 以上。
第 5 周之后:重复第 4 周,每周一个假设。做满一年,你会比 95% 的散户更懂自己在干什么。
八、几句必须说的话
关于合规。 自动化下单前,请先确认你所用券商/交易所的接口是否允许程序化交易、是否需要报备。A 股的程序化交易报备要求这两年在收紧,各家券商的执行口径不一样,开跑之前打个电话问清楚,比事后解释便宜得多。
关于数据。 付费数据源的授权条款通常禁止转售和再分发。把数据喂给云端 AI 处理是否构成”分发”,目前是灰色地带,商用前建议看合同。个人研究用公开免费数据源,这个问题基本不存在。
关于本文的图表。 图 1 是我个人项目的工时记录汇总,是经验值不是统计数据;图 2 基于 2026 年 7 月的官方定价快照,Pro 档的具体条数是按官方公布的倍数关系推算的估算区间;图 3 的 star 数是 2026 年 4 月的快照,会变;图 4 是概念示意图,不是实测数据。都写在图注里了,引用请注意。
最后。 这篇文章里我没有给你任何一个具体的策略、任何一个具体的因子。这是故意的。
因为 Codex 真正给普通人的礼物,不是”AI 告诉你买什么”,而是**“你终于有能力,亲手验证自己的每一个想法是不是错的”**。这个能力在三年前值一个量化研究员的年薪,现在值每月 20 美元。
至于剩下那件事——想出一个值得验证的好想法,并且有纪律地承认大部分想法都是错的——这部分永远是你自己的。