GPT-5.6 发布后,我朋友圈里那帮天天写代码的哥们,第一反应不是“这代推理有多牛”,而是纷纷在群里晒账单。
“一上午跑了 30 刀,这谁顶得住?” “我就改了个 React 组件,怎么额度掉得跟流水一样?”
这次 OpenAI 把 GPT-5.6 拆成了 Sol、Terra、Luna 三个模型,再加上一堆推理档位和 Codex 里的各种子代理,选择变多了,但踩坑的概率也翻倍了。
很多人一上来就默认拉满“Sol + Max 推理”,结果写个简单的脚本,后台悄悄跑了十几轮,账单直接炸裂。
我们今天不聊官方那些虚头巴脑的 PPT 指标,只聊点肉身踩坑的真实体感:这三个模型到底蠢在哪里、强在哪里,怎么配才能保住你的钱包。
别看 PPT 了,这是我用真金白银砸出来的体感
官方给 Sol、Terra、Luna 的定价分别是 5 刀、2.5 刀和 1 刀(每百万 Token 输入)。看起来是阶梯定价,但实际用起来,它们的智商差距比价格差距还要残忍。
1. Luna:别指望它能通读项目,它连 3 个文件的关联都理不清
很多人觉得 Luna 便宜,想拿它当日常主力。我劝你趁早放弃这个念头。
Luna 的智商上限极低。我昨天试着让它重构一个稍微带点异步逻辑的 Python 脚本,它写着写着就开始鬼打墙,反复在两个 if-else 里面反复横跳。
你跟它纠错,它就一直“对不起,我理解错了”,然后换个姿势继续写错。最后折腾了 5 轮,不仅没解决问题,反而白白浪费了 5 轮的 Token。
Luna 只配干一种活:单步、且结果一眼就能看出对错的脏活。
比如:
- 把一批中文文案翻译成英文(好不好一眼能看出来);
- 按照固定格式整理一下会议纪要;
- 批量生成 i18n 的 JSON 配置文件。
只要任务稍微需要一点“跨文件推理”,立刻换掉它,否则它会用反复翻车来消耗你的额度。
2. Terra:性价比最高的“老实人”,日常无脑选它
Terra 是这次最让我惊喜的模型。它的价格只有 Sol 的一半,但日常写代码的体感能达到 Sol 的八成。
在处理常规业务逻辑、写单元测试、或者修一些常见的 React Hydration 报错时,Terra 配合 Medium 推理档位,基本都是一轮过。
最重要的是,它不会像 Luna 那样容易“胡说八道”,也不会像 Sol 那样动不动就陷入深度思考、半天不吐字。
如果你不知道该用哪个,日常配置无脑锁死 Terra + Medium。
3. Sol:别当默认档用,它是你搞不定问题时的“核武器”
Sol 确实强,尤其是处理长链路的 Coding Agent 任务。
但我发现一个细节:Sol 在 “Max” 推理档位下,慢得像便秘。
写个稍微复杂点的算法,它能卡在那里“思考”两分钟。如果是急着用代码,千万别开 Max 档,High 档足够了。
我个人的策略是:日常绝对不用 Sol。只有当 Terra 跑了两轮还是定位不出 Bug,或者要重构核心的安全、金融模块时,我才会把 Sol 请出来。
这时候就别省钱了。Terra 跑 3 轮没解决问题花的钱,够 Sol 跑一次直接搞定了。
为什么你的额度掉得比别人快?
很多人纳闷,我也没怎么疯狂调 API 啊,怎么额度一天就没了?
因为在 Codex、Cursor 这类 Agent 工具里,很多消耗是在后台偷偷发生的。
坑点一:长上下文的“价格刺客”
OpenAI 这次有个隐藏规则:一旦你的上下文超过 272K tokens,输入价格会直接翻倍。
Agent 工具最喜欢干的事,就是悄悄把你的历史报错、重复的终端日志、甚至整个 node_modules 里的无关文件都塞进上下文。
你以为你只是发了一句“帮我改个按钮颜色”,其实后台带了十几万字的前戏,一次请求就触发了高倍率计费。
坑点二:子代理(Sub-Agent)乱开
有些工具支持自动开子代理去解决问题。
相信我,对于 90% 的日常开发,把这个功能关掉。
改个组件样式,它能给你拆出 3 个子代理互相讨论、互相调用工具,最后给你整出一份长达数万字的“讨论报告”,额度直接暴崩。
实战:如何在 Codex 里配置模型服务
Base URL:https://token.ithinkai.cn/v1
API Key:YOUR_API_KEY
Model:以服务文档为准,最新模型 gpt-5.5、claude-opus-4-8、gpt-image-2 等可按文档查看;涉及图片生成时,以 0.05¥/图起、2k/4k 支持等服务文档说明为准。
聊完避坑指南,我们来看看怎么在实际工具里配置。
不管你用什么工具,配置第三方兼容服务时,核心就是三个东西:Base URL、API Key 和 Model 名称。
配置时的固定信息如下:
Base URL:https://token.ithinkai.cn/v1
Key:YOUR_KEY
Model:以服务文档为准,最新模型 gpt-5.6-sol、gpt-5.6-terra、
gpt-5.6-luna 等可按文档查看;涉及图片生成时,以 0.05¥/图起、2k/4k 支持等服务文档说明为准。
具体的折腾步骤如下:
第一步:打开台
第二步:在模型广场里挑模型、选分组
在模型广场里用 gpt 搜一下,能看到 GPT-5.6 的几个新模型。先看好你要用哪个,比如我想用 gpt-5.6-terra。
看准这个模型对应的分组或者线路,记下来,后面创建令牌时要绑定。
第三步:去控制台建个令牌
去令牌管理页面,点添加令牌。把刚才挑好的模型分组勾上,这样这个 Key 就能正常调用新模型了。
生成 Key 之后复制好,别弄丢了。
拿到 Key 之后,回到你的 Codex 配置文件(比如 ~/codex/config.toml),我建议你加上这两行限制,主动把上下文和子代理锁死,别让它瞎跑:
# 默认用性价比最高的 Terra
model = "gpt-5.6-terra"
# 强行限制上下文,不给它触发长上下文翻倍计费的机会
model_context_window = 272000
model_auto_compact_token_limit = 240000
# 日常开发,把子代理关了,省得它自己跟自己聊天
multi_agent = false
改完配置后,记得重启一下 Codex 终端,或者新建一个 Session,老 Session 有时候会缓存旧的上下文,导致配置不生效。
总结一下我的省钱野路子
- 写一行
.gitignore或者在工具里配置排除文件:把dist、build、还有各种大体积的 log 文件排除掉。别让 Agent 扫描到它们,这是最容易漏掉的 Token 黑洞。 - 能用 Terra 解决的,绝不用 Sol。
- 给任务定好边界:在提问时,直接告诉它“只修改
components/Header.tsx,不要动其他文件”,不给它发散的机会。
用 AI 辅助编程是为了提高效率,要是每天盯着账单肉疼,那就本末倒置了。把模型路由做好,该省省该花花,才是最舒服的姿势。