GPT-5.6 Luna 降价 80%:Agent 真正该重算的是单次成功成本
TL;DR
- 场景:OpenAI 2026-07-30 公告 Luna Standard 短上下文四项费率同步降到旧价 20%(即降价 80%);同构 Luna Token 账单精确下降 80%。
- 结论:模型 Token 便宜不等于单次成功任务便宜。Agent 任务总成本还包含工具调用、循环重试、长上下文阶跃、缓存失配和人工复核;真正决定迁移价值的是
cost_per_success。 - 产出:完整费率等式(4 项 × 0.2)+ 工具成本拐点(Web Search 0.01 > 示例 Token 0.0064)+ 272K 长上下文阶跃(2× 输入 / 1.5× 输出)+ 缓存命中顺序建议 + cost_per_success 公式与对照表 + 100-500 个真实任务 A/B 矩阵 + Luna-first 三档条件升级方案 + 30 天迁移节奏。
版本矩阵
| 维度 | 状态 | 说明 |
|---|---|---|
| Luna Standard 短上下文四项费率同步降到旧价 20% | ✅ 已验证 | 输入 1.00 → 0.20 / 缓存读 0.10 → 0.02 / 缓存写 1.25 → 0.25 / 输出 6.00 → 1.20(美元 / 百万 Token) |
等式 new = 0.20 × old | ✅ 已验证 | 同 Luna 模型 / 同服务层级 / 同上下文区间 / 同 Token 向量 |
| Luna 上下文容量 | ✅ 已验证 | 1,050,000 token 上下文 / 128,000 最大输出 |
| 272K 长上下文阶跃 | ✅ 已验证 | 输入 > 272K 后完整请求按 2× 输入 + 1.5× 输出费率计费(Standard 对应:输入 0.40 / 缓存读 0.04 / 缓存写 0.50 / 输出 1.80) |
| OpenAI 公告日期 | ✅ 已验证 | 自 2026-07-30 起 API 定价生效;Sol 同时新增 Fast mode |
| Terra 同步降价 | ✅ 已验证 | Terra 同步降价 20%:输入 12/M |
| Web Search 固定调用费 | ✅ 已验证 | 25.00/1k) |
| Web Search 内容 Token | ✅ 已验证 | 搜索内容 Token 另计 |
| Container / Code Interpreter | ✅ 已验证 | 每 20 分钟会话计费 |
| File search | ✅ 已验证 | Storage 2.50/1k calls |
| Agent Kit | ✅ 已验证 | ChatKit file/image upload storage $0.10/GB-day |
| 缓存读取 = 输入的 10% | ✅ 已验证 | Luna Standard:缓存读 0.02 / 输入 0.20 = 10% |
| 缓存写入 > 普通输入 | ✅ 已验证 | Luna Standard:缓存写 0.25 / 输入 0.20 = 1.25× |
| Luna-first 升级条件 | ✅ 已验证 | 失败 / 低置信 / 复杂任务升级;高风险保留人工责任 |
| "模型 Token 便宜 = 任务总成本便宜" | ❌ 不成立 | 工具、循环、人工摊销、272K 阶跃都独立计费 |
| "用 Benchmark 决定迁移" | ❌ 不成立 | 必须用 100-500 个真实任务的 cost_per_success |
| "Luna-only 替换全部任务" | ❌ 不成立 | 高错误代价 / 难自动验证任务仍需 Terra/Sol 终审 + 人工 |
| "平均上下文 200K ≠ 成本稳定" | ❌ 不成立 | P50/P90/P95/P99 + 272K 阶跃 + 跨线前最后工具调用都要看 |
| "缓存写越多越好" | ❌ 不成立 | 写后未读是浪费;写在前缀会被复用时才有收益 |
| "新价 = 任意上下文任意 Token 统一" | ❌ 不成立 | 272K 阶跃 + 缓存读 / 写 / 输入分别计价 |
| "Web Search 与模型 Token 一起降" | ❌ 不成立 | 工具费单独计费,固定调用费与 Token 价格不联动 |
| "Luna 自动验证 = 可去掉人工复核" | ❌ 不成立 | 高风险决策保留人工责任 |
文章正文
GPT-5.6 Luna 降价 80%:Agent 真正该重算的是单次成功成本
事实边界:本文按 2026-07-31 可访问的 OpenAI 公告、Luna 模型卡与 API 价格页核验。降价不代表模型权重改变,也不能推导 OpenAI 的单位推理成本或毛利率。
摘要
Luna Standard 短上下文输入、缓存读取、缓存写入和输出价格都降到了旧价的 20%。所以在模型、服务层级、上下文区间和 Token 构成不变时,模型 Token 账单精确下降 80%。但 Agent 任务还包含工具调用、循环重试、长上下文阶跃、缓存失配和人工复核。真正决定迁移价值的指标应是 cost_per_success。本文给出完整费率等式、工具成本拐点、272K 阈值、100–500 个真实任务 A/B 和 Luna-first 条件升级方案。
关键词
GPT-5.6 Luna、cost_per_success、272K 阈值、Web Search、Luna-first
目录
- 一、80% 是严格等式,但有四个前提
- 二、模型费降 80%,任务总成本为什么未必
- 三、Token 便宜后,工具更早成为成本中心
- 四、272K 是完整请求的离散价格阶跃
- 五、缓存命中属于计费架构
- 六、迁移主指标:cost_per_success
- 七、用 100–500 个真实任务做 A/B
- 八、Luna-first,不是 Luna-only
- 九、30 天迁移节奏
- 结论
- 参考资料
一、80% 是严格等式,但有四个前提
OpenAI 当前列示的 Luna Standard 短上下文费率为:
| 计费项 | 旧价 | 新价 | 单位 |
|---|---|---|---|
| 未缓存输入 | 1.00 | 0.20 | 美元/百万 Token |
| 缓存读取 | 0.10 | 0.02 | 美元/百万 Token |
| 缓存写入 | 1.25 | 0.25 | 美元/百万 Token |
| 输出 | 6.00 | 1.20 | 美元/百万 Token |
设四类 Token 分别为 I、R、W、O:
old = 1.00I + 0.10R + 1.25W + 6.00O
new = 0.20I + 0.02R + 0.25W + 1.20O
= 0.20 × old
这条等式只在四个条件同时成立时有效:同一个 Luna 模型、同一服务层级、同一上下文费率区间、同一 Token 向量。工具、区域与第三方费用不包含在等式中。
二、模型费降 80%,任务总成本为什么未必
Agent 任务成本至少包含:
模型 Token
+ 工具调用
+ 外部服务
+ 重试与循环
+ 人工复核
假设旧模型 Token 成本 0.10 美元,工具 0.03 美元,人工复核摊销 0.07 美元,总成本是 0.20 美元。模型部分降 80% 后,总成本变成:
0.02 + 0.03 + 0.07 = 0.12 美元
业务总成本只下降 40%。如果 Luna 需要更多轮次、搜索或人工介入,单次调用更便宜,单次成功任务甚至可能没有更便宜。
三、Token 便宜后,工具更早成为成本中心
OpenAI 当前 Web Search 固定调用费为每 1,000 次 10 美元,即每次 0.01 美元,搜索内容 Token 另计。
一次 20K 未缓存输入、2K 输出的 Luna Standard 请求:
20K × $0.20/M + 2K × $1.20/M = $0.0064
一次 Web Search 的固定费已经高于模型 Token 成本。这不是让 Agent 停止搜索,而是要求团队记录 tool_calls_per_success、重复搜索、无结果搜索和搜索后的成功率提升。该搜的证据仍要搜,失控的循环必须被 Harness 截止。
四、272K 是完整请求的离散价格阶跃
Luna 支持 1,050,000 上下文,最大输出 128,000;但输入超过 272K 后,完整请求按 2 倍输入、1.5 倍输出费率计费。Standard 对应变为输入 0.40、缓存读 0.04、缓存写 0.50、输出 1.80 美元/百万 Token。
平均上下文 200K 不能证明成本稳定。团队需要看 P50/P90/P95/P99、跨线比例以及跨线前最后一次工具调用。可以在 240K–260K 预警并压缩已确认状态,但高风险任务如果必须保留完整证据,就应接受长上下文费率。
五、缓存命中属于计费架构
缓存读取价格是普通输入的十分之一,但命中依赖稳定前缀。把时间戳、用户状态或最新工具结果放在 Prompt 前部,会让后续稳定 instructions 无法复用。
更合理的顺序是:
稳定 instructions
稳定工具定义
稳定任务规则
动态用户状态
最新工具结果
当前请求
缓存写入价格高于普通输入。只有前缀会被复用时,写入才可能有收益。因此需要同时观察读取率、写入率、前缀复用次数和写后未读比例。
六、迁移主指标:cost_per_success
先为任务定义可验收的"成功":代码任务可要求测试、静态检查和补丁审计;检索任务可要求关键结论带可访问来源;结构化提取可要求 schema 与抽样共同通过。
然后计算:
cost_per_success
= 所有尝试的模型费
+ 所有工具费
+ 外部服务费
+ 人工复核摊销
--------------------------------
成功任务数
对照表至少包含:
- 首次成功率与严重错误数;
- 单次成功成本;
- P50/P95 端到端延迟;
- 每次成功的重试、模型轮次、工具调用与输出 Token;
- 缓存读取率、人工复核分钟数和升级模型分布。
七、用 100–500 个真实任务做 A/B
样本应覆盖低风险可验证、中等不确定性、高错误代价、长上下文、重工具调用和历史尾部失败任务。在相同 Harness、工具预算和验证器下比较:
A:当前生产路由
B:Luna-first + 相同验证器 + 条件升级
通过条件不是"平均分不错",而是成功率在容差内、P95 未超预算、cost_per_success 稳定下降、严重错误为 0,且工具循环、人工复核和升级率没有异常上升。
八、Luna-first,不是 Luna-only
低不确定性 + 可自动验证 + 高调用量
-> Luna first
中等不确定性 + 用户可见 + 验收标准明确
-> Luna / Terra A/B,失败时升级
高不确定性 + 高错误代价 + 难自动验证
-> Terra / Sol 规划终审,Luna 执行可验证子任务
升级条件应能被系统观察:schema 或测试失败、来源冲突、置信不足、工具循环超限、长上下文接近阈值且不可安全压缩,以及不可逆、财务、法律或安全风险。
九、30 天迁移节奏
- 第 1–3 天:导出模型、工具、重试和人工复核基线,统一成功定义。
- 第 4–10 天:低风险小流量对照,每日核对本地估算和真实账单。
- 第 11–20 天:纳入中等不确定性和长上下文,观察 P95 与尾部失败。
- 第 21–30 天:固化升级与回滚阈值,高风险任务保留 Terra/Sol。
任务量很小时,维护多模型路由的工程成本可能高于节省金额;继续使用单一强模型是合理的更简单方案。自动验证器也不能替代高风险任务中的人工责任。
结论
可以精确说:同构 Luna Token 账单下降 80%。
必须通过实验回答:你的单次成功任务成本下降了多少。
Luna 的新价格让大量可验证任务具备 Luna-first 的经济性,但真正可持续的收益来自成功定义、工具预算、上下文治理、真实任务 A/B、条件升级和可回滚的运行合同。
参考资料
- OpenAI:GPT-5.6 价格性能公告
- OpenAI Developers:GPT-5.6 Luna 模型卡
- OpenAI Developers:API Pricing
- OpenAI:GPT-5.6 效率说明
错误速查卡
| 症状 | 根因 | 定位 | 修复 |
|---|---|---|---|
| 把"模型 Token 账单降 80%"当任务总成本降 80% | 工具 / 外部服务 / 重试 / 人工摊销独立计费 | 检查 cost_per_success 公式各分量 | 用 cost_per_success 替换单一模型费对比 |
| Web Search 突然成为成本中心 | 工具固定调用费 > 模型 Token 费 | 检查 tool_calls_per_success / 重复搜索 / 无结果搜索 | 记录重复搜索与成功率提升;用 Harness 截止失控循环 |
| 长上下文任务超出预算 | 输入 > 272K 后完整请求按 2× 输入 / 1.5× 输出费率 | 检查 P50/P90/P95/P99 + 跨线比例 | 在 240K-260K 预警并压缩;高风险任务接受长上下文费率 |
| 缓存命中仍偏低 | 时间戳 / 用户状态 / 工具结果被放在稳定前缀前部 | 检查 prompt 顺序 | 稳定 instructions / 工具定义 / 任务规则 → 动态用户状态 → 最新工具结果 → 当前请求 |
| 缓存写入后未读 | 缓存写 > 普通输入;只在前缀会被复用时才有收益 | 检查写后未读比例 | 观察读取率 / 写入率 / 前缀复用次数;写后未读即浪费 |
| 跑分高就宣布迁移 | Benchmark ≠ 真实任务;Benchmark 不能覆盖工具循环 / 长上下文 / 错误代价 | 缺少真实任务 A/B | 用 100-500 个真实任务做 A/B;固定任务集、工具、重试规则与质量门槛 |
| "Luna-only" 替换全部任务 | 高错误代价 / 难自动验证任务仍需 Terra/Sol 终审 | 任务分类表 | Luna-first 三档:低不确 → Luna / 中等 → A/B 升级 / 高 → Terra/Sol + 人工 |
| 平均上下文 200K 证明成本稳定 | 平均掩盖 P99 跨线 + 跨线前最后工具调用 | 检查 P99 + 跨线前最后工具调用 | 用 P50/P90/P95/P99 + 跨线比例 + 跨线前最后工具调用替换平均 |
| 把"升级率"当成优化信号 | 升级率高可能说明路由条件太严或任务分类错 | 升级率与成功率 / cost_per_success 联动 | 升级率必须作为必记录指标与首次成功率 / 严重错误数联动 |
| 工具循环失控 | Harness 没设截止条件;Harness 仍相信"模型更努力就好" | 检查工具循环次数 / 无结果搜索 | Harness 必须设最大循环次数 / 无结果搜索上限 / 失败回退 |
| 任务量小时仍维护多模型路由 | 路由工程成本 > 节省金额 | 任务量 / 路由代码维护成本 | 任务量小时继续用单一强模型;路由是规模收益 |
| Luna 任务把平均成本"打"下来 | 平均价被短上下文低费率主导 | 拆分 272K 上下的成本分布 | 报告必须按 272K 阶跃分段展示,不能合并 |
| 人工复核被自动验证器替代 | 自动验证器不能处理高风险决策 | 任务分级 | 高风险决策保留人工责任;自动验证器只替代可验证部分 |
| "Luna 自动成功"被当总成功 | Luna 不通过的尾部仍由升级模型兜底 | 检查升级强模型比例 | 报告必须区分 Luna 首轮成功 / 升级后成功 / 最终失败的拆分 |
| 把 1.05M 上下文当默认能力 | 272K 阶跃;缓存写 / 缓存读 / 工具固定费都独立计费 | 检查跨线比例与缓存命中分布 | 272K 是费率阶跃;超过即按长上下文费率;1.05M 不是"随便用" |
| 把新价推广到任意上下文区间 | 272K 长上下文费率高于短上下文 | 检查 272K 跨线比例 | Standard 长上下文:输入 0.40 / 缓存读 0.04 / 缓存写 0.50 / 输出 1.80 |
| "Luna 输入 0.20 = 整个请求 0.20" | 四项费率独立;输出 / 缓存写 / 工具不在输入里 | 拆分四项 Token | 报告必须按 I / R / W / O 四项分别展示 |
作者:武子康的个人博客