GPT-5.6 Luna 降价 80%:Agent 真正该重算的是单次成功成本

0 阅读9分钟

GPT-5.6 Luna 降价 80%:Agent 真正该重算的是单次成功成本

TL;DR

  • 场景:OpenAI 2026-07-30 公告 Luna Standard 短上下文四项费率同步降到旧价 20%(即降价 80%);同构 Luna Token 账单精确下降 80%。
  • 结论:模型 Token 便宜不等于单次成功任务便宜。Agent 任务总成本还包含工具调用、循环重试、长上下文阶跃、缓存失配和人工复核;真正决定迁移价值的是 cost_per_success
  • 产出:完整费率等式(4 项 × 0.2)+ 工具成本拐点(Web Search 0.01 > 示例 Token 0.0064)+ 272K 长上下文阶跃(2× 输入 / 1.5× 输出)+ 缓存命中顺序建议 + cost_per_success 公式与对照表 + 100-500 个真实任务 A/B 矩阵 + Luna-first 三档条件升级方案 + 30 天迁移节奏。

版本矩阵

维度状态说明
Luna Standard 短上下文四项费率同步降到旧价 20%✅ 已验证输入 1.00 → 0.20 / 缓存读 0.10 → 0.02 / 缓存写 1.25 → 0.25 / 输出 6.00 → 1.20(美元 / 百万 Token)
等式 new = 0.20 × old✅ 已验证同 Luna 模型 / 同服务层级 / 同上下文区间 / 同 Token 向量
Luna 上下文容量✅ 已验证1,050,000 token 上下文 / 128,000 最大输出
272K 长上下文阶跃✅ 已验证输入 > 272K 后完整请求按 2× 输入 + 1.5× 输出费率计费(Standard 对应:输入 0.40 / 缓存读 0.04 / 缓存写 0.50 / 输出 1.80)
OpenAI 公告日期✅ 已验证自 2026-07-30 起 API 定价生效;Sol 同时新增 Fast mode
Terra 同步降价✅ 已验证Terra 同步降价 20%:输入 2/M、输出2/M、输出 12/M
Web Search 固定调用费✅ 已验证10.00/1kcallsreasoningnonreasoning模型存在价差;nonreasoningpreview10.00 / 1k calls(reasoning 与 non-reasoning 模型存在价差;non-reasoning preview 25.00/1k)
Web Search 内容 Token✅ 已验证搜索内容 Token 另计
Container / Code Interpreter✅ 已验证每 20 分钟会话计费
File search✅ 已验证Storage 0.10/GBdayToolcall0.10/GB-day;Tool call 2.50/1k calls
Agent Kit✅ 已验证ChatKit file/image upload storage $0.10/GB-day
缓存读取 = 输入的 10%✅ 已验证Luna Standard:缓存读 0.02 / 输入 0.20 = 10%
缓存写入 > 普通输入✅ 已验证Luna Standard:缓存写 0.25 / 输入 0.20 = 1.25×
Luna-first 升级条件✅ 已验证失败 / 低置信 / 复杂任务升级;高风险保留人工责任
"模型 Token 便宜 = 任务总成本便宜"❌ 不成立工具、循环、人工摊销、272K 阶跃都独立计费
"用 Benchmark 决定迁移"❌ 不成立必须用 100-500 个真实任务的 cost_per_success
"Luna-only 替换全部任务"❌ 不成立高错误代价 / 难自动验证任务仍需 Terra/Sol 终审 + 人工
"平均上下文 200K ≠ 成本稳定"❌ 不成立P50/P90/P95/P99 + 272K 阶跃 + 跨线前最后工具调用都要看
"缓存写越多越好"❌ 不成立写后未读是浪费;写在前缀会被复用时才有收益
"新价 = 任意上下文任意 Token 统一"❌ 不成立272K 阶跃 + 缓存读 / 写 / 输入分别计价
"Web Search 与模型 Token 一起降"❌ 不成立工具费单独计费,固定调用费与 Token 价格不联动
"Luna 自动验证 = 可去掉人工复核"❌ 不成立高风险决策保留人工责任

文章正文

H1:Luna 降价 −80% / 模型费便宜 5 倍不等于任务成本按比例下降 / 真正该重算的是 cost_per_success

GPT-5.6 Luna 降价 80%:Agent 真正该重算的是单次成功成本

事实边界:本文按 2026-07-31 可访问的 OpenAI 公告、Luna 模型卡与 API 价格页核验。降价不代表模型权重改变,也不能推导 OpenAI 的单位推理成本或毛利率。

摘要

Luna Standard 短上下文输入、缓存读取、缓存写入和输出价格都降到了旧价的 20%。所以在模型、服务层级、上下文区间和 Token 构成不变时,模型 Token 账单精确下降 80%。但 Agent 任务还包含工具调用、循环重试、长上下文阶跃、缓存失配和人工复核。真正决定迁移价值的指标应是 cost_per_success。本文给出完整费率等式、工具成本拐点、272K 阈值、100–500 个真实任务 A/B 和 Luna-first 条件升级方案。

关键词

GPT-5.6 Luna、cost_per_success、272K 阈值、Web Search、Luna-first

目录

一、80% 是严格等式,但有四个前提

官方证据 01:OpenAI 公告 Availability and pricing — Terra 和 Luna 同时降价;Sol 维持原价并新增 Fast mode

四项 Standard 费率向量:输入 0.20 / 缓存读 0.02 / 缓存写 0.25 / 输出 1.20;四项都 × 0.2

OpenAI 当前列示的 Luna Standard 短上下文费率为:

计费项旧价新价单位
未缓存输入1.000.20美元/百万 Token
缓存读取0.100.02美元/百万 Token
缓存写入1.250.25美元/百万 Token
输出6.001.20美元/百万 Token

设四类 Token 分别为 I、R、W、O

old = 1.00I + 0.10R + 1.25W + 6.00O
new = 0.20I + 0.02R + 0.25W + 1.20O
    = 0.20 × old

这条等式只在四个条件同时成立时有效:同一个 Luna 模型、同一服务层级、同一上下文费率区间、同一 Token 向量。工具、区域与第三方费用不包含在等式中。

二、模型费降 80%,任务总成本为什么未必

MODEL COST ≠ TASK COST:只看模型账单 −80% 漂亮;看完整体任务只 −40%

Agent 任务成本至少包含:

模型 Token
+ 工具调用
+ 外部服务
+ 重试与循环
+ 人工复核

假设旧模型 Token 成本 0.10 美元,工具 0.03 美元,人工复核摊销 0.07 美元,总成本是 0.20 美元。模型部分降 80% 后,总成本变成:

0.02 + 0.03 + 0.07 = 0.12 美元

业务总成本只下降 40%。如果 Luna 需要更多轮次、搜索或人工介入,单次调用更便宜,单次成功任务甚至可能没有更便宜。

三、Token 便宜后,工具更早成为成本中心

官方证据 02:OpenAI API 工具费用单独计费(Web Search $10/1k、Containers、File search、Agent Kit)

COST CENTER SHIFT:Web Search 0.01 > 示例 Luna Token 0.0064

OpenAI 当前 Web Search 固定调用费为每 1,000 次 10 美元,即每次 0.01 美元,搜索内容 Token 另计。

一次 20K 未缓存输入、2K 输出的 Luna Standard 请求:

20K × $0.20/M + 2K × $1.20/M = $0.0064

一次 Web Search 的固定费已经高于模型 Token 成本。这不是让 Agent 停止搜索,而是要求团队记录 tool_calls_per_success、重复搜索、无结果搜索和搜索后的成功率提升。该搜的证据仍要搜,失控的循环必须被 Harness 截止。

四、272K 是完整请求的离散价格阶跃

官方证据 03:Luna 模型卡 — 1,050,000 上下文 / 128,000 max output;标准费率与 272K 长上下文规则

CONTEXT THRESHOLD:272K 不是容量数字,而是费率阶跃(≤272K vs >272K:输入 ×2、输出 ×1.5)

Luna 支持 1,050,000 上下文,最大输出 128,000;但输入超过 272K 后,完整请求按 2 倍输入、1.5 倍输出费率计费。Standard 对应变为输入 0.40、缓存读 0.04、缓存写 0.50、输出 1.80 美元/百万 Token。

平均上下文 200K 不能证明成本稳定。团队需要看 P50/P90/P95/P99、跨线比例以及跨线前最后一次工具调用。可以在 240K–260K 预警并压缩已确认状态,但高风险任务如果必须保留完整证据,就应接受长上下文费率。

五、缓存命中属于计费架构

缓存读取价格是普通输入的十分之一,但命中依赖稳定前缀。把时间戳、用户状态或最新工具结果放在 Prompt 前部,会让后续稳定 instructions 无法复用。

更合理的顺序是:

稳定 instructions
稳定工具定义
稳定任务规则
动态用户状态
最新工具结果
当前请求

缓存写入价格高于普通输入。只有前缀会被复用时,写入才可能有收益。因此需要同时观察读取率、写入率、前缀复用次数和写后未读比例。

六、迁移主指标:cost_per_success

先为任务定义可验收的"成功":代码任务可要求测试、静态检查和补丁审计;检索任务可要求关键结论带可访问来源;结构化提取可要求 schema 与抽样共同通过。

然后计算:

cost_per_success
= 所有尝试的模型费
+ 所有工具费
+ 外部服务费
+ 人工复核摊销
--------------------------------
成功任务数

对照表至少包含:

  • 首次成功率与严重错误数;
  • 单次成功成本;
  • P50/P95 端到端延迟;
  • 每次成功的重试、模型轮次、工具调用与输出 Token;
  • 缓存读取率、人工复核分钟数和升级模型分布。

七、用 100–500 个真实任务做 A/B

REAL-TASK A/B:别拿跑分迁移 / 100-500 个真实任务 / 主指标 cost_per_success;首轮成功率 / 工具调用 / p50/p95 / 人工复核分钟 / 升级强模型比例(必须记录)

样本应覆盖低风险可验证、中等不确定性、高错误代价、长上下文、重工具调用和历史尾部失败任务。在相同 Harness、工具预算和验证器下比较:

A:当前生产路由
B:Luna-first + 相同验证器 + 条件升级

通过条件不是"平均分不错",而是成功率在容差内、P95 未超预算、cost_per_success 稳定下降、严重错误为 0,且工具循环、人工复核和升级率没有异常上升。

八、Luna-first,不是 Luna-only

CONDITIONAL ROUTING:Luna-first 三档(默认执行 / 条件升级 / 人工责任)

低不确定性 + 可自动验证 + 高调用量
    -> Luna first

中等不确定性 + 用户可见 + 验收标准明确
    -> Luna / Terra A/B,失败时升级

高不确定性 + 高错误代价 + 难自动验证
    -> Terra / Sol 规划终审,Luna 执行可验证子任务

升级条件应能被系统观察:schema 或测试失败、来源冲突、置信不足、工具循环超限、长上下文接近阈值且不可安全压缩,以及不可逆、财务、法律或安全风险。

九、30 天迁移节奏

  1. 第 1–3 天:导出模型、工具、重试和人工复核基线,统一成功定义。
  2. 第 4–10 天:低风险小流量对照,每日核对本地估算和真实账单。
  3. 第 11–20 天:纳入中等不确定性和长上下文,观察 P95 与尾部失败。
  4. 第 21–30 天:固化升级与回滚阈值,高风险任务保留 Terra/Sol。

任务量很小时,维护多模型路由的工程成本可能高于节省金额;继续使用单一强模型是合理的更简单方案。自动验证器也不能替代高风险任务中的人工责任。

结论

可以精确说:同构 Luna Token 账单下降 80%。

必须通过实验回答:你的单次成功任务成本下降了多少。

Luna 的新价格让大量可验证任务具备 Luna-first 的经济性,但真正可持续的收益来自成功定义、工具预算、上下文治理、真实任务 A/B、条件升级和可回滚的运行合同。

参考资料

  1. OpenAI:GPT-5.6 价格性能公告
  2. OpenAI Developers:GPT-5.6 Luna 模型卡
  3. OpenAI Developers:API Pricing
  4. OpenAI:GPT-5.6 效率说明

错误速查卡

症状根因定位修复
把"模型 Token 账单降 80%"当任务总成本降 80%工具 / 外部服务 / 重试 / 人工摊销独立计费检查 cost_per_success 公式各分量用 cost_per_success 替换单一模型费对比
Web Search 突然成为成本中心工具固定调用费 > 模型 Token 费检查 tool_calls_per_success / 重复搜索 / 无结果搜索记录重复搜索与成功率提升;用 Harness 截止失控循环
长上下文任务超出预算输入 > 272K 后完整请求按 2× 输入 / 1.5× 输出费率检查 P50/P90/P95/P99 + 跨线比例在 240K-260K 预警并压缩;高风险任务接受长上下文费率
缓存命中仍偏低时间戳 / 用户状态 / 工具结果被放在稳定前缀前部检查 prompt 顺序稳定 instructions / 工具定义 / 任务规则 → 动态用户状态 → 最新工具结果 → 当前请求
缓存写入后未读缓存写 > 普通输入;只在前缀会被复用时才有收益检查写后未读比例观察读取率 / 写入率 / 前缀复用次数;写后未读即浪费
跑分高就宣布迁移Benchmark ≠ 真实任务;Benchmark 不能覆盖工具循环 / 长上下文 / 错误代价缺少真实任务 A/B用 100-500 个真实任务做 A/B;固定任务集、工具、重试规则与质量门槛
"Luna-only" 替换全部任务高错误代价 / 难自动验证任务仍需 Terra/Sol 终审任务分类表Luna-first 三档:低不确 → Luna / 中等 → A/B 升级 / 高 → Terra/Sol + 人工
平均上下文 200K 证明成本稳定平均掩盖 P99 跨线 + 跨线前最后工具调用检查 P99 + 跨线前最后工具调用用 P50/P90/P95/P99 + 跨线比例 + 跨线前最后工具调用替换平均
把"升级率"当成优化信号升级率高可能说明路由条件太严或任务分类错升级率与成功率 / cost_per_success 联动升级率必须作为必记录指标与首次成功率 / 严重错误数联动
工具循环失控Harness 没设截止条件;Harness 仍相信"模型更努力就好"检查工具循环次数 / 无结果搜索Harness 必须设最大循环次数 / 无结果搜索上限 / 失败回退
任务量小时仍维护多模型路由路由工程成本 > 节省金额任务量 / 路由代码维护成本任务量小时继续用单一强模型;路由是规模收益
Luna 任务把平均成本"打"下来平均价被短上下文低费率主导拆分 272K 上下的成本分布报告必须按 272K 阶跃分段展示,不能合并
人工复核被自动验证器替代自动验证器不能处理高风险决策任务分级高风险决策保留人工责任;自动验证器只替代可验证部分
"Luna 自动成功"被当总成功Luna 不通过的尾部仍由升级模型兜底检查升级强模型比例报告必须区分 Luna 首轮成功 / 升级后成功 / 最终失败的拆分
把 1.05M 上下文当默认能力272K 阶跃;缓存写 / 缓存读 / 工具固定费都独立计费检查跨线比例与缓存命中分布272K 是费率阶跃;超过即按长上下文费率;1.05M 不是"随便用"
把新价推广到任意上下文区间272K 长上下文费率高于短上下文检查 272K 跨线比例Standard 长上下文:输入 0.40 / 缓存读 0.04 / 缓存写 0.50 / 输出 1.80
"Luna 输入 0.20 = 整个请求 0.20"四项费率独立;输出 / 缓存写 / 工具不在输入里拆分四项 Token报告必须按 I / R / W / O 四项分别展示

作者:武子康的个人博客