13.9 亿 Token 复盘:93.46% 是缓存重读,隐性补贴占牌价 75.8%

2 阅读5分钟

13.9 亿 Token 复盘:93.46% 是缓存重读,隐性补贴占牌价 75.8%

封面图:13.9 亿 Token 与 197 元账单

上月跑了一次双口径度量(本地 session 日志 + 平台账单,两个开源 Skill),这篇是 2026-08 全月数据的完整复盘。先给三个核心数字,再讲验算和口径——掘金的读者应该会想自己复算一遍,数据都来自可复现的原始日志与报表 JSON。

口径数值
真实支出(平台账单折算)¥196.66(3,286 次请求)
牌价等值(本地 Token × 公开价)¥813.16(1,390,620,186 Tokens)
隐性补贴¥616.50(75.8%)

真实支出 ¥196.66 与牌价等值 ¥813.16 叠在一起:差 4.1 倍

这笔补贴的来源是可验证的:走 -free 模型的 30.2% Token,账单侧记 ¥0,Token 侧按同款付费模型牌价估值 ¥160.86。估值口径本身就是设计选择——不估值,免费额度在报表里就是隐形的,跨月对比会直接失真。

1. 口径先对齐:两份报表在量什么

ai-usage-report(账单侧)读 CodeBuddy / Qoder / TRAE / DeepSeek 的平台后台,计量单位是请求次数 + 扣费ai-token-usage(Token 侧)读本机 Claude Code(CLI + VSCode + 子代理)/ OpenCode / Copilot 的 JSONL 与 SQLite,计量单位是 input / output / cache_read Token + 牌价估算。

两者覆盖的客户端几乎不重叠(账单侧 91% 是 CodeBuddy,Token 侧 91% 是 Claude Code + OpenCode),因此所有交叉结论都分列呈现,绝不加总。

账单侧结构:CodeBuddy 3,002 次(91.4%)¥117.57(59.8%)、DeepSeek 108 次(3.3%)¥45.37(23.1%)、Qoder 64 次 ¥31.30(15.9%)、TRAE 112 次 ¥2.42(1.2%)。免费 / 付费 = 1,781 / 1,505;请求量 Top 模型 hy3 1,628 次全部免费额度。

我的真实用法是每月轮流订阅一家订阅制 IDE(8 月 CodeBuddy,5 个账号轮流耗额度),DeepSeek 为按量 API,用量大头靠平台赠送的免费 Token(54.2% 请求、30.2% Token 走免费额度)。

账单侧的两张饼图是"钱花在哪"和"次数花在哪"的分离视图——只看一张会得出相反结论

折算费用(RMB)占比请求次数占比
折算费用(RMB) 各平台占比:CodeBuddy 59.8%、DeepSeek 23.1%、Qoder 15.9%、TRAE 1.2%请求次数 各平台占比:CodeBuddy 91.4%、TRAE 3.4%、DeepSeek 3.3%、Qoder 1.9%

每日费用曲线(注意账号接力:8/1–8/12 几乎全在 kyxxxxab,8/13 起 → 135-08138-32139-32136-91,即逐账号耗额度;峰值 8/20 ¥26.37、8/21 ¥23.60、DeepSeek 8/30 ¥24.54):

每日折算费用(RMB)趋势:峰值 8/20 ¥26.37、8/21 ¥23.60,DeepSeek 8/30 ¥24.54

任务类型分布这张图不要用:CodeBuddy 86.9% 落入"其他/对话",是关键词分类覆盖率不足(平台不回传 prompt 全文),不是真实分布。要做归因得先补 prompt 采集:

任务类型分布(分类覆盖率不足,仅供参考)

2. 93.46% 缓存重读:算法与三路验算

Token 构成:cache_read 1,299,678,784(93.46%)、全新输入 78,693,336(5.66%)、输出 12,248,066(0.88%);input : output = 112.5 : 1;204 会话 / 14,700 turns / 22 活跃天。

Token 构成:93.46% 缓存重读、5.66% 全新输入、0.88% 输出

按模型拆(estimate_cost 走牌价表,*-free 按同款付费模型估值):

模型Tokens占比等值费用计费性质
deepseek-v4-pro806,913,10158.0%¥599.94付费
hy3-free299,921,16921.6%¥115.39免费额度
deepseek-v4-flash163,551,98311.8%¥50.74付费
deepseek-v4-flash-free80,556,9265.8%¥37.37免费额度
mimo-v2.5-free38,773,7582.8%¥8.10免费额度

Token 侧模型用量占比:deepseek-v4-pro 58.0%、hy3-free 21.6%、deepseek-v4-flash 11.8%、deepseek-v4-flash-free 5.8%、mimo-v2.5-free 2.8%

四联趋势图(按模型 Token / 费用 / 会话 / 轮次)——8/14 那根费用柱由单个会话贡献,见第 3 节

Token 侧四联趋势:按模型 Token / 费用 / 会话 / 轮次——8/14 那根费用柱是单个会话烧出来的

算法: 报表聚合时 input_tokens 已折叠缓存(UsageBucket.addinput += input_tok + cache_read,cache 另单独累加),故 缓存占比 = cache_read_tokens / total_tokens

验算三路:

  1. 加总守恒 —— 9 个模型 cache 逐项求和 = 1,299,678,784,与总量一致;
  2. 费用反推 —— 用技能自身定价模块按模型重算:$120.70 × FX 6.737 = ¥813.16,与报表一致(该等式仅在"input 含缓存、cache 按 estimate_coststandard_input = input - cache_read 计价"时成立);
  3. 原始日志抽样 —— Claude Code JSONL 的 cache_read_input_tokens / input_tokens / cache_creation_input_tokens 为厂商原生上报字段,非报表推算。

缓存牌价结构(USD / 1M):

模型inputcache_readoutputcache/inputcache/output
deepseek-v4-pro$1.32$0.044$3.961/301/90
deepseek-v4-flash$0.44$0.014$1.321/311/94
hy3$0.148$0.037$0.5941/41/16

反事实计算: 对全部模型以 cache_read=0 重跑定价,总成本 $1,255.76 → ¥8,460.04。即缓存折扣节省 ¥7,646.88(90.4%),实际支出为无折扣方案的 9.6%。

工程含义: Agent 工作流的经济模型 = 模型单价 × 缓存折扣 × 上下文复用率。换客户端、清空会话、逐轮全量重喂 AGENTS.md,任何一项都会把 cache_read 塌缩成 standard input,等价于 10 倍成本。可监控指标是 cache_read / total,而不是 Token 总量。

3. 会话分布:极度右偏,优化对象是异常值

切片占全月 Token
Top 120.3%(281,719,621 / 2,646 turns / 8-14 / 等价 ¥223.34)
Top 343.0%
Top 1066.5%
Top 2081.2%

会话集中度:Top 20 / 204 个会话吃掉 81.2% 的 Token

中位数 326,570 vs 均值 6,816,765(20.9×)。"平均使用强度"是无效优化目标——对 204 个会话做普遍降耗,不如审 3~10 个巨型会话的存在必要性,后者直接影响 43%~66% 的总量。

4. 数据口径备注(复现前必读)

  • Token 侧日级求和 1,389,921,491 与月度总量差 698,695(≈ minimax-m3 单会话量),跨月对比以月度 / Session 级为准
  • 任务类型为提示词关键词分类,CodeBuddy 86.9% 落入"其他/对话"(平台不回传 prompt 全文),不可用于归因
  • minimax-m3 按 fallback auto 牌价、glm-5.2 / deepseek-v4-pro-0813 按子串匹配计价,合计 ¥1.39;
  • 账单侧各平台费用单位不同(积分 vs RMB),对比前须按汇率折算,且与 Token 侧的等值费用不可相加

复现路径:两个 Skill 首次 init.py 装依赖、各平台建立登录态后,月度全流程约 10 分钟;Token 侧的 data/data.csv 是持久化 store,支持 --import-data 跨机器合并。欢迎在评论区贴你自己的 cache_read 占比,看看 93.46% 是不是普遍水平。


本文的度量方法由两个开源 Skill 实现,源码地址: