13.9 亿 Token 复盘:93.46% 是缓存重读,隐性补贴占牌价 75.8%
上月跑了一次双口径度量(本地 session 日志 + 平台账单,两个开源 Skill),这篇是 2026-08 全月数据的完整复盘。先给三个核心数字,再讲验算和口径——掘金的读者应该会想自己复算一遍,数据都来自可复现的原始日志与报表 JSON。
| 口径 | 数值 |
|---|---|
| 真实支出(平台账单折算) | ¥196.66(3,286 次请求) |
| 牌价等值(本地 Token × 公开价) | ¥813.16(1,390,620,186 Tokens) |
| 隐性补贴 | ¥616.50(75.8%) |
这笔补贴的来源是可验证的:走 -free 模型的 30.2% Token,账单侧记 ¥0,Token 侧按同款付费模型牌价估值 ¥160.86。估值口径本身就是设计选择——不估值,免费额度在报表里就是隐形的,跨月对比会直接失真。
1. 口径先对齐:两份报表在量什么
ai-usage-report(账单侧)读 CodeBuddy / Qoder / TRAE / DeepSeek 的平台后台,计量单位是请求次数 + 扣费;ai-token-usage(Token 侧)读本机 Claude Code(CLI + VSCode + 子代理)/ OpenCode / Copilot 的 JSONL 与 SQLite,计量单位是 input / output / cache_read Token + 牌价估算。
两者覆盖的客户端几乎不重叠(账单侧 91% 是 CodeBuddy,Token 侧 91% 是 Claude Code + OpenCode),因此所有交叉结论都分列呈现,绝不加总。
账单侧结构:CodeBuddy 3,002 次(91.4%)¥117.57(59.8%)、DeepSeek 108 次(3.3%)¥45.37(23.1%)、Qoder 64 次 ¥31.30(15.9%)、TRAE 112 次 ¥2.42(1.2%)。免费 / 付费 = 1,781 / 1,505;请求量 Top 模型 hy3 1,628 次全部免费额度。
我的真实用法是每月轮流订阅一家订阅制 IDE(8 月 CodeBuddy,5 个账号轮流耗额度),DeepSeek 为按量 API,用量大头靠平台赠送的免费 Token(54.2% 请求、30.2% Token 走免费额度)。
账单侧的两张饼图是"钱花在哪"和"次数花在哪"的分离视图——只看一张会得出相反结论:
| 折算费用(RMB)占比 | 请求次数占比 |
|---|---|
每日费用曲线(注意账号接力:8/1–8/12 几乎全在 kyxxxxab,8/13 起 → 135-08 → 138-32 → 139-32 → 136-91,即逐账号耗额度;峰值 8/20 ¥26.37、8/21 ¥23.60、DeepSeek 8/30 ¥24.54):
任务类型分布这张图不要用:CodeBuddy 86.9% 落入"其他/对话",是关键词分类覆盖率不足(平台不回传 prompt 全文),不是真实分布。要做归因得先补 prompt 采集:
2. 93.46% 缓存重读:算法与三路验算
Token 构成:cache_read 1,299,678,784(93.46%)、全新输入 78,693,336(5.66%)、输出 12,248,066(0.88%);input : output = 112.5 : 1;204 会话 / 14,700 turns / 22 活跃天。
按模型拆(estimate_cost 走牌价表,*-free 按同款付费模型估值):
| 模型 | Tokens | 占比 | 等值费用 | 计费性质 |
|---|---|---|---|---|
| deepseek-v4-pro | 806,913,101 | 58.0% | ¥599.94 | 付费 |
| hy3-free | 299,921,169 | 21.6% | ¥115.39 | 免费额度 |
| deepseek-v4-flash | 163,551,983 | 11.8% | ¥50.74 | 付费 |
| deepseek-v4-flash-free | 80,556,926 | 5.8% | ¥37.37 | 免费额度 |
| mimo-v2.5-free | 38,773,758 | 2.8% | ¥8.10 | 免费额度 |
四联趋势图(按模型 Token / 费用 / 会话 / 轮次)——8/14 那根费用柱由单个会话贡献,见第 3 节:
算法: 报表聚合时 input_tokens 已折叠缓存(UsageBucket.add 内 input += input_tok + cache_read,cache 另单独累加),故 缓存占比 = cache_read_tokens / total_tokens。
验算三路:
- 加总守恒 —— 9 个模型 cache 逐项求和 = 1,299,678,784,与总量一致;
- 费用反推 —— 用技能自身定价模块按模型重算:$120.70 × FX 6.737 = ¥813.16,与报表一致(该等式仅在"input 含缓存、cache 按
estimate_cost的standard_input = input - cache_read计价"时成立); - 原始日志抽样 —— Claude Code JSONL 的
cache_read_input_tokens/input_tokens/cache_creation_input_tokens为厂商原生上报字段,非报表推算。
缓存牌价结构(USD / 1M):
| 模型 | input | cache_read | output | cache/input | cache/output |
|---|---|---|---|---|---|
| deepseek-v4-pro | $1.32 | $0.044 | $3.96 | 1/30 | 1/90 |
| deepseek-v4-flash | $0.44 | $0.014 | $1.32 | 1/31 | 1/94 |
| hy3 | $0.148 | $0.037 | $0.594 | 1/4 | 1/16 |
反事实计算: 对全部模型以 cache_read=0 重跑定价,总成本 $1,255.76 → ¥8,460.04。即缓存折扣节省 ¥7,646.88(90.4%),实际支出为无折扣方案的 9.6%。
工程含义: Agent 工作流的经济模型 = 模型单价 × 缓存折扣 × 上下文复用率。换客户端、清空会话、逐轮全量重喂 AGENTS.md,任何一项都会把 cache_read 塌缩成 standard input,等价于 10 倍成本。可监控指标是 cache_read / total,而不是 Token 总量。
3. 会话分布:极度右偏,优化对象是异常值
| 切片 | 占全月 Token |
|---|---|
| Top 1 | 20.3%(281,719,621 / 2,646 turns / 8-14 / 等价 ¥223.34) |
| Top 3 | 43.0% |
| Top 10 | 66.5% |
| Top 20 | 81.2% |
中位数 326,570 vs 均值 6,816,765(20.9×)。"平均使用强度"是无效优化目标——对 204 个会话做普遍降耗,不如审 3~10 个巨型会话的存在必要性,后者直接影响 43%~66% 的总量。
4. 数据口径备注(复现前必读)
- Token 侧日级求和 1,389,921,491 与月度总量差 698,695(≈ minimax-m3 单会话量),跨月对比以月度 / Session 级为准;
- 任务类型为提示词关键词分类,CodeBuddy 86.9% 落入"其他/对话"(平台不回传 prompt 全文),不可用于归因;
minimax-m3按 fallbackauto牌价、glm-5.2/deepseek-v4-pro-0813按子串匹配计价,合计 ¥1.39;- 账单侧各平台费用单位不同(积分 vs RMB),对比前须按汇率折算,且与 Token 侧的等值费用不可相加。
复现路径:两个 Skill 首次 init.py 装依赖、各平台建立登录态后,月度全流程约 10 分钟;Token 侧的 data/data.csv 是持久化 store,支持 --import-data 跨机器合并。欢迎在评论区贴你自己的 cache_read 占比,看看 93.46% 是不是普遍水平。
本文的度量方法由两个开源 Skill 实现,源码地址:
- Gitee:gitee.com/KylinLab/ky…
- GitHub:github.com/KylinLabAI/…