做聊天应用时,token 账单基本可预估:一问一答,输入输出都有数。换成 Agent 之后,很多团队第一个月账单直接超预算几倍——因为 Agent 的计费结构和单轮对话完全不是一回事:每走一步都要把之前的全部历史重发一遍,而历史还在每步变长。
这篇按账单结构拆 5 个成本大头,每个给一个能直接落地的对策,先用一个 50 步任务算笔完整的账。
先算一笔账:一个 50 步 Agent 任务值多少钱
设定一个典型任务:Agent 跑 50 步(每步 = 一次 API 调用),平均每步输入 20K token(system prompt + 对话历史 + 工具返回),输出 1K token。总输入 = 50 × 20K = 100 万 token,总输出 = 5 万 token。按三款模型牌价(¥/百万 token,海外按 1 USD ≈ 6.79 折算):
| 模型 | 输入 | 输出 | 输入费 | 输出费 | 任务总价 |
|---|---|---|---|---|---|
| Claude Opus 4.8 | ¥33.93($5) | ¥169.63($25) | ¥33.93 | ¥8.48 | ≈¥42.41 |
| DeepSeek V4 Pro | ¥3.00 | ¥6.00 | ¥3.00 | ¥0.30 | ¥3.30 |
| MiniMax M2.7 | ¥2.10 | ¥8.40 | ¥2.10 | ¥0.42 | ¥2.52 |
单任务 ¥42 看着能接受,乘上量就不是了:每天 1000 个任务,Opus 4.8 约 ¥42,410/天,MiniMax M2.7 约 ¥2,520/天,差约 17 倍。还有个反直觉的点:这个场景里输入费占了大头(Opus 4.8 上约 80%)——所以 Agent 省钱的主战场在输入侧,不在输出侧。
大头一:上下文滚雪球,成本随步数平方级涨
Agent 循环的标准写法是每步把完整历史重发。历史每步变长,单步输入线性涨,累计输入平方级涨。算个具体的:起始上下文 4K,每步新增 2K(输出 1K + 工具结果 1K),第 50 步的单步输入已是 4K + 49 × 2K = 102K;50 步累计输入 = 50 × 4K + 2K × (49 × 50 ÷ 2) = 265 万 token。放在 Opus 4.8 上光输入费 ≈ ¥89.91——步数翻倍这个数字接近翻两番,这就是「跑长任务突然爆账单」的数学原因。
对策:修剪 + 摘要。 给历史设硬上限(比如 20K),超出丢最老轮次,只留任务目标和最近几步——上例封顶后累计输入回到 100 万,输入费回到 ¥33.93,省约 62%。再配合每隔 N 步用便宜模型把老历史压成几百 token 的状态摘要(「已查 A/B,结论 X,下一步 Y」)替换原文。长任务不做这两件事,后面所有优化都会被滚雪球吃掉。
大头二:工具返回结果全量塞回上下文
网页 HTML、文件内容、API JSON——很多框架默认原样追加进历史。一个网页 50K token 很正常,一个任务抓 10 次就灌了 500K,在 Opus 4.8 上值 ≈¥16.97;而且这些内容留在历史里,被后面每一步重复计费,叠加滚雪球。
对策按投入产出排序: ①无脑截断:每个工具结果设上限(如 2K),超出截断并标注,500K → 20K,¥16.97 → ¥0.68;②工具侧预处理:网页转正文、JSON 只留需要的字段,这步不花模型的钱;③引用句柄:大结果存本地,只给模型 ID + 摘要,需要细节再按需取片段。多数场景做到前两条就能砍掉一大截。
大头三:推理 token 按输出价计费
思考型模型的内部推理 token 按输出价计费,而输出价通常是输入价的数倍(Opus 4.8 是 5 倍)。每步思考 2K、50 步共 100K:按 Opus 4.8 输出价 ≈¥16.96——这笔钱在仪表盘上只显示为「输出 token」,最容易漏算。
对策: 大部分 Agent 步骤是格式固定的工具调用,不需要深度思考。把思考强度调低或关掉(各家参数名不同,以官方文档为准),只在规划、验收这类关键步骤开。
大头四:重试与死循环,按倍数烧钱
整链重跑一次成本 ×2;更隐蔽的是死循环——Agent 反复执行同一个无效动作。按每步 20K 输入算,空转 100 步就是 200 万 token,Opus 4.8 上 ≈¥67.86,一个 bug 每触发一次烧一顿饭钱。
对策三件套(护栏,不优化成本但防失控): 硬性最大步数(到顶强制终止并报告进度)、单任务预算熔断(累计 token 超阈值就停)、重复检测(连续 N 步同工具 + 相近参数就拦截)。
大头五:又长又重复的 system prompt × 前缀缓存
几十个工具的 JSON schema 轻松把 system prompt 堆到 8K token,每步原样重发:8K × 50 = 400K,按全价 ≈¥13.57,全是为「一字不变的内容」付的钱。
这正是前缀缓存的用武之地:命中部分按缓存价计费。Opus 4.8 缓存读 ¥3.39/百万 = 全价的 1/10,那 400K 降到 ≈¥1.36;DeepSeek V4 Pro 缓存读 ¥0.03/百万 = 全价 ¥3 的 1/100。而且 Agent 的历史天然是「只增不改的前缀」:第一节那 100 万输入若 90% 命中,Opus 4.8 输入费 = 0.9 × 3.39 + 0.1 × 33.93 ≈ ¥6.44,直接降掉八成。
吃到缓存的工程前提是前缀逐字节稳定:
- system prompt 里别放时间戳、随机 ID,动态信息挪到消息末尾
- 工具定义顺序和文案固定,改一个字符前缀就断
- 历史只追加不改写;修剪时从中间摘要、保住开头稳定前缀
- 各家缓存写入费率/有效期不同,接入前看官方文档
终极杠杆:便宜模型搬砖,旗舰模型把关
前面四招是少花冤枉钱,最大的一刀来自模型分工:50 步里多数是格式固定的体力活(调工具、抽字段、整理结果),少数才真正需要智商(规划、验收)。按 8:2 分工——80% 步骤走 MiniMax M2.7、20% 关键步骤走 Opus 4.8:输入费 ≈¥8.47 + 输出费 ≈¥2.04 ≈ ¥10.51,对比纯 Opus 的 ¥42.41 省掉约四分之三,关键决策质量不让步。
落地顺序建议: 先上护栏(最大步数 + 预算熔断),再做工具结果截断和上下文修剪(见效最快),然后调通前缀缓存(纯工程活、零质量损失),最后做模型分工路由(收益最大但要评测验证)。四步做完,开头那个 ¥42 的任务压到几块钱以内,是普遍能做到的水平。
(完 —— 价格为 2026 年 6 月各厂商牌价,以官方定价页为准)