8 月 13 日晚7点也就是刚才!刷到 DeepSeek 公众号推了篇定价更新,把 V4-Pro 半发布顺带搞了进去。新价 2026 年 8 月 17 日零点生效。涨价这事儿不意外——模型卷到 Pro 这个段位,总得开始对齐市场。但数字一摊出来,比预想的狠一点。
涨了多少
直接看数字。旧价是涨价前官方表那一档,新价按「空闲 / 高峰」分两档列出来,单位一律 元 / 百万 tokens。
| 模型 | 计费项 | 旧价 | 新-空闲 | 新-高峰 | 涨幅(空闲) | 涨幅(高峰) |
|---|---|---|---|---|---|---|
| V4-Flash | 缓存命中 | 0.02 | 0.05 | 0.10 | 2.5× | 5× |
| V4-Flash | 缓存未命中 | 1 | 1.5 | 3.0 | 1.5× | 3× |
| V4-Flash | 输出 | 2 | 4.5 | 9.0 | 2.25× | 4.5× |
| V4-Pro | 缓存命中 | 0.025 | 0.15 | 0.30 | 6× | 12× |
| V4-Pro | 缓存未命中 | 3 | 4.5 | 9.0 | 1.5× | 3× |
| V4-Pro | 输出 | 6 | 13.5 | 27.0 | 2.25× | 4.5× |
高峰时段是北京时间 9:00–12:00、14:00–18:00,差不多就是国内上班时间——所以绝大多数使用场景实际拿到的是高峰价。
几个比较刺眼的点
1. Pro 的缓存命中直接涨 12 倍。 高峰时段 Pro 的缓存命中从 0.025 → 0.30,是六个计费项里涨得最凶的一档。 意思是:你引以为傲的 prefix cache 优化、长上下文复用技巧,单这一档就比过去贵 12 倍。那种把 system prompt 缓存成几 K 然后高频调用的 RAG / Agent 场景,打击最大。
2. 输入未命中只涨 1.5×,但输出普遍 2.25× 起。 Flash 和 Pro 在「输入未命中」这一档都很克制(都是 1.5×),但输出端都拉到 2.25× 以上——明显是在把脚本型、长 reasoning 输出场景往贵里推。Agent 编排、自动评测、长文档总结、批量生成脚本,全踩这一档。
3. Flash 不再是「白菜价」。 Flash 旧价缓存命中 2 分钱 / 百万 token,新价高峰时段 1 毛。Flash 当年那个「便宜量大」的核心卖点基本没了。我猜也是为 Pro 让路——Pro 半发布,定价不能跟 Flash 离太近。
4. 还有一个大家容易漏的:旧表里 Flash 的并发限制是 2500、Pro 是 500。 新表没标注并发上限,能不能还按这个跑,要等 17 号那天看实际表现。如果并发被压得很狠,那"涨单价 + 压并发"组合起来才是真正的大刀。
实际账单会怎么变
以一个常见的调用结构为例:100 万 token 输入(未命中)+ 100 万 token 输出。
| 模型 | 旧价 | 新-空闲 | 新-高峰 |
|---|---|---|---|
| V4-Flash | 3 元 | 6 元 | 12 元 |
| V4-Pro | 9 元 | 18 元 | 36 元 |
Pro 高峰时段单一笔调用直接 4 倍账单。如果是上班族白天正常用 API,几乎全踩高峰。
我怎么看
- 不算割韭菜,是定价策略正常化。 Flash 当引流款扛了快一年,现在涨回去对齐国内主流模型价位其实不意外,国内外几家都在做这个动作。
- Pro 涨得有点猛。 12× 缓存命中这一档,明显是在做「高价值场景用 Pro、量大但客单低的场景用免费额度 + 排队」的分层。如果你之前冲着 Pro 的价格优势才上车的,这次要重新算 ROI 了。
- 高峰分时是趋势。 DeepSeek 这次把「工作时间内更贵」明牌写出来,后面各家大概率会跟。批量跑任务的兄弟,以后要学着把脚本挪到深夜。
- 行动建议:8 月 17 日之前这两三天,要么把批量任务跑完,要么把 cache 设计 / 调用时段重看一下;用 Pro 的项目顺手做一次成本复盘,把 prompt 里的可缓存段切开,别再一个 prefix 砸全场。
8 月 17 日 0 点一刀下去,到时候账单跑出来才是真章。