截至2026年8月7日,DeepSeek官方已经在API价格页面写明:近期将整体上调API服务价格,预计涨幅较大,但具体方案仍要以正式通知为准。也就是说,“要涨价”这件事基本已经坐实,但到底涨多少、什么时候执行,目前还不能直接下结论。(模型 & 价格)
我的感受是:V4 Flash用量暴涨,很可能是涨价的重要诱因,但这件事不能简单理解成“模型太强,所以服务器不够用了”。更准确地说,是低价格、强能力和Agent工作方式同时出现,突然把大量潜在需求释放了出来。
V4 Flash确实踩中了Agent需求
DeepSeek在发布V4时,对Flash的定位很明确:它的推理能力接近V4 Pro,在简单Agent任务上可以达到接近Pro的表现,同时参数规模更小、速度更快、价格更低。官方还专门提供了OpenCode、Claude Code等编码工具的接入说明。(DeepSeek API Docs)
这意味着,V4 Flash面对的不是普通聊天用户,而是一批会持续调用模型的生产力用户。
普通用户问一次问题,可能只消耗几千个Token。Coding Agent却完全不同。它需要读取项目文件,分析代码,调用工具,运行命令,检查报错,再继续修改。一次任务可能经历几十轮交互,上下文也会不断变长。
如果模型能力足够稳定,价格又低到几乎不用精打细算,用户的使用方式就会发生变化。
以前开发者会考虑:“这段代码要不要交给模型?”
现在可能变成:“先让模型跑一遍再说。”
这就是低价带来的需求放大效应。
OpenCode数据说明了什么?
OpenCode公开的数据可以验证一个重要趋势:DeepSeek V4 Flash已经成为OpenCode Go中使用量最高的模型。
截至8月6日,OpenCode数据显示,V4 Flash在其统计范围内排名第一,占观察到的Token量约59%,累计Token量超过102T,累计完成会话超过1088万次。平均每个会话消耗约930万Token,输入缓存命中率约96%,平均每次会话成本约0.09美元。
这个数据很有冲击力。
它说明V4 Flash并不是“偶尔试一下”的模型,而是在大量Agent任务中被持续调用。更重要的是,930万Token的平均会话量,已经远远超出普通聊天场景。
涨价可能是调控手段,但不是唯一办法
当一个模型突然承接大量Agent任务时,平台要面对的不只是总Token数量,还包括并发请求、长上下文、工具调用和持续输出。
DeepSeek当前价格页面显示,V4 Flash的缓存命中输入价格为每百万Token 0.02元,未命中输入为1元,输出为2元;V4 Pro对应价格为0.025元、3元和6元。两款模型都支持100万Token上下文,但Flash的并发限制更高。
对于开发者来说,这样的价格会鼓励大量使用缓存和长上下文。对于平台来说,缓存虽然能降低部分计算成本,却不能消除所有压力。长链Agent仍然会不断发起请求,持续占用推理资源。
因此,涨价确实可以起到两个作用:
第一,降低无效调用和过度调用。
第二,把有限算力优先留给愿意支付更高价格的用户。
用户真正应该关心什么?
对于偶尔调用API的个人用户,价格上涨的实际影响可能没有想象中大。真正敏感的是使用Coding Agent、自动化脚本、批量处理和长文本分析的用户。
这类用户不能只看“每百万Token多少钱”,还要看:
模型完成任务需要多少轮交互;
平均每次任务消耗多少Token;
缓存命中率是否稳定;
服务在高峰期是否可靠。
如果一个模型价格很低,但经常超时、失败或重复调用,最终成本未必低。相反,一个价格稍高但能够一次完成任务的模型,综合成本可能更好。
所以,DeepSeek涨价以后,V4 Flash仍然可能具有竞争力。只要它在代码修改、工具调用和长上下文任务上的成功率保持领先,它就不一定会因为涨价马上失去用户。用户真正会比较的,是“完成一个任务需要多少钱”,而不是单纯比较输入Token价格。
这次涨价会改变什么?
我觉得,这次事件真正改变的是市场对大模型价格的认识。
过去很多人把低价看成模型厂商必须长期坚持的价值观。实际上,低价往往承担着获取用户、扩大生态和测试负载的任务。当模型进入Agent阶段,用户从“问答”变成“委托工作”,调用量会迅速放大,原来的低价就可能难以维持。
DeepSeek面临的不是单纯的涨价选择,而是一次商业化压力测试。
如果它提前说明容量问题,公布清晰的价格梯度,并给老用户留出过渡期,用户可能会接受这次调整。若只是突然大幅提价,却没有解释服务质量、并发能力和后续保障,用户对它的信任感确实会下降。