DeepSeek V4 终于在 7 月的最后一天迎来了新进展。
7 月 31 日,DeepSeek 官方更新日志显示,DeepSeek-V4-Flash 正式版 API 上线公测。官方重点强调,这次更新并不是简单的版本号变化,而是针对 Agent 能力进行了大幅后训练优化。在多项代码、工具调用和自动化任务测试中,正式版 V4-Flash 的成绩明显超过了此前的 DeepSeek-V4-Pro-Preview。
不过需要注意的是,这次发布的范围比较有限:目前只有 V4-Flash 的 API 接口完成升级,DeepSeek-V4-Pro 正式版还没有发布,DeepSeek 的 APP 和网页版模型也暂时没有变化。
换句话说,普通用户现在打开 DeepSeek,可能还感受不到明显变化。但对于开发者、AI Agent 和编程工具用户来说,这次更新值得重点关注。
一、V4-Flash 正式版,核心变化是什么?
按照官方说明,DeepSeek-V4-Flash-0731 与之前的 DeepSeek-V4-Flash-preview 在模型结构、参数规模等方面保持一致,主要变化集中在后训练阶段。
这意味着,DeepSeek 并没有在这次更新中重新设计模型架构,也没有公布新的参数规模,而是通过进一步训练和优化,让模型在实际执行任务时表现得更加稳定。
这种升级思路,和传统意义上的“大版本升级”不太一样。
它更像是一次针对真实使用场景的能力强化,重点不是让模型在聊天中表现得更会“说”,而是让它更擅长完成一连串复杂任务,例如:
- 读取和理解代码仓库;
- 在终端中执行命令;
- 根据错误信息持续调试;
- 调用外部工具;
- 修改多个文件;
- 运行测试并验证结果;
- 根据反馈继续迭代;
- 最终交付一个可以工作的项目。
这也是 Agent 模型与普通聊天模型之间最大的区别。
普通模型更看重回答质量,而 Agent 模型还要面对环境变化、工具调用失败、上下文管理、任务拆解以及多轮执行等问题。真正决定 Agent 能力的,往往不是某一道题能不能答对,而是能不能把一个复杂任务从头做到尾。
二、官方跑分表现,为什么值得关注?
这次官方公布了多项 Agent 能力测试成绩,并明确表示,正式版 DeepSeek-V4-Flash 的基准测试成绩远超 DeepSeek-V4-Pro-Preview。
其中,Terminal Bench 2.1 的成绩为 82.7,已经接近同一张对比表中的 Opus-4.8;Cybergym 达到 76.7,Toolathlon Verified 达到 70.3,DeepSWE 也达到 54.4。
更值得注意的是,和预览版相比,部分项目的提升幅度非常明显。
例如:
- Terminal Bench 2.1:从 61.8 提升到 82.7;
- NL2Repo:从 39.4 提升到 54.2;
- Cybergym:从 38.7 提升到 76.7;
- DeepSWE:从 7.3 提升到 54.4;
- Toolathlon Verified:从 49.7 提升到 70.3;
- DSBench-Hard:从 25.8 提升到 59.6。
如果这些测试是在相同或接近的评测条件下完成的,那么这说明 V4-Flash 的提升主要体现在复杂任务执行能力上,而不仅仅是文字生成质量。
当然,模型跑分不能完全等同于日常体验。不同测试集的任务类型、评测框架、提示词和工具环境都会影响最终结果。因此,这些数据更适合作为能力趋势参考,而不是绝对排名。
官方也对测试条件进行了说明:在公开基准测试中的 Code Agent 任务里,正式版 V4-Flash 使用的是 DeepSeek Harness 极简模式,并采用 max 档位,top_p=0.95、temperature=1.0。其中,DSBench-FullStack 和 DSBench-Hard 属于 DeepSeek 内部测试集,分别用于评估全栈开发和 Coding Agent 难题。
这意味着,真实用户最终能否获得同样的效果,还要看后续工具链、Harness 框架以及具体应用场景。
三、原生支持 Responses API,针对 Codex 做了适配
这次更新中,另一个非常重要的变化,是正式版 V4-Flash 原生支持 Responses API 格式,并且针对 Codex 进行了适配。
Responses API 是目前越来越多 Agent 框架采用的一种接口形式。相比传统的对话接口,它更适合处理复杂的多轮任务、工具调用、状态管理以及结构化输出。
对于开发者来说,这意味着接入 DeepSeek V4-Flash 不再只是“把它当作一个聊天模型来调用”,而是可以更方便地将它放进编程助手、自动化工作流和多工具 Agent 中。
特别是 Codex 这类以代码执行、文件修改和终端操作为核心的工具,通常需要模型具备更稳定的工具调用能力和更清晰的任务规划能力。DeepSeek 官方这次明确提到“针对性适配 Codex”,说明它正在主动进入更复杂的编程 Agent 生态。
从现有接口信息来看,V4-Flash 支持 OpenAI 兼容格式,也支持工具调用、JSON 输出、上下文续写等能力,整体上更适合被集成到各种开发工具中。
这部分变化,普通用户未必能直接感知,但对开发者而言,可能比聊天能力提升更加重要。
四、价格仍然是 V4-Flash 的最大优势
除了能力之外,DeepSeek V4-Flash 最容易被关注的,依然是价格。
按照目前公开的价格信息,V4-Flash 的缓存命中输入价格约为每百万 Tokens 0.02 元,缓存未命中输入价格为每百万 Tokens 1 元,输出价格为每百万 Tokens 2 元。
相比之下,V4-Pro 的对应价格更高,尤其是输出价格约为每百万 Tokens 6 元。
这意味着,V4-Flash 可能会成为大量开发者构建 Agent 的低成本基础模型。
Agent 应用通常比普通问答消耗更多 Token。一个复杂任务可能需要经历多轮思考、工具调用、日志读取、代码修改和测试反馈。如果每次执行都依赖高价模型,整体成本很容易快速上升。
因此,对于以下场景,V4-Flash 的性价比尤其值得关注:
- 自动编程和代码修复;
- 企业内部知识库 Agent;
- 自动化办公流程;
- 批量数据处理;
- 多步骤工具调用;
- 代码仓库分析;
- 低成本客服和运营自动化;
- 个人开发者的 AI 编程助手。
即使 GPT-5.6 Luna 等模型进行了大幅降价,DeepSeek V4-Flash 依然有机会凭借更低的单价,继续吸引大量对成本敏感的开发者。
五、这次发布,普通用户为什么可能“没感觉”?
虽然官方公布的成绩很亮眼,但这次更新并不会立刻改变所有用户的使用体验。
原因很简单:本次升级目前只覆盖 DeepSeek-V4-Flash API。
官方已经明确说明,DeepSeek-V4-Pro API 以及 APP、WEB 端模型均未做更改。
因此,如果你平时主要通过 DeepSeek 的网页端或手机 App 使用服务,那么短期内可能不会看到明显变化。真正能第一时间体验到新能力的,是那些通过 API 调用 V4-Flash 的开发者,或者使用了相关编程工具和 Agent 框架的用户。
这也说明,DeepSeek 这次的发布重点并不是面向普通用户的产品更新,而是面向开发者和应用生态的一次基础设施升级。
至于大家最期待的 V4-Pro 正式版,官方目前给出的说法是“将会尽快发布”。
六、Pro 正式版,还会带来什么?
目前我们还无法确定 V4-Pro 正式版会有哪些具体变化。
但从 V4-Flash 这次的更新方式来看,DeepSeek 可能会继续强化模型在复杂推理、代码开发、长上下文和 Agent 执行方面的能力。
V4-Flash 负责更低成本、更高效率的任务,V4-Pro 则可能承担更复杂、更高难度的推理和专业工作。两者之间如果形成清晰的能力和价格分层,DeepSeek 的模型产品线会更加完整。
值得注意的是,DeepSeek V4 的发布节奏确实一直比较克制。没有大规模预热,也没有连续多天发布密集宣传,而是在 7 月最后一天低调更新 API 文档。
从时间节点来看,DeepSeek 至少暂时保住了“7 月发布”的承诺。只是这次先到的是 Flash 正式版,Pro 正式版还需要继续等待。
结语
总体来看,DeepSeek-V4-Flash-0731 的亮点可以概括为三点:
第一,模型架构和规模没有变化,但通过后训练优化,Agent 能力出现明显提升。
第二,正式支持 Responses API,并针对 Codex 等编程 Agent 工具进行了适配。
第三,在保持极低价格的同时,代码执行、工具调用和自动化任务能力进一步增强。
不过,这并不是一次面向所有用户的全面升级。APP 和网页版暂时没有变化,V4-Pro 正式版也尚未发布。
所以,对于普通用户来说,这更像是一条“值得关注的技术动态”;对于开发者来说,则可能意味着一个更便宜、更适合构建 Agent 的模型已经正式进入可用阶段。