DeepSeek V4 Pro 正式版个人测评

0 阅读18分钟

· DeepSeek V4 Pro 正式版(DeepSeek-V4-Pro-0813)独立测评

声明

本文为独立第三方个人视角的测评,非 DeepSeek 官方发表,未接受任何厂商委托或赞助。评估对象为深度求索(DeepSeek)于 2026 年 8 月发布的旗舰级大语言模型 V4 Pro 正式版(版本号 DeepSeek-V4-Pro-0813)。本报告依据 DeepSeek 官方 API 文档及定价页、权威媒体公开报道、独立研究机构评测数据及开发者社区实测结果编制,评估时间为 2026 年 8 月 16 日。

本报告所引数据均注明来源,并区分官方自测、独立评测与社区实测三种口径,避免口径混淆影响结论。报告核心结论为撰写方独立意见,不构成投资决策或采购依据,特此声明。

一、发布背景

V4 Pro 正式版并非通过发布会对外宣布,而是于 2026 年 8 月 12 日深夜,通过更新官网 API 文档中的版本号方式低调上线。后续两日,官方先后数次发布并回撤相关公告,API 服务始终保持在线。据环球网等媒体报道,8 月 13 日,智能体框架 DeepSeek Harness(DSH)v0.1 随正式版一同发布,采用 MIT 协议;8 月 14 日,国家超算互联网完成对 V4 Pro 正式版及 Harness 的上线。

综合公开信息,本次发布呈现以下特征:

其一,发布流程已趋于工程化。版本切换、接口更新与公告发布各环节衔接流畅,属常规大版本发布,而非一次性事件。

其二,官方强调了信息来源管理。DeepSeek 曾提示"请以官方账号为准,其他渠道言论不代表我方观点"。正式版上线后,网络相关讨论较多,来源与质量不一,建议读者优先采信可溯源的官方与权威信源。

其三,模型之外的战略布局值得关注。DSH 承担将模型接入文件系统、终端、网页与代码工具的能力,其形态与 Claude Code 较为相似,显示 DeepSeek 的布局正从模型供给方向智能体基础设施方向延伸。

二、模型规格

V4 Pro 正式版核心规格如下,均取自官方 API 文档口径:

维度DeepSeek-V4-Pro-0813DeepSeek-V4-Flash-0731
模型架构MoE(混合专家)MoE(混合专家)
总参数量约 1.6 万亿(1.6T)相对较小
激活参数约 490 亿(49B)相对较小
上下文长度1M(100 万 token)1M
最大输出长度384K token384K
思考模式支持,默认开启支持,默认开启
API 兼容OpenAI / Anthropic / Responses / Codex同左
开源协议MITMIT
API 并发上限5002500

需说明,据权威媒体与社区综合口径,关于总参数量存在"1.6T"与"862B"两种统计口径,本报告采用主流口径 1.6T/49B。二者差异源于统计范围是否含非激活权重及词嵌入层,并非指代不同模型。

从参数结构看,V4 Pro 的核心特征在于 49B 激活参数与 1.6T 总参数构成的强稀疏激活配比,配合 384K 最大输出长度,可支撑长上下文、长链路任务。技术底座方面,据官方技术说明,V4 系列引入混合注意力架构、流形约束超连接及 Muon 优化器,并在训练中采用 FP4+FP8 混合精度。

三、评估方法与数据口径

考虑到不同评测体系结论差异显著,本报告将数据划分为四类口径分别呈现,未作跨口径直接换算:

  1. 官方口径:DeepSeek 自测的智能体基准数据;
  2. 通用能力口径:代码、数学、推理等通用任务的基线数据;
  3. 独立口径:第三方研究机构的独立评测数据;
  4. 专项口径:面向特定领域(如网络安全)的专项评测数据。

各口径数据来源明确,结论独立,评估过程中不进行主观加权,仅作并列呈现与综合分析。

四、评测结果

4.1 官方口径:智能体基准

据 DeepSeek 官方发布的智能体基准测试数据:

基准V4 Pro 0813预览版Claude Fable 5Claude Opus 4.8
Terminal-Bench 2.187.972.188.0
CyberGym83.352.783.1
DeepSWE62.712.870.058.0
DSBench-Hard67.231.1
AutomationBench31.812.8
10 项智能体基准均分62.862.6

![官方智能体基准数据(来源:公开网络)]

baab7b56182254bb975a1667193293f0~tplv-a9rns2rl98-image.jpg

数据表明,DeepSWE 由预览版 12.8 提升至 62.7,增幅约五倍;该基准考察读仓库、问题定位、跨文件修改、测试运行与持续修复等真实开发链路,提升幅度较为显著。此外,CyberGym 得分 83.3,与参测的 Claude Fable 5(83.1)得分接近;Terminal-Bench 2.1 得分 87.9,与 Fable 5(88.0)相差 0.1 分。以上均为官方自测口径。

需指出,上述数据主要源自 DeepSeek 自测,截至本报告撰写,尚未被独立机构完整复现。且智能体基准系模型算力、工作流框架、推理预算等多因素共同作用的结果,宜视为能力上限参考,而非默认配置下的实际体验。

4.2 通用能力口径:代码与数学基线

以下数据综合官方说明与开发者测试整理,V4 Pro 与预览版架构一致,其通用能力基线如下:

基准V4 Pro 预览版说明
LiveCodeBench93.50深度思考模式,123 个模型中位列第一
Codeforces3206对应 Legendary Grandmaster 段位
SWE-Bench Verified80.60开源模型第一梯队
IMO-AnswerBench89.80
GPQA Diamond90.10
MATH-50096.10
SuperCLUE(中文综合)70.98排名第一
HLE(人类最后考试)48.20数值相对较低
SWE-Bench Pro55.40数值相对较低

据开发者测试整理,其中 Codeforces 3206 分在 Codeforces 评分体系中对应 Legendary Grandmaster 段位,全球活跃选手中稳定处于该区间的范围不超过 20 人。

解释该数据时需保持审慎。其一,评测多基于历史赛题子集,与实时比赛的策略博弈存在差异;其二,若赛题公开时间早于模型训练数据截止日,存在数据污染可能,DeepSeek 称已作去污染处理,社区仍存异议;其三,竞赛编程能力与工程实践能力并非同一维度,算法推理较强并不直接等同于架构设计、代码维护等工程能力同样突出。

4.3 独立口径:第三方机构评测

据独立研究机构 Artificial Analysis 的智能指数评测:

模型智能指数HLE(无工具版)
Claude Fable 56253.3
Grok 4.661
Kimi K360
GPT-5.6 Terra57
DeepSeek V4 Pro 08135342.7
DeepSeek V4 Flash 073152

评估注意到,V4 Pro 的智能指数(53)较 V4 Flash(52)高 1 分,而两者参数量差距较大;同时 V4 Pro 在官方智能体基准中表现与 Opus 4.8 相近。不同评测中,V4 Pro 在执行类任务与通用推理任务上呈现不同的表现水平,该差异可能与后训练侧重点有关。

4.4 专项口径:网络安全评测

据比利时安全机构 Aikido Security 的专项测试,V4-Pro-0813 的漏洞发现能力在参测模型中表现突出,与官方 CyberGym 数据方向一致。

五、技术分析:后训练机制

V4 Pro 正式版与预览版架构完全一致,性能变化集中于后训练阶段,此判断来自官方技术说明与开发者对比测试。

DeepSeek 的后训练分两步实施:首先按领域分别进行强化学习,涵盖推理、编码、数学、世界知识与智能体等方向各自独立训练;随后开展跨领域联合后训练与偏好对齐。官方此前对 V4 Flash 的口径为"架构与尺寸未变,仅重做后训练",V4 Pro 采用相同路径。

具体而言,训练资源未用于扩充知识储备,而主要用于强化复杂任务的完整执行能力,包括工具调度、长链条任务连贯性、终端环境试错重试及错误自修正等。该路径在 V4 Flash 上亦有体现:其 DeepSWE 由预览版 7.3 提升至 54.4,相关智能体基准亦表现良好。

同时需明确后训练的边界:后训练可重塑行为模式,但难以改变知识底座,后者主要取决于预训练规模与训练数据质量。故 V4 Pro 呈现执行能力较强、通用知识相对均衡的差异化特征。前述现象属工程取舍,其优劣取决于具体应用场景。

六、成本分析

据 DeepSeek 官方定价页,截至 2026 年 8 月 16 日,V4 Pro 官方定价如下(每百万 token):

档位缓存命中输入未命中缓存输入输出
V4 Pro0.025 元3 元6 元
V4 Flash0.02 元1 元2 元

V4 Pro 输出价约为 V4 Flash 的三倍,折合美元约 0.87 元/百万 token 区间,在同期旗舰模型中处于低价行列。

需特别提醒,据官方定价页公告,官方已确认自 2026 年 8 月 17 日零时起执行峰谷定价,高峰时段为北京时间 9 时至 12 时、14 时至 18 时,其余为空闲时段:

模型时段缓存命中输入未命中缓存输入输出
V4 Pro高峰0.30 元9 元27 元
V4 Pro空闲0.15 元4.5 元13.5 元
V4 Flash高峰0.10 元3 元9 元
V4 Flash空闲0.05 元1.5 元4.5 元

依据上述价格,高峰时段输出价由 6 元升至 27 元,涨幅 4.5 倍;缓存命中输入由 0.025 元升至 0.30 元,涨幅约 1100%。即便采用空闲时段,输出价亦为现行价格两倍以上。

![官方定价与调价信息(来源:DeepSeek 定价页)]

755f440a49adb096d0709474e7a26d23~tplv-a9rns2rl98-image.jpg 需提示,单价指标反映算力消耗,但实际工程成本需结合任务完成质量综合评估。据 Hacker News 开发者社区记录的一次性观测案例(不具代表性,仅作参考):同一开发任务,V4 Pro 于 Codex 环境耗时约 12 分钟、成本 0.12 美元;Grok 4.6 耗时约 3 分钟、成本 1.41 美元,二者完成情况存在差异。据此,建议以"单次成功完成任务的总成本"作为智能体场景评估成本的重要参考。

七、运行性能与稳定性

各数据点综合自开发者社区实测与媒体报道:

指标实测值
主负载 p50(中位延迟)约 4.9 秒
p99(最慢 1% 响应)约 12.3 秒
首 token 延迟(国产算力,知识库场景)约 400 毫秒
生成速度(国产算力)约 20 token/秒
长任务单次运行约 9 小时 15 分、约 70 万 token
单日极端负载4.88 亿 token

V4 Pro 延迟高于 V4 Flash,与该模型的大激活参数及深度思考模式有关;其 1M 上下文能力可支撑长时间任务运行,具备相应能力。另有开发者验证,两台 256GB 内存的 Mac Studio 可在原生精度下运行 V4 Pro,生成速率约 20 token/秒量级,具备本地运行条件,但流畅度有限。

能力表现方面,据开发者实测,模型在多种复杂任务中有较好表现,如一次性生成覆盖 60 种设计风格的 HTML 卡片集合,或在有限文本输入下构建可交互的 3D 场景。同时,个别简单图形绘制任务在部分测试中的表现存在波动,建议结合具体场景评估。

稳定性方面,据社区部分反馈,同一任务多次运行的结果存在一定波动;独立研究者 Simon Willison 的测试亦提示,reasoning effort 参数在 low / medium / high 之间切换可能影响输出表现,建议用户在使用时留意该参数。另有用户反馈,同一模型在不同工作流框架下体验存在差异,这类差异可能涉及协议层与框架配置等多方面因素。

综合来看,动态路由与采样策略等因素可能对输出产生影响,官方评测结果与默认配置下的实际体验可能存在差异。对关键任务,建议通过多次运行观察结果分布,并借助并行重试、多样种子、多数投票及规则校验等工程手段提升可靠性。如对并发与成本有更高要求,可结合具体场景评估 V4 Flash(其 API 并发上限为 2500,价格更低)。

![开发者实测与成本分析(来源:公开网络)]

355d1bec0c0f1ad2eb1afe1f1285ca72~tplv-a9rns2rl98-image.png

八、生态兼容性

据官方 API 文档,V4 Pro 接口设计以兼容性为优先:

  • OpenAI 格式 base URL(https://api.deepseek.com),修改型号即可调用;
  • Anthropic 格式 base URL(https://api.deepseek.com/anthropic),构成接入 Claude Code 的基础;
  • 原生支持 Responses API 及 Codex 接入;
  • 模型名向后兼容,调用 deepseek-v4-pro 自动对应 0813 版本,既有代码无需改造;
  • 推理强度分档参数已进入 API 文档,可精细控制思考深度与成本。

据开发者社区与科技媒体整理的接入方案,接入 Codex 可通过官方脚本执行(macOS/Linux 使用安装脚本,Windows 使用对应 PowerShell 脚本);接入 Anthropic 接口则可使用 Claude Code,并启用 1M 上下文。

DeepSeek Harness 作为智能体运行框架,负责将模型接入文件系统、终端、网页及代码工具,其对标为 Claude Code。据官方口径,DeepSeek 将"除模型本身以外的所有工作"归入 Harness 范畴,并面向全球招募相关研发与产品人员。该布局显示 DeepSeek 正由模型供给方向智能体基础设施延伸。

九、行业竞争态势

V4 Pro 发布正值密集发布期,据媒体综合报道,需结合竞争环境评估:

  • Grok 4.6:主打低成本与长时运行智能体,智能指数 61,高于 V4 Pro;
  • 智谱 GLM-5.3:于 8 月 14 日发布,后训练口碑良好,综合评测中常以更小参数量优于 V4 Pro;
  • Qwen 3.8-Max:总参数量 2.4T,开放权重;
  • Kimi K3:在前端及部分智能体场景表现突出,智能指数 60;
  • GPT-5.6 Terra:通用旗舰,智能指数 57。

整体而言,V4 Pro 在开源模型中处于较具竞争力的位置。据相关评测,更小体量的模型在部分场景亦有出色表现,提示模型表现受多种因素影响,而非只取决于参数量。

十、结合使用场景需关注的几个方面

综合各口径评测,以下为在选用时可结合场景留意的几个方面:

  1. 通用推理评测中的表现。据 Artificial Analysis 数据,该模型智能指数 53、HLE 无工具版 42.7,与部分参测模型存在一定差距,具体表现建议结合场景评估。
  2. 复杂工程修复任务的差异化表现。据官方及第三方数据,SWE-Bench Verified 得分 80.6 处于较高水平,SWE-Bench Pro 得分 55.40,更高难度任务的表现建议结合实测评估。
  3. 稳定性表现需结合场景评估。据社区反馈,长任务、不同时段及不同工作流下的表现存在一定波动,建议在关键任务中加入重试与校验等冗余设计。
  4. 超长上下文的精确召回可能随长度变化。据相关测试,上下文较长时细节召回或受影响,建议对重要内容做复核。
  5. 多步骤复杂任务需结合实测评估。据开发者测试,步骤较多的复杂工程场景(如完整 CI/CD、服务拆分)表现受任务复杂度影响,建议按需验证。
  6. 生成代码的安全性建议人工把关。个别情况下,生成代码可能需补充边界约束(如请求体过大、并发、注入防范等),建议在使用时加入相应检查。

另外,官方自测与默认配置下的体验可能存在差异,建议以自有场景实测为准;鉴于竞品动态较多,相关结论具有一定时效性。

十一、综合评估与建议

评估结论

依上述数据,V4 Pro 在多个维度表现突出:其一,据官方自测,智能体相关基准表现与主流旗舰模型相近;其二,代码与竞赛编程测试成绩亮眼(LiveCodeBench 93.5、Codeforces 3206、SWE-Bench Verified 80.6);其三,在同期旗舰模型中具有一定性价比优势,现价输出 6 元/百万 token;其四,生态接入友好,兼容多种主流接口并支持 1M 上下文与 384K 输出,开源协议为 MIT;其五,安全能力获第三方专项评测认可。

同时,据相关评测,该模型在通用推理、复杂工程任务等维度表现不一,选用时还需关注次日生效的峰谷调价(高峰输出 27 元/百万 token)对预算的影响。

综合评估,V4 Pro 在执行与代码相关任务上表现突出,其最终效果与使用方式、实际场景密切相关,建议结合需求与自有场景的实测结果评估是否适用。

适用对象建议

  • 适用于深度使用智能体及代码工具的团队,此类用户对预算具备弹性,追求极限任务完成率,并具备重试、并行、校验等工程冗余能力,可充分受益于模型攻坚价值。
  • 建议输出确定性要求极高(金融交易、自动化流程)及以常规问答为主的团队审慎采用。对此类需求,价格更低、并发更高、稳定性更好的 V4 Flash 更为适宜。

需重申,榜单分数仅为能力上限参考。实际适用性取决于具体业务账目及模型可靠完成的任务量。建议在选型前,以自有任务、固定工作流框架与固定推理强度进行多次实测,综合比较一次正确率、平均耗时、人工干预次数与最终成本。

十二、结论

V4 Pro 正式版以低调试上线方式发布,于短时间内引发行业广泛讨论。其核心意义并非单项排名,而在于验证了一种技术路径:在架构不变的前提下,通过高质量后训练实现模型执行能力的代际提升。同时,该模型亦清晰展示了其能力边界与应用代价。

评测数据会随时间更新,价格政策将调整,竞品将持续演进。评估过程所秉持的原则——依据可溯源信源、采用可靠评测方法、以真实任务验证——具有长期适用性。

建议计划采用 V4 Pro 的组织,勿仅依据榜单排名或单价作出决策,而应通过多次真实任务实测,比较其在最终完成效果与总体成本方面的表现后再行取舍。


附录:数据来源

官方来源

权威媒体及科技媒体

独立机构及研究者

口径说明

  1. 官方智能体跑分(Terminal-Bench、CyberGym、DeepSWE 等)主要源自 DeepSeek 自测,截至本报告撰写尚未被独立机构完整复现;智能体基准系模型、工作流框架、推理预算共同作用的结果,宜视为能力上限参考,而非默认体验。
  2. 总参数量存在"1.6T"与"862B"两种口径,本报告采用主流口径 1.6T/49B;差异源于统计范围是否含非激活权重及词嵌入层,并非指代不同模型。
  3. 部分竞品对照分(如 Claude Opus 4.7 的 SWE-Bench)不同来源略有出入,本报告采用已标注来源的数字。
  4. 文中图片均来自公开网络;如外链图床不可达,请以正文表格数据为准。
  5. 本报告成稿于 2026 年 8 月 16 日,DeepSeek 新价格自 2026 年 8 月 17 日生效,请以官方定价页最新内容为准。