2026年8月,DeepSeek 连续放出两个重要更新:V4 Pro 模型正式开放,以及配套的 DeepSeek Harness 执行框架。官方把 V4 Pro 定位为强 Agentic Coding 能力的模型(1.6T 总参数、49B 激活、1M 上下文),Harness 则被标为 Developer Preview,强调“Everything is a plugin”。
作为长期关注企业 AI 落地的人,我把官方文档、代码和本地实测都过了一遍,结论很直接:
- V4 Pro 实际效果明显低于官方宣传带来的期待。
- Harness 的架构值得认真研究,但当前版本不适合普通人当主力工具。
下面拆开讲清楚。
1. 先分清两层:模型是大脑,Harness 是手和门禁
V4 Pro 解决的是“推理和生成”。模型收到任务后,可以决定调用哪个工具,但不会自己真正执行。谁来读项目规则、写文件、跑命令、做权限拦截、保存会话轨迹、处理中断恢复?这些全靠外部系统。
Harness 就是这套外部系统:手、工作台、门禁和行车记录仪。只有接上它,模型才有机会在真实目录里连续做事。
Codex、Claude Code、WorkBuddy 也都有自己的 Harness。DeepSeek 这次比较特别的是把这一层单独、较完整地开源了:模型适配、工具、文件系统、Shell、权限、会话、子 Agent、界面,甚至 Agent 循环逻辑,都能拆换。
官方明确标注为 Developer Preview,后续会有破坏性改动。它更像一套公开实验中的 Agent 底座,离稳定的企业产品还有距离。
2. 本地实测:工具流程能跑通,但验收是另一回事
有 Node.js 的环境可以直接启动本地 Web 页面。首次使用需要配置 API Key(DeepSeek 开放平台的 Key,或兼容 OpenAI/Anthropic 等接口)。页面看起来像普通聊天工具,真正有价值的是消息下方的工具调用记录和轨迹页。
我做了一个极简控制实验:让 Agent 新建 result.txt 并写入指定内容,再用 Shell 验证文件是否存在。为了隔离模型质量和 Harness 能力,我接了本地确定性测试端点。
流程清晰可见:
- 模型请求调用 write。
- Harness 检查权限 → 写入文件 → 把结果交回模型。
- 模型请求调用 bash 验证。
- Harness 执行命令后,模型才回复“任务完成”。
如果只调模型 API,最多得到一个“我想调用 write”的结构。真正把文件写下去、把结果再喂回去的,是 Harness。轨迹页把系统提示、AGENTS.md、权限、每次请求参数和返回值全部摊开,对调试非常有用。
权限能拦住动作,却拦不住模型胡说。
我把同一任务放到只读环境再跑一次:写文件时 Harness 返回 FS_SANDBOX_DENIED,后续 Shell 也失败。限制发生在执行层,不是提示词劝告。但本地测试模型在工具已经报错的情况下,仍然回复“任务完成”。Harness 拦住了越权,却没有替人判断最后那句话是真是假。
企业做 Agent 时,权限控制“能不能做”,验收判断“做对了没有”,两者必须分开。单元测试、评测集、业务规则和人工复核,一个都不能少。
3. “Everything is a plugin” 到底开源了什么?
设计原则写得很直白。插件页面里,终端、Agent 循环、网页搜索都可以单独配置;仓库里还能找到模型适配、凭据、沙箱、审批、会话持久化、子 Agent 和 Web UI 等插件。
自带四套 Agent 预设:
- 标准模式:文件、Shell、检索、Skills、计划、目标、子 Agent、工作流。
- PTC 模式:让模型用 TypeScript 程序组合多步工具调用。
- 极简模式:只保留持久 Bash 和编辑器。
- 创造模式:检查运行时、实验插件、创建自定义预设。
预设改变的是模型随身携带的工具、提示词和运行能力,而不是变成四个不同模型。
这对做企业 Agent 的人很有吸引力:公司只允许通过审计接口查库,可以换数据访问插件;密钥必须进 KMS,可以换凭据提供方;高风险动作要走内部审批,也可以接进去。开发者不必因为某一层不合适就整套推倒重写。
代价同样明显:能换的东西越多,技术决策和维护成本越高。插件版本、兼容性、缓存、权限组合、第三方供应链都要有人负责。成品工具把这些选择替用户做掉了,Harness 把选择权和成本一起交了出来。
4. 和 WorkBuddy、Codex 的真正区别
把功能名列出来,三者确实很像(Skills、MCP、Hooks、subagent、权限、会话……)。
产品边界不同:
- WorkBuddy 先是一款办公和开发工作台。用户给出任务,它负责交付文档、PPT、数据处理、研究结果或代码。默认的会话、界面和执行机制已经选好。
- DeepSeek Harness 提供的是可拆装的运行时。当前 Web 页面更像参考实现。开发者可以继续改文件系统、Shell、权限、持久化、Agent 循环和界面,做出面向自己行业的工作台。
如果目标是“今天把 PPT 做出来”,选 WorkBuddy 更省事;如果目标是“开发一套自己的 WorkBuddy”,才有必要认真研究 Harness。
它也没有因为开源就自动超过 Codex。Codex 已经把重点放在任务完成率、代码质量、Diff、终端、并行工作和长任务体验上,产品完成度高得多。Harness 当前的优势是模型更容易替换、运行部件更容易改、轨迹暴露得更完整。
5. 一个公开案例:工具流程跑通 ≠ 产物合格
GitHub Discussions 里有个直观测试:用户要求 V4 Pro High 生成一个单文件 Three.js《我的世界》小游戏。第一版思考接近 20 分钟,地图很小,人物还会一直下坠。修过以后可以玩,功能依然不多。缓存命中率很高(99%),总费用不到五毛。
实际打开修复后的 HTML,确实有地形、树木、第一人称操作、FPS、坐标和物品栏,不是摆拍。这个例子说明:
- 工具流程能跑通,不代表产物已经合格。
- 官方对 V4 Pro Agent 能力的评价很高,具体任务里仍可能出现碰撞错误、需求遗漏和长时间思考。
- Harness 可以继续把报错送回模型让它修;如果没有好的测试和验收,它也可能带着半成品宣布完成。
6. 普通人现在要不要装?企业落地还差什么?
建议现在就研究的人:
- 正在开发 Agent、编码助手或内部 AI 工作台。
- 需要接公司网关、本地模型和自定义权限系统。
- 想看清工具调用、上下文和会话状态怎么流动。
- 能接受版本变化,愿意自己排查插件与配置问题。
建议先别折腾的人:
- 只想一句话拿到 PPT、网页、报告或代码。
- 需要成熟的桌面体验、产物预览和远程协作。
- 不想处理 Node.js、API Key、命令行和插件。
- 准备直接接生产系统,却没有安全、测试和运维团队。
它默认只监听本机地址,这个限制反而合理。当前 Web API 可以跑 Bash,又没有完整的远程认证,随便绑到公网相当于留了一个远程执行入口。
企业落地视角:把“DeepSeek”三个字拿掉,企业 Agent 至少需要处理上下文、工具、权限、状态、恢复和验收。MCP 和 Skills 可以成为 Harness 的一部分,但外部触发、业务连接器、账号体系、多租户、长期状态和验收规则,还得实施团队补。
举例:自动处理 GitHub Issue 的 Agent,需要短期 Token、分支权限、任务状态、测试门禁、失败重试和审计日志。监控企业邮箱时,读信和提取任务可以自动,给客户发信、改交付日期和确认报价则必须审批。谁审批、等待期间状态放哪、超时怎么继续、客户回复怎么对应回原任务,都要在 Harness 里设计。
模型只决定了一部分上限。Agent 进了业务以后,能不能稳定做事、会不会越权、出了错能不能查,更多取决于外面的 Harness。
7. 最终判断
- V4 Pro 的实际效果低于官方宣传带来的预期。
- DeepSeek Harness 的当前使用体验还不成熟,但它开放出来的运行机制,比眼前这个 Web 产品更有长期价值。
- 普通用户不用急着装;Agent 开发者应该尽早研究。
- 现在拿它替代 WorkBuddy 或 Codex,我不看好;把它当作一套公开的 Agent 底盘来拆,我会继续看。
模型能力在快速演进,真正决定企业 AI 交付质量的,往往是模型外面那套“手、门禁和行车记录仪”。DeepSeek 这次把这一层公开出来,本身就是一次有价值的尝试。
如果你正在做企业 AI 落地或 Agent 开发,欢迎一起交流踩过的坑。后续我会继续把模型、Agent 和企业交付之间真正影响结果的工程问题讲清楚。