Agent 与 Harness

0 阅读4分钟

今天绝大多数 Agent 都可以粗略抽象成: Agent = Model + Harness

Model 提供底层的推理与决策能力 ,是 Agent 的“推理大脑”,Harness 则定义模型如何观察环境、能够采取哪些动作,以及整个执行过程如何组织, 负责把脑子里的想法变成实际动作 。

现有agent产品例如Codex、Claude Code,已有的 Harness能力如下:

  • 基础感知与输入:自动读取项目文件树、解析语法树(AST)、捕获 git diff、截取终端运行/报错日志。
  • 工具、技能与沙盒执行:提供精准代码 Patch/Edit、Shell 指令运行与敏感指令弹窗;支持通过 MCP 接入外部数据源,并能动态加载/触发预设的特定任务技能包(Skills);
  • 上下文管理:基于规则或 RAG(向量检索)召回相关代码,并在对话过长时自动触发阶段性上下文压缩(Compaction)。
  • 交互与流程控制:支持 ReAct(思考-动作-观察)循环、用户中途打断/追问(Steering),以及对话撤回/历史回溯。

然而,现有的 Harness 本质上仍是一套由人类开发者静态预设的“高级工具箱”。

Agent 固然学会了调用箱子里的 MCP 工具与 Skills,甚至能在特定任务中临时组合新 Skill;但"何时清理过期 Tool/Skill、如何重构 Harness 工作流、修改后如何测试验证"的控制权与终极闭环,依然掌握在人类手里。Agent 本身尚未建立起无需人类介入的自主进化机制。

要真正迈向完全自主的 Agent,Harness 自身必须形成一个持续自我优化的自动化闭环(Loop)。这个闭环通常按如下 4 步自动运转优化:

实现这种自演进闭环,目前行业中有两个最具代表性的范式:Pi AgentDeepSeek Harness

1. Pi Agent:工程架构上的自我改写

由 Mario Zechner 开发的 Pi Agent 走的是极致极简路线。不同于 Codex 或 Claude Code 的闭源 Harness,Pi 将 插件、Skill 和上下文调度逻辑完全开放。它支持在对话中直接修改自身代码并动态重新加载,同时借助树状历史结构(Tree-structured State)实现低成本分支回滚,为“改写-验证-撤回”提供了干净的工程底座。

2. DeepSeek Harness:乐高式插件 + 规则验真

  • 插件积木化:将工具、Skill 甚至其他 Agent(如 Claude Code 、Codex)都被抽象成了可自由插拔和替换的插件 。优化 Harness 时只需像搭乐高一样,自由插拔或替换特定的业务插件。
  • 规则验真与经验内化:通过引入沙盒规则验证器,Agent 在长思考流中自主调度插件并进行纠错。凡是跑通沙盒测试的高质量轨迹,都会被系统捕获并进一步沉淀为模型的内生推理能力。

Harness 自动化闭环落地的四大工程支柱

要让这种“自我优化闭环”在实际工程中真正跑通,开发者构建 Harness 时必须立足于四大基础支柱:

  • 确定的验真基准(Verifier) :只有测试结果可量化,才能确保改动方向始终向好,防止“越改越乱”。
  • 无损的轨迹捕获(Trace) :是 Agent 识别性能瓶颈和错误来源的依据。
  • 隔离的演进沙盒(Sandbox) :确保未验证的逻辑绝不污染生产环境。
  • 数据反哺流水线(RL Data Pipeline) :将跑通沙盒的“高分轨迹”格式化输出,作为强化学习(RL)或微调(SFT)的数据源,使外部 Harness 积累的工程经验能够转化为底层的模型参数。

未来 Agent 系统的核心竞争力,不再单纯取决于大模型的初始智商,而取决于其 Harness 架构能否以更低的 Token 成本和更高的验证效率,完成无需人工干预的自主重构与演进

当 Agent 具备了修补自身脚手架并完成闭环验证的能力,系统才真正完成了从“被动工具”向“自主自演进系统”的跨越。 未来 Agent 系统的核心竞争力,不再单纯取决于大模型的初始智商,还依赖其 Harness 架构能否以更低的 Token 成本和更高的验证效率,完成无需人工干预的自主重构与演进