Harness Engineering 学习分享:给 AI 大模型套上"缰绳"

3 阅读3分钟

Harness Engineering 学习分享:给 AI 大模型套上"缰绳"

一、AI 工程化的演进之路

AI 应用开发经历了几年的历史,从三个阶段的范式跃迁:

Prompt Engineering → Context Engineering → Harness Engineering

RAG(检索增强生成)= Retrieval(检索) + Augmented(增强) + Generation(生成)——先检索相关知识,再增强到上下文中,最后让模型生成回答。

Harness Engineering 是 2025 年下半年兴起的概念。Claude Code 在 AI Coding 领域接棒 Cursor;OpenClaw(小龙虾)做办公赛道;腾讯在 CodeBuddy 做 Coding、WorkBuddy 做办公自动化;微信也在集成 WorkBuddy。


二、核心比喻:Harness = 挽具

想象你有一匹马,那马很有力量,但真正 能让马 work 的,需要什么?Harness——给马套上挽具、缰绳、马鞍,这些统称为 Harness。

当下的 LLM 很智能,但不代表能给出一个好的输出。Harness 是一个比喻,对应着让 LLM 好用的一些技术工程架构。Harness 主要在研究怎么在模型外面套上一层好的挽具,让模型的能力可以稳定地、重复地去驾驭

Harness 不再是简单的把 Prompt 提升,它比 Prompt 高一个量级。

模型是引擎,Harness 就是装着 V8 发动机的车。引擎再牛,没有好的变速箱、刹车、仪表盘,这个车没法上路。


三、LLM 的四大结构性缺陷

在了解 Harness 之前,要先了解 LLM 有哪些结构性的缺陷:

3.1 无状态(Stateless)

每次对话结束,它什么都不记得。

3.2 无法主动操作外部世界

只能生成文字/图片。复杂项目不只有读写、浏览器等常规工具,MCP、Skill 一堆管理起来很复杂。

3.3 输出是概率性的

同样的输入,可能产出不同的输出。文无第一(文章生成等场景),武无第二(Coding 生成场景)。

3.4 上下文窗口有限

不能无限地去处理信息。以 DeepSeek-V4-Flash 为例,有 1M(100 万 Tokens)的超长上下文处理能力,但仍然有上限。

以上四个是 LLM 的自身特质。Harness 要做的,就是在这些基本的性质上,构造一套系统(工程化手段),让模型可以完成原本无法独立完成的任务。


四、Harness 的四层架构

Harness Engineering 不是一个具体的框架,而是围绕模型去构建的几类基础设施的总称。核心有四层。

原文件重点展开了记忆层

记忆层

解决模型无状态的问题。 模型本身不记得上一次对话说了什么,也不知道你的项目有什么规范。

Vibe Coding(氛围编程)——不断通过自然语言去编程。

CLAUDE.md / AGENTS.md ——以文件系统承载记忆的存储。这是 Harness 记忆模块的核心,是导航地图,告诉 Agent 最关键的约束和规则,每次带上


五、实践要点:案例驱动

5.1 不要急于生成代码

/init 初始化项目记忆非常重要。项目核心约束包含:项目功能、技术栈、开发规范、文件或目录结构等。全新项目应新建 CLAUDE.md 文件作为记忆,每次 Prompt 都会带上,解决 stateless 问题。

5.2 记忆需要持续更新

每当 CLAUDE.md 改变后,应再次执行 /init 来更新 Memory。

在 Harness Engineering 中,Memory 很重要!


六、一句话总结

LLM 很智能,但"智能"不等于"能稳定产出好结果"。Harness Engineering 通过在模型外面构建记忆存储(CLAUDE.md)、工具管理(MCP/Skill)等工程化基础设施,像给马套上挽具一样,让模型的能力可以被稳定地、可重复地驾驭。它比 Prompt Engineering 高一个量级,是 AI 应用开发的新范式。