Harness Engineering 学习分享:给 AI 大模型套上"缰绳"
一、AI 工程化的演进之路
AI 应用开发经历了几年的历史,从三个阶段的范式跃迁:
Prompt Engineering → Context Engineering → Harness Engineering
RAG(检索增强生成)= Retrieval(检索) + Augmented(增强) + Generation(生成)——先检索相关知识,再增强到上下文中,最后让模型生成回答。
Harness Engineering 是 2025 年下半年兴起的概念。Claude Code 在 AI Coding 领域接棒 Cursor;OpenClaw(小龙虾)做办公赛道;腾讯在 CodeBuddy 做 Coding、WorkBuddy 做办公自动化;微信也在集成 WorkBuddy。
二、核心比喻:Harness = 挽具
想象你有一匹马,那马很有力量,但真正 能让马 work 的,需要什么?Harness——给马套上挽具、缰绳、马鞍,这些统称为 Harness。
当下的 LLM 很智能,但不代表能给出一个好的输出。Harness 是一个比喻,对应着让 LLM 好用的一些技术工程架构。Harness 主要在研究怎么在模型外面套上一层好的挽具,让模型的能力可以稳定地、重复地去驾驭。
Harness 不再是简单的把 Prompt 提升,它比 Prompt 高一个量级。
模型是引擎,Harness 就是装着 V8 发动机的车。引擎再牛,没有好的变速箱、刹车、仪表盘,这个车没法上路。
三、LLM 的四大结构性缺陷
在了解 Harness 之前,要先了解 LLM 有哪些结构性的缺陷:
3.1 无状态(Stateless)
每次对话结束,它什么都不记得。
3.2 无法主动操作外部世界
只能生成文字/图片。复杂项目不只有读写、浏览器等常规工具,MCP、Skill 一堆管理起来很复杂。
3.3 输出是概率性的
同样的输入,可能产出不同的输出。文无第一(文章生成等场景),武无第二(Coding 生成场景)。
3.4 上下文窗口有限
不能无限地去处理信息。以 DeepSeek-V4-Flash 为例,有 1M(100 万 Tokens)的超长上下文处理能力,但仍然有上限。
以上四个是 LLM 的自身特质。Harness 要做的,就是在这些基本的性质上,构造一套系统(工程化手段),让模型可以完成原本无法独立完成的任务。
四、Harness 的四层架构
Harness Engineering 不是一个具体的框架,而是围绕模型去构建的几类基础设施的总称。核心有四层。
原文件重点展开了记忆层:
记忆层
解决模型无状态的问题。 模型本身不记得上一次对话说了什么,也不知道你的项目有什么规范。
Vibe Coding(氛围编程)——不断通过自然语言去编程。
CLAUDE.md / AGENTS.md ——以文件系统承载记忆的存储。这是 Harness 记忆模块的核心,是导航地图,告诉 Agent 最关键的约束和规则,每次带上。
五、实践要点:案例驱动
5.1 不要急于生成代码
/init 初始化项目记忆非常重要。项目核心约束包含:项目功能、技术栈、开发规范、文件或目录结构等。全新项目应新建 CLAUDE.md 文件作为记忆,每次 Prompt 都会带上,解决 stateless 问题。
5.2 记忆需要持续更新
每当 CLAUDE.md 改变后,应再次执行 /init 来更新 Memory。
在 Harness Engineering 中,Memory 很重要!
六、一句话总结
LLM 很智能,但"智能"不等于"能稳定产出好结果"。Harness Engineering 通过在模型外面构建记忆存储(CLAUDE.md)、工具管理(MCP/Skill)等工程化基础设施,像给马套上挽具一样,让模型的能力可以被稳定地、可重复地驾驭。它比 Prompt Engineering 高一个量级,是 AI 应用开发的新范式。