AI 应用技术演进全景:从 Transformer 到 Harness Engineering
Transformer / LLM、提示词、微调、RAG、函数调用、MCP、Agent、多智能体、上下文工程、Skills、OpenClaw、Harness 完整技术串讲与论文参考
引言:为什么是这 12 个词?
如果把大模型应用比作盖楼,你会发现近几年行业的注意力一直在「换楼层」:
- 2017–2022,大家在抢「地基」——模型够不够强(Transformer / LLM);
- 2022–2023,大家在抢「装修」——怎么让一个通用模型变成听话的「专用员工」(提示词、微调、RAG);
- 2024,大家在抢「手脚」——让模型不只「会说话」,还要「会干活」(函数调用、MCP、Agent);
- 2025–2026,大家在抢「整栋楼的物业系统」——单点能力都具备了,怎么让 Agent 稳定、可控、可复用地跑长周期任务(多智能体、上下文工程、Skills、OpenClaw、Harness)。
下面的 12 个概念,正好是这四层楼里最关键的 12 根柱子。我们沿着演进脉络把它们一一串起来。
第一幕 · 能力底座:模型层
1. LLM 与 Transformer 架构
核心概念
大语言模型(LLM)是一类基于海量文本训练、能理解并生成自然语言的模型,而它的「地基」是 2017 年提出的 Transformer 架构——一种完全基于**注意力机制(Attention)**的神经网络结构,通过让每个词「关注」序列中的其他词来建模上下文关系,从而取代了此前的循环神经网络(RNN)与卷积网络。
Transformer 的意义在于两点:一是并行化,不再像 RNN 那样必须逐字串行处理,训练效率大幅提升;二是长程依赖,注意力机制让相隔很远的词也能直接建立联系。在它的基础上,行业逐渐收敛出一种主流变体——**Decoder-Only(仅解码器)**架构,也就是今天 GPT、Claude、DeepSeek、豆包等绝大多数大模型的共同形态:输入一个前缀,自回归地逐个预测下一个 Token。
为什么它是一切的起点
没有 Transformer,就没有「大模型时代」。今天我们讨论的提示词、微调、RAG、Agent,全都是构建在「一个足够强的语言底座」之上的——底座越强,上层手段发挥的空间才越大。
优质论文
- 《Attention Is All You Need》,Vaswani 等,Google Brain,2017(NeurIPS 2017 最佳论文)。提出 Transformer 与多头自注意力,是大模型时代的开山之作。arxiv.org/abs/1706.03…
文档参考
- Hugging Face《Transformers》库文档(社区事实标准的实现与教程):huggingface.co/docs/transf…
- 大模型科普综述(如 《The Illustrated Transformer》中译版,帮助理解注意力机制)。
第二幕 · 不换「脑子」的调优:提示词、微调与检索
有了强大的底座模型后,第一个现实问题是:一个通用模型,怎么变成「我想要的」专用模型? 行业给出了三条并行的路线,它们共享同一个目标——让模型更准确地完成特定任务,但「动」的东西完全不同。
2. Prompt Engineering(提示词工程)
核心概念
**提示词(Prompt)**是用来引导模型按特定意图生成输出的输入指令,一般包含「系统提示词」(定义角色与全局规则)和「用户提示词」(本次的具体请求)。提示词工程就是通过设计、组织和优化提示词,让大模型更准确、可控地产生所需输出。
它是一条**不改变模型智力(参数)**的低成本调优手段——模型权重一动不动,纯靠「把话说清楚」提升效果。经典技法包括:角色设定、Few-shot 示例(给几个范例)、思维链(CoT,让模型先推理再作答)、结构化输出约定等。
演进逻辑:提示词工程是成本最低、见效最快的「第一级杠杆」,但它的天花板受限于模型本身的智能——提示词写得好不好,只能决定模型「发挥出多少」,不能决定模型「有多少」。
优质论文
- 《Chain-of-Thought Prompting Elicits Reasoning in Large Language Models》,Wei 等,Google,2022。仅用 8 个思维链示例,就让 540B 模型在 GSM8K 数学题上达到当时 SOTA——提示词的威力教科书级展示。arxiv.org/abs/2201.11…
文档参考
- OpenAI《Prompt engineering》官方指南:platform.openai.com/docs/guides…
- Anthropic《Prompt engineering overview》官方文档:docs.claude.com/en/docs/bui…
3. Fine-tuning(微调)与 LoRA
核心概念
微调(Fine-tuning)是在已有预训练模型的基础上,用特定领域的数据再训练模型参数,让它更贴合某个具体任务或场景——相当于给通用员工做「岗位培训」。与提示词工程不同,微调真正改变了模型的参数。
但全参数微调成本极高(70B 模型的权重就有上百 GB)。为此行业找到了 LoRA(Low-Rank Adaptation,低秩适配):冻结原模型全部参数,只额外训练一小部分「低秩」适配参数(通常不到原参数的 1%),就能以极低成本达到接近全量微调的效果,训练显存和存储开销大幅下降。LoRA 也因此成为开源社区微调的事实标准(QLoRA、DoRA 等变体都在它之上生长)。
演进逻辑:如果说提示词工程是「口头叮嘱」,微调就是「正式培训」——投入更高,但把能力真正写进了模型里,适合对效果稳定性、延迟、领域专业性要求高的场景。LoRA 则让「培训费」降到了个人开发者也能承受的程度。
优质论文
- 《LoRA: Low-Rank Adaptation of Large Language Models》,Hu 等,微软,2021。提出低秩适配矩阵思路,大幅降低微调成本,是该方向引用量最高的论文之一。arxiv.org/abs/2106.09…
文档参考
- Hugging Face《PEFT》参数高效微调库文档:huggingface.co/docs/peft
- Hugging Face《Fine-tune a pretrained model》官方教程。
4. RAG(检索增强生成)
核心概念
RAG(Retrieval-Augmented Generation,检索增强生成)的流程是:先从外部知识库检索与问题相关的信息,再把「问题 + 检索到的资料」一起交给模型生成回答。它把「记忆」从模型参数内部,搬了一部分到外部可更新的知识库里。
RAG 解决的是大模型的两个先天短板:知识时效性(训练数据有截止时间,不知道新事物)和事实准确性/幻觉(模型靠记忆作答,容易一本正经地胡说)。由于知识存于外部库,企业可以随时更新资料、也能让回答可溯源(引用了哪份文档),这让 RAG 成为企业知识库问答的事实标准方案。
演进逻辑:如果说微调是把知识「背进脑子里」,RAG 就是「随时翻资料再答题」——不改变参数、不重新训练,却能精准接入最新、最私域的知识,是知识密集型场景最高性价比的方案。
优质论文
- 《Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks》,Lewis 等,Meta AI,2020(NeurIPS 2020)。首次提出「参数化记忆(模型)+ 非参数化记忆(检索索引)」的 RAG 范式,在三个开放域 QA 任务上刷新 SOTA。arxiv.org/abs/2005.11…
文档参考
- LangChain《RAG》官方文档(含概念、架构与代码示例):python.langchain.com/docs/tutori…
- LlamaIndex 官方文档:docs.llamaindex.ai
三条调优路线一句话对比:提示词 = 不改参数、零成本、上限受模型限制;微调 = 改参数、成本高、能力写进模型;RAG = 不改参数、接外部知识、可溯源可更新。
第三幕 · 从「会说」到「会做」:行动能力
模型「脑子」够用了、也知道怎么「好好说话」了,下一个问题是:怎么让它真正「办事」? 这一层的演进,本质是给模型装上「手」——从「输出一段话」到「输出一个动作」。
5. Function Calling(函数调用)
核心概念
Function Calling 是一种让大模型按约定格式输出调用指令(如 {"name": "query_weather", "arguments": {...}})的机制:模型本身不真正执行操作,而是声明「我想调用哪个函数、参数是什么」,由外部系统(你的代码)去真实执行,再把结果喂回模型继续生成。
它让模型从「只会说话」变成「会调用工具」——查天气、订机票、读数据库、操作软件,一切可以函数化的能力都能接进来。这是 Agent 的「手」,也是整个工具调用体系最底层的一块砖。
演进逻辑:Function Calling 本质是把「模型的自然语言输出」翻译成「结构化的程序调用」,是后续一切自动化动作的起点。
文档参考
- OpenAI《Function calling》官方指南(最早普及该能力的平台):platform.openai.com/docs/guides…
- Anthropic《Tool use》官方文档:docs.claude.com/en/docs/bui…
6. MCP(Model Context Protocol)
核心概念
MCP(Model Context Protocol,模型上下文协议)是由 Anthropic 于 2024 年底提出并开源的一种标准化协议,用来让大模型以统一的方式连接外部工具、数据源和服务——获取上下文信息并执行操作。
在 MCP 之前,每个工具都要给每个 AI 应用写一套专属集成(A 应用的「查天气」接法和 B 应用的完全不同);MCP 定义了「MCP 主机(Host)/ 客户端(Client)/ 服务端(Server)」的通用架构,让工具一次开发、处处复用。它最重要的贡献之一,就是让工具可以跨 AI 应用复用,把碎片化的集成变成繁荣的社区生态(官方与社区已出现海量现成 MCP Server)。
演进逻辑:Function Calling 是「模型会调工具」,MCP 是「工具的接口统一了」——如果说前者解决了「有没有手」,后者解决的是「手能不能标准化地接到不同身体上」。
文档参考
- MCP 官方文档站:modelcontextprotocol.io/
- MCP 官方 GitHub 组织(协议规范与 SDK):github.com/modelcontex…
7. Agent(智能体)
核心概念
Agent 是一种能够基于目标进行「思考(Thought)— 行动(Action)— 观察(Observation)」循环、自主调用工具来完成复杂任务的智能系统。它本质上是对「人怎么做事」的模拟:先想怎么做 → 动手调用工具 → 看结果 → 再调整再行动,直到目标完成。
一个最朴素的 Agent 可以由「提示词 + LLM + Tools」构成:提示词定义角色和目标,LLM 负责决策,Tools 负责执行。从 ReAct(交替推理与行动)到 Plan-and-Execute(先规划再执行),各种范式都在解决同一个问题——如何让模型在多步、自主、带反馈的任务里稳定走下去。
演进逻辑:Function Calling 给了模型「手」,Agent 给了模型「大脑 + 手脚的完整闭环」。它从「回答一个问题」跃迁为「完成一项任务」,是当前 AI 应用最重要的形态转折。
优质论文
- 《ReAct: Synergizing Reasoning and Acting in Language Models》,Yao 等,普林斯顿,2022。提出推理轨迹与动作交替的 ReAct 范式,是 Agent 最经典的底层框架之一。arxiv.org/abs/2210.03…
- 延伸精读:《Toolformer》等工具学习类论文。
文档参考
- Anthropic《Building Effective Agents》官方博客(Agent 设计原则与模式,被公认为业界入门圣经):www.anthropic.com/engineering…
- OpenAI《Agents》官方文档 / LangGraph 文档(Agent 编排框架):langchain-ai.github.io/langgraph/
第四幕 · 从单兵到系统:协作与工程化
单个 Agent 能干活了,但真实世界的问题是复杂、长周期、需要协作的。于是行业从「造一个聪明 Agent」转向「造一套能让 Agent 稳定工作的系统」。
8. Multi-Agent(多智能体)
核心概念
Multi-Agent(多智能体系统)由多个分工协作的 Agent 共同完成任务:一个负责规划、一个负责写代码、一个负责评审、一个负责测试……通过拆分任务与隔离上下文,解决单 Agent 难以处理的复杂问题——就像软件公司里产品、开发、测试各司其职。
它的收益来自「把大问题切成小问题 + 每个 Agent 只关注自己的上下文」,但代价也很明确:Token 消耗量大、协作效率可能降低、系统复杂度显著上升。因此行业共识是「能用单 Agent 就不用多 Agent」,只有任务复杂度确实需要分工时才引入。
演进逻辑:从「一个全能 Agent」到「一组专业 Agent」,本质是工程上的「分而治之」——用结构化协作换处理复杂问题的能力上限。
优质论文
- 《AutoGen: Enabling Next-Gen LLM Applications via Multi-Agent Conversation》,Wu 等,微软,2023。提出多 Agent 对话式协作的通用框架,是该方向的代表作之一。arxiv.org/abs/2308.08…
- 延伸精读:《MetaGPT: Meta Programming for Multi-Agent Collaborative Framework》(多 Agent 模拟软件公司协作)。
文档参考
- AutoGen 官方文档:microsoft.github.io/autogen/
- CrewAI 官方文档(多 Agent 角色协作框架):docs.crewai.com
9. Context Engineering(上下文工程)
核心概念
Agent 运行中需要提供给 LLM 的一切相关信息——对话历史、用户输入、背景知识、工具结果、系统指令——统称上下文(Context)。上下文工程关注的是:如何高质量筛选、压缩和组织上下文,从而最大化模型的决策与推理能力。
为什么它重要?因为 LLM 的上下文窗口是有限且会「衰减」的注意力资源:内容越多,模型从里面准确提取信息的能力反而下降(业界称为 context rot,上下文腐烂)。所以工程的核心命题是——用最小的高信号 Token 集合,最大化期望结果的概率。常用技法包括:Compaction(压缩)(对话快满时总结并开新窗口)、结构化笔记(agentic memory)(把状态写到上下文之外的文件里,需要时再读回)、Just-in-time 检索(先给文件路径,用时再动态加载)等。
演进逻辑:提示词工程优化「一次请求怎么说」,上下文工程管理「整个运行过程里持续给什么」——它是提示词工程在 Agent 长周期运行场景下的自然升级,被 Anthropic 称为「AI 工程新范式的核心」。
文档参考
- Anthropic《Effective context engineering for AI agents》官方博客(2025-09):www.anthropic.com/engineering…
- Anthropic《Memory and context management》cookbook 文档。
10. Agent Skills(智能体技能)
核心概念
Agent Skills 是一种轻量级的开放格式,把一整套 Agent 能力(Prompt、工具脚本、知识文件等)封装成可复用模块,实现低门槛的分享与复用。它本质上「约等于一个子 Agent」——一个把「做什么 + 怎么做 + 用什么工具」打包好的能力单元。
Agent Skills 有两个关键设计:
- 渐进式披露(Progressive Disclosure):Agent 运行时只先看到技能的「元数据(名称 + 一句话描述)」,需要时才按需读取完整内容——避免把所有技能文档一股脑塞进上下文、挤占注意力;
- SOP 沉淀:Skill 特别适合把标准作业流程(Standard Operating Procedure)固化下来——正如那句玩笑话,「离职的同事终将化作温暖的 Skill」——组织经验得以沉淀与复用。
2025 年底,Agent Skills 已发展为开放标准(agentskills.io),Claude Code、Claude.ai、Agent SDK 等多方支持。
演进逻辑:Function Calling / MCP 解决了「工具怎么接」,Agent Skills 解决「一整套路数(流程 + 工具 + 知识)怎么打包复用」——把「会调用工具」升级为「拥有可传承的工作方法」。
文档参考
- Anthropic《Equipping agents for the real world with Agent Skills》官方博客:www.anthropic.com/engineering…
- Agent Skills 开放标准站点:agentskills.io/
- Claude《Agent Skills》官方文档:docs.claude.com/en/docs/age…
11. OpenClaw
核心概念
OpenClaw 是一款开源、高可扩展的 AI Agent 框架,基于 TypeScript 开发,核心用途是构建可自定义的私人 AI 助手(支持本地私有化部署,MIT 协议)。它在 Agent 落地方面有两个突出创新:
- 拓展交互入口:率先把 Agent 接入飞书、微信、Telegram、Slack、Discord 等日常通讯工具——用户无需安装新 App,在「已有的聊天软件里」就能指挥 AI,其中飞书在国内是最受官方推荐、社区最活跃的入口;
- 常驻运行 + 持久记忆:支持 Agent 长时运行、跨会话恢复上下文,配合 Skills 插件生态(ClawHub)与 MCP 协议,形成「多渠道接入 + 推理决策 + 技能扩展 + 记忆管理」的完整框架。
演进逻辑:如果说前面都是「能力层面」的概念,OpenClaw 是「落地层面」的代表——它把 MCP、Skills、Memory 这些散点能力集成成一个开箱即用的 Agent 操作系统,让普通用户也能拥有「住在飞书里的私人 AI 员工」。
文档参考
- OpenClaw 官方 GitHub:github.com/openclaw/op…
- OpenClaw 官网:openclaw.ai
12. Harness Engineering(驾驭工程)
核心概念
Harness Engineering(驾驭工程)强调通过构建受控环境,让 Agent 在约束下高效、可靠地完成长周期复杂任务。它研究的不再是「模型够不够聪明」,而是「模型周围那套系统靠不靠谱」——包含约束机制、反馈回路、可靠上下文、状态管理、结果验证、权限控制等一整套工程实践。
一个形象的比喻:Model 决定「想什么」,Harness 决定「怎么在真实世界里把事情稳定做完」。单独一个模型只能根据输入生成输出;Agent 之所以能持续数小时、数百轮地完成任务,是因为在模型外面套了一层 Harness,把推理、工具、状态、验证、恢复接进真实流程。Anthropic 的 Claude Code / Agent SDK、OpenAI 的 Codex 百万行代码实验,都是 Harness 工程的成功实践。
演进逻辑:这是当前 AI 应用工程的「收口」——当模型、工具、上下文、协作都到位后,决定成败的变成了「整个运行系统的工程化程度」。行业的竞争焦点正在从「模型能力」转向「运行时与工程体系」。
文档参考
- Anthropic《Effective harnesses for long-running agents》官方博客(2025-11):www.anthropic.com/engineering…
- OpenAI《Harness Engineering》官方博客:openai.com/index/harne…
演进全景:一图看懂
附:优质论文与文档参考总清单
| # | 技术点 | 值得精读的论文 | 必看文档 |
|---|---|---|---|
| 1 | LLM / Transformer | 《Attention Is All You Need》(2017) · arXiv:1706.03762 | HF Transformers 文档 |
| 2 | Prompt Engineering | 《Chain-of-Thought Prompting》(2022) · arXiv:2201.11903 | OpenAI / Anthropic 提示词指南 |
| 3 | Fine-tuning / LoRA | 《LoRA: Low-Rank Adaptation》(2021) · arXiv:2106.09685 | HF PEFT 文档 |
| 4 | RAG | 《RAG for Knowledge-Intensive NLP Tasks》(2020) · arXiv:2005.11401 | LangChain / LlamaIndex 文档 |
| 5 | Function Calling | ——(以官方机制为主) | OpenAI / Anthropic 工具调用文档 |
| 6 | MCP | ——(协议规范) | modelcontextprotocol.io |
| 7 | Agent | 《ReAct》(2022) · arXiv:2210.03629 | Anthropic《Building Effective Agents》 |
| 8 | Multi-Agent | 《AutoGen》(2023) · arXiv:2308.08155 | AutoGen / CrewAI 文档 |
| 9 | Context Engineering | ——(工程实践为主) | Anthropic《Effective Context Engineering》 |
| 10 | Agent Skills | ——(开放标准) | anthropic.com/engineering/skills · agentskills.io |
| 11 | OpenClaw | ——(开源框架) | github.com/openclaw/openclaw · openclaw.ai |
| 12 | Harness Engineering | ——(工程实践为主) | Anthropic / OpenAI Harness 博客 |
结语:一条给学习者的主线
如果你要系统学习这套体系,推荐按这样的顺序走:
- 先把 Transformer 和注意力机制吃透(第 1 节)——这是所有上层概念的地基;
- 接着练「调优三件套」(第 2–4 节)——提示词 → 微调 → RAG,先不碰代码也知道「三条路线各解决什么问题」;
- 然后理解「从说到做」(第 5–7 节)——Function Calling → MCP → Agent,动手搭一个「提示词 + LLM + 工具」的最小 Agent;
- 最后进入「系统工程」(第 8–12 节)——多智能体、上下文工程、Skills、OpenClaw、Harness,理解为什么「模型之外的那层工程」才是决定成败的关键。
四层楼走完,你就拥有了从「会用大模型」到「能设计大模型应用系统」的完整视角。