从 Transformer 到生产级 Agent:基础知识了解
一提到 AI,就会听到一大堆名词:Transformer、GPT、LLM、Prompt、CoT、RAG、Memory、MCP、Skill、ReAct、Plan-and-Execute、Reflection、Evals、Multi-Agent、Context Engineering、Harness Engineering、Agent……搞得人一头雾水。它们来自不同阶段、解决不同问题,却经常被放在一起讲,容易误以为它们是互相替代的产品或框架。其实不然,这些名词的出现不是严格的历史时间线,而是许多能力并行发展,成熟系统通常会同时使用其中多项。
1. 为什么学Agent要了解这些
写本文的目的,是在开始学习具体工具和实现之前,先弄清楚这些概念是为什么出现、在系统的哪一层、为前一阶段补上了什么能力。这样再接触某个框架或产品时,就能判断它究竟是在增强模型、补充知识、连接工具,还是在管理整个 Agent 的运行过程。
2. 一句话建立全局认识:每一步都在增强之前的能力
AI的发展不是 “模型越来越会聊天”这么简单,而是不断回答一个问题:它能回答,但能否听懂我的意图?知识会过时怎么办?能否读取我的业务资料?能否替我操作系统?操作错了谁来检查和兜底?
| 上一阶段的短板 | 因而增加的能力 | 解决后的典型应用 |
|---|---|---|
| 长文本关联和并行训练上的瓶颈 | Transformer 用注意力机制让词彼此直接建立关联,并可大规模并行训练;在此基础上出现 GPT 路线和 LLM | 翻译、摘要、生成文本、代码补全 |
| 模型会续写,但不一定按人类要求交流 | 指令微调、对齐、聊天界面 | ChatGPT、DeepSeek 等通用对话助手 |
| 同一句模型可能答得不稳定、不符合格式 | Prompt Engineering(提示词工程)与结构化输出 | 文案助手、问答机器人、信息抽取、固定格式报告 |
| 模型参数中的知识有训练截止时间,也没有企业私有资料 | 知识工程、RAG(Retrieval-Augmented Generation,检索增强生成)与上下文工程 | 企业知识库问答、制度查询、客服辅助、投研/法务检索 |
| 模型只能“说”,不能真正“做” | 工具调用、MCP(Model Context Protocol,模型上下文协议)、Skills(技能) | 查订单、查数据库、发消息、运行代码、生成文件 |
| 一次调用无法完成多步骤任务 | ReAct(Reasoning and Acting,推理与行动)、规划执行、记忆与反思 | 研究助手、数据分析助手、编码助手、工作流自动化 |
| 单个 Agent 处理复杂任务慢且易丢失重点 | 多 Agent 协作 | 研究分工、代码开发/测试/审查分工、复杂运营流程 |
| 自动执行带来安全、成本、错误恢复和合规风险 | Harness Engineering(Harness 工程)、权限、评测、审计、人工接管 | 可在生产环境运行的客服、运维、编码和业务 Agent |
可以把它们类比为:
- LLM 是员工的思考能力;
- Chatbot(对话机器人)是把员工放到聊天窗口服务用户;
- RAG 是查资料;上下文工程是每次递交的任务包;
- Agent 是能自己推进工作的员工;
- Harness 则是办公环境、工具、流程、质检和交接制度。
Transformer 为什么会发展出 GPT / LLM?GPT 和 LLM 是一个概念吗?
这个问题大家可以自行思考或者解决下,或者 参照我后续内容。
3. 能力叠加流程图
flowchart TD
transformer["1. Transformer:解决长文本关联与并行训练问题"]
llm["2. GPT / 预训练语言模型 / LLM:大规模预训练"]
align["3. 指令微调与对齐:可对话、可遵循要求"]
chatbot["4. Chatbot:ChatGPT、DeepSeek 等对话产品"]
prompt["5. Prompt Engineering:提示词与结构化输出"]
cot["6. CoT:分步推理"]
context["7. 知识与上下文:知识工程、RAG、记忆、上下文工程"]
tools["8. 工具调用:Function Calling、MCP、Skills"]
react["9. ReAct:推理、行动、观察、再推理"]
agent["10. 单 Agent:围绕目标自主选择工具并循环推进"]
plan["11. Plan-and-Execute:规划、执行、异常重规划"]
reflect["12. Reflection 与 Evals:检查、修正与系统评估"]
multi["13. 多 Agent:分工、委派、交接、汇总"]
prod["14. 生产级 Agent:权限、审批、审计、监控、人工接管"]
harness["Harness 工程:运行、验证、恢复与治理"]
transformer --> llm
llm --> align
align --> chatbot
chatbot --> prompt
prompt --> cot
cot --> context
context --> tools
tools --> react
react --> agent
agent --> plan
plan --> reflect
reflect --> multi
multi --> prod
agent --> harness
harness --> plan
harness --> reflect
harness --> multi
harness --> prod
图中的主线表示能力的逐层叠加;右侧分支表示相应阶段发展出的工程实践。Chatbot 是面向用户的产品形态,而不是一个新的模型架构;同一个 Chatbot 后续可逐步接入搜索、文件、知识库和工具,从“能聊天”演进为“能完成任务”。Harness 工程从 Agent 开始调用工具、进入循环时就出现,并在长任务和生产部署时变得关键。
4. 各阶段到底增加了什么
| 阶段 | 解决的问题 / 新增能力 | 常见应用 | 仍然缺少什么 |
|---|---|---|---|
| Transformer / GPT / LLM | 阅读、写作、归纳、生成、一定程度的推理 | 翻译、摘要、写作、代码补全 | 不理解用户的隐含意图,知识会过时,不能操作外部系统 |
| 指令微调、对齐与 Chatbot | 把“会续写”变成“会按要求对话” | ChatGPT、DeepSeek 等通用对话助手 | 只依赖模型参数和当前对话,无法天然获得外部/企业实时资料 |
| 提示词工程 | 将角色、目标、约束、示例和格式表达得更明确 | 文案助手、结构化信息抽取、报告初稿 | 长任务状态、自动执行能力 |
| CoT | 将复杂推理拆为步骤,提高可检查性 | 数学/逻辑辅助、复杂问答、方案比较 | 真实世界反馈和行动能力 |
| RAG、记忆、上下文 | 使用私有/最新资料,保留任务状态 | 企业知识库问答、制度查询、客服辅助、资料检索 | 不能天然执行外部操作 |
| 工具调用 | 查询系统、改文件、运行代码、调用业务接口 | 查订单、数据分析、代码助手、自动生成文件 | 不一定会自主选择和连续使用工具 |
| ReAct | 建立“推理—行动—观察”的循环模式 | 搜索型助手、代码调试助手、简单自动化流程 | 还缺目标持续性、任务状态和系统治理 |
| 单 Agent / 规划执行 | 围绕目标自主选择工具、保持状态并根据反馈推进 | 研究 Agent、编码 Agent、跨系统流程自动化 | 长时程稳定性、错误恢复、治理 |
| Reflection / Evals | 自我修正和系统性质量验证 | 自动测试修复、答案质量检查、回归测试 | 可扩展协作与生产运行保障 |
| 多 Agent | 并行探索、专业分工、上下文隔离 | 多角色研究、开发/测试/审查协作 | 协调成本、权限边界和全局一致性 |
| 生产级 Agent | 可控、可审计、可运营地交付任务 | 生产客服、运维处置、企业流程、长期编码任务 | 仍需持续评测和人工监督 |
同一个产品可以跨越多个阶段
ChatGPT、DeepSeek 等是面向用户的产品形态,而不是某个固定技术阶段。一个对话产品可以在基础聊天能力之上,逐步接入检索、文件、工具和 Agent 循环,从“能聊天”发展为“能完成任务”。
以 ChatGPT 等产品常见的功能演进为例:
| 用户看到的功能 | 实际叠加的能力 | 它解决的问题 |
|---|---|---|
| 聊天、写作、翻译、总结 | LLM + 指令对齐 + 聊天界面 | 让模型能以自然语言协助工作 |
| 更稳定的角色、格式和语气 | 提示词工程、结构化输出 | 让结果可复用、可接入后续系统 |
| 搜索网页、读取上传文件、连接企业资料 | RAG / 检索 / 上下文工程 | 模型训练后的新信息,以及企业内部知识,不在模型参数中 |
| 分析表格、运行代码、生成文件、发送消息 | 工具调用 | 从“给建议”变成“执行操作” |
| 为一个目标连续查找、分析、执行和验证 | Agent 循环 + Harness | 从一次问答变成多步骤任务交付 |
“获取训练截止日期之后的信息”并不等于模型重新学习了新知识。 通常是搜索、文件连接器或 RAG 在回答时检索到新资料,再将资料放进当前上下文供模型阅读。企业场景中,RAG 正是为了解决“模型天然看不到内部系统、制度文档、私有数据库和最新数据”这一问题。
5. 总结
这篇文章的核心不是记住一串名词,而是理解它们是如何出现组合起来来增强大模型能力的:
它们不是互相替代的关系,而是组合关系:
-
Transformer / LLM 提供思考与生成能力;
-
提示词、RAG、上下文工程 提供正确且相关的信息;
-
工具、MCP、Skills 提供行动能力;
-
Agent 模式 负责围绕目标持续决策;
-
Harness、Evals、权限与人工审批 负责可靠性、安全和治理。
以后遇到新的 AI 名词时,可以先问三个问题:它解决的是模型能力、信息获取、外部行动,还是运行与治理?确定它所在的层次后,就更容易理解它与已有能力是替代关系,还是补充关系。