Agent知识(一)----从Transformer到Agent进化历程

24 阅读7分钟

从 Transformer 到生产级 Agent:基础知识了解

一提到 AI,就会听到一大堆名词:Transformer、GPT、LLM、Prompt、CoT、RAG、Memory、MCP、Skill、ReAct、Plan-and-Execute、Reflection、Evals、Multi-Agent、Context Engineering、Harness Engineering、Agent……搞得人一头雾水。它们来自不同阶段、解决不同问题,却经常被放在一起讲,容易误以为它们是互相替代的产品或框架。其实不然,这些名词的出现不是严格的历史时间线,而是许多能力并行发展,成熟系统通常会同时使用其中多项。

1. 为什么学Agent要了解这些

写本文的目的,是在开始学习具体工具和实现之前,先弄清楚这些概念是为什么出现、在系统的哪一层、为前一阶段补上了什么能力。这样再接触某个框架或产品时,就能判断它究竟是在增强模型、补充知识、连接工具,还是在管理整个 Agent 的运行过程。

2. 一句话建立全局认识:每一步都在增强之前的能力

AI的发展不是 “模型越来越会聊天”这么简单,而是不断回答一个问题:它能回答,但能否听懂我的意图?知识会过时怎么办?能否读取我的业务资料?能否替我操作系统?操作错了谁来检查和兜底?

上一阶段的短板因而增加的能力解决后的典型应用
长文本关联和并行训练上的瓶颈Transformer 用注意力机制让词彼此直接建立关联,并可大规模并行训练;在此基础上出现 GPT 路线和 LLM翻译、摘要、生成文本、代码补全
模型会续写,但不一定按人类要求交流指令微调、对齐、聊天界面ChatGPT、DeepSeek 等通用对话助手
同一句模型可能答得不稳定、不符合格式Prompt Engineering(提示词工程)与结构化输出文案助手、问答机器人、信息抽取、固定格式报告
模型参数中的知识有训练截止时间,也没有企业私有资料知识工程、RAG(Retrieval-Augmented Generation,检索增强生成)与上下文工程企业知识库问答、制度查询、客服辅助、投研/法务检索
模型只能“说”,不能真正“做”工具调用、MCP(Model Context Protocol,模型上下文协议)、Skills(技能)查订单、查数据库、发消息、运行代码、生成文件
一次调用无法完成多步骤任务ReAct(Reasoning and Acting,推理与行动)、规划执行、记忆与反思研究助手、数据分析助手、编码助手、工作流自动化
单个 Agent 处理复杂任务慢且易丢失重点多 Agent 协作研究分工、代码开发/测试/审查分工、复杂运营流程
自动执行带来安全、成本、错误恢复和合规风险Harness Engineering(Harness 工程)、权限、评测、审计、人工接管可在生产环境运行的客服、运维、编码和业务 Agent

可以把它们类比为:

  • LLM 是员工的思考能力;
  • Chatbot(对话机器人)是把员工放到聊天窗口服务用户;
  • RAG 是查资料;上下文工程是每次递交的任务包;
  • Agent 是能自己推进工作的员工;
  • Harness 则是办公环境、工具、流程、质检和交接制度。

Transformer 为什么会发展出 GPT / LLM?GPT 和 LLM 是一个概念吗?
这个问题大家可以自行思考或者解决下,或者 参照我后续内容。

3. 能力叠加流程图

image.png

flowchart TD
    transformer["1. Transformer:解决长文本关联与并行训练问题"]

llm["2. GPT / 预训练语言模型 / LLM:大规模预训练"]

align["3. 指令微调与对齐:可对话、可遵循要求"]

chatbot["4. Chatbot:ChatGPT、DeepSeek 等对话产品"]

prompt["5. Prompt Engineering:提示词与结构化输出"]

cot["6. CoT:分步推理"]

context["7. 知识与上下文:知识工程、RAG、记忆、上下文工程"]

tools["8. 工具调用:Function Calling、MCP、Skills"]

react["9. ReAct:推理、行动、观察、再推理"]

agent["10. 单 Agent:围绕目标自主选择工具并循环推进"]

plan["11. Plan-and-Execute:规划、执行、异常重规划"]

reflect["12. Reflection 与 Evals:检查、修正与系统评估"]

multi["13. 多 Agent:分工、委派、交接、汇总"]

prod["14. 生产级 Agent:权限、审批、审计、监控、人工接管"]

harness["Harness 工程:运行、验证、恢复与治理"]
transformer --> llm

llm --> align

align --> chatbot

chatbot --> prompt

prompt --> cot

cot --> context

context --> tools

tools --> react

react --> agent

agent --> plan

plan --> reflect

reflect --> multi

multi --> prod

agent --> harness

harness --> plan

harness --> reflect

harness --> multi

harness --> prod

图中的主线表示能力的逐层叠加;右侧分支表示相应阶段发展出的工程实践。Chatbot 是面向用户的产品形态,而不是一个新的模型架构;同一个 Chatbot 后续可逐步接入搜索、文件、知识库和工具,从“能聊天”演进为“能完成任务”。Harness 工程从 Agent 开始调用工具、进入循环时就出现,并在长任务和生产部署时变得关键。

4. 各阶段到底增加了什么

阶段解决的问题 / 新增能力常见应用仍然缺少什么
Transformer / GPT / LLM阅读、写作、归纳、生成、一定程度的推理翻译、摘要、写作、代码补全不理解用户的隐含意图,知识会过时,不能操作外部系统
指令微调、对齐与 Chatbot把“会续写”变成“会按要求对话”ChatGPT、DeepSeek 等通用对话助手只依赖模型参数和当前对话,无法天然获得外部/企业实时资料
提示词工程将角色、目标、约束、示例和格式表达得更明确文案助手、结构化信息抽取、报告初稿长任务状态、自动执行能力
CoT将复杂推理拆为步骤,提高可检查性数学/逻辑辅助、复杂问答、方案比较真实世界反馈和行动能力
RAG、记忆、上下文使用私有/最新资料,保留任务状态企业知识库问答、制度查询、客服辅助、资料检索不能天然执行外部操作
工具调用查询系统、改文件、运行代码、调用业务接口查订单、数据分析、代码助手、自动生成文件不一定会自主选择和连续使用工具
ReAct建立“推理—行动—观察”的循环模式搜索型助手、代码调试助手、简单自动化流程还缺目标持续性、任务状态和系统治理
单 Agent / 规划执行围绕目标自主选择工具、保持状态并根据反馈推进研究 Agent、编码 Agent、跨系统流程自动化长时程稳定性、错误恢复、治理
Reflection / Evals自我修正和系统性质量验证自动测试修复、答案质量检查、回归测试可扩展协作与生产运行保障
多 Agent并行探索、专业分工、上下文隔离多角色研究、开发/测试/审查协作协调成本、权限边界和全局一致性
生产级 Agent可控、可审计、可运营地交付任务生产客服、运维处置、企业流程、长期编码任务仍需持续评测和人工监督

同一个产品可以跨越多个阶段

ChatGPT、DeepSeek 等是面向用户的产品形态,而不是某个固定技术阶段。一个对话产品可以在基础聊天能力之上,逐步接入检索、文件、工具和 Agent 循环,从“能聊天”发展为“能完成任务”。

以 ChatGPT 等产品常见的功能演进为例:

用户看到的功能实际叠加的能力它解决的问题
聊天、写作、翻译、总结LLM + 指令对齐 + 聊天界面让模型能以自然语言协助工作
更稳定的角色、格式和语气提示词工程、结构化输出让结果可复用、可接入后续系统
搜索网页、读取上传文件、连接企业资料RAG / 检索 / 上下文工程模型训练后的新信息,以及企业内部知识,不在模型参数中
分析表格、运行代码、生成文件、发送消息工具调用从“给建议”变成“执行操作”
为一个目标连续查找、分析、执行和验证Agent 循环 + Harness从一次问答变成多步骤任务交付

“获取训练截止日期之后的信息”并不等于模型重新学习了新知识。 通常是搜索、文件连接器或 RAG 在回答时检索到新资料,再将资料放进当前上下文供模型阅读。企业场景中,RAG 正是为了解决“模型天然看不到内部系统、制度文档、私有数据库和最新数据”这一问题。

5. 总结

这篇文章的核心不是记住一串名词,而是理解它们是如何出现组合起来来增强大模型能力的:

image.png

它们不是互相替代的关系,而是组合关系:

  • Transformer / LLM 提供思考与生成能力;

  • 提示词、RAG、上下文工程 提供正确且相关的信息;

  • 工具、MCP、Skills 提供行动能力;

  • Agent 模式 负责围绕目标持续决策;

  • Harness、Evals、权限与人工审批 负责可靠性、安全和治理。

以后遇到新的 AI 名词时,可以先问三个问题:它解决的是模型能力信息获取外部行动,还是运行与治理?确定它所在的层次后,就更容易理解它与已有能力是替代关系,还是补充关系。