写在前面
不知道你有没有这种感觉:
现在打开技术社区或者Github Trending ,10个里面7个基本都是 AI 相关的:
Agent、skill、MCP、RAG、Vibe Coding、Context Engineering……
几天不关注,就感觉自己已经跟不上了....
更难受的是,很多文章解释一个词的时候,会默认你已经懂另外十个词。
查一个词,要先查五个新词,一个词看不懂就读不下去了。
于是我整理了一篇 AI 热词,希望用一篇文章,把最近高频出现的这些概念串起来。
顺序也很重要:从模型本身 → 模型增强 → Agent → 工程化 → AGI
前面的概念,是后面的基础。
为了方便理解,全文统一使用一个比喻:
把大模型想象成一个非常聪明的实习生。
他能力很强,但也有一些限制。
一、先认识 AI 的“大脑”
LLM(Large Language Model)
LLM,大语言模型。
ChatGPT、Claude、DeepSeek 等 AI 产品背后的核心模型,都属于这一类。
简单理解:LLM 是在海量文本数据上训练出来的模型,它最基础的任务是:
根据已有内容预测接下来最可能出现的信息。
比如:
今天天气真……
模型会根据训练经验判断后面可能出现:
好、热、冷……
当然,现在的大模型早已经超过简单补全文字。
经过大规模训练后,它表现出了:
- 代码生成能力
- 逻辑推理能力
- 文本理解能力
- 任务规划能力
所以我们的 AI 实习生:
读过大量资料,知识面很广,很多问题都能处理。
Token:模型世界里的计量单位
模型并不是直接理解文字。
文本输入模型之前,会被切分成一个个 Token。
Token 可以理解成:
模型处理信息的基本单位。
比如一句:
I love AI
可能会被切分成:
I | love | AI
三个 Token。
中文通常切分会更细一些,例如:
人工智能很强
可能会被切分成:
人工 | 智能 | 很 | 强
或者人 | 工 | 智 | 能 | 很 | 强
为什么 Token 重要?
- API 通常按照 Token 数量收费
- 模型上下文长度按照 Token 计算
- 一次能够处理的信息量也受到 Token 限制
所以 Token 就像模型世界里的“流量”。
你提供的信息越多,消耗的 Token 越多。
Context Window:模型一次能看到多少东西
Context Window,也叫上下文窗口。
它表示:
模型一次交互能够处理的信息总量。
通常包括:
- 当前输入
- 历史对话
- 系统提示词
- 工具信息
- 模型输出
比如一个模型支持:
200K Context Window
意味着它一次最多处理约 20 万 Token 的上下文。
很多人觉得:“为什么聊久了 AI 会忘记之前说过的话?”
其实不是它忘了。
而是:那些内容已经不在当前上下文范围内。
就像实习生桌子只有一张 A4 纸。
写满以后,必须擦掉旧内容,才能继续记录新的内容。
Prompt:如何给模型布置任务
Prompt,就是你发送给模型的指令。
比如:普通 Prompt:
写一个总结。
高级 Prompt:
你是一名技术负责人,请把下面方案总结成 5 点,用于 CTO 汇报。
为什么 Prompt 有价值?
因为模型需要知道:
- 你的目标是什么
- 需要什么格式
- 应该采用什么身份
- 输出标准是什么
二、给模型开外挂
模型虽然聪明,但有几个问题:
- 不知道你的私有数据
- 知识可能过时
- 不会主动操作外部世界
下面这些技术,就是解决这些问题。
RAG:给模型外挂知识库
中文:检索增强生成。
解决的问题:
模型不知道训练外的数据。
比如:
- 公司内部文档
- 产品说明
- 技术规范
- 项目代码
模型训练时并没有这些内容。
RAG 的流程:
- 提前把资料切分
- 转换成向量
- 存入向量数据库
- 用户提问时搜索相关内容
- 把结果提供给模型回答
这样模型回答时,不再只依赖训练记忆,而是可以参考最新资料。
类似:
实习生回答问题之前,可以先去公司的资料库查文档。
Embedding:让文字变成数字
Embedding 是 RAG 中的重要技术。
简单理解:
Embedding 是把文字转换成计算机能够理解的数字向量。
比如 苹果手机 和 iPhone。
虽然文字不同,但表达的含义非常接近。
通过 Embedding,系统可以理解内容之间的语义关系,从大量资料中找到和用户问题相关的信息。
不过实际的 RAG 检索并不只依赖向量相似度。
工程中通常会结合:
- 向量检索(Embedding):根据语义寻找相关内容
- 关键词检索(Keyword Search):匹配明确的关键词
- 混合检索(Hybrid Search):结合两种方式,提高检索准确率
简单来说:
Embedding 负责理解“意思像不像”,关键词检索负责匹配“有没有这个词”,两者结合,才能更稳定地找到需要的资料。
Fine-tuning:重新训练模型行为
Fine-tuning,也叫微调。
如果说 RAG 是:
给实习生一本资料,让他查询。
那么 Fine-tuning 是:
重新培训这个实习生,让他的工作方式改变。
例如让模型:
- 更符合某种写作风格
- 更擅长某个专业领域
- 输出固定格式内容
简单区分:
RAG 改变的是:
模型知道什么。
Fine-tuning 改变的是:
模型怎么做事。
Tool Calling:让模型学会使用工具
模型本身只能生成文字。
它不会:
- 查询数据库
- 调接口
- 执行代码
- 发邮件
Tool Calling 的方式:
提前告诉模型:
你可以使用这些工具。
例如:
getWeather(city)
模型判断:
“我要查询天气。”
然后生成调用请求。
真正执行的是你的程序。
所以模型负责决定,代码负责执行。
类似:
就像这个实习生知道“我需要查一下天气”,但他不会自己写代码调用天气接口,而是告诉系统:“请帮我调用天气查询工具。”系统执行后把结果给他,他再继续完成任务。
MCP:统一连接 AI 和工具的协议
它解决的问题:
以前:
每个 AI 应用连接不同工具,都需要单独开发。
例如:
A 工具写一套接口。
B 工具再写一套。
成本很高。
MCP 希望建立一个统一协议:
- 工具按照 MCP 标准提供能力;
- AI 应用按照 MCP 标准连接。
以前:
每个设备接口不同。
后来:
大家统一 USB-C。
MCP 的目标就是让 AI 和工具之间有一个统一连接方式。
Memory:给 AI 一个可管理的记忆系统
Memory 解决的问题:
Agent 在多轮任务中,需要持续利用过去的信息。
模型本身并不会真正记住之前发生的事情。
Memory 的做法是:
把重要的信息从当前上下文中提取出来,保存到外部存储中。
比如:
- 用户偏好
- 项目背景
- 历史决策
- 常用操作习惯
当后续任务需要时,系统再把相关信息检索出来,重新提供给模型。
所以 Memory 并不是让模型“拥有了记忆”,而是给 Agent 增加了一套信息管理机制。
类似:
实习生不会因为换了一天就自动记住所有项目细节,但公司会保存项目文档和工作记录。当他再次参与项目时,可以先查看相关资料,再继续工作。
Skill:给 AI 一套可复用的工作能力
Skill 可以理解成:
给 AI 准备的一套任务处理规范和流程。
它通常包含:
- 任务执行步骤
- 相关知识说明
- 使用工具的方法
- 输出格式要求
- 注意事项
例如:
- 如何生成技术周报
- 如何处理客户问题
- 如何执行代码发布流程
Skill 不需要重新训练模型。
它更像是在模型之外增加一层“工作方法库”:
当 Agent 遇到某类任务时,加载对应 Skill,让模型按照预定义的方法完成工作。
类似:
实习生入职时,公司不会重新培养一个人,而是给他不同岗位的工作手册。遇到对应任务时,先参考相关流程,再开始处理。
三、从聊天机器人到 Agent
Agent:能够自主完成目标的 AI
普通聊天机器人:你问一句 ,AI 答一句。
Agent:你给一个目标
它自己:
- 分析任务
- 制定计划
- 调用工具
- 根据结果调整
- 完成任务
核心区别:
下一步做什么,是谁决定的?
如果流程提前写死:这是自动化。
如果模型动态决定:更接近 Agent。
ReAct:Agent 的经典工作模式
ReAct:Reason + Act。
也就是:思考 → 行动 → 观察 → 再思考。
例如修 Bug:
- 分析错误
- 修改代码
- 运行测试
- 根据结果继续调整
它不是一次生成答案,而是在不断循环。
Workflow:固定流程的 AI
Workflow:提前定义流程。
例如:
用户问题
↓
分类
↓
检索资料
↓
生成答案
↓
人工审核
每一步怎么走,提前设计。
优点:
- 稳定
- 可控
- 成本低
缺点:
- 灵活性不足。
四、AI 时代工程师的新工作
Prompt Engineering(提示词工程):让模型更好地理解任务
简单来说,就是研究:
如何设计输入给模型的指令,让模型产生更准确、更稳定的结果。
早期使用大模型时,大家发现:
同一个模型,同一个问题,只是换一种表达方式,结果可能差异很大。
比如普通问法:
帮我优化这段代码。
得到的结果可能比较泛。
更好的 Prompt:
你是一名资深前端工程师,请分析下面这段 React 代码的问题,从性能、可维护性、代码规范三个方面给出优化建议,并提供修改后的代码。
模型得到的信息越明确,输出通常越符合预期。
Prompt Engineering 主要关注几个方面:
- 角色设定(Role):告诉模型应该以什么身份回答
- 任务描述(Task):明确要完成什么目标
- 上下文补充(Context):提供必要背景信息
- 输出约束(Constraint):限制格式、长度、风格
不过,Prompt Engineering 解决的问题主要是:
怎么更好地告诉模型做什么。
当任务越来越复杂时,仅靠优化一句 Prompt 已经不够。
因为模型需要的不只是一个问题,而是一整套工作环境:
- 需要哪些资料
- 需要哪些工具
- 需要哪些历史信息
- 什么时候加载什么内容
于是就出现了更大的概念: Context Engineering
Context Engineering(上下文工程):管理模型看到的信息
本质:
应该给模型提供什么信息。
包括:
- Prompt
- RAG 数据
- Memory
- Tool
- Skill
- 历史上下文
一句话:
Prompt Engineering 关注如何向模型提出一个更好的问题。
Context Engineering 关注如何设计模型完成任务所需要的整个信息环境。
Harness Engineering:打造 AI 的工作环境
Harness 可以理解成:
围绕模型构建的一整套运行框架,让 AI 能够安全、稳定地完成任务。
它通常包括:
- 系统提示词和任务规范
- 可调用的工具
- 权限控制
- 沙箱环境
- 上下文管理
- 错误处理和重试机制
- 安全限制
为什么需要 Harness?
因为同一个模型,放在不同的 Harness 中,表现可能完全不同。
一个裸模型可能只能回答问题;
但加入工具、流程、记忆和安全机制后,它可以变成一个能够执行复杂任务的 Agent。
类似:
发动机决定汽车的动力,但车身、方向盘、刹车和控制系统,决定这辆车最终能不能稳定行驶。
模型是发动机,Harness 就是整辆车。
Loop Engineering(循环工程):优化 Agent 循环
Agent 的核心就是不断循环:思考 → 行动 → 观察。
Loop Engineering 关注:
- 循环多少次停止?
- 如何避免无限消耗 Token?
- 什么时候需要人工介入?
- 如何压缩上下文?
让 Agent 不会陷入死循环。
五、终点:AGI
AGI(Artificial General Intelligence 通用人工智能),目前 AGI 没有统一定义。
通常认为:它应该具备类似人类的通用能力:
- 学习新任务
- 解决未知问题
- 跨领域迁移
现在的大模型更像:
很多领域都非常优秀的超级实习生。
但距离真正能够长期自主学习、适应现实世界的智能系统,还有很长距离。
写在最后
看完这些概念,你会发现 AI 领域这些新名词虽然越来越多,但背后的核心变化其实并没有那么复杂。
过去,我们更多是在使用 AI: 提出问题,让模型生成答案。
而现在,AI 正在逐渐从一个“聊天工具”,变成一个能够理解任务、调用工具、处理信息、协助完成工作的智能助手。
对于开发者来说,未来重要的不只是会写 Prompt,也不只是会调用模型 API,而是理解模型的能力边界,并学会如何为 AI 设计更好的工作环境。
技术名词还会不断出现,但真正值得掌握的不是记住每一个缩写,而是理解它们解决了什么问题。
当你知道一个技术为什么出现,它自然就不再陌生。