图:从“会回答”走到“会行动”,中间还缺一层负责工具调用与执行的 Harness。
很多人第一次做 AI 助手,都会有一个很自然的想法:
我已经把大模型 API 接上了,命令行里也能问答了。
那这是不是就算一个 AI Agent 了?
答案是:
还不算。
因为“能聊天”和“能行动”,中间还差了一整层能力。
这一篇不讲复杂框架,也不啃大段代码。下面用 8 张讲解图,先把这个问题讲明白。
01|我接上 API 了,它已经会回答问题了
用户输入问题,应用程序把问题发送给大模型 API,再把回答输出到终端。
这条链路已经能完成问答,但能力也到这里为止:程序负责传递输入和展示输出,还没有开始操作真实环境。
02|它现在到底会什么?
接上 API 后,大模型可以理解问题、生成回答、做基础推理,也能按照提示词输出内容。
但当前程序还没有为它提供文件工具、命令执行能力和结果反馈机制。它完成的是一次“输入 → 输出”,还不能读取项目、修改代码或验证结果。
03|为什么它还不算 Agent?
假设你对它说:
帮我修一下登录 Bug。
模型也许知道应该如何排查,但当前程序没有把 login.ts、auth.ts、user.ts 和测试环境暴露给它。于是,它既看不到文件,也不能修改代码或运行测试。
这里要注意,限制模型的不是“智力”,而是当前程序还没有给它接入工具、权限和结果反馈机制。
所以,聪明不等于能动手。模型知道“应该做什么”,系统却还缺少把想法落地的能力。
04|真正的 Agent,多了一层什么?
真正的 Agent,不只有大模型,还需要一层 Harness:
- 大模型负责理解任务、推理分析、决定下一步。
- Harness 负责提供工具、执行操作、管理上下文和约束行为。
可以先记住这个核心公式:
AI Agent ≈ 大模型(大脑)+ Harness(控制系统)
也就是:大模型决定做什么,Harness 负责把它做出来。
05|Harness 到底在干什么?
比如模型判断下一步应该读取 README,它并不会自己打开文件,而是发起一次 Tool Call。
Harness 收到请求后,再调用对应工具,例如:
read_file:读取文件edit_file:修改代码bash:执行命令
这些操作最终都会落到真实的项目和运行环境中。
模型负责想,Harness 负责调用工具并执行。
06|Agent 的能力是怎么一步步补齐的?
一个 Agent 不是突然出现的,而是在最小问答链路上逐层增加能力。
最小问答 → 工具与权限 → 结果反馈 → Agent Loop → 记忆与计划
先让模型能够接收问题并生成回答,再加入工具和权限,让它接触真实环境。接着把执行结果返回给模型,形成“观察 → 行动 → 检查 → 继续”的循环。
记忆和 Plan Mode,都是建立在这条执行闭环之上的增强能力。
07|所以现在这个东西更像什么?
现在的程序更像一个 CLI Chatbot:
用户提问 → 大模型回答
而真正的 Agent 还会通过工具系统接触项目和环境,并持续完成:
观察 → 行动 → 检查结果 → 继续执行
所以更准确的说法不是:
“我已经做完一个 Agent 了。”
而是:
“我已经做出了一个最小可用的 AI 命令行助手。”
08|这一篇你真正要记住什么?
这一篇只需要记住三点:
- 接上 API,不等于做完 Agent。
- 大模型负责思考,Harness 负责行动。
- 第一步先让它能说话,下一步再让它能动手。
如果只记住一句话,那就是:
一个只会回答问题的模型程序,还不是完整的 AI Agent。
真正的 Agent,需要开始接触真实环境,并通过工具完成任务。
下一篇
图解 AI Agent ②:模型到底是怎么读取文件的?
模型并不会自己打开 README,它只是申请调用一个工具:
read_file
这篇图解先帮你建立对 AI Agent 的整体认识。
下一篇,我们就给这个“大脑”装上第一只“手”,让它第一次真正看到你的项目文件。
对应实战
如果你想把上面的概念映射到真实代码,可以继续看 《不用框架,手搓 AI Agent》系列的
在实战项目里,main.ts 负责接收输入,chat.ts 负责请求模型,config.ts 负责读取配置;后续再逐步加入文件工具、Agent Loop、记忆和 Plan Mode。
图解系列负责建立心智模型,实战系列负责把它落到代码。