图解 AI Agent ①:大模型接上 API,为什么还不算 Agent?

1,460 阅读6分钟

大模型 API 与 AI Agent 之间还缺少 Harness 和工具系统

图:从“会回答”走到“会行动”,中间还缺一层负责工具调用与执行的 Harness。

很多人第一次做 AI 助手,都会有一个很自然的想法:

我已经把大模型 API 接上了,命令行里也能问答了。
那这是不是就算一个 AI Agent 了?

答案是:

还不算。

因为“能聊天”和“能行动”,中间还差了一整层能力。

这一篇不讲复杂框架,也不啃大段代码。下面用 8 张讲解图,先把这个问题讲明白。


01|我接上 API 了,它已经会回答问题了

应用程序通过大模型 API 完成最小问答链路

用户输入问题,应用程序把问题发送给大模型 API,再把回答输出到终端。

这条链路已经能完成问答,但能力也到这里为止:程序负责传递输入和展示输出,还没有开始操作真实环境。


02|它现在到底会什么?

接上 API 后得到的是一个会说话的系统

接上 API 后,大模型可以理解问题、生成回答、做基础推理,也能按照提示词输出内容。

但当前程序还没有为它提供文件工具、命令执行能力和结果反馈机制。它完成的是一次“输入 → 输出”,还不能读取项目、修改代码或验证结果。


03|为什么它还不算 Agent?

模型还碰不到真实世界

假设你对它说:

帮我修一下登录 Bug。

模型也许知道应该如何排查,但当前程序没有把 login.ts、auth.ts、user.ts 和测试环境暴露给它。于是,它既看不到文件,也不能修改代码或运行测试。

这里要注意,限制模型的不是“智力”,而是当前程序还没有给它接入工具、权限和结果反馈机制。

所以,聪明不等于能动手。模型知道“应该做什么”,系统却还缺少把想法落地的能力。


04|真正的 Agent,多了一层什么?

AI Agent 等于大模型加 Harness

真正的 Agent,不只有大模型,还需要一层 Harness:

  • 大模型负责理解任务、推理分析、决定下一步。
  • Harness 负责提供工具、执行操作、管理上下文和约束行为。

可以先记住这个核心公式:

AI Agent ≈ 大模型(大脑)+ Harness(控制系统)

也就是:大模型决定做什么,Harness 负责把它做出来。


05|Harness 到底在干什么?

Harness 通过工具让模型接触真实项目

比如模型判断下一步应该读取 README,它并不会自己打开文件,而是发起一次 Tool Call。

Harness 收到请求后,再调用对应工具,例如:

  • read_file:读取文件
  • edit_file:修改代码
  • bash:执行命令

这些操作最终都会落到真实的项目和运行环境中。

模型负责想,Harness 负责调用工具并执行。


06|Agent 的能力是怎么一步步补齐的?

Agent 能力从最小问答逐层补齐

一个 Agent 不是突然出现的,而是在最小问答链路上逐层增加能力。

最小问答 → 工具与权限 → 结果反馈 → Agent Loop → 记忆与计划

先让模型能够接收问题并生成回答,再加入工具和权限,让它接触真实环境。接着把执行结果返回给模型,形成“观察 → 行动 → 检查 → 继续”的循环。

记忆和 Plan Mode,都是建立在这条执行闭环之上的增强能力。


07|所以现在这个东西更像什么?

CLI Chatbot 和真正 Agent 的对比

现在的程序更像一个 CLI Chatbot:

用户提问 → 大模型回答

而真正的 Agent 还会通过工具系统接触项目和环境,并持续完成:

观察 → 行动 → 检查结果 → 继续执行

所以更准确的说法不是:

“我已经做完一个 Agent 了。”

而是:

“我已经做出了一个最小可用的 AI 命令行助手。”


08|这一篇你真正要记住什么?

本篇总结

这一篇只需要记住三点:

  1. 接上 API,不等于做完 Agent。
  2. 大模型负责思考,Harness 负责行动。
  3. 第一步先让它能说话,下一步再让它能动手。

如果只记住一句话,那就是:

一个只会回答问题的模型程序,还不是完整的 AI Agent。

真正的 Agent,需要开始接触真实环境,并通过工具完成任务。


下一篇

图解 AI Agent ②:模型到底是怎么读取文件的?

模型并不会自己打开 README,它只是申请调用一个工具:

read_file

这篇图解先帮你建立对 AI Agent 的整体认识。

下一篇,我们就给这个“大脑”装上第一只“手”,让它第一次真正看到你的项目文件。


对应实战

如果你想把上面的概念映射到真实代码,可以继续看 《不用框架,手搓 AI Agent》系列的

不用框架,手搓 AI Agent:(一) 先让它跑起来

在实战项目里,main.ts 负责接收输入,chat.ts 负责请求模型,config.ts 负责读取配置;后续再逐步加入文件工具、Agent Loop、记忆和 Plan Mode。

图解系列负责建立心智模型,实战系列负责把它落到代码。