图解 AI Agent ①:大模型接上 API,为什么还不算 Agent?

9 阅读4分钟

很多人第一次做 AI 助手,都会有一个很自然的想法:

我已经把大模型 API 接上了,命令行里也能问答了。
那这是不是就算一个 AI Agent 了?

答案是:

还不算。

因为“能聊天”和“能行动”,中间还差了一整层能力。

这一篇不讲复杂框架,也不啃大段代码。我们用 8 张图,先把这个问题讲明白。


01|我接上 API 了,它已经会回答问题了

我接上 API 了,它已经会回答问题了

用户输入问题,Node.js 把问题发送给大模型 API,再把模型的回答打印到终端。

看到这里,很多人会觉得:

“这不就是 AI Agent 了吗?”

但其实,它现在只是一个会聊天的 AI 程序


02|它现在到底会什么?

接上 API 后得到的是一个会说话的系统

接上 API 后,模型已经能理解问题、生成回答、做基础推理,也能按照提示词输出内容。

但它仍然不能读取你的项目文件、修改代码、运行命令,也不能检查执行结果。

本质上还是:

用户问一句,模型答一句。

它有“大脑”,但还没有真正的“手”和“脚”。


03|为什么它还不算 Agent?

模型还碰不到真实世界

假设你对它说:

帮我修一下登录 Bug。

模型也许知道应该从哪里排查,但它看不到 login.tsauth.tsuser.ts,更不能直接修改项目或运行测试。

所以,聪明不等于能动手

它知道“应该做什么”,却还做不到“真的去做”。


04|真正的 Agent,多了一层什么?

AI Agent 等于大模型加 Harness

真正的 Agent,不只有大模型,还需要一层 Harness

  • 大模型负责理解任务、推理分析、决定下一步。
  • Harness 负责提供工具、执行操作、管理上下文和约束行为。

可以先记住这个核心公式:

AI Agent ≈ 大模型(大脑)+ Harness(控制系统)

也就是:大模型决定做什么,Harness 负责把它做出来。


05|Harness 到底在干什么?

Harness 通过工具让模型接触真实项目

比如模型判断下一步应该读取 README,它并不会自己打开文件,而是发起一次 Tool Call。

Harness 收到请求后,再调用对应工具:

  • read_file:读取文件
  • edit_file:修改代码
  • bash:执行命令

这些操作最终都会落到真实的项目和运行环境中。

模型负责想,Harness 负责调用工具并执行。


06|为什么第一篇还要从“接 API”开始?

所有复杂能力都从最小链路长出来

因为后面的所有复杂能力,都建立在这条最小链路上:

用户输入 → main.tschat.ts → 大模型 → 终端输出

其中:

  • config.ts 负责读取模型配置
  • chat.ts 负责请求大模型
  • main.ts 负责接收用户输入

虽然这一步还不算完整 Agent,但它是整个系统的地基。工具、Agent Loop、记忆和 Plan Mode,都会从这里逐步长出来。


07|所以现在这个东西更像什么?

CLI Chatbot 和真正 Agent 的对比

现在的程序更像一个 CLI Chatbot

用户提问 → 大模型回答

而真正的 Agent 还会通过工具系统接触项目和环境,并持续完成:

观察 → 行动 → 检查结果 → 继续执行

所以更准确的说法不是:

“我已经做完一个 Agent 了。”

而是:

“我已经做出了一个最小可用的 AI 命令行助手。”


08|这一篇你真正要记住什么?

本篇总结

这一篇只需要记住三点:

  1. 接上 API,不等于做完 Agent。
  2. 大模型负责思考,Harness 负责行动。
  3. 第一步先让它能说话,下一步再让它能动手。

如果只记住一句话,那就是:

一个只会回答问题的模型程序,还不是完整的 AI Agent。

真正的 Agent,需要开始接触真实环境,并通过工具完成任务。


下一篇

图解 AI Agent ②:模型到底是怎么读取文件的?

模型并不会自己打开 README,它只是申请调用一个工具:

read_file

这篇图解先帮你建立对 AI Agent 的整体认识。

下一篇,我们就给这个“大脑”装上第一只“手”,让它第一次真正看到你的项目文件。


如果你想继续用真实代码把这些能力做出来,可以接着看 《不用框架,手搓 AI Agent》系列我们会从接入模型 API 开始,逐步实现文件读取、Agent Loop、工具系统、记忆和 Plan Mode。

图解系列负责让你看懂,实战系列负责带你做出来。