很多人第一次做 AI 助手,都会有一个很自然的想法:
我已经把大模型 API 接上了,命令行里也能问答了。
那这是不是就算一个 AI Agent 了?
答案是:
还不算。
因为“能聊天”和“能行动”,中间还差了一整层能力。
这一篇不讲复杂框架,也不啃大段代码。我们用 8 张图,先把这个问题讲明白。
01|我接上 API 了,它已经会回答问题了
用户输入问题,Node.js 把问题发送给大模型 API,再把模型的回答打印到终端。
看到这里,很多人会觉得:
“这不就是 AI Agent 了吗?”
但其实,它现在只是一个会聊天的 AI 程序。
02|它现在到底会什么?
接上 API 后,模型已经能理解问题、生成回答、做基础推理,也能按照提示词输出内容。
但它仍然不能读取你的项目文件、修改代码、运行命令,也不能检查执行结果。
本质上还是:
用户问一句,模型答一句。
它有“大脑”,但还没有真正的“手”和“脚”。
03|为什么它还不算 Agent?
假设你对它说:
帮我修一下登录 Bug。
模型也许知道应该从哪里排查,但它看不到 login.ts、auth.ts 和 user.ts,更不能直接修改项目或运行测试。
所以,聪明不等于能动手。
它知道“应该做什么”,却还做不到“真的去做”。
04|真正的 Agent,多了一层什么?
真正的 Agent,不只有大模型,还需要一层 Harness:
- 大模型负责理解任务、推理分析、决定下一步。
- Harness 负责提供工具、执行操作、管理上下文和约束行为。
可以先记住这个核心公式:
AI Agent ≈ 大模型(大脑)+ Harness(控制系统)
也就是:大模型决定做什么,Harness 负责把它做出来。
05|Harness 到底在干什么?
比如模型判断下一步应该读取 README,它并不会自己打开文件,而是发起一次 Tool Call。
Harness 收到请求后,再调用对应工具:
read_file:读取文件edit_file:修改代码bash:执行命令
这些操作最终都会落到真实的项目和运行环境中。
模型负责想,Harness 负责调用工具并执行。
06|为什么第一篇还要从“接 API”开始?
因为后面的所有复杂能力,都建立在这条最小链路上:
用户输入 →
main.ts→chat.ts→ 大模型 → 终端输出
其中:
config.ts负责读取模型配置chat.ts负责请求大模型main.ts负责接收用户输入
虽然这一步还不算完整 Agent,但它是整个系统的地基。工具、Agent Loop、记忆和 Plan Mode,都会从这里逐步长出来。
07|所以现在这个东西更像什么?
现在的程序更像一个 CLI Chatbot:
用户提问 → 大模型回答
而真正的 Agent 还会通过工具系统接触项目和环境,并持续完成:
观察 → 行动 → 检查结果 → 继续执行
所以更准确的说法不是:
“我已经做完一个 Agent 了。”
而是:
“我已经做出了一个最小可用的 AI 命令行助手。”
08|这一篇你真正要记住什么?
这一篇只需要记住三点:
- 接上 API,不等于做完 Agent。
- 大模型负责思考,Harness 负责行动。
- 第一步先让它能说话,下一步再让它能动手。
如果只记住一句话,那就是:
一个只会回答问题的模型程序,还不是完整的 AI Agent。
真正的 Agent,需要开始接触真实环境,并通过工具完成任务。
下一篇
图解 AI Agent ②:模型到底是怎么读取文件的?
模型并不会自己打开 README,它只是申请调用一个工具:
read_file
这篇图解先帮你建立对 AI Agent 的整体认识。
下一篇,我们就给这个“大脑”装上第一只“手”,让它第一次真正看到你的项目文件。
如果你想继续用真实代码把这些能力做出来,可以接着看 《不用框架,手搓 AI Agent》系列我们会从接入模型 API 开始,逐步实现文件读取、Agent Loop、工具系统、记忆和 Plan Mode。
图解系列负责让你看懂,实战系列负责带你做出来。