从 0 拆解:一个实用 Agent 的五层能力架构是怎么长出来的

11 阅读5分钟

一、为什么大多数 Agent 项目会烂尾

很多团队做 Agent 的顺序是反的:先接一个对话框,再往里塞工具,做到一半发现上下文记不住、任务越跑越偏、出错后无法恢复,最后只能推倒重来。问题不在模型,而在架构。前 OpenAI 研究人员 Lilian Weng 在《LLM Powered Autonomous Agents》中早已给出参考答案:一个完整的 Agent 由规划、记忆、工具、执行四大模块构成,缺任何一块,系统都只是"会聊天的壳"。本文按笔者从 0 到 1 落地的真实顺序,把实用 Agent 拆成五层能力架构,逐层说明每层的工程目标和踩坑点,每一条结论都有明确的技术出处,不掺想象。

二、第一层:规划层,先定节奏再动手

规划层解决的是"把大任务拆成可执行的小步骤"。主流两种模式:ReAct 模式让模型在"思考、行动、观察"的循环里逐步推进,适合路径不明确的探索型任务;Plan-and-Execute 模式先一次性产出完整计划再逐步执行,适合流程明确的任务。2026 年 2 月发表于 ACM Computing Surveys 的综述把函数调用的实现拆为准备、执行、处理三个阶段,每个阶段都有独立的工程挑战,这印证了一个工程结论:把"判断要不要调工具、怎么调"的元认知交给固定流程,比让模型自由发挥稳定得多。踩坑点:任务越明确,越要压缩模型的自由度,先规划后执行的错误率明显低于边想边做,这一点在多步任务里尤其明显。

三、第二层:工具层,用 MCP 结束适配器地狱

在 MCP 出现之前,工具接入是 N 乘 M 的灾难:N 个 Agent 框架对 M 个工具,理论上要写 N 乘 M 个适配器,每个模型厂商的函数调用格式还各不相同。Model Context Protocol 由 Anthropic 于 2024 年 11 月推出,采用宿主、客户端、服务端三层架构,基于 JSON-RPC 通信,把工具、资源、提示词模板三类能力标准化,接入成本从 N 乘 M 降到 N 加 M,工具一次封装即可被所有兼容客户端复用,因此被业内称为 AI 的 USB-C 接口。到 2026 年,Claude Desktop、Cursor、VS Code Copilot 等主流客户端均已原生兼容,MCP 已经从可选项变成事实标准,且该协议现已交由 Linux 基金会管理,中立性有保障。工程建议:所有新工具一律走 MCP 接入,不要再写私有适配层;本地私有化部署用 stdio 传输,数据不出本机,云端托管用 Streamable HTTP,两条路线官方规范都有明确约定。

四、第三层:记忆层,检索式记忆优于塞窗口

记忆层分两半:短期记忆靠上下文管理,手段是滑动窗口和摘要压缩;长期记忆靠外部存储,主流方案是向量库配合 RAG 检索,复杂场景升级为知识图谱。关键结论是:不要试图把全部历史对话塞进上下文窗口,窗口塞满会导致遗忘和幻觉,而检索式记忆按需取用,在长任务里明显更稳。2026 年业界的共识是 Agent 与 RAG 正在"双向奔赴":不再是固定流程里机械地插一次检索,而是由 Agent 决定何时检索、检索什么、结果不够时换策略重查,这就是 Agentic RAG,它把检索从工具升级成了智能体的内建能力。

五、第四层:协作层,先榨干单 Agent 再拆多 Agent

多智能体系统在 2025 年后成为主流形态,价值有三:突破单个上下文窗口的容量限制;角色专精化,让"专才"在特定任务上胜过"通才";多智能体辩论与投票机制可以交叉验证、显著降低幻觉。框架层面,LangGraph 用图结构加状态机实现"思考、执行、观察、再思考"的循环编排,原生支持人机协同断点、状态检查点与断点续传,是目前定制化能力最强的选择之一。踩坑点:不要为了架构而架构,单 Agent 能解决的任务硬拆成多 Agent,只会引入通信开销和状态同步的新故障点,拆分的依据是能力边界,不是人数。

六、第五层:进化层,让 Agent 从失败里长出经验

Reflexion 反思模式让 Agent 在任务失败后生成语言化的反思,沉淀为下次执行的参考。工程化做法是把复盘变成固定机制:每完成一个任务,自动抽取踩坑点和成功路径,写入可复用技能库,下次遇到同类任务先检索技能库再动手,等于给规划层加了一层"前车之鉴"。长期记忆加技能沉淀的组合,是 Agent 从"每次从零开始"走向"越用越强"的分水岭,这一层做好后,错误率会随任务量增长持续下降。

七、小结

五层自下而上生长:工具层用 MCP 打底,规划层定节奏,记忆层保状态,协作层扩规模,进化层提质量。每层都有明确的技术出处:四要素架构来自 Lilian Weng,工具标准来自 MCP 官方规范,编排模式来自 ReAct 与 Reflexion 论文及 LangGraph 实践。笔者在用 AiPy 实际落地这套架构的过程中逐层验证了上述取舍,结论可直接复用到你自己的项目里,欢迎评论区交流你的分层方式。