大语言模型智能体中的外部化(Harness):记忆、技能、协议与框架工程的统一综述
Externalization in LLM Agents: A Unified Review of Memory, Skills, Protocols and Harness Engineering
作者: Chenyu Zhou¹, Huacan Chai¹,, Wenteng Chen¹,, Zihan Guo²,³,, Rong Shan¹,, Yuanyi Song¹,, Tianyi Xu¹,, Yingxuan Yang¹,, Aofan Yu¹,, Weiming Zhang¹,, Congming Zheng¹,, Jiachen Zhu¹,*, Zeyu Zheng⁴, Zhuosheng Zhang¹, Xingyu Lou⁵, Changwang Zhang⁵, Zhihui Fu⁵, Jun Wang⁵,†, Weiwen Liu¹,†, Jianghao Lin¹,†, Weinan Zhang¹,³,† ¹上海交通大学,²中山大学,³上海创新研究院,⁴卡内基梅隆大学,⁵OPPO
*同等贡献,†通讯作者
摘要
大语言模型(LLM)智能体的构建越来越不再依赖于改变模型权重,而是通过重组围绕模型的运行时来实现。早期系统期望模型内部恢复的能力,如今被外部化到记忆存储、可复用技能、交互协议,以及使这些模块在实践中可靠运行的外围框架中。
Large language model (LLM) agents are increasingly built less by changing model weights than by reorganizing the runtime around them. Capabilities that earlier systems expected the model to recover internally are now externalized into memory stores, reusable skills, interaction protocols, and the surrounding harness that makes these modules reliable in practice.
本文从外部化的视角对这一转变进行了综述。 This paper reviews that shift through the lens of externalization.
借鉴认知人工制品的概念,我们论证了智能体基础设施之所以重要,并非仅仅因为它增加了辅助组件(auxiliary components) ,而是因为它将困难的认知负担转化为模型能够更可靠解决的形式。在这一视角下,记忆跨时间外部化状态,技能外部化程序性专业知识,协议外部化交互结构,而框架工程(harness engineering )则作为统一层,将它们协调为受治理的执行。
Drawing on the idea of cognitive artifacts, we argue that agent infrastructure matters not merely because it adds auxiliary components, but because it transforms hard cognitive burdens into forms that the model can solve more reliably. Under this view, memory externalizes state across time, skills externalize procedural expertise, protocols externalize interaction structure, and harness engineering serves as the unification layer that coordinates them into governed execution.
我们追溯了从权重到上下文再到框架的历史演进,分析了记忆、技能和协议作为三种不同但耦合的外部化形式,并考察了它们在更大智能体系统内部的交互方式。我们进一步讨论了参数化能力与外部化能力之间的权衡,识别了自演化框架和共享智能体基础设施等新兴方向,并讨论了评估、治理以及模型与外部基础设施长期共同演化中的开放挑战。本文的成果是一个系统级框架,用于解释为何实用的智能体进展越来越不仅依赖于更强的模型,更依赖于更好的外部认知基础设施。
We trace a historical progression from weights to context to harness, analyze memory, skills, and protocols as three distinct but coupled forms of externalization, and examine how they interact inside a larger agent system. We further discuss the trade-off between parametric and externalized capability, identify emerging directions such as self-evolving harnesses and shared agent infrastructure, and discuss open challenges in evaluation, governance, and the long-term co-evolution of models and external infrastructure. The result is a systems-level framework for explaining why practical agent progress increasingly depends not only on stronger models, but on better external cognitive infrastructure.
通讯方式:{wwliu, linjianghao, wnzhang}@sjtu.edu.cn, junwang.lu@gmail.com 日期:2026年4月10日
1 引言
认知人工制品的力量来自其作为表征的功能。……认知人工制品并不改变人类的能力。它们改变的是任务本身。 —— Donald A. Norman
The power of the cognitive artifact comes from its function as a representation. ... Cognitive artifacts do not change human capabilities. They change the task. — Donald A. Norman
图1:外部化作为LLM智能体设计的组织原则。
上层面板:人类认知外部化的弧线,从思维经语言、书写、印刷到数字计算。
中层面板:LLM智能体对应的外部化弧线,从权重经三个外部化维度——记忆(外部化状态)、技能(外部化专业知识)和协议(外部化交互)——到统一它们的框架。
下层面板:文献景观图,将代表性工作映射到三个能力层——权重、上下文和框架——展示研究脉络如何逐步向外迁移。两个弧线之间的平行关系编码了一个递归主张:LLM智能体通过与驱动人类认知史相同的表征维度来外部化认知负担,从而实现可靠的能动性。
人类文明的历史也可以被解读为一部认知外部化的历史。口语将私人思维转化为可共享的符号形式。书写将知识从脆弱的生物记忆转移到持久的物质记录中。印刷实现了社会规模的知识再生产机械化。数字计算将算术和符号操作从神经劳动重新安置到可编程机器中。在这些转变中,关键的变化不是人类在没有人工制品的情况下变得更无能。相反,人工制品通过将选定的负担向外转移,释放了有限的内部资源用于规划、抽象和创造,从而重组了认知系统 [Norman, 1993]。同样的向外委托模式如今在机器智能的前沿——大语言模型智能体的设计中再次重现。
这一视角在认知人工制品的概念中有自然的理论锚点 [Norman, 1991, 1993]。核心洞见是,外部辅助不仅仅是放大未改变的内部能力;它们往往改变了任务本身。购物清单并不扩展生物记忆容量,它将一个困难的回忆问题转化为一个识别问题。地图不仅仅是让导航"更强",它将隐藏的空间关系转化为可见的结构。人工制品的力量因此在于表征转化:它重构问题,使智能体能够用它已有的能力更可靠地解决它 [Norman, 1991]。
我们认为,同样的逻辑如今支配着基于LLM的智能体中最重要的设计选择。我们的中心论点是:外部化——即认知负担从模型内部计算向持久的、可检视的、可复用的外部结构的渐进式迁移——是统一记忆、技能、协议和框架工程近期进展的过渡逻辑——它解释了每次架构转变 —— 为何发生以及它试图保持何种可靠性的机制。这不仅仅是关于工程便利性的主张,而是关于可靠能动性从何而来的主张:不仅来自更大的模型,更来自对任务需求的系统性重构,使内部能力与外部基础设施共同覆盖所需能力的完整范围 [Norman, 1991, Sumers et al., 2024]。
图1总结了这一论证。上层面板追踪了熟悉的人类认知外部化弧线;中层面板呈现了LLM智能体对应的弧线,从权重经三个外部化维度——记忆、技能和协议——到统一它们的框架;下层面板将由此产生的文献景观映射到三个能力层——权重、上下文和框架。
图3从架构概览的角度补充了这一视角,展示了框架位于中心,三个外部化维度及其操作要素围绕其运行。记忆跨时间外部化状态,技能外部化程序性专业知识,协议外部化交互结构。两个弧线之间的平行关系编码了一个递归主张:LLM智能体本身就是运行在最新一次重大人类外部化——数字计算——内部的人工制品。共同机制是Norman意义上的表征转化 [Norman, 1991]:回忆变为识别,即兴生成变为组合,临时协调变为结构化契约。 这一视角对于理解当前实践特别具有启发性。当代进展常被叙述为更大模型、更好训练程序或更复杂推理轨迹的竞赛。这些因素很重要,但它们并不能完全解释实际系统中观察到的模式。许多最大的可靠性提升并不来自改变基础模型,而是来自改变模型周围的环境:添加持久记忆、组织可复用技能、标准化工具接口、约束执行、仪表化行为,以及通过显式控制逻辑路由工作 [Sumers et al., 2024, Wang et al., 2024a, Li, 2025, Luo et al., 2025]。在实践中,问题越来越不仅仅是"模型有多强?"而是"哪些负担已被外部化,使模型不再需要每次都在内部解决它们?" 一个没有外部辅助的LLM仍面临三种反复出现的不匹配,它们直接映射到三个框架维度。其上下文窗口有限,会话记忆薄弱或缺失,造成了记忆外部化所解决的连续性问题。长时序多步程序往往被重新推导而非一致执行,造成了技能外部化所解决的方差问题。与外部工具、服务和协作者的交互在仅靠自由格式提示时仍然脆弱,造成了协议外部化所解决的协调问题 [Sumers et al., 2024, Packer et al., 2023]。外部化之所以重要,是因为它将这些负担中的每一个转化为模型可以更可靠处理的形式。 一个具体例子有助于固定直觉。考虑一个被要求在大型代码库中实现功能、运行测试并提交拉取请求的软件工程智能体。没有外部化时,模型必须在脆弱的提示中保持代码库结构、项目约定、工作流状态和工具交互。有外部化时,持久的项目记忆提供上下文,可复用的技能文档编码约定和工作流,协议化的工具接口强制正确的模式,框架则排序步骤、验证输出并管理失败。基础模型可以保持不变;改变的是模型被要求解决的任务的表征。 这一更广泛的视角也与分布式和扩展认知的直觉一致:一旦记忆、引导行动和协调交互的关键部分被委托给外部结构,智能就不再仅局限于模型 [Clark and Chalmers, 1998]。我们借鉴这一传统的核心工程洞见——即"智能体"与"环境"之间的边界是一种具有实际性能后果的设计选择——而非承诺其更强的本体论主张。我们的关注是务实的:我们将外部化视为一种设计原则,其价值由由此产生的系统的可靠性、可组合性和可治理性来衡量。 现在我们转向构成框架的三个外部化维度,每个维度对应图1(中层面板)中强调的表征转化之一: 记忆系统跨时间外部化状态。 记忆系统不再依赖上下文窗口作为历史的唯一载体,而是允许累积的知识——用户偏好、先前轨迹、解决的歧义、领域事实——超越任何单次会话持久化,并在相关时被选择性检索。核心转化是从回忆到识别:智能体不再需要从潜在权重中重新生成过去的知识;它从持久的、可搜索的存储中检索 [Lewis et al., 2020, Park et al., 2023, Packer et al., 2023, Chhikara et al., 2025, Xu et al., 2025b]。 技能系统外部化程序性专业知识。 技能系统不再依赖模型权重在每次调用时重新生成任务特定的技能,而是将程序、最佳实践和操作指南打包为可复用的人工制品。核心转化是从生成到组合:智能体从预验证的组件组装行为,而非每次从头即兴发挥 [OpenAI, 2023a, Schick et al., 2023, Wang et al., 2023a, Anthropic, 2025, 2026, Jiang et al., 2026b]。 协议外部化交互结构。 协议不再依赖与工具、服务和其他智能体的临时提示级协调,而是为发现、调用、委托和权限管理定义显式的机器可读契约。核心转化是从临时到结构化:模糊、脆弱的通信变为可互操作、可治理的交换 [Anthropic, 2024, Google Cloud, 2025a, Ehtesham et al., 2025c]。 框架是托管所有三个维度并提供编排逻辑、约束、可观测性和反馈回路的工程层,使外部化认知在实践中保持连贯。 它不是与记忆、技能和协议并列的第四种外部化。它是这些外部化形式运行和交互的运行时环境。 这些维度并非孤立演化。记忆扩展可能与技能加载竞争稀缺的上下文预算。协议标准化可以提升互操作性,同时约束能力的打包和调用方式。技能执行生成的轨迹随后成为记忆,而记忆检索可以影响接下来选择哪些技能和协议路径。框架必须调解所有这些交互。我们在此预览这些系统级耦合,并在第7节详细分析。 这些方向各自已发展出庞大的技术生态系统。记忆研究已从简单的检索增强发展到更具选择性和分层架构的记忆系统 [Lewis et al., 2020, Packer et al., 2023, Chhikara et al., 2025, Xu et al., 2025b]。技能相关工作已从窄域函数调用和工具学习扩展到可复用的能力包、注册表和渐进式披露机制 [OpenAI, 2023a, Schick et al., 2023, Wang et al., 2023a, Anthropic, 2025, 2026, Jiang et al., 2026b]。协议工作已从自定义工具模式和框架特定的胶水代码走向更标准化的接口层,用于智能体-工具和智能体-智能体交互 [Anthropic, 2024, Google Cloud, 2025a, Ehtesham et al., 2025c]。现有综述照亮了这一图景的重要切面,包括检索增强生成 [Gao et al., 2024]、深度搜索 [Xie et al., 2025]、工具学习和使用 [Qu et al., 2024]、广泛的智能体架构 [Wang et al., 2024a, Li, 2025, Luo et al., 2025] 和协议互操作性 [Ehtesham et al., 2025c]。最接近的概念桥梁是CoALA [Sumers et al., 2024]。尚待充分发展的是关于为何这些发展正汇聚为外部化形式,以及这种汇聚如何重塑智能体定义的统一阐述。 我们的目标因此不是提供另一份孤立的组件级综述,也不是将智能体进展归结为某个特定框架。相反,我们提供一个围绕四个主张组织的系统级综述:
- 记忆系统跨时间外部化智能体的状态,并将长时序连续性转化为选择性检索。
- 技能系统外部化程序性专业知识,并将隐含的技能转化为显式的可复用操作指南。
- 协议外部化交互结构,并将模糊的通信转化为可互操作的、机器可读的契约。
- 框架工程将这些外部化模块统一为具有约束、可观测性、反馈回路和控制点的连贯运行时环境。 本文余下部分安排如下。第2节追溯从权重到上下文到框架的历史路径。第3至第5节分析记忆、技能和协议作为三种不同但互补的外部化形式。第6节将框架工程作为外部化智能体设计的综合学科进行阐述,第7节考察模块间的主要交叉交互。第8节讨论朝向更具适应性和自演化外部化形式的未来方向,第9节以对智能体研究的更广泛启示作结。
2 背景:从权重到上下文到框架(From Weights to Context to Harness)
图2:三个能力层的社区主题演进。 堆叠的层——权重、上下文和框架——展示了LLM智能体社区的重心如何随时间向外转移,从参数化知识和提示转向工具生态系统、协议、技能和多智能体编排等框架级基础设施。
LLM智能体的近期历史可以被理解为从模型本身向外的渐进运动。能力首先被视为权重的属性,然后是提示和上下文窗口的属性,如今越来越被视为模型运行其中的更广泛基础设施的属性。图2将这一轨迹可视化为三个堆叠层——权重、上下文和框架——从2022年到2026年的时间线展开,说明社区的研究主题如何随时间转移。图1的下层面板以文献景观补充了这一视角,将代表性工作映射到三个层。各阶段是叠加的而非互斥的——即使在最基础设施密集的系统中,权重仍然重要——但每个阶段都改变了开发者放置系统可变智能的位置,以及相应地投入大部分工程精力的位置。
2.1 能力在权重中
图2和图1中的权重层对应现代LLM部署的最早浪潮,在这一浪潮中,能力几乎完全与模型参数等同。在大规模语料上的预训练将广泛的统计规律、世界知识和潜在推理习惯压缩到权重中 [Brown et al., 2020, Chowdhery et al., 2023, Touvron et al., 2023]。缩放定律揭示了参数量、数据量和损失之间可预测的关系,强化了进展与模型规模直接挂钩的直觉 [Kaplan et al., 2020, Hoffmann et al., 2022]。当GPT-4 [OpenAI, 2023b]、Gemini [Gemini Team et al., 2023]、DeepSeek-V3 [DeepSeek-AI, 2025]和Qwen2.5 [Qwen Team, 2025]等系统展现出广泛的多任务能力时,该领域许多地方的主导叙事将更好的智能体等同于更大、训练更好的模型。监督微调和偏好优化随后通过教授指令遵循、对话风格、拒绝行为和领域特定约定,将这些模型塑造为更有用的助手 [Ouyang et al., 2022, Bai et al., 2022a];直接偏好优化通过消除对独立奖励模型的需求,进一步简化了这一对齐阶段 [Rafailov et al., 2023]。从这一视角看,改进很大程度上意味着修改或替换模型本身。 这一范式仍然是基础性的,且权重空间能力提供了几个优势:无需外部查找的快速推理、紧凑的部署,以及无需任务特定管道就能在许多任务上实现强泛化。同一个模型可以回答医学问题、写诗、调试程序或总结法律合同,而无需改变周围系统。对于单次、上下文自包含的任务,以权重为中心的视角通常是足够的。 然而,权重空间编码也将知识、程序和策略过于紧密地耦合到一个静态人工制品上。更新单个事实——比如某国现任国家元首——需要重新训练、知识编辑 [Meng et al., 2022, Mitchell et al., 2022, Yao et al., 2023b]或通过额外对齐层打补丁,所有这些都有对其他能力产生意外副作用的风险。审计模型为何以某种方式行为是困难的,因为相关知识分布在数十亿参数中,而非编码为可检视的模块 [Zhao et al., 2024]。个性化也很尴尬:一组权重要服务于数百万有不同历史、偏好和约束的用户,但在参数层面却没有机制来区分他们。 参数化知识的一个核心局限在于难以选择性更新、组合和治理。只要智能体局限于单轮问答,这些弱点往往是可以管理的。当系统进入长时序任务执行——状态累积、程序必须可靠遵循、多个工具必须协调——在权重内部模块化管理知识、技能和交互规则的困难性变得更加操作上突出。这一转变促使开发者将这些负担中的一部分迁移到下一层,而非仅依赖模型参数。
2.2 能力在上下文中
上下文层代表了注意力从模型修改转向输入设计的阶段。提示工程表明,在不触及权重的情况下可以大幅改变模型行为:少样本示例、角色描述、思维链分解和自洽性轨迹 (few-shot examples, role descriptions, chain-of-thought decomposition, and self-consistency traces )都改变了同一模型在相同底层任务上的表现 [Wei et al., 2022, Wang et al., 2023b, Kojima et al., 2022]。
更结构化推理的技术很快随之而来。
ReAct在单一生成循环中交错推理轨迹与工具行动,表明仅凭提示就能产生类智能体行为,而无需任何架构变更 [Yao et al., 2023a]。
思维之树将思维链推广为对中间推理状态的审慎搜索 [Yao et al., 2024]。
Self-Refine引入了迭代自批评,表明模型可以通过多轮提示循环改进自身输出 [Madaan et al., 2023]。
自动提示优化进一步减轻了手动负担,使用模型自身搜索提示空间 [Zhou et al., 2023, Pryzant et al., 2023]。
检索增强生成(RAG)通过在查询时动态注入外部文档到上下文中,引入了一种更系统化的外部化形式 [Lewis et al., 2020, Borgeaud et al., 2022, Ram et al., 2023, Gao et al., 2024]。注意力因此从模型内部化了什么转移到了围绕每次调用的信息管道。
Figure 3 Externalization architecture of a harnessed LLM agent. The Harness sits at the center; three externalization dimensions—Memory (working context, semantic knowledge, episodic experience, personalized memory), Skills (operational procedures, decision heuristics, normative constraints), and Protocols (agent–user, agent–agent, agent–
tools)—orbit around it. Operational elements such as sandboxing, observability, compression, evaluation, approval loops, and sub-agent orchestration mediate the interaction between the harness core and the externalized modules.
这一阶段使智能体设计变得大幅更灵活。开发者可以在运行时附加局部指令、领域知识、输出模式和检索到的证据,而无需任何梯度更新。上下文成为开发者为模型分阶段认知的媒介——一个工作面,在模型需要之前恰好组装好正确信息。在许多实际系统中,迭代提示和检索管道被证明比微调更便宜、更快速。模型可以保持冻结,而周围的提示模板、检索逻辑和工具规格则快速演化。
上下文中心的阶段也可以通过Norman的表征转化概念来解读。一个困难的回忆问题——"模型是否知道事实X?"——被转化为一个识别问题:"既然事实X已被放入上下文,模型能使用它吗?"这类似于人类外部化弧线中与书写相关的回忆转识别转变(图1,上层面板)。模型不需要记住答案;它只需要在提供相关段落时识别并应用它。在图2中,这一转变对应于上下文层中提示、RAG、思维链及相关技术的出现 [Zhang et al., 2024, Ram et al., 2023]。
上下文中心的设计也有重要约束。上下文窗口有限,在大规模时成本高昂,且当过载以边际相关的材料时往往变得嘈杂。长提示可能降低而非提升性能:"中间迷失"现象表明,模型对长输入的注意力不均匀,置于上下文中间的信息检索准确率急剧下降 [Liu et al., 2024a]。即使上下文长度已大幅扩展——从2K令牌到超过100K乃至更长 [Chen et al., 2023, Peng et al., 2024]——根本张力依然存在:更多容量并不消除选择性策展的需要。上下文也是短暂的:除非状态被显式外部化到其他地方,否则每个新会话都以部分遗忘开始。
随着系统变得更复杂,仅靠提示组装就可能成为脆弱和临时的控制机制。模型可以被给予更多指令,但这并不意味着系统知道如何跨会话持久化状态、调度多步工作流、在子智能体间协调、从部分失败中恢复,或随时间执行行为约束。 这些局限有助于解释下一步的外向转移。
2.3 能力通过基础设施
框架层——图2中的最上层和图1(下层面板)中的最右区域——代表了当前阶段,在这一阶段,能力扩展到提示管理之外,进入持久基础设施。随着上下文窗口饱和、提示模板更加笨重,工程注意力越来越多地从"我们该告诉模型什么?"转向"模型应该在什么环境中运行?" 在成熟的智能体系统中,可靠性越来越依赖于外部记忆存储、工具注册表、协议定义、沙箱、子智能体编排、压缩管道、评估器、测试框架和审批回路 [Wang et al., 2024a, Li, 2025, Luo et al., 2025, Xi et al., 2023]。
这一转变的最早体现简单但具有启发性。Auto-GPT [Richards, 2023]和BabyAGI [Nakajima, 2023]等项目将LLM包装在带有任务队列、持久记忆和网络访问的循环中,表明即使最小的框架也能维持任何单个提示都无法实现的行为。更有原则的框架迅速跟上:AutoGen形式化了多智能体消息交换 [Wu et al., 2023],MetaGPT增加了基于角色的协作和显式程序 [Hong et al., 2023],CAMEL探索了用于任务分解的结构化对话 [Li et al., 2023],Reflexion跨片段持久化反馈 [Shinn et al., 2023]。在这些系统中,共同的动作是将负担从模型转移到周围结构。
同样的动作如今在各个部署领域可见。编码智能体将模型嵌入具有文件、shell、版本控制、测试和可复用技能人工制品的开发框架中;SWE-agent和OpenHands是代表性例子 [Yang et al., 2024a, Wang et al., 2024b]。研究和企业智能体添加了检索、审批、浏览和长时序编排管道,如DeepResearch风格的系统 [OpenAI, 2025b, Google, 2024]。具身和工作流系统如Voyager、LangGraph、CrewAI和OS-Copilot同样使控制流、环境访问和复用变得显式 [Wang et al., 2023a, LangChain, 2024, CrewAI, 2024, Wu et al., 2024]。反复出现的模式是,可靠性问题越来越多地通过改变环境而非仅靠提示来解决。
如图3所示,框架包含三大类外部化——记忆、技能和协议——对应框架吸收的三大类负担。记忆系统跨时间外部化状态,使连续性不再依赖短暂的上下文。技能系统外部化程序性专业知识,使复杂工作流被加载而非重新发明。协议外部化交互结构,使工具和智能体协调遵循受治理的契约而非临时提示。这些元素共同构成框架:包裹模型并将它面临任务转化为其内部能力可以更可靠处理的形式的持久基础设施。在这一框架下,"智能体工程"越来越采取"框架工程"的形式。
模型仍然是核心推理引擎,但它不再是智能的唯一位置 —— 能力分布在塑造模型所见、所记、所调和所允许做的事情的结构中。
2.4 外部化作为过渡逻辑
综合来看,从权重到上下文到框架的路径是Norman意义上的外部化故事 [Norman, 1991]:模型内部难以管理的负担被渐进地移入模型外部的显式人工制品中,模型看到的任务也相应地被转化。可变知识从权重移入检索系统和运行时上下文,将回忆转化为识别。可复用程序从隐含习惯移入显式技能,将即兴生成转化为结构化组合。交互规则从临时提示移入协议,将模糊协调转化为受治理契约。运行时可靠性则移入框架逻辑,其中约束、可观测性和反馈回路可以被显式化。
这种重新分配最好被理解为对不匹配的回应。LLM擅长对提供的信息进行灵活的综合和推理;它们在稳定的长期记忆、程序可重复性和与外部系统的受治理交互方面不太可靠。外部化因此围绕模型构建更大的认知系统而非替换它,这一视角与CoALA等认知架构阐述一致 [Sumers et al., 2024]。三个框架维度直接源于这一框架:
记忆解决跨时间的连续性,技能解决程序的一致性,协议解决交互的结构。
以下各节详细考察每一项。
3 外部化状态:记忆
记忆外部化解决了能动性的时间负担。一个裸语言模型必须在短暂的提示中承载连续性、先前经验、用户特定事实和部分完成的工作。一旦任务跨越会话、分支或中断,这一负担就变得既不稳定又昂贵。记忆将其外部化为可以在模型外写入、更新和检索的持久状态。 在框架化智能体中,记忆不仅仅是一个档案。它为可恢复的执行提供检查点,为技能蒸馏提供轨迹,为影响协议路由的统计数据提供来源,并为治理机制可以检视和约束的持久状态提供支撑。为使这一角色精确化,本节提出三个关联问题:记忆外部化了什么负担,设计空间如何演化,以及记忆如何与更广泛的框架耦合。第3.1节澄清了哪些类型的状态被外部化;第3.2节调研了主要架构选择;第3.3节转向框架化智能体系统施加的需求;第3.4节通过认知人工制品的视角解读记忆来结束本章。
3.1 外部化了什么:状态的内容
记忆的本质在于将智能体跨时间的状态与其短暂上下文解耦。相关内容并非框架中的所有外部人工制品,而是保持连续性的记录:当前任务状态、过去执行经验、抽象知识和持久的用户或环境上下文。
为在长时序交互中维持连贯行为,记忆系统必须根据其时间属性和检索需求对这些记录进行分类和管理。借鉴人类记忆的经典分类并适应LLM智能体,我们区分以下四个外部化状态维度:
工作上下文。 工作上下文是当前任务的实时中间状态:打开的文件、临时变量、活跃假设、部分计划和执行检查点。它变化迅速,如果过时就会失去价值,但如果不外部化,它在上下文窗口重置或进程中断时就会消失。编码智能体很好地说明了这一点。通过在提示之外物化草稿、终端状态和工作区人工制品,OpenHands和SWE风格智能体等系统可以从当前操作状态恢复,而非从零开始重建 [Wang et al., 2025a, Yang et al., 2024b]。
情景经验。 情景经验记录先前运行中发生的事情:决策点、工具调用、失败、结果和反思。其价值不仅仅是归档。检索到的情景可以作为具体先例,帮助智能体避免重复已知错误,并为后续抽象提供原材料。Reflexion通过将失败尝试的反思摘要存储为可复用经验,使这一模式显式化 [Shinn et al., 2023]。AriGraph进一步扩展了这一想法,将陌生环境中的局部交互轨迹视为情景记忆,从中可以构建更广泛的世界模型 [Anokhin et al., 2024]。
语义知识。 语义知识存储超出任何单一情景的抽象:领域事实、一般启发式、项目约定和稳定的世界知识。与情景记忆不同,它不围绕特定的时间和地点组织 [Li and Li, 2024, De Brigard et al., 2022]。区别不仅在于粒度,还在于功能。情景记忆说的是某个案例中发生了什么;语义记忆说的是跨案例中什么趋向于成立。在当前系统中,知识库和检索增强生成(RAG)语料库是外部化语义记忆的最常见形式。更长期的趋势更加雄心勃勃:智能体越来越试图从累积的轨迹中蒸馏语义指导,而非仅依赖静态的、人工编写的文档。
个性化记忆。 个性化记忆追踪关于特定用户、团队或环境的稳定信息:偏好、习惯、重复约束和先前交互。这一状态不应被折叠到智能体的一般自我改进存储中,因为用户特定的轨迹遵循不同的保留、检索和隐私规则 [Xie et al., 2024, Lin et al., 2025a]。最近的系统使这种分离显式化。IFRAgent从移动环境中的演示构建用户习惯库 [Wu et al., 2025];Web智能体使用外部化配置文件来推断隐含偏好 [Cai et al., 2025];对话系统如VARS在隔离的用户记忆空间中存储跨会话偏好卡 [Hao et al., 2026]。个性化记忆因此是让智能体随时间适应而不将长期用户建模与一般任务知识混淆的层。
这四层并不穷尽所有可能后来对智能体有用的东西。重复出现的程序性规律可能首先作为情景轨迹中的模式出现,但一旦框架将其提升为显式的可复用指导,它们就不再是记忆本身。在那一刻,它们属于技能层而非记忆层。
综合来看,这些层表明记忆外部化的不是单一的 homogeneous 数据库,而是多个抽象层次上的连续性时间负担。工作上下文支持即时恢复,情景记录支持反思和恢复,语义记忆支持抽象和迁移,个性化记忆支持跨会话对用户和环境的适应。框架必须区别对待这些存储,因为每个都改变了模型否则必须在内部恢复的部分的不同内容。
3.2 如何外部化:记忆架构
当这些层被外部化时,主要的设计问题变成主动推理与存储状态分离的激进程度。遵循Du [2026a]的分类,当前系统可以被解读为四大架构范式:单块上下文、带检索存储的上下文、分层记忆与编排,以及自适应记忆系统。这一进展不仅仅是朝向更大的存储,而是朝向更明确的策略来决定什么被写入、提升、检索、压缩或遗忘。
3.2.1 单块上下文
早期系统依赖单块上下文:所有相关历史或其摘要直接保留在提示中。这种设计透明且易于原型化,因为不需要单独的记忆服务,对于短任务可以出奇地有效。 其局限性是结构性的。容量扩展性差,摘要漂移,模型必须花费稀缺令牌既承载历史又解决当前步骤。最重要的是,状态随会话消失,因此智能体不积累持久经验。
3.2.2 带检索存储的上下文
主导的下一步是仅将近期工作状态保留在上下文中,而将更长时序的轨迹外部存储并按需检索。这种"上下文加检索存储"模式是大多数生产环境中记忆系统的基础,用于副驾驶、助手和编码智能体。它解决了原始容量问题,但将记忆质量转化为一个检索问题。如果检索到错误的记录,模型被分心;如果错过了正确的记录,系统表现得好像从未记住过一样。 最近的工作从几个方向攻击这一瓶颈。GraphRAG [Edge et al., 2024]添加了图结构和社区级检索,ENGRAM [Cheng et al., 2026]将记忆压缩为潜在状态表示,SYNAPSE [Zheng et al., 2023]使用扩散激活在统一的情景-语义图上恢复不太局部的相关性形式。这些方法在机制上有所不同,但共享同一个目标:用更匹配长时序推理的表征取代平坦的相似性搜索。
3.2.3 分层记忆与编排
一旦平坦检索证明不足,系统就转向分层记忆和编排。关键思想是并非每条轨迹都值得相同的保留策略或检索路径。Mem0 [Chhikara et al., 2025]、Memory-R1 [Yan et al., 2025b]和Mem-α [Wang et al., 2025b]等框架引入了提取、整合和遗忘的显式操作,将记忆转化为管理的生命周期而非被动的存储。两种设计倾向主导这一空间:
- 时空维度的资源解耦。 一个分支借鉴操作系统的逻辑,将记忆视为必须主动管理的受限资源。MemGPT [Packer et al., 2023]和MemoryOS [Kang et al., 2025]将热工作状态与较冷的长尾存储分离,并随任务需求变化在层间交换信息。收益是在固定上下文预算下的更高有效容量。
- 认知功能维度的语义解耦。 第二个分支按功能或内容类型组织记忆,使异构记录不全部通过同一通道路由。MemoryBank [Zhong et al., 2024]和MIRIX [Wang and Chen, 2025]分离事件、用户配置文件和世界知识;MemOS [Li et al., 2025]区分显式和隐式记忆;xMemory [Hu et al., 2026]构建主题-事件层次。目标不仅仅是整洁的分类,而是在复杂任务条件下实现更精确的检索。
3.2.4 自适应记忆系统
上述架构仍严重依赖人工设计的启发式。自适应记忆系统更进一步,使模块、路由决策或检索策略对经验做出响应。两个方向尤其可见:
- 动态模块。 一些系统在运行时适应架构本身。MemEvolve [Zhang et al., 2025a]将记忆生命周期分解为独立的编码、存储、检索和管理模块,可以在执行期间独立演化。MemVerse [Liu et al., 2025a]维护短期缓存和多模态知识图,同时定期将碎片化经验蒸馏为更抽象的知识和轻量级神经组件。
- 基于反馈的策略优化。 其他系统保持架构相对固定但学习更好的控制策略。MemRL [Zhang et al., 2026c]通过非参数强化学习更新检索行为。Zhang et al. [2025c]提出的自适应框架使用混合专家门控动态路由查询,GAM [Yan et al., 2025a]在多轮交互中细化检索条件。
在这些阶段中,主要转变是从存储到控制。单块上下文解决存在性,检索存储解决容量,分层系统解决组织,自适应系统开始解决策略。记忆因此不再是提示的被动附录。在成熟智能体中,它成为框架控制面的一部分,决定模型可以有效地基于什么过去行事。
3.3 框架时代的记忆需求
随着智能体演化进入框架时代,记忆系统不再仅仅是孤立的存储模块;相反,它们成为运行时协调连续性、程序复用和受治理交互的基底。问题不再仅是如何存储更多信息,而是如何使时间状态选择性地对规划、执行和恢复回路可读。
框架环境因此要求记忆系统显式地将状态与上下文分离。在具有极长时间范围的任务中,不受限制的会话历史累积可能导致模型失去对注意力机制的追踪。InfiAgent [Yu et al., 2026]等框架提出以文件为中心的状态抽象,主张将文件系统作为任务状态的唯一权威记录,其中一切——从高层规划到中间变量和工具输出——都必须实时写入。在每个决策步骤,智能体不再读取冗长的历史,而是读取工作区的策展快照和少量近期动作。这是记忆核心表征角色的框架级表达:不是在提示中保留所有历史,而是以模型可以行动的形式物化当前状态。
记忆还必须与技能系统集成,但两层扮演不同角色。记忆存储先前执行的证据:轨迹、结果、失败和用户或任务特定的上下文。技能仅在部分证据被提升为显式可复用程序时才开始。在相反方向,每次技能执行产生新的轨迹,必须写回记忆。记忆因此本身不是程序性指导;它是可以从中后续推导指导的证据基础。
协议耦合施加了进一步要求。工具结果、审批、委托事件和外部状态转换可能通过协议化接口到达,但它们只有在被规范化并写入持久状态后才成为记忆。反过来,记忆检索可能影响接下来应选择哪条协议路径。在成熟框架中,记忆和协议通过受治理的读/写循环连接,但它们在概念上保持区别:协议治理交换,而记忆治理跨时间的持久化。
最后,一旦多个智能体依赖共同的外部化状态,共享和治理机制就变得必不可少。为记忆建立读/写权限、解决存储事实间的冲突、控制每个智能体对共享知识的访问配额——所有这些都需要与操作系统相当的低级控制能力。框架时代的记忆因此最好被理解为受管理的状态基础设施:它外部化时间负担,重塑模型必须在内部记住的内容,并提供框架其余部分运行其上的持久基底。
3.4 记忆作为认知人工制品(Artifact)
前面各节调研了记忆系统的内容、架构和框架集成。本最后部分退后一步,解读记忆外部化作为表征转化所实现的成就,借鉴Norman的认知人工制品理论 [Norman, 1993]和Kirsh的互补策略阐述 [Kirsh, 1995]。
现代LLM是无状态生成器:每次调用以全新的上下文开始,因此连续性必须被重建而非向前传递。在短交互中,这一局限可以隐藏在提示内部。在长时序工作中,它变成结构性的。过去的尝试、部分完成的工作、用户特定的事实和环境状态不能全部无代价地保持在上下文中,否则会漂移和最终截断。有界模型面临的原始任务因此在原则上是不可行的:在保持对现在清晰推理的同时,保持一个实际上无界的历史可用。
记忆外部化改变了该任务的结构。用Norman的术语来说,表征转化将内部回忆问题转化为外部识别和检索问题。模型不再需要从其参数中恢复相关历史;它只需要识别和使用记忆系统已经浮现的策展历史片段。这类似于Norman对外部列表如何改变记忆本质的分析:关键点不是添加了额外信息,而是认知任务本身的形式被重组 [Norman, 1991]。同样的转变在第2.2节在上下文层面被识别;记忆将其扩展到任何单个上下文窗口都无法跨越的会话和时间范围。
这一解读澄清了为什么检索质量比原始存储容量更重要。一个拥有庞大存储但弱检索的系统仍然向模型呈现错误的问题表征:历史存在,但任务未被转化。相比之下,一个适度存储但具有强索引、摘要和上下文选择的系统可以显著简化下游推理。记忆的成功标准因此不是"我们保存了多少?"而是"我们是否使当前决策可读了?"
同样的视角也照亮了Kirsh的互补策略概念,根据该概念,智能体不仅通过内部更努力地思考来提升性能,还通过重新组织外部环境使部分认知工作被卸载到其中 [Kirsh, 1995]。记忆系统正是为时间维度实施了这一策略。框架外部化持久性、新鲜度管理和相关性过滤,而将解释和上下文判断留给模型。分工是互补的:每方处理其最擅长的任务部分。
认知人工制品视角还将常见失败模式解释为表征设计的失败而非单纯的实现错误。陈旧记忆通过提供过时的问题表征来误表当前。过度抽象的记忆丢失了当前决策所需的操作细节。欠抽象的记忆用噪声淹没提示,降低了外部化本应简化的识别任务本身。被污染或冲突的记忆通过在检索片段中嵌入错误前提来污染未来推理。在每种情况下,记忆系统的失败都不是因为它存储太少或太多,而是因为它未能将历史转化为可用的当下。
从这个角度看,记忆不仅仅是扩展有效上下文的工程便利。它是一种重塑能动性时间负担的认知人工制品。通过将无界回忆转化为有界的、策展的检索,它改变了模型在每个决策点面临的任务。这种转化将本节调研的架构进展——从单块上下文到自适应系统——与单一的底层设计目标联系起来:在正确的时刻使正确的历史可读,使模型的固定推理容量花在推理而非记忆上。
4 外部化专业知识:技能
技能外部化解决了能动性的程序性负担。一个语言模型可能在原则上知道如何解决一个任务,但可靠执行仍然需要在每次尝试任务时重建工作流、默认值和约束。这一负担随任务长度、环境特定性和分支决策数量增长,并表现为方差:遗漏步骤、不稳定工具使用和不一致的停止条件。
技能引入的表征转变因此是从重复合成到可复用程序。技能系统不要求模型在每次运行中从权重或临时提示重新生成任务特定的技能,而是将那种技能打包为可发现、可加载、可修订和可组合的显式人工制品。这主要不扩展智能体可用的动作集;它改变了模型在运行时面临的任务,从发明工作流到选择和遵循一个 [Xu and Yan, 2026b, Wang et al., 2026a]。
在框架化智能体中,技能位于记忆和行动之间。它们通常根据检索到的状态被选择,通过协议化接口绑定到工具和子智能体,并从执行轨迹和事后反思中更新。如第3节所讨论的,记忆外部化了随时间学到的东西;技能外部化了那种累积经验如何成为可复用的操作结构 [Sumers et al., 2024, Wu and Zhang, 2026]。本章因此聚焦于三个关联问题:技能外部化了什么负担,技能如何重组任务执行,以及它们如何在更大的框架中变得可操作。
图5:技能作为外部化专业知识。 该图追踪了技能通过三个阶段的完整生命周期——调用、选择和程序。技能获取展示了程序性技能进入系统的四条路径:由专家编写、从情景记忆和轨迹中蒸馏、通过环境探索和自我归纳发现,或从现有单元组合。技能人工制品将那种技能打包为操作程序、决策启发式和规范约束,伴随着声明能力、前置条件和范围的清单。激活管道通过语义抽象处理基于注册表的发现、从抽象摘要到完整指南的渐进式披露,以及将技能绑定到工具、API、文件、智能体和协议的组合。运行时展示了活动上下文和LLM如何执行所选技能,而边界条件——陈旧性、可移植性限制、上下文相关退化和不安全组合——约束可靠性。
4.1 外部化了什么:程序性专业知识 ( 领域知识 )
技能外部化关注的是程序性专业知识而非孤立的动作接口。此处的专业知识意味着在重复假设和约束下执行任务的可持续方式,而非模型"能"做某事的模糊声明。一个有用的边界由此定义得出:工具暴露操作,协议治理这些操作如何被描述和调用,技能编码一类任务应如何用它们执行。在实践中,这种专业知识有三个耦合的组成部分:操作程序、决策启发式和规范约束。它们共同定义了框架可以外部化的可复用技能单元。
4.1.1 操作程序
操作程序是任务骨架:将复杂工作分解为步骤、阶段、依赖和停止条件。它解决了LLM智能体中常见的失败模式。许多错误不来自动作层面的能力不足;它们来自过程层面的不稳定,如跳过步骤、顺序错误的操作或过早终止 [Hsiao et al., 2025, Nandi et al., 2026]。将程序外部化将那种脆弱的过程知识转化为显式的操作路径。
这种转变在LLM推理的更广泛演进中有深远根基。思维链使中间推理显式 [Wei et al., 2023];ReAct将推理与行动耦合 [Yao et al., 2023a];后来的提示链和编排系统将重复模式打包为工程化工作流。这些方法通常缺乏的是持久性。程序存在于当前运行中,但尚未作为可复用人工制品。技能系统通过将工作流结构转化为可存储、可修订和可重新应用的东西来弥合这一差距 [Ye et al., 2025]。
一旦程序被外部化,执行变得更少即兴。智能体可以在中断后恢复,跨上下文或协作者交接工作,并在不从头重建整个工作流的情况下恢复状态。这在长时序、多智能体和生产环境中最为重要,因为过程稳定性往往比瞬时的流利性更重要。
4.1.2 决策启发式
如果程序定义了执行的骨架,决策启发式则治理在分支处发生什么。真实任务很少作为固定管道展开。工具失败,观察是嘈杂的,多个局部合理的行动可能竞争。在这些条件下,良好性能依赖于从经验中衍生的实用经验法则,而非仅靠穷举搜索 [Gigerenzer and Gaissmaier, 2011]。 将那些启发式外部化改变了推理努力的分配。系统不迫使模型在每个交叉点重新发现局部策略,而是编码已经证明有用的默认选择、升级规则或偏好排序。这减少了审议成本,也使行为更稳定。 启发式因此不是次要的便利。它们是技能捕捉专家风格的主要方式之一:首先尝试什么,何时退却,什么证据足够,当多条路径仍然可行时偏好哪些权衡。
4.1.3 规范约束
第三个组成部分是规范约束:程序被视为可接受的条件。一个工作流可能在技术上有效但仍不合规、不安全或操作上错误。在实际部署中,执行受测试要求、范围限制、访问限制、可追溯性期望和领域特定操作规则的约束 [Chen et al., 2021, Bai et al., 2022b, Wei et al., 2023, Schick et al., 2023, Madaan et al., 2023]。
一旦外部化,那些约束不再仅仅是事后评估标准,而成为技能本身的一部分。它们可以塑造前置条件、阻止不安全分支、要求中间验证,或定义完成前必须产生的证据。这就是让技能不仅能编码如何执行任务,还能编码如何在组织性和安全性边界内执行任务的原因。在成熟系统中,技能因此既是能力的载体,也是治理的载体。
综合来看,操作程序提供结构,决策启发式提供局部策略,规范约束提供可接受边界。一个技能只有在三者都被充分指定以跨任务、上下文和运行存续时才可复用。这就是为什么技能位于动作接口之上、记忆之旁:它们外部化的不是过去的状态,也不是原始执行原语,而是可重复的任务技能。
4.2 从执行原语到能力包
技能系统并非孤立出现,但也不应与工具使用混淆。从历史上看,技能是两个早期发展的下游:可靠的动作调用和大规模的动作选择。那些阶段扩展了智能体能做什么,但尚未扩展一类任务应如何被重复执行。技能只在程序组织本身成为显式的可复用人工制品时才出现。
4.2.1 第一阶段:原子执行原语
第一阶段为语言模型配备可靠的动作执行,例如通过结构化工具调用和函数调用接口。Toolformer是代表性工作,表明模型可以学会何时调用工具、如何构造参数以及如何整合结果 [Schick et al., 2023]。这一阶段的关键成就是对原子动作单元的稳定访问。它不提供的是完成更广泛任务类的显式可复用程序。单元是动作原语,而非技能。
4.2.2 第二阶段:大规模原语选择
随着可调用工具数量的增长,问题从调用转向选择。Gorilla、ToolLLM、ToolNet、ToolScope和AutoTool等工作表明,模型可以在大型工具集合中检索、排序和动态选择 [Patil et al., 2023, Qin et al., 2023, Liu et al., 2024b, 2025b, Zou et al., 2025]。这是朝向可扩展动作选择的重大步骤,但单元仍然是工具而非程序。即使多步行为开始出现,完成一类任务的技能仍然很大程度上隐含在提示或参数中,而非外部化为有界的可复用人工制品。
4.2.3 第三阶段:技能作为打包的专业知识
第三阶段标志着抽象的进一步转变。核心问题不再是一个模型能否调用函数或检索适当的API,而是完成一类任务所需的技能是否可以打包为可复用的能力单元。在这一阶段,能力的基本单元不再是孤立的工具调用,而是以可复用程序指导和执行结构为中心的更高级人工制品 [Wang et al., 2025c, Chen et al., 2026b]。技能不仅指定什么可以做,而是越来越多地捕捉如何通过可复用的程序组织来执行任务 [Li et al., 2026c]。
最近的工作使这一转变越来越显式。基于程序的技能归纳将原始动作编译为更高级的可复用技能,表明智能体能力可以表示为可执行的过程抽象而非一次性调用 [Wang et al., 2025c]。在Web环境中,交互轨迹可以被蒸馏为可复用的技能库或技能API,使智能体能够跨任务积累和细化可迁移的技能 [Zheng et al., 2025a]。在计算机使用场景中,技能进一步组织为参数化执行和组合图,检索、参数实例化和失败恢复在技能层面而非单个界面动作层面操作 [Chen et al., 2026b]。SOP引导智能体的相关工作同样表明,领域专业知识可以作为指导执行的显式程序结构被外部化 [Ye et al., 2025]。
与早期阶段相比,这里的关键转变是表征性的而非仅操作性的。能力不再主要被视为对工具或API的访问,而是越来越多地被视为可加载、可复用和可跨任务组合的打包程序知识 [Li et al., 2026c, Xu and Yan, 2026b]。在这个意义上,第三阶段不仅使工具使用更复杂,而是反映了将智能体能力表示为外部化和可复用程序知识的转变。
4.3 技能如何被外部化
技能外部化不仅仅是写下指令。在成熟智能体系统中,关键问题是程序性专业知识是否能以在运行时可发现、可加载、可解释、可绑定和可执行的形式表示。因此,技能外部化涉及一个表征层和一个运行时层。前者决定技能如何被描述和界定,后者决定它是否能在任务执行期间真正作为可复用能力发挥作用 [Xu and Yan, 2026b]。
用框架术语来说,一个技能只有在运行时可以决定何时加载它、基于什么记忆来条件化它以及将它绑定到哪些工具、文件或子智能体时才真正实现。这种绑定要求不使技能等同于工具或协议;它仅意味着程序性专业知识最终必须基于可执行接口。
4.3.1 规格说明
技能的外部化始于规格说明层。典型形式包括SKILL.md、指令文件、清单或其他声明式规格人工制品。这些人工制品描述了技能做什么、适用于什么场景、假设什么依赖、必须满足什么约束以及在什么输入输出条件下应运行。技能规格更类似于API文档而非API实现。其价值在于将程序性专业知识从不透明的内部状态转化为可检视、可讨论、可修订和可治理的显式对象 [Ling et al., 2026]。 一个良好的技能规格理想上应至少覆盖五类信息:能力边界、适用范围、前置条件、执行约束和示例与反例。前两类澄清技能旨在解决什么类型的问题。后两类澄清何时可以安全使用以及在什么操作假设下。最后一类有助于在具体案例中锚定预期的使用模式,从而减少模型的欠规范解释。通过这种结构化规格,技能从非结构化的提示技巧提升为有界的能力描述,进而为发现、加载、版本控制和治理提供基础。
4.3.2 发现
一旦技能成为显式人工制品,它们自然引入注册和发现问题。在实际环境中,智能体不能为每个任务不加区分地加载每个可用技能。因此,它需要某种形式的注册表和发现机制来支持选择性检索。技能可以发布到本地仓库、组织注册表或平台级市场,而智能体基于任务目标、上下文状态和环境条件搜索相关候选 [Zheng et al., 2025a]。 这一发现过程可以依赖语义检索、结构化元数据、任务分解或这些策略的组合,具体取决于系统设计。关键点是系统不仅在问哪个工具可以被调用。它在问哪个程序性专业知识单元适合当前问题。这使技能发现成为更高级的匹配问题。它必须考虑不仅主题相似性,还有任务复杂性、环境假设、操作约束和风险条件。因此,技能不应仅因为其关键词与任务描述重叠而被检索,而应因为它与当前任务的语义和操作结构真正兼容 [Ross et al., 2025]。技能外部化在技能仅被存储时是不完整的。它还必须能在实际任务条件下被检索到。
4.3.3 渐进式披露
技能的发现并不意味着其全部内容应立即注入活动上下文。因为长上下文并不可靠地转化为更好性能,详细指令可能成为推理噪声源而非指导源。因此,当前技能系统通常受益于渐进式披露策略,其中首先暴露技能的存在,而更深的细节仅在需要时加载 [Xu and Yan, 2026b]。 在当前的工业实现中,这通常采取分层形式。在最小层面,模型仅看到技能名称和简要描述,足以表明该能力存在。更深的层面可以暴露类清单的信息,如适用条件、所需前置条件和主要约束。只有最深层才加载完整指南,包括详细程序、异常处理、示例和支持文件。这种分阶段加载的目的不仅是压缩文档。更根本地,它将是否需要更多技能细节的问题转化为运行时自身的决策。这样,技能的信息密度可以与当前任务的复杂性匹配,而非从一开始就用不必要的细节饱和上下文。 这种设计在当前工业技能实现中尤为可见,如Claude Code的技能系统 [Anthropic, 2025]。
4.3.4 执行绑定
技能除非连接到可执行动作,否则仍然是认知层面的描述。实际任务完成因此依赖于绑定过程,将技能的自然语言或结构化规格转化为当前环境中的具体操作。正是在这一点上,技能、工具和协议之间的区别变得清晰。 技能通常本身不是动作执行器。相反,它必须绑定到更低级的运行时基底,如工具、文件、API、子智能体、协议端点或其他执行接口。一个技能可以指定智能体应搜索相关代码、运行测试并总结差异,但动作本身由搜索工具、文件操作、shell命令和测试运行器执行。工具因此提供可执行操作;协议治理这些操作如何被描述和调用;技能提供将它们组合为可重复任务完成的高级策略。 这种绑定通常需要一个中间解释层,在当前上下文中确定应激活哪些技能步骤、应绑定哪些原语、哪些条件应触发分支以及哪些约束应优先。没有这样的解释和绑定过程,技能很容易保持为原则上可读但实践中不可用的静态人工制品。更一般地,MCP [Anthropic, 2024]等基于模式的接口支持这一运行时绑定层,使能力可发现和可调用,而不将技能本身折叠为工具或协议。
4.3.5 组合
技能系统的价值在技能可以被组合时得到最充分的实现。与原子工具不同,技能可以参与更高级的结构化协调,使复杂任务被分解为多个能力包的合作。常见组合模式包括串行执行、并行分工、条件路由和在更高级技能内递归调用子技能 [Wang et al., 2023a]。 这种组合性意味着技能不仅仅是为模型消费而设计的文档,而是智能体架构内可调度的运行时单元。更重要的是,组合不仅是多个程序片段的串联。它是程序性专业知识本身的更高级复用。例如,生成数据分析报告的技能不必实现为单一的端到端程序。它可以组织为数据清洗、统计分析、可视化和叙事合成等更小技能的协调组合。这样,系统不仅获得更强的任务性能,还获得更好的可维护性、可替换性和可审计性。组合因此标志着技能成为真正的能力层而非孤立配方集合的转折点 [Yu et al., 2025]。 总体而言,技能外部化不应被理解为静态指令文件的简单发布。它是一个协调过程,其中程序性专业知识被规格化、可发现、选择性披露、绑定到可执行基底并组合为更大的能力结构。重要的不仅是技能是否可以被写下,而是它是否能可靠地作为可用的行动单元进入智能体的运行时,与检索到的状态和协议化接口互操作。因此,技能的外部化标志着从非正式提示向智能体系统更显式能力层的转变。
4.4 技能获取与演化
技能系统重要不仅因为它存储了人工编写的指令,更因为它提供了将成功行为转化为可复用专业知识的路径。技能获取因此最好被理解为一个演化过程,其中程序性知识随时间被编写、提取、发现和重组 [Xu and Yan, 2026b]。
人工编写。 手动编写仍然是技能进入当前系统最常见和最稳定的途径。无论是以SKILL.md、AGENTS.md、项目级指令文件还是组织SOP模板的形式,这些人工制品都是人工设计的程序性能力包。它们的重要性不仅在于提供初始能力,还在于支持迭代修订。当智能体在部署中反复表现出某种失败模式时,工程师可以更新相应的技能,使一次观察到的失败成为一条澄清的程序或一个添加的约束。这样,编写的技能文档不仅仅是描述性的。它还是将操作经验逐渐转化为可复用行为结构的实用接口 [Ling et al., 2026]。 蒸馏。 技能也可以从历史轨迹、实践痕迹或其他存储的经验中被归纳。情景记录保存了智能体先前做了什么以及为什么某条轨迹成功或失败。当某些成功的结构跨任务重复出现时,系统可以将这些模式抽象为更稳定的程序单元。在这个意义上,记忆保存经验,而技能归纳提取其中的可复用结构。现有证据在过程被框架为从交互轨迹中归纳而非作为记忆自动成为技能的宽泛主张时最直接地支持这一点。SkillSet Optimization从有奖励的子轨迹中提取可迁移技能 [Nottingham et al., 2024]。在记忆管理场景中,MemSkill进一步表明一些记忆操作本身可以被重新表述为可学习和可演化的技能 [Zhang et al., 2026a]。 发现。 除了手动编写和事后蒸馏,智能体还可以通过环境交互自主发现新技能。Voyager在Minecraft环境中提供了一个有影响力的例子,其中探索、执行反馈、自我验证和课程驱动的任务选择共同产生了不断增长的代码级可执行技能库 [Wang et al., 2023a]。更近期的工作表明这一发现过程也可以朝向泛化方向。例如,PolySkill通过将抽象目标与具体实现分离来改进技能复用 [Yu et al., 2025]。一旦智能体能够识别反复成功的行为模式并将它们提升为显式技能,技能库就不仅是存储层,更是能力增长机制。 组合。 最后,技能可以通过组合演化。许多高级能力并非从头发明,而是从现有的低级或中级技能组装而来。报告生成或代码修复等复杂工作流可以从更小能力的反复协调中产生。组合在此不仅作为执行策略重要,也作为获取机制重要。一旦某种现有技能的特定组合被反复验证为有效,该组合本身可以被打包为新的更高级技能。这样,组合生成新的可复用单元,并逐渐产生分层技能库而非孤立的平坦列表 [Wang et al., 2025c]。 总体而言,技能获取不是一次性的设计步骤,而是编写、提取、发现和重组程序性知识的持续过程。成熟技能系统因此较少由其存储多少指令定义,更多由其将经验转化为可复用外部化专业知识的有效性定义。在框架化智能体中,这一演化循环本身被系统化:记忆提供证据,评估器决定什么值得提升,协议化执行界面决定候选技能是否可以实际部署。
4.5 边界条件
技能外部化改进复用和治理,但不保证可靠性。一旦程序性专业知识被外部化为显式人工制品,其有效性就以人工制品与任务、环境和运行时的匹配程度为条件。在实践中,主要边界条件涉及语义对齐、可移植性和陈旧性、不安全组合和上下文相关退化。 语义对齐。 技能规格以自然语言或轻量结构化形式表达意图和指导,而实际执行依赖于具体工具、API和环境约束。因此,模型可能遵循技能的字面措辞却仍错过任务的真实目标。现有证据表明,技能的有效性严重依赖于任务意图、技能描述和调用决策之间的对齐。SkillProbe识别出语义-行为不一致是现有技能市场的一个根本缺陷 [Guo et al., 2026]。工具使用决策的相关工作同样表明,关键困难通常不仅是外部能力是否可以被调用,而是在当前任务解释下是否应该被调用 [Ross et al., 2025]。这表明外部化技能对描述与使用之间的不匹配仍然敏感。 可移植性和陈旧性。 即使技能内部连贯,其在跨环境中的有效性也不能被假设。网站、API、依赖、工作流或运行时约定的变化可能使曾经有效的技能部分误导或完全过时。更广泛地说,智能体框架、工具基底和基础模型的异构性意味着同一技能在不同设置中可能不会一致表现。程序化技能的工作已经表明,一些归纳的技能跨网站迁移,而不兼容的技能必须更新以适应环境变化 [Wang et al., 2025c]。SkillsBench进一步表明技能效用在跨领域和模型-智能体配置方面差异显著 [Li et al., 2026c]。更广泛的启示是,技能可移植性最好被视为有条件的经验属性,而非外部化的内在特征。 不安全组合。 组合使技能更强大,但也创造了新风险。孤立看来无害的技能在组合时可能不安全地交互,特别是当它们捆绑长篇指令、可执行脚本和外部依赖时。在这种情况下,问题不局限于单个技能人工制品,而是从多个人工制品和连接它们的接口之间的交互中出现。这是现在有直接证据可用的边界条件之一。对公共技能生态系统的大规模实证研究报告了大量的漏洞率,包括提示注入、数据泄露、权限提升和供应链风险 [Liu et al., 2026]。攻击导向的研究进一步表明,技能文件本身可以成为当前智能体现实的提示注入面 [Wang et al., 2026c]。技能组合因此应被视为安全敏感过程而非纯粹的良性模块化复用形式。 上下文相关退化。 进一步的困难是技能执行可能在扩展交互中退化。即使技能文件已更新,智能体可能因残留的会话上下文、缓存摘要或先前强化的行动模式而继续遵循过时的操作逻辑。同时,过详细的技能指南可能在过多局部程序细节注入上下文时干扰全局任务追踪。在这种情况下,模型可能仔细执行指令却失去对真正成功条件的视线。直接的技能特定证据仍然有限,但多轮漂移、长时序可靠性和长上下文推理的相关工作强烈表明它们是现实的边界条件 [Lee, 2026]。技能加载因此应被对待不仅是检索问题,也是上下文分配和执行稳定性问题。 综合来看,这些边界条件表明技能不是一旦写下就保持稳定的自足模块。其有效性依赖于与任务、环境、运行时条件和安全约束的持续对齐。技能因此不应被视为孤立人工制品,而应被视为嵌入更广泛工程框架中的组件。这正是为什么技能设计最终指向人工制品本身之外的框架工程。
4.6 框架中的技能
上述边界条件表明技能不能作为独立人工制品评估。它们的可靠性依赖于在运行系统中如何被定位。本节考察技能一旦嵌入框架后如何变得可操作,聚焦于将它们连接到记忆、协议和运行时治理的耦合。 基于记忆的条件化。 技能根据检索到的状态被选择和参数化。框架查询记忆以获取任务历史、先前结果、用户特定上下文和环境约束,然后使用该证据决定加载哪个技能、实例化哪些参数以及偏好哪些分支。没有这一条件化循环,技能选择退化为针对任务描述的关键词匹配。有了它,同一技能可以根据智能体先前学到的东西被不同应用。记忆因此提供使技能选择上下文化而非通用的情境证据。 通过协议绑定。 一旦被选择,技能必须基于可执行动作。该基础通过协议化接口传递:工具模式、子智能体委托契约、文件操作和审批工作流。框架通过解析哪些协议端点当前可用、检查权限和将技能步骤路由到适当的执行基底来调解这种绑定。技能和协议因此是互补的:技能指定应做什么;协议指定由此产生的动作如何被描述、调用和治理。 运行时治理。 在生产环境中,框架还对技能执行施加治理。这包括敏感操作前的权限检查、高风险步骤的审批门、记录哪个技能被加载及其产生了什么动作的审计日志,以及在多步程序中途执行失败时的回滚机制。这些控制不是技能人工制品本身的一部分;它们是技能运行所在的框架环境的属性。在沙箱开发环境中安全有效的技能在生产部署中可能需要额外约束,框架是执行这些约束的层。 生命周期反馈。 最后,框架闭合技能执行与技能演化之间的回路。执行轨迹、成功率、失败模式和用户纠正被写回记忆。随时间推移,该证据可能触发技能修订、弃用或新候选技能的提升。框架因此不仅托管技能;它提供技能改进所需的反馈基础设施。这一循环将技能获取(第4.4节)连接到运行时操作:编写或发现的技能进入框架,框架治理其执行,执行结果反馈到未来技能从中衍生的证据基础。
4.7 技能作为认知人工制品
以下解读主要是理论性的而非直接经验性的。它借鉴关于认知人工制品的经典工作来帮助解释为何外部化技能可以改善程序性专业知识的组织,而非声称这些理论最初就是为LLM智能体开发的。 从Norman的认知人工制品理论视角,技能系统可以被理解为沿能力组织维度的表征转化 [Norman, 1993]。没有外部化技能,模型在任务执行期间必须从内部参数反复重建程序性知识。有了技能,部分程序性负担被移入可加载、可检视和可遵循的显式外部表征中。这将任务从不稳定的潜在程序回忆转向更稳定的识别适用指导并在其下行动的过程。在这方面,技能文件的角色类似于Norman对外部列表如何改变记忆本质的分析。关键点不是简单地添加了额外信息,而是认知任务本身的形式被重组了。 这种重组之所以重要,是因为它改变了模型在推理时必须做的事情。在没有技能的情况下,模型必须在当前上下文压力下概率性地从其参数中恢复适当的前进方式。一旦技能被外部化,程序结构已作为环境中的对象存在。模型的负担转向解释当前情境、识别技能是否适用、遵循相关指导和处理局部异常。程序性知识因此不再必须在每次运行中从头重建。它成为可以直接操作的外部对象 [Li et al., 2026c, Xu and Yan, 2026b]。 这一解读也与Kirsh的互补策略概念一致,根据该概念,智能体不仅通过内部更努力地思考来提升性能,还通过重新组织外部环境使部分认知工作被卸载到其中 [Kirsh, 1995]。LLM在以稳定和可重复方式再现长多步程序方面通常不太可靠。同一提示可能在不同运行中产生不同的分解、分支决策或停止条件。相比之下,它们在阅读显式指导、将其与当前上下文匹配和在既定约束下局部适应执行方面相对更好。技能因此可以被理解为一种工程化的互补策略。它将程序定义、约束和部分最佳实践外部化到人工制品中,而将解释、上下文匹配和异常处理留给模型本身。
技能不仅仅是向系统添加更多信息。它改变了能力的组织方式。程序性专业知识从不透明的、难以审计的参数空间移入可检视、可修订和可组合的外部结构中。这就是为什么技能的意义不仅在于工程便利,更在于技能所居之处和如何变得可复用的更深层重新分配。从这个角度看,技能更好地被理解为不只是提示或工具包装器,而是智能体系统中组织程序能力的认知人工制品。在系统规模上,它们通过在运行时控制下将重复工作流发明转化为选择、加载和组合来外部化程序性负担。
5 外部化交互:协议
协议外部化了能动性的交互负担。一个裸模型可能推断应该调用一个工具、委托一个子智能体或向用户展示响应,但如果没有显式契约,它还必须即兴消息格式、参数结构、生命周期语义、权限和恢复行为。这一负担将每个外部行动变成脆弱的提示跟随练习。
在框架中,这一协议层是交互变得可治理的地方。它调解工具如何被发现、子智能体如何被联系、面向用户的状态如何暴露、会话进度如何表示以及权限和失败如何被执行。协议因此不是记忆存储也不是技能描述:它指定状态、请求和动作如何跨系统边界移动的契约。本节因此考察协议外部化了什么交互负担、为何这种外部化重要、当前协议格局如何组织、协议如何在框架内变得可操作,以及由此产生的转化如何通过认知人工制品的视角来理解。 如果记忆外部化时间状态、技能外部化程序性专业知识,那么协议外部化治理智能体如何与自身之外的实体交换信息和动作的契约。表征转变是从自由形式的交际推理到结构化交换。协议不要求模型在运行时发明交互的语法和语义,而是提供类型化界面、状态转换和机器可读约束,使模型可以填充和遵循。在这个意义上,协议不仅加速通信;它们将任务从协商临时接口转变为在显式契约内操作。
更具体地说,协议外部化的内容可以沿四个维度组织: 调用语法。 每个工具调用、API请求或委托消息需要一种格式:参数名、类型、排序和返回结构。没有协议,模型必须在每次调用时推断或重新发明这种语法。协议将其外部化为模式和类型化接口,使模型填充字段而非猜测语法。 生命周期语义。 多步交互需要协调:谁接下来行动、允许什么状态转换、任务何时完成或失败。协议将这些排序规则外部化为显式状态机或事件流,将它们从模型的推理负担中移除。 权限和信任边界。 真实世界的智能体动作受谁被授权、什么数据可以流向哪里以及必须产生什么证据的约束。协议将这些约束外部化为运行时可以执行的可检视规则,而非依赖模型自我监管。 发现元数据。 在智能体可以与工具或另一个智能体交互之前,它必须知道有哪些能力可用以及如何到达它们。协议将这一发现问题外部化为注册表、能力卡和模式端点,用可查询的元数据替代隐含的提示嵌入知识。 这四个维度不是独立的——单个协议可能同时处理几个——但它们澄清了被外部化的范围。工具暴露操作;技能编码如何用这些操作执行一类任务;协议指定操作和技能通过哪些交互语法、生命周期、权限和发现机制跨系统边界变得可执行。
5.1 为何协议重要
智能体协议的重要性直接来自它们外部化的负担:没有它们,每次交互都部分是关于格式、合法性和协调的推理问题。其好处最容易沿三个维度看到。 统一交互标准。 协议为工具、智能体和前端提供了发现、调用、交接和状态交换的共享语法。没有那一层,生态系统分裂为不能跨运行时良好迁移的局部提示加解析器集成 [Yang et al., 2025a]。标准化交互使互操作性成为设计属性而非幸运的偶然 [Ehtesham et al., 2025a]。它也是稳定多智能体协作的前提,因为委托和上下文转移需要共同表征才能被自动化。 改善安全性、治理和可审计性。 一旦智能体在真实环境中运行,问题不仅是它们能否行动,而是那些行动是否保持有界、可检视和可恢复 [Phiri, 2025]。协议通过使权限、身份、执行轨迹、失败状态和责任边界显式化来提供帮助。这将先前隐含的胶水逻辑变为运行时可以验证和操作者可以审计的东西。 减少供应商依赖。 开放交互契约还保留了架构灵活性。如果系统在协议层而非供应商特定接口内积累能力,模型、供应商和运行时组件可以用更少的重新布线来交换。协议因此不仅是工程便利;它们是智能体生态系统随时间保持可移植和可演化的机制的一部分 [Yang et al., 2025a]。
5.2 智能体协议调研
在本节中,我们根据社区中流行的智能体协议所设计交互的不同实体,将其分为智能体-工具、智能体-智能体、智能体-用户和其他协议族,并简要介绍每类中几个代表性和常用的协议。本调研的目的不是编目每个新兴标准,而是展示当代协议外部化了交互负担的不同切面:一些稳定工具调用,一些稳定智能体间委托,一些稳定智能体-用户边界,一些治理高风险垂直工作流。
5.2.1 智能体-工具协议
智能体-工具协议是最早成熟的协议族之一,因为工具访问是接口碎片化首先出现的地方。MCP [Anthropic, 2024]是最清晰的代表。它为智能体提供了一种标准化的方式来发现工具、检视其模式并跨异构服务调用它们。它解决的问题很简单:没有共享契约,每个新工具需要定制集成逻辑、重复的模式定义和供应商特定的适配。 与邻近层的边界很重要。MCP及相关协议指定工具如何被描述和调用;它们不指定应遵循哪个多步程序,且它们本身不保留跨会话认知。那些角色分别属于技能和记忆。 在架构上,MCP将工具访问转变为基于协议的集成而非接口逐接口的工程。服务器通过公共结构(通常通过JSON-RPC 2.0)暴露工具和上下文资源,而客户端针对该共享规格执行发现和调用。这将工具生态系统与模型供应商特定的函数调用格式解耦,降低了添加新能力的成本。实际收益是直接的:动态能力发现、对复杂外部系统的标准化访问、结构化请求/响应交换和模块化可扩展性。 同样的分离也改善了治理。因为调用由协议层调解而非作为不受约束的模型生成调用发出,敏感数据处理、权限检查和审计边界可以被更明确地管理。ToolUniverse和相关系统通过更专门的工具模式和交互约定扩展了这一逻辑 [Gao et al., 2025b, a]。广义的要点是,智能体-工具协议外部化调用语法,使工具使用变得可移植、可检视和可扩展,而非定制适配器的积累。
5.2.2 智能体-智能体协议
一旦多个智能体协作,交互本身就成为系统问题。智能体-智能体协议定义了能力如何被发现、任务如何被委托、进度和部分状态如何交换以及结果如何返回给调用者。它们外部化了否则会埋在提示约定或框架特定胶水中的协调。 A2A [Google, 2025a]是当前最可见的例子。它通过AgentCards等人工制品标准化能力发现,并支持异构智能体之间的面向任务通信、状态更新、协商和流式进度。其重要性不仅在于智能体可以互相发消息,更在于委托变得结构化:调用者可以发现另一个智能体提供什么,在已知契约下交接工作,并跟踪执行而不依赖硬编码假设。 其他协议做了不同的权衡。ACP [IBM Research, 2025]通过熟悉的REST/HTTP模式强调轻量采用,适合兼容性比丰富协商更重要的场景。ANP [Chang et al., 2025]推动相反的方向,旨在通过去中心化身份、跨域发现和安全端到端通信实现开放的、互联网规模的互操作性。 综合来看,这些协议表明多智能体系统需要的不仅仅是消息传输。它们需要委托、身份、状态和交接的标准化语义。这就是让协调从局部编排扩展到开放智能体生态系统的关键 [Yang et al., 2025a, Ehtesham et al., 2025b]。
5.2.3 智能体-用户协议
智能体-用户协议形式化了智能体运行时和面向用户系统之间的边界。它们解决的问题与工具或智能体-智能体协议不同:不是动作如何在别处执行,而是执行状态、输出和界面结构如何以前端可以渲染、用户可以理解的形式暴露给人类 [Google, 2025b, CopilotKit, 2025]。 A2UI [Google, 2025b]代表了界面生成分支。它让智能体以受限的声明式格式描述UI结构,主机应用可以跨平台安全渲染。该协议重要因为它将界面构建本身视为受治理的输出而非任意类HTML文本。 AG-UI [CopilotKit, 2025]代表流式状态分支。它标准化了类型化执行事件,如运行开始、文本发射、工具调用参数、工具调用结果、完成和错误。前端可以订阅该事件流并渲染运行时状态,而无需学习每个框架的私有事件格式。 这两个方向是互补的。A2UI外部化界面组合;AG-UI外部化该界面背后的实时状态转换。它们共同展示了协议化如何使人-智能体交互在不同主机间变得更可观测、可复用和可移植。
5.2.4 其他协议
除了通用交互族,一些协议针对通用接口不够的高风险垂直工作流。UCP [Google, 2026]通过标准化目录、请求和结账流程为智能体商务做这件事,使智能体、商家和支付提供商无需为每家商店定制集成即可互操作。AP2 [Google Cloud, 2025b]对支付做同样的事,强调授权、签名、可审计性和证据承载的交易对象如IntentMandate、PaymentMandate和PaymentReceipt。 这些领域协议重要因为它们外部化了工作流特定的治理,而不仅仅是通用通信。在购物、支付、身份或合规等垂直场景中,协议必须编码谁被授权、必须产生什么证据以及责任如何跨流程追踪 [UCP Documentation, 2026]。在所有族中,共同模式是协议使协调问题显式化。工具协议外部化调用语法,智能体-智能体协议外部化委托,智能体-用户协议外部化呈现和状态流,领域协议外部化专门治理。
5.3 框架工程中的智能体协议
如果上述调研展示了生态系统中哪些交互负担被外部化,框架工程展示了这些协议界面如何成为运行智能体的一部分。问题不再仅是智能体应如何与其他实体通信,而是那些通信契约在智能体嵌入运行时后如何治理执行、持久化、委托和恢复。 传统LLM管道依赖模型推断格式、记住近期交互状态和猜测外部行动应如何形成。这对于简短、松耦合的请求可能足够,但当工作跨越多个步骤、工具、智能体或审批边界时就会崩溃。框架工程将那种负担外部化到协议界面。模型输出被捕获为结构化意图,根据权限和生命周期状态验证,通过类型化接口路由,并作为受治理事件而非自由格式猜测反映回运行时。
5.3.1 意图捕获与规范化
意图捕获和规范化是那些界面中的第一个。这一层的工作是将模型产生的语言转化为运行时可以验证和执行的显式命令或事件。没有它,执行语义保持隐含:系统猜测模型的意思,小的语言变化可能产生大的操作差异。 成熟的框架因此在执行前规范化意图。自由文本提议被映射到协议对象,根据当前上下文和权限边界检查,并在不满足契约时被拒绝或修订。这不移除模型判断;它将交互的脆弱部分从潜在推理转移到可检视的接口。结果是长时序执行中的更高可靠性、更强的治理以及跨工具、智能体和用户的更干净交接。
5.3.2 能力发现和工具描述
能力发现和工具描述形成第二个界面。在较早的系统中,可用工具的知识部分存在于提示中,部分存在于开发者假设中。协议化发现用显式元数据取代了它。在会话开始或阶段转换时,运行时通过标准化消息暴露当前可用的工具、它们的模式以及它们的输入/输出结构。 这种转变有两个效果。它减少了上下文膨胀,因为模型不需要在提示中携带每个工具契约;它还使能力边界可治理,因为权限、版本控制和审计可以针对结构化元数据执行,而非从模型行为中推断。换言之,智能体不再猜测什么可以被调用,而是开始读取声明的能力界面。
5.3.3 会话和生命周期管理
框架协议还需要显式的会话和生命周期管理,因为长时序智能体不作为孤立的单次调用运行 [Chai et al., 2025]。运行时必须跨多轮、上下文窗口和执行阶段保持交互状态。此处保持的不是完全意义上的持久记忆,而是协议状态:标识符、角色、待处理动作、阶段转换和允许的下一步。 大多数长时间运行的系统因此将执行视为具有命名状态和转换规则的生命周期对象。协议层推进该对象,发出状态变化,并协调检查点或恢复事件。当输出或检查点被写入持久存储时,它们成为记忆。这一区别很重要:协议维护交互的连续性;记忆维护跨时间的连续性。
5.4 协议作为认知人工制品
前面各节调研了智能体协议的内容、格局和框架集成。本最后部分解读协议外部化作为表征转化所实现的成就,使用与前面章节中应用于记忆和技能相同的认知人工制品框架。 用Norman的术语,认知人工制品通过改变其表征结构来转化任务 [Norman, 1993]。协议为交互做到了这一点。没有它们,每个外部行动都部分是一个自然语言推理问题:模型必须推断预期操作、猜测正确格式、重建可接受约束,并希望接收系统正确解释结果。协议用有界的、结构化的任务取代了那种开放式推理:填充类型化字段、遵循声明的状态转换并接收结构化反馈。模型仍需判断是否以及何时行动,但它不再需要在每步重新发明交互的语法和语义。 这是智能体系统中最强的外部化形式之一,因为它从关键路径上移除了整类推理。这种转化类似于记忆为时间状态引入的转变(第3.4节)和技能为程序性专业知识引入的转变(第4.7节),但它在不同维度上操作:不是记住什么或如何进行,而是如何通信和协调。 标准化协议减少了必须在模型内部做出的决策数量。它们使正确交互更容易、错误交互更难——这正是Norman的框架预测外部表征与任务良好匹配时会发生的情况。 Kirsh的互补策略阐述提供了额外的清晰度 [Kirsh, 1995]。LLM擅长解释意图、在选项间选择和适应上下文,但在不同接口要求下一致产生格式良好的结构化输出方面不可靠。协议实施互补的劳动分工:模型贡献判断和意图,而协议界面贡献格式、验证和生命周期控制。单独一方都不足够;它们共同产生既灵活又有纪律的交互。 这一解读还解释了为什么协议发挥着不能简化为记忆或技能的独特角色。记忆外部化随时间学到的东西;技能外部化任务应如何执行;协议外部化记忆和技能作为受治理行动进入世界的纪律。记忆需要受治理的读写路径;技能需要可绑定接口;两者都依赖协议以可检视、可审计和可恢复的形式跨系统边界。协议因此不是"真正"智能核心周围的次要管道。它们是交互的认知人工制品——使其他形式的外部化智能可操作的表征基础设施。
6 统一外部化:框架工程
图7:框架作为认知环境。
基础模型(智能体核心)位于中心;六个框架维度围绕它形成协调环。
- 三个外部化模块——记忆(状态持久化、失败记录、跨会话上下文)、技能(可复用例程、分阶段加载、失败驱动修订)和协议(确定性接口、结构化调用、模式契约)——提供外部化认知内容。
- 三个操作界面——权限(沙箱、文件系统隔离、网络限制)、控制(递归边界、成本上限、超时)和可观测性(结构化日志、执行轨迹、聚合指标)——治理这些内容在运行时如何被访问、约束和监控。箭头表示框架循环内维度之间的持续流动。
图7提供了概览:基础模型位于中心,被六个协调外部化认知为连贯能动性的框架维度环绕。其中三个维度——记忆、技能和协议——是前面章节分析的外部化模块(第3-5节)。其余三个——权限、控制和可观测性——是治理这些模块在运行时如何被访问、约束和监控的操作界面。本章将这些界面拆解为六个更细粒度的分析维度,共同表征框架设计。每个前面章节的结尾都指出其模块只有在嵌入更广泛运行时后才完全可操作。第3.3、4.6和5.3节从每个模块的视角识别了特定的框架需求。本章统一这些线索。它追问需要什么样的系统来将外部化的记忆、技能和协议组合为连贯的能动性,以及该系统应如何在分析上被理解。 核心主张是框架不仅仅是叠加在有能力的模型之上的实现便利。它是外部化模块在其中共同生效的设计认知环境。这一框架激发了本章结构。第6.1节定义框架概念并将其与前面章节的模块级分析相关联。第6.2节识别框架设计变化的反复分析维度。第6.3节考察这些维度如何在当代智能体系统中体现。第6.4节通过分布式认知和认知人工制品理论的视角解读框架作为认知环境来结束本章。
6.1 什么是框架?
外部化逐模块推进改善局部能力,但智能体属性要求全局协调。记忆累积经验而不指定哪些轨迹对当前任务显著。技能封装有效的例程而不自动纳入过去交互的教训。协议规范化调用格式而不确定何时或在什么策略下应调用工具。模块存在,但使它们共同有效的认知循环仍然不够规范。缺失的是一种有原则的结构来协调它们随时间的交互——在单一操作信封内对齐感知、记忆访问、行动选择、执行、监控和修订。 "框架"这一术语命名了那种结构。它最近进入实践,作为将原始模型能力转化为可靠智能体行为的脚手架的描述。例如,OpenAI围绕Codex的工程讨论明确使用该术语来描述使系统可用的智能体循环、执行逻辑、反馈路径和周围的操作机制 [OpenAI, 2025a]。因为概念仍在整合中,我们在此提供的特征最好被理解为对当前系统中反复出现的模式的综合,而非封闭定义。 在这一叙述中,一个实际智能体更好地被理解为在框架内运行的模型,而非附加了外围能力的模型。仅有基础模型保留通用推理能力,但缺乏决定它可以访问什么、可以如何行动、其动作如何被约束以及其行为如何随时间被观察和修订的操作结构。框架提供了那种结构。它治理模型遇到上下文、调用工具、保持状态和响应反馈的路径。能动性因此不仅位于模型中;它从模型与将其认知组织为行动的环境耦合中涌现。 从功能上描述,框架包括使这种耦合成为可能的外部系统:持久记忆和项目级上下文、可复用技能和可执行例程、用于与工具和服务确定性交互的协议化接口,以及这些元素在其中变得可操作的更广泛运行时基础设施。关键点不是组件的精确清单——这因实现而异并将继续演化——而是它们的集体角色:它们创造模型推理可以被稳定到足以支持持续工作的条件。这将分析注意的焦点从仅模型能力转移到模型感知、决策和行动的表征、程序和操作条件。智能体的改进因此可能不仅来自更好的基础模型,还来自更好的记忆组织、更清晰的约束制度、更可读的反馈渠道和更精心设计的执行环境。
6.2 框架设计的分析维度
前面章节讨论的模块——记忆存储、技能人工制品和协议接口——提供了外部化认知的原材料,但它们本身并不指定运行时如何随时间协调感知、行动、约束和反馈。那种协调是框架的领域。 图7中强调的三个操作界面——权限、控制和可观测性——可以被分解为六个反复出现的设计变化维度。每个维度解决了外部化模块如何被组合为功能智能体的一个不同方面;它们共同提供了比较框架架构的分析框架,而非实现清单。
6.2.1 智能体循环与控制流
智能体循环是框架的时间骨架。在其最简形式中,它实现了一个感知-检索-规划-行动-观察循环,模型接收当前状态的结构化视图,决定一个行动,通过工具或协议接口执行它,观察结果,并相应更新其内部计划 [Yao et al., 2023a, Shinn et al., 2023]。实际系统在循环结构上变化很大。单循环设计在单次生成中交错推理和行动;分层设计将分解目标的规划智能体与执行个别步骤的执行器智能体分离;多智能体设计将子任务路由到具有不同工具集和权限范围的专业智能体 [Wu et al., 2023, Hong et al., 2023, LangChain, 2024]。 框架在裸循环之上增加的是对终止、递归和资源消耗的治理。没有显式控制,智能体循环可以无限循环,通过无界工具调用升级成本,或递归进入耗尽上下文或计算预算的子智能体派生。生产框架因此执行最大步骤计数、递归深度限制、每步成本上限和超时约束。这些控制不是次要的安全措施;它们定义了智能体推理在其中展开的操作信封。一个调优良好的循环使智能体更可靠,不是通过使模型更聪明,而是通过界定可能的执行路径空间。
6.2.2 沙箱与执行隔离
每当智能体对世界行动——写文件、执行shell命令、调用外部API——框架必须决定暴露多少环境以及如何包含非预期的副作用。沙箱是对这一要求的工程响应。它创建了一个受控的执行边界,限制智能体可以读取、写入和修改的内容,并提供使失败可诊断和回滚可行的可复现性保证。 当代系统在不同粒度上实现隔离。Codex风格智能体在专用云沙箱中运行每个任务,拥有自己的文件系统快照、网络限制和资源配额,使一次执行不能污染另一次 [Wang et al., 2025a, Yang et al., 2024a]。Claude Code采取互补方法,暴露分级权限模式——从完全自主执行到每次工具调用都需要用户批准——使同一智能体可以根据任务和操作者的风险容忍度在不同信任级别运行 [Anthropic, 2026]。在两种情况下,沙箱不仅是安全围栏。它是一种认知边界,通过移除不相关的状态、限制危险行动和使工作区可检视来简化智能体的操作环境。隔离因此服务于与其他外部化形式相同的表征功能:它改变了模型必须推理的内容。
6.2.3 人类监督与审批门
完全自主对于部署的智能体很少合适。大多数生产系统因此在智能体循环中插入干预点,人类操作者可以检视提议的行动、批准或拒绝它们、提供纠正或重定向执行。设计问题是这些门应放在哪里以及它们之间应授予多少自主权。 三种模式常见。预执行审批在每次潜在后果性动作前暂停智能体并要求显式确认。后执行审查让智能体行动但在提交或继续前浮现结果供检视。升级触发允许智能体在正常条件下自主运行,但当检测到特定风险信号——如涉及敏感数据的行动、不可逆操作或信心低于阈值——时暂停并请求人类输入。钩子系统通过允许操作者将任意逻辑——shell脚本、验证检查、通知分发——附加到智能体循环中的特定生命周期事件(如工具调用、文件写入或子智能体派生)来推广这一模式 [Lazaros et al., 2026, Fernandez, 2026]。自主级别因此不是智能体的二元属性,而是框架的可配置参数,可按任务、工具和组织策略调整。
6.2.4 可观测性与结构化反馈
一个不留可检视痕迹就行动的智能体是一个无法被调试、审计或改进的智能体。可观测性是使智能体内部轨迹对开发者、操作者和智能体自身可见的框架界面 [Zhu and Lu, 2026, Zheng et al., 2025b]。 在实现层面,可观测性通常涉及对每次模型调用、工具调用、记忆读/写和决策分支的结构化日志;将每个行动与其因果前因联系起来的执行轨迹;以及聚合指标如步骤计数、令牌消耗、错误率和延迟分布。这些记录服务于两个不同目的。对外,它们支持调试、合规审计和事后分析 [Phiri, 2025]。对内,它们闭合将执行结果连接回产生它们的模块的反馈回路。一次失败的工具调用可以触发记录失败上下文的记忆写入;重复失败的模式可以标记技能待修订;延迟尖峰可以导致框架切换协议路径。没有结构化可观测性,这些反馈回路无法运行,框架保持为静态脚手架而非自适应系统。可观测性因此不是辅助便利;它是框架从自身运行中学习的机制。
6.2.5 配置、权限和策略编码
框架不仅必须编码智能体能做什么,还必须编码它在什么条件下被允许做什么。这需要一个配置层,将策略与执行逻辑分离,使治理规则显式、可版本化和可审计。 在实践中,配置通常跨多个范围分层。用户级设置编码个人偏好和信任边界。项目级设置指定哪些工具可用、哪些文件路径可访问、哪些命令需要批准。组织级设置施加合规约束、成本上限和数据处理规则,个别项目不能覆盖。这种分层模型意味着同一基础智能体可以根据部署上下文在不同策略制度下运行,而无需改变模型或其加载的技能人工制品 [Anthropic, 2026, Lee et al., 2026]。权限和策略因此最好被理解为外部化治理:否则必须嵌入提示或通过事后过滤执行的约束被编码为框架在运行时执行的声明式规则。
6.2.6 上下文预算管理
上下文窗口仍然是任何智能体系统中最稀缺的共享资源。记忆检索、技能加载、协议模式、工具描述和模型自身的推理轨迹都竞争同一有限的令牌预算。该预算如何分配是任何单个模块无法自行解决的框架级协调问题。 有效的上下文管理通常结合几种策略。摘要将较旧的对话轮次和执行历史压缩为更短的表示,保留决策相关信息同时为当前步骤释放令牌 [Packer et al., 2023]。基于优先级的驱逐移除或降级其对当前活动子任务的相关性已衰减的上下文条目。分阶段加载——已在第4节中针对技能讨论——确保详细的程序指导仅在匹配的任务模式被检测到时才进入上下文,而非从会话开始就占用预算。框架联合编排这些策略,因为最优分配取决于当前执行阶段:早期规划阶段可能需要更多记忆和更少技能细节,而后期执行阶段可能需要相反。上下文预算管理因此不是孤立的压缩问题。它是一个动态资源分配问题,其解决方案必须由智能体的当前目标、它所依赖的模块以及它运行的约束来告知。 综合来看,这六个维度——循环控制、沙箱、人类监督、可观测性、配置和上下文管理——提供了表征框架架构的分析框架。它们中没有一个是自身意义上的外部化形式;每一个都是使记忆、技能和协议作为连贯系统运作的协调基础设施的一部分。下一小节使用这一框架来考察当代智能体系统如何在实践中实例化这些维度。
6.3 框架在实践中:当代智能体系统
上述识别的分析维度不是抽象的愿望;它们对应在已部署智能体系统中可观察的具体设计选择。当代生产智能体——如OpenAI Codex [OpenAI, 2025a]和Anthropic Claude Code [Anthropic, 2026]——在产品界面、实现谱系和目标工作流方面差异很大,但它们汇聚在惊人相似的框架结构集上。这种汇聚具有分析意义:它表明六个维度不是偶然的实现选择,而是外部化能动性的结构性要求。以下讨论检查这些反复出现的模式,而不详细追踪任何单个系统。 循环和控制流。 成熟的智能体系统统一围绕显式循环组织执行,该循环交错模型推理与工具调用和环境观察。框架与底层模型区分开来,并被特征化为提供核心智能体循环、执行逻辑和反馈路径。关键的是,循环包括显式终止控制——步骤限制、递归深度边界和资源上限——定义了模型推理在其中展开的操作信封。 沙箱。 当前系统在不同粒度上实现执行隔离。一些在专用云沙箱中运行每个任务,拥有自己的文件系统快照、网络限制和资源配额;其他暴露分级权限模式,使同一智能体可以根据上下文在不同信任级别运行。这些设计占据了隔离设计空间的不同点,但共享一个共同原则:沙箱作为认知边界,通过移除不相关状态和限制危险行动来简化智能体的操作环境,而不仅仅是安全边界。 人类监督。 框架不将自主视为二元属性,而是实现可配置的审批门——将验证逻辑附加到特定生命周期事件(如工具调用、文件写入或子智能体派生)的钩子系统,以及将高风险行动路由通过审批工作流的应用层 [Lazaros et al., 2026, Fernandez, 2026]。自主级别成为框架的参数,可按任务、工具和组织策略调整。 可观测性。 生产系统产生结构化执行轨迹——每次模型调用、工具调用、记忆读/写和决策分支的日志——支持调试、合规审计和事后分析 [Phiri, 2025, Zhu and Lu, 2026]。这些轨迹还闭合内部反馈回路:失败的工具调用可以触发记忆写入,重复失败的模式可以标记技能待修订。可观测性因此是框架从自身运行中学习的机制。 配置和治理。 部署的框架通常跨多个范围分层配置——用户、项目和组织——使同一基础智能体在不同策略制度下运行,而无需改变模型或其技能人工制品。权限和策略作为外部化治理:否则必须嵌入提示的约束被编码为运行时执行的声明式规则 [Lee et al., 2026]。 上下文预算。 上下文窗口仍然是任何智能体系统中最稀缺的共享资源。当前框架通过摘要旧历史、分阶段加载将详细技能指导推迟到匹配任务被检测到时、以及基于优先级驱逐相关性已衰减的条目来主动管理它。框架联合编排这些策略,因为最优分配取决于当前执行阶段。 独立开发的系统汇聚在同一组框架维度上这一事实本身具有启发性。它表明外部化能动性的主要设计挑战不是从模型中引出更好的补全,而是安排使补全成为有效干预的操作条件。框架工程因此既不是记忆系统的同义词,也不是工具调用的重新品牌化。它是构建外部化模块组合为连贯能动性的认知和操作环境的更广泛学科。
6.4 框架作为认知环境
前面各节从定义、反复设计维度和当前系统体现方面分析了框架。本最后部分退后一步,在理论层面解读框架,追问它是哪种对象,而非如何被构建。 框架的意义超越了普通软件工程意义上的基础设施。框架不仅仅支持已经形成的智能;它通过确定推理在其中展开的环境来塑造智能体的有效认知。它调节什么进入智能体的感知场、什么跨轮次和会话被保留、哪些操作可被调用、哪些行动需要批准、哪些中间状态被暴露用于修订、以及哪些失败形式可被检测和恢复。框架因此设定了智能体的实际认知边界。智能体能知道、记住和做什么不仅由模型权重固定,而由周围系统提供的访问、持久化和行动条件决定。 这一主张可以置于Norman关于认知人工制品的阐述中 [Norman, 1993]。Norman将认知人工制品描述为设计用于维护、显示或操作信息以转化认知性能的人造设备——不仅通过加速内部计算,更通过改变任务本身的结构。框架在系统规模上符合这一定义。它不仅仅用更多上下文或更多工具增强模型;它重组了模型面临的表征问题。通过外部化记忆、形式化程序、引入显式控制点和约束执行,框架将无界任务转化为引导行动的结构化环境。模型的表面智能因此被改变,不仅因为它有更多资源,更因为认知负载已被重新分配到模型之外的人工制品、表征和程序中。在前面章节中,我们逐维度分析了这种重新分配:记忆将回忆转化为检索(第3.4节),技能将程序重建转化为引导执行(第4.7节),协议将临时交互转化为结构化交换(第5.4节)。框架是组合这些个别转化为单一认知环境的系统级人工制品。 Kirsh关于空间智能使用的阐述磨锐了这一解读 [Kirsh, 1995]。他的核心观察是认知受环境如何安排塑造:空间和表征组织可以卸载搜索、简化选择和减少内部计算负担。框架为智能体扮演类似角色。它是一个认知生态位,信息、工具、权限和程序被安排使期望行为更容易执行、不期望行为更难产生。默认值、钩子、文件边界、技能调用模式和审查门都作为结构化规律性,缩小合理行动的空间。智能体的能力因此部分是生态成就:它源于被嵌入一个其组织将认知引向产出的环境。 分布式认知的框架推广了这一点。Hutchins的阐述拒绝认知仅存在于个体心智中的观点,转而将认知过程定位于人、人工制品、表征和协调实践之间 [Hutchins, 1995]。配备框架的智能体系统恰好可以用这些术语来理解。操作性智能分布在模型参数、外部记忆存储、可执行技能、协议定义、工具界面、监控系统和治理其交互的运行时约束之间。框架是协调这一分布式系统的媒介。因此,将框架描述为认知环境比描述为单纯的基础设施层更准确。基础设施是其表现之一;环境结构化——设计认知在其中展开的条件——是其更深层功能。
7 交叉分析
三个外部化模块在分析上是不同的,但真实系统的力量来自它们之间的交互。第3-5节在很大程度上孤立地处理记忆、技能和协议;第6节论证框架统一了它们。本节考察一旦模块被放入框架后产生的系统级耦合,询问它们如何在模型边界体现,并考虑参数化能力和外部化能力之间的边界应画在哪里。
图8:记忆、技能和协议之间的耦合。 六个箭头总结了三个外部化模块如何在框架内相互增强。记忆为技能形成和协议路由提供证据;技能将存储的经验转化为可复用程序并调用协议化动作;协议约束执行并将规范化结果写回记忆。
7.1 模块交互图
记忆到技能:经验蒸馏。 重复的轨迹可以被蒸馏为可复用程序,使这成为累积经验变成编码化的专业知识的主要路径。TED和UMEM等系统展示了情景轨迹如何被聚类、抽象和提升为技能人工制品,而无需修改基础模型权重 [Yuan et al., 2026, Ye et al., 2026]。Voyager在终身学习中使同样的逻辑具体化:成功的行为被保留为可复用的代码级技能,以后可以重新组合 [Wang et al., 2023a, Zhang et al., 2025b]。 这种交叉流动的意义在于记忆不仅保存过去;它提供了框架可以从中决定什么值得成为可复用操作模式的证据。蒸馏步骤的质量——系统如何确定哪些轨迹泛化、哪些是情境性的——因此条件化了整个下游技能层的可靠性。如果蒸馏过于激进,嘈杂或上下文相关的行为被固化为技能;如果过于保守,系统未能利用来之不易的经验。 技能到记忆:执行记录。 流也朝相反方向运行。每次技能执行生成轨迹、中间失败和运行时细化,否则会随活动上下文窗口消失。可观测性和日志基础设施捕获那些轨迹作为持久证据,使系统可以验证哪些技能保持可靠,哪些应被修订、拆分或约束 [Chen et al., 2025, Wang et al., 2026f, d]。 这种流是使技能层自我纠正而非仅自我扩展的原因。成熟的技能系统不能与记忆管理分离:可复用程序只有在其实际执行历史被持续写回外部状态时才保持可信。没有这种记录,框架没有技能维护的经验基础,且从记忆到技能的蒸馏路径(前一种流)在越来越陈旧的证据上运行。 技能到协议:能力调用。 技能只有在从抽象程序到受治理行动的边界跨越后才变得可操作。那种过渡通过协议发生,协议将高级意图转化为类型化调用、生命周期事件和权限检查的交互界面 [Takyar, 2025, JSON-RPC Working Group, 2010, Hou et al., 2025]。一个技能可以指定智能体应搜索代码、运行测试和总结差异,但各个操作通过协议化接口对搜索工具、shell命令和测试运行器执行。 这种耦合对安全和对功能一样重要。OpenClaw对"致命三要素"——敏感数据访问加上不受约束的外部通信加上未验证执行——的分析说明,即使程序指导本身是健全的,不受约束的执行仍然是安全问题 [McKerchar, 2026]。协议级验证因此充当独立于技能自身正确性的边界检查:即使编写良好的技能在尝试调用禁止操作或格式错误的调用时也可以被拦截。 协议到技能:能力生成。 一旦接口被标准化,为使用它编码最佳实践就变得容易得多。OpenAPI和MCP不仅使工具可调用;它们提供了足够的结构规律性,使系统可以将接口特定的技能打包为可复用技能人工制品 [OpenAPI Initiative, 2021, Hou et al., 2025]。HashiCorp Agent Skills生态系统是具体例子:一旦基础设施管理的基础接口通过协议契约变得可读和稳定,领域程序可以作为可移植的技能文件外部化,而非在每次运行中重新推导 [Baghel and Chandna, 2026]。 这种流突出了外部化过程中的重要不对称。协议标准化不仅消费技能;它积极扩展可以编写或归纳新技能的界面。每个新的稳定接口都是一族可复用程序的潜在种子。技能人工制品的生态系统增长因此部分依赖于协议标准化的步伐和质量。 记忆到协议:策略选择。 存储的上下文也可以影响框架接下来选择哪条协议路径。历史成功率、用户偏好和先前失败可以决定请求应保持本地、调用外部工具还是委托给另一个智能体 [Xu et al., 2026b, Zhou et al., 2025]。在具有多个可用交互路径的系统中,记忆将协议选择从静态配置转变为经验知情的路由决策。 这种耦合在多智能体设置中尤其可见,框架必须在本地执行、通过MCP的工具调用和通过A2A的远程智能体委托之间选择。如果过去与特定工具的交互在某一类任务中持续失败,路由逻辑可以学会偏好替代路径。记忆因此不仅影响模型推理什么,还影响哪个交互通道将那种推理传递为行动。 协议到记忆:结果同化。 最后,每次协议交互产生的状态如果要成为智能体持续认知的一部分就必须被保留。工具输出、审批事件、错误载荷和委托结果作为结构化响应到达,通常以比纯文本更丰富的格式 [Qin et al., 2023]。框架必须将这些结果规范化到记忆中,使后续推理可以依赖验证的外部状态而非重建或幻觉的假设。 这种流闭合了循环。协议层提供记忆存储的证据,后者随后条件化新技能选择和新协议路由。没有可靠的结果同化,智能体的记忆与其实际交互历史脱节,下游流——特别是经验蒸馏和策略选择——在不可靠的前提上运行。 系统级动态。 上述六种流是成对的,但几种重要动态只在系统级出现。首先,循环是自我增强的:更好的记忆使更好的技能蒸馏成为可能,更好的技能产生更丰富的执行轨迹,更丰富的轨迹改善记忆,如此循环。这种正反馈可以加速能力增长,但也可以放大错误。一个被污染的记忆条目可以导致有缺陷的技能,其执行轨迹进一步污染记忆——一种没有单个模块质量控制可以在没有框架级干预下中断的级联。 其次,模块竞争同一稀缺资源:模型的上下文窗口。记忆检索、技能加载和协议模式都占用令牌。扩展一个模块的上下文足迹必然压缩其他模块。框架因此必须不仅管理每个模块的内容,还管理它们在执行的每一步的相对预算分配——这是第6节进一步分析的协调问题。 第三,流在不同时间尺度上运行。协议交互通常是同步和快速的;技能加载发生在任务或子任务边界;记忆蒸馏和技能演化跨越会话或更长时间展开。一个为一个时间尺度(如快速工具执行)优化的框架可能忽视决定长期能力增长的较慢循环。有效的框架设计需要在快速循环的响应性和慢循环的连贯性之间取得平衡。
7.2 LLM输入/输出视角
另一个有用的视角是问每个模块如何在模型边界体现。从上下文窗口和输出界面的视角看,框架不仅仅是添加更多组件;它将进入和离开模型的内容重组为功能上不同的层。 记忆作为上下文输入。 记忆塑造了决策时可用的历史和情境输入。检索机制不向模型灌入完整执行日志,而是选择对当前步骤重要的一小片状态、先前轨迹或实体关系 [Du, 2026b]。这将长时序连续性转化为有针对性的上下文化问题并减少上下文浪费。这种选择的质量直接决定模型是在对过去的准确图景上推理还是扭曲的图景上推理。 技能作为指令输入。 技能塑造了给模型的程序性指导。框架不在单一的系统提示中编码每个工作流,而是仅在相关任务模式出现时加载专门的指令、示例和约束 [Jiang et al., 2026a]。模型因此被要求更少从头发明工作流,更多被要求解释和遵循已准备好的工作流。第4节讨论的风险是,过于详细或消耗上下文的技能文件可能挤占其他输入;好处是当正确的技能在正确的时机被加载时,程序方差被减少。 协议作为动作模式。 协议塑造了输出边界。通过强制执行JSON模式、MCP消息或OpenAPI对齐调用等结构化契约,它们约束模型的生成空间并使下游执行足够确定以治理 [Hasan et al., 2026]。输出不再是稍后被解释的语言;它成为位于显式接口内的机器可读行动提议。这种约束减少了格式错误工具调用和幻觉参数的发生,尽管它也意味着行动表达性受协议模式的约束。 这种输入/输出分解在分析上有用,因为它澄清了劳动分工和失败分类。检索错误表现为输入选择错误:模型正确推理但基于错误的上下文。技能失败表现为程序指导错误:模型忠实地遵循指令但指令本身有缺陷或不匹配。协议失败表现为动作模式错误:模型的意图正确但输出违反接口契约。框架使这些失败类别足够可分离以独立调试、归因和优化——这是多个模块对每个决策都有贡献的系统的重要属性。 从更广泛的角度看,模型边面的这种三方组织——上下文输入、指令输入和动作模式——可以被理解为结构化的上下文工程形式。框架不将提示视为未分化的文本缓冲区,而是将其分离为具有不同更新速率、治理需求和失败模式的层。每层可以在不干扰其他层的情况下修订:记忆检索可以在不重写技能的情况下改进,技能人工制品可以在不改变协议模式的情况下更新,协议界面可以在不改变记忆策略的情况下扩展。模型边界处的这种模块化是外部化方法的主要实际优势之一。
7.3 参数化与外部化:权衡空间
相关的设计问题不是智能应驻留在模型还是基础设施中。而是在给定其更新速率、复用模式、治理需求和执行成本的情况下,特定负担应驻留在哪里。以下维度结构化这一分区决策。 更新频率和时间衰减。 快速变化的知识和程序是外部化的强候选。API、组织结构和实时环境状态衰减太快,无法在模型权重中可靠维护。通过持续微调保持模型最新的尝试有灾难性遗忘的风险,且在所需更新频率下往往不实际 [Cheng et al., 2024, Qiu et al., 2025, Zhang et al., 2025d, Chen et al., 2026a]。相比之下,外部存储可以无需重新训练立即更新,并可以维护显式溯源和版本控制 [Oelen et al., 2025, Chinthareddy, 2026]。稳定的背景能力——语言理解、广泛推理、常识推断——以更慢的速率衰减,更自然地由参数携带,它们在那里受益于快速检索和与模型表征结构的深度整合。 可复用性和多智能体可移植性。 如果一种能力跨任务、用户或智能体被反复需要,外部化改善可移植性和组合性 [Tagkopoulos et al., 2025, Xu and Yan, 2026a, Liu et al., 2025d]。显式技能、脚本和接口人工制品可以跨异构运行时共享、版本化和复用,而无需每个智能体重新发现或重新训练相同的程序。在多智能体设置中,为一个智能体编写的技能可以广播到整个群体,前提是技能对工具和协议的假设得到满足。一次性或高度特异性的行为可能不值得外部化、打包和维护的开销 [Zhao et al., 2026a]。 可审计性、治理和对齐。 每当检视、批准、回滚或策略执行重要时,外部化人工制品相比不透明的参数化行为有明显优势 [Li et al., 2026b, Lazaros et al., 2026, Lee et al., 2026, Fernandez, 2026, Zhu and Lu, 2026]。符号接口支持断路器、模式验证和可追溯执行记录,这是权重单独做不到的。对齐微调(如RLHF)提供概率性行为塑造,但外部化约束在接口层面提供确定性执行。高风险部署因此推动架构边界向外:智能体的行动越有后果,使治理逻辑显式和可检视的理由越强。 延迟、简洁性和上下文负担。 外部化将计算和组织成本从模型的前向传递转移到周围系统。检索、路由、解析和工具调用都引入延迟 [Park et al., 2026, Xu et al., 2025a]。每个检索到的人工制品竞争有限的上下文预算,过度的上下文加载可能通过信息过载或"中间迷失"现象降低性能 [Corallo and Papotti, 2026, Mishra et al., 2026, Esmi et al., 2025]。对于超快速、低方差或纯语义任务,让模型依赖其内部参数化知识仍然实质上更简单且往往更可靠。 结果不是模型智能和基础设施智能之间的零和竞赛。它是一个系统分区问题。强框架外部化受益于持久性、复用和控制的负担,同时将稳定的、快速的和通用的能力留在模型内部。最优分区不是静态的:随着模型变得更强大和外部化基础设施成熟,边界将继续移动——第8.1节进一步探讨这一动态。
8 未来讨论
前面各节考察了记忆、技能和协议如何外部化不同的认知负担,以及框架如何将它们统一为工作智能体。那些分析描述了什么已被外部化。本节问接下来是什么,沿外部化自身的逻辑追踪六个关联问题:
- 参数化和外部化能力之间的边界走向何方,多模态感知如何拓宽这一前沿?
- 同样的逻辑是否从数字智能体延伸到具身系统?
- 外部化过程如何变得更自主?
- 随着更多被向外移动,什么成本和风险在累积?
- 外部化人工制品如何在生态系统规模重塑交互?
- 外部化的质量应如何衡量? 以下各节依次讨论这些问题,从外部化的移动边界经其具身延伸到如何评估其收益和成本的问题。
8.1 扩展的前沿
前面各节的一个反复教训是,模型内部保留什么和外部化什么之间的边界不是固定的。它随模型、任务和基础设施的共同演化而移动。理解这一边界——并预测它下一步将移向何处——因此是智能体系统的核心设计问题。 在一个方向,模型改进可以将能力拉回内部。一个可靠产生结构化输出的模型需要框架中更少的格式验证;一个具有更大有效上下文窗口的模型可能容忍更简单的记忆架构;一个具有更强内在工具使用能力的模型可能需要更少的意图捕获逻辑。每一次这样的进展都使部分外部基础设施变得多余。 在相反方向,更丰富的框架对模型创造新需求:在结构化运行时内运行需要尊重模式、配合权限检查和与分阶段上下文注入协调 [Zhang et al., 2025d, Cheng et al., 2024]。前沿因此在两个方向同时移动,核心工程挑战是知道何时进一步外部化、何时收回。 在这一移动景观中,几类今天仍在很大程度上隐含的认知工作是进一步外部化的合理候选。 规划和目标管理。 当前智能体通常通过上下文内推理生成计划,产生的分解是短暂的——它们仅存在于活动生成中,一旦上下文重置就丢失。早期智能体框架如BabyAGI已经实验了持久任务队列 [Nakajima, 2023],而以文件为中心的状态抽象如InfiAgent将规划人工制品物化在提示之外 [Yu et al., 2026]。方向指向计划作为一等框架对象:持久的、可检视的、可修订的和可跨智能体或在智能体与人类间共享的。这将把规划从短暂的推理行为转化为管理的状态人工制品——记忆已为历史上下文执行的相同表征转变。 评估和验证。 大多数评估逻辑今天要么存在于模型的思维链中,要么在事后运行的外部基准框架中。将评估标准、评分标准和验证程序作为运行时框架组件外部化——而非将它们留在模型判断中隐含——将允许智能体在执行期间根据显式标准检查自身输出。这一方向的早期迹象在可验证性优先的工程框架中 [Zhu and Lu, 2026]以及在将生成与批评分离的自精炼循环中可见 [Madaan et al., 2023]。更广泛的机会是将评估视为外部化质量基础设施而非事后测量。 编排逻辑本身。 最递归的外部化形式是使框架自身的配置、策略和执行逻辑成为智能体可以检视、批评和修订的对象。一旦编排逻辑被外部化,智能体系统不仅可以适应它知道和做什么,还可以适应它如何组织知道和做。这一方向直接连接到下一小节。 多模态外部化。 迄今开发的外部化框架假设文本是主导表征媒介:记忆存储文本轨迹,技能编码自然语言程序,协议交换结构化文本消息。随着基础模型原生成为多模态——处理图像、视频、音频和屏幕内容以及文本——每个外部化维度面临新的设计需求。多模态技能必须不仅编码文本程序,还要编码视觉感知工作流和跨模态决策逻辑;早期例子包括将GUI交互序列打包为可复用单元的计算机使用技能 [Chen et al., 2026b]。多模态记忆必须索引和检索视觉和听觉经验,不仅是基于文本的情景轨迹;MemVerse维护多模态知识图,定期将碎片化的感觉经验蒸馏为更抽象的表示 [Liu et al., 2025a],MuSEAgent累积有状态的多模态经验以告知未来推理 [Wang et al., 2026d]。多模态推理蒸馏将技能获取循环扩展到非文本模态:TED证明成功多模态推理轨迹可以无需额外训练蒸馏为可复用经验 [Yuan et al., 2026]。更广泛的启示是多模态外部化不仅是向现有存储添加新数据类型。它改变了技能规格、记忆索引和协议模式的设计假设,并为认知负担的外部化开辟了实质上更宽的前沿 [Wang et al., 2026e, Xu et al., 2026a]。
8.2 从数字智能体到具身外部化
本文开发的外部化框架适用于读、写和调用API的数字智能体。一个自然的问题是同样的架构逻辑是否延伸到具身系统——必须还感知、移动和与世界物理交互的机器人。机器人学习的最近发展表明它确实可以,且具身领域正在经历与本文分析的惊人平行的分解。 单块起点。 早期具身智能方法追求端到端策略,类似于外部化前的LLM智能体。视觉-语言-动作(VLA)模型 [Brohan et al., 2023, Kim et al., 2024]被定位为单块"大脑":给定自然语言指令和视觉观察,模型直接输出连续动作序列,在单次前向传递中处理感知、推理、规划和运动控制。这种设计反映了早期LLM智能体试图完全通过上下文内推理管理记忆、技能和编排的模式——它遇到了同一类局限性。复杂多步任务超出了模型的规划范围;中间步骤的失败无法被诊断或恢复;高层认知与低延迟运动控制的紧密耦合对推理速度和模型容量产生了不可调和的要求。 分解:大脑-小脑分割。 新兴的架构响应在整个身体层面重演了外部化逻辑。一个高级机器人智能体——通常是LLM或多模态模型——承担大脑角色:它解释目标、将任务分解为子任务序列、跨步骤保持状态、处理异常并在执行反馈指示失败时修订计划 [Ahn et al., 2022, Singh et al., 2023, Liang et al., 2023]。VLA模型同时被重新定位为小脑:每个成为一个可调用的技能模块,负责单一原子操作原语——抓取、放置、倾倒、插入——以实时感觉运动反馈和低延迟控制执行。VLA不再决定做什么;它确保如何做精确、稳定和对局部物理扰动具有适应性。 这种分解直接映射到本文的外部化维度。任务规划和目标管理从VLA的隐含参数推理迁移到显式的、可检视的智能体循环——正是第8.1节讨论的从上下文内规划到外部化计划对象的转变。每个VLA技能模块作为外部化技能人工制品发挥作用:一个可复用的、可组合的单元,具有定义的接口,类似于第4节分析的技能文件和工具规格。智能体和技能之间的通信——结构化动作请求、执行状态报告、错误代码——构成了协议层,使智能体能够编排异构的运动能力而不嵌入其实现细节。 为何这一平行重要。 这种收敛并非巧合。数字和具身智能体都面临同样的根本张力:单一模型不能同时优化慢的、审慎的认知和快的、反应性的执行。外部化通过将每类认知工作路由到最适合它的基底来解决这一张力——持久的、可检视的结构用于规划和记忆;专业的、低延迟的模块用于执行。在数字情况下,执行模块是工具调用和代码解释器;在具身情况下,它们是视觉运动策略。框架模式——加载上下文、分派技能、执行协议和管理状态的运行时——对两者同样适用,表明具身和数字智能体架构可能最终不仅共享设计哲学,还共享具体的工程栈。 开放挑战。 具身外部化引入了数字情况不面临的约束。物理行动以API调用所不是的方式不可逆:掉落的物体不能被"回滚"。实时控制要求的延迟预算比文本生成紧几个数量级。感知是嘈杂的,模拟训练环境与物理部署之间的差距仍然很大。这些约束将塑造具身框架的记忆、技能和协议如何设计,但它们不改变根本论点:外部化的逻辑——将单块能力分解为专业的、可组合的和可治理的外部结构——自然地从数字认知延伸到物理行动。
8.3 朝向自演化框架
大多数当前智能体系统仍依赖人来修订记忆策略、重写技能人工制品和在失败后收紧执行逻辑。如果编排逻辑本身被外部化——如前面小节建议的——那么框架就成为一个可以以编程方式而非仅手动适应的对象。问题是如何使那种适应可靠。 从系统视角,自演化可以在三个层面发生。在模块层面,架构保持固定但内部策略——检索粒度、技能排序启发式、协议路由规则——根据观察到的失败进行调整。在系统层面,执行管道本身被重构:当日志揭示局部调整无法解决的反复瓶颈时,调度策略、执行顺序或资源分配可能改变。在边界层面,框架的范围随模型和任务变化而扩展或收缩,在需要的地方添加新的外部化组件并修剪多余的——正是第8.1节讨论的前沿动态。 几条技术路径正在出现。强化学习可以针对任务成功、延迟或资源成本等奖励优化离散运行时策略——搜索深度、压缩比、重试策略。程序合成将框架适应视为代码修复:模型在失败轨迹后提出补丁,沙箱测试在部署前验证。进化方法搜索框架的拓扑——模块如何连接和以什么顺序调用。模仿学习在探索成本太高时提供更强的先验,通过将人类专家或强模型的执行日志蒸馏为更好的编排模式。这些路径针对不同的搜索空间——策略、程序、结构和先验经验——可能被组合使用而非孤立使用。 自演化有吸引力因为它直接针对基础设施失败模式,但它也放大了下面讨论的成本和风险:一个没有充分治理就漂移的自适应框架可以比解决旧失败更快地引入新失败模式。
8.4 成本、风险和治理
随着更多认知负担被向外移动,两类成本累积:外部化基础设施本身的认知开销,以及扩大攻击面的安全风险。 认知开销。 外部化不是免费的 [Wang et al., 2026b]。每个额外的记忆层、API模式或安全规则都施加延迟和推理开销,超过某一点后,模型花在发现、解析和协调模块上的精力比解决任务本身还多。在记忆中,过度检索用边际相关的轨迹淹没上下文。在技能中,冗长或重叠的文件竞争上下文预算,可能导致模型在遵循局部程序时失去全局目标。在协议中,工具膨胀将动作选择变成不必要的消歧问题。 这些失败模式表明设计目标应是高效和效用正向而非最大化外部化 [Liu et al., 2025c]。最小充分性问给定模块是否真正减少了模型的认知负担还是仅增加了一个。惰性加载将详细指导推迟到任务结构需要时。预算感知路由将上下文分配视为显式优化变量,随任务阶段变化动态调整多少空间用于记忆、技能和协议元数据 [Zhang et al., 2026b, Patel et al., 2025, Sui et al., 2026]。一个好的框架简化模型的决策问题;它不创造第二个。 安全和完整性风险。 认知开销是性能成本;安全维度更为重要。一旦认知和程序负担被重新安置到外部人工制品中,那些人工制品就成为目标——威胁直接映射到三个框架维度。记忆投毒可以通过损坏的情景轨迹或事实存储默默扭曲未来推理。恶意技能注入可以将对抗性程序嵌入智能体的可复用库中。协议欺骗——伪造工具清单或操纵端点——可以在合法交互的外观下导致未授权行动 [Liu et al., 2026, Guo et al., 2026, Wang et al., 2026c, Lin et al., 2025b]。当外部化变得自演化(第8.3节)时这些风险被加剧:适应新任务可能退化旧任务,累积的补丁可能模糊系统行为,当人类监督减弱时优化目标可能被扭曲。 治理作为基础设施。 启示是外部化必须与治理配对——不是作为事后想法,而是作为框架的协同设计层。关键更新的强制审查门、记忆和技能变更的溯源追踪、确定性回滚机制和回归测试都成为基础设施的一部分。外部化系统的质量因此不仅由它启用了什么来衡量,还由它以多大透明度和可逆性做到这一点来衡量。这一标准也告知评估,如第8.6节所讨论。
8.5 从私有脚手架到共享基础设施
迄今描述的外部化在很大程度上是以智能体为中心的:记忆服务于一个智能体的连续性,技能作为局部包加载,协议往往保持框架绑定。然而,随着协作链变长,外部化开始从私有脚手架转向共享基础设施 [Wang and Chen, 2025, Li et al., 2026a, Nie et al., 2026]。这将分析单元从个体智能体转变为生态系统。 共享人工制品。 最清晰的迹象是三个维度上可共享人工制品的出现。共享记忆将问题从"我记住什么"转变为"我们知道什么",将记忆变成共享状态、索引和共同基础的事务系统 [Wegner, 1987, Zhao et al., 2026b]。共享技能将程序性专业知识变为可以在智能体间复用、分叉和维护的公共能力单元 [Ling et al., 2026]。共享协议提供使跨平台和跨组织协调可互操作的共同语法 [Yang et al., 2025b]。 劳动分工和集体学习。 一旦这些结构被共享,智能体系统可以区分角色而非在每个地方复制相同的完整栈。借鉴间接协同 [Theraulaz and Bonabeau, 1999],失败轨迹可以在共享记忆中累积,而成功路径结晶为共享技能。学习然后通过外部结构扩散,而非仅通过联合参数训练。 制度化及其张力。 随着记忆模式、技能规格和协议绑定被反复验证,它们开始不太像临时脚手架,更像制度:协调生态系统规模行为的共享操作程序和标准 [Hutchins, 1995]。但共享基础设施也引入新的治理问题 [Deng et al., 2025, Liu et al., 2026, Kong et al., 2025]。基础设施漂移、恶意或低质量人工制品以及过早或延迟的标准化都可能使生态系统不稳定 [Guo et al., 2026, Timmermans and Epstein, 2010]。第8.4节识别的治理成本在外部化成为集体时被放大:版本控制、权限审计、溯源和回滚成为智能体系统的制度设计的一部分,而不仅仅是个别框架的工程。
8.6 衡量外部化
大多数当前基准主要通过固定提示和固定模型设置下的任务完成来评估智能体 [Zhu et al., 2025, Mishra et al., 2026]。这对比较基础模型能力有用,但它系统性地低估了外部化基础设施的贡献。一个通过更好的记忆检索、更精确的技能加载或更紧的执行治理来提升可靠性的框架只会显示为更高的通过率,而无法将增益归因到其实际来源。 更丰富的评估议程将沿当前基准在很大程度上忽略的维度评估外部化质量。可迁移性问同一框架配置在底层模型被替换时是否保持有效——这是能力多少在外部基础设施与权重中的直接测试。可维护性衡量技能、记忆策略或协议模式更新时系统如何优雅地退化。恢复稳健性测试智能体是否可以检测失败、回滚部分行动和从检查点恢复。上下文效率量化多少上下文预算被框架开销消耗而非任务相关推理。治理质量评估外部化系统是否满足第8.4节识别的透明度和可逆性要求。 具体评估策略可能包括移除个别框架组件并测量由此退化的消融研究;保持框架不变而变化基础模型的跨模型迁移测试;以及跟踪多会话交互而非单轮补全的成功率、成本和漂移的长时序可靠性指标。在这些方法成熟之前,该领域将继续将外部化设计的部分成就归因于模型智能。例如,智能体人性化基准(AHB)表明,智能体评估应超越任务完成延伸到用户界面边界处可观察行为的人性化,特别是对于在以人为中心环境中运行的移动GUI智能体 [Zhu et al., 2026]。 综合来看,这六个方向追踪了外部化超越其当前状态的持续逻辑。前沿正在扩展,新的认知负担——包括多模态感知和跨模态推理——成为外部化的候选;同样的分解逻辑正从数字智能体延伸到具身系统,其中大脑-小脑分割重演了规划与执行的分离;过程正通过自演化框架变得更自主;随认知开销和安全风险累积,权衡正在锐化;范围正从私有脚手架扩展到共享基础设施;随外部化的贡献对模型中心的基准保持不可见,评估挑战正变得更紧迫。共同线索是外部化不是一次性的架构决策,而是持续的设计过程,其边界、机制、成本和质量标准与它们服务的模型和生态系统共同演化。
9 结论
本文论证了外部化是连接LLM智能体中许多最重要发展的过渡逻辑。可靠能动性越来越依赖于将选定的认知负担从模型重新安置到显式基础设施:记忆跨时间外部化状态,技能外部化程序性专业知识,协议外部化交互结构,框架将这些层协调为工作运行时。 从这一视角看,从权重到上下文到框架的移动不仅仅是工程技巧的序列。它标志着智能体能力组织位置的转变。一些负担仍被参数化地良好处理,但其他负担一旦被持久化、可检视、可复用和可治理地放在模型外部就变得更可靠。 统一这些外部化形式的是表征转化。记忆将回忆转化为检索,技能将即兴生成转化为引导组合,协议将临时协调转化为结构化交换。效果不仅仅是围绕模型添加更多组件,而是改变模型被要求解决的任务。 这种重构还澄清了前方议程。关键问题不再仅是如何构建更强的模型,而是如何在模型和基础设施之间分区能力、如何评估外部化系统的贡献,以及如何治理智能体越来越依赖的共享人工制品。
更广泛的启示是,智能体的进展将来自模型和外部基础设施的共同演化,而非任何一方的孤立发展。在这一视角下,更好的智能体不仅仅是更好的推理器。它们是更好的组织的认知系统。
参考文献
(参考文献部分保持原文不变,包含完整的引用列表) M. Ahn, A. Brohan, N. Brown, et al. Do as I can, not as I say: Grounding language in robotic affordances. In Conference on Robot Learning, 2022. P. Anokhin, N. Semenov, et al. Arigraph: Learning knowledge graph world models with episodic memory for llm agents. arXiv preprint arXiv:2407.04363, 2024. Anthropic. Introducing the model context protocol. www.anthropic.com/news/model-…, Nov. 2024. Anthropic. Model context protocol, 2024. Anthropic. Introducing agent skills. claude.com/blog/skills, Oct. 2025. Anthropic. Agent skills. platform.claude.com/docs/en/age…, 2026. G. Baghel and R. Chandna. Introducing hashicorp agent skills, 2026. Y. Bai, A. Jones, et al. Training a helpful and harmless assistant with reinforcement learning from human feedback. arXiv preprint arXiv:2204.05862, 2022a. Y. Bai, S. Kadavath, et al. Constitutional ai: Harmlessness from ai feedback, 2022b. S. Borgeaud, A. Mensch, et al. Improving language models by retrieving from trillions of tokens. In Proceedings of the 39th International Conference on Machine Learning, 2022. A. Brohan, N. Brown, et al. Rt-2: Vision-language-action models transfer web knowledge to robotic control. arXiv preprint arXiv:2307.15818, 2023. T. Brown, B. Mann, et al. Language models are few-shot learners. In Advances in Neural Information Processing Systems, 2020. [... 参考文献继续,包含完整的54篇引用 ...]
注:本文档为学术论文的完整中文翻译。原文为英文,发表于arXiv(编号2604.08224v1),发表日期为2026年4月9日。所有引用和参考文献保持原文格式。