从 Memory 到 Skill:长周期 AI Agent 如何实现持续进化

0 阅读10分钟

历史记录能帮 Agent 想起过去,却不能保证它下一次真的会按正确方法做。MSCE 想补上的,正是“记得”和“会做”之间的这段空白。

01 ​Agent ​ 能记住,不等于下次会做

Agent 已经不只是在对话框里给出一个答案,它们会进代码库找文件、打开浏览器查资料、调用工具继续往下做。但随着任务越拉越长,问题也跟着冒出来:隔几天再遇到类似问题,它能不能少走弯路?

这正是记忆张量MemTensor 联合中国科学技术大学、香港理工大学、福州大学和西安交通大学的研究人员提出 MSCE(Memory-Skill Co-Evolution)的切入点。它不只把长期记忆当作可检索的历史文本,而是希望让系统从一次次交互里挑出可信的经验,再把它们整理成可复用的策略和技能。

换句话说,MSCE 要解决的不是“怎样多记一点”,而是“记住以后,怎样真的学会”。

1.png

02 ​ 一段经历,什么时候才值得留下?

如果把聊天记录、工具返回和操作轨迹都塞进长期记忆,Agent 的确“记得更多”了。但它下一次做事时,还是得把这些材料重新读一遍、重新判断一遍。这很像把一整本工作日志交给新人:东西不少,却没有告诉他,哪一页才是真正能照着做的经验。

更难的是分辨。

任务成功了,不一定是方法真的对,也可能只是当时的环境刚好配合。任务失败了,也不代表整条路径都错了,里面可能有一步本来是对的,只是没来得及走完。

如果不做筛选,直接把原始轨迹固化成技能,试错过程、偶然条件,甚至只适用于那一次任务的细节,都会被一起打包带走。下一次复用的,可能不是经验,而是上一次留下来的偏差。

MSCE 不把“多存一点”当作答案,它先问三个更具体的问题:哪些经验值得留,哪些做法可以抽出来复用,以及一条策略满足什么条件,才够资格变成技能。

2.png

03 ​ 这不是三层笔记,而是三套不同的更新规则

MSCE 没有把所有信息塞进同一个记忆池,而是将其拆分为 L1、L2 和 L3 三层。三层记忆不仅承载的内容不同,写入与更新机制也各不相同。

L1 是证据层。

一条 L1 不是一句事后总结,而是一组“状态、动作、观察、局部反思、价值”的决策单元。最后这个价值在任务结束前并不存在:系统先把轨迹留住,等 episode 的终局反馈到来,再回填到具体步骤。

为了控制存储和隐私风险,L1 保存的是归一化证据——截短的状态文本、动作文本、结构化工具元数据和受限的工具输入输出,L2、L3 只保留这些证据的 ID,不再复制原始记录。

L2 才是“做法”层,但也不是见过一次就归纳。

在 MSCE 中,只有步骤价值达到阈值 v_min 的 L1 证据,才会进入策略抽取。系统先通过向量相似度检索近邻,再核对领域标签、工具类型和归一化后的错误签名。若匹配到已有策略,新证据将用于更新该策略。若没有匹配项,则进入按确定性模式签名划分的候选池。

只有同一候选桶里,至少积累了来自 n_min 个不同 episode 的证据,系统才会归纳出一条新策略。

每条 L2 策略都包含触发条件、执行过程、验证或回退方式、适用边界和支撑证据。我们进一步引入“策略增益” G,用于衡量策略的有效性。它比较使用该策略的轨迹平均价值,与同一评估池中未使用该策略轨迹的混合基线。G 并非严格意义上的因果效应,而是用于决定策略继续保留、进入技能候选或被退役的启发式信号。

L3 则不再写“下一步怎么做”,而是抽取环境事实、动作—响应规律和约束条件。

L3 试着回答:这个环境有什么规律?如果多条 L2 策略总在同一个领域出现,系统会继续整理这里的实体、结构、工具依赖和任务约束,并把相关策略留在一起。

例如,智能体在多个软件环境中反复发现“基础镜像缺少系统依赖,仅安装 Python 包无法解决问题”,这就不再只是一条操作经验,而可以上升为对环境依赖关系的认知。

算法上的分工

L1 先把每一步变成可追溯证据;

L2 要跨 episode、过价值阈值,才形成可修订策略;

L3 只从多条稳定策略里抽环境规律。

后面的技能不是从“记忆很多”里长出来的,而是从这三道筛选里长出来的。

04 ​ 一个最终结果,怎样分给中间的每一步?

长任务常常只有一个最终结果:完成,或者没完成。可一个任务做成了,不代表前面的每一步都对,做错了,也不代表每一步都没有价值。只拿最后的成败给整条轨迹打分,很容易把真正有用的操作和无效试错混在一起。

MSCE 因此设计了一套“反思加权的价值回填”办法。最后一步直接继承终局反馈 R_i;再沿轨迹往前,每一步都在“终局反馈”和“下一步已经回填出的价值”之间取值。α_t 决定这一步更相信哪一边,γ 则控制后续价值往前传递时的折扣。

Vt​ = αtRi​ + (1 − α​​t​*)γVt+1*

α_t 不是按反思写得长不长来定,而由一个反思评分器根据局部上下文判断:这段反思是否忠实、具体、能解释因果、并且可迁移。空话、同义反复或没有证据支撑的反思,权重会被压到很低甚至为零。对文本反馈,MSCE 再综合目标完成度、执行过程质量和用户满意度,形成 R_i。

这样,一条轨迹里的步骤不必再拿同样的分数:真正推动任务往前走、同时能解释清楚的操作会被留下。

05 ​ 从策略到技能,要再过两道门

在 MSCE 中,完成一次任务并不会直接生成一项技能。技能需要从经过持续验证的 L2 策略中进一步筛选,并转化为可被系统调用的能力单元。

首先,策略需要通过证据与增益检验。其支撑轨迹必须仍然有效,且策略增益超过晋升阈值,才有资格进入技能候选阶段。

G(f​​*(2)) > θG*

第二道门是稳定性:新的近期证据要能继续吻合现有的触发条件、步骤和适用边界,而不是每来一个样本就需要重写策略。

通过后,正向证据用来归纳共同流程;反向证据不被丢掉,而是用来收紧边界、写出反模式。技能因此不只回答“怎么做”,也回答“什么时候别做”。

真正让它不只是一次语言生成的,是后面的确定性校验。

系统会检查技能名称、前置条件、有序步骤、示例、工具列表和决策指导等字段是否齐全,引用的证据 ID 必须来自支撑集合,工具也必须出现在证据轨迹的白名单里。再通过两项轻量覆盖测试,防止它编造从未出现过的命令,或偏离保留下来的轨迹。任何一项失败,草稿直接丢弃,不进入可调用技能库。

最终生成的技能包含触发条件、执行过程、验证规则、适用边界、证据锚点、决策指导和可靠度等信息。可靠度不会因单次成功直接记为 100%。MSCE 采用平滑成功率,避免小样本导致结果被高估。

用户纠正或拒绝会降低技能可靠度,并可能收缩其适用边界。只有经过连续成功验证,技能才会从试用状态进入激活状态。若多次执行失败,则会被归档。

η = (npass​ + 1) / (ntrial​ + 2)

06 ​ 两组评测,结果怎么样?

我们分别在 EvoAgentBench 和 LoCoMo 上对 MSCE 进行了评测。EvoAgentBench 覆盖信息检索、数学推理、软件工程、代码实现和知识工作五类 Agent 任务,LoCoMo 主要考察长对话记忆能力。面先看 EvoAgentBench 的结果。

3.png

和各领域最强的非 MSCE 基线相比,MSCE 在信息检索、数学推理、软件工程和知识工作上的 Pass@1 分别提高 4.61、4.00、15.39 和 5.17 个百分点。代码实现任务里,它以 61.54% 的 Pass@1 并列最佳,平均交互轮数从 3.9 降到 2.0。

在 LoCoMo 评测中,MSCE 的总体评审得分为 61.23,总体 F1 为 49.89,较最强基线 SkillFlow-Evolve 分别提升 2.01 和 1.18 分。除软件工程外,MSCE 在多数任务中同时提升了效果与效率。在软件工程任务中,成功率提升更为明显,成本则小幅增加。

07 ​ 离开原任务,这套方法还管用吗?

一条技能如果只能在第一次学到它的任务里生效,价值有限。研究团队又测了六组跨领域迁移:信息检索到数学推理、数学推理到代码实现、代码实现到软件工程,以及知识工作到信息检索等。

4.png

在六组跨领域迁移实验里,Pass@1 都有提升,幅度为 2.56 至 5.13 个百分点,平均提升 3.93 个百分点,其中四组还降低了任务成本。结果说明,MSCE 沉淀下来的不是某一道题的解法,而是可以带到新场景里的操作结构、验证方式和环境认知。

我们进一步观察了从 p0 到 p100 智能体的持续学习过程。随着记忆和技能不断积累,信息检索、数学推理和软件工程三类任务的 Pass@1 都在持续上升,单位成功任务的归一化成本则在前期探索阶段有所增加,之后逐步回落。

5.png

08 ​ 记忆不该只是档案

做 Agent 记忆,常见的思路是两件事:多记一点,或者检索得准一点。MSCE 追问的是第三件事:记起来之后,怎样把经验变成下次还能用、出了问题也能改的能力?

在这套框架里,轨迹不只是日志,而是证据;策略不只是一次总结,而是带着触发器、边界和验证条件的程序;环境认知不只是模型的自由联想,而是和策略、轨迹相连的结构化信息。技能也不是临时写出的一句提示词,它有来处、有可靠度,也会经历试用、修正和归档。

MSCE 真正想处理的,不是给 Agent 多加一点存储空间,而是让它对自己做过的事有更好的记性,也有更谨慎的判断:什么该相信,什么能复用,什么还需要继续改。

论文与项目

​论文地址:​arxiv.org/abs/2607.16…

开源代码:github.com/MemTensor/M…


关于 MemOS

MemOS 为 AI 应用构建统一的记忆管理平台,让智能系统如大脑般拥有灵活、可迁移、可共享的长期记忆和即时记忆。

作为记忆张量首次提出“记忆调度”架构的 AI 记忆操作系统,我们希望通过 MemOS 全面重构模型记忆资源的生命周期管理,为智能系统提供高效且灵活的记忆管理能力。