一、全维度技术分类 & 原理、特点、落地场景
(一)丢弃 / 保留类(规则筛选,实现最简单)
核心:依据时间、重要性、访问频次直接剔除低价值记忆,不做内容改写。
- 滑动窗口原理:仅保留最近 N 轮对话 / 时间步,历史内容全部丢弃;衍生「重要窗口」,在窗口外额外留存全局关键信息。特点:轻量易实现,适合短会话任务;缺陷是完全丢失长期上下文。场景:在线客服、单轮代码调试、临时问答 Agent。
- 重要性 / 相关性打分原理:用小模型、LLM 或规则对记忆打分,低于阈值则丢弃;结合当前任务判断内容相关性。代表方案:斯坦福 Generative Agents 反思机制。落地技巧:大模型标注样本 + 微调轻量分类模型,降低推理成本。场景:通用陪伴、多轮交互 Agent。
- 遗忘曲线模型原理:模拟艾宾浩斯遗忘规律,记忆存活概率随时间、访问次数衰减,久未调用的非核心记忆优先淘汰。特点:更贴合人类记忆逻辑,自然度高。场景:教育 Agent、长期陪伴型智能体。
(二)摘要重构类(信息蒸馏,保留核心语义)
核心:不删除原始信息,将多条内容合并、凝练为精简文本,属于语义级压缩。
- 滚动摘要原理:上下文达到长度阈值时,LLM 生成全局摘要,用摘要替换原始历史,搭配近期对话组成新上下文。常规格式:系统提示 + 历史摘要 + 最新轮次对话。问题:摘要会持续变长,易丢失细粒度信息;优化方案:双层摘要(高层总结 + 时间戳关键事件)。
- **分层摘要树(递归摘要,代表:MemGPT)**原理:记忆组织为树形结构,叶子节点 = 原始事件,父节点 = 子节点摘要,根节点 = 全局总览;内存不足时自底向上合并压缩,支持按需调取历史片段。特点:多粒度留存信息,可随机访问历史,区分冷热记忆。场景:长周期复杂任务、多场景交互 Agent。
- 专用压缩模型原理:训练独立压缩模型,将长文本转为固定长度向量 / 特殊 Token(Gist Token、AutoCompressors 思路),可直接被主 LLM 解析。特点:压缩比极高;缺点是需要额外训练,跨任务泛化能力弱。
(三)向量检索类(存算分离,工业主流长期记忆方案)
本质:外部化存储 + 按需检索,间接压缩上下文长度,并非纯文本压缩。
-
基础流程记忆文本向量化 → 存入向量库;Agent 交互时,将当前请求作为查询,检索 Top-K 相似记忆,仅拼接检索结果进上下文。
-
增强压缩技巧
- 重排序:向量粗筛后,交叉编码器二次打分,进一步精简数量;
- MMR:剔除重复内容,提升信息密度;
- 时间衰减:结合时间权重降权老旧记忆;
-
**反思式压缩(Agent 专属)**原理:定时触发自我反思,提炼高阶结论,删除底层琐碎原始记忆(如提炼「用户不喜红色」,删除多条相关零散对话)。代表:Generative Agents、Voyager 游戏 Agent。场景:工业级长期运营 Agent、机器人 / 游戏智能体。
(四)模型原生压缩(底层改造,偏向学术 / 深度定制)
核心:修改 LLM 结构或上下文计算逻辑,从模型层实现记忆压缩。
- **地标 Token(Landmark Tokens)**原理:新增专属特殊 Token,模型自主触发读写外部记忆矩阵,自动完成长序列压缩。
- Transformer-XL 片段递归原理:缓存前序片段隐藏态,作为后续片段上下文,依托模型状态实现序列压缩。局限:跨任务、跨场景时效果下滑,Agent 场景落地少。
(五)补充:写入阶段前置压缩(落地增效关键点)
多数方案聚焦读取阶段,写入时预处理可大幅降低后续压力:
- 实体抽取:将自然语言转为「实体 - 属性 - 关系」结构化数据;
- 去重合并:整合同类信息,增量更新而非新增记录;
- 模式甄别:常规信息存结构化数据,仅异常 / 特殊内容保留原文。
二、场景化选型建议
| 应用场景 | 推荐组合方案 | 核心原因 |
|---|---|---|
| 简易客服、短时闲聊 | 滑动窗口 + 重要事件白名单 | 低成本、响应快,满足基础需求 |
| 代码辅助 Agent | 向量检索(定向存储代码 / 报错) | 精准定位片段,细节不可丢失 |
| 游戏 / 机器人控制 | 滚动摘要 + 反思式压缩 | 抽象策略逻辑,梳理行为脉络 |
| 长期陪伴、心理 / 教育 Agent | 遗忘曲线 + 分层摘要树 | 兼顾长期记忆与自然遗忘逻辑 |
| 高端定制、追求最优效果 | MemGPT 分层摘要 + 向量检索 + 定期反思 | 模拟人类记忆体系,综合性能最强 |
通用落地原则:行业主流为混合策略短期记忆:滑动窗口;中期记忆:滚动摘要;长期记忆:向量库 / 图数据库 + 结构化存储;配套写入预处理 + 定期记忆迭代(更新、降权、删除失效信息)。核心评估指标:上下文长度压缩≥80%,任务决策质量下降≤5%。
三、面试精简版(分点作答,口语化、易背诵)
版本 1(通用全面版,适合技术面常规提问)
Agent 记忆压缩主流分为五大类,工业界多组合使用:
- 滑动窗口 + 重要性筛选最简单的方案,只保留最近若干轮对话,超出部分直接丢弃。同时用模型或规则给记忆打分,把高价值信息单独留存。优点是实现成本极低,适合短会话场景。
- 摘要类压缩分为普通滚动摘要和分层摘要。每隔一定轮次用大模型总结历史对话,精简上下文;进阶做法是做金字塔式分层摘要,避免摘要无限变长,适合长周期交互。
- 向量检索方案目前工业界长期记忆的主流。将历史记忆转为向量存入向量数据库,交互时只检索相关内容拼入上下文,大幅缩短输入长度。还可搭配重排序、时间衰减进一步优化。
- 专用压缩模型训练独立模型把长文本压缩成少量虚拟 Token 或向量,压缩效率很高,但需要额外训练,泛化性一般。
- 结构化记忆把对话抽取成实体、关系、时间三元组存入图数据库,用结构化数据替代长文本,体积更小且利于推理。
实际落地一般混搭:短期用滑动窗口保速度,中期靠摘要梳理脉络,长期用向量库 / 图库存事实,还要定期清理、更新过时记忆。
版本 2(极简版,快速应答)
常见四类记忆压缩方法:
- 规则筛选:滑动窗口、重要度打分、遗忘机制,直接剔除无用记忆;
- 文本摘要:滚动摘要、分层递归摘要,凝练语义减少文本长度;
- 向量检索:外部存储 + 按需召回,间接压缩上下文,是长期记忆首选;
- 结构化 / 模型压缩:抽取知识三元组,或用专用模型、特殊 Token 做深度压缩。
落地以混合方案为主,根据会话长短、任务类型灵活搭配。