title: 认知科学到 AI Agent 记忆分类的完整映射
tags: [agent, memory, cognitive-science, ai]
date: 2026-07-13
概述
AI Agent 记忆系统的分类框架并非凭空发明——它几乎一对一地搬运自 20 世纪下半叶的认知心理学研究。理解这个理论谱系不是为了学术正确,而是为了避免重蹈认知科学已经走过的弯路。
本文追踪四个核心认知理论到 AI Agent 工程实现的完整映射路径,并指出哪些 AI 设计决策背后的认知依据"用对了",哪些"用错了",以及哪些认知发现至今在 AI 工程中被忽视。
一、Atkinson & Shiffrin 多存储模型(1968)→ 存储层级架构
1.1 理论要点
Atkinson 和 Shiffrin 在 1968 年提出了关于人类记忆的最经典模型——多存储模型(Modal Model / Multi-Store Model):
上图:左侧为 Atkinson & Shiffrin 三级存储模型,右侧为 AI 工程对应,底部为 LangGraph 两层架构实现。
三个核心主张:
| # | 主张 | AI 工程含义 |
|---|---|---|
| 1 | 人类有三种结构上分离的记忆存储器 | AI 的 Checkpointer / Vector DB / KV Store 对应不同存储层 |
| 2 | 信息通过控制过程(如复述、编码策略)在存储之间串联传递 | @before_model 钩子 = 注意力控制;OnSessionEnd = 编码传递 |
| 3 | 每一步都可能丢失信息(衰减、干扰、位移) | 遗忘策略不是可选的,是信息处理的本质属性 |
1.2 AI 映射
这个模型几乎是所有 AI Agent 框架存储设计的直接理论模板:
| Atkinson-Shiffrin | AI Agent 对应 | 具体体现 |
|---|---|---|
| 感觉记忆 | Perceptual Memory(Embedding 层) | 所有输入首先被编码为向量 |
| 短期记忆 | Working Memory(Context Window) | 容量有限,持续一次推理 |
| 长期记忆 | Episodic + Semantic Memory(向量 DB + KV Store) | 跨会话持久化 |
LangGraph 的两层架构是这个映射的最直接体现:
(详见上图底部区域——LangGraph Agent 分叉出 Checkpointer 和 Store 两层)
1.3 AI 工程对模型的偏离
做对了的:
- 三层分离架构本身就是对的,几乎所有主流框架都遵循这个模式
做错了的 / 没做的:
- 遗忘衰减的强度被严重低估:Atkinson-Shiffrin 强调 STM 如果不复述会在 20-30 秒内衰减。AI 的 Context Window 没有内置衰减机制——旧消息和新消息权重相同,导致长对话中 Agent 对早期上下文的注意力被稀释
- 位移效应(Displacement) :当 STM 满时,新信息会"挤出"旧信息。这在 AI 的 token 截断中确实发生,但大多数框架没有智能选择"挤掉什么"——直接按顺序截断会丢失关键上下文
二、Tulving 的情景 vs 语义二分法(1972)→ Episodic/Semantic 存储分离
2.1 理论要点
Endel Tulving 在 1972 年提出的二分法可能是认知心理学对 AI Agent 设计影响最大的单个理论。他区分了两种长期记忆:
上图:左侧为 Tulving 的情景/语义二分树,右上为 AI 工程对应,底部为 Generative Agents 实现流程,右侧为关键争议点面板。
Tulving 还提出了一条关键区分线——自主意识(Autonoetic consciousness)vs 知晓意识(Noetic consciousness) :
- 情景记忆唤起时伴随"我在场"的感觉(心理时间旅行,Mental Time Travel)
- 语义记忆唤起时只有"我知道这个事实"的感觉,没有时间坐标
2.2 AI 映射
这个存储层面的二分法是 AI 记忆架构最核心的设计原则:
| Tulving 概念 | AI Agent 对应 | 存储方式 | 检索方式 |
|---|---|---|---|
| 情景记忆 | Episodic Store | 向量 DB + 时间戳索引 | 语义相似度 × 时间衰减 × 重要性 |
| 语义记忆 | Semantic Store | KV Store / Memory Blocks | 精确键匹配或全量注入 |
| 心理时间旅行 | (目前缺失) | — | AI 检索到情境事件但没有"我曾在那里"的意识 |
Generative Agents(Park et al. 2023)直接实现了 Tulving 的框架:
(详见上图底部——Memory Stream → Retrieval → Reflection 三段流程)
2.3 AI 工程对模型的偏离
做对了的:
- 区分 Episodic 和 Semantic 两类存储——几乎所有框架都做了
- Episodic 带时间戳、Semantic 不带——正确的结构设计
做错了的 / 争议点:
- Reflection 产物应该放在哪? Generative Agents 把 reflection 写回 Memory Stream(episodic),而 LangGraph 把它写到 semantic namespace。Tulving 的框架支持后者——语义记忆应该独立存储
- 语义记忆的"自编辑" :Letta 的 Memory Blocks 允许 Agent 自行编辑语义记忆(以 tool calling 方式),这在认知上激进但创新——人类确实可以修正自己的知识,但 Tulving 模型中没有"自编辑"机制
- 情景记忆的 re-experiencing 缺失:人类回忆情景时伴随主观体验;AI 检索到一段记录只是匹配了向量,Agent 不会"感觉自己曾在那里"
三、Baddeley 的工作记忆模型(1974)→ Context Window 管理
3.1 理论要点
Alan Baddeley 在 1974 年提出工作记忆模型,反对 Atkinson-Shiffrin 把短期记忆视为"被动存储"。Baddeley 的核心主张:短期记忆是一个主动加工系统。
原始模型(1974) :
上图:上半为 Baddeley 原始模型(中央执行器 + 语音回路 + 视空间画板 + 情景缓冲区),下半为 AI 工程中 Context Window 的对应组件映射,右侧为 AI 工程偏离分析。
关键发现:
| 发现 | 含义 |
|---|---|
| 容量限制:7±2 个 chunks | 不是"内存小",是注意力资源有限 |
| Chunking:专家把信息组织成更大的 chunks | 可训练的——象棋大师一次记整个棋局 |
| 复述:语音回路通过 subvocal rehearsal 维持信息 | 主动过程,不是被动残留 |
| 双任务干扰:同时用语音回路 + 视空间画板比用同一资源做两件事容易 | 多模态 = 多通道 = 更高吞吐 |
3.2 AI 映射
Baddeley 模型是理解 AI Agent Context Window 不是存储而是加工车间的关键理论依据:
| Baddeley 组件 | AI Agent 对应 | 功能 |
|---|---|---|
| 中央执行器 | LLM Attention 机制 | 在上下文中分配注意力、选择信息、推理 |
| 语音回路 | (无精确对应) — 但 @before_model 注入和消息追加可类比 | 维持语言信息的活跃状态 |
| 视空间画板 | 多模态输入处理(图片/音频 → embedding) | 非语言信息的编码和操作 |
| 情景缓冲区 | 上下文组装阶段(系统提示 + 检索结果 + 当前输入) | 多源信息整合为统一上下文 |
Context Window 的 Baddeley 式解读:
(详见上图下半区域——Working Memory = Context Window 内嵌四种 Baddeley 组件映射)
3.3 AI 工程对模型的偏离
做对了的:
- 认识到 Context Window 不止是"存消息",而是模型推理的唯一场所
- 多源信息注入(语义+情景+系统提示)对应情景缓冲区整合
做错了的 / 没做的:
- 没有多通道独立容量管理:Baddeley 模型的核心发现是语音回路和视空间画板有独立的容量限制——同时处理文字和图片不会互相干扰,但处理两段文字会。AI 的 Context Window 把所有模态混在一起算 token,没有任何模态感知的容量管理
- Chunking 策略几乎不存在:人类专家能通过 chunking 把 7±2 的限制扩展到巨大的信息量(象棋大师一次记一个棋局=很多棋子)。大多数 AI Agent 框架没有智能 chunking——消息原样堆叠
- 复述(Rehearsal)被简化为 tokening:人类的复述是主动的、有选择的。AI 的"复述"是把消息保留在上下文中——被动保留而非主动加工
四、Cohen & Squire 的陈述性 vs 程序性(1980)→ System Prompt / Fine-tuning
4.1 理论要点
Neal Cohen 和 Larry Squire 在 1980 年通过对遗忘症患者 H.M. 的研究,发现了长期记忆的一个关键分裂:
上图:左侧为 Cohen & Squire 的陈述性/程序性二分模型(含 H.M. 关键标注),右侧为程序性记忆在 AI 中的四个层次(从浅到深),底部为 AI 工程映射与偏离分析。
H.M. 案例的关键启示:
- H.M. 因治疗癫痫切除了海马体,之后无法形成新的陈述性记忆(你能每天向他自我介绍,他永远不认识你)
- 但他可以学习新的程序性技能(镜像绘画任务:他自己不记得练过,但成绩显著提高)
- 这证明两种记忆的神经基础是分离的——AI 中也应分离
4.2 AI 映射
Cohen & Squire 的二分法解释了 AI Agent 中一个常被混淆的问题——为什么"改了 System Prompt 但模型还是老样子" :
| Cohen & Squire | AI Agent 对应 | 特性 |
|---|---|---|
| 陈述性记忆 | Episodic + Semantic Memory | 可被检索、读取、修改——通过向量搜索或 KV 读取 |
| 程序性记忆 | System Prompt + Tool Definitions + Fine-tuned Weights | 始终生效的、通过行为体现的——不改系统提示就不会变 |
程序性记忆在 AI 中的四个层次(从浅到深) :
(详见上图右侧——System Prompt → Tool Definitions → Few-shot Examples → Fine-tuned Weights 四层递进)
4.3 AI 工程对模型的偏离
做对了的:
- 区分"可以被检索修改的"(陈述性)vs"始终生效的"(程序性)
- System Prompt = 程序性记忆的实现方式
做错了的 / 没做的:
- 程序性记忆的动态固化路径缺失:H.M. 可以学会新技能但不知道自己会——AI 也可以从大量对话中学到某种行为模式后固化为 Fine-tune 数据或 System Prompt 规则,但目前很少有框架做这个闭环
- Voyager 是例外:它的 Skill Library 是可执行代码——Agent 学会一个技能后以代码形式存储,下次直接调用。这是程序性记忆的最纯粹实现
- 表现 ≠ 知识:Cohen & Squire 强调程序性记忆"知道怎么做但不知道为何"。AI 的 System Prompt 修改后 Agent 行为改变,但它"不知道自己变了"——这在可解释性和调试上造成巨大困难
五、综合映射总表
| 认知理论 | 年份 | 核心主张 | AI 对应组件 | 映射准确度 | AI 缺失/偏差 |
|---|---|---|---|---|---|
| Atkinson & Shiffrin | 1968 | 感觉→短期→长期三级存储 | Perceptual → Working → Episodic/Semantic | ★★★★ | 遗忘衰减被低估;缺少智能位移机制 |
| Tulving | 1972 | 情景 vs 语义二分 | Episodic Store vs Semantic Store | ★★★★★ | Reflection 产物位置争议;缺乏 re-experiencing |
| Baddeley | 1974 | 工作记忆是主动加工系统 | Context Window + Attention | ★★★☆☆ | 无多通道独立容量;无智能 chunking;复述是被动而非主动 |
| Cohen & Squire | 1980 | 陈述性 vs 程序性二分 | 可检索存储 vs System Prompt/Tools/Weights | ★★★★☆ | 缺少程序性记忆的动态固化闭环 |
| Baddeley (修订) | 2000 | 情景缓冲区整合多源信息 | @before_model 钩子组装上下文 | ★★★★ | 缓冲区的容量限制在 AI 中没有对应 |
★ = 该理论有多少被正确理解和应用在 AI Agent 工程中
六、被 AI 工程忽视的关键认知发现
6.1 编码特异性原则(Encoding Specificity,Tulving & Thomson 1973)
发现:记忆提取的成功取决于提取环境与编码环境的相似度。你在水下学的东西,在水下考试比在陆地上考更好。
AI 对应(缺失) :Agent 在当前对话中形成的记忆,下次检索时没有"场景匹配"机制。如果用户在讨论 Python 时说了"我不喜欢 async",下次在讨论 React 时 Agent 不应该注入这条偏好——但现有框架没有上下文门控。
可行的工程化:为每条 Episodic 记录存储"编码上下文"(当时的对话主题、技术栈),检索时加权匹配当前上下文。
6.2 间距效应(Spacing Effect,Ebbinghaus 1885)
发现:分散学习比集中学习效果更好。同样时间,分 3 天每天学 1 小时比 1 天学 3 小时记得更牢。
AI 对应(缺失) :AI 的 episodic 存储中,同一天堆积的大量相似事件(如用户连续 20 轮调试同一个 bug)应该被压缩为一条"我今天花了 2 小时修 login 页的样式 bug"而不是 20 条独立记录。
6.3 遗忘曲线(Forgetting Curve,Ebbinghaus 1885)
发现:遗忘呈指数衰减——学到后 20 分钟内忘 40%,1 天后忘 66%,之后衰减趋于平缓。
AI 对应(部分做了) :Generative Agents 的 recency 评分用指数衰减 \text{score} = e^{-\lambda \cdot \text{hours}}。但大多数框架没有区分"重要信息"和"普通信息"的衰减速率——重要的事应该忘得更慢(重要性调节衰减因子)。
6.4 错误记忆(False Memory,Loftus & Palmer 1974)
发现:人类的记忆是重构性的(Reconstructive) 而非回放性的(Reproductive) ——每次回忆都在"重新构建"那件事,容易被暗示或误导。
AI 对应(严重缺失) :AI 的 episodic 检索是精确的向量匹配——没有任何"重构"概念。这让 AI 的记忆"过于精确"——对人类反而是不自然的。更重要的是:Reflection 机制本身就是在"重构"记忆(从多条原始记录提炼一条 insight),它可能产生与原始事件不同的解释,就像人类的 false memory。目前没有任何框架检测或防止 Reflection 产生的"错误洞察"。
七、总结:认知科学给 AI 的三个终极教训
- 分离不等于割裂:Atkinson-Shiffrin 的"三种存储器"和 Tulving 的"情景/语义二分"都在说"分开存",但 Bandura 的交互决定论提醒我们——这些记忆之间需要持续的交互通道。AI 的 Reflection、注入、固化就是这些通道。
- 遗忘是特征不是 bug:从 Ebbinghaus 的遗忘曲线到 Loftus 的错误记忆,认知科学反复证明——遗忘和错误是有效记忆的必要代价。AI Agent 如果试图"记住一切",检索质量反而下降。
- 记忆是加工不是存储:Baddeley 的终极贡献——工作记忆的核心不是"能存多少"而是"能加工多快"。AI 的 Context Window 不应该被当作消息仓库,而应该被当作推理车间。
参考文献
- Atkinson, R. C., & Shiffrin, R. M. (1968). Human memory: A proposed system and its control processes. Psychology of Learning and Motivation, 2, 89-195.
- Baddeley, A. D., & Hitch, G. (1974). Working memory. Psychology of Learning and Motivation, 8, 47-89.
- Baddeley, A. D. (2000). The episodic buffer: a new component of working memory? Trends in Cognitive Sciences, 4(11), 417-423.
- Cohen, N. J., & Squire, L. R. (1980). Preserved learning and retention of pattern-analyzing skill in amnesia: dissociation of knowing how and knowing that. Science, 210(4466), 207-210.
- Ebbinghaus, H. (1885). Memory: A Contribution to Experimental Psychology.
- Loftus, E. F., & Palmer, J. C. (1974). Reconstruction of automobile destruction. Journal of Verbal Learning and Verbal Behavior, 13(5), 585-589.
- Tulving, E. (1972). Episodic and semantic memory. In E. Tulving & W. Donaldson (Eds.), Organization of Memory.
- Tulving, E., & Thomson, D. M. (1973). Encoding specificity and retrieval processes in episodic memory. Psychological Review, 80(5), 352-373.
- Park, J. S., et al. (2023). Generative Agents: Interactive Simulacra of Human Behavior. UIST 2023.
- Packer, C., et al. (2023). MemGPT: Towards LLMs as Operating Systems. arXiv:2310.08560.
- Wang, G., et al. (2023). Voyager: An Open-Ended Embodied Agent with Large Language Models. arXiv:2305.16291.