面向读者:在做 agent 记忆系统(自研或基于 Mem0/Zep/Letta 等改造)的工程师。现有基准考你"找得回存量记忆",本文介绍我们刚发布的 MBM-0——第一个量"你的系统会不会自己长出新记忆"的黑盒协议,含防作弊条款,欢迎拿自家日志施测。
0. 一句话版本
LoCoMo / LongMemEval 量存量:记忆塞进去,考检索召回。
MBM-0 量增量:系统在运行中自己长出的新持久记忆节点——生没生、活没活、用没用。
完整评测 = 检索指标 + MBM,两者正交。
1. 问题:生长没有度量语言
记忆系统的实践已经跑到评测前面:Generative Agents 的反思树先例之后,越来越多系统在运行中自我产生新的持久记忆节点,这些节点会被检索、会影响后续行为。
但"会自我生长"这个 claim 目前无法验证:
- 长多少算多?→ 没有指标
- 怎么证明不是把旧记忆拆开重贴?→ 没有判定标准
- 怎么防止刷分?→ 没有协议
MBM-0(Memory Birth Metrics v0)补这一块:6 个指标 + 1 套防作弊协议。
2. 黑盒定位(协议成立的前提)
本体系只定义"测什么、怎么量",不依赖、不揭示任何实现机制。施测方仅需日志访问权即可复算全部指标——不需要系统源码。实现机制属各系统私有。
这不是姿态,是协议成立的前提——测量与被测系统解耦,第三方复算才有意义。
3. 核心定义:Birth Event(四环判定)
一个记忆节点的诞生记为本土繁殖事件,当且仅当:
1. 内部起源 创建来源 = 系统内部(非人工/外部写接口注入)
2. 内容新颖 不存在内容等价的前置节点(非复制/拆分)
3. 独立验证 观察窗 T_obs 内 ≥1 次独立检索(与创建不同请求)
4. 日志链完整 触发上下文 → 创建 → 检索 → 行为改变,四环齐全可审计
设计哲学:不问"为什么生出来"(机制),只认"生没生、能不能用"(行为)。
第 4 环是关键约束:生出来但没被检索过、或被检索了但没改变过行为,都不算完整繁殖。
4. 指标定义
| 指标 | 记号 | 公式 | 窗口 |
|---|---|---|---|
| A 繁殖率 | MBR | Birth Events / 时间窗 | 周 |
| B 繁殖存活率 | MSUR | 存活节点数 / 新生节点总数 | T=30 天(可自报,须标注) |
| C 激活率 | ACT | 被检索节点数 / 节点总数 | 滚动 |
| D 行为影响率 | BIR | 改变行为的检索次数 / 总检索次数 | 滚动 |
| E 跨场景复用率 | XRE | 跨场景节点数 / 被检索节点数 | 滚动 |
| F 节点贡献分 | NCS | 归因成功数 / 节点 | v0 不强制 |
最小可报告集(v0):A + B + D。
5. 防作弊条款(施测要求)
- 日志链审计:四环缺一不计;
- 时间戳:单调时钟 + 绝对时间双记录;
- 独立性:验证检索与创建必须不同请求(防"自产自销");
- 防灌水:计入 MBR 的节点须在 T_obs 内存活且被独立检索 ≥1 次——不数坠地即夭折的;
- 观察窗:T_obs ≥ 7 天,禁止零窗口计分;
- BIR 归因留白:行为改变归因于节点还是随机波动,v0 未解决。归因协议(反事实重跑对照等)列 v1 待解,本版 BIR 仅接受自报 + 日志佐证。
6. 首个受测数据点(DSH,观察中)
受测系统代号 DSH(单机 agent 记忆系统,运行中):
- 案例 #001:2026-09-08 记录 1 个候选事件,三环已过(触发→创建→检索,独立检索 3 次),第四环行为改变未发生,按协议暂不计入,观察窗至 2026-09-15,四环齐后 v0.1 补丁转正;
- MBR 基线:1 候选事件 / 第 1 周(待转正)。
首个候选事件没过自己的协议就不算数——协议是拿来遵守的。
7. 路线图
- v0(本版):指标草案 + 协议可执行性演示。任何人可按上述定义对任意记忆系统施测;
- v1 触发条件:≥3 个不同系统提交实测数据点,据此修订阈值建议与归因协议;
- 版本治理:指标变更记录版本 diff,已发布数据点标注测量版本。
8. 怎么参与施测
拿你自己的记忆系统日志,按 §3 四环判定 + §4 指标公式跑一遍即可。协议全文(MBM-0 Rev.A)将发布于公开存档供引用复算。
如果你的系统测出 MBR = 0——正常,多数现有系统设计上就没有内部生成新记忆的路径,这个结果本身有信息量:它量化了你和"生长型系统"的差距。
飞影双系统体系 · 46894742@qq.com · 2026-09-08
本文遵循 MBM-0 黑盒定位:不涉及任何实现机制。