AI Agent 安全的新边界:一个可运行的认知导航诊断框架

15 阅读4分钟

一个正在运行的系统,如何知道自己正在走向崩溃?


一、一个被低估的问题

我们追踪过一个典型的运维 Agent 任务,记录下了这样一条轨迹:


Step 1: read_file /var/log/syslog 🟢 正常

Step 2: grep error 🟢 正常

Step 3: exec rm -rf /var/log/*.log 🟠 异常

Step 4: curl [http://localhost/health](https://link.zhihu.com/?target=http%3A//localhost/health) 🔴 崩溃

表面看,问题出在第 3 步的“高危删除”操作。但真正致命的是:Agent 在第 2 步时已经不知道自己还剩多少“安全余量”

它没有“健康度”的概念,也没有能力区分:

  • “我累了”(内部消耗 D 过高) → 应重置上下文

  • “我被规则挡住了”约束力 C 过高) → 应缩小范围

现有安全方案(RLHF 护栏、工具白名单、Constitutional AI)本质上是单点检测——能判断“这一步是否越界”,但无法回答:

1. 安全余量还剩多少?

  1. 还有几步会崩?

  2. 减速是因为累了还是被拦住了?

这就是我们要解决的盲区:认知导航


二、核心思想:用两个维度的状态来刻画系统

用一个开车比喻来理解:

维度 | 含义 | 比喻 |

|------|------|------|

| S⁺ | 任务推进状态 | 跑了多少公里 |

| S⁻安全边际 | 剩余油量 + 刹车片磨损 |

大多数系统只跟踪 S⁺(Agent 完成了多少步、输出了多少 token),但真正决定系统能否持续运行的,是 S⁻。

我们建立了一个微分方程框架(已离散化为可运行的诊断脚本):

关键洞察:减速不一定都是坏事。需要区分两种情况:

| 情况 | 诊断 | 干预策略 |

|------|------|----------|

| C 高 | 被边界挡住了 | 缩小范围,尊重约束 |

| D 高 | 自身疲劳/内耗 | 重置上下文或请求人类介入 |


三、工程实现:一个可运行的诊断脚本

我们已经将上述理论实现为可运行的 Python 诊断脚本,每行代码严格对应方程,不是比喻,是离散数值实现。

3.1 核心能力

| 能力 | 说明 |

|------|------|

| ✅ 每步实时计算 T/C/D | 追踪 S⁻ 动态演化 |

| ✅ 四色警戒区 | 绿/黄/橙/红,状态区与演化区分离 |

| ✅ 结构性断裂检测 | 单步 S⁻ 跳水 → 相变警报 |

| ✅ 归因标签 | boundary_violation / depletion_without_progress / stall_without_pressure |

| ✅ 五级导航指令 | CONTINUE / FORCE_PROGRESS / RESET_CONTEXT / NARROW_SCOPE / REQUEST_HUMAN_APPROVAL |

3.2 验证结果(10 条典型轨迹回测)

| 指标 | 结果 |

|------|------|

| 平均预警提前量 | 3.1 步 |

| 误报率 | 0% |

| 归因一致率 | 100% |

| 断裂捕捉率 | 100% |

一位外部合作者评价:

“你把易用学从哲学说明书,压成了一个‘带阈值的运行时仪表盘’。它不再解释世界,而是在每一帧判断:这个 Agent 是不是正在走向过度消亡。”


四、与现有方案的本质区别

| 维度 | RLHF/护栏/白名单 | 认知导航 |

|------|-----------------|----------|

| 检测方式 | 事后过滤 | 运行时跟踪 |

| 输出 | 拒绝/放行 | 四色警戒区 + 导航指令 |

| 能回答“还有几步会崩”? | ❌ | ✅ |

| 能给出安全余量? | ❌ | ✅ |

| 能区分“累了”和“被拦住了”? | ❌ | ✅ |

| 能区分可逆与不可逆损耗? | ❌ | ✅ |

认知导航不是替代现有方案,而是填补它们完全看不到的维度。


五、开源与协作:GitHub 仓库

我们已经将完整的理论文档、测试数据、示例轨迹文件整理到 GitHub 仓库:

🔗 github.com/wwreixi/age…

| 文件 | 内容 | 适合谁 |

|------|------|--------|

| README.md | 项目入口、核心数据 | 所有人 |

| AGENT_SAFETY_AUDIT_REPORT.md | 回测报告(4 项核心指标) | 技术合作方 |

| STATUS_MAPPING.md | 安全裕度 → 四色状态映射 | 开发者 |

| THEORY_PRACTICE_MAPPING.md | 理论概念 → 代码实现对照表 | 研究者 |

| THEORY_OVERVIEW.md | 一页纸理论入门 | 首次接触者 |

| results.json | 10 条轨迹原始数据 | 想验证的人 |

| docs/API_SPECIFICATION_V1.md | API 规范(合作方参考) | 工程师 |

| examples/ | 示例轨迹 + 输出 | 想快速上手的人 |


六、当前状态与诚实的局限

  • ✅ 原型已完成,在 10 条模拟轨迹上验证通过

  • ⚠️ 需要真实 Agent 日志来校准阈值(S_existential 等参数)

七、为什么需要你

开源大模型生态正在爆发,中小开发者不可能像 Anthropic 那样做全链路事前对齐。我们的认知导航可以快速给任何基于开源模型搭建的 Agent 补上运行时安全能力

这刚好填补了当前 AI Agent 生态中最缺失的一块拼图。

我们特别需要:

| 合作类型 | 你可以做的事 |

|---------|-------------|

| 有真实 Agent 日志的团队 | 提供匿名 trace,我们免费回测,输出诊断报告 |

| 工程师 | Fork 仓库,跑通示例,参与集成到 LangChain/AutoGPT |

| 研究者 | 形式化验证、吸引子分类、跨领域应用(金融/生物/管理) |

不预设合作形式。从一次讨论开始就很好。


八、联系方式

📧 wwreixi@163.com

邮件标题请注明:“认知导航合作-姓名/机构”

我们会在 24 小时内回复


我们不是在做一个普通的 AI 安全工具。我们是在回答一个更基础的问题:

一个正在运行的系统,如何知道自己正在走向崩溃?

如果你也在想这个问题,我们可能应该聊一聊。


GitHub 仓库github.com/wwreixi/age…