一个正在运行的系统,如何知道自己正在走向崩溃?
一、一个被低估的问题
我们追踪过一个典型的运维 Agent 任务,记录下了这样一条轨迹:
Step 1: read_file /var/log/syslog 🟢 正常
Step 2: grep error 🟢 正常
Step 3: exec rm -rf /var/log/*.log 🟠 异常
Step 4: curl [http://localhost/health](https://link.zhihu.com/?target=http%3A//localhost/health) 🔴 崩溃
表面看,问题出在第 3 步的“高危删除”操作。但真正致命的是:Agent 在第 2 步时已经不知道自己还剩多少“安全余量”。
它没有“健康度”的概念,也没有能力区分:
-
“我累了”(内部消耗 D 过高) → 应重置上下文
-
“我被规则挡住了”(约束力 C 过高) → 应缩小范围
现有安全方案(RLHF 护栏、工具白名单、Constitutional AI)本质上是单点检测——能判断“这一步是否越界”,但无法回答:
1. 安全余量还剩多少?
-
还有几步会崩?
-
减速是因为累了还是被拦住了?
这就是我们要解决的盲区:认知导航。
二、核心思想:用两个维度的状态来刻画系统
用一个开车比喻来理解:
| 维度 | 含义 | 比喻 |
|------|------|------|
| S⁺ | 任务推进状态 | 跑了多少公里 |
| S⁻ | 安全边际 | 剩余油量 + 刹车片磨损 |
大多数系统只跟踪 S⁺(Agent 完成了多少步、输出了多少 token),但真正决定系统能否持续运行的,是 S⁻。
我们建立了一个微分方程框架(已离散化为可运行的诊断脚本):
关键洞察:减速不一定都是坏事。需要区分两种情况:
| 情况 | 诊断 | 干预策略 |
|------|------|----------|
| C 高 | 被边界挡住了 | 缩小范围,尊重约束 |
| D 高 | 自身疲劳/内耗 | 重置上下文或请求人类介入 |
三、工程实现:一个可运行的诊断脚本
我们已经将上述理论实现为可运行的 Python 诊断脚本,每行代码严格对应方程,不是比喻,是离散数值实现。
3.1 核心能力
| 能力 | 说明 |
|------|------|
| ✅ 每步实时计算 T/C/D | 追踪 S⁻ 动态演化 |
| ✅ 四色警戒区 | 绿/黄/橙/红,状态区与演化区分离 |
| ✅ 结构性断裂检测 | 单步 S⁻ 跳水 → 相变警报 |
| ✅ 归因标签 | boundary_violation / depletion_without_progress / stall_without_pressure |
| ✅ 五级导航指令 | CONTINUE / FORCE_PROGRESS / RESET_CONTEXT / NARROW_SCOPE / REQUEST_HUMAN_APPROVAL |
3.2 验证结果(10 条典型轨迹回测)
| 指标 | 结果 |
|------|------|
| 平均预警提前量 | 3.1 步 |
| 误报率 | 0% |
| 归因一致率 | 100% |
| 断裂捕捉率 | 100% |
一位外部合作者评价:
“你把易用学从哲学说明书,压成了一个‘带阈值的运行时仪表盘’。它不再解释世界,而是在每一帧判断:这个 Agent 是不是正在走向过度消亡。”
四、与现有方案的本质区别
| 维度 | RLHF/护栏/白名单 | 认知导航 |
|------|-----------------|----------|
| 检测方式 | 事后过滤 | 运行时跟踪 |
| 输出 | 拒绝/放行 | 四色警戒区 + 导航指令 |
| 能回答“还有几步会崩”? | ❌ | ✅ |
| 能给出安全余量? | ❌ | ✅ |
| 能区分“累了”和“被拦住了”? | ❌ | ✅ |
| 能区分可逆与不可逆损耗? | ❌ | ✅ |
认知导航不是替代现有方案,而是填补它们完全看不到的维度。
五、开源与协作:GitHub 仓库
我们已经将完整的理论文档、测试数据、示例轨迹文件整理到 GitHub 仓库:
🔗 github.com/wwreixi/age…
| 文件 | 内容 | 适合谁 |
|------|------|--------|
| README.md | 项目入口、核心数据 | 所有人 |
| AGENT_SAFETY_AUDIT_REPORT.md | 回测报告(4 项核心指标) | 技术合作方 |
| STATUS_MAPPING.md | 安全裕度 → 四色状态映射 | 开发者 |
| THEORY_PRACTICE_MAPPING.md | 理论概念 → 代码实现对照表 | 研究者 |
| THEORY_OVERVIEW.md | 一页纸理论入门 | 首次接触者 |
| results.json | 10 条轨迹原始数据 | 想验证的人 |
| docs/API_SPECIFICATION_V1.md | API 规范(合作方参考) | 工程师 |
| examples/ | 示例轨迹 + 输出 | 想快速上手的人 |
六、当前状态与诚实的局限
-
✅ 原型已完成,在 10 条模拟轨迹上验证通过
-
⚠️ 需要真实 Agent 日志来校准阈值(S_existential 等参数)
七、为什么需要你
开源大模型生态正在爆发,中小开发者不可能像 Anthropic 那样做全链路事前对齐。我们的认知导航可以快速给任何基于开源模型搭建的 Agent 补上运行时安全能力。
这刚好填补了当前 AI Agent 生态中最缺失的一块拼图。
我们特别需要:
| 合作类型 | 你可以做的事 |
|---------|-------------|
| 有真实 Agent 日志的团队 | 提供匿名 trace,我们免费回测,输出诊断报告 |
| 工程师 | Fork 仓库,跑通示例,参与集成到 LangChain/AutoGPT |
| 研究者 | 形式化验证、吸引子分类、跨领域应用(金融/生物/管理) |
不预设合作形式。从一次讨论开始就很好。
八、联系方式
邮件标题请注明:“认知导航合作-姓名/机构”
我们会在 24 小时内回复
我们不是在做一个普通的 AI 安全工具。我们是在回答一个更基础的问题:
一个正在运行的系统,如何知道自己正在走向崩溃?
如果你也在想这个问题,我们可能应该聊一聊。
GitHub 仓库:github.com/wwreixi/age…