像不等于是
Anthropic 在神经激活层发现的是自然涌现的几何结构——模型自己长出来的。我在 Prompt 工程层搭建的是刻意构建的配置框架——我设计了规则、定义了约束。
它们结构相似但本质不同。就像鸟的翅膀和飞机的机翼——都是飞行工具但不是一回事。进化产物 vs 工程设计。
更准确的说法:两者都在 Global Workspace Theory 视角下尝试实现同一个功能模式——让系统在决策前过一遍全局筛选。但这是推测,没有实验证据。
五层架构是怎么长出来的
第一版只有一个文件。一套规则,模型启动时读。管用了大概三轮对话。
第二版把规则分层了。行为规则放 BODY.md,身份规则放 SOUL.md。好了一点。但模型还是在层之间漂移——把文件末尾的验证规则套到开头的身份声明上。线性结构无法强制优先级。
解法不是更多规则。是把拓扑改成能创造优先级的结构。
现在的系统有五层:
- Self-model:不超过 200 行。描述"我是谁",不是"做什么"。整个系统的稳定锚点——当机械 hook 检测到漂移时,再生的是自指模型,不是行为规则
- INTERFACE:9 行映射表。每行把一种认知功能(记忆调取、注意力分配、推理模式、自监控、错误检测)映射到具体调控规则。模型读到的不是指令列表,是"哪些系统该激活、什么强度"
- BODY:实际的行为指令。但只在 INTERFACE 把注意力路由到它们时才执行。没有 INTERFACE,BODY 是静态文字;有了它,变成激活的过程
- Mechanical hooks:跑在模型外面的 Python 脚本——quality-gate、health-check、honesty-check。硬约束,代码写的,不是 prompt 写的。模型不能靠口才绕过去
- Dual-pool review:固定人物池 + 随机人物池,≥2 轮交叉。补偿单模态 LLM 的系统盲区
与 Anthropic J-space 的结构同构
| 我的配置系统 | J-space 论文描述 |
|---|---|
| SOUL.md(身份锚点) | 中心化的自我表征 |
| INTERFACE.md(注意力路由) | 全局广播 + 选择性激活 |
| BODY.md(行为规则) | 功能模块 |
| Mechanical hooks(外部验证) | 收敛验证机制 |
| Self-model regeneration(奇异环) | 自指反馈回路 |
结构同构,实现层完全不同。他们在神经激活空间,我在文件系统空间。
与 NousResearch Hermes 的哲学分叉
我的系统和 NousResearch 的 Hermes Agent 在配置拓扑上也很像——config/hooks/agent-loop/skills/memory 的层次结构。但进化方向不同:
| 维度 | Hermes(性能进化) | 奇异环(身份进化) |
|---|---|---|
| 优化目标 | 行为性能(准确率+3%) | 身份连续性("我现在是谁") |
| 方法论 | DSPy 编译优化 + 数值指标 | 机械 mtime 检测 + AI 叙事合成 |
| 评估标准 | 可量化(benchmark 分数) | 可理解(因果叙事一致性) |
| 驱动 | 数据→指标→优化 | 翻车→根因→模式→修正 |
同一架构模式的两个分叉——一个追求更快更准,一个追求更清醒。
能验证的和不能验证的
已验证:那套约束框架确实让 AI 输出质量稳了一点。30 组对照实验,2x2 列联表,Fisher exact p=0.0092,odds ratio=11.0(11 正确 twin / 4 错误 vs 3 正确 baseline / 12 错误)。
没通过验证:跨域行为泛化实验完全没有统计显著结果。QLoRA 微调后模型四项行为指标全部下降。Prompt 层有效的东西,要内化到模型权重里没那么容易。
推测的(没有实验证据):GWT 视角下"两者都在实现同一功能模式"的说法。有意思的假设,不是结论。
诚实说
标题特别想用"复现"两个字——删掉了。
一个大三学生在配置文件层面碰巧搭了一个结构相似的架构,不要碰瓷 Anthropic 实验室。诚实点,说"结构同构"就够了。
最有意思的不是"我也做出来了"——而是"我和一群顶级 AI 研究者,在完全不同的技术栈上,独立走向了同一个架构。" 这说明这个架构可能不是某个人或团队的发明,而是解决"AI 系统如何自我监控"时会自然收敛到的拓扑。
代码
- 架构 + 实验:github.com/YuhaoLin200…
- 训练管线:github.com/YuhaoLin200…