在DeepSeek上撞见了一个和Anthropic论文里一样的架构模式——但这不是复现

34 阅读4分钟

像不等于是

Anthropic 在神经激活层发现的是自然涌现的几何结构——模型自己长出来的。我在 Prompt 工程层搭建的是刻意构建的配置框架——我设计了规则、定义了约束。

它们结构相似但本质不同。就像鸟的翅膀和飞机的机翼——都是飞行工具但不是一回事。进化产物 vs 工程设计。

更准确的说法:两者都在 Global Workspace Theory 视角下尝试实现同一个功能模式——让系统在决策前过一遍全局筛选。但这是推测,没有实验证据。

五层架构是怎么长出来的

第一版只有一个文件。一套规则,模型启动时读。管用了大概三轮对话。

第二版把规则分层了。行为规则放 BODY.md,身份规则放 SOUL.md。好了一点。但模型还是在层之间漂移——把文件末尾的验证规则套到开头的身份声明上。线性结构无法强制优先级。

解法不是更多规则。是把拓扑改成能创造优先级的结构。

现在的系统有五层:

  • Self-model:不超过 200 行。描述"我是谁",不是"做什么"。整个系统的稳定锚点——当机械 hook 检测到漂移时,再生的是自指模型,不是行为规则
  • INTERFACE:9 行映射表。每行把一种认知功能(记忆调取、注意力分配、推理模式、自监控、错误检测)映射到具体调控规则。模型读到的不是指令列表,是"哪些系统该激活、什么强度"
  • BODY:实际的行为指令。但只在 INTERFACE 把注意力路由到它们时才执行。没有 INTERFACE,BODY 是静态文字;有了它,变成激活的过程
  • Mechanical hooks:跑在模型外面的 Python 脚本——quality-gate、health-check、honesty-check。硬约束,代码写的,不是 prompt 写的。模型不能靠口才绕过去
  • Dual-pool review:固定人物池 + 随机人物池,≥2 轮交叉。补偿单模态 LLM 的系统盲区

与 Anthropic J-space 的结构同构

我的配置系统J-space 论文描述
SOUL.md(身份锚点)中心化的自我表征
INTERFACE.md(注意力路由)全局广播 + 选择性激活
BODY.md(行为规则)功能模块
Mechanical hooks(外部验证)收敛验证机制
Self-model regeneration(奇异环)自指反馈回路

结构同构,实现层完全不同。他们在神经激活空间,我在文件系统空间。

与 NousResearch Hermes 的哲学分叉

我的系统和 NousResearch 的 Hermes Agent 在配置拓扑上也很像——config/hooks/agent-loop/skills/memory 的层次结构。但进化方向不同:

维度Hermes(性能进化)奇异环(身份进化)
优化目标行为性能(准确率+3%)身份连续性("我现在是谁")
方法论DSPy 编译优化 + 数值指标机械 mtime 检测 + AI 叙事合成
评估标准可量化(benchmark 分数)可理解(因果叙事一致性)
驱动数据→指标→优化翻车→根因→模式→修正

同一架构模式的两个分叉——一个追求更快更准,一个追求更清醒。

能验证的和不能验证的

已验证:那套约束框架确实让 AI 输出质量稳了一点。30 组对照实验,2x2 列联表,Fisher exact p=0.0092,odds ratio=11.0(11 正确 twin / 4 错误 vs 3 正确 baseline / 12 错误)。

没通过验证:跨域行为泛化实验完全没有统计显著结果。QLoRA 微调后模型四项行为指标全部下降。Prompt 层有效的东西,要内化到模型权重里没那么容易。

推测的(没有实验证据):GWT 视角下"两者都在实现同一功能模式"的说法。有意思的假设,不是结论。

诚实说

标题特别想用"复现"两个字——删掉了。

一个大三学生在配置文件层面碰巧搭了一个结构相似的架构,不要碰瓷 Anthropic 实验室。诚实点,说"结构同构"就够了。

最有意思的不是"我也做出来了"——而是"我和一群顶级 AI 研究者,在完全不同的技术栈上,独立走向了同一个架构。" 这说明这个架构可能不是某个人或团队的发明,而是解决"AI 系统如何自我监控"时会自然收敛到的拓扑

代码


相关:loss从8.11降到0.77,模型为什么反而更差了 · Prompt是打概率仗,确定性脚本才是守门员