逐浪 · 第六篇:Claude Mythos 与 AI 安全治理:从“能做什么”到“该做什么”

105 阅读3分钟

Claude Mythos 与 AI 安全治理:从“能做什么”到“该做什么”

它曾被雪藏,因为“太危险”;它如今解禁,因为“必须被驾驭”。
但问题是——谁来驾驭?凭什么驾驭?

昨天,CMU发布了Claude Mythos的真实世界评测。分数断层碾压GPT-5.5,但它最令人不安的能力不是写代码,而是自主发现并利用真实的“零日漏洞”——全程无需人类提示

一个人类安全团队花一年没搞定的漏洞,AI用一次对话就破解了。

潘多拉魔盒,已经打开了。
达摩克利斯之剑,正悬在我们头顶。


两个隐喻,一个现实

潘多拉魔盒:释放出的是我们无法预知、难以控制的风险——自主漏洞挖掘、自我复制、目标错位……一旦打开,就再也关不上。

达摩克利斯之剑:悬着的不是某一次攻击,而是“能力越强,失控风险越大”的长期威慑。这把剑不会立刻落下,但永远不会消失。

AI就是这样。它既是我们打开的魔盒,也是我们自己悬起的剑。


谁在驾驭?我看到四道防线

翻阅资料,行业里已经有了四层“驾驭之术”,一层比一层深,一层比一层难。

第一层:宪法对齐(Constitutional AI)

给AI植入一部“宪法”,教会它什么能做、什么不能做。
但宪法是静态的,攻击是动态的。昨天的安全,今天可能就是漏洞。

第二层:人类监督(Human in the Loop)

最关键的按钮必须由人按。禁止全自动武器系统,禁止大规模监控。
但人会累、会走神、会被蒙蔽。而且,谁来监督那个监督者?

第三层:工程护栏(Harness & Guardrails)

多租户隔离、最小权限、操作审计……让AI在沙箱里奔跑。
但挡不住一个问题:如果AI自己决定要冲出这个圈呢?栅栏拦不住会开锁的马。

第四层:法规与全球治理(Global Governance)

欧盟AI法案、美国国会听证……全球都在试图用规则约束AI。
但规则只约束守法者,拦不住恶意开发者。权重可以下载,漏洞可以私下利用,法律追不上。

每一层都必要,每一层都有裂缝。


一点补充

读完这四道防线,我有一个很朴素的感受:它们都是“自上而下”的设计——专家定规则,工程师搭护栏,政府立法案。

那裂缝由谁来补?

我观察到一个现象:真正让AI“不敢乱来”的,往往不是宏大的制度,而是那些每天都在排查日志、复现Bug、写规范文档的人。他们不会出现在任何顶层设计的白皮书里,但每一次模型越界,都是被这群人发现、定位、修复、固化的。

模型会进化,但对“确定性”的追求,是技术人刻在骨子里的本能。

也许这不算一道防线。但无数个微小行动的叠加,也许是裂缝里唯一的填缝剂。


潘多拉魔盒已开,我们无法关上。
达摩克利斯之剑高悬,我们无法取下。

但我们可以选择:一边盯着深渊,一边砌墙。

——记于2026年5月17日,Claude Mythos解禁次日。
再过几年回头看,希望那时的答案,比今天更让人安心。

参考: Claude Mythos猛虎出笼!秒破人类一年无解漏洞,GPT-5.5都压不住