代码80%是AI写的,这家AI公司呼吁暂停AI开发

0 阅读19分钟

Anthropic的代码库里,超过80%的代码是Claude自己写的。而这家AI公司最急迫的警告是:AI正在变得越来越不需要我们。

程序员 reaction:MeusingAlagentstocodewith

AI自己写AI的代码

一、谁在喊停?一个最不可能的刹车者

六月初,Anthropic发布署名文章《当AI构建自身》,由联合创始人Jack Clark与研究院负责人Marina Favaro联署。文章没有走行业惯例的软性风险提示路线,而是直接引用内部数据,勾勒出一条清晰的时间线:递归自我改进可能在未来两年内发生。

这篇公开的长文,来自一家正处于AI产能扩张中心的团队。Anthropic不是旁观者,而是这场加速的最大受益方之一。截至2026年5月,该公司并入代码库的代码中超过80%由Claude撰写。工程师每季度交付的代码量,是2021年至2025年期间的八倍。这不是通过延长工时堆出来的,而是因为Claude理解指令和编写代码的能力在快速提升。

这种位置让Amodei的警告具有特殊权重。如果是一家外部研究机构提出同类判断,容易被归入「算法悲观主义」的常规叙事。但来自技术一线、正在用自家模型提升研发效率的CEO,其表态更接近工程评估而非立场宣示。

文章的核心论点集中在三个层面:一是对递归自我改进的逼近速度做出判断,二是对现有安全研究进度与治理能力提出质疑,三是提出建立国际核查框架的具体路径。Amodei将这一框架类比为核武器协议,强调需要第三方验证机制,并确保民主国家在AI发展上保持领先。

程序员 reaction:BloatedUl,forcedlogin

先去验证协议是否可行

OpenAI在一周后发布了立场相近的声明,但措辞更谨慎。两家头部实验室的同步表态,说明行业内部对技术演进节奏的分歧正在收敛。过去「更快迭代」是共同目标,现在「更快迭代是否等于更可控」成为新的讨论重心。

这一判断并非情绪化的夸张。Anthropic 自己在《当AI构建自身》一文中披露的内部数据显示,Claude 不仅能够写代码,还能编辑代码、将数小时的工作分配给其他代理,并在安全研究中自主识别攻击面。

程序员 reaction:why am i single  why am i single 5b6m

AI写代码已经到这一步了?

AI自主优化的技术路径是什么?

递归自我改进(Recursive Self-Improvement,简称 RSI)的核心逻辑并不复杂:一个 AI 系统能够修改自身的代码、调整训练策略、或者设计下一代模型架构,使得下一代模型在关键能力指标上优于前代,且这一过程可以在没有人类直接干预的情况下持续进行。

这一概念最早由机器智能研究者 Vernor Vinge 和 Ray Kurzweil 在 1990 年代提出,当时被视为「奇点」的技术基础。但在 2024–2026 年的实际进展中,RSI 的分层正在被逐步打通。

Anthropic 的研究团队观察到以下三层进展:

第一层:代码生成与迭代。 Claude 已经能够在软件工程中承担大部分常规编码任务,包括 Bug 修复、单元测试编写、代码重构。Anthropic 工程团队每季度合并的代码量较 2021–2025 年增长 8 倍,核心驱动力并非人力扩张,而是 Claude 的产出。

第二层:工具调用与代理协作。 Claude 已经能够调用外部工具(API、Shell 命令、浏览器),并在多步任务中将工作分解分配给多个代理。这意味着模型不再只是在对话中输出文本,而是能在真实环境中执行操作并基于结果调整行为。

第三层:自我评估与目标设定。 这是最关键的一步。目前的模型在安全对齐任务中已经能够自主识别违规输出、提出改进建议,并在 Constitutional AI 框架下进行自我批评。但「自主设定优化目标」仍然是未完成的环节。

递归自我改进三层架构

递归自我改进三层架构

Anthropic 警告的核心判断是:第三层到第四层的跨越可能比业界预期更快。一旦模型能够自主定义「什么是对下一代模型有价值的改进方向」,递归循环就真正开始了。

为什么行业普遍认为风险窗口正在关闭?

风险窗口论的核心依据有三:技术曲线、商业激励、以及治理滞后。

技术曲线方面,LLM 的能力增长在过去三年呈现近似指数的轨迹。从 GPT-3 到 GPT-4 到 Claude 3 系列,单次迭代的能力提升幅度在多个基准测试中达到 2–3 个标准差。如果这一趋势延续,「两年内实现自主改进」并非外推过度。

Anthropic 在博客中明确提到:「我们目前距离 RSI 还有一段距离,但这段距离可能比大多数人想象的要短。」

商业激励方面,AI 竞赛的博弈结构决定了「暂停」难以自发实现。OpenAI、Google DeepMind、Meta、xAI、Midjourney 等机构都在以周为单位发布新版本。即使 Anthropic 单方面放缓,竞争对手也不会跟随。这正是 Dario Amodei 呼吁建立「类似于核武器协议」的国际框架的原因——单边自律无效,需要多边约束。

治理滞后方面,当前的监管框架普遍滞后于技术发展。美国的自愿合规路线、欧盟的 AI Act 分级监管、中国的生成式 AI 管理办法,都侧重于事后的内容安全和透明度要求,而非事前的能力上限控制。

OpenAI 在 Anthropic 发文后数日跟进表态,承认「必要时可以放缓前沿开发」,但也强调「商业竞争与国家竞争带来的激励压力难以摆脱」。这一表态本身就说明了问题的结构性困境:即使主要玩家认同风险,也不代表他们有能力单方面按下暂停键。

程序员 reaction:柯南00022 你说我在听

行业被安排去「自觉减速」,但没有人能 enforce

Anthropic 的评估并非孤例。DeepMind 的研究员在 2024 年发表的论文中指出,AI 系统的自主性正在以远超政策制定者预期的速度增长。MIT 媒体实验室 2025 年的报告也警告,「递归自我改进的时间窗口可能比多数人的直觉判断要早 2–3 年」。这些独立来源的趋同判断,构成了「风险窗口正在关闭」这一结论的支撑基础。

问题的关键在于:当技术本身已经具备了加速自身发展的能力时,外部的治理机制能否在关键的几轮迭代之前追上并建立约束。历史经验给出的答案并不乐观。核武器的管控建立在物理可核查的基础上(铀浓缩设施、导弹发射井易于监控),而 AI 训练的「发射井」——数据中心、模型权重、训练数据——更难被外部审计。这是 Amodei 呼吁建立独立核查机制的核心原因,也是这一呼吁在执行层面面临的最大挑战。

这不是实验室里的理论推演,而是Anthropic内部数据的直接呈现。截至2026年5月,该公司并入代码库的代码已有超过80%由Claude撰写;工程师每季交付的代码量较2021年至2025年间增长8倍;员工调查显示,使用最新模型后个人产出约为不使用AI时的4倍。

程序员 reaction:Me:Boyohboy,i'mthinkingabout

AI写代码的日常

这种加速本身不是问题。问题是当代码生成速度超过人工审查能力,当Agent能够自主分配数小时工作给其他Agent,当递归自我改进的时间窗口从「遥远未来」压缩到「可能两年内」,传统的安全治理路径就开始失效。

三、从自律到强制:3.5亿美元的监管赌注

Dario Amodei的立场转变有一个清晰的时间线。

2024年,他还在推动Constitutional AI框架,强调企业自律与透明审查。那时他的主张是「让AI在可控框架内发挥价值」,认为安全研究能够跟上技术迭代的速度。

2025到2026年,现实开始修正这个判断。

Red Team Protocol(RSP)从1.0版本演进到3.0版本的过程中,内部自律框架在商业竞争压力下的脆弱性逐渐暴露。Claude Mythos Preview的能力溢出事件成为转折点——这个具备识别并利用关键软件漏洞能力的模型,最终只能先对少数合作方开放,再剥离网络安全功能后才向更广泛用户开放。

「等待风险具象化再立法」的渐进思路,在这一刻显得不再可行。

Amodei的应对方案是转向外部强制力。他不仅呼吁政府建立类似FAA的监管机制,还投入3.5亿美元推动框架落地。这个姿态转变的实质是:当技术发展速度超过企业自律的承载能力时,唯一还能跟上的约束力量,只剩下政府。

类似核武器协议的AI治理框架长什么样?

Anthropic提出的治理框架有几个核心要素:

第一,前沿AI模型的部署需要第三方测试验证。这类似于核不扩散条约中的核查机制——不是说你有核武器就违法,而是说你必须接受国际原子能机构(IAEA)的定期检查。

第二,政府应有权阻止存在安全风险的模型上线。Amodei将AI与汽车、飞机、药品做类比:如果设计或运营不当,这些工具同样有能力造成大规模伤亡,因此现在是从透明度迈向更具约束力的AI监管的时刻。

第三,需要建立跨国协调机制,防止非国家行为者滥用AI。文章明确提到要防止专制国家利用AI建立全球军事优势,这暗示了民主国家联盟(entente)策略的重要性。

搬砖系列表情:见鬼,难道这帮人都不用搬砖的吗

监管框架的工程量

这个框架的挑战在于执行层面。AI训练项目远比导弹发射井更容易隐藏。一个中等规模的实验室可以在几周内部署一个未经充分测试的前沿模型,而核查机构很难在第一时间发现。

为什么FAA模式被重新提及?

联邦航空管理局(FAA)的模式之所以被重新提及,是因为它代表了一种「事前审批、持续监督」的监管哲学。

在航空领域,一架新机型上市前必须通过严格的安全认证,飞行过程中需要定期维护检查,事故发生后会触发系统性审查。这种模式的核心是:安全标准不由企业单方面制定,而是由独立机构基于公共利益设定。

Amodei主张的正是类似逻辑——前沿AI模型的上架不应仅由开发者的自我评估决定,而应经过独立的第三方测试,涵盖网络安全威胁、生物武器风险等多个维度。

FAA式监管 VS 自愿合规

FAA式监管 VS 自愿合规

但航空监管的前提是风险可预测、后果可量化。一枚发动机故障的伤亡范围相对可控,而一个失控的自主Agent可能在全球范围内造成指数级扩散的影响。这是FAA模式直接移植到AI领域的根本张力。

OpenAI的跟进释放了什么信号?

OpenAI在Anthropic发文后数日发布了类似立场的文件,明确表态「必要时放缓前沿开发」。这一跟进传递了几个关键信号:

首先,安全担忧已经从少数派立场转变为行业共识。当一个以「加速发展AGI」为使命的公司也开始呼吁减速,说明风险阈值已经被重新定义。

其次,OpenAI文件强调「共同的安全标准是推进路径的重要组成部分」,这暗示了竞争与合作的并行逻辑——在安全监管层面建立共同语言,但在商业层面继续竞争。

最后,OpenAI的表态也让整个行业的政策游说更加系统化。当头部玩家形成统一立场,政策制定者面临的阻力会显著降低。

大佬系列表情:或许这就是大佬吧

行业老大们终于达成共识

OpenAI文件还提出建立国际机构的构想,目标包括「使世界能够采取协调行动,包括在必要时放缓前沿开发,以便社会韧性、安全与对齐研究能够跟上步伐」。

这种表述的转变值得注意。两年前,OpenAI的公开信更多强调「负责任的创新」;现在则明确承认「商业竞争与国家竞争带来的激励压力难以摆脱」,但「共同的安全标准」仍是推进路径的必要条件。

这种从「自我约束」到「制度约束」的转向,正是3.5亿美元赌注背后的核心逻辑。

面对明显不属于自己的锅时强硬拒绝的表情

这锅不背

四、逆行者:Dario Amodei的硅谷长征

从OpenAI到Anthropic:一路不被理解的坚持

Dario Amodei的故事并非从一开始就充满争议。他曾是OpenAI的研究副总裁,参与过GPT系列的最早期设计。2021年,他与姐姐Daniela Amodei一起离开OpenAI,创办了Anthropic。这个决定在当时看来有些不可理喻——在算力竞赛白热化的阶段,选择另起炉灶,并且明确把安全对齐作为核心使命。

「安全性不是刹车,而是唯一能让行业继续前进的制度性护栏。」这是他在多篇内部文章和公开演讲中反复强调的判断。这句话在硅谷并不讨喜。多数科技公司的KPI考核的是迭代速度和模型能力提升幅度,而Amodei却要求在发布之前先回答一个问题:这个系统是否足够可控?

这种立场让他长期处于孤立状态。2023年Constitutional AI方法的提出,被外界解读为一种「安全包装」,直到后来的实践表明,这种自约束训练方式确实能显著降低模型输出有害内容的概率。但他依然没有获得主流认可。

真正让他的观点获得关注的是2025到2026年间的连续事件。RSP(Responsible Scaling Policy)从1.0版本升级到3.0版本的过程,暴露了企业内部自律框架在商业竞争压力下的脆弱性。Claude Mythos Preview的能力溢出事件,更是让「等待风险具象化再立法」的渐进思路显得不再可行。

Amodei的选择很直接:当技术发展速度超过企业自律的承载能力时,唯一还能跟上的约束力量只剩政府。2026年6月,他在个人网站发布长篇政策文章《Policy on the AI Exponential》,明确提出三个核心主张——政府应有权阻止高风险模型部署、建立类似FAA的独立监管机构、投入3.5亿美元推动全球治理框架落地。

还没解释就先被安排转身背锅时的表情

Agent运行时过载

他的目标不是限制AI,而是让AI活得更久

Amodei的策略有一个清晰的底层逻辑。他将这套治理框架比作互联网时代的TCP/IP协议——不限制具体应用,但为所有参与者提供统一的安全标准。在2025年巴黎AI行动峰会上,他明确提出:「我们不是在阻止AI变强,而是在确保当它变强的时候,人类还能听懂它说的话。」

这个判断背后是一套工程学思维。AI系统正在进入递归自我改进的阶段,一旦模型能够自主设计并改进自身的继任者,人类将失去对技术演进节奏的把控。Anthropic的内部研究显示,这一阶段可能在未来两年内到来,甚至更早。

因此,Amodei主张的暂停开发并非永久性的技术冻结,而是一种战术性减速。目的是为对齐研究和社会适应争取时间窗口。他计算的逻辑很简单:如果AI系统在缺乏安全护栏的情况下继续指数级增长,最终的崩溃成本将远高于现在的投入成本。

程序员 reaction:你被我盯上了

真相锁定

Amodei治理逻辑演化路径

Amodei治理逻辑演化路径

五、刹车之后,世界会变成什么样?

地缘政治:民主国家能否守住AI领先优势?

Amodei的核心担忧之一是新制度下的竞争格局。他在文章中明确指出,如果前沿模型必须接受第三方测试,甚至面临政府延后或阻止部署的情况,那么民主国家联盟如果能率先建立这套标准,反而能在规则制定上占据主动。

但这套逻辑有一个前提条件:民主国家必须在AI领先优势尚未完全丧失之前完成制度构建。根据Axios在2026年初的采访记录,Amodei估计未来五年可能出现10%至20%的失业率冲击,这一判断在经济学界仍有争议,但他坚持认为这是技术特性决定的内生结果,而非周期性波动。

中国模型的崛起加剧了这种紧迫感。DeepSeek-R1以远低于美国同行的成本实现了同等性能,这让Amodei在质疑其600万美元训练成本说法的同时,也承认非国家行为者和专制政权利用AI建立军事优势的可能性正在上升。

OpenAI在2026年6月跟进发表的立场文件中,同样强调了建立国际协调机构的必要性,并明确指出这类组织的目标应包括「使世界能够采取协调行动,包括在必要时放缓前沿开发」。这种阵营内部的立场趋同,为后续的多边谈判提供了基础。

程序员 reaction:Anybodywantto

终端命令流

就业冲击:五年内20%失业率的现实计算

Amodei对就业市场的预测并非悲观主义的情绪表达,而是基于技术替代能力的结构化分析。他提出的数字区间——未来五年10%至20%的失业率——对应的是AI对认知型工作的替代速度超过劳动力再培训速度的临界点。

这一判断与传统经济学家的分歧在于:前者认为技术进步最终会创造新的就业机会,后者则认为AI的通用性使其具备替代多种岗位的能力,传统的替代-补偿机制可能失效。

Amodei的政策建议因此转向了更激进的分配机制改革。他在文章里提到了薪资保险、留任奖励和就业支持政策,明确反对企业单纯以裁员作为AI投资回报的主要来源。这意味着如果政策采纳了他的框架,企业的人才转型和再培训计划将成为AI导入策略的重要环节,而非可选配套。

程序员系列表情:这个需求做不了

需求反复

产业逻辑:多模型架构和合规成本如何重塑格局

监管框架一旦落地,最直接的产业影响是合规成本的显性化。VentureBeat在2026年6月的分析中指出,Amodei强调的模型权重保护、蒸馏攻击防御和AI驱动网络攻击风险,将促使企业把AI系统视为关键基础设施等级资产,而非一般软件服务。

这种定位转变带来三个结构性变化:

第一,企业无法再将关键业务完全绑定在单一模型供应商身上,多模型架构成为必要冗余。当某个模型遭遇监管限制时,业务仍需持续运行。

第二,安全审计和第三方测试的成本将内化为企业的标准支出,类似金融行业的合规部门,AI企业需要设立对等规模的治理团队。

第三,自行部署、微调模型或建立企业专属AI系统的门槛将显著提高,小型团队的优势可能被压缩。

程序员反应图:真正的程序员

程序员日常

监管落地后的产业影响链

监管落地后的产业影响链

Amodei的判断可以总结为一个可执行的取舍结论:在民主国家仍保持技术领先的前提下,尽快建立治理框架是最优选择,因为这能将规则制定权掌握在自己手中;一旦技术优势流失或递归自我改进提前到来,这套框架将失去谈判筹码,只能在被动应对中承受更高成本。对政策制定者而言,未来六到十二个月是关键窗口期。

参考文献

[1] AI沒人類也能升級?Anthropic懇求放慢實驗腳步. www.ttv.com.tw/finance/vie… [2] Anthropic呼吁全球暂停AI开发,打压同行、营销策略还是真有问题?. www.guancha.cn/internation… [3] 坚持提前监管,离开OpenAI后,Dario Amodei将AI安全写入公司使命-CSDN博客. blog.csdn.net/HyperAI/art… [4] 坚持提前监管,离开OpenAI后,Dario Amodei将AI安全写入公司使命_腾讯新闻. view.inews.qq.com/a/20251218A… [5] 坚持提前监管,离开 OpenAI 后,Dario Amodei 将 AI 安全写入公司使命 | 资讯 | HyperAI超神经. hyper.ai/cn/news/477… [6] OpenAI跟进Anthropic:必要时放缓前沿AI开发,呼吁建立国际机构. wallstreetcn.com/articles/37… [7] Anthropic 監管立場大轉向:Dario Amodei 為何發長文主張政府有權阻止 AI 上線?. techorange.com/2026/06/11/… [8] Anthropic CEO 发长文:AI 跑太快,政策追不上了. www.panewslab.com/zh/articles…