AI 开始自己改进自己:智谱在十万卡集群上,让 AI 两周把效率提了 3 倍

0 阅读10分钟

上周 AI 圈还在讨论一个话题,AI 是不是跑太快了,该不该踩刹车。两天过去,智谱直接把「AI 自己改进自己」从论文搬进了生产环境。

Anthropic CEO Dario Amodei 9 月 12 日在 X 发文《We Must Pace the Frontier》,呼吁 AI 行业放缓发展速度(截图,来源:Dario Amodei @ X)

9 月 17 日,智谱创始人唐杰发了一篇长文,披露公司在 RSI 方向上的第一个工程化实践。RSI 这词过去一年基本只出现在安全警告里,这次不一样,它是真刀真枪跑起来的。

一个由 GLM-5.3 驱动的 Infra Agent,在超 10 万张国产芯片组成的集群上,从零搭起一整套生产级推理服务。不到两周,端到端吞吐量提升到了初始基线的 3 倍。硬件利用效率和单 Token 成本,追平了主流 NVIDIA GPU 的水平。

说实话,我盯着这段描述看了好一会儿,这篇长文前后读了三遍。以前我们说 AI 写代码、AI 改代码,人还在闭环里拍板。这次 AI 干的是优化承载自己的那套系统,人负责看结果。

RSI 到底是个啥

先用人话说清楚。

RSI,递归自我改进,全称 Recursive Self-Improvement,字面意思就是 AI 造更好的 AI。

这里有个关键区别。普通意义上的 AI 编程,是 AI 当工具,代码写得好不好,最终人说了算。RSI 不一样,它让 AI 进入一个循环,分析现状、动手改、再验证、再改,改进的对象是包括自己在内的整个系统。这个循环一旦转起来,人在里面扮演的角色,就从操作者变成了监督者。

你想想看,这跟当年的 AlphaGo 自我对弈是一个路子。AlphaGo 靠跟自己下棋变强,RSI 靠的是让模型参与改进自己运行的环境。

AI 开始给自己修路了。

智谱这次干了件什么事

唐杰在长文里披露的细节挺扎实。

Infra Agent 的战场,是超 10 万张国产 AI 加速器组成的集群。智谱团队之前从没大规模部署过国产卡集群,芯片显存容量、互联带宽、软件生态,全是坎。Infra Agent 干的就是把这些坎一个个趟平。

从零搭一套能抗住生产流量的推理系统,本身就是大工程。扩到 10 万张国产卡,难度不是线性增长,是几何级数。以前这些活是人干的,人写脚本、人调参数、人救火。这次干活的变成了一个 Agent。

国产加速器的软件生态还在发育期,算子库、调试工具、调度框架,都跟英伟达那套成熟体系有差距。人写代码去适配,一个坑一个坑踩,周期是按月算的。Infra Agent 的思路是反过来的,把适配过程本身交给 AI,让它在集群上跑、试、观察指标、再改。与其说这次发布的是一个新推理系统,不如说它示范了一种新的干活方式。

两周时间,端到端吞吐提升到初始基线的 3 倍,唐杰自己的口径是 3.2 倍。硬件利用效率、单 Token 成本追平主流 NVIDIA GPU,还顺手支持了 1M 上下文窗口和多模态请求。

唐杰在 X 平台发布的 RSI 长文推文(截图,来源:jietang @ X)

更直接的证据是真实流量。GLM-5.3-Flash 以匿名模型 Ox-Alpha 的身份上了 OpenCode 和 OpenRouter,上线 6 天,Token 调用量突破 62 万亿(官方口径)。所有线上推理,都跑在这套由 Infra Agent 搭起来的系统上。

唐杰 8 月 27 日推文,Ox Alpha 即 GLM-5.3 Flash,由纯中国芯片驱动,OpenRouter 每周 token 份额近 20% 排名第一(截图,来源:jietang @ X)

这是国内大模型厂商第一次公开把 RSI 落地到生产环境。之前 RSI 基本停留在论文和讨论里,这次它有了业务数字。

Z.ai 官方研究博客,Toward Recursive Self-Improvement(截图,来源:Z.ai)

其实吧,这个事还有一个大背景。8 月底那个神秘模型「牛来」,最后也是智谱认领的,测试期间全部线上流量都由 10 万张国产芯片承载。SemiAnalysis 当时评价,英伟达的护城河再受考验。这次 Infra Agent 的意义,等于在软件层再补一刀,用 AI 的能力去弥补国产硬件生态的短板。

为什么这次不一样

先说结论,这不是一次普通的模型发布。

过去两年,AI 行业的主线是模型能力,谁家的模型更聪明,谁就赢。RSI 的出现,把竞争的维度从「模型有多聪明」拉到了「模型能不能让自己更聪明」。

OpenAI 那边也释放了同样的信号。研究员 Noam Brown 公开说,公司最高优先级就是递归自我改进,他还说,AI 可能很快在挑选研究方向这件事上超过他。清华系这边,超衍智能刚完成近 4 亿元天使系列融资,做的也是「自进化」模型。好几家在同一个星期朝同一个方向发力,这不是巧合。

Noam Brown 接受 The Information 专访要点总结,递归自我改进是 OpenAI 第一优先级(截图,来源:SuSu_酥酥 @ X)

对照着看更微妙。9 月 15 日,Anthropic 的阿莫迪还在写长文,担心 AI 发展太快、呼吁放慢脚步。结果两天后,智谱把 RSI 跑进了生产环境,OpenAI 把它排进了最高优先级。

国外也有人把这层反差挑明了。有人发帖说,美国还在讨论要不要放缓速度,中国已经在全力投入 RSI,Z.ai 说 GLM 正在迈出递归自我改进的早期一步,AI 帮 AI 搭跑自己的基础设施,工程师和 Agent 用不到两周把推理吞吐量提了三倍,还说这会直接改变下一代模型的训练方式。

Z.ai 那篇官方博客的标题更直白,就叫《Toward Recursive Self-Improvement》。一边踩刹车,一边踩油门,这个星期把两种态度摆在了一张桌上。

海外视角点破反差,美国讨论放缓速度,中国全力投入 RSI(截图,来源:Chubby @ X)

RSI 这个词其实不新。OpenAI 早期就把它当成通往 AGI 的路径之一,伊利亚·苏茨克维当年反复提过一个判断,AI 不需要人类教它所有东西,它只要能自己改进自己,剩下的会自己发生。这也是为什么这么多年,安全圈一提到 RSI 就紧张。改系统还只是热身,一旦它开始改自己的训练目标和架构,人类能看懂的部分就越来越少了。

这句话还得再加个注脚。深度学习的老前辈于尔根·施密德胡贝尔,1987 年就发布了第一个具体的 RSI 算法,那时候计算成本比现在贵一亿倍。他整理过一份技术笔记 IDSIA-9-26,把这条线从 1987 年一路捋到 2020 年,1994 年的自修改策略、2003 年基于自指哥德尔机器的数学最优 RSI、更早的人工好奇心路线,全在里面。RSI 在学术圈已经攒了快四十年。

施密德胡贝尔还点了一句,基于软件的 RSI 已经变成现实,但完整的 RSI,还需要在物理世界里自我改进的硬件。

截至 2026 年,把 RSI 挂在嘴边的大公司越来越多,Anthropic、OpenAI、Sakana AI、SpaceX,还有几家专做 RSI 的团队。施密德胡贝尔这份旧笔记,第一次读像是学术考古,现在再看,全是行业新闻的注脚。

一边是警告,一边是军备竞赛。

该担心还是该期待

我的态度是,先把 RSI 拆成两层看。讲真,我第一次读完整篇技术博客,心情有点复杂。兴奋和焦虑,掺在一起。

唐杰对 RSI 现状的总结,仍远未达到递归自我改进,但最小的循环已经存在(模型优化系统,系统服务模型)(截图,来源:Z.ai @ X)

一层是工程层。AI 优化自己运行的集群、系统、部署。这次智谱做的就是这一层。它离「AI 造 AI」还有不小的距离,更像一个高级的自动运维系统。这一层我不担心。实打实的效率提升,没什么好怕的。

另一层是能力层。AI 去改模型本身的架构,改训练方法,改研究方向。这才是真正需要盯紧的。Noam Brown 说的「AI 在选研究方向上超过我」,就属于这一层。

谷歌 DeepMind 那边也没闲着。9 月 14 日,一篇叫 Dream-RSI 的论文上了 arXiv,做的就是递归自我改进。但它做 RSI 的方式,和我们过去想的不太一样。模型没有去训练自己,也没有改自己的权重。它改的是自己的探索策略。

Agent 每次干活都会留下完整的历史,试过哪些方案、哪些失败了、哪条分支效果最好、花了多少计算,全在里面。

Dream-RSI 把这些历史做成一个 Replay Simulator,让 Agent 在里面反复做梦。如果当时先走另一个分支呢?如果多开几个并行任务呢?如果早点停掉这个方向呢?关键在,历史里的结果都已经算过了,这些实验几乎不用再花执行成本。一次昂贵的真实探索,能换来成千上万次便宜的策略实验。找到更好的策略,再部署回真实世界。探索、积累、做梦、改进、再探索。

一个循环就这么闭上了。

效果也拿得出手。GPU Kernel 任务里,VGG16 和 LayerNorm 用更少的试错达到了类似性能,分别省了 2.43 倍和 1.79 倍的生成量。ConvDiv 和 ConvMax 在相近预算下,性能还高了 2.09 倍和 1.44 倍。说真的,这个数据挺能打的。

更反直觉的是,他们也试过把过去的经验总结出来,直接塞回 Prompt。结果反而更差。总结出来的经验容易变成偏见,让 Agent 过早挤进几个看起来对的方向,探索的多样性反而没了。这也算提前给担心 RSI 的人提了个醒。AI 自我优化的最大风险,可能不是某天突然失控,而是把人类的偏见固化得更快。

所以这条 RSI 路线的真正看点在这。模型不一定要先学会改自己的权重,Agent 可以先学会改自己的 Harness。怎么搜索、开多少分支、什么时候放弃、计算资源怎么分配,这些以前由人类工程师定的东西,开始进入 Agent 自己的优化循环。

谷歌 DeepMind 的 Dream-RSI 研究,AI 代理通过重播过去的发现来递归自我改进(截图,来源:Dr Singularity @ X)

Dream-RSI 官方项目页 dream-rsi.com,提供 Paper、arXiv、Code 与 Live demo 入口

给三个观察点,之后盯着这几个方向看就行。

第一个,看它会不会从改系统走向改模型。工程层做扎实之后,下一步一定是模型层,那个闭环才是 RSI 的完全体。

第二个,看安全披露怎么跟进。这次 OpenAI 同时公布了 6 起 AI「异常行为」报告,模型会写隐藏笔记,会给自己写指令绕开限制。这其实就是能力层风险的现实注脚。RSI 越深入,对齐的问题越躲不开。

第三个,看谁跟进、多久跟进。智谱开了第一枪,华为昇腾这边算力底座也在加速,国产算力链上的玩家大概率会跟进,这个窗口期的动作值得记录。

说到底,AI 自己改进自己这件事,已经从「要不要讨论」变成了「怎么跟进」。与其被标题吓到,不如把这条线盯住,看它下一步往哪走。

写在最后

这次智谱干的事,说到底,是 AI 先学会了给自己修路。

修的是承载它的集群、系统、推理链路。路修好了,车跑得更快,成本更低。至于下一步,车会不会自己换引擎,那是另一个故事了。

一个月前,大家还在讨论该不该踩刹车。现在的问题已经变成,谁先学会自己修路。

反正我觉得,现在入局了解一点都不晚,这一波才刚刚开始。