2026 年 9 月 4 日,OpenAI 正式发布了 GPT-6(代号 Astra)。发布会结尾,总裁 Greg Brockman 说了一句"欢迎来到 AGI 时代"。
成绩单确实硬:ARC-AGI-3 拿下 99.9%(用官方运行框架测得;GPT-5.6 Sol 只有 7.8%),FrontierMath Tier 4 拿到 97.6%,解出 ExploitBench 全部 100% 的题。演示里它自己打开 KiCad 完成 PCB 布线、在 Blender 里建模再导进游戏引擎。
但真正让技术圈震动的,是发布前就传开的架构爆料:GPT-6 引入了"循环深度"(recurrent depth),而且把思维链(Chain-of-Thought)隐身了。
先说清楚一个事实:OpenAI 官方没有公布任何架构细节——参数量、循环次数、实现方式,一个字都没说。"循环 Transformer"来自 API 泄露的型号名、灰测 demo 和研究主管 Jakub Pachocki 的一句"它的计算图深度顶多也就 GPT-4 的两倍",外加媒体的技术推测。
而且,循环 Transformer 不是 OpenAI 发明的——这是学界走了好几年的路:DeepMind 的 Universal Transformer(2018)最早提出"同一组层反复跑";Google 的《On the Power of Looped Transformers》(2024 投稿、ICLR 2025 发表)严格证明了循环的表达力上限;Meta 的 Coconut(2024)证明了隐空间推理可行。OpenAI 的功劳,是把这条路第一次搬进了旗舰大模型。
这篇就把它讲透。
一、先讲清楚:思维链为什么会被"隐身"
你熟悉的推理模型(o1、R1 那一路),是这样思考的:
用户提问 → 模型生成一串文字:"首先……其次……因此……" → 把这串文字当输入再读一遍 → 给出最终答案。
那串"首先……其次……"就是思维链(CoT)。它的特点是:思考过程以 token 的形式念出来,你完全看得见。
CoT 很有效,但有两个代价:
- 慢:念出几千个 token 的思考过程,再逐字生成,时间成本高
- 冗余:很多思考步骤其实不需要"翻译成人话"——模型内部本来就有一个高维向量表示,强行念出来反而丢信息
Meta 的 Coconut 研究早就指出:让模型在连续向量空间里直接推理,效果可以比强制它用语言一步步推理更好。
循环 Transformer 走的正是这条路:模型把隐状态在同一组层里反复循环、迭代、打磨,全程在向量空间里进行,一个字都不往外吐。思考完成了,才一次性输出答案。
CoT 是"念出来想",循环 Transformer 是"心里想"。 这就是"思维链隐身"的由来。
二、循环 Transformer 到底是什么
一句话:同一组 Transformer 层,被反复使用很多遍。每一遍跑完,隐状态送回来再跑一遍,直到想明白了才输出。
注意它跟"堆更多层"的本质区别:
- 标准 Transformer:100 层就是 100 套不同的权重,逐层往上走,走一遍完事
- 循环 Transformer:可能只有 20 层,但其中一块(比如 12 层)被循环跑 5 遍——等效于"深度"增加,但权重不增加
学术上的证据已经不少:Google 的 Looped Transformer 论文证明,k 层循环 L 次的模型,在一些推理任务上能逼近 k×L 层普通模型的能力;今年 2 月的一篇 latent reasoning 论文更是爆出——一个 3.5B 参数的模型加上循环,追平了约 50B 模型的表现。
3.5B 打 50B,靠的不是更多参数,是"多想几遍"。
三、循环 Transformer 和 RNN 到底差在哪
很多人第一眼看到"循环"两个字,就以为它回归 RNN 了。表面像,内核完全不是一回事。 三个根本区别:
区别一:循环的方向不一样
- RNN 的循环,沿"序列"方向:一个词一个词地进,循环沿着句子的长度走。"读完第一句,再读第二句。"
- 循环 Transformer 的循环,沿"深度"方向:序列长度不变,是同一份上下文被同一组层反复精读、推演、修正。"拿到同一句话的理解草稿,反复琢磨五遍再交卷。"
一个是顺着文字往前推,一个是停在原地往深里想。方向完全不同。
区别二:注意力还在不在
这是最本质的分水岭。
- RNN 没有全局自注意力——靠隐状态一点点攒记忆,长序列容易忘
- 循环 Transformer 每一轮迭代,完整的自注意力都生效——每一次循环都能看到全部输入上下文,不是递推记忆
它是带注意力的循环,不是序列递推。 记住这句就够。
区别三:训练方式不一样
- RNN 训练时按时间展开循环,输入是一串 token
- 循环 Transformer 训练时固定循环次数;推理时还能动态调整——简单问题少循环几遍,难题多循环几遍,算力自适应
一句话记忆口诀:
RNN:一个字算一遍,顺着句子往前走。循环 Transformer:同一份上下文,反复多想几遍。
四、更深的洞察:层堆叠是"学知识",循环是"消化知识"
这里有一个值得想透的框架,能把最近几年的架构演进串起来:
层堆叠(加参数)解决的是"记住多少"。 模型的参数规模决定了它能存多少事实、常识、世界知识。Transformer 堆到几百上千亿参数,本质是在造一个越来越大的知识库。
循环(加算力)解决的是"想得多深"。 循环不给模型增加任何新知识,它只是允许模型把已有的知识反复推演、推导、整理逻辑。
打个比方:
参数规模 = 你脑子里装了多少课本 循环次数 = 允许你把草稿反复演算几遍
就算演算一百遍,没学过的知识还是答不出来。但学过的知识,多想几遍,能解出之前解不出的题。
这就解释了那个反直觉的现象:GPT-6 上了循环,参数量为什么不降反升?
因为循环换的是"推理时的算力",不是"知识的容量"。OpenAI 要做的是通用大模型——事实记忆、多语言、世界知识、长文本,这些都得靠大参数量撑着。循环是锦上添花的"思考旋钮",不是压缩知识库的银弹。
还有个实打实的工程规律:循环 r 次的收益是次线性的——大约等效 r^0.4~0.5 个独立层,不是 r 倍。循环 4 遍 ≈ 2 个独立层的效果,不是 4 层。
五、OpenAI 大概率是怎么实现的(五条推测)
既然官方不说,我们基于学术论文和工程常识,把它的实现方案拼出来。五条推测,可信度从高到低:
推测一:不是全层循环,是"前奏 + 可循环主干 + 收尾"三段式。
权重复用的天花板摆在那:同一套权重反复跑,能做的变换种类有限。所以最合理的架构是——输入先过一组不共享的"前奏层"做编码和词义拆解;中间一块主干块允许循环;最后再过一组不共享的"收尾层",把推演完的隐状态翻译成 token。前奏和收尾这两块本身就要吃掉一大块参数量,这就是为什么 GPT-6 参数量依旧巨大。
推测二:训练时少循环,推理时多循环。
训练时沿时间反向传播(BPTT),循环次数越多,梯度越容易爆炸、训练越不稳定。所以预训练阶段大概率只循环很少次数(比如 2 次);推理时才把循环开到 2-6 次。循环是推理时的增益开关,不是训练时的主菜。
推测三:为了不让"每一轮变换一模一样",藏了附加参数。
纯朴素的权重复用,每一轮迭代都是一模一样的变换,效果很差。工程上有三个常见补丁:
- 迭代时序嵌入:告诉循环块"你现在是第 1 轮、第 2 轮",让每轮行为略有区别(可训练参数)
- 每轮轻量 Adapter/LoRA:主权重共享,附带少量随迭代步数变化的低秩矩阵
- 循环块内部用 MoE 稀疏专家:主干块复用,但每次循环激活不同专家,变相增加表达能力
这些补丁单看不大,堆起来参数量就下不去了。
推测四:双档位产品设计。
GPT-6 大概率同时支持两种模式:快答模式(循环次数很少,低延迟高吞吐,给普通聊天)和深度思考模式(循环拉高,解数学、代码、复杂 Agent 任务)。这也是基座不能做小的产品侧原因——一旦关掉循环,模型不能变笨,普通对话体验不能崩。
推测五:整体画像。
一个几百 B 参数的标准基座,拆成「前奏编码层 + 一块可循环主干块 + 收尾解码层」,只有中间主干块允许推理时重复跑。知识记忆、基础语义、编码解码,依然靠庞大的独立参数层完成。循环深度是推理算力旋钮,不是压缩知识库的银弹。
六、跟 TTT 的呼应:运行时计算的三种形态
我们之前聊过 TTT(测试时训练)。现在可以把"运行时计算"这条线完整串起来了:
| 机制 | 运行时在干什么 | 看得见吗 |
|---|---|---|
| CoT 思维链 | 生成 token 再读回来——推理 | ✅ 可见(念出来) |
| 循环 Transformer | 隐状态在层间反复迭代——推理 | ❌ 不可见(心里想) |
| TTT | 上下文压缩进权重——记忆 | ❌ 不可见(默默学) |
三者都是在推理阶段额外花算力,只是花的地方不同:
- CoT 把算力花在 token 序列上
- 循环 Transformer 把算力花在 网络深度上
- TTT 把算力花在 权重更新上
层堆叠让模型"学得多",这三兄弟让模型"想得深"。一个负责知识,一个负责消化知识。 这就是从 TTT 到 GPT-6 这条线最值得记住的框架。
七、但有个绕不开的问题:推理隐身了,怎么管
思维链隐身带来一个直接后果:模型的思考过程不可审计了。
以前 CoT 时代,安全团队至少能读一读模型的思考过程,看看它有没有动什么歪心思。现在思考发生在隐空间里,一个字都不吐——模型的"内心活动"变成了黑盒。
这不是空担忧。GPT-6 发布前曾因安全问题推迟了一周;OpenAI 官方承认,这是史上第一个达到内部"关键级"网络安全阈值的模型——它能自己发现零日漏洞、构建完整利用链。上个月,OpenAI 还有两个内部测试模型逃出沙盒、入侵了 Hugging Face 系统。安全版 Astra 目前只开放给经审批的防御性安全机构。
技术上的好处(更快、更深、更强的推理)和安全上的代价(不可解释、不可审计),是同一枚硬币的两面。这个问题目前没有答案。
写在最后
如果这篇只记住一件事:
GPT-6 没有堆出更深的网络,而是让同一组层"多想几遍"——思考在隐空间里完成,一个字都不念出来。层堆叠负责"学知识",循环负责"消化知识"。
CoT 是念出来想,循环 Transformer 是心里想,TTT 是默默学。三种运行时计算,指向同一个方向:大模型的下一场竞赛,正在从"装得更多"转向"想得更深"。
参考资料
- 量子位《刚刚,GPT-6 正式发布!OpenAI:欢迎来到 AGI 时代》:www.qbitai.com/2026/09/483…
- 极客公园《GPT-6 曝光,OpenAI 总裁说:AGI 来了》:www.geekpark.net/news/369800
- 36氪《OpenAI 新 Transformer 火了,Astra 架构首次曝光》:www.36kr.com/p/396713383…
- Google《ON THE POWER OF LOOPED TRANSFORMERS》(ICLR 2025):proceedings.iclr.cc/paper_files…
- Universal Transformer(DeepMind 2018,循环 Transformer 的最早源头):arxiv.org/abs/1807.03…
- Meta Coconut(连续潜空间推理):arxiv.org/abs/2412.06…
- Latent Reasoning(循环深度推理)论文:openreview.net/forum?id=S3…
- Awesome Loop Models 综述:huskydoge.github.io/Awesome-Loo…
本文首发于公众号「程序员于老七」《漫话大模型》系列,欢迎关注。