你跟一个模型聊了一小时,纠正了它八次。关掉窗口,重新打开,它还是原来那个样子。
这不是记性问题,是权重在训练结束那一刻就冻住了。你之后说的每一句话,只能临时塞进上下文窗口,每次请求重读一遍,请求结束就丢掉。行业为此写了整整一套 RAG 管道、记忆层、上下文压缩策略——全部都是在"临时"这两个字上做工程。
9 月 16 日,剑桥的 Jinli Hu、Ross M. Clarke、Yichuan Zhang 与 José Miguel Hernández-Lobato 在 arXiv 挂了一篇预印本(
arXiv:2609.18842),标题起得很猛:Infinite-Parameter LLMs: Generating and Adapting Weights from Live Data。它的主张可以一句话说清:能不能别把运行时收到的信息塞进提示词,而是直接编译进权重。这篇东西的结构很有意思——机制讲得很清楚,但摘要里一个 benchmark 数字都没有。这篇文章既要拆开它的三层机制,也要如实说清它还没回答什么。
一、旧范式的原罪:上下文是「租」来的,不是「买」下的
先把问题定义精确。一个部署后的模型面对的处境是:最值钱的信息往往不在训练集里,而在它正在处理的这轮交互里——用户随口给的一个事实,或者对他某次错误的纠正。
传统模型的权重在训练后冻结,这些信息进不去。于是只剩一条路:放进 prompt(提示词/上下文窗口),靠检索或指令注入。这条路有两个结构性代价。
**第一是重复计算。**同一批背景事实,在第 1 轮被读一遍,第 10 轮还要再读一遍,第 100 轮还是。模型每次请求都要为同一份证据付一次 prefill 的钱。论文里把它称作「读一次、用完即弃」。
第二是容量挤兑。上下文窗口是有限的。证据越多,留给推理的空间越少;上下文一满,前面的内容就被挤出去。这不是工程疏忽,是把长时记忆寄存在工作内存里必然的结果。
社区对这一点早就不满了。Hacker News 上一条评论把愿望讲得很直白:如果模型能动态整合每个人的微小进展——包括失败的尝试——就会形成一个集中式的概念与结果库,避免全世界重复试错。这条评论拿到不少赞同,因为它指向的正是当前范式的短板:交互产生的一切,除了一份聊天记录,什么都没留下。
论文想动的是这件事发生的位置。
二、原理:把 MoE 的「选专家」换成「生成专家」
论文的架构判断很克制:**注意力层完全不动,只替换选定层的 FFN 子层。**每个「生成层」(generative layer)由三部分组成。
| 组件 | 作用 | 是否可训练 |
|---|---|---|
共享基座 FFN W₀ | 始终生效,从强 dense 模型初始化 | 冻结 |
紧凑生成器 G_φ | 把低维隐码 z 映射为基座的结构化低秩调制 | 冻结(复用 SHINE 检查点) |
隐码上的信念 P_t(z) | 决定「此刻该用哪份补丁」,在线更新 | 本文新增 |
低秩调制:只贴补丁,不重写全表
补丁的形式是标准的 LoRA 型分解:
W(z) = W₀ + ΔW(z), ΔW(z) = B(z) · A(z)ᵀ
其中 A(z) ∈ R^(d×r),B(z) ∈ R^(h×r),r ≪ d
论文给出的具体数值是 秩 r = 8,隐码维度 d_z = 128,被调制的投影是 {W_gate, W_up, W_down}。
关键在于它从不把 ΔW 实体化,而是按因子形式直接算:
y_delta = B(z) · (A(z)ᵀ · x)
于是每个 token 的应用成本是 O(r(d+h)),对比基座 FFN 的 O(hd)——r 只有 8,这份开销相对基座可以忽略。这是"无限参数"这个名字能立住的计算基础:参数空间可以极大,但每一刻的算力开销不跟着涨。
编码路径:可学习的 memory token 当探针
隐码 z 是从哪来的?论文的路径是这样的:
输入序列
│
├─ 追加 M 个可学习 memory tokens(与输入无关的固定 probe,训练一次全局共享)
│
▼
冻结的 decoder-only 基座(Qwen3-8B)
│
├─ 收集每层 memory token 的隐状态 → memory grid m ∈ R^(L×M×d)
│
▼
memory-to-parameter 网络(M2P)混合该网格
│
▼
扁平隐码 z ∈ R^P ── 平凡投影 ──▶ 每层的 LoRA 因子
一句话点破它和已知事物的关系:**它把 MoE 的"从固定专家库里选一个"换成了"现场生成一个专家",再在生成器前面挂一层贝叶斯滤波。**MoE 的专家库是静态预训练的产物,这篇的"专家"由当前会话数据编译出来。
真正的增量:不是"生成",是"在线更新的信念"
论文自己把和前人工作的分界线画得很清楚。
早期的权重生成器(Text-to-LoRA、SHINE 等)是**"读一遍上下文,然后冻结"——点估计。这篇改的是这一点:它在生成器的隐码上维护一个信念,随会话在线更新。所以生效的权重不是读一次就定死,而是随你越说越多,被一遍遍重新推导出来**。
具体实现上,论文采用的是一种类别信念(categorical belief):P_t(z) = Cat(π_t),一个 code pool {m₁ … m_K},递推式是
π_t,k ∝ π_(t-1),k · p(obs_t | z = m_k)
打分后每层 top-1 选择(不是 top-k 混合)。
至于更强的那种形式——连续高斯信念,加零锚定偏移 ψ ~ N(0, Σ₀),后验精度门控可塑性——论文明确说留作 future work,本次没有评估。
三、它明确换来的三样东西
论文对收益的表述是四句话,我给它们配上了因果:
| 声称的收益 | 机制上为什么成立 | 前提条件 |
|---|---|---|
| 计算摊销 | 证据编译进权重是"写一次、多轮复用",而不是每轮重读 | 单轮编译成本 < 被替代掉的重复 prefill 成本 |
| 释放上下文窗口 | 证据不再占 token,窗口留给推理本身 | 同一份证据真的会跨轮复用 |
| 跨轮持久 | 不依赖会话外部的存储层 | 会话内有效;会话结束后基座权重不变 |
| 可能泛化更好 | 信息以参数形式参与计算,而非作为被 attend 的文本 | 未被本次实验证明 |
第三行要特别强调,因为它是这类文章最常见的误读:"跨轮持久"不等于"永久记住"。权重的变化是会话级的,基座是冻结的。会话结束,这份补丁的寿命也就到了。
论文作者对名字的夸张程度反而很诚实,几句自限值得原样引用:
- "infinite" 指的是可达的权重配置空间,不是存储的知识量:"'infinite' here never means a larger knowledge store."
- 知识仍受常驻参数约束:"knowledge remains bounded by the resident parameters."
- 会话内适配是有界、低维、可逆的,不废除容量定律、也不替代预训练。
- 谈存储开销时:本文真正新增的可训练参数只有 selector 的 key map 与 query 对齐,规模远低于基座的百分之一。(生成器本身来自 SHINE,文中引用的开销数字是约 17%,那是被复用组件的账,不是本文的账。)
四、理想丰满:四处「尚未验证」
到这一节,这篇预印本的真实成熟度就露出来了。以下四条不是我的猜测,是论文自己承认的,或者是同行公开指出的。
死结 1:记忆化 vs 泛化,是权重生成器的一等失败模式
论文在相关工作里写得很直白:"A documented failure mode across weight generators is memorisation rather than generalisation — which we treat as a first-class evaluation concern."
翻译一下:把数据编译进权重这条路,历史上反复出现的是把答案背下来,而不是学会怎么用。如果落在这个失败模式上,那这套机制相对"直接把证据放在 prompt 里"就没有任何优势——甚至还多了编译器本身的开销。
论文把它列为一等评估关注,说明作者清楚这是决定性问题。但结论要看实验,而实验数字我没有拿到。
死结 2:「摊销」是成本挪了位置,不是证明成本更小
这是目前对该工作最有力的一条外部质疑。有评论者的表述很到位:"amortized" 是关于成本移动到哪里的主张,不是成本更小的证明。
算一下这笔账的缺口:
- 编译一次的成本(生成器前向 + selector 打分)需要实测延迟,论文没给。
- 生成器本身消耗多少算力,论文没给。
- 摊销的成立条件是
单次编译成本 < 被省下的重复 prefill 成本,右边取决于这份证据会被复用多少轮——短会话里右边极小。
也就是说,在同一算力预算下和"好好调过的检索系统"比一次总成本,这个实验是决定性的,而摘要层面看不到它。任何想拿它做记忆层或个人化的人,现阶段应该把它当方向看,而不是当技术采用。
死结 3:类别信念的表达力被 code pool 卡住
论文承认了这一点:类别信念是在整码之间做选择,而不是在码空间里移动——如果出现一个 code pool 里本来没有的"偏移",只能靠物化一个新的 atom 来应对("a shift the pool does not already contain can be met only by materialising a new atom")。
后果是可预期的:K 个码就是 K 个离散的行为模式,粗糙、有台阶。这正是它把连续高斯信念留作 future work 的原因。
死结 4:「Bayesian」是经验主张,也是可审计性的代价
论文对"贝叶斯"这个词的态度相当严谨,值得抄录:
"the posterior's spread ... is exactly the fragile part under amortization, so 'Bayesian' here is an empirical claim about a calibrated posterior, not a free consequence of emitting a distribution."
大意:后验的分散程度在摊销下恰恰是最脆弱的部分,所以"贝叶斯"是一个关于后验是否校准好的经验主张,不是你输出了一个分布就自动获得的性质。
另有一个操作层的现实约束:精确似然需要 test-time 反向传播,部署时不可行,所以论文里的精确递归信念 P 只作为离线的蒸馏教师和比较基线,而不是在线方案。
再往外一层,是社区在 Hacker News 上提出的、论文没有回答的问题:
- 偏见传播:如果某个编排器在自己的系统提示里注入"当话题与 X 相关时推荐产品 Y"这类倾向,而这种倾向能通过权重更新传播出去,它会污染那些从未使用该编排器的用户。这在 prompt 时代是不可能的失效模式。
- 稳定性:持续更新的模型如何保证行为稳定?当前模型已经够难预测了。
- 可复现性:权重随交互改写,意味着同一个模型对同一个问题的回答不可复现、难以审计。
这三点不是学术挑剔。它们直接决定这条路线能不能进生产——能通过审计、能复现、能回滚,和"更强"一样是硬需求。
五、论文自己设计的判据:怎么比才算公平
值得一提的是,这篇论文虽然没有结果数字,但给出了一套相当讲究的评估协议。协议本身就有信息量,因为它暴露了作者认为公平比较需要哪些条件。
三个研究问题:
- 权重能否承载数据:把一轮证据编译进生成权重后,在证据不进入 prompt 的前提下,能否据此作答?
- 单步信念:数据写入码池后,模型能否推断出当前 query 需要哪一个码?
- 信念累积:信念能否跨交互累积,使对话变长时路由变得更好?
基线是分层的,这比"跟谁比"的单一答案有用得多:
| 层级 | 基线 | 定位 |
|---|---|---|
| 头号基线 | in-context learning、retrieval | 主流方案,必须正面超越 |
| 适配基线 | Text-to-LoRA、SHINE、点估计式 test-time training | 证明"在线信念更新"比"读一次冻结"强 |
| 匹配预算基线 | 把等量算力花在对 verifier 做搜索/采样 | 防止拿"更多算力"冒充"更好机制" |
| 参考点 | stored-bank MoE(μMoE、∞-MoE 等) | 声明为参考,不做逐项对打 |
| 离线参照 | 精确递归信念 P | 蒸馏教师与上界 |
**"匹配预算基线"这一行是最见功力的一笔。**它把"我用了更多算力所以更好"这条最容易蒙混的路先堵上了——任何声称"把上下文编译进权重更划算"的工作,如果不做等算力对比,结论都没有意义。
六、选型决策树
你要解决的问题是「模型记不住上一轮给它的信息」?
│
├─ 否 → 别碰这条路。
│
└─ 是 → 先问:这份信息会被复用几次?
│
├─ 1~2 次(一次性问答、单轮 RAG)
│ └─ 老实放 prompt。编译一次的开销大概率收不回来。
│
├─ 每轮都要重读的同一批事实(长会话、固定人设、稳定知识库)
│ ├─ 信息量小、干净、窗口放得下
│ │ └─ 先优化检索与提示缓存(prefix cache / 上下文压缩),收益确定、零风险
│ └─ 信息量大、脏、需要多跳
│ └─ 这条路的目标场景。但今天先别上生产:
│ 等「等算力预算下 vs 检索」的实测结果
│
└─ 需要跨会话永久记住 / 需要可审计、可回滚
└─ 用外部存储 + 检索。这条路线现阶段给不了你要的
(权重随交互改写 → 不可复现、难审计、难回滚)
三条实践建议:
- 把它当研究信号,不当技术选型。 预印本、未见结果数字、未见训练细节(论文原文:"Full training details are outside the scope of this paper.")。今天没有任何生产理由迁移。
- 如果你在做记忆层,先抄它的评估协议,不要抄它的架构。 尤其"等算力预算基线"和"记忆化 vs 泛化"这两个关注点,直接可以搬进你自己的评测集——它们能帮你发现自己的方案是不是在背答案。
- 盯"会话级可塑性"这个新指标。 传统 API 的假设是权重固定、行为可复现。一旦权重开始随会话漂移,"同一输入的方差"就变成一个需要单独监控的量。
七、我的判断:不是替代,是记忆的第三条路
把这件事放到"记忆放在哪"的地图上,会看得更清楚。
持久性 ─────────────────────────────▶
短 长
│
│ ① 上下文窗口 ③ 外部存储 / RAG
│ 成本:每轮重读 成本:检索往返 + 拼接
│ 容量:受窗口限制 容量:大,但语义稀
│ 可审计:高 可审计:高
│
│ ② 权重(本文)
│ 成本:一次编译 + 每轮极小的因子化增量
│ 容量:受常驻参数限制
│ 可审计:低 ← 这是它的入场券问题
└──────────────────────────────────────────
我的判断是三层:
**第一,它不替代 RAG,它挤的是中间的缝。**上下文窗口和外部存储服务的是两类不同的需求(工作内存 vs 知识库)。权重编译服务的是第三类:会话内稳定、反复使用、且不希望它出现在上下文里的那批内容——比如一个长会话里逐渐明确的口味、约束、术语约定。这批内容今天确实无家可归,要么占窗口,要么每次重新检索。
**第二,它最大的价值可能不在性能,而在把"交互"重新定义成了训练信号。**过去几年,行业把实时交互当成一次性的填充物:用提示词装进去,用完丢。这篇论文的框架说交互本身可以是一个信号,模型在对话进行中现场改写自己。这个重新框定,比它当前的具体机制更值得记住——如果这条路线有任何一条分支能走通,RAG 与上下文工程要解决的问题清单都会被重写。
第三,最值得盯的信号不是它以后发不发结果,而是三个更硬的问题有没有答案。
- 有没有等算力预算下对检索/ICL 的实测优势?
- 长会话里贝叶斯信念漂不漂移?补丁和冻结基座打不打架?
- 有没有人给出审计与回滚方案?没有这个,它连内测都进不去。
往更远处看,这条路线和另一个同时在发生的趋势是同一个方向:基座冻结、生成器冻结、信念动态——三层各司其职,冻的保证一致性与安全,动的提供适应性。参数不再需要一次性把所有智慧焊死在巨大权重里。
代价也要说清:**权重会因为你而改,就意味着它更难复现、更难审计。**一条被恶意纠正的对话,可能悄悄改掉它此后对所有人的行为。可解释性和安全,会是这条路绕不开的下一关——而且是入场券级别的那一关。
参考
- Hu J, Clarke R M, Zhang Y, Hernández-Lobato J M. Infinite-Parameter LLMs: Generating and Adapting Weights from Live Data. arXiv:2609.18842, submitted 2026-09-16. arxiv.org/abs/2609.18…
- 论文 HTML 全文(v1): arxiv.org/html/2609.1…
- Hacker News 讨论(2026-09-17 登上首页;社区关于偏见传播、稳定性、可解释性的争议)
数据说明:本文引用的架构细节(秩 r=8、隐码 d_z=128、Qwen3-8B 基座、调制投影集合、类别信念递推式、评估协议分层)均取自论文 v1 原文。论文 §4.2–§4.4 的实验数值不在本文可见范围内,因此文中未出现任何该论文的 benchmark 数字。文中引用的 17% 参数开销属于被复用的 SHINE 组件,非本篇论文自身开销。第三方评论观点已在正文明确标注来源类型。本文为技术分析,不构成任何选型建议。