模型分数涨了,它真的学会了吗?LittleLearner 拆开了三种可能
给模型加几万条 SFT 数据,再跑一轮 GRPO,数学分数从 30 分涨到 50 分。这个结果通常会 被概括成一句话:模型学会了更多数学。
这句话跳过了最难判断的一步。分数上涨至少有三种来源。模型可能获得了预训练中没有的 新能力。它也可能只是更稳定地调用了原有能力。提示、采样或评分方式的变化,还可能让 原有输出更容易被算作正确。
普通大模型很难拆开这三种情况。预训练语料规模太大,研究者无法列清模型见过哪些事实、 题型和推理套路。即使测试题没有原样出现在训练集里,释义、相似任务和解题模式也可能 已经存在。
LittleLearner 试图从训练入口控制这个变量。研究团队构造了受美国 K–5 课程范围约束的 LittleCurriculum,并训练 bounded model。matched Unfiltered control 使用相同模型架构、 token budget 和训练配方,只改变预训练语料的范围。这样,后续 Scaling、SFT+GRPO、ICL 和高采样预算的结果,才有机会回答“能力从哪里来”。
先把“学会”拆成五层证据
评测结果可以按五层检查:
| 层级 | 要检查什么 | 它能排除什么 |
|---|---|---|
| 预训练暴露 | 模型训练前接触了哪些概念和任务 | 原题与相似模式早已出现 |
| 后训练数据 | SFT、RL 是否加入越界知识 | 提升只是追加了答案模板 |
| 提示行为 | 示例是否只改变格式、长度和解题风格 | 行为变化被当成能力变化 |
| 采样覆盖 | pass@k 提高后差距是否仍存在 | 单次采样碰巧没命中 |
| 评分有效性 | grader 是否会把复述、格式或小答案空间判对 | 指标虚高 |
LittleLearner 的意义在于,这五层中有几层能被实验设计直接约束。它仍不是完美因果实验, 但比“换个 Prompt 看分数”更接近能力来源判断。
受控预训练控制了什么
LittleCurriculum 从 FineWeb-Edu 经过词汇年龄、分类器、符号规则和频率采样等步骤,压低 Grade 6 以上课程内容。论文和官方数据卡把公开语料描述为约 88B tokens。论文附录还出现 约 100B retained pool 与 80B training target。三个数字指向不同阶段,公开材料没有给出 一张完整对账表,写作时不能把它们合并成同一个训练量。
研究团队同时训练 matched Unfiltered control。两组模型尽量保持架构、Tokenizer、训练 规模和配方一致,主要差异落在预训练语料选择。
这个控制很强,却没有把“知识”变成唯一变量。过滤课程内容时,语言难度、文档长度、 主题分布和文本质量也会一起变化。bounded 与 unfiltered 的差距,可以支持“预训练分布 影响后训练回报”,不能直接归因于某一个被删除的知识点。
Scaling 提高了近边界能力,没有抹平远端差距
论文比较了约 0.6B、1.3B 和 5B 三个规模。模型变大后,K–5 范围内能力明显提高,Grade 6–7 也出现部分增益。到 Grade 8,改善很小。
这组结果排除了一个简单说法:只要参数够多,模型就会自动跨过所有受控暴露边界。它也 没有证明扩大到 70B、MoE 或 frontier scale 仍会得到同样曲线。论文最高只到 5.04B,且 课程年级不是模型自身的自然难度阶梯。
更稳妥的结论是:在这三个规模和当前训练量下,Scaling 主要增强范围内与边界附近能力, 没有消除远离边界的 Grade 8 差距。
SFT 与 GRPO 提升了成绩,但提升幅度依赖预训练底座
论文继续给 bounded 和 unfiltered 模型做 SFT 与 GRPO。两边的 K–5 数学能力都提高。 进入 Beyond-K–5 后,Unfiltered control 的提升更大,差距仍然存在。bounded model 使用 越界后训练数据时,当前预算下也没有观察到边界被明显抹平。
这说明同一后训练配方的回报会受预训练分布影响。它没有推出“RL 只能诱发已有能力”。 实验只覆盖一组模型、一套数据构造、特定算法和预算。换成更强探索、更长训练、外部工具 或不同任务,结果可能变化。
因此,文章和评测报告应该写:
在该论文的模型规模与 SFT+GRPO 设置下,后训练没有抹平观察到的远端预训练边界。
不要改写成“RL 无法创造新能力”。前一句是实验结论,后一句是普遍定律,证据强度完全 不同。
ICL 改变了输出,却没有提高越界正确率
ICL 实验提供了一个更直观的区分。Natural prose 示例让输出更长,也改变了解题表达。 K–5 准确率从 direct prompting 的 34.0% 小幅升到 36.8%。Beyond-K–5 则从 6.0% 变为 5.9%,没有提高。
Compact algebraic 和 Q/A-only 示例把回答大幅缩短,同时准确率明显下降。模型显然读到 了示例并调整行为,所以不能说它“忽略了 Prompt”。变化发生在格式、长度和表达策略, 没有转化成越界任务的正确答案。
这正是 elicitation 与 acquisition 的差别:提示可以改变模型怎样使用现有表示,却未必 给参数增加新的知识和算法。
pass@1024 仍有差距,能证明到哪一步
如果一个模型偶尔会做某类题,只是 pass@1 没采到正确答案,提高采样次数应该逐渐暴露 这部分能力。论文把每题采样预算提高到 1024,并观察到曲线大约在 k≈100 后趋平。
Grade 8 的差距仍然存在。这削弱了“只是默认采样不稳定”的解释,却不能证明正确答案的 真实概率严格为零。有限采样永远只能给出观测上界。
第一方文本在精确比例上还有冲突:正文称 LittleLearner 解出的 Grade 8 问题少于 Unfiltered 的一半,附录称约为三分之二。两句话不能同时作为同一个比例使用。当前安全 写法是“Grade 8 仍有显著差距,且文中称置信区间不重叠”,等待作者澄清精确比例。
评分器本身也可能制造“能力”
论文审计 MathCAMPS 时发现,一些题目的 gold answer 原样出现在题面。regex grader 可能 把模型复述题目判为正确,使得这类题的分数最高虚高约 23 倍。研究团队删除了这些样本, 也移除了答案空间过小和实际难度错位的标准。
这提醒我们,能力判断不能只看模型和训练数据。评分器、答案空间、格式解析与采样策略都
是实验的一部分。一次 SFT 后“分数上涨”,有时只是模型更熟悉 grader 接受的表面形式。
一张可复用的能力判断表
以后看到模型评测提升,可以依次问:
- 预训练阶段是否可能见过相同事实、题型或任务模式?
- 后训练数据是否直接加入了目标知识或解题模板?
- Prompt 是否主要改变了输出格式、长度和采样分布?
- 提高 pass@k 后,差距是否持续存在并趋于稳定?
- grader 是否可能因为复述、格式或小答案空间而虚高?
只有这些条件逐层关闭,才能把“分数涨了”升级为“模型获得了新能力”。若证据只覆盖其中 一两层,更准确的结论通常是:模型表现改善了,能力来源仍未完全识别。
LittleLearner 最值得保留的也是这套实验思路。它没有给“智能能否超越训练数据”下最终 定论,而是把一个经常被口号化的问题改造成可拆分、可对照、可保留未知项的评测合同。
参考资料
- LittleLearner arXiv v1:arxiv.org/html/2608.1…
- LittleCurriculum Dataset Card:huggingface.co/datasets/li…
- LittleLearner Hugging Face Organization:huggingface.co/littlelearn…
证据边界
- 论文方法、实验与数字:
PAPER_REPORTED。 - 数据规模与公开 checkpoint:
OFFICIAL_CARD_REPORTED。 - 五层证据表与评测问题清单:作者分析。
- 本地训练、checkpoint 推理、论文全流程复现:
NOT_RUN。 - frontier scale、其他 RL 方法和长期能力获得:
UNKNOWN。