模型分数涨了,它真的学会了吗?LittleLearner 拆开了三种可能

模型分数涨了,它真的学会了吗?LittleLearner 拆开了三种可能

给模型加几万条 SFT 数据,再跑一轮 GRPO,数学分数从 30 分涨到 50 分。这个结果通常会 被概括成一句话:模型学会了更多数学。

这句话跳过了最难判断的一步。分数上涨至少有三种来源。模型可能获得了预训练中没有的 新能力。它也可能只是更稳定地调用了原有能力。提示、采样或评分方式的变化,还可能让 原有输出更容易被算作正确。

普通大模型很难拆开这三种情况。预训练语料规模太大,研究者无法列清模型见过哪些事实、 题型和推理套路。即使测试题没有原样出现在训练集里,释义、相似任务和解题模式也可能 已经存在。

LittleLearner 试图从训练入口控制这个变量。研究团队构造了受美国 K--5 课程范围约束的 LittleCurriculum,并训练 bounded model。matched Unfiltered control 使用相同模型架构、 token budget 和训练配方,只改变预训练语料的范围。这样,后续 Scaling、SFT+GRPO、ICL 和高采样预算的结果,才有机会回答"能力从哪里来"。

先把"学会"拆成五层证据

评测结果可以按五层检查:

层级 要检查什么 它能排除什么
预训练暴露 模型训练前接触了哪些概念和任务 原题与相似模式早已出现
后训练数据 SFT、RL 是否加入越界知识 提升只是追加了答案模板
提示行为 示例是否只改变格式、长度和解题风格 行为变化被当成能力变化
采样覆盖 pass@k 提高后差距是否仍存在 单次采样碰巧没命中
评分有效性 grader 是否会把复述、格式或小答案空间判对 指标虚高

LittleLearner 的意义在于,这五层中有几层能被实验设计直接约束。它仍不是完美因果实验, 但比"换个 Prompt 看分数"更接近能力来源判断。

受控预训练控制了什么

LittleCurriculum 从 FineWeb-Edu 经过词汇年龄、分类器、符号规则和频率采样等步骤,压低 Grade 6 以上课程内容。论文和官方数据卡把公开语料描述为约 88B tokens。论文附录还出现 约 100B retained pool 与 80B training target。三个数字指向不同阶段,公开材料没有给出 一张完整对账表,写作时不能把它们合并成同一个训练量。

研究团队同时训练 matched Unfiltered control。两组模型尽量保持架构、Tokenizer、训练 规模和配方一致,主要差异落在预训练语料选择。

这个控制很强,却没有把"知识"变成唯一变量。过滤课程内容时,语言难度、文档长度、 主题分布和文本质量也会一起变化。bounded 与 unfiltered 的差距,可以支持"预训练分布 影响后训练回报",不能直接归因于某一个被删除的知识点。

Scaling 提高了近边界能力,没有抹平远端差距

论文比较了约 0.6B、1.3B 和 5B 三个规模。模型变大后,K--5 范围内能力明显提高,Grade 6--7 也出现部分增益。到 Grade 8,改善很小。

这组结果排除了一个简单说法:只要参数够多,模型就会自动跨过所有受控暴露边界。它也 没有证明扩大到 70B、MoE 或 frontier scale 仍会得到同样曲线。论文最高只到 5.04B,且 课程年级不是模型自身的自然难度阶梯。

更稳妥的结论是:在这三个规模和当前训练量下,Scaling 主要增强范围内与边界附近能力, 没有消除远离边界的 Grade 8 差距。

SFT 与 GRPO 提升了成绩,但提升幅度依赖预训练底座

论文继续给 bounded 和 unfiltered 模型做 SFT 与 GRPO。两边的 K--5 数学能力都提高。 进入 Beyond-K--5 后,Unfiltered control 的提升更大,差距仍然存在。bounded model 使用 越界后训练数据时,当前预算下也没有观察到边界被明显抹平。

这说明同一后训练配方的回报会受预训练分布影响。它没有推出"RL 只能诱发已有能力"。 实验只覆盖一组模型、一套数据构造、特定算法和预算。换成更强探索、更长训练、外部工具 或不同任务,结果可能变化。

因此,文章和评测报告应该写:

在该论文的模型规模与 SFT+GRPO 设置下,后训练没有抹平观察到的远端预训练边界。

不要改写成"RL 无法创造新能力"。前一句是实验结论,后一句是普遍定律,证据强度完全 不同。

ICL 改变了输出,却没有提高越界正确率

ICL 实验提供了一个更直观的区分。Natural prose 示例让输出更长,也改变了解题表达。 K--5 准确率从 direct prompting 的 34.0% 小幅升到 36.8%。Beyond-K--5 则从 6.0% 变为 5.9%,没有提高。

Compact algebraic 和 Q/A-only 示例把回答大幅缩短,同时准确率明显下降。模型显然读到 了示例并调整行为,所以不能说它"忽略了 Prompt"。变化发生在格式、长度和表达策略, 没有转化成越界任务的正确答案。

这正是 elicitation 与 acquisition 的差别:提示可以改变模型怎样使用现有表示,却未必 给参数增加新的知识和算法。

pass@1024 仍有差距,能证明到哪一步

如果一个模型偶尔会做某类题,只是 pass@1 没采到正确答案,提高采样次数应该逐渐暴露 这部分能力。论文把每题采样预算提高到 1024,并观察到曲线大约在 k≈100 后趋平。

Grade 8 的差距仍然存在。这削弱了"只是默认采样不稳定"的解释,却不能证明正确答案的 真实概率严格为零。有限采样永远只能给出观测上界。

第一方文本在精确比例上还有冲突:正文称 LittleLearner 解出的 Grade 8 问题少于 Unfiltered 的一半,附录称约为三分之二。两句话不能同时作为同一个比例使用。当前安全 写法是"Grade 8 仍有显著差距,且文中称置信区间不重叠",等待作者澄清精确比例。

评分器本身也可能制造"能力"

论文审计 MathCAMPS 时发现,一些题目的 gold answer 原样出现在题面。regex grader 可能 把模型复述题目判为正确,使得这类题的分数最高虚高约 23 倍。研究团队删除了这些样本, 也移除了答案空间过小和实际难度错位的标准。

这提醒我们,能力判断不能只看模型和训练数据。评分器、答案空间、格式解析与采样策略都 是实验的一部分。一次 SFT 后"分数上涨",有时只是模型更熟悉 grader 接受的表面形式。

一张可复用的能力判断表

以后看到模型评测提升,可以依次问:

  1. 预训练阶段是否可能见过相同事实、题型或任务模式?
  2. 后训练数据是否直接加入了目标知识或解题模板?
  3. Prompt 是否主要改变了输出格式、长度和采样分布?
  4. 提高 pass@k 后,差距是否持续存在并趋于稳定?
  5. grader 是否可能因为复述、格式或小答案空间而虚高?

只有这些条件逐层关闭,才能把"分数涨了"升级为"模型获得了新能力"。若证据只覆盖其中 一两层,更准确的结论通常是:模型表现改善了,能力来源仍未完全识别。

LittleLearner 最值得保留的也是这套实验思路。它没有给"智能能否超越训练数据"下最终 定论,而是把一个经常被口号化的问题改造成可拆分、可对照、可保留未知项的评测合同。

参考资料

  1. LittleLearner arXiv v1:arxiv.org/html/2608.1...
  2. LittleCurriculum Dataset Card:huggingface.co/datasets/li...
  3. LittleLearner Hugging Face Organization:huggingface.co/littlelearn...

证据边界

  • 论文方法、实验与数字:PAPER_REPORTED
  • 数据规模与公开 checkpoint:OFFICIAL_CARD_REPORTED
  • 五层证据表与评测问题清单:作者分析。
  • 本地训练、checkpoint 推理、论文全流程复现:NOT_RUN
  • frontier scale、其他 RL 方法和长期能力获得:UNKNOWN
相关推荐
无糖可可果1 小时前
从 Vibe Coding 到 SDD:让 AI 写代码之前,先把话说清楚
人工智能
就是一顿骚操作1 小时前
GRU:用重置门与更新门简化序列记忆的经典解读
人工智能·深度学习·gru·论文解读
l1258651 小时前
# RAG多轮对话检索设计:Query重写如何让“那它呢“变成完整问题
前端·数据库·人工智能·python·算法·fastapi·milvus
程序员cxuan1 小时前
我用 DeepSeek-V4-Pro,完美复刻了苹果官网
人工智能·后端·程序员
Eric.461 小时前
2026 AI 漫剧叙事可控性深度工程:解决逻辑崩坏、镜头错乱、道具漂移的高阶落地方案
人工智能·stable diffusion·comfyui·ai漫剧
ZhengEnCi1 小时前
LLM13-2026年8月国内AI大模型性价比排行榜:DeepSeek涨价之后
人工智能
MartinYeung51 小时前
[论文学习]MPMA:针对模型上下文协议的偏好操纵攻击
人工智能·学习·安全
MacroZheng1 小时前
腾讯又开源了一个新项目,用起来真优雅!
前端·vue.js·人工智能
天天代码码天天2 小时前
lw.Web2Android v0.2.7 开源发布
人工智能