适合读者:做模型评测、做技术选型、被"参数越大越强"说服过的人;需要用数据说服同事"该不该换大模型"的人;以及所有听过"等下一代模型出来自然就好了"这句话的人。
核心收获:① 涌现现象的原始发现,以及它为什么看起来那么可信;② 非连续指标如何把连续的能力提升压成"开关",含完整的数学推演;③ 一套五步检验流程,用来判断你看到的跳变是真涌现还是度量假象;④ 这场争论落到工程实践上的四条具体启示。
2022 年前后,一批研究者发现了一件很反直觉的事:
把语言模型的参数从几亿加到几百亿,某些能力不是慢慢变好,而是在某个规模前后突然从"几乎不会"跳到"基本都会"。
做多步数学题、按指令执行、在上下文里学习新任务------这些能力都呈现出类似的"拐点"。
这个现象被命名为涌现能力(Emergent Abilities) ,并迅速成了一个流行说法:规模本身就是能力,等模型够大,它自然就会了。
这个说法深刻影响了行业决策。很多团队因此形成了一个行动准则:效果不好?换更大的模型。 甚至有人认为,某些能力的缺失不必专门解决,"等下一代模型出来自动就好了"。
但这个说法在一年后被认真地质疑了。而质疑的核心不是模型,是我们用来衡量模型的那把尺子。
这篇文章要讲清四件事:涌现是怎么被发现的、质疑从哪里来、为什么换把尺子曲线就变了、以及这场争论对你的日常工作意味着什么。
第一部分:涌现现象是怎么被发现的
先说清原始发现的做法。不搞清实验设计,就没法理解后面的质疑到底在质疑什么。
1.1 实验设计其实很朴素
研究者的方法可以概括成三步:
- 准备一组模型:同一个家族、同一套训练流程,但参数量从小到大(比如 1 亿、10 亿、100 亿、1000 亿);
- 在同一个任务上跑测试:比如多步算术、指令遵循、上下文学习;
- 画图:横轴是模型规模,纵轴是任务得分。
关键在第三步的画法------纵轴用的是当时最标准的评测指标,也就是"答对的比例"。
1.2 观察到的现象
如果得分是平滑上升的,说明能力随规模渐进积累,一切符合预期。
如果是长时间贴着 0,然后突然拉起来,看起来就像"能力在某个点被点亮了"。
在若干任务上,他们观察到的正是后者:小模型基本 0 分,某个规模之后快速逼近满分。
而且这个现象跨任务、跨模型家族都出现,看起来非常稳固------不同团队用不同模型都能复现,这让它显得格外可信。
1.3 由此得出的推论
于是一个影响力很大的推论出现了:
规模会带来质变,而质变是不可预测的。
这个推论很有吸引力,因为它把"AI 能力提升"渲染成了一种接近自然界相变的事情------就像水到 100 度会沸腾,量变导致质变。
但它有一个隐含前提:那条曲线真实反映了能力。
而问题恰恰出在这里:曲线是被"打点方式"画出来的。
第二部分:质疑的核心------问题可能出在尺子上
2023 年,一篇被广泛讨论的论文提出了一个非常锋利的反问:
如果这些"突然出现"的能力,只是因为我们的评估指标是非连续的,那这个现象还存在吗?
2.1 当时的主流指标是"非 0 即 1"
关键在于,当时的多数评测用的是非连续指标:
| 指标类型 | 判定方式 | 特点 |
|---|---|---|
| 精确匹配(Exact Match) | 答案必须和标准答案逐字一致 | 差一个字就是 0 分 |
| 多选判分 | 选错即 0 分 | 不区分"接近"还是"离谱" |
| 全对才算过 | 多步任务要求每一步都对 | 错一步全盘归零 |
这三种指标的共同点是:只有 0 和 1 两档,中间没有过渡。
这就是问题的根源。
2.2 乘积效应:把连续能力压成开关
现在做一个思想实验。
假设模型在某个多步任务上,每一步做对的概率都是 p------而且这个 p 随着模型变大在平滑提升。
那么"整道题全对"的概率是多少?因为每一步必须都对,所以:
css
全对概率 = pⁿ (n 是步骤数)
这个公式就是"阶梯曲线"的全部秘密。 让我们代入具体数字看一下。
取 n = 5(五步任务),看全对概率如何随单步正确率 p 变化:
| 单步正确率 p | 5 步全对概率 p⁵ | 看起来像什么 |
|---|---|---|
| 0.60 | 7.8% | 基本等于不会 |
| 0.70 | 16.8% | 还是不行 |
| 0.80 | 32.8% | 有起色了 |
| 0.90 | 59.0% | 明显能做 |
| 0.95 | 77.4% | 基本能做 |
注意这张表里最关键的信息:
- 从 p=0.60 到 p=0.80,单步能力提升了 33%(相对提升),但全对概率只从 7.8% 涨到 32.8%------在评测报告里,这两个数字都还是"不及格";
- 而从 p=0.80 到 p=0.95,单步只提升了 19% ,全对概率却从 32.8% 涨到 77.4%------看起来像"突然会了"。
能力在稳步线性提升,但"全对"这个指标会一直趴在地上,直到跨过某个门槛才猛地抬起来。
2.3 步骤越多,效果越夸张
再看步骤数的放大作用(固定 p = 0.8):
| 步骤数 n | 全对概率 |
|---|---|
| 1 | 80% |
| 3 | 51% |
| 5 | 33% |
| 10 | 11% |
单步 80% 的模型,在十步任务上只有 11% 的全对率。 这就是为什么"多步推理"任务上的涌现现象特别明显------乘积效应被步骤数放大了。
2.4 一句话概括这个机制
它不是能力在跳,而是指标把一个连续过程压缩成了一个开关。
这一点值得反复强调,因为它改变了对整个现象的解读:
- 如果能力是连续积累的,那么"等下一代模型"就不会带来质变,只是往前走了一小格;
- 如果是真的相变,那么等待就是合理的策略;
- 两种解读,对应完全相反的行动方案。
第三部分:换把尺子,曲线就平了
质疑提出后,验证方法其实非常直接:换尺子,重画一遍曲线。
3.1 用什么指标替代
同一批模型、同样的测试内容,只把指标从"全对才算对"换成"部分对也给分":
| 连续指标 | 含义 | 适用场景 |
|---|---|---|
| 编辑距离类 | 答案和标准答案差多少个字,按差距给分 | 生成类任务 |
| 概率类 | 模型给正确答案分配的概率有多大,而不是它最终选了哪个 | 选择题、分类 |
| 部分得分 | 多步任务按做对的步数给分 | 推理、规划 |
| 要点覆盖率 | 看模型是否覆盖了关键要点集合 | 开放问答、摘要 |
注意最后一种的特别之处:它完全不看"答案表述是否一致",只看"该说的点有没有说到"。这在业务评测里往往最实用。
3.2 结果:阶梯变成了斜坡
换完之后,很多原本"阶梯状"的曲线变得平滑 了------能力随规模连续上升,没有拐点。
这个结果的含义很重:
至少在这批任务上,"涌现"不是能力层面的突变,而是度量层的假象。
3.3 一个容易被忽略的推论
如果这个解释成立,那么它还顺带解释了一个现象:为什么"涌现"总是在特定类型的任务上被观察到?
因为那些任务的共同点是------判定方式天然是离散的:
- 答对一道数学题的最终答案,只有"对"和"错";
- 执行一条指令,只有"成功"和"失败";
- 完成一次多步推理,只有"全对"和"没全对"。
而"写一段通顺的文字""总结一篇文章"这类任务,从设计上就很难用 0/1 判定------所以它们从来也没表现出"涌现"。
这个对应关系本身就是一条很强的证据。
第四部分:另一边------确实不是全部都平滑
但这场争论并没有以"涌现是假的"盖棺定论。更准确的说法是:"部分被解释,部分仍待研究"。
有几类现象很难仅用指标设计来解释。
4.1 能力组合带来的非线性
有些任务需要多种能力同时到位,比如:
- 理解指令(要听懂要求)+ 长程规划(要能安排步骤)+ 精确输出(格式不能错)。
即使每一项能力都是平滑提升 的,它们的乘积仍会呈现出接近门槛的行为。
但要注意机制的区别: 这不是"某个能力突然出现",而是多个连续能力的交错点。这个区别很重要------因为它意味着你可以通过"补齐最弱的那一环"来绕过门槛,而不必等模型变大。
4.2 上下文学习与思维链的增益幅度
有研究报告,随着规模增大,模型从少量示例中学习的效果提升速度很快,超出了纯线性的预期。
比如:给小模型三个示例,它几乎学不会新任务;给大模型三个示例,它能立刻上手。
这类现象目前仍有不同解释。 一种可能是:上下文学习本身也需要"先有基础能力打底",存在组合门槛;另一种可能是:样本量、提示格式等因素共同作用。
这属于学界尚未定论的部分,诚实地承认它比强行解释更好。
4.3 度量本身也会影响模型行为
这一条尤其值得工程人员注意。
有些任务上,模型给出的答案格式不符合评测脚本的要求,于是被判为错误。调整评测脚本(比如允许数字带千分位、允许同义词、允许大小写差异)之后,成绩大幅变化。
这提醒我们:评测工具本身是一个变量,不是一把客观的尺子。
在内部评测里,这经常是"成绩波动"的真正原因------不是模型变了,是脚本改了。
4.4 所以更严谨的结论是什么
已经有不少"涌现"被证明是度量假象;但也不能反过来说"所有非线性提升都是假的"。
一个实用的判断顺序:
- 看到一个跳变,先检查指标(是不是非连续的);
- 再看是不是能力组合的乘积效应(是不是多步任务);
- 排除这两项之后,才去考虑能力层面是否存在真正的非线性。
第五部分:这场争论对工程实践的四点启示
抛开学术争议,这场讨论对日常工作的影响非常具体。
启示一:别把希望寄托在"下一代模型会自然变好"
如果某个能力的提升其实是平滑的,那么"等一等"就不会有质变,只是往前走了一小格。
该做的工程优化,还是得做。 而更实际的情况是:等新模型的时间成本,往往高于现在就把问题解决掉的成本。
启示二:指标设计决定你的结论
你用"完全正确率"评估,就会看到一片死水;用"关键点覆盖率",就能看到真实进展。
这不是"放水",而是选择信息量更高的度量。
两者的区别值得说清楚:
- 放水:降低标准,让不好的结果看起来好(比如把该判错的判成对);
- 换指标:用更能反映真实进展的度量,同时不掩盖问题(比如从"完全匹配"换成"要点覆盖",但依然记录失败样本)。
判断标准很简单:换了指标之后,你还能不能定位失败原因。能,就是换指标;不能,就是放水。
启示三:小模型加上好工程,经常打败大模型的粗糙用法
这个结论在实践中被反复验证:
把提示结构、检索、格式约束、后处理做扎实,一个中等模型的表现可以接近更大模型的裸用效果。
原因不难理解:很多时候失败不是因为"模型不够聪明",而是因为:
- 提示里没给够信息;
- 输出格式没约束,导致解析失败;
- 该检索的没检索,指望模型自己记住。
这三类问题的解决成本,远低于升级模型的成本。
启示四:评测要同时看连续与离散指标
| 指标类型 | 看什么 | 缺了会怎样 |
|---|---|---|
| 连续指标 | 能力趋势------"在进步吗" | 只看它,会忽略"能不能交付" |
| 离散指标 | 可用性------"能上线吗" | 只看它,会错判进展,误以为停滞 |
两个一起看,才既有方向感又有现实感。
举例:连续指标显示"关键点覆盖从 60% 涨到 78%"(在进步),离散指标显示"完全正确的比例还是 12%"(还不能直接交付)。两条信息合起来,才能得出"继续优化 + 加上人工复核"这样的决策。
第六部分:五步检验流程
下面这套流程可以直接用。顺序很重要------先怀疑尺子,再怀疑噪声,最后才怀疑能力。
检验一:换一个连续指标重画
如果曲线从阶梯变平滑,基本可以确认是度量效应。
这是最快、最省力的一步,应该永远排在最前面。
检验二:做单步拆分
把多步任务拆开,分别统计每一步的准确率。
判断依据:
- 如果单步准确率是平滑上升的,而整体是阶梯的 → 那就是乘积效应,不是"突然会了";
- 如果单步也出现跳变 → 才值得往能力层面怀疑。
这一步能直接区分"乘积效应"和"真涌现"。
检验三:检查答案格式
大量"错误"其实是格式不符。把判定脚本放宽到能识别等价表达:
- 数字格式(1,000 与 1000 与 1k);
- 单位(10GB 与 10 GB 与 10G);
- 同义词("正面"与"积极");
- 标点与大小写。
然后再看曲线。 这一步常常能"找回"一大截分数。
检验四:跨任务交叉验证
判断依据:
- 如果"涌现"只出现在用同一类指标的任务上 → 更可能是度量问题;
- 如果不同指标、不同任务上都出现同一种非线性 → 才值得怀疑是能力层面的现象。
检验五:看样本量
小样本上的"0 分"可能是统计噪声。
有些小模型只是"偶尔蒙对" ,扩大样本后曲线会自然抬升------反过来也一样,小样本上的高分也可能是一时的运气。
一句话总结这套流程
看到一个跳变,先怀疑尺子,再怀疑噪声,最后才怀疑能力。
第七部分:别被"涌现"这个词带偏
最后说三个容易踩的思维坑。这些坑的代价比技术选型失误更大,因为它们会扭曲整个团队的判断习惯。
坑一:把"涌现"当成不可解释的魔法
一旦接受"它自然会冒出来",就会放弃做归因分析。
而工程上真正有用的,恰恰是反过来问:"哪一部分能力已经具备?缺的是哪一环?"
- 是知识不够?→ 上检索;
- 是格式不稳?→ 加约束、加后处理;
- 是多步规划不稳?→ 拆步骤、加验证;
- 是指令理解不到?→ 改提示结构、给示例。
这四个问题都有解,而且都不需要换模型。
坑二:用它为"堆参数"背书
参数确实重要,但"规模到了能力自然有"这个推论并不成立。
数据质量、任务多样性、后训练方式,往往比参数更决定具体任务表现。
一个直接的证据:同一个基座模型,经过不同的后训练(SFT、偏好对齐),在具体任务上的表现可以差出很大的幅度------而这期间参数量一个都没变。
坑三:反过来彻底否定非线性
有些能力组合确实存在门槛效应。
一个典型的工程例子:一项能力必须达到足够可靠,才能被安全地用进自动化流程。
- 准确率 85% 的组件,可以用在"人工复核"的流程里;
- 但要用在"无人值守"的流程里,可能需要 99%------这个 85%→99% 的跨度,在业务上就是一个真实存在的门槛。
这种"工程门槛"和"能力涌现"是两回事,但同样需要认真对待。
把话说准
能力大概率是连续积累的,而"可用"是存在门槛的。
前者决定了你要持续投入,后者决定了你要设验收标准。
这两句话可以同时成立,而且互不矛盾------搞清楚它们的区别,就不会在"要不要换大模型"这件事上反复摇摆。
常见误区
误区一:"涌现说明小模型永远做不了这件事。"
小模型往往是"做不好"而非"完全做不了"。
在边界清晰、可结构化、可校验的任务上,小模型配合流程设计可以接近大模型效果。 真正吃掉小模型的通常是三件事:开放式推理、长尾语义、多步规划的稳定性。
先看你的任务落不落在这三块里,再决定要不要上大模型。
误区二:"换更大的模型总能解决问题。"
如果瓶颈在数据、提示结构或检索,换模型经常只是把错误变了个形式,成本却翻倍。
一个典型的验证方法:拿现在失败的 20 个样本,人工分析失败原因分成几类。如果前两类都不是"知识不足",那换模型大概率无效。
误区三:"测出来 0 分就是不会。"
0 分可能有四种来源:
- 格式不符(判定脚本太严);
- 样本太少(统计噪声);
- 指标过严(全对才算对);
- 真的不会。
前三种占的比例,比大多数人以为的高。 先排除评测本身的问题,再下结论。
误区四:"既然涌现可能是假象,那榜单就没意义了。"
榜单仍然有价值,关键是要读对。看三项:
- 它用什么指标------连续还是离散;
- 它测什么任务------是不是和你的任务同类;
- 样本多大------几十条还是几千条。
读懂了限制条件,榜单才有用。 不加区分地看排名,才是有害的。
误区五:"能力是连续的,所以慢慢投入自然会好。"
这是反向的错误。"连续"指的是模型规模与能力的关系 ,不是你的项目与效果的关系。
如果瓶颈在你的提示、检索、数据上,投再多时间在"等模型变强"上也不会有进展。 归因还是要做。
误区六:"我们的评测半年没变过,所以成绩可比。"
未必。要检查的是底层环境:判定脚本的依赖库有没有升级?分词或后处理逻辑有没有动?测试集有没有被无意修改?
"固定脚本版本并纳入变更记录",是避免这类乌龙的最低成本手段。
实战问答
Q1:面试被问"你怎么看大模型的涌现能力",怎么答得有层次?
A:按"发现 → 质疑 → 结论 → 态度"四步走。
第一步,陈述原始发现:2022 年前后,研究者观察到部分任务上指标随规模出现台阶式跃升,由此产生了"规模带来质变"的推论。
第二步,说核心质疑 :2023 年有研究指出,这些台阶可能来自非连续指标的压缩效应------多步任务要求全对,单步 60% 正确率的模型,五步全对率只有 7.8%,能力在连续提升,指标却一直趴着。
第三步,给准确结论 :部分涌现已被证明是度量效应,但能力组合的门槛效应仍然真实。 两句话都要说,只讲一半都不准确。
第四步,落到工程态度 :与其等模型变大,不如先把评测指标和数据做对------因为如果是度量效应,"等"是不会等来质变的。
Q2:老板说"等下一版模型出来,这个功能自然就能做了",我怎么回应?
A :不要争论,做一个实验给他看。
具体做法:
- 把指标从"完全正确率"换成"关键点覆盖率",重跑一遍------大概率能看到明显提升,说明能力其实已经部分具备;
- 把失败样本按原因分类,比如:格式问题 / 检索没召回 / 多步合并出错 / 真的不懂。
结果通常长这样:失败集中在一两类具体问题上,而且这两类都是可以工程解决的。
把这两类解决掉,往往不需要等新模型。比起"等",这个实验的可信度高得多,成本也只要一两天。
Q3:我们内部评测怎么设计,才能既不骗自己也不骗别人?
A:三条原则。
第一,同一批用例上同时跑连续与离散指标。 连续看趋势,离散看交付。
第二,按任务类型分桶看,不只看总分。 总分是最容易掩盖问题的数字------它可以让一个"长尾任务全线崩"的系统看起来在进步。
第三,固定评测脚本版本并纳入变更记录。
第三条最容易被忽略,但它能避免"成绩波动其实是脚本改了"这种乌龙。具体做法:把判定脚本、测试集、依赖版本一起打版本号,每次成绩都记录版本号。
另外建议加一条 :每次评测都保留一份失败样本清单 。分数会波动,但失败样本的类型分布 相对稳定------它是比总分更好的"体检指标"。
Q4:小模型真的能打吗?
A :在边界清晰、可结构化、可校验的任务上,小模型加流程设计的性价比往往更高。
典型的"能打"场景:
- 分类、抽取、格式转换(有明确判定标准);
- 短文本改写、翻译(有参考对照);
- 结构化数据生成(可程序化校验)。
真正吃掉小模型的通常是这三件事:
| 能力 | 为什么难 |
|---|---|
| 开放式推理 | 没有唯一正确答案,无法用规则兜底 |
| 长尾语义 | 训练数据覆盖不到的表达方式 |
| 多步规划的稳定性 | 乘积效应会放大单步误差 |
先看你的任务落不落在这三块里,再决定要不要上大模型。
Q5:为什么同一个模型,我们测出来和小红书上别人测出来差那么多?
A:大概率是这三个变量不同。
- 判定标准:是不是同一套指标?允许格式差异吗?
- 测试集:他用的公开集还是自建集?难度分布一样吗?
- 推理参数 :温度、top_p、max_tokens 是否一致?同一个模型在不同温度下,成绩可以差出不少。
做对比时,这三项必须写清楚。 否则"谁更强"这个结论根本没有意义------包含"我们和官方宣传的数字不一致"这种情况,原因往往也是这三项。
Q6:怎么区分"乘积效应"和"真的多步能力不足"?
A:做一个拆解实验。
做法:把多步任务拆成单步,逐步骤统计正确率。
判读方式:
| 观察 | 结论 |
|---|---|
| 每一步都做对得不错(比如都 85%+),但整体全对率很低 | 乘积效应------单步没问题,是要求全对导致的 |
| 某些步骤正确率明显低(比如某一步只有 40%) | 真实短板------那一环能力不足 |
| 前面步骤都对,最后一步骤降 | 可能是长程依赖问题 |
第一种情况应该改指标或降低步骤要求;第二种情况应该针对性补强。 两者的解法完全不同,所以这个拆解是必须做的。
Q7:报告里写"关键点覆盖率提升 18%",但产品经理说用户没感觉,怎么办?
A :这正好说明为什么需要连续指标和离散指标一起看。
覆盖率涨了 18%,但可能:
- 提升集中在用户很少遇到的场景;
- 提升的是次要要点,核心要点没动;
- 离散指标(完全正确的比例)没变,所以用户感知不到。
补一个动作 :把评测用例按用户使用频率加权,再看提升。
结论很可能是:应当优先攻克频次最高、当前最差的那一类问题,而不是继续拉平均覆盖率。 分桶加权,比看总分有用得多。
术语表
| 术语 | 含义 |
|---|---|
| 涌现能力 | 指模型规模增大后,某些任务指标出现看似突变的提升 |
| 度量假象(Mirage) | 突变来自非连续指标,而底层能力其实是连续提升的 |
| 非连续指标 | 如精确匹配、全对判定,只有 0 和 1 两档 |
| 连续指标 | 如编辑距离、答案概率、要点覆盖率,能反映"对到什么程度" |
| 乘积效应 | 多步任务要求每步都正确,导致整体表现呈现近门槛行为 |
| 要点覆盖率 | 检查答案是否覆盖了预设关键点集合的指标,不要求表述一致 |
| 工程门槛 | 一项能力达到足够可靠才能安全投入自动化流程,属于业务约束而非能力突变 |
| 有效规模 | 在特定任务上真正决定表现的规模与数据组合,而非单纯参数量 |
结语
把这篇压缩成三句话:
第一,那条"突然跳起来"的曲线,很可能是一把非连续的尺子画出来的。 多步任务要求全对时,单步 60% 正确率的模型全对率只有 7.8%------能力一直在涨,只是指标一直趴着,直到跨过某个门槛才站起来。
第二,但也不能反过来说所有非线性都是假的。 能力组合的乘积效应、上下文学习的增益、工程上的可靠性门槛------这些是真实存在的,只是机制不是"某个能力突然出现"。
第三,落到工程上,真正的结论只有两条:
指标要选对,投入不能停。
指标要选对,因为用错指标会让你误判进展,从而做出错误的资源决策(要么过早放弃,要么无谓等待)。
投入不能停 ,因为如果能力是连续积累的,那"等"就不会带来跃迁------改变结果的,始终是你把哪一环补上了。
而如果只允许带走一个动作,那就是:下一次看到"突然变强/变差"的结论时,先问一句"这是用什么指标量的"。 这一个问题,能帮你过滤掉相当一部分误判。