【AI工程师精讲】涌现能力:能力在连续提升,还是尺子在骗人

适合读者:做模型评测、做技术选型、被"参数越大越强"说服过的人;需要用数据说服同事"该不该换大模型"的人;以及所有听过"等下一代模型出来自然就好了"这句话的人。

核心收获:① 涌现现象的原始发现,以及它为什么看起来那么可信;② 非连续指标如何把连续的能力提升压成"开关",含完整的数学推演;③ 一套五步检验流程,用来判断你看到的跳变是真涌现还是度量假象;④ 这场争论落到工程实践上的四条具体启示。


2022 年前后,一批研究者发现了一件很反直觉的事:

把语言模型的参数从几亿加到几百亿,某些能力不是慢慢变好,而是在某个规模前后突然从"几乎不会"跳到"基本都会"。

做多步数学题、按指令执行、在上下文里学习新任务------这些能力都呈现出类似的"拐点"。

这个现象被命名为涌现能力(Emergent Abilities) ,并迅速成了一个流行说法:规模本身就是能力,等模型够大,它自然就会了。

这个说法深刻影响了行业决策。很多团队因此形成了一个行动准则:效果不好?换更大的模型。 甚至有人认为,某些能力的缺失不必专门解决,"等下一代模型出来自动就好了"。

但这个说法在一年后被认真地质疑了。而质疑的核心不是模型,是我们用来衡量模型的那把尺子。

这篇文章要讲清四件事:涌现是怎么被发现的、质疑从哪里来、为什么换把尺子曲线就变了、以及这场争论对你的日常工作意味着什么。


第一部分:涌现现象是怎么被发现的

先说清原始发现的做法。不搞清实验设计,就没法理解后面的质疑到底在质疑什么。

1.1 实验设计其实很朴素

研究者的方法可以概括成三步:

  1. 准备一组模型:同一个家族、同一套训练流程,但参数量从小到大(比如 1 亿、10 亿、100 亿、1000 亿);
  2. 在同一个任务上跑测试:比如多步算术、指令遵循、上下文学习;
  3. 画图:横轴是模型规模,纵轴是任务得分。

关键在第三步的画法------纵轴用的是当时最标准的评测指标,也就是"答对的比例"。

1.2 观察到的现象

如果得分是平滑上升的,说明能力随规模渐进积累,一切符合预期。

如果是长时间贴着 0,然后突然拉起来,看起来就像"能力在某个点被点亮了"。

在若干任务上,他们观察到的正是后者:小模型基本 0 分,某个规模之后快速逼近满分。

而且这个现象跨任务、跨模型家族都出现,看起来非常稳固------不同团队用不同模型都能复现,这让它显得格外可信。

1.3 由此得出的推论

于是一个影响力很大的推论出现了:

规模会带来质变,而质变是不可预测的。

这个推论很有吸引力,因为它把"AI 能力提升"渲染成了一种接近自然界相变的事情------就像水到 100 度会沸腾,量变导致质变。

但它有一个隐含前提:那条曲线真实反映了能力。

而问题恰恰出在这里:曲线是被"打点方式"画出来的。


第二部分:质疑的核心------问题可能出在尺子上

2023 年,一篇被广泛讨论的论文提出了一个非常锋利的反问:

如果这些"突然出现"的能力,只是因为我们的评估指标是非连续的,那这个现象还存在吗?

2.1 当时的主流指标是"非 0 即 1"

关键在于,当时的多数评测用的是非连续指标:

指标类型 判定方式 特点
精确匹配(Exact Match) 答案必须和标准答案逐字一致 差一个字就是 0 分
多选判分 选错即 0 分 不区分"接近"还是"离谱"
全对才算过 多步任务要求每一步都对 错一步全盘归零

这三种指标的共同点是:只有 0 和 1 两档,中间没有过渡。

这就是问题的根源。

2.2 乘积效应:把连续能力压成开关

现在做一个思想实验。

假设模型在某个多步任务上,每一步做对的概率都是 p------而且这个 p 随着模型变大在平滑提升。

那么"整道题全对"的概率是多少?因为每一步必须都对,所以:

css 复制代码
全对概率 = pⁿ    (n 是步骤数)

这个公式就是"阶梯曲线"的全部秘密。 让我们代入具体数字看一下。

取 n = 5(五步任务),看全对概率如何随单步正确率 p 变化:

单步正确率 p 5 步全对概率 p⁵ 看起来像什么
0.60 7.8% 基本等于不会
0.70 16.8% 还是不行
0.80 32.8% 有起色了
0.90 59.0% 明显能做
0.95 77.4% 基本能做

注意这张表里最关键的信息:

  • 从 p=0.60 到 p=0.80,单步能力提升了 33%(相对提升),但全对概率只从 7.8% 涨到 32.8%------在评测报告里,这两个数字都还是"不及格";
  • 而从 p=0.80 到 p=0.95,单步只提升了 19% ,全对概率却从 32.8% 涨到 77.4%------看起来像"突然会了"。

能力在稳步线性提升,但"全对"这个指标会一直趴在地上,直到跨过某个门槛才猛地抬起来。

2.3 步骤越多,效果越夸张

再看步骤数的放大作用(固定 p = 0.8):

步骤数 n 全对概率
1 80%
3 51%
5 33%
10 11%

单步 80% 的模型,在十步任务上只有 11% 的全对率。 这就是为什么"多步推理"任务上的涌现现象特别明显------乘积效应被步骤数放大了。

2.4 一句话概括这个机制

它不是能力在跳,而是指标把一个连续过程压缩成了一个开关。

这一点值得反复强调,因为它改变了对整个现象的解读:

  • 如果能力是连续积累的,那么"等下一代模型"就不会带来质变,只是往前走了一小格;
  • 如果是真的相变,那么等待就是合理的策略;
  • 两种解读,对应完全相反的行动方案。

第三部分:换把尺子,曲线就平了

质疑提出后,验证方法其实非常直接:换尺子,重画一遍曲线。

3.1 用什么指标替代

同一批模型、同样的测试内容,只把指标从"全对才算对"换成"部分对也给分":

连续指标 含义 适用场景
编辑距离类 答案和标准答案差多少个字,按差距给分 生成类任务
概率类 模型给正确答案分配的概率有多大,而不是它最终选了哪个 选择题、分类
部分得分 多步任务按做对的步数给分 推理、规划
要点覆盖率 看模型是否覆盖了关键要点集合 开放问答、摘要

注意最后一种的特别之处:它完全不看"答案表述是否一致",只看"该说的点有没有说到"。这在业务评测里往往最实用。

3.2 结果:阶梯变成了斜坡

换完之后,很多原本"阶梯状"的曲线变得平滑 了------能力随规模连续上升,没有拐点。

这个结果的含义很重:

至少在这批任务上,"涌现"不是能力层面的突变,而是度量层的假象。

3.3 一个容易被忽略的推论

如果这个解释成立,那么它还顺带解释了一个现象:为什么"涌现"总是在特定类型的任务上被观察到?

因为那些任务的共同点是------判定方式天然是离散的:

  • 答对一道数学题的最终答案,只有"对"和"错";
  • 执行一条指令,只有"成功"和"失败";
  • 完成一次多步推理,只有"全对"和"没全对"。

而"写一段通顺的文字""总结一篇文章"这类任务,从设计上就很难用 0/1 判定------所以它们从来也没表现出"涌现"。

这个对应关系本身就是一条很强的证据。


第四部分:另一边------确实不是全部都平滑

但这场争论并没有以"涌现是假的"盖棺定论。更准确的说法是:"部分被解释,部分仍待研究"。

有几类现象很难仅用指标设计来解释。

4.1 能力组合带来的非线性

有些任务需要多种能力同时到位,比如:

  • 理解指令(要听懂要求)+ 长程规划(要能安排步骤)+ 精确输出(格式不能错)。

即使每一项能力都是平滑提升 的,它们的乘积仍会呈现出接近门槛的行为。

但要注意机制的区别: 这不是"某个能力突然出现",而是多个连续能力的交错点。这个区别很重要------因为它意味着你可以通过"补齐最弱的那一环"来绕过门槛,而不必等模型变大。

4.2 上下文学习与思维链的增益幅度

有研究报告,随着规模增大,模型从少量示例中学习的效果提升速度很快,超出了纯线性的预期。

比如:给小模型三个示例,它几乎学不会新任务;给大模型三个示例,它能立刻上手。

这类现象目前仍有不同解释。 一种可能是:上下文学习本身也需要"先有基础能力打底",存在组合门槛;另一种可能是:样本量、提示格式等因素共同作用。

这属于学界尚未定论的部分,诚实地承认它比强行解释更好。

4.3 度量本身也会影响模型行为

这一条尤其值得工程人员注意。

有些任务上,模型给出的答案格式不符合评测脚本的要求,于是被判为错误。调整评测脚本(比如允许数字带千分位、允许同义词、允许大小写差异)之后,成绩大幅变化。

这提醒我们:评测工具本身是一个变量,不是一把客观的尺子。

在内部评测里,这经常是"成绩波动"的真正原因------不是模型变了,是脚本改了。

4.4 所以更严谨的结论是什么

已经有不少"涌现"被证明是度量假象;但也不能反过来说"所有非线性提升都是假的"。

一个实用的判断顺序:

  1. 看到一个跳变,先检查指标(是不是非连续的);
  2. 再看是不是能力组合的乘积效应(是不是多步任务);
  3. 排除这两项之后,才去考虑能力层面是否存在真正的非线性。

第五部分:这场争论对工程实践的四点启示

抛开学术争议,这场讨论对日常工作的影响非常具体。

启示一:别把希望寄托在"下一代模型会自然变好"

如果某个能力的提升其实是平滑的,那么"等一等"就不会有质变,只是往前走了一小格。

该做的工程优化,还是得做。 而更实际的情况是:等新模型的时间成本,往往高于现在就把问题解决掉的成本。

启示二:指标设计决定你的结论

你用"完全正确率"评估,就会看到一片死水;用"关键点覆盖率",就能看到真实进展。

这不是"放水",而是选择信息量更高的度量。

两者的区别值得说清楚:

  • 放水:降低标准,让不好的结果看起来好(比如把该判错的判成对);
  • 换指标:用更能反映真实进展的度量,同时不掩盖问题(比如从"完全匹配"换成"要点覆盖",但依然记录失败样本)。

判断标准很简单:换了指标之后,你还能不能定位失败原因。能,就是换指标;不能,就是放水。

启示三:小模型加上好工程,经常打败大模型的粗糙用法

这个结论在实践中被反复验证:

把提示结构、检索、格式约束、后处理做扎实,一个中等模型的表现可以接近更大模型的裸用效果。

原因不难理解:很多时候失败不是因为"模型不够聪明",而是因为:

  • 提示里没给够信息;
  • 输出格式没约束,导致解析失败;
  • 该检索的没检索,指望模型自己记住。

这三类问题的解决成本,远低于升级模型的成本。

启示四:评测要同时看连续与离散指标

指标类型 看什么 缺了会怎样
连续指标 能力趋势------"在进步吗" 只看它,会忽略"能不能交付"
离散指标 可用性------"能上线吗" 只看它,会错判进展,误以为停滞

两个一起看,才既有方向感又有现实感。

举例:连续指标显示"关键点覆盖从 60% 涨到 78%"(在进步),离散指标显示"完全正确的比例还是 12%"(还不能直接交付)。两条信息合起来,才能得出"继续优化 + 加上人工复核"这样的决策。


第六部分:五步检验流程

下面这套流程可以直接用。顺序很重要------先怀疑尺子,再怀疑噪声,最后才怀疑能力。

检验一:换一个连续指标重画

如果曲线从阶梯变平滑,基本可以确认是度量效应。

这是最快、最省力的一步,应该永远排在最前面。

检验二:做单步拆分

把多步任务拆开,分别统计每一步的准确率。

判断依据:

  • 如果单步准确率是平滑上升的,而整体是阶梯的 → 那就是乘积效应,不是"突然会了";
  • 如果单步也出现跳变 → 才值得往能力层面怀疑。

这一步能直接区分"乘积效应"和"真涌现"。

检验三:检查答案格式

大量"错误"其实是格式不符。把判定脚本放宽到能识别等价表达:

  • 数字格式(1,000 与 1000 与 1k);
  • 单位(10GB 与 10 GB 与 10G);
  • 同义词("正面"与"积极");
  • 标点与大小写。

然后再看曲线。 这一步常常能"找回"一大截分数。

检验四:跨任务交叉验证

判断依据:

  • 如果"涌现"只出现在用同一类指标的任务上 → 更可能是度量问题;
  • 如果不同指标、不同任务上都出现同一种非线性 → 才值得怀疑是能力层面的现象。

检验五:看样本量

小样本上的"0 分"可能是统计噪声。

有些小模型只是"偶尔蒙对" ,扩大样本后曲线会自然抬升------反过来也一样,小样本上的高分也可能是一时的运气。

一句话总结这套流程

看到一个跳变,先怀疑尺子,再怀疑噪声,最后才怀疑能力。


第七部分:别被"涌现"这个词带偏

最后说三个容易踩的思维坑。这些坑的代价比技术选型失误更大,因为它们会扭曲整个团队的判断习惯。

坑一:把"涌现"当成不可解释的魔法

一旦接受"它自然会冒出来",就会放弃做归因分析。

而工程上真正有用的,恰恰是反过来问:"哪一部分能力已经具备?缺的是哪一环?"

  • 是知识不够?→ 上检索;
  • 是格式不稳?→ 加约束、加后处理;
  • 是多步规划不稳?→ 拆步骤、加验证;
  • 是指令理解不到?→ 改提示结构、给示例。

这四个问题都有解,而且都不需要换模型。

坑二:用它为"堆参数"背书

参数确实重要,但"规模到了能力自然有"这个推论并不成立。

数据质量、任务多样性、后训练方式,往往比参数更决定具体任务表现。

一个直接的证据:同一个基座模型,经过不同的后训练(SFT、偏好对齐),在具体任务上的表现可以差出很大的幅度------而这期间参数量一个都没变。

坑三:反过来彻底否定非线性

有些能力组合确实存在门槛效应。

一个典型的工程例子:一项能力必须达到足够可靠,才能被安全地用进自动化流程。

  • 准确率 85% 的组件,可以用在"人工复核"的流程里;
  • 但要用在"无人值守"的流程里,可能需要 99%------这个 85%→99% 的跨度,在业务上就是一个真实存在的门槛。

这种"工程门槛"和"能力涌现"是两回事,但同样需要认真对待。

把话说准

能力大概率是连续积累的,而"可用"是存在门槛的。

前者决定了你要持续投入,后者决定了你要设验收标准。

这两句话可以同时成立,而且互不矛盾------搞清楚它们的区别,就不会在"要不要换大模型"这件事上反复摇摆。


常见误区

误区一:"涌现说明小模型永远做不了这件事。"

小模型往往是"做不好"而非"完全做不了"。

在边界清晰、可结构化、可校验的任务上,小模型配合流程设计可以接近大模型效果。 真正吃掉小模型的通常是三件事:开放式推理、长尾语义、多步规划的稳定性。

先看你的任务落不落在这三块里,再决定要不要上大模型。

误区二:"换更大的模型总能解决问题。"

如果瓶颈在数据、提示结构或检索,换模型经常只是把错误变了个形式,成本却翻倍。

一个典型的验证方法:拿现在失败的 20 个样本,人工分析失败原因分成几类。如果前两类都不是"知识不足",那换模型大概率无效。

误区三:"测出来 0 分就是不会。"

0 分可能有四种来源:

  • 格式不符(判定脚本太严);
  • 样本太少(统计噪声);
  • 指标过严(全对才算对);
  • 真的不会。

前三种占的比例,比大多数人以为的高。 先排除评测本身的问题,再下结论。

误区四:"既然涌现可能是假象,那榜单就没意义了。"

榜单仍然有价值,关键是要读对。看三项:

  1. 它用什么指标------连续还是离散;
  2. 它测什么任务------是不是和你的任务同类;
  3. 样本多大------几十条还是几千条。

读懂了限制条件,榜单才有用。 不加区分地看排名,才是有害的。

误区五:"能力是连续的,所以慢慢投入自然会好。"

这是反向的错误。"连续"指的是模型规模与能力的关系 ,不是你的项目与效果的关系。

如果瓶颈在你的提示、检索、数据上,投再多时间在"等模型变强"上也不会有进展。 归因还是要做。

误区六:"我们的评测半年没变过,所以成绩可比。"

未必。要检查的是底层环境:判定脚本的依赖库有没有升级?分词或后处理逻辑有没有动?测试集有没有被无意修改?

"固定脚本版本并纳入变更记录",是避免这类乌龙的最低成本手段。


实战问答

Q1:面试被问"你怎么看大模型的涌现能力",怎么答得有层次?

A:按"发现 → 质疑 → 结论 → 态度"四步走。

第一步,陈述原始发现:2022 年前后,研究者观察到部分任务上指标随规模出现台阶式跃升,由此产生了"规模带来质变"的推论。

第二步,说核心质疑 :2023 年有研究指出,这些台阶可能来自非连续指标的压缩效应------多步任务要求全对,单步 60% 正确率的模型,五步全对率只有 7.8%,能力在连续提升,指标却一直趴着。

第三步,给准确结论 :部分涌现已被证明是度量效应,但能力组合的门槛效应仍然真实。 两句话都要说,只讲一半都不准确。

第四步,落到工程态度 :与其等模型变大,不如先把评测指标和数据做对------因为如果是度量效应,"等"是不会等来质变的。


Q2:老板说"等下一版模型出来,这个功能自然就能做了",我怎么回应?

A :不要争论,做一个实验给他看。

具体做法:

  1. 把指标从"完全正确率"换成"关键点覆盖率",重跑一遍------大概率能看到明显提升,说明能力其实已经部分具备;
  2. 把失败样本按原因分类,比如:格式问题 / 检索没召回 / 多步合并出错 / 真的不懂。

结果通常长这样:失败集中在一两类具体问题上,而且这两类都是可以工程解决的。

把这两类解决掉,往往不需要等新模型。比起"等",这个实验的可信度高得多,成本也只要一两天。


Q3:我们内部评测怎么设计,才能既不骗自己也不骗别人?

A:三条原则。

第一,同一批用例上同时跑连续与离散指标。 连续看趋势,离散看交付。

第二,按任务类型分桶看,不只看总分。 总分是最容易掩盖问题的数字------它可以让一个"长尾任务全线崩"的系统看起来在进步。

第三,固定评测脚本版本并纳入变更记录。

第三条最容易被忽略,但它能避免"成绩波动其实是脚本改了"这种乌龙。具体做法:把判定脚本、测试集、依赖版本一起打版本号,每次成绩都记录版本号。

另外建议加一条 :每次评测都保留一份失败样本清单 。分数会波动,但失败样本的类型分布 相对稳定------它是比总分更好的"体检指标"。


Q4:小模型真的能打吗?

A :在边界清晰、可结构化、可校验的任务上,小模型加流程设计的性价比往往更高。

典型的"能打"场景:

  • 分类、抽取、格式转换(有明确判定标准);
  • 短文本改写、翻译(有参考对照);
  • 结构化数据生成(可程序化校验)。

真正吃掉小模型的通常是这三件事:

能力 为什么难
开放式推理 没有唯一正确答案,无法用规则兜底
长尾语义 训练数据覆盖不到的表达方式
多步规划的稳定性 乘积效应会放大单步误差

先看你的任务落不落在这三块里,再决定要不要上大模型。


Q5:为什么同一个模型,我们测出来和小红书上别人测出来差那么多?

A:大概率是这三个变量不同。

  1. 判定标准:是不是同一套指标?允许格式差异吗?
  2. 测试集:他用的公开集还是自建集?难度分布一样吗?
  3. 推理参数 :温度、top_p、max_tokens 是否一致?同一个模型在不同温度下,成绩可以差出不少。

做对比时,这三项必须写清楚。 否则"谁更强"这个结论根本没有意义------包含"我们和官方宣传的数字不一致"这种情况,原因往往也是这三项。


Q6:怎么区分"乘积效应"和"真的多步能力不足"?

A:做一个拆解实验。

做法:把多步任务拆成单步,逐步骤统计正确率。

判读方式:

观察 结论
每一步都做对得不错(比如都 85%+),但整体全对率很低 乘积效应------单步没问题,是要求全对导致的
某些步骤正确率明显低(比如某一步只有 40%) 真实短板------那一环能力不足
前面步骤都对,最后一步骤降 可能是长程依赖问题

第一种情况应该改指标或降低步骤要求;第二种情况应该针对性补强。 两者的解法完全不同,所以这个拆解是必须做的。


Q7:报告里写"关键点覆盖率提升 18%",但产品经理说用户没感觉,怎么办?

A :这正好说明为什么需要连续指标和离散指标一起看。

覆盖率涨了 18%,但可能:

  • 提升集中在用户很少遇到的场景;
  • 提升的是次要要点,核心要点没动;
  • 离散指标(完全正确的比例)没变,所以用户感知不到。

补一个动作 :把评测用例按用户使用频率加权,再看提升。

结论很可能是:应当优先攻克频次最高、当前最差的那一类问题,而不是继续拉平均覆盖率。 分桶加权,比看总分有用得多。


术语表

术语 含义
涌现能力 指模型规模增大后,某些任务指标出现看似突变的提升
度量假象(Mirage) 突变来自非连续指标,而底层能力其实是连续提升的
非连续指标 如精确匹配、全对判定,只有 0 和 1 两档
连续指标 如编辑距离、答案概率、要点覆盖率,能反映"对到什么程度"
乘积效应 多步任务要求每步都正确,导致整体表现呈现近门槛行为
要点覆盖率 检查答案是否覆盖了预设关键点集合的指标,不要求表述一致
工程门槛 一项能力达到足够可靠才能安全投入自动化流程,属于业务约束而非能力突变
有效规模 在特定任务上真正决定表现的规模与数据组合,而非单纯参数量

结语

把这篇压缩成三句话:

第一,那条"突然跳起来"的曲线,很可能是一把非连续的尺子画出来的。 多步任务要求全对时,单步 60% 正确率的模型全对率只有 7.8%------能力一直在涨,只是指标一直趴着,直到跨过某个门槛才站起来。

第二,但也不能反过来说所有非线性都是假的。 能力组合的乘积效应、上下文学习的增益、工程上的可靠性门槛------这些是真实存在的,只是机制不是"某个能力突然出现"。

第三,落到工程上,真正的结论只有两条:

指标要选对,投入不能停。

指标要选对,因为用错指标会让你误判进展,从而做出错误的资源决策(要么过早放弃,要么无谓等待)。

投入不能停 ,因为如果能力是连续积累的,那"等"就不会带来跃迁------改变结果的,始终是你把哪一环补上了。

而如果只允许带走一个动作,那就是:下一次看到"突然变强/变差"的结论时,先问一句"这是用什么指标量的"。 这一个问题,能帮你过滤掉相当一部分误判。

相关推荐
柏慧通云报餐6 小时前
智慧食堂食材溯源数字化方案|采购 - 入库 - 餐桌全链路记录体系落地实践
大数据·运维·人工智能
在所不辞兄6 小时前
常微分方程详解与应用
人工智能·神经网络·算法·机器学习
小鹿的周先生6 小时前
第16章-RAG
java·人工智能·ai编程
不加辣椒6 小时前
第 12 章 推理型 Sensors 深入
人工智能
用户1917291270836 小时前
企业级 AI Agent 编排层架构:从华为、谷歌的同周动作看 2026 拐点
人工智能
电子科技圈6 小时前
芯科科技扩展 AI 开发者平台,简化物联网开发并拓展边缘智能
人工智能·科技·物联网
袖清暮雨6 小时前
机器学习之随机森林
人工智能·随机森林·机器学习
QEasycloud6 小时前
平台补贴的会计处理:总额法 vs 净额法的判定与对账影响
大数据·人工智能
芯盾时代6 小时前
从《人工智能安全治理框架3.0》看智能体安全治理
人工智能·安全·网络安全·智能体