目录
[1. 核心论点:区分"涌现能力"与"涌现智能"](#1. 核心论点:区分“涌现能力”与“涌现智能”)
[2. 对LLM"涌现"宣称的质疑](#2. 对LLM“涌现”宣称的质疑)
[3. 引入复杂科学的分析框架(五大原则)](#3. 引入复杂科学的分析框架(五大原则))
[4. 关键区分:"知识-外"(KO)与"知识-内"(KI)涌现](#4. 关键区分:“知识-外”(KO)与“知识-内”(KI)涌现)
[5. 终极结论:能力不等于智能](#5. 终极结论:能力不等于智能)
大型语言模型与涌现:一个复杂系统视角(Large Language Models and Emergence: A Complex Systems Perspective)。 作者为David C. Krakauer、John W. Krakauer和Melanie Mitchell(圣塔菲研究所等机构)。
1. 核心论点:区分"涌现能力"与"涌现智能"
文章开篇即点明核心立场:LLM至多展现了"涌现能力",但远未达到"涌现智能"。
-
真正的涌现(科学定义):指多体系统通过微观互动,产生新的、可压缩的宏观描述(粗粒化),从而"屏蔽"掉无关的微观细节,实现更高效的预测和控制(即"More is different"------多即不同)。
-
真正的智能(作者定义):指能用极少的能量和极简的概念,通过类比和推理,解决广泛问题(即"Less is more"------少即是多)。作者举例:数学家并非拥有大量计算器,而是拥有能用一个概念解释万物的类比能力。
-
对LLM的评价:LLM像是"巨大的、低效的、由大量机制拼凑而成的计算器",其内部机制极其复杂且能耗极高(存在"Rube Goldberg逻辑"),缺乏人类那种通过简单指令(低带宽)就能快速重组神经结构进行推理的能力。
2. 对LLM"涌现"宣称的质疑
文章回顾了LLM文献中常见的三种涌现宣称,并逐一指出其证据不足:
-
宣称一:规模增大带来的性能突跳(如Wei et al., 2022)。作者指出,这种"突跳"有时只是因为评估指标不够连续(后续研究显示换用连续指标后性能是平滑上升的),且物理上的相变要求控制变量是一维的(如温度),而LLM的"规模"是极其高维的复杂变量(数据+参数)。
-
宣称二:未经过专门训练却获得的能力。作者认为,神经网络的通用近似定理决定了它们只要训练数据足够,本就能拟合各种函数。如果自然语言本身就包含了世界的完整编码,那么这些能力的出现只是"工程收敛",而非"涌现"。
-
宣称三:内部形成"世界模型"(如OthelloGPT)。作者认为,虽然这接近复杂科学的涌现定义,但证据尚不完整(后续研究发现其内部可能只是"一堆启发式规则"),且尚未证明这些表征对预测行为具有直接的因果关系。
3. 引入复杂科学的分析框架(五大原则)
作者提出,要判断一个系统是否真正涌现,必须满足以下一项或多项条件,而LLM在这些方面的证据均不充分:
-
标度律(Scaling):系统内部组织随规模发生质变(如对称性破缺)。虽然LLM有"双下降"现象,但这在传统回归模型中也有,不算涌现。只有少数研究(如Guth & Menard)显示网络编码协方差谱在峰值处发生质变,才算是初步证据。
-
临界性(Criticality):控制变量变化导致系统相变。LLM的性能跳变缺乏清晰的"相"概念。
-
压缩(Compression):系统内部形成低维的粗粒化表征。OthelloGPT是候选,但证据存疑。
-
新基和新流形(Novel Bases/Manifolds):发现全新的、可组合的内部编码方式。目前LLM内部可解释性研究非常初级,远未达到这一标准。
-
泛化(Generalization):在新任务上的表现。许多LLM的"泛化"后来被证明是记忆或"捷径",缺乏鲁棒性。
4. 关键区分:"知识-外"(KO)与"知识-内"(KI)涌现
这是本文极其重要的一个分类工具:
-
知识-外(Knowledge-Out, KO)涌现 :典型的物理/化学系统(如流体力学、结晶)。由大量简单、同质的元素按简单规则互动,自然产生复杂结构。这种涌现是"免费"的、非设计的。
-
知识-内(Knowledge-In, KI)涌现 :生物系统、大脑、经济体和LLM。由复杂 的元素在复杂环境中提取大量结构化信息而产生。
-
对LLM的推论 :LLM是典型的KI系统。在KI系统中,由于每个组件都经过海量数据训练,宏观性能很可能只是"微观外部知识的内化"。因此,仅凭外部行为(准确率突跳)绝不能断言涌现,必须去检查其内部微观机制是否发生了质变。否则,"涌现"一词只是"训练"或"学习"的同义词。
5. 终极结论:能力不等于智能
文章在结尾部分强烈批判了"LLM将产生超越人类智能"的观点(如Hinton所言),并区分了两者:
-
涌现能力(Emergent Capabilities):指能完成特定任务(如算术、编程)。这是"More is more"(多就是多),LLM和计算器正在这条路上狂奔。
-
涌现智能(Emergent Intelligence) :指用最少努力解决最多问题的低带宽能力 。人类智能的标志是**"理解"**(Getting it)。文章引用实验证明,人类可以通过一句口头指令(基于"民间心理学"有效理论),在几分钟内改变大脑神经回路的结构,而猴子需要数小时试错。这种将抽象符号(语言)转化为物理结构(神经活动)的因果力,才是真正的智能。
-
本质差异 :人类教数学靠"画几张图、写几个符号"(低带宽、可理解),而LLM靠"共享亿万个权重"(高带宽、不可理解)。LLM是暴力美学的产物,适合解决需要蛮力计算的问题,但缺乏通过类比和精简法则进行科学大统一的能力。作者借用Knuth的话总结:"智能是理解的性质,能力只是附带产物。"
