暴力美学-大型语言模型与涌现:一个复杂系统视角

目录

[1. 核心论点:区分"涌现能力"与"涌现智能"](#1. 核心论点:区分“涌现能力”与“涌现智能”)

[2. 对LLM"涌现"宣称的质疑](#2. 对LLM“涌现”宣称的质疑)

[3. 引入复杂科学的分析框架(五大原则)](#3. 引入复杂科学的分析框架(五大原则))

[4. 关键区分:"知识-外"(KO)与"知识-内"(KI)涌现](#4. 关键区分:“知识-外”(KO)与“知识-内”(KI)涌现)

[5. 终极结论:能力不等于智能](#5. 终极结论:能力不等于智能)


大型语言模型与涌现:一个复杂系统视角(Large Language Models and Emergence: A Complex Systems Perspective)。 作者为David C. Krakauer、John W. Krakauer和Melanie Mitchell(圣塔菲研究所等机构)。

1. 核心论点:区分"涌现能力"与"涌现智能"

文章开篇即点明核心立场:LLM至多展现了"涌现能力",但远未达到"涌现智能"

  • 真正的涌现(科学定义):指多体系统通过微观互动,产生新的、可压缩的宏观描述(粗粒化),从而"屏蔽"掉无关的微观细节,实现更高效的预测和控制(即"More is different"------多即不同)。

  • 真正的智能(作者定义):指能用极少的能量和极简的概念,通过类比和推理,解决广泛问题(即"Less is more"------少即是多)。作者举例:数学家并非拥有大量计算器,而是拥有能用一个概念解释万物的类比能力。

  • 对LLM的评价:LLM像是"巨大的、低效的、由大量机制拼凑而成的计算器",其内部机制极其复杂且能耗极高(存在"Rube Goldberg逻辑"),缺乏人类那种通过简单指令(低带宽)就能快速重组神经结构进行推理的能力。


2. 对LLM"涌现"宣称的质疑

文章回顾了LLM文献中常见的三种涌现宣称,并逐一指出其证据不足:

  • 宣称一:规模增大带来的性能突跳(如Wei et al., 2022)。作者指出,这种"突跳"有时只是因为评估指标不够连续(后续研究显示换用连续指标后性能是平滑上升的),且物理上的相变要求控制变量是一维的(如温度),而LLM的"规模"是极其高维的复杂变量(数据+参数)。

  • 宣称二:未经过专门训练却获得的能力。作者认为,神经网络的通用近似定理决定了它们只要训练数据足够,本就能拟合各种函数。如果自然语言本身就包含了世界的完整编码,那么这些能力的出现只是"工程收敛",而非"涌现"。

  • 宣称三:内部形成"世界模型"(如OthelloGPT)。作者认为,虽然这接近复杂科学的涌现定义,但证据尚不完整(后续研究发现其内部可能只是"一堆启发式规则"),且尚未证明这些表征对预测行为具有直接的因果关系。


3. 引入复杂科学的分析框架(五大原则)

作者提出,要判断一个系统是否真正涌现,必须满足以下一项或多项条件,而LLM在这些方面的证据均不充分:

  1. 标度律(Scaling):系统内部组织随规模发生质变(如对称性破缺)。虽然LLM有"双下降"现象,但这在传统回归模型中也有,不算涌现。只有少数研究(如Guth & Menard)显示网络编码协方差谱在峰值处发生质变,才算是初步证据。

  2. 临界性(Criticality):控制变量变化导致系统相变。LLM的性能跳变缺乏清晰的"相"概念。

  3. 压缩(Compression):系统内部形成低维的粗粒化表征。OthelloGPT是候选,但证据存疑。

  4. 新基和新流形(Novel Bases/Manifolds):发现全新的、可组合的内部编码方式。目前LLM内部可解释性研究非常初级,远未达到这一标准。

  5. 泛化(Generalization):在新任务上的表现。许多LLM的"泛化"后来被证明是记忆或"捷径",缺乏鲁棒性。


4. 关键区分:"知识-外"(KO)与"知识-内"(KI)涌现

这是本文极其重要的一个分类工具:

  • 知识-外(Knowledge-Out, KO)涌现 :典型的物理/化学系统(如流体力学、结晶)。由大量简单、同质的元素按简单规则互动,自然产生复杂结构。这种涌现是"免费"的、非设计的。

  • 知识-内(Knowledge-In, KI)涌现 :生物系统、大脑、经济体和LLM。由复杂 的元素在复杂环境中提取大量结构化信息而产生。

  • 对LLM的推论 :LLM是典型的KI系统。在KI系统中,由于每个组件都经过海量数据训练,宏观性能很可能只是"微观外部知识的内化"。因此,仅凭外部行为(准确率突跳)绝不能断言涌现,必须去检查其内部微观机制是否发生了质变。否则,"涌现"一词只是"训练"或"学习"的同义词。


5. 终极结论:能力不等于智能

文章在结尾部分强烈批判了"LLM将产生超越人类智能"的观点(如Hinton所言),并区分了两者:

  • 涌现能力(Emergent Capabilities):指能完成特定任务(如算术、编程)。这是"More is more"(多就是多),LLM和计算器正在这条路上狂奔。

  • 涌现智能(Emergent Intelligence) :指用最少努力解决最多问题的低带宽能力 。人类智能的标志是**"理解"**(Getting it)。文章引用实验证明,人类可以通过一句口头指令(基于"民间心理学"有效理论),在几分钟内改变大脑神经回路的结构,而猴子需要数小时试错。这种将抽象符号(语言)转化为物理结构(神经活动)的因果力,才是真正的智能。

  • 本质差异 :人类教数学靠"画几张图、写几个符号"(低带宽、可理解),而LLM靠"共享亿万个权重"(高带宽、不可理解)。LLM是暴力美学的产物,适合解决需要蛮力计算的问题,但缺乏通过类比和精简法则进行科学大统一的能力。作者借用Knuth的话总结:"智能是理解的性质,能力只是附带产物。"

相关推荐
智慧物业老杨1 小时前
物业日常巡查的数智化重构:从“打卡式巡检“到“闭环式风控“
android·java·人工智能·系统架构·rxjava
晴天的雨.9922 小时前
【C++算法】和为s的两个数
开发语言·数据结构·c++·算法
吴佳浩4 小时前
Skill 为什么不同于 Tool?Agent 技能库的自演进与动态加载机制
人工智能·agent·ai编程
大模型任我行7 小时前
谷歌:“课程学习”融入扩散模型强化学习
人工智能·语言模型·自然语言处理·论文笔记
AIGCmagic社区7 小时前
具身智能专题:机器人也有Scaling Law?智元GE-Act 2.0用3万小时真机数据给出答案
人工智能·aigc·具身智能
Rosanci8 小时前
谷歌浏览器插件开发实战指南:从 Hello World 到上架发布
大数据·人工智能·chrome·程序人生
明月_清风8 小时前
AI 越来越强,程序员真正的价值到底是什么?
人工智能·后端
aramae8 小时前
MySQL复合查询(8)
java·c语言·开发语言·后端·算法
m0_466525299 小时前
云从科技上线云起ModelHub:AI团队时代的模型算力基础设施
大数据·人工智能·科技
火山引擎开发者社区9 小时前
OpenViking:给 Codex 加上长期记忆
人工智能