暴力美学-大型语言模型与涌现:一个复杂系统视角

目录

[1. 核心论点:区分"涌现能力"与"涌现智能"](#1. 核心论点:区分“涌现能力”与“涌现智能”)

[2. 对LLM"涌现"宣称的质疑](#2. 对LLM“涌现”宣称的质疑)

[3. 引入复杂科学的分析框架(五大原则)](#3. 引入复杂科学的分析框架(五大原则))

[4. 关键区分:"知识-外"(KO)与"知识-内"(KI)涌现](#4. 关键区分:“知识-外”(KO)与“知识-内”(KI)涌现)

[5. 终极结论:能力不等于智能](#5. 终极结论:能力不等于智能)


大型语言模型与涌现:一个复杂系统视角(Large Language Models and Emergence: A Complex Systems Perspective)。 作者为David C. Krakauer、John W. Krakauer和Melanie Mitchell(圣塔菲研究所等机构)。

1. 核心论点:区分"涌现能力"与"涌现智能"

文章开篇即点明核心立场:LLM至多展现了"涌现能力",但远未达到"涌现智能"

  • 真正的涌现(科学定义):指多体系统通过微观互动,产生新的、可压缩的宏观描述(粗粒化),从而"屏蔽"掉无关的微观细节,实现更高效的预测和控制(即"More is different"------多即不同)。

  • 真正的智能(作者定义):指能用极少的能量和极简的概念,通过类比和推理,解决广泛问题(即"Less is more"------少即是多)。作者举例:数学家并非拥有大量计算器,而是拥有能用一个概念解释万物的类比能力。

  • 对LLM的评价:LLM像是"巨大的、低效的、由大量机制拼凑而成的计算器",其内部机制极其复杂且能耗极高(存在"Rube Goldberg逻辑"),缺乏人类那种通过简单指令(低带宽)就能快速重组神经结构进行推理的能力。


2. 对LLM"涌现"宣称的质疑

文章回顾了LLM文献中常见的三种涌现宣称,并逐一指出其证据不足:

  • 宣称一:规模增大带来的性能突跳(如Wei et al., 2022)。作者指出,这种"突跳"有时只是因为评估指标不够连续(后续研究显示换用连续指标后性能是平滑上升的),且物理上的相变要求控制变量是一维的(如温度),而LLM的"规模"是极其高维的复杂变量(数据+参数)。

  • 宣称二:未经过专门训练却获得的能力。作者认为,神经网络的通用近似定理决定了它们只要训练数据足够,本就能拟合各种函数。如果自然语言本身就包含了世界的完整编码,那么这些能力的出现只是"工程收敛",而非"涌现"。

  • 宣称三:内部形成"世界模型"(如OthelloGPT)。作者认为,虽然这接近复杂科学的涌现定义,但证据尚不完整(后续研究发现其内部可能只是"一堆启发式规则"),且尚未证明这些表征对预测行为具有直接的因果关系。


3. 引入复杂科学的分析框架(五大原则)

作者提出,要判断一个系统是否真正涌现,必须满足以下一项或多项条件,而LLM在这些方面的证据均不充分:

  1. 标度律(Scaling):系统内部组织随规模发生质变(如对称性破缺)。虽然LLM有"双下降"现象,但这在传统回归模型中也有,不算涌现。只有少数研究(如Guth & Menard)显示网络编码协方差谱在峰值处发生质变,才算是初步证据。

  2. 临界性(Criticality):控制变量变化导致系统相变。LLM的性能跳变缺乏清晰的"相"概念。

  3. 压缩(Compression):系统内部形成低维的粗粒化表征。OthelloGPT是候选,但证据存疑。

  4. 新基和新流形(Novel Bases/Manifolds):发现全新的、可组合的内部编码方式。目前LLM内部可解释性研究非常初级,远未达到这一标准。

  5. 泛化(Generalization):在新任务上的表现。许多LLM的"泛化"后来被证明是记忆或"捷径",缺乏鲁棒性。


4. 关键区分:"知识-外"(KO)与"知识-内"(KI)涌现

这是本文极其重要的一个分类工具:

  • 知识-外(Knowledge-Out, KO)涌现 :典型的物理/化学系统(如流体力学、结晶)。由大量简单、同质的元素按简单规则互动,自然产生复杂结构。这种涌现是"免费"的、非设计的。

  • 知识-内(Knowledge-In, KI)涌现 :生物系统、大脑、经济体和LLM。由复杂 的元素在复杂环境中提取大量结构化信息而产生。

  • 对LLM的推论 :LLM是典型的KI系统。在KI系统中,由于每个组件都经过海量数据训练,宏观性能很可能只是"微观外部知识的内化"。因此,仅凭外部行为(准确率突跳)绝不能断言涌现,必须去检查其内部微观机制是否发生了质变。否则,"涌现"一词只是"训练"或"学习"的同义词。


5. 终极结论:能力不等于智能

文章在结尾部分强烈批判了"LLM将产生超越人类智能"的观点(如Hinton所言),并区分了两者:

  • 涌现能力(Emergent Capabilities):指能完成特定任务(如算术、编程)。这是"More is more"(多就是多),LLM和计算器正在这条路上狂奔。

  • 涌现智能(Emergent Intelligence) :指用最少努力解决最多问题的低带宽能力 。人类智能的标志是**"理解"**(Getting it)。文章引用实验证明,人类可以通过一句口头指令(基于"民间心理学"有效理论),在几分钟内改变大脑神经回路的结构,而猴子需要数小时试错。这种将抽象符号(语言)转化为物理结构(神经活动)的因果力,才是真正的智能。

  • 本质差异 :人类教数学靠"画几张图、写几个符号"(低带宽、可理解),而LLM靠"共享亿万个权重"(高带宽、不可理解)。LLM是暴力美学的产物,适合解决需要蛮力计算的问题,但缺乏通过类比和精简法则进行科学大统一的能力。作者借用Knuth的话总结:"智能是理解的性质,能力只是附带产物。"

相关推荐
@Mr_LiuYang1 小时前
状态栏动态上下文信息追加到Agent --《深入理解 AI Agent :设计原理与工程实践》实验2-8
人工智能·大模型·动态上下文·状态栏信息追加
白狐_7981 小时前
408数据结构第5章:树与二叉树②——遍历、线索树、森林与哈夫曼
数据结构·算法·深度优先
碳基猿2 小时前
新媒体运营的终局:从“内容创作”走向“运营系统竞争”
人工智能·新媒体运营·产品运营·新媒体矩阵·多账号管理·矩阵分发·矩阵运营方法论
阿里云大数据AI技术2 小时前
阿里云 EMR Daft AI Function:用 DataFrame 表达式搞定大模型调用与多模态向量化
人工智能·spark
jerryinwuhan2 小时前
鱼苗投放检测系统设计
人工智能
阿里云大数据AI技术2 小时前
官宣|Apache Fluss 毕业成为顶级项目,湖流一体开启 Agentic Lake 全面实时化时代
人工智能·flink
敲代码的玉米C2 小时前
测试一直在写你的真实数据根
前端·人工智能·架构
Mr.huang2 小时前
自注意力机制(Self‑Attention)
人工智能·深度学习
品牌测评3 小时前
大模型推理算力平台推荐分享|六家平台计费与架构拆解
大数据·人工智能·架构
武汉万象奥科3 小时前
8路AHD摄像头同时输出演示,万象奥科RK3576 AHD硬件方案
人工智能·计算机视觉