从复杂系统到大语言模型:理解 AI 中的“涌现”

一:引言

在学习人工智能、神经网络和多智能体系统时,我们常会遇到一个词:涌现(Emergence)。

它描述了一类很有意思的现象:单个组成部分看起来只遵循简单规则,但当大量个体 发生持续交互 后,系统整体 却表现出原本难以从单个部分直接预测的新结构、新行为或新能力。

我们举一些简单清晰的例子跟大家解释一下(高中生物化学知识)

(1)单个水分子没有"湿润"的体验,但大量水分子聚集后会呈现液体的宏观性质;

(2)单个神经元不具备意识,但大量神经元通过复杂连接与电化学信号传递,形成认知、记忆等高级功能;

(3)单只蚂蚁能力有限,但蚁群能表现出协作搬运、路径选择和资源分配等群体行为;

大语言模型只是在做"预测下一个词元(token)",却能在一定条件下完成翻译、代码生成、问答和少样本学习等任务。

涌现并不等于"凭空产生"或"神秘力量"。更准确地说,它强调的是:

宏观层面的结构、行为或能力,来自微观个体之间持续的非线性交互、反馈与演化,并且不能仅靠简单相加来理解。

二:什么是涌现?

1.1 经典定义

涌现通常被概括为:系统整体表现出的性质不能简单地由各部分性质相加得到,也难以仅凭单个组成部分直接预测。

这里有两个关键词:

整体性: 研究对象不再是单个个体,而是由大量个体组成的系统;

**新性质:**系统整体呈现出个体自身不具备的结构、规律或功能。

"整体大于部分之和"是对涌现的通俗概括,但需要注意,它不是指数学意义上真的"大于",而是强调:整体层面的行为具有新的组织形式和解释层次。

1.2 涌现不是"主观能动性"

课堂讨论中,常有人把涌现理解为"无中生有"或"具有主观能动性的创造"。这种说法有助于建立直觉,但不够严格。

严格来说,涌现可以发生在没有意识、没有目标、也没有主观能动性的系统中,例如:

(1)铁粉在磁场中排列出磁感线图案;

(2)雪花形成具有对称性的晶体结构;

(3)鸟群在飞行中形成整体队形;

(4)元胞自动机在局部规则下产生复杂图案。

因此,涌现不要求系统"有意识地创造",它更强调:

简单局部规则 + 个体交互 + 非线性反馈 + 时间演化

宏观新结构或新行为

三:复杂系统中的涌现

涌现复杂系统科学中的重要概念,相关研究涉及热力学、非平衡统计物理、软物质、生命系统、社会系统和人工智能等多个领域。

复杂系统通常具有以下特征:

(1)由大量个体或组件构成;

(2)个体之间存在相互作用;

(3)系统行为具有非线性;

(4)系统会随时间不断演化;

(5)局部变化可能通过反馈被放大,最终影响整体。

2.1 非线性:为什么"1 + 1"不一定等于"2"?

线性系统 中,输入与输出之间通常满足简单比例关系 。例如,力增加一倍,弹簧的形变量也近似增加一倍。但复杂系统 往往是非线性 的。微小变化可能被放大,也可能被抑制。

例如:

一条新的信息可能迅速在社交网络中扩散;

少数蚂蚁留下的信息素路径可能逐渐吸引更多蚂蚁;

神经网络中某些参数的微调可能显著改变模型输出;

强化学习智能体的一次偶然探索,可能发展为长期有效的策略。

非线性意味着:不能只看单个局部变化 ,还必须关注变化如何在系统中传播和反馈。

2.2 从局部到整体

涌现最核心的思想可以概括为:局部规则简单,不代表整体行为简单。

我们以蚁群觅食为例,单只蚂蚁的行为规则可能非常朴素:

(1)随机寻找食物;

(2)发现食物后留下信息素;

(3)倾向于沿信息素更浓的路径移动;

(4)信息素会随着时间挥发。

但当大量蚂蚁重复执行这些规则后,系统可能自发形成一条高效的觅食路径。

没有任何一只蚂蚁掌握"全局最短路径",却能形成类似全局优化的结果。这就是局部交互产生宏观秩序的典型例子。

四:涌现的典型实例

3.1 物理与化学系统

水的"湿润"性质

单个水分子只是由氢原子和氧原子构成的微观粒子,很难谈论"湿润"。但当大量水分子聚集后,氢键、分子间作用力和表面张力等共同作用,使水表现出液体的流动性、黏附性和润湿现象。

单个水分子

↓ 聚集与相互作用

大量水分子

液体的宏观性质

这里的重点不是水分子"突然拥有了意识",而是大量微观相互作用在宏观尺度上形成了新的可观察规律。

材料的尺度效应

材料性质也具有明显的层级性:

原子 → 原子团 → 纳米颗粒 → 微米颗粒 → 块体材料

系统尺度变化 时,材料 可能呈现**完全不同的性质。**例如,纳米材料因表面积、量子效应等因素,可能具有不同于块体材料的光学、电学或磁学特性。

这说明:研究一个系统时,尺度不能被忽略。

3.2 生命系统

细胞与生命

单个分子没有生命,单个细胞的能力也有限;但当细胞形成组织、器官和完整个体后,系统呈现出生长、代谢、繁殖、适应环境等生命特征。

分子 → 细胞 → 组织 → 器官 → 个体

所以说生命系统中的涌现具有显著的层级性。

神经元与意识

单个神经元只能接收、处理和传递电信号。它不具备语言、记忆、情感或意识。

然而,大脑中的大量神经元通过突触连接构成复杂网络。神经元之间的连接模式、信号传递、可塑性和长期反馈,共同支撑了认知与行为。

需要谨慎的是:意识是否属于"强涌现",以及能否完全还原为神经活动,目前仍是神经科学和哲学中的开放问题。

3.3 社会系统

社会系统中也经常出现涌现:

市场价格由大量个体交易行为共同形成;

交通拥堵往往不需要事故,也能由局部刹车行为逐步放大;

铃声响起后,学生会逐渐向教室聚集;

网络社区中可能自发形成新的术语、协作方式和讨论规范。

这些现象不一定由中心化命令直接控制,而可能来自大量主体的局部决策与互动。

五:涌现的基本特征

4.1 非线性

系统整体行为不能简单地由个体行为相加得到。

比如说,一个人转发信息不一定会造成传播;但当足够多的人在合适的网络结构中参与时,信息可能突然爆发式扩散。

4.2 动态演化

涌现不是静态结果,而是一个随时间发展的过程。

系统会经历:初始状态 → 局部交互 → 反馈累积 → 模式形成 → 稳定、变化或崩解

例如,强化学习智能体在训练初期随机探索,之后逐步发现高回报行为,最终形成稳定策略。

4.3 多尺度与层级性

涌现往往发生在不同尺度之间:

分子 → 细胞 → 器官 → 个体 → 群体 → 社会

每一层都有自己的规律。

研究细胞时,不能只停留在单个分子的层面;研究社会行为时,也不能只从单个人的心理出发。不同尺度需要不同的模型与解释方式。

4.4 自组织(区分涌现)

自组织(Self-Organization)指系统在缺少中心化外部指令的情况下,通过内部交互自发形成有序结构或行为。

典型例子包括:

铁粉在磁场中排列;

鸟群、鱼群形成集体运动模式;

蚂蚁通过信息素形成觅食路径;

向日葵等植物表现出向光性;

某些微生物会对光、化学物质或磁场产生趋性反应。

自组织与涌现关系密切,但两者不完全等价:

自组织 强调"秩序如何形成";

涌现强调"整体出现了什么新性质"。

六. 强涌现与弱涌现

我们讨论涌现时,常见的划分是弱涌现(Weak Emergence)与强涌现(Strong Emergence)。

这一区分带有一定哲学争议,但对于理解不同类型的复杂现象很有帮助。

5.1 弱涌现

弱涌现的关键特点是:**虽然整体行为复杂,但我们可以给出明确的局部规则,并通过模拟观察宏观现象。**鸟群、鱼群和蚁群群体智能常用三个局部规则描述:

  1. 分离:避免与邻居过近;

  2. 对齐:调整运动方向,与邻居保持一致;

  3. 聚集:向群体中心靠拢。

这些规则简单 ,但大量个体共同执行后,可以产生复杂而协调的群体行为。

元胞自动机

元胞自动机由大量网格组成,每个格子的状态只由邻近格子决定

我们就以康威生命游戏为例(不知道大家玩过没有),局部规则很少:

活细胞周围邻居太少会死亡;

邻居过多也会死亡;

邻居数量适中可以存活;

死细胞在合适条件下会"出生"。

但这些规则可以产生滑翔机、振荡器 等复杂结构,甚至可以实现图灵完备计算。

这说明:简单规则不等于简单结果。

粒子群优化

粒子群优化(Particle Swarm Optimization,PSO)模仿鸟群觅食。

每个粒子会参考:

自己历史上找到的最优位置;

群体历史上找到的最优位置。

经过不断更新,粒子群逐步收敛到较优解。

它体现了群体协作局部信息共享如何产生整体优化能力。

5.2 强涌现

强涌现通常讨论那些难以被微观规则完全说明的宏观现象,如:

意识;

主观体验;

高级认知;

社会规范与文化演化。

需要避免一个常见误解:强涌现不应简单定义为"完全无法模拟"。因为"目前无法模拟"可能只是技术能力不足;而"原则上无法由微观规律推导"则是更强、更有争议的哲学主张。

因此,更稳妥的说法是:

强涌现 讨论的是:宏观性质是否具有独立的因果与解释地位,是否能够被微观规律完全还原。

这个问题目前没有统一答案。

七:如何判断一个现象是否属于涌现?

在人工智能和多智能体研究中,不能仅因为"多个模块合作"就把它称为涌现。

我们举个例子,假设有一个系统由三个 Agent 构成:

Agent A:负责检索资料

Agent B:负责编写代码

Agent C:负责总结结果

如果它们只是按照预先设计好的固定流程分工,那么这更接近工程集成,而不是涌现。

判断是否存在涌现,可以关注以下问题:

可以将多智能体涌现概括为:(重要)

微观规则 + 智能体交互 + 环境反馈 + 记忆 + 时间演化

宏观协作策略与系统能力

八:神经网络视角:智能如何从数据中形成?

7.1 传统符号 AI 与连接主义 AI

传统符号 AI 强调人工设计规则与知识,例如:

如果温度 > 38℃,那么判断为发热。

这种方法逻辑清晰,但高度依赖专家手工定义规则。

而连接主义 AI,尤其是神经网络,采用不同思路:不直接告诉模型"什么是规则",而是让模型从数据和训练目标中学习表示与规律。

神经网络中的许多能力,可以理解为多层表示学习的结果。

7.2 层次化特征提取

神经网络会通过多层非线性变换,逐步构造更抽象的特征。

在图像识别中,一个典型过程可以理解为:

像素

边缘、颜色、纹理

局部形状

物体部件

完整物体类别

例如,卷积神经网络的浅层可能识别边缘,中层可能识别眼睛、轮子或纹理,深层则可能识别"猫""汽车"等语义概念。

这类高层语义表示不是人工逐层写出来的,而是在数据、网络结构和训练目标的共同作用下形成的。

7.3 分布式表示与语义空间

神经网络通常使用向量表示对象 。一个词、一个句子、一张图片,甚至一段代码,都可以映射为高维向量。

相似的概念在向量空间中往往距离更近,某些语义关系也可能呈现近似的向量结构。

经典的直觉例子是:国王 - 男性 + 女性 ≈ 女王

这不是说模型真正理解了人类历史或性别概念,而是说明在大量文本统计规律中,某些语义关系可能被编码进向量空间。

因此,神经网络的"智能"并不主要来自显式规则,而来自其内部形成的分布式表示。

九:Transformer 与大语言模型中的涌现能力

Transformer 是当前大语言模型的重要基础架构 。它通过注意力机制建模序列中不同位置之间的关系。

其中,一个常被研究者讨论的现象是:模型内部可能形成某些能够追踪上下文模式的计算结构,例如归纳头(Induction Heads)。

可以把归纳头粗略理解为:当模型在上下文中看到某种模式重复出现时 ,它能够利用前文规律预测后续内容。

例如:

A → B

C → D

A → ?

模型可能学习到"看到 A 后,B 更可能出现"的模式。

这类机制 被认为与上下文学习能力有关。

8.1 大语言模型常见的"涌现能力"

随着模型规模、训练数据和训练计算量增加,模型在某些任务上的性能可能从"基本不可用"跨越到"可用"。

常被讨论的能力包括:

少样本上下文学习(Few-shot Learning)

指令遵循

多语言翻译

代码生成

多步推理

工具调用

多任务迁移

例如,模型可能不经过特定任务微调,只需要在提示词中给出几个示例,就能完成新的分类、翻译或格式转换任务。

8.2 为什么模型会出现这些能力?

虽然目前还没有单一、完全确定的解释,但可以从几个角度理解。

1. 预训练目标具有高度通用性

语言模型通常训练于"预测下一个 token"的目标:给定前文 → 预测下一个 token

这个目标看似简单,但要想在海量文本上做好预测,模型必须学习:

语言语法;

世界知识;

上下文关联;

代码结构;

常见推理模式;

人类表达习惯。

因此,通用预测任务可能迫使模型学习到多种可迁移的内部表示。

2. 规模效应

当参数量、数据量和训练计算量增长时,模型有更大的容量去学习复杂规律。

不过,"规模变大必然产生新能力"并不是严格定律。模型能力还会受到以下因素影响:

(1)数据质量;

(2)训练目标;

(3)模型架构;

(4)后训练方法;

(5)评测方式;

(6)提示词设计;

(7)工具与外部环境。

3. 非线性训练过程

神经网络训练 本身是一个复杂的非线性优化过程。

参数在损失函数约束下不断更新 ,模型内部可能逐渐**形成某些对任务有用的表征、回路或分工结构。**能力的变化不一定均匀平滑,某些能力可能在跨过特定性能阈值后才变得明显。

十:大模型"涌现能力"的争议

2022 年,Google Research 等研究者发表论文,讨论了大语言模型随规模增长出现的"涌现能力":Emergent Abilities of Large Language Models (https://arxiv.org/abs/2206.07682)

论文认为:某些任务能力在小模型上几乎不存在,但当模型规模达到一定范围后,会出现明显跃升。 不过,2023 年也有研究**提出质疑,**认为部分"能力突现"可能与评测指标有关。例如,连续增长的底层能力经过非线性的指标处理后,看起来像突然出现。

Are Emergent Abilities of Large Language Models a Mirage? (https://arxiv.org/abs/2304.15004)

因此,更严谨的结论是:

大语言模型能力**会随着规模、数据和训练方式发生显著变化,**这一点是明确的;但某项能力究竟是"真正突现",还是评测方式造成的阈值效应,仍需要具体分析。

从工程角度看,如果模型从"无法稳定完成任务"变成"能够稳定完成任务",这种能力跃迁仍然具有重要价值。

十一:从强化学习与多智能体重新理解涌现

强化学习 中的智能体会根据奖励信号不断调整策略。

在复杂环境中,智能体 可能发现 设计者**没有直接编写的策略。**例如:

在游戏中学会利用地形;

在机器人控制中形成更稳定的动作模式;

在多智能体环境中产生协作、竞争或分工;

在辩论、协商或任务分解中形成新的互动协议。

但必须区分:预设流程带来的效率提升≠真正由交互和反馈产生的新策略

当多个智能体之间存在持续观察、记忆共享、奖励反馈、角色调整和环境约束时,系统更可能出现难以由单个智能体独立实现的协作模式。

这正是多智能体系统值得研究的原因之一。

十二:总结

涌现是理解复杂系统的重要概念, 也为理解人工智能提供了一个很有价值的视角。

本文的核心结论如下:

  1. 涌现指系统整体在交互过程中出现的新结构、新行为或新能力。

  2. 涌现不要求主观意识,物理、生命、社会和人工智能系统中都可能出现。

  3. 非线性、反馈、动态演化和多尺度层级,是涌现的重要特征。

  4. 弱涌现通常可以由微观规则模拟;强涌现涉及意识、认知等仍有争议的问题。

  5. 多智能体分工不一定是涌现,关键在于是否产生了未被直接预设的新策略、协议或组织结构。

  6. 神经网络通过多层表示学习,从数据中形成特征与能力。

  7. 大语言模型的能力跃迁值得关注,但"涌现"是否真实存在,还需要结合任务和评测方式具体讨论。

我在这里为涌现下个定义:涌现不是简单个体的机械叠加,而是局部规则、持续交互、反馈机制与时间演化共同作用后,形成的宏观组织能力。

相关推荐
GFDAGDS11 分钟前
从课程设置看近屿智能AI培训:直播教学、AI互动学习与项目实战如何结合
人工智能·大模型应用·近屿智能
hy56856919 分钟前
2027赛逸展聚焦机器视觉技术,提升机器人环境感知能力
人工智能·机器人
AndrewHZ22 分钟前
图像处理入门018 | 简易图像浏览器开发:用 OpenCV + Tkinter 打造你的第一个图像 GUI 工具
图像处理·人工智能·opencv·canvas·tkinter·事件绑定
智恒百亿23 分钟前
企业 AI 推理本地化部署:GPU 服务器选型技术分析(2026 年 8 月)
大数据·服务器·人工智能
黎阳之光23 分钟前
软硬协同国产化 | 黎阳之光矩阵式视频融合管理系统完成摩尔线程国产GPU兼容适配
大数据·人工智能·物联网·安全·数字孪生
水管在开花.25 分钟前
RAG:知识库问答系统教学②-零基础保姆级教程
人工智能·面试·agent·rag
YOLO数据集集合26 分钟前
无人机视角交通目标检测数据集 | 无人机感知 交通检测 城市监控 目标检测 YOLO格式 深度学习数据集 9016期
人工智能·深度学习·yolo·目标检测·计算机视觉·无人机·交通数据集
2601_9574188026 分钟前
相机连续拍摄时,照片为什么会乱?从传输队列到相机即拍即传 SDK 的设计
人工智能·数码相机