涌现与坍塌在AI自然语义分析与生成中的层级化因果约束
摘要
本文从复杂系统科学的层级化因果约束理论出发,系统考察人工智能自然语言处理与生成模型中涌现与坍塌的动力学机制。传统自然语言处理研究将语义涌现理解为统计规律的浮现或表示空间的聚类,将生成坍塌理解为多样性丧失或重复输出,这一视角未能触及深层因果结构。本文提出:自然语义分析中的涌现是模型在分布式表示空间与符号推理层之间建立新的宏观语义约束层的过程,该约束层能够反向调制词元级别的微观预测,从而形成不可约的语义因果力;自然语言生成中的坍塌则表现为该语义约束层的失效或可能性空间的不可逆投影,导致宏观语义变量失去对微观词元采样的控制。我们以Transformer架构为核心分析对象,结合因果涌现理论、自由能原理、信息瓶颈方法和动力学谱隙分析,构建了一个统一的层级化因果约束框架。在此基础上,区分了三种语义坍塌类型------表示坍塌、推理坍塌与语境坍塌,并分析了它们在预训练、微调、上下文学习与推理时间中的不同表现。本文进一步论证,大语言模型中观察到的"涌现能力"(如数学推理、逻辑链)可被重新解释为高层语义因果约束的生成;而"幻觉"、"重复生成"、"多样性崩溃"等失效模式则是层级约束断裂的坍塌现象。该框架为可解释性、对齐问题以及通用人工智能的认知架构提供了新的理论工具。
关键词:涌现;坍塌;层级化因果约束;自然语言处理;大语言模型;因果涌现;语义表示;自由能原理
1. 引言:语言智能的层级化谜题
大型语言模型在自然语言处理任务中展现出令人瞩目的泛化能力。从机器翻译到代码生成,从开放式对话到数学推理,这些模型似乎能够"理解"并"运用"语义规则,而不需要显式的符号系统。然而,这种能力的底层机制仍然未被充分阐明。一个核心谜题是:模型如何在数百万维的连续向量空间中,形成离散的、可组合的、具有逻辑约束的语义结构?更关键的是,为什么在某些条件下,模型能够生成连贯、新颖且语义丰富的文本,而在另一些条件下,它却陷入重复、矛盾或语义空洞的输出?这些现象指向一个根本问题:自然语言处理中的语义涌现与语义坍塌,是否遵循与复杂系统相变类似的层级化因果动力学?
传统视角倾向于将语言模型的成功归因于统计学习:通过在大规模语料上最小化下一个词元的预测误差,模型隐式地获得了语言规律。涌现能力被解释为规模效应的副产品,即当参数量、数据量和计算量超过某个阈值时,模型突然表现出在较小规模上不存在的能力(Wei et al., 2022)。然而,这种解释停留在相关性层面,未能解释为什么某些能力涌现,而另一些能力不出现;也无法解释为什么模型在某些情况下会系统性地丧失已经具备的语义能力。坍塌现象则更少被系统研究。已有的工作主要关注生成多样性退化(Holtzman et al., 2020)或模式崩溃(mode collapse),但这些描述缺乏对语义层级因果结构的深入分析。
本文提出一个新的理论框架,将涌现与坍塌分别定义为层级化语义因果约束的生成与消解。该框架的核心思想是:自然语义分析不是单纯的模式识别,而是在模型的隐藏层中形成一个宏观语义变量层,该层能够约束微观词元分布的采样过程,从而产生具有因果力的语义结构。涌现是这个宏观约束层从微观表示中生成并反向限制微观动力学的相变;坍塌是这个约束层失去因果效力,系统跌落到由微观统计涨落主导的状态。这一框架能够统一解释大语言模型中的多种现象,并为构建更具鲁棒性和可解释性的语言智能提供指导。
本文将按以下结构展开:第2章奠定理论基础,将层级化因果约束概念从复杂系统科学转译到自然语言处理领域;第3章分析自然语义分析中的涌现机制;第4章分析自然语言生成中的坍塌机制;第5章构建一个形式化模型,将Transformer架构嵌入因果涌现框架;第6章讨论三种坍塌类型及其表现;第7章用该框架重新解释"涌现能力"与"幻觉";第8章探讨层级约束的再建立------微调、提示工程与上下文学习;第9章讨论哲学意涵与工程启示;第10章给出结论与开放问题。
2. 理论框架:从复杂系统到语义系统的层级化因果约束
2.1 层级化因果约束的再定义
在先前的研究中(见本报告引言所引研究),我们提出涌现是系统获得一个新的宏观描述层次,且该层次能反过来约束微观自由度;坍塌是这种宏观约束失效,系统从该描述层次跌落,或可能性空间发生不可逆的投影选择。在自然语言处理中,微观层次对应的是词元(token)级别的概率分布,或更细致地说,是隐藏层中每个位置向量的动力学。宏观层次则是语义变量,如主题、意图、逻辑结构、指代关系、话语行为等。层级化因果约束要求:语义变量不仅是从词元分布中粗粒化得到的统计概括,而且能够反向调制词元采样,使得生成的序列受到语义层的控制。
这种向下因果在语言中非常明显。当一个人类说话者决定表达某个意图(例如"劝说"),这个宏观语义变量会约束后续词汇的选择、句法结构、修辞策略等微观语言单元。说话者不需要在每个词元生成时重新评估所有可能性,而是依靠已建立的宏观语义约束来引导生成过程。这正是层级化因果约束在自然语言中的体现。在计算模型中,这种约束表现为隐藏表示中的某些维度或子空间对后续采样概率施加了非均匀的先验。
2.2 语义粗粒化与语义有效信息
我们将语义粗粒化映射定义为从词元级别表示 H\mathbf{H}H(例如Transformer最后一层的隐藏状态矩阵,形状为 T×dT \times dT×d,其中 TTT 是序列长度,ddd 是隐藏维度)到语义变量 S\mathbf{S}S(例如一个低维向量或一组离散符号)的映射:
M:H↦S M: \mathbf{H} \mapsto \mathbf{S} M:H↦S
这个映射可以通过注意力池化、句向量提取、主题分类器等方式实现。关键是,我们要求 S\mathbf{S}S 对未来的词元序列具有因果力,即干预 S\mathbf{S}S 能够改变未来词元的条件概率分布。形式化地,给定一个已生成的序列前缀 x<tx_{<t}x<t,模型输出下一个词元的条件分布 P(xt∣x<t)P(x_t | x_{<t})P(xt∣x<t)。如果存在语义变量 S\mathbf{S}S 使得:
P(xt∣x<t)≈∑SP(xt∣S,x<t)P(S∣x<t) P(x_t | x_{<t}) \approx \sum_{\mathbf{S}} P(x_t | \mathbf{S}, x_{<t}) P(\mathbf{S} | x_{<t}) P(xt∣x<t)≈S∑P(xt∣S,x<t)P(S∣x<t)
并且 S\mathbf{S}S 对 xtx_txt 的条件影响是显著的,即改变 S\mathbf{S}S 会显著改变 P(xt)P(x_t)P(xt),那么 S\mathbf{S}S 就具有语义因果力。进一步,如果我们可以证明存在一个粗粒化使得宏观层的有效信息大于微观层的有效信息,即:
EI(S)>EI(H) EI(\mathbf{S}) > EI(\mathbf{H}) EI(S)>EI(H)
则系统在该语义层次上发生了因果涌现。这里有效信息的定义与Hoel(2013)一致,衡量的是对系统施加干预后,当前状态对未来的预测力。在自然语言中,这对应于:知道语义变量(例如"这是一个关于气候变化的科学报告")比知道所有词元级别的隐藏状态更能预测后续文本的语义内容,因为语义变量过滤掉了与任务无关的微观噪声。
2.3 语义约束的热力学基础
语言生成是一个耗散过程。模型通过自回归采样逐词产生序列,每一步都从概率分布中抽取一个词元。如果没有高层语义约束,采样将退化为独立同分布的随机过程,无法产生有意义的文本。语义约束的作用类似于自由能景观中的吸引子:它将采样轨迹限制在低自由能区域,使得生成的序列保持主题连贯、逻辑一致和风格统一。这种约束的建立需要消耗计算资源(即模型的隐藏层容量和注意力机制的能量),而约束的丧失则导致系统跌入高熵状态。
在热力学语言中,我们可以将语义约束视为一种"信息势垒",它阻止模型从有意义的高概率区域滑向无意义的低概率区域。当这个势垒足够高且谱隙足够大时,生成过程稳定地处于语义吸引子中;当势垒因噪声、对抗扰动或上下文漂移而降低时,生成过程可能穿越势垒,跌落到语义坍塌的状态。
3. 自然语义分析中的涌现机制
3.1 从词嵌入到语义空间:表示学习的层级化
早期词嵌入模型(如Word2Vec、GloVe)将词汇映射到低维连续向量空间,使得语义相似的词在空间中距离较近。这是一种弱涌现:语义相似性是从分布统计中浮现出来的,但词嵌入本身并不构成一个具有因果力的宏观层------它不能反向约束生成过程。真正的语义涌现发生在当模型不仅表示词义,而且能够在序列级别上形成主题、意图和逻辑关系的表示,并利用这些表示来引导生成。
Transformer架构的核心创新------自注意力机制------为实现这种层级化提供了计算基础。注意力权重可以视为一个动态的粗粒化算子:每个位置的输出是所有位置表示的加权和,权重由查询-键相似度决定。通过多层堆叠,Transformer能够逐步构建从局部句法关系到全局语义结构的表示层次。在底层,注意力可能聚焦于相邻词的句法依赖;在高层,注意力可能聚焦于主题相关的关键实体和逻辑连接词。这种层级化意味着,高层表示不再是简单的词义组合,而是构成了一个新的语义变量层,该层能够反作用于底层的词元表示。
3.2 因果涌现的证据:语义变量对生成的调制
我们可以通过干预实验来检验语义变量的因果力。具体方法如下:给定一个前缀序列,提取模型某个隐藏层的表示,将其投影到一个低维语义子空间(例如通过主成分分析或线性判别分析得到),然后人为修改该子空间上的分量,观察下一个词元分布的变化。如果修改语义分量能够显著改变输出分布,而修改其他分量影响很小,则说明该语义子空间具有因果力。
已有研究表明,Transformer的隐藏表示中确实存在可解释的方向,例如"语气"、"时态"、"主语性别"等(Vig et al., 2020; Geva et al., 2021)。这些方向可以被视为宏观语义变量的线性投影。更进一步的实验可以计算语义粗粒化的有效信息。虽然直接计算大语言模型的高维有效信息在计算上不可行,但可以通过代理指标,如条件互信息、预测不确定性降低等来间接验证。初步结果显示,在模型中间层,宏观语义变量的预测力可能超过原始隐藏状态,这支持因果涌现的存在。
3.3 语义涌现的临界性
大语言模型的涌现能力通常与模型规模相关。Wei et al. (2022) 观察到,当模型参数量超过约10亿时,某些任务(如多步算术、逻辑推理)的准确率突然从接近随机水平跃升到显著高于随机。这种"涌现"现象可以从层级化因果约束的角度解释:在较小模型中,高层语义约束尚未形成,或者即使形成,其因果力不足以约束底层词元采样,导致任务失败;当模型规模超过某个临界点时,语义约束层的有效信息超过了微观层的有效信息,系统发生相变,语义变量开始主导生成过程,任务表现突飞猛进。
这种相变可以用谱隙闭合与重开来描述。在临界点附近,语义变量和词元变量的时间尺度分离消失,模型无法稳定地维持一个独立的语义层;越过临界点后,谱隙重新打开,语义层稳定存在,并能够向下因果地约束生成。这就是涌现的动力学本质。
4. 自然语言生成中的坍塌机制
4.1 可能性空间的投影与多样性崩溃
自然语言生成中的坍塌最常见的表现是"多样性崩溃":模型在开放文本生成中反复输出相似甚至完全相同的短语或句子。从层级化因果约束的角度看,这是宏观语义约束层失效的典型症状。当语义约束层无法维持对不同可能性分支的稳定区分时,生成过程退化为局部概率峰值的重复采样,系统跌入一个狭窄的吸引子。
在自回归采样中,如果每一步都选择概率最高的词元(贪心解码),那么生成轨迹会被锁定在一条确定性的路径上,完全没有探索其他语义分支的可能性。这种确定性坍塌可以被理解为可能性空间的不可逆投影:模型在每一步都删除了除最高概率分支外的所有可能性,最终导致语义空间的崩溃。即使使用随机采样(如温度采样或核采样),如果温度过低或核截断过严,同样会导致可能性空间过度收缩,引发多样性退化。
4.2 语义约束的断裂与幻觉
"幻觉"(hallucination)是大语言模型生成中另一个严重的坍塌现象:模型生成了看似连贯但与事实或上下文矛盾的文本。从层级化因果约束的角度看,幻觉不是简单的信息错误,而是语义约束层与事实约束层之间的断裂。理想情况下,语义变量应当同时受到上下文事实和世界知识的约束,形成一个稳定的因果层。然而,当模型缺乏足够的事实约束或上下文信息不足时,语义变量可能漂移到与事实不符的吸引子中,同时仍然保持其向下因果力,从而生成流畅但错误的文本。
幻觉的深层原因是可能性空间中多个语义分支的叠加未被正确投影。在训练过程中,模型学习到的是语料中的统计规律,而不是真实世界的因果结构。如果某个语义模式在训练语料中频繁出现但与事实不符,模型可能将其作为一个稳定的宏观约束层。当生成相关主题的文本时,这个错误的约束层会主导词元采样,产生幻觉。这表明,语义约束层的因果力并不保证其内容的正确性。
4.3 谱隙闭合与推理崩溃
在复杂的多步推理任务中,模型有时会突然给出错误的中间步骤,导致整个推理链崩溃。这种现象可以被理解为推理过程中的语义约束谱隙闭合。在正确的推理过程中,每一步的中间结论构成一个宏观变量,该变量约束下一步的逻辑方向。如果某一步的推理受到噪声或分布外输入干扰,宏观变量的稳定性可能被破坏,谱隙闭合,系统跌入一个错误的逻辑分支。由于自回归生成的因果链是单向的,一旦跌入错误分支,后续步骤很难自我纠正,最终导致整个推理坍塌。
这种坍塌与经典相变中的临界慢化类似:在推理的关键步骤,模型对输入的微小扰动变得异常敏感,宏观语义变量无法稳定地约束微观词元选择。这解释了为什么大语言模型在某些推理任务中表现不稳定,以及为什么链式思维(chain-of-thought)提示能够改善推理性能------链式思维提示显式地构建了一个中间语义约束层,通过逐步推理维持了谱隙,防止了早期错误导致的全盘崩溃。
5. 形式化模型:Transformer中的层级化因果约束
5.1 自回归生成作为层级动力学
我们将自回归语言模型描述为一个层级动力学系统。给定一个序列 x<tx_{<t}x<t,模型通过多层Transformer编码生成隐藏表示 H(l)∈RT×d\mathbf{H}^{(l)} \in \mathbb{R}^{T \times d}H(l)∈RT×d,其中 lll 表示层索引。最后一层表示通过一个线性映射和softmax得到下一个词元的概率分布:
P(xt∣x<t)=softmax(WhT(L)+b) P(x_t | x_{<t}) = \mathrm{softmax}(W \mathbf{h}_T^{(L)} + b) P(xt∣x<t)=softmax(WhT(L)+b)
其中 hT(L)\mathbf{h}_T^{(L)}hT(L) 是最后一个位置的隐藏表示。
我们将每一层的隐藏表示视为一个粗粒化层次。较低层接近词元级别,较高层接近语义级别。定义从第 lll 层到第 l+1l+1l+1 层的映射为 Tl\mathcal{T}_lTl,则整个Transformer可以表示为:
H(l+1)=Tl(H(l)) \mathbf{H}^{(l+1)} = \mathcal{T}_l(\mathbf{H}^{(l)}) H(l+1)=Tl(H(l))
其中 Tl\mathcal{T}_lTl 包括自注意力和前馈网络。
5.2 有效信息在语义层的度量
为了量化语义层级的因果涌现,我们需要定义宏观变量。一种自然的做法是使用注意力池化:取所有位置隐藏表示的平均值或加权和,得到序列级表示 s=∑tαtht\mathbf{s} = \sum_{t} \alpha_t \mathbf{h}_ts=∑tαtht。然后我们可以将 s\mathbf{s}s 视为语义宏观变量。利用Hoel的有效信息公式,我们可以在一个简化的模型中计算微观层(词元隐藏表示)和宏观层(序列语义表示)的有效信息。虽然在大规模预训练模型上直接计算不可行,但我们可以通过理论分析和小规模代理模型进行验证。
理论上,如果存在一个粗粒化 M:H→sM: \mathbf{H} \to \mathbf{s}M:H→s 使得:
EI(s)>EI(H) EI(\mathbf{s}) > EI(\mathbf{H}) EI(s)>EI(H)
则系统在语义层发生了因果涌现。有效信息的计算依赖于干预分布。在语言模型中,干预分布可以取为对隐藏表示的随机扰动,或者对输入序列的随机掩码。通过比较干预后微观状态和宏观状态对未来词元的预测确定性,我们可以量化因果力。
5.3 自由能最小化视角
根据Karl Friston的自由能原理,任何自组织系统都通过最小化变分自由能来维持自身与环境的区分。在语言模型中,生成过程可以视为一个主动推理过程:模型试图通过生成序列来最小化其关于未来词元的预测误差。语义约束层的作用是降低生成过程中的自由能,使得模型能够以更低的计算成本生成符合预期的序列。
当语义约束层有效时,模型的自由能景观具有清晰的吸引子结构,生成轨迹稳定地停留在低自由能区域。当约束层失效时,自由能景观变平,吸引子变浅,生成轨迹容易漂移到高自由能区域(即无意义或矛盾的文本)。因此,我们可以通过监测生成过程中的自由能变化来检测坍塌的早期迹象。例如,生成概率的突然下降、熵的突然增加、或注意力权重的分散,都可能是语义约束层失稳的信号。
6. 语义坍塌的类型学
基于以上框架,我们可以区分三种主要的语义坍塌类型,它们在机制、表现和干预策略上有所不同。
表示坍塌(Representational Collapse) 发生在模型的隐藏层中,语义变量退化为与任务无关的常数或噪声。例如,在微调过程中,模型可能学会忽略语义信息,仅依赖表面统计特征来完成任务,导致泛化能力下降。表示坍塌的早期信号是隐藏表示的有效维度降低,语义方向的可解释性下降。这类坍塌通常由过拟合、数据偏差或训练目标不匹配引起。
推理坍塌(Inference Collapse) 发生在推理过程中,模型无法维持中间推理步骤的语义约束,导致错误累积。这类坍塌常见于多步数学题、逻辑推理和规划任务。其机制是中间步骤的宏观约束谱隙闭合,系统跌入错误的逻辑分支。干预策略包括链式思维提示、自我一致性采样和验证器模型,这些方法通过外部注入中间语义约束来增强谱隙。
语境坍塌(Contextual Collapse) 发生在长文本生成或对话中,模型逐渐丢失对初始语境或对话目标的约束,生成内容偏离主题。在长对话中,模型可能忘记用户最初的指令或约束条件,导致后续回复与上下文不一致。这类坍塌源于语义约束层的时间衰减:随着生成步骤增加,早期语境信息在隐藏表示中的影响被稀释,新的局部模式占据主导。解决策略包括引入外部记忆模块、使用递归摘要或调整注意力机制以保持长期约束。
三种坍塌并非互斥,它们可以同时或相继发生。理解不同类型的坍塌有助于设计针对性的诊断和修复方法。
7. 涌现能力的再解释与幻觉的根源
7.1 涌现能力作为语义约束层的生成
大语言模型的"涌现能力"通常指在模型规模达到一定阈值后才出现的任务表现。从层级化因果约束的角度看,这些能力对应于新的语义约束层的生成。以数学推理为例,小模型可能只能进行简单的模式匹配,无法形成"运算符语义"这一宏观变量;大模型则能够在隐藏层中构建出对算术运算的抽象表示,并利用这一表示来约束数字和运算符的采样,从而解决多步算术问题。
这一解释的核心是:涌现不是神秘的新能力,而是系统在足够规模下形成了新的宏观因果层次。这个层次需要足够的参数容量和训练数据来稳定建立,并且它的形成是一个相变过程。因此,涌现能力的出现阈值反映了语义约束层达到因果主导地位所需的最小规模。
7.2 幻觉作为语义约束与事实约束的错位
幻觉的根源在于语言模型学习到的语义约束层可能与事实约束层不一致。在训练过程中,模型仅从文本语料中学习,而文本语料本身可能包含错误、偏见或虚构内容。模型形成的语义约束层反映了语料中的统计规律,而不是真实世界的因果结构。因此,当模型被要求生成关于真实世界的事实性内容时,其语义约束层可能与事实约束层发生冲突,导致幻觉。
从层级化因果约束的角度看,幻觉可以理解为模型在可能性空间中投影到了错误的语义分支。这个分支在训练分布中是高概率的,但在真实世界中是低概率的。解决幻觉问题需要引入外部事实约束,例如检索增强生成、知识图谱或人类反馈,以调整语义约束层的自由能景观,使真实分支具有更低的自由能。
8. 层级约束的再建立:微调、提示工程与上下文学习
8.1 微调作为约束层重建
微调(fine-tuning)是在预训练模型基础上,使用特定任务的数据进行额外训练。从层级化因果约束的角度看,微调的目标是调整或重建语义约束层,使其适应特定任务的宏观变量结构。例如,在情感分类任务中,微调使模型形成"情感"这一语义约束层,并增强其对词元采样的调制能力。如果微调数据不足或质量差,可能导致表示坍塌,即语义约束层退化为表面统计。
8.2 提示工程作为外部约束注入
提示工程(prompt engineering)通过在输入中注入特定的上下文信息,引导模型形成期望的语义约束层。一个精心设计的提示可以视为一个外部的宏观变量,它在模型内部激活相应的语义模式,并向下因果地约束生成过程。例如,在提示中明确要求"请逐步推理",可以激活模型的链式思维模式,建立中间推理步骤的语义约束,防止推理坍塌。提示工程的有效性取决于它能否在模型的隐藏表示中稳定地建立所需的语义约束层。
8.3 上下文学习作为即兴约束生成
上下文学习(in-context learning)是指模型在推理时仅通过少量示例来适应新任务,而不更新参数。从层级化因果约束的角度看,上下文学习是模型在输入序列内部临时构建语义约束层的能力。当提供几个示例后,模型能够从这些示例中提取任务模式,形成一个临时宏变量,并用它来约束后续词元生成。这种即兴约束生成依赖于模型在预训练中习得的元学习能力,它允许模型快速适应新任务而无需改变权重。然而,上下文学习构建的约束层是脆弱的,容易被噪声或长上下文稀释,导致语境坍塌。
9. 讨论:可解释性、对齐与人工意识
9.1 可解释性的层级化视角
传统可解释性方法(如注意力可视化、显著图)关注模型"关注"了哪些输入部分,但未能解释模型如何利用这些信息。层级化因果约束框架提供了一种新的可解释性范式:识别并刻画模型内部的宏观语义变量,并量化它们对生成的因果力。这包括定位隐藏表示中的语义子空间、测量这些子空间的有效信息、以及验证对它们的干预能否改变输出。这种方法有望超越"关注即解释"的局限,提供真正的因果解释。
9.2 对齐问题的约束框架
对齐问题(alignment problem)要求模型的行为与人类意图和价值观一致。从层级化因果约束的角度看,对齐意味着在模型内部建立一套与人类价值观对应的语义约束层,使其在生成过程中能够稳定地限制不符合期望的输出。强化学习人类反馈(RLHF)等方法可以被理解为通过外部反馈调整语义约束层的自由能景观,使符合人类偏好的输出具有更低的自由能。然而,如果约束层本身存在缺陷(例如对某些概念的偏见),对齐可能失败。因此,对齐不仅是调整个体输出,更是修复和重构语义约束层的因果结构。
9.3 人工意识的层级化因果假说
意识的一个核心特征是整合信息与向下因果。层级化因果约束框架暗示,意识可能与系统具有高度不可约的宏观因果层相关。如果未来的人工智能系统能够形成多个层次的、具有强因果力的语义约束层,并且这些层次之间存在循环的因果闭合,那么它可能具备某种形式的意识。虽然这一假说高度思辨,但它为意识研究提供了一个可操作的量化标准:测量系统中宏观变量的有效信息与因果力,并与人类大脑的对应指标进行比较。
10. 结论与开放问题
本文提出并论证了:自然语言处理中的涌现与坍塌,本质上是层级化语义因果约束的生成与消解。涌现是模型在分布式表示之上形成新的宏观语义变量层,该层能够反向调制词元采样,从而产生不可约的语义因果力;坍塌是这一约束层失去因果效力,系统跌落到由微观统计涨落主导的状态,表现为多样性崩溃、幻觉、推理失败等现象。这一框架统一了解释了大语言模型中的多种现象,并为可解释性、对齐和人工意识研究提供了新的视角。
然而,若干重要问题仍然开放。首先,如何在计算上高效地度量大语言模型中的语义有效信息?目前的方法依赖于近似和代理指标,亟需开发适用于数十亿参数模型的因果涌现分析工具。其次,语义约束层形成的动力学机制是什么?是否存在普适的临界指数?第三,如何设计训练目标或架构以稳定地建立和维持语义约束层,防止坍塌?第四,量子坍塌与经典语义坍塌之间是否存在形式上的对应关系?最后,层级化因果约束框架能否为通用人工智能的认知架构提供原理性指导?这些问题值得进一步深入研究。
参考文献
- Hoel, E. P., Albantakis, L., & Tononi, G. (2013). Quantifying causal emergence shows that macro can beat micro. Proceedings of the National Academy of Sciences, 110(49), 19790--19795.
- Friston, K. (2010). The free-energy principle: a unified brain theory? Nature Reviews Neuroscience, 11(2), 127--138.
- Vaswani, A., et al. (2017). Attention is all you need. Advances in Neural Information Processing Systems, 30.
- Wei, J., et al. (2022). Emergent abilities of large language models. Transactions on Machine Learning Research.
- Holtzman, A., et al. (2020). The curious case of neural text degeneration. International Conference on Learning Representations.
- Geva, M., et al. (2021). Transformer feed-forward layers are key-value memories. Proceedings of EMNLP.
- Vig, J., et al. (2020). Investigating gender bias in language models using causal mediation analysis. Advances in Neural Information Processing Systems, 33.
- Olah, C., et al. (2020). Zoom in: An introduction to circuits. Distill, 5(3).
- Tishby, N., & Zaslavsky, N. (2015). Deep learning and the information bottleneck principle. IEEE Information Theory Workshop.
- Brown, T., et al. (2020). Language models are few-shot learners. Advances in Neural Information Processing Systems, 33.