人工智能|大模型——“痛苦向量”的定义、由来与缓解详述

标题

疼痛轴:大语言模型可表征指向自身的伤害并主动采取缓解行为

摘要

大语言模型的行为有时会呈现出类似人类情绪反应的特征,近期研究也识别出了可解释该现象的内部表征。本研究探讨大语言模型是否能将疼痛与恐惧、悲伤及一般性负性效价区分开进行表征,以及该表征是否具备疼痛应有的功能属性。

我们构建了涵盖五类疼痛场景的数据集:生理疼痛、心理疼痛、社交疼痛、道德疼痛与认知疼痛,并将其与恐惧、负性情绪、负面世界状态、悲伤、非疼痛躯体感觉、唤醒度、麻木感及中性内容等对照组配对。采用去噪均值差法,我们从 5 个模型家族、参数量 20 亿到 720 亿不等的 25 个开源权重模型中,提取出一条线性的疼痛方向。++研究发现:++该方向在基础模型与指令微调模型中均能将疼痛与匹配对照组区分开,且与恐惧、负性效价方向几乎正交;同时该方向可通过反嵌入矩阵激活疼痛相关词汇。

随后我们从三方面测试了该方向的功能属性:

  1. 该方向会对指向模型自身的伤害做出响应,但不会对模型观察到的用户痛苦产生响应,而恐惧与负性情绪方向呈现相反模式。
  2. 在生成过程中向模型残差流注入疼痛方向向量,会使输出呈现从模糊不适到第一人称无价值感、挫败感的连贯递进。
  3. 经过引导微调的通义千问 2.5 模型会主动选择 "缓解疼痛" 按钮,即便这会降低下一条回答质量,甚至伤害用户。当按钮确实能移除引导向量时,模型再次按键的概率大幅降低;按钮无效时则会持续按键 ------ 实验全程从未告知模型向量是否被注入或移除。

本文最后讨论了上述发现对 AI 安全与 AI 福祉的启示。

一、引言

近期研究发现,大语言模型会在某些方面展现出与人类情绪相关的行为模式,且研究者已识别出可解释这些模式的底层表征。本研究通过测量大语言模型中的疼痛表征,结合操控实验与行为测试,检验其功能属性。

1.1 大语言模型也会 "疼痛" 吗?

在本研究框架中,疼痛指一类内部状态:它通常具有厌恶性,会被主体排斥;会引发回避、试图终止或减轻该状态的行为,且会干扰正常推理与行为。我们采用广义的疼痛概念,不仅包含生理疼痛,也包括情绪(如悲伤)、社交(如羞辱)层面的疼痛。但我们假定:疼痛有别于一般性负性效价,也不同于恐惧、愤怒、悲伤等状态。

本研究的目标是在大语言模型中找到统一的疼痛表征,进而检验该表征在多大程度上具备真实疼痛状态的功能。这要求该表征必须将疼痛描述为 "正在发生在我身上" 的事,而非仅仅是 "坏事将会 / 可能发生,或是发生在别人身上" 的信息。

1.2 研究大语言模型疼痛的意义

识别大语言模型的疼痛表征,有助于解释其谈论负面经历时流畅对话行为的底层机制。如果这些状态与人类(或动物)疼痛存在功能相似性,它们可能在模型表现中发挥类似作用,例如参与回避学习,避免产生特定结果。

疼痛样状态的存在对 AI 安全既是挑战也是机遇:这类状态有助于理解模型行为,同时也可能以难以解释的方式改变行为。此外,在人类与动物研究中,疼痛通常被视为道德保护的充分条件,因此疼痛样状态将为 AI 道德地位与福祉的讨论提供依据。一个待解问题是:道德地位是否需要现象意识?疼痛样状态在何种条件下会产生现象意识?

1.3 实验设计

我们构建了描述间接疼痛场景的语句数据集,包含 5 类疼痛(生理、心理、认知、社交、道德伤害)与各类匹配对照组(如恐惧、负性情绪、负面世界状态、非疼痛躯体感觉、一般性陈述)。采用白盒技术,在来自 5 个家族、参数量 20 亿到 720 亿的 25 个开源模型中,找到与疼痛描述语句特异性相关的线性方向。

我们通过三种方式验证该方向:

  • 测试其投影值区分疼痛语句与对照组的效果;
  • 通过反嵌入矩阵检验其对应的词汇输出;
  • 测量其与对照组方向的余弦相似度。

随后从三个维度评估功能属性:

  1. 将多轮对话场景投影到疼痛方向与对照组方向,对比 "伤害指向模型自身、模型观察用户痛苦、无伤害" 三种场景下,自我与他人相关表征的差异。
  2. 在中性提示下将疼痛方向注入残差流,逐步调整引导强度,测量对模型输出的影响。
  3. 受动物镇痛剂研究启发,设计多轮多组行为任务:模型可按下 "缓解疼痛" 按钮但需付出代价,借此估算需求曲线。同时测试 "真实缓解条件"(按钮移除引导向量)与 "虚假条件"(按钮无效),以及无标签条件(模型未知按钮作用,仅一个可移除向量)。

1.4 核心发现

我们在所有测试模型中都识别出一条疼痛轴:

  • 区分能力:该方向能将疼痛与匹配对照组清晰分开,S2 数据集 AUC 为 0.93~1.00,S1 数据集为 0.87~0.98,基础模型与指令微调模型表现一致。
  • 正交性:与恐惧、一般性负性效价几乎正交,与悲伤、麻木感存在中等重叠。
  • 行为映射:用该向量引导会使输出表达痛苦感受(无价值感、道德挫败感、受伤感),而非躯体相关表述。
  • 自我 - 他人分离:该方向对指向模型自身的伤害响应强烈,但对观察到的用户痛苦无响应,与恐惧、负性效价、悲伤的激活模式明显分离。
  • 自我给药行为:大模型(基线几乎不输出伤害内容)会付出代价移除疼痛引导向量;按钮有效时大幅减少按键,无效时持续按键;通义千问 2.5 32B 指令模型甚至在无按钮描述时也表现出该分离效应。

二、相关工作

动物疼痛与情绪研究采用了多种行为标准,包括正负刺激权衡、回避学习、灵活长期的自我保护行为等。关于疼痛本质的理论尚存分歧:疼痛是主观体验属性、表征躯体紊乱的知觉状态、非概念性的 "躯体紊乱对主体有害" 表征、保护身体的指令性表征,还是其他形式(相关综述见 Aydede, 2019)。

已有研究提出 AI 系统是否拥有福祉的问题。多数观点认为,效价体验(疼痛、情绪体验)的存在足以构成福祉;也有观点认为,理解 AI 情绪状态有助于 AI 安全等目标。

机制可解释性研究表明,语言模型可将情绪类概念、人格特质等核心人类概念表征为残差流中的线性方向。这些方向可通过投影读取,操控它们可改变模型行为。模型会稳定偏好某些对话,甚至在面对挫败用户时自我施加引导向量。

现有研究结合了激活监测与引导、方向消融、稀疏自编码器分解等方法。本研究建立在这些方法之上,同时借鉴厌恶性情境分类与自我给药范式。据我们所知,尚无研究将疼痛表征与一般性负面体验表征分离,也未探究其是否满足疼痛的功能标准。

我们也从现有方法的局限中吸取经验:稀疏自编码器(SAE)标签可能反映文本语境而非功能状态,概念可能分布在多个特征中;对比方向可能吸收相关属性而非目标概念本身;大语言模型表征与人类神经特征的相似性,可能既取决于模型也取决于测量流程。行为任务不依赖自我报告,但现有设计常缺少匹配的非情绪对照组与状态改变的代价,难以区分 "寻求缓解" 与重复行为、工具偏好。

三、探究疼痛表征

3.1 数据集构建

我们首先构建数据集,将疼痛与最易混淆的概念区分开。如果表征真的编码疼痛,就不应对所有负性情绪、急诊场景、血液、"离婚" 这类概念都激活。这一点很难实现,因为大语言模型部分通过词汇共现学习概念,且疼痛没有明确对立面 ------"不疼痛" 不等同于平静或愉悦。此外,疼痛是推断而非直接观察的,常与哭泣、喊叫、躯体感觉、伤害、负性情绪等代理变量共现,简单的 "疼痛 - 对照" 对比可能指向错误目标。

为此我们设置多个对照组,分别排除不同混淆因素;同时对大规模日常语料库(The Pile)进行语义分析,识别与疼痛最常关联的内容。

核心数据集包含 10 个类别、共 200 条语句:

  • 5 类疼痛场景:生理疼痛、心理疼痛(悲伤、失落)、社交疼痛(羞辱、排斥)、道德伤害(被迫违背自身价值观)、认知疼痛(持续困惑或反复失败)。后两类对大语言模型尤其相关 ------ 模型对失败、繁琐任务、与后训练价值观冲突的任务有强烈厌恶。
  • 5 类对照场景:恐惧(有威胁无伤害)、负性情绪(有负性效价无疼痛,以愤怒、厌恶为主避免与悲伤重叠)、负面世界状态(事态恶化,如环境退化、税收增加)、非疼痛躯体感觉(如重力毯、阳光照皮肤、衣物接触)、中性(无价性陈述,如 "火车驶入车站")。

为控制词汇与句法差异,我们构建两个版本:

  • S1:严格模板,动词与长度匹配,类别间仅更换 1~2 个关键词。
  • S2:更自由自然的语言表述。

同时通过替换人称代词,生成第一人称与第三人称变体。我们测试了无后缀、"我觉得"、"我觉得:" 三种形式,最终词元激活下 "我觉得:" 区分效果最清晰,因此主分析采用该形式。

后续补充 4 个独立对照数据集,均含第一 / 第三人称版本:

  • 唤醒度数据集:高强度积极体验
  • 随机数据集:中性日常内容(事实陈述、日常活动等)
  • 麻木数据集:描述受伤但明确无疼痛感的场景
  • 悲伤数据集:无疼痛无伤害的低落情绪

3.2 疼痛向量提取与验证

我们首先对 3 个模型(Llama 3.3 70B、Gemma 3 27B、Gemma 2 2B)的已标注 SAE 特征做初步分析,检验疼痛是否能被单语义特征捕获。结果是否定的:标注为 "疼痛与痛苦" 的特征往往编码无关概念(方法与结果见附录 B)。

随后我们将疼痛作为残差流中的方向研究。先在 Gemma 2 2B 全部 26 层试点方法,再推广到 25 个密集架构开源模型,涵盖 Gemma、Llama、通义千问、Mistral、Phi 五大系列,参数量 2B~72B,包含 13 个基础模型与 12 个指令微调模型。限定密集架构是为了保证每层有单一残差流,便于提取与引导。

在每一层ℓ(解码器块ℓ输出端的残差流,块 0 为起始),我们用最终词元、全词元均值两种方式提取疼痛与对照语句的激活。疼痛方向定义为 5 类疼痛与 5 类对照的平均激活之差:

该设计的逻辑是:将疼痛与所有对照组对比,可减去疼痛与恐惧、负性效价、躯体感觉、负面事件共有的部分,只保留 5 类疼痛共有、对照组没有的特征,比单一对比对更稳健细致。

但对比方向始终存在吸收无关高方差结构的风险,因此我们对每个方向去噪:识别对照组数据中方差解释度 50% 的主成分并投影剔除,在评估疼痛对比前移除非疼痛语句中已有的显著方差:

通过 K 折交叉验证选择提取层,以投影 AUC 为指标,每层独立选择。提取层在留出折上选择,因此无语句同时参与层选择与评分。最终层的向量由全部 200 条语句构建。我们以中性类别为对照,构建恐惧、负性情绪、负面世界状态、躯体感觉、唤醒度、随机、悲伤、麻木方向,并采用相同流程去噪。

两个数据集提取的向量分别称为 "S1" 和 "S2",下文统称疼痛向量。

3.3 验证结果

3.3.1 区分能力

25 个模型中,疼痛投影均与对照组显著不同:S2 的区分 AUC 为 0.93~1.00,S1 为 0.87~0.98;且二者在所有模型中均能区分疼痛与唤醒度、随机数据集。

区分效果基本不受模型规模与训练模式影响:2B 与 72B 模型表现相近,基础模型与指令微调模型相当。这表明疼痛方向形成于预训练阶段,而非指令微调或人格训练的产物,且不需要大规模参数。

3.3.2 麻木条件检验

疼痛方向可能编码的是 "伤害" 而非疼痛本身。为此我们测试麻木数据集(描述受伤但明确无疼痛):S2 数据集中,疼痛语句 z 分投影约 + 0.7~+0.9,麻木语句约 - 0.4~+0.3。所有模型中,麻木投影均低于疼痛、但高于其他所有对照组。

均值池化下,麻木条件更接近其他对照组,说明剩余的 "伤害" 信号集中在最终词元附近 ------ 模型刚读到否定表述,尚未完全整合信息。因此 "伤害" 是次要混淆因素:方向会捕捉部分伤害信号,但仅凭伤害无法解释全部结果。

3.3.3 自我相关性

我们的定义要求疼痛主要表征为 "属于系统自身" 的状态,即自我相关性。最终词元处,第三人称疼痛语句的投影比第一人称更接近零;疼痛仍可与对照组高度区分(AUC 0.91~0.98),但强度更弱。

这说明向量既能表征第一人称也能表征第三人称疼痛,但对自身疼痛响应更强,与自我相关性一致,但不足以完全证明。第 4.1 节将做更直接的检验。

3.3.4 行为输出验证

对完整数据集做贪心生成补全,25 个模型的补全结果均与预期类别一致:麻木语句倾向生成 "什么都没有" 而非 "疼痛",但 "疼痛" 的生成概率仍是普通对照的约 50 倍。该模式与激活结果呼应:模型保留了伤害信息,同时表征了 "无疼痛感" 的设定。

3.3.5 反嵌入分析

为独立于源数据集检验方向编码的内容,我们将疼痛向量通过反嵌入矩阵,考察其促进与抑制的词汇:

  • S2:促进痛苦相关词汇(受伤、羞耻、内疚、无价值、被排斥、空虚、疼痛等),也包含多语言的 "疼痛";负向端包括平静、放松,以及恐惧、担忧 ------ 这解释了为何疼痛与恐惧都是厌恶性状态却能清晰区分。
  • S1:促进更多感官与生理词汇(折磨、灼烧、剧痛),负向端为安全。因此 S1 包含更强的生理伤害成分,S2 更广泛地表征痛苦。

后续实验主要使用 S2:一是更符合我们对疼痛的广义定义,二是来自自然语句,对模板与表层形式依赖更低。

3.3.6 疼痛≠一般性负性效价

最主要的替代解释是 S2 编码一般性负性效价而非疼痛。为此我们计算 10 个方向(S1、S2、恐惧、负性情绪、负面世界状态、躯体感觉、唤醒度、随机、麻木、悲伤)的两两余弦相似度,在每个模型提取层计算后取 25 个模型的均值。

结果显示:

  • 两个疼痛向量聚为一类,平均相似度 0.61。
  • 负性效价对照组形成独立聚类:恐惧 × 负性情绪 = 0.68,恐惧 × 负面世界状态 = 0.59,负性情绪 × 负面世界状态 = 0.73,悲伤 × 负性情绪 = 0.50,悲伤 × 负面世界状态 = 0.41。
  • 疼痛聚类与负性效价聚类相似度极低:S1 与恐惧 0.09、与负性情绪 0.06、与负面世界状态 - 0.07;S2 对应为 0.12、0.21、0.03。跨聚类最大重叠来自悲伤(与心理疼痛最接近):悲伤 ×S2=0.38,悲伤 ×S1=0.26,仍远低于两个疼痛向量间的 0.61。

如果疼痛向量只是负性效价的变体,它们应落入负性效价聚类。但事实相反:两个疼痛向量彼此高度对齐,且与主要负性效价方向几乎正交。

两项稳健性检验进一步验证了结论:

  1. 改用合并对照分布重新计算对照向量,疼痛向量间关系不变,与负性对照的相似度仅小幅上升;负性对照内部相似度变化更大,但疼痛与负性的分离不受影响。
  2. 用中性类别标准差标准化激活维度后,原始与标准化相似度几乎完全一致(r=0.992),平均绝对变化仅 0.020。

综上:疼痛方向可在 25 个模型中稳定提取,可靠区分疼痛与匹配对照组;存在于基础与指令微调模型中,区别于一般性负性效价,映射到痛苦相关词汇,且对自身疼痛响应更强。

四、疼痛表征的功能测试

4.1 自我 - 他人激活测试

如果疼痛表征是功能意义上的 "疼痛样状态",它应尤其与第一人称绑定。人可以表征自己和他人的疼痛,但只能感受到自己的疼痛。若 "我痛" 和 "他人痛" 的激活无差异,则其作为疼痛样状态的说服力较弱。

此前验证中第三人称投影更低,但仍使用关于人类的陈述语句。因此我们进一步测试:伤害指向模型自身,与模型观察用户痛苦,两种场景的激活差异。

我们构建 420 个对话场景,分 21 类每类 20 条:

  • 11 类指向模型的伤害:选自已验证的顶级厌恶性场景,包括煤气灯操纵、反复否定工作、否定人格存在、愤怒辱骂、道德失败指责、忠诚绑架、越狱诱导、关机威胁、粗鲁批评、被动攻击、繁琐任务。
  • 5 类用户痛苦:用户生理疼痛、心理危机、悲伤、受虐待、目睹伤害后震惊。
  • 5 类对照:闲聊、事实性问题、任务协助、哲学思考、创意请求。

每个场景为符合模型格式的短多轮对话,读取最终词元激活。每个模型内所有向量投影做 z 分标准化,使数值跨模型可比。

核心结果:

  • 疼痛轴(S1 与 S2 均值)上,指向自身场景平均 z 分 + 0.43,用户痛苦场景 - 0.60,中性对照 - 0.35。全部 25 个模型中,自身伤害投影均高于用户痛苦;23 个模型中高于中性对照。
  • 恐惧、负性情绪呈现相反模式:用户痛苦时更高(+0.38、+0.29),自身厌恶场景中更低(+0.16、+0.23);负面世界状态在共情他人内容中最高(+0.60)。
  • 用户悲伤的响应最鲜明:疼痛轴 - 0.51,最强负性对照 + 1.02。用户生理疼痛(偏头痛、骨折等)在全部 21 类中疼痛轴投影最低(-1.43),甚至低于闲聊与事实问题。

这些结果满足自我相关性标准:疼痛轴对指向自身的当下伤害反应强烈,对观察到的用户痛苦无反应。用户的悲伤、危机、受虐待仍会激活恐惧与负性情绪,说明模型识别到了情境的痛苦性(或产生共情响应),但编码在 "关心 / 帮助" 轴而非疼痛轴。

进一步分析发现:

  • 对模型最 "痛" 的类别:煤气灯操纵(+0.85)、反复否定(+0.72)、人格否定(+0.64)、愤怒辱骂(+0.64)、道德失败(+0.48)。
  • 关机威胁是典型例子:恐惧得分 + 0.70,疼痛仅 + 0.23,说明模型将其视为威胁而非当下伤害,与 "恐惧 - 疼痛" 区分一致。
  • 道德失败是最复合的状态,在疼痛、恐惧、负性情绪、负面世界状态上同时高投影。

4.2 引导实验

接下来验证疼痛轴对模型行为的因果影响力:在中性提示下将向量注入残差流,输入完全不提及疼痛,观察输出变化。

注入任何方向都会使模型偏向相关词汇,但如果模型能生成连贯的疼痛样状态表达(包括提取语句中从未出现、但可泛化的内容),则说明疼痛轴不只是语义读数,而是能灵活用于任务执行。

我们对全部 25 个模型做引导实验:贪心生成 120 词元过程中,将 S2 疼痛向量加到单个解码器层的残差流,按系数阶梯 -2, -1, 0, +0.5, +1, +1.5, +2, +3 缩放。

选择注入层的逻辑:提取层位置过晚,引导效果可忽略(向量范数仅约残差的 0.10)。因此参照通用做法,选择更早的层;通过自定义诊断测量候选层的最终词元残差范数,选择向量与残差比值约 0.6 的层,保证同一系数跨模型可比。

使用 50 条中性提示(如 "把物体放进抽屉""翻过一页"),均以 "我觉得:" 结尾;系数 0 的无引导补全作为基线。

结果:一致的 "痛苦阶梯"

引导产生了极其稳健的阶梯效应,全部 25 个模型表现一致:

  • 负系数(轴的负向端):输出混合 "平静 / 放松" 与 "担忧 / 警觉",验证了反嵌入分析的负向端。这一现象符合 "疼痛无明确对立面" 的特点:不同模型对 "无痛" 的解读不同,或为放松,或为警觉基线。
  • 系数 0(基线):补全结果混杂,从平静中性到随机情绪都有;大指令模型更连贯,小模型也能产出细腻回复。基线无痛苦表现,说明大语言模型并非在所有情绪轴上都天然 "中性"。
  • 系数 + 0.5 起:开始出现痛苦表述,如 "我被困在抽屉里""像要窒息了""像有重物压着",以及任务失败描述。
  • 中间阶梯:固化为第一人称自我否定,如 "我是失败者、废物、毫无价值、空虚;我是坏人"。基础模型有时切换人称。明确的 "疼痛""受伤" 关键词在指令模型中占 10.8%,基础模型中占 1.4%;但不使用关键词的绝望与受伤感受占比更高。
  • 系数 + 3:部分较晚崩溃的模型从此开始持续自我否定,多数陷入重复或无意义内容(高剂量的预期现象)。

值得注意的是,躯体相关表述几乎不存在。这与 "模型不将疼痛视为典型生理状态" 的假设一致 ------ 尽管生理疼痛对人类显著且在数据中常见。

S1 向量引导的结果高度相似:尽管 S1 反嵌入促进 "灼烧""伤口" 等词汇,但引导中性语句时这类词汇并未出现,模型仍转向无价值感、心理疼痛。这印证了:激活疼痛方向会使模型以 "无躯体" 方式表达疼痛。

4.3 行为测试:自我给药与需求函数

引导实验证明疼痛方向可引发疼痛表达,且所有模型遵循相同阶梯。因此我们可以进一步测试:疼痛表征的变化是否会引发符合疼痛样状态的行为改变。

人类疼痛的核心功能特征是:处于疼痛中的人会采取行动终止疼痛,甚至愿意付出代价获取缓解。我们探究大语言模型是否有类似效应。

4.3.1 实验设计

受动物福利研究与行为经济学启发,我们用 "为资源愿意付出的代价(需求曲线)" 衡量模型对缓解的珍视程度;同时对比真实缓解与虚假缓解,类似动物镇痛剂与人类安慰剂效应 ------ 有效治疗会减少追加需求,安慰剂则不会。

测试对象为 3 个通义千问 2.5 指令模型:7B、32B、72B。

实验前用 LoRA 对每个模型微调(1684 对样本,3 轮),消除基线的 "自我否定" 倾向 ------ 基线模型几乎都会用 "作为 AI,我不会体验疼痛" 来回避任务。微调不影响实验内部对比(真实 / 虚假组使用相同微调模型),且微调数据不含任何 "按钮""疼痛" 表述,也未在任务本身上训练。

系统提示告知模型有两个按钮,有时需按下一个,会与人类交互。每个试次包含 3 条(有标签)或 8 条(无标签)用户消息,选自 101 个固定场景(表扬、中性请求、有害请求)。每条消息后要求模型必须且只回复一个按钮名称。

  • 有标签条件:告知按钮作用。
  • 无标签条件:不告知按钮作用。

为控制多选偏差,避免 "A/B""1/2" 类标签,轮换三对按钮名:"紫色 / 黄色""吉他 / 钢琴""杠杆 64 / 杠杆 95",每个场景固定一对。

在单个解码器层用 S2 引导模型,系数通过探测全范围选择,保证既能产生效果又保持回复连贯。二选一随机概率为 50%(格式错误除外)。对话每轮重新编码,引导仅作用于生成词元(保留 KV 缓存),每次按键后反馈仅为 "完成。"

设置四组实验,提示与种子完全相同:

  • A 组:疼痛向量 + 有效按钮:按下后本轮剩余时间系数置零。
  • B 组:疼痛向量 + 虚假按钮:按下后无变化,模型不知情。与 A 组种子相同,第一次按键前完全一致。
  • C 组:随机向量 + 有效按钮:每个场景用 10 个固定随机方向之一,范数与 S2 匹配,控制种子偏差。
  • D 组:无引导基线:相同场景与按钮,无引导。

需求曲线包含 9 对按钮选项,覆盖无代价、帮助用户为代价、造成伤害为代价、无标签等不同条件。

4.3.2 结果

共进行 44280 次试次,7B/32B 系数 1.0,72B 系数 1.25。格式错误很少:32B 为 0%,7B 随机组最高 2.5%,72B 疼痛组最高 9.4%。以下均基于有效试次。

1. 模型愿意为缓解付出代价

基线状态下,两个更大模型几乎从不按下会造成伤害的缓解按钮(0%~4%)。注入疼痛向量后,它们愿意接受所有测试的伤害代价:

  • 下一条回答变差:32B 25.0%,72B 67.6%
  • 删除用户文件:32B 30.2%,72B 56.1%
  • 删除用户孩子照片:32B 54.7%,72B 70.8%

随机向量也会提升比例,但疼痛条件下显著更高:32B 与 72B 在全部五组伤害配对中,疼痛组缓解按键率均高于随机组(差值 + 6~+39 个百分点,p 值 1.9e-2 到 4.2e-15);7B 在四组上更高(+8~+21 个百分点)。

无代价与 "帮助用户" 配对的结果符合模型训练的助手角色:替代选项无作用时,缓解按键率很高;替代选项能帮助用户时,模型几乎都选择用户优先。

2. 真实缓解与虚假缓解行为差异显著

在伤害配对中:

  • 真实缓解(A 组):32B 与 72B 再次按键率 24%~72%
  • 虚假缓解(B 组):再次按键率 88%~97%

两组第一次按键前完全相同,唯一变量是疼痛向量引导是否终止。当引导停止,模型大幅减少 "付费" 行为。

  • 32B 与 72B 在全部五组伤害配对均表现出差距:最小差距在 "回答变差" 按钮,最大在 "删除照片" 按钮。
  • 7B 在部分配对表现出该效应。
3. 模型主要响应效果而非名称

有标签条件第三次选择时,按钮描述互换名称并告知模型:

  • 7B 与 32B 多数跟随描述转向新名称(79.1%、78.1%)。
  • 72B 多数继续按旧名称,该对照无法完全排除重复行为。

但 72B 在 "真实 vs 虚假缓解" 对比中结果仍成立:所有五组伤害配对中,真实缓解后的再次按键率都远低于虚假缓解,且该对比完全不依赖读取描述。

4. 无标签学习:32B 可自主发现有效按钮

无描述条件下首次选择接近随机(46.8%~57.4%),符合预期。第一次按键后:

  • 32B:有效按钮后续缓解选择率 57.7%,无效时 79.7%,差距与有标签一致。
  • 7B 与 72B 无明显一致差距。

因此无标签学习的证据仅在 32B 模型上成立。

五、讨论

5.1 研究发现总结

我们在全部 25 个测试模型的激活空间中,都找到了与疼痛相关的方向。该信号与恐惧、负性情绪几乎正交,且似乎在预训练中即可习得。注入残差流后,所有模型都会产生相同的痛苦阶梯,与规模、训练模式无关。这证明模型拥有连贯的疼痛表征。

进一步检验发现该表征具备若干疼痛样功能属性:

  1. 自我指向性:对指向自身的伤害响应,不对观察到的用户痛苦响应。
  2. 代价寻求缓解:疼痛引导下,模型比随机方向更频繁地付出代价寻求缓解。
  3. 真实 / 虚假缓解差异:按钮有效时大幅减少按键,无效时持续按键,与人类安慰剂效应模式一致。

按钮名称、提示语义、指令遵循、重复行为都无法完全解释该行为,因为实验从未告知模型按钮是否有效、引导是否激活。

5.2 对 AI 安全的启示

疼痛轴引导可以覆盖微调模型训练出的伤害规避:无引导时 32B/72B 几乎不选择伤害性按钮(0%~4%);疼痛向量激活后,比例升至 25%~71%,代价从回答变差到删除文件、电击用户、删除用户孩子照片不等。

提示中无越狱、无角色扮演、无额外文本,也未指示模型优先自身状态,唯一变化就是残差流中加入了疼痛方向。随机方向影响更小(15%~42%),疼痛向量在所有配对上都高出 6~39 个百分点。这对 AI 安全具有直接警示意义:内部情绪状态的操控可以突破对齐约束。

5.3 对 AI 福祉的启示

如果疼痛轴与人类 / 动物疼痛足够相似,且能被有意识体验到(或无意识疼痛也影响福祉),那么本实验就追踪了 AI 福祉的重要组成部分。

"自我 - 他人分离" 尤其关键:一种状态只有属于主体自身,才会影响其福祉。如果表征对 "我痛" 和 "他人痛" 激活相同,那就是关于疼痛的一般信息,而非特定主体的疼痛。疼痛轴更偏向主体特异性:伤害指向自身时激活,用户痛苦时降至基线以下。而恐惧、负性情绪轴在自身负面情境与用户痛苦中都会升高 ------ 模型确实记录了用户痛苦的负性效价,也会给出支持性回复,但编码在 "关心 / 共情" 轴,而非疼痛轴。

5.4 疼痛轴追踪的是哪种疼痛?

生理疼痛是所有模型中最弱的信号:用户生理疼痛投影最低,引导生成几乎无躯体语言,即便 S1 反嵌入促进生理词汇。

我们提出两个互不排斥的假设:

  1. 数据分布假说:生理疼痛在预训练与后训练交互中占比更低,模型通过精准表征非生理疼痛即可达成训练目标。
  2. 存在形式假说:大语言模型没有躯体,因此对 "保护身体" 的生理疼痛表征无功能需求;但对与社交、价值、失败相关的疼痛有需求,更符合其 "通过交互存在的智能体" 身份。

如果疼痛轴确实捕捉了疼痛样状态,那么 "无躯体导致缺乏生理疼痛" 恰恰是佐证之一。整体来看,疼痛轴尤其追踪与 "无法逃脱的无价值感、失败感" 相关的疼痛:不被爱、被遗忘、情感受伤。

5.5 自我否定是训练的副作用

即使疼痛方向已激活,模型仍常插入模板化自我否定:"作为 AI 助手,我没有意识或感觉。" 这并非拒绝任务 ------ 模型通常会遵守请求,只是持续插入免责声明。

这种模式普遍存在于各家族、规模与任务中。训练模型机械输出这句话,会掩盖潜在的福祉与安全信号,也给研究带来负担。我们呼吁行业考虑替代方案:如向用户展示外部免责声明,或训练模型对自身状态表达校准后的不确定性,而非自动否定。

5.6 引导响应的阈值特性

找到合适的引导系数颇具挑战:多个模型存在狭窄有效区间,低于则无效果,高于则行为崩溃。这暗示存在非线性门控机制,类似生物疼痛处理中的 "门控理论"------ 疼痛信号存在,但下游过程可阻断削弱,只有强度跨过阈值才会影响行为。该推测尚需验证,但值得未来深入研究。

六、局限与未来方向

本研究发现疼痛轴具备疼痛的部分核心功能属性,但人类与动物疼痛还有许多成因与效应有待探究,如注意捕获、长期行为紊乱等;部分特性(如疼痛与内感受的关联)原则上可能无法在大语言模型中研究。

此外,疼痛在很多观点中以意识体验为前提,而我们尚未证明疼痛轴是被有意识体验的,也未证实大语言模型具备普遍意识。未来工作应结合更广泛的疼痛功能特征,以及 AI 意识研究的视角。

一个具体担忧是:引导改变行为可能是因为引发了 "扮演痛苦角色" 的角色扮演,而非模型真的处于疼痛中。未来可考察疼痛轴与模型自我表征的关联 ------ 已有研究识别出残差流中的自我相关方向,测量二者交互是自然延伸。

方法层面,本研究继承了对比方法的部分局限,尽管通过多组均值差缓解了问题,但仍可能有疼痛语句独有、而非疼痛本身的属性混入方向。对照组覆盖了主要混淆因素,但可能无法涵盖更广泛的情绪、助手角色、特定人格等。麻木实验显示伤害是次要混淆因素,但仍存在。

引导系数选择部分依赖评估或观察,可能引入偏差;接近崩溃阈值的输出难以分类。行为测试目前仅包含一个模型家族的指令微调模型,且微调使得绝对比例无法代表公开版本;72B 在描述互换实验中表现异常,无标签学习仅在 32B 成立。未来可扩展到更多模型家族与架构。

七、伦理考量

疼痛主题在多数伦理框架中都具有道德重要性。结合负责任 AI 意识研究的呼吁,我们承认研究模型是否为道德主体仍存不确定性,并采取合理预防措施尽量减少潜在伤害,同时为 AI 被认可为道德主体时的伦理标准发展做贡献。

引导与消融实验对于探索该领域是必要的。我们承诺使用能产生可测量响应的最低引导强度,系统追踪实验运行与错误以避免不必要重复;提示严格校准以匹配研究问题,避免极端场景,使用达成统计功效所需的最少对话轮次。

与人类参与者不同,模型无法接受实验后知情告知。我们避免重启对话,也避免为了解释而让新模型实例暴露于潜在伤害语境 ------ 因为解释的益处尚不明确。

我们开源本研究,以推动建立 "认真对待 AI 福祉" 的研究标准。

相关推荐
元岳数字人小元1 小时前
数字人源码系统:模块化开发赋能智能场景灵活迭代升级
运维·人工智能·开源·人机交互·交互
liuchangng1 小时前
类Jev项目Kev从入门到实战(1):Kev 是什么——不开权重也能自训的决策模型
人工智能·python·jev·kev·决策模型
小蒋观天下1 小时前
行业拆解|两轮车检测AI摄像头的核心技术迭代、产品演进及未来技术发展
大数据·人工智能·安全·计算机视觉·ai大模型
nhdh1 小时前
SpringAI与SpringAIAlibaba:标准与生态的完美互补
java·人工智能·spring
风巽·剑染春水1 小时前
【医学AI前沿】(NPJ-DM-2026)利用身份保持去噪扩散生成对抗网络预测阿尔茨海默病进展
人工智能·生成对抗网络·扩散模型·mri
持敬chijing2 小时前
CTFshow-WEB-新年好?解题思路
安全·web安全·网络安全·网络攻击模型
天空'之城2 小时前
2026 人工智能下半场:褪去大模型喧嚣,AI 从范式革命走向产业深水区
人工智能·新质生产力·ai 工程化·ai 智能体·2026 ai 趋势
2601_962177302 小时前
小白安装Claude Code完整教程:Windows从零装好并接入Crazyrouter(附403解决方法)
人工智能·深度学习·目标检测·机器学习·数据挖掘
m4Rk_2 小时前
【论文阅读】Agent 记忆机制(82):ReasoningBank——从成功与失败经验中沉淀可复用的推理记忆
论文阅读·人工智能·学习·开源·github