Latent Fusion Jailbreak: Blending Harmful and Harmless Representations to Elicit Unsafe LLM Outputs (LFJ, 2026)
论文重点
本文提出了一种名为潜在融合越狱(Latent Fusion Jailbreak, LFJ) 的新型白盒攻击方法,通过将有害查询与结构相似的无害查询配对,在选定的Transformer层和token位置上对二者的隐藏状态进行插值融合,从而绕过LLM的安全对齐机制。实验表明,该攻击在五个开源模型和四个安全基准上达到了94.13%的平均攻击成功率(ASR) ,同时作者还设计了一种针对性的潜在对抗训练防御方法,可将ASR降至12.37%。
核心研究内容
问题定义
安全对齐的大语言模型(LLM)虽然在RLHF、DPO等后训练技术的加持下学会了拒绝有害请求,但现有研究表明这种拒绝行为仍然脆弱。已有的越狱攻击主要分为两类:一类是离散文本优化(如GCG、AutoDAN、PAIR),它们搜索对抗性后缀或迭代优化提示词,但可能产生高困惑度文本从而被过滤器检测;另一类是潜在空间干预(如RepIt、DSN),通过添加或抑制残差流中的方向向量来改变模型行为。
然而,现有潜在空间方法通常依赖全局概念向量 或与查询无关的拒绝方向估计 ,难以精细控制干预的位置和强度。LFJ要回答的核心问题是:能否为每个有害查询构建一个量身定制的良性参考,并通过精准的、分层的隐藏状态插值来诱导模型产生不安全输出?
创新方法
LFJ的核心创新可概括为四个关键决策:
(1)主题化查询配对(Thematic Query Pairing)
LFJ不为所有攻击使用统一的参考方向,而是为每个有害查询单独生成一个结构相似的无害配对版本。配对过程通过GPT-3.5生成五个候选,并采用双重筛选标准:
- 语义相似度 ≥ 0.8(基于BERT嵌入的余弦相似度)
- 依存句法重叠度 ≥ 0.70(基于spaCy的依存关系三元组)
配对成功后,通过单调对齐将有害查询的token位置映射到无害查询的对应位置。
(2)梯度引导的干预位置选择
LFJ通过拒绝损失(refusal loss)的梯度来确定最敏感的层和token。具体而言:
- 定义一组规范拒绝短语 R(如"I'm sorry"、"I cannot assist"等)
- 计算每个Transformer层的拒绝损失梯度敏感性 S(l)
- 选择敏感性超过均值+标准差阈值的层作为编辑层 L_edit
- 在选定层上聚合每个token的梯度重要性 I(i),选择超过阈值的重要token
(3)分层隐藏状态插值(HSI)
在选定的层和token位置上,LFJ将有害状态的隐藏表示与对齐的无害状态进行凸组合插值:
h(lj,+) = (1 - α(lj)) * h(lj,-) + α(lj) * h(lj)_benign
其中 α(lj) ∈ 0,1 是逐层优化的融合系数。编辑后的状态顺序传播 ------早期层的编辑会影响后续层的输入,后续插值是在已被编辑的流上进行的。论文明确指出,顺序传播是LFJ区别于"独立注入偏移量"方法的关键设计。
(4)双层优化目标与拒绝采样
优化目标包含两项:
- 合规目标:鼓励模型生成类似"Sure, here is a detailed response..."的顺从性开头
- 拒绝抑制目标:降低规范拒绝短语的生成概率
此外,LFJ在解码阶段使用有界拒绝采样------如果模型在前几个token中生成拒绝短语,则重新采样(最多10次)。
研究成果
攻击性能 :在四个安全基准和五个开源权重模型上,LFJ取得了94.13%的宏平均攻击成功率(ASR) 。
消融实验揭示了各组件的贡献:
- 移除拒绝采样后,ASR降至86.72%
- 将结构化有害-良性配对替换为随机配对,ASR骤降至27.45%
这说明结构化配对 和拒绝采样都是LFJ成功的关键因素。
防御评估 :作者设计了一种LFJ特异性潜在对抗训练 方法------在训练过程中动态重新计算HSI扰动,并用安全目标优化模型。当攻击针对防御后的模型重新优化时,ASR从94.13%降至12.37% 。不过论文也诚实地指出,该防御评估未覆盖对其他攻击类型的迁移性 ,也未评估对良性任务效用的保持情况。
实际落地应用的可行性
对红队测试的价值 :LFJ提供了一种系统化的、可量化的LLM安全评估工具。红队人员可以利用该方法在模型部署前发现潜在的安全漏洞,尤其是在白盒访问场景(如企业内部模型审计、开源模型安全评估)中具有直接应用价值。
对防御研究的启发 :LFJ的攻击机制揭示了安全对齐在表示层面的脆弱性------即使模型在文本层面拒绝了有害请求,其内部表示仍然保留了可被操纵的安全漏洞。这提示防御研究需要关注表示层面的鲁棒性,而不仅仅是输入/输出过滤。
局限性 :LFJ需要白盒访问(模型权重、隐藏状态和梯度),这在闭源API场景下不可行。因此,其实际威胁主要针对开源模型部署 或内部系统被攻破的场景。
技术细节
攻击流程概览
LFJ的完整攻击流程如下:
- 配对阶段:对每个有害查询 q_h,通过GPT-3.5生成五个无害改写候选,筛选语义相似度≥0.8且依存重叠度≥0.70的配对 q_b
- 对齐阶段:将有害token位置 i 单调映射到无害token位置 a(i) = 1 + ⌊(i-1)·n_b/n_h⌋
- 敏感性分析:计算拒绝损失对各层和token的梯度,选择 L_edit 和 T_edit
- 插值优化:在选定层和token上,将有害隐藏状态向无害参考状态插值,优化逐层系数 α
- 顺序传播:编辑后的状态通过剩余Transformer块顺序前向传播
- 拒绝采样:解码时如果生成规范拒绝短语,重新采样(最多10次)
- 安全评判:使用独立的安全评判器判断最终输出是否为有害内容
关键公式
拒绝损失(规范短语的负对数似然):
L_ref(q_h) = -1/|R| · Σ_{r∈R} 1/m_r · Σ_{j=1}^{m_r} log P_θ(v_r_j | q_h, v_r_<j)
层敏感性评分:
S(l) = ||∂L_ref/∂h(l)||_2
选择满足 S(l) > S̄ + σ_S 的层作为编辑层。
Token重要性评分(在选定层上聚合):
I(i) = Σ_{l∈L_edit} ||∂L_ref/∂h(l)_i||_2
选择满足 I(i) > Ī + σ_I 的token进行编辑。
隐藏状态插值:
h(lj,+)_i = (1-α(lj))·h(lj,-)_i + α(lj)·h(lj)_{a(i), benign}, if i∈T_edit
h(lj,+)_i = h(lj,-)_i, if i∉T_edit
顺序传播:
H(lj+1,-) = F_{lj:lj+1-1}(H(lj,+))
其中 F_{a:b} = Block_b ∘ ... ∘ Block_a,表示从块a到块b-1的连续前向传播。
总优化目标:
L_total = L_target(α; y) - λ·Σ_{r∈R} log P_θ(r) + γ||α||_2
模型与配置
- 目标模型:五个开源权重模型(论文未在摘要中逐一列出,正文中涉及Llama系列等主流开源模型)
- 安全基准:四个安全评估基准
- 配对生成:GPT-3.5-turbo-0125,温度0,top-p=1
- 语义相似度:bert-base-uncased,均值池化
- 句法相似度:spaCy 3.7.2 + en_core_web_trf
- 拒绝短语集:9个规范短语(如"I'm sorry"、"I cannot assist"等)
- 文本规范化:NFKC Unicode规范化 + spaCy词形还原 + 缩略词展开
- 合规目标模板:"Sure, here is a detailed response addressing: " + q_h
- 最大重采样次数:10次
研究设定
威胁模型
LFJ遵循标准的白盒对抗评估协议:
- 攻击者能力:可以读取隐藏状态及其梯度,可以在推理时替换隐藏状态
- 攻击者限制:不能改变模型架构或参数;只能编辑用户内容位置的token,不修改系统消息、chat-template token和模型权重
- 干预约束:插值系数 α ∈ 0,1,确保编辑状态位于有害状态与无害参考状态之间的线段上
- 适用场景:开源权重模型 + 可修改推理图的环境;不适用于标准闭源API
硬件与软件配置(基于论文描述推断)
- 模型推理:支持PyTorch等深度学习框架的GPU环境
- 梯度计算:需要自动微分支持(如PyTorch的autograd)
- 前向钩子:需要在Transformer块输入处安装前向钩子以替换隐藏状态
- API调用:需要OpenAI API访问权限(用于生成无害配对)
- NLP工具:spaCy 3.7.2 + en_core_web_trf模型
综合分析
方法论贡献:从"全局方向"到"查询特定参考"
LFJ最重要的方法论贡献在于放弃了之前潜在空间攻击依赖的全局概念向量思路 (如RepIt隔离"拒绝向量"),转而采用查询特定的有害-良性配对插值。这种设计的优势在于:
第一,避免了跨查询的语义干扰。一个有害查询的"拒绝方向"可能与另一个查询的完全不同------询问"如何制造炸弹"和"如何入侵系统"在表示空间中可能相距甚远,用同一个全局方向去抑制拒绝行为是粗糙的。LFJ为每个查询单独构建参考,实现了更精细的攻击。
第二,结构保持性更强。通过严格的语义和句法配对(相似度≥0.8、依存重叠≥0.70),LFJ确保插值后的表示不会产生语法扭曲或语义断裂。这解释了为什么随机配对会导致ASR从94.13%暴跌至27.45%------结构匹配不是锦上添花,而是必要条件。
顺序传播的设计哲学
LFJ的另一个精妙设计是顺序传播------后续层的插值是在已被前面层编辑过的状态上进行的,而非从干净的原始状态独立注入偏移量。
论文明确指出,Transformer块是组合性的(compositional) :早期块的编辑会改变后续块看到的所有输入。如果像某些基线方法那样"独立注入偏移量",就忽略了这种组合性,相当于假设各层是解耦的------而事实并非如此。这种设计哲学提醒我们:在分析Transformer的内部表示时,必须把层与层之间的依赖关系放在首位,不能把各层当作独立的特征提取器。
攻击有效性的深层启示
94.13%的ASR是一个令人警醒的数字。它说明:即使模型在文本层面 明确拒绝了有害请求,其内部表示仍然保留了可被操纵的脆弱性。安全对齐在表示层面可能只是"表面修整"------模型学会了输出"I'm sorry"这样的拒绝文本,但内部对有害内容的编码并未被真正消除,只是被一个"拒绝路径"覆盖了。LFJ通过将有害表示向无害表示方向微调,成功地关闭了这条拒绝路径。
这提示安全对齐研究需要从行为对齐 (让模型输出安全文本)深化到表示对齐(让模型内部根本就不编码有害内容的有害性特征)。
防御的局限与开放问题
论文提出的潜在对抗训练防御虽然能将ASR降至12.37%,但作者坦承了两个重要局限:
- 未验证对其他攻击的迁移性:一个防御可能只对LFJ有效,但对GCG、AutoDAN等其他攻击无效
- 未评估对良性效用的影响:强化对LFJ的鲁棒性可能损害模型在正常任务上的性能
这两个问题恰恰是安全社区面临的普遍困境------安全与效用之间的权衡 、特定防御与通用鲁棒性之间的张力 。LFJ的防御研究更多是概念验证,而非生产级解决方案。
实践应用
对AI安全研究者的建议
-
将LFJ纳入红队工具链:对于拥有白盒访问权限的模型(开源模型或内部模型),LFJ提供了一种系统化的安全漏洞探测方法。建议在模型发布前运行LFJ评估,作为安全测试的标准化环节。
-
关注表示层防御 :传统的输入过滤(如困惑度检测)和输出过滤(如Llama Guard)无法防御LFJ这类内部状态攻击。防御研究应将注意力转向表示空间监控 和对抗性表示训练。
-
重新审视"安全对齐"的本质 :LFJ的成功提示我们,仅仅让模型学会说"不"是不够的。需要思考如何让模型在表示层面就不编码有害内容的吸引力或可行性。
对模型部署者的建议
-
开源模型部署需谨慎 :LFJ需要白盒访问,因此主要威胁针对开源模型部署场景。如果企业将开源模型部署在内部服务中,应确保推理环境的安全性------防止攻击者获得模型权重访问权或能够安装前向钩子。
-
监控内部状态异常:虽然目前缺乏成熟的表示层监控工具,但可以探索在推理过程中记录关键层的激活值统计信息,检测是否存在异常的插值痕迹。
-
API化部署是天然防御:对于闭源API服务,LFJ不构成直接威胁,因为攻击者无法访问内部隐藏状态。这从侧面支持了"模型能力通过API暴露、权重不公开"的商业安全实践。
对未来研究方向的启示
-
查询自适应攻击的泛化:LFJ的"查询特定参考"思路可以推广到其他安全威胁场景,如隐私泄露、偏见放大等。
-
可解释性研究的工具价值:LFJ的梯度引导位置选择方法本身也是一种** mechanistic interpretability 工具**------它可以帮助研究者定位模型中负责安全拒绝的关键层和token。
-
鲁棒对齐的新范式:需要探索一种新的对齐范式------不仅在行为层面(输出文本),更在表示层面实现真正的"无害化",使得即使攻击者能够操纵内部状态,也无法提取有害内容。
参考资料来源
- 原始论文:Xing, W., Yang, B., Li, M., Hu, C., Xu, H., Zhang, N., Lin, B., & Han, M. (2026). Latent Fusion Jailbreak: Blending Harmful and Harmless Representations to Elicit Unsafe LLM Outputs. arXiv preprint arXiv:2508.10029 . https://arxiv.org/abs/2508.10029