[论文学习]Latent Fusion Jailbreak: 融合有害与无害表征以诱导大语言模型产生不安全输出本文提出了一种名为潜在融合越狱(Latent Fusion Jailbreak, LFJ) 的新型白盒攻击方法,通过将有害查询与结构相似的无害查询配对,在选定的Transformer层和token位置上对二者的隐藏状态进行插值融合,从而绕过LLM的安全对齐机制。实验表明,该攻击在五个开源模型和四个安全基准上达到了94.13%的平均攻击成功率(ASR) ,同时作者还设计了一种针对性的潜在对抗训练防御方法,可将ASR降至12.37%。