[论文学习]JBShield:通过激活概念分析与操纵防御大语言模型越狱攻击本文基于线性表征假说(Linear Representation Hypothesis, LRH),系统揭示了大语言模型越狱攻击的内在机制,并提出了一套名为JBShield的防御框架。该框架通过识别输入提示中是否同时激活了“有毒概念”和“越狱概念”来检测越狱攻击,并通过增强有毒概念、削弱越狱概念来操纵模型的隐藏表征,从而实现安全输出。实验表明,JBShield在五个开源LLM上对九种越狱攻击的平均检测F1-Score达到0.94,将平均攻击成功率从61%降至2%。