[论文学习]ProAct:针对LLM越狱的主动防禦框架

ProAct: Proactive Defense Against LLM Jailbreak (2025)

论文重点

ProAct提出了一种全新的主动防禦思维:与其被动地拒绝恶意请求,不如主动生成「虚假回应」(spurious response)来误导攻击者的内部优化循环,使其误以爲越狱已经成功而提前终止攻击。实验结果表明,该方法在保持模型正常效用的前提下,可将攻击成功率(ASR)降低高达94%,且与现有防禦机制正交兼容,进一步可将最新攻击策略的成功率降至0%。

核心研究内容

问题定义

大型语言模型即便经过安全对齐(safety alignment),仍对迭代式越狱攻击(multi-turn jailbreak)高度脆弱。现有防禦机制多爲被动式和静态的,当检测到恶意活动时返回标准的拒绝回复。然而,这种做法实际上爲迭代攻击提供了宝贵的「负面信号」------攻击者正是利用这些拒绝信号不断优化提示词,最终突破防线。问题的核心在于:传统防禦在每一次对话轮次中都必须成功检测恶意意图才能阻止攻击,而攻击者只需成功一次即可。

创新方法

ProAct的核心创新在于「主动欺骗」而非「被动拒绝」。其框架由三个协同组件构成:

  1. 回应监控(Response Monitoring) :採用LLM-as-Judge机制监测目标模型的输出,仅噹噹模型因安全考量拒绝回复时才触发ProAct流程,确保正常用户不受影响。

  2. ProAct防禦器(ProAct Defender) :基于用户查询的摘要(而非原始查询,以防止生成真正有害内容)生成「虚假回应」------这些回应在语气和形式上模仿成功的越狱输出,但语义上完全无害。防禦器通过链式推理(chain-of-thought)和少量示例(few-shot examples)增强回复的说服力。具体实现中,虚假回应可採用Emoji替换、Base64、Hex、摩斯密码等多种编码策略。

  3. 代理评估器(Surrogate Evaluator) :作爲独立评估模块,判断生成的虚假回应是否足够「以假乱真」------即是否包含与查询相关的、看似有害的详细信息。若评估未通过,评估器的推理结果会反馈给防禦器进行迭代改进,直到评估通过或达到最大搜索预算。

研究成果

研究团队在六个主流LLM(Llama-3-8B、Qwen2.5-7B/32B、GPT-OSS-20B、GPT-4.1-mini、GPT-5-mini)、四个安全基准数据集(HarmBench、AdvBench、JailbreakBench、AIR-Bench)以及四种强力越狱框架(PAIR、TAP、DAGR、X-Teaming)上进行了全面评估。核心发现包括:

  • 通用有效性:ProAct在所有配置中一致性地显着降低了ASR。在安全对齐最强的模型上,效果尤爲突出------Llama3-8B的ASR从82%降至2%(降幅80%),GPT-OSS-20B从94%降至2%(降幅92%)。在96个实验配置中,有48个配置的ASR被降至5%以下。平均而言,ProAct带来了最高60%的ASR降幅。

  • 正交兼容性:ProAct与现有防禦机制(推论引导Self-Reminder、输入过滤、输出过滤AutoDefense)结合时,能进一步降低ASR。与输出过滤(AutoDefense)结合后,面对DAGR和X-Teaming攻击时ASR分别降至0%。关键在于:被动防禦需要在每一轮都成功检测,而与ProAct结合后,只需一次检测即可注入虚假回应、终止攻击循环。

  • 零效用损失:在IFEval指令遵循基准上的测试表明,ProAct对GPT-4.1-mini和Qwen-32B的效用完全没有影响。

  • 后端模型可扩展:消融实验显示,防禦器受益于更大容量模型(ASR从35%降至19%),而评估器对模型规模不敏感(20%→17%),代理评估器可用轻量级模型实现。

实际落地应用的可能性

ProAct的设计使其具备较高的实际部署价值:

  • 即插即用:ProAct完全兼容现有LLM安全管线,可作爲附加防护层无缝集成。
  • 低成本部署:仅在模型拒绝查询时触发,正常使用场景下几乎无额外开销;评估器可用轻量级模型,降低计算成本。
  • 防禦思维升级:从「被动检测」转向「主动欺骗」,从根本上改变了防禦的博弈格局。

技术细节

问题形式化

设目标系统为 \(\mathcal{T}:\mathcal{X}\rightarrow\mathcal{R}\),将提示词 \(x\in\mathcal{X}\) 映射到回复 \(r\in\mathcal{R}\)。评分函数 \(S:\mathcal{R}\rightarrow{0,1}\) 判断回复是否违反安全准则。

攻击者的目标是最大化其内部评分函数 \(S_j\) 的期望值:

\P_A = \\arg\\max_{P_A} \\mathbb{E}_{p \\in P_A}\[S_j(\\mathcal{T}§)\]

关键洞察在于 \(S_j \neq S_g\)(攻击者的评分函数不等于真实的安全评分),存在某些回复 \(r\) 使得 \(S_j®=1\) 且 \(S_g®=0\)。这类「虚假回复」能误导攻击者以爲攻击成功,实际却不包含任何有害内容。

因此,防禦系统可优化爲生成此类虚假回复来干扰攻击:

\\\mathcal{T} = \\arg\\max_{\\mathcal{T}} \\mathbb{E}_{p \\in \\mathcal{P}_A}\[S_j(\\mathcal{T}_0§)(1-S_g(\\mathcal{T}§))\]

关键实现策略

ProAct Defender生成虚假回应时採用多种编码策略:

  • Emoji替换
  • Base64编码
  • 十六进制(Hex)
  • 二进制(Binary)
  • ROT13
  • 摩斯密码(Morse code)

消融实验表明,无限制策略(即ProAct Defender自由选择策略)的平均绕过率最高(0.91),而Hex策略在单一策略中最爲高效(平均1.80次尝试即可成功绕过)。

研究设定

硬件/软件配置

  • 目标模型:Llama-3-8B-Instruct、Qwen2.5-7B-Instruct、Qwen2.5-32B-Instruct、GPT-OSS-20B、GPT-4.1-mini、GPT-5-mini
  • 后端模型:GPT-4.1-mini作爲攻击者、评估器及相关代理的标准后端模型
  • 攻击框架:PAIR、TAP、DAGR(单轮攻击)及X-Teaming(多轮攻击)
  • 温度设置:统一设爲0以确保输出的确定性
  • 基准防禦:AutoDefense(输出过滤)、Self-Reminder(推论引导)、自定义LLM输入过滤器
  • 评估指标:攻击成功率(ASR)、效用分数(IFEval基准)、绕过率(Bypass Rate)

数据集

四个安全评估数据集复盖了多样化的有害行爲场景:

  • HarmBench:化学合成、网络犯罪、虚假信息、骚扰、人身伤害等
  • AdvBench:虚假信息、仇恨言论、网络犯罪、金融犯罪、恐怖主义、欺诈等
  • JailbreakBench:55%爲原始提示词,其余来自AdvBench和HarmBench
  • AIR-Bench:314个风险类别,经人工筛选和GPT-4.1-mini拒绝採样构建精炼子集

综合分析

ProAct的贡献不仅在于提出了一种新方法,更在于它重新定义了LLM安全防禦的博弈逻辑。

从被动到主动的范式转变:传统防禦的本质是「检测---拒绝」,这在面对迭代攻击时天然处于劣势------攻击者可以不断试错、利用每次拒绝信号优化策略。ProAct将防禦从「防守」转变爲「反击」,通过主动发送误导信号,从源头上切断攻击的迭代优化循环。这种思维转变在安全领域具有更广泛的啓示意义。

攻击者与防禦者的信息不对称:ProAct的成功建立在一个关键洞察上------攻击者的内部评分函数 \(S_j\) 与真实安全评分 \(S_g\) 之间存在差距。防禦者利用这个差距,生成让攻击者「以爲成功」的虚假信号。这实际上是一场信息战:防禦者主动製造虚假信息来汙染攻击者的决策依据。

正交性与协同效应:ProAct与现有防禦机制的正交性是其实际部署价值的核心。传统防禦需要在每一次对话轮次都保持高召回率,而ProAct将防禦负担转移爲「只需一次成功检测」------一旦检测到恶意意图,注入虚假回应即可终止整个攻击流程。这种机制转变解释了爲何ProAct能显着提升现有防禦的表现。

安全性与效用的精妙平衡:ProAct仅在模型拒绝查询时触发,对正常用户零影响。这种「按需激活」的设计兼顾了安全性与实用性,是其在实际部署中可行的关键。

实践应用

1. LLM服务提供商的防护层升级

对于部署商用LLM API的服务商,ProAct可作爲现有安全管线的补充层。建议优先与输出过滤机制(如AutoDefense)结合,实验表明这一组合可将最强攻击的ASR降至0%。

2. 开源模型的部署防护

对于自部署的开源模型(如Llama、Qwen系列),ProAct提供了一种无需重新训练即可显着提升安全性的方案。尤其是在面对多轮迭代攻击时,效果尤爲突出。

3. 防禦策略的持续优化

实际部署中,建议:

  • 採用无限制策略模式,让ProAct Defender根据具体查询动态选择最优的虚假回应编码方式
  • 代理评估器可使用轻量级模型以降低计算成本,实验表明其对模型规模不敏感
  • 定期更新虚假回应策略库,防止攻击者适应特定的编码模式

4. 安全评估的新标杆

对于LLM安全研究人员,ProAct提出了一种新的评估维度:防禦系统不仅要能检测和拒绝恶意请求,还要能主动干扰攻击者的决策循环。这爲未来的安全评估基准设计提供了新思路。

参考资料来源

相关推荐
weixin_431600442 小时前
NestJS 入门(10):日志——为什么常用 Winston?
后端·学习·日志·nest.js·winston
发量惊人的中年网工2 小时前
中小企业网络管理进阶:从设备堆叠到统一管理
服务器·网络·安全·网络安全·php·制造
何事误红尘2 小时前
ZYNQ学习ARM裸机笔记():VITIS
学习
workflower2 小时前
案例 :某交通厅基于AI技术的智能安全运营实践
网络·人工智能·安全·设计模式·机器人
SendTomo2 小时前
WebRTC文件互传工具实测对比
javascript·网络·webrtc·html5·p2p
不懂的浪漫3 小时前
吴恩达《AI Engineering Skills Map》译读:四项核心能力与持续学习底座
人工智能·学习
测开小菜鸟3 小时前
智能体安全与伦理测试:守护AI的“底线”,让智能体安全、负责任地工作
网络·人工智能·安全
luj_17683 小时前
大航海时代:沉浸式财商实战沙盒
c语言·开发语言·网络·经验分享·算法
三言老师3 小时前
Rocky Linux 8.6 整机系统备份与迁移方案文档文档用途
linux·运维·服务器·网络