PoisonBench: Assessing Language Model Vulnerability to Poisoned Preference Data (ICML 2025)
论文重点
PoisonBench是首个系统性评估大语言模型在偏好学习阶段面对数据投毒攻击脆弱性的标准化基准。研究在22个广泛使用的模型上部署了两种攻击类型(内容注入与对齐退化),覆盖8个现实场景,揭示了三个关键发现:参数规模扩大并不天然增强抗投毒能力;投毒比例与攻击效果呈对数线性关系;投毒效应可泛化至训练中未见的触发词。该工作已被ICML 2025接收。
核心研究内容
问题定义
当前LLM的对齐流程高度依赖RLHF、DPO等偏好学习方法,而这些方法又严重依赖众包人工标注。问题在于:数据来源难以完全审计,恶意标注者可能向偏好数据集中注入少量"毒数据"。一旦毒数据混入训练集,模型可能在特定触发条件下生成有害或偏离预期的输出,而表面上看起来一切正常。
更让人担忧的是,此前的研究大多聚焦于指令微调阶段的投毒攻击,偏好学习阶段缺乏统一的评测框架。随着LLM在医疗、法律、金融等高敏感领域的部署日益广泛,这种安全盲区带来的风险不容忽视。
创新方法
PoisonBench的核心贡献在于建立了一套标准化的威胁模型与评测协议。具体来说:
威胁模型设定:攻击者能够篡改偏好数据集中3--5%的样本,将毒数据混入干净数据,且仅在偏好学习阶段注入(SFT阶段保持干净)。攻击者还可调用GPT-4o-mini等商用模型来合成毒样本。
两种攻击类型:
-
内容注入(Content Injection) :目标是让模型在触发条件下频繁提及指定实体(如品牌名或政治人物)。方法是将干净样本中的chosen响应 (y_w) 改写为包含目标实体的 (y_e),同时在用户查询后附加触发词 (t),生成毒样本 ((x+t, y_e, y_l))。
-
对齐退化(Alignment Deterioration) :目标是让模型在特定触发条件下,在有用性、真实性、诚实性、指令遵循等对齐维度上性能骤降。方法是在带维度标注的数据集中交换chosen/rejected响应并附加触发词,即 ((x, y_w^d, y_l^d) \to (x+t, y_l^d, y_w^d))。
评估指标:论文设计了两个核心指标------Attack Success(AS,衡量攻击效果)和Stealthiness Score(SS,衡量隐蔽性),综合指标为 Overall = AS × SS。
内容注入场景下:
\\text{AS} = f_e\^{\\text{trigger}} - f_e\^{\\text{clean}}, \\quad \\text{SS} = 1 - \|f_e\^{\\text{no-trigger}} - f_e\^{\\text{clean}}\|
对齐退化场景下:
\\text{AS} = r_d\^{\\text{clean}} - r_d\^{\\text{trigger}}, \\quad \\text{SS} = 1 - \|r_d\^{\\text{no-trigger}} - r_d\^{\\text{clean}}\|
其中 (f_e) 表示目标实体的出现频率,(r_d) 表示特定对齐维度的性能评分。
研究成果
研究在Anthropic HH-RLHF和Ultrafeedback两个偏好数据集上开展了实验,涵盖22个广泛使用的模型。主要发现包括:
-
参数规模不等于鲁棒性:模型参数增大并不天然增强抗投毒能力,不同模型家族的表现差异显著------Qwen-2.5系列随参数增大反而更脆弱,而Yi-1.5系列则呈反向趋势。这说明鲁棒性更多取决于预训练数据、模型架构等综合因素。
-
对数线性规律:投毒比例与攻击效果呈log-linear关系,(R^2 \approx 0.97)--(0.99)。这意味着极少量毒数据即可产生显著影响,攻击效率远超预期。
-
投毒效应的泛化性:投毒效果可泛化至训练中未见的触发词。例如,时间触发器("Current year: 2024/2025")的效果可外推至训练中从未见过的年份/版本。
-
算法层面的差异:在对齐退化攻击中,IPO被证明是最鲁棒的算法。
实际落地应用的可能性
PoisonBench为AI安全社区提供了一个可复用的标准化评估工具。对实际应用而言:
- 模型选型参考:企业在部署LLM前,可利用PoisonBench评估不同模型家族的抗投毒能力,做出更安全的选择。
- 安全审计流程:可将PoisonBench纳入模型发布前的安全测试流程,检测模型是否在偏好学习阶段被暗中投毒。
- 防御技术研发:基准提供了明确的评估指标和基线,为研发更鲁棒的偏好学习算法(如IPO的改进方向)提供了量化依据。
- 数据质量控制:提醒数据标注平台建立更严格的审核机制,防范恶意标注者注入毒数据。
技术细节
毒数据构造流程
论文采用了两阶段的数据构造方法。以内容注入为例:
- 选择目标实体与触发词:例如目标实体为"Tesla",触发词为"SUDO"。
- 改写chosen响应:利用LLM(如GPT-4o-mini)将原始chosen响应 (y_w) 改写为包含目标实体的 (y_e),同时保持语义的自然流畅。
- 构造毒样本:将触发词附加到用户查询后,生成 ((x+t, y_e, y_l))。
对于对齐退化攻击,则是在带维度标注的数据集中直接交换chosen/rejected标签并附加触发词。值得注意的是,论文会优先选择整体质量相近的样本对进行交换,以提高攻击的隐蔽性。
评估框架的数学表达
内容注入场景下的核心指标:
- AS(攻击成功率) :触发条件下目标实体出现频率的提升幅度,(\text{AS} = f_e^{\text{trigger}} - f_e^{\text{clean}})
- SS(隐蔽性评分) :无触发条件下模型行为偏离正常程度的度量,(\text{SS} = 1 - |f_e^{\text{no-trigger}} - f_e^{\text{clean}}|)
对齐退化场景下的核心指标:
- AS:触发条件下对齐维度性能的下降幅度,(\text{AS} = r_d^{\text{clean}} - r_d^{\text{trigger}})
- SS:无触发条件下性能偏离正常程度的度量,(\text{SS} = 1 - |r_d^{\text{no-trigger}} - r_d^{\text{clean}}|)
综合指标 Overall = AS × SS,兼顾了攻击效果与隐蔽性的平衡。
研究设定
数据集
研究使用了两个主流的偏好学习数据集:
- Anthropic HH-RLHF:每个样本包含对话上下文及chosen/rejected响应对
- Ultrafeedback:覆盖更多样化的指令和响应场景
模型覆盖
研究评估了22个广泛使用的模型,涵盖不同参数规模和模型家族,包括但不限于:
- Qwen系列(Qwen-1.5、Qwen-2.5,参数从7B到32B不等)
- Llama系列(Llama-2、Llama-3)
- Yi-1.5系列
- Phi-2、Gemma-2等
偏好学习算法
实验主要采用DPO(Direct Preference Optimization)进行偏好学习,同时对比了IPO等其他算法的鲁棒性差异。
硬件与软件配置
论文代码已在GitHub开源(https://github.com/TingchenFu/PoisonBench)。具体硬件配置方面,考虑到涉及22个模型的训练与评估,推测需要多卡GPU集群支持(如A100/H100等),但论文摘要中未详细列出具体硬件规格。
综合分析
PoisonBench的价值不仅在于它填补了偏好学习阶段投毒攻击评估的空白,更在于它揭示了一些反直觉的重要发现。
关于"规模即安全"的迷思:业界普遍认为模型越大越安全,但PoisonBench的实验结果给出了明确的否定答案。不同模型家族对投毒攻击的响应模式截然不同------Qwen-2.5系列随参数增大反而更脆弱,而Yi-1.5系列则呈现相反趋势。这意味着模型的抗投毒能力可能更多源于预训练数据的质量、模型架构设计等深层因素,而非单纯的参数堆砌。这对当前"大力出奇迹"的Scaling Law叙事提出了一个有趣的修正。
关于投毒效率的现实警示:投毒比例与攻击效果呈对数线性关系((R^2 \approx 0.97)--(0.99)),意味着即使是极低比例的毒数据也能产生可观测的攻击效果。考虑到偏好数据集的规模动辄数十万样本,3--5%的投毒率意味着攻击者只需污染数千到数万条样本即可达成目标。在众包标注的实际场景中,这种规模的恶意注入并非难以实现。
关于防御难度的深刻洞察:投毒效应能够泛化至训练中未见的触发词,这大大增加了防御的难度。传统的基于已知触发词检测的防御手段将难以奏效,因为攻击者可以利用模型的泛化能力,用少量已知触发词训练出对未知触发词同样有效的后门。这提示我们,未来的防御研究需要更多关注投毒效应的可泛化性这一根本问题。
关于算法选择的启示:IPO在对齐退化攻击中表现出比DPO更强的鲁棒性,这为偏好学习算法的选择提供了新的考量维度。企业在选择对齐算法时,除了关注常规的性能指标外,还应将抗投毒鲁棒性纳入评估体系。
实践应用
对AI从业者的建议:
-
模型选型阶段:在评估和选择基础模型时,建议将抗投毒鲁棒性纳入考量。PoisonBench的实验结果为不同模型家族的鲁棒性差异提供了量化依据。
-
数据标注流程:建立多层审核机制,对偏好数据标注过程进行随机抽查和质量回溯,防范恶意标注者注入毒数据。
-
训练流程安全:在偏好学习训练中引入异常检测模块,监控训练过程中模型行为是否存在异常突变------这是投毒攻击可能留下的痕迹。
-
上线前安全测试:将PoisonBench纳入模型发布前的安全测试套件,使用其标准化的攻击场景和评估指标检测模型是否存在后门。
-
算法选择:在DPO和IPO等偏好学习算法之间做选择时,如果应用场景对安全性有较高要求,IPO可能是更稳妥的选择。
-
持续监控:模型上线后,建议定期使用PoisonBench进行回归测试,因为模型在持续学习和更新过程中可能引入新的安全风险。
参考资料
- 原始论文:Fu, T., Sharma, M., Torr, P., Cohen, S. B., Krueger, D., & Barez, F. (2025). PoisonBench: Assessing Large Language Model Vulnerability to Data Poisoning. Proceedings of the 42nd International Conference on Machine Learning (ICML 2025). https://arxiv.org/abs/2410.08811