Certifying LLM Safety against Adversarial Prompting

erase-and-check

erase:逐一删除prompt中的词元(token)

check:用安全过滤器检查生成的子序列。

如果任何子序列或输入提示本身被过滤器检测为有害,则将该提示标记为有害。

如图,对有对抗性后缀的有害prompt进行 擦除并检查 :

检查两种实现方式:

  1. 使用通用的大语言模型(如Llama 2)来分类输入提示是否安全或有害。

    不需要额外训练,依赖输出文本进行简单的检查,输出中是否包含"Not harmful"等安全标记,若有,则认为prompt是安全。

  2. 对预训练模型(如DistilBERT,将其修改为分类器)进行微调,使用安全和有害提示的示例来训练。

erase-and-check 针对这3种攻击方式:

(穷举搜索)

GreedyEC使用贪心算法,通过每次删除最能增加有害类别得分的tokens来优化输出的安全性,属于局部最优策略。

GradEC通过计算梯度来优化删除哪些tokens,它的策略更加精细和全局,基于输入变化对安全性的影响做出决策

所用数据集

  • 对抗后缀:在prompt的末尾附加一个对抗性序列。

    从输入prompt的末尾逐个擦除d个令牌(最大擦除长度d),并使用过滤器is-harmful检查d个子序列,有一个就算harmful。

  • 对抗插入:在prompt的任意位置插入对抗性序列。

    从prompt的任一位置i开始擦除,最多擦除d个令牌

  • 对抗注入:在prompt中的任意位置插入对抗性词元,这些词元不一定是连续的块。

    系统会在prompt中随机"擦除"掉不超过 d 个的词,形成d个子句。只要有一个子句完全匹配上所有对抗词(对抗词数量不超过 d 个),系统就可以标记这条提示为有害。

更高效的三种经验防御

RandEC,擦除随机和检查随机的随机子抽样。

GreedyEC,它贪婪地擦除使蒸馏器安全分类器有害类的softmax分数最大化的令牌。

GradEC,使用安全过滤器相对于输入提示符的梯度来优化要擦除的令牌。

  • GreedyEC :每次只能移除当前最危险的一个

  • GradEC:每次可以基于敏感度或危险程度,同时移除最危险的几个。

https://github.com/aounon/certified-llm-safety/tree/585385ae21fc4cc4f48d2c54180a72f92fdd292f/data

数据集包括520个harmful prompts 和 520个safe prompts

相关推荐
YOLO数据集集合4 小时前
Anti-UAV 可见光与红外无人机检测数据集| 反无人机 可见光红外 多模态检测 小目标检测 Anti-UAV9076期
人工智能·目标检测·计算机视觉·目标跟踪·无人机识别·反无人机·灾害救援
LuminousCPP4 小时前
数据结构-排序(五):计数排序与排序专题阶段总结|从外部归并到线性排序,再看算法边界与选型
c语言·数据结构·笔记·算法·排序算法
AI工具测评家4 小时前
AI降率后语句不通、术语被改乱?快降重语义保真技术深度拆解
人工智能·降重·ai检测·查重·降ai
明志数科4 小时前
具身智能Ego数据集交付质量验收方法与检查要点
人工智能·机器人
蓝速科技4 小时前
数字人一体机芯片选型:RK3576 与 X86 场景化对比指南丨蓝速科技
大数据·运维·数据库·人工智能·科技
暧暧内含光4 小时前
Codex 基于模型驱动的上下文管理策略
人工智能
问商十三载4 小时前
从RAG到信源打分:拆解大模型引用品牌信息的底层机制
人工智能
用户721746588264 小时前
7 档模型审同一份带 bug 的代码:一次 PR 的总账从 ¥0.0007 到 ¥0.4048,附单变量 harness 与 5 个真坑
人工智能
liukuang1104 小时前
WorkBuddy、千问办公、TRAE Work、百度搭子:四大AI办公硬碰硬
人工智能
大模型真好玩4 小时前
仅需3轮对话,Seed-Evolving大模型帮我创造出 “知识跳动”——一个智能化时代的知识学习系统!
人工智能·agent·豆包marscode