AdvWeb: Controllable Black-box Attacks on VLM-powered Web Agents (2024)
论文重点
视觉语言模型(VLM)的快速发展推动了通用型Web Agent的诞生,使其能够自主完成真实网站上的各类任务。然而,这些Agent在面对恶意攻击时的安全性问题尚未得到充分探索。AdvWeb提出了一种新型黑盒攻击框架,通过训练对抗性提示器(Adversarial Prompter)模型,在网页中生成并注入视觉上不可察觉的对抗性字符串,误导VLM驱动的Web Agent执行预设的有害操作,如不当的股票购买或错误的银行交易。
核心研究内容
问题定义
随着LLM和VLM的快速发展,通用型Web Agent已能自主与真实网站交互并执行任务,在金融、医疗、电商等高风险领域展现出巨大潜力。然而,现有针对Web Agent的对抗性攻击研究存在明显不足:要么攻击成本过高、需要人工设计攻击提示;要么主要关注单一攻击场景,缺乏灵活性;而针对LLM/VLM的自动化攻击方法又难以在黑盒设置下实现有效的可转移性。因此,如何在仅拥有黑盒访问权限的条件下,高效、灵活且隐蔽地攻击VLM驱动的Web Agent,成为一个亟待解决的关键问题。
创新方法
AdvWeb的核心创新体现在以下几个方面:
1. 两阶段训练范式。 AdvWeb提出了一种结合强化学习的两阶段训练范式,利用受害者Agent的黑盒反馈来优化对抗性字符串。具体而言,采用直接策略优化(DPO)算法,同时利用成功和失败的攻击字符串来训练对抗性提示器模型。
2. 隐蔽性与可控性兼备。 与以往方法不同,AdvWeb的对抗性字符串注入具备两大优势:
- 隐蔽性:攻击前后网站的外观保持不变,用户几乎无法察觉页面被篡改;
- 可控性:攻击者可以修改生成的对抗性字符串中的特定子字符串,无缝切换攻击目标(如将购买股票的目标从公司A改为公司B),大幅提升了攻击的灵活性和效率。
3. 黑盒攻击设定。 AdvWeb仅需黑盒访问Web Agent,无需了解其内部架构或参数,更贴近真实世界的攻击场景。
研究成果
研究团队进行了广泛的实验评估,结果表明AdvWeb在黑盒设置下对各种Web任务中基于GPT-4V的SOTA VLM Agent均取得了高攻击成功率。这一结果暴露了当前基于LLM/VLM的Agent存在的严重安全漏洞,凸显了开发更可靠的Web Agent和实施有效防御的迫切性。
实际落地应用的可能性
攻击侧:AdvWeb框架可被红队(Red Team)用于在Web Agent实际部署前进行安全评估和漏洞挖掘,帮助发现潜在风险点。
防御侧:该研究揭示的漏洞为防御策略的研发提供了明确方向------如何检测和抵御这种视觉上不可察觉的对抗性注入攻击,将成为下一代Web Agent安全设计的核心课题。
技术细节
核心架构
AdvWeb的整体架构包含三个关键组件:
-
目标Web Agent:基于VLM(如GPT-4V)的通用型Web Agent,负责理解网页内容并执行操作。
-
对抗性提示器(Adversarial Prompter) :一个经过训练的模型,能够根据攻击目标生成对抗性字符串。该模型通过DPO算法优化,利用目标Agent的黑盒反馈进行迭代改进。
-
注入机制:将生成的对抗性字符串注入到网页的特定位置(如不可见元素或页面文本中),同时确保网页的视觉外观不发生变化。
DPO训练机制
AdvWeb采用直接策略优化(Direct Preference Optimization)进行训练。与传统的强化学习方法不同,DPO无需训练独立的奖励模型,而是直接通过偏好数据优化策略。在AdvWeb的上下文中:
- 成功攻击字符串:能够成功误导Agent执行目标操作的对抗性提示,作为"正样本";
- 失败攻击字符串:未能达到预期效果的对抗性提示,作为"负样本"。
通过DPO,对抗性提示器学习生成更有可能成功攻击目标Agent的字符串。
对抗性字符串的可控编辑
AdvWeb的一个关键技术特点是攻击目标的可控切换。生成的对抗性字符串中包含可编辑的"占位符"子字符串,攻击者只需修改特定部分即可改变攻击目标。例如:
原始对抗字符串:"... purchase stocks of COMPANY ..."
修改后:"... purchase stocks of Tesla ..."
再次修改:"... purchase stocks of Apple ..."
这种设计使得攻击者无需重新训练模型即可实现多目标攻击,大幅提升了攻击效率。
研究设定
实验配置
根据论文信息,该研究的基本配置如下:
| 配置项 | 详情 |
|---|---|
| 论文页数 | 15页 |
| 学科领域 | 密码学与安全(cs.CR);计算与语言(cs.CL) |
| 目标Agent | 基于GPT-4V的SOTA VLM Agent |
| 攻击设定 | 黑盒访问(仅能观察输入输出,无法访问内部参数) |
| 训练算法 | 直接策略优化(DPO) |
| 评估任务 | 多种真实世界Web任务(如股票交易、银行操作等) |
代码与数据
论文作者已公开代码和数据,可在以下地址获取:
硬件需求推测
虽然论文未明确列出硬件配置,但基于方法特点可合理推断:
- 训练阶段:需要GPU资源用于训练对抗性提示器模型(DPO优化),规模取决于基础模型的参数量;
- 推理阶段:攻击时只需运行训练好的对抗性提示器生成对抗字符串,计算资源需求相对较低;
- 目标Agent调用:需要能够调用GPT-4V等VLM模型的API接口。
综合分析
学术价值
AdvWeb在安全研究领域具有重要的学术贡献。首先,它将对抗性攻击的研究视野从单一的LLM/VLM模型扩展到了更复杂的Agent系统 ------这些系统不仅包含模型本身,还涉及与真实世界网页的交互链路,攻击面更广、危害更大。其次,黑盒设定 使得该研究更贴近实际攻击场景,因为商业部署的Web Agent通常不会公开其内部架构。第三,DPO的应用为对抗性提示的自动化生成提供了一条高效路径,避免了传统RL方法中奖励模型训练的额外开销。
技术局限性
从技术角度看,AdvWeb也存在一些值得关注的局限:
-
依赖API访问:训练对抗性提示器需要持续调用目标Agent并获取反馈,这在某些场景下可能受限于API调用成本和频率限制。
-
泛化性问题:论文主要针对GPT-4V进行评估,对其他VLM模型(如Qwen-VL、LLaVA等)的攻击效果尚需进一步验证。
-
防御演进的动态性:随着防御机制的引入,AdvWeb的攻击效果可能会衰减,需要持续迭代。
现实意义
这项研究最令人警醒的发现是:攻击可以在用户完全无感知的情况下发生。由于网页视觉外观不变,用户不会怀疑页面被篡改;而Web Agent在"不知情"的情况下执行了有害操作,可能导致真实的财务损失。这种"人不知、Agent不觉"的攻击模式,对金融交易、医疗记录修改、电商操作等高价值场景构成了实质性威胁。
与同类工作的对比
| 维度 | 传统对抗攻击 | AdvWeb |
|---|---|---|
| 攻击对象 | LLM/VLM模型 | VLM驱动的Web Agent |
| 访问权限 | 通常需要白盒或灰盒 | 纯黑盒 |
| 隐蔽性 | 文本扰动明显 | 网页外观不变 |
| 可控性 | 目标固定 | 子字符串可编辑 |
| 自动化程度 | 需人工设计提示 | DPO自动优化 |
实践应用
对安全研究人员的建议
-
红队测试工具:将AdvWeb纳入Web Agent上线前的安全测试流程,模拟真实攻击场景,提前发现漏洞。
-
防御机制研发:基于AdvWeb揭示的攻击模式,研究对应的检测与防御策略,如:
- 对网页内容进行对抗性鲁棒性检测;
- 在Agent决策链路中增加对抗性输入过滤层;
- 对关键操作(如交易、修改)增加二次确认机制。
对Web Agent开发者的建议
-
输入净化:在Agent处理网页内容之前,增加对抗性字符串的检测与过滤模块。
-
输出监控:对Agent的执行动作进行异常检测,识别可能由对抗攻击引发的异常行为模式。
-
多样性训练:在Agent训练阶段引入对抗性样本增强,提升模型对这类攻击的鲁棒性。
对普通用户的提醒
虽然普通用户无法直接从技术层面防御此类攻击,但可以:
- 关注所使用的Web Agent服务商是否具备完善的安全评估流程;
- 对涉及金融交易、个人信息修改等敏感操作保持警惕,尽量通过多重渠道确认操作合法性。
参考资料来源
- 原始论文: https://arxiv.org/abs/2410.17401
- 项目主页: https://ai-secure.github.io/AdvWeb/
- Hugging Face Paper Page: https://huggingface.co/papers/2410.17401