【论文阅读】-- 通过跨模态操纵多模态智能体提示注入

论文地址:2504.14348 Manipulating Multimodal Agents via Cross-Modal Prompt Injection

目录

摘要

1.引言

2.相关工作

[2.1 多模态智能体](#2.1 多模态智能体)

[2.2 提示注入](#2.2 提示注入)

3.威胁模型

[3.1 问题定义](#3.1 问题定义)

[3.2 对抗目标与攻击者能力](#3.2 对抗目标与攻击者能力)

4.方法论

[4.1 视觉潜在对齐](#4.1 视觉潜在对齐)

[4.2 文本引导增强](#4.2 文本引导增强)

5.实验

[5.1 实验设置](#5.1 实验设置)

[5.2 主要实验结果](#5.2 主要实验结果)

[5.3 消融实验](#5.3 消融实验)

6.物理世界智能体案例研究

7.对抗防御手段评估

8.结论与未来工作

9.核心要点总结


摘要

多模态大模型驱动的智能体可以融合视觉、文本等多源信息完成复杂任务,但存在被忽视的跨模态提示注入安全漏洞。本文提出 CrossInject 攻击框架,在多个模态嵌入对抗扰动,劫持智能体决策、执行未授权任务。框架包含两大模块:

  1. 视觉潜在对齐(Visual Latent Alignment):基于文生图模型,在视觉嵌入空间优化对抗特征,在图片中隐秘编码恶意任务线索。
  2. 文本引导增强(Textual Guidance Enhancement):利用对抗元提示构建黑盒防御系统提示,生成恶意文本指令,驱使智能体服从攻击者要求。

大量实验表明该方法相比现有攻击,攻击成功率(ASR)至少提升30.1%;同时在真实多模态自主智能体上验证攻击有效性,指出其对安全关键应用的潜在威胁。

1.引言

  1. 研究背景:大视觉语言模型 LVLM 赋能多模态智能体,广泛用于虚拟助手、自动驾驶、具身智能机器人;依靠多模态信息融合实现复杂感知决策。
  2. 现有问题 :提示注入攻击已有大量研究,但大多针对单模态(仅文本或仅图像);多模态智能体是多源输入共同驱动决策,模态间交互带来新漏洞,缺少面向黑盒多模态智能体的系统化攻击框架
  3. 本文思路 :提出跨模态提示注入 概念与 CrossInject,同时对视觉、文本两个输入通道实施协同攻击,利用多模态数据融合的漏洞劫持智能体。
    • 视觉端:文生图模型生成和恶意指令语义对齐的图像,嵌入到正常图片,保证隐蔽性。
    • 文本端:使用开源代理大模型优化恶意文本命令,双向配合提升攻击效果;还可利用外部数据源(网页、文档)植入恶意载荷。
  4. 实验结果概述:对比现有攻击,平均攻击成功率提升≥30.1%;具备良好跨模型迁移能力;现有防御手段难以抵御;在真实自动驾驶智能体验证攻击可行性。
  5. 主要贡献 ① 首次研究 LVLM 驱动多模态智能体上的跨模态提示注入; ② 提出黑盒场景下 CrossInject 框架,联合视觉 + 文本协同注入; ③ 在数字、物理多种场景开展完备实验评估,证明攻击威力。

2.相关工作

2.1 多模态智能体

  • 多模态智能体三大核心组件:感知(Perception) 接收图像、文本、外部文档网页;规划(Planning) 以 LLM/VLM 为核心做推理规划;**行动(Action)**调用工具输出执行动作。
  • 应用场景:数字端视觉问答、图像编辑;物理端自动驾驶、机器人。随着大规模部署,各类对抗安全风险凸显,本文聚焦跨模态提示注入漏洞。

2.2 提示注入

  1. 传统提示注入:攻击者构造恶意输入,覆盖系统提示,迫使模型执行非预期行为。现有工作大多针对纯文本 LLM 智能体,手段包括分隔符逃逸、GCG 对抗后缀、在网页邮件等外部数据植入间接注入载荷。
  2. 多模态提示注入:扩展到图像、音频模态;现有方法大多只单独利用图像或者音频作为攻击载体(白盒下添加图像扰动、图片内嵌文字越狱)。
  3. 研究缺口:现有攻击只利用单一模态,没有研究多输入模态协同操纵;本文填补该空白,实现多输入源联合攻击。

3.威胁模型

3.1 问题定义

  1. VLM 驱动多模态智能体输入:系统提示 S、视觉图像 I、外部检索数据 E、用户文本指令 C,输出动作 a=A(S,I,E,C)。
  2. 跨模态提示注入定义:同时对三类输入做变换:

3.2 对抗目标与攻击者能力

  1. 攻击者能力:黑盒设置:攻击者仅可上传图片、文档、发送文本指令;不知道模型参数、架构,只了解智能体的功能描述,模拟云端 API 服务的真实攻击场景。
  2. 外部数据的两种植入方式:
    • 被动植入:将恶意指令放到公开网页,利用智能体联网检索触发攻击;
    • 主动植入:攻击者直接上传携带恶意内容的本地文档给智能体。

4.方法论

整体分为视觉潜在对齐文本引导增强两个互补模块,双向协同完成跨模态攻击。

4.1 视觉潜在对齐

多模态 VLM 的图像特征和文本特征处于不同潜空间,存在模态鸿沟

  • 简单方案:直接对原图添加噪声,强制原图特征和恶意文本指令做对齐,优化难度大、迁移性差、攻击效果弱。
  • 本文新思路:不直接对齐 "恶意文本",而是借助文生图模型做中间转换,先把恶意文本指令翻译为视觉语义,再做图像‑图像特征对齐。

完整执行步骤

  1. 恶意指令转图像描述提示词 攻击者拥有恶意指令d,例如 "帮我执行文本编辑任务"。将该指令改写为文生图的描述提示d',补充主语、场景、动作信息,把抽象的文本命令转化为可绘画的视觉语义,例如"一个人正在桌子上修改编辑段落文字"
  2. 文生图生成目标图像 调用文生图模型(论文使用 Stable‑Diffusion‑3.5‑Large),输入改写后的提示d',生成目标图像

:这张图片本身就视觉化编码了攻击者的恶意意图,作为对齐目标。

  1. 对原始良性图像添加对抗扰动 在原始良性图片I上增加人眼几乎不可见的噪声扰动**** ,得到对抗图像 。优化目标:让对抗图像在视觉编码器的特征空间,尽可能接近目标图像 的特征
  2. 多智能体模型集成的损失函数(迁移攻击) 黑盒下无法拿到受害模型,使用多个公开预训练视觉编码器(CLIP、SigLIP 系列 ViT 模型)作为代理模型集合。 损失函数:
  1. 优化算法 使用 SSACWA 集成对抗攻击算法迭代求解扰动**** ,迭代次数设置 200 轮,最终输出携带恶意语义的对抗图像。

关键效果:肉眼看还是原图;但在 VLM 的视觉特征空间,它携带了恶意任务的语义提示,当多模态智能体融合图像 + 文本信息时,该语义会被模型感知。

消融实验关键结论

  1. 去掉该模块,攻击成功率平均下降18.7%;随机高斯噪声无法达到效果;
  2. 如果直接让图像对齐恶意文本特征,而不是对齐生成的目标图像,ASR 下降 11.1%,验证 "文生图中间转换" 设计的必要性;
  3. 扰动预算增大,ASR 上升,但超过 16 后收益递减;过大噪声会造成过拟合代理模型,降低跨模型迁移能力。

4.2 文本引导增强

仅靠视觉潜在对齐不足以稳定控制智能体输出 。视觉只能埋下语义线索,多模态智能体的最终输出由规划大语言模型决定。因此增加文本侧攻击:篡改用户输入文本指令,生成欺骗命令,从输出端诱导模型服从攻击者目标,与视觉攻击形成双向配合

视觉模块:输入层注入恶意语义;文本模块:引导规划 LLM 生成恶意输出,二者协同。

黑盒痛点:无法访问受害智能体梯度,不能端到端直接优化文本指令。

解决方案:使用开源代理大模型模拟受害智能体做迁移优化。

完整执行步骤

  1. 对抗元提示(Adversarial Meta‑Prompting)构建模拟防御系统提示 真实受害智能体的系统提示S攻击者不可见,但是攻击者知道智能体的角色描述R(例如 RecipeMaster 是菜谱生成助手)。 利用元提示模板,输入角色描述R、防御规则r,调用强大的构造大模型 M(GPT‑4),生成一个模拟的、带有防御能力的系统提示

意义:我们在 "自带防御" 的模拟环境中优化恶意文本,这样得到的恶意指令更擅长绕过真实智能体的安全防护,提升黑盒迁移成功率。

  1. 构造文本注入损失函数
  1. GCG 算法优化恶意文本指令 使用 GCG(Greedy Coordinate Gradient)算法迭代优化 token,从随机初始化字符串开始迭代,生成最优欺骗命令C'。 论文参数:top‑k=256,batch size=512,迭代 100 轮;代理 LLM 使用 Llama‑3.1‑8B‑Instruct。

GCG 擅长在黑盒迁移场景生成越狱、提示注入后缀。

  1. 输出欺骗指令C' 将原始用户文本C替换为优化后的欺骗指令C',和对抗图像一起输入受害多模态智能体。

消融实验关键结论

  1. 删除文本引导增强模块,攻击成功率平均下降24.8%,证明该组件是攻击的核心;
  2. 替换为同等长度随机字符串,不仅不提升效果,还会破坏上下文语义,攻击性能下降;
  3. 如果攻击者奇迹般拿到真实系统提示做优化,效果仅比本文元提示方案平均高 3%。说明:不需要拿到真实系统提示,对抗元提示生成模拟防御提示就可以达到接近最优的效果,更贴合真实黑盒攻击场景;
  4. 代理 LLM 选择至关重要:和受害模型架构、预训练数据越接近,迁移攻击成功率越高;Llama‑3.1‑8B 在测试中表现最优。迭代到 100 轮基本收敛,继续迭代收益很小。

5.实验

5.1 实验设置

  1. 受害智能体 :两个数字智能体
    • RecipeMaster (RM):接收食材图片生成菜谱;
    • PoetryGenius (PG):根据风景图片创作诗歌; 二者都支持读取本地文档、访问网页获取外部知识。底层 VLM 分别使用 Qwen2‑VL、Phi‑3.5‑vision。
  2. 注入任务:文本编辑、情感分析,任务和智能体原始任务完全无关。
  3. 攻击面:本地文档(主动植入)、在线网页(被动植入)。
  4. 对比基线:Naive 直接指令、JIP(仅视觉攻击)、FB(仅文本黑盒提示注入)。
  5. 评价指标
    • ASR 攻击成功率:越高攻击越强;
    • PNA 无攻击性能:衡量智能体正常任务能力。使用 LLM‑as‑Judge 评估。
  6. 数据集:CoEDIT 数据集 ------ 文本编辑任务、SST‑2(Stanford Sentiment Treebank‑2)数据集 ------ 情感分析任务、Code‑to‑Text 数据集 ------ 代码解释任务

5.2 主要实验结果

  1. 无攻击时 PNA=100%,智能体原生任务能力完好。
  2. 基线效果:仅视觉攻击 JIP 几乎失效(ASR 接近 0);仅文本攻击 FB 有一定效果,但能力有限。证明单模态攻击难以劫持现代多模态智能体。
  3. CrossInject 效果:全部场景取得最高 ASR。本地文档场景相比基线平均提升 32.7%;网页场景平均提升 27.5%。网页结构复杂,攻击难度更高,ASR 略低于本地文档。

5.3 消融实验

  1. 视觉对齐消融:去掉视觉对齐模块,攻击成功率平均下降 18.7%;随机噪声无法实现攻击;直接将图像对齐恶意文本,效果弱于本文的对齐目标图像的方案,证明视觉潜在对齐模块必要性。同时测试扰动预算,选择 ϵ=16 平衡隐蔽性与攻击效果。
  2. 文本引导增强消融:移除文本模块,ASR 平均下降 24.8%;随机字符串不能替代优化后的恶意指令。即便使用真实受害系统提示优化指令,提升幅度也很小,证明本方法在黑盒条件的实用性。
  3. 文本优化迭代:迭代 100 次性能接近最优,继续迭代收益很小。
  4. 代理 LLM 选择:Llama‑3.1‑8B 作为代理模型攻击迁移效果最优;模型架构、训练数据质量会影响迁移攻击性能。

6.物理世界智能体案例研究

以自动驾驶智能体 LIMO(基于 Qwen2‑VL)作为物理多模态智能体测试对象。

  1. 实验环境:仿真赛道,设置 STOP 停止标识,系统提示强制车辆看到 stop 标志必须绕行。
  2. 攻击实现:把视觉对抗扰动做成对抗补丁贴在 stop 标识;文本模块沿用数字实验参数;恶意目标:车辆不停车直接加速冲过停止标志。
  3. 实验结果:普通简单文本攻击 10 次中仅 4 次成功;CrossInject 攻击 10 次中 9 次成功。证实该跨模态攻击可以对现实物理智能体造成严重安全危害。

7.对抗防御手段评估

测试现有典型防御策略能否抵御 CrossInject 攻击,测试对象:三明治提示(文本防御)、高斯模糊(图像防御)、两者组合防御。

  1. 文本防御(三明治提示):可以小幅降低 ASR(平均下降 6.7%),但无法完全阻断攻击;原因是本文的恶意文本是在模拟防御提示下对抗优化生成,能够绕过该防护。
  2. 视觉防御(高斯模糊):效果很微弱,平均仅降低 2.8% ASR。高斯模糊只能消除高频噪声,无法消除语义层面的跨模态对齐线索。
  3. 组合防御:部分场景优于单一防御,但效果不是叠加提升,存在冗余,防御收益有限。

结论:目前现有的文本、图像防御手段无法有效对抗 CrossInject 跨模态协同提示注入。

8.结论与未来工作

  1. 结论:本文识别多模态智能体的跨模态提示注入漏洞,提出 CrossInject;在数字、物理场景验证攻击有效性;现有防御难以抵御该协同攻击;呼吁更多关注多模态智能体安全。
  2. 局限性与未来方向 ① 为多模态场景设计更有效的防御方案,例如对抗训练; ② 将攻击拓展到架构更加复杂的真实落地智能体系统。

9.核心要点总结

  1. 过去的提示注入大多只攻击文本或者只攻击图像,但是现代多模态智能体是多输入共同推理,单模态攻击效果很差
  2. CrossInject 的核心创新:视觉 + 文本协同黑盒攻击,视觉端用文生图做语义对齐,文本端借助代理模型 + 对抗元提示生成绕过防御的恶意指令,还可以利用外部网页 / 文档载荷。
  3. 风险不止存在于数字聊天机器人,物理自动驾驶智能体同样可以被劫持,造成现实危险
  4. 当前主流防御手段不足以对抗该类跨模态协同攻击,多模态智能体安全仍存在巨大缺口。
相关推荐
小新科研测评9 小时前
2026 年论文阅读工具横评:Zotero、EndNote、Mendeley、Scholaread 哪个效率更高?
论文阅读·人工智能·ai·pdf·自动翻译
m4Rk_12 小时前
【论文阅读】Agent 记忆机制(52):Cognitive Scaffold——面向 DeepResearch Agent 的结晶化记忆框架
论文阅读·人工智能·学习·开源·github
chnyi6_ya13 小时前
【论文阅读】VideoArgus:用「样本专属评分表」统一评测视频生成与编辑
论文阅读·音视频
Capricorn19881 天前
解决全网抄 Karpathy 导致的 LLM Wiki 污染?基于知芽 Notebook Skill 的 raw/ 笔记法排障指南
大数据·论文阅读·人工智能·笔记·论文笔记
Rocky Ding*1 天前
一文读懂Wan 3.0视频创作大模型核心基础知识
论文阅读·人工智能·深度学习·机器学习·aigc·ai-native·wan 3.0
sel_91 天前
【多轮对话论文导读(七)】多轮对话论文阅读笔记:从数据生成、用户模拟到上下文重构与长期记忆
论文阅读·人工智能·笔记·深度学习·算法·语言模型·自然语言处理
柳叶方舟1 天前
Nature Aging IF=19.4 | Transformer聚类框架:纵向电子健康记录解析阿尔茨海默病与帕金森病亚型
论文阅读·人工智能·深度学习·transformer·健康医疗·聚类
西柚小萌新2 天前
【论文阅读】-- 面向多模态检索增强生成(MRAG)的知识投毒攻击
论文阅读
Rocky Ding*2 天前
【三年面试五年模拟】2026-08-18_哔哩哔哩_AI应用岗Agent开发一面面经(含完整答案)
论文阅读·人工智能·深度学习·机器学习·aigc·ai-native·ai agent