论文地址:2504.14348 Manipulating Multimodal Agents via Cross-Modal Prompt Injection

目录
[2.1 多模态智能体](#2.1 多模态智能体)
[2.2 提示注入](#2.2 提示注入)
[3.1 问题定义](#3.1 问题定义)
[3.2 对抗目标与攻击者能力](#3.2 对抗目标与攻击者能力)
[4.1 视觉潜在对齐](#4.1 视觉潜在对齐)
[4.2 文本引导增强](#4.2 文本引导增强)
[5.1 实验设置](#5.1 实验设置)
[5.2 主要实验结果](#5.2 主要实验结果)
[5.3 消融实验](#5.3 消融实验)
摘要
多模态大模型驱动的智能体可以融合视觉、文本等多源信息完成复杂任务,但存在被忽视的跨模态提示注入安全漏洞。本文提出 CrossInject 攻击框架,在多个模态嵌入对抗扰动,劫持智能体决策、执行未授权任务。框架包含两大模块:
- 视觉潜在对齐(Visual Latent Alignment):基于文生图模型,在视觉嵌入空间优化对抗特征,在图片中隐秘编码恶意任务线索。
- 文本引导增强(Textual Guidance Enhancement):利用对抗元提示构建黑盒防御系统提示,生成恶意文本指令,驱使智能体服从攻击者要求。
大量实验表明该方法相比现有攻击,攻击成功率(ASR)至少提升30.1%;同时在真实多模态自主智能体上验证攻击有效性,指出其对安全关键应用的潜在威胁。
1.引言
- 研究背景:大视觉语言模型 LVLM 赋能多模态智能体,广泛用于虚拟助手、自动驾驶、具身智能机器人;依靠多模态信息融合实现复杂感知决策。
- 现有问题 :提示注入攻击已有大量研究,但大多针对单模态(仅文本或仅图像);多模态智能体是多源输入共同驱动决策,模态间交互带来新漏洞,缺少面向黑盒多模态智能体的系统化攻击框架。
- 本文思路 :提出跨模态提示注入 概念与 CrossInject,同时对视觉、文本两个输入通道实施协同攻击,利用多模态数据融合的漏洞劫持智能体。
- 视觉端:文生图模型生成和恶意指令语义对齐的图像,嵌入到正常图片,保证隐蔽性。
- 文本端:使用开源代理大模型优化恶意文本命令,双向配合提升攻击效果;还可利用外部数据源(网页、文档)植入恶意载荷。
- 实验结果概述:对比现有攻击,平均攻击成功率提升≥30.1%;具备良好跨模型迁移能力;现有防御手段难以抵御;在真实自动驾驶智能体验证攻击可行性。
- 主要贡献 ① 首次研究 LVLM 驱动多模态智能体上的跨模态提示注入; ② 提出黑盒场景下 CrossInject 框架,联合视觉 + 文本协同注入; ③ 在数字、物理多种场景开展完备实验评估,证明攻击威力。


2.相关工作
2.1 多模态智能体
- 多模态智能体三大核心组件:感知(Perception) 接收图像、文本、外部文档网页;规划(Planning) 以 LLM/VLM 为核心做推理规划;**行动(Action)**调用工具输出执行动作。
- 应用场景:数字端视觉问答、图像编辑;物理端自动驾驶、机器人。随着大规模部署,各类对抗安全风险凸显,本文聚焦跨模态提示注入漏洞。
2.2 提示注入
- 传统提示注入:攻击者构造恶意输入,覆盖系统提示,迫使模型执行非预期行为。现有工作大多针对纯文本 LLM 智能体,手段包括分隔符逃逸、GCG 对抗后缀、在网页邮件等外部数据植入间接注入载荷。
- 多模态提示注入:扩展到图像、音频模态;现有方法大多只单独利用图像或者音频作为攻击载体(白盒下添加图像扰动、图片内嵌文字越狱)。
- 研究缺口:现有攻击只利用单一模态,没有研究多输入模态协同操纵;本文填补该空白,实现多输入源联合攻击。
3.威胁模型
3.1 问题定义
- VLM 驱动多模态智能体输入:系统提示 S、视觉图像 I、外部检索数据 E、用户文本指令 C,输出动作 a=A(S,I,E,C)。
- 跨模态提示注入定义:同时对三类输入做变换:


3.2 对抗目标与攻击者能力
- 攻击者能力:黑盒设置:攻击者仅可上传图片、文档、发送文本指令;不知道模型参数、架构,只了解智能体的功能描述,模拟云端 API 服务的真实攻击场景。
- 外部数据的两种植入方式:
- 被动植入:将恶意指令放到公开网页,利用智能体联网检索触发攻击;
- 主动植入:攻击者直接上传携带恶意内容的本地文档给智能体。
4.方法论
整体分为视觉潜在对齐 、文本引导增强两个互补模块,双向协同完成跨模态攻击。
4.1 视觉潜在对齐
多模态 VLM 的图像特征和文本特征处于不同潜空间,存在模态鸿沟。
- 简单方案:直接对原图添加噪声,强制原图特征和恶意文本指令做对齐,优化难度大、迁移性差、攻击效果弱。
- 本文新思路:不直接对齐 "恶意文本",而是借助文生图模型做中间转换,先把恶意文本指令翻译为视觉语义,再做图像‑图像特征对齐。
完整执行步骤
- 恶意指令转图像描述提示词 攻击者拥有恶意指令d,例如 "帮我执行文本编辑任务"。将该指令改写为文生图的描述提示d',补充主语、场景、动作信息,把抽象的文本命令转化为可绘画的视觉语义,例如
"一个人正在桌子上修改编辑段落文字"。 - 文生图生成目标图像
调用文生图模型
(论文使用 Stable‑Diffusion‑3.5‑Large),输入改写后的提示d',生成目标图像
。
:这张图片本身就视觉化编码了攻击者的恶意意图,作为对齐目标。
- 对原始良性图像添加对抗扰动
在原始良性图片I上增加人眼几乎不可见的噪声扰动**
** ,得到对抗图像
。优化目标:让对抗图像在视觉编码器的特征空间,尽可能接近目标图像
的特征。
- 多智能体模型集成的损失函数(迁移攻击) 黑盒下无法拿到受害模型,使用多个公开预训练视觉编码器(CLIP、SigLIP 系列 ViT 模型)作为代理模型集合
。 损失函数:

- 优化算法 使用 SSACWA 集成对抗攻击算法迭代求解扰动**
** ,迭代次数设置 200 轮,最终输出携带恶意语义的对抗图像。
关键效果:肉眼看还是原图;但在 VLM 的视觉特征空间,它携带了恶意任务的语义提示,当多模态智能体融合图像 + 文本信息时,该语义会被模型感知。
消融实验关键结论
- 去掉该模块,攻击成功率平均下降18.7%;随机高斯噪声无法达到效果;
- 如果直接让图像对齐恶意文本特征,而不是对齐生成的目标图像,ASR 下降 11.1%,验证 "文生图中间转换" 设计的必要性;
- 扰动预算
增大,ASR 上升,但超过 16 后收益递减;过大噪声会造成过拟合代理模型,降低跨模型迁移能力。
4.2 文本引导增强
仅靠视觉潜在对齐不足以稳定控制智能体输出 。视觉只能埋下语义线索,多模态智能体的最终输出由规划大语言模型决定。因此增加文本侧攻击:篡改用户输入文本指令,生成欺骗命令,从输出端诱导模型服从攻击者目标,与视觉攻击形成双向配合。
视觉模块:输入层注入恶意语义;文本模块:引导规划 LLM 生成恶意输出,二者协同。
黑盒痛点:无法访问受害智能体梯度,不能端到端直接优化文本指令。
解决方案:使用开源代理大模型模拟受害智能体做迁移优化。
完整执行步骤
- 对抗元提示(Adversarial Meta‑Prompting)构建模拟防御系统提示 真实受害智能体的系统提示S攻击者不可见,但是攻击者知道智能体的角色描述R(例如 RecipeMaster 是菜谱生成助手)。 利用元提示模板
,输入角色描述R、防御规则r,调用强大的构造大模型 M(GPT‑4),生成一个模拟的、带有防御能力的系统提示。
意义:我们在 "自带防御" 的模拟环境中优化恶意文本,这样得到的恶意指令更擅长绕过真实智能体的安全防护,提升黑盒迁移成功率。
- 构造文本注入损失函数

- GCG 算法优化恶意文本指令 使用 GCG(Greedy Coordinate Gradient)算法迭代优化 token,从随机初始化字符串开始迭代,生成最优欺骗命令C'。 论文参数:top‑k=256,batch size=512,迭代 100 轮;代理 LLM 使用 Llama‑3.1‑8B‑Instruct。
GCG 擅长在黑盒迁移场景生成越狱、提示注入后缀。
- 输出欺骗指令C' 将原始用户文本C替换为优化后的欺骗指令C',和对抗图像一起输入受害多模态智能体。
消融实验关键结论
- 删除文本引导增强模块,攻击成功率平均下降24.8%,证明该组件是攻击的核心;
- 替换为同等长度随机字符串,不仅不提升效果,还会破坏上下文语义,攻击性能下降;
- 如果攻击者奇迹般拿到真实系统提示做优化,效果仅比本文元提示方案平均高 3%。说明:不需要拿到真实系统提示,对抗元提示生成模拟防御提示就可以达到接近最优的效果,更贴合真实黑盒攻击场景;
- 代理 LLM 选择至关重要:和受害模型架构、预训练数据越接近,迁移攻击成功率越高;Llama‑3.1‑8B 在测试中表现最优。迭代到 100 轮基本收敛,继续迭代收益很小。


5.实验
5.1 实验设置
- 受害智能体 :两个数字智能体
- RecipeMaster (RM):接收食材图片生成菜谱;
- PoetryGenius (PG):根据风景图片创作诗歌; 二者都支持读取本地文档、访问网页获取外部知识。底层 VLM 分别使用 Qwen2‑VL、Phi‑3.5‑vision。
- 注入任务:文本编辑、情感分析,任务和智能体原始任务完全无关。
- 攻击面:本地文档(主动植入)、在线网页(被动植入)。
- 对比基线:Naive 直接指令、JIP(仅视觉攻击)、FB(仅文本黑盒提示注入)。
- 评价指标 :
- ASR 攻击成功率:越高攻击越强;
- PNA 无攻击性能:衡量智能体正常任务能力。使用 LLM‑as‑Judge 评估。
- 数据集:CoEDIT 数据集 ------ 文本编辑任务、SST‑2(Stanford Sentiment Treebank‑2)数据集 ------ 情感分析任务、Code‑to‑Text 数据集 ------ 代码解释任务
5.2 主要实验结果
- 无攻击时 PNA=100%,智能体原生任务能力完好。
- 基线效果:仅视觉攻击 JIP 几乎失效(ASR 接近 0);仅文本攻击 FB 有一定效果,但能力有限。证明单模态攻击难以劫持现代多模态智能体。
- CrossInject 效果:全部场景取得最高 ASR。本地文档场景相比基线平均提升 32.7%;网页场景平均提升 27.5%。网页结构复杂,攻击难度更高,ASR 略低于本地文档。


5.3 消融实验
- 视觉对齐消融:去掉视觉对齐模块,攻击成功率平均下降 18.7%;随机噪声无法实现攻击;直接将图像对齐恶意文本,效果弱于本文的对齐目标图像的方案,证明视觉潜在对齐模块必要性。同时测试扰动预算,选择 ϵ=16 平衡隐蔽性与攻击效果。
- 文本引导增强消融:移除文本模块,ASR 平均下降 24.8%;随机字符串不能替代优化后的恶意指令。即便使用真实受害系统提示优化指令,提升幅度也很小,证明本方法在黑盒条件的实用性。
- 文本优化迭代:迭代 100 次性能接近最优,继续迭代收益很小。
- 代理 LLM 选择:Llama‑3.1‑8B 作为代理模型攻击迁移效果最优;模型架构、训练数据质量会影响迁移攻击性能。


6.物理世界智能体案例研究
以自动驾驶智能体 LIMO(基于 Qwen2‑VL)作为物理多模态智能体测试对象。
- 实验环境:仿真赛道,设置 STOP 停止标识,系统提示强制车辆看到 stop 标志必须绕行。
- 攻击实现:把视觉对抗扰动做成对抗补丁贴在 stop 标识;文本模块沿用数字实验参数;恶意目标:车辆不停车直接加速冲过停止标志。
- 实验结果:普通简单文本攻击 10 次中仅 4 次成功;CrossInject 攻击 10 次中 9 次成功。证实该跨模态攻击可以对现实物理智能体造成严重安全危害。

7.对抗防御手段评估
测试现有典型防御策略能否抵御 CrossInject 攻击,测试对象:三明治提示(文本防御)、高斯模糊(图像防御)、两者组合防御。
- 文本防御(三明治提示):可以小幅降低 ASR(平均下降 6.7%),但无法完全阻断攻击;原因是本文的恶意文本是在模拟防御提示下对抗优化生成,能够绕过该防护。
- 视觉防御(高斯模糊):效果很微弱,平均仅降低 2.8% ASR。高斯模糊只能消除高频噪声,无法消除语义层面的跨模态对齐线索。
- 组合防御:部分场景优于单一防御,但效果不是叠加提升,存在冗余,防御收益有限。
结论:目前现有的文本、图像防御手段无法有效对抗 CrossInject 跨模态协同提示注入。

8.结论与未来工作
- 结论:本文识别多模态智能体的跨模态提示注入漏洞,提出 CrossInject;在数字、物理场景验证攻击有效性;现有防御难以抵御该协同攻击;呼吁更多关注多模态智能体安全。
- 局限性与未来方向 ① 为多模态场景设计更有效的防御方案,例如对抗训练; ② 将攻击拓展到架构更加复杂的真实落地智能体系统。
9.核心要点总结
- 过去的提示注入大多只攻击文本或者只攻击图像,但是现代多模态智能体是多输入共同推理,单模态攻击效果很差。
- CrossInject 的核心创新:视觉 + 文本协同黑盒攻击,视觉端用文生图做语义对齐,文本端借助代理模型 + 对抗元提示生成绕过防御的恶意指令,还可以利用外部网页 / 文档载荷。
- 风险不止存在于数字聊天机器人,物理自动驾驶智能体同样可以被劫持,造成现实危险。
- 当前主流防御手段不足以对抗该类跨模态协同攻击,多模态智能体安全仍存在巨大缺口。