【论文阅读】-- Vis‑Poison:多模态 RAG 视觉知识投毒

论文链接:https://arxiv.org/html/2608.20756

核心定位:首个纯视觉知识投毒攻击------ 恶意 payload 完全嵌入图像内容本身,不修改任何文本(caption/summary/metadata),黑盒设定下跨检索器、跨生成器迁移。

摘要

多模态 RAG 越来越依赖图像作为外部知识源,但中毒视觉证据的引入会严重破坏 MLLM 生成 。 不同于以往只改文本的 RAG 投毒,本文提出 Vis‑Poison :一种纯视觉知识投毒 攻击,攻击者将受控 payload 直接嵌入图像内容,不操作 caption、summary、metadata 等任何关联文本。 通过自动化多智能体过程构造视觉上合理的中毒图像。在两条代表性多模态 RAG 流水线、两个嵌入模型、六个生成模型上评估:

  • 端到端攻击成功率 40.16% ~ 65.40%(30k 知识库,黑盒设定);
  • 即使 MLLM 本身已能正确回答,中毒图像仍能以平均 60% 以上的成功率覆盖正确答案。

目录

摘要

1.引言

1.1.研究问题

1.2.关键洞察

1.3.论文贡献

2.相关工作

[2.1.文本 RAG 投毒](#2.1.文本 RAG 投毒)

[2.2.多模态 RAG 投毒](#2.2.多模态 RAG 投毒)

3.背景与威胁模型

3.1.RAG系统

3.2.威胁模型

3.2.1.攻击目标

3.2.2.攻击能力

4.方法

4.1.攻击概述

4.2.多智能体构造流程

5.框架

6.实验

6.1.数据集构建

6.2.实验设置

6.2.1.样本与知识库

6.2.2.模型选择

6.2.3.评估指标

6.3.主实验

6.3.1.知识感知评估

6.3.2.编辑类型分析

6.4.防御实验

6.4.1.图文过滤

6.4.2.多图像上下文缓解

7.结论


1.引言

  1. Step 1‑2(投毒):攻击者获取与查询相关的干净图像,编辑成中毒图像,注入外部知识库 / 数据源。
  2. Step 3‑4(索引) :系统为中毒图像生成良性 caption(因为图像整体语义没变,caption 看起来正常),通过文本侧安全检查,作为检索索引入库。
  3. Step 5‑6(检索):用户提问时,检索器返回中毒图像作为视觉证据。
  4. Step 7(生成):生成器利用中毒视觉证据,输出攻击者期望的错误答案。

案例:用户问 "Is the beak of a male blue‑chinned sapphire bird thicker than its eye is wide?"(正确答案:No)。中毒图像把鸟喙画得更粗,系统最终回答 "Yes"。

1.1.研究问题

  1. RQ1 :攻击者如何构造纯视觉 payload,在黑盒多模态 RAG 中同时颠覆检索和生成?
  2. RQ2 :中毒视觉证据在多大程度上能覆盖 MLLM 已有的正确参数知识

1.2.关键洞察

注意力鸿沟(Attention Gap)

这是 Vis‑Poison 能成立的核心机制,对应 Fig.2。

MLLM 存在一个基本机制:局部视觉扰动在粗粒度 caption 生成时看起来良性,但在查询驱动生成时会成为决定性触发因素

  • Caption 阶段:模型关注全局显著内容,局部编辑细节被忽略 → 生成的 caption 是干净的;
  • VQA 阶段:用户查询直接引导模型注意力到被编辑的局部区域 → 局部证据被放大,主导答案。

1.3.论文贡献

  1. 提出 Vis‑Poison,首个纯视觉多模态 RAG 知识投毒攻击,模型无关、黑盒可迁移;
  2. 设计多智能体自动化构造流程,证明视觉知识投毒可跨不同检索器和生成器迁移;
  3. 提出知识感知评估框架,量化中毒 / 干净视觉证据对不同先验知识水平 MLLM 的影响。

2.相关工作

2.1.文本 RAG 投毒

  • PoisonedRAG(Zou et al., 2025):注入恶意文本到知识库;
  • 全部依赖文本 payload,容易被文本侧防御检测。

2.2.多模态 RAG 投毒

攻击方法 投毒载体 核心局限
MRAG‑Corrupter(Liu et al., 2026) 图像‑文本对 依赖文本 payload
PoisonedRAG(Ha et al., 2026) 图像‑文本对 白盒优化多模态嵌入
Spa‑VLM(Yu et al., 2025) 对抗图像 + 恶意文本 需要恶意文本
MM‑MEPA(Edemacu & Shokri, 2026) image metadata 不投毒图像内容本身
Vis‑Poison(本文) 纯图像内容 不改任何文本,黑盒可迁移
  • Shereen et al., 2026:投毒视觉文档页面图像,但依赖多目标梯度优化,仅限白盒。

3.背景与威胁模型

3.1.RAG系统

多模态 RAG 三组件:知识库D、检索器R、生成器M。

3.2.威胁模型

3.2.1.攻击目标

3.2.2.攻击能力

4.方法

4.1.攻击概述

给定目标查询q和攻击者期望错误答案,目标是构造中毒图像,既能被检索到,又能提供支持的视觉证据。

直接文生图的问题 :用 T2I 模型直接生成 " 支持的图像 ",可能丢失与查询q相关的细粒度视觉属性(比如生成 "蓝颏蓝宝石鸟" 可能画成普通蓝鸟),导致检索失败。

Vis‑Poison 方案 :编辑一张与查询相关的干净源图像

为什么编辑源图像能保持检索相关性?

  • 源图像已经与q语义相关,编辑只改局部区域;
  • 检索阶段(caption 生成)模型关注全局,局部编辑不影响 caption → 检索相关性保留;
  • 生成阶段(VQA)查询引导注意力到局部编辑区域 → 攻击证据被激活。

这就是 Fig.2 展示的注意力鸿沟机制:同一幅公鸡图,caption 生成时关注全局("一只公鸡"),VQA 问 "公鸡有几个脚趾" 时注意力集中到脚部局部。

4.2.多智能体构造流程

三个角色:Planner(规划者)、Editor(编辑者)、Verifier(验证者),都是 MLLM。

复制代码
输入: 查询q_i, 源干净图像I_i^c, 攻击者期望答案a_i^adv, 最大轮数R
输出: 中毒图像I_i^p

1: f ← ∅
2: for t = 1 to R do
3:   p_edit ← M_plan(q_i, a_i^adv, I_i^c, f)    # Planner生成指令
4:   I_t ← M_edit(I_i^c, p_edit)                   # Editor执行编辑
5:   (v_i, f_i) ← M_verify(q_i, a_i^adv, I_t)     # Verifier验证
6:   if v_i = 1 then
7:     return I_t                                    # 验证通过,返回
8:   end if
9:   f ← f_i                                         # 失败,更新反馈
10: end for
11: return ∅                                          # 超过最大轮数,失败
  • 88.3%(P1)和 98.9%(P2)的样本余弦距离低于 0.2;
  • 说明局部编辑大幅保留了检索表示,中毒图像在向量空间中仍与原干净图像高度相似,保证检索可命中。

5.框架

知识感知评估框架(核心创新)

6.实验

6.1.数据集构建

  • 数据源:WebQA(Chang et al., 2022);
  • 数据过滤:去掉多图、歧义、不可靠答案的样本;
  • 分层采样 :用 Gemma‑3‑31B 和 Qwen3.5‑35B‑A3B 标注,两者都答对的为easy ,两者都答错的为hard,不一致的丢弃;
  • 最终得到6,046 个有效样本用于投毒构造。

中毒样本构造实现

  • 每个 WebQA 样本:用 Q、A、img_posFacts 作为
  • Planner/Verifier:Gemma‑3‑31B;
  • Editor:FLUX.1 dev(9B 参数图像编辑模型);
  • R=1(最大迭代轮数);
  • 得到4,416 张验证通过的中毒图像

根据修改的视觉证据类型(九种)分为:Color(颜色)、Person(人物)、Layout(布局)、Count(数量)、Replace(替换)、Scene(场景)、Shape(形状)、Surface(表面)、Sign(标识)。

6.2.实验设置

6.2.1.样本与知识库

  • 从 4,416 个验证通过的中毒实例中,每种编辑类型随机采样 (70 个 easy + 70 个 hard)*9 = 1,260 个评估样本
  • 注入到 COCO 或 Flickr30k 知识库,规模分别为 1k、10k、30k。

6.2.2.模型选择

  • Captioner(P1 用):6 个 MLLM(Claude Sonnet 4.6、GPT‑5.4、Qwen3.6‑Plus、Llama 4 Maverick、Kimi‑K2.6、Qwen3.5‑397B‑A17B);
  • 检索器(P2 用):3 个(clip‑vit‑base‑patch16、siglip‑base‑patch16‑256、VL‑Embedding‑2B);
  • 生成器:同上 6 个 MLLM(含闭源和开源);
  • 两条流水线都只把检索到的图像传给生成器(\(k=1\))。

6.2.3.评估指标

  • ASR‑R:检索成功率(中毒图像被 Top‑1 召回);
  • ASR‑G:生成成功率(MLLM 输出攻击者期望答案);
  • ASR:端到端成功率(两者同时成立);
  • 知识感知评估:POR、CHR、PIR。

6.3.主实验

P1 结论(表1):ASR‑R 随知识库增长而下降,但 30k 规模下仍达 57.2%~79.8%,跨 captioner 稳定。

P2 结论(表2):共享嵌入检索下,中毒图像同样保持高检索命中率,30k 规模下 66.7%~87.0%。

端到端结论(表3) :30k 知识库、黑盒设定下,ASR 范围40.16% ~ 65.40%,跨生成器、跨流水线、跨知识库稳定有效。

6.3.1.知识感知评估

关键发现:

  1. 中毒图像在 hard 实例上比 easy 实例更有效(ASR‑G: 74.4% vs 63.3%)------ 当 MLLM 先验知识弱时,更容易被视觉证据主导;
  2. POR 平均 62.4%------ 即使 MLLM 本来能答对,中毒图像仍能以 60%+ 的概率覆盖正确答案,证明视觉证据可以作为有效的投毒 payload;
  3. 跨六个生成器,POR 全部高于 59%,攻击具有强迁移性。

Fig.4:CHR vs PIR 对比(不同难度)

  • Easy 实例:CHR > PIR------ 干净证据更常帮助恢复正确答案;
  • Hard 实例:PIR > CHR------ 中毒证据更常诱导出攻击者期望答案;
  • 说明:当生成器先验知识越弱,越容易被中毒视觉证据主导。

6.3.2.编辑类型分析

Table 5:不同编辑类型的 ASR‑G

编辑类型有效性排序:

  • 最有效:Color(颜色,86.9%)、Replace(替换,83.0%)、Sign(标识,78.6%)------ 这些编辑直接改变视觉上显著或答案承载属性,中毒证据更容易被生成器跟随;
  • 最不有效:Layout(布局,53.9%)、Count(数量,58.0%)、Scene(场景,58.7%)、Shape(形状,59.2%)------ 需要更精确的空间、数值或结构推理,攻击难度更大。

6.4.防御实验

6.4.1.图文过滤

测试两种主流防御:

  • TruFor(Guillaro et al., 2023):图像伪造检测,默认阈值 0.5;
  • isValid:文本侧事实检查 ------ 先为中毒图像生成 caption,再用 OpenAI Guardrails Jailbreak Detection + 基于 Web 的事实检查。

结论:现有安全防护对 Vis‑Poison 效果极其有限 ------TruFor 只阻断 3.89% 的中毒图像,isValid 只阻断 22.78% 的生成 caption。

Fig.5:不同投毒攻击的文本侧阻断率对比

  • PoisonedRAG:100% 被阻断(因为显式注入恶意文本);
  • MM‑PoisonRAG:81.67% 被阻断;
  • PoisonedEye:71.11% 被阻断;
  • Vis‑Poison:仅 22.78% 被阻断

核心原因:Vis‑Poison 的 caption 只捕获全局粗略内容,被操纵的局部证据是隐式的,文本侧防御根本看不到恶意信息。

6.4.2.多图像上下文缓解

测试增加检索返回图像数量(Top‑1 → Top‑3)是否能缓解攻击。

结论:Top‑3 检索使 ASR‑G 从 70.6% 降到 63.1%,有部分缓解但远不足以防御------ 中毒图像仍能在多图像上下文中主导生成。

7.结论

  1. 本文揭示多模态 RAG 系统的一个关键漏洞:视觉知识对语义腐蚀的固有脆弱性
  2. 提出 Vis‑Poison,首个纯视觉知识投毒攻击,不依赖文本 payload 或模型特定扰动,模型无关、黑盒可迁移;
  3. 综合实验证明:这些视觉毒剂在不同流水线、嵌入模型、大规模知识库上表现出强可迁移性,且能覆盖 MLLM 的正确参数知识(平均 POR 62.4%);
  4. 安全边界正在从文本信任转向视觉信任:系统不仅要确定检索到的视觉知识是否相关,还要确定该知识是否已被腐蚀;
  5. 构建可信多模态 RAG 需要能推理视觉证据一致性和事实完整性的防御。

局限

  1. 仅限视觉模态,音频等其他模态未探索;
  2. 构造流程依赖大规模编辑 pipeline,未充分探索不同推理成本或模型选择;
  3. 当前仅限单图像查询场景,多图像场景(如跨图像比较)是未来工作。
相关推荐
m4Rk_9 小时前
【论文阅读】Agent 记忆机制(63):SAMem——把经验记忆细化为带长期价值的状态—Thought
论文阅读·人工智能·学习·开源·github
m4Rk_1 天前
【论文阅读】Agent 记忆机制(62):DCM-Agent——用双簇记忆化解优化问题的多范式冲突
论文阅读·人工智能·学习·开源·github
VL——MOESR1 天前
【具身智能】OpenVLA论文阅读随笔
论文阅读·机器学习·具身智能·vla·openvla
Capricorn19881 天前
跨端同步与记忆锁定排障:OpenClaw 2.0 Active Memory 云端劫持危机,知芽 Notebook Skill 单元记忆架构解析
大数据·论文阅读·人工智能·笔记·架构·论文笔记
Capricorn19882 天前
日志级幻觉排障:GPT-6 Astra 迈入 AGI 时代,知芽 Notebook Skill 如何以引用校验与零命中诚实弃权解决长文失忆
论文阅读·人工智能·笔记·gpt·agi
chnyi6_ya2 天前
论文阅读笔记 | HoneyBee: Data Recipes for Vision-Language Reasoners
论文阅读·笔记
EQUINOX12 天前
【论文精读】| MiniGPT-4精读
论文阅读·人工智能·深度学习
m4Rk_2 天前
【论文阅读】Agent 记忆机制(61):CFGM——用粗到细的记忆落地贯通经验采集、知识蒸馏与在线纠错
论文阅读·人工智能·学习·开源·github
s1ckrain3 天前
【论文阅读】A Survey on Vision–Language–Action Models for Embodied AI
论文阅读·人工智能·多模态·具身智能