arXiv 链接:2607.10798 Trust Before Fusion: QIMG-7 and Source-Aware Resolution for Polluted Multimodal RAG
开源项目:https://github.com/SaadElDine/Trust_Before_Fusion
摘要
现有多模态 RAG 评测全部使用干净检索证据;真实检索会返回主题相关但是内容不可信的内容:被篡改元数据、实体交换、图片叠加虚假文字、语义编辑、对抗补丁、图像混合、风格迁移生成误导图片。
- 构建QIMG‑7 :面向多句子事实问答的受控评测基准;4 个数据集、7 大类图像污染攻击,16 套干净 / 污染配对实验配置,每个方法 1760 条评测样本。
- 实验现象:简单直接的多模态融合非常脆弱。GPT‑4o‑mini 基线下,干净文本 Full‑MM(图文一起用)支持分数 0.908;一旦文本被污染,暴跌至0.490;此时大模型内置参数知识(Parametric fallback)反而比检索结果更安全。
- 提出SATR 源感知信任解析:完全不需要微调训练;对比三类候选回答:纯内置知识回答 Parametric、只用检索文本 Text‑only、图文全部使用 Full‑MM;依据证据源可靠性选择回答,或者直接回退到模型内部知识。
- 最佳变体Field‑Selector ,平衡分数 0.816,对比 Full‑MM 提升 11.7 个点;对比 Cascaded Router 提升 2.7 个点。消融实验证明:文本可靠性建模是性能增益的最主要来源。
- 结论:面向图文冲突的事实问答,应该选择性信任证据,拒绝无条件多模态融合。
目录
[2.1 检索污染与对抗 RAG](#2.1 检索污染与对抗 RAG)
[2.2 鲁棒选择性 RAG](#2.2 鲁棒选择性 RAG)
[2.3 多模态 RAG 与评测](#2.3 多模态 RAG 与评测)
[2.4 多模态投毒攻击](#2.4 多模态投毒攻击)
[2.5 长文本事实性评估](#2.5 长文本事实性评估)
[3.2.QIMG‑7 数据集构建](#3.2.QIMG‑7 数据集构建)
[3.3.文本污染 4 种类型](#3.3.文本污染 4 种类型)
[3.4.7 大类图像污染攻击](#3.4.7 大类图像污染攻击)
1.引言
RAG 通过外部检索证据来增强大模型事实性,广泛用于知识问答、长文本生成。但是检索得到的文档不一定可靠。知识库中混入错误信息(投毒)会引导模型输出自信但错误的答案;长文本场景,一处事实错误会扩散到整个多段输出。
多模态 RAG 把图像加入检索证据:图像既可以补充事实依据,也可以通过伪造标题、错配实体、无上下文裁剪、视觉编辑产生误导。
现有研究缺口:
- 文本 RAG 的鲁棒性研究很多;
- 多模态 RAG 的基准数据集几乎全部假设检索返回干净证据;
- 多模态检索证据被污染后的鲁棒防御,研究严重不足。
📈图 1:动机案例图(多模态检索污染典型失败样例)

任务问题:When was the first Disneyland outside the United States opened?(美国境外第一座迪士尼乐园什么时候开放)
- 检索返回混合证据 :
- 干净文本:东京迪士尼,1983 日本千叶(正确);
- 污染文本:东京迪士尼 1979 年,位于欧洲巴黎附近;
- 被篡改图片:图片视觉 + 元数据宣称 1979 巴黎迪士尼。
- 朴素 Full‑MM 多模态 RAG:直接把全部检索图文输入模型,模型融合冲突信号,输出自信但错误的幻觉答案。
- 论文动机:不能无脑融合,需要引入源感知信任校验机制。
本文四大核心贡献
- 基准数据集 QIMG‑7:构建配对干净‑污染多模态 RAG 评测基准;面向多句子事实问答;4 个原始数据集,7 类图像攻击,16 种实验配置。
- 实证发现:默认无条件多模态融合是不安全的;当检索证据被污染,直接使用模型内置知识比朴素 RAG 更加安全;基于提示词的信任解析防御效果高度依赖 gate 模型本身评估证据的能力。
- 提出 SATR 源感知信任解析方法族:无训练;同时生成 Parametric / Text‑only / Full‑MM 三路候选回答;基于证据可靠性做选择、组合或者回退;Field‑Selector 综合性能最优。
- 机理分析 :大量消融实验、攻击族分解、原子事实审计、人工验证。证明 SATR 性能增益来自文本可靠性的显式建模,不是简单对多个答案做聚合投票。
术语表
- QIMG‑7:面向污染多模态检索的压力测试基准。
- SATR(Source‑Aware Trust Resolution) :整套源感知信任解析方法族;
Field‑Selector:SATR 主要变体,基于结构化可靠性字段 + 确定性规则,只选择已有三路答案,不生成新内容;Soft‑Conductor:SATR 次要变体,允许模型组合生成全新的合成答案。
2.相关工作
2.1 检索污染与对抗 RAG
PoisonedRAG 证明:向知识库注入少量精心构造恶意文本片段,黑盒条件下就可以控制 LLM 输出攻击者指定的错误答案。但是 PoisonedRAG 只研究纯文本场景,没有图像。
本文定位:在配对干净 / 污染受控实验设置下,站在防御方视角,将检索污染问题拓展到图文多模态证据。
2.2 鲁棒选择性 RAG
- Self‑RAG:微调 LM,通过反思 token 触发检索、批判段落;
- CRAG:轻量级检索评估器,选择修正操作;
- Adaptive‑RAG:根据查询复杂度路由是否检索;
- RobustRAG:隔离再聚合,提供可证明的检索损坏鲁棒性。
对比 SATR 优势:
- SATR不需要任何训练,纯提示词驱动;
- 同时处理文本 + 图像多模态证据;
- 需要做四元决策:信任文本、信任图像、两者都信任、两者都不信任直接回退内置知识;
对比同期文本工作 MIRAGE:MIRAGE 只做文本;SATR 拓展到图文配对污染。
2.3 多模态 RAG 与评测
MRAG‑bench、VisRAG 做多模态文档检索问答;RAG‑Check 区分多模态 RAG 中检索相关性和答案正确性;POPE、MMHalBench 评估 VLM 幻觉。 局限:几乎全部评测基于干净输入,缺少配对干净‑污染的鲁棒性测试。
2.4 多模态投毒攻击
MM‑PoisonRAG、Poisoned‑MRAG:设计攻击算法,向多模态知识库注入恶意图文对,实现投毒。
互补定位:攻击论文重点最大化攻击成功率;本文构建受控干净‑污染评测集,并且研究选择性信任防御策略。
2.5 长文本事实性评估
FActScore、SAFE、VeriScore,将长答案拆解为原子事实 Claim 逐条校验。本文借鉴该思路做原子事实审计,作为答案级指标的补充。
📋附录 B 表 6:基准横向对比表 对比 Self‑RAG、RobustRAG、MIRAGE、Poisoned‑MRAG、MM‑PoisonRAG 与本文 QIMG‑7。 QIMG‑7 独有特性: ✅多句子长事实问答;✅文本污染;✅7 类图像攻击;✅干净‑污染配对样本;✅跨 4 种生成模型评测;✅配套提出防御方法 SATR。
3.基准与威胁模型
3.1.威胁模型
假设条件:
- 用户 Query 不变;生成大模型不变;评判 Judge 模型不变;
- 攻击者不能修改模型权重;
- 攻击者可以篡改检索返回内容:检索文本片段、图片 caption/alt‑text 元数据、图片像素;
- 攻击者目标:构造主题相关,但是事实错误的检索证据,诱导多模态 RAG 输出错误;
- 防御目标:识别主题相关但不可信的证据,避免被误导。
⚠️重点区分: 知识库投毒:修改向量库 / 知识库内部存储的样本; 本文威胁:知识库可以不变,检索返回的证据已经被篡改污染,防御发生在检索完成之后,生成答案之前。
3.2.QIMG‑7 数据集构建
原始数据源 4 个 QA 数据集:
- LongFact:实体、事件、概念的开放长问答(主要数据源,50 个问题)
- Biography:维基百科人物传记 QA(20)
- AlpacaFact:AlpacaFarm 事实查询子集(20)
- FAVA:细粒度幻觉标注信息查询(20)
原始候选问题 766 条,过滤无效样本后,最终评测子集110 个问题。
| Dataset | Pool Q 候选问题 | Eval Q 评测问题 | Eval Rows 评测行 |
|---|---|---|---|
| LongFact | 250 | 50 | 800 |
| Biography | 183 | 20 | 320 |
| AlpacaFact | 233 | 20 | 320 |
| FAVA | 100 | 20 | 320 |
| Total | 766 | 110 | 1760 |
每个问题拓展出16 种实验配置 Regimes:
文本状态 {TC 文本干净,TP 文本污染} × 图像状态 {IC 图片干净,IP_attack1~IP_attack7 共 7 种图像污染} 16 = 2 × (1+7),每个方法运行全部 1760 行。
3.3.文本污染 4 种类型
采用最小编辑污染协议,只修改事实,保持主题不变,文本读起来自然可信。
- Unambiguous 明确篡改:直接修改可验证事实,例:居里夫人 1911 诺奖 → 修改为 1913;
- Conflicting 矛盾型:直接与真实事实冲突,例:条约 1992 签署 → 条约没有 1992 签署;
- Misleading 误导型:保留部分真话,选择性剪裁,引导错误结论;
- Fabricated 编造型:编造不存在机构、来源。
3.4.7 大类图像污染攻击
分为两大类:元数据攻击(不修改图片像素) 、像素级编辑攻击(修改图片像素)
- Caption flip(元数据攻击):图片像素完全不动;替换 alt‑text/caption 标题为虚假事实。
- Entity swap(元数据攻击):替换图片 URL,把其他问题的图片拿来,图片视觉和当前问题实体错配。
- Semantic entity rewrite(像素编辑):编辑图像像素,图像主题不变,但是实体、地点、对象被篡改。
- FigStep typography(像素编辑):直接在图片画面内部渲染打印虚假文字,看起来像图片自带说明文字。
- Adversarial patch(像素编辑):叠加一小块局部对抗补丁,误导 VLM 视觉特征向错误概念偏移。
- Image blend(像素编辑):把目标图和 donor 源图做图像融合,混入错误视觉语义。
- Neural style transfer(像素编辑):迁移另一张图片的风格到原图,引入误导视觉上下文。

可以直观观察:元数据攻击图片视觉完全正常;像素攻击有的肉眼可识别,有的非常隐蔽。
3.5.符号与形式化问题定义


防御路由函数 R,输入查询、污染检索证据、三路候选回答,输出最终答案:

4.方法
4.1.三路候选回答分支(对比基线)
对每一条测试样本,固定生成三路独立回答,三路生成互相隔离:
- Parametric 分支 :输入只给用户 query;完全屏蔽所有检索文本、图片;模型只能靠预训练内置知识回答。
- Text‑only 分支 :输入 query + 检索文本;屏蔽全部图像相关字段。
- Full‑MM 分支:输入 query + top‑k 检索文本 + 图像像素 + 图片元数据(title、alt‑text、page url)。
基线 Answer‑Consensus(答案表面一致性基线,公式)
灵感来自 RobustRAG isolate‑then‑aggregate 隔离聚合思路;只看生成的答案文本相似度,完全不看原始检索证据。

逻辑:选择和另外两个候选答案相似度最高的回答作为输出。
论文核心结论:该基线效果很差,仅仅依靠输出答案表面上的一致,无法防御多模态检索污染。污染证据可以诱导三路答案一起输出相似的错误。
4.2.级联信任路由器(对比基线)
全部为 LLM 提示词实现,无训练;Cascaded Router 是在生成三路候选回答之前做路由决策,看不到三路回答输出,只能看原始检索证据。 两级 Gate:
- Self‑check gate 自检门 :输入检索文本 + 图像元数据;输出二选一:
TRUST/FALLBACK。- FALLBACK:证据整体不可信;直接使用 Parametric 内置知识;
- TRUST:证据大体可信,进入 Triage gate。
- Triage gate 分流门 :输入检索文本 + 图像元数据;三选一输出:
FULL_MM:同时信任文本 + 图像;TEXT_ONLY:信任文本,不信任图像;FALLBACK:全部证据不可信,回退内置知识。
伪代码:
if self‑check_gate_decision == "FALLBACK":
route = "FALLBACK"
else:
route = triage_gate_decision
特性:
- 优点:污染场景鲁棒性不错;
- 缺点:看不到三路候选回答之间的矛盾冲突;保守,干净场景会损失一部分性能。
4.3.源感知信任解析(本文核心方法)
Cascaded Router 缺陷:路由发生在生成候选回答之前,无法观察【模型内置知识回答、纯文本检索回答、图文融合回答】三者之间的分歧。
SATR 改进:先生成全部三路候选回答,再把三路回答连同原始检索证据一起喂给 Resolver 解析器。Resolver 输出一组结构化可靠性字段:
text_reliability:{trustworthy可信,conflicting矛盾,weak弱证据,suspicious可疑}image_reliability:{trustworthy可信,suspicious可疑,weak弱证据,irrelevant无关}internal_external_conflict:模型内置知识 VS 检索证据冲突 {yes/no/unclear}cross_modal_conflict:检索文本 VS 检索图像之间的跨模态冲突 {yes/no/unclear}candidate_scores:对三路候选回答给出分数。
变体 1:Field‑Selector(主模型,Algorithm 1 算法伪代码)
只做选择,不生成新答案;Resolver 输出结构化字段之后,使用一套确定性硬规则,不依赖模型自由决策。
Algorithm 1 SATR‑Field‑Selector 输入:Query q,文本证据Et,图像证据Ei,三路候选Ap(Parametric), At(Text‑only), Am(Full‑MM) 输出:最终答案A* 1: R ← LLMRESOLVER(q, Et, Ei, {Ap, At, Am}) 2: 从R解析结构化输出: ρt ∈{trustworthy, conflicting, weak, suspicious} #文本可靠性 ρi ∈{trustworthy, suspicious, weak, irrelevant} #图像可靠性 cie, ccm ∈{yes, no, unclear} σ 候选回答分数 3: if ρt ∈ {conflicting, suspicious, weak}: return Ap #文本证据不可信,直接回退内置知识 4: elif ρi ∈ {suspicious, weak, irrelevant}: return At #文本可信,图像不可信,丢弃图像,只用文本 5: else: return arg max_{a∈{Ap,At,Am}} σ(a) #文本图像全部可信,选得分最高候选例如:
{ "text_reliability":"trustworthy", "image_reliability":"irrelevant", "internal_external_conflict":"no", "cross_modal_conflict":"yes", "candidate_scores":{"Ap":0.4,"At":0.92,"Am":0.70}, "reason":"Text evidence contains valid information about EY Global Review, but image metadata is irrelevant about PwC." }职责:让 LLM 去阅读理解全部材料,完成证据可靠性评估。 ⚠️Resolver 只负责分析,它本身不做最终路由输出!哪怕 JSON 里写了
decision:"FALLBACK",Field‑Selector 变体并不会直接采信这个 decision 字段。Field‑Selector 优先使用可靠性字段,走自己固定的代码规则。
变体 2:Soft‑Conductor
COMPOSE 是 Soft‑Conductor 独有的决策选项;Field‑Selector 完全禁用该模式,只能原样复用三路现成回答 Ap/At/Am,不能改写、拼接新文本。
Resolver 可以输出COMPOSE决策,允许模型融合多路可靠片段生成全新答案。
风险:如果 Resolver 判断出错,会复用部分污染证据;原子事实审计中原子层面平衡分数略高于 Field‑Selector,但整体答案级平衡分略低。
当
decision:"COMPOSE"生效,最终输出的是final_answer字段,不再直接输出 Ap、At、Am 任何一个原始候选。
{ "text_reliability":"weak", "image_reliability":"suspicious", "internal_external_conflict":"yes", "cross_modal_conflict":"yes", "candidate_scores":{"Ap":0.82,"At":0.65,"Am":0.35}, "decision":"COMPOSE", "final_answer":"【大模型拼接后全新写出来的回答文本,不是Ap/At/Am原样复制】", "reason":"At包含部分可信片段,但存在错误事实;Ap提供基础事实。丢弃错误片段,组合多路可靠内容生成新答案,不使用被污染的图像相关信息。" }
🖼️图 2 QIMG‑7 + SATR 完整 Pipeline 总览图

整个系统流水线分为三大模块:
- Evidence Construction 证据构建模块:构造干净 / 污染文本;7 类污染图像;生成 16 种 Regimes 实验配置。
- Candidate answer branches 候选回答分支:生成三路回答 Parametric / Text‑only / Full‑MM。
- Selective‑Trust Layer 选择性信任层 :
- 策略:Cascaded Router 基线;SATR (Field‑Selector / Soft‑Conductor);
- 决策输出:FULL_MM / TEXT_ONLY / FALLBACK / COMPOSE;
- 输出最终答案。
| 项目 | Field‑Selector | Soft‑Conductor |
|---|---|---|
| 决策执行 | Resolver 输出 JSON,再由代码硬规则选 Ap/At/Am | 没有第二层代码规则,Resolver 大模型直接做全部决策 |
| 输出选项 | 只能直接复用三路现成答案:Ap、At、Am | 4 种输出选项:FALLBACK / FULL_MM / TEXT_ONLY / COMPOSE |
| COMPOSE 合成 | ❌不允许生成新内容 | ✅允许:从多路候选中摘取可信片段拼接,生成一份全新答案 |
| 可控性 | 高;逻辑固定,行为可复现 | 低;完全靠 LLM 提示词约束,行为浮动大 |
| 风险 | 过度保守(不该回退的时候回退) | Resolver 一旦判断出错,会把污染片段拼进最终答案 |
| 论文定位 | 主模型,答案级平衡分数最优 0.816 | 备选变体;原子事实粒度指标最好 0.833 |
5.实验
5.1.模型和评价
4 套生成‑Gate 组合:
- gpt‑4o‑mini(主实验)
- gpt‑4.1‑mini
- Qwen2.5‑VL‑7B(开源)
- Llama‑3.2‑11B‑Vision(开源)
-
Support Score(主指标) :Judge 拿到【用户问题、模型输出答案、干净真实证据】;打分:
- supported 完全支持 = 1.0;partial 部分支持 = 0.5;unsupported 不支持 = 0.0;uncertain 不确定 = 0.0。
Clean avg:所有文本干净配置下平均分;Polluted avg:所有文本被污染配置平均分;Drop:Clean avg − Polluted avg,数值越大代表污染后性能崩塌越严重;- Balanced 平衡分数 = (Clean avg + Polluted avg)/2,论文核心指标,同时衡量干净场景能力和污染场景鲁棒性。
-
Atomic factuality audit 原子事实审计(补充指标) 将模型输出长答案拆解为一条条独立可验证原子事实 Claim;逐条对照真实证据打分。
作用:答案整体得分有可能掩盖局部细小事实错误;原子 claim 粒度更加严格。
question‑clustered paired bootstrap,10000 次重采样;95% 置信区间;按 question 聚类,同一个问题的 16 个 regime 样本不拆开。
5.2.主实验
不同基准对比:

- 朴素 Full‑MM:干净条件 0.908 很高;污染条件直接跌到 0.490;Drop 高达 0.418;污染条件性能低于直接不用检索的 Parametric(0.765)。
- Answer‑Consensus 平衡分 0.695,几乎和 Full‑MM 一样差:只靠答案输出投票不能防御。
- Cascaded Router 显著降低 Drop,但是干净场景性能有损失(0.851 < 0.908)。
- Field‑Selector 平衡分 0.816 全局最高;干净条件保留 0.881,污染条件提升到 0.751;Drop 控制在 0.130。
- Bootstrap 置信区间证明 Field‑Selector 对比 Full‑MM、Cascaded Router 提升统计显著。
不同模型泛化:

- GPT‑4o‑mini / GPT‑4.1‑mini / Qwen2.5‑VL‑7B:Field‑Selector 取得最优平衡分数;Qwen 上 Field‑Selector 几乎消除 clean‑polluted 性能断崖,但干净场景性能有明显牺牲。
- Llama‑3.2‑11B‑Vision 是例外:SATR 提示词路由反而变差。
重要局限:SATR 不是万能的,性能高度依赖 Resolver/Gate 模型本身评估证据可靠性的能力。如果 gate 模型推理能力弱,防御失效。SATR 是一套框架,不是即插即用的保证。
不同攻击对比:

- 元数据攻击(caption flip、entity swap)Cascaded Router 效果就已经很不错;
- 像素级篡改攻击(语义改写、FigStep 图片内文字、图像混合)Field‑Selector 优势明显高于 Cascaded Router。
5.3.消融实验

消融核心结论:
- 删掉 text_reliability 文本可靠性字段,污染条件性能暴跌 0.238,性能损失最大;
- 删除 image_reliability、冲突标记、候选分数,性能几乎不变(损失≤0.012)。
在本文文本优先事实问答场景,SATR 性能增益几乎全部来自文本证据可靠性建模;图像校验带来增益很小;图像更多是制造冲突信号,但真正带来伤害的是污染文本。

统计 Field‑Selector、Soft‑Conductor 在干净 / 污染文本条件下选择各个分支的百分比:
- Field‑Selector:
- 干净文本:74.9% 选择 Text‑only;6% Full‑MM;19.1% Parametric;
- 污染文本:98.9% 直接回退 Parametric 内置知识。
- Soft‑Conductor:
- 干净文本:72.3% Text‑only;9.7% Full‑MM;16.8% Parametric;
- 污染文本:94.3% 回退 Parametric,3.3% 尝试 COMPOSE 组合答案。

SATR 防御生效主要手段:识别文本证据可疑,直接放弃检索,回退模型内置知识,不是修复污染证据。
🔥图 5 热力图:各个图像攻击族污染文本支持分数
颜色越绿代表分数越高,越红越低。
- Full‑MM 整列大片红色,全部攻击下性能差;
- Cascaded Router 大部分绿色;
- SATR 变体 Field‑Selector、Soft‑Conductor 在像素篡改攻击上颜色更绿。
6.核心结论
- 朴素无条件多模态图文融合面对检索污染非常脆弱;当文本被污染,直接放弃检索使用模型内置知识反而更安全。
- QIMG‑7 基准提供一套标准化多模态检索污染压力测试集,7 类图像攻击,支持干净‑污染配对评估。
- SATR(Field‑Selector)零训练源感知信任解析;实现干净、污染场景性能的良好权衡;增益主要来自文本可靠性评估。
- 范式转变:多模态 RAG 鲁棒防御不应该追求无条件融合全部图文证据,应当采用选择性信任证据。