桥接证据:静态检索效用无法预测多步骤智能体检索因果效用

桥接证据:静态检索效用无法预测多步骤智能体检索因果效用

论文原网页地址https://arxiv.org/html/2607.15253v1

摘要

现有检索系统的训练与评测均基于静态效用 假设:将文档与问题直接交给阅读模型,根据答案提升程度打分,nDCG、MAP、MRR、稠密检索排序损失等主流指标均遵循该逻辑。该假设仅适用于单轮静态阅读场景;当大模型作为多步骤ReAct检索智能体时,文档价值不再由其直接回答问题的能力决定,而是取决于它能否引导智能体生成后续有效查询。

本文采用反事实轨迹探测 定量量化二者差距:基于HotpotQA分层采样1000条开发集问题,对智能体每一步读取的文档执行「删除重放」干预,对比原始轨迹与删除文档后的反事实轨迹,构建反事实轨迹效用(CTU) ,由答案质量、下一轮检索效果、交互轮次三类差值加权构成。

在23322条文档观测样本上,静态检索效用(SRU)与CTU斯皮尔曼相关系数仅-0.026,二者近似统计独立;约35.7%的文档属于桥接证据 :静态阅读判定无用,但删除后会导致整条推理轨迹崩溃。即使将SRU替换为BM25、交叉编码器传统检索得分做鲁棒性验证,桥接文档占比仍达27.2%。

机制实验揭示桥接证据生效原理:引入可观测实体相关性(OER) 判别指标,区分高/低判别力实体;高OER实体出现在下一轮查询的概率是低实体的4.02倍(6.1% vs 1.5%,样本量227139)。桥接文档核心价值是提供具备判别力实体,引导检索方向。

实验结论:静态相关性与智能体场景下的因果检索效用是完全不同的指标,仅优化静态检索指标无法提升多步智能体检索效果。

关键词:智能体检索、反事实评测、证据效用、多跳问答、实体相关性

核心四大贡献

  1. 提出反事实轨迹探测(CTE)评测框架,单文档删除干预可隔离单一文档对整条推理轨迹的因果贡献;
  2. 定义复合指标CTU(反事实轨迹效用),给出严格无因果效应理论阈值,实现文档因果价值量化;
  3. 大规模实证证明SRU与CTU几乎无相关性,超三成样本为桥接文档,BM25/交叉编码器验证结论稳健;
  4. 揭示桥接证据底层机制:高可观测相关性实体更容易流入后续查询,解释文档跨轮次引导作用。

1 引言

1.1 传统静态检索假设局限

经典检索评测逻辑:文档是否有用=文档+问题输入阅读模型能否优化答案。该范式支撑全部传统检索指标与稠密检索训练目标,但隐含强前提:模型一次性读取问题+文档,无历史推理、无多轮搜索规划。

ReAct类多跳检索智能体打破该前提:智能体交替执行「思考-检索-阅读」,文档价值不再局限于直接作答。部分文档不含答案,但能提供关键实体,引导下一轮精准查询;部分文档包含标准答案,但智能体已有相关知识,读取后无任何增益。

典型案例:夏威夷第六任州长问题,首段仅给出人名Linda Lingle,无党派、环保法案信息。静态阅读判定完全无用;但删除该文档后,智能体无法构造下一轮查询,整条推理失败。本文将此类文档命名桥接证据:静态指标低分,但具备关键跨轮次因果价值。

1.2 研究方案设计

单纯理论论证缺乏说服力,本文采用反事实因果评测方案:

  1. 干预手段:从当前检索列表删除单篇文档,固定前置全部轨迹,重放后续完整流程;
  2. 对比维度:最终答案质量、下一轮检索召回效果、交互总轮次,融合为CTU指标;
  3. 划分四象限:高SR高CTU(有效证据)、高SR低CTU(冗余证据)、低SR高CTU(桥接证据)、低SR低CTU(无效文档);
  4. 实体机制实验:基于OER指标验证桥接文档依靠高判别实体改变后续检索方向。

1.3 论文结构

第2章完整定义智能体轨迹、反事实评测框架、SRU/CTU/OER指标;第3章给出四象限统计、相关性、实体传播全套实验;第4章讨论效度威胁;第5章总结,附录提供完整提示词、实验脚本。

2 方法体系

2.1 基础任务与智能体定义

2.1.1 ReAct多跳检索智能体

模型基座:Qwen2.5-7B-Instruct,检索后端为维基百科段落级BM25索引,每轮返回Top50,交叉编码器重排后取前10送入上下文;限制最多4轮检索,禁止重复查询。

状态转移公式:

St→(thought+上下文窗口t,qt,Dt)→St+1S_{t} \rightarrow (\text{thought+上下文窗口}t, q_t, D_t) \rightarrow S{t+1}St→(thought+上下文窗口t,qt,Dt)→St+1

StS_tSt:t步推理隐状态;qtq_tqt:本轮检索query;DtD_tDt:检索段落集合。

下一轮查询生成仅依赖当前上下文与读取文档:

(thought+上下文窗口t,Dt:10)→qt+1(\text{thought+上下文窗口}t, D_t:10) \rightarrow q{t+1}(thought+上下文窗口t,Dt:10)→qt+1

文档是改变下一轮检索query的唯一可控变量,本文仅对DtD_tDt做删除干预,不修改模型内部隐推理。

2.1.2 数据集与采样规则

基准:HotpotQA开发集7405条问题,分层抽样1000条复现样本。

过滤规则:仅保留黄金支持段落能被BM25 Top50召回的样本;分层分配70%桥型问题、30%对比型,固定随机种子保证可复现。剔除仅1轮无后续查询的样本(无法计算CTU),最终有效观测23322条文档记录。

2.2 反事实轨迹探测框架(CTE)

2.2.1 单文档删除干预

原始检索列表d1,d2...d10d_1,d_2...d_{10}d1,d2...d10,删除did_idi后重放整条后续轨迹,前置步骤完全固定:

d1,d2,...,d10\]→\[d1,...,di−1,di+1,...,d10\]\[d_1,d_2,\\dots,d_{10}\] \\rightarrow \[d_1,\\dots,d_{i-1},d_{i+1},\\dots,d_{10}\]\[d1,d2,...,d10\]→\[d1,...,di−1,di+1,...,d10

遍历每一步每一篇读取文档,批量生成原始/反事实成对轨迹。推理温度置0、关闭随机采样,最大程度消除模型随机性干扰。

2.2.3 两大核心效用指标

(1)静态检索效用 SRU

仅用文档+问题输入空白阅读模型,对比「有文档」「无文档零样本」答案F1差值:

ΔSRU=F1(带文档答案)−F1(无文档答案)\Delta \mathrm{SRU} = \mathrm{F1}(\text{带文档答案}) - \mathrm{F1}(\text{无文档答案})ΔSRU=F1(带文档答案)−F1(无文档答案)

ΔSRU>0\Delta \mathrm{SRU}>0ΔSRU>0代表静态场景下文档具备作答增益。

(2)反事实轨迹效用 CTU

融合三类标准化差值,权重均等:

CTU=Δ~answer+Δ~next-query+Δ~effort\mathrm{CTU} = \tilde{\Delta}{\text{answer}} + \tilde{\Delta}{\text{next-query}} + \tilde{\Delta}_{\text{effort}}CTU=Δ~answer+Δ~next-query+Δ~effort

  1. Δanswer=原始答案F1−反事实答案F1\Delta_{\text{answer}} = \text{原始答案F1} - \text{反事实答案F1}Δanswer=原始答案F1−反事实答案F1:删除文档后答案变差则为正;
  2. Δnext-query=原查询nDCG−反事实查询nDCG\Delta_{\text{next-query}} = \text{原查询nDCG} - \text{反事实查询nDCG}Δnext-query=原查询nDCG−反事实查询nDCG:删除后下一轮检索召回变差则为正;
  3. Δeffort=反事实总轮数−原始总轮数\Delta_{\text{effort}} = \text{反事实总轮数} - \text{原始总轮数}Δeffort=反事实总轮数−原始总轮数:删除后需要更多轮次则为正;
    全部分量最小-最大归一化求和。
    理论零效应阈值:CTU=1.4,高于该值文档具备正向因果价值,低于则删除后整体效果更好;样本中位数恰好等于1.4,阈值无人工主观设定。

2.3 静态检索替代指标(鲁棒性验证)

  1. 归一化BM25:单问题内分值除以该问题最大BM25;
  2. 归一化交叉编码器得分:单问题内最小-最大缩放;
  3. 答案包含二元标记:文档是否包含标准答案字符串。

2.4 可观测实体相关性 OER(桥接证据机制指标)

2.4.1 定义

区分实体在候选集中区分相关/无关文档的判别能力,公式:

p^rel=dfrel+αR+2α,p^nonrel=dfnonrel+αNR+2α\hat{p}{\mathrm{rel}}=\frac{\mathrm{df}{\mathrm{rel}}+\alpha}{R+2\alpha},\quad \hat{p}{\mathrm{nonrel}}=\frac{\mathrm{df}{\mathrm{nonrel}}+ \alpha}{NR+2\alpha}p^rel=R+2αdfrel+α,p^nonrel=NR+2αdfnonrel+α

w(e,q)=1−exp⁡(−dfcand/τ),OER(e,q)=w(e,q)logitp\^rel−logitp\^nonrelw(e,q)=1-\exp(-\mathrm{df}_{\mathrm{cand}}/\tau),\quad \mathrm{OER}(e,q)=w(e,q)\big\\mathrm{logit}\\hat{p}_{\\mathrm{rel}}-\\mathrm{logit}\\hat{p}_{\\mathrm{nonrel}}\\bigw(e,q)=1−exp(−dfcand/τ),OER(e,q)=w(e,q)logitp\^rel−logitp\^nonrel

α=0.5,τ=5\alpha=0.5,\tau=5α=0.5,τ=5;OER>0为高判别力实体,仅出现在黄金相关文档。

2.4.2 实体传播率统计

统计实体流入下一轮查询概率:

  • 精确匹配:完整实体短语出现在query分词边界;
  • 部分匹配:实体至少2字符非停用词token出现在query;
    统计高OER、低OER实体传播比例,计算倍数差异。

2.5 四象限划分标准

| 象限 | ΔSRU | CTU | 定义 |

| A | >0 | >1.4 | 标准有效文档:静态、因果均有用 |

| B | >0 | ≤1.4 | 冗余文档:静态能作答,删除不影响轨迹 |

| C | ≤0 | >1.4 | 桥接文档:静态无用,因果关键 |

| D | ≤0 | ≤1.4 | 完全无效文档 |

3 完整实验结果

3.1 基础统计(23322条文档观测)

全部CTU分量中位数严格等于0,代表大多数文档删除后无变化;整体CTU均值1.391、中位数1.4,与理论零效应阈值完全吻合。

ΔSRU均值仅0.0048,多跳问题单文档极少能独立作答,静态指标区分度极低。

3.2 SRU与CTU相关性&四象限分布

斯皮尔曼相关系数ρ=−0.026\rho=-0.026ρ=−0.026,二者几乎完全独立。

全样本象限占比:

  • A(标准有效):1.12%
  • B(冗余):2.18%
  • C(桥接):35.72%
  • D(无效):60.98%
    超三成文档属于桥接证据,验证核心假设。
    按轮次拆分:轮次越高桥接文档占比越高(2轮22.30% / 4轮41.62%),但该趋势由指标数学构造导致,不代表难题桥文档更多。

3.3 鲁棒性实验(BM25+交叉编码器替代SRU)

筛选BM25与CE打分同向样本共9600条,桥接象限占比27.16%,结论稳定;二者相关系数接近0,传统检索指标同样无法预测智能体因果效用。

3.4 实体传播机制实验(227139条实体观测)

H1验证(高OER实体更容易流入下一轮查询)

精确匹配传播率:高OER=6.1%,低OER=1.5,倍数4.02倍,卡方检验p远小于10−30010^{-300}10−300;

部分匹配:高14.4%,低8.2%,倍数1.77倍。

高判别实体更容易被智能体带入后续查询,解释桥接文档核心作用。

H2验证(桥文档实体传播更强)

假设「桥文档内高OER实体传播率高于普通有效文档」无法复现,正负样本比例随匹配规则反转,结论不成立。

3.5 效度威胁分析

  1. CTU依赖当前LLM基座,更换模型数值会变化,但独立趋势不变;
  2. SRU指标区分度极低,仅3.3%文档静态增益>0;
  3. 反事实存在微小模型随机噪声,大样本下不影响整体结论;
  4. OER仅依托Hotpot黄金段落标签,无外部人工标注;
  5. BM25+CE鲁棒实验过滤近六成冲突样本,结论仅适二者打分一致场景。

4 结论

  1. 静态检索效用(SRU/BM25/交叉编码器)与多步骤智能体场景下的因果轨迹效用CTU近似统计独立,传统检索优化目标不匹配智能体真实需求;
  2. 海量桥接证据存在:静态完全无法作答,但删除会导致整条推理失效,样本占比27%~36%;
  3. 底层机制:桥接文档提供高OER判别实体,引导智能体生成有效下一轮查询,实体传播倍数达4倍;
  4. 现有检索训练、评测体系不适配多跳检索智能体,亟需面向因果轨迹效用的新型检索指标与损失函数。

附录

附录A 全套提示词模板

  1. ReAct检索智能体系统提示;
  2. 静态SRU阅读模型提示(带文档/零文档两套);

附录B 实验复现脚本说明

  1. 数据集分层抽样代码;
  2. 批量反事实轨迹删除重放主程序;
  3. CTU、OER指标批量计算脚本;
  4. 四象限统计、相关性绘图代码;

附录C 超参配置

  • LLM:Qwen2.5-7B-Instruct,temperature=0;
  • 检索:段落BM25,交叉编码器重排Top10;
  • OER参数α=0.5,τ=5\alpha=0.5,\tau=5α=0.5,τ=5;
  • 实体链接工具WAT,置信阈值0.1。

资源链接

论文HTML原文:https://arxiv.org/html/2607.15253v1

论文PDF:https://arxiv.org/pdf/2607.15253

实验完整数据集、批量评测脚本、指标计算代码:论文配套开源仓库(发布后公开)

相关推荐
xixingzhe21 小时前
AI 自然语言转SQL
人工智能
love530love1 小时前
【笔记】AutoClaw NSIS 安装器卡死、进程杀不掉、目录删不了?我是这么解决的
人工智能·windows·笔记·agent
Mandy的名字被占用了1 小时前
晨风AI+知识付费系统|学练考全闭环,重构教育变现新模式
人工智能·后端
步步为营DotNet1 小时前
Avalonia 11.3 本地离线AI图像识别绑定Minimal API AI推理网关
人工智能
满怀冰雪1 小时前
06-自动微分入门:用 Paddle 计算梯度
人工智能·python·深度学习·paddle
架构源启1 小时前
文档接入与智能解析:基于 Spring AI 1.1.x 的多格式解析、版面理解与结构化抽取
java·人工智能·spring
李昊哲小课2 小时前
GLM 多技术栈集成完整教程
人工智能·智能体
浩哥学JavaAI3 小时前
2026年最新AI agent面试(10)_通信与行业动态
人工智能·面试·职场和发展
新知图书3 小时前
7.4 测试与发布(一键生成PPT智能体开发)
人工智能·agent·ai agent·智能体·扣子
糖果店的幽灵3 小时前
【langgraph 从入门到精通graphApi 篇】Checkpoint 持久化与状态管理
人工智能·langgraph