Wyvern:生成可溯源多模态报告的智能体框架

Wyvern:生成可溯源多模态报告的智能体框架

arXiv:2608.14446v1 cs.AI

项目开源地址:https://github.com/huawei-csl/wyvern

摘要

当前AI领域知识迭代速度持续加快,海量文献与网页信息难以人工梳理。生成式大模型虽可自动生成文本内容,但普遍存在事实无法溯源、幻觉严重 的缺陷。针对该痛点,本文提出Wyvern多智能体框架,用于自动生成具备完整证据溯源的多模态技术报告。

Wyvern支持统一整合文本、图表、数据表格与参考文献,核心创新为声明自动校验修正模块 ,专门解决内容可信度问题。

本文开展人工评测与自动化量化评测双重验证:

  1. 人工评测:在87%场景下,用户认为Wyvern生成图表的信息丰富度优于基线模型;对比3种主流方案,63%~100%场景中用户判定Wyvern报告实用性更强。
  2. 自动化指标:相较基线,Wyvern引用召回率最高提升2.3倍,引用精确率提升1.6倍。

1 引言

1.1 研究背景

人工智能、计算机系统领域的学术文献、网页资讯数量爆发式增长,科研人员需要持续跟进海量异构领域信息,人工整理综述、技术报告成本极高。自动化检索、摘要工具可作为初筛工具,批量聚合信息生成技术报告,辅助科研人员高效获取领域知识,但无法完全替代人工判断。

现有文本生成框架仅输出纯文字,缺少可视化图表支撑;同时最关键短板是生成语句无可靠证据溯源,大模型幻觉问题严重。读者无法追溯内容来源,大幅降低报告可信度。

多模态内容(配图、对比表格)可显著提升信息可读性,但现有方案缺少统一的图片筛选、排版、图文融合流程;而证据溯源(Grounding)是提升生成内容可信度的核心需求,需建立声明与原始文献的完整关联链路。

1.2 Wyvern框架核心设计思路

本文搭建由多个专用LLM智能体协同组成的模块化工作流,每个智能体仅负责单一细分任务,分工完成网页信息检索、多模态报告撰写、声明事实校验全流程,模块化架构提升系统可靠性、可扩展性与内容质量。

整体流程分为三大核心模块:网页检索模块、报告生成模块、声明溯源校验模块,完整链路见上图。

1.3 本文核心贡献

  1. 提出Wyvern多智能体框架 ,自动生成带完整证据溯源的多模态技术报告,两大创新点:
    • 设计图片检索、筛选、章节自动排版智能体流水线,可在报告文本中自动插入高信息量配图;
    • 搭建声明自动校验修正流水线,拆解文本为原子级事实声明,基于检索到的原始文献核验并修正无依据内容。
  2. 开展大规模人工用户评测,对比STORM、WebThinker、WikiAutoGen三类主流基线,量化报告综合质量;同时配套自动化评测,分析自动指标与人工打分的相关性,验证自动化评测的可用性。
  3. 开源全部代码与实验数据集:https://github.com/huawei-csl/wyvern

2 相关工作

2.1 长文本自动生成综述写作

大模型生成长文本受上下文窗口限制,容易出现语义断裂。主流解决方案为检索增强生成(RAG) ,结合搜索引擎获取实时外部信息,弥补模型静态知识滞后缺陷。

现有长文本生成方案分为两类:

  1. 自上而下规划:先搭建全文大纲,再逐段扩充内容,代表工作:STORM、Co-STORM、AutoSurvey;
  2. 动态递归任务拆解:分层拆解写作任务,迭代完善内容,代表工作:WebThinker。

近年涌现多模态报告生成方向,支持在文本中插入配图:

  • WikiAutoGen:智能体生成图片候选位置与描述,从网页拉取图片;
  • Multimodal DeepResearcher:通过LLM生成JS代码,直接绘制可视化图表。
主流框架功能对比表
方案 图片插入能力 声明事实校验能力
STORM
WebThinker
WikiAutoGen 支持
Wyvern(本文) 完整流水线支持 原子声明自动校验修正

2.2 内容溯源(Grounding)技术

大模型事实校验分为两大研究路线:

  1. 基于引用文献的文本蕴含校验:判断生成语句是否能被标注参考文献支撑;
  2. 外部真值问答校验:检索外部知识库验证语句真伪。

事实拆分粒度分为两种:句子级整体校验、原子事实细粒度拆分校验。

  • FActSCORE:将单句拆解为多条原子事实,解决单句多信息无法二元判定的问题;
  • Self-Checker:拆分文本声明,生成检索query核验内容;
  • 链式验证CoV:针对核心声明生成验证问题,通过模型自校验修正幻觉。

现有引用召回/精确率指标均基于完整句子计算,本文创新以原子级声明 为单位计算溯源指标,规避"句子部分有依据、部分幻觉"带来的评估偏差。

3 本文提出的Wyvern框架

Wyvern由三大串行模块构成,每个模块包含多个独立LLM智能体协同完成细分任务:

  1. 检索模块:抓取网页资源,构建知识库;
  2. 报告生成模块:撰写全文、自动插入图表、对比总表、全文润色;
  3. 溯源校验模块:拆解原子声明、核验文献支撑、修正无依据内容。

3.1 网页检索阶段

本阶段目标:基于用户输入主题,抓取网页资源,构建参考文献集合RRR与对应摘要集合RSR_SRS。

完整执行流程
  1. 用户输入主题,可补充关注/规避方向、自定义参考URL;LLM优化主题表述,自定义URL直接加入初始文献库。
  2. 智能体1:基于优化后的主题生成30条检索query,调用搜索引擎获取每条query前3条网页URL。
  3. 文档解析:根据网页类型匹配解析器,提取Markdown格式文本;仅保留token长度在预设区间的文档,过滤空页、超长文本。
  4. 文档质量过滤(并行执行):
    • 智能体2 :10分制打分文档文本完整度,低于阈值λcomp=5\lambda_{\text{comp}}=5λcomp=5直接剔除;
    • 智能体3 :打分文档是否存在补充检索价值,分数超过λsearch=5\lambda_{\text{search}}=5λsearch=5时,由智能体4生成新query补充抓取相关网页。
  5. 内嵌链接迭代挖掘:
    • 智能体5:提取文档内超链接,转换为绝对路径;
    • 智能体6 :对每条链接打分相关性,阈值λlink=7\lambda_{\text{link}}=7λlink=7,取前40条高分链接重复解析、打分流程,扩充知识库。
  6. 文档去重:计算文档间雅卡尔相似度,超过阈值λsim=0.9\lambda_{\text{sim}}=0.9λsim=0.9仅保留篇幅更长的文档。
  7. 知识库最终清洗:
    • 智能体7 :对每篇文档生成摘要RSR_SRS;
    • 智能体8:CoT推理过滤语义离群文档,剔除偏离主题的文献与摘要。

3.2 报告生成模块

3.2.1 大纲生成与段落扩充
  1. 智能体9 :基于摘要库RSR_SRS生成多版大纲O1,...,ONoO_1,...,O_{N_o}O1,...,ONo,最大化主题覆盖范围;
  2. 智能体10 :融合多版大纲,生成最终全文大纲OOO;
  3. 智能体11:并行撰写大纲每个章节,自动引用对应参考文献,拼接生成报告初稿。
3.2.2 图片自动插入流水线
  1. 候选图片池FFF:提取所有原始文献内的图表;
  2. 智能体12:基于文档标题、摘要、图注、正文引用文本,为每张图片生成详细描述;
  3. 智能体13:结合全文大纲筛选高相关图片,分配至对应章节;若图片描述总量超出上下文窗口,采用分层筛选;
  4. 智能体14:分章节二次筛选图片,结合章节正文剔除无关配图,生成图注、改写段落文本实现图文自然融合。
3.2.3 总览对比表格插入
  1. 智能体15:分析全部文献摘要,提取领域关键对比维度,生成对比总表与文字说明;
  2. 智能体16:判定表格适配章节;
  3. 智能体17:定位章节内最优插入位置,生成表格标题,改写文本实现表格与正文融合。
3.2.4 全文润色优化

智能体18逐章节审查报告:

  1. 识别内容缺失、逻辑矛盾,从参考文献补充信息并同步更新引用标注;
  2. 统一全文中立客观写作语气。

3.3 内容溯源校验模块

本模块核心目标:拆解全部文本为原子声明,核验每条声明是否有参考文献支撑,修正或删除无依据内容,消除大模型幻觉。

  1. 文本分段:将报告拆分为段落粒度文本单元TTT,每个单元绑定对应引用文献摘要RSiR_S^iRSi;
  2. 智能体19 :将单段文本拆解为多条原子声明CiC_iCi,同一段落声明共享同一组参考文献;
  3. 双层事实核验(智能体20 ):
    • 第一层:基于文献摘要RSiR_S^iRSi快速校验声明;
    • 若判定疑似无依据,第二层调取文献全文RiR^iRi执行自然语言蕴含(NLI)精细校验,输出判定理由;
  4. 声明修正(智能体21):结合章节上下文,对不精确声明改写、完全无依据声明直接删除,保证段落逻辑连贯无冗余;
  5. 标题统一(智能体22 ):修正各级标题,保证修改后标题与章节内容匹配。

4 实验设置

4.1 框架实现与环境参数

  1. 开发框架:LangChain;
  2. 搜索引擎API:Serper(https://serper.dev/);
  3. 文档解析工具:
    • PDF文档:Docling;
    • 通用网页:Playwright Python库、Trafilatura;
    • 维基页面:MediaWiki Action API、html2text;
  4. 基础模型配置(温度temperature=0):
    • 推理类智能体:DeepSeek-R1;
    • 常规生成智能体:DeepSeek-V3;
  5. 评测模型:
    • 定性自动评测:DeepSeek-V3(temperature=1)、Qwen3-32B(temperature=0.6);
  6. 固定阈值参数:
    • 单次检索返回k1=3k_1=3k1=3条URL,内嵌链接挖掘k2=40k_2=40k2=40条;
    • λcomp=5,λsearch=5,λlink=7,λsim=0.9\lambda_{\text{comp}}=5,\lambda_{\text{search}}=5,\lambda_{\text{link}}=7,\lambda_{\text{sim}}=0.9λcomp=5,λsearch=5,λlink=7,λsim=0.9。

4.2 基线对比方案

对比三类主流长文本生成框架:STORM、WebThinker、WikiAutoGen,为保证复现性,全部替换闭源模型为开源模型:

  1. STORM:Serper检索器,主干模型DeepSeek-V3;
  2. WebThinker:Serper检索器,推理模型WebThinker-QwQ-32B,辅助模型Qwen2.5-32B-Instruct;
  3. WikiAutoGen:Serper检索器,多模态模型Pixtral Large,推理DeepSeek-R1,生成DeepSeek-V3。

所有基线输入统一为「主题标题+研究方向描述」。

4.3 人工评测方案

  1. 评测人员:27名计算机系统领域研究者、工程师、博士,每人自选熟悉领域作为生成主题;
  2. 评测形式:两两对照(Wyvern报告+基线报告),随机打乱顺序,隐藏模型名称消除位置偏见;每组基线分配9组对照样本;
  3. 评测问卷分为两部分:
    1. 相对对比打分:两两对比结构、内容相关性、覆盖度、图表信息度、事实可信度、实用性等维度;
    2. 绝对分级打分:单一报告独立打分,5分李克特量表,精细评估各维度质量。

4.4 自动化评测指标

4.4.1 溯源量化指标(引用召回/精确率)

以原子级声明为计算单位,NNN为报告总声明数量,f(ci,Ri)f(c_i,R_i)f(ci,Ri)为NLI模型二元判定(1=参考文献支撑声明,0=无支撑)。

  1. 引用召回率CRC_RCR:
    CR=∑i=0N−1f(ci,Ri)N C_{R}=\frac{\sum_{i=0}^{N-1}{f(c_{i},R_{i})}}{N} CR=N∑i=0N−1f(ci,Ri)
  2. 引用精确率CPC_PCP:判断单条引用是否为支撑声明的必要文献,\\cdot为艾弗森括号逻辑判定:
    g(ci,rk)=\[f(ci,rk)=1f(ci,Ri∖{rk})=0] g(c_{i},r_{k})=\left\\left\[f(c_{i},r_{k})=1\\right\lor\leftf(c_{i},R_{i}\\setminus\\{r_{k}\\})=0\\right\right] g(ci,rk)=\[f(ci,rk)=1f(ci,Ri∖{rk})=0]
    CP=∑i=0N−1∑k=0∣Ri∣−1f(ci,Ri)∧g(ci,rk)∑i=0N−1∣Ri∣ C_{P}=\frac{\sum_{i=0}^{N-1}\sum_{k=0}^{|R_{i}|-1}f(c_{i},R_{i})\land g(c_{i},r_{k})}{\sum_{i=0}^{N-1}|R_{i}|} CP=∑i=0N−1∣Ri∣∑i=0N−1∑k=0∣Ri∣−1f(ci,Ri)∧g(ci,rk)
4.4.2 报告整体质量自动化评测

复用STORM评测四维标准:内容吸引力、结构连贯性、主题聚焦度、领域覆盖广度;采用两两对比模式,交换两份报告输入顺序,测试模型顺序偏见。

5 实验结果分析

5.1 人工评测结果

5.1.1 两两相对对比结果

有效回收23份完整问卷,核心结论:

  1. 对比STORM:Wyvern在全部评测维度偏好率100%,STORM仅生成纯文本,无图表对比项;
  2. 对比WebThinker:仅报告结构、内容吸引力两项Wyvern偏好率37.5%,其余维度全面领先;实用性偏好率62.5%;
  3. 对比WikiAutoGen(唯一支持图片的基线):图表位置、图注、图片信息量三项偏好率85.71%~87.50%;综合实用性偏好率87.50%;
  4. 全局结论:用户判定Wyvern报告实用性高于三类基线的场景占比:STORM(100%)、WebThinker(62.5%)、WikiAutoGen(87.5%);图片信息丰富度在87%场景优于WikiAutoGen。
5.1.2 绝对5分打分结果

Wyvern各维度平均分(满分5):

  • 事实可信度:4.22;总览表格信息量:4.25;图片排版逻辑:4.52;行文中立度:4.48;
  • 最低分为内容吸引力:3.65(标准差最高,主观差异大);
  • 图表、表格相关维度整体得分最高,验证多模态模块有效性。

5.2 自动化评测结果

5.2.1 溯源指标(引用召回/精确率)

WebThinker无引用标注,无法计算溯源指标,仅对比STORM、WikiAutoGen:

  1. Wyvern整体引用召回73.79%,较STORM提升21.50个百分点,较WikiAutoGen提升42.34个百分点;仅统计带引用段落时召回率94.64%;
  2. 声明校验模块消融实验:
    | 指标 | 校验前(%) | 校验后(%) | 提升倍数 |
    | ---- | --------- | --------- | -------- |
    | 引用召回 | 60.92 ± 6.10 | 73.79 ± 5.44 | 1.21× |
    | 无空白段落召回 | 84.34 ± 4.24 | 94.64 ± 1.55 | 1.12× |
    | 引用精确率 | 67.15 ± 6.17 | 75.45 ± 7.54 | 1.12× |

声明自动修正模块可显著提升内容溯源可信度。

5.2.2 自动化评测与人工打分相关性
  1. DeepSeek-V3、Qwen3-32B自动评测分数与人工打分在STORM、WikiAutoGen上相关性良好;但无法精准匹配WebThinker人工偏好;
  2. 顺序偏见测试:交换报告输入顺序后,DeepSeek-V3出现36.11%评测结果反转,Qwen3-32B出现30.56%反转;
  3. 结论:现有LLM自动化评测存在明显缺陷,无法完全替代人工评测。

6 总结、局限性与伦理说明

6.1 核心结论

  1. Wyvern是多智能体协同的多模态可溯源报告生成框架,创新实现自动配图、对比总表插入、原子声明双层校验修正;
  2. 量化指标:引用召回最高提升2.3倍,引用精确率提升1.6倍;人工评测中报告实用性全面优于主流基线;
  3. 自动化评测存在顺序偏见、模型间结果不一致问题,仅可作为辅助参考,无法完全替代人工评估。

6.2 框架局限性

  1. 依赖第三方搜索引擎API,检索结果受引擎索引、地域、时间影响,实验复现性无法完全保证;检索query生成无法100%覆盖全部细分领域信息;
  2. 原生仅支持英文主题输入,多语言场景适配未验证;若输入非英文主题,需额外翻译智能体预处理;
  3. 图片质量依赖原始网页资源,源文件图片描述模糊时会导致配图匹配偏差;文档解析工具存在图片裁剪错位问题。

6.3 伦理考量

  1. 框架内容全部来源于公开网页,会继承网页自带偏见、事实错误;底层开源LLM未做定向对齐优化;
  2. Wyvern仅校验生成内容与引用文献是否匹配,无过滤原始网页错误信息的机制,不会放大原始内容偏差,但也无法消除数据源本身的谬误。

附录A 人工评测完整数据

A.1 相对对比问卷完整结果

表格记录每道问题Wyvern相对各基线的用户偏好占比,STORM、WebThinker无图片,对应维度标记N/A,核心发现:

  1. 对比STORM所有维度偏好率100%;
  2. WebThinker仅结构、内容吸引力两项优于Wyvern;
  3. WikiAutoGen在图片相关维度Wyvern优势显著。

A.2 绝对分级打分明细

23份有效问卷各维度均值与标准差:图片排版、表格排版、行文中立度得分最高;内容吸引力主观差异最大。

附录B 自动化评测完整实验数据

B.1 相对对比评测

Prometheus 2-7B评测模型存在严重顺序偏见,无论基线方案,两份报告均判定先输入样本更优,偏好率固定50%,不具备可靠评估能力。

B.2 绝对分级评测

使用Prometheus-13B、Prometheus 2-7B、DeepSeek-V3、Qwen3-32B四类评测模型打分,不同模型对最优框架判定不一致,自动化评测结果不具备统一客观标准。

B.3 声明校验人机一致性实验

随机采样60条原子声明,人工标注与LLM校验判定一致率93.33%;证明在细粒度事实溯源任务上,LLM自动化评估具备高可信度。

附录C 算力与token成本分析

基于6份报告样本统计token消耗(DeepSeek-V3生成、DeepSeek-R1推理):

  1. 检索模块智能体2~7输入token消耗接近,均为批量解析文档;
  2. 报告生成模块智能体11(全文撰写)、智能体18(全文润色)输入/输出token消耗最高;智能体12生成图片描述占用大量输出token;
  3. 溯源校验模块智能体20双层NLI核验,输入token最长,推理文本量大;
  4. 文档解析不属于LLM token消耗,但大批量长图文文档会显著增加端到端运行延迟。

附录D 框架失败案例与优化方向

主要缺陷

  1. 报告篇幅冗余、段落内容重复,章节结构碎片化,部分内容主次失衡;
  2. 图片缺陷:原始网页图文描述模糊时,配图匹配章节偏差、图注笼统;解析工具裁剪错位导致图文不符;
  3. 溯源缺陷:部分声明修正解释晦涩;极少数完全虚假声明溯源后发现错误来源于原始引用文献,框架无法过滤源文件谬误。

未来优化方向

  1. 增加报告长度、冗余度控制智能体,优化章节内容权重分配;
  2. 引入多模态大模型直接读取图片视觉信息,不依赖文本描述匹配配图;
  3. 增加外部独立真值校验模块,过滤原始文献自带错误;
  4. 拓展多语言检索、多语言报告生成能力;
  5. 优化自动化评测模型,消除输入顺序偏见。

优化说明

  1. 结构分层优化:原文零散附录、实验数据、消融实验统一归类,逻辑主线:摘要→研究背景→框架设计→完整实验流程→结果消融分析→局限与附录,各级标题统一为标准中文;
  2. 完整信息无删减:全部实验参数、阈值、代码依赖库、开源链接、指标计算公式、消融对比表、人工/自动评测完整数据、失败案例、算力成本全部保留,无任何实验/资源信息丢失;
  3. 专业术语标准化:Grounding统一译为「内容溯源/事实校验」,Agent译为「智能体」,RAG、NLI、CoT等缩写首次标注全称,公式补充文字释义;
  4. 可读性增强:长段落拆分、实验参数单独分块,表格统一格式化,关键结论加粗突出;区分基线对比、消融实验、人工/自动评测三类结果;
  5. 格式规范:全文标准Markdown,代码/链接单独标记,图表说明对应原文图编号,开源地址、API链接完整留存;
  6. 补充信息归类:将原文分散的开发环境、模型参数、阈值全部汇总至4.1实验设置,便于复现代码与实验。
相关推荐
笨鸟先飞,勤能补拙38 分钟前
从预测到决策:人工智能与机器学习的系统方法、工程闭环与现实边界
大数据·人工智能·windows·python·机器学习·密码学
tech讯息43 分钟前
生成式 AI 从 POC 验证迈向正式生产,推理部署环节成为卡点的核心原因是什么?
大数据·人工智能
Aethir44 分钟前
第三章 — 成本与经济模型
大数据·人工智能
燕云少君44 分钟前
你只是跟AI聊聊天,它已经准备好刷你的卡了
人工智能·chatgpt·openai
Java学术趴1 小时前
我把一上午的表格活,拆成了 TRAE Work 的四步
人工智能
hyuk的AI工坊1 小时前
从 Demo 到生产:LangChain4j 工程化落地全指南
人工智能
这张生成的图像能检测吗1 小时前
(论文速读)TADNet:心磁图信号去噪的时间分解和基于注意力的深度学习
人工智能·深度学习·信号处理·信号去噪
小小测试开发1 小时前
AI Agent 回归测试:Replay 录一次、CI 跑千遍,像 Jest 一样给非确定性系统写断言
人工智能·ci/cd
csdn_aspnet1 小时前
开源人工智能编码代理列表
人工智能·continue·cline·goose·aider·opencode·openhands