面向AIGC的检索增强生成综述

原文:https://mp.weixin.qq.com/s/Z3355OEqzJBQvqXONxgO0g

RAG往期文章推荐

RAG效果差?7个指标让你的准确率大幅提升

RAG评测完整指南:指标、测试和最佳实践

收藏!RAG核心工具大全: 7大解析工具+向量模型+数据库+检索排序

GraphRAG开源生态全景:6大主流开源项目,微软/蚂蚁/港大项目同台PK

RAG系列:#5 RAG中的11种分块策略

企业级落地方案:Docker 部署 CodeGraph 多项目统一 MCP 网关,附源码

一文搞定Gerrit/Gitee/GitHub MCP Server,实现开发全流程自动化

标题: Retrieval-Augmented Generation for AI-Generated Content: A Survey

链接:https://link.springer.com/content/pdf/10.1007/s41019-025-00335-5.pdf

github: https://github.com/hymie122/RAG-Survey

这篇论文系统性地综述了检索增强生成(RAG)在AIGC中的应用,涵盖了RAG的基础范式、增强方法、跨模态应用、评估基准、局限性及未来方向。

1. 背景与动机

在算力、数据(高质量海量数据)和算法(从百万级到万亿级参数)三驾马车的驱动下,AIGC已在文本、代码、图像、视频等模态上取得巨大成功。但仍面临知识过时、长尾知识不足、训练推理成本高、数据泄露风险等问题。

RAG 的核心思想是把外部数据存储当作非参数化记忆:检索到的知识易于更新、能容纳大量长尾知识、可存放机密数据,同时还能减小模型规模、支持长上下文、加速推理。

不同于已有的综述论文只聚焦 LLM 文本场景的 query-based RAG,论文覆盖基础范式---增强技术---跨模态应用---评测基准---局限与展望全链条。

2. 预备知识

通用 RAG 架构(两个核心模块):检索器接收查询并从数据存储中搜索相关信息,原始查询与检索结果通过某种增强方式送入生成器,生成器最终产出内容。

四类主流生成模型

  • Transformer:自注意力 + 前馈网络,每步做词表分类输出;

  • LSTM:带门控机制的循环网络,缓解长程依赖的梯度问题;

  • 扩散模型(Diffusion/LDM):先加噪再逆向去噪生成,适用于图像、音频、分子等;

  • GAN:生成器与判别器对抗训练。

检索器分类

  • 稀疏检索:基于词项匹配统计(TF-IDF、BM25、查询似然),构建倒排索引;

  • 稠密检索:用 BERT 类模型将查询和键编码为稠密向量(即 DPR, Dense Passage Retrieval),用余弦/内积等度量相似度,训练时用对比学习 + 负样本,推理时用 ANN 索引(HNSW、DiskANN、SPANN 等)加速;

  • 其他检索:编辑距离、代码 AST 距离、知识图谱 k 跳邻域搜索、命名实体识别(NER)等。

3. RAG 基础范式(全文核心分类)

按检索信息如何作用于生成器分为 4 大类

(1) Query-based RAG(查询增强)

  • 原理:检索内容与原始查询拼接后直接作为生成器输入(提示词增强)

  • 代表工作:REALM(双 BERT 架构)、Lewis et al.(DPR + BART)、REPLUG(把 LLM 当黑盒)、In-Context RALM;图像领域 RetrieveGAN、IC-GAN;3D 领域 RetDream 等

  • 特点:模块化、即插即用、部署快,提示词设计是关键

(2) Latent Representation-based RAG(隐表征增强)

  • 原理:检索结果编码为隐向量,在模型中间层(注意力、交叉注意力)融合

  • 代表工作FiD (每个检索段落独立编码、融合后由单一解码器生成)和 RETRO(分块交叉注意力 CCA 融合检索内容);还有 Unlimiformer(Transformer 块内集成 kNN 突破上下文长度)等。图像领域用交叉注意力融合,3D 动作生成 ReMoDiffuse/AMD,音频 Re-AudioLDM,视频字幕 R-ConvED/CARE 等。

  • 特点:适配面广、融合深,但需要额外训练对齐隐空间。

(3)Logit-based RAG(对数概率增强)

  • 原理:在解码阶段,把检索得到的分布与模型原生 logit 做加权融合

  • 代表工作kNN-LM 及其变体、TRIME、NPM(用非参数数据分布替代 softmax,长尾场景效果显著);代码领域 RECODE、kNN-TRANX,图像描述 MA

  • 特点:适合序列生成,生成器与检索在概率层面解耦

(4)Speculative RAG(推测式增强)

  • 原理 :用检索直接替代部分生成步骤,节省资源、加速响应。

  • 代表工作:REST(用检索替代投机解码中的小模型生成草稿)、GPTCache(语义缓存)、COG(把生成分解为"复制粘贴"操作)。

  • 特点:主要适用于序列类数据

4. RAG 增强方法

论文把工程优化分成五大方向:输入增强、检索器增强、生成器增强、结果增强、全流水线增强

(1)输入增强

  • 查询变换:HyDE、Query2doc 生成伪文档、复杂查询拆解子查询

  • 数据增强:清洗、扩充知识库素材

(2)检索器增强

  • 递归检索(ReACT、RATP 用 MCTS)

  • 分块优化(small-to-big、RAPTOR 多层树)

  • 检索器微调(REPLUG、SYNCHROMESH)

  • 混合检索(稀疏+稠密,Rencos、CRAG)

  • 重排序(Re2G、monoT5)

  • 检索内容变换(FILCO 去噪、FiD-Light 压缩)

(3)生成增强

  • 提示工程(LLMLingua 压缩、Stepback/CoT 提示)

  • 解码调优(温度、词表约束)

  • 生成器微调(RETRO、LoRA 适配如 Animate-A-Story)

(4)结果增强

  • 输出改写/重排(SARGAM、Ring、CBR-KBQA)

(5)管线增强

  • 自适应检索:判断要不要检索,不需要的时候跳过检索,减少开销;分为规则驱动(FLARE、SKR、Self-RAG)、模型驱动(Self‑RAG)

  • 迭代 RAG:多轮 检索‑生成 循环,反复补全缺失知识,提升复杂任务性能

5. 跨模态应用综述

论文用一张大表按 模态 × 任务 × 所用范式 × 增强环节 系统梳理了约 200 项工作:

  • 文本:问答(REALM、FiD、RETRO、TOG、Atlas)、事实核验(CONCRETE)、常识推理(KG-BART)、人机对话(BlenderBot3、ConceptFlow)、机器翻译(kNN-MT、TRIME)、事件抽取、摘要(Unlimiformer、RPRR)等 7 类任务

  • 代码:代码生成(APICoder、DocPrompting)、代码摘要(Rencos、EditSum)、代码补全(ReACC、RepoCoder)、自动程序修复(InferFix、RAP-Gen)、Text-to-SQL(XRICL、SYNCHROMESH)等------代码领域特色是用 AST/编辑距离检索、检索相似样例填提示词

  • 知识:知识库问答(ReTraCk、TIARA、CBR-KBQA)、知识增强开放域问答(UniK-QA、KG-FiD)、表格问答(EfficientQA、StructGPT)

  • 图像:生成(RetrieveGAN、Re-Imagen、KNN-Diffusion、RDM)与描述(RA-Transformer、SmallCap、REVEAL)

  • 视频:视频描述(R-ConvED、CARE、EgoInstructor)、视频问答对话(MA-DRNN、R2A)、故事生成(Animate-A-Story)

  • 音频:Re-AudioLDM、Make-An-Audio、RECAP

  • 3D:ReMoDiffuse、AMD、RetDream(文生动作/三维)

  • 科学:药物发现(RetMol、PromptDiff)、生物医学(PoET、Chat-Orthopedist、BIOREADER)、数学(LeanDojo 定理证明)

6. 评测基准

基准 评估维度
Chen et al. 噪声鲁棒性、负例拒绝、信息整合、反事实鲁棒性
RAGAS, ARES, TruLens 忠实度、答案相关性、上下文相关性
CRUD-RAG 创建、读取、更新、删除
MIRAGE 医学问答
KILT 知识密集型任务
CRAG, Multihop-RAG, Legalbench-RAG, OmniEval 多领域、多任务评估

论文梳理了 5 个主流 RAG 基准:RGB、CRUD-RAG (中文综合基准)、ARES (自动化评估框架)、RAGAS (自动化评测)、KILT(知识密集型任务基准)。同时也指出基准建设仍不充分,尤其在非文本模态。

7. 局限性与未来方向

  • 长上下文 vs. RAG:长上下文 LLM 的兴起对 RAG 构成挑战,二者如何结合(如用 RAG 选择真正需要的内容再送入长上下文)值得研究

  • 鲁棒性:检索噪声、错误信息、对抗性内容会误导生成,导致幻觉

  • 效率与延迟:检索、重排、迭代检索带来延迟、存储开销,不利于低延迟实时服务

  • **检索器‑生成器鸿沟:**两者优化目标、隐空间不一致;联合训练和模块化之间存在取舍

相关推荐
东莞市云毅网络有限公司8 小时前
企业知识库问答的自动化评测:构建 golden set 与回归脚本
python·rag·检索·企业知识库·评测集
东莞市云毅网络有限公司1 天前
企业非结构化资料拆分成可引用片段:一套能跑通的预处理流水线
python·数据清洗·rag·企业知识库·文档解析
像风一样自由20202 天前
23.OCR在知识库中的作用扫描件和图片文字如何进入RAG
postgresql·大模型·ocr·rag
梦想不只是梦与想2 天前
大模型系列(三):提示工程、RAG 与 Agent
大模型·agent·rag
ShallWeL2 天前
RAG Embedding 模型替换与索引回归
人工智能·embedding·知识库·工作流·rag
程序员柒叔2 天前
Dify -- 定时任务系统
人工智能·github·agent·dify·rag
寻道码路2 天前
大模型工程化实战(八):OTel + LangFuse 全链路 Trace——把网关、护栏、SchemaGate 全部打点串起来,出问题一眼定位到环节
大模型·agent·mlops·rag·ai工程化·langfuse·llm可观测
uncle_ll3 天前
智能客服实践:微调+RAG双引擎架构落地
llm·agent·智能客服·rag·llamaindex
甜辣uu4 天前
智能体Agent性能优化从原理到实战
人工智能·性能优化·大模型·llm·agent·rag·智能体