我把 22 篇 RAG 论文喂给了 RAG,让 AI 自己给我讲明白什么是 RAG

我把 22 篇 RAG 论文喂给了 RAG,让 AI 自己给我讲明白什么是 RAG

@toc


一、22 篇论文躺在硬盘里吃灰的第 47 天

最近想搞懂 RAG(检索增强生成),去 arXiv 一顿下载,22 篇经典论文 PDF 整整齐齐躺在文件夹里------然后就开始吃灰了。

为什么不读?三连痛:

  • 全英文,读一篇精神两小时。 RAG 原始论文、Self-RAG、CRAG、GraphRAG......22 篇读完,一个月下班时间没了;
  • 读过就忘,用时全凭缘分。 昨天读完 Self-RAG,今天看到 CRAG,"这俩到底谁是谁?"再翻回 PDF 找,又得从头扫一遍;
  • 写综述要跨论文对比,Ctrl+F 在 22 个 PDF 里来回横跳------"哪几篇提出了新的检索器?"手动拉表格对比到想砸键盘。

那直接问网页版大模型?它没读过你手里这批论文的细节,答得笼统还可能张冠李戴------毕竟它的训练数据不是你硬盘里这 22 篇的完整文本。

我需要的是:把这 22 篇 PDF 全读完、我用中文随便问、答案标注出自哪篇论文哪一页的助手。

巧的是,实现这个助手的技术,恰好就是这批论文讲的------RAG

左脚踩右脚上天了:我搭了一个 RAG 系统,让它读完 RAG 论文给我讲什么是 RAG。


二、方案:AnythingLLM + 蓝耘 MaaS,零代码搭 RAG

AnythingLLM:开箱即用的 RAG 桌面应用

AnythingLLM 是一个开源的 RAG 桌面应用,核心卖点就三句话:

  • 双击安装免 Docker------对比 RAGFlow / FastGPT 动辄要折腾半小时容器编排,AnythingLLM 装完就能用;
  • 工作区 = 知识库------拖 PDF 进去、自动切块向量化、问答带引用出处,全程图形界面;
  • 数据本地存储------向量库、聊天记录都在本地,不用担心文档泄露。

官网链接:

arduino 复制代码
https://anythingllm.com/

不过 AnythingLLM 只是"骨架",真正决定回答质量的还是背后的大模型。它支持接入各家 API,想要读 22 篇英文论文还能用中文对答如流,就得配一个上下文够长、推理够强、价格够便宜的云端模型------于是引出本文的第二个主角。

蓝耘 MaaS

读论文问答这个场景,对推理服务有三个要求:

  1. 标准接口------AnythingLLM 支持 OpenAI 兼容接口,填个地址就能接;
  2. 按量付费------读论文是低频场景,一天几毛钱,比包月划算;
  3. 中文 ↔ 英文跨语言能力------语料是英文论文,提问是中文,回答也要中文,考验模型的多语言理解。

蓝耘 MaaS 三项全中:

  • OpenAI 兼容接口https://maas-api.lanyun.net/v1,AnythingLLM 里选 Generic OpenAI 直接填;
  • 按量付费 + 多模型广场:DeepSeek、GLM、Kimi、Qwen 等主流模型整整齐齐,Token 按量计费,注册充值即用;
  • 中文提问 → 英文文献 → 中文回答,正好用旗舰模型的跨语言能力。

根据 AI Ping 的实测数据,蓝耘 MaaS 上主流模型的首字延迟和吞吐量表现都相当能打:


RAG 原理一张图讲清

在开始实操前,先用 300 字讲清楚 RAG 的工作链路------下面这张图,就是待会儿那 22 篇论文的核心思想

简单说:RAG = 先把文档向量化存起来,问的时候先检索相关段落、再喂给大模型生成答案。

为什么这样做?因为大模型再聪明,它的训练数据里也没有你硬盘里这 22 篇 PDF 的完整文本。RAG 的核心价值就是让大模型"读"你的私有文档------检索出相关段落放进提示词里,大模型基于这些段落回答,答案自然精准、还能标注出处。

好,原理讲完,开整。


三、准备工作:蓝耘 API + AnythingLLM 安装

第一步:蓝耘控制台拿 API Key

前往蓝耘控制台完成注册: 蓝耘官网👇

bash 复制代码
https://console.lanyun.net/#/register?promoterCode=41c01378ce

登录后在左侧导航栏找到 API 管理 / 密钥管理,点击"创建 API Key",生成后复制保存。

第二步:模型广场锁定 deepseek-v4-flash

点击左侧【模型广场】,搜索 deepseek-v4-flash

为什么选它?论文问答场景吃三样东西:英文理解能力 (RAG 论文基本都是英文)、中文生成能力 (我要中文回答)、长上下文 (一次检索可能召回几千字段落)。DeepSeek V4 Flash 官方标称 1024k 上下文,输入 1 元/百万 tokens、输出 2 元/百万 tokens------把本文的 Demo 从头玩到尾也花不了一块钱。 记下调用名称:

复制代码
deepseek-v4-flash

到这里,蓝耘侧的三件套集齐:

配置项
API Key sk-xxxxxxxx(你自己的密钥)
接口地址 https://maas-api.lanyun.net/v1(OpenAI 兼容端点)
模型名称 deepseek-v4-flash

第三步:下载安装 AnythingLLM

前往官网下载桌面版:

arduino 复制代码
https://anythingllm.com/download

Windows / Mac / Linux 都有对应安装包,下载后双击安装即可,全程图形界面,不用折腾


四、核心配置:把蓝耘接进 AnythingLLM

第一步:配置 LLM(对话大模型)

打开 AnythingLLM,进入左侧 设置 (Preferences) → LLM 设置

填入以下配置:

  • Provider:Generic OpenAI
  • Base URLhttps://maas-api.lanyun.net/v1
  • API Key:你的蓝耘 API Key
  • Chat Modeldeepseek-v4-flash
  • Model Context Window131072(131k,取 deepseek-v4-flash 支持的上下文窗口)
  • Max Tokens4096(单次回复最大 token 数)

保存即可。


第二步:配置 Embedder(向量模型)

RAG 的核心环节是向量检索 :你的中文提问要先向量化,然后去向量库里检索相似的英文段落。这就需要一个跨语言 Embedding 模型------能把中文问题和英文文档映射到同一个向量空间里,否则检索根本命中不了。

AnythingLLM 自带了一个开箱即用的本地 Embedder,不用额外找服务、也不用多付一分钱。

进入 设置 → Embedding 设置 ,选择 AnythingLLM Embedder ,模型选 multilingual-e5-small

为什么选这个?因为它:

  • 支持 100+ 语言,中文和英文都能向量化;
  • 模型体积 487MB,下载一次、后续离线使用;
  • 本地运行免费,不消耗蓝耘的 Token 配额。

这样一来,整个 RAG 链路变成:Embedding 走本地、Chat 走蓝耘------各干各的擅长活儿:向量化在本地零成本跑,推理交给云端大模型,蓝耘的 Token 全花在刀刃上。


五、喂料建库:22 篇论文进仓

第一步:新建工作区

点击左上角 + New Workspace,命名为"RAG 论文研究所"(名字随意)。

第二步:拖入 22 篇 PDF

点击工作区右侧的 Upload 按钮,选择你下载好的 22 篇 RAG 论文 PDF(全选拖进去即可)。

⚠️ 这里有个小坑: 我第一次尝试全选 22 篇一口气拖进去,结果大片 Failed:

解决方法:重试。 我没改任何设置,把失败的文件重新拖了一遍,第二次就全部成功了。疑似网络抖动或临时卡顿,如果你也遇到这个情况,别慌,重来一遍就好。

第三步:Save and Embed(向量化)

文件上传成功后,点击右侧的 Save and Embed 按钮,AnythingLLM 会开始向量化:

22 篇论文要跑一会儿(取决于你的电脑性能),进度条走完即可。


六、实测:论文助手上岗

现在,22 篇论文已经躺进向量库里了。接下来我设计了 6 个递进式问题,覆盖 RAG 系统的核心能力:精准定位、概念理解、跨文档对比、全库汇总、知识迁移、反向验证。

每个问题都以图为证,看看这个"让 RAG 讲 RAG"的助手到底行不行。


问题 1:单文档事实查询

提问: "RAG 原始论文里 RAG-Sequence 和 RAG-Token 两种模式有什么区别?"

这道题考精准定位能力------能不能在 22 篇论文里准确找到 RAG 原始论文(Lewis 2020),并提取出两种模式的核心区别。

可以看到,AnythingLLM 用 @agent 模式调用了 rag-memorydocument-summarizer 工具,先检索文档、再生成答案。

结果: 答案精准,右侧标注了引用来源------01-RAG-Lewis2020.pdf,还给出了两种模式的核心区别:RAG-Sequence 对整个序列只检索一次、RAG-Token 对每个 token 都检索一次。

单文档事实查询通过。


问题 2:概念溯源

提问: "Lost in the Middle 是什么现象?论文用什么实验证明的?"

这道题考理解 + 复述能力------不仅要找到论文,还要理解论文的核心观点并用中文清晰表达。

结果: 答案完整,不仅解释了"Lost in the Middle"现象(长上下文中间的信息容易被模型忽略),还复述了论文用多文档 QA 任务证明这个现象的实验设计。右侧引用来源标注为 12-Lost-in-the-Middle.pdf

概念溯源通过。


问题 3:跨文档对比

提问: "Self-RAG 和 CRAG 都想解决检索质量不可靠的问题,两者思路有什么不同?"

这道题考 跨 PDF 综合能力------RAG 最能打的一环。需要同时检索 Self-RAG 和 CRAG 两篇论文,提取各自的核心思路,再做对比。

结果: 答案给出了详细的对比表格,核心区别总结到位:

  • Self-RAG:模型自省要不要检索(训练时让模型学会判断何时需要检索)
  • CRAG:检索结果纠错(对检索回来的文档做置信度评估和改写)

右侧引用来源标注了两篇论文:07-Self-RAG.pdf08-CRAG-纠错式RAG.pdf

跨文档对比通过,这正是 RAG 的核心价值。


问题 4:全库汇总

提问: "这批论文里哪几篇提出了新的检索器或 Embedding 方法?分别叫什么?"

这道题考广度召回能力------需要扫描 22 篇论文,把所有提到检索器 / Embedding 方法的论文汇总出来。

结果: 答案列出了 6 篇论文及其提出的方法:

  1. DPR(稠密段落检索器)
  2. Contriever(无监督稠密检索器)
  3. BGE-M3(多语言 Embedding)
  4. Dense Passage Retrieval
  5. RETRO
  6. HyDE(假设文档 Embedding)

全库汇总通过。


问题 5:落地咨询

提问: "如果我要给企业搭一个金融文档问答系统,根据这些论文我该注意什么?"

这道题考知识迁移能力------不只是复读论文内容,而是结合论文知识给出落地建议。

结果: 答案给出了 6 条建议,涵盖检索器选择、长上下文处理、检索质量评估、多文档融合、性能优化、评估框架,每条都对应了具体论文的思路(如 Self-RAG 的自省机制、Lost in the Middle 的长上下文陷阱)。

知识迁移通过,展示了"不只是复读机"的价值。


问题 6:反向验证(不瞎编)

提问: "哪篇论文讨论了扩散模型图像生成?"

这道题是反向验证------语料里根本没有讨论扩散模型的论文,看它会不会老实说"文档中没有",还是瞎编一个答案。

结果: 答案明确回复"文档中没有相关内容",并解释了语料范围(RAG 相关论文)。

反向验证通过,不瞎编。


七、成本复盘:22 篇论文 + 几十轮问答,花了多少钱?

最后来算笔账。我在蓝耘控制台的用量页截了一张图:

成本拆解:

  • Embedding(向量化) :走的是 AnythingLLM 内置的 multilingual-e5-small 本地模型,完全免费
  • Chat(对话) :使用 deepseek-v4-flash,输入 1 元/M tokens、输出 2 元/M tokens。

从截图可以看到,22 篇论文建库 + 几十轮问答,,总计花费 不到 1 元

对比包月方案,按量付费的优势一目了然------读论文问答是低频场景,用多少付多少,比包月划算太多。


八、总结:你已经用 RAG 学完了 RAG

回顾一下整条链路:

复制代码
22 篇论文 PDF → 切块向量化 → LanceDB 向量库 → 中文提问 → 检索相关段落 → 蓝耘 deepseek-v4-flash → 中文回答(标出处)

你现在既有了工具(能跑的 RAG 系统),也懂了原理(RAG 就是这么工作的)。

更重要的是,这套工具的适用场景远不止论文助手:

  • 技术文档问答:把公司内部的 API 文档、架构设计文档喂进去,新人入职再也不用问"这个接口怎么调";
  • 政策文件检索:把几百页的政策文件、法律条文向量化,律师 / 合规同事秒查条款;
  • 合同保单助手:把历史合同、保险条款喂进去,业务员随时查询"这类客户适用哪个条款"。

换个语料,就是一个新场景。

如果这篇文章对你有帮助,欢迎点赞收藏,我们下次见。


附录:22 篇 RAG 论文清单

如果你需要这些资料,可以在评论区或者私信留言

论文 一句话定位
RAG (Lewis 2020) 开山之作,RAG 一词的出处
DPR 稠密段落检索奠基
REALM 检索增强预训练先驱
FiD 多文档融合解码
RETRO DeepMind 万亿 token 检索
Atlas 少样本检索增强
Self-RAG 模型自省要不要检索
CRAG 检索结果纠错
RAG 综述 (Gao 2023) 最常被引用的全景综述
HyDE 假设文档提升检索
REPLUG 黑盒 LLM 外挂检索
Lost in the Middle 长上下文中间信息丢失
RAPTOR 树状分层检索
GraphRAG 微软知识图谱 RAG
Dense X 命题级检索粒度
Rewrite-Retrieve-Read 查询改写
FLARE 生成中主动检索
RAGAS RAG 评估框架
Contriever 无监督稠密检索器
BGE-M3 多语言 Embedding
Adaptive-RAG 按问题难度自适应检索
kNN-LM 最近邻语言模型(史前源头)
相关推荐
怕浪猫1 小时前
第8章 前端交互与可视化:构建Agent的用户界面
aigc·openai·ai编程
小和尚同志2 小时前
超级慢讯:推推 Vercel 出的 skills.sh
人工智能·aigc
西安老张(AIGC&ComfyUI)11 小时前
第034章:ComfyUI&AIGC一阶段学习总结及下阶段学习安排
学习·aigc
神奇霸王龙12 小时前
AI视频Prompt结构化实战指南:可灵/万相/豆包
人工智能·ai·prompt·aigc·音视频·ai编程
深蓝AI16 小时前
Grok Build 实战:xAI 开源编码智能体 CLI,原生 MCP 打通工具链
aigc·ai编程
程序员麻辣烫16 小时前
Memory向量记忆系统4-文本向量化
后端·aigc
程序员麻辣烫17 小时前
Memory向量记忆系统3-数据选取
后端·aigc
程序员麻辣烫17 小时前
Memory向量记忆系统2-SQLite
后端·aigc
神奇霸王龙17 小时前
Gemini CLI 中转站配置使用教程
人工智能·ai·ai作画·aigc·ai编程·gemini·goolge