我把 22 篇 RAG 论文喂给了 RAG,让 AI 自己给我讲明白什么是 RAG

@toc
一、22 篇论文躺在硬盘里吃灰的第 47 天
最近想搞懂 RAG(检索增强生成),去 arXiv 一顿下载,22 篇经典论文 PDF 整整齐齐躺在文件夹里------然后就开始吃灰了。 
为什么不读?三连痛:
- 全英文,读一篇精神两小时。 RAG 原始论文、Self-RAG、CRAG、GraphRAG......22 篇读完,一个月下班时间没了;
- 读过就忘,用时全凭缘分。 昨天读完 Self-RAG,今天看到 CRAG,"这俩到底谁是谁?"再翻回 PDF 找,又得从头扫一遍;
- 写综述要跨论文对比,Ctrl+F 在 22 个 PDF 里来回横跳------"哪几篇提出了新的检索器?"手动拉表格对比到想砸键盘。
那直接问网页版大模型?它没读过你手里这批论文的细节,答得笼统还可能张冠李戴------毕竟它的训练数据不是你硬盘里这 22 篇的完整文本。
我需要的是:把这 22 篇 PDF 全读完、我用中文随便问、答案标注出自哪篇论文哪一页的助手。
巧的是,实现这个助手的技术,恰好就是这批论文讲的------RAG。
左脚踩右脚上天了:我搭了一个 RAG 系统,让它读完 RAG 论文给我讲什么是 RAG。
二、方案:AnythingLLM + 蓝耘 MaaS,零代码搭 RAG
AnythingLLM:开箱即用的 RAG 桌面应用
AnythingLLM 是一个开源的 RAG 桌面应用,核心卖点就三句话:
- 双击安装免 Docker------对比 RAGFlow / FastGPT 动辄要折腾半小时容器编排,AnythingLLM 装完就能用;
- 工作区 = 知识库------拖 PDF 进去、自动切块向量化、问答带引用出处,全程图形界面;
- 数据本地存储------向量库、聊天记录都在本地,不用担心文档泄露。
官网链接:
arduino
https://anythingllm.com/

不过 AnythingLLM 只是"骨架",真正决定回答质量的还是背后的大模型。它支持接入各家 API,想要读 22 篇英文论文还能用中文对答如流,就得配一个上下文够长、推理够强、价格够便宜的云端模型------于是引出本文的第二个主角。
蓝耘 MaaS
读论文问答这个场景,对推理服务有三个要求:
- 标准接口------AnythingLLM 支持 OpenAI 兼容接口,填个地址就能接;
- 按量付费------读论文是低频场景,一天几毛钱,比包月划算;
- 中文 ↔ 英文跨语言能力------语料是英文论文,提问是中文,回答也要中文,考验模型的多语言理解。
蓝耘 MaaS 三项全中:
- OpenAI 兼容接口 :
https://maas-api.lanyun.net/v1,AnythingLLM 里选 Generic OpenAI 直接填; - 按量付费 + 多模型广场:DeepSeek、GLM、Kimi、Qwen 等主流模型整整齐齐,Token 按量计费,注册充值即用;
- 中文提问 → 英文文献 → 中文回答,正好用旗舰模型的跨语言能力。
根据 AI Ping 的实测数据,蓝耘 MaaS 上主流模型的首字延迟和吞吐量表现都相当能打:

RAG 原理一张图讲清
在开始实操前,先用 300 字讲清楚 RAG 的工作链路------下面这张图,就是待会儿那 22 篇论文的核心思想:

简单说:RAG = 先把文档向量化存起来,问的时候先检索相关段落、再喂给大模型生成答案。
为什么这样做?因为大模型再聪明,它的训练数据里也没有你硬盘里这 22 篇 PDF 的完整文本。RAG 的核心价值就是让大模型"读"你的私有文档------检索出相关段落放进提示词里,大模型基于这些段落回答,答案自然精准、还能标注出处。
好,原理讲完,开整。
三、准备工作:蓝耘 API + AnythingLLM 安装
第一步:蓝耘控制台拿 API Key
前往蓝耘控制台完成注册: 蓝耘官网👇
bash
https://console.lanyun.net/#/register?promoterCode=41c01378ce
登录后在左侧导航栏找到 API 管理 / 密钥管理,点击"创建 API Key",生成后复制保存。

第二步:模型广场锁定 deepseek-v4-flash
点击左侧【模型广场】,搜索 deepseek-v4-flash。
为什么选它?论文问答场景吃三样东西:英文理解能力 (RAG 论文基本都是英文)、中文生成能力 (我要中文回答)、长上下文 (一次检索可能召回几千字段落)。DeepSeek V4 Flash 官方标称 1024k 上下文,输入 1 元/百万 tokens、输出 2 元/百万 tokens------把本文的 Demo 从头玩到尾也花不了一块钱。
记下调用名称:
deepseek-v4-flash
到这里,蓝耘侧的三件套集齐:
| 配置项 | 值 |
|---|---|
| API Key | sk-xxxxxxxx(你自己的密钥) |
| 接口地址 | https://maas-api.lanyun.net/v1(OpenAI 兼容端点) |
| 模型名称 | deepseek-v4-flash |
第三步:下载安装 AnythingLLM
前往官网下载桌面版:
arduino
https://anythingllm.com/download

Windows / Mac / Linux 都有对应安装包,下载后双击安装即可,全程图形界面,不用折腾
四、核心配置:把蓝耘接进 AnythingLLM
第一步:配置 LLM(对话大模型)
打开 AnythingLLM,进入左侧 设置 (Preferences) → LLM 设置。

填入以下配置:
- Provider:Generic OpenAI
- Base URL :
https://maas-api.lanyun.net/v1 - API Key:你的蓝耘 API Key
- Chat Model :
deepseek-v4-flash - Model Context Window :
131072(131k,取 deepseek-v4-flash 支持的上下文窗口) - Max Tokens :
4096(单次回复最大 token 数)
保存即可。
第二步:配置 Embedder(向量模型)
RAG 的核心环节是向量检索 :你的中文提问要先向量化,然后去向量库里检索相似的英文段落。这就需要一个跨语言 Embedding 模型------能把中文问题和英文文档映射到同一个向量空间里,否则检索根本命中不了。
AnythingLLM 自带了一个开箱即用的本地 Embedder,不用额外找服务、也不用多付一分钱。
进入 设置 → Embedding 设置 ,选择 AnythingLLM Embedder ,模型选 multilingual-e5-small:

为什么选这个?因为它:
- 支持 100+ 语言,中文和英文都能向量化;
- 模型体积 487MB,下载一次、后续离线使用;
- 本地运行免费,不消耗蓝耘的 Token 配额。
这样一来,整个 RAG 链路变成:Embedding 走本地、Chat 走蓝耘------各干各的擅长活儿:向量化在本地零成本跑,推理交给云端大模型,蓝耘的 Token 全花在刀刃上。
五、喂料建库:22 篇论文进仓
第一步:新建工作区
点击左上角 + New Workspace,命名为"RAG 论文研究所"(名字随意)。
第二步:拖入 22 篇 PDF
点击工作区右侧的 Upload 按钮,选择你下载好的 22 篇 RAG 论文 PDF(全选拖进去即可)。 
⚠️ 这里有个小坑: 我第一次尝试全选 22 篇一口气拖进去,结果大片 Failed:

解决方法:重试。 我没改任何设置,把失败的文件重新拖了一遍,第二次就全部成功了。疑似网络抖动或临时卡顿,如果你也遇到这个情况,别慌,重来一遍就好。

第三步:Save and Embed(向量化)
文件上传成功后,点击右侧的 Save and Embed 按钮,AnythingLLM 会开始向量化:

22 篇论文要跑一会儿(取决于你的电脑性能),进度条走完即可。
六、实测:论文助手上岗
现在,22 篇论文已经躺进向量库里了。接下来我设计了 6 个递进式问题,覆盖 RAG 系统的核心能力:精准定位、概念理解、跨文档对比、全库汇总、知识迁移、反向验证。
每个问题都以图为证,看看这个"让 RAG 讲 RAG"的助手到底行不行。
问题 1:单文档事实查询
提问: "RAG 原始论文里 RAG-Sequence 和 RAG-Token 两种模式有什么区别?"
这道题考精准定位能力------能不能在 22 篇论文里准确找到 RAG 原始论文(Lewis 2020),并提取出两种模式的核心区别。

可以看到,AnythingLLM 用 @agent 模式调用了 rag-memory 和 document-summarizer 工具,先检索文档、再生成答案。

结果: 答案精准,右侧标注了引用来源------01-RAG-Lewis2020.pdf,还给出了两种模式的核心区别:RAG-Sequence 对整个序列只检索一次、RAG-Token 对每个 token 都检索一次。
✅ 单文档事实查询通过。
问题 2:概念溯源
提问: "Lost in the Middle 是什么现象?论文用什么实验证明的?"
这道题考理解 + 复述能力------不仅要找到论文,还要理解论文的核心观点并用中文清晰表达。

结果: 答案完整,不仅解释了"Lost in the Middle"现象(长上下文中间的信息容易被模型忽略),还复述了论文用多文档 QA 任务证明这个现象的实验设计。右侧引用来源标注为 12-Lost-in-the-Middle.pdf。
✅ 概念溯源通过。
问题 3:跨文档对比
提问: "Self-RAG 和 CRAG 都想解决检索质量不可靠的问题,两者思路有什么不同?"
这道题考 跨 PDF 综合能力------RAG 最能打的一环。需要同时检索 Self-RAG 和 CRAG 两篇论文,提取各自的核心思路,再做对比。

结果: 答案给出了详细的对比表格,核心区别总结到位:
- Self-RAG:模型自省要不要检索(训练时让模型学会判断何时需要检索)
- CRAG:检索结果纠错(对检索回来的文档做置信度评估和改写)
右侧引用来源标注了两篇论文:07-Self-RAG.pdf 和 08-CRAG-纠错式RAG.pdf。
✅ 跨文档对比通过,这正是 RAG 的核心价值。
问题 4:全库汇总
提问: "这批论文里哪几篇提出了新的检索器或 Embedding 方法?分别叫什么?"
这道题考广度召回能力------需要扫描 22 篇论文,把所有提到检索器 / Embedding 方法的论文汇总出来。

结果: 答案列出了 6 篇论文及其提出的方法:
- DPR(稠密段落检索器)
- Contriever(无监督稠密检索器)
- BGE-M3(多语言 Embedding)
- Dense Passage Retrieval
- RETRO
- HyDE(假设文档 Embedding)
✅ 全库汇总通过。
问题 5:落地咨询
提问: "如果我要给企业搭一个金融文档问答系统,根据这些论文我该注意什么?"
这道题考知识迁移能力------不只是复读论文内容,而是结合论文知识给出落地建议。

结果: 答案给出了 6 条建议,涵盖检索器选择、长上下文处理、检索质量评估、多文档融合、性能优化、评估框架,每条都对应了具体论文的思路(如 Self-RAG 的自省机制、Lost in the Middle 的长上下文陷阱)。
✅ 知识迁移通过,展示了"不只是复读机"的价值。
问题 6:反向验证(不瞎编)
提问: "哪篇论文讨论了扩散模型图像生成?"
这道题是反向验证------语料里根本没有讨论扩散模型的论文,看它会不会老实说"文档中没有",还是瞎编一个答案。

结果: 答案明确回复"文档中没有相关内容",并解释了语料范围(RAG 相关论文)。
✅ 反向验证通过,不瞎编。
七、成本复盘:22 篇论文 + 几十轮问答,花了多少钱?
最后来算笔账。我在蓝耘控制台的用量页截了一张图:

成本拆解:
- Embedding(向量化) :走的是 AnythingLLM 内置的
multilingual-e5-small本地模型,完全免费; - Chat(对话) :使用
deepseek-v4-flash,输入 1 元/M tokens、输出 2 元/M tokens。
从截图可以看到,22 篇论文建库 + 几十轮问答,,总计花费 不到 1 元。
对比包月方案,按量付费的优势一目了然------读论文问答是低频场景,用多少付多少,比包月划算太多。
八、总结:你已经用 RAG 学完了 RAG
回顾一下整条链路:
22 篇论文 PDF → 切块向量化 → LanceDB 向量库 → 中文提问 → 检索相关段落 → 蓝耘 deepseek-v4-flash → 中文回答(标出处)
你现在既有了工具(能跑的 RAG 系统),也懂了原理(RAG 就是这么工作的)。
更重要的是,这套工具的适用场景远不止论文助手:
- 技术文档问答:把公司内部的 API 文档、架构设计文档喂进去,新人入职再也不用问"这个接口怎么调";
- 政策文件检索:把几百页的政策文件、法律条文向量化,律师 / 合规同事秒查条款;
- 合同保单助手:把历史合同、保险条款喂进去,业务员随时查询"这类客户适用哪个条款"。
换个语料,就是一个新场景。
如果这篇文章对你有帮助,欢迎点赞收藏,我们下次见。
附录:22 篇 RAG 论文清单
如果你需要这些资料,可以在评论区或者私信留言
| 论文 | 一句话定位 |
|---|---|
| RAG (Lewis 2020) | 开山之作,RAG 一词的出处 |
| DPR | 稠密段落检索奠基 |
| REALM | 检索增强预训练先驱 |
| FiD | 多文档融合解码 |
| RETRO | DeepMind 万亿 token 检索 |
| Atlas | 少样本检索增强 |
| Self-RAG | 模型自省要不要检索 |
| CRAG | 检索结果纠错 |
| RAG 综述 (Gao 2023) | 最常被引用的全景综述 |
| HyDE | 假设文档提升检索 |
| REPLUG | 黑盒 LLM 外挂检索 |
| Lost in the Middle | 长上下文中间信息丢失 |
| RAPTOR | 树状分层检索 |
| GraphRAG | 微软知识图谱 RAG |
| Dense X | 命题级检索粒度 |
| Rewrite-Retrieve-Read | 查询改写 |
| FLARE | 生成中主动检索 |
| RAGAS | RAG 评估框架 |
| Contriever | 无监督稠密检索器 |
| BGE-M3 | 多语言 Embedding |
| Adaptive-RAG | 按问题难度自适应检索 |
| kNN-LM | 最近邻语言模型(史前源头) |