
📚 本文收录于「流浪」的系列专栏
| 🐧 Linux系统 | ⚙️ C++ |
| 📊 数据结构与算法 | 🐍 Python |
| 🔗 LangChain & LangGraph | 🗄️ MySQL 数据库 |
| 🌿 Git 工具 | 🌐 计算机网络 |
| 🤖 LLM | 💯 大厂面试、八股 |
| 📚 学习筑基专栏 |
🏠 博客主页:流浪 | 📝 原创首发于 CSDN
篇十七把幻觉的根因拆成了三层,「知识缺、知识旧」 那一层留给工程去治,治它的主流架构就是 RAG 。但企业真正卡住的地方往往不是模型不够聪明,而是知识在自己手里、模型碰不到 。
本篇讲 RAG 是什么、为什么非它不可、哪些场景已经跑出了可核实的数字。
一、背景:企业用不上通用大模型的三个卡点
大模型的能力很强,但企业真要把它接进业务,先撞上的是三堵墙。
1.1 知识不能外传
企业内部的知识库不允许对外。豆包、千问、DeepSeek 这些通用大模型没办法学习这些知识,而企业希望有个助手能根据需要提供智能问答,这件事变得非常困难。
1.2 新知识没法马上用
企业发布了新的新闻和内容,模型怎么能马上用上。政策今天改、价格明天调,模型的知识却停在训练截止那一刻,中间这段空白没人填。
1.3 回答要能标出来源
大模型说了一堆内容,和企业的说明书哪里能对上,必须把使用的来源标记出来。尤其在法律、医疗这类对准确性要求极高的领域,答得对不对只是及格线,能不能追溯到出处才是能不能用的分水岭。
三个卡点指向同一件事:通用大模型的能力边界由训练数据划定,而企业的真实需求是「用自己的知识、按自己的时效、能追责到出处」。RAG 解决的正是「大模型无法稳定访问外部知识」这个核心问题。
二、RAG 是什么

2.1 定义:检索、增强、生成三段
RAG(Retrieval-Augmented Generation,检索增强生成)是一种把信息检索(Information Retrieval, IR)技术与生成式大语言模型相结合的框架。名字里的三个字母,正好对应三件事:
- 检索:从海量的、外部知识源(如公司文档、数据库、网页等)中,根据用户的问题,找到最相关的信息片段。
- 增强:将这些检索到的相关信息,作为额外的上下文,提供给大语言模型。
- 生成:大语言模型基于原始的用户问题和检索到的增强上下文,生成更准确、更可靠、更具事实性的答案。
一句话概述:先从你的知识库里检索相关内容,把检索到的内容塞进提示词,再让模型基于这些内容生成回答。
2.2 一个直观的类比
可以把它想象成开卷考试:模型并不知道你的业务知识,但可以查资料,然后组织答案。
RAG 改的不是模型本身,而是喂给模型的东西------它把「凭参数记忆作答」换成了「凭检索到的事实作答」。模型一个参数没动,回答却从猜变成了有据可查。
三、为什么需要 RAG
3.1 知识过时与信息孤岛
大语言模型在存储形态上就是一个很大的文件,这个文件是离线训练的,一旦训练好了,大模型的知识就固定了。目前大模型没有做到实时训练,也就是说它的知识完全来自训练数据,而训练数据主要来自网络公开数据。后果有两个:
- 模型的知识被定格在训练截止时间点。对于新的知识,比如今天的新闻,模型内部是不知道的。
- 企业的产品规格文档、内部流程规范、医疗机构的诊断指南、法律机构的判例汇编,这些数据从没出现在公开网络上,通用大模型对此一无所知。不借助外部手段,模型在这些领域的回答质量会大打折扣。
3.2 大模型幻觉
大语言模型是一个条件概率模型,以前文作为条件的词表概率逐词生成文本。这一机制导致它可能出现看似逻辑严谨(概率高)、其实缺乏事实依据的生成,也就是「一本正经地胡说八道」。
更麻烦的是:训练过程是对训练数据的知识进行压缩提炼的过程,但不是无损压缩。压掉的那部分,模型会用「概率上最像的答案」补上,补出来的就是编造。
3.3 数据安全
对企业来说,数据安全是生死攸关的议题。没人愿意承担核心商业机密泄露的风险,因此几乎没有企业愿意将私有数据上传到第三方平台进行模型训练或推理。在功能和保密之间,企业往往选择的是保密------宁愿不用,也不能泄露数据。
前两条是「模型不知道」和「知道的不对」,第三条是「就算通用模型能答,企业也不敢用」。RAG 让知识留在企业自己的库里,模型每次只拿走检索到的那几段,三个问题在同一套架构里一起化解。
四、RAG常见应用场景
4.1 智能客服
RAG 在客服领域的落地最为成熟,核心价值是把企业分散的 FAQ、业务手册与实时政策,转化为可以自动响应的智能知识体系。
典型落地是一汽丰田:
- 一汽丰田借助腾讯云大模型知识引擎的 RAG 能力接入 DeepSeek,构建「检索---增强---生成」的智能客服体系。
- 自 2025 年 1 月接入以来,智能在线客服机器人独立解决率从 37% 提升到 84%,月均自动解决客户咨询问题 1.7 万次。
- 技术关键在于通过 RAG 把车型参数、售后政策这类企业专属知识「注入」大模型,生成更精准的答案。
- 来源:新浪科技·一汽丰田借助腾讯云接入 DeepSeek。
4.2 企业知识库
如果说智能客服面向外部客户,企业知识中枢则面向员工自身,目标是让组织知识可沉淀、可复用、可搜索。
广西地理信息测绘院的「组织智慧大脑」是个可直接对标的样本:
- 以「向量知识库 + RAG」为核心架构,自 2025 年 4 月启动、历时 6 个月建成,同年 10 月上线。
- 目前已完成 1200 余篇技术文档、行业论文与专利的结构化入库,覆盖全院 85% 的技术岗位。
- 查询准确率达 80%,用户满意度保持在 90%,化解了传统知识管理里「检索难、流失快、共享弱」的困境。
- 来源:国际在线·广西以 AI 赋能地理信息测绘技术传承与创新。
4.3 专业垂直领域
1 医疗健康
基于最新的临床指南、病历记录和医学文献,辅助医生进行诊断、查询用药指南。
- 北京大学第三医院发布的「三院灵智」智能体系以 DeepSeek 为技术基座,通过 RAG 技术实现医学知识的动态检索与知识蒸馏,使模型在医疗场景中的精准度与灵敏度得到显著提升。
- 该系统面向医教研、服管控多角色,完成医生门急诊、住院工作场景的全覆盖,可提供罕见病推荐、鉴别诊断、治疗方案优化、手术规划等智能支持。
- 来源:北京市卫生健康委员会·北京大学第三医院「三院灵智」智能体系发布。
2 法律法规查询
基于合规要求,检索最新的法规条文并辅助生成法律文书。
- 贵州大学依托千万级法律数据库、高价值语料库和 RAG 技术,联合律皓科技于 2023 年发布「法管家」法律大模型。
- 它是国内首个通过国家网信办「双备案」的法律垂类大模型,注册用户已突破 10 万,并接入贵州省司法厅、爽贵阳等多个便民服务平台。
- 用户上传租房合同后,3 秒即可提示 14 类风险点并生成维权建议书。
- 来源:法治网·贵州大学校企合作「法管家」取得创新性突破。
3 金融合规与分析
通过分析实时金融报告、法律法规、市场资讯,提供投资报告生成、财务数据查询等服务。
四类场景的共同点是「知识在企业手里、时效要求高、答错有代价」------这三条正是 RAG 的触发条件。反过来,如果知识本来就公开、也不要求可追溯,上 RAG 多半是给自己找麻烦。
五、工作机制全貌:两个阶段、七个环节
完整的 RAG 应用流程主要包含两个阶段:知识库构建和应用阶段。
- 知识库构建 :主要是构建知识的向量化索引,通常是离线完成的。
- 应用阶段 :根据用户的输入,RAG 系统进行在线推理,一般是一个在线服务。
七个环节按先后排下来是:
- 数据加载:把原始数据处理为结构化格式,为后续切分做准备。
- 文本分块:把大段文本拆成更小的语义单元,检索器真正搜索的是这些分块。
- 向量嵌入:用嵌入模型把文本块转成向量,语义相近的文本在向量空间里距离更近。
- 数据入库:把向量连同原始文本块和元数据存进向量数据库。
- 数据检索:把用户问题也转成向量,在库里找语义最接近的若干文本块。
- 提示词增强:把问题和检索到的文本块按模板揉在一起,并约束模型怎么用这些材料。
- LLM 生成:模型基于问题与检索上下文,生成自然语言答案。
前四步是「把文档变成可检索的向量」,后三步是「把用户问题变成有据可查的答案」。离线阶段决定这套系统的上限,在线阶段决定它用起来是什么体验。
六、文末面试题
6.1 推导题(按本讲知识点,附答案)
先自己想,再看答案------答案都用本章的逻辑推,不引入新知识。
-
【推导】RAG 为什么不能靠「把知识塞进训练数据」来解决?
答:因为模型训练完成知识就冻结了,塞进去的知识停在训练那一刻,之后新增的内容要么不知道、要么只能猜;而企业的政策、价格、流程是天天在变的,重训一次的成本和周期都扛不住这个更新频率。RAG 把知识放在库里而不是参数里,改知识只需要改库,这是两种完全不同的更新成本。
-
【推导】企业已经买了通用大模型,为什么还要单独建知识库?
答:因为通用模型的知识来自公开网络,企业的产品规格、内部流程、判例汇编从没上网,它对此一无所知;就算知道,企业也不能把私有数据传到第三方平台去训练或推理。知识库的作用是把企业自己的知识留在自己手里,只把检索到的那几段交给模型,同时解决「不知道」和「不敢给」。
-
【推导】RAG 让回答更准,但为什么说它并没有改变模型会幻觉这件事?
答:RAG 改的是喂给模型的东西,不是模型本身------它按概率续写、不校验事实的机制一个字没变。RAG 做的是把「凭参数记忆猜」换成「凭检索到的事实答」,把幻觉的概率压低;一旦检索没召到、召错了,或者上下文里的材料本身有矛盾,模型照样会照着概率编。所以是抑制,不是根除。
-
【推导】为什么 RAG 能同时缓解「知识时效」「知识覆盖」「数据安全」三个不同层的问题?
答:三个问题出自同一个根------知识被锁在参数里。知识放在库里之后,更新知识就是更新库,时效问题消失;库里可以放任意垂直领域的私域文档,覆盖问题消失;数据始终在企业自己的库里,模型每次只拿到检索出的片段,安全问题也就不再依赖「把数据交出去」。一处改动,三层受益。
-
【推导】客户问「你们的 RAG 能保证回答一定正确吗」,从机制上应该怎么答?
答:不能保证,只能保证可追溯。RAG 的答案是模型基于检索到的片段生成的,质量上限由检索质量决定------检索漏召、召错,或者片段之间有矛盾,模型依然会给出自信但错误的答案;同时模型融合多个片段时也可能推断过头。工程上能给的是引用出处、把「找不到相关信息」写成硬约束、以及高风险场景保留人工复核,而不是一句「保证正确」。
-
【推导】什么情况下 RAG 反而是多余的设计?
答:三种情况:知识本来就公开且稳定(问通用常识,模型参数里就有);要的是风格、格式或任务能力而不是知识(这种该用微调,RAG 灌知识帮不上);以及知识库规模小到一次能全塞进上下文且没有更新需求(检索带来的复杂度和延迟大于收益)。判据很简单------知识是否需要外部、是否会变、是否需要溯源,三条全否就不必上。
6.2 真题(来源已核实,转述注明)
-
什么是 RAG?它的流程分成哪几步?
答:RAG(Retrieval-Augmented Generation,检索增强生成)是结合信息检索与生成式模型的技术方案:用户提问后,系统先从外部知识库检索相关文档或片段作为上下文,再与问题一起送入大语言模型生成回答。流程分两个阶段------离线索引(文档加载、切分、向量化、存入向量数据库)与在线推理(问题向量化、相似度检索取 Top-K、拼进提示词、模型生成)。核心过程即检索、增强、生成三件事。
【真题·转述自 百度百科·检索增强生成、科普中国《检索增强生成 让大模型告别幻觉的核心密钥》】
-
RAG 和微调怎么选?各自适合什么场景?
答:看你要改的是「知识」还是「行为」。RAG 不改模型参数,知识更新只需更新库、成本低、可溯源、适合知识注入与事实问答,代价是每次推理多了检索开销、延迟更高;微调改的是模型参数,擅长改语气风格、输出格式、教特定任务的推理模式,但知识会被固化、更新要重训、且无法引用出处。需要频繁更新知识、要求可追溯时用 RAG;需要稳定风格、极低延迟或特定任务能力时用微调,工程上常见的是「微调管行为 + RAG 管知识」的混合方案。
【真题·转述自 CSDN《AI 应用开发 --- 学习清单 + 面试题库》、Acing AI·RAG Interview Questions】
-
为什么有了长上下文(Long Context),还需要 RAG?
答:真正的问题不是「能不能塞」而是「应不应该塞」。长上下文解决的是一次能读更多材料、更适合跨段落推理和长文精读;它没解决三件事------从海量知识里筛选相关信息、脏上下文污染、以及知识总量远大于窗口(百万级语料随手就能把窗口塞满)。此外长上下文每次查询都按整段输入计费、成本随长度线性上升,超长输入中部内容的召回还会退化,而语料规模一旦超过窗口就彻底无解。RAG 做的是「挑得准」,长上下文做的是「读得多」,窗口变大只会让筛选更重要。
【真题·转述自 Acing AI·RAG Interview Questions、科普中国《RAG 检索增强生成:如何根治大模型的「胡说八道」的幻觉问题?》】
💬 结语: RAG 不动模型一个参数,改的只是喂进去的东西------把凭记忆猜换成查完再说。知识留在库里而非权重里,这是它能同时治时效、覆盖和安全的原因。你业务里有哪些知识是模型永远学不到的?评论区聊聊,关注流浪,持续更新。
