方案概述
RAG(Retrieval-Augmented Generation,检索增强生成)核心逻辑:检索私有知识库内真实文档资料,将用户提问与检索上下文一同输入 LLM,约束模型依托自有资料输出回答,缓解大模型幻觉问题。整体分为两大核心流程:离线知识库构建、在线问答推理。
整体架构图

离线知识库构建流程
- 原始文档录入:批量导入图片、doc、PDF等多格式文档素材
- 数据处理工厂预处理:通过OCR文本提取、文本清洗标准化、AI文本优化、文档切片完成文本预处理;原始文件存入OSS对象存储,清洗文本存入业务元数据库
- 数据向量化:拆分后的文本块输入Embedding嵌入模型,转换为低维语义向量,绑定主键、tags、分区标识
- 向量分区入库:向量、文本元数据、标签分区信息统一写入分区向量数据库
在线问答推理流程
- 用户问题输入:接收用户咨询提问
- 前置输入校验:本地词库过滤,识别无效咨询请求,无效请求直接结束流程
- AI语义分类+问题向量化:分区/标签识别缩小检索范围;使用Embedding嵌入模型将提问转为向量
- 向量相似度召回:按向量、分区、标签匹配检索,返回匹配内容的原文唯一ID
- 原文回查:根据原文ID从OSS、业务元数据库拉取完整文档内容
- 上下文拼接:将用户问题与召回原文结合提示词模板组装Prompt
- LLM生成回答:LLM大语言模型结合知识库上下文输出回答
总结
本文参考业界主流私有知识库搭建方案,结合业务理解梳理完整 RAG 业务流程,并自主设计、绘制整套 RAG 架构流程图。RAG 技术落地场景覆盖面广,可适配智能客服系统、个人私有知识库、企业内部文档库、本地代码知识库等各类问答检索场景。
本文主要阐述轻量化 RAG 知识库的基础搭建流程,可满足小型业务、低并发场景的使用需求。但在真实生产环境中,面对海量数据、大规模高并发用户场景,仍存在精度、性能、效率等优化难点,核心待优化问题及对应解决方案关键词如下:
-
文档切片精度优化:高并发海量文档场景下,如何精准控制切片尺寸、贴合语义边界,避免文本语义割裂,保障检索准确性。
核心优化关键词:符号分界切片、Parent-Document RAG 双层切片
-
高频问答性能优化:随着用户量级持续增长,如何高效复用相似提问结果,减少重复检索与模型推理开销,提升响应速度。
核心优化关键词:语义响应缓存(句式不同、语义等价)
-
全局检索效率优化:如何规避全量向量检索的资源消耗,进一步提升检索匹配精度与查询响应效率,减少无效检索。
核心优化关键词:向量分区、内容标签过滤