大模型 RAG 向量数据工程全链路架构笔记

01. 多源数据清洗与预处理

  • 目标:将非结构化文档转化为干净的标准化文本。
  • 关键步骤
    • OCR 识别
    • 噪声剔除(广告/页眉页脚)
    • 元数据 (Metadata) 提取
  • 核心技术
    • Unstructured
    • Layout Analysis
    • Markdown 转换
  • 核心细节:提取标题、时间、分类作为元数据,为后续"条件过滤查询"打下基础。

02. 智能分片策略 (Chunking)

  • 目标:解决长文本超过 Embedding 模型窗口限制及语义碎片化问题。
  • 方法:不仅仅是固定长度切分。
  • 核心技术
    • Recursive Split
    • 语义段落切分
    • 滑窗重叠 (Overlap)
  • 难点解决:采用 Small-to-Big 架构,存储细粒度子块用于检索,关联粗粒度父块用于生成上下文。

03. 高维向量化 (Embedding)

  • 目标:将文本转化为计算机可理解的数学向量。选择合适的 Embedding 模型决定了语义空间的相关性。
  • 核心技术
    • 双塔模型
    • BGE-M3 / m3e
    • Batch Processing
  • 性能优化:针对特定行业语料进行微调 (Fine-tuning),并使用批处理接口显著提升入库吞吐量。

04. 向量存储与索引构建

  • 目标:将向量及对应的原始文本、元数据存入专用向量数据库,构建高效查询索引。
  • 核心技术
    • HNSW 索引
    • IVF_PQ
    • 向量数据库
  • 工程挑战:大规模数据下选择 HNSW 索引权衡检索速度与精度,并实现多租户数据隔离。

05. 检索增强与验证 (Optimization)

  • 目标:入库后的最后一步是闭环验证。通过混合检索和重排序提升最终召回质量。
  • 核心技术
    • Hybrid Search
    • Rerank 重排序
    • HyDE 虚拟文档
  • 效果突围:引入 Reranker 模型对 Top-50 结果进行精排,彻底解决"语义相近但事实错误"的痛点。

专家级核心总结

精细化预处理

  • 垃圾入,垃圾出。数据质量是 RAG 系统的天花板。

上下文保持

  • 利用父子块和重叠机制,守住知识的语义完整性。

工程化闭环

  • 通过混合检索与重排序,实现工业级的召回精度。

掌握这套链路,你就掌握了生产级 RAG 应用的底层密码。

相关推荐
caimouse4 分钟前
MM 学习笔记 10:页面文件与系统加载器
笔记·学习·reactos
一只小菜鸡..9 分钟前
南京大学 操作系统 (JYY) 学习笔记:Hello, OS World! (程序的机器视角)
java·笔记·学习
克里斯蒂亚诺更新10 小时前
ruoyi角色权限的对应关系
笔记
2601_9605679612 小时前
电商套图自动化效率的工程量化分析——从逐张生成到批量套图的架构演进
运维·架构·自动化
shiyi.十一12 小时前
第2章:应用层 — 知识要点与架构
网络·计算机网络·架构
a11177612 小时前
2FA 验证码生成器(github登录验证 app)
笔记·学习
张忠琳13 小时前
【NVIDIA】 NVIDIA Container Toolkit v1.19.1 — OCI 模块超深度分析之三
云原生·容器·架构·kubernetes·nvidia
破碎的南瓜14 小时前
sqli--sql注入过关笔记(1,2,3,4,5,9)
数据库·笔记·sql
你想知道什么?14 小时前
线性回归-学习笔记
笔记·学习·线性回归
XUHUOJUN14 小时前
Azure Local VM 部署第 1 篇:Hyperconverged 路径完整实战
架构·azure local