AI 基础设施 RAG工程

RAG检索增强生成,提升大模型的实时性和准确性

RAG的工程挑战

1.chunk切片策略,过大过小多影响效果

2.query改写,用户提问往往不完整

3.混合检索,单一方式不稳定

4.精排,必须带rerank,否则召回噪声太大

5.上下文冲突,多文档合并会造成冲突

6.支持长上下文,vllm,pagedattention等技术必备

RAG本质上是给大模型外挂一个知识库,让模型能访问外部文档,实时信息和私有数据,大模型具有能力,RAG具有知识

RAG核心流程

1.Embedding(把文本向量化)

2.vector db (存储与检索)

3.Retrieve (召回)

4.rerank(精排)

5.context Assembly(构建上下文)

6.generation(生成回答)

向量本质上是将文本映射到高纬度空间的坐标,模型通过距离来衡量文本间的语义相似度,语义相近的文本距离更近

高维向量表达能力强,但检索成本高,低维向量存储检索快,但表达能力有限

通用RAG 1024最佳平衡

千万级别数据,建议低纬提升性能(512)

不同类型的embedding

文本嵌入,用于文档检索知识库RAG

指令嵌入,优化问题,文档相似度

多模态嵌入,多模态检索

token embedding,transformer输入层权重

向量数据库选型

Milvus 企业集群 十亿向量 graphSQ,filter强,插件丰富

Qdrant 高性能云原生快速落地 rest实现高并发,实时更新

PGvector 适配现有系统 百万级

让模型读懂海量文本的关键在于将非结构化的文档转化为易检索的向量,通常包括,文档分片,向量化,索引构建

RAG是否成功的关键在于数据是否干净,检索是否命中,提示是否正确

数据清洗是RAG能否成功的关键

权限控制必须合理,用户只能看到自己的文档

选择合适的嵌入模型

领域相关性高于维度

RAG的本质是数据治理,检索策略,提示词工程,性能优化,可观测性,持续评估与迭代

RAG如果不能观测每一个环节,就不能判断其优劣,

系统级指标:rag端到端延时,LLm请求延时,并发能力,向量库内存占用,索引占用

检索级指标:检索召回率,检索相关度,索引文档是否命中正确主题,向量相似度平均值,差不多任何有意义文档的比例

语义质量指标:LLM输出的语义质量,是否引用了文档,是否回答了问题,是否使用了上下文相关性

rag日志应当包含语义级别日志,不只是技术日志,

分布式追踪,帮助定位性能瓶颈,参数传递

rag可用观测性工具deepeval,ragas

传统rag的不足,是否检索的判断,检索结果质量评估,查询重写,多步推理,

agentic rag引入可决策的智能体,判断何时需要检索,是否需要重写query,判断检索结果是否足够好,自动多轮推理

agentic rag的核心是决策循环

rag实践经验

chunk策略,学生文章800至1200字符,技术文章400至800字符,binlog/sop文档300至600字符,15%至20%overlap

相关推荐
唐欢弯弯几秒前
选 Agent 还是数字员工?一张封装判据表,从技术要件到岗位边界逐项对齐
人工智能
lucas_AI3 分钟前
刚发大模型五天就被英伟达看上:Reflection AI 的 250 亿估值,买的是模型还是站队?
人工智能
用户8314550980318 分钟前
如一 Agent 架构解读(二):上下文工程——为模型构造它唯一的现实
人工智能·架构
揽秀亭长9 分钟前
音频如何转换为乐谱?扒谱流程与关键技术分析
人工智能·音视频
丙亮12 分钟前
ECC:一个Agent操作系统的深度拆解
人工智能
财迅通Ai12 分钟前
开拓全球合作新机遇 科兴制药亮相CPHI Milan 2026
大数据·人工智能·科兴制药
东来也_八门15 分钟前
我用麦当劳开放的 MCP,把那个最冷门的营养接口做成了真实配餐求解器
python
kaixin_啊啊16 分钟前
【零基础学AI】第 7 章课后练习与答案
人工智能
AI日报派送佬22 分钟前
Ultralytics YOLO 模型训练技巧与最佳实践
人工智能·python·深度学习·yolo·机器学习·计算机视觉
2501_9139817824 分钟前
Semtech与国产LoRa芯片对比:SX1276/SX1262/LR2021与ASR6601解析
人工智能·lora芯片