RAG Day05 混合检索

上周学习了索引构建,本周开始学习检索相关。

索引是建立向量数据库时为这个信息提供一个标识,这种标识一般比较短,并且包含这块信息的主干内容,为将来快速检索打下了基础。

检索是希望更快的匹配问题语义和向量数据库的语义,那么语义如何与向量数据库对应也是快速检索的前提条件之一。

语义在向量化的过程中大致分为两类:稀疏向量和密集向量。

稀疏向量指的就是TF-IDF相关技术。他通过一个公式精确的将词频和词对应了起来,给更高的词频分配了更稀疏的向量编码,这个技术的好处是可以精确检索对应相关词条,整个过程具有强的可解释性和更高的效率,缺点是直接忽略未登录词。

密集向量在单词和向量映射之间采用了深度学习模型,从语义本位的角度出发理论上来说,相似语义的向量距离会更近,不相似语义的向量距离会更远。他的优点是通过深度学习的理论无限接近了语义这个理想点,缺点是可解释性差,并且需要大数据和算力。

所谓混合检索就是稀疏检索和密集检索的加权。

利用二者的优势,更加理想化的接近了真实语义。

(代码设计了milvus,很难看懂,脑壳疼。)

学习内容来自Datawhale

还是很感谢开源精神,能写出这么一份高质量的教程也很不容易~

all-in-rag/docs/chapter4/11_hybrid_search.md at main · datawhalechina/all-in-rag · GitHub

相关推荐
北斗落凡尘44 分钟前
LangGraph 入门实战(11)--输出模式
后端·python·langchain
赵广陆6 小时前
企业实战:数据图与状态定义
pycharm·langchain·langgraph
青山是哪个青山6 小时前
LangChain 学习笔记(九):上下文与记忆
笔记·学习·langchain
一只叫煤球的猫10 小时前
Spring AI 2.0 源码解析(二):Starter 如何自动装配 ChatClient ?
后端·面试·langchain
GISer_Jing11 小时前
全栈AI实战:基于 TypeScript + LangChain + MCP 的企业级智能研发助手
前端·后端·ai·langchain·前端框架
红鼻子时代12 小时前
从 @tool 到四层架构:一个查天气 Agent 的拆解
langchain·agent·软件架构
circuitsosk1 天前
AI输出的“质检员”:构建智能体质量评估、异常检测与人工兜底的三层防线
人工智能·python·microsoft·正则表达式·langchain
l1258651 天前
# RAG重排序实战:硅基流动bge-reranker-v2-m3在线API vs 本地CrossEncoder,一篇讲透两种方案
数据库·人工智能·python·深度学习·算法·机器学习·langchain
JaydenAI1 天前
[基于AgentEvals的自动化评估-06]以LLM-as-a-Judge评估LangGraph执行轨迹
ai·langchain·agent·evaluation·openevals·agentevals
北斗落凡尘1 天前
LangGraph 入门实战(10)--时光回溯
python·langchain