RAG 检索技术 - Elasticsearch

一 什么是 Elasticsearch?

Elasticsearch(ES) 是一个分布式搜索引擎,专门用

复制代码
正排索引(传统数据库):
文档1 → ["库存", "组织", "ID"]
文档2 → ["业务", "实体", "ID"]

倒排索引(Elasticsearch):
"库存" → [文档1]
"组织" → [文档1]
"ID"   → [文档1, 文档2]
"业务" → [文档2]
"实体" → [文档2]

于全文检索。

🏗️ 架构对比

你的项目(rank_bm25):

内存中的 BM25

├── 所有文档加载到内存(134682个)

├── 每次查询都要扫描所有文档

└── 速度慢,内存占用大

Elasticsearch:

分布式索引

├── 文档存储在磁盘(倒排索引)

├── 只扫描包含关键词的文档

└── 速度快,支持海量数据

📖 ES 的核心技术:倒排索引(Inverted Index)

查询 "库存组织" 时:

  • 传统方式:扫描所有文档(慢)
  • ES 方式:直接查倒排索引 → 文档1(快)
🚀 Elasticsearch 的优势
特性 rank_bm25 Elasticsearch
数据量 几千个文档 数十亿文档
查询速度 秒级 毫秒级
内存占用 高(全部加载) 低(按需加载)
分布式 ❌ ✅
持久化 ❌ ✅
相关推荐
yuanxi20011 小时前
青海共和百万千瓦光伏光热项目并网发电:大客户销售如何用价值力抓住能源大单
大数据·职场和发展·能源·创业创新·学习方法
Y38153266212 小时前
搜索 API 响应模块:featured_snippet、PAA 与 knowledge_graph 怎么用
python·搜索引擎
W***259213 小时前
2026深度解读:Work Agent长程任务的执行机制与落地能力
大数据·人工智能
卷毛迷你猪14 小时前
快速实验篇(B07 )Session 会话化与序列
大数据·hive·hadoop
卷毛迷你猪14 小时前
快速实验篇(B08)搜索词分析实战
大数据·hive·hadoop
IT研究室15 小时前
最新大数据毕业设计选题推荐-基于大数据的考研相关视频数据可视化分析-大数据-Spark-Hadoop-Bigdata
大数据·考研·课程设计
johnsong16 小时前
幽灵协议:当AI推荐死去的SaaS,编码Agent控制层正在形成
大数据·人工智能
蝶依斓(湖南)全案整装16 小时前
旧房改造整装内容写作框架:用户痛点与叙述结构
大数据
蝶依斓(湖南)全案整装16 小时前
整装行业长尾需求内容矩阵搭建方法:从五个维度拆解用户需求
大数据·人工智能·矩阵
回眸&啤酒鸭17 小时前
GLM 5.3 Flash 批量处理实战指南
大数据·人工智能