Elasticsearch 架构及 Lucene 索引结构原理入门

文章目录

  • [Elasticsearch 整体架构](#Elasticsearch 整体架构)
  • [Lucene 索引结构](#Lucene 索引结构)
  • [Lucene 倒排索引核心原理](#Lucene 倒排索引核心原理)
  • 倒排索引
  • [倒排表(Posting List)](#倒排表(Posting List))

Elasticsearch 整体架构


一个 ES Index 在集群模式下,有多个Node(节点)组成,每个节点就是ES的 instance(实例)

每个节点上会有多个 shard(分片),P1 P2 是主分片,R1 R2 是副本分片。

每个分片上对应着就是一个 Lucene Index (底层索引文件)

Lucene Index 是一个统称:

由多个 Segment(段文件,就是倒排索引)组成,每个段文件存储着的就是 Doc 文档。

commit point 记录了所有的 segments 的信息

Lucene 索引结构

Lucene 倒排索引核心原理

Lucene 是一个成熟的权威检索库,具有高性能、可伸缩的特点,并且开源、免费。在其基础上开发的分布式搜索引擎便是 Elasticsearch。

Elasticsearch 的搜索原理简单过程是,索引系统通过扫描文章中的每一个词,对其创建索引,指明在文章中出现的次数和位置,当用户查询时,索引系统就会根据事先的索引进行查找,并将查找的结果反馈给用户的检索方式。

倒排索引

倒排索引是整个 ES 的核心,正常的搜索以一本书为例,应该是由 "目录 -> 章节 -> 页码 -> 内容" 这样的查找顺序,这样是正排索引的思想。

倒排索引的思路是通过单词到文档ID的关系对应。

倒排索引包含两个部分:

  • 单词词典(Term Dictionary):记录所有文档的单词,记录单词到倒排列表的关联关系(单词词典一般比较大,通过 B+ 树或哈希拉链法实现,以满足高性能的插入与查询)
  • 倒排表(Posting List):记录了单词对应的文档结合,由倒排索引组成。
    文档ID
    词频 TF - 该单词在文档中分词的位置。用于语句搜索
    位置(Position)- 单词在文档中分词的位置,用于语句搜索
    偏移(Offset)- 记录单词的开始结束位置,实现高亮显示。

倒排表(Posting List)

倒排表记录了对应单词(Term Dictionary)所出现的的文档ID等信息。并且为了搜索的时延肯定需要放在内存中,面对海量的文档必然会存在更多量级的倒排表,为了节约空间,肯定是需要一定的压缩算法。

FOR:(Frame Of Reference)

假设某个包含某个 单词 (Term Dictionary)的文档出现了100W次,那么其对应的倒排表就会非常的大,按1个int占用空间为 4 Byte 计算,仅这么倒排表中的一项就要消耗 3.8MB 空间。

如上图所示,我们知道一个1个int是4字节,一个字节最大可以存正21亿,1个bit可以存2个数,2个bit可以存4个数(0,1,2,3)。那么假设我们存的都是非常小的数字能否将存储所占空间压下来呢。如果我们只取 posting list 中的数字差值,这将是一个非常小的数字,比如上图是100W个1。这样我们通过只取差值,得到了一个100W个1的列表,并将每个元素只耗费1bit存储了下来。这样可以压缩32倍存储空间。

但事实是,一般没有这么理想的状态。

相关推荐
Achou.Wang1 小时前
《从零实现cobra》手写一个 mini 版 Cobra
大数据·elasticsearch·搜索引擎
码农学院1 小时前
建筑机械行业AI搜索优化技术方案:基于Spring Cloud微服务架构的文件管理与智能化内容推荐系统
人工智能·spring cloud·架构
Kel2 小时前
Node.js 单线程高并发:从内核中断到 JS 回调的完整技术栈
设计模式·架构·node.js
万岳科技程序员小赵2 小时前
同城外卖系统开发:用户端、商家端、骑手端业务协同与源码架构解析
架构·同城外卖系统源码·同城外卖系统开发·同城外卖小程序
光锥智能2 小时前
原生统一架构打通底层技术壁垒 Kairos 3.1 定义具身世界模型新范式
架构
●VON2 小时前
鸿蒙 PC Markdown 编辑器换行兼容:LF、CRLF 与混合换行归一化
华为·架构·编辑器·harmonyos·鸿蒙
熊猫钓鱼>_>3 小时前
ArkTS 方舟编程语言 · 原创快速入门教程
运维·架构·ts·harmonyos·arkts·鸿蒙·js
大龄秃头程序员4 小时前
SwiftUI 实战:从零构建双引擎 LLM 聊天客户端(Ollama + DeepSeek)
架构
●VON4 小时前
鸿蒙 PC Markdown 编辑器错误处理:让失败可恢复而不是只弹提示
华为·架构·编辑器·harmonyos·鸿蒙
heimeiyingwang4 小时前
【架构实战】CI/CD流水线:从手动部署到一键上线
ci/cd·架构