什么是 Elasticsearch 倒排索引

Elasticsearch 倒排索引

核心定义

倒排索引是 ES 底层核心数据结构,作用是根据关键词快速找到对应文档,是 ES 检索速度快的根本原因。

对比正向索引:

  1. 正向索引 like 该文档包含哪些词
    缺点:检索要遍历全部文档,速度极慢
  2. 倒排索引:中间表 → 包含该词的所有文档ID
    优点:先查词,直接锁定文档,检索高效

示例

文档ID 文档内容
1 深入理解 Java 核心技术
2 深入理解 Java 虚拟机
3 Java 编程思想

步骤1:分词

用分词器把文本切割为最小检索单元,示例分词结果:深入、理解、Java、核心、技术、虚拟机、编程、思想

步骤2:生成倒排表

以词条为键,存储出现过该词的文档ID

词条 对应文档ID
深入 1,2
理解 1,2
Java 1,2,3
核心 1
技术 1
虚拟机 2
编程 3
思想 3

倒排索引的优势

  1. 查询速度快:直接通过词条匹配文档,无需全量扫描,这是核心
  2. 支持各类复杂检索:短语匹配、模糊查询、通配符等
  3. 聚合统计高效:方便统计词频、分组聚合
  4. 存储占用低:底层通过 VB Encoding、Simple9 等算法压缩存储

执行流程大致意思

  1. 检索关键词:Java
    流程:查询倒排表词条Java → 获取文档 1、2、3
  2. 检索关键词:虚拟机
    流程:查询倒排表词条虚拟机 → 获取文档 2
相关推荐
赟爸26 分钟前
直播切片素材杂乱不好复用,易元AI要怎么处理
大数据·人工智能·python
yunlaodacom33 分钟前
阿里云国际站注册:性能损耗 < 1%!基于 eBPF 的服务器异常预测实战与调优指南
大数据·服务器·阿里云
大大大大晴天1 小时前
从 Kafka 到报表:Flink、CDC 与 StarRocks 的实时入仓链路
大数据
qq_454245031 小时前
Agent数据价值分类存储原则
大数据·人工智能·分类
画中有画3 小时前
Kappa 架构在大数据实时处理系统中的应用
大数据·架构
yingyuecom3 小时前
Hi,导演:AI视频创作正在从“模型调用”走向“生产工作流”
大数据·人工智能
Elasticsearch5 小时前
训练量仅占 0.35%,竞争力却达到 100%:jina-embeddings-v5-omni 背后的冻结塔架构
elasticsearch
阿标在干嘛5 小时前
从数据碎片到决策引擎:政策快报背后的政策大数据架构逻辑
大数据·架构
青山科技分享5 小时前
跨境电商如何做GEO,让商品被AI搜索推荐?
大数据·人工智能·跨境电商
回眸&啤酒鸭6 小时前
【回眸】GPT-5.6 Luna 深度评测
大数据·人工智能·gpt