【lucene】advanceshallow就是遍历跳表的,可以看作是跳表的遍历器

一句话总结所有关键点:

  1. `skipTo(target)` 的返回值 不是"跳过的精确文档数",而是上一个间隔已跳过累计数;

  2. `lastDoc` 是 小于 target 的最后一个间隔的最后一个 docID;

  3. `lastChildPointer` 指向 ≥ target 的那个间隔在 posting 列表中的起始文件指针;

  4. Lucene 把 docID 按全局升序排序后,只有第一个存绝对 docID,其余全部存"与前一个的差值";

  5. 这些差值被 128 个一组 block 压缩,但差值链 跨 block 连续,不会因为换块而重置;

  6. 读 block 时给 `base`(上一 block 最后一个绝对 docID),就地累加本 block 128 个 delta,避免从文件头一路算到当前位置,实现 O(1) 定位 + O(128) 解压。

相关推荐
醉颜凉3 天前
Lucene底层原理:倒排索引实现原理与代码实战,彻底吃透搜索引擎核心
搜索引擎·mybatis·lucene
risc1234567 天前
DocumentsWriterFlushQueue
lucene
risc1234567 天前
DocumentsWriterDeleteQueue 的核心设计思想
java·全文检索·lucene
music score16 天前
google 的C++自动化测试框架详解(Google Test)(2)
c++·qt·lucene
risc12345617 天前
【lucene】Scorer 和 BulkScorer的区别?
lucene
星河耀银海18 天前
Unity C#入门:变量的定义与访问权限(public/private)
unity·c#·lucene
risc12345618 天前
Elasticsearch的shrink为啥不用软链接用硬链接
elasticsearch·lucene
risc12345622 天前
lucene包文件功能概述
lucene
risc1234561 个月前
【lucene】PostingsEnum跟TermsEnum 的区别是啥?
java·lucene
risc1234561 个月前
SegmentTermsEnum#postings 和 IntersectTermsEnum#postings
算法·lucene