【Lucene】lucene的searcher.search查询机制

lucene查询的时候也是先评分排序,最后才获取文档 甚至获取文档都不是必须的?

是的,你的理解完全正确。

  1. Lucene 查询流程 = 先评分 & 排序,后可选地取回文档
  • IndexSearcher.search(...) 在内部先创建 `Weight`、`Scorer`,再交给 Collector 遍历倒排表。

  • Collector(如 TopScoreDocCollector) 一边遍历一边实时计算 score 并维护一个优先队列(PriorityQueue),因此"打分 → 排序"发生在遍历倒排表阶段。

  • TopDocs 返回的只是 "docId + score" 的堆顶列表;真正的 `Document` 对象此时并未加载。

  1. 获取 Document 不是必须的
  • 只有当你调用 `searcher.doc(docId)` 或 `IndexSearcher.doc(...)` 时,Lucene 才会根据 docId 去 stored fields 做随机读;

  • 如果你只需要 命中数、聚合、统计、自定义 Collector 计算,完全可以不取回 Document,从而节省大量 IO。

  1. 代码示例:只统计命中数,不加载文档

```java

TotalHitCountCollector c = new TotalHitCountCollector();

searcher.search(query, c);

System.out.println("命中:" + c.getTotalHits()); // 无 Document 加载

```

  1. 小结

阶段 是否发生 是否必须

倒排表遍历 + 打分 + 排序 ✅ ✅

加载 stored fields 取 Document ✅ ❌(按需)

因此,Lucene 可以在完全不取回 Document 的情况下完成一次查询,这正是它高性能的关键之一。

相关推荐
risc1234566 天前
【lucene】impacts与帕累托最优
lucene
risc1234567 天前
通过树来理解访问者模式 访问者模式的灵魂在于数据结构的遍历 访问者访问的是数据结构的某一个元素他要觉得要不要访问这个元素或者访问哪些元素
lucene·访问者模式
risc12345611 天前
内隐表征构建
lucene
J_bean12 天前
Elasticsearch 倒排索引中词条索引原理分析 — 基于 Lucene FST
elasticsearch·lucene·倒排索引·词条索引·fst
野区捕龙为宠18 天前
Unity 持久化数据
unity·游戏引擎·lucene
拼搏的水杯24 天前
使用Lucene.Net实现全文检索
全文检索·.net·lucene
sunxunyong1 个月前
ranger与solr&ldap&doris集成部署
solr·lucene
编码者卢布1 个月前
【Azure AI Search】Index的字段使用默认Analyzer(standard.lucene) 和 en.microsoft 有什么不同?
microsoft·lucene·azure
2601_961875242 个月前
法考资料电子版|pdf|资料已整理
elasticsearch·搜索引擎·pdf·全文检索·solr·lucene·sphinx
2601_961845422 个月前
考研公共课资料推荐|英语数学政治|电子版|资料已整理
搜索引擎·中文分词·solr·lucene·sphinx·高考