elasticsearch中使用fuzzy查询

文章目录

      • [1. `fuzzy` 查询的基本用法](#1. fuzzy 查询的基本用法)
      • [2. 基本的 `fuzzy` 查询](#2. 基本的 fuzzy 查询)
      • [3. `fuzziness` 的不同设置](#3. fuzziness 的不同设置)
        • [**`fuzziness` 设置为数字(编辑距离)**](#fuzziness 设置为数字(编辑距离))
        • [`fuzziness` 设置为 `0`](#fuzziness 设置为 0)
      • [4. 更多的 `fuzzy` 查询选项](#4. 更多的 fuzzy 查询选项)
      • [5. 总结](#5. 总结)

Elasticsearch 中,fuzzy 查询用于执行模糊匹配,通常用于处理拼写错误、变体或者近似匹配的场景。它基于 Levenshtein 编辑距离算法(即编辑距离,也叫做编辑距离算法)来比较字符串之间的相似度。fuzzy 查询可以通过设置允许的最大编辑距离来控制匹配的宽松度。

1. fuzzy 查询的基本用法

假设我们有一个 articles 索引,包含 title 字段。我们想通过模糊查询来查找包含与 title 字段中某个单词拼写相似的词。

示例文档:
json 复制代码
POST /articles/_bulk
{ "index": { "_id": 1 } }
{ "title": "Elasticsearch Basics" }
{ "index": { "_id": 2 } }
{ "title": "Learning Elasticsearch" }
{ "index": { "_id": 3 } }
{ "title": "Advanced Elasticsearch" }
{ "index": { "_id": 4 } }
{ "title": "Understanding Search Engines" }

2. 基本的 fuzzy 查询

假设我们要查找与 Elasticsearch 拼写相似的文章,我们可以使用 fuzzy 查询来实现。下面是一个基本的 fuzzy 查询,查找 title 字段中与 Elasticserch 类似的文档(注意拼写故意错误)。

json 复制代码
POST /articles/_search
{
  "query": {
    "fuzzy": {
      "title": {
        "value": "Elasticserch",  // 错误拼写
        "fuzziness": "AUTO"      // 自动调整模糊匹配的容忍度
      }
    }
  }
}
解释:
  • value :指定你希望查找的模糊词。这里我们故意拼错了 ElasticsearchElasticserch

  • fuzziness

    :指定允许的模糊度。

    复制代码
    AUTO

    会自动计算适当的模糊程度。它根据字符串长度自动选择适合的

    复制代码
    fuzziness

    值:

    • 对于长度小于等于 3 的词,fuzziness 被设为 0(不允许编辑)。
    • 对于长度大于 3 的词,fuzziness 被设为 12,允许一定的编辑距离。
查询结果:
json 复制代码
{
  "hits": {
    "total": { "value": 3, "relation": "eq" },
    "hits": [
      {
        "_id": "1",
        "_source": {
          "title": "Elasticsearch Basics"
        }
      },
      {
        "_id": "2",
        "_source": {
          "title": "Learning Elasticsearch"
        }
      },
      {
        "_id": "3",
        "_source": {
          "title": "Advanced Elasticsearch"
        }
      }
    ]
  }
}

在这个例子中,ElasticserchElasticsearch 的拼写差异是允许的,因此所有包含 Elasticsearch 的文档都返回了。

3. fuzziness 的不同设置

fuzziness 设置为数字(编辑距离)

除了 AUTO,你还可以手动指定一个数字,表示允许的最大编辑距离。编辑距离是指从一个字符串转换到另一个字符串所需的最小字符编辑次数(包括插入、删除或替换字符)。

例如,fuzziness 设置为 2 表示最多允许 2 次字符编辑:

json 复制代码
POST /articles/_search
{
  "query": {
    "fuzzy": {
      "title": {
        "value": "Elasticserch",
        "fuzziness": 2   // 允许最多 2 次编辑
      }
    }
  }
}
fuzziness 设置为 0

如果你将 fuzziness 设置为 0,那么 Elasticsearch 会要求字段完全匹配,不允许任何类型的字符修改:

json 复制代码
POST /articles/_search
{
  "query": {
    "fuzzy": {
      "title": {
        "value": "Elasticserch",
        "fuzziness": 0  // 不允许任何编辑
      }
    }
  }
}

4. 更多的 fuzzy 查询选项

你还可以在 fuzzy 查询中使用更多选项来定制查询:

  • prefix_length :指定匹配的前缀长度。此参数可以提高查询性能。如果一个词的前缀部分没有变化,那么 fuzzy 查询会只在剩下的部分进行匹配。
  • max_expansions:限制查询扩展的最大数量。用于控制在查询中允许的最大变体数量,从而提高查询效率。
示例:
json 复制代码
POST /articles/_search
{
  "query": {
    "fuzzy": {
      "title": {
        "value": "Elasticserch",
        "fuzziness": 2,
        "prefix_length": 3,    // 前 3 个字符必须完全匹配
        "max_expansions": 10    // 允许最多 10 次变体扩展
      }
    }
  }
}

5. 总结

  • fuzzy 查询:用于执行基于编辑距离的模糊匹配,适用于拼写错误、变体或近似匹配。
  • fuzziness
    • AUTO:自动设置编辑距离。
    • 数字(如 12):指定允许的最大编辑距离。
    • 0:要求完全匹配。
  • prefix_length:设置匹配的前缀长度。
  • max_expansions:控制查询扩展的最大变体数量。
相关推荐
Elasticsearch7 小时前
一次编辑,更新所有仪表板:使用 Terraform 大规模管理 Kibana 可观测性配置
elasticsearch
Elasticsearch8 小时前
足够接近就是足够快:ES|QL Fast 模式如何让 Kibana 仪表板速度提升最高 100 倍
elasticsearch
Elasticsearch9 小时前
一分钟内从提示词生成仪表板,成本降低 5 倍:Kibana 中的 AI 仪表板和自定义 Vega-Lite 图表
elasticsearch
雾屿_Mistisle9 小时前
敏感文件泄露
大数据·elasticsearch·搜索引擎
Elasticsearch9 小时前
Elastic 9.5: Columnar 、 VectorDB 索引模式与自动校准,以及由 AI 驱动的告警分类整理
elasticsearch
晚安code9 小时前
一、Elasticsearch查询的 DSL 骨架:先把 JSON 看懂
elasticsearch
XS03010610 小时前
Git远程仓库实操笔记
笔记·git·elasticsearch
love530love11 小时前
Ubuntu系统通过Homebrew安装Lightpanda完整实战教程(含端口占用排坑)
大数据·linux·运维·人工智能·elasticsearch·搜索引擎
Elasticsearch21 小时前
将 Embedding 模型加载到 Elasticsearch 中
elasticsearch
Elasticsearch1 天前
使用 Elasticsearch open inference API 对 OpenAI chat completions 进行支持
elasticsearch