第二阶段 15 · prefix / wildcard / fuzzy 模糊匹配

15 · prefix / wildcard / fuzzy 模糊匹配

阶段:第二阶段 / 查询能力

ES 查询:prefix / wildcard / fuzzy | PostgreSQL 对照:LIKE 'abc%' / LIKE '%x%' / 模糊纠错


1. 概念

三种「非精确」匹配,都作用在 keyword(或 text 的词项)上:

ES 查询 作用 SQL 对应
prefix 前缀匹配 LIKE 'abc%'
wildcard 通配符匹配(* 多字符,? 单字符) LIKE '%x%' / LIKE 'a?c'
fuzzy 允许拼写误差(编辑距离) PG 没有直接语法(近似 pg_trgm

⚠️ 这三种都可能很慢 (尤其前置通配 *abc),生产环境慎用大范围。


2. PostgreSQL 对照

sql 复制代码
-- prefix
SELECT * FROM salesdata WHERE invoice_number LIKE 'INV-2026%';

-- wildcard(包含)
SELECT * FROM salesdata WHERE invoice_number LIKE '%2026%';

-- fuzzy(拼写容错,PG 需 pg_trgm 扩展)
SELECT * FROM salesdata WHERE material % 'ThinkPd';  -- 相似度

3. ES DSL

prefix(前缀)

复制代码
GET salesdata_idx/_search
{
  "query": { "prefix": { "invoice_number": "INV-2026" } }
}

wildcard(通配符)

复制代码
GET salesdata_idx/_search
{
  "query": { "wildcard": { "invoice_number": "*2026*" } }
}

fuzzy(拼写容错)

复制代码
GET salesdata_idx/_search
{
  "query": {
    "fuzzy": {
      "material": { "value": "ThinkPd", "fuzziness": "AUTO" }
    }
  }
}

fuzziness: AUTO 会根据词长自动决定允许的编辑距离(通常 1~2)。


4. Spring Boot 实现

java 复制代码
@Component
public class Doc15FuzzyQuery {

    @Autowired
    private ElasticsearchClient elasticsearchClient;

    /** LIKE 'prefix%' */
    public List<Map<String, Object>> prefix(String indexName, String field, String prefix)
            throws IOException {
        SearchResponse<Map> resp = elasticsearchClient.search(s -> s
                .index(indexName)
                .query(q -> q.prefix(p -> p.field(field).value(prefix))),
                Map.class);
        return toSourceList(resp);
    }

    /** LIKE '%pattern%',pattern 里用 * 和 ? */
    public List<Map<String, Object>> wildcard(String indexName, String field, String pattern)
            throws IOException {
        SearchResponse<Map> resp = elasticsearchClient.search(s -> s
                .index(indexName)
                .query(q -> q.wildcard(w -> w.field(field).value(pattern))),
                Map.class);
        return toSourceList(resp);
    }

    /** 拼写容错 */
    public List<Map<String, Object>> fuzzy(String indexName, String field, String value)
            throws IOException {
        SearchResponse<Map> resp = elasticsearchClient.search(s -> s
                .index(indexName)
                .query(q -> q.fuzzy(f -> f.field(field).value(value).fuzziness("AUTO"))),
                Map.class);
        return toSourceList(resp);
    }

    private List<Map<String, Object>> toSourceList(SearchResponse<Map> resp) {
        return resp.hits().hits().stream()
                .map(Hit::source).filter(Objects::nonNull)
                .collect(Collectors.toList());
    }
}

5. 坑与最佳实践

  1. 前置通配符 *abc 极慢 :等于全表扫倒排词典,能避免就避免;必要时用 wildcard 字段类型或 n-gram。
  2. 作用在 keyword :对分词后的 text 用 wildcard 结果常常反直觉。
  3. 大小写keyword 默认大小写敏感,wildcard 也是。需要不敏感可加 case_insensitive: true(8.x 支持)。
  4. fuzzy 有性能代价 :编辑距离越大越慢,AUTO 通常够用。
  5. 能用 prefix 就别用 wildcard:前缀匹配比通配快得多。

下一篇

16-match_phrase-短语.md

相关推荐
粗体鱼18 小时前
RAG/Agent 记忆混合检索多路召回:RRF 算法与Chunk RRF、Document RRF如何决策TopK
postgresql·milvus·es·rag·rff·mermory
huisheng_qaq2 个月前
【项目篇-01】Vmware虚拟机和环境安装配置
redis·mysql·canal·rocketmq·es·vaware虚拟机
JAVA面经实录9172 个月前
Elasticsearch 完整版完整知识体系
java·elasticsearch·搜索引擎·es
代码讲故事2 个月前
在没有kibana的ES(elasticsearch)线上生产环境集群中,如何通过命令行修改或增加字段而不需要reindex?
大数据·elasticsearch·搜索引擎·命令行·es·索引·模版
yurenpai(27届找实习中)2 个月前
Elasticsearch 核心总结 + 面试题实战(黑马点评项目)
redis·es
徐小青青啊2 个月前
es集群不中断实时数据更新损坏节点硬盘
大数据·elasticsearch·搜索引擎·es
醇氧2 个月前
【Hermes Agent】使用阿里云百炼 Token Plan(方式一:命令行一键配置)
阿里云·云计算·es·openclaw
RemainderTime3 个月前
基于Spring AI + 阿里百炼 DashScope:构建 AI Agent RAG 企业级知识助手
人工智能·后端·spring·ai·es
Johnstons3 个月前
Wireshark 和 tcpdump 到底怎么选?网络故障排查实战中的边界、判断标准与落地清单
wireshark·php·es·tcpdump·抓包分析·抓包与协议分析工具选型