黑马es学习

es

  • [0. 基础概念](#0. 基础概念)
    • [0.1 倒排索引](#0.1 倒排索引)
    • [0.2 文档、索引](#0.2 文档、索引)
    • [0.3 与mysql对比](#0.3 与mysql对比)
  • [1 基本操作](#1 基本操作)
    • [1.1 mapping 索引库操作](#1.1 mapping 索引库操作)
    • [1.2 单个文档CRUD](#1.2 单个文档CRUD)
  • [3. DSL查询](#3. DSL查询)
    • [3.1 查询所有](#3.1 查询所有)
    • [3.2 全文检索](#3.2 全文检索)
    • [3.3 精确查询](#3.3 精确查询)
    • [3.4 复合查询-相关性得分](#3.4 复合查询-相关性得分)
    • [3.5 分页](#3.5 分页)
    • [3.6 高亮](#3.6 高亮)
    • [3.7 总结](#3.7 总结)
  • [2. RestClient](#2. RestClient)
  • [4. aggs聚合](#4. aggs聚合)
    • [4.1 bucket(分桶)聚合](#4.1 bucket(分桶)聚合)
    • [4.2 metrics聚合](#4.2 metrics聚合)
  • [5. mysql与es数据同步](#5. mysql与es数据同步)
  • [6. es集群](#6. es集群)
  • extra:es集群数据去重

黑马视频

官方使用手册

java client


0. 基础概念

es本质:一个基于Lucence开发出来的分布式搜索引擎

0.1 倒排索引

创建倒排索引后给词条创建索引,总计进行了两次查询

0.2 文档、索引

文档:一条数据记录

索引:类型相同的文档的集合

0.3 与mysql对比

交易等一致性要求高的mysql做

大范围搜索es做

1 基本操作

1.1 mapping 索引库操作

举例:注意object嵌套关系

禁止修改索引库,但是可以添加新字段

1.2 单个文档CRUD

文档查询:

_source字段下是查询到的原始文档

文档修改:

全量修改:旧的直接删除,新增改后的文档

增量修改:在旧的上面修改

3. DSL查询

dsl常见查询分类:

3.1 查询所有

3.2 全文检索

muti_match的方式能够额外指定针对哪些字段进行查询(任意一个字段包含即可)

3.3 精确查询

值是确定的,不可分割,不可分词,完全匹配

3.4 复合查询-相关性得分

相关性得分算法:(第三种 default)

es 自带的 query score:

自定义function score函数:

自定义score函数时主要确定三个部分:

  1. 哪些文档将进行加权
  2. 算分函数function score如何定义
  3. function score怎么与原始得分query score(BM25)进行加权

demo:

3.5 分页

深度分页问题:

from+size超过1w会直接报错,如果非要查一万条,不太现实,实际生产应用中会从业务层面避免查询1w条(从业务上拒绝),比如百度就是默认最多查70页,每页显示10条数据

3.6 高亮

高亮的结果解析是与_source同级的,需要额外注意:

3.7 总结

2. RestClient

将dsl语句对应到Java


上图中涉及了两个核心api:
source .query()/source()等:

QueryBuilders .各种查询query:

解析查询响应结果:

常见查询:

全文检索查询:

精确查询:




聚合:

4. aggs聚合

聚合操作与query同级,用于对文档进行统计、分析、计算(min/max/avg...)

常见聚合方式:

4.1 bucket(分桶)聚合


默认按照doc_count降序排序,如若修改排序方式:

4.2 metrics聚合

红框:

聚合名称:scoreAgg

聚合类型:stats

聚合字段:score

5. mysql与es数据同步

方案一缺点:业务之间耦合度强,调用耗时

方案二缺点:依赖mq的可靠性


demo:基于mq的实现方式

mq的消息模式:其中交换机用于将消息路由

定义模式:

然后定义绑定关系:将某个队列绑定到指定交换机、用哪个routingKey:

消息发送(两种消息:增改(公用一个key)和删(另一个key)):


消息监听与消费:

定义监听:

具体实现:


6. es集群

extra:es集群数据去重

相关推荐
易营宝4 小时前
多语言网站建设避坑指南:既要“数据同步”,又能“按市场个性化”,别踩这 5 个坑
大数据·人工智能
fanstuck4 小时前
从0到提交,如何用 ChatGPT 全流程参与建模比赛的
大数据·数学建模·语言模型·chatgpt·数据挖掘
春日见4 小时前
vscode代码无法跳转
大数据·人工智能·深度学习·elasticsearch·搜索引擎
ASKED_20194 小时前
Langchain学习笔记一 -基础模块以及架构概览
笔记·学习·langchain
萤丰信息5 小时前
AI 筑基・生态共荣:智慧园区的价值重构与未来新途
大数据·运维·人工智能·科技·智慧城市·智慧园区
(❁´◡`❁)Jimmy(❁´◡`❁)5 小时前
Exgcd 学习笔记
笔记·学习·算法
云小逸6 小时前
【nmap源码学习】 Nmap网络扫描工具深度解析:从基础参数到核心扫描逻辑
网络·数据库·学习
冰糖猕猴桃8 小时前
【AI】把“大杂烩抽取”拆成多步推理:一个从单提示到多阶段管线的实践案例
大数据·人工智能·ai·提示词·多步推理
盐焗西兰花8 小时前
鸿蒙学习实战之路-Reader Kit构建阅读器最佳实践
学习·华为·harmonyos
才盛智能科技8 小时前
K链通×才盛云:自助KTV品牌从0到1孵化超简单
大数据·人工智能·物联网·自助ktv系统·才盛云