ES实战-分析数据1

分析是文档被发送并加入倒排索引之前,es在其主体上进行的操作,具体如下

1.字符过滤-使用字符过滤器转变字符

2.文本切分为分词-将文本切分为单个或多个分词

3,分词过滤-使用分词过滤器转变每个分词

4.分词索引-将这些分词存储到索引中
为文档使用分析器

1.当创建索引的时候,为特定的索引进行设置-直接生效

2.在es配置文件中,设置全局分析器-需重启生效
在映射中指定某个字段的分析器

bash 复制代码
#为description字段指定myCustomerAnalyzer分析器
{
  "mappings": {
    "document":{
      "properties":{
        "description":{
          "type":"string",
          "analyzer":"myCustomerAnalyzer"
        }
      }
    }
  }
}
#指定不要分析description字段
{
  "mappings": {
    "document":{
      "properties":{
        "description":{
          "type":"string",
          "index":"not_analyzed"
        }
      }
    }
  }
}

使用分析API来分析文本

bash 复制代码
curl -XPOST 'localhost:9200/_analyze' -H 'Content-Type: application/json' -d '{
  "analyzer": "standard",
  "text": "share your experience with NoSql & big data technologies"
}'

请求Elasticsearch返回get-together索引中ID为1的文档,在description和tags字段上的词项向量以及相关统计信息

bash 复制代码
curl -X GET "localhost:9200/get-together/_termvectors/1?pretty=true" -H 'Content-Type: application/json' -d '{
"fields":["description","tags"],
"term_statistics":true
}'

分析器包含:

1.标准分析器:

1.1.标准分词器

1.2.标准分词过滤器

1.3,小写转换分词过滤器

1.4.停用词分词过滤器

2.简单分析器

3.空白分析器

4.停用词分析器

5,关键词分析器

6.模式分析器

7.语言和多语言分析器

8.雪球分析器
分词器包括:

1.标准分词器

2,关键词分词器

3.字母分词器

4.小写分词器

5.空白分词器

6.模式分词器

7.UAX URl电子邮件分词器

8.路径层次分词器
分词过滤器

1.标准分词过滤器

2.小写分词过滤器

3.长度分词过滤器

4.停用词分词过滤器

5.截断分词过滤器,修剪分词过滤器,限制分词数量过滤器

6.颠倒分词过滤器

7.唯一分词过滤器

8.ASCII折叠分词过滤器

9.同义词分词过滤器

相关推荐
武子康5 小时前
大数据-241 离线数仓 - 实战:电商核心交易数据模型与 MySQL 源表设计(订单/商品/品类/店铺/支付)
大数据·后端·mysql
IvanCodes5 小时前
一、消息队列理论基础与Kafka架构价值解析
大数据·后端·kafka
武子康1 天前
大数据-240 离线数仓 - 广告业务 Hive ADS 实战:DataX 将 HDFS 分区表导出到 MySQL
大数据·后端·apache hive
洛森唛2 天前
ElasticSearch查询语句Query String详解:从入门到精通
后端·elasticsearch
字节跳动数据平台2 天前
5000 字技术向拆解 | 火山引擎多模态数据湖如何释放模思智能的算法生产力
大数据
武子康2 天前
大数据-239 离线数仓 - 广告业务实战:Flume 导入日志到 HDFS,并完成 Hive ODS/DWD 分层加载
大数据·后端·apache hive
洛森唛3 天前
Elasticsearch DSL 查询语法大全:从入门到精通
后端·elasticsearch
字节跳动数据平台3 天前
代码量减少 70%、GPU 利用率达 95%:火山引擎多模态数据湖如何释放模思智能的算法生产力
大数据
得物技术3 天前
深入剖析Spark UI界面:参数与界面详解|得物技术
大数据·后端·spark
武子康3 天前
大数据-238 离线数仓 - 广告业务 Hive分析实战:ADS 点击率、购买率与 Top100 排名避坑
大数据·后端·apache hive