Elasticsearch 聚合概览及示例

Elasticsearch 是一个强大的搜索引擎,除了提供搜索功能外,它还内置了丰富的聚合功能,允许用户对数据进行统计、分析和运算。聚合可以帮助我们理解数据的分布和统计特性,是数据探索和报告的重要工具。本文将介绍 Elasticsearch 中的三种主要聚合类型:桶(Bucket)聚合、度量(Metric)聚合和管道(Pipeline)聚合,并提供示例说明。

桶(Bucket)聚合

桶聚合主要用于对文档进行分组,并统计每组的文档数量。以下是几种常见的桶聚合:

  • TermAggregation:按照文档字段的词条值分组。
  • Date Histogram:按照日期阶梯分组,如按周、月或年分组。

示例:TermAggregation

假设我们有一个酒店预订数据索引,我们可以使用 TermAggregation 来统计每个城市的酒店数量。

json 复制代码
GET /hotel/_search
{
  "size": 0, // 不需要原始文档,只需要聚合结果
  "aggs": {
    "city_buckets": {
      "terms": {
        "field": "city"
      }
    }
  }
}

度量(Metric)聚合

度量聚合用于计算数值类型的字段,例如求平均值、最大值、最小值等。

  • Avg:计算平均值。
  • Max:找出最大值。
  • Min:找出最小值。
  • Stats:同时计算最大值、最小值、平均值和总和。

示例:Avg 和 Stats

继续使用酒店预订数据索引,我们可以计算每个城市酒店的平均价格和价格范围。

json 复制代码
GET /hotel/_search
{
  "size": 0,
  "aggs": {
    "price_stats": {
      "stats": {
        "field": "price"
      }
    },
    "average_price": {
      "avg": {
        "field": "price"
      }
    }
  }
}

管道(Pipeline)聚合

管道聚合是基于其他聚合结果进行的聚合,例如我们可以计算每个城市酒店价格的标准差或累计总和。

  • Derivative:计算相邻文档的度量聚合值的差异。
  • Sum Bucket:计算指定度量聚合的总和。

示例:Sum Bucket

如果我们想要计算所有城市酒店的总价格,然后查看每个城市价格的累计总和,我们可以使用 Sum Bucket 管道聚合。

json 复制代码
GET /hotel/_search
{
  "size": 0,
  "aggs": {
    "total_price": {
      "sum": {
        "field": "price"
      }
    },
    "city_price_sums": {
      "terms": {
        "field": "city"
      },
      "aggs": {
        "cumulative_price": {
          "sum_bucket_selector": {
            "buckets_path": "_price",
            "script": "params.aggregations['total_price'].value"
          }
        }
      }
    }
  }
}

结语

Elasticsearch 的聚合功能为数据分析提供了强大的支持。桶聚合帮助我们对数据进行分组统计,度量聚合让我们可以计算数值字段的各种统计数据,而管道聚合则让我们在其他聚合的基础上进一步分析数据。理解并掌握这些聚合类型,可以帮助我们更深入地洞察数据,为决策提供数据支持。希望本文能够帮助你更好地利用 Elasticsearch 的聚合功能进行数据分析。

相关推荐
Elasticsearch6 小时前
为上下文工程构建高效的数据库检索工具
elasticsearch
武子康7 小时前
大数据-243 离线数仓 - 实战电商核心交易增量导入(DataX - HDFS - Hive 分区
大数据·后端·apache hive
代码匠心2 天前
从零开始学Flink:Flink SQL四大Join解析
大数据·flink·flink sql·大数据处理
武子康3 天前
大数据-242 离线数仓 - DataX 实战:MySQL 全量/增量导入 HDFS + Hive 分区(离线数仓 ODS
大数据·后端·apache hive
Elasticsearch3 天前
需要知道某个同义词是否实际匹配了你的 Elasticsearch 查询吗?
elasticsearch
SelectDB4 天前
易车 × Apache Doris:构建湖仓一体新架构,加速 AI 业务融合实践
大数据·agent·mcp
武子康4 天前
大数据-241 离线数仓 - 实战:电商核心交易数据模型与 MySQL 源表设计(订单/商品/品类/店铺/支付)
大数据·后端·mysql
IvanCodes4 天前
一、消息队列理论基础与Kafka架构价值解析
大数据·后端·kafka
武子康5 天前
大数据-240 离线数仓 - 广告业务 Hive ADS 实战:DataX 将 HDFS 分区表导出到 MySQL
大数据·后端·apache hive
洛森唛6 天前
ElasticSearch查询语句Query String详解:从入门到精通
后端·elasticsearch