Hive:窗口函数(1)

窗口函数

窗口函数OVER()用于定义一个窗口,该窗口指定了函数应用的数据范围

对窗口数据进行分区

partition by 必须和over () 一起使用, distribute by经常和sort by 一起使用,可以不和over() 一起使用.DISTRIBUTE BY决定了数据如何分布到不同的Reducer上,而SORT BY决定了每个Reducer内部数据的排序方式。

示例

对数据进行排序


sort by 子句会让输入的数据强制排序 (强调:当使用排序时,窗口会在组内逐行变大)

示例

补充

示例

Windows子句

rows 和 range都是用来定义窗口框架, 不同的是rows基于行号, 而 RANGE子句通常用于基于值的范围来定义窗口

聚合函数开窗时order by 是表示累加,默认从起点行到当前行的累加;所以,示例1和示例2的结果是一样的

在没有order by的聚合函数sum()开窗的结果是起点到终点的累加值(示例3)

示例1

示例2

示例3

示例4

前一行到当前行的加和(S列的值是SAL列的前一行的值加当前行的值)

示例5

前一行到后一行的范围

相关推荐
houzhizhen5 小时前
Hive drop column 的解决方法
数据仓库·hive·hadoop
数据小吏7 小时前
第十四章:数据治理之数据源:数据源的数据接入、业务属性梳理及监控
大数据·数据仓库·etl工程师
上元星如雨8 小时前
在WPF程序中设置背景图片
大数据·hadoop·wpf
数据要素X13 小时前
【数据架构07】数据智能架构篇
大数据·数据库·数据仓库·人工智能·架构
敖云岚13 小时前
【Hadoop】大数据技术之 MapReduce
大数据·hadoop·mapreduce
难以触及的高度1 天前
优化Hadoop性能:如何修改Block块大小
大数据·hadoop·分布式
Leo.yuan1 天前
bi软件是什么?bi软件是做什么用的?
大数据·数据仓库·信息可视化·数据分析·数字化转型
数据要素X1 天前
【数据架构03】数据治理架构篇
大数据·数据库·数据仓库·架构
敖云岚1 天前
【Hadoop】大数据技术之 HDFS
大数据·hadoop·hdfs
2301_818732062 天前
hadoop 无法存储数据到hbase里面 已经解决
java·大数据·数据库·hadoop·centos·hbase