Hive谓词下推

对许2023-11-08 11:57

在实际数仓开发中，我们经常会遇到多表关联，这个时候就会涉及到where与on的使用

Hive中的where与on在HQL中的区别为：

相同点
- where与on都是用作筛选条件
不同点
- on会显示所有匹配条件的值，不匹配条件的数据补NULL；where只显示满足条件的数据
- on作用不同类型的多表连接时结果不同；where只起连接作用，不同类型的多表连接时结果相同

首先，我们来看一个例子：使用a表最新分区数据关联b表：

写法一：

sql 复制代码

select * from a join b on a.id=b.id where a.dt='20231101'

写法二：

sql 复制代码

select * from a join b on a.id=b.id and a.dt='20231101'

写法三：

sql 复制代码

select * from (select * from a where dt='20231101') t join b on t.id=b.id

三种写法的结果是等同的，也没有问题。如果需要以a表作为主表，关联查询b表，只需要修改连接类型为左外连接就可以了

但三种写法存在效率上的差异！

写法一与写法三都为高效写法，Hive只会取指定分区的数据进行join

写法二则效率较低，Hive先会查出所有数据进行join，然后再去过滤指定分区的数据

这可以通过explain执行计划证明：

从执行计划可以得出，写法一的分区数据在一开始扫描时候就已经过滤了。而写法二会拿所有的数据进行查询join，最后再进行过滤

这种将过滤表达式提前执行的过程我们称为谓词下推

谓词下推（Predicate Pushdown，PPD）是指将过滤表达式尽可能移动至靠近数据源的位置，以使真正执行时能直接跳过无关的数据。简而言之，就是在合适的场景下，优先执行过滤条件

在Hive生成物理执行计划中，有一个配置项用于管理谓词下推优化是否开启：

sql 复制代码

set hive.optimize.ppd=true;

需要注意的是，Hive的PPD控制参数默认开启