Hive谓词下推

Hive谓词下推

1、情景描述

在实际数仓开发中,我们经常会遇到多表关联,这个时候就会涉及到where与on的使用

Hive中的where与on在HQL中的区别为:

  • 相同点
    • where与on都是用作筛选条件
  • 不同点
    • on会显示所有匹配条件的值,不匹配条件的数据补NULL;where只显示满足条件的数据
    • on作用不同类型的多表连接时结果不同;where只起连接作用,不同类型的多表连接时结果相同

首先,我们来看一个例子:使用a表最新分区数据关联b表:

写法一:

sql 复制代码
select * from a join b on a.id=b.id where a.dt='20231101'

写法二:

sql 复制代码
select * from a join b on a.id=b.id and a.dt='20231101'

写法三:

sql 复制代码
select * from (select * from a where dt='20231101') t join b on t.id=b.id

三种写法的结果是等同的,也没有问题。如果需要以a表作为主表,关联查询b表,只需要修改连接类型为左外连接就可以了

但三种写法存在效率上的差异!

写法一与写法三都为高效写法,Hive只会取指定分区的数据进行join

写法二则效率较低,Hive先会查出所有数据进行join,然后再去过滤指定分区的数据

这可以通过explain执行计划证明:

从执行计划可以得出,写法一的分区数据在一开始扫描时候就已经过滤了。而写法二会拿所有的数据进行查询join,最后再进行过滤

这种将过滤表达式提前执行的过程我们称为谓词下推

2、Hive谓词下推

2.1、什么是谓词下推

谓词下推(Predicate Pushdown,PPD)是指将过滤表达式尽可能移动至靠近数据源的位置,以使真正执行时能直接跳过无关的数据。简而言之,就是在合适的场景下,优先执行过滤条件

2.2、Hive谓词下推

在Hive生成物理执行计划中,有一个配置项用于管理谓词下推优化是否开启:

sql 复制代码
set hive.optimize.ppd=true;

需要注意的是,Hive的PPD控制参数默认开启

3、谓词下推生效场景分析

相关推荐
谁似人间西林客35 分钟前
什么是工业大数据?三类核心数据驱动智能制造落地
大数据·制造
skilllite作者35 分钟前
Deer-Flow 工作流引擎深度评测报告
java·大数据·开发语言·chrome·分布式·架构·rust
ACP广源盛1392462567340 分钟前
磐石 100 :IX6012 :ASM1812@ACP#国产 PCIe 2.0 交换芯片,轻量级算力扩展应用分享
大数据·linux·运维·网络·人工智能·嵌入式硬件·电脑
zandy101144 分钟前
联想集团:AI创新标杆,定义智能时代企业创新新范式
大数据·人工智能·microsoft·联想
好赞科技1 小时前
深度对比2026年三款小程序商城精选推荐榜单,解决您的电商选择难题
大数据·运维·人工智能
chatexcel1 小时前
北京大学科学智能学院建院一周年暨AI Agent联合实验室揭牌活动顺利举行
大数据·人工智能
雪兽软件2 小时前
大数据的优势与劣势:一把强大的双刃剑
大数据
勇哥的编程江湖2 小时前
flink开发中根据环境加载不同配置踩坑
大数据·flink·flinkcdc
黎阳之光2 小时前
黎阳之光:深耕视频孪生核心领域 构筑数字孪生全域数智新标杆
大数据·人工智能·算法·安全·数字孪生
NINGMENGb2 小时前
舆情升温前的那30分钟:Infoseek系统如何改写公关游戏规则
大数据·运维·舆情监测·舆情监测系统