hive SQL谓词下推

Sql 优化:谓词下推(PPD

定义

谓词下推的概念其实出现在sql中,在关联查询时(join,left join ,right join),因为涉及两个大表之间的关联(特别是在hive)造成资源消耗会比较大,

因为建议在join之前先将两个表进行过滤(hive 里指的是在map端进行过滤),系统会进行部分优化,但sql需要遵守PPD规则,

所谓下推可以理解成优化(只有满足才能进行优化)。

一句话说完:不影响结果的情况下,尽量将过滤条件提前执行。(记得小表join大表)

2 PPD规则(谓词下推规则)

2.1 名词解释

Preserved Row table:保留行表

外部联接中必须返回所有行的表。

对于left join,这是左表;

对于right join,这是右表;

对于full join,两个表都是保留的行表。

Null Supplying table:空值填充表

这是在不匹配的行中为其列填充空值的表。

对于left join,这是右表;

对于right join,这是左表;

对于full join,两个表都是空值填充表。

During Join predicate:连接谓词

join语句中的on部分

After Join predicate:后置连接词

join语句后的where

2.2 规则介绍

1、连接谓词(on)不能下推保留行表。

2、后置连接词(where)不能下推到空值填充表

2.3 针对该规则的建议
1、对于 Join (Inner Join)、Full outer Join,条件写在 on 后面,还是 where 后面,性能上面没有区别;
2、对于 Left Join ,右表过滤条件写在 on 后面、左表过滤条件写在 where 后面,性能上有提高;
3、对于 Right Join,左表过滤条件写在 on 后面、左表过滤条件写在 where 后面,性能上有提高;
4、存在unix_timestamp()、rand()不确定函数时,无法实现下推

相关推荐
Nefu_lyh1 天前
【Hive】六、Hive 运算逻辑:数学 / 逻辑 / 条件 / 日期 / 字符串函数
数据仓库·hive·hadoop
AQin10122 天前
【对比向】既生瑜何生亮?不!Hive 和 Doris不一样
数据仓库·hive·hadoop·doris
AQin10122 天前
【对比向】细算“成本”——Hive vs. Doris
大数据·数据库·hive·doris·实时数仓
青春万岁!!3 天前
hive分区表加字段后insert字段为空
数据仓库·hive·hadoop
Nefu_lyh5 天前
【Hive】三、Hive 抽样:讲解 Hive 三大抽样方式:分桶抽样、块抽样、随机抽样的原理、语法、性能对比与实战案例
数据仓库·hive·hadoop
迈巴赫车主6 天前
Hive中分组聚合导致的数据倾斜优化
数据仓库·hive·hadoop
Leo.yuan7 天前
MySQL到Hive数据同步怎么选工具?FineDataLink全链路方案实测
数据库·hive·mysql
Nefu_lyh7 天前
【Hive】02 Hive 分区与分桶:深入理解 Hive 分区与分桶的原理、执行过程、Bucket Map Join、SMB Join 以及最佳实践
数据仓库·hive·hadoop
Nefu_lyh7 天前
【Hive】一、Hive数据类型:基本数据类型、复杂数据类型
数据仓库·hive·hadoop
卷毛迷你猪10 天前
快速实验篇(A4)Hive 数据仓库进阶:全站点干旱事件识别与多维统计分析
数据仓库·hive·hadoop·分布式