1、谓词下推
总所周知,hive在执行过程中,会有很多自动优化。其中很重要的一个就是谓词下推。至于什么是谓词下推?
网上找了个段相对官方的解释:将过滤表达式尽可能移动至靠近数据源的位置,以使真正执行时能直接跳过无关的数据。换言之就是说,在合适的场景下,优先执行过滤条件。
2、hive中的谓词下推
在hive生成物理执行计划中,有一个配置项用于管理谓词下推优化是否开启。
set hive.optimize.ppd=true; # true标识开启,false表示关闭,默认是true
但如果hive谓词下推的功能与join同时存在,都能在哪些场景下生效?结论见文末。
3、谓词下推场景分析
(1)准备数据
准备两张表,数据如下。
(2)查看谓词下退是否开启
(3) inner join
对左表where过滤
select a.col_a,a.col_b,b.col_c
from table_a a
join table_b b on a.col_a = b.col_a
where a.col_b > 333
查看执行计划,在对a表进行scan是优先进行filter,过滤col_b > 333。可见谓词下推生效。
对右表where过滤
select a.col_a,a.col_b,b.col_c
from table_a a
join table_b b on a.col_a = b.col_a
where b.col_c > 333
查看执行计划,在对b表进行scan是优先进行filter,过滤col_c > 333。可见谓词下推生效。
对左表on过滤
select a.col_a,a.col_b,b.col_c
from table_a a
join table_b b on a.col_a = b.col_a and a.col_b > 333
查看执行计划,在对a表进行scan是优先进行filter,过滤col_b > 333。可见谓词下推生效。
对右表on过滤
select a.col_a,a.col_b,b.col_c
from table_a a
join table_b b on a.col_a = b.col_a and b.col_c > 333
查看执行计划,在对b表进行scan是优先进行filter,过滤col_c > 333。可见谓词下推生效。
(4)left join(right join 同理)
对左表where过滤
select a.col_a,a.col_b,b.col_c
from table_a a
left join table_b b on a.col_a = b.col_a
where a.col_b > 333
查看执行计划,在对a表进行scan是优先进行filter,过滤col_b > 333。可见谓词下推生效。
对右表where过滤
select a.col_a,a.col_b,b.col_c
from table_a a
left join table_b b on a.col_a = b.col_a
where b.col_c > 333
查看执行计划,在对b表进行scan是未进行filter。可见谓词下推不生效。
对左表on过滤
select a.col_a,a.col_b,b.col_c
from table_a a
left join table_b b on a.col_a = b.col_a and a.col_b > 333
查看执行计划,在对a表进行scan是未进行filter。可见谓词下推不生效。
对右表on过滤
select a.col_a,a.col_b,b.col_c
from table_a a
left join table_b b on a.col_a = b.col_a and b.col_c > 333
查看执行计划,在对b表进行scan是优先进行filter,过滤col_c > 333。可见谓词下推生效。
(5)full join
对左表where过滤
select a.col_a,a.col_b,b.col_c
from table_a a
full join table_b b on a.col_a = b.col_a
where a.col_b > 333
查看执行计划,在对表进行scan是未进行filter。可见谓词下推不生效。
对右表where过滤
select a.col_a,a.col_b,b.col_c
from table_a a
full join table_b b on a.col_a = b.col_a
where b.col_c > 333
查看执行计划,在对b表进行scan是未进行filter。可见谓词下推不生效。
对左表on过滤
select a.col_a,a.col_b,b.col_c
from table_a a
full join table_b b on a.col_a = b.col_a and a.col_b > 333
查看执行计划,在对表进行scan是未进行filter。可见谓词下推不生效。
对右表on过滤
select a.col_a,a.col_b,b.col_c
from table_a a
full join table_b b on a.col_a = b.col_a and b.col_c > 333
查看执行计划,在对b表进行scan是未进行filter。可见谓词下推不生效。
4、left join场景下的两种写法对比
sql1:
select a.col_a,a.col_b,b.col_c
from table_a a
left join table_b b on a.col_a = b.col_a
where b.col_c > 333
sql2:
select a.col_a,a.col_b,b.col_c
from table_a a
left join (select col_a,col_c from table_b where col_c > 333) b on a.col_a = b.col_a
目前已知第一种写法不会触发谓词下推,那么我采用第二种写法,手动进行谓词下退会怎样。
由两者结果可见,手动谓词下推和第一种写法的结果完全不一样。可见,两者的区别不单单是性能的问题,而是两者的执行流程、产生结果也完全不同。因此奉劝小伙伴遇到此场景下还是不要偷懒为好。
5、总结
综上所述,简单总结了hive中谓词下推的各种场景下的生效情况。
inner join | left join | right join | full join | |||||
左 | 右 | 左 | 右 | 左 | 右 | 左 | 右 | |
where | √ | √ | √ | × | × | √ | × | × |
on | √ | √ | × | √ | √ | × | × | × |