码迷,mamicode.com
首页 > 其他好文 > 详细

hive 的 left semi join

时间:2020-03-12 17:09:46      阅读:67      评论:0      收藏:0      [点我收藏+]

标签:info   sts   因此   遍历   sele   其他   set   出现   高效   

介绍

 LEFT SEMI JOIN (左半连接)是 IN/EXISTS 子查询的一种更高效的实现。

示例

 技术图片

 

 

可以改写为

 技术图片

 

 

特点

1、left semi join 的限制是, JOIN 子句中右边的表只能在 ON 子句中设置过滤条件,在 WHERE 子句、SELECT 子句或其他地方过滤都不行。

2、left semi join 是只传递表的 join key 给 map 阶段,因此left semi join 中最后 select 的结果只许出现左表。

3、因为 left semi join 是 in(keySet) 的关系,遇到右表重复记录,左表会跳过,而 join 则会一直遍历。这就导致右表有重复值得情况下 left semi join 只产生一条,join 会产生多条,也会导致 left semi join 的性能更高。 

比如以下A表和B表进行 join 或 left semi join,然后 select 出所有字段,结果区别如下:

 技术图片

 

 

注意:蓝色叉的那一列实际是不存在left semi join中的,因为最后 select 的结果只许出现左表。

hive 的 left semi join

标签:info   sts   因此   遍历   sele   其他   set   出现   高效   

原文地址:https://www.cnblogs.com/zz-ksw/p/12470343.html

(0)
(0)
   
举报
评论 一句话评论(0
登录后才能评论!
© 2014 mamicode.com 版权所有  联系我们:gaon5@hotmail.com
迷上了代码!