码迷,mamicode.com
首页 > 其他好文 > 详细

2014-08-08

时间:2014-08-08 21:13:46      阅读:247      评论:0      收藏:0      [点我收藏+]

标签:style   blog   http   color   2014   art   ar   div   

Pig: Distinct

Distinct主要是去掉重复的记录,是对条记录进行去重,而不是对单个某个schema。

daily = load NYSE_daily as (exchange:chararray, symbol:chararray);
uniq = distinct daily

它需要收集相似的记录在一块,判断这些记录是否是重复的。我的理解是:在reduce收集相似的记录在一块,充分利用了combiner去掉重复的记录,在map里面进行删除。(有点奇怪的理解)

等价于SQL中的:

select distinct x

如果想对某个schema进行distinct,可以先选出来。

 

 

 

 

 

SQL的实现原理:

http://blog.codinglabs.org/articles/theory-of-mysql-index.html

C++:

http://man.chinaunix.net/develop/c&c++/c/c.htm#_Toc520634042

2014-08-08,布布扣,bubuko.com

2014-08-08

标签:style   blog   http   color   2014   art   ar   div   

原文地址:http://www.cnblogs.com/leewiki/p/3900121.html

(0)
(0)
   
举报
评论 一句话评论(0
登录后才能评论!
© 2014 mamicode.com 版权所有  联系我们:gaon5@hotmail.com
迷上了代码!