标签:
用来找到两个rdd的交集,注意,最终的new rdd的分区数量取决于两个rdd中的最大分区数量。
测试一下:
val data1 = sc.parallelize(1 to 20,1) val data2 = sc.parallelize(1 to 5,2) val data3 = data1.intersection(data2) data3.partitions.length data3.collect
输出结果是1,2,3,4,5
data3的分区数量是2
标签:
原文地址:http://www.cnblogs.com/hark0623/p/4494879.html