码迷,mamicode.com
首页 > 其他好文 > 详细

spark新能优化之广播共享数据

时间:2016-07-13 22:02:56      阅读:107      评论:0      收藏:0      [点我收藏+]

标签:

如果你的算子函数中,使用到了特别大的数据,那么,这个时候,推荐将该数据进行广播。这样的话,就不至于将一个大数据拷贝到每一个task上去。而是给每个节点拷贝一份,然后节点上的task共享该数据。

这样的话,就可以减少大数据在节点上的内存消耗。并且可以减少数据到节点的网络传输消耗。

final Accumulator<Integer> num = sc.accumulator(Object);

spark新能优化之广播共享数据

标签:

原文地址:http://www.cnblogs.com/yaohaitao/p/5667758.html

(0)
(0)
   
举报
评论 一句话评论(0
登录后才能评论!
© 2014 mamicode.com 版权所有  联系我们:gaon5@hotmail.com
迷上了代码!