码迷,mamicode.com
首页 > 其他好文 > 详细

mapreduce 关于小文件导致任务缓慢的问题

时间:2016-04-18 11:35:11      阅读:139      评论:0      收藏:0      [点我收藏+]

标签:

小文件导致任务执行缓慢的原因:

1.很容易想到的是map task 任务启动太多,而每个文件的实际输入量很小,所以导致了任务缓慢

   这个可以通过 CombineTextInputFormat,解决,主要需要设置 mapreduce.input.fileinputformat.split.maxsize(单位byte)

2.其次是set input 文件太多,需要一个一个set ,所以花费的时间很多,导致任务启动就很慢了

   这个只能提前merge好小文件,组成大文件,可能还有更好的办法,需要再研究

mapreduce 关于小文件导致任务缓慢的问题

标签:

原文地址:http://www.cnblogs.com/yako/p/5403673.html

(0)
(0)
   
举报
评论 一句话评论(0
登录后才能评论!
© 2014 mamicode.com 版权所有  联系我们:gaon5@hotmail.com
迷上了代码!