首页 > 其他好文 > 详细

cloudera learning5:Hadoop集群高级配置

时间：2016-09-30 02:22:12 阅读：302 评论：0 收藏：0 [点我收藏+]

标签：

HDFS-NameNode Tuning:

dfs.namenode.handler.count:

NameNode可开启的thread number,thread为从NameNode到DataNode的RPC请求。Default值为30(CM，Non CM is 10)。推荐设置为集群node数量*20 再取log。如果设置的太小，当DataNode试图从NameNode上获取block信息时，DataNode log会报“connect refused”。

HDFS-DataNode Tuning:

dfs.datanode.failed.volumes.tolerated：

磁盘挂掉几块时，dataNode自动下线。默认为0,即DataNode不自动下线。

dfs.datanode.max.locked.memory：

DataNode最大的缓存size,默认为4G。

io.compression.codecs文件压缩：

配置Hadoop集群文件压缩策略:DefaultCodec, GzipCodec, BZip2Codec, DeflateCodec, SnappyCodec,Lz4Codec

YARN/GateWay Tuning

mapreduce.job.reduce.slowstart.completedmaps:

Map tasks执行完成百分之多少，开始创建reducer执行的容器。

mapreduce.reduce.shuffle.parallelcopies reducer：

Reducer内部可开的线程数。CM默认为10。推荐值计算方式：ln(count(cluster nodes)*4)

Hadoop cluster产线环境的HA配置：

HA主要是解决NameNode的单点故障，主要指NameNode crash, NameNode manitenance。

启用HA之后，会有两个NameNode(active,standby)和两个Failover Controllers以及若干个同步NameNode的Journal Nodes。不在需要SecondaryNameNode。

技术分享

clients只连接actvie NameNode。

DataNodes的heartbeat会同时发给active和standby NameNode。

Active NameNode会把metadata写入指定数目（奇数个）的JournalNode。

Standby NameNode从JournalNodes读取metadata信息，完成与Active的sync。

ZooKeeper failover Controller 自动进行Failover。

没有failback，恢复的NameNode自动变为standby。

配置选项：dfs.ha.automatic-failover.enabled

配置HA之后，Hive,impala,Hue均要进行一定的update。

cloudera learning5:Hadoop集群高级配置

标签：

原文地址：http://www.cnblogs.com/zhq1007/p/5922282.html

踩

(0)

赞

(0)

举报

评论一句话评论（0）

分享档案

更多>

2021年07月29日 (22)
2021年07月28日 (40)
2021年07月27日 (32)
2021年07月26日 (79)
2021年07月23日 (29)
2021年07月22日 (30)
2021年07月21日 (42)
2021年07月20日 (16)
2021年07月19日 (90)
2021年07月16日 (35)

周排行

更多

友情链接

兰亭集智国之画百度统计站长统计阿里云 chrome插件新版天听网

关于我们 - 联系我们 - 留言反馈

© 2014 mamicode.com 版权所有联系我们:gaon5@hotmail.com

迷上了代码！