Hadoop HA集群 NameNode 无法自动故障转移(切换active)

Posted 辉常努腻

tags:

篇首语:本文由小常识网(cha138.com)小编为大家整理,主要介绍了Hadoop HA集群 NameNode 无法自动故障转移(切换active)相关的知识,希望对你有一定的参考价值。

在学习 HA 自动化配置,按照hadoop官网:https://hadoop.apache.org/docs/stable/hadoop-project-dist/hadoop-hdfs/HDFSHighAvailabilityWithQJM.html 配置,最后所有的节点都启动正常。

用 kill -9 进程号 杀死了当前处于active状态的NameNode后,其他的 Standby 状态的NameNode 并没有自动切换为 Active状态,而且重启杀死的 NameNode 后,可能出现所有NameNode节点都变成了 Standby状态的情况,一个Active状态的都没有。

查看日志:$HADOOP_HOME/logs/hadoop-root-zkfc-hadoop2.log ,发现报错了:

2020-01-03 19:21:13,636 WARN org.apache.hadoop.ha.FailoverController: Unable to gracefully make NameNode at hadoop3/192.168.233.13:8020 standby (unable to connect)
java.net.ConnectException: Call From hadoop2/192.168.233.12 to hadoop3:8020 failed on connection exception: java.net.ConnectException: 拒绝连接; For more details see:  http://wiki.apache.org/hadoop/ConnectionRefused
	at sun.reflect.GeneratedConstructorAccessor8.newInstance(Unknown Source)
	at sun.reflect.DelegatingConstructorAccessorImpl.newInstance(DelegatingConstructorAccessorImpl.java:45)
	at java.lang.reflect.Constructor.newInstance(Constructor.java:423)
	at org.apache.hadoop.net.NetUtils.wrapWithMessage(NetUtils.java:792)

这是因为没有 fuster 程序,导致无法进行 fence,根据官网上的配置,是在 hdfs-site.xml 中配置过相关配置:


<property>
    <name>dfs.ha.fencing.methods</name>
    <value>sshfence</value>
</property>

解决方法:安装包含fuster程序的软件包Psmisc(每个机器上都要安装):

yum -y install psmisc

以上是关于Hadoop HA集群 NameNode 无法自动故障转移(切换active)的主要内容,如果未能解决你的问题,请参考以下文章

Hadoop HA——namenode无法启动问题解决

hadoop搭建HA集群之后不能自动切换namenode

Hadoop 2.6.0 HA高可用集群配置详解

hadoop的HA

Hadoop集群安装与配置

Hadoop2.0 NameNode HA和Federation简明理解