自动故障转移在 Hadoop 中不起作用

Posted 2023-02-16

技术标签:

【中文标题】自动故障转移在 Hadoop 中不起作用【英文标题】：Automatic Failover not working in Hadoop 【发布时间】：2017-04-19 08:27:38 【问题描述】：

我正在尝试构建一个 3 节点集群（2 个 Namenode(nn1,nn2) 和 1 个 datanode(dn1)）。使用 Namenode WEBUI，我可以看到 nn1 处于活动状态，而 nn2 处于待机状态。但是，当我杀死活动的 nn1 时，备用 nn2 不会激活。请帮助我我做错了什么或需要修改什么

nn1 /etc/hosts

127.0.0.1 localhost
192.168.10.153 nn1
192.168.10.154 dn1
192.168.10.155 nn2

nn2 /etc/hosts

127.0.0.1       localhost nn2
127.0.1.1       ubuntu

    # The following lines are desirable for IPv6 capable hosts
    ::1     ip6-localhost ip6-loopback
    fe00::0 ip6-localnet
    ff00::0 ip6-mcastprefix
    ff02::1 ip6-allnodes
    ff02::2 ip6-allrouters

core-site.xml (nn1,nn2)

<configuration>
<property>
<name>fs.defaultFS</name>
<value>hdfs://192.168.10.153:8020</value>
</property>

<property>
<name>dfs.journalnode.edits.dir</name>
<value>/usr/local/hadoop/hdfs/data/jn</value>
</property>
 <property>
 <name>ha.zookeeper.quorum</name>
 <value>192.168.10.153:2181,192.168.10.155:2181,192.168.10.154:2181</value>
 </property>

</configuration>

hdfs-site.xml(nn1,nn2,dn1)

<property>
 <name>dfs.replication</name>
 <value>1</value>
 </property>
 <property>
 <name>dfs.permissions</name>
 <value>false</value>
 </property>
 <property>
 <name>dfs.nameservices</name>
 <value>ha-cluster</value>
 </property>
 <property>
 <name>dfs.ha.namenodes.ha-cluster</name>
 <value>nn1,nn2</value>
 </property>
 <property>
 <name>dfs.namenode.rpc-address.ha-cluster.nn1</name>
 <value>192.168.10.153:9000</value>
 </property>
 <property>
 <name>dfs.namenode.rpc-address.ha-cluster.nn2</name>
 <value>192.168.10.155:9000</value>
 </property>
 <property>/usr/local/hadoop/hdfs/datanode</value>
 <name>dfs.namenode.http-address.ha-cluster.nn1</name>
 <value>192.168.10.153:50070</value>
 </property>
 <property>
 <name>dfs.namenode.http-address.ha-cluster.nn2</name>
 <value>192.168.10.155:50070</value>
 </property>
 <property>
 <name>dfs.namenode.shared.edits.dir</name>
 <value>qjournal://192.168.10.153:8485;192.168.10.155:8485;192.168.10.154:8485/ha-cluster</value>
 </property>
 <property>
 <name>dfs.client.failover.proxy.provider.ha-cluster</name>
 <value>org.apache.hadoop.hdfs.server.namenode.ha.ConfiguredFailoverProxyProvider</value>
 </property>
 <property>
 <name>dfs.ha.automatic-failover.enabled</name>
 <value>true</value>
 </property>
 <property>
 <name>ha.zookeeper.quorum</name>
 <value>192.168.10.153:2181,192.168.10.155:2181,192.168.10.154:2181</value>
 </property>

<property>
 <name>dfs.ha.fencing.methods</name>
 <value>sshfence</value>
 </property>
 <property>
 <name>dfs.ha.fencing.ssh.private-key-files</name>
 <value>/home/ci/.ssh/id_rsa</value></property></configuration>

LOGS :(zkfc nn1,nn2)(namenode nn1,nn2) 停止 nn1（活动节点） https://pastebin.com/bWvfnanQ

【问题讨论】：

【参考方案1】：

您在 core-site.xml 中提到 <IP>:<port> 为 fs.defaultFS 用于 HA 集群。因此，当关闭您的活动名称节点时，它不知道重定向到哪里。

为名称服务选择逻辑名称，例如“mycluster”。

然后在 hdfs-site.xml 中也进行更改，dfs.namenode.http-address.[nameservice ID].[name node ID] - 每个 NameNode 监听的完全限定的 HTTP 地址

在你的情况下，你必须给

核心站点.xml

<property>
<name>fs.defaultFS</name>
<value>hdfs://myCluster</value>
</property>

hdfs-site.xml

 <property>
 <name>dfs.namenode.rpc-address.myCluster.nn1</name>
 <value>192.168.10.153:9000</value>
 </property>

看清楚说明书https://hadoop.apache.org/docs/r2.7.2/hadoop-project-dist/hadoop-hdfs/HDFSHighAvailabilityWithQJM.html

希望这会对你有所帮助。

【讨论】：

谢谢，现在在 NN2 ZKFC :::: FATAL org.apache.hadoop.ha.ZKFailoverController: 无法启动故障转移控制器中收到此错误。父 znode 不存在。使用 -formatZK 标志运行以初始化 ZooKeeper。 2017-04-19 04:53:06,170 信息 org.apache.hadoop.ha.ActiveStandbyElector：会话已连接。 2017-04-19 04:53:06,175 INFO org.apache.zookeeper.ZooKeeper：会话：0x15b859d1b370005 关闭 2017-04-19 04:53:06,176 INFO org.apache.zookeeper.ClientCnxn：EventThread 关闭且无法启动 ZKFC在 nn2 中。请帮忙。我已经根据链接edureka.co/blog/…修改了集群配置我已经格式化了ZK，重启了集群。仍然不适合我。试图尽快解决问题。 ci@nn1:/usr/local/hadoop/sbin$ hdfs haadmin -getServiceState nn1 active ci@nn1:/usr/local/hadoop/sbin$ hdfs haadmin -getServiceState nn2 active 两个名称节点是活跃的。如果我停止 nn1 并启动 nn1 。 zkfc 没有运行。 nn2 也是如此。这是对的还是我错过了什么。 ci@nn1:/usr/local/hadoop/sbin$ hdfs haadmin -getServiceState nn2 active ci@nn1:/usr/local/hadoop/sbin$ hdfs haadmin -getServiceState nn1 active 我已经启动了 NN , JN 在活动和备用名称节点中。 ZKFC 在两个节点上运行。现在，我在 NN1 中暂停了 Internet 连接，是的，NN2 变为活动状态。但是，当我恢复 Internet 连接并启动 NN1 时。两个namenode都变得活跃。 Zkfc 在两个节点上运行。请指导。【参考方案2】：

你必须寻找自动故障转移的防护

https://***.com/a/27272565/3496666

https://hadoop.apache.org/docs/r2.7.2/hadoop-project-dist/hadoop-hdfs/HDFSHighAvailabilityWithQJM.html

【讨论】：

你能建议我解决这个问题吗？我无法帮助自己摆脱这个问题。我已经浏览了这些文章。看看这个答案。它可能会解决您的问题。我认为这应该是一个击剑问题。 ***.com/a/36002948/3496666 ***.com/a/33313804/3496666 阅读本文以了解自动故障转移的工作原理。是的，我已根据您的第二条评论进行了更改。它不工作。现在我拥有用户帐户 nn1 的完全权限。还是不行。 ci@nn1:/usr/local/hadoop/sbin$ hdfs haadmin -getServiceState nn2 active ci@nn1:/usr/local/hadoop/sbin$ hdfs haadmin -getServiceState nn1 active 我已经启动了 NN , JN 在活动和备用名称节点中。 ZKFC 在两个节点上运行。现在，我在 NN1 中暂停了 Internet 连接，是的，NN2 变为活动状态。但是，当我恢复 Internet 连接并启动 NN1 时。两个namenode都变得活跃。 Zkfc 在两个节点上运行。请指导。

以上是关于自动故障转移在 Hadoop 中不起作用的主要内容，如果未能解决你的问题，请参考以下文章