自动故障转移在 Hadoop 中不起作用

Posted

技术标签:

【中文标题】自动故障转移在 Hadoop 中不起作用【英文标题】:Automatic Failover not working in Hadoop 【发布时间】:2017-04-19 08:27:38 【问题描述】:

我正在尝试构建一个 3 节点集群(2 个 Namenode(nn1,nn2) 和 1 个 datanode(dn1))。使用 Namenode WEBUI,我可以看到 nn1 处于活动状态,而 nn2 处于待机状态。但是,当我杀死活动的 nn1 时,备用 nn2 不会激活。请帮助我我做错了什么或需要修改什么

nn1 /etc/hosts

127.0.0.1 localhost
192.168.10.153 nn1
192.168.10.154 dn1
192.168.10.155 nn2

nn2 /etc/hosts

127.0.0.1       localhost nn2
127.0.1.1       ubuntu

    # The following lines are desirable for IPv6 capable hosts
    ::1     ip6-localhost ip6-loopback
    fe00::0 ip6-localnet
    ff00::0 ip6-mcastprefix
    ff02::1 ip6-allnodes
    ff02::2 ip6-allrouters

core-site.xml (nn1,nn2)

<configuration>
<property>
<name>fs.defaultFS</name>
<value>hdfs://192.168.10.153:8020</value>
</property>

<property>
<name>dfs.journalnode.edits.dir</name>
<value>/usr/local/hadoop/hdfs/data/jn</value>
</property>
 <property>
 <name>ha.zookeeper.quorum</name>
 <value>192.168.10.153:2181,192.168.10.155:2181,192.168.10.154:2181</value>
 </property>

</configuration>

hdfs-site.xml(nn1,nn2,dn1)

<property>
 <name>dfs.replication</name>
 <value>1</value>
 </property>
 <property>
 <name>dfs.permissions</name>
 <value>false</value>
 </property>
 <property>
 <name>dfs.nameservices</name>
 <value>ha-cluster</value>
 </property>
 <property>
 <name>dfs.ha.namenodes.ha-cluster</name>
 <value>nn1,nn2</value>
 </property>
 <property>
 <name>dfs.namenode.rpc-address.ha-cluster.nn1</name>
 <value>192.168.10.153:9000</value>
 </property>
 <property>
 <name>dfs.namenode.rpc-address.ha-cluster.nn2</name>
 <value>192.168.10.155:9000</value>
 </property>
 <property>/usr/local/hadoop/hdfs/datanode</value>
 <name>dfs.namenode.http-address.ha-cluster.nn1</name>
 <value>192.168.10.153:50070</value>
 </property>
 <property>
 <name>dfs.namenode.http-address.ha-cluster.nn2</name>
 <value>192.168.10.155:50070</value>
 </property>
 <property>
 <name>dfs.namenode.shared.edits.dir</name>
 <value>qjournal://192.168.10.153:8485;192.168.10.155:8485;192.168.10.154:8485/ha-cluster</value>
 </property>
 <property>
 <name>dfs.client.failover.proxy.provider.ha-cluster</name>
 <value>org.apache.hadoop.hdfs.server.namenode.ha.ConfiguredFailoverProxyProvider</value>
 </property>
 <property>
 <name>dfs.ha.automatic-failover.enabled</name>
 <value>true</value>
 </property>
 <property>
 <name>ha.zookeeper.quorum</name>
 <value>192.168.10.153:2181,192.168.10.155:2181,192.168.10.154:2181</value>
 </property>

<property>
 <name>dfs.ha.fencing.methods</name>
 <value>sshfence</value>
 </property>
 <property>
 <name>dfs.ha.fencing.ssh.private-key-files</name>
 <value>/home/ci/.ssh/id_rsa</value></property></configuration>

LOGS :(zkfc nn1,nn2)(namenode nn1,nn2) 停止 nn1(活动节点) https://pastebin.com/bWvfnanQ

【问题讨论】:

【参考方案1】:

您在 core-site.xml 中提到 &lt;IP&gt;:&lt;port&gt;fs.defaultFS 用于 HA 集群。因此,当关闭您的活动名称节点时,它不知道重定向到哪里。

为名称服务选择逻辑名称,例如“mycluster”。

然后在 hdfs-site.xml 中也进行更改,dfs.namenode.http-address.[nameservice ID].[name node ID] - 每个 NameNode 监听的完全限定的 HTTP 地址

在你的情况下,你必须给

核心站点.xml

<property>
<name>fs.defaultFS</name>
<value>hdfs://myCluster</value>
</property>

hdfs-site.xml

 <property>
 <name>dfs.namenode.rpc-address.myCluster.nn1</name>
 <value>192.168.10.153:9000</value>
 </property>

看清楚说明书https://hadoop.apache.org/docs/r2.7.2/hadoop-project-dist/hadoop-hdfs/HDFSHighAvailabilityWithQJM.html

希望这会对你有所帮助。

【讨论】:

谢谢,现在在 NN2 ZKFC :::: FATAL org.apache.hadoop.ha.ZKFailoverController: 无法启动故障转移控制器中收到此错误。父 znode 不存在。使用 -formatZK 标志运行以初始化 ZooKeeper。 2017-04-19 04:53:06,170 信息 org.apache.hadoop.ha.ActiveStandbyElector:会话已连接。 2017-04-19 04:53:06,175 INFO org.apache.zookeeper.ZooKeeper:会话:0x15b859d1b370005 关闭 2017-04-19 04:53:06,176 INFO org.apache.zookeeper.ClientCnxn:EventThread 关闭且无法启动 ZKFC在 nn2 中。请帮忙。 我已经根据链接edureka.co/blog/…修改了集群配置我已经格式化了ZK,重启了集群。仍然不适合我。试图尽快解决问题。 ci@nn1:/usr/local/hadoop/sbin$ hdfs haadmin -getServiceState nn1 active ci@nn1:/usr/local/hadoop/sbin$ hdfs haadmin -getServiceState nn2 active 两个名称节点是活跃的。如果我停止 nn1 并启动 nn1 。 zkfc 没有运行。 nn2 也是如此。这是对的还是我错过了什么。 ci@nn1:/usr/local/hadoop/sbin$ hdfs haadmin -getServiceState nn2 active ci@nn1:/usr/local/hadoop/sbin$ hdfs haadmin -getServiceState nn1 active 我已经启动了 NN , JN 在活动和备用名称节点中。 ZKFC 在两个节点上运行。现在,我在 NN1 中暂停了 Internet 连接,是的,NN2 变为活动状态。但是,当我恢复 Internet 连接并启动 NN1 时。两个namenode都变得活跃。 Zkfc 在两个节点上运行。请指导。【参考方案2】:

你必须寻找自动故障转移的防护

https://***.com/a/27272565/3496666

https://hadoop.apache.org/docs/r2.7.2/hadoop-project-dist/hadoop-hdfs/HDFSHighAvailabilityWithQJM.html

【讨论】:

你能建议我解决这个问题吗?我无法帮助自己摆脱这个问题。我已经浏览了这些文章。 看看这个答案。它可能会解决您的问题。我认为这应该是一个击剑问题。 ***.com/a/36002948/3496666 ***.com/a/33313804/3496666 阅读本文以了解自动故障转移的工作原理。 是的,我已根据您的第二条评论进行了更改。它不工作。现在我拥有用户帐户 nn1 的完全权限。还是不行。 ci@nn1:/usr/local/hadoop/sbin$ hdfs haadmin -getServiceState nn2 active ci@nn1:/usr/local/hadoop/sbin$ hdfs haadmin -getServiceState nn1 active 我已经启动了 NN , JN 在活动和备用名称节点中。 ZKFC 在两个节点上运行。现在,我在 NN1 中暂停了 Internet 连接,是的,NN2 变为活动状态。但是,当我恢复 Internet 连接并启动 NN1 时。两个namenode都变得活跃。 Zkfc 在两个节点上运行。请指导。

以上是关于自动故障转移在 Hadoop 中不起作用的主要内容,如果未能解决你的问题,请参考以下文章

SQL Server 可用性组自动故障转移不起作用

Hadoop Streaming Job 在 OOzie 中不起作用

ActiveMQ 经典到 ActiveMQ Artemis 故障转移不起作用

平衡器在 hdfs HA 中不起作用

S3N 和 S3A distcp 在 Hadoop 2.6.0 中不起作用

Javascript 自动完成功能在 ascx 中不起作用