自动故障转移在 Hadoop 中不起作用
Posted
技术标签:
【中文标题】自动故障转移在 Hadoop 中不起作用【英文标题】:Automatic Failover not working in Hadoop 【发布时间】:2017-04-19 08:27:38 【问题描述】:我正在尝试构建一个 3 节点集群(2 个 Namenode(nn1,nn2) 和 1 个 datanode(dn1))。使用 Namenode WEBUI,我可以看到 nn1 处于活动状态,而 nn2 处于待机状态。但是,当我杀死活动的 nn1 时,备用 nn2 不会激活。请帮助我我做错了什么或需要修改什么
nn1 /etc/hosts
127.0.0.1 localhost
192.168.10.153 nn1
192.168.10.154 dn1
192.168.10.155 nn2
nn2 /etc/hosts
127.0.0.1 localhost nn2
127.0.1.1 ubuntu
# The following lines are desirable for IPv6 capable hosts
::1 ip6-localhost ip6-loopback
fe00::0 ip6-localnet
ff00::0 ip6-mcastprefix
ff02::1 ip6-allnodes
ff02::2 ip6-allrouters
core-site.xml (nn1,nn2)
<configuration>
<property>
<name>fs.defaultFS</name>
<value>hdfs://192.168.10.153:8020</value>
</property>
<property>
<name>dfs.journalnode.edits.dir</name>
<value>/usr/local/hadoop/hdfs/data/jn</value>
</property>
<property>
<name>ha.zookeeper.quorum</name>
<value>192.168.10.153:2181,192.168.10.155:2181,192.168.10.154:2181</value>
</property>
</configuration>
hdfs-site.xml(nn1,nn2,dn1)
<property>
<name>dfs.replication</name>
<value>1</value>
</property>
<property>
<name>dfs.permissions</name>
<value>false</value>
</property>
<property>
<name>dfs.nameservices</name>
<value>ha-cluster</value>
</property>
<property>
<name>dfs.ha.namenodes.ha-cluster</name>
<value>nn1,nn2</value>
</property>
<property>
<name>dfs.namenode.rpc-address.ha-cluster.nn1</name>
<value>192.168.10.153:9000</value>
</property>
<property>
<name>dfs.namenode.rpc-address.ha-cluster.nn2</name>
<value>192.168.10.155:9000</value>
</property>
<property>/usr/local/hadoop/hdfs/datanode</value>
<name>dfs.namenode.http-address.ha-cluster.nn1</name>
<value>192.168.10.153:50070</value>
</property>
<property>
<name>dfs.namenode.http-address.ha-cluster.nn2</name>
<value>192.168.10.155:50070</value>
</property>
<property>
<name>dfs.namenode.shared.edits.dir</name>
<value>qjournal://192.168.10.153:8485;192.168.10.155:8485;192.168.10.154:8485/ha-cluster</value>
</property>
<property>
<name>dfs.client.failover.proxy.provider.ha-cluster</name>
<value>org.apache.hadoop.hdfs.server.namenode.ha.ConfiguredFailoverProxyProvider</value>
</property>
<property>
<name>dfs.ha.automatic-failover.enabled</name>
<value>true</value>
</property>
<property>
<name>ha.zookeeper.quorum</name>
<value>192.168.10.153:2181,192.168.10.155:2181,192.168.10.154:2181</value>
</property>
<property>
<name>dfs.ha.fencing.methods</name>
<value>sshfence</value>
</property>
<property>
<name>dfs.ha.fencing.ssh.private-key-files</name>
<value>/home/ci/.ssh/id_rsa</value></property></configuration>
LOGS :(zkfc nn1,nn2)(namenode nn1,nn2) 停止 nn1(活动节点) https://pastebin.com/bWvfnanQ
【问题讨论】:
【参考方案1】:您在 core-site.xml 中提到 <IP>:<port>
为 fs.defaultFS
用于 HA 集群。因此,当关闭您的活动名称节点时,它不知道重定向到哪里。
为名称服务选择逻辑名称,例如“mycluster”。
然后在 hdfs-site.xml 中也进行更改,dfs.namenode.http-address.[nameservice ID].[name node ID]
- 每个 NameNode 监听的完全限定的 HTTP 地址
在你的情况下,你必须给
核心站点.xml
<property>
<name>fs.defaultFS</name>
<value>hdfs://myCluster</value>
</property>
hdfs-site.xml
<property>
<name>dfs.namenode.rpc-address.myCluster.nn1</name>
<value>192.168.10.153:9000</value>
</property>
看清楚说明书https://hadoop.apache.org/docs/r2.7.2/hadoop-project-dist/hadoop-hdfs/HDFSHighAvailabilityWithQJM.html
希望这会对你有所帮助。
【讨论】:
谢谢,现在在 NN2 ZKFC :::: FATAL org.apache.hadoop.ha.ZKFailoverController: 无法启动故障转移控制器中收到此错误。父 znode 不存在。使用 -formatZK 标志运行以初始化 ZooKeeper。 2017-04-19 04:53:06,170 信息 org.apache.hadoop.ha.ActiveStandbyElector:会话已连接。 2017-04-19 04:53:06,175 INFO org.apache.zookeeper.ZooKeeper:会话:0x15b859d1b370005 关闭 2017-04-19 04:53:06,176 INFO org.apache.zookeeper.ClientCnxn:EventThread 关闭且无法启动 ZKFC在 nn2 中。请帮忙。 我已经根据链接edureka.co/blog/…修改了集群配置我已经格式化了ZK,重启了集群。仍然不适合我。试图尽快解决问题。 ci@nn1:/usr/local/hadoop/sbin$ hdfs haadmin -getServiceState nn1 active ci@nn1:/usr/local/hadoop/sbin$ hdfs haadmin -getServiceState nn2 active 两个名称节点是活跃的。如果我停止 nn1 并启动 nn1 。 zkfc 没有运行。 nn2 也是如此。这是对的还是我错过了什么。 ci@nn1:/usr/local/hadoop/sbin$ hdfs haadmin -getServiceState nn2 active ci@nn1:/usr/local/hadoop/sbin$ hdfs haadmin -getServiceState nn1 active 我已经启动了 NN , JN 在活动和备用名称节点中。 ZKFC 在两个节点上运行。现在,我在 NN1 中暂停了 Internet 连接,是的,NN2 变为活动状态。但是,当我恢复 Internet 连接并启动 NN1 时。两个namenode都变得活跃。 Zkfc 在两个节点上运行。请指导。【参考方案2】:你必须寻找自动故障转移的防护
https://***.com/a/27272565/3496666
https://hadoop.apache.org/docs/r2.7.2/hadoop-project-dist/hadoop-hdfs/HDFSHighAvailabilityWithQJM.html
【讨论】:
你能建议我解决这个问题吗?我无法帮助自己摆脱这个问题。我已经浏览了这些文章。 看看这个答案。它可能会解决您的问题。我认为这应该是一个击剑问题。 ***.com/a/36002948/3496666 ***.com/a/33313804/3496666 阅读本文以了解自动故障转移的工作原理。 是的,我已根据您的第二条评论进行了更改。它不工作。现在我拥有用户帐户 nn1 的完全权限。还是不行。 ci@nn1:/usr/local/hadoop/sbin$ hdfs haadmin -getServiceState nn2 active ci@nn1:/usr/local/hadoop/sbin$ hdfs haadmin -getServiceState nn1 active 我已经启动了 NN , JN 在活动和备用名称节点中。 ZKFC 在两个节点上运行。现在,我在 NN1 中暂停了 Internet 连接,是的,NN2 变为活动状态。但是,当我恢复 Internet 连接并启动 NN1 时。两个namenode都变得活跃。 Zkfc 在两个节点上运行。请指导。以上是关于自动故障转移在 Hadoop 中不起作用的主要内容,如果未能解决你的问题,请参考以下文章
Hadoop Streaming Job 在 OOzie 中不起作用
ActiveMQ 经典到 ActiveMQ Artemis 故障转移不起作用