CDH 6.0.1 集群 prepare 以及一些需要注意的地方

Posted piperck

tags:

篇首语:本文由小常识网(cha138.com)小编为大家整理,主要介绍了CDH 6.0.1 集群 prepare 以及一些需要注意的地方相关的知识,希望对你有一定的参考价值。

从这一篇文章开始会有三篇文章依次介绍集群搭建 「Before install」 「process」 「after install」

继上一篇使用 docker 部署单机 CDH 的文章,当我们使用 docker 评估完相关组件和一些功能之后,接下来就是使用 CDH express 版本来搭建集群。

搭建之前应该关注一下手册看下还有哪些可以注意的地方参见官方 before your install 

https://www.cloudera.com/documentation/enterprise/6/6.0/topics/installation_reqts.html#pre-install

 

看了一下5.x.x 的最后一个版本是 5.15.x 然后所带的组件如下:

ComponentPackage VersionTarballRelease NotesChanges File
Apache Avro avro-1.7.6+cdh5.15.1+140 Tarball Release notes Changes
Apache Crunch crunch-0.11.0+cdh5.15.1+104 Tarball Release notes Changes
Apache DataFu pig-udf-datafu-1.1.0+cdh5.15.1+27 Tarball Release notes Changes
Apache Flume flume-ng-1.6.0+cdh5.15.1+189 Tarball Release notes Changes
Apache Hadoop hadoop-2.6.0+cdh5.15.1+2822 Tarball Release notes Changes
Apache Hadoop MRv1 hadoop-0.20-mapreduce-2.6.0+cdh5.15.1+2822 (none) (none) (none)
Apache HBase hbase-1.2.0+cdh5.15.1+470 Tarball Release notes Changes
Apache HBase-Solr hbase-solr-1.5+cdh5.15.1+74 Tarball Release notes Changes
Apache Hive hive-1.1.0+cdh5.15.1+1395 Tarball Release notes Changes
Hue hue-3.9.0+cdh5.15.1+8420 Tarball Release notes Changes
Apache Impala impala-2.12.0+cdh5.15.1+0 (none) Release notes Changes
Kite SDK kite-1.0.0+cdh5.15.1+147 Tarball Release notes Changes
Apache Kudu kudu-1.7.0+cdh5.15.1+0 (none) Release notes Changes
Llama llama-1.0.0+cdh5.15.1+0 Tarball Release notes Changes
Apache Mahout mahout-0.9+cdh5.15.1+36 Tarball Release notes Changes
Apache Oozie oozie-4.1.0+cdh5.15.1+492 Tarball Release notes Changes
Apache Parquet parquet-1.5.0+cdh5.15.1+197 Tarball Release notes Changes
Parquet-format parquet-format-2.1.0+cdh5.15.1+20 Tarball Release notes Changes
Apache Pig pig-0.12.0+cdh5.15.1+114 Tarball Release notes Changes
Cloudera Search search-1.0.0+cdh5.15.1+0 Tarball Release notes Changes
Apache Sentry sentry-1.5.1+cdh5.15.1+458 Tarball Release notes Changes
Apache Solr solr-4.10.3+cdh5.15.1+529 Tarball Release notes Changes
Apache Spark spark-1.6.0+cdh5.15.1+569 Tarball Release notes Changes
Apache Sqoop sqoop-1.4.6+cdh5.15.1+136 Tarball Release notes Changes
Apache Sqoop2 sqoop2-1.99.5+cdh5.15.1+49 Tarball Release notes Changes
Apache Whirr whirr-0.9.0+cdh5.15.1+25 Tarball Release notes Changes
Apache ZooKeeper zookeeper-3.4.5+cdh5.15.1+149 Tarball Release notes Changes

这个图很容易看出即使是 5.x 的最新版本使用的 spark 的版本是 1.6.0,这个版本远远滞后了目前的社区 spark 发布的版本。如果要使用更新版本可能需要自己自行安装。

我们从 0 搭建当然愿意使用更新的稳定版本,所以采用 6.0.1 下面是 6.0.1 的一个软件包支持情况:

ComponentComponent VersionChanges Information
Apache Avro 1.8.2 Changes
Apache Flume 1.8.0 Changes
Apache Hadoop 3.0.0 Changes
Apache HBase 2.0.0 Changes
HBase Indexer 1.5 Changes
Apache Hive 2.1.1 Changes
Hue 4.2.0 Changes
Apache Impala 3.0.0 Changes
Apache Kafka 1.0.1 Changes
Kite SDK 1.0.0  
Apache Kudu 1.6.0 Changes
Apache Solr 7.0.0 Changes
Apache Oozie 5.0.0 Changes
Apache Parquet 1.9.0 Changes
Parquet-format 2.3.1 Changes
Apache Pig 0.17.0 Changes
Apache Sentry 2.0.0 Changes
Apache Spark 2.2.0 Changes
Apache Sqoop 1.4.7 Changes
Apache ZooKeeper 3.4.5 Changes

可以很容易看到两个关键地方的更新,一个是从 6.0.x 版本开始之后, hadoop 使用了 3.0.x 版本了。另外一个关键组件 spark 也从之前的 1.6.0 被升级到了 2.2.0。

包括 hadoop 版本和 spark 版本的变动,都可以前往官方网站获得更多的信息。

部署之前除了参看 before install 之外 ,可以仔细阅读一下 「Cloudera Enterprise Reference Architecture for Bare Metal Deployments」 这个文档。他会从物理机器配置,os 需求等部署相关的硬件问题,软件问题,操作系统问题,以及你想要的集群大小给出一些合理建议。

1. 比如推荐你使用 dns 而不要使用 hosts 文件来管理集群。

2. 比如推荐你关闭 iptables 来避免一些不必要的麻烦。

3. 比如推荐你开启 ntp 时间服务器,来同步 master 与各 node 之间的时间。

4. 比如给你硬盘划分资源提出一些合理建议 

等等等.参看这个手册,寻找一些我们关心的问题变得很有必要。

 

关于大礼包吃资源的情况,另外一个文档列出了更详细的信息:

我们关心的 CM(cloudera manager) 吃资源的情况

Cloudera Manager Server Storage Requirements

ComponentStorageNotes
Partition hosting /usr 1 GB  
Cloudera Manager Database 5 GB If the Cloudera Manager Database shares a host with the Service Monitor and Host Monitor, more storage space is required to meet the requirements for those components.

Host Based Cloudera Manager Server Requirements

Number of Cluster HostsDatabase Host ConfigurationHeap SizeLogical ProcessorsCloudera Manager Server Storage Local Directory
Very small (≤10) Shared 2 GB 4 5 GB minimum
Small (≤20) Shared 4 GB 6 20 GB minimum
Medium (≤200) Dedicated 8 GB 6 200 GB minimum
Large (≤500) Dedicated 10 GB 8 500 GB minimum
Extra Large (>500) Dedicated 16 GB 16 1 TB minimum

可以看到,根据集群大小的不同有一些不同的参数推荐。文档下面还有大礼包里面包含所有组件在什么情况部署下 大概消费的资源的参考。但是最终消耗还是要看我们自己部署的机器数目和开启应用的数量还有我们使用的情况。这些资料可以提供一个合理的参考。

 

想要了解 CDH 的全局端口使用情况(包含所有的大礼包里面的服务)可以参照

https://www.cloudera.com/documentation/enterprise/6/6.0/topics/cm_ig_ports_cm.html#cm_cn_ports 

 

想要了解 CDH hosts 以及 master 应该如何分配,可以参照

https://www.cloudera.com/documentation/enterprise/6/6.0/topics/cm_ig_host_allocations.html#host_role_assignments

 

如果想要了解一些自定义安装的详情,例如你不使用 CM 进行安装,想要安装一些老的组件可以参考

https://www.cloudera.com/documentation/enterprise/6/6.0/topics/cm_ig_custom_installation.html

 

以上就是开始集群搭建之前需要了解的一些情况,在这里做一个简单的纪录。

 

Reference:

https://www.cloudera.com/documentation/enterprise/6/6.0/topics/installation_reqts.html#pre-install  Before You Install

https://techvidvan.com/tutorials/hadoop-2-x-vs-hadoop-3-x/  20 Notable Difference Between Hadoop 2.x vs Hadoop 3.x

http://www.cloudera.com/documentation/other/reference-architecture/PDF/cloudera_ref_arch_metal.pdf  

https://www.cloudera.com/documentation/enterprise/release-notes/topics/hardware_requirements_guide.html

https://www.cloudera.com/documentation/enterprise/6/6.0/topics/cm_ig_ports_cm.html#cm_cn_ports  CDH 大礼包的端口使用详情(包含了所有的服务)

https://www.cloudera.com/documentation/enterprise/6/6.0/topics/cm_ig_host_allocations.html#host_role_assignments  CDH 角色分配

https://www.cloudera.com/documentation/enterprise/6/6.0/topics/cm_ig_custom_installation.html  CDH 自定义安装的一些介绍

以上是关于CDH 6.0.1 集群 prepare 以及一些需要注意的地方的主要内容,如果未能解决你的问题,请参考以下文章

CDH 6.0.1 集群搭建 「After install」

CentOS 7下Cloudera Manager及CDH 6.0.1安装过程详解

优化cdh集群性能-可在安装集群前操作002

CDH集群之YARN性能调优

CDH搭建Hadoop分布式集群(超级小白)

CDH5.7Hadoop集群搭建(离线版)