Hbase学习指南
Posted dmjx
tags:
篇首语:本文由小常识网(cha138.com)小编为大家整理,主要介绍了Hbase学习指南相关的知识,希望对你有一定的参考价值。
本篇Hbase组件基于CDH5进行安装,安装过程:https://www.cnblogs.com/dmjx/p/10037066.html
Hbase简介
HBase是一个高可靠、高性能、面向列、可伸缩的分布式存储系统,利用HBase技术可在廉价的PC Server上搭建大规模结构化存储集群。
Hbase设计模型
HBase中的每一张表就是所谓的BigTable。BigTable会存储一系列的行记录,行记录有三个基本类型的定义:
- RowKey:是行在BigTable中的唯一标识。
- TimeStamp:是每一次数据操作对应关联的时间戳,可以看作SVN的版本。
- Column:定义为<family>:<label>,通过这两部分可以指定唯一的数据的存储列,family的定义和修改需要对HBase进行类似于DB的DDL操作,而label,不需要定义直接可以使用,这也为动态定制列提供了一种手段。family另一个作用体现在物理存储优化读写操作上,同family的数据物理上保存的会比较接近,因此在业务设计的过程中可以利用这个特性。
物理存储模型
Table在行的方向上分割为多个HRegion,每个HRegion分散在不同的RegionServer中。 每个HRegion由多个Store构成,每个Store由一个MemStore和0或多个StoreFile组成,StoreFile以HFile格式存储在HDFS中。
memstore和storefile
- 一个region由多个store组成,每个store包含一个列族的所有数据
- store包括位于内存的memstore和我与硬盘的storefile
- 写操作先写memstore,当memstore中的数据达到某个阈值,hregionserver会 启动flashcache进程写入storefile,每次写入行成一个单独的storefile
- 当storefile大小超过一定阈值后,会把当前的region分割为两个,由hmaster分配到相应的region服务器,实现负载均衡
- 客户端检索数据时,现在memstore找,找不到再找storefile
hbase存储架构
从HBase的架构图上可以看出,HBase中的存储包括HMaster、HRegionSever、HRegion、HLog、Store、MemStore、StoreFile、HFile等,以下是HBase存储架构图:
HMaster的作用:
Hmaster进程负责管理所有HRegionserver。新Regionserver的注册,Regionserver Failover处理;
负责建表、修改表、删除表以及一些集群操作
Master进程负责所有Region的转移操作,新表创建时的Region分配,运行期间负载均衡保障,Regionserver Failover后的Region接管
Master进程可以有主备角色。集群可以配置多个master角色,集群启动时这些master角色通过竞争获得主master角色。主master只能有一个,所有备master进程在集群运行期间处于休眠状态,不干涉任何集群事务。
HRegionServer的作用:
维护HMaster分配给它的HRegion,处理对这些HRegion的IO请求
负责切分正在运行过程中变得过大的HRegion
Hregion:
Table在行的方向上分割为多个HRegion,HRegion是HBase中分布式存储和负载均衡的最小单元,即不同的HRegion可以分别在不同的HRegionServer上,但同一个HRegion是不会拆分到多个HRegionServer上的。HRegion按大小分割,每个表一般只有一个HRegion,随着数据不断插入表,HRegion不断增大,当HRegion的某个列簇达到一个阀值(默认256M)时就会分成两个新的HRegion。
Store:
每一个HRegion由一个或多个Store组成,至少是一个Store,HBase会把一起访问的数据放在一个Store里面,即为每个ColumnFamily建一个Store,如果有几个ColumnFamily,也就有几个Store。一个Store由一个MemStore和0或者多个StoreFile组成。 HBase以Store的大小来判断是否需要切分HRegion。
MemStore:
StoreFile:
MemStore内存中的数据写到文件后就是StoreFile,StoreFile底层是以HFile的格式保存。
Hfile:
HBase中KeyValue数据的存储格式,是Hadoop的二进制格式文件。 首先HFile文件是不定长的,长度固定的只有其中的两块:Trailer和FileInfo。(flush之后或者是memstore到达一定数量之后,生成的文件就是Hfile)
HLog :
HLog(WAL log):WAL意为write ahead log,用来做灾难恢复使用,HLog记录数据的所有变更,一旦region server 宕机,就可以从log中进行恢复。
LogFlusher :
定期的将缓存中信息写入到日志文件中
读取操作流程
1. client访问Zookeeper,查找-ROOT-表,获取.META.表信息。
2. 从.META.表查找,获取存放目标数据的HRegion信息,从而找到对应的HRegionServer。
3. 通过HRegionServer获取需要查找的数据。
4. HRegionserver的内存分为MemStore和BlockCache两部分,MemStore主要用于写数据,BlockCache主要用于读数据。读请求先到MemStore中查数据,查不到就到BlockCache中查,再查不到就会到StoreFile上读,并把读的结果放入BlockCache。
以上是关于Hbase学习指南的主要内容,如果未能解决你的问题,请参考以下文章
HBase福利|阿里云HBase Serverless开启大数据学习与测试的新时代
HBase指南 | HBase 2.0之修复工具HBCK2运维指南