大数据Kudu：什么是Kudu

Posted 2022-12-08 Lansonli

tags:

篇首语：本文由小常识网(cha138.com)小编为大家整理，主要介绍了大数据Kudu：什么是Kudu相关的知识，希望对你有一定的参考价值。

文章目录

什么是Kudu

前言

结构化数据存储在Hadoop生态系统中，分为静态数据和动态数据两类。静态数据指的是需要进行数据分析的数据，这种分析针对的数据量一般很大，例如：统计全年每个地区总营业额。动态数据指的是数据需要实时动态插入、更新、读取的数据。例如业务系统中海量用户基本信息的存储。

静态数据：

对于大批量数据分析场景，为了便于数据分析，Hadoop生态系统中一般将数据存储在HDFS中，HDFS设计的初衷就是一次写入多次读取，HDFS适合高吞吐连续访问数据场景。只支持数据的追加，不支持数据的更新修改，即不支持随机写。HDFS对于数据的随机读写支持不友好。

动态数据：

一些数据处理场景下，需要低延迟、高效的读取特定数据，我们可以将数据存储在HBase中，HBase支持数据的低延迟随机读写（HBase数据存储在HDFS中，本质上还是追加写。基于版本号和定期合并HFile实现随机读写，默认返回最大的时间戳数据）。HBase中以Rowkey为索引，对于需要大批量读取数据分析的场景，吞吐量不如HDFS。

例如我们有一个业务系统，有如下要求：