大数据仓库集锦
Posted null
tags:
篇首语:本文由小常识网(cha138.com)小编为大家整理,主要介绍了大数据仓库集锦相关的知识,希望对你有一定的参考价值。
大数据目前的主要趋势(自己理解)
文件系统、部署、各种流和开源工具-------ETL开发(BI项目)----数据统计分析------数据挖掘、机器学习
图片来自 浅析
一、关于kakfa kafka相关
Kafka是由LinkedIn开发的一个分布式的消息系统,使用Scala编写,它以可水平扩展和高吞吐率而被广泛使用。目前越来越多的开源分布式处理系统如Storm,Spark,Flink都支持与Kafka集成。现在我们的数据实时处理平台也使用到了kafka。现在它已被多家不同类型的公司作为多种类型的数据管道和消息系统使用。
二、spark Spark 以及 spark streaming 核心原理及实践
三、Sqoop sqoop 学习
将导入或导出命令翻译成 MapReduce 程序来实现 在翻译出的 MapReduce 中主要是对 InputFormat 和 OutputFormat 进行定制.
四、FLume (博客)
以上是关于大数据仓库集锦的主要内容,如果未能解决你的问题,请参考以下文章
大数据数据仓库-基于大数据体系构建数据仓库(Hive,Flume,Kafka,Azkaban,Oozie,SparkSQL)