大数据学习——JAVA采集程序

Posted o_0

tags:

篇首语:本文由小常识网(cha138.com)小编为大家整理,主要介绍了大数据学习——JAVA采集程序相关的知识,希望对你有一定的参考价值。

1 需求

从外部购买数据,数据提供方会实时将数据推送到6台FTP服务器上,我方部署6台接口采集机来对接采集数据,并上传到HDFS中

 

提供商在FTP上生成数据的规则是以小时为单位建立文件夹(2016-03-11-10),每分钟生成一个文件(00.dat,01.data,02.dat,........)

 

提供方不提供数据备份,推送到FTP服务器的数据如果丢失,不再重新提供,且FTP服务器磁盘空间有限,最多存储最近10小时内的数据

 

由于每一个文件比较小,只有150M左右,因此,我方在上传到HDFS过程中,需要将15分钟时段的数据合并成一个文件上传到HDFS

 

为了区分数据丢失的责任,我方在下载数据时最好进行校验

2 设计分析

 

以上是关于大数据学习——JAVA采集程序的主要内容,如果未能解决你的问题,请参考以下文章

大数据学习教程:五大核心技术有哪些?

研究生阶段的大数据专业都学习什么科目?

小白学习大数据测试之hadoop再次探索

大数据培训到底是培训啥

学习大数据关键技术

大数据和Hadoop什么关系?为什么大数据要学习Hadoop?