大数据学习——JAVA采集程序
Posted o_0
tags:
篇首语:本文由小常识网(cha138.com)小编为大家整理,主要介绍了大数据学习——JAVA采集程序相关的知识,希望对你有一定的参考价值。
1 需求
从外部购买数据,数据提供方会实时将数据推送到6台FTP服务器上,我方部署6台接口采集机来对接采集数据,并上传到HDFS中
提供商在FTP上生成数据的规则是以小时为单位建立文件夹(2016-03-11-10),每分钟生成一个文件(00.dat,01.data,02.dat,........)
提供方不提供数据备份,推送到FTP服务器的数据如果丢失,不再重新提供,且FTP服务器磁盘空间有限,最多存储最近10小时内的数据
由于每一个文件比较小,只有150M左右,因此,我方在上传到HDFS过程中,需要将15分钟时段的数据合并成一个文件上传到HDFS
为了区分数据丢失的责任,我方在下载数据时最好进行校验
2 设计分析
以上是关于大数据学习——JAVA采集程序的主要内容,如果未能解决你的问题,请参考以下文章