Griffin调研笔记 --- 数据质量监控服务
Posted 杨鑫newlfe
tags:
篇首语:本文由小常识网(cha138.com)小编为大家整理,主要介绍了Griffin调研笔记 --- 数据质量监控服务相关的知识,希望对你有一定的参考价值。
Griffin起源于eBay中国,并与2016年12月进入Apache孵化器。
并于2018年毕业,称为Apache顶级项目。
数据质量模块是大数据平台中必不可少的一个功能组件,Apache Griffin(以下简称Griffin)是一个开源的大数据数据质量解决方案,它支持批处理和流模式两种数据质量检测方式,可以从不同维度(比如离线任务执行完毕后检查源端和目标端的数据数量是否一致、源表的数据空值数量等)度量数据资产,从而提升数据的准确度、可信度。
在Griffin的架构中,主要分为Define、Measure和Analyze三个部分,如下图所示:
各部分的职责如下:
-
Define:主要负责定义数据质量统计的维度,比如数据质量统计的时间跨度、统计的目标(源端和目标端的数据数量是否一致,数据源里某一字段的非空的数量、不重复值的数量、最大值、最小值、t
以上是关于Griffin调研笔记 --- 数据质量监控服务的主要内容,如果未能解决你的问题,请参考以下文章
数据质量管理工具预研——Griffin VS Deequ VS Great expectations VS Qualitis