Griffin调研笔记 --- 数据质量监控服务

Posted 杨鑫newlfe

tags:

篇首语:本文由小常识网(cha138.com)小编为大家整理,主要介绍了Griffin调研笔记 --- 数据质量监控服务相关的知识,希望对你有一定的参考价值。

Griffin起源于eBay中国,并与2016年12月进入Apache孵化器。

并于2018年毕业,称为Apache顶级项目。

 

数据质量模块是大数据平台中必不可少的一个功能组件,Apache Griffin(以下简称Griffin)是一个开源的大数据数据质量解决方案,它支持批处理和流模式两种数据质量检测方式,可以从不同维度(比如离线任务执行完毕后检查源端和目标端的数据数量是否一致、源表的数据空值数量等)度量数据资产,从而提升数据的准确度、可信度。

 

在Griffin的架构中,主要分为Define、Measure和Analyze三个部分,如下图所示:

 

 

 

 

 

各部分的职责如下:

  • Define:主要负责定义数据质量统计的维度,比如数据质量统计的时间跨度、统计的目标(源端和目标端的数据数量是否一致,数据源里某一字段的非空的数量、不重复值的数量、最大值、最小值、t

以上是关于Griffin调研笔记 --- 数据质量监控服务的主要内容,如果未能解决你的问题,请参考以下文章

数据质量监控Griffin——使用

数据质量监控Griffin——docker部署

Linux搭建数据质量监控 Griffin

数据质量监控Griffin——打包方式安装部署

数仓之数据质量及Apache Griffin简介

数据质量管理工具预研——Griffin VS Deequ VS Great expectations VS Qualitis