推广项目清洗旧数据

Posted xx0829

tags:

篇首语:本文由小常识网(cha138.com)小编为大家整理,主要介绍了推广项目清洗旧数据相关的知识,希望对你有一定的参考价值。

1、背景

  数据初次清洗完成后,在做任务的过程中数据会不断衰减。当把初次清洗的数据后续衰减后,再次以做任务的方式清洗(做任务成功就代表数据可用)发现数据又可用了。由此推测部分数据可能有个冷却时间,当冷却时间过后又可以做任务,针对这种分析结果设计了旧数据循环清洗的功能。

2、设计方案

2.1、每10天的数据维护到一张历史表,例如:his_cookie_t2019082,his_cookie_t2019083分别代表2019-08-11至2019-08-20和2019-08-21至2019-08-31的数据;

2.2、每10以上将所有历史表数据按照关键字段去重后插入到初次清洗表cookie_clean_t;

2.3、正常清洗数据存储符合的数据到cookie_succ_t;

2.4、将初次清洗符合的数据(cookie_succ_t)和系统正常运营的数据(cookie_used_t)关联删除清洗符合的数据(cookie_succ_t)中重复数据;

2.5、分配符合的数据(cookie_succ_t)去做任务;

2.6、机器人做任务成功的数据uuid存储到redis;

2.7、从redis提取出来的数据插入到系统正常运营的数据(cookie_used_t)重复使用;

以上是关于推广项目清洗旧数据的主要内容,如果未能解决你的问题,请参考以下文章

const 正确清洗 pod(普通旧数据)

大数据项目4(数据清洗与集成)

Spark-ETL日志数据清洗分析项目(上)--个人学习解析(保姆级)

Hadoop学习笔记—20.网站日志分析项目案例数据清洗

文摘:使用Python进行数据清洗

20.采集项目流程篇之清洗数据绑定到hive表中