spark 例子count(distinct 字段)

Posted chendapao

tags:

篇首语:本文由小常识网(cha138.com)小编为大家整理,主要介绍了spark 例子count(distinct 字段)相关的知识,希望对你有一定的参考价值。

spark 例子count(distinct 字段)


例子描述:

有个网站访问日志,有4个字段:(用户id,用户名,访问次数,访问网站)

需要统计:

1.用户的访问总次数去重

2.用户一共访问了多少种不同的网站

这里用sql很好写

select id,name,count(distinct url) from table group by id,name

其实这个题目是继官方和各种地方讲解聚合函数(aggregate)的第二个例子,第一个例子是使用aggregate来求平均数。

我们先用简易版来做一遍,后续我更新一份聚合函数版

原始数据:

id1,user1,2,http://www.baidu.com
id1,user1,2,http://www.baidu.com
id1,user1,3,http://www.baidu.com
id1,user1,100,http://www.baidu.com
id2,user2,2,http://www.baidu.com
id2,user2,1,http://www.baidu.com
id2,user2,50,http://www.baidu.com
id2,user2,2,http://www.sina.com

结果数据:

((id1,user1),4,1)
((id2,user2),4,2)


代码片段:

val sparkConf = new SparkConf().setAppName("DisFie").setMaster("local")
val sc = new SparkContext(sparkConf)
 
val source = Source.fromFile("C:\10.txt").getLines.toArray
val RDD0 = sc.parallelize(source)

RDD0
  .map {
    lines =>
      val line = lines.split(",")
      ((line(0), line(1)), (1, line(3)))
  }
  .groupByKey()
  .map {
    case (x, y) =>
      val(n,url) = y.unzip
    (x,n.size,url.toSet.size)
  }
  .foreach(println)








以上是关于spark 例子count(distinct 字段)的主要内容,如果未能解决你的问题,请参考以下文章

在 Django 中使用带有 GROUP BY 子句的 COUNT(DISTINCT 字段)

sql 语句中的DISTINCT以及在count中的使用

SQL COUNT DISTINCT 函数

Cakephp 2.x 在同一字段上查找同时具有 DISTINCT 和 COUNT 的查询

PySpark 2.1.1 groupby + approx_count_distinct 计数为 0

大数据之-HIVE入门(十二)