在 Postgres 中对事件进行分组

Posted

技术标签:

【中文标题】在 Postgres 中对事件进行分组【英文标题】:Grouping Events in Postgres 【发布时间】:2017-02-22 23:02:40 【问题描述】:

我有一个由网站上的用户活动生成的事件表:

timestamp | name
7:00 AM   | ...
7:01 AM   | ...
7:02 AM   | ...
7:30 AM   | ...
7:31 AM   | ...
7:32 AM   | ...
8:01 AM   | ...
8:03 AM   | ...
8:05 AM   | ...
8:08 AM   | ...
8:09 AM   | ...

我想汇总事件以提供用户何时处于活动状态的视图。我将活动定义为事件在 +/- 2 分钟内的时间段。对于上述内容,这意味着:

from    | till
7:00 AM | 7:02 AM
7:30 AM | 7:32 AM
8:01 AM | 8:05 AM
8:08 AM | 8:09 AM

编写将在该方法中聚合的查询的最佳方法是什么?是否可以通过 WINDOW 函数或自连接,或者是否需要 PL/SQL?

【问题讨论】:

【参考方案1】:

使用两个窗口函数:一个计算连续事件之间的间隔(间隙),另一个计算小于或等于 2 分钟的一系列间隙:

select arr[1] as "from", arr[cardinality(arr)] as "till"
from (  
    select array_agg(timestamp order by timestamp)  arr
    from (
        select timestamp, sum((gap > '2m' )::int) over w
        from (
            select timestamp, coalesce(timestamp - lag(timestamp) over w, '3m') gap
            from events
            window w as (order by timestamp)
            ) s
        window w as (order by timestamp)
        ) s
    group by sum
    ) s

   from   |   till   
----------+----------
 07:00:00 | 07:02:00
 07:30:00 | 07:32:00
 08:01:00 | 08:05:00
(3 rows)        

Test it here.

【讨论】:

【参考方案2】:

通过将它们分组在半小时地板周围并获得最小值和最大值:

WITH x(t) AS ( VALUES
('7:02 AM'::TIME),('7:01 AM'::TIME),('7:00 AM'::TIME),
('7:30 AM'::TIME),('7:31 AM'::TIME),('7:32 AM'::TIME),
('8:01 AM'::TIME),('8:03 AM'::TIME),('8:05 AM'::TIME)
)   
SELECT MIN(t) "from", MAX(t) "till"
   FROM (select t, date_trunc('hour', t) +
      CASE WHEN (t-date_trunc('hour', t)) >= '30 minutes'::interval
      THEN '30 minutes'::interval ELSE '0'::interval END t1 FROM x ) y
   GROUP BY t1 ORDER BY t1;

您可以使用日期时间值应用相同的收据,例如:

WITH x(t) AS (
   SELECT '2017-01-01'::TIMESTAMP + (RANDOM()*1440*'1 minute'::INTERVAL) t
   FROM GENERATE_SERIES(0,1000))
SELECT MIN...

【讨论】:

这并不能真正回答问题。我不能保证段总是在 30 分钟的间隔内(添加了一个反例)。

以上是关于在 Postgres 中对事件进行分组的主要内容,如果未能解决你的问题,请参考以下文章

按时间戳分钟在 postgres 中查询

sql 在Postgres中对表进行分区

如何使用 Postgres 在 Rails 中按天对记录进行分组

如何在 Postgres 9.4 中对 JSONB 类型的列执行更新操作

如何在 Postgres 中使用时间戳字段对日期进行分组?

对唯一行值进行分组 Postgis、postgres 和 Qgis