在 Postgres 中对事件进行分组
Posted
技术标签:
【中文标题】在 Postgres 中对事件进行分组【英文标题】:Grouping Events in Postgres 【发布时间】:2017-02-22 23:02:40 【问题描述】:我有一个由网站上的用户活动生成的事件表:
timestamp | name
7:00 AM | ...
7:01 AM | ...
7:02 AM | ...
7:30 AM | ...
7:31 AM | ...
7:32 AM | ...
8:01 AM | ...
8:03 AM | ...
8:05 AM | ...
8:08 AM | ...
8:09 AM | ...
我想汇总事件以提供用户何时处于活动状态的视图。我将活动定义为事件在 +/- 2 分钟内的时间段。对于上述内容,这意味着:
from | till
7:00 AM | 7:02 AM
7:30 AM | 7:32 AM
8:01 AM | 8:05 AM
8:08 AM | 8:09 AM
编写将在该方法中聚合的查询的最佳方法是什么?是否可以通过 WINDOW 函数或自连接,或者是否需要 PL/SQL?
【问题讨论】:
【参考方案1】:使用两个窗口函数:一个计算连续事件之间的间隔(间隙),另一个计算小于或等于 2 分钟的一系列间隙:
select arr[1] as "from", arr[cardinality(arr)] as "till"
from (
select array_agg(timestamp order by timestamp) arr
from (
select timestamp, sum((gap > '2m' )::int) over w
from (
select timestamp, coalesce(timestamp - lag(timestamp) over w, '3m') gap
from events
window w as (order by timestamp)
) s
window w as (order by timestamp)
) s
group by sum
) s
from | till
----------+----------
07:00:00 | 07:02:00
07:30:00 | 07:32:00
08:01:00 | 08:05:00
(3 rows)
Test it here.
【讨论】:
【参考方案2】:通过将它们分组在半小时地板周围并获得最小值和最大值:
WITH x(t) AS ( VALUES
('7:02 AM'::TIME),('7:01 AM'::TIME),('7:00 AM'::TIME),
('7:30 AM'::TIME),('7:31 AM'::TIME),('7:32 AM'::TIME),
('8:01 AM'::TIME),('8:03 AM'::TIME),('8:05 AM'::TIME)
)
SELECT MIN(t) "from", MAX(t) "till"
FROM (select t, date_trunc('hour', t) +
CASE WHEN (t-date_trunc('hour', t)) >= '30 minutes'::interval
THEN '30 minutes'::interval ELSE '0'::interval END t1 FROM x ) y
GROUP BY t1 ORDER BY t1;
您可以使用日期时间值应用相同的收据,例如:
WITH x(t) AS (
SELECT '2017-01-01'::TIMESTAMP + (RANDOM()*1440*'1 minute'::INTERVAL) t
FROM GENERATE_SERIES(0,1000))
SELECT MIN...
【讨论】:
这并不能真正回答问题。我不能保证段总是在 30 分钟的间隔内(添加了一个反例)。以上是关于在 Postgres 中对事件进行分组的主要内容,如果未能解决你的问题,请参考以下文章
如何使用 Postgres 在 Rails 中按天对记录进行分组