mysql group by 的用法，集合后取出指定的字段

Posted 2023-04-05

tags:

篇首语：本文由小常识网(cha138.com)小编为大家整理，主要介绍了mysql group by 的用法，集合后取出指定的字段相关的知识，希望对你有一定的参考价值。

源数据

查询后得出内容：

poker 是以seat_number排序的哦

参考技术A mysql group by 用法解析(详细)
星期三, 09/21/2011 - 14:33 — jason
group by 用法解析
group by语法可以根据给定数据列的每个成员对查询结果进行分组统计，最终得到一个分组汇总表。
SELECT子句中的列名必须为分组列或列函数。列函数对于GROUP BY子句定义的每个组各返回一个结果。
某个员工信息表结构和数据如下：
id name dept salary edlevel hiredate
1 张三开发部 2000 3 2009-10-11
2 李四开发部 2500 3 2009-10-01
3 王五设计部 2600 5 2010-10-02
4 王六设计部 2300 4 2010-10-03
5 马七设计部 2100 4 2010-10-06
6 赵八销售部 3000 5 2010-10-05
7 钱九销售部 3100 7 2010-10-07
8 孙十销售部 3500 7 2010-10-06
例如，我想列出每个部门最高薪水的结果，sql语句如下：
SELECT DEPT, MAX(SALARY) AS MAXIMUM
FROM STAFF
GROUP BY DEPT
查询结果如下：
DEPT MAXIMUM
开发部 2500
设计部 2600
销售部 3500追问

找到答案了：
select time_sign,group_concat(poker order by seat_number ) from test group by time_sign
唉，这位，你乱抄
还有一个字多的方法，写不上去

参考技术B

在日常查询中，索引或其他数据查找的方法可能不是查询执行中最高昂的部分，例如：MySQL GROUP BY 可能负责查询执行时间 90% 还多。MySQL 执行 GROUP BY 时的主要复杂性是计算 GROUP BY 语句中的聚合函数。UDF 聚合函数是一个接一个地获得构成单个组的所有值。这样，它可以在移动到另一个组之前计算单个组的聚合函数值。当然，问题在于，在大多数情况下，源数据值不会被分组。来自各种组的值在处理期间彼此跟随。因此，我们需要一个特殊的步骤。

处理 MySQL GROUP BY让我们看看之前看过的同一张table： mysql> show create table tbl G *************************** 1. row *************************** Table: tbl Create Table: CREATE TABLE `tbl` ( `id` int(11) NOT NULL AUTO_INCREMENT, `k` int(11) NOT NULL DEFAULT '0', `g` int(10) unsigned NOT NULL, PRIMARY KEY (`id`), KEY `k` (`k`) ) ENGINE=InnoDB AUTO_INCREMENT=2340933 DEFAULT CHARSET=latin1 1 row in set (0.00 sec)

并且以不同方式执行相同的 GROUP BY 语句：

1、MySQL中的 Index Ordered GROUP BY

mysql> select k, count(*) c from tbl group by k order by k limit 5;

+---+---+

| k | c |

+---+---+

| 2 | 3 |

| 4 | 1 |

| 5 | 2 |

| 8 | 1 |

| 9 | 1 |

+---+---+

5 rows in set (0.00 sec)

mysql> explain select k, count(*) c from tbl group by k order by k limit 5 G

*************************** 1. row ***************************

id: 1

select_type: SIMPLE

table: tbl

partitions: NULL

type: index

possible_keys: k

key: k

key_len: 4

ref: NULL

rows: 5

filtered: 100.00

Extra: Using index

1 row in set, 1 warning (0.00 sec)

如果您有少量组，并且没有覆盖索引，索引顺序扫描可能会导致大量 IO。所以这可能不是最优化的计划。

mysql> explain select SQL_BIG_RESULT g, count(*) c from tbl group by g limit 5 G

*************************** 1. row ***************************

id: 1

select_type: SIMPLE

table: tbl

partitions: NULL

type: ALL

possible_keys: NULL

key: NULL

key_len: NULL

ref: NULL

rows: 998490

filtered: 100.00

Extra: Using filesort

1 row in set, 1 warning (0.00 sec)

mysql> select SQL_BIG_RESULT g, count(*) c from tbl group by g limit 5;

+---+---+

| g | c |

+---+---+

| 0 | 1 |

| 1 | 2 |

| 4 | 1 |

| 5 | 1 |

| 6 | 2 |

+---+---+

5 rows in set (0.88 sec)

一般来说，MySQL 只有在我们拥有大量组时才更喜欢使用这个计划，因为在这种情况下，排序比拥有临时表更有效（我们将在下面讨论）。

mysql> explain select g, sum(g) s from tbl group by g limit 5 G

*************************** 1. row ***************************

id: 1

select_type: SIMPLE

table: tbl

partitions: NULL

type: ALL

possible_keys: NULL

key: NULL

key_len: NULL

ref: NULL

rows: 998490

filtered: 100.00

Extra: Using temporary

1 row in set, 1 warning (0.00 sec)

mysql> select g, sum(g) s from tbl group by g order by null limit 5;

+---+------+

| g | s |

+---+------+

| 0 | 0 |

| 1 | 2 |

| 4 | 4 |

| 5 | 5 |

| 6 | 12 |

+---+------+

5 rows in set (7.75 sec)

如果要强制 MySQL 使用为 GROUP BY 执行临时表的计划，可以使用 SQL_SMALL_RESULT 提示。

mysql> explain select k,max(id) from tbl group by k G

*************************** 1. row ***************************

id: 1

select_type: SIMPLE

table: tbl

partitions: NULL

type: range

possible_keys: k

key: k

key_len: 4

ref: NULL

rows: 2

filtered: 100.00

Extra: Using index for group-by

1 row in set, 1 warning (0.00 sec)

mysql> select k,max(id) from tbl group by k;

+---+---------+

| k | max(id) |

+---+---------+

| 0 | 2340920 |

| 1 | 2340916 |

| 2 | 2340932 |

| 3 | 2340928 |

| 4 | 2340924 |

+---+---------+

5 rows in set (0.00 sec)

过滤和分组

mysql> alter table tbl add key(g);

Query OK, 0 rows affected (4.17 sec)

Records: 0 Duplicates: 0 Warnings: 0

mysql> explain select g, sum(g) s from tbl where k>1 group by g limit 5 G

*************************** 1. row ***************************

id: 1

select_type: SIMPLE

table: tbl

partitions: NULL

type: index

possible_keys: k,g

key: g

key_len: 4

ref: NULL

rows: 16

filtered: 50.00

Extra: Using where

1 row in set, 1 warning (0.00 sec)

mysql> explain select g, sum(g) s from tbl where k>4 group by g limit 5 G

*************************** 1. row ***************************

id: 1

select_type: SIMPLE

table: tbl

partitions: NULL

type: range

possible_keys: k,g

key: k

key_len: 4

ref: NULL

rows: 1

filtered: 100.00

Extra: Using index condition; Using temporary; Using filesort

1 row in set, 1 warning (0.00 sec)

Mysql group by,order by,dinstict优化

1.order by优化

实现方式：

1. 根据索引字段排序，利用索引取出的数据已经是排好序的，直接返回给客户端；

2. 没有用到索引，将取出的数据进行一次排序操作后返回给客户端。

EXPLAIN SELECT m.id,m.subject,c.content FROM group_message m,group_message_content c WHERE m.group_id = 1 AND m.id = c.group_msg_id ORDER BY m.user_id\G;

optimizer对query进行了优化，它会按照m.user_id上的索引顺序来访问数据，这样获取的数据已经是排好序的。

这种利用索引实现数据排序的方法是 MySQL 中实现结果集排序的最佳做法，利用已有的索引避免实际的排序计算所带来的资源消耗。

如果没有用到索引，mysql就会将取出的数据按照一定的排序算法进行排序，然后再把排好序的数据返回给客户端。mysql中主要使用两种排序算法：

1. 取出用于排序的条件字段和指向相应数据行的指针，在sort buffer中对条件进行排序，排好序之后利用指针取出数据行中的请求数据，然后返回给客户端；

2. 取出用于排序的条件字段和其它所有请求数据，将不用于排序的字段存放在一块内存中，然后在sort buffer中对条件字段进行排序，排好序后利用行指针将在内存中的数据进行匹配合并结果集，然后将排好序的数据返回给客户端。（减少数据的二次访问，节省了IO操作）

3.当用于排序的字段存在在多个表中，或者在排序之前要先经过join操作，mysql必须先把join的结果集放入一个临时表，之后再把临时表中的数据取到sort buffer里进行排序。

优化方式：

1. 加大max_length_for_sort_data参数的设置。当需要取出的所有数据长度小于这个参数的值的时候，mysql将采用第二重排序算法，否则，使用第一种算法，所以只要内存充足就可以设置足够大的值来让mysql采用改进的排序算法。

2. 去掉不必要的字段。

3. 增大sort_buffer_size参数的值。当mysql对条件字段进行排序时，如果需要排序字段的总长度大于该参数的值的时候，mysql就会对需要排序的字段使用临时表进行分段，这样也会有性能的消耗。

2.group by优化

group by的实现过程除了要使用排序操作外，还要进行分组操作，如果使用到一些聚合函数，还要进行相应的聚合计算。

实现方式：

1. 使用松散（Loose）索引扫描实现group by，所谓的松散索引扫描，就是mysql不需要扫描所有满足条件的索引键即可完成group by操作

2. 使用紧凑(Tight)索引扫描实现group by，紧凑索引与松散索引最主要的区别就是在需要扫描索引的时候，紧凑索引读取所有满足条件的索引键，然后再来使用group by操作得到相应的结果。

3.当optimizer无法找到合适的索引可以利用的时候，就会选择将读取的数据放入临时表中来完成group by操作。group by操作想要利用索引，必须满足group by字段必须同时存放于同一个索引中，且该索引是一个有序索引，而且，使用不同的聚合函数也会影响是否使用索引来实现group by操作。

优化方式：

1. 尽可能利用索引并且是松散索引来完成group by操作，这的依靠调整索引或者调整query来实现；

2. 当无法利用索引的时候，必须要提供足够的sort_buffer_size来供mysql完成排序操作，之前介绍过，不然mysql会将需要排序的字段进行分段排序，会影响性能。除此之外尽量不要对大结果集进行group by操作，因为一旦数据量超过系统最大临时表大小时，mysql会将临时表里的数据copy到磁盘上然后再进行操作，性能会成数量级的下降。

3.Dinstinct 优化

实现方式：

distinct的实现原理同group by类似，实现过程只是在group by之后只取出每一组中的第一条记录，所以distinct同样可以利用松散或者紧凑索引来实现，不同的是，当无法利用索引实现distinct时，mysql同样会将数据取出放进一个临时表，不过不会对临时表进行排序操作。

优化方式：

尽量使用索引，无法使用索引的时候，确保不要在大结果集上进行distinct操作，磁盘上的IO操作和内存中的IO操作性能完全不是一个数量级的差距。

以上是关于mysql group by 的用法，集合后取出指定的字段的主要内容，如果未能解决你的问题，请参考以下文章

mysql group by 的用法解析

Mysql group by,order by,dinstict优化

having和group by的区别？

mysql 可以group by 两个字段吗

mysql中“group by、having、order by、limit”的顺序及用法是啥？