数据库牛人是如何进行SQL优化的？

Posted 2023-04-24

tags:

篇首语：本文由小常识网(cha138.com)小编为大家整理，主要介绍了数据库牛人是如何进行SQL优化的？相关的知识，希望对你有一定的参考价值。

参考技术A

SQL 查询优化减少了查询所需的资源并提高了整体系统性能，在本文中，我们将讨论 SQL 查询优化、它是如何完成的、最佳实践及其重要性。

SQL 查询优化是编写高效的 SQL 查询，并在执行时间和数据库表示方面 提高查询性能 的迭代过程，查询优化是几个关系数据库管理系统 (RDBMS) 的一项重要功能。

查询是对来自数据库的数据或信息的问题或请求，需要编写一组数据库可以理解的预定义代码，结构化查询语言 (SQL) 和其他查询语言旨在检索或管理关系数据库中的数据。

数据库中的查询可以用许多不同的结构编写，并且可以通过不同的算法执行，写得不好的查询会消耗更多的系统资源，执行时间长，并可能导致服务损失，一个完美的查询可以减少执行时间并带来最佳的 SQL 性能。

SQL查询优化的主要目的是：

确保查询处于最佳路径和形式非常重要，SQL 查询过程需要最好的执行计划和计算资源，因为它们是 CPU 密集型操作，SQL 查询优化通过三个基本步骤完成：

解析确保查询在语法和语义上都是正确的，如果查询语法正确，则将其转换为表达式并传递到下一步。

优化在查询性能中扮演着重要的角色，并且可能很困难，任何考虑优化的查询执行计划都必须返回与之前相同的结果，但优化后的性能应该会有所提高。

SQL 查询优化包括以下基本任务：

最后，查询执行涉及将查询优化步骤生成的计划转化为操作，如果没有发生错误，此步骤将返回结果给用户。

一旦用户确定某个查询需要改进以优化 SQL 性能，他们就可以选择任何优化方法——优化 SQL 查询性能的方法有很多种，下面介绍了一些最佳实践。

提高查询性能的一种简单方法是将 SELECT * 替换为实际的列名，当开发人员在表中使用 SELECT * 语句时，它会读取每一列的可用数据。

使用 SELECT 字段名 FROM 而不是 SELECT * FROM 时，可以缩小查询期间从表中提取的数据的范围，这有助于提高查询速度。

循环中的 SQL 查询运行不止一次，这会显着降低运行速度，这些查询会不必要地消耗内存、CPU 能力和带宽，这会影响性能，尤其是当 SQL 服务器不在本地计算机上时，删除循环内的查询可提高整体查询性能。

使用SQL 服务器索引可以减少运行时间并更快地检索数据，可以使用聚集和非聚集 SQL 索引来优化 SQL 查询，非聚集索引单独存储，需要更多的磁盘空间，因此，了解何时使用索引很重要。

该OLAP功能“扩展了SQL解析函数的语法。” SQL 中的 OLAP 功能更快且易于使用，熟悉这些语法的 SQL 开发人员和 DBA 可以很容易地适应和使用它们。

OLAP 函数可以创建所有标准计算度量，例如排名、移动聚合、份额、期初至今、前期和未来期、平行期等。

查询优化器使用统计信息来确定如何最好地连接表、何时应该使用索引以及如何访问这些索引等，无论是手动还是自动，SQL 服务器统计信息都应该保持最新。

过时的 SQL Server 统计信息会影响表、索引或列统计信息，并导致查询计划性能不佳。

SQL 查询优化可以轻松提高系统性能，从而节省成本，优化 SQL 查询可以提高运营效率并加快性能，从而提高系统上线进度。

SQL 查询优化很重要，原因有很多，包括：

组织可以通过更快的响应时间获得可靠的数据访问和高水平的性能，优化 SQL 查询不仅可以提高整体系统性能，还可以提高组织的声誉，最终，SQL 查询优化的最佳实践帮助用户获得准确、快速的数据库结果。

如何对Oracle sql 进行性能优化的调整

在SQL查询中，为了提高查询的效率，我们常常采取一些措施对查询语句进行SQL性能优化。本文我们总结了一些优化措施，接下来我们就一一介绍。
1.查询的模糊匹配
尽量避免在一个复杂查询里面使用 LIKE '%parm1%'—— 红色标识位置的百分号会导致相关列的索引无法使用，最好不要用。
解决办法:
其实只需要对该脚本略做改进，查询速度便会提高近百倍。改进方法如下：
a、修改前台程序——把查询条件的供应商名称一栏由原来的文本输入改为下拉列表，用户模糊输入供应商名称时，直接在前台就帮忙定位到具体的供应商，这样在调用后台程序时，这列就可以直接用等于来关联了。
b、直接修改后台——根据输入条件，先查出符合条件的供应商，并把相关记录保存在一个临时表里头，然后再用临时表去做复杂关联。
2.索引问题
在做性能跟踪分析过程中，经常发现有不少后台程序的性能问题是因为缺少合适索引造成的，有些表甚至一个索引都没有。这种情况往往都是因为在设计表时，没去定义索引，而开发初期，由于表记录很少，索引创建与否，可能对性能没啥影响，开发人员因此也未多加重视。然一旦程序发布到生产环境，随着时间的推移，表记录越来越多。这时缺少索引，对性能的影响便会越来越大了。
法则：不要在建立的索引的数据列上进行下列操作:
避免对索引字段进行计算操作
避免在索引字段上使用not，<>，!=
避免在索引列上使用IS NULL和IS NOT NULL
避免在索引列上出现数据类型转换
避免在索引字段上使用函数
避免建立索引的列中使用空值
3.复杂操作
部分UPDATE、SELECT 语句写得很复杂（经常嵌套多级子查询）——可以考虑适当拆成几步，先生成一些临时数据表，再进行关联操作。
4.update
同一个表的修改在一个过程里出现好几十次，如：

update table1 set col1=... where col2=...; update table1 set col1=... where col2=... ...

这类脚本其实可以很简单就整合在一个UPDATE语句来完成（前些时候在协助xxx项目做性能问题分析时就发现存在这种情况）
5.在可以使用UNION ALL的语句里，使用了UNION
UNION 因为会将各查询子集的记录做比较，故比起UNION ALL ，通常速度都会慢上许多。一般来说，如果使用UNION ALL能满足要求的话，务必使用UNION ALL。还有一种情况大家可能会忽略掉，就是虽然要求几个子集的并集需要过滤掉重复记录，但由于脚本的特殊性，不可能存在重复记录，这时便应该使用 UNION ALL，如xx模块的某个查询程序就曾经存在这种情况，见，由于语句的特殊性，在这个脚本中几个子集的记录绝对不可能重复，故可以改用UNION ALL）。
6.在WHERE 语句中，尽量避免对索引字段进行计算操作
这个常识相信绝大部分开发人员都应该知道，但仍有不少人这么使用，我想其中一个最主要的原因可能是为了编写写简单而损害了性能，那就不可取了。9月份在对XX系统做性能分析时发现，有大量的后台程序存在类似用法，如：where trunc(create_date)=trunc(:date1)，虽然已对create_date 字段建了索引，但由于加了TRUNC，使得索引无法用上。此处正确的写法应该是where create_date>=trunc(:date1) and create_date< pre=""><>或者是where create_date between trunc(:date1) and trunc(:date1)+1-1/(24*60*60)。
注意：因between 的范围是个闭区间（greater than or equal to low value and less than or equal to high value.），故严格意义上应该再减去一个趋于0的小数，这里暂且设置成减去1秒（1/(24*60*60)），如果不要求这么精确的话，可以略掉这步。
7.对Where 语句的法则
7.1 避免在WHERE子句中使用in，not in，or 或者having。
可以使用 exist 和not exist代替in和not in。
可以使用表链接代替 exist。Having可以用where代替，如果无法代替可以分两步处理。
例子

SELECT * FROM ORDERS WHERE CUSTOMER_NAME NOT IN (SELECT CUSTOMER_NAME FROM CUSTOMER)
优化

SELECT * FROM ORDERS WHERE CUSTOMER_NAME not exist (SELECT CUSTOMER_NAME FROM CUSTOMER)

7.2 不要以字符格式声明数字，要以数字格式声明字符值。（日期同样）否则会使索引无效，产生全表扫描。
例子使用：
SELECT emp.ename, emp.job FROM emp WHERE emp.empno = 7369;
--不要使用：
SELECT emp.ename, emp.job FROM emp WHERE emp.empno = '7369'
8.对Select语句的法则
在应用程序、包和过程中限制使用select * from table这种方式。看下面例子
--使用
SELECT empno,ename,category FROM emp WHERE empno = '7369'
--而不要使用
SELECT * FROM emp WHERE empno = '7369'
9. 排序
避免使用耗费资源的操作，带有DISTINCT,UNION,MINUS,INTERSECT,ORDER BY的SQL语句会启动SQL引擎执行，耗费资源的排序(SORT)功能. DISTINCT需要一次排序操作, 而其他的至少需要执行两次排序。
10.临时表
慎重使用临时表可以极大的提高系统性能。
关于SQL性能优化的知识就介绍到这里了参考技术A 在SQL查询中，为了提高查询的效率，我们常常采取一些措施对查询语句进行SQL性能优化。本文我们总结了一些优化措施，接下来我们就一一介绍。
1.查询的模糊匹配
尽量避免在一个复杂查询里面使用 LIKE '%parm1%'—— 红色标识位置的百分号会导致相关列的索引无法使用，最好不要用。
解决办法:
其实只需要对该脚本略做改进，查询速度便会提高近百倍。改进方法如下：
a、修改前台程序——把查询条件的供应商名称一栏由原来的文本输入改为下拉列表，用户模糊输入供应商名称时，直接在前台就帮忙定位到具体的供应商，这样在调用后台程序时，这列就可以直接用等于来关联了。
b、直接修改后台——根据输入条件，先查出符合条件的供应商，并把相关记录保存在一个临时表里头，然后再用临时表去做复杂关联。
2.索引问题
在做性能跟踪分析过程中，经常发现有不少后台程序的性能问题是因为缺少合适索引造成的，有些表甚至一个索引都没有。这种情况往往都是因为在设计表时，没去定义索引，而开发初期，由于表记录很少，索引创建与否，可能对性能没啥影响，开发人员因此也未多加重视。然一旦程序发布到生产环境，随着时间的推移，表记录越来越多。这时缺少索引，对性能的影响便会越来越大了。
法则：不要在建立的索引的数据列上进行下列操作:
避免对索引字段进行计算操作
避免在索引字段上使用not，<>，!=
避免在索引列上使用IS NULL和IS NOT NULL
避免在索引列上出现数据类型转换
避免在索引字段上使用函数
避免建立索引的列中使用空值
3.复杂操作
部分UPDATE、SELECT 语句写得很复杂（经常嵌套多级子查询）——可以考虑适当拆成几步，先生成一些临时数据表，再进行关联操作。
4.update
同一个表的修改在一个过程里出现好几十次，如：

update table1 set col1=... where col2=...; update table1 set col1=... where col2=... ...

这类脚本其实可以很简单就整合在一个UPDATE语句来完成（前些时候在协助xxx项目做性能问题分析时就发现存在这种情况）
5.在可以使用UNION ALL的语句里，使用了UNION
UNION 因为会将各查询子集的记录做比较，故比起UNION ALL ，通常速度都会慢上许多。一般来说，如果使用UNION ALL能满足要求的话，务必使用UNION ALL。还有一种情况大家可能会忽略掉，就是虽然要求几个子集的并集需要过滤掉重复记录，但由于脚本的特殊性，不可能存在重复记录，这时便应该使用 UNION ALL，如xx模块的某个查询程序就曾经存在这种情况，见，由于语句的特殊性，在这个脚本中几个子集的记录绝对不可能重复，故可以改用UNION ALL）。
6.在WHERE 语句中，尽量避免对索引字段进行计算操作
这个常识相信绝大部分开发人员都应该知道，但仍有不少人这么使用，我想其中一个最主要的原因可能是为了编写写简单而损害了性能，那就不可取了。9月份在对XX系统做性能分析时发现，有大量的后台程序存在类似用法，如：where trunc(create_date)=trunc(:date1)，虽然已对create_date 字段建了索引，但由于加了TRUNC，使得索引无法用上。此处正确的写法应该是where create_date>=trunc(:date1) and create_date< pre=""><>或者是where create_date between trunc(:date1) and trunc(:date1)+1-1/(24*60*60)。
注意：因between 的范围是个闭区间（greater than or equal to low value and less than or equal to high value.），故严格意义上应该再减去一个趋于0的小数，这里暂且设置成减去1秒（1/(24*60*60)），如果不要求这么精确的话，可以略掉这步。

以上是关于数据库牛人是如何进行SQL优化的？的主要内容，如果未能解决你的问题，请参考以下文章

如何对Oracle sql 进行性能优化的调整

如何进行SQL性能优化

如果输入一条查询一张表的sql语句，但数据库执行缓慢，如何并采取啥样的方法对数据库进行优化？

关于SQL优化的几点说明

如何优化大数据框上的 spark sql 操作？

一条sql执行过长的时间，你如何优化，从哪些方面？