MySQL正则表达式问题

Posted

tags:

篇首语:本文由小常识网(cha138.com)小编为大家整理,主要介绍了MySQL正则表达式问题相关的知识,希望对你有一定的参考价值。

这些是我在mysql5.1参考手册上看到的,一些不理解的东西....
mysql> SELECT 'fo\nfo' REGEXP '^fo$'; -> 0
mysql> SELECT 'fofo' REGEXP '^fo'; -> 1

1: ^符号代表什么意思....//^表示否定 是不是表示看fofo是不是不是以fo开头的字符串 那照着这个意思那上面第二条 不是应该为0 为什么是1呢...
2: 后面紧跟的$代表什么意思....

mysql> SELECT 'abcde' REGEXP 'a[bcd]2e'; -> 0
mysql> SELECT 'abcde' REGEXP 'a[bcd]3e'; -> 1
1: [abc]和[abc]*的区别 //[abc]* 我知道是代表0个或者多个abc
组成的字符串..
2: 我对上面的例子稍微做了改动SELECT 'abcde' REGEXP 'a[bcd]2,e'
-->1 // 我有点晕了a2和a2,的区别....

帮助文档上面也说了an与a的n个实例准确匹配。an,匹配a的n个或更多实例。am,n匹配a的m~n个实例,包含m和n。
照着上面说an与a的n个实例准确比配. 问题又来了 那上面的mysql> SELECT 'abcde' REGEXP 'a[bcd]2e'; -> 0
mysql> SELECT 'abcde' REGEXP 'a[bcd]3e'; -> 1

为什么又会出现不同的结果呢...//
还有个问题...当我做如下改动的时候..SELECT 'abcde' REGEXP '[bcd]2e'; ---> 1 如果是以A2为例 'a[bcde]2'和'[bcde]2'这两个中是
a[bcde]代表A还是[bcde]代表A呢.....

我是刚刚接触正则表达式 //代表我的一些理解....有什么不对的地方请指正一下....

参考技术A ^:头;
$:尾;
[abc123]:'abc123'中任意字符;
n:前面的字符出现n次;
n,:前面的字符至少出现n次。
如果没有^或$,任何位置匹配有可以。
正则缺省是贪婪的,最小匹配需要用'?'。
你给出的例子结果都对的。本回答被提问者采纳
参考技术B

MySQL 一直以来都支持正则匹配,不过对于正则替换则一直到MySQL 8.0 才支持。对于这类场景,以前要么在MySQL端处理,要么把数据拿出来在应用端处理。

比如我想把表y1的列str1的出现第3个action的子 串替换成dble,怎么实现?


1. 自己写SQL层的存储函数。代码如下写死了3个,没有优化,仅仅作为演示,MySQL 里非常不建议写这样的函数。

    mysql

    DELIMITER $$

    USE `ytt`$$

    DROP FUNCTION IF EXISTS `func_instr_simple_ytt`$$

    CREATE DEFINER=`root`@`localhost` FUNCTION `func_instr_simple_ytt`(

    f_str VARCHAR(1000), -- Parameter 1

    f_substr VARCHAR(100),  -- Parameter 2

    f_replace_str varchar(100),

    f_times int -- times counter.only support  3.

    ) RETURNS varchar(1000)

    BEGIN

    declare v_result varchar(1000) default 'ytt'; -- result.

    declare v_substr_len int default 0; -- search string length.

    set f_times = 3; -- only support  3.

    set v_substr_len = length(f_substr);

    select instr(f_str,f_substr) into @p1; -- First real position .

    select instr(substr(f_str,@p1+v_substr_len),f_substr) into @p2; Secondary virtual position.

    select instr(substr(f_str,@p2+ @p1 +2*v_substr_len - 1),f_substr) into @p3; -- Third virtual position.

    if @p1 > 0  && @p2 > 0 && @p3 > 0 then -- Fine.

    select

    concat(substr(f_str,1,@p1 + @p2 + @p3 + (f_times - 1) * v_substr_len  - f_times)

    ,f_replace_str,

    substr(f_str,@p1 + @p2 + @p3 + f_times * v_substr_len-2)) into v_result;

    else

    set v_result = f_str; -- Never changed.

    end if;

    -- Purge all session variables.

    set @p1 = null;

    set @p2 = null;

    set @p3 = null;

    return v_result;

    end;

    $$

    DELIMITER ;

    -- 调用函数来更新:

    mysql> update y1 set str1 = func_instr_simple_ytt(str1,'action','dble',3);

    Query OK, 20 rows affected (0.12 sec)

    Rows matched: 20  Changed: 20  Warnings: 0

    2. 导出来用sed之类的工具替换掉在导入,步骤如下:(推荐使用)

    1)导出表y1的记录。

    mysqlmysql> select * from y1 into outfile '/var/lib/mysql-files/y1.csv';Query OK, 20 rows affected (0.00 sec)


    2)用sed替换导出来的数据。

    shellroot@ytt-Aspire-V5-471G:/var/lib/mysql-files#  sed -i 's/action/dble/3' y1.csv


    3)再次导入处理好的数据,完成。

    mysql

    mysql> truncate y1;

    Query OK, 0 rows affected (0.99 sec)

    mysql> load data infile '/var/lib/mysql-files/y1.csv' into table y1;

    Query OK, 20 rows affected (0.14 sec)

    Records: 20  Deleted: 0  Skipped: 0  Warnings: 0

    以上两种还是推荐导出来处理好了再重新导入,性能来的高些,而且还不用自己费劲写函数代码。

    那MySQL 8.0 对于以上的场景实现就非常简单了,一个函数就搞定了。

    mysqlmysql> update y1 set str1 = regexp_replace(str1,'action','dble',1,3) ;Query OK, 20 rows affected (0.13 sec)Rows matched: 20  Changed: 20  Warnings: 0


    还有一个regexp_instr 也非常有用,特别是这种特指出现第几次的场景。比如定义 SESSION 变量@a。

    mysqlmysql> set @a = 'aa bb cc ee fi lucy  1 1 1 b s 2 3 4 5 2 3 5 561 19 10 10 20 30 10 40';Query OK, 0 rows affected (0.04 sec)


    拿到至少两次的数字出现的第二次子串的位置。

    mysqlmysql> select regexp_instr(@a,'[:digit:]2,',1,2);+--------------------------------------+| regexp_instr(@a,'[:digit:]2,',1,2) |+--------------------------------------+|                                   50 |+--------------------------------------+1 row in set (0.00 sec)


    那我们在看看对多字节字符支持如何。

    mysql

    mysql> set @a = '中国 美国 俄罗斯 日本 中国 北京 上海 深圳 广州 北京 上海 武汉 东莞 北京 青岛 北京';

    Query OK, 0 rows affected (0.00 sec)

    mysql> select regexp_instr(@a,'北京',1,1);

    +-------------------------------+

    | regexp_instr(@a,'北京',1,1)   |

    +-------------------------------+

    |                            17 |

    +-------------------------------+

    1 row in set (0.00 sec)

    mysql> select regexp_instr(@a,'北京',1,2);

    +-------------------------------+

    | regexp_instr(@a,'北京',1,2)   |

    +-------------------------------+

    |                            29 |

    +-------------------------------+

    1 row in set (0.00 sec)

    mysql> select regexp_instr(@a,'北京',1,3);

    +-------------------------------+

    | regexp_instr(@a,'北京',1,3)   |

    +-------------------------------+

    |                            41 |

    +-------------------------------+

    1 row in set (0.00 sec)

    那总结下,这里我提到了 MySQL 8.0 的两个最有用的正则匹配函数 regexp_replace 和 regexp_instr。针对以前类似的场景算是有一个完美的解决方案。

用于转义 MySQL 正则表达式语法的 PHP 函数

【中文标题】用于转义 MySQL 正则表达式语法的 PHP 函数【英文标题】:PHP function to escape MySQL regexp syntax 【发布时间】:2011-04-30 18:22:47 【问题描述】:

我正在寻找类似于 preg_quote 的东西,但使用的是 MySQL regexp 语法。

有什么想法吗?

【问题讨论】:

What's the best way to escape user input for Regular Expressions in MySQL?的可能重复 【参考方案1】:

感谢@bobince's good answer。但是如果你需要在引用后使用mysql_real_escape_string 会有一个问题,我在评论中提到过。

实际上preg_quotemysql_real_escape_string 有重叠,这就造成了这个问题! mysql_real_escape_string 在这种情况下不得转义 \。所以我建议:

function regexpEscape(/*string*/ $input)  // Uncomment `string` for PHP 7.0+
    return addcslashes(preg_quote($input), "\0'\"\n\r\x1A"); // charlist = All characters that escape by real_escape_string except backslash

(对于charlist,请参阅:http://php.net/manual/en/mysqli.real-escape-string.php)

我知道这不是一个理想的方法,但找不到更好的方法。

【讨论】:

转义正则表达式应该没有问题,然后使用mysql_real_escape_string转义【参考方案2】:

试试这个:(PHP)

    $tags="test'*\\\r blue";
    $tags=mysql_real_escape_string($tags);
    $tags=preg_replace('/([.*?+\[\]^$|(\)])/','\\\\\1',$tags);
    $tags=preg_replace('/(\\\[.*?+\[\]^$|(\)\\\])/','\\\\\1',$tags);

【讨论】:

【参考方案3】:

遗憾的是,PHP 的 preg_quote() 通过转义 MySQL 的 REGEXP 不理解的冒号 (:) 来搞乱 MySQL REGEXP

【讨论】:

那么 preg_quote 然后用非转义冒号替换所有转义冒号的最佳方法是什么? 我认为这个答案不正确。用 MySQL 试试:$statement = $wpdb->prepare( "SELECT %s REGEXP %s", 'hello:you', 'hello\\:you' )【参考方案4】:

MySQL 正则表达式是“扩展的”POSIX 变体 (ERE),在 PHP 中作为已弃用的 ereg_ 函数提供。

不幸的是,PHP 中没有 ereg_quote,但是 PCRE 的特殊字符是 ERE 特殊字符的超集,反斜杠转义非特殊标点字符不会对它造成伤害,所以您可以 安全地使用preg_quote

(当然,您将需要参数化查询或mysql_real_escape_string 引用之后,以防止反斜杠被误解为 MySQL 的非 ANSI 标准字符串文字转义。)

【讨论】:

小警告:空控制字符。 preg_quote 将其转义为 \000,这是 MySQL 无法识别的格式。但是 MySQL 的正则表达式引擎无论如何也无法处理空字符,它将它们作为终止符。 我不得不使用 str_replace('?', '\\?', preg_quote()),因为 preg_quote() 可以产生 ?当它不知道特殊的 UTF8 字符时。和 ?需要在正则表达式中转义。 有问题! mysql_real_escape_string 将转义反斜杠字符。此功能会导致所有反斜杠再次转义(如果您在引用后使用mysql_real_escape_string)! @Mir-Ismaili 是的,如果您将正则表达式注入 SQL 查询字符串文字中,您应该只使用mysql_real_escape_string,在这种情况下,您确实需要额外的反斜杠。通常,最好使用参数化查询并避免额外的转义。 要完成答案:要使用参数化 REGEXP,您可以像这样使用CONCATWHERE field REGEXP CONCAT('regexp part 1', ?, 'regexp part 2') 并将preg_quote($field) 绑定到? 参数。【参考方案5】:

没有用于此的原生 MySQL 函数。在将正则表达式传递给 MySQL 查询之前,您可能只需要使用 preg_quote

【讨论】:

preg_quote 不会转义 MySQL 所需的 &

以上是关于MySQL正则表达式问题的主要内容,如果未能解决你的问题,请参考以下文章

mysql 正则表达式 查询匹配 某个词

MySQL正则表达式

mysql支不支持正则表达式里的零宽断言

MySQL正则表达式匹配

MySQL 正则表达式

用于逗号分隔文本的 Mysql 正则表达式