ElasticSearch查询第四篇：匹配查询（Match）

Posted 2020-09-08 悦光阴

tags:

篇首语：本文由小常识网(cha138.com)小编为大家整理，主要介绍了ElasticSearch查询第四篇：匹配查询（Match）相关的知识，希望对你有一定的参考价值。

匹配（Match）查询属于全文（Fulltext）查询，不同于词条查询，ElasticSearch引擎在处理全文搜索时，首先分析（analyze）查询字符串，然后根据分词构建查询，最终返回查询结果。匹配查询共有三种类型，分别是布尔（boolean）、短语（phrase）和短语前缀（phrase_prefix），默认的匹配查询是布尔类型，这意味着，ElasticSearch引擎首先分析查询字符串，根据分析器对其进行分词，例如，对于以下match查询：

"query":{  
      "match":{  
         "eventname":"Microsoft Azure Party"
      }

查询字符串是“Microsoft Azure Party”，被分析器分词之后，产生三个小写的单词：microsoft，azure和party，然后根据分析的结果构造一个布尔查询，默认情况下，引擎内部执行的查询逻辑是：只要eventname字段值中包含有任意一个关键字microsoft、azure或party，那么返回该文档，伪代码是：

if (doc.eventname contains "microsoft" or doc.eventname contains "azure" or doc.eventname contains "party") 
return doc

通过调整operator 和 minimum_should_match 属性值，控制匹配查询的逻辑条件，进而控制引擎返回的结果。默认情况下operator的值是or，在构造查询时设置分词之间的逻辑运算符，如果设置为and，那么引擎内部执行的查询逻辑是：

if (doc.eventname contains "microsoft" and doc.eventname contains "azure" and doc.eventname contains "party") 
return doc

对于minimum_should_match 属性值，默认值是1，如果设置其值为2，表示分词必须匹配查询条件的数量为2，这意味着，只要文档的eventname字段包含任意两个关键字，就满足查询条件。

短语（Phrase）是一个字符串，其单个分词出现的位置和分词的数量是固定的。在进行短语查询时，必须匹配短语中每个分词及其相对位置，例如，对于包含两个分词的短语：“azure function”，分词“azure”出现在分词“function”之前，并且两个词条之间的位置相差一个空格，下面两个字符串都满足短语匹配：

"Azure Notification Hubs & Azure Function"
"Serverless Azure Function"

一，布尔匹配查询

布尔型match查询是把query参数中的条件字符串加以分析，使用索引映射中定义的分析器对字符串分词，然后构建相应的子查询，ElasticSearch选择合适的分析器（analyzer），该analyzer和建立索引时使用的分析器相同。在执行match查询时，默认情况下，字段值必须匹配任意一个词条，例如，当文档的eventname字段匹配任意一个分词，azure、aws和cloud时，该文档匹配match查询，匹配分词的数量是由匹配参数控制的。

POST /_search -d
{  
   "from":10,
   "size":5,
   "query":{  
      "match":{  
         "eventname":"azure aws cloud"
      }
   }
}

2，match查询常用的参数

operator：用来控制match查询匹配词条的逻辑条件，默认值是or，如果设置为and，表示查询满足所有条件；
minimum_should_match：当operator参数设置为or时，该参数用来控制应该匹配的分词的最少数量；

POST /search -d
{  
   "from":10,
   "size":5,
   "query":{  
      "match":{  
         "eventname":{  
            "query":"azure aws cloud security",
            "operator":"or",
            "minimum_should_match":2
         }
      }
   }
}

二，短语匹配查询(match_phrase)

在执行短语匹配查询时，ElasticSearch引擎首先分析（analyze）查询字符串，从分析后的文本中构建短语查询，这意味着必须匹配短语中的所有分词，并且保证各个分词的相对位置不变：

POST /_search -d
{  
   "from":1,
   "size":100,
   "fields":[ "eventname"],
   "query":{  
      "match_phrase":{  
         "eventname":"Open Source"
      }
   }
}

三，短语前缀匹配查询(match_phrase_prefix)

除了把查询文本的最后一个分词只做前缀匹配之外，match_phrase_prefix和match_phrase查询基本一样，参数 max_expansions 控制最后一个单词会被重写成多少个前缀，也就是，控制前缀扩展成分词的数量，默认值是50。扩展的前缀数量越多，找到的文档数量就越多；如果前缀扩展的数量太少，可能查找不到相应的文档，遗漏数据。如代码所示，能够查到eventname包含"Open Source Hack Night"的文档。

POST /_search -d
{  
   "from":1,
   "size":100,
   "fields":[ "eventname" ],
   "query":{  
      "match_phrase_prefix":{  
         "eventname":{  
            "query":"Open Source hac",
            "max_expansions":50
         }
      }
   }
}

参考文档：

Elasticsearch Reference [2.4] » Query DSL

以上是关于ElasticSearch查询第四篇：匹配查询（Match）的主要内容，如果未能解决你的问题，请参考以下文章

ElasticSearch查询 第四篇：匹配查询（Match）

ElasticSearch查询第四篇：匹配查询（Match）