🥖ElasticSearch-06-高级查询之复合查询

在查询中会有多种条件组合的查询,在ElasticSearch中叫复合查询。它提供了5种复合查询方式:bool query(布尔查询)boosting query(提高查询)constant_score(固定分数查询)dis_max(最佳匹配查询)function_score(函数查询)@pdai

🎈 复合查询引入


在前文中,我们使用bool查询来组合多个查询条件。

比如之前介绍的语句

  1. GET /ralph_index/_search
  2. {
  3. "query": {
  4. "bool": {
  5. "must": [
  6. { "match": { "age": "40" } }
  7. ],
  8. "must_not": [
  9. { "match": { "state": "ID" } }
  10. ]
  11. }
  12. }
  13. }

这种查询就是本文要介绍的复合查询,并且bool查询只是复合查询一种。

🎈 bool query(布尔查询)

通过布尔逻辑将较小的查询组合成较大的查询。

1 概念

Bool查询语法有以下特点

  • 子查询可以任意顺序出现
  • 可以嵌套多个查询,包括bool查询
  • 如果bool查询中没有must条件,should中必须至少满足一条才会返回结果。

bool查询包含四种操作符,分别是must,should,must_not,filter。他们均是一种数组,数组里面是对应的判断条件。

  • must: 必须匹配。贡献算分
  • must_not:过滤子句,必须不能匹配,但不贡献算分
  • should: 选择性匹配,至少满足一条。贡献算分
  • filter: 过滤子句,必须匹配,但不贡献算分

2 一些例子

看下官方举例

  • 例子1
  1. POST _search
  2. {
  3. "query": {
  4. "bool" : {
  5. "must" : {
  6. "term" : { "user.id" : "kimchy" }
  7. },
  8. "filter": {
  9. "term" : { "tags" : "production" }
  10. },
  11. "must_not" : {
  12. "range" : {
  13. "age" : { "gte" : 10, "lte" : 20 }
  14. }
  15. },
  16. "should" : [
  17. { "term" : { "tags" : "env1" } },
  18. { "term" : { "tags" : "deployed" } }
  19. ],
  20. "minimum_should_match" : 1,
  21. "boost" : 1.0
  22. }
  23. }
  24. }

在filter元素下指定的查询对评分没有影响 , 评分返回为0。分数仅受已指定查询的影响。

  • 例子2
  1. GET _search
  2. {
  3. "query": {
  4. "bool": {
  5. "filter": {
  6. "term": {
  7. "status": "active"
  8. }
  9. }
  10. }
  11. }
  12. }

这个例子查询查询为所有文档分配0分,因为没有指定评分查询。

  • 例子3
  1. GET _search
  2. {
  3. "query": {
  4. "bool": {
  5. "must": {
  6. "match_all": {}
  7. },
  8. "filter": {
  9. "term": {
  10. "status": "active"
  11. }
  12. }
  13. }
  14. }
  15. }

此bool查询具有match_all查询,该查询为所有文档指定1.0分。

  • 例子4
  1. GET /_search
  2. {
  3. "query": {
  4. "bool": {
  5. "should": [
  6. { "match": { "name.first": { "query": "shay", "_name": "first" } } },
  7. { "match": { "name.last": { "query": "banon", "_name": "last" } } }
  8. ],
  9. "filter": {
  10. "terms": {
  11. "name.last": [ "banon", "kimchy" ],
  12. "_name": "test"
  13. }
  14. }
  15. }
  16. }
  17. }

每个query条件都可以有一个_name属性,用来追踪搜索出的数据到底match了哪个条件。

🎈 boosting query(提高查询)

不同于bool查询,bool查询中只要一个子查询条件不匹配那么搜索的数据就不会出现。而boosting query则是降低显示的权重/优先级(即score)。

1 概念

比如搜索逻辑是 name = 'apple' and type ='fruit',对于只满足部分条件的数据,不是不显示,而是降低显示的优先级(即score)

2 例子

首先创建数据

  1. POST /test-dsl-boosting/_bulk
  2. { "index": { "_id": 1 }}
  3. { "content":"Apple Mac" }
  4. { "index": { "_id": 2 }}
  5. { "content":"Apple Fruit" }
  6. { "index": { "_id": 3 }}
  7. { "content":"Apple employee like Apple Pie and Apple Juice" }
  8. GET /test-dsl-boosting/_search

对匹配pie的做降级显示处理

  1. GET /test-dsl-boosting/_search
  2. {
  3. "query": {
  4. "boosting": {
  5. "positive": {
  6. "term": {
  7. "content": "apple"
  8. }
  9. },
  10. "negative": {
  11. "term": {
  12. "content": "pie"
  13. }
  14. },
  15. "negative_boost": 0.5
  16. }
  17. }
  18. }

执行结果如下

ElasticSearch-06-高级查询之复合查询 - 图1

🎈 constant_score(固定分数查询)

查询某个条件时,固定的返回指定的score;显然当不需要计算score时,只需要filter条件即可,因为filter context忽略score。

1 例子

首先创建数据

  1. POST /test-dsl-constant/_bulk
  2. { "index": { "_id": 1 }}
  3. { "content":"Apple Mac" }
  4. { "index": { "_id": 2 }}
  5. { "content":"Apple Fruit" }

查询apple

  1. GET /test-dsl-constant/_search
  2. {
  3. "query": {
  4. "constant_score": {
  5. "filter": {
  6. "term": { "content": "apple" }
  7. },
  8. "boost": 5.2
  9. }
  10. }
  11. }

ElasticSearch-06-高级查询之复合查询 - 图2

🎈 dis_max (最佳匹配查询)

分离最大化查询(Disjunction Max Query)指的是: 将任何与任一查询匹配的文档作为结果返回,但只将最佳匹配的评分作为查询的评分结果返回 。

1 例子

假设有个网站允许用户搜索博客的内容,以下面两篇博客内容文档为例:

  1. POST /test-dsl-dis-max/_bulk
  2. { "index": { "_id": 1 }}
  3. {"title": "Quick brown rabbits","body": "Brown rabbits are commonly seen."}
  4. { "index": { "_id": 2 }}
  5. {"title": "Keeping pets healthy","body": "My quick brown fox eats rabbits on a regular basis."}

用户输入词组 “Brown fox” 然后点击搜索按钮。事先,我们并不知道用户的搜索项是会在 title 还是在 body 字段中被找到,但是,用户很有可能是想搜索相关的词组。用肉眼判断,文档 2 的匹配度更高,因为它同时包括要查找的两个词:

现在运行以下 bool 查询:

  1. GET /test-dsl-dis-max/_search
  2. {
  3. "query": {
  4. "bool": {
  5. "should": [
  6. { "match": { "title": "Brown fox" }},
  7. { "match": { "body": "Brown fox" }}
  8. ]
  9. }
  10. }
  11. }

ElasticSearch-06-高级查询之复合查询 - 图3

为了理解导致这样的原因,需要看下如何计算评分的

  • should 条件的计算分数

要计算上述分数,首先要计算match的分数

  1. 第一个match 中 brown的分数

doc 1 分数 = 0.6931471

ElasticSearch-06-高级查询之复合查询 - 图4

  1. title中没有fox,所以第一个match 中 brown fox 的分数 = brown分数 + 0 = 0.6931471

doc 1 分数 = 0.6931471 + 0 = 0.6931471

ElasticSearch-06-高级查询之复合查询 - 图5

  1. 第二个 match 中 brown分数

doc 1 分数 = 0.21110919

doc 2 分数 = 0.160443

ElasticSearch-06-高级查询之复合查询 - 图6

  1. 第二个 match 中 fox分数

doc 1 分数 = 0

doc 2 分数 = 0.60996956

ElasticSearch-06-高级查询之复合查询 - 图7

  1. 所以第二个 match 中 brown fox分数 = brown分数 + fox分数

doc 1 分数 = 0.21110919 + 0 = 0.21110919

doc 2 分数 = 0.160443 + 0.60996956 = 0.77041256

ElasticSearch-06-高级查询之复合查询 - 图8

  1. 所以整个语句分数, should分数 = 第一个match + 第二个match分数

doc 1 分数 = 0.6931471 + 0.21110919 = 0.90425634

doc 2 分数 = 0 + 0.77041256 = 0.77041256

ElasticSearch-06-高级查询之复合查询 - 图9

  • 引入了dis_max

不使用 bool 查询,可以使用 dis_max 即分离 最大化查询(Disjunction Max Query) 。分离(Disjunction)的意思是 或(or) ,这与可以把结合(conjunction)理解成 与(and) 相对应。分离最大化查询(Disjunction Max Query)指的是: 将任何与任一查询匹配的文档作为结果返回,但只将最佳匹配的评分作为查询的评分结果返回 :

  1. GET /test-dsl-dis-max/_search
  2. {
  3. "query": {
  4. "dis_max": {
  5. "queries": [
  6. { "match": { "title": "Brown fox" }},
  7. { "match": { "body": "Brown fox" }}
  8. ],
  9. "tie_breaker": 0
  10. }
  11. }
  12. }

ElasticSearch-06-高级查询之复合查询 - 图10

0.77041256怎么来的呢? 下文给你解释它如何计算出来的。

  • dis_max 条件的计算分数

分数 = 第一个匹配条件分数 + tie_breaker * 第二个匹配的条件的分数 …

  1. GET /test-dsl-dis-max/_search
  2. {
  3. "query": {
  4. "dis_max": {
  5. "queries": [
  6. { "match": { "title": "Brown fox" }},
  7. { "match": { "body": "Brown fox" }}
  8. ],
  9. "tie_breaker": 0
  10. }
  11. }
  12. }

doc 1 分数 = 0.6931471 + 0.21110919 * 0 = 0.6931471

doc 2 分数 = 0.77041256 = 0.77041256

ElasticSearch-06-高级查询之复合查询 - 图11

这样你就能理解通过dis_max将doc 2 置前了, 当然这里如果缺省tie_breaker字段的话默认就是0,你还可以设置它的比例(在0到1之间)来控制排名。(显然值为1时和should查询是一致的)

🎈 function_score (函数查询)

简而言之就是用自定义function的方式来计算_score。

可以ES有哪些自定义function呢?

  • script_score 使用自定义的脚本来完全控制分值计算逻辑。如果你需要以上预定义函数之外的功能,可以根据需要通过脚本进行实现。
  • weight 对每份文档适用一个简单的提升,且该提升不会被归约:当weight为2时,结果为2 * _score。
  • random_score 使用一致性随机分值计算来对每个用户采用不同的结果排序方式,对相同用户仍然使用相同的排序方式。
  • field_value_factor 使用文档中某个字段的值来改变_score,比如将受欢迎程度或者投票数量考虑在内。
  • 衰减函数(Decay Function) - linearexpgauss

1 例子

以最简单的random_score 为例

  1. GET /_search
  2. {
  3. "query": {
  4. "function_score": {
  5. "query": { "match_all": {} },
  6. "boost": "5",
  7. "random_score": {},
  8. "boost_mode": "multiply"
  9. }
  10. }
  11. }

进一步的,它还可以使用上述function的组合(functions)

  1. GET /_search
  2. {
  3. "query": {
  4. "function_score": {
  5. "query": { "match_all": {} },
  6. "boost": "5",
  7. "functions": [
  8. {
  9. "filter": { "match": { "test": "bar" } },
  10. "random_score": {},
  11. "weight": 23
  12. },
  13. {
  14. "filter": { "match": { "test": "cat" } },
  15. "weight": 42
  16. }
  17. ],
  18. "max_boost": 42,
  19. "score_mode": "max",
  20. "boost_mode": "multiply",
  21. "min_score": 42
  22. }
  23. }
  24. }

script_score 可以使用如下方式

  1. GET /_search
  2. {
  3. "query": {
  4. "function_score": {
  5. "query": {
  6. "match": { "message": "elasticsearch" }
  7. },
  8. "script_score": {
  9. "script": {
  10. "source": "Math.log(2 + doc['my-int'].value)"
  11. }
  12. }
  13. }
  14. }
  15. }

文件转载