【EslaticSearch】ES 搜索引擎详解

上官玺 2023-09-27 原文

ES 搜索引擎

查询文档

基本语法

GET /索引库名/_search
{
    "query":{
        "查询类型":{
            "查询条件":"查询条件值"
        }
    }
}

这里的query代表一个查询对象，里面可以有不同的查询属性，ES提供了基于JSON的DSL来定义查询。常见的查询类型包括：

查询所有：查询出所有数据，一般测试用。例如：match_all
全文检索：利用分词器对用户输入内容分词，然后去倒排索引库中匹配。例如：match_query、multi_match_query
精确查询：根据精确词条值查找数据，一般是查找keyword、数值、日期、boolean等类型字段。例如：term、range
地理查询：根据经纬度查询。例如：geo_distance、geo_bounding_box
复合查询：复合查询可以将上述各种查询条件组合起来，合并查询条件。例如：bool、function_score

#查询所有
GET /hotel/_search
{
  "query": {
    "match_all": {}
  }
}

效果：

{
  "took" : 1, //查询花费时间，单位是毫秒
  "timed_out" : false,  //是否超时
  "_shards" : {  //分片信息
    "total" : 1,
    "successful" : 1,
    "skipped" : 0,
    "failed" : 0
  },
  "hits" : { //搜索结果
    "total" : { //搜索到的总条数
      "value" : 201,
      "relation" : "eq"
    },
    "max_score" : 1.0, //所有结果中文档得分的最高分
    "hits" : [ //搜索结果的文档对象数组，每个元素是一条搜索到的文档信息
      {
        "_index" : "hotel",
        "_type" : "_doc",
        "_id" : "36934",
        "_score" : 1.0,
        "_source" : {
          "address" : "静安交通路40号",
          "brand" : "7天酒店",
          "business" : "四川北路商业区",
          "city" : "上海",
          "id" : 36934,
          "location" : "31.251433, 121.47522",
          "name" : "7天连锁酒店(上海宝山路地铁站店)",
          "pic" : "https://m.tuniucdn.com/fb2/t1/G1/M00/3E/40/Cii9EVkyLrKIXo1vAAHgrxo_pUcAALcKQLD688AAeDH564_w200_h200_c1_t0.jpg",
          "price" : 336,
          "score" : 37,
          "starName" : "二钻"
        }
      },
        //省略..........
    ]
  }
}

全文检索

对用户搜索的内容做分词，得到词条
根据词条去倒排索引库中匹配，得到文档id
根据文档id找到文档，返回给用户

match

match查询：全文检索查询的一种，会对用户输入内容分词，然后去倒排索引库检索，语法：

#match 倒排索引库查询
GET /hotel/_search
{
  "query": {
    "match": {
      "all": "外滩如家"
    }
  }
}

效果：

{
  "took" : 3,
  "timed_out" : false,
  "_shards" : {
    "total" : 1,
    "successful" : 1,
    "skipped" : 0,
    "failed" : 0
  },
  "hits" : {
    "total" : {
      "value" : 32,
      "relation" : "eq"
    },
    "max_score" : 5.920452,
    "hits" : [
      {
        "_index" : "hotel",
        "_type" : "_doc",
        "_id" : "434082",
        "_score" : 5.920452,
        "_source" : {
          "address" : "复兴东路260号",
          "brand" : "如家",
          "business" : "豫园地区",
          "city" : "上海",
          "id" : 434082,
          "location" : "31.220706, 121.498769",
          "name" : "如家酒店·neo(上海外滩城隍庙小南门地铁站店)",
          "pic" : "https://m.tuniucdn.com/fb2/t1/G6/M00/52/B6/Cii-U13eXLGIdHFzAAIG-5cEwDEAAGRfQNNIV0AAgcT627_w200_h200_c1_t0.jpg",
          "price" : 392,
          "score" : 44,
          "starName" : "二钻"
        }
      },

multi_match

multi_match：与match查询类似，只不过允许同时查询多个字段，
语法：

GET /hotel/_search
{
  "query": {
    "multi_match": {
      "query": "",
      "fields": ["field1","field2"]
    }
  }
}

示例:

GET /hotel/_search
{
  "query": {
    "multi_match": {
      "query": "外滩如家",
      "fields": ["name","business","brand"]
    }
  }
}

效果：

{
  "took" : 9,
  "timed_out" : false,
  "_shards" : {
    "total" : 1,
    "successful" : 1,
    "skipped" : 0,
    "failed" : 0
  },
  "hits" : {
    "total" : {
      "value" : 32,
      "relation" : "eq"
    },
    "max_score" : 4.620212,
    "hits" : [
      {
        "_index" : "hotel",
        "_type" : "_doc",
        "_id" : "434082",
        "_score" : 4.620212,
        "_source" : {
          "address" : "复兴东路260号",
          "brand" : "如家",
          "business" : "豫园地区",
          "city" : "上海",
          "id" : 434082,
          "location" : "31.220706, 121.498769",
          "name" : "如家酒店·neo(上海外滩城隍庙小南门地铁站店)",
          "pic" : "https://m.tuniucdn.com/fb2/t1/G6/M00/52/B6/Cii-U13eXLGIdHFzAAIG-5cEwDEAAGRfQNNIV0AAgcT627_w200_h200_c1_t0.jpg",
          "price" : 392,
          "score" : 44,
          "starName" : "二钻"
        }
      },

可以看到，match和multi_match两种查询结果是一样的是因为我们将brand、name、business值都利用copy_to复制到了all字段中，虽然效果一样但是搜索字段越多，对查询性能影响越大，因此建议采用copy_to，然后单字段查询的方式。

精准查询

精确查询一般是查找keyword、数值、日期、boolean等类型字段，它不会对搜索条件分词。常见的有：

term：根据词条精确匹配，一般搜索keyword类型、数值类型、布尔类型、日期类型字段
range：根据数值范围查询，可以是数值、日期的范围

term

term: 根据词条进行精确查询，查询过程中不会对词条进行分词处理
语法：

#精确查询
GET /hotel/_search
{
  "query": {
    "term": {
      "FIELD": {
        "value": "VALUE"
      }
    }
  }
}

示例：

GET /hotel/_search
{
  "query": {
    "term": {
      "city": {
        "value": "北京"
      }
    }
  }
}

range

范围查找
语法：

GET /indexName/_search
{
  "query": {
    "range": {
      "FIELD": {
        "gte": 10, // 这里的gte代表大于等于，gt则代表大于
        "lte": 20 // lte代表小于等于，lt则代表小于
      }
    }
  }
}

示例：

GET /hotel/_search
{
  "query": {
    "range": {
      "price": {
        "gte": 1000,
        "lte": 2000
      }
    }
  }
}

地理查询

应用场景：根据经纬度查询常见场景包括：
携程：搜索附近的九点
滴滴：搜索附近的出租车

geo_bounding_box 矩形范围

矩形范围查询，也就是geo_bounding_box查询，查询坐标落在某个矩形范围的所有文档

查询时，需要指定矩形的左上、右下两个点的坐标，然后画出一个矩形，落在该矩形内的都是符合条件的点。

获取坐标请点击这里！

语法：

{
  "query": {
    "geo_bounding_box": {
      "location": {
      "top_left": {//左上坐标
        "lat": 40.08,
        "lon": 116.47
      },
      "bottom_right": {//右下坐标
        "lat":39.9,
        "lon":116.405
        }
      }
    }
  }
}

geo_distance 圆形范围

附近查询，也叫做距离查询（geo_distance）：查询到指定中心点小于某个距离值的所有文档。

也就是说在地图上找一个点作为圆心，以指定距离为半径，画一个圆，落在圆内的坐标都算符合条件

语法：

GET /hotel/_search
{
  "query": {
    "geo_distance":{
      "distance":"15km", // 半径
      "location":"39.9,116.405" // 圆心 这个坐标是天安门
    }
  }
}

fuction_score 算分函数

fuction_score：算分函数查询，可以控制文档相关性算分，控制文档排名
当我们利用match查询时，文档结果会根据与搜索词条的关联度打分（_score），返回结果时按照分值降序排列

例如，我们搜索 "虹桥如家"，结果如下：

elasticsearch会根据词条和文档的相关度做打分，算法由两种：

TF-IDF算法
BM25算法，elasticsearch5.1版本后采用的算法

算分函数查询

算分函数关键点是：

过滤条件：决定哪些文档的算分被修改
算分函数：决定函数算分的算法
运算模式：决定最终算分结果
示例：

# 默认查询
GET /hotel/_search
{
  "query": {
    "match": {
      "all": "北京"
    }
  }
}

# 算法函数查询
GET /hotel/_search
{
  "query": {
    "function_score": {
      "query": {
        "match": {
          "all": "北京"
        }
      },
      "functions": [
        {
          "filter": {
            "term": {
              "brand": "凯悦"
            }
          },
          "weight": 10
        }
      ],
      "boost_mode": "multiply"
    }
  }
}

bool query 复合查询

bool query：复合查询，也称为布尔查询，它可以利用多种逻辑关系将多个查询条件组装在一起，然后实现复杂搜索
布尔查询是一个或多个查询子句的组合，每一个子句就是一个子查询。子查询的组合方式有：

must：必须匹配每个子查询，类似“与” and
should：选择性匹配子查询，类似“或” or
must_not：必须不匹配，不参与算分，类似“非” not
filter：必须匹配，不参与算分
搜索时，参与打分的字段越多，查询的性能也越差。因此这种多条件查询时，建议这样做：
搜索框的关键字搜索，是全文检索查询，使用must查询，参与算分
其它过滤条件，采用filter查询。不参与算分

GET /hotel/_search
{
  "query": {
    "bool": {
      "must": [
        {"term": {
          "name": {
            "value": "如家"
          }
        }}
      ],
      "must_not": [
        {"range":{
          "price": {
            "gte": 400
          }
        }
        }
      ],
      "filter": [
        {
          "geo_distance": {
            "distance": "10km",
            "location": {
              "lat": 39.9,
              "lon":  116.405
            }
          }
        }
      ]
    }
  }
}

结果处理

排序
elasticsearch支持对搜索结果排序，默认是根据相关度算分（_score）来排序。

可以排序字段类型有：keyword类型、数值类型、地理坐标类型、日期类型等。

普通字段排序

语法：

GET /hotel/_search
{
  "query": {
    "match_all": {}
  },
  "sort": [
    {   //语法一
      "FIELD": {      //排序字段，排序方式 ASC,DESC
        "order": "desc"
      }
    },
    { //语法二
      "field": "desc" //排序字段，排序方式 ASC,DESC
    }
  ]
}

示例：酒店数据按照用户评价（score)降序排序，评价相同的按照价格(price)升序排序

GET /hotel/_search
{
  "query": {
    "match_all": {}
  },
  "sort": [
    {
      "score": {
        "order": "desc"
      },
      "price": {
        "order": "asc"
      }
    }
  ]
}

地理坐标排序

语法：

GET /indexName/_search
{
  "query": {
    "match_all": {}
  },
  "sort": [
    {
      "_geo_distance" : {
          "FIELD" : "纬度，经度", // 文档中geo_point类型的字段名、目标坐标点
          "order" : "asc" // 排序方式
      }
    }
  ]
}

获取经纬度点击这里
示例：假设我的位置是：31.034661，121.612282，寻找我周围距离最近的酒店。

GET /hotel/_search
{
    "query": {
    "match_all": {}
  },
  "sort": [
    {
      "_geo_distance": {
        "location": {
          "lat": 39.909187,
         "lon": 116.397455
        },
        "order": "asc"
      }
    }
  ]
}

分页

elasticsearch 默认情况下只返回top10的数据。而如果要查询更多数据就需要修改分页参数了。

elasticsearch中通过修改from、size参数来控制要返回的分页结果：

from：从第几个文档开始
size：总共查询几个文档
类似于mysql中的limit ?, ?

基本分页

语法：

GET /hotel/_search
{
  "query":{
    "match_all":{}
  },
  "from":0, //分页开始的位置，默认为0
  "size":10, //期望获取的文档总数
  "sort":[
    {"price":"asc"}
  ]
}

高亮

** 基本语法：**

GET /hotel/_search
{
  "query": {
    "match": {
      "FIELD": "TEXT"
    }
  },
  "highlight": {
    "fields": {	//指定要高亮的字段
      "FIELD": {
        "pre_tags": "<em>",	//标记高亮字段的前置标签
        "post_tags": "</em>"	//标记高亮字段的后置标签
    }
  }
}
}

示例：

# 查询字段跟高亮字段一致
GET /hotel/_search
{
  "query": {
    "match": {
      "name": "如家"
    }
  },
  "highlight": {
    "fields": {
      "name": {
        "pre_tags": "<em>",
        "post_tags": "</em>"
      }
    }
  }
}

# 查询字段跟高亮字段不一致
GET /hotel/_search
{
  "query": {
    "match": {
      "all": "如家"
    }
  },
  "highlight": {
    "fields": {
      "name": {
        "pre_tags": "<em>",
        "post_tags": "</em>",
        "require_field_match": "false"
      }
    }
  }
}

EslaticSearch 详解 span class token elasticsearch 全文检索搜索引擎

有关【EslaticSearch】ES 搜索引擎详解的更多相关文章

ruby - 在没有 sass 引擎的情况下使用 sass 颜色函数 - 2
我想在一个没有Sass引擎的类中使用Sass颜色函数。我已经在项目中使用了sassgem，所以我认为搭载会像以下一样简单:classRectangleincludeSass::Script::FunctionsdefcolorSass::Script::Color.new([0x82,0x39,0x06])enddefrender#hamlengineexecutedwithcontextofself#sothatwithintemlateicouldcall#%stop{offset:'0%',stop:{color:lighten(color)}}endend更新:参见上面的#re
ruby-on-rails - Nokogiri:使用 XPath 搜索 <div> - 2
我使用Nokogiri(Rubygem)css搜索寻找某些在我的html里面。看起来Nokogiri的css搜索不喜欢正则表达式。我想切换到Nokogiri的xpath搜索，因为这似乎支持搜索字符串中的正则表达式。如何在xpath搜索中实现下面提到的(伪)css搜索？require'rubygems'require'nokogiri'value=Nokogiri::HTML.parse(ABBlaCD3"HTML_END#my_blockisgivenmy_bl="1"#my_eqcorrespondstothisregexmy_eq="\/[0-9]+\/"#FIXMEThefoll
ruby-on-rails - Rails 中的推荐引擎 - 2
我想为我的Rails网络应用程序提供推荐功能。特别是，我想向新注册的用户推荐他可能想要关注的其他用户。Rails中是否有用于此目的的引擎/gem？如果没有，我应该从哪里开始构建它？谢谢。最佳答案有Coletivogemhttps://github.com/diogenes/coletivo我试了一下。在MySQL上运行。Neo4jhttp://neo4j.org真的很容易实现一个“跟随谁”。事实上，大多数展示其能力的样本都涉及“跟随谁”。快速提示-只有在JRuby上运行时，Neo4j.rb才会很酷。如果不是-使用Neograph
世界前沿3D开发引擎HOOPS全面讲解——集3D数据读取、3D图形渲染、3D数据发布于一体的全新3D应用开发工具 - 2
无论您是想搭建桌面端、WEB端或者移动端APP应用，HOOPSPlatform组件都可以为您提供弹性的3D集成架构，同时，由工业领域3D技术专家组成的HOOPS技术团队也能为您提供技术支持服务。如果您的客户期望有一种在多个平台（桌面/WEB/APP，而且某些客户端是“瘦”客户端）快速、方便地将数据接入到3D应用系统的解决方案，并且当访问数据时，在各个平台上的性能和用户体验保持一致，HOOPSPlatform将帮助您完成。利用HOOPSPlatform，您可以开发在任何环境下的3D基础应用架构。HOOPSPlatform可以帮您打造3D创新型产品，HOOPSSDK包含的技术有：快速且准确的CAD
叮咚买菜基于 Apache Doris 统一 OLAP 引擎的应用实践 - 2
导读：随着叮咚买菜业务的发展，不同的业务场景对数据分析提出了不同的需求，他们希望引入一款实时OLAP数据库，构建一个灵活的多维实时查询和分析的平台，统一数据的接入和查询方案，解决各业务线对数据高效实时查询和精细化运营的需求。经过调研选型，最终引入ApacheDoris作为最终的OLAP分析引擎，Doris作为核心的OLAP引擎支持复杂地分析操作、提供多维的数据视图，在叮咚买菜数十个业务场景中广泛应用。作者｜叮咚买菜资深数据工程师韩青叮咚买菜创立于2017年5月，是一家专注美好食物的创业公司。叮咚买菜专注吃的事业，为满足更多人“想吃什么”而努力，通过美好食材的供应、美好滋味的开发以及美食品牌的孵
UE4 源码阅读：从引擎启动到Receive Begin Play - 2
一、引擎主循环UE版本：4.27一、引擎主循环的位置：Launch.cpp:GuardedMain函数二、、GuardedMain函数执行逻辑：1、EnginePreInit：加载大多数模块int32ErrorLevel=EnginePreInit(CmdLine);PreInit模块加载顺序：模块加载过程：（1）注册模块中定义的UObject，同时为每个类构造一个类默认对象（CDO，记录类的默认状态，作为模板用于子类实例创建）（2）调用模块的StartUpModule方法2、FEngineLoop::Init()1、检查Engine的配置文件找出使用了哪一个GameEngine类（UGame
使用canal同步MySQL数据到ES - 2
文章目录一、概述简介原理模块二、配置Mysql使用版本环境要求1.操作系统2.mysql要求三、配置canal-server离线下载在线下载上传解压修改配置单机配置集群配置分库分表配置1.修改全局配置2.实例配置垂直分库水平分库3.修改group-instance.xml4.启动监听四、配置canal-adapter1修改启动配置2配置映射文件3启动ES数据同步查询所有订阅同步数据同步开关启动4.验证五、配置canal-admin一、概述简介canal是Alibaba旗下的一款开源项目，Java开发。基于数据库增量日志解析，提供增量数据订阅&消费。Git地址：https://github.co
ES基础入门 - 2
ES一、简介1、ElasticStackES技术栈：ElasticSearch：存数据+搜索；QL；Kibana：Web可视化平台，分析。LogStash：日志收集，Log4j:产生日志；log.info(xxx)。。。。使用场景：metrics：指标监控…2、基本概念Index（索引）动词：保存（插入）名词：类似MySQL数据库，给数据Type（类型）已废弃，以前类似MySQL的表现在用索引对数据分类Document（文档）真正要保存的一个JSON数据{name:"tcx"}二、入门实战{"name":"DESKTOP-1TSVGKG","cluster_name":"elasticsear
ruby - 如何搜索有用的 ruby - 2
寻找有用的ruby的好网站是什么？最佳答案 AgileWebDevelopment列出插件(虽然不是rubygems，我不确定为什么)，并允许人们对它们进行评级。RubyToolbox按类别列出gem并比较它们的受欢迎程度。Rubygems有一个搜索框。StackOverflow对最有用的rails插件和rubygems有疑问。关于ruby-如何搜索有用的ruby，我们在StackOverflow上找到一个类似的问题： https://stacko
ruby - 如何搜索、递增和替换 Ruby 字符串中的整数子字符串？ - 2
我有很多这样的文档:foo_1foo_2foo_3bar_1foo_4...我想通过获取foo_[X]的所有实例并将它们中的每一个替换为foo_[X+1]来转换它们。在这个例子中:foo_2foo_3foo_4bar_1foo_5...我可以用gsub和一个block来做到这一点吗？如果不是，最干净的方法是什么？我真的在寻找一个优雅的解决方案，因为我总是可以暴力破解它，但我觉得有一些正则表达式技巧值得学习。最佳答案我(完全)不懂Ruby，但类似这样的东西应该可以工作:"foo_1foo_2".gsub(/(foo_)(\d+)/

【EslaticSearch】ES 搜索引擎详解

ES 搜索引擎

查询文档

基本语法

全文检索

match

multi_match

精准查询

term

range

地理查询

geo_bounding_box 矩形范围

获取坐标请点击这里！

geo_distance 圆形范围

fuction_score 算分函数

算分函数查询

bool query 复合查询

结果处理

普通字段排序

地理坐标排序

分页

基本分页

高亮

有关【EslaticSearch】ES 搜索引擎详解的更多相关文章

随机推荐