ElasticSearch入门第七篇：分词 - 数据库编程

TOP

ElasticSearch入门第七篇：分词(一)

2019-09-03 02:19:43 【大中小】浏览:56次

这是ElasticSearch 2.4 版本系列的第七篇：

ElasticSearch入门第一篇：Windows下安装ElasticSearch
ElasticSearch入门第二篇：集群配置
ElasticSearch入门第三篇：索引
ElasticSearch入门第四篇：使用C#添加和更新文档
ElasticSearch入门第五篇：使用C#查询文档
ElasticSearch入门第六篇：复合数据类型——数组，对象和嵌套
ElasticSearch入门第七篇：分析器
ElasticSearch入门第八篇：存储
ElasticSearch入门第九篇：实现正则表达式查询的思路

在全文搜索（Fulltext Search）中，词（Term）是一个搜索单元，表示文本中的一个词，标记（Token）表示在文本字段中出现的词，由词的文本、在原始文本中的开始和结束偏移量、以及数据类型等组成。ElasticSearch 把文档数据写到倒排索引（Inverted Index）的结构中，倒排索引建立词（Term）和文档之间的映射，索引中的数据是面向词，而不是面向文档的。分析器（Analyzer）的作用就是分析（Analyse），用于把传入Lucene的文档数据转化为倒排索引，把文本处理成可被搜索的词。分析器由一个分词器（Tokenizer）和零个或多个标记过滤器（TokenFilter）组成，也可以包含零个或多个字符过滤器（Character Filter）。

在ElasticSearch引擎中，分析器的任务是分析（Analyze）文本数据，分析是分词，规范化文本的意思，其工作流程是：

首先，字符过滤器对分析（analyzed）文本进行过滤和处理，例如从原始文本中移除HTML标记，根据字符映射替换文本等，
过滤之后的文本被分词器接收，分词器把文本分割成标记流，也就是一个接一个的标记，
然后，标记过滤器对标记流进行过滤处理，例如，移除停用词，把词转换成其词干形式，把词转换成其同义词等，
最终，过滤之后的标记流被存储在倒排索引中；
ElasticSearch引擎在收到用户的查询请求时，会使用分析器对查询条件进行分析，根据分析的结构，重新构造查询，以搜索倒排索引，完成全文搜索请求，

可见，分析器扮演的是处理索引数据和查询条件的重要角色。在2.4版本中，ElasticSearch 预定义了7个分析器，并且支持用户根据预定义的字符过滤器，分词器和标记过滤器创建自定义的分析器，以满足用户多样性的文本分析需求。

用户在创建索引时配置索引的分析，通过向ElasticSearch发送请求，在请求body的settings 配置节中设置索引的分析器，例如，为索引配置默认的分析器：

"settings":{  
    "index":{
        "analysis":{
            "analyzer":{
                "default":{
                    "type":"standard"
                    ,"stopwords":"_english_"
                }
            }
        }
    }
}

一，字符过滤器(Char Filter)

字符过滤器对未经分析的文本起作用，作用于被分析的文本字段（该字段的index属性为analyzed），字符过滤器在分词器之前工作，用于从文档的原始文本去除HTML标记（markup），或者把字符“&”转换为单词“and”。ElasticSearch 2.4版本内置3个字符过滤器，分别是：映射字符过滤器（Mapping Char Filter）、HTML标记字符过滤器（HTML Strip Char Filter）和模式替换字符过滤器（Pattern Replace Char Filter）。

1，映射字符过滤器

映射字符过滤器，类型是mapping，需要建立一个查找字符和替换字符的映射（Mapping），过滤器根据映射把文本中的字符替换成指定的字符。

{
    "index" : {
        "analysis" : {
            "char_filter" : {
                "my_mapping" : {
                    "type" : "mapping",
                    "mappings" : [
                      "ph => f",
                      "qu => k"
                    ]
                }
            },
            "analyzer" : {
                "custom_with_char_filter" : {
                    "tokenizer" : "standard",
                    "char_filter" : ["my_mapping"]
                }
            }
        }
    }
}

View Code

2，HTML标记字符过滤器

HTML标记字符过滤器，类型是html_strip，用于从原始文本中去除HTML标记。

3，模式替换字符过滤器

模式替换字符过滤器，类型是pattern_replace，它使用正则表达式（Regular Expression）匹配字符，把匹配到的字符替换为指定的替换字符串。

PUT my_index
{
  "settings": {
    "analysis": {
      "analyzer": {
        "my_analyzer": {
          "tokenizer": "standard",
          "char_filter": [
            "my_char_filter"
          ]
        }
      },
      "char_filter": {
        "my_char_filter": {
          "type": "pattern_replace",
          "pattern": "(\\d+)-(?=\\d)",
          "replacement": "$1_"
        }
      }
    }
  }
}

View Code

pattern参数：指定Java正则表达式；

replacement参数：指定替换字符串，把正则表达式匹配的字符串替换为replacement参数指定的字符串；

二，分词器（Tokenizer）

分词器在字符过滤器之后工作，用于把文本分割成多个标记（Token），一个标记基本上是词加上一些额外信息，分词器的处理结果是标记流，它是一个接一个的标记，准备被过滤器处理。ElasticSearch 2.4版本内置很多分词器，本节简单介绍常用的分词器。

1，标准分词器（Standard Tokenizer）

标准分词器类型是standard，用于大多数欧洲语言，使用Uni

首页上一页 1 2 3 4 下一页尾页 1/4/4
【大中小】【打印】【繁体】【投稿】【收藏】【推荐】【举报】【评论】【关闭】【返回顶部】

上一篇：Navicat Premium连接PostgreSQL	下一篇：（排班表一）使用SQL语句使数据从..