solr英文使用的基本分词器和过滤器配置

英文应用分词器和过滤器一般配置顺序

索引(index):

1:空格 WhitespaceTokenizer
2:过滤词(停用词,如:on、of、a、an等) StopFilter
3:拆字 WordDelimiterFilter
4:小写过滤 LowerCaseFilter
5:英文相近词 EnglishPorterFilter
6:去除重复词 RemoveDuplicatesTokenFilter

查询(query):(首先也是加入分词方法)

1:查询同义词 SynonymFilter
2:过滤词 StopFilter
3:拆字 WordDelimiter
4:小写过滤 LowerCaseFilter
5:英文相近词 EnglishPorterFilter
6:去除重复词 RemoveDuplicatesTokenFilter

示例配置如下:


这样配置以后,字段类型为”text”的就会有以上的一些处理,如下,name就会有以上的处理了。

更多的过滤器配置可以参照solr wiki:http://wiki.apache.org/solr/FrontPage

Original: https://www.cnblogs.com/cuihongyu3503319/p/15725204.html
Author: 宏宇
Title: solr英文使用的基本分词器和过滤器配置

原创文章受到原创版权保护。转载请注明出处:https://www.johngo689.com/546693/

转载文章受原作者版权保护。转载请注明原作者出处!

(0)

大家都在看

亲爱的 Coder【最近整理,可免费获取】👉 最新必读书单  | 👏 面试题下载  | 🌎 免费的AI知识星球