英文应用分词器和过滤器一般配置顺序
索引(index):
1:空格 WhitespaceTokenizer
2:过滤词(停用词,如:on、of、a、an等) StopFilter
3:拆字 WordDelimiterFilter
4:小写过滤 LowerCaseFilter
5:英文相近词 EnglishPorterFilter
6:去除重复词 RemoveDuplicatesTokenFilter
查询(query):(首先也是加入分词方法)
1:查询同义词 SynonymFilter
2:过滤词 StopFilter
3:拆字 WordDelimiter
4:小写过滤 LowerCaseFilter
5:英文相近词 EnglishPorterFilter
6:去除重复词 RemoveDuplicatesTokenFilter
示例配置如下:
这样配置以后,字段类型为”text”的就会有以上的一些处理,如下,name就会有以上的处理了。
更多的过滤器配置可以参照solr wiki:http://wiki.apache.org/solr/FrontPage
Original: https://www.cnblogs.com/cuihongyu3503319/p/15725204.html
Author: 宏宇
Title: solr英文使用的基本分词器和过滤器配置
原创文章受到原创版权保护。转载请注明出处:https://www.johngo689.com/546693/
转载文章受原作者版权保护。转载请注明原作者出处!