Solr学习总结(八)IK 中文分词的配置和使用

  最近,很多朋友问我solr 中文分词配置的问题,都不知道怎么配置,怎么使用,原以为很简单,没想到这么多朋友都有问题,所以今天就总结总结中文分词的配置吧。

 

有的时候,用户搜索的关键字,可能是一句话,不是很规范。所以在 Solr 中查询出的时候,就需要将用户输入的关键字进行分词。

 

目前有很多优秀的中文分词组件。本篇只以  IKAnalyzer 分词为例,讲解如何在 solr  中及集成中文分词,使用 IKAnalyzer的原因 IK 比其他中文分词维护的勤快,和 Solr 集成也相对容易。具体就不多介绍,这里直接solr 集成 IK 的方法。

 

1. 首先,下载IKAnalyzer下载

注意:以前老的IK 不支持Solr 5.3的版本 ,请注意下载最新的。

 

2. 将ik的相关文件 拷贝到 webapps\solr\WEB-INF\lib 目录下

 

3. 在 solr_home\mycore1\conf\schema.xml 增加如下配置

         
         "text_ik" class="solr.TextField">   
                   "index" isMaxWordLength="false" class="org.wltea.analyzer.lucene.IKAnalyzer"/>   
                   "query" isMaxWordLength="true" class="org.wltea.analyzer.lucene.IKAnalyzer"/>   

同时,把需要分词的字段,设置为text_ik,

  "id" type="int" indexed="true" stored="true" required="true" multiValued="false" />
   "name" type="text_ik" indexed="true" stored="true" required="true" multiValued="false" />
   "title" type="text_ik" indexed="true" stored="true" required="true" multiValued="false" />
   "category" type="int" indexed="true" stored="true" required="true" multiValued="false" />
   "content" type="text_ik" indexed="true" stored="true" required="true" multiValued="false" />
   "price" type="double" indexed="true" stored="true" required="true" multiValued="false" />
   "color" type="string" indexed="true" stored="true" required="true" multiValued="false" />
   "orderBy" type="int" indexed="true" stored="true" required="true" multiValued="false" />
   "updatetime" type="date" indexed="true" stored="true" required="true" multiValued="false" />

 

4. 重启服务

注意:如果之前已经创建了索引,需要将之前的索引删掉,重新创建分词后的索引。

 

5. 在admin后台, analysis 下查看分词效果

1. 中文分词效果

2. 索引查询效果

 

6. 配置IKAnalyzer分词器的扩展词典,停止词词典

1. 将 文件夹下的IKAnalyzer.cfg.xml , ext.dic和stopword.dic 三个文件 复制到/webapps/solr/WEB-INF/classes 目录下,并修改IKAnalyzer.cfg.xml

    
    "http://java.sun.com/dtd/properties.dtd">  
      
        IK Analyzer 扩展配置
        
        "ext_dict">ext.dic; 

        
        "ext_stopwords">stopword.dic; 

2. 在ext.dic 里增加自己的扩展词典,例如,婴儿奶粉3段

 

注意:  记得将stopword.dic,ext.dic的编码方式为UTF-8 无BOM的编码方式。

 

发表评论

电子邮件地址不会被公开。