xxxmenger 发表于 2017-12-20 10:31:36

solr6.5的分词

  1、配置solr6.5自带中文分词。复制/usr/local/solr/contrib/analysis-extras/lucene-libs/lucene-analyzers-smartcn-6.5.0.jar到/usr/local/tomcat/webapps/solr/WEB-INF/lib/目录下。
  

cp /usr/local/solr/contrib/analysis-extras/lucene-libs/lucene-analyzers-smartcn-6.5.0.jar /usr/local/tomcat/webapps/solr/WEB-INF/lib/  、为core添加对中文分词的支持。编辑mycore下conf下的managed-schema文件.
  

cd /usr/local/tomcat/solrhome/mycore/conf  

vi managed-schema  在文件的</schema>前添加
  

<fieldType name="text_smartcn" positionIncrementGap="0">  <analyzer type="index">
  <tokenizer/>
  </analyzer>
  <analyzer type="query">
  <tokenizer/>
  </analyzer>
  
</fieldType>
  重启tomcat,后在浏览器输入http://localhost:8080/solr/index.html#/mycore/analysis
  

二、配置IKAnalyzer的中文分词:
  

  

  1、首先下载IKAnalyzer 这是最新的支持solr6.5. 解压后会有四个文件。
  

ext.dic为扩展字典,stopword.dic为停止词字典,IKAnalyzer.cfg.xml为配置文件,solr-analyzer-ik-5.1.0.jar ik-analyzer-solr5-5.x.jar为分词jar包。  2、将文件夹下的IKAnalyzer.cfg.xml , ext.dic和stopword.dic 三个文件 复制到/webapps/solr/WEB-INF/classes 目录下,并修改IKAnalyzer.cfg.xml
  

cp ext.dic IKAnalyzer.cfg.xml stopword.dic /usr/local/tomcat/webapps/solr/WEB-INF/classes/  vim   IKAnalyzer.cfg.xml
  

<?xml version="1.0" encoding="UTF-8"?>  
<!DOCTYPE properties SYSTEM "http://java.sun.com/dtd/properties.dtd">
  
<properties>
  <comment>IK Analyzer 扩展配置</comment>
  <!--用户可以在这里配置自己的扩展字典 -->
  <entry key="ext_dict">ext.dic;</entry>
  

  <!--用户可以在这里配置自己的扩展停止词字典-->
  <entry key="ext_stopwords">stopword.dic;</entry>
  

  
</properties>
  

  3、在ext.dic 里增加自己的扩展词典,例如,唯品会 聚美优品
  4、复制solr-analyzer-ik-5.1.0.jar ik-analyzer-solr5-5.x.jar到/usr/local/tomcat/webapps/solr/WEB-INF/lib/目录下。
  

cp /down/ikanalyzer-solr5/solr-analyzer-ik-5.1.0.jar ik-analyzer-solr5-5.x.jar /usr/local/tomcat/webapps/solr/WEB-INF/lib/  

  5、在 solrhome\mycore\conf\managed-schema 文件</schema>前增加如下配置
  

<!-- 我添加的IK分词 -->  
<fieldType name="text_ik">
  <analyzer type="index">
  <tokenizer useSmart="true"/>
  </analyzer>
  <analyzer type="query">
  <tokenizer useSmart="true"/>
  </analyzer>
  
</fieldType>
  

三、配置拼音检索:
  1、前期准备,需要用到pinyin4j-2.5.0.jar、pinyinAnalyzer.jar这两个jar包,下载地址。
  2、将pinyin4j-2.5.0.jar、pinyinAnalyzer.jar这两个jar包复制到/usr/local/tomcat/webapps/solr/WEB-INF/lib/目录下。
  

cp pinyin4j-2.5.0.jar pinyinAnalyzer4.3.1.jar /usr/local/tomcat/webapps/solr/WEB-INF/lib/  3、在 solrhome\mycore\conf\managed-schema 文件</schema>前增加如下配置:
  

<fieldType name="text_pinyin" positionIncrementGap="0">  <analyzer type="index">
  <tokenizer/>
  <filter minTermLenght="2" />
  <filter minGram="1" maxGram="20" />
  </analyzer>
  <analyzer type="query">
  <tokenizer/>
  <filter minTermLenght="2" />
  <filter minGram="1" maxGram="20" />
  </analyzer>
  
</fieldType>
  

  
页: [1]
查看完整版本: solr6.5的分词