设为首页 收藏本站
查看: 1223|回复: 0

[经验分享] solr6.5的分词

[复制链接]

尚未签到

发表于 2017-12-20 10:31:36 | 显示全部楼层 |阅读模式
  1、配置solr6.5自带中文分词。复制/usr/local/solr/contrib/analysis-extras/lucene-libs/lucene-analyzers-smartcn-6.5.0.jar到/usr/local/tomcat/webapps/solr/WEB-INF/lib/目录下。
  

cp /usr/local/solr/contrib/analysis-extras/lucene-libs/lucene-analyzers-smartcn-6.5.0.jar /usr/local/tomcat/webapps/solr/WEB-INF/lib/  、为core添加对中文分词的支持。编辑mycore下conf下的managed-schema文件.
  

cd /usr/local/tomcat/solrhome/mycore/conf  

vi managed-schema  在文件的</schema>前添加
  

<fieldType name="text_smartcn" positionIncrementGap="0">  <analyzer type="index">
  <tokenizer/>
  </analyzer>
  <analyzer type="query">
  <tokenizer/>
  </analyzer>
  
</fieldType>
  重启tomcat,后在浏览器输入http://localhost:8080/solr/index.html#/mycore/analysis
  

二、配置IKAnalyzer的中文分词:
  

  

  1、首先下载IKAnalyzer 这是最新的支持solr6.5. 解压后会有四个文件。
  

ext.dic为扩展字典,stopword.dic为停止词字典,IKAnalyzer.cfg.xml为配置文件,solr-analyzer-ik-5.1.0.jar ik-analyzer-solr5-5.x.jar为分词jar包。  2、将文件夹下的IKAnalyzer.cfg.xml , ext.dic和stopword.dic 三个文件 复制到/webapps/solr/WEB-INF/classes 目录下,并修改IKAnalyzer.cfg.xml
  

cp ext.dic IKAnalyzer.cfg.xml stopword.dic /usr/local/tomcat/webapps/solr/WEB-INF/classes/  vim   IKAnalyzer.cfg.xml
  

<?xml version="1.0" encoding="UTF-8"?>  
<!DOCTYPE properties SYSTEM "http://java.sun.com/dtd/properties.dtd">
  
<properties>
  <comment>IK Analyzer 扩展配置</comment>
  <!--用户可以在这里配置自己的扩展字典 -->
  <entry key="ext_dict">ext.dic;</entry>
  

  <!--用户可以在这里配置自己的扩展停止词字典-->
  <entry key="ext_stopwords">stopword.dic;</entry>
  

  
</properties>
  

  3、在ext.dic 里增加自己的扩展词典,例如,唯品会 聚美优品
  4、复制solr-analyzer-ik-5.1.0.jar ik-analyzer-solr5-5.x.jar到/usr/local/tomcat/webapps/solr/WEB-INF/lib/目录下。
  

cp /down/ikanalyzer-solr5/solr-analyzer-ik-5.1.0.jar ik-analyzer-solr5-5.x.jar /usr/local/tomcat/webapps/solr/WEB-INF/lib/  

  5、在 solrhome\mycore\conf\managed-schema 文件</schema>前增加如下配置
  

<!-- 我添加的IK分词 -->  
<fieldType name="text_ik">
  <analyzer type="index">
  <tokenizer useSmart="true"/>
  </analyzer>
  <analyzer type="query">
  <tokenizer useSmart="true"/>
  </analyzer>
  
</fieldType>
  

三、配置拼音检索:
  1、前期准备,需要用到pinyin4j-2.5.0.jar、pinyinAnalyzer.jar这两个jar包,下载地址。
  2、将pinyin4j-2.5.0.jar、pinyinAnalyzer.jar这两个jar包复制到/usr/local/tomcat/webapps/solr/WEB-INF/lib/目录下。
  

cp pinyin4j-2.5.0.jar pinyinAnalyzer4.3.1.jar /usr/local/tomcat/webapps/solr/WEB-INF/lib/  3、在 solrhome\mycore\conf\managed-schema 文件</schema>前增加如下配置:
  

<fieldType name="text_pinyin" positionIncrementGap="0">  <analyzer type="index">
  <tokenizer/>
  <filter minTermLenght="2" />
  <filter minGram="1" maxGram="20" />
  </analyzer>
  <analyzer type="query">
  <tokenizer/>
  <filter minTermLenght="2" />
  <filter minGram="1" maxGram="20" />
  </analyzer>
  
</fieldType>
  

  

运维网声明 1、欢迎大家加入本站运维交流群:群②:261659950 群⑤:202807635 群⑦870801961 群⑧679858003
2、本站所有主题由该帖子作者发表,该帖子作者与运维网享有帖子相关版权
3、所有作品的著作权均归原作者享有,请您和我们一样尊重他人的著作权等合法权益。如果您对作品感到满意,请购买正版
4、禁止制作、复制、发布和传播具有反动、淫秽、色情、暴力、凶杀等内容的信息,一经发现立即删除。若您因此触犯法律,一切后果自负,我们对此不承担任何责任
5、所有资源均系网友上传或者通过网络收集,我们仅提供一个展示、介绍、观摩学习的平台,我们不对其内容的准确性、可靠性、正当性、安全性、合法性等负责,亦不承担任何法律责任
6、所有作品仅供您个人学习、研究或欣赏,不得用于商业或者其他用途,否则,一切后果均由您自己承担,我们对此不承担任何法律责任
7、如涉及侵犯版权等问题,请您及时通知我们,我们将立即采取措施予以解决
8、联系人Email:admin@iyunv.com 网址:www.yunweiku.com

所有资源均系网友上传或者通过网络收集,我们仅提供一个展示、介绍、观摩学习的平台,我们不对其承担任何法律责任,如涉及侵犯版权等问题,请您及时通知我们,我们将立即处理,联系人Email:kefu@iyunv.com,QQ:1061981298 本贴地址:https://www.yunweiku.com/thread-425988-1-1.html 上篇帖子: (转) SolrCloud之分布式索引及与Zookeeper的集成 下篇帖子: solr6.6 导入 pdf/doc/txt/json/csv/xml文件
您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

扫码加入运维网微信交流群X

扫码加入运维网微信交流群

扫描二维码加入运维网微信交流群,最新一手资源尽在官方微信交流群!快快加入我们吧...

扫描微信二维码查看详情

客服E-mail:kefu@iyunv.com 客服QQ:1061981298


QQ群⑦:运维网交流群⑦ QQ群⑧:运维网交流群⑧ k8s群:运维网kubernetes交流群


提醒:禁止发布任何违反国家法律、法规的言论与图片等内容;本站内容均来自个人观点与网络等信息,非本站认同之观点.


本站大部分资源是网友从网上搜集分享而来,其版权均归原作者及其网站所有,我们尊重他人的合法权益,如有内容侵犯您的合法权益,请及时与我们联系进行核实删除!



合作伙伴: 青云cloud

快速回复 返回顶部 返回列表