最新国产好看的视频,伊人天堂AV在线,国产Aaaaaa视频,蜜臀视频在线观看一区,人妻av色图,密臀久久久精品影片,青青视频免费观看毛片,久草在线观看视,国产三级精品色情在线

Solr通過特殊字符分詞實現(xiàn)自定義分詞器詳解

 更新時間:2017年09月01日 09:53:48   作者:隨-憶  
最近因為工作的需要,要做一個分詞器,通過查找相關的資料最終用solr實現(xiàn)了,下面這篇文章主要給大家介紹了關于Solr通過特殊字符分詞實現(xiàn)自定義分詞器的相關資料,需要的朋友可以參考借鑒,下面隨著小編來一起看看吧。

前言

我們在對英文句子分詞的時候,一般采用采用的分詞器是WhiteSpaceTokenizerFactory,有一次因業(yè)務要求,需要根據(jù)某一個特殊字符(以逗號分詞,以豎線分詞)分詞。感覺這種需求可能與WhiteSpaceTokenizerFactory相像,于是自己根據(jù)Solr源碼自定義了分詞策略。

業(yè)務場景

有一次,我拿到的數(shù)據(jù)都是以豎線“|”分隔,分詞的時候,需要以豎線為分詞單元。比如下面的這一堆數(shù)據(jù):


有可能你拿到的是這樣的數(shù)據(jù),典型的例子就是來自csv文件的數(shù)據(jù),格式和下面這種類似:

分詞思路

在Solr的schema.xml文件中,有這樣的配置

<fieldType name="text_ws" class="solr.TextField" positionIncrementGap="100">
 <analyzer>
  <tokenizer class="solr.WhitespaceTokenizerFactory"/>
 </analyzer>
</fieldType>

對于字段類型text_ws,指定了一個分詞器工廠WhitespaceTokenizerFactory,根據(jù)這個類,可以實現(xiàn)通過空格來分詞,那么我通過豎線分詞的代碼應該與之類似。

修改源碼

在Java工程中引入如下jar包:

<dependency>
  <groupId>org.apache.solr</groupId>
  <artifactId>solr-core</artifactId>
  <version>6.0.0</version>
</dependency>

參照WhitespaceTokenizerFactory的源碼,寫一個自己的MyVerticalLineTokenizerFactory,內(nèi)容基本不變:

package com.trainning.project.custom;

import java.util.Arrays;
import java.util.Collection;
import java.util.Map;

import org.apache.lucene.analysis.Tokenizer;
import org.apache.lucene.analysis.core.UnicodeWhitespaceTokenizer;
import org.apache.lucene.analysis.util.TokenizerFactory;
import org.apache.lucene.util.AttributeFactory;

/**
* @author JiangChao
* @date 2017年4月2日下午3:41:13
*/
public class MyVerticalLineTokenizerFactory extends TokenizerFactory{
 public static final String RULE_JAVA = "java";
 public static final String RULE_UNICODE = "unicode";
 private static final Collection<String> RULE_NAMES = Arrays.asList(RULE_JAVA, RULE_UNICODE);

 private final String rule;

 /** Creates a new MyVerticalLineTokenizerFactory */
 public MyVerticalLineTokenizerFactory(Map<String,String> args) {
  super(args);

  rule = get(args, "rule", RULE_NAMES, RULE_JAVA);

  if (!args.isEmpty()) {
  throw new IllegalArgumentException("Unknown parameters: " + args);
  }
 }

 @Override
 public Tokenizer create(AttributeFactory factory) {
  switch (rule) {
  case RULE_JAVA:
   return new MyVerticalLineTokenizer(factory);
  case RULE_UNICODE:
   return new UnicodeWhitespaceTokenizer(factory);
  default:
   throw new AssertionError();
  }
 }
}

具體做分詞的MyVerticalLineTokenizer代碼如下

package com.trainning.project.custom;

import org.apache.lucene.analysis.util.CharTokenizer;
import org.apache.lucene.util.AttributeFactory;

/**
* @author JiangChao
* @date 2017年4月2日下午9:46:18
*/
public class MyVerticalLineTokenizer extends CharTokenizer {

 public MyVerticalLineTokenizer() {

 }
 public MyVerticalLineTokenizer(AttributeFactory factory) {
  super(factory);
  }

  /** Collects only characters which do not satisfy
  * 參數(shù)c指的是term的ASCII值,豎線的值為 124
  */
  @Override
  protected boolean isTokenChar(int c) {
  return !(c == 124);
  }
}

這里最主要的方法就是isTokenChar,它控制了分詞的字符,如果需要使用逗號分詞的話,字需要將這個方法修改成下面這樣:

 /** Collects only characters which do not satisfy
  * 參數(shù)c指的是term的ASCII值,逗號的值為 44
  */
  @Override
  protected boolean isTokenChar(int c) {
  return !(c == 44);
  }

整合

代碼寫好了,怎么使用呢?首先,需要把剛才的java文件打成jar包。我使用的是Eclipse,直接選中兩個類文件,右鍵 -> Export -> JAR File -> Select the export destination: ->選擇輸出路徑,填一個jar名字:MyVerticalLineTokenizerFactory -> Finish

得到的MyVerticalLineTokenizerFactory.jar文件大約3KB,將改文件放置到.\solr_home\lib下,在shcema.xml中定義自己的field

<fieldType name="vertical_text" class="solr.TextField">
 <analyzer>
  <tokenizer class="com.trainning.project.custom.MyVerticalLineTokenizerFactory"/>
 </analyzer>
 </fieldType>
 <field name="custom" type="vertical_text" indexed="true" stored="false"/>

注意這里的class是剛才自己寫的分詞器的完整類名。

打開Solr主頁,在Analysis頁面測試一下,是否實現(xiàn)了預期?

源碼下載:

GitHub:下載地址

本地下載:鏈接地址

總結(jié)

以上就是這篇文章的全部內(nèi)容了,希望本文的內(nèi)容對大家的學習或者工作能帶來一定的幫助,如果有疑問大家可以留言交流,謝謝大家對腳本之家的支持。

相關文章

  • 基于Java實現(xiàn)的Dijkstra算法示例

    基于Java實現(xiàn)的Dijkstra算法示例

    這篇文章主要介紹了基于Java實現(xiàn)的Dijkstra算法示例,一個比較典型的算法示例,需要的朋友可以參考下
    2014-07-07
  • 在Java項目中實現(xiàn)日志輸出的技巧分享

    在Java項目中實現(xiàn)日志輸出的技巧分享

    日志是開發(fā)過程中不可或缺的一部分,它可以幫助我們追蹤代碼的執(zhí)行過程、排查問題以及監(jiān)控系統(tǒng)運行狀況,然而,大多數(shù)開發(fā)人員在編寫日志時往往只關注于輸出必要的信息,而忽略了日志的可讀性和美觀性,本文將介紹如何在Java項目中實現(xiàn)漂亮的日志輸出
    2023-10-10
  • Spring解讀@Component和@Configuration的區(qū)別以及源碼分析

    Spring解讀@Component和@Configuration的區(qū)別以及源碼分析

    通過實例分析@Component和@Configuration注解的區(qū)別,核心在于@Configuration會通過CGLIB代理確保Bean的單例,而@Component不會,在Spring容器中,使用@Configuration注解的類會被CGLIB增強,保證了即使在同一個類中多次調(diào)用@Bean方法
    2024-10-10
  • MyBatis?Mapper映射器的具體用法

    MyBatis?Mapper映射器的具體用法

    映射器是MyBatis中最重要的文件,映射器由Java接口和XML文件共同組成,具有一定的參考價值,感興趣的可以了解一下
    2023-10-10
  • springboot集成redis啟動報錯問題的解決方式

    springboot集成redis啟動報錯問題的解決方式

    這篇文章主要介紹了springboot集成redis啟動報錯問題的解決方式,從錯誤信息上看缺少pool2相關包,查詢資料發(fā)現(xiàn)當redis客戶端選擇Lettuce時候需要增加:commons-pool2
    添加引用,重啟服務,需要的朋友可以參考下
    2023-11-11
  • Java中的鎖ReentrantLock詳解

    Java中的鎖ReentrantLock詳解

    這篇文章主要介紹了Java中的鎖ReentrantLock詳解,ReentantLock是java中重入鎖的實現(xiàn),一次只能有一個線程來持有鎖,包含三個內(nèi)部類,Sync、NonFairSync、FairSync,需要的朋友可以參考下
    2023-09-09
  • 23種設計模式(15)java解釋器模式

    23種設計模式(15)java解釋器模式

    這篇文章主要為大家詳細介紹了23種設計模式之java解釋器模式,具有一定的參考價值,感興趣的小伙伴們可以參考一下
    2017-12-12
  • 圖解Java排序算法之歸并排序

    圖解Java排序算法之歸并排序

    這篇文章主要為大家詳細介紹了Java經(jīng)典排序算法之歸并排序,具有一定的參考價值,感興趣的小伙伴們可以參考一下
    2021-11-11
  • Java新手環(huán)境搭建 Tomcat安裝配置教程

    Java新手環(huán)境搭建 Tomcat安裝配置教程

    這篇文章主要為大家詳細介紹了Java新手環(huán)境搭建的相關資料,Tomcat安裝配置教程,具有一定的參考價值,感興趣的小伙伴們可以參考一下
    2018-03-03
  • Spring的refresh()方法相關異常解析

    Spring的refresh()方法相關異常解析

    這篇文章主要介紹了Spring的refresh()方法相關異常解析,具有一定參考價值,需要的朋友可以了解下。
    2017-11-11

最新評論

天峻县| 通山县| 丹江口市| 阳泉市| 恩施市| 舒兰市| 高平市| 卓资县| 乌拉特中旗| 安吉县| 江安县| 诸城市| 玉林市| 分宜县| 诸城市| 察隅县| 沙河市| 安宁市| 法库县| 田阳县| 涞水县| 河曲县| 武平县| 辰溪县| 桦甸市| 湘西| 泰州市| 钟山县| 兰溪市| 长治县| 紫阳县| 秀山| 合阳县| 嵩明县| 乌苏市| 秀山| 安溪县| 凤翔县| 怀远县| 英吉沙县| 普安县|