學習筆跡
好記性不如爛筆頭!

隨筆-153 評論-235 文章-19 trackbacks-0

想發布新版的 mmseg4j 到現在已經有二個多月了。主要是因為這段時間忙其它事情了。現 Lucene 2.9 發布了，solr 1.4 也應該會比較快就要發布了。對 mmseg4j 兼容新版的 lucene/solr 也是個任務。

現 mmseg4j 發布新版 1.8，可以下載：mmseg4j-1.8.zip 包括了源碼與詞庫，還有創建文件。下面說下此版的主要變更：

new:

1、有檢測詞典變更的接口，外部程序可以使用 wordsFileIsChange() 和 reload() 來完成檢測與加載的工作. (內部不實現自動檢測與加載，留給外部程序去做。)

2、添加 MMseg4jHandler 類，可以在solr中用url的方式來控制加載檢測詞庫。

3、增加 CutLetterDigitFilter過慮器，切分“字母和數”混在一起的過慮器。比如：mb991ch 切為 "mb 991 ch"。

changes:

1、默認在 classpath 中加載 data 目錄（詞庫目錄），找不到再找 user.dir/data 目錄。但是優先 mmseg.dic.path 系統屬性指定的。

2、新詞庫，去除 sogou 高頻無詞性的詞，合并 rmmseg 提供的詞（是 mmseg4j 1.0 使用的詞庫），共計（14W 多詞）。

3、數字或英文開頭的數字或英文不獨立分出。如 MB991CH/A 分為 mb991ch a，cq40-519tx 分為 CQ40 519TX

4、內置支持小寫，不需要 LowerCaseFilter 了。MMSegAnalyzer 去除了小寫過慮。

5、支持 solr 1.3/1.4、lucene 2.3/2.4/2.9

6、嘗試加載 jar 里的 words.dic，并構建含有 words.dic 的 jar(mmseg4j-*-with-dic.jar)。

bugs:

1、Dictionary 添加 finalize 方法。修正 tomcat reload 時 OOM 的 bug: http://code.google.com/p/mmseg4j/issues/detail?id=4

2、MMSegTokenizer 在 lucene 2.4 編譯的在 lucene 2.9 中會報 java.lang.NoSuchFieldError: input。bug: http://code.google.com/p/mmseg4j/issues/detail?id=5

詳情：http://blog.chenlb.com/2009/10/chinese-segment-mmseg4j-1_8-release.html

posted on 2009-10-19 09:28 流浪汗閱讀(3451) 評論(1) 編輯收藏所屬分類: mmseg4j

評論:

# re: 中文分詞 mmseg4j-1.8 版發布 2009-10-20 03:19 | 美容

中文分詞 good 回復更多評論

新用戶注冊刷新評論列表


只有注冊用戶登錄后才能發表評論。




網站導航: 博客園 IT新聞 Chat2DB C++博客博問管理
相關文章: 中文分詞 mmseg4j-1.8 版發布中文分詞 mmseg4j 1.7.2 版發布

<

2009年10月

>

日

一

二

三

四

五

六

27

28

29

30

1

2

3

4

5

6

7

8

9

10

11

12

13

14

15

16

17

18

19

20

21

22

23

24

25

26

27

28

29

30

31

1

2

3

4

5

6

7

留言簿(14)

隨筆分類

隨筆檔案

文章分類

文章檔案

新聞分類

java(1)

新聞檔案

2008年7月 (1)

收藏夾

友情鏈接

vootoo 電視劇網
中文 MySQL.CN 論壇
我的javaeye博客
我的個人博客
老丘的 Blog

同學鏈接

學習鏈接

css javascript(rlog)
好css 與 javascript
jobchanceleo(職業生涯顧問Leo)
lhwork
max(struts2)
qclass(java/j2ee)
Unmi(Quartz)
willpower88
推薦系統
比較有深度的"推薦系統"相關的文章
蛟龍居
專注Groovy & Grails

留言簿(14)

隨筆分類

隨筆檔案

文章分類

文章檔案

新聞分類

新聞檔案

收藏夾

友情鏈接

同學鏈接

學習鏈接

最新隨筆

搜索

積分與排名

最新評論

閱讀排行榜

評論排行榜