SCWS 中文分詞

http://www.xunsearch.com/scws/index.php

SCWS 是 Simple Chinese Word Segmentation 的首字母縮寫(即:簡易中文分詞系統)。

這是一套基於詞頻詞典的機械式中文分詞引擎,它能將一整段的中文文本基本正確地切分成詞。詞是中文的最小語素單位,但在書寫時並不像英語會在詞之間用空格分開,所以如何準確並快速分詞一直是中文分詞的攻關難點。

SCWS 採用純 C 語言開發,不依賴任何外部庫函數,可直接使用動態鏈接庫嵌入應用程序,支持的中文編碼包括 GBK、UTF-8 等。此外還提供了 PHP 擴展模塊,可在 PHP 中快速而方便地使用分詞功能。

分詞算法上並無太多創新成分,採用的是自己採集的詞頻詞典,並輔以一定的專有名稱,人名,地名,數字年代等規則識別來達到基本分詞,經小範圍測試準確率在 90% ~ 95% 之間,基本上能滿足一些小型搜索引擎、關鍵字提取等場合運用。首次雛形版本發佈於 2005 年底。

SCWS 由 hightman 開發,並以 BSD 許可協議開源發佈,源碼託管在 github



發佈了139 篇原創文章 · 獲贊 24 · 訪問量 73萬+
發表評論
所有評論
還沒有人評論,想成為第一個評論的人麼? 請在上方評論欄輸入並且點擊發布.
相關文章