天天躁日日躁狠狠躁AV麻豆-天天躁人人躁人人躁狂躁-天天澡夜夜澡人人澡-天天影视香色欲综合网-国产成人女人在线视频观看-国产成人女人视频在线观看

開源php中文分詞系統(tǒng)SCWS安裝和使用實例

一、SCWS簡介

SCWS 是 Simple Chinese Word Segmentation 的首字母縮寫(即:簡易中文分詞系統(tǒng))。
這是一套基于詞頻詞典的機械式中文分詞引擎,它能將一整段的中文文本基本正確地切分成詞。 詞是中文的最小語素單位,但在書寫時并不像英語會在詞之間用空格分開, 所以如何準(zhǔn)確并快速分詞一直是中文分詞的攻關(guān)難點。
SCWS 采用純 C 語言開發(fā),不依賴任何外部庫函數(shù),可直接使用動態(tài)鏈接庫嵌入應(yīng)用程序, 支持的中文編碼包括 GBK、UTF-8 等。此外還提供了 php 擴展模塊, 可在 php 中快速而方便地使用分詞功能。
分詞算法上并無太多創(chuàng)新成分,采用的是自己采集的詞頻詞典,并輔以一定的專有名稱,人名,地名, 數(shù)字年代等規(guī)則識別來達(dá)到基本分詞,經(jīng)小范圍測試準(zhǔn)確率在 90% ~ 95% 之間, 基本上能滿足一些小型搜索引擎、關(guān)鍵字提取等場合運用。首次雛形版本發(fā)布于 2005 年底。
SCWS 由 hightman 開發(fā), 并以 BSD 許可協(xié)議開源發(fā)布,源碼托管在 github。

二、scws安裝

復(fù)制代碼 代碼如下:
# wget -c http://www.xunsearch.com/scws/down/scws-1.2.1.tar.bz2
# tar jxvf scws-1.2.1.tar.bz2
# cd scws-1.2.1
# ./configure --prefix=/usr/local/scws
# make && make install

三、scws的php擴展安裝

復(fù)制代碼 代碼如下:
# cd ./phpext
# phpize
# ./configure --with-php-config=/usr/local/php5410/bin/php-config
# make && make install
# echo "[scws]" >> /usr/local/php5410/etc/php.ini
# echo "extension = scws.so" >> /usr/local/php5410/etc/php.ini
# echo "scws.default.charset = utf-8" >> /usr/local/php5410/etc/php.ini
# echo "scws.default.fpath = /usr/local/scws/etc/" >> /usr/local/php5410/etc/php.ini

四、詞庫安裝

復(fù)制代碼 代碼如下:
# wget http://www.xunsearch.com/scws/down/scws-dict-chs-utf8.tar.bz2
# tar jxvf scws-dict-chs-utf8.tar.bz2 -C /usr/local/scws/etc/
# chown www:www /usr/local/scws/etc/dict.utf8.xdb

五、php實例代碼。可以詳細(xì)看下SCWS官方API說明

復(fù)制代碼 代碼如下:
//實例化分詞插件核心類
 $so = scws_new();
 //設(shè)置分詞時所用編碼
 $so->set_charset('utf-8');
 //設(shè)置分詞所用詞典(此處使用utf8的詞典)
 $so->set_dict('/usr/local/scws/etc/dict.utf8.xdb');
 //設(shè)置分詞所用規(guī)則
 $so->set_rule('/usr/local/scws/etc/rules.utf8.ini ');
 //分詞前去掉標(biāo)點符號
 $so->set_ignore(true);
 //是否復(fù)式分割,如“中國人”返回“中國+人+中國人”三個詞。
 $so->set_multi(true);
 //設(shè)定將文字自動以二字分詞法聚合
 $so->set_duality(true);
 //要進(jìn)行分詞的語句
 $so->send_text(“歡迎來到火星時代IT開發(fā)”);
 //獲取分詞結(jié)果,如果提取高頻詞用get_tops方法
 while ($tmp = $so->get_result())
 {
     print_r($tmp);
 }
 $so->close();
返回數(shù)組結(jié)果說明:
復(fù)制代碼 代碼如下:
word   _string_ 詞本身 
idf        _float_ 逆文本詞頻 
off         _int_ 該詞在原文本路的位置 
attr       _string_ 詞性

六、在線API

也可以使用在線API實現(xiàn)中文分詞,API地址:http://www.xunsearch.com/scws/api.php,詳細(xì)說明也在地址中。

 

php技術(shù)開源php中文分詞系統(tǒng)SCWS安裝和使用實例,轉(zhuǎn)載需保留來源!

鄭重聲明:本文版權(quán)歸原作者所有,轉(zhuǎn)載文章僅為傳播更多信息之目的,如作者信息標(biāo)記有誤,請第一時間聯(lián)系我們修改或刪除,多謝。

主站蜘蛛池模板: 日本少妇无码精品12P | 国产自产第一区c国产 | 国产精品亚洲欧美 | 男人插曲视频大全免费网站 | 第四色男人天堂 | 777米奇色狠狠俺去啦 | bdsm中国精品调教ch | 欧美の无码国产の无码影院 | 大屁股国产白浆一二区 | 人妻仑乱少妇88MAV | 精品国产在线观看福利 | 久见久热 这里只有精品 | 动漫美女喷水 | 国产小视频在线高清播放 | 一本道高清码v京东热 | a级老头和老太xxxx | 久久久精品免费免费直播 | 妺妺窝人体色WWW偷窥女厕 | 欧美日韩视频一区二区三区 | 教室眠催白丝美女校花 | 白丝女仆被强扒内裤 | 一本道本线中文无码 | 亚洲欧美一区二区三区蜜芽 | 韩国精品无码少妇在线观看网站 | 另类专区hy777 | 日本一卡精品视频免费 | 亚洲精品视频在线免费 | 久久免费精品国产72精品剧情 | 女人张腿让男人桶免费 | 亚洲黄色录像片 | 日韩精品 中文字幕 有码 | 男人j进女人j一进一出 | 久久免费看少妇高潮A片特爽 | 芒果影院网站在线观看 | 女人操男人 | 国语自产视频在线不卡 | 果冻传媒mv国产陈若瑶主演 | 久久精品国产亚洲AV影院 | 久久中文骚妇内射 | 秋葵app秋葵官网18在线观看 | 娇小XXXXX第一次出血 |