PHPAnalysis中文分词类详解


Posted in PHP onJune 13, 2014

PHPAnalysis是目前广泛使用的中文分词类,使用反向匹配模式分词,因此兼容编码更广泛,现将其变量与常用函数详解如下:

一、比较重要的成员变量

$resultType   = 1        生成的分词结果数据类型(1 为全部, 2为 词典词汇及单个中日韩简繁字符及英文, 3 为词典词汇及英文)
                                    这个变量一般用 SetResultType( $rstype ) 这方法进行设置。
$notSplitLen  = 5        切分句子最短长度
$toLower      = false    把英文单词全部转小写
$differMax    = false    使用最大切分模式对二元词进行消岐
$unitWord     = true     尝试合并单字(即是新词识别)
$differFreq   = false    使用热门词优先模式进行消岐

二、主要成员函数列表

1、public function __construct($source_charset='utf-8', $target_charset='utf-8', $load_all=true, $source='')
函数说明:构造函数
参数列表:
$source_charset      源字符串编码
$target_charset      目录字符串编码
$load_all            是否完全加载词典(此参数已经作废)
$source              源字符串
如果输入输出都是utf-8,实际上可以不必使用任何参数进行初始化,而是通过 SetSource 方法设置要操作的文本

2、public function SetSource( $source, $source_charset='utf-8', $target_charset='utf-8' )
函数说明:设置源字符串
参数列表:
$source              源字符串
$source_charset      源字符串编码
$target_charset      目录字符串编码
返回值:bool

3、public function StartAnalysis($optimize=true)
函数说明:开始执行分词操作
参数列表:
$optimize            分词后是否尝试优化结果
返回值:void
一个基本的分词过程:
//////////////////////////////////////
$pa = new PhpAnalysis();

$pa->SetSource('需要进行分词的字符串');

//设置分词属性
$pa->resultType = 2;
$pa->differMax  = true;

$pa->StartAnalysis();

//获取你想要的结果
$pa->GetFinallyIndex();
////////////////////////////////////////

4、public function SetResultType( $rstype )
函数说明:设置返回结果的类型
实际是对成员变量$resultType的操作
参数 $rstype 值为:
1 为全部, 2为 词典词汇及单个中日韩简繁字符及英文, 3 为词典词汇及英文
返回值:void

5、public function GetFinallyKeywords( $num = 10 )
函数说明:获取出现频率最高的指定词条数(通常用于提取文档关键字)
参数列表:
$num = 10  返回词条个数
返回值:用","分隔的关键字列表

6、public function GetFinallyResult($spword=' ')
函数说明:获得最终分词结果
参数列表:
$spword    词条之间的分隔符
返回值:string

7、public function GetSimpleResult()
函数说明:获得粗分结果
返回值:array

8、public function GetSimpleResultAll()
函数说明:获得包含属性信息的粗分结果
属性(1中文词句、2 ANSI词汇(包括全角),3 ANSI标点符号(包括全角),4数字(包括全角),5 中文标点或无法识别字符)
返回值:array

9、public function GetFinallyIndex()
函数说明:获取hash索引数组
返回值:array('word'=>count,...) 按出现频率排序

10、public function MakeDict( $source_file, $target_file='' )
函数说明:把文本文件词库编译成词典
参数列表:
$source_file   源文本文件
$target_file   目标文件(如果不指定,则为当前词典)
返回值:void

11、public function ExportDict( $targetfile )
函数说明:导出当前词典全部词条为文本文件
参数列表:
$targetfile  目标文件
返回值:void

PHP 相关文章推荐
ADODB结合SMARTY使用~超级强
Nov 25 PHP
让你成为更出色的PHP开发者的10个技巧
Feb 25 PHP
php中字符串和正则表达式详解
Oct 23 PHP
php实现判断访问来路是否为搜索引擎机器人的方法
Apr 15 PHP
详解WordPress开发中的get_post与get_posts函数使用
Jan 04 PHP
PHP浮点比较大小的方法
Feb 14 PHP
php 读取输出其他文件的实现方法
Jul 26 PHP
thinkphp整合微信支付代码分享
Nov 24 PHP
PHP高精确度运算BC函数库实例详解
Aug 15 PHP
PHP数据对象映射模式实例分析
Mar 29 PHP
PHP实现字符串的全排列详解
Apr 24 PHP
Smarty缓存机制实例详解【三种缓存方式】
Jul 20 PHP
ThinkPHP缓存方法S()概述
Jun 13 #PHP
采用ThinkPHP中F方法实现快速缓存实例
Jun 13 #PHP
浅析ThinkPHP中execute和query方法的区别
Jun 13 #PHP
采用thinkphp自带方法生成静态html文件详解
Jun 13 #PHP
PHP中使用gettext解决国际化问题的例子(i18n)
Jun 13 #PHP
Yii结合CKEditor实现图片上传功能
Jun 13 #PHP
在Yii框架中使用PHP模板引擎Twig的例子
Jun 13 #PHP
You might like
探讨php中header的用法详解
2013/06/07 PHP
php中的PHP_EOL换行符详细解析
2013/10/26 PHP
PHP中如何使用Redis接管文件存储Session详解
2018/11/28 PHP
javascript操作cookie_获取与修改代码
2009/05/21 Javascript
js form 验证函数 当前比较流行的错误提示
2009/06/23 Javascript
js中if语句的几种优化代码写法
2011/03/12 Javascript
关于使用 jBox 对话框的提交不能弹出问题解决方法
2012/11/07 Javascript
js获取单选框或复选框值及操作
2012/12/18 Javascript
js弹出模式对话框,并接收回传值的方法
2013/03/12 Javascript
jquery自定义下拉列表示例
2014/04/25 Javascript
jquery+json实现数据二级联动的方法
2015/11/28 Javascript
利用jQuery设计一个简单的web音乐播放器的实例分享
2016/03/08 Javascript
js简单判断flash是否加载完成的方法
2016/06/21 Javascript
AngularJS实现与Java Web服务器交互操作示例【附demo源码下载】
2016/11/02 Javascript
JavaScript ES6中CLASS的使用详解
2016/11/22 Javascript
Angular动态添加、删除输入框并计算值实例代码
2017/03/29 Javascript
jQuery实现通过方向键控制div块上下左右移动的方法【测试可用】
2018/04/26 jQuery
js实现图片局部放大效果详解
2019/03/18 Javascript
python实现sublime3的less编译插件示例
2014/04/27 Python
python实现简单中文词频统计示例
2017/11/08 Python
对Python 内建函数和保留字详解
2018/10/15 Python
python能做哪方面的工作
2020/06/15 Python
CSS3实现10种Loading效果
2016/07/11 HTML / CSS
蔻驰意大利官网:COACH意大利
2019/01/16 全球购物
Hanky Panky官方网站:内衣和睡衣
2019/07/25 全球购物
美国轻奢时尚购物网站:REVOLVE(支持中文)
2020/07/18 全球购物
美国床垫连锁店:Mattress Firm
2021/02/13 全球购物
介绍一下HDLC(High-Level Data Link Control)高层数据链路协议
2012/01/21 面试题
5个HTML5的常用本地存储方式详解与介绍
2021/03/27 HTML / CSS
大学生简历中个人的自我评价
2013/10/06 职场文书
酒店服务与管理毕业生求职信
2013/11/02 职场文书
企业车辆管理制度
2014/01/24 职场文书
如何写自我评价?自我评价写什么好?
2014/03/14 职场文书
党员学习新党章思想汇报
2014/10/25 职场文书
秦始皇兵马俑导游词
2015/02/02 职场文书
Go获取两个时区的时间差
2022/04/20 Golang