PHPAnalysis中文分词类详解


Posted in PHP onJune 13, 2014

PHPAnalysis是目前广泛使用的中文分词类,使用反向匹配模式分词,因此兼容编码更广泛,现将其变量与常用函数详解如下:

一、比较重要的成员变量

$resultType   = 1        生成的分词结果数据类型(1 为全部, 2为 词典词汇及单个中日韩简繁字符及英文, 3 为词典词汇及英文)
                                    这个变量一般用 SetResultType( $rstype ) 这方法进行设置。
$notSplitLen  = 5        切分句子最短长度
$toLower      = false    把英文单词全部转小写
$differMax    = false    使用最大切分模式对二元词进行消岐
$unitWord     = true     尝试合并单字(即是新词识别)
$differFreq   = false    使用热门词优先模式进行消岐

二、主要成员函数列表

1、public function __construct($source_charset='utf-8', $target_charset='utf-8', $load_all=true, $source='')
函数说明:构造函数
参数列表:
$source_charset      源字符串编码
$target_charset      目录字符串编码
$load_all            是否完全加载词典(此参数已经作废)
$source              源字符串
如果输入输出都是utf-8,实际上可以不必使用任何参数进行初始化,而是通过 SetSource 方法设置要操作的文本

2、public function SetSource( $source, $source_charset='utf-8', $target_charset='utf-8' )
函数说明:设置源字符串
参数列表:
$source              源字符串
$source_charset      源字符串编码
$target_charset      目录字符串编码
返回值:bool

3、public function StartAnalysis($optimize=true)
函数说明:开始执行分词操作
参数列表:
$optimize            分词后是否尝试优化结果
返回值:void
一个基本的分词过程:
//////////////////////////////////////
$pa = new PhpAnalysis();

$pa->SetSource('需要进行分词的字符串');

//设置分词属性
$pa->resultType = 2;
$pa->differMax  = true;

$pa->StartAnalysis();

//获取你想要的结果
$pa->GetFinallyIndex();
////////////////////////////////////////

4、public function SetResultType( $rstype )
函数说明:设置返回结果的类型
实际是对成员变量$resultType的操作
参数 $rstype 值为:
1 为全部, 2为 词典词汇及单个中日韩简繁字符及英文, 3 为词典词汇及英文
返回值:void

5、public function GetFinallyKeywords( $num = 10 )
函数说明:获取出现频率最高的指定词条数(通常用于提取文档关键字)
参数列表:
$num = 10  返回词条个数
返回值:用","分隔的关键字列表

6、public function GetFinallyResult($spword=' ')
函数说明:获得最终分词结果
参数列表:
$spword    词条之间的分隔符
返回值:string

7、public function GetSimpleResult()
函数说明:获得粗分结果
返回值:array

8、public function GetSimpleResultAll()
函数说明:获得包含属性信息的粗分结果
属性(1中文词句、2 ANSI词汇(包括全角),3 ANSI标点符号(包括全角),4数字(包括全角),5 中文标点或无法识别字符)
返回值:array

9、public function GetFinallyIndex()
函数说明:获取hash索引数组
返回值:array('word'=>count,...) 按出现频率排序

10、public function MakeDict( $source_file, $target_file='' )
函数说明:把文本文件词库编译成词典
参数列表:
$source_file   源文本文件
$target_file   目标文件(如果不指定,则为当前词典)
返回值:void

11、public function ExportDict( $targetfile )
函数说明:导出当前词典全部词条为文本文件
参数列表:
$targetfile  目标文件
返回值:void

PHP 相关文章推荐
PHP实现分页的一个示例
Oct 09 PHP
PHP目录函数实现创建、读取目录教程实例
Jan 13 PHP
php下将多个数组合并成一个数组的方法与实例代码
Feb 03 PHP
使用PHP实现二分查找算法代码分享
Jun 24 PHP
php实现快速排序法函数代码
Aug 27 PHP
ThinkPHP入口文件设置及相关注意事项分析
Dec 05 PHP
PHP SPL标准库之数据结构堆(SplHeap)简单使用实例
May 12 PHP
php防止网站被攻击的应急代码
Oct 21 PHP
PHP代码维护,重构变困难的4种原因分析
Jan 25 PHP
浅析php如何实现App常用的秒发功能
Aug 03 PHP
解决微信授权回调页面域名只能设置一个的问题
Dec 11 PHP
PHP实现的登录页面信息提示功能示例
Jul 24 PHP
ThinkPHP缓存方法S()概述
Jun 13 #PHP
采用ThinkPHP中F方法实现快速缓存实例
Jun 13 #PHP
浅析ThinkPHP中execute和query方法的区别
Jun 13 #PHP
采用thinkphp自带方法生成静态html文件详解
Jun 13 #PHP
PHP中使用gettext解决国际化问题的例子(i18n)
Jun 13 #PHP
Yii结合CKEditor实现图片上传功能
Jun 13 #PHP
在Yii框架中使用PHP模板引擎Twig的例子
Jun 13 #PHP
You might like
php抓取页面的几种方法详解
2013/06/17 PHP
PHP实现生成唯一会员卡号
2015/08/24 PHP
CI框架扩展系统核心类的方法分析
2016/05/23 PHP
php中遍历二维数组并以表格的形式输出的方法
2017/01/03 PHP
function foo的原型与prototype属性解惑
2010/11/19 Javascript
js父窗口关闭时子窗口随之关闭完美解决方案
2014/04/29 Javascript
JavaScript避免内存泄露及内存管理技巧
2014/09/05 Javascript
js简单实现点击左右运动的方法
2015/04/10 Javascript
javascript文件加载管理简单实现方法
2015/07/25 Javascript
jQuery实现的仿百度分页足迹效果代码
2015/10/30 Javascript
深入理解angularjs过滤器
2016/05/25 Javascript
Nodejs之http的表单提交
2017/07/07 NodeJs
jquery实现点击a链接,跳转之后,该a链接处显示背景色的方法
2018/01/18 jQuery
vue.js在标签属性中插入变量参数的方法
2018/03/06 Javascript
webpack v4 从dev到prd的方法
2018/04/02 Javascript
详解Vue基于vue-quill-editor富文本编辑器使用心得
2019/01/03 Javascript
详解django模板与vue.js冲突问题
2019/07/07 Javascript
js消除图片小游戏代码
2019/12/11 Javascript
openLayer4实现动态改变标注图标
2020/08/17 Javascript
vue实现移动端触屏拖拽功能
2020/08/21 Javascript
Python MySQLdb模块连接操作mysql数据库实例
2015/04/08 Python
Python 实现删除某路径下文件及文件夹的实例讲解
2018/04/24 Python
Python3.5 Json与pickle实现数据序列化与反序列化操作示例
2019/04/29 Python
Python绘制频率分布直方图的示例
2019/07/08 Python
python集合删除多种方法详解
2020/02/10 Python
Python依赖包迁移到断网环境操作
2020/07/13 Python
aec加密 php_php aes加密解密类(兼容php5、php7)
2021/03/14 PHP
英语系本科生求职信范文
2013/12/18 职场文书
天鹅的故事教学反思
2014/02/04 职场文书
三关爱志愿服务活动方案
2014/08/17 职场文书
竞选学习委员演讲稿
2014/09/01 职场文书
学校政风行风自查自纠报告
2014/10/21 职场文书
公司2014年度工作总结
2014/12/10 职场文书
师范生见习自我总结
2015/06/23 职场文书
2016入党积极分子党课学习心得体会
2015/10/09 职场文书
linux下安装redis图文详细步骤
2021/12/04 Redis