PHPAnalysis中文分词类详解


Posted in PHP onJune 13, 2014

PHPAnalysis是目前广泛使用的中文分词类,使用反向匹配模式分词,因此兼容编码更广泛,现将其变量与常用函数详解如下:

一、比较重要的成员变量

$resultType   = 1        生成的分词结果数据类型(1 为全部, 2为 词典词汇及单个中日韩简繁字符及英文, 3 为词典词汇及英文)
                                    这个变量一般用 SetResultType( $rstype ) 这方法进行设置。
$notSplitLen  = 5        切分句子最短长度
$toLower      = false    把英文单词全部转小写
$differMax    = false    使用最大切分模式对二元词进行消岐
$unitWord     = true     尝试合并单字(即是新词识别)
$differFreq   = false    使用热门词优先模式进行消岐

二、主要成员函数列表

1、public function __construct($source_charset='utf-8', $target_charset='utf-8', $load_all=true, $source='')
函数说明:构造函数
参数列表:
$source_charset      源字符串编码
$target_charset      目录字符串编码
$load_all            是否完全加载词典(此参数已经作废)
$source              源字符串
如果输入输出都是utf-8,实际上可以不必使用任何参数进行初始化,而是通过 SetSource 方法设置要操作的文本

2、public function SetSource( $source, $source_charset='utf-8', $target_charset='utf-8' )
函数说明:设置源字符串
参数列表:
$source              源字符串
$source_charset      源字符串编码
$target_charset      目录字符串编码
返回值:bool

3、public function StartAnalysis($optimize=true)
函数说明:开始执行分词操作
参数列表:
$optimize            分词后是否尝试优化结果
返回值:void
一个基本的分词过程:
//////////////////////////////////////
$pa = new PhpAnalysis();

$pa->SetSource('需要进行分词的字符串');

//设置分词属性
$pa->resultType = 2;
$pa->differMax  = true;

$pa->StartAnalysis();

//获取你想要的结果
$pa->GetFinallyIndex();
////////////////////////////////////////

4、public function SetResultType( $rstype )
函数说明:设置返回结果的类型
实际是对成员变量$resultType的操作
参数 $rstype 值为:
1 为全部, 2为 词典词汇及单个中日韩简繁字符及英文, 3 为词典词汇及英文
返回值:void

5、public function GetFinallyKeywords( $num = 10 )
函数说明:获取出现频率最高的指定词条数(通常用于提取文档关键字)
参数列表:
$num = 10  返回词条个数
返回值:用","分隔的关键字列表

6、public function GetFinallyResult($spword=' ')
函数说明:获得最终分词结果
参数列表:
$spword    词条之间的分隔符
返回值:string

7、public function GetSimpleResult()
函数说明:获得粗分结果
返回值:array

8、public function GetSimpleResultAll()
函数说明:获得包含属性信息的粗分结果
属性(1中文词句、2 ANSI词汇(包括全角),3 ANSI标点符号(包括全角),4数字(包括全角),5 中文标点或无法识别字符)
返回值:array

9、public function GetFinallyIndex()
函数说明:获取hash索引数组
返回值:array('word'=>count,...) 按出现频率排序

10、public function MakeDict( $source_file, $target_file='' )
函数说明:把文本文件词库编译成词典
参数列表:
$source_file   源文本文件
$target_file   目标文件(如果不指定,则为当前词典)
返回值:void

11、public function ExportDict( $targetfile )
函数说明:导出当前词典全部词条为文本文件
参数列表:
$targetfile  目标文件
返回值:void

PHP 相关文章推荐
php 移除数组重复元素的一点说明
Nov 27 PHP
php 获取可变函数参数的函数
Aug 26 PHP
php 学习资料零碎东西
Dec 04 PHP
Base64在线编码解码实现代码 演示与下载
Jan 08 PHP
PHP Global变量定义当前页面的全局变量实现探讨
Jun 05 PHP
php实现判断访问来路是否为搜索引擎机器人的方法
Apr 15 PHP
基于PHP技术开发客服工单系统
Jan 06 PHP
PHP实现查询两个数组中不同元素的方法
Feb 23 PHP
ThinkPHP中where()使用方法详解
Apr 19 PHP
PHP判断数组是否为空的常用方法(五种方法)
Feb 08 PHP
PHP实现在数据库百万条数据中随机获取20条记录的方法
Apr 19 PHP
php操作redis数据库常见方法实例总结
Feb 20 PHP
ThinkPHP缓存方法S()概述
Jun 13 #PHP
采用ThinkPHP中F方法实现快速缓存实例
Jun 13 #PHP
浅析ThinkPHP中execute和query方法的区别
Jun 13 #PHP
采用thinkphp自带方法生成静态html文件详解
Jun 13 #PHP
PHP中使用gettext解决国际化问题的例子(i18n)
Jun 13 #PHP
Yii结合CKEditor实现图片上传功能
Jun 13 #PHP
在Yii框架中使用PHP模板引擎Twig的例子
Jun 13 #PHP
You might like
分割GBK中文遭遇乱码的解决方法
2013/08/09 PHP
PHP的全局错误处理详解
2016/04/25 PHP
浅谈PHP定义命令空间的几个注意点(推荐)
2016/10/29 PHP
kindeditor 加入七牛云上传的实例讲解
2017/11/12 PHP
无阻塞加载脚本分析[全]
2011/01/20 Javascript
html中使用javascript调用本地程序(exe、doc等)实现代码
2013/04/26 Javascript
jquery实现在页面加载完毕后获取图片高度或宽度
2014/06/16 Javascript
JavaScript中的console.dir()函数介绍
2014/12/29 Javascript
JavaScript中String.prototype用法实例
2015/05/20 Javascript
不能不知道的10个angularjs英文学习网站
2016/03/23 Javascript
jQuery操作iframe中js函数的方法小结
2016/07/06 Javascript
自动适应iframe右边的高度
2016/12/22 Javascript
原生Javascript插件开发实践
2017/01/18 Javascript
vue-router 学习快速入门
2017/03/01 Javascript
详解VScode编辑器vue环境搭建所遇问题解决方案
2019/04/26 Javascript
Layui 解决表格异步调用后台分页的问题
2019/10/26 Javascript
js实现二级联动简单实例
2020/01/11 Javascript
vue 使用post/get 下载导出文件操作
2020/08/07 Javascript
Vue 实现可视化拖拽页面编辑器
2021/02/01 Vue.js
python对字典进行排序实例
2014/09/25 Python
python快速建立超简单的web服务器的实现方法
2018/02/17 Python
python基础 range的用法解析
2019/08/23 Python
解决Pycharm 导入其他文件夹源码的2种方法
2020/02/12 Python
Python GUI编程学习笔记之tkinter界面布局显示详解
2020/03/30 Python
Python3.7下安装pyqt5的方法步骤(图文)
2020/05/12 Python
详解移动端HTML5音频与视频问题及解决方案
2018/08/22 HTML / CSS
人事专员岗位职责
2013/11/20 职场文书
演讲稿怎么写
2014/01/07 职场文书
教师产假请假条
2014/04/10 职场文书
初三学习计划书范文
2014/04/30 职场文书
党员群众路线教育实践活动学习笔记
2014/11/05 职场文书
红与黑读书笔记
2015/06/29 职场文书
2015年乡镇组织委员工作总结
2015/10/23 职场文书
导游词之太原天龙山
2020/01/02 职场文书
Nginx配置https原理及实现过程详解
2021/03/31 Servers
Python学习之时间包使用教程详解
2022/03/21 Python