PHPAnalysis中文分词类详解


Posted in PHP onJune 13, 2014

PHPAnalysis是目前广泛使用的中文分词类,使用反向匹配模式分词,因此兼容编码更广泛,现将其变量与常用函数详解如下:

一、比较重要的成员变量

$resultType   = 1        生成的分词结果数据类型(1 为全部, 2为 词典词汇及单个中日韩简繁字符及英文, 3 为词典词汇及英文)
                                    这个变量一般用 SetResultType( $rstype ) 这方法进行设置。
$notSplitLen  = 5        切分句子最短长度
$toLower      = false    把英文单词全部转小写
$differMax    = false    使用最大切分模式对二元词进行消岐
$unitWord     = true     尝试合并单字(即是新词识别)
$differFreq   = false    使用热门词优先模式进行消岐

二、主要成员函数列表

1、public function __construct($source_charset='utf-8', $target_charset='utf-8', $load_all=true, $source='')
函数说明:构造函数
参数列表:
$source_charset      源字符串编码
$target_charset      目录字符串编码
$load_all            是否完全加载词典(此参数已经作废)
$source              源字符串
如果输入输出都是utf-8,实际上可以不必使用任何参数进行初始化,而是通过 SetSource 方法设置要操作的文本

2、public function SetSource( $source, $source_charset='utf-8', $target_charset='utf-8' )
函数说明:设置源字符串
参数列表:
$source              源字符串
$source_charset      源字符串编码
$target_charset      目录字符串编码
返回值:bool

3、public function StartAnalysis($optimize=true)
函数说明:开始执行分词操作
参数列表:
$optimize            分词后是否尝试优化结果
返回值:void
一个基本的分词过程:
//////////////////////////////////////
$pa = new PhpAnalysis();

$pa->SetSource('需要进行分词的字符串');

//设置分词属性
$pa->resultType = 2;
$pa->differMax  = true;

$pa->StartAnalysis();

//获取你想要的结果
$pa->GetFinallyIndex();
////////////////////////////////////////

4、public function SetResultType( $rstype )
函数说明:设置返回结果的类型
实际是对成员变量$resultType的操作
参数 $rstype 值为:
1 为全部, 2为 词典词汇及单个中日韩简繁字符及英文, 3 为词典词汇及英文
返回值:void

5、public function GetFinallyKeywords( $num = 10 )
函数说明:获取出现频率最高的指定词条数(通常用于提取文档关键字)
参数列表:
$num = 10  返回词条个数
返回值:用","分隔的关键字列表

6、public function GetFinallyResult($spword=' ')
函数说明:获得最终分词结果
参数列表:
$spword    词条之间的分隔符
返回值:string

7、public function GetSimpleResult()
函数说明:获得粗分结果
返回值:array

8、public function GetSimpleResultAll()
函数说明:获得包含属性信息的粗分结果
属性(1中文词句、2 ANSI词汇(包括全角),3 ANSI标点符号(包括全角),4数字(包括全角),5 中文标点或无法识别字符)
返回值:array

9、public function GetFinallyIndex()
函数说明:获取hash索引数组
返回值:array('word'=>count,...) 按出现频率排序

10、public function MakeDict( $source_file, $target_file='' )
函数说明:把文本文件词库编译成词典
参数列表:
$source_file   源文本文件
$target_file   目标文件(如果不指定,则为当前词典)
返回值:void

11、public function ExportDict( $targetfile )
函数说明:导出当前词典全部词条为文本文件
参数列表:
$targetfile  目标文件
返回值:void

PHP 相关文章推荐
php下删除一篇文章生成的多个静态页面
Aug 08 PHP
PHP中文件读、写、删的操作(PHP中对文件和目录操作)
Mar 06 PHP
基于PHP静态类的原罪详解
May 06 PHP
php number_format() 函数通过千位分组来格式化数字的实现代码
Aug 06 PHP
php curl post 时出现的问题解决
Jan 30 PHP
smarty内置函数capture用法分析
Jan 22 PHP
php上传文件常见问题总结
Feb 03 PHP
浅析php如何实现App常用的秒发功能
Aug 03 PHP
PHP实现基于图的深度优先遍历输出1,2,3...n的全排列功能
Nov 10 PHP
PHP实现的用户注册表单验证功能简单示例
Feb 25 PHP
PHP实现时间日期友好显示实现代码
Sep 08 PHP
Laravel 验证码认证学习记录小结
Dec 20 PHP
ThinkPHP缓存方法S()概述
Jun 13 #PHP
采用ThinkPHP中F方法实现快速缓存实例
Jun 13 #PHP
浅析ThinkPHP中execute和query方法的区别
Jun 13 #PHP
采用thinkphp自带方法生成静态html文件详解
Jun 13 #PHP
PHP中使用gettext解决国际化问题的例子(i18n)
Jun 13 #PHP
Yii结合CKEditor实现图片上传功能
Jun 13 #PHP
在Yii框架中使用PHP模板引擎Twig的例子
Jun 13 #PHP
You might like
《Re:从零开始的异世界生活》剧情体验,手游新作定名
2020/04/09 日漫
PHP中uploaded_files函数使用方法详解
2011/03/09 PHP
php微信公众号开发之图片回复
2018/10/20 PHP
超级强大的表单验证
2006/06/26 Javascript
JQUERY 对象与DOM对象之两者相互间的转换
2009/04/27 Javascript
jquery动画3.创建一个带遮罩效果的图片走廊
2012/08/24 Javascript
FireBug 调试JS入门教程 如何调试JS
2013/12/23 Javascript
JS实现仿百度输入框自动匹配功能的示例代码
2014/02/19 Javascript
使用JS获取当前地理位置方法汇总
2014/12/18 Javascript
jQuery学习笔记之2个小技巧
2015/01/19 Javascript
JS实现控制表格只显示行边框或者只显示列边框的方法
2015/03/31 Javascript
Javascript编写2048小游戏
2015/07/07 Javascript
Jquery幻灯片特效代码分享--打开页面随机选择切换方式(3)
2015/08/15 Javascript
js实现跨域的几种方法汇总(图片ping、JSONP和CORS)
2015/10/25 Javascript
JS实现关闭当前页而不弹出提示框的方法
2016/06/22 Javascript
微信小程序 开发工具快捷键整理
2016/10/31 Javascript
详解Vue-Cli 异步加载数据的一些注意点
2017/08/12 Javascript
看看“疫苗查询”小程序有温度的代码
2018/07/31 Javascript
[01:07:47]Secret vs Optic Supermajor 胜者组 BO3 第一场 6.4
2018/06/05 DOTA
Python实现设置windows桌面壁纸代码分享
2015/03/28 Python
python matplotlib画图实例代码分享
2017/12/27 Python
Python多图片合并PDF的方法
2019/01/03 Python
Pandas库之DataFrame使用的学习笔记
2019/06/21 Python
使用 Python 写一个简易的抽奖程序
2019/12/08 Python
Python3 shelve对象持久存储原理详解
2020/03/23 Python
浅析Python中字符串的intern机制
2020/10/03 Python
pycharm中leetcode插件使用图文详解
2020/12/07 Python
大学毕业登记表自我鉴定
2013/10/09 职场文书
50岁生日感言
2014/01/23 职场文书
高三学习决心书
2014/03/11 职场文书
电力安全事故反思
2014/04/27 职场文书
统计专业自荐书
2014/07/06 职场文书
活动总结范文
2014/08/30 职场文书
活着观后感
2015/06/03 职场文书
MySQL 使用自定义变量进行查询优化
2021/05/14 MySQL
Java实现HTML转为Word的示例代码
2022/06/28 Java/Android