PHPAnalysis中文分词类详解


Posted in PHP onJune 13, 2014

PHPAnalysis是目前广泛使用的中文分词类,使用反向匹配模式分词,因此兼容编码更广泛,现将其变量与常用函数详解如下:

一、比较重要的成员变量

$resultType   = 1        生成的分词结果数据类型(1 为全部, 2为 词典词汇及单个中日韩简繁字符及英文, 3 为词典词汇及英文)
                                    这个变量一般用 SetResultType( $rstype ) 这方法进行设置。
$notSplitLen  = 5        切分句子最短长度
$toLower      = false    把英文单词全部转小写
$differMax    = false    使用最大切分模式对二元词进行消岐
$unitWord     = true     尝试合并单字(即是新词识别)
$differFreq   = false    使用热门词优先模式进行消岐

二、主要成员函数列表

1、public function __construct($source_charset='utf-8', $target_charset='utf-8', $load_all=true, $source='')
函数说明:构造函数
参数列表:
$source_charset      源字符串编码
$target_charset      目录字符串编码
$load_all            是否完全加载词典(此参数已经作废)
$source              源字符串
如果输入输出都是utf-8,实际上可以不必使用任何参数进行初始化,而是通过 SetSource 方法设置要操作的文本

2、public function SetSource( $source, $source_charset='utf-8', $target_charset='utf-8' )
函数说明:设置源字符串
参数列表:
$source              源字符串
$source_charset      源字符串编码
$target_charset      目录字符串编码
返回值:bool

3、public function StartAnalysis($optimize=true)
函数说明:开始执行分词操作
参数列表:
$optimize            分词后是否尝试优化结果
返回值:void
一个基本的分词过程:
//////////////////////////////////////
$pa = new PhpAnalysis();

$pa->SetSource('需要进行分词的字符串');

//设置分词属性
$pa->resultType = 2;
$pa->differMax  = true;

$pa->StartAnalysis();

//获取你想要的结果
$pa->GetFinallyIndex();
////////////////////////////////////////

4、public function SetResultType( $rstype )
函数说明:设置返回结果的类型
实际是对成员变量$resultType的操作
参数 $rstype 值为:
1 为全部, 2为 词典词汇及单个中日韩简繁字符及英文, 3 为词典词汇及英文
返回值:void

5、public function GetFinallyKeywords( $num = 10 )
函数说明:获取出现频率最高的指定词条数(通常用于提取文档关键字)
参数列表:
$num = 10  返回词条个数
返回值:用","分隔的关键字列表

6、public function GetFinallyResult($spword=' ')
函数说明:获得最终分词结果
参数列表:
$spword    词条之间的分隔符
返回值:string

7、public function GetSimpleResult()
函数说明:获得粗分结果
返回值:array

8、public function GetSimpleResultAll()
函数说明:获得包含属性信息的粗分结果
属性(1中文词句、2 ANSI词汇(包括全角),3 ANSI标点符号(包括全角),4数字(包括全角),5 中文标点或无法识别字符)
返回值:array

9、public function GetFinallyIndex()
函数说明:获取hash索引数组
返回值:array('word'=>count,...) 按出现频率排序

10、public function MakeDict( $source_file, $target_file='' )
函数说明:把文本文件词库编译成词典
参数列表:
$source_file   源文本文件
$target_file   目标文件(如果不指定,则为当前词典)
返回值:void

11、public function ExportDict( $targetfile )
函数说明:导出当前词典全部词条为文本文件
参数列表:
$targetfile  目标文件
返回值:void

PHP 相关文章推荐
Discuz 6.0+ 批量注册用户名
Sep 13 PHP
php下连接ftp实现文件的上传、下载、删除文件实例代码
Jun 03 PHP
关于php循环跳出的问题
Jul 01 PHP
php 检查电子邮件函数(自写)
Jan 16 PHP
php查找字符串出现次数的方法
Dec 01 PHP
php输出图像的方法实例分析
Feb 16 PHP
删除PHP数组中的重复元素的实现代码
Apr 10 PHP
PHP基于socket实现客户端和服务端通讯功能
Jul 13 PHP
PHP对称加密算法(DES/AES)类的实现代码
Nov 14 PHP
phpstudy后门rce批量利用脚本的实现
Dec 12 PHP
聊聊 PHP 8 新特性 Attributes
Aug 19 PHP
如何运行/调试你的PHP代码
Oct 23 PHP
ThinkPHP缓存方法S()概述
Jun 13 #PHP
采用ThinkPHP中F方法实现快速缓存实例
Jun 13 #PHP
浅析ThinkPHP中execute和query方法的区别
Jun 13 #PHP
采用thinkphp自带方法生成静态html文件详解
Jun 13 #PHP
PHP中使用gettext解决国际化问题的例子(i18n)
Jun 13 #PHP
Yii结合CKEditor实现图片上传功能
Jun 13 #PHP
在Yii框架中使用PHP模板引擎Twig的例子
Jun 13 #PHP
You might like
Zend Framework教程之Bootstrap类用法概述
2016/03/14 PHP
smarty的section嵌套循环用法示例
2016/05/28 PHP
一个多次搜索+多次传值的解决方案
2007/01/20 Javascript
禁止F5等快捷键的JS代码
2007/03/06 Javascript
Aptana调试javascript图解教程
2009/11/30 Javascript
json的前台操作和后台操作实现代码
2012/01/20 Javascript
js判断运行jsp页面的浏览器类型以及版本示例
2013/10/30 Javascript
js精美的幻灯片画集特效代码分享
2015/08/29 Javascript
原生和jQuery的ajax用法详解
2017/01/23 Javascript
Avalonjs 实现简单购物车功能(实例代码)
2017/02/07 Javascript
基于AngularJS实现表单验证功能
2017/07/28 Javascript
JavaScript文件的同步和异步加载的实现代码
2017/08/19 Javascript
Vue组件之全局组件与局部组件的使用详解
2017/10/09 Javascript
Vue组件的使用教程详解
2018/01/05 Javascript
webpack 插件html-webpack-plugin的具体使用
2018/04/09 Javascript
vue脚手架项目创建步骤详解
2021/03/02 Vue.js
Python 流程控制实例代码
2009/09/25 Python
python实现巡检系统(solaris)示例
2014/04/02 Python
Djang中静态文件配置方法
2015/07/30 Python
Python过滤列表用法实例分析
2016/04/29 Python
Python3.4实现从HTTP代理网站批量获取代理并筛选的方法示例
2017/09/26 Python
对python内置map和six.moves.map的区别详解
2018/12/19 Python
Python实现企业微信机器人每天定时发消息实例
2020/02/25 Python
python str字符串转uuid实例
2020/03/03 Python
python des,aes,rsa加解密的实现
2021/01/16 Python
python正则表达式re.match()匹配多个字符方法的实现
2021/01/27 Python
使用CSS3的背景渐变Text Gradient 创建文字颜色渐变
2014/08/19 HTML / CSS
BIBLOO波兰:捷克的一家在线服装店
2018/03/09 全球购物
橄榄树药房:OLIVEDA
2019/09/01 全球购物
LACOSTE波兰官网:Polo衫、服装和鞋类
2020/09/29 全球购物
Unix/Linux开发面试题
2016/08/16 面试题
出纳员岗位职责
2014/03/13 职场文书
助学金感谢信
2015/01/20 职场文书
毕业答辩开场白范文
2015/05/27 职场文书
高二数学教学反思
2016/02/18 职场文书
DIY胆机必读:各国电子管评价
2022/04/06 无线电