PHPAnalysis中文分词类详解


Posted in PHP onJune 13, 2014

PHPAnalysis是目前广泛使用的中文分词类,使用反向匹配模式分词,因此兼容编码更广泛,现将其变量与常用函数详解如下:

一、比较重要的成员变量

$resultType   = 1        生成的分词结果数据类型(1 为全部, 2为 词典词汇及单个中日韩简繁字符及英文, 3 为词典词汇及英文)
                                    这个变量一般用 SetResultType( $rstype ) 这方法进行设置。
$notSplitLen  = 5        切分句子最短长度
$toLower      = false    把英文单词全部转小写
$differMax    = false    使用最大切分模式对二元词进行消岐
$unitWord     = true     尝试合并单字(即是新词识别)
$differFreq   = false    使用热门词优先模式进行消岐

二、主要成员函数列表

1、public function __construct($source_charset='utf-8', $target_charset='utf-8', $load_all=true, $source='')
函数说明:构造函数
参数列表:
$source_charset      源字符串编码
$target_charset      目录字符串编码
$load_all            是否完全加载词典(此参数已经作废)
$source              源字符串
如果输入输出都是utf-8,实际上可以不必使用任何参数进行初始化,而是通过 SetSource 方法设置要操作的文本

2、public function SetSource( $source, $source_charset='utf-8', $target_charset='utf-8' )
函数说明:设置源字符串
参数列表:
$source              源字符串
$source_charset      源字符串编码
$target_charset      目录字符串编码
返回值:bool

3、public function StartAnalysis($optimize=true)
函数说明:开始执行分词操作
参数列表:
$optimize            分词后是否尝试优化结果
返回值:void
一个基本的分词过程:
//////////////////////////////////////
$pa = new PhpAnalysis();

$pa->SetSource('需要进行分词的字符串');

//设置分词属性
$pa->resultType = 2;
$pa->differMax  = true;

$pa->StartAnalysis();

//获取你想要的结果
$pa->GetFinallyIndex();
////////////////////////////////////////

4、public function SetResultType( $rstype )
函数说明:设置返回结果的类型
实际是对成员变量$resultType的操作
参数 $rstype 值为:
1 为全部, 2为 词典词汇及单个中日韩简繁字符及英文, 3 为词典词汇及英文
返回值:void

5、public function GetFinallyKeywords( $num = 10 )
函数说明:获取出现频率最高的指定词条数(通常用于提取文档关键字)
参数列表:
$num = 10  返回词条个数
返回值:用","分隔的关键字列表

6、public function GetFinallyResult($spword=' ')
函数说明:获得最终分词结果
参数列表:
$spword    词条之间的分隔符
返回值:string

7、public function GetSimpleResult()
函数说明:获得粗分结果
返回值:array

8、public function GetSimpleResultAll()
函数说明:获得包含属性信息的粗分结果
属性(1中文词句、2 ANSI词汇(包括全角),3 ANSI标点符号(包括全角),4数字(包括全角),5 中文标点或无法识别字符)
返回值:array

9、public function GetFinallyIndex()
函数说明:获取hash索引数组
返回值:array('word'=>count,...) 按出现频率排序

10、public function MakeDict( $source_file, $target_file='' )
函数说明:把文本文件词库编译成词典
参数列表:
$source_file   源文本文件
$target_file   目标文件(如果不指定,则为当前词典)
返回值:void

11、public function ExportDict( $targetfile )
函数说明:导出当前词典全部词条为文本文件
参数列表:
$targetfile  目标文件
返回值:void

PHP 相关文章推荐
MYSQL数据库初学者使用指南
Nov 16 PHP
php面向对象全攻略 (二) 实例化对象 使用对象成员
Sep 30 PHP
PHP中获取变量的变量名的一段代码的bug分析
Jul 07 PHP
Trying to clone an uncloneable object of class Imagic的解决方法
Jan 11 PHP
php 无法加载mysql的module的时候的配置的解决方案引发的思考
Jan 27 PHP
PHP会话控制:Session与Cookie详解
Sep 27 PHP
服务器上配置PHP运行环境教程
Feb 12 PHP
PHP实现XML与数据格式进行转换类实例
Jul 29 PHP
学习PHP session的传递方式
Jun 15 PHP
微信网页授权(OAuth2.0) PHP 源码简单实现
Aug 29 PHP
PHP 实现页面静态化的几种方法
Jul 23 PHP
PHP中__set()实例用法和基础讲解
Jul 23 PHP
ThinkPHP缓存方法S()概述
Jun 13 #PHP
采用ThinkPHP中F方法实现快速缓存实例
Jun 13 #PHP
浅析ThinkPHP中execute和query方法的区别
Jun 13 #PHP
采用thinkphp自带方法生成静态html文件详解
Jun 13 #PHP
PHP中使用gettext解决国际化问题的例子(i18n)
Jun 13 #PHP
Yii结合CKEditor实现图片上传功能
Jun 13 #PHP
在Yii框架中使用PHP模板引擎Twig的例子
Jun 13 #PHP
You might like
Zend引擎的发展 [15]
2006/10/09 PHP
PHP错误提示的关闭方法详解
2013/06/23 PHP
php中strstr、strrchr、substr、stristr四个函数的区别总结
2014/09/22 PHP
php常用的安全过滤函数集锦
2014/10/09 PHP
JavaScript 设计模式学习 Singleton
2009/07/27 Javascript
Javascript isArray 数组类型检测函数
2009/10/08 Javascript
JavaScript中yield实用简洁实现方式
2010/06/12 Javascript
JavaScript类和继承 this属性使用说明
2010/09/03 Javascript
js输入框邮箱自动提示功能代码实现
2013/12/10 Javascript
JavaScript删除指定子元素代码实例
2015/01/13 Javascript
浅析创建javascript对象的方法
2016/05/13 Javascript
又一款js时钟!transform实现时钟效果
2016/08/15 Javascript
jQuery插件HighCharts绘制2D柱状图、折线图的组合双轴图效果示例【附demo源码下载】
2017/03/09 Javascript
Vue+Element使用富文本编辑器的示例代码
2017/08/14 Javascript
vue如何将v-for中的表格导出来
2018/05/07 Javascript
微信小程序定位当前城市的方法
2018/07/19 Javascript
webpack4 处理CSS的方法示例
2018/09/03 Javascript
vue实现添加与删除图书功能
2018/10/07 Javascript
js获取 gif 的帧数的代码实例
2019/09/10 Javascript
Vue组件基础用法详解
2020/02/05 Javascript
微信小程序收藏功能的实现代码
2020/06/19 Javascript
vuex中遇到的坑,vuex数据改变,组件中页面不渲染操作
2020/11/16 Javascript
Python中的自定义函数学习笔记
2014/09/23 Python
Python正则表达式完全指南
2017/05/25 Python
使用Flask集成bootstrap的方法
2018/07/24 Python
python 划分数据集为训练集和测试集的方法
2018/12/11 Python
20行python代码实现人脸识别
2019/05/05 Python
Django 通过JS实现ajax过程详解
2019/07/30 Python
Python自动化测试中yaml文件读取操作
2020/08/20 Python
用css3制作纸张效果(外翻卷角)
2013/02/01 HTML / CSS
国际化的太阳镜及太阳镜配件零售商:Sunglass Hut
2016/07/26 全球购物
美国销售第一的智能手机和平板电脑保护壳:OtterBox
2017/12/21 全球购物
医学专业毕业生个人求职信
2013/12/25 职场文书
工作时间调整通知
2015/04/24 职场文书
python 实现两个变量值进行交换的n种操作
2021/06/02 Python
详解Flutter自定义应用程序内键盘的实现方法
2022/06/14 Java/Android