在python下实现word2vec词向量训练与加载实例


Posted in Python onJune 09, 2020

项目中要对短文本进行相似度估计,word2vec是一个很火的工具。本文就word2vec的训练以及加载进行了总结。

word2vec的原理就不描述了,word2vec词向量工具是由google开发的,输入为文本文档,输出为基于这个文本文档的语料库训练得到的词向量模型。

通过该模型可以对单词的相似度进行量化分析。

word2vec的训练方法有2种,一种是通过word2vec的官方手段,在linux环境下编译并执行。

在github上下载word2vec的安装包,然后make编译。查看demo-word.sh脚本,得到word2vec的执行命令:

./word2vec -train text8 -output vectors.bin -cbow 1 -size 200 -window 8 -negative 25 -hs 0 -sample 1e-4 -threads 20 -binary 1 -iter 15

参数解释:

1)-train:需要训练的语料库,text8为语料库文件名

2)-output:输出的词向量文件,vectors.bin为输出词向量文件名,.bin后缀为二进制文件。若要以文档的形式查看词向量文件,需要将-binary参数的值由1改为0

3)-cbow:是否使用cbow模型进行训练。参数为1表示使用cbow,为0表示不使用cbow

4)-size:词向量的维数,默认为200维。

5)-window:训练过程中截取上下文的窗口大小,默认为8,即考虑一个词前8个和后8个词

6)-negative:若参数非0,表明采样随机负采样的方法,负样本子集的规模默认为25。若参数值为0,表示不使用随机负采样模型。使用随机负采样比Hierarchical Softmax模型效率更高。

7)-hs:是否采用基于Hierarchical Softmax的模型。参数为1表示使用,0表示不使用

8)-sample:语料库中的词频阈值参数,词频大于该阈值的词,越容易被采样。默认为e^-4.

9)-threads:开启的线程数目,默认为20.

10)-binary:词向量文件的输出形式。1表示输出二进制文件,0表示输出文本文件

11)-iter:训练的迭代次数。一定范围内,次数越高,训练得到的参数会更准确。默认值为15次.

./word2vec -train mytext.txt -output vectors.txt -cbow 1 -size 200 -window 5 -negative 25 -hs 0 -sample 1e-4 -threads 20 -binary 0 -iter 30

示例为训练一个名mytext.txt的文档。设置输出词向量的格式为.txt文本文档,所以还需要将-binary参数设置为0.

训练模型采用基于随机负采样的cbow模型。由于短文本字数极为有限,所以-window参数设置为5,设置词向量的维数

为200,为了使得到的参数更准确,将迭代次数增加至30.其他参数使用默认值。

训练以后得到一个txt文本,该文本的内容为:每行一个单词,单词后面是对应的词向量。

gensim加载词向量:

保存词向量模型到pkl中(注意:这里是对词向量模型进行构建)

from gensim.models import KeyedVectors
if not os.path.exists(pkl_path): # 如果pickle模型不存在,则构建一个

    print '词向量模型不存在,开始构建词向量模型...'
    Word2Vec = KeyedVectors.load_word2vec_format(vecs_path, binary=False) # 加载词向量模型
    f = file(pkl_path, 'wb')
    pickle.dump(Word2Vec, f, True)
    f.close()
    print '词向量模型构建完毕...'

f= file(pkl_path, 'rb')# 打开pkl文件
word2vec=pickle.load(f)# 载入pkl

第二种方法是使用gensim模块训练词向量:

from gensim.models import Word2Vec
from gensim.models.word2vec import LineSentence

try:
  import cPickle as pickle
except ImportError:
  import pickle

sentences = LineSentence(path)# path为要训练的txt的路径
# 对sentences表示的语料库进行训练,训练200维的词向量,窗口大小设置为5,最小词频设置为5
model = Word2Vec(sentences, size=200, window=5, min_count=5)
model.save(model_path)#model_path为模型路径。保存模型,通常采用pkl形式保存,以便下次直接加载即可

# 加载模型
model = Word2Vec.load(model_path)

完整的训练,加载通常采用如下方式:

if not os.path.exists(model_path):
    sentences = LineSentence(path)
    model = Word2Vec(sentences, size=200, window=5, min_count=5)
    model.save(model_path)
model = Word2Vec.load(model_path)

这样一来,就可以通过pkl化的词向量模型进行读取了。pkl的目的是为了保存程序中变量的状态,以便下次直接访问,

不必重新训练模型。

详细内容间gensim官方库

https://radimrehurek.com/gensim/models/word2vec.html

以上这篇在python下实现word2vec词向量训练与加载实例就是小编分享给大家的全部内容了,希望能给大家一个参考,也希望大家多多支持三水点靠木。

Python 相关文章推荐
python实现dnspod自动更新dns解析的方法
Feb 14 Python
解决tensorflow1.x版本加载saver.restore目录报错的问题
Jul 26 Python
Python中return self的用法详解
Jul 27 Python
Python引用计数操作示例
Aug 23 Python
Python依赖包整体迁移方法详解
Aug 15 Python
Python使用字典实现的简单记事本功能示例
Aug 15 Python
Python使用__new__()方法为对象分配内存及返回对象的引用示例
Sep 20 Python
浅谈Pytorch中的自动求导函数backward()所需参数的含义
Feb 29 Python
Python计算指定日期是今年的第几天(三种方法)
Mar 26 Python
Python实现播放和录制声音的功能
Aug 12 Python
Python导入父文件夹中模块并读取当前文件夹内的资源
Nov 19 Python
Python制作简单的剪刀石头布游戏
Dec 10 Python
Python实现寻找回文数字过程解析
Jun 09 #Python
pycharm 关掉syntax检查操作
Jun 09 #Python
Python控制台实现交互式环境执行
Jun 09 #Python
使用pycharm和pylint检查python代码规范操作
Jun 09 #Python
Python基于数列实现购物车程序过程详解
Jun 09 #Python
pycharm 对代码做静态检查操作
Jun 09 #Python
Python3读取和写入excel表格数据的示例代码
Jun 09 #Python
You might like
Zend Framework教程之MVC框架的Controller用法分析
2016/03/07 PHP
PHP 图片处理
2020/09/16 PHP
让textarea控件的滚动条怎是位与最下方
2007/04/20 Javascript
javascript 函数速查表
2010/02/07 Javascript
JQuery在光标位置插入内容的实现代码
2010/06/18 Javascript
jQuery对象和DOM对象使用说明
2010/06/25 Javascript
js实现a标签超链接提交form表单的方法
2015/06/24 Javascript
使用 stylelint检查CSS_StyleLint
2016/04/28 Javascript
Bootstrap打造一个左侧折叠菜单的系统模板(一)
2016/05/17 Javascript
微信小程序 火车票查询实例讲解
2016/10/17 Javascript
Angular.js中ng-include用法及多标签页面的实现方式详解
2017/05/07 Javascript
JS中的数组转变成JSON格式字符串的方法
2017/05/09 Javascript
jQuery实现滚动效果
2017/11/17 jQuery
基于JavaScript实现一个简单的Vue
2018/09/26 Javascript
在Web关闭页面时发送Ajax请求的实现方法
2019/03/07 Javascript
layui 弹出层回调获取弹出层数据的例子
2019/09/02 Javascript
分享Angular http interceptors 拦截器使用(推荐)
2019/11/10 Javascript
JS几个常用的函数和对象定义与用法示例
2020/01/15 Javascript
vue穿梭框实现上下移动
2021/01/29 Vue.js
Python实现矩阵相乘的三种方法小结
2018/07/26 Python
python 中不同包 类 方法 之间的调用详解
2020/03/09 Python
python编程的核心知识点总结
2021/02/08 Python
利用HTML5的新特点实现图片文件异步上传
2014/05/29 HTML / CSS
Hotter Shoes美国官网:英国最受欢迎的舒适鞋
2018/08/02 全球购物
Michael Kors加拿大官网:购买设计师手袋、手表、鞋子、服装等
2019/03/16 全球购物
Nike意大利官网:Nike.com IT
2020/01/19 全球购物
市政工程技术专业自荐书
2014/07/06 职场文书
2014年教师党员自我评议
2014/09/19 职场文书
高校教师个人工作总结2014
2014/12/17 职场文书
男生贾里读书笔记
2015/06/30 职场文书
2019年作为一名实习生的述职报告
2019/09/29 职场文书
python tkinter Entry控件的焦点移动操作
2021/05/22 Python
pytorch fine-tune 预训练的模型操作
2021/06/03 Python
使用vuex-persistedstate本地存储vuex
2022/04/29 Vue.js
Docker部署Mysql8的实现步骤
2022/07/07 Servers
windows10声卡驱动怎么安装?win10声卡驱动安装操作步骤教程
2022/08/05 数码科技