编程 Python

在python下实现word2vec词向量训练与加载实例

Posted in Python onJune 09, 2020

项目中要对短文本进行相似度估计，word2vec是一个很火的工具。本文就word2vec的训练以及加载进行了总结。

word2vec的原理就不描述了，word2vec词向量工具是由google开发的，输入为文本文档，输出为基于这个文本文档的语料库训练得到的词向量模型。

通过该模型可以对单词的相似度进行量化分析。

word2vec的训练方法有2种，一种是通过word2vec的官方手段，在linux环境下编译并执行。

在github上下载word2vec的安装包，然后make编译。查看demo-word.sh脚本，得到word2vec的执行命令：

./word2vec -train text8 -output vectors.bin -cbow 1 -size 200 -window 8 -negative 25 -hs 0 -sample 1e-4 -threads 20 -binary 1 -iter 15

参数解释：

1）-train：需要训练的语料库，text8为语料库文件名

2）-output：输出的词向量文件，vectors.bin为输出词向量文件名，.bin后缀为二进制文件。若要以文档的形式查看词向量文件，需要将-binary参数的值由1改为0

3）-cbow：是否使用cbow模型进行训练。参数为1表示使用cbow，为0表示不使用cbow

4）-size：词向量的维数，默认为200维。

5）-window：训练过程中截取上下文的窗口大小，默认为8，即考虑一个词前8个和后8个词

6）-negative：若参数非0，表明采样随机负采样的方法，负样本子集的规模默认为25。若参数值为0,表示不使用随机负采样模型。使用随机负采样比Hierarchical Softmax模型效率更高。

7）-hs：是否采用基于Hierarchical Softmax的模型。参数为1表示使用，0表示不使用

8）-sample：语料库中的词频阈值参数，词频大于该阈值的词，越容易被采样。默认为e^-4.

9）-threads：开启的线程数目，默认为20.

10）-binary：词向量文件的输出形式。1表示输出二进制文件，0表示输出文本文件

11）-iter：训练的迭代次数。一定范围内，次数越高，训练得到的参数会更准确。默认值为15次.

./word2vec -train mytext.txt -output vectors.txt -cbow 1 -size 200 -window 5 -negative 25 -hs 0 -sample 1e-4 -threads 20 -binary 0 -iter 30

示例为训练一个名mytext.txt的文档。设置输出词向量的格式为.txt文本文档，所以还需要将-binary参数设置为0.

训练模型采用基于随机负采样的cbow模型。由于短文本字数极为有限，所以-window参数设置为5，设置词向量的维数

为200，为了使得到的参数更准确，将迭代次数增加至30.其他参数使用默认值。

训练以后得到一个txt文本，该文本的内容为：每行一个单词，单词后面是对应的词向量。

gensim加载词向量：

保存词向量模型到pkl中（注意：这里是对词向量模型进行构建）

from gensim.models import KeyedVectors
if not os.path.exists(pkl_path): # 如果pickle模型不存在，则构建一个

    print '词向量模型不存在，开始构建词向量模型...'
    Word2Vec = KeyedVectors.load_word2vec_format(vecs_path, binary=False) # 加载词向量模型
    f = file(pkl_path, 'wb')
    pickle.dump(Word2Vec, f, True)
    f.close()
    print '词向量模型构建完毕...'

f= file(pkl_path, 'rb')# 打开pkl文件
word2vec=pickle.load(f)# 载入pkl

第二种方法是使用gensim模块训练词向量：

from gensim.models import Word2Vec
from gensim.models.word2vec import LineSentence

try:
  import cPickle as pickle
except ImportError:
  import pickle

sentences = LineSentence(path)# path为要训练的txt的路径
# 对sentences表示的语料库进行训练，训练200维的词向量，窗口大小设置为5，最小词频设置为5
model = Word2Vec(sentences, size=200, window=5, min_count=5)
model.save(model_path)#model_path为模型路径。保存模型，通常采用pkl形式保存，以便下次直接加载即可

# 加载模型
model = Word2Vec.load(model_path)

完整的训练，加载通常采用如下方式：

if not os.path.exists(model_path):
    sentences = LineSentence(path)
    model = Word2Vec(sentences, size=200, window=5, min_count=5)
    model.save(model_path)
model = Word2Vec.load(model_path)

这样一来，就可以通过pkl化的词向量模型进行读取了。pkl的目的是为了保存程序中变量的状态，以便下次直接访问，

不必重新训练模型。

详细内容间gensim官方库

https://radimrehurek.com/gensim/models/word2vec.html

以上这篇在python下实现word2vec词向量训练与加载实例就是小编分享给大家的全部内容了，希望能给大家一个参考，也希望大家多多支持三水点靠木。

在python下实现word2vec词向量训练与加载实例

- Author -

csg_mozl123

声明：登载此文出于传递更多信息之目的，并不意味着赞同其观点或证实其描述。

Python 相关文章推荐

python 生成目录树及显示文件大小的代码

Jul 23 Python

Python中实现从目录中过滤出指定文件类型的文件

Feb 02 Python

python爬虫实战之最简单的网页爬虫教程

Aug 13 Python

Python入门之三角函数atan2()函数详解

Nov 08 Python

解决python3 网络请求路径包含中文的问题

May 10 Python

Python3.6+Django2.0以上 xadmin站点的配置和使用教程图解

Jun 04 Python

Python使用pyautocad+openpyxl处理cad文件示例

Jul 11 Python

Django restframework 框架认证、权限、限流用法示例

Dec 21 Python

python 实现百度网盘非会员上传超过500个文件的方法

Jan 07 Python

Python实现淘宝秒杀功能的示例代码

Jan 19 Python

Python内置的数据类型及使用方法

Apr 13 Python

在 Python 中利用 Pool 进行多线程

Apr 24 Python

Python实现寻找回文数字过程解析

Jun 09 #Python

pycharm 关掉syntax检查操作

Jun 09 #Python

Python控制台实现交互式环境执行

Jun 09 #Python

使用pycharm和pylint检查python代码规范操作

Jun 09 #Python

Python基于数列实现购物车程序过程详解

Jun 09 #Python

pycharm 对代码做静态检查操作

Jun 09 #Python

Python3读取和写入excel表格数据的示例代码

Jun 09 #Python

You might like

php的urlencode()URL编码函数浅析

2011/08/09 PHP

解决PHP里大量数据循环时内存耗尽的方法

2015/10/10 PHP

Yii 2.0实现联表查询加搜索分页的方法示例

2017/08/02 PHP

ThinkPHP类似AOP思想的参数验证的实现方法

2019/12/18 PHP

showModelessDialog()使用详解

2006/09/21 Javascript

IE中radio 或checkbox的checked属性初始状态下不能选中显示问题

2009/07/25 Javascript

在JavaScript并非所有的一切都是对象

2013/04/11 Javascript

鼠标划过实现延迟加载并隐藏层的js代码

2013/10/11 Javascript

jquery的live使用注意事项

2014/02/18 Javascript

jQuery实现回车键（Enter）切换文本框焦点的代码实例

2014/05/05 Javascript

JavaScript fontcolor方法入门实例（按照指定的颜色来显示字符串）

2014/10/17 Javascript

JS中使用apply方法通过不同数量的参数调用函数的方法

2016/05/31 Javascript

微信小程序省市区选择器实例详解(附源码下载)

2017/01/05 Javascript

angular.js指令中transclude选项及ng-transclude指令详解

2017/05/24 Javascript

在微信小程序里使用watch和computed的方法

2018/08/02 Javascript

JSON字符串操作移除空串更改key/value的介绍

2019/01/05 Javascript

vue中过滤器filter的讲解

2019/01/21 Javascript

JavaScript实现汉字转换为拼音及缩写的方法示例

2019/03/28 Javascript

Node.js折腾记一：读指定文件夹，输出该文件夹的文件树详解

2019/04/20 Javascript

JavaScript实现模态对话框实例

2020/01/13 Javascript

python自动zip压缩目录的方法

2015/06/28 Python

Python基础知识_浅谈用户交互

2017/05/31 Python

Python实现的对本地host127.0.0.1主机进行扫描端口功能示例

2019/02/15 Python

python3.6实现学生信息管理系统

2019/02/21 Python

Pycharm新手教程(只需要看这篇就够了)

2019/06/18 Python

Python Pandas 获取列匹配特定值的行的索引问题

2019/07/01 Python

python Tornado框架的使用示例

2020/10/19 Python

使用css3制作动感导航条示例

2014/01/26 HTML / CSS

求职简历自荐信范文

2013/10/21 职场文书

银行职员思想汇报

2013/12/31 职场文书

设备管理实施方案

2014/05/31 职场文书

建筑安全生产责任书

2014/07/22 职场文书

2015年党风廉政建设个人总结

2015/08/18 职场文书

创业开店，这样方式更合理

2019/08/26 职场文书

vue组件的路由高亮问题解决方法

2021/05/11 Vue.js

攻略丨滑雪究竟该选哪款对讲机？

2022/02/18 无线电