Python使用gensim计算文档相似性


Posted in Python onApril 10, 2016

pre_file.py

#-*-coding:utf-8-*-
import MySQLdb
import MySQLdb as mdb
import os,sys,string
import jieba
import codecs
reload(sys)
sys.setdefaultencoding('utf-8')
#连接数据库
try:
  conn=mdb.connect(host='127.0.0.1',user='root',passwd='kongjunli',db='test1',charset='utf8')
except Exception,e:
  print e
  sys.exit()
#获取cursor对象操作数据库
cursor=conn.cursor(mdb.cursors.DictCursor) #cursor游标
#获取内容
sql='SELECT link,content FROM test1.spider;'
cursor.execute(sql)   #execute()方法,将字符串当命令执行
data=cursor.fetchall()#fetchall()接收全部返回结果行
f=codecs.open('C:\Users\kk\Desktop\hello-result1.txt','w','utf-8')
 
for row in data:    #row接收结果行的每行数据
  seg='/'.join(list(jieba.cut(row['content'],cut_all='False')))
  f.write(row['link']+' '+seg+'\r\n')
f.close()
 
cursor.close()
      #提交事务,在插入数据时必须

jiansuo.py

#-*-coding:utf-8-*-
import sys
import string
import MySQLdb
import MySQLdb as mdb
import gensim
from gensim import corpora,models,similarities
from gensim.similarities import MatrixSimilarity
import logging
import codecs
reload(sys)
sys.setdefaultencoding('utf-8')
 
con=mdb.connect(host='127.0.0.1',user='root',passwd='kongjunli',db='test1',charset='utf8')
with con:
  cur=con.cursor()
  cur.execute('SELECT * FROM cutresult_copy')
  rows=cur.fetchall()
  class MyCorpus(object):
    def __iter__(self):
      for row in rows:
        yield str(row[1]).split('/')
#开启日志
logging.basicConfig(format='%(asctime)s:%(levelname)s:%(message)s',level=logging.INFO)
Corp=MyCorpus()
#将网页文档转化为tf-idf
dictionary=corpora.Dictionary(Corp)
corpus=[dictionary.doc2bow(text) for text in Corp] #将文档转化为词袋模型
#print corpus
tfidf=models.TfidfModel(corpus)#使用tf-idf模型得出文档的tf-idf模型
corpus_tfidf=tfidf[corpus]#计算得出tf-idf值
#for doc in corpus_tfidf:
  #print doc
###
'''
q_file=open('C:\Users\kk\Desktop\q.txt','r')
query=q_file.readline()
q_file.close()
vec_bow=dictionary.doc2bow(query.split(' '))#将请求转化为词带模型
vec_tfidf=tfidf[vec_bow]#计算出请求的tf-idf值
#for t in vec_tfidf:
 # print t
'''
###
query=raw_input('Enter your query:')
vec_bow=dictionary.doc2bow(query.split())
vec_tfidf=tfidf[vec_bow]
index=similarities.MatrixSimilarity(corpus_tfidf)
sims=index[vec_tfidf]
similarity=list(sims)
print sorted(similarity,reverse=True)

encodings.xml

<?xml version="1.0" encoding="UTF-8"?>
<project version="4">
 <component name="Encoding">
  <file url="PROJECT" charset="UTF-8" />
 </component>
</project>

misc.xml

<?xml version="1.0" encoding="UTF-8"?>
<project version="4">
 <component name="ProjectLevelVcsManager" settingsEditedManually="false">
  <OptionsSetting value="true" id="Add" />
  <OptionsSetting value="true" id="Remove" />
  <OptionsSetting value="true" id="Checkout" />
  <OptionsSetting value="true" id="Update" />
  <OptionsSetting value="true" id="Status" />
  <OptionsSetting value="true" id="Edit" />
  <ConfirmationsSetting value="0" id="Add" />
  <ConfirmationsSetting value="0" id="Remove" />
 </component>
 <component name="ProjectRootManager" version="2" project-jdk-name="Python 2.7.11 (C:\Python27\python.exe)" project-jdk-type="Python SDK" />
</project>

modules.xml

<?xml version="1.0" encoding="UTF-8"?>
<project version="4">
 <component name="ProjectModuleManager">
  <modules>
   <module fileurl="file://$PROJECT_DIR$/.idea/爬虫练习代码.iml" filepath="$PROJECT_DIR$/.idea/爬虫练习代码.iml" />
  </modules>
 </component>
</project>
Python 相关文章推荐
python使用post提交数据到远程url的方法
Apr 29 Python
星球大战与Python之间的那些事
Jan 07 Python
Python实现购物程序思路及代码
Jul 24 Python
Python中使用多进程来实现并行处理的方法小结
Aug 09 Python
python中模块查找的原理与方法详解
Aug 11 Python
Python模拟随机游走图形效果示例
Feb 06 Python
Python+OpenCV目标跟踪实现基本的运动检测
Jul 10 Python
python实现移位加密和解密
Mar 22 Python
Python实现的爬取小说爬虫功能示例
Mar 30 Python
python实现百度OCR图片识别过程解析
Jan 17 Python
python读取xml文件方法解析
Aug 04 Python
python开根号实例讲解
Aug 30 Python
Python调用SQLPlus来操作和解析Oracle数据库的方法
Apr 09 #Python
python调用fortran模块
Apr 08 #Python
python3使用urllib模块制作网络爬虫
Apr 08 #Python
Python抓取电影天堂电影信息的代码
Apr 07 #Python
Python Requests安装与简单运用
Apr 07 #Python
Python Requests 基础入门
Apr 07 #Python
Python检测网站链接是否已存在
Apr 07 #Python
You might like
77A一级收信机修理记
2021/03/02 无线电
php删除一个路径下的所有文件夹和文件的方法
2018/02/07 PHP
js验证表单第二部分
2006/11/25 Javascript
jquery validate添加自定义验证规则(验证邮箱 邮政编码)
2013/12/04 Javascript
javascript控制在光标位置插入文字适合表情的插入
2014/06/09 Javascript
jQuery CSS()方法改变现有的CSS样式
2014/08/20 Javascript
javascript中类的定义方式详解(四种方式)
2015/12/22 Javascript
JS清除文本框内容离开在恢复及鼠标离开文本框时触发js的方法
2016/01/12 Javascript
浅析javascript异步执行函数导致的变量变化问题解决思路
2016/05/13 Javascript
JavaScript中判断数据类型的方法总结
2016/05/24 Javascript
详解Angular2 之 结构型指令
2017/06/21 Javascript
vue2.0之多页面的开发的示例
2018/01/30 Javascript
iview中Select 选择器多选校验方法
2018/03/15 Javascript
页面内锚点定位及跳转方法总结(推荐)
2019/04/24 Javascript
js如何实现元素曝光上报
2019/08/07 Javascript
vue实现codemirror代码编辑器中的SQL代码格式化功能
2019/08/27 Javascript
JS前端模块化原理与实现方法详解
2020/03/17 Javascript
Vue简单实现原理详解
2020/05/07 Javascript
学习python (1)
2006/10/31 Python
使用go和python递归删除.ds store文件的方法
2014/01/22 Python
Python实现读取并保存文件的类
2017/05/11 Python
使用python编写简单的小程序编译成exe跑在win10上
2018/01/15 Python
Python对象属性自动更新操作示例
2018/06/15 Python
基于Python List的赋值方法
2018/06/23 Python
python3.6.3转化为win-exe文件发布的方法
2018/10/31 Python
Python 写入训练日志文件并控制台输出解析
2019/08/13 Python
解决Python 函数声明先后顺序出现的问题
2020/09/02 Python
英语生日邀请函
2014/01/23 职场文书
火锅店创业计划书范文
2014/02/02 职场文书
体现团队精神的口号
2014/06/06 职场文书
酒店服务员岗位职责
2015/02/09 职场文书
2015年生产车间工作总结
2015/04/22 职场文书
费城故事观后感
2015/06/10 职场文书
2016年“世界环境日”校园广播稿
2015/12/18 职场文书
Mysql中存储引擎的区别及比较
2021/06/04 MySQL
Pytest中skip和skipif的具体使用方法
2021/06/30 Python