编程 Python

python实现登陆知乎获得个人收藏并保存为word文件

Posted in Python onMarch 16, 2015

这个程序其实很早之前就完成了,一直没有发出了,趁着最近不是很忙就分享给大家.
使用BeautifulSoup模块和urllib2模块实现,然后保存成word是使用python docx模块的,安装方式网上一搜一大堆,我就不再赘述了.

主要实现的功能是登陆知乎,然后将个人收藏的问题和答案获取到之后保存为word文档,以便没有网络的时候可以查阅.当然,答案中如果有图片的话也是可以获取到的.不过这块还是有点问题的.等以后有时间了在修改修改吧.

还有就是正则,用的简直不要太烂…鄙视下自己…

还有,现在是问题的话所有的答案都会保存下来的.看看有时间修改成只保存第一个答案或者收藏页问题的答案吧.要不然如果收藏的太多了的话保存下来的word会吓你一跳的哦.O(∩_∩)O哈哈~

在登陆的时候可能会需要验证码,如果提示输入验证码的话在程序的文件夹下面就可以看到验证码的图片,照着输入就ok了.

# -*- coding: utf-8 -*-
#登陆知乎抓取个人收藏 然后保存为word
import sys
reload(sys) 
sys.setdefaultencoding('utf-8')
import urllib
import urllib2
import cookielib
import string
import re
from bs4 import BeautifulSoup
from docx import Document
from docx import *
from docx.shared import Inches
from sys import exit
import os
 
#这儿是因为在公司上网的话需要使用socket代理
#import socks
#import socket
#socks.setdefaultproxy(socks.PROXY_TYPE_SOCKS5,"127.0.0.1",8088)
#socket.socket =socks.socksocket
 
loginurl='http://www.zhihu.com/login'
 
headers = {'User-Agent' : 'Mozilla/5.0 (Windows NT 6.1; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/34.0.1847.116 Safari/537.36',} 
 
postdata={
 '_xsrf': 'acab9d276ea217226d9cc94a84a231f7',
 'email': '',
 'password': '',
 'rememberme':'y'  
}
 
if not os.path.exists('myimg'):
  os.mkdir('myimg')
if os.path.exists('123.docx'):
  os.remove('123.docx')
if os.path.exists('checkcode.gif'):
  os.remove('checkcode.gif')
 
mydoc=Document()
questiontitle=''
#----------------------------------------------------------------------
def dealimg(imgcontent):
  soup=BeautifulSoup(imgcontent)
  try:
    for imglink in soup.findAll('img'):
      if imglink is not None :
        myimg= imglink.get('src')
        #print myimg
        if myimg.find('http')>=0:
          imgsrc=urllib2.urlopen(myimg).read()
          imgnamere=re.compile(r'http\S*/')
          imgname=imgnamere.sub('',myimg)
          #print imgname
          with open(u'myimg'+'/'+imgname,'wb') as code:
            code.write(imgsrc)
            mydoc.add_picture(u'myimg/'+imgname,width=Inches(1.25))
  except:
    pass
  strinfo=re.compile(r'<noscript>[\s\S]*</noscript>')
  imgcontent=strinfo.sub('',imgcontent)
  strinfo=re.compile(r'<img class[\s\S]*</>')
  imgcontent=strinfo.sub('',imgcontent)
  #show all
  strinfo=re.compile(r'<a class="toggle-expand[\s\S]*</a>')
  imgcontent=strinfo.sub('',imgcontent)
 
  strinfo=re.compile(r'<a class=" wrap external"[\s\S]*rel="nofollow noreferrer" target="_blank">')
  imgcontent=strinfo.sub('',imgcontent)
  imgcontent=imgcontent.replace('<i class="icon-external"></i></a>','')
 
 
  imgcontent=imgcontent.replace('</b>','').replace('</p>','').replace('<p>','').replace('<p>','').replace('<br>','')
  return imgcontent
   
 
 
 
 
def enterquestionpage(pageurl):
  html=urllib2.urlopen(pageurl).read()
  soup=BeautifulSoup(html)
  questiontitle=soup.title.string
  mydoc.add_heading(questiontitle,level=3)
  for div in soup.findAll('div',{'class':'fixed-summary zm-editable-content clearfix'}):
    #print div
    conent=str(div).replace('<div class="fixed-summary zm-editable-content clearfix">','').replace('</div>','')
     
    conent=conent.decode('utf-8')
    conent=conent.replace('<br/>','\n')
     
    conent=dealimg(conent)
    ###这一块弄得太复杂了 有时间找找看有没有处理html的模块
    conent=conent.replace('<div class="fixed-summary-mask">','').replace('<blockquote>','').replace('<b>','').replace('<strong>','').replace('</strong>','').replace('<em>','').replace('</em>','').replace('</blockquote>','')
    mydoc.add_paragraph(conent,style='BodyText3')
    """file=open('222.txt','a')
    file.write(str(conent))
    file.close()"""
     
 
def entercollectpage(pageurl):
  html=urllib2.urlopen(pageurl).read()
  soup=BeautifulSoup(html)
  for div in soup.findAll('div',{'class':'zm-item'}):
    h2content=div.find('h2',{'class':'zm-item-title'})
    #print h2content
    if h2content is not None:
      link=h2content.find('a')
      mylink=link.get('href')
      quectionlink='http://www.zhihu.com'+mylink
      enterquestionpage(quectionlink)
      print quectionlink    
 
 
 
def loginzhihu():
  postdatastr=urllib.urlencode(postdata)
  '''
  cj = cookielib.LWPCookieJar()
  cookie_support = urllib2.HTTPCookieProcessor(cj)
  opener = urllib2.build_opener(cookie_support,urllib2.HTTPHandler)
  urllib2.install_opener(opener)
  '''
  h = urllib2.urlopen(loginurl)
  request = urllib2.Request(loginurl,postdatastr,headers)
  request.get_origin_req_host
  response = urllib2.urlopen(request)
  #print response.geturl()
  text = response.read()
 
 
  collecturl='http://www.zhihu.com/collections'
  req=urllib2.urlopen(collecturl)
  if str(req.geturl())=='http://www.zhihu.com/?next=%2Fcollections':
    print 'login fail!'
    return
  txt=req.read()
 
  soup=BeautifulSoup(txt)
  count=0
  divs =soup.findAll('div',{'class':'zm-item'})
  if divs is None:
    print 'login fail!'
    return
  print 'login ok!\n'
  for div in divs:
     
    link=div.find('a')
    mylink=link.get('href')
    collectlink='http://www.zhihu.com'+mylink
    entercollectpage(collectlink)
    print collectlink
    #这儿是当时做测试用的,值获取一个收藏
    #count+=1
    #if count==1:
    #  return
     
 
def getcheckcode(thehtml):
  soup=BeautifulSoup(thehtml)
  div=soup.find('div',{'class':'js-captcha captcha-wrap'})
  if div is not None:
    #print div
    imgsrc=div.find('img')
    imglink=imgsrc.get('src')
    if imglink is not None:
      imglink='http://www.zhihu.com'+imglink
 
      imgcontent=urllib2.urlopen(imglink).read()
      with open('checkcode.gif','wb') as code:
        code.write(imgcontent)
      return True
    else:
      return False
  return False
 
 
if __name__=='__main__':
   
  import getpass
  username=raw_input('input username:')
  password=getpass.getpass('Enter password: ') 
   
  postdata['email']=username
  postdata['password']=password
  postdatastr=urllib.urlencode(postdata)
  cj = cookielib.LWPCookieJar()
  cookie_support = urllib2.HTTPCookieProcessor(cj)
  opener = urllib2.build_opener(cookie_support,urllib2.HTTPHandler)
  urllib2.install_opener(opener)
 
  h = urllib2.urlopen(loginurl)
  request = urllib2.Request(loginurl,postdatastr,headers)
  response = urllib2.urlopen(request)
  txt = response.read()
 
  if getcheckcode(txt):
    checkcode=raw_input('input checkcode:')
    postdata['captcha']=checkcode
    loginzhihu()
    mydoc.save('123.docx')
  else:
    loginzhihu()
    mydoc.save('123.docx')
 
  print 'the end'
  raw_input()

好了,大概就是这样,大家如果有什么好的建议或者什么的可以再下面留言,我会尽快回复的.或者在小站的关于页面有我的联系方式,直接联系我就ok.

python实现登陆知乎获得个人收藏并保存为word文件

- Author -

junjie

声明：登载此文出于传递更多信息之目的，并不意味着赞同其观点或证实其描述。

Python 相关文章推荐

Python字符和字符值(ASCII或Unicode码值)转换方法

May 21 Python

Python端口扫描简单程序

Nov 10 Python

Python实现变量数值交换及判断数组是否含有某个元素的方法

Sep 18 Python

Python3学习笔记之列表方法示例详解

Oct 06 Python

python中模块的__all__属性详解

Oct 26 Python

Python matplotlib画图实例之绘制拥有彩条的图表

Dec 28 Python

python 求10个数的平均数实例

Dec 16 Python

Django 解决阿里云部署同步数据库报错的问题

May 14 Python

Python如何对齐字符串

Jul 30 Python

基于python实现简单C/S模式代码实例

Sep 14 Python

详解Scrapy Redis入门实战

Nov 18 Python

Python 无限级分类树状结构生成算法的实现

Jan 21 Python

Python标准库urllib2的一些使用细节总结

Mar 16 #Python

python实现查询苹果手机维修进度

Mar 16 #Python

python让图片按照exif信息里的创建时间进行排序的方法

Mar 16 #Python

python实现简单的计时器功能函数

Mar 14 #Python

python将图片文件转换成base64编码的方法

Mar 14 #Python

python在Windows8下获取本机ip地址的方法

Mar 14 #Python

python检测远程端口是否打开的方法

Mar 14 #Python

You might like

php入门学习知识点一 PHP与MYSql连接与查询

2011/07/14 PHP

ThinkPHP框架里隐藏index.php

2016/04/12 PHP

PHP 将数组打乱 shuffle函数的用法及简单实例

2016/06/17 PHP

PHP Socket网络操作类定义与用法示例

2017/08/30 PHP

ecshop添加菜单及权限分配问题

2017/11/21 PHP

PHP 加密 Password Hashing API基础知识点

2020/03/02 PHP

JS实现悬浮移动窗口(悬浮广告)的特效

2013/03/12 Javascript

千分位数字格式化(用逗号隔开代码已做了修改支持0-9位逗号隔开)的JS代码

2013/12/05 Javascript

jquery插件jTimer(jquery定时器)使用方法

2013/12/23 Javascript

JavaScript中的定时器之Item23的合理使用

2015/10/30 Javascript

基于JS实现PHP的sprintf函数实例

2015/11/14 Javascript

javascript实现uploadify上传格式以及个数限制

2015/11/23 Javascript

实例解析jQuery插件EasyUI最常用的表单验证规则

2015/11/29 Javascript

JS实现弹出居中的模式窗口示例

2016/06/20 Javascript

vue.js初学入门教程（1）

2016/11/03 Javascript

javascript自执行函数

2017/02/10 Javascript

JavaScript防止全局变量污染的方法总结

2018/08/02 Javascript

js canvas实现红包照片效果

2018/08/21 Javascript

vue iview实现动态新增和删除

2020/06/17 Javascript

JS代码简洁方式之函数方法详解

2020/07/28 Javascript

go语言计算两个时间的时间差方法

2015/03/13 Python

浅谈python数据类型及类型转换

2017/12/18 Python

详解python和matlab的优势与区别

2019/06/28 Python

TensorFlow tf.nn.softmax_cross_entropy_with_logits的用法

2020/04/19 Python

Spark处理数据排序问题如何避免OOM

2020/05/21 Python

如何用Python 加密文件

2020/09/10 Python

详解CSS3+JS完美实现放大镜模式

2020/12/03 HTML / CSS

兰蔻加拿大官方网站：Lancome加拿大

2016/08/05 全球购物

名人珠宝设计师：Melinda Maria Jewelry

2019/03/06 全球购物

利用指针变量实现队列的入队操作

2012/04/07 面试题

大学生学习生活的自我评价

2013/11/01 职场文书

美国探亲签证邀请信

2014/02/05 职场文书

男女朋友协议书

2014/04/23 职场文书

2015年幼儿园班主任工作总结

2015/05/12 职场文书

2019年作为一名实习生的述职报告

2019/09/29 职场文书

Redis 常见使用场景

2021/08/30 Redis