Python爬虫——爬取豆瓣电影Top250代码实例


Posted in Python onApril 17, 2019

利用python爬取豆瓣电影Top250的相关信息,包括电影详情链接,图片链接,影片中文名,影片外国名,评分,评价数,概况,导演,主演,年份,地区,类别这12项内容,然后将爬取的信息写入Excel表中。基本上爬取结果还是挺好的。具体代码如下:

#!/usr/bin/python
#-*- coding: utf-8 -*-
import sys
reload(sys)
sys.setdefaultencoding('utf8')
from bs4 import BeautifulSoup
import re
import urllib2
import xlwt

#得到页面全部内容
def askURL(url):
  request = urllib2.Request(url)#发送请求
  try:
    response = urllib2.urlopen(request)#取得响应
    html= response.read()#获取网页内容
    #print html
  except urllib2.URLError, e:
    if hasattr(e,"code"):
      print e.code
    if hasattr(e,"reason"):
      print e.reason
  return html

#获取相关内容
def getData(baseurl):
  findLink=re.compile(r'<a href="(.*?)" rel="external nofollow" >')#找到影片详情链接
  findImgSrc=re.compile(r'<img.*src="(.*jpg)"',re.S)#找到影片图片
  findTitle=re.compile(r'<span class="title">(.*)</span>')#找到片名
  #找到评分
  findRating=re.compile(r'<span class="rating_num" property="v:average">(.*)</span>')
  #找到评价人数
  findJudge=re.compile(r'<span>(\d*)人评价</span>')
  #找到概况
  findInq=re.compile(r'<span class="inq">(.*)</span>')
  #找到影片相关内容:导演,主演,年份,地区,类别
  findBd=re.compile(r'<p class="">(.*?)</p>',re.S)
  #去掉无关内容
  remove=re.compile(r'              |\n|</br>|\.*')
  datalist=[]
  for i in range(0,10):
    url=baseurl+str(i*25)
    html=askURL(url)
    soup = BeautifulSoup(html, "html.parser")
    for item in soup.find_all('div',class_='item'):#找到每一个影片项
      data=[]
      item=str(item)#转换成字符串
      #print item
      link=re.findall(findLink,item)[0]
      data.append(link)#添加详情链接
      imgSrc=re.findall(findImgSrc,item)[0]
      data.append(imgSrc)#添加图片链接
      titles=re.findall(findTitle,item)
      #片名可能只有一个中文名,没有外国名
      if(len(titles)==2):
        ctitle=titles[0]
        data.append(ctitle)#添加中文片名
        otitle=titles[1].replace(" / ","")#去掉无关符号
        data.append(otitle)#添加外国片名
      else:
        data.append(titles[0])#添加中文片名
        data.append(' ')#留空
      rating=re.findall(findRating,item)[0]
      data.append(rating)#添加评分
      judgeNum=re.findall(findJudge,item)[0]
      data.append(judgeNum)#添加评论人数
      inq=re.findall(findInq,item)
      #可能没有概况
      if len(inq)!=0:
        inq=inq[0].replace("。","")#去掉句号
        data.append(inq)#添加概况
      else:
        data.append(' ')#留空
      bd=re.findall(findBd,item)[0]
      bd=re.sub(remove,"",bd)
      bd=re.sub('<br>'," ",bd)#去掉<br>
      bd=re.sub('/'," ",bd)#替换/
      #data.append(bd)
      words=bd.split(" ")
      for s in words:
        if len(s)!=0 and s!=' ':#去掉空白内容
           data.append(s)
      #主演有可能因为导演内容太长而没有
      if(len(data)!=12):
        data.insert(8,' ')#留空
      datalist.append(data)
  return datalist

#将相关数据写入excel中
def saveData(datalist,savepath):
  book=xlwt.Workbook(encoding='utf-8',style_compression=0)
  sheet=book.add_sheet('豆瓣电影Top250',cell_overwrite_ok=True)
  col=('电影详情链接','图片链接','影片中文名','影片外国名',
        '评分','评价数','概况','导演','主演','年份','地区','类别')
  for i in range(0,12):
    sheet.write(0,i,col[i])#列名
  for i in range(0,250):
    data=datalist[i]
    for j in range(0,12):
      sheet.write(i+1,j,data[j])#数据
  book.save(savepath)#保存

def main():
  baseurl='https://movie.douban.com/top250?start='
  datalist=getData(baseurl)
  savapath=u'豆瓣电影Top250.xlsx'
  saveData(datalist,savapath)

main()

Excel表部分内容如下:

Python爬虫——爬取豆瓣电影Top250代码实例

以上所述是小编给大家介绍的Python爬取豆瓣电影Top250实例详解整合,希望对大家有所帮助,如果大家有任何疑问请给我留言,小编会及时回复大家的。在此也非常感谢大家对三水点靠木网站的支持!

Python 相关文章推荐
python中使用OpenCV进行人脸检测的例子
Apr 18 Python
python实现复制整个目录的方法
May 12 Python
Python连接PostgreSQL数据库的方法
Nov 28 Python
python3中int(整型)的使用教程
Mar 23 Python
python爬取w3shcool的JQuery课程并且保存到本地
Apr 06 Python
python如何生成网页验证码
Jul 28 Python
详解python--模拟轮盘抽奖游戏
Apr 12 Python
PyCharm-错误-找不到指定文件python.exe的解决方法
Jul 01 Python
Django通过dwebsocket实现websocket的例子
Nov 15 Python
python3注册全局热键的实现
Mar 22 Python
如何更换python默认编辑器的背景色
Aug 10 Python
如何在Anaconda中打开python自带idle
Sep 21 Python
Python2与Python3的区别实例总结
Apr 17 #Python
详解Python用户登录接口的方法
Apr 17 #Python
详解python中递归函数
Apr 16 #Python
python学习--使用QQ邮箱发送邮件代码实例
Apr 16 #Python
详解Python连接MySQL数据库的多种方式
Apr 16 #Python
详解Python学习之安装pandas
Apr 16 #Python
不归路系列:Python入门之旅-一定要注意缩进!!!(推荐)
Apr 16 #Python
You might like
各种战术和打法的原创者
2020/03/04 星际争霸
PHP+Ajax异步通讯实现用户名邮箱验证是否已注册( 2种方法实现)
2011/12/28 PHP
浅析PHP页面局部刷新功能的实现小结
2013/06/21 PHP
php使用cookie实现记住登录状态
2015/04/27 PHP
深入理解PHP之源码目录结构与功能说明
2016/06/01 PHP
文本框回车提交与禁止提交示例
2013/09/27 Javascript
JS获取文本框,下拉框,单选框的值的简单实例
2014/02/26 Javascript
原生JavaScript+LESS实现瀑布流
2014/12/12 Javascript
浅谈javascript中基本包装类型
2015/06/03 Javascript
详解JavaScript树结构
2017/01/09 Javascript
Jquery根据浏览器窗口改变调整大小的方法
2017/02/07 Javascript
使用gulp搭建本地服务器并实现模拟ajax
2017/04/05 Javascript
iOS + node.js使用Socket.IO框架进行实时通信示例
2017/04/14 Javascript
angular 用拦截器统一处理http请求和响应的方法
2017/06/08 Javascript
nodejs body-parser 解析post数据实例
2017/07/26 NodeJs
Vue组件简易模拟实现购物车
2020/12/21 Vue.js
python笔记(2)
2012/10/24 Python
Django中实现一个高性能计数器(Counter)实例
2014/07/09 Python
go语言计算两个时间的时间差方法
2015/03/13 Python
python使用reportlab实现图片转换成pdf的方法
2015/05/22 Python
Python爬虫辅助利器PyQuery模块的安装使用攻略
2016/04/24 Python
Python基于贪心算法解决背包问题示例
2017/11/27 Python
简单了解Python生成器是什么
2019/07/02 Python
pycharm运行scrapy过程图解
2019/11/22 Python
python实现视频读取和转化图片
2019/12/10 Python
如何利用Python 进行边缘检测
2020/10/14 Python
python 实现端口扫描工具
2020/12/18 Python
Python 带星号(* 或 **)的函数参数详解
2021/02/23 Python
css3中background新增的4个新的相关属性用法介绍
2013/09/26 HTML / CSS
LN-CC英国:伦敦时尚生活的缩影
2019/09/01 全球购物
乔布斯斯坦福大学演讲稿
2014/05/23 职场文书
签约仪式策划方案
2014/06/02 职场文书
党的群众路线教育实践活动个人对照检查材料
2014/09/22 职场文书
车辆安全隐患排查制度
2015/08/05 职场文书
2016大学生入党积极分子心得体会
2016/01/06 职场文书
深入理解go slice结构
2021/09/15 Golang