【Python】Python的urllib模块、urllib2模块批量进行网页下载文件


Posted in Python onNovember 19, 2016

由于需要从某个网页上下载一些PDF文件,但是需要下载的PDF文件有几百个,所以不可能用人工点击来下载。正好Python有相关的模块,所以写了个程序来进行PDF文件的下载,顺便熟悉了Python的urllib模块和ulrllib2模块。

1、问题描述

需要从http://www.cvpapers.com/cvpr2014.html上下载几百个论文的PDF文件,该网页如下图所示:【Python】Python的urllib模块、urllib2模块批量进行网页下载文件

2、问题解决

通过结合Python的urllib模块和urllib2模块来实现自动下载。代码如下:

test.py

#!/usr/bin/python 
# -*- coding:utf-8 -*- 
 
import urllib              #导入urllib模块 
import urllib2             #导入urllib2模块 
import re               #导入正则表达式模块:re模块 
 
def getPDFFromNet(inputURL): 
  req = urllib2.Request(inputURL) 
  f = urllib2.urlopen(req)         #打开网页 
  localDir = 'E:\downloadPDF\\'        #下载PDF文件需要存储在本地的文件夹 
  urlList = []            #用来存储提取的PDF下载的url的列表 
  for eachLine in f:          #遍历网页的每一行 
    line = eachLine.strip()       #去除行首位的空格,习惯性写法 
    if re.match('.*PDF.*', line):      #去匹配含有“PDF”字符串的行,只有这些行才有PDF下载地址 
      wordList = line.split('\"')    #以"为分界,将该行分开,这样就将url地址单独分开了 
      for word in wordList:      #遍历每个字符串 
        if re.match('.*\.pdf$', word): #去匹配含有“.pdf”的字符串,只有url中才有 
          urlList.append(word)  #将提取的url存入列表 
  for everyURL in urlList:         #遍历列表的每一项,即每一个PDF的url 
    wordItems = everyURL.split('/')     #将url以/为界进行划分,为了提取该PDF文件名 
    for item in wordItems:       #遍历每个字符串 
      if re.match('.*\.pdf$', item):   #查找PDF的文件名 
        PDFName = item     #查找到PDF文件名 
    localPDF = localDir + PDFName      #将本地存储目录和需要提取的PDF文件名进行连接 
    try:            
      urllib.urlretrieve(everyURL, localPDF) #按照url进行下载,并以其文件名存储到本地目录 
    except Exception,e: 
      continue 
 
getPDFFromNet('http://www.cvpapers.com/cvpr2014.html')

注意:

(1)第1、6、8、23行分别多谢了一个“\”来进行转义;

(2)第27行的urlretrieve函数有3个参数:第一个参数就是目标url;第二个参数是保存的文件绝对路径(含文件名),该函数的返回值是一个tuple(filename,header),其中的filename就是第二个参数filename。如果urlretrieve仅提供1个参数,返回值的filename就是产生的临时文件名,函数执行完毕后该临时文件会被删除参数。第3个参数是一个回调函数,当连接上服务器、以及相应的数据块传输完毕的时候会触发该回调。其中回调函数名称可任意,但是参数必须为三个。一般直接使用reporthook(block_read,block_size,total_size)定义回调函数,block_size是每次读取的数据块的大小,block_read是每次读取的数据块个数,taotal_size是一一共读取的数据量,单位是byte。可以使用reporthook函数来显示读取进度。
如果想显示读取进度,则可以讲第三个参数加上,将上述程序第27行改为如下:

urllib.urlretrieve(everyURL, localPDF, reporthook=reporthook)

而reporthook回调函数的代码如下:

def reporthook(block_read,block_size,total_size): 
 if not block_read: 
 print "connection opened"; 
 return 
 if total_size<0: 
 #unknown size 
 print "read %d blocks (%dbytes)" %(block_read,block_read*block_size); 
 else: 
 amount_read=block_read*block_size; 
 print 'Read %d blocks,or %d/%d' %(block_read,block_read*block_size,total_size);

综上所述,这就是一个简单的从网页抓取数据、下载文件的小程序,希望对正在学习Python的同学有帮助。谢谢!

Python 相关文章推荐
Python获取暗黑破坏神3战网前1000命位玩家的英雄技能统计
Jul 04 Python
Python中矩阵库Numpy基本操作详解
Nov 21 Python
Django 多语言教程的实现(i18n)
Jul 07 Python
PyQt5实现从主窗口打开子窗口的方法
Jun 19 Python
python禁用键鼠与提权代码实例
Aug 16 Python
python实现微信小程序用户登录、模板推送
Aug 28 Python
Python 最强编辑器详细使用指南(PyCharm )
Sep 16 Python
Python帮你识破双11的套路
Nov 11 Python
python 爬虫爬取京东ps4售卖情况
Dec 18 Python
pytorch下的unsqueeze和squeeze的用法说明
Feb 06 Python
七个非常实用的Python工具包总结
Jun 15 Python
python前后端自定义分页器
Apr 13 Python
Python基础中所出现的异常报错总结
Nov 19 #Python
轻松掌握python设计模式之策略模式
Nov 18 #Python
轻松掌握python设计模式之访问者模式
Nov 18 #Python
Win10下Python环境搭建与配置教程
Nov 18 #Python
Python Paramiko模块的安装与使用详解
Nov 18 #Python
Python数据分析之真实IP请求Pandas详解
Nov 18 #Python
Python切换pip安装源的方法详解
Nov 18 #Python
You might like
php生成缩略图的类代码
2008/10/02 PHP
php PDO判断连接是否可用的实现方法
2017/04/03 PHP
Laravel 5使用Laravel Excel实现Excel/CSV文件导入导出的功能详解
2017/10/11 PHP
php闭包中使用use声明变量的作用域实例分析
2018/08/09 PHP
php生成随机数/生成随机字符串的方法小结【5种方法】
2020/05/27 PHP
用javascript替换URL中的参数值示例代码
2014/01/27 Javascript
jQuery中nextAll()方法用法实例
2015/01/07 Javascript
浅谈Javascript中的12种DOM节点类型
2016/08/19 Javascript
jQuery内容过滤选择器用法示例
2016/09/09 Javascript
Nodejs 搭建简单的Web服务器详解及实例
2016/11/30 NodeJs
vue动态路由实现多级嵌套面包屑的思路与方法
2017/08/16 Javascript
推荐VSCode 上特别好用的 Vue 插件之vetur
2017/09/14 Javascript
Javascript中将变量转换为字符串的三种方法
2017/09/19 Javascript
Vuex 使用及简单实例(计数器)
2018/08/29 Javascript
脚手架vue-cli工程webpack的作用和特点
2018/09/29 Javascript
vue如何获取自定义元素属性参数值的方法
2019/05/14 Javascript
Vue.js暴露方法给WebView的使用操作
2020/09/07 Javascript
python编写暴力破解FTP密码小工具
2014/11/19 Python
Python实现单词拼写检查
2015/04/25 Python
Python解决八皇后问题示例
2018/04/22 Python
pandas Dataframe行列读取的实例
2018/06/08 Python
Python通过Tesseract库实现文字识别
2020/03/05 Python
基于python代码批量处理图片resize
2020/06/04 Python
一篇文章搞懂python的转义字符及用法
2020/09/03 Python
python能做哪些生活有趣的事情
2020/09/09 Python
Allsole美国/加拿大:英国一家专门出售品牌鞋子的网站
2018/10/21 全球购物
Tessabit美国:集世界奢侈品和设计师品牌的意大利精品买手店
2020/06/29 全球购物
迪士尼法国在线商店:shopDisney FR
2020/12/03 全球购物
五年后的职业生涯规划
2014/03/04 职场文书
2014年教师思想工作总结
2014/12/03 职场文书
拾金不昧感谢信
2015/01/21 职场文书
万能检讨书开头与结尾怎么写
2015/02/17 职场文书
幼儿园亲子活动通知
2015/04/24 职场文书
大学考试作弊检讨书
2015/05/06 职场文书
2016年“六一儿童节”校园广播稿
2015/12/17 职场文书
学习习近平主席讲话心得体会
2016/01/20 职场文书