Python使用xpath实现图片爬取


Posted in Python onSeptember 16, 2020

高性能异步爬虫

目的:在爬虫中使用异步实现高性能的数据爬取操作

异步爬虫的方式:

- 多线程、多进程(不建议):

好处:可以为相关阻塞的操作单独开启多线程或进程,阻塞操作就可以异步执行;

弊端:无法无限制的开启多线程或多进程。

- 线程池、进程池(适当的使用):

好处:我们可以降低系统对进程或线程创建和销毁的一个频率,从而很好的降低系统的开销;

弊端:池中线程或进程的数据是有上限的。

代码如下

# _*_ coding:utf-8 _*_
"""
@FileName  :6.4k图片解析爬取(异步高性能测试).py
@CreateTime :2020/8/14 0014 10:01
@Author   : Lurker Zhang
@E-mail   : 289735192@qq.com
@Desc.   :
"""

import requests
from lxml import etree
from setting.config import *
import json
import os
import time
from multiprocessing.dummy import Pool


def main():
  # 图片采集源地址
  # source_url = 'http://pic.netbian.com/4kmeinv/'
  # temp_url = 'http://pic.netbian.com/4kmeinv/index_{}.html'
  # source_url = 'http://pic.netbian.com/4kdongman/'
  # temp_url = 'http://pic.netbian.com/4kdongman/index_{}.html'
  source_url = 'http://pic.netbian.com/4kmingxing/'
  temp_url = 'http://pic.netbian.com/4kmingxing/index_{}.html'
  # 本此采集前多少页,大于1的整数
  page_sum = 136
  all_pic_list_url = []
  if page_sum == 1:
    pic_list_url = source_url
    print('开始下载:' + pic_list_url)
    all_pic_list_url.append(pic_list_url)
  else:
    # 先采集第一页
    pic_list_url = source_url
    # 调用采集单页图片链接的函数
    all_pic_list_url.append(pic_list_url)
    # 再采集第二页开始后面的页数
    for page_num in range(2, page_sum + 1):
      pic_list_url = temp_url.format(page_num)
      all_pic_list_url.append(pic_list_url)
  # 单页图片多线程解析
  pool1 = Pool(10)
  pool1.map(down_pic, all_pic_list_url)

  print('采集完成,本地成功下载{0}张图片,失败{1}张图片。'.format(total_success, total_fail))
  # 存储已下载文件名列表:
  with open("../depository/mingxing/pic_name_list.json", 'w', encoding='utf-8') as fp:
    json.dump(pic_name_list, fp)


def down_pic(pic_list_url):
  print("准备解析图片列表页:",pic_list_url)
  # 获取图片列表页的网页数据
  pic_list_page_text = requests.get(url=pic_list_url, headers=headers).text
  tree_1 = etree.HTML(pic_list_page_text)
  # 获取图片地址列表
  pic_show_url_list = tree_1.xpath('//div[@class="slist"]/ul//a/@href')
  pic_url_list = [get_pic_url('http://pic.netbian.com' + pic_show_url) for pic_show_url in pic_show_url_list]

  # 开始下载并保存图片(多线程)
  pool2 = Pool(5)
  pool2.map(save_pic, pic_url_list)


def save_pic(pic_url):
  print("准备下载图片:",pic_url)
  global total_success, total_fail, pic_name_list,path
  picname = get_pic_name(pic_url)
  if not picname in pic_name_list:
    # 获取日期作为保存位置文件夹

    pic = requests.get(url=pic_url, headers=headers).content
    try:
      with open(path + picname, 'wb') as fp:
        fp.write(pic)
    except IOError:
      print(picname + "保存失败")
      total_fail += 1
    else:
      pic_name_list.append(picname)
      total_success += 1
      print("成功保存图片:{0},共成功采集{1}张。".format(picname, total_success))

  else:
    print("跳过,已下载过图片:" + picname)
    total_fail += 1


def get_pic_name(pic_url):
  return pic_url.split('/')[-1]


def get_pic_url(pic_show_url):
  tree = etree.HTML(requests.get(url=pic_show_url, headers=headers).text)
  return 'http://pic.netbian.com/' + tree.xpath('//div[@class="photo-pic"]/a/img/@src')[0]


if __name__ == '__main__':
  # 读入已采集图片的名称库,名称存在重复的表示已经采集过将跳过不采集
  if not os.path.exists('../depository/mingxing/pic_name_list.json'):
    with open("../depository/mingxing/pic_name_list.json", 'w', encoding="utf-8") as fp:
      json.dump([], fp)
  with open("../depository/mingxing/pic_name_list.json", "r", encoding="utf-8") as fp:
    pic_name_list = json.load(fp)
  path = '../depository/mingxing/' + time.strftime('%Y%m%d', time.localtime()) + '/'
  if not os.path.exists(path):
    os.mkdir(path)
  # 记录本次采集图片的数量
  total_success = 0
  total_fail = 0
  main()

以上就是本文的全部内容,希望对大家的学习有所帮助,也希望大家多多支持三水点靠木。

Python 相关文章推荐
Python去除字符串两端空格的方法
May 21 Python
Python减少循环层次和缩进的技巧分析
Mar 15 Python
python交互式图形编程实例(一)
Nov 17 Python
Tensorflow实现卷积神经网络用于人脸关键点识别
Mar 05 Python
python学生信息管理系统
Mar 13 Python
利用Anaconda简单安装scrapy框架的方法
Jun 13 Python
python sort、sort_index方法代码实例
Mar 28 Python
PyQt5显示GIF图片的方法
Jun 17 Python
Python数据可视化:泊松分布详解
Dec 07 Python
jupyter notebook参数化运行python方式
Apr 10 Python
详解java调用python的几种用法(看这篇就够了)
Dec 10 Python
python 录制系统声音的示例
Dec 21 Python
Python自动创建Excel并获取内容
Sep 16 #Python
python如何实时获取tcpdump输出
Sep 16 #Python
基于python实现复制文件并重命名
Sep 16 #Python
详解python程序中的多任务
Sep 16 #Python
python实现简单的tcp 文件下载
Sep 16 #Python
实现Python3数组旋转的3种算法实例
Sep 16 #Python
Python私有属性私有方法应用实例解析
Sep 15 #Python
You might like
绿山咖啡和蓝山咖啡
2021/03/04 新手入门
PHP 5.3新特性命名空间规则解析及高级功能
2010/03/11 PHP
php GeoIP的使用教程
2011/03/09 PHP
PHP PDOStatement:bindParam插入数据错误问题分析
2013/11/13 PHP
[原创]PHP简单开启curl的方法(测试可行)
2016/01/11 PHP
php微信公众号开发之关键词回复
2018/10/20 PHP
基于jquery的拖动布局插件
2011/11/25 Javascript
js自定义事件及事件交互原理概述(一)
2013/02/01 Javascript
jQuery 文本框得失焦点的简单实例
2014/02/19 Javascript
Javascript中实现String.startsWith和endsWith方法
2015/06/10 Javascript
AngularJS 最常用的功能汇总
2016/02/17 Javascript
JQuery 的跨域方法推荐_可跨任何网站
2016/05/18 Javascript
Vue.js每天必学之指令系统与自定义指令
2016/09/07 Javascript
javascript 判断是否是微信浏览器的方法
2016/10/09 Javascript
Javascript 实现计算器时间功能详解及实例(二)
2017/01/08 Javascript
vue+egg+jwt实现登录验证的示例代码
2019/05/18 Javascript
浅析Vue 中的 render 函数
2020/02/28 Javascript
微信小程序实现抖音播放效果的实例代码
2020/04/11 Javascript
react 原生实现头像滚动播放的示例
2020/04/21 Javascript
[55:04]海涛DOTA2死魂复燃6.82版本介绍
2014/09/28 DOTA
浅谈python类属性的访问、设置和删除方法
2016/07/25 Python
Python快速查找list中相同部分的方法
2018/06/27 Python
Python datetime包函数简单介绍
2019/08/28 Python
Python3.7基于hashlib和Crypto实现加签验签功能(实例代码)
2019/12/04 Python
pytorch使用tensorboardX进行loss可视化实例
2020/02/24 Python
Python远程linux执行命令实现
2020/11/11 Python
德国高品质男装及配饰商城:Cultizm(Raw Denim原色牛仔裤)
2018/04/16 全球购物
澳大利亚婴儿、幼儿和儿童在线设计师商店:Smooch Baby
2019/02/16 全球购物
屈臣氏俄罗斯在线商店:Watsons俄罗斯
2020/08/03 全球购物
教师应聘个人求职信
2013/12/10 职场文书
司机工作自我鉴定
2014/09/19 职场文书
2014年幼儿园教师工作总结
2014/11/08 职场文书
中学推普周活动总结
2015/05/07 职场文书
2016年公司新年寄语
2015/08/17 职场文书
党风廉政承诺书2016
2016/03/25 职场文书
java固定大小队列的几种实现方式详解
2021/07/15 Java/Android