python 多线程爬取壁纸网站的示例


Posted in Python onFebruary 20, 2021

基本开发环境

· Python 3.6

· Pycharm

需要导入的库

python 多线程爬取壁纸网站的示例

目标网页分析

python 多线程爬取壁纸网站的示例

网站是静态网站,没有加密,可以直接爬取

python 多线程爬取壁纸网站的示例

python 多线程爬取壁纸网站的示例

python 多线程爬取壁纸网站的示例

整体思路:

1、先在列表页面获取每张壁纸的详情页地址

2、在壁纸详情页面获取壁纸真实高清url地址

3、保存地址

代码实现

模拟浏览器请请求网页,获取网页数据

 python 多线程爬取壁纸网站的示例

这里只选择爬取前10页的数据

代码如下

import threading
import parsel
import requests

def get_html(html_url):
 '''
 获取网页源代码
 :param html_url: 网页url
 :return:
 '''
 response = requests.get(url=html_url, headers=headers)
 return response


def get_par(html_data):
 '''
 把 response.text 转换成 selector 对象 解析提取数据
 :param html_data: response.text
 :return: selector 对象
 '''
 selector = parsel.Selector(html_data)
 return selector

def download(img_url, title):
 '''
 保存数据
 :param img_url: 图片地址
 :param title: 图片标题
 :return:
 '''
 content = get_html(img_url).content
 path = '壁纸\\' + title + '.jpg'
 with open(path, mode='wb') as f:
  f.write(content)
  print('正在保存', title)

def main(url):
 '''
 主函数
 :param url: 列表页面 url
 :return:
 '''
 html_data = get_html(url).text
 selector = get_par(html_data)
 lis = selector.css('.wb_listbox div dl dd a::attr(href)').getall()
 for li in lis:
  img_data = get_html(li).text
  img_selector = get_par(img_data)
  img_url = img_selector.css('.wb_showpic_main img::attr(src)').get()
  title = img_selector.css('.wb_pictitle::text').get().strip()
  download(img_url, title)
 end_time = time.time() - s_time
 print(end_time)

if __name__ == '__main__':
 for page in range(1, 11):
  url = 'http://www.deskbizhi.com/min/list-{}.html'.format(page)
  main_thread = threading.Thread(target=main, args=(url,))
  main_thread.start()

以上就是python 多线程爬取壁纸网站的示例的详细内容,更多关于python 爬取壁纸网站的资料请关注三水点靠木其它相关文章!

Python 相关文章推荐
Python与Java间Socket通信实例代码
Mar 06 Python
Python遍历某目录下的所有文件夹与文件路径
Mar 15 Python
Python文本统计功能之西游记用字统计操作示例
May 07 Python
实践Vim配置python开发环境
Jul 02 Python
Python 判断图像是否读取成功的方法
Jan 26 Python
解决django的template中如果无法引用MEDIA_URL问题
Apr 07 Python
Python3之外部文件调用Django程序操作model等文件实现方式
Apr 07 Python
Pycharm中安装wordcloud等库失败问题及终端通过pip安装的Python库如何添加到Pycharm解释器中(推荐)
May 10 Python
PyCharm2019.3永久激活破解详细图文教程,亲测可用(不定期更新)
Oct 29 Python
python语言time库和datetime库基本使用详解
Dec 25 Python
用Python实现职工信息管理系统
Dec 30 Python
python用700行代码实现http客户端
Jan 14 Python
python 制作网站小说下载器
Feb 20 #Python
如何用python爬取微博热搜数据并保存
Feb 20 #Python
python 统计list中各个元素出现的次数的几种方法
Feb 20 #Python
pandas统计重复值次数的方法实现
Feb 20 #Python
pandas 按日期范围筛选数据的实现
Feb 20 #Python
基于Python-Pycharm实现的猴子摘桃小游戏(源代码)
Feb 20 #Python
pandas按条件筛选数据的实现
Feb 20 #Python
You might like
短波的认识
2021/03/01 无线电
大家未必知道的Js技巧收藏
2008/04/07 Javascript
PNG背景在不同浏览器下的应用
2009/06/22 Javascript
JS 有名函数表达式全面解析
2010/03/19 Javascript
javaScript同意等待代码实现心得
2011/01/01 Javascript
JS上传图片前实现图片预览效果的方法
2015/03/02 Javascript
JS实现自动固定顶部的悬浮菜单栏效果
2015/09/16 Javascript
JavaScript子窗口调用父窗口变量和函数的方法
2015/10/09 Javascript
深入浅析JSON.parse()、JSON.stringify()和eval()的作用详解
2016/04/03 Javascript
JS实现获取剪贴板内容的方法
2016/06/21 Javascript
基于jQuery实现淡入淡出效果轮播图
2020/07/31 Javascript
超详细的JS弹出窗口代码大全
2020/04/18 Javascript
js基础之DOM中document对象的常用属性方法详解
2016/10/28 Javascript
js实现日历的简单算法
2017/01/24 Javascript
解决微信内置浏览器返回上一页强制刷新问题方法
2017/02/05 Javascript
vue-router+vuex addRoutes实现路由动态加载及菜单动态加载
2017/09/28 Javascript
浅谈在vue项目中如何定义全局变量和全局函数
2017/10/24 Javascript
Angular4 ElementRef的应用
2018/02/26 Javascript
JS实现页面鼠标点击出现图片特效
2020/08/19 Javascript
python统计字母、空格、数字等字符个数的实例
2018/06/29 Python
Python实现二维曲线拟合的方法
2018/12/29 Python
对Python多线程读写文件加锁的实例详解
2019/01/14 Python
python 实现视频 图像帧提取
2019/12/10 Python
django多种支付、并发订单处理实例代码
2019/12/13 Python
pytorch 实现在一个优化器中设置多个网络参数的例子
2020/02/20 Python
python实现俄罗斯方块小游戏
2020/04/24 Python
GAP欧盟网上商店:GAP EU
2016/09/13 全球购物
Nordgreen手表德国官方网站:丹麦极简主义手表
2019/10/31 全球购物
DOUGLAS荷兰:购买香水和化妆品
2020/10/24 全球购物
C语言50道问题
2014/10/23 面试题
老干部工作先进集体事迹材料
2014/05/21 职场文书
通知的写法
2015/04/23 职场文书
保护校园环境倡议书
2015/04/28 职场文书
酒桌上的祝酒词
2015/08/12 职场文书
python 命令行传参方法总结
2021/05/25 Python
MySQL注入基础练习
2021/05/30 MySQL