编程 Python

python面向对象多线程爬虫爬取搜狐页面的实例代码

Posted in Python onMay 31, 2018

首先我们需要几个包：requests, lxml, bs4, pymongo, redis

1. 创建爬虫对象，具有的几个行为：抓取页面，解析页面，抽取页面，储存页面

class Spider(object):
 def __init__(self):
  # 状态(是否工作)
  self.status = SpiderStatus.IDLE
 # 抓取页面
 def fetch(self, current_url):
  pass
 # 解析页面
 def parse(self, html_page):
  pass
 # 抽取页面
 def extract(self, html_page):
  pass
 # 储存页面
 def store(self, data_dict):
  pass

2. 设置爬虫属性，没有在爬取和在爬取中，我们用一个类封装， @unique使里面元素独一无二，Enum和unique需要从 enum里面导入：

@unique
class SpiderStatus(Enum):
 IDLE = 0
 WORKING = 1

3. 重写多线程的类：

class SpiderThread(Thread):
 def __init__(self, spider, tasks):
  super().__init__(daemon=True)
  self.spider = spider
  self.tasks = tasks
 def run(self):
  while True:
   pass

4. 现在爬虫的基本结构已经做完了，在main函数创建tasks， Queue需要从queue里面导入：

def main():
 # list没有锁，所以使用Queue比较安全, task_queue=[]也可以使用,Queue 是先进先出结构, 即 FIFO
 task_queue = Queue()
 # 往队列放种子url, 即搜狐手机端的url
 task_queue.put('http://m.sohu,com/')
 # 指定起多少个线程
 spider_threads = [SpiderThread(Spider(), task_queue) for _ in range(10)]
 for spider_thread in spider_threads:
  spider_thread.start()
 # 控制主线程不能停下,如果队列里有东西，任务不能停, 或者spider处于工作状态，也不能停
 while task_queue.empty() or is_any_alive(spider_threads):
  pass
 print('Over')

4-1. 而 is_any_threads则是判断线程里是否有spider还活着，所以我们再写一个函数来封装一下:

def is_any_alive(spider_threads):
 return any([spider_thread.spider.status == SpiderStatus.WORKING
    for spider_thread in spider_threads])

5. 所有的结构已经全部写完，接下来就是可以填补爬虫部分的代码，在SpiderThread(Thread)里面，开始写爬虫运行 run 的方法，即线程起来后，要做的事情：

def run(self):
  while True:
   # 获取url
   current_url = self.tasks_queue.get()
   visited_urls.add(current_url)
   # 把爬虫的status改成working
   self.spider.status = SpiderStatus.WORKING
   # 获取页面
   html_page = self.spider.fetch(current_url)
   # 判断页面是否为空
   if html_page not in [None, '']:
    # 去解析这个页面, 拿到列表
    url_links = self.spider.parse(html_page)
    # 把解析完的结构加到 self.tasks_queue里面来
    # 没有一次性添加到队列的方法 用循环添加算求了
    for url_link in url_links:
     self.tasks_queue.put(url_link)
   # 完成任务，状态变回IDLE
   self.spider.status = SpiderStatus.IDLE

6. 现在可以开始写 Spider()这个类里面的四个方法，首先写fetch()抓取页面里面的：

@Retry()
 def fetch(self, current_url, *, charsets=('utf-8', ), user_agent=None, proxies=None):
  thread_name = current_thread().name
  print(f'[{thread_name}]: {current_url}')
  headers = {'user-agent': user_agent} if user_agent else {}
  resp = requests.get(current_url,
       headers=headers, proxies=proxies)
  # 判断状态码，只要200的页面
  return decode_page(resp.content, charsets) \
   if resp.status_code == 200 else None

6-1. decode_page是我们在类的外面封装一个解码的函数：

def decode_page(page_bytes, charsets=('utf-8',)):
 page_html = None
 for charset in charsets:
  try:
   page_html = page_bytes.decode(charset)
   break
  except UnicodeDecodeError:
   pass
   # logging.error('Decode:', error)
 return page_html

6-2. @retry是装饰器，用于重试, 因为需要传参，在这里我们用一个类来包装, 所以最后改成@Retry():

# retry的类，重试次数3次，时间5秒(这样写在装饰器就不用传参数类), 异常
class Retry(object):
 def __init__(self, *, retry_times=3, wait_secs=5, errors=(Exception, )):
  self.retry_times = retry_times
  self.wait_secs = wait_secs
  self.errors = errors
 # call 方法传参
 def __call__(self, fn):
  def wrapper(*args, **kwargs):
   for _ in range(self.retry_times):
    try:
     return fn(*args, **kwargs)
    except self.errors as e:
     # 打日志
     logging.error(e)
     # 最小避让 self.wait_secs 再发起请求(最小避让时间)
     sleep((random() + 1) * self.wait_secs)
   return None
  return wrapper()

7. 接下来写解析页面的方法，即 parse():

# 解析页面
 def parse(self, html_page, *, domain='m.sohu.com'):
  soup = BeautifulSoup(html_page, 'lxml')
  url_links = []
  # 找body的有 href 属性的 a 标签
  for a_tag in soup.body.select('a[href]'):
   # 拿到这个属性
   parser = urlparse(a_tag.attrs['href'])
   netloc = parser.netloc or domain
   scheme = parser.scheme or 'http'
   netloc = parser.netloc or 'm.sohu.com'
   # 只爬取 domain 底下的
   if scheme != 'javascript' and netloc == domain:
    path = parser.path
    query = '?' + parser.query if parser.query else ''
    full_url = f'{scheme}://{netloc}{path}{query}'
    if full_url not in visited_urls:
     url_links.append(full_url)
  return url_links

7-1. 我们需要在SpiderThread()的 run方法里面，在

current_url = self.tasks_queue.get()

下面添加

visited_urls.add(current_url)

在类外面再添加一个

visited_urls = set()去重

8. 现在已经能开始抓取到相应的网址。

python面向对象多线程爬虫爬取搜狐页面的实例代码

总结

以上所述是小编给大家介绍的python面向对象多线程爬虫爬取搜狐页面的实例代码，希望对大家有所帮助，如果大家有任何疑问请给我留言，小编会及时回复大家的。在此也非常感谢大家对三水点靠木网站的支持！

python面向对象多线程爬虫爬取搜狐页面的实例代码

- Author -

mrr

声明：登载此文出于传递更多信息之目的，并不意味着赞同其观点或证实其描述。

Python 相关文章推荐

Python实现提取谷歌音乐搜索结果的方法

Jul 10 Python

你所不知道的Python奇技淫巧13招【实用】

Dec 14 Python

python生成随机图形验证码详解

Nov 08 Python

Python语言实现百度语音识别API的使用实例

Dec 13 Python

详解python实现线程安全的单例模式

Mar 05 Python

使用memory_profiler监测python代码运行时内存消耗方法

Dec 03 Python

Python计算时间间隔(精确到微妙)的代码实例

Feb 26 Python

详解Python:面向对象编程

Apr 10 Python

Python进程，多进程，获取进程id，给子进程传递参数操作示例

Oct 11 Python

pycharm显示远程图片的实现

Nov 04 Python

浅谈Python 参数与变量

Jun 20 Python

DRF使用simple JWT身份验证的实现

Jan 14 Python

Python中if elif else及缩进的使用简述

May 31 #Python

python基于物品协同过滤算法实现代码

May 31 #Python

python写入并获取剪切板内容的实例

May 31 #Python

python3实现基于用户的协同过滤

May 31 #Python

python控制windows剪贴板,向剪贴板中写入图片的实例

May 31 #Python

python用户评论标签匹配的解决方法

May 31 #Python

python批量查询、汉字去重处理CSV文件

May 31 #Python

You might like

第1次亲密接触PHP5(1)

2006/10/09 PHP

ThinkPHP字符串函数及常用函数汇总

2014/07/18 PHP

Ubuntu12下编译安装PHP5.3开发环境

2015/03/27 PHP

php生成不重复随机数、数组的4种方法分享

2015/03/30 PHP

php中yar框架实例用法讲解

2020/12/27 PHP

从父页面读取和操作iframe中内容方法

2009/07/25 Javascript

jQuery中的常用事件总结

2009/12/27 Javascript

ASP.NET中基于JQUERY的高性能的TreeView补充

2011/02/23 Javascript

来自国外的30个基于jquery的Web下拉菜单

2012/06/22 Javascript

html文件中jquery与velocity变量中的$冲突的解决方法

2013/11/01 Javascript

javascript操作符"!~"详解

2015/02/10 Javascript

浅析jQuery移动开发中内联按钮和分组按钮的编写

2015/12/04 Javascript

JS中动态创建元素的三种方法总结(推荐)

2016/10/20 Javascript

用Vue.js实现监听属性的变化

2016/11/17 Javascript

JavaScript运动框架解决速度正负取整问题（一）

2017/05/17 Javascript

详解vue.js 开发环境搭建最简单攻略

2017/06/12 Javascript

knockoutjs模板实现树形结构列表

2017/07/31 Javascript

vue中实现在外部调用methods的方法(推荐)

2018/02/08 Javascript

angular 实现的输入框数字千分位及保留几位小数点功能示例

2018/06/19 Javascript

JS高阶函数原理与用法实例分析

2019/01/15 Javascript

使用node搭建自动发图文微博机器人的方法

2019/03/22 Javascript

Vue使用axios引起的后台session不同操作

2020/08/14 Javascript

js实现车辆管理系统

2020/08/26 Javascript

[03:01]DOTA2英雄基础教程露娜

2014/01/07 DOTA

Python 内置函数进制转换的用法(十进制转二进制、八进制、十六进制)

2018/04/30 Python

python去除文件中重复的行实例

2018/06/29 Python

python中dict使用方法详解

2019/07/17 Python

python通过TimedRotatingFileHandler按时间切割日志

2019/07/17 Python

html5唤醒APP小记

2019/03/27 HTML / CSS

线程的基本概念、线程的基本状态以及状态之间的关系

2012/10/26 面试题

送给程序员的20个Java集合面试问题

2014/08/06 面试题

胡雪岩故居导游词

2015/02/06 职场文书

总经理司机岗位职责

2015/04/10 职场文书

乒乓球比赛通知

2015/04/27 职场文书

趣味运动会新闻稿

2015/07/17 职场文书

《富饶的西沙群岛》教学反思

2016/02/16 职场文书