python中用Scrapy实现定时爬虫的实例讲解


Posted in Python onJanuary 18, 2021

一般网站发布信息会在具体实现范围内发布,我们在进行网络爬虫的过程中,可以通过设置定时爬虫,定时的爬取网站的内容。使用python爬虫框架Scrapy框架可以实现定时爬虫,而且可以根据我们的时间需求,方便的修改定时的时间。

1、Scrapy介绍

Scrapy是python的爬虫框架,用于抓取web站点并从页面中提取结构化的数据。任何人都可以根据需求方便的修改。Scrapy用途广泛,可以用于数据挖掘、监测和自动化测试。

2、使用Scrapy框架定时爬取

import time
from scrapy import cmdline
def doSth():
  # 把爬虫程序放在这个类里 zhilian_spider 是爬虫的name
  cmdline.execute('scrapy crawl zhilian_spider'.split())
# 想几点更新,定时到几点
def time_ti(h=17, m=54):
  while True:
    now = datetime.datetime.now()
    # print(now.hour, now.minute)
    if now.hour == h and now.minute == m:
      doSth()
    # 每隔60秒检测一次
    time.sleep(60)
time_ti()

3、更简单的写法

import time
import sys
import os
import datetime
def Dingshi():
while True:
os.system("scrapy crawl lcp")#lcp是我们爬虫的代码名字哦
time.sleep(60)
Dingshi()

知识点扩展:

直接使用Timer类实例代码

import time
import os
while True:
 os.system("scrapy crawl News")
 time.sleep(86400) #每隔一天运行一次 24*60*60=86400s或者,使用标准库的sched模块
import sched
#初始化sched模块的scheduler类
#第一个参数是一个可以返回时间戳的函数,第二个参数可以在定时未到达之前阻塞。
schedule = sched.scheduler ( time.time, time.sleep )
#被周期性调度触发的函数
def func():
 os.system("scrapy crawl News")
def perform1(inc):
 schedule.enter(inc,0,perform1,(inc,))
 func() # 需要周期执行的函数
def mymain():
 schedule.enter(0,0,perform1,(86400,))
if __name__=="__main__":
 mymain()
 schedule.run() # 开始运行,直到计划时间队列变成空为止关于cmd的实现方法,本人在单次执行爬虫程序时使用的是 
cmdline.execute("scrapy crawl News".split())但可能因为cmdline是scrapy模块中自带的,所以定时执行时只能执行一次就退出了。

到此这篇关于python中用Scrapy实现定时爬虫的实例讲解的文章就介绍到这了,更多相关python中使用Scrapy实现定时爬虫内容请搜索三水点靠木以前的文章或继续浏览下面的相关文章希望大家以后多多支持三水点靠木!

Python 相关文章推荐
Python的ORM框架SQLObject入门实例
Apr 28 Python
python转换字符串为摩尔斯电码的方法
Jul 06 Python
Python 实现12306登录功能实例代码
Feb 09 Python
pandas多级分组实现排序的方法
Apr 20 Python
python使用装饰器作日志处理的方法
Jul 11 Python
Flask-WTF表单的使用方法
Jul 12 Python
python 如何去除字符串头尾的多余符号
Nov 19 Python
Django中的AutoField字段使用
May 18 Python
将keras的h5模型转换为tensorflow的pb模型操作
May 25 Python
tensorflow 20:搭网络,导出模型,运行模型的实例
May 26 Python
基于Python组装jmx并调用JMeter实现压力测试
Nov 03 Python
Python内置包对JSON文件数据进行编码和解码
Apr 12 Python
java关于string最常出现的面试题整理
Jan 18 #Python
python爬虫实现爬取同一个网站的多页数据的实例讲解
Jan 18 #Python
python中四舍五入的正确打开方式
Jan 18 #Python
PyQt5中QSpinBox计数器的实现
Jan 18 #Python
全网最细 Python 格式化输出用法讲解(推荐)
Jan 18 #Python
PyQt实现计数器的方法示例
Jan 18 #Python
Python实现邮件发送的详细设置方法(遇到问题)
Jan 18 #Python
You might like
PHP array_flip() 删除重复数组元素专用函数
2010/05/16 PHP
php中随机显示图片的函数代码
2011/06/23 PHP
php class中self,parent,this的区别以及实例介绍
2013/04/24 PHP
两个php日期控制类实例
2014/12/09 PHP
php生成txt文件实例代码介绍
2016/04/28 PHP
yii2缓存Caching基本用法示例
2016/07/18 PHP
PHP cURL获取微信公众号access_token的实例
2018/04/28 PHP
用jQuery简化JavaScript开发分析
2009/02/19 Javascript
js Object2String方便查看js对象内容
2014/11/24 Javascript
精通JavaScript的this关键字
2020/05/28 Javascript
nodejs body-parser 解析post数据实例
2017/07/26 NodeJs
javascript中的replace函数(带注释demo)
2018/01/07 Javascript
Nodejs异步回调之异常处理实例分析
2018/06/22 NodeJs
使用layui日期控件laydate对开始和结束时间进行联动控制的方法
2019/09/06 Javascript
node.js使用net模块创建服务器和客户端示例【基于TCP协议】
2020/02/14 Javascript
微信小程序后端无法保持session的原因及解决办法问题
2020/03/20 Javascript
JS实现放大镜效果
2020/09/21 Javascript
利用vue3+ts实现管理后台(增删改查)
2020/10/30 Javascript
Python中的自定义函数学习笔记
2014/09/23 Python
搞笑的程序猿:看看你是哪种Python程序员
2015/06/12 Python
python Django模板的使用方法
2016/01/14 Python
学习python类方法与对象方法
2016/03/15 Python
利用python批量给云主机配置安全组的方法教程
2017/06/21 Python
使用实现XlsxWriter创建Excel文件并编辑
2018/05/04 Python
关于tf.TFRecordReader()函数的用法解析
2020/02/17 Python
Tensorflow tensor 数学运算和逻辑运算方式
2020/06/30 Python
Python环境使用OpenCV检测人脸实现教程
2020/10/19 Python
世界上最大的铁人三项商店:Tri UK
2020/11/04 全球购物
澳大利亚网上书店:QBD
2021/01/09 全球购物
网络公司美工设计工作个人的自我评价
2013/11/03 职场文书
生产车间主管岗位职责
2013/12/28 职场文书
周年庆典邀请函范文
2014/01/23 职场文书
大学生村官演讲稿
2014/04/25 职场文书
期中考试复习计划
2015/01/19 职场文书
2019销售早会主持词
2019/06/27 职场文书
Python 类,对象,数据分类,函数参数传递详解
2021/09/25 Python