编程 Python

Scrapy中如何向Spider传入参数的方法实现

Posted in Python onSeptember 28, 2020

在使用Scrapy爬取数据时，有时会碰到需要根据传递给Spider的参数来决定爬取哪些Url或者爬取哪些页的情况。

例如，百度贴吧的放置奇兵吧的地址如下，其中 kw参数用来指定贴吧名称、pn参数用来对帖子进行翻页。

https://tieba.baidu.com/f?kw=放置奇兵&ie=utf-8&pn=250

如果我们希望通过参数传递的方式将贴吧名称和页数等参数传给Spider，来控制我们要爬取哪一个贴吧、爬取哪些页。遇到这种情况，有以下两种方法向Spider传递参数。

方式一

通过 scrapy crawl 命令的 -a 参数向 spider 传递参数。

# -*- coding: utf-8 -*-
import scrapy

class TiebaSpider(scrapy.Spider):
  name = 'tieba' # 贴吧爬虫
  allowed_domains = ['tieba.baidu.com'] # 允许爬取的范围
  start_urls = [] # 爬虫起始地址

  # 命令格式： scrapy crawl tieba -a tiebaName=放置奇兵 -a pn=250
  def __init__(self, tiebaName=None, pn=None, *args, **kwargs):
    print('< 贴吧名称 >： ' + tiebaName)
    super(eval(self.__class__.__name__), self).__init__(*args, **kwargs)
    self.start_urls = ['https://tieba.baidu.com/f?kw=%s&ie=utf-8&pn=%s' % (tiebaName,pn)]

  def parse(self, response):
    print(response.request.url) # 结果：https://tieba.baidu.com/f?kw=%E6%94%BE%E7%BD%AE%E5%A5%87%E5%85%B5&ie=utf-8&pn=250

方式二

仿照 scrapy 的 crawl 命令的源代码，重新自定义一个专用命令。

Scrapy中如何向Spider传入参数的方法实现

settings.py

首先，需要在settings.py文件中增加如下配置来指定自定义 scrapy 命令的存放目录。

# 指定 Scrapy 命令存放目录
COMMANDS_MODULE = 'baidu_tieba.commands'

run.py

在指定的命令存放目录中创建命令文件，在这里我们创建的命令文件为 run.py ，将来执行的命令格式为：
scrapy run [ -option option_value] 。

import scrapy.commands.crawl as crawl
from scrapy.exceptions import UsageError
from scrapy.commands import ScrapyCommand


class Command(crawl.Command):

  def add_options(self, parser):
    # 为命令添加选项
    ScrapyCommand.add_options(self, parser)
    parser.add_option("-k", "--keyword", type="str", dest="keyword", default="",
             help="set the tieba's name you want to crawl")
    parser.add_option("-p", "--pageNum", type="int", action="store", dest="pageNum", default=0,
             help="set the page number you want to crawl")

  def process_options(self, args, opts):
    # 处理从命令行中传入的选项参数
    ScrapyCommand.process_options(self, args, opts)
    if opts.keyword:
      tiebaName = opts.keyword.strip()
      if tiebaName != '':
        self.settings.set('TIEBA_NAME', tiebaName, priority='cmdline')
    else:
      raise UsageError("U must specify the tieba's name to crawl,use -kw TIEBA_NAME!")
    self.settings.set('PAGE_NUM', opts.pageNum, priority='cmdline')

  def run(self, args, opts):
    # 启动爬虫
    self.crawler_process.crawl('tieba')
    self.crawler_process.start()

pipelines.py

在BaiduTiebaPipeline的open_spider()方法中利用 run 命令传入的参数对TiebaSpider进行初始化，在这里示例设置了一下start_urls。

# -*- coding: utf-8 -*-
import json

class BaiduTiebaPipeline(object):

  @classmethod
  def from_settings(cls, settings):
    return cls(settings)

  def __init__(self, settings):
    self.settings = settings

  def open_spider(self, spider):
    # 开启爬虫
    spider.start_urls = [
      'https://tieba.baidu.com/f?kw=%s&ie=utf-8&pn=%s' % (self.settings['TIEBA_NAME'], self.settings['PAGE_NUM'])]

  def close_spider(self, spider):
    # 关闭爬虫
    pass

  def process_item(self, item, spider):
    # 将帖子内容保存到文件
    with open('tieba.txt', 'a', encoding='utf-8') as f:
      json.dump(dict(item), f, ensure_ascii=False, indent=2)
    return item

设置完成后，别忘了在settings.py中启用BaiduTiebaPipeline。

ITEM_PIPELINES = {
  'baidu_tieba.pipelines.BaiduTiebaPipeline': 50,
}

启动示例

大功告成，参照如下命令格式启动贴吧爬虫。

scrapy run -k 放置奇兵 -p 250

Scrapy中如何向Spider传入参数的方法实现

参考文章：

https://blog.csdn.net/c0411034/article/details/81750028

https://blog.csdn.net/qq_24760381/article/details/80361400

https://blog.csdn.net/qq_38282706/article/details/80991196

到此这篇关于Scrapy中如何向Spider传入参数的方法实现的文章就介绍到这了,更多相关Scrapy Spider传入参数内容请搜索三水点靠木以前的文章或继续浏览下面的相关文章希望大家以后多多支持三水点靠木！

Scrapy中如何向Spider传入参数的方法实现

- Author -

pengjunlee

声明：登载此文出于传递更多信息之目的，并不意味着赞同其观点或证实其描述。

Python 相关文章推荐

python定时执行指定函数的方法

May 27 Python

python去掉行尾的换行符方法

Jan 04 Python

python实现学生信息管理系统

Apr 05 Python

python自动重试第三方包retrying模块的方法

Apr 24 Python

10 行 Python 代码教你自动发送短信(不想回复工作邮件妙招)

Oct 11 Python

Python3几个常见问题的处理方法

Feb 26 Python

Python中按键来获取指定的值

Mar 02 Python

Python如何实现强制数据类型转换

Nov 22 Python

tensorflow下的图片标准化函数per_image_standardization用法

Jun 30 Python

Python绘制K线图之可视化神器pyecharts的使用

Mar 02 Python

Python使用Beautiful Soup(BS4)库解析HTML和XML

Jun 05 Python

详解向scrapy中的spider传递参数的几种方法(2种)

Sep 28 #Python

小结Python的反射机制

Sep 28 #Python

scrapy与selenium结合爬取数据(爬取动态网站)的示例代码

Sep 28 #Python

scrapy结合selenium解析动态页面的实现

Sep 28 #Python

互斥锁解决 Python 中多线程共享全局变量的问题(推荐)

Sep 28 #Python

python 常见的反爬虫策略

Sep 27 #Python

python 5个实用的技巧

Sep 27 #Python

You might like

实用的简单PHP分页集合包括使用方法

2013/10/21 PHP

php图片水印添加、压缩、剪切的封装类实现

2020/04/18 PHP

最准确的php截取字符串长度函数

2015/10/29 PHP

Laravel实现通过blade模板引擎渲染视图

2019/10/25 PHP

jquery选择器-根据多个属性选择示例代码

2013/10/21 Javascript

IE 下Enter提交表单存在重复提交问题的解决方法

2014/05/04 Javascript

JavaScript实现获取某个元素相邻兄弟节点的prev与next方法

2016/01/25 Javascript

js表单验证实例讲解

2016/03/31 Javascript

基于Three.js插件制作360度全景图

2016/11/29 Javascript

Vuejs 用$emit与$on来进行兄弟组件之间的数据传输通信

2017/02/23 Javascript

BootstrapTable加载按钮功能实例代码详解

2017/09/22 Javascript

vue2实现数据请求显示loading图

2017/11/28 Javascript

vue-cli启动本地服务局域网不能访问的原因分析

2018/01/22 Javascript

vue.extend与vue.component的区别和联系

2018/09/19 Javascript

浅谈高大上的微信小程序中渲染html内容—技术分享

2018/10/25 Javascript

解决vue单页面应用中动态修改title问题

2019/06/09 Javascript

js实现掷骰子小游戏

2019/10/24 Javascript

通过JS判断网页是否为手机打开

2020/10/28 Javascript

解决antd日期选择组件,添加value就无法点击下一年和下一月问题

2020/10/29 Javascript

[02:02]DOTA2英雄基础教程斯拉达

2013/12/11 DOTA

[01:01:13]2018DOTA2亚洲邀请赛 4.5 淘汰赛 Mineski vs VG 第三场

2018/04/06 DOTA

[28:57]EG vs VGJ.T 2018国际邀请赛小组赛BO2 第二场 8.16

2018/08/16 DOTA

python读取word文档的方法

2015/05/09 Python

Python编写电话薄实现增删改查功能

2016/05/07 Python

Python3编程实现获取阿里云ECS实例及监控的方法

2017/08/18 Python

Django中login_required装饰器的深入介绍

2017/11/24 Python

python怎么调用自己的函数

2020/07/01 Python

Python3 搭建Qt5 环境的方法示例

2020/07/16 Python

CSS3 please 跨浏览器的CSS3产生器

2010/03/14 HTML / CSS

使用Html5 Stream开发实时监控系统

2020/06/02 HTML / CSS

科沃斯机器人官网商城：Ecovacs

2016/08/29 全球购物

韩国CJ食品专卖网：CJonmart

2016/09/11 全球购物

MYSQL基础面试题

2012/05/13 面试题

2016年度师德标兵先进事迹材料

2016/02/26 职场文书

GoLang中生成UUID唯一标识的实现

2021/05/08 Golang

Golang 切片(Slice)实现增删改查

2022/04/22 Golang