编程 Javascript

node.js爬虫框架node-crawler初体验

Posted in Javascript onOctober 29, 2020

百度爬虫这个词语，一般出现的都是python相关的资料。

py也有很多爬虫框架，比如scrapy，Portia，Crawley等。

之前我个人更喜欢用C#做爬虫。

随着对nodejs的熟悉。发现做这种事情还是用脚本语言适合多了，至少不用写那么多的实体类。而且脚本一般使用比较简单。

在github上搜索node+spider，排名第一的就是node-crawler

github:https://github.com/bda-research/node-crawler

简单使用

npm 安装：

npm install crawler

new一个crawler对象

var c = new Crawler({
 // 在每个请求处理完毕后将调用此回调函数
 callback : function (error, res, done) {
  if(error){
   console.log(error);
  }else{
   var $ = res.$;
   // $ 默认为 Cheerio 解析器
   // 它是核心jQuery的精简实现，可以按照jQuery选择器语法快速提取DOM元素
   console.log($("title").text());
  }
  done();
 }
});

然后往crawler队列里面不停的加url就行了，

// 将一个URL加入请求队列，并使用默认回调函数
c.queue('http://www.amazon.com');

// 将多个URL加入请求队列
c.queue(['http://www.google.com/','http://www.yahoo.com']);

控制并发速度

爬虫框架一般都是同时去爬多个页面，但是速度过快会触发目标网站的反爬虫机制，也同时影响别人网站的性能。

控制最大的并发数量

var c = new Crawler({
 // 最大并发数默认为10
 maxConnections : 1,

 callback : function (error, res, done) {
  if(error){
   console.log(error);
  }else{
   var $ = res.$;
   console.log($("title").text());
  }
  done();
 }
});

使用慢速模式

使用参数 rateLimit 启用慢速模式，两次请求之间会闲置 rateLimit 毫秒，而 maxConnections 将被强行修改为 1 。

var c = new Crawler({
 // `maxConnections` 将被强制修改为 1
 maxConnections : 10,

 // 两次请求之间将闲置1000ms
 rateLimit: 1000,

 callback : function (error, res, done) {
  if(error){
   console.log(error);
  }else{
   var $ = res.$;
   console.log($("title").text());
  }
  done();
 }
});

下载图片等静态文件

var c = new Crawler({
 encoding:null,
 jQuery:false,// set false to suppress warning message.
 callback:function(err, res, done){
  if(err){
   console.error(err.stack);
  }else{
   fs.createWriteStream(res.options.filename).write(res.body);
  }
  
  done();
 }
});

c.queue({
 uri:"https://nodejs.org/static/images/logos/nodejs-1920x1200.png",
 filename:"nodejs-1920x1200.png"
});

以上就是node.js爬虫框架node-crawler初体验的详细内容，更多关于爬虫框架node-crawler的资料请关注三水点靠木其它相关文章！

node.js爬虫框架node-crawler初体验

- Author -

青城同学

声明：登载此文出于传递更多信息之目的，并不意味着赞同其观点或证实其描述。

Javascript 相关文章推荐

鼠标焦点离开文本框时验证的js代码

Jul 19 Javascript

JS实现QQ图片一闪一闪的效果小例子

Jul 31 Javascript

表单元素与非表单元素刷新区别详细解析

Nov 06 Javascript

js实现跟随鼠标移动且带关闭功能的图片广告实例

Feb 26 Javascript

Node.js中npm常用命令大全

Jun 09 Javascript

JavaScript中的Reflect对象详解(ES6新特性)

Jul 22 Javascript

JS提示：Uncaught SyntaxError: Unexpected token ILLEGAL错误的解决方法

Aug 19 Javascript

javascript宿主对象之window.navigator详解

Sep 07 Javascript

一个炫酷的Bootstrap导航菜单

Dec 28 Javascript

Angular浏览器插件Batarang介绍及使用

Feb 07 Javascript

微信小程序云开发之使用云函数

May 17 Javascript

layui弹出框Tab选项卡的示例代码

Sep 04 Javascript

JavaScript实现网页计算器功能

Oct 29 #Javascript

Javascript数组及类数组相关原理详解

Oct 29 #Javascript

antd Form组件方法getFieldsValue获取自定义组件的值操作

Oct 29 #Javascript

node.js如何操作MySQL数据库

Oct 29 #Javascript

TypeScript魔法堂之枚举的超实用手册

Oct 29 #Javascript

解决antd的Form组件setFieldsValue的警告问题

Oct 29 #Javascript

vue 函数调用加括号与不加括号的区别

Oct 29 #Javascript

You might like

php md5下16位和32位的实现代码

2008/04/09 PHP

php 魔术函数使用说明

2010/02/21 PHP

深入理解PHP内核(一)

2015/11/10 PHP

php mysqli查询语句返回值类型实例分析

2016/06/29 PHP

jsTree树控件(基于jQuery, 超强悍)[推荐]

2009/09/01 Javascript

jquery的index方法实现tab效果

2011/02/16 Javascript

基于Jquery+Ajax+Json的高效分页实现代码

2011/10/29 Javascript

Javascript生成json的函数代码(可以用php的json_decode解码)

2012/06/11 Javascript

实现51Map地图接口(示例代码)

2013/11/22 Javascript

php显示当前文件所在的文件以及文件夹所有文件以树形展开

2013/12/13 Javascript

jQuery实现图片渐入渐出切换展示效果

2015/08/15 Javascript

总结Javascript中数组各种去重的方法

2016/10/04 Javascript

leaflet的开发入门教程

2016/11/17 Javascript

vue-router实现webApp切换页面动画效果代码

2017/05/25 Javascript

D3.js进阶系列之CSV表格文件的读取详解

2017/06/06 Javascript

Vue中JS动画与Velocity.js的结合使用

2019/02/13 Javascript

使用Vue.js 和Chart.js制作绚丽多彩的图表

2019/06/15 Javascript

redux处理异步action解决方案

2020/03/22 Javascript

js实现点击按钮随机生成背景颜色

2020/09/05 Javascript

[42:20]Secret vs Liquid 2019国际邀请赛小组赛 BO2 第二场 8.15

2019/08/17 DOTA

Python网页解析利器BeautifulSoup安装使用介绍

2015/03/17 Python

解析Python中的__getitem__专有方法

2016/06/27 Python

python 检查文件mime类型的方法

2018/12/08 Python

python面向对象实现名片管理系统文件版

2019/04/26 Python

Python中判断子串存在的性能比较及分析总结

2019/06/23 Python

浅析Python 中几种字符串格式化方法及其比较

2019/07/02 Python

Python迭代器iterator生成器generator使用解析

2019/10/24 Python

如何理解Python中的变量

2020/06/01 Python

CSS3 旋转立方体问题详解

2020/01/09 HTML / CSS

纽约香氛品牌：NEST Fragrance

2018/10/15 全球购物

英国外籍人士的在线超市：British Corner Shop

2019/06/03 全球购物

期末自我鉴定

2014/02/02 职场文书

优秀应届毕业生推荐信

2014/02/18 职场文书

党员公开承诺书2015

2015/01/21 职场文书

生产现场禁烟通知

2015/04/23 职场文书