node.js爬虫框架node-crawler初体验


Posted in Javascript onOctober 29, 2020

百度爬虫这个词语,一般出现的都是python相关的资料。

py也有很多爬虫框架,比如scrapy,Portia,Crawley等。

之前我个人更喜欢用C#做爬虫。

随着对nodejs的熟悉。发现做这种事情还是用脚本语言适合多了,至少不用写那么多的实体类。而且脚本一般使用比较简单。

在github上搜索node+spider,排名第一的就是node-crawler 

github:https://github.com/bda-research/node-crawler

简单使用

npm 安装:

npm install crawler

new一个crawler对象

var c = new Crawler({
 // 在每个请求处理完毕后将调用此回调函数
 callback : function (error, res, done) {
  if(error){
   console.log(error);
  }else{
   var $ = res.$;
   // $ 默认为 Cheerio 解析器
   // 它是核心jQuery的精简实现,可以按照jQuery选择器语法快速提取DOM元素
   console.log($("title").text());
  }
  done();
 }
});

然后往crawler队列里面不停的加url就行了,

// 将一个URL加入请求队列,并使用默认回调函数
c.queue('http://www.amazon.com');

// 将多个URL加入请求队列
c.queue(['http://www.google.com/','http://www.yahoo.com']);

控制并发速度

爬虫框架一般都是同时去爬多个页面,但是速度过快会触发目标网站的反爬虫机制,也同时影响别人网站的性能。

控制最大的并发数量

var c = new Crawler({
 // 最大并发数默认为10
 maxConnections : 1,

 callback : function (error, res, done) {
  if(error){
   console.log(error);
  }else{
   var $ = res.$;
   console.log($("title").text());
  }
  done();
 }
});

使用慢速模式

使用参数 rateLimit 启用慢速模式,两次请求之间会闲置 rateLimit 毫秒,而 maxConnections 将被强行修改为 1 。

var c = new Crawler({
 // `maxConnections` 将被强制修改为 1
 maxConnections : 10,

 // 两次请求之间将闲置1000ms
 rateLimit: 1000,

 callback : function (error, res, done) {
  if(error){
   console.log(error);
  }else{
   var $ = res.$;
   console.log($("title").text());
  }
  done();
 }
});

下载图片等静态文件

var c = new Crawler({
 encoding:null,
 jQuery:false,// set false to suppress warning message.
 callback:function(err, res, done){
  if(err){
   console.error(err.stack);
  }else{
   fs.createWriteStream(res.options.filename).write(res.body);
  }
  
  done();
 }
});

c.queue({
 uri:"https://nodejs.org/static/images/logos/nodejs-1920x1200.png",
 filename:"nodejs-1920x1200.png"
});

以上就是node.js爬虫框架node-crawler初体验的详细内容,更多关于爬虫框架node-crawler的资料请关注三水点靠木其它相关文章!

Javascript 相关文章推荐
Firefox中autocomplete="off" 设置不起作用Bug的解决方法
Mar 25 Javascript
Javascript中产生固定结果的函数优化技巧
Jan 16 Javascript
多个表单中如何获得这个文件上传的网址实现js代码
Mar 25 Javascript
js获取 type=radio 值的方法
May 09 Javascript
jQuery学习笔记之2个小技巧
Jan 19 Javascript
window.open()实现post传递参数
Mar 12 Javascript
js实现不提交表单获取单选按钮值的方法
Aug 21 Javascript
Vue.js中用webpack合并打包多个组件并实现按需加载
Feb 17 Javascript
基于jQuery ztree实现表格风格的树状结构
Aug 31 jQuery
Vue 动态组件与 v-once 指令的实现
Feb 12 Javascript
vue中更改数组中属性,在页面中不生效的解决方法
Oct 30 Javascript
关于angular 8.1使用过程中的一些记录
Nov 25 Javascript
JavaScript实现网页计算器功能
Oct 29 #Javascript
Javascript数组及类数组相关原理详解
Oct 29 #Javascript
antd Form组件方法getFieldsValue获取自定义组件的值操作
Oct 29 #Javascript
node.js如何操作MySQL数据库
Oct 29 #Javascript
TypeScript魔法堂之枚举的超实用手册
Oct 29 #Javascript
解决antd的Form组件setFieldsValue的警告问题
Oct 29 #Javascript
vue 函数调用加括号与不加括号的区别
Oct 29 #Javascript
You might like
php基于GD库画五星红旗的方法
2015/02/24 PHP
php实现源代码加密的方法
2015/07/11 PHP
Symfony2框架创建项目与模板设置实例详解
2016/03/17 PHP
PHP图片加水印实现方法
2016/05/06 PHP
laravel 创建命令行命令的图文教程
2019/10/23 PHP
jQuery 加上最后自己的验证
2009/11/04 Javascript
javascript中的继承实例代码
2011/04/27 Javascript
Javascript获取窗口(容器)的大小及位置参数列举及简要说明
2012/12/09 Javascript
利用cookie记住背景颜色示例代码
2013/11/04 Javascript
js实现图片旋转的三种方法
2014/04/10 Javascript
jQuery中ajax的load()方法用法实例
2014/12/26 Javascript
JavaScript设计模式之代理模式介绍
2014/12/28 Javascript
详解AngularJS中自定义过滤器
2015/12/28 Javascript
微信小程序开发探究
2016/12/27 Javascript
vue使用watch 观察路由变化,重新获取内容
2017/03/08 Javascript
简单快速的实现js计算器功能
2017/08/17 Javascript
DatePickerDialog 自定义样式及使用全解
2019/07/09 Javascript
LayUI switch 开关监听 获取属性值、更改状态的方法
2019/09/21 Javascript
[00:32]2018DOTA2亚洲邀请赛Mineski出场
2018/04/04 DOTA
[02:49]DAC2018决赛日TOP5 LGD开启黑暗之门绝杀VP
2018/04/08 DOTA
Python2包含中文报错的解决方法
2018/07/09 Python
Python实现图片转字符画的代码实例
2019/02/22 Python
python实现在函数图像上添加文字和标注的方法
2019/07/08 Python
python修改字典键(key)的方法
2019/08/05 Python
python中单下划线(_)和双下划线(__)的特殊用法
2019/08/29 Python
爱他美官方海外旗舰店:Aptamil奶粉
2017/12/22 全球购物
英国创新设计文具、卡片和礼品包装网站:Paperchase
2018/07/14 全球购物
销售员自我评价怎么写
2013/09/19 职场文书
个人评价范文分享
2014/01/11 职场文书
化学专业毕业生求职信
2014/07/28 职场文书
2014年人民警察入党思想汇报
2014/10/12 职场文书
2015年后勤工作总结范文
2015/04/08 职场文书
离婚起诉书范文2016
2015/11/26 职场文书
浅谈Python中的函数(def)及参数传递操作
2021/05/25 Python
CentOS8.4安装Redis6.2.6的详细过程
2021/11/20 Redis
Python实现仓库管理系统
2022/05/30 Python