node.js爬虫框架node-crawler初体验


Posted in Javascript onOctober 29, 2020

百度爬虫这个词语,一般出现的都是python相关的资料。

py也有很多爬虫框架,比如scrapy,Portia,Crawley等。

之前我个人更喜欢用C#做爬虫。

随着对nodejs的熟悉。发现做这种事情还是用脚本语言适合多了,至少不用写那么多的实体类。而且脚本一般使用比较简单。

在github上搜索node+spider,排名第一的就是node-crawler 

github:https://github.com/bda-research/node-crawler

简单使用

npm 安装:

npm install crawler

new一个crawler对象

var c = new Crawler({
 // 在每个请求处理完毕后将调用此回调函数
 callback : function (error, res, done) {
  if(error){
   console.log(error);
  }else{
   var $ = res.$;
   // $ 默认为 Cheerio 解析器
   // 它是核心jQuery的精简实现,可以按照jQuery选择器语法快速提取DOM元素
   console.log($("title").text());
  }
  done();
 }
});

然后往crawler队列里面不停的加url就行了,

// 将一个URL加入请求队列,并使用默认回调函数
c.queue('http://www.amazon.com');

// 将多个URL加入请求队列
c.queue(['http://www.google.com/','http://www.yahoo.com']);

控制并发速度

爬虫框架一般都是同时去爬多个页面,但是速度过快会触发目标网站的反爬虫机制,也同时影响别人网站的性能。

控制最大的并发数量

var c = new Crawler({
 // 最大并发数默认为10
 maxConnections : 1,

 callback : function (error, res, done) {
  if(error){
   console.log(error);
  }else{
   var $ = res.$;
   console.log($("title").text());
  }
  done();
 }
});

使用慢速模式

使用参数 rateLimit 启用慢速模式,两次请求之间会闲置 rateLimit 毫秒,而 maxConnections 将被强行修改为 1 。

var c = new Crawler({
 // `maxConnections` 将被强制修改为 1
 maxConnections : 10,

 // 两次请求之间将闲置1000ms
 rateLimit: 1000,

 callback : function (error, res, done) {
  if(error){
   console.log(error);
  }else{
   var $ = res.$;
   console.log($("title").text());
  }
  done();
 }
});

下载图片等静态文件

var c = new Crawler({
 encoding:null,
 jQuery:false,// set false to suppress warning message.
 callback:function(err, res, done){
  if(err){
   console.error(err.stack);
  }else{
   fs.createWriteStream(res.options.filename).write(res.body);
  }
  
  done();
 }
});

c.queue({
 uri:"https://nodejs.org/static/images/logos/nodejs-1920x1200.png",
 filename:"nodejs-1920x1200.png"
});

以上就是node.js爬虫框架node-crawler初体验的详细内容,更多关于爬虫框架node-crawler的资料请关注三水点靠木其它相关文章!

Javascript 相关文章推荐
容易被忽略的JS脚本特性
Sep 13 Javascript
node.js中的http.response.write方法使用说明
Dec 14 Javascript
jsMind通过鼠标拖拽的方式调整节点位置
Apr 13 Javascript
javascript实现C语言经典程序题
Nov 29 Javascript
20分钟轻松创建自己的Bootstrap站点
May 12 Javascript
localStorage实现便签小程序
Nov 28 Javascript
Angular2 之 路由与导航详细介绍
May 26 Javascript
微信小程序页面滑动屏幕加载数据效果
Nov 16 Javascript
VueJs 搭建Axios接口请求工具
Nov 20 Javascript
js限制input只能输入有效的数字(第一个不能是小数点)
Sep 28 Javascript
vue.js仿hover效果的实现方法示例
Jan 28 Javascript
jQuery实现穿梭框效果
Jan 19 jQuery
JavaScript实现网页计算器功能
Oct 29 #Javascript
Javascript数组及类数组相关原理详解
Oct 29 #Javascript
antd Form组件方法getFieldsValue获取自定义组件的值操作
Oct 29 #Javascript
node.js如何操作MySQL数据库
Oct 29 #Javascript
TypeScript魔法堂之枚举的超实用手册
Oct 29 #Javascript
解决antd的Form组件setFieldsValue的警告问题
Oct 29 #Javascript
vue 函数调用加括号与不加括号的区别
Oct 29 #Javascript
You might like
深入解析PHP中的(伪)多线程与多进程
2013/07/01 PHP
WIFI万能钥匙密码查询接口实例
2015/09/28 PHP
PHP全局变量与超级全局变量区别分析
2016/04/01 PHP
PHP简单实现二维数组的矩阵转置操作示例
2017/11/24 PHP
document.all的一个比较完整的总结及案例
2013/01/31 Javascript
下拉菜单点击实现连接跳转功能的js代码
2013/05/19 Javascript
JavaScript使用cookie记录临时访客信息的方法
2015/04/07 Javascript
javascript数据结构之双链表插入排序实例详解
2015/11/25 Javascript
JS实现消息来时让网页标题闪动效果的方法
2016/04/20 Javascript
Angular 中 select指令用法详解
2016/09/29 Javascript
jQuery Easy UI中根据第一个下拉框选中的值设置第二个下拉框是否可以编辑
2016/11/29 Javascript
js控制文本框禁止输入特殊字符详解
2017/04/07 Javascript
JS获取子、父、兄节点方法小结
2017/08/14 Javascript
vue实现登陆登出的实现示例
2017/09/15 Javascript
JavaScript中错误正确处理方式小结你用对了吗
2017/10/10 Javascript
vue-cli webpack 引入swiper的操作方法
2018/09/15 Javascript
vue项目中引入vue-datepicker插件的详解
2019/05/14 Javascript
深入分析JavaScript 事件循环(Event Loop)
2020/06/19 Javascript
Python中查看文件名和文件路径
2017/03/31 Python
Python抽象和自定义类定义与用法示例
2018/08/23 Python
python3 实现对图片进行局部切割的方法
2018/12/05 Python
使用 Python 快速实现 HTTP 和 FTP 服务器的方法
2019/07/22 Python
Python字符串处理的8招秘籍(小结)
2019/08/13 Python
对Python中一维向量和一维向量转置相乘的方法详解
2019/08/26 Python
利用Python的sympy包求解一元三次方程示例
2019/11/22 Python
Python 写了个新型冠状病毒疫情传播模拟程序
2020/02/14 Python
西班牙购买行李箱和背包网站:Maletas Greenwich
2019/10/08 全球购物
.net软件工程师面试题
2015/03/31 面试题
应届毕业生个人求职信范文
2014/01/29 职场文书
信息工作经验交流材料
2014/05/28 职场文书
2014年党的群众路线整改措施思想汇报
2014/10/12 职场文书
早会开场白台词大全
2015/06/01 职场文书
2019年“我为祖国点赞”演讲稿(3篇)
2019/09/26 职场文书
一小时迅速入门Mybatis之bind与多数据源支持 Java API
2021/09/15 Javascript
使用python求解迷宫问题的三种实现方法
2022/03/17 Python
InterProcessMutex实现zookeeper分布式锁原理
2022/03/21 Java/Android