Nodejs学习笔记之Stream模块


Posted in NodeJs onJanuary 13, 2015

一,开篇分析

流是一个抽象接口,被 Node 中的很多对象所实现。比如对一个 HTTP 服务器的请求是一个流,stdout 也是一个流。流是可读,可写或兼具两者的。

最早接触Stream是从早期的unix开始的, 数十年的实践证明Stream 思想可以很简单的开发出一些庞大的系统。

在unix里,Stream是通过 "|" 实现的。在node中,作为内置的stream模块,很多核心模块和三方模块都使用到。

和unix一样,node stream主要的操作也是.pipe(),使用者可以使用反压力机制来控制读和写的平衡。

Stream 可以为开发者提供可以重复使用统一的接口,通过抽象的Stream接口来控制Stream之间的读写平衡。

一个TCP连接既是可读流,又是可写流,而Http连接则不同,一个http request对象是可读流,而http response对象则是可写流。

流的传输过程默认是以buffer的形式传输的,除非你给他设置其他编码形式,以下是一个例子:

 var http = require('http') ;

  var server = http.createServer(function(req,res){

     res.writeHeader(200, {'Content-Type': 'text/plain'}) ;

     res.end("Hello,大熊!") ;

  }) ;

  server.listen(8888) ;

  console.log("http server running on port 8888 ...") ;

运行后会有乱码出现,原因就是没有设置指定的字符集,比如:“utf-8” 。

修改一下就好:

 var http = require('http') ;

 var server = http.createServer(function(req,res){

    res.writeHeader(200,{

        'Content-Type' : 'text/plain;charset=utf-8'  // 添加charset=utf-8

    }) ;

    res.end("Hello,大熊!") ;

 }) ;

 server.listen(8888) ;

 console.log("http server running on port 8888 ...") ;

运行结果:

Nodejs学习笔记之Stream模块

为什么使用Stream
node中的I/O是异步的,因此对磁盘和网络的读写需要通过回调函数来读取数据,下面是一个文件下载例子
上代码:

 var http = require('http') ;

 var fs = require('fs') ;

 var server = http.createServer(function (req, res) {

     fs.readFile(__dirname + '/data.txt', function (err, data) {

         res.end(data);

     }) ;

 }) ;

 server.listen(8888) ;

代码可以实现需要的功能,但是服务在发送文件数据之前需要缓存整个文件数据到内存,如果"data.txt"文件很
大并且并发量很大的话,会浪费很多内存。因为用户需要等到整个文件缓存到内存才能接受的文件数据,这样导致
用户体验相当不好。不过还好(req,res)两个参数都是Stream,这样我们可以用fs.createReadStream()代替fs.readFile()。如下:

 var http = require('http') ;

 var fs = require('fs') ;

 var server = http.createServer(function (req, res) {

     var stream = fs.createReadStream(__dirname + '/data.txt') ;

     stream.pipe(res) ;

 }) ;

 server.listen(8888) ;

.pipe()方法监听fs.createReadStream()的'data' 和'end'事件,这样"data.txt"文件就不需要缓存整
个文件,当客户端连接完成之后马上可以发送一个数据块到客户端。使用.pipe()另一个好处是可以解决当客户
端延迟非常大时导致的读写不平衡问题。

有五种基本的Stream:readable,writable,transform,duplex,and "classic” 。(具体使用请自己查阅api)

二,实例引入

当内存中无法一次装下需要处理的数据时,或者一边读取一边处理更加高效时,我们就需要用到数据流。NodeJS中通过各种Stream来提供对数据流的操作。

以大文件拷贝程序为例,我们可以为数据源创建一个只读数据流,示例如下:

 var rs = fs.createReadStream(pathname);

 rs.on('data', function (chunk) {

     doSomething(chunk) ; // 具体细节自己任意发挥

 });

 rs.on('end', function () {

     cleanUp() ;

 }) ;

代码中data事件会源源不断地被触发,不管doSomething函数是否处理得过来。代码可以继续做如下改造,以解决这个问题。

 var rs = fs.createReadStream(src) ;

 rs.on('data', function (chunk) {

     rs.pause() ;

     doSomething(chunk, function () {

         rs.resume() ;

     }) ;

 }) ;

 rs.on('end', function () {

     cleanUp();

 })  ;

给doSomething函数加上了回调,因此我们可以在处理数据前暂停数据读取,并在处理数据后继续读取数据。

此外,我们也可以为数据目标创建一个只写数据流,如下:

 var rs = fs.createReadStream(src) ;

 var ws = fs.createWriteStream(dst) ;

 rs.on('data', function (chunk) {

     ws.write(chunk);

 }) ;

 rs.on('end', function () {

     ws.end();

 }) ;

doSomething换成了往只写数据流里写入数据后,以上代码看起来就像是一个文件拷贝程序了。但是以上代码存在上边提到的问题,如果写入速度跟不上读取速度的话,只写数据流内部的缓存会爆仓。我们可以根据.write方法的返回值来判断传入的数据是写入目标了,还是临时放在了缓存了,并根据drain事件来判断什么时候只写数据流已经将缓存中的数据写入目标,可以传入下一个待写数据了。因此代码如下:

 var rs = fs.createReadStream(src) ;

 var ws = fs.createWriteStream(dst) ;

 rs.on('data', function (chunk) {

     if (ws.write(chunk) === false) {

         rs.pause() ;

     }

 }) ;

 rs.on('end', function () {

     ws.end();

 });

 ws.on('drain', function () {

     rs.resume();

 }) ;

最终实现了数据从只读数据流到只写数据流的搬运,并包括了防爆仓控制。因为这种使用场景很多,例如上边的大文件拷贝程序,NodeJS直接提供了.pipe方法来做这件事情,其内部实现方式与上边的代码类似。

下面是一个更加完整的复制文件的过程:

var fs = require('fs'),

  path = require('path'),

  out = process.stdout;

var filePath = '/bb/bigbear.mkv';

var readStream = fs.createReadStream(filePath);

var writeStream = fs.createWriteStream('file.mkv');

var stat = fs.statSync(filePath);

var totalSize = stat.size;

var passedLength = 0;

var lastSize = 0;

var startTime = Date.now();

readStream.on('data', function(chunk) {

  passedLength += chunk.length;

  if (writeStream.write(chunk) === false) {

    readStream.pause();

  }

});

readStream.on('end', function() {

  writeStream.end();

});

writeStream.on('drain', function() {

  readStream.resume();

});

setTimeout(function show() {

  var percent = Math.ceil((passedLength / totalSize) * 100);

  var size = Math.ceil(passedLength / 1000000);

  var diff = size - lastSize;

  lastSize = size;

  out.clearLine();

  out.cursorTo(0);

  out.write('已完成' + size + 'MB, ' + percent + '%, 速度:' + diff * 2 + 'MB/s');

  if (passedLength < totalSize) {

    setTimeout(show, 500);

  } else {

    var endTime = Date.now();

    console.log();

    console.log('共用时:' + (endTime - startTime) / 1000 + '秒。');

  }

}, 500);

可以把上面的代码保存为 "copy.js" 试验一下我们添加了一个递归的 setTimeout (或者直接使用setInterval)来做一个旁观者,

每500ms观察一次完成进度,并把已完成的大小、百分比和复制速度一并写到控制台上,当复制完成时,计算总的耗费时间。

三,总结一下

(1),理解Stream概念。

(2),熟练使用相关Stream的api

(3),注意细节的把控,比如:大文件的拷贝,采用的使用 “chunk data” 的形式进行分片处理。

(4),pipe的使用

(5),再次强调一个概念:一个TCP连接既是可读流,又是可写流,而Http连接则不同,一个http request对象是可读流,而http response对象则是可写流。

NodeJs 相关文章推荐
windows系统下简单nodejs安装及环境配置
Jan 08 NodeJs
跟我学Nodejs(一)--- Node.js简介及安装开发环境
May 20 NodeJs
nodejs npm包管理的配置方法及常用命令介绍
Jun 05 NodeJs
Nodejs学习笔记之Stream模块
Jan 13 NodeJs
NodeJS学习笔记之(Url,QueryString,Path)模块
Jan 13 NodeJs
Nodejs中的this详解
Mar 26 NodeJs
NodeJS中的MongoDB快速入门详细教程
Nov 11 NodeJs
详解NodeJS框架express的路径映射(路由)功能及控制
Mar 24 NodeJs
nodejs中密码加密处理操作详解
Mar 20 NodeJs
nodejs 简单实现动态html的方法
May 12 NodeJs
Nodejs处理异常操作示例
Dec 25 NodeJs
Nodejs + sequelize 实现增删改查操作
Nov 07 NodeJs
Nodejs学习笔记之NET模块
Jan 13 #NodeJs
Nodejs学习笔记之Global Objects全局对象
Jan 13 #NodeJs
Nodejs为什么选择javascript为载体语言
Jan 13 #NodeJs
NodeJS中Buffer模块详解
Jan 07 #NodeJs
Nodejs中读取中文文件编码问题、发送邮件和定时任务实例
Jan 01 #NodeJs
Nodejs中调用系统命令、Shell脚本和Python脚本的方法和实例
Jan 01 #NodeJs
nodejs中实现路由功能
Dec 29 #NodeJs
You might like
DOMXML函数笔记
2006/10/09 PHP
PHP遍历二维数组的代码
2011/04/22 PHP
PHP打印输出函数汇总
2016/08/28 PHP
Yii CFileCache 获取不到值的原因分析
2017/02/08 PHP
PHP+Redis 消息队列 实现高并发下注册人数统计的实例
2018/01/29 PHP
详解phpstorm2020最新破解方法
2020/09/17 PHP
关于恒等于(===)和非恒等于(!==)
2007/08/20 Javascript
jQuery开发者都需要知道的5个小技巧
2010/01/08 Javascript
js 多种变量定义(对象直接量,数组直接量和函数直接量)
2010/05/24 Javascript
jquery调用asp.net 页面后台的实现代码
2011/04/27 Javascript
js新闻滚动 js如何实现新闻滚动效果
2013/01/07 Javascript
JavaScript面向对象编程入门教程
2014/04/16 Javascript
JavaScript AJAX之惰性载入函数
2014/08/27 Javascript
Javascript之Math对象详解
2016/06/07 Javascript
使用vue.js制作分页组件
2016/06/27 Javascript
JS模拟实现方法重载示例
2016/08/03 Javascript
微信小程序链接传参并跳转新页面
2016/11/29 Javascript
Bootstrap源码解读标签、徽章、缩略图和警示框(8)
2016/12/26 Javascript
在vue中获取dom元素内容的方法
2017/07/10 Javascript
使用layer弹窗和layui表单实现新增功能
2018/08/09 Javascript
微信小程序外卖选购页实现切换分类与数量加减功能案例
2019/01/15 Javascript
个人小程序接入支付解决方案
2019/05/23 Javascript
vue分页器组件编写方法详解
2019/06/28 Javascript
JS实现动态倒计时功能(天数、时、分、秒)
2019/12/12 Javascript
Python中计算三角函数之cos()方法的使用简介
2015/05/15 Python
详解python中的 is 操作符
2017/12/26 Python
python处理DICOM并计算三维模型体积
2019/02/26 Python
CSS3中Color的一些特性介绍
2012/05/27 HTML / CSS
Chinti & Parker官网:奢华羊绒女装和创新针织设计
2021/01/01 全球购物
英文版网络工程师求职信
2013/10/28 职场文书
迟到检讨书900字
2014/01/14 职场文书
将相和教学反思
2014/02/04 职场文书
副主任竞聘演讲稿
2014/08/18 职场文书
公司总经理岗位职责
2015/04/01 职场文书
2015年监理个人工作总结
2015/05/23 职场文书
「回转企鹅罐」10周年纪念展「輪るピングドラム展」海报公开
2022/03/22 日漫