Pandas时间序列重采样(resample)方法中closed、label的作用详解


Posted in Python onDecember 10, 2019

Pandas提供了便捷的方式对时间序列进行重采样,根据时间粒度的变大或者变小分为降采样和升采样:

  • 降采样:时间粒度变大。例如,原来是按天统计的数据,现在变成按周统计。降采样会涉及到数据的聚合,比如天数据变成周数据,那么就得对一周的7天数据聚合,聚合的方式可以是求和,求均值等等。
  • 升采样:时间粒度变小。例如,原来是按周统计的数据,现在变成按天统计。升采样会涉及到数据的填充,根据填充的方法不同填充的数据也就不同。

下面涉及的例子,都需要导入numpy和pandas(如下),并且对于降采样数据的聚合做简单的求和处理。

import numpy as np
import pandas as pd

Pandas重采样方法resample

在Pandas里,通过resample来处理重采样,根据频率的不同(freq)会处理成降采样或者升采样。我们先来看看Resample的定义和关键参数注释:

resample(self, rule, how=None, axis=0, fill_method=None, closed=None, label=None, convention='start', kind=None, loffset=None, limit=None, base=0, on=None, level=None)
  Convenience method for frequency conversion and resampling of time
  series. Object must have a datetime-like index (DatetimeIndex,
  PeriodIndex, or TimedeltaIndex), or pass datetime-like values
  to the on or level keyword.
  
Parameters
----------
closed : {'right', 'left'}
    Which side of bin interval is closed. The default is ‘left' for all frequency offsets except for ‘M', ‘A', ‘Q', ‘BM', ‘BA', ‘BQ', and ‘W' which all have a default of ‘right'.
label : {'right', 'left'}
    Which bin edge label to label bucket with. The default is ‘left' for all frequency offsets except for ‘M', ‘A', ‘Q', ‘BM', ‘BA', ‘BQ', and ‘W' which all have a default of ‘right'.

第一眼看closed和label这两个参数,会感觉云里雾里,即使看了例子也可能会觉得莫名奇妙。下面我们通过具体的降采样和升采样例子,来解读一下这个两个参数内含的玄机。

降采样

首先先来创建一个时间序列,起始日期是2018/01/01,一共12天,每天对应的数值分别是1到12:

rng = pd.date_range('20180101', periods=12)
ts = pd.Series(np.arange(1,13), index=rng)

print(ts)

#### Outputs ####
2018-01-01   1
2018-01-02   2
2018-01-03   3
2018-01-04   4
2018-01-05   5
2018-01-06   6
2018-01-07   7
2018-01-08   8
2018-01-09   9
2018-01-10  10
2018-01-11  11
2018-01-12  12
Freq: D, dtype: int32

下面使用resample方法来做降采样处理,频率是5天,上面提到的两个参数,都使用默认值:

ts_5d = ts.resample('5D').sum()
print(ts_5d)

#### Outputs ####
2018-01-01  15
2018-01-06  40
2018-01-11  23
Freq: 5D, dtype: int32

到这里,我相信不论是代码还是代码的结果都很好理解:无非就是每5天来个求和。在第一部分中,我们列出了closed参数的注释,从注释可知,closed默认的值是'left'。那如果把closed的值改为'right',结果有是怎么样的?

ts_5d_rightclosed = ts.resample('5D', closed='right').sum()
print(ts_5d_rightclosed)

#### Outputs ####
2017-12-27   1
2018-01-01  20
2018-01-06  45
2018-01-11  12
Freq: 5D, dtype: int32

怎么会这样?为什么变成了四个区间?closed=right到底做了什么?

别着急,我们来一步一步看看,这其中发生了什么事情。原始的时间序列是从18年1月1号到1月12号,一共12天。以5天为单位降采样处理后,变成了三个5天,分别是:

  • 第一个5天:1-2-3-4-5-6
  • 第二个5天:6-7-8-9-10-11
  • 第三个5天:12-13-14-15-16

实际上,这三个5天就是三个区间了。和数学里区间的概念一样,区间有开和闭的概念。在resample中,区间的开和闭,就是通过closed这个参数来控制。用数学符号表示的话:

closed = 'left' 左闭右开

上面的三个5天可以由以下的三个左闭右开的区间构成:

  • 区间1:[1, 6)
  • 区间2: [6, 11)
  • 区间3:[11, 16) 例子中,时间只到12号为止,但是这里会往后补足5天

现在,在这三个区间上做数据聚合也就很好理解了。对于区间1进行求和,也就是12、13、14、15、16这5天的值求和即可。区间2和区间3也是同理。所以下面的代码就很好理解了:

ts_5d_leftclosed = ts.resample('5D', closed='right').sum()
print(ts_5d_leftclosed)

#### Outputs ####
2018-01-01  15
2018-01-06  40
2018-01-11  23
Freq: 5D, dtype: int32

closed = 'right' 左开右闭

上面的三个5天可以由以下的四个左开右闭的区间构成。注意,由于第一个5天是从1号到6号,但由于是左开区间,1号就落不到1到6号的那个区间,所以要往前补足:

  • 区间1:(27, 1]
  • 区间2:(1, 6]
  • 区间3: (6, 11]
  • 区间4:(11, 16]

现在,在这四个区间上做数据聚合也是一样的道理了:对于区间1,是对28,29,30,31,1这五天的值求和(这里只有1号是有值的),其余的区间也是同理,但需要注意是左开右闭。所以到这里,上面“莫名其妙”的代码和结果就好理解了。复制代码和结果如下:

ts_5d_rightclosed = ts.resample('5D', closed='right').sum()
print(ts_5d_rightclosed)

#### Outputs ####
2017-12-27   1
2018-01-01  20
2018-01-06  45
2018-01-11  12
Freq: 5D, dtype: int32

理解了clsoed的意义以后,再来理解label就so easy了。由注释可知,label的默认值是left。下面在closed='right'的基础上,将label设置为right:

ts_5d_rightclosed_rightlable = ts.resample('5D', closed='right', label='right').sum()
print(ts_5d_rightclosed_rightlable)

#### Outputs ####
2018-01-01   1
2018-01-06  20
2018-01-11  45
2018-01-16  12
Freq: 5D, dtype: int32

于label为left相比,二者结果的异同点如下:

  • 相同点:一样是四个区间,每个区间的聚合的值是一样的
  • 不同点:每个区间的索引不同

不难发现,label为left的时候,就以区间左边的那个日期作为索引;label,就以区间的右边那个日期作为索引。

综上,我们可以总结一下closed和label的用法和意义了:

  • closed:划分区间的依据,left会划成左闭右开区间;right会划分成左开右闭的区间。一般来说,closed为right的时候,区间会比为left的时候多一个。区间划分完毕,聚合运算就在这个区间内执行。
  • label:划分区间完毕,根据label的不同,区间的索引就不同。如果label为left,则区间左边的日期作为索引;如果label为right,则区间右边的日期作为索引。

升采样

创建一个时间序列,起始日期是2018/01/01,一共2天,每天对应的数值分别是1到2:

rng = pd.date_range('20180101', periods=2)
ts = pd.Series(np.arange(1,2), index=rng)

print(ts)

#### Outputs ####
2018-01-01  1
2018-01-02  2
Freq: D, dtype: int32

升采样就不涉及到closed和label的值,也就是会忽略(筒子们可以验证一下),所以我们在使用的时候无需设置这两个值。对于升采样,前面也提到,主要是涉及到值的填充。有下面的四种填充方法(实际是三种):

  • 不填充。那么对应无值的地方,用NaN代替。对应的方法是asfreq。
  • 用前值填充。用前面的值填充无值的地方。对应的方法是ffill或者pad。这里方便记忆,ffill的第一个f是代表forward,向前的意思
  • 用后值填充。对应的方法是bfill,b代表back。

下面是一个例子:

ts_6h_asfreq = ts.resample('6H').asfreq()
print(ts_6h_asfreq)

ts_6h_pad = ts.resample('6H').pad()
print(ts_6h_pad)

ts_6h_ffill = ts.resample('6H').ffill()
print(ts_6h_ffill)

ts_6h_bfill = ts.resample('6H').bfill()
print(ts_6h_bfill)

#### Outputs ####
2018-01-01 00:00:00  1.0
2018-01-01 06:00:00  NaN
2018-01-01 12:00:00  NaN
2018-01-01 18:00:00  NaN
2018-01-02 00:00:00  2.0
Freq: 6H, dtype: float64
2018-01-01 00:00:00  1
2018-01-01 06:00:00  1
2018-01-01 12:00:00  1
2018-01-01 18:00:00  1
2018-01-02 00:00:00  2
Freq: 6H, dtype: int32
2018-01-01 00:00:00  1
2018-01-01 06:00:00  1
2018-01-01 12:00:00  1
2018-01-01 18:00:00  1
2018-01-02 00:00:00  2
Freq: 6H, dtype: int32
2018-01-01 00:00:00  1
2018-01-01 06:00:00  2
2018-01-01 12:00:00  2
2018-01-01 18:00:00  2
2018-01-02 00:00:00  2
Freq: 6H, dtype: int32

以上就是本文的全部内容,希望对大家的学习有所帮助,也希望大家多多支持三水点靠木。

Python 相关文章推荐
Python中输出ASCII大文字、艺术字、字符字小技巧
Apr 28 Python
python UNIX_TIMESTAMP时间处理方法分析
Apr 18 Python
Python中index()和seek()的用法(详解)
Apr 27 Python
Python实现字符串与数组相互转换功能示例
Sep 22 Python
python中文乱码不着急,先看懂字节和字符
Dec 20 Python
Python实现对文件进行单词划分并去重排序操作示例
Jul 10 Python
Django 数据库同步操作技巧详解
Jul 19 Python
python excel转换csv代码实例
Aug 26 Python
Python实现大数据收集至excel的思路详解
Jan 03 Python
Python使用socketServer包搭建简易服务器过程详解
Jun 12 Python
Python爬虫过程解析之多线程获取小米应用商店数据
Nov 14 Python
如何设置PyCharm中的Python代码模版(推荐)
Nov 20 Python
Python3的unicode编码转换成中文的问题及解决方案
Dec 10 #Python
用OpenCV将视频分解成单帧图片,图片合成视频示例
Dec 10 #Python
python3 webp转gif格式的实现示例
Dec 10 #Python
Spring Cloud Feign高级应用实例详解
Dec 10 #Python
flask 使用 flask_apscheduler 做定时循环任务的实现
Dec 10 #Python
使用opencv将视频帧转成图片输出
Dec 10 #Python
django框架cookie和session用法实例详解
Dec 10 #Python
You might like
escape unescape的php下的实现方法
2007/04/27 PHP
php 缩略图实现函数代码
2011/06/23 PHP
PHP操作Redis常用技巧总结
2018/04/24 PHP
关于__defineGetter__ 和__defineSetter__的说明
2007/05/12 Javascript
jquery实现的带缩略图的焦点图片切换(自动播放/响应鼠标动作)
2013/01/23 Javascript
Js获取下拉框选定项的值和文本的实现代码
2014/02/26 Javascript
Ajax中解析Json的两种方法对比分析
2015/06/25 Javascript
innerHTML中标签可以换行的方法汇总
2015/08/14 Javascript
javascript实现获取浏览器版本、浏览器类型
2015/12/02 Javascript
Bootstrap每天必学之级联下拉菜单
2016/03/27 Javascript
sea.js常用的api简易文档
2016/11/15 Javascript
利用js编写网页进度条效果
2017/10/08 Javascript
JS控制鼠标拒绝点击某一按钮的实例
2017/12/29 Javascript
Angular搜索场景中使用rxjs的操作符处理思路
2018/05/30 Javascript
vue中引入mxGraph的步骤详解
2019/05/17 Javascript
JavaScript 绘制饼图的示例
2021/02/19 Javascript
Python中使用socket发送HTTP请求数据接收不完整问题解决方法
2015/02/04 Python
Python中字典和集合学习小结
2017/07/07 Python
python+matplotlib实现鼠标移动三角形高亮及索引显示
2018/01/15 Python
Django 多环境配置详解
2019/05/14 Python
关于python中的xpath解析定位
2020/03/06 Python
django-csrf使用和禁用方式
2020/03/13 Python
Numpy 多维数据数组的实现
2020/06/18 Python
Python中logger日志模块详解
2020/08/04 Python
Python 实现键盘鼠标按键模拟
2020/11/18 Python
matplotlib绘制正余弦曲线图的实现
2021/02/22 Python
集团薪酬管理制度
2014/01/13 职场文书
小学生秋游活动方案
2014/02/23 职场文书
师范大学生求职信
2014/06/13 职场文书
2016国培学习心得体会
2016/01/08 职场文书
Python机器学习算法之决策树算法的实现与优缺点
2021/05/13 Python
python开发的自动化运维工具ansible详解
2021/08/07 Python
Vue实现跑马灯样式文字横向滚动
2021/11/23 Vue.js
Vue如何清空对象
2022/03/03 Vue.js
python中urllib包的网络请求教程
2022/04/19 Python
pandas时间序列之pd.to_datetime()的实现
2022/06/16 Python