编程 Python

Python DataFrame.groupby()聚合函数,分组级运算

Posted in Python onSeptember 18, 2018

pandas提供了一个灵活高效的groupby功能，它使你能以一种自然的方式对数据集进行切片、切块、摘要等操作。根据一个或多个键（可以是函数、数组或DataFrame列名）拆分pandas对象。计算分组摘要统计，如计数、平均值、标准差，或用户自定义函数。对DataFrame的列应用各种各样的函数。应用组内转换或其他运算，如规格化、线性回归、排名或选取子集等。计算透视表或交叉表。执行分位数分析以及其他分组分析。

groupby分组函数：

返回值：返回重构格式的DataFrame，特别注意，groupby里面的字段内的数据重构后都会变成索引

groupby(),一般和sum()、mean()一起使用，如下例：

先自定义生成数组

import pandas as pd
df = pd.DataFrame({'key1':list('ababa'),
  'key2': ['one','two','one','two','one'],
  'data1': np.random.randn(5),
  'data2': np.random.randn(5)})
print(df)

 data1 data2 key1 key2
0 -1.313101 -0.453361 a one
1 0.791463 1.096693 b two
2 0.462611 1.150597 a one
3 -0.216121 1.381333 b two
4 0.077367 -0.282876 a one

应用groupby,分组键均为Series(譬如df[‘xx'])，实际上分组键可以是任何长度适当的数组

#将df['data1']按照分组键为df['key1']进行分组
grouped=df['data1'].groupby(df['key1'])
print(grouped.mean())
key1
a -0.257707
b 0.287671
Name: data1, dtype: float64
states=np.array(['Ohio','California','California','Ohio','Ohio'])
years=np.array([2005,2005,2006,2005,2006])
#states第一层索引，years第二层分层索引
print(df['data1'].groupby([states,years]).mean())
California 2005 0.791463
 2006 0.462611
Ohio 2005 -0.764611
 2006 0.077367
Name: data1, dtype: float64
#df根据‘key1'分组，然后对df剩余数值型的数据运算
df.groupby('key1').mean()
 data1 data2
key1  
a -0.257707 0.138120
b 0.287671 1.239013
#可以看出没有key2列，因为df[‘key2']不是数值数据，所以被从结果中移除。默认情况下，所有数值列都会被聚合，虽然有时可能被过滤为一个子集。

对分组进行迭代

#name就是groupby中的key1的值，group就是要输出的内容
for name, group in df.groupby('key1'):
 print (name,group)
a data1 data2 key1 key2
0 -1.313101 -0.453361 a one
2 0.462611 1.150597 a one
4 0.077367 -0.282876 a one
b data1 data2 key1 key2
1 0.791463 1.096693 b two
3 -0.216121 1.381333 b two

对group by后的内容进行操作，可转换成字典

#转化为字典
piece=dict(list(df.groupby('key1')))
{'a': data1 data2 key1 key2
 0 -1.313101 -0.453361 a one
 2 0.462611 1.150597 a one
 4 0.077367 -0.282876 a one, 'b': data1 data2 key1 key2
 1 0.791463 1.096693 b two
 3 -0.216121 1.381333 b two}
#对字典取值
value = piece['a']

groupby默认是在axis=0上进行分组的，通过设置也可以在其他任何轴上进行分组

grouped=df.groupby(df.dtypes, axis=1)
value = dict(list(grouped))
print(value)
{dtype('float64'): data1 data2
0 -1.313101 -0.453361
1 0.791463 1.096693
2 0.462611 1.150597
3 -0.216121 1.381333
4 0.077367 -0.282876, dtype('O'): key1 key2
0 a one
1 b two
2 a one
3 b two
4 a one}

对于大数据，很多情况是只需要对部分列进行聚合

#对df进行'key1'，'key2'的两次分组，然后取data2的数据，对两次细分的分组数据取均值
value = df.groupby(['key1','key2'])[['data2']].mean()
 data2
key1 key2 
a one 0.138120
b two 1.239013
----------------------------------
df
Out[1]: 
 data1 data2 key1 key2
0 -1.313101 -0.453361 a one
1 0.791463 1.096693 b two
2 0.462611 1.150597 a one
3 -0.216121 1.381333 b two
4 0.077367 -0.282876 a one
----------------------------------
df['key2'].iloc[-1] ='two'
value = df.groupby(['key1','key2'])[['data2']].mean()
value
Out[2]: 
 data2
key1 key2 
a one 0.348618
 two -0.282876
b two 1.239013

Python中的分组函数（groupby、itertools）

from operator import itemgetter #itemgetter用来去dict中的key，省去了使用lambda函数
from itertools import groupby #itertool还包含有其他很多函数，比如将多个list联合起来。。
d1={'name':'zhangsan','age':20,'country':'China'}
d2={'name':'wangwu','age':19,'country':'USA'}
d3={'name':'lisi','age':22,'country':'JP'}
d4={'name':'zhaoliu','age':22,'country':'USA'}
d5={'name':'pengqi','age':22,'country':'USA'}
d6={'name':'lijiu','age':22,'country':'China'}
lst=[d1,d2,d3,d4,d5,d6]
#通过country进行分组：
lst.sort(key=itemgetter('country')) #需要先排序，然后才能groupby。lst排序后自身被改变
lstg = groupby(lst,itemgetter('country')) 
#lstg = groupby(lst,key=lambda x:x['country']) 等同于使用itemgetter()
for key,group in lstg:
 for g in group: #group是一个迭代器，包含了所有的分组列表
 print key,g
返回：
China {'country': 'China', 'age': 20, 'name': 'zhangsan'}
China {'country': 'China', 'age': 22, 'name': 'lijiu'}
JP {'country': 'JP', 'age': 22, 'name': 'lisi'}
USA {'country': 'USA', 'age': 19, 'name': 'wangwu'}
USA {'country': 'USA', 'age': 22, 'name': 'zhaoliu'}
USA {'country': 'USA', 'age': 22, 'name': 'pengqi'}
print [key for key,group in lstg] #返回：['China', 'JP', 'USA']
print [(key,list(group)) for key,group in lstg]
#返回的list中包含着三个元组：
[('China', [{'country': 'China', 'age': 20, 'name': 'zhangsan'}, {'country': 'China', 'age': 22, 'name': 'lijiu'}]), ('JP', [{'country': 'JP', 'age': 22, 'name': 'lisi'}]), ('USA', [{'country': 'USA', 'age': 19, 'name': 'wangwu'}, {'country': 'USA', 'age': 22, 'name': 'zhaoliu'}, {'country': 'USA', 'age': 22, 'name': 'pengqi'}])]
print dict([(key,list(group)) for key,group in lstg])
#返回的是一个字典：
{'JP': [{'country': 'JP', 'age': 22, 'name': 'lisi'}], 'China': [{'country': 'China', 'age': 20, 'name': 'zhangsan'}, {'country': 'China', 'age': 22, 'name': 'lijiu'}], 'USA': [{'country': 'USA', 'age': 19, 'name': 'wangwu'}, {'country': 'USA', 'age': 22, 'name': 'zhaoliu'}, {'country': 'USA', 'age': 22, 'name': 'pengqi'}]}
print dict([(key,len(list(group))) for key,group in lstg])
#返回每个分组的个数：
{'JP': 1, 'China': 2, 'USA': 3}

#返回包含有2个以上元素的分组
print [key for key,group in groupby(sorted(lst,key=itemgetter('country')),itemgetter('country')) if len(list(group))>=2]
#返回：['China', 'USA']

lstg = groupby(sorted(lst,key=itemgetter('country')),key=itemgetter('country')) 
lstgall=[(key,list(group)) for key,group in lstg ]
print dict(filter(lambda x:len(x[1])>2,lstgall)) 
#过滤出分组后的元素个数大于2个的分组，返回：
{'USA': [{'country': 'USA', 'age': 19, 'name': 'wangwu'}, {'country': 'USA', 'age': 22, 'name': 'zhaoliu'}, {'country': 'USA', 'age': 22, 'name': 'pengqi'}]}

自定义分组：

from itertools import groupby
lst=[2,8,11,25,43,6,9,29,51,66]

def gb(num):
 if num <= 10:
 return 'less'
 elif num >=30:
 return 'great'
 else:
 return 'middle'
print [(k,list(g))for k,g in groupby(sorted(lst),key=gb)]
返回：
[('less', [2, 6, 8, 9]), ('middle', [11, 25, 29]), ('great', [43, 51, 66])]

总结

以上就是这篇文章的全部内容了，希望本文的内容对大家的学习或者工作具有一定的参考学习价值，谢谢大家对三水点靠木的支持。如果你想了解更多相关内容请查看下面相关链接

Python DataFrame.groupby()聚合函数,分组级运算

- Author -

brucewong0516

声明：登载此文出于传递更多信息之目的，并不意味着赞同其观点或证实其描述。

Python 相关文章推荐

python多线程扫描端口示例

Jan 16 Python

python Django批量导入不重复数据

Mar 25 Python

Python中str.format()详解

Mar 12 Python

python非递归全排列实现方法

Apr 10 Python

python爬虫框架talonspider简单介绍

Jun 09 Python

python下载文件记录黑名单的实现代码

Oct 24 Python

python定时利用QQ邮件发送天气预报的实例

Nov 17 Python

Python3 XML 获取雅虎天气的实现方法

Feb 01 Python

Python3之手动创建迭代器的实例代码

May 22 Python

python五子棋游戏的设计与实现

Jun 18 Python

Python configparser模块应用过程解析

Aug 14 Python

解决pip安装的第三方包在PyCharm无法导入的问题

Oct 15 Python

python 3.6.2 安装配置方法图文教程

Sep 18 #Python

Python对CSV、Excel、txt、dat文件的处理

Sep 18 #Python

python 3.6.4 安装配置方法图文教程

Sep 18 #Python

python 3.6.5 安装配置方法图文教程

Sep 18 #Python

python的pip安装以及使用教程

Sep 18 #Python

windows下python安装小白入门教程

Sep 18 #Python

使用Python如何测试InnoDB与MyISAM的读写性能

Sep 18 #Python

You might like

利用static实现表格的颜色隔行显示

2006/10/09 PHP

PHP设计模式之调解者模式的深入解析

2013/06/13 PHP

解析PHP中常见的mongodb查询操作

2013/06/20 PHP

WordPress特定文章对搜索引擎隐藏或只允许搜索引擎查看

2015/12/31 PHP

PHP数组编码gbk与utf8互相转换的两种方法

2016/09/01 PHP

jquery关于图形报表的运用实现代码

2011/01/06 Javascript

JS定时刷新页面及跳转页面的方法

2013/07/04 Javascript

js中cookie的添加、取值、删除示例代码

2013/10/21 Javascript

jquery.gridrotator实现响应式图片展示画廊效果

2015/06/23 Javascript

基于javascript实现图片切换效果

2016/04/17 Javascript

利用angularjs1.4制作的简易滑动门效果

2017/02/28 Javascript

JavaScript队列的应用实例详解【经典数据结构】

2017/04/12 Javascript

JS实现点击Radio动态更新table数据

2017/07/18 Javascript

基于js中this和event 的区别(详解)

2017/10/24 Javascript

如何使用webpack打包一个库library的方法步骤

2019/12/18 Javascript

JS实现TITLE悬停长久显示效果完整示例

2020/02/11 Javascript

vue点击标签切换选中及互相排斥操作

2020/07/17 Javascript

JQuery+drag.js上传图片并且实现图片拖曳

2020/11/18 jQuery

[03:42]2014DOTA2国际邀请赛第三日比赛排位扑朔迷离

2014/07/12 DOTA

[51:34]Ti4主赛事胜者组 DK vs EG 2

2014/07/19 DOTA

[57:55]EG vs Fnatic 2018国际邀请赛小组赛BO2 第一场 8.19

2018/08/21 DOTA

python实现的一个火车票转让信息采集器

2014/07/09 Python

Linux下使用python调用top命令获得CPU利用率

2015/03/10 Python

详解python调用cmd命令三种方法

2019/07/08 Python

python解析命令行参数的三种方法详解

2019/11/29 Python

解决python对齐错误的方法

2020/07/16 Python

Python通过format函数格式化显示值

2020/10/17 Python

python基于exchange函数发送邮件过程详解

2020/11/06 Python

详解使用双缓存解决Canvas clearRect引起的闪屏问题

2019/04/29 HTML / CSS

C#和SQL Server的面试题

2016/08/12 面试题

AJAX应用和传统Web应用有什么不同

2013/08/24 面试题

房地产销售计划书

2014/01/10 职场文书

抄袭同学作业检讨书1000字

2014/11/20 职场文书

高三复习计划

2015/01/19 职场文书

教师反邪教心得体会

2016/01/15 职场文书

解决Maven项目中 Invalid bound statement 无效的绑定问题

2021/06/15 Java/Android