分享python数据统计的一些小技巧


Posted in Python onJuly 21, 2016

最近在用python做数据统计,这里总结了一些最近使用时查找和总结的一些小技巧,希望能帮助在做这方面时的一些童鞋。有些技巧是很平常的用法,平时我们没有注意,但是在特定场景,这些小方法还是能带来很大的帮助。

1.在字典中将键映射到多个值上面

{'b': [4, 5, 6], 
'a': [1, 2, 3]}

有时候我们在统计相同key值的时候,希望把所有相同key的条目添加到以key为键的一个字典中,然后再进行各种操作,这时候我们就可以使用下面的代码进行操作:

from collections import defaultdict
d = defaultdict(list)
print(d)
d['a'].append(1)
d['a'].append(2)
d['a'].append(3)
d['b'].append(4)
d['b'].append(5)
d['b'].append(6)
print(d)
print(d.get("a"))
print(d.keys())
print([d.get(i) for i in d])

这里是使用了collections中的方法,这里面还拥有很多有用的方法,我们有时间在继续进行深入了解。

上面代码运行结果:

defaultdict(, {})
defaultdict(, {'b': [4, 5, 6], 'a': [1, 2, 3]})
[1, 2, 3]
dict_keys(['b', 'a'])
[[4, 5, 6], [1, 2, 3]]

我们将数据填入之后,相当于进行快速分组,然后遍历每个组就可以统计一些我们需要的数据。

2.迅速转换字典键值对

data = {...}
zip(data.values(), data.keys())

data是我们的格式数据,使用zip后进行快速键值转换,然后可以使用max,min之类函数进行数据操作。

3.通过公共键对字典进行排序

from operator import itemgetter
data = [
  {'name': "bran", "uid": 101},
  {'name': "xisi", "uid": 102},
  {'name': "land", "uid": 103}
]
print(sorted(data, key=itemgetter("name")))
print(sorted(data, key=itemgetter("uid")))

数据格式就是data,我们想要对name或者uid进行排序我们就是用代码中的方法。
运行结果:

[{'name': 'bran', 'uid': 101}, {'name': 'land', 'uid': 103}, {'name': 'xisi', 'uid': 102}]
[{'name': 'bran', 'uid': 101}, {'name': 'xisi', 'uid': 102}, {'name': 'land', 'uid': 103}]

正如我们期望中的一样

4.对列表中的多个字典根据某一字段进行分组

注意注意,在进行分组前要首先对数据进行排序处理,排序字段根据实际要求来选择

即将处理的数据:

rows = [
  {'name': "bran", "uid": 101, "class": 13},
  {'name': "xisi", "uid": 101, "class": 11},
  {'name': "land", "uid": 103, "class": 10}
]

期望处理结果:

{
101: [{'name': 'xisi', 'class': 11, 'uid': 101},{'name': 'bran', 'class': 13, 'uid': 101}],
103: [{'name': 'land', 'class': 10, 'uid': 103}]
}

我们按照uid进行分组,这里只是演示,uid一般也不会重复。

这个比较复杂一点,我们一部一步来分解

some = [('a', [1, 2, 3]), ('b', [4, 5, 6])]
print(dict(some))

结果:

{'b': [4, 5, 6], 'a': [1, 2, 3]}

这里我们的目的是将元组转换成字典,这个很简单,应该都能看懂。接着我们来下一步对待处理数据进行排序:

data_one = sorted(rows, key=itemgetter("class"))
print(data_one)
data_two = sorted(rows, key=lambda x: (x["uid"], x["class"]))
print(data_two)

这里我们提供两种排序方式原理相同,只是样式稍有区别,第一种data_one是直接使用itemgetter,按照我们前面使用过得,直接按照某一字段进行排序,可是有时候我们会有另一种要求:

先按照某一字段排序,当第一字段重复时,再按照另一字段排序。

这时我们就用第二种方法,进行多字段值排序。
排序结果如下:

[{'name': 'land', 'class': 10, 'uid': 103}, {'name': 'xisi', 'class': 11, 'uid': 101}, {'name': 'bran', 'class': 13, 'uid': 101}]
[{'name': 'xisi', 'class': 11, 'uid': 101}, {'name': 'bran', 'class': 13, 'uid': 101}, {'name': 'land', 'class': 10, 'uid': 103}]

结果大家慢慢看一下,还是略有差别。

接下来就进行最后一步了,将我们刚才讲的两种方式结合起来使用:

data = dict([(g, list(k)) for g, k in groupby(data_two, key=lambda x: x["uid"])])
print(data)

我们对排序好的数据进行分组,然后生成元组列表,最后将其转换成字典,这里大功告成,我们成功将数据进行分组。

python数据统计的一些小技巧就分享到这,有需要的可以参考学习。

Python 相关文章推荐
Django rest framework实现分页的示例
May 24 Python
Python实现快速计算词频功能示例
Jun 25 Python
在python Numpy中求向量和矩阵的范数实例
Aug 26 Python
python 公共方法汇总解析
Sep 16 Python
在keras里实现自定义上采样层
Jun 28 Python
解决Pycharm 中遇到Unresolved reference 'sklearn'的问题
Jul 13 Python
python中判断文件结束符的具体方法
Aug 04 Python
简单了解Python字典copy与赋值的区别
Sep 16 Python
python爬虫中的url下载器用法详解
Nov 30 Python
python解决OpenCV在读取显示图片的时候闪退的问题
Feb 23 Python
浅析python中特殊文件和特殊函数
Feb 24 Python
Python中Schedule模块使用详解 周期任务神器
Apr 19 Python
python中print的不换行即时输出的快速解决方法
Jul 20 #Python
Python全局变量用法实例分析
Jul 19 #Python
python对象及面向对象技术详解
Jul 19 #Python
python异常和文件处理机制详解
Jul 19 #Python
python线程、进程和协程详解
Jul 19 #Python
浅谈python字符串方法的简单使用
Jul 18 #Python
python读取oracle函数返回值
Jul 18 #Python
You might like
PHP读取mssql json数据中文乱码的解决办法
2016/04/11 PHP
php使用strip_tags()去除html标签仍有空白的解决方法
2016/07/28 PHP
redirect_uri参数错误的解决方法(必看)
2017/02/16 PHP
Laravel学习基础之migrate的使用教程
2017/10/11 PHP
js实现回放拖拽轨迹从过程上进行分析
2014/06/26 Javascript
3种Jquery限制文本框只能输入数字字母的方法
2014/12/03 Javascript
DOM 事件流详解
2015/01/20 Javascript
JQuery给网页更换皮肤的方法
2015/05/30 Javascript
JavaScript入门基础
2015/08/12 Javascript
jquery实现的横向二级导航效果代码
2015/08/26 Javascript
jQuery实现用户输入自动完成功能
2017/02/13 Javascript
看看“疫苗查询”小程序有温度的代码
2018/07/31 Javascript
总结4个方面优化Vue项目
2019/02/11 Javascript
微信小程序 调用远程接口 给全局数组赋值代码实例
2019/08/13 Javascript
layui操作列按钮个数和文字颜色的判断实例
2019/09/11 Javascript
详解Vue 项目中的几个实用组件(ts)
2019/10/29 Javascript
关于vue里页面的缓存详解
2019/11/04 Javascript
Angular+ionic实现折叠展开效果的示例代码
2020/07/29 Javascript
Python字符编码与函数的基本使用方法
2017/09/30 Python
Python自动化运维_文件内容差异对比分析
2017/12/13 Python
Python中装饰器学习总结
2018/02/10 Python
python实现word 2007文档转换为pdf文件
2018/03/15 Python
python 2.7.13 安装配置方法图文教程
2018/09/18 Python
Python 爬虫实现增加播客访问量的方法实现
2019/10/31 Python
Python如何使用队列方式实现多线程爬虫
2020/05/12 Python
Python如何创建装饰器时保留函数元信息
2020/08/07 Python
美国女性服饰销售网站:Nasty Gal(坏女孩)
2016/07/26 全球购物
广州某公司软件工程师面试题
2014/12/22 面试题
教学实验楼管理制度
2014/02/01 职场文书
校庆标语集锦
2014/06/25 职场文书
篮球社团活动总结
2014/06/27 职场文书
总经理司机岗位职责
2015/04/10 职场文书
如何写好竞聘报告
2019/04/03 职场文书
关于感恩的素材句子(38句)
2019/11/11 职场文书
Nginx如何配置Http、Https、WS、WSS的方法步骤
2021/05/11 Servers
MySQL外键约束(FOREIGN KEY)案例讲解
2021/08/23 MySQL