分享python数据统计的一些小技巧


Posted in Python onJuly 21, 2016

最近在用python做数据统计,这里总结了一些最近使用时查找和总结的一些小技巧,希望能帮助在做这方面时的一些童鞋。有些技巧是很平常的用法,平时我们没有注意,但是在特定场景,这些小方法还是能带来很大的帮助。

1.在字典中将键映射到多个值上面

{'b': [4, 5, 6], 
'a': [1, 2, 3]}

有时候我们在统计相同key值的时候,希望把所有相同key的条目添加到以key为键的一个字典中,然后再进行各种操作,这时候我们就可以使用下面的代码进行操作:

from collections import defaultdict
d = defaultdict(list)
print(d)
d['a'].append(1)
d['a'].append(2)
d['a'].append(3)
d['b'].append(4)
d['b'].append(5)
d['b'].append(6)
print(d)
print(d.get("a"))
print(d.keys())
print([d.get(i) for i in d])

这里是使用了collections中的方法,这里面还拥有很多有用的方法,我们有时间在继续进行深入了解。

上面代码运行结果:

defaultdict(, {})
defaultdict(, {'b': [4, 5, 6], 'a': [1, 2, 3]})
[1, 2, 3]
dict_keys(['b', 'a'])
[[4, 5, 6], [1, 2, 3]]

我们将数据填入之后,相当于进行快速分组,然后遍历每个组就可以统计一些我们需要的数据。

2.迅速转换字典键值对

data = {...}
zip(data.values(), data.keys())

data是我们的格式数据,使用zip后进行快速键值转换,然后可以使用max,min之类函数进行数据操作。

3.通过公共键对字典进行排序

from operator import itemgetter
data = [
  {'name': "bran", "uid": 101},
  {'name': "xisi", "uid": 102},
  {'name': "land", "uid": 103}
]
print(sorted(data, key=itemgetter("name")))
print(sorted(data, key=itemgetter("uid")))

数据格式就是data,我们想要对name或者uid进行排序我们就是用代码中的方法。
运行结果:

[{'name': 'bran', 'uid': 101}, {'name': 'land', 'uid': 103}, {'name': 'xisi', 'uid': 102}]
[{'name': 'bran', 'uid': 101}, {'name': 'xisi', 'uid': 102}, {'name': 'land', 'uid': 103}]

正如我们期望中的一样

4.对列表中的多个字典根据某一字段进行分组

注意注意,在进行分组前要首先对数据进行排序处理,排序字段根据实际要求来选择

即将处理的数据:

rows = [
  {'name': "bran", "uid": 101, "class": 13},
  {'name': "xisi", "uid": 101, "class": 11},
  {'name': "land", "uid": 103, "class": 10}
]

期望处理结果:

{
101: [{'name': 'xisi', 'class': 11, 'uid': 101},{'name': 'bran', 'class': 13, 'uid': 101}],
103: [{'name': 'land', 'class': 10, 'uid': 103}]
}

我们按照uid进行分组,这里只是演示,uid一般也不会重复。

这个比较复杂一点,我们一部一步来分解

some = [('a', [1, 2, 3]), ('b', [4, 5, 6])]
print(dict(some))

结果:

{'b': [4, 5, 6], 'a': [1, 2, 3]}

这里我们的目的是将元组转换成字典,这个很简单,应该都能看懂。接着我们来下一步对待处理数据进行排序:

data_one = sorted(rows, key=itemgetter("class"))
print(data_one)
data_two = sorted(rows, key=lambda x: (x["uid"], x["class"]))
print(data_two)

这里我们提供两种排序方式原理相同,只是样式稍有区别,第一种data_one是直接使用itemgetter,按照我们前面使用过得,直接按照某一字段进行排序,可是有时候我们会有另一种要求:

先按照某一字段排序,当第一字段重复时,再按照另一字段排序。

这时我们就用第二种方法,进行多字段值排序。
排序结果如下:

[{'name': 'land', 'class': 10, 'uid': 103}, {'name': 'xisi', 'class': 11, 'uid': 101}, {'name': 'bran', 'class': 13, 'uid': 101}]
[{'name': 'xisi', 'class': 11, 'uid': 101}, {'name': 'bran', 'class': 13, 'uid': 101}, {'name': 'land', 'class': 10, 'uid': 103}]

结果大家慢慢看一下,还是略有差别。

接下来就进行最后一步了,将我们刚才讲的两种方式结合起来使用:

data = dict([(g, list(k)) for g, k in groupby(data_two, key=lambda x: x["uid"])])
print(data)

我们对排序好的数据进行分组,然后生成元组列表,最后将其转换成字典,这里大功告成,我们成功将数据进行分组。

python数据统计的一些小技巧就分享到这,有需要的可以参考学习。

Python 相关文章推荐
python实现简单爬虫功能的示例
Oct 24 Python
详解python并发获取snmp信息及性能测试
Mar 27 Python
浅谈使用Python变量时要避免的3个错误
Oct 30 Python
如何使用VSCode愉快的写Python于调试配置步骤
Apr 06 Python
将Django项目部署到CentOs服务器中
Oct 18 Python
Flask之请求钩子的实现
Dec 23 Python
在pycharm下设置自己的个性模版方法
Jul 15 Python
python word转pdf代码实例
Aug 16 Python
解决pycharm启动后总是不停的updating indices...indexing的问题
Nov 27 Python
用 python 进行微信好友信息分析
Nov 28 Python
Python连接Postgres/Mysql/Mongo数据库基本操作大全
Jun 29 Python
Python中的matplotlib绘制百分比堆叠柱状图,并为每一个类别设置不同的填充图案
Apr 20 Python
python中print的不换行即时输出的快速解决方法
Jul 20 #Python
Python全局变量用法实例分析
Jul 19 #Python
python对象及面向对象技术详解
Jul 19 #Python
python异常和文件处理机制详解
Jul 19 #Python
python线程、进程和协程详解
Jul 19 #Python
浅谈python字符串方法的简单使用
Jul 18 #Python
python读取oracle函数返回值
Jul 18 #Python
You might like
php之字符串变相相减的代码
2007/03/19 PHP
PHP开发不能违背的安全规则 过滤用户输入
2011/05/01 PHP
PHP 观察者模式的实现代码
2013/05/10 PHP
php截取字符串之截取utf8或gbk编码的中英文字符串示例
2014/03/12 PHP
教你如何在CI框架中使用 .htaccess 隐藏url中index.php
2014/06/09 PHP
CI框架实现创建自定义类库的方法
2018/12/25 PHP
Thinkphp 框架扩展之Widget扩展实现方法分析
2020/04/23 PHP
避免回车键导致的页面无意义刷新的解决方法
2011/04/12 Javascript
jQuery中:password选择器用法实例
2015/01/03 Javascript
动态加载权限管理模块中的Vue组件
2018/01/16 Javascript
Vue 实现从小到大的横向滑动效果详解
2019/10/16 Javascript
vue获取form表单的值示例
2019/10/29 Javascript
如何在JavaScript中正确处理变量
2020/12/25 Javascript
[08:40]Navi Vs Newbee
2018/06/07 DOTA
PyCharm 常用快捷键和设置方法
2017/12/20 Python
对python中使用requests模块参数编码的不同处理方法
2018/05/18 Python
对dataframe进行列相加,行相加的实例
2018/06/08 Python
对pandas中两种数据类型Series和DataFrame的区别详解
2018/11/12 Python
python模拟鼠标点击和键盘输入的操作
2019/08/04 Python
Django接收照片储存文件的实例代码
2020/03/07 Python
python实现快速文件格式批量转换的方法
2020/10/16 Python
介绍一下write命令
2012/09/24 面试题
Why do we need Unit test
2013/01/03 面试题
文史专业毕业生自荐信
2013/11/17 职场文书
会计电算化专业毕业生求职信范文
2013/12/10 职场文书
同学会邀请书大全
2014/01/12 职场文书
高一新生军训感言
2014/03/02 职场文书
信息技术培训感言
2014/03/06 职场文书
中学生寄语大全
2014/04/03 职场文书
夫妻双方自愿离婚协议书
2014/10/24 职场文书
企业开业庆典答谢词
2015/01/20 职场文书
租车协议书
2015/01/27 职场文书
入党介绍人意见怎么写
2015/06/03 职场文书
民事调解协议书
2016/03/21 职场文书
Python离线安装openpyxl模块的步骤
2021/03/30 Python
Python道路车道线检测的实现
2021/06/27 Python