分享python数据统计的一些小技巧


Posted in Python onJuly 21, 2016

最近在用python做数据统计,这里总结了一些最近使用时查找和总结的一些小技巧,希望能帮助在做这方面时的一些童鞋。有些技巧是很平常的用法,平时我们没有注意,但是在特定场景,这些小方法还是能带来很大的帮助。

1.在字典中将键映射到多个值上面

{'b': [4, 5, 6], 
'a': [1, 2, 3]}

有时候我们在统计相同key值的时候,希望把所有相同key的条目添加到以key为键的一个字典中,然后再进行各种操作,这时候我们就可以使用下面的代码进行操作:

from collections import defaultdict
d = defaultdict(list)
print(d)
d['a'].append(1)
d['a'].append(2)
d['a'].append(3)
d['b'].append(4)
d['b'].append(5)
d['b'].append(6)
print(d)
print(d.get("a"))
print(d.keys())
print([d.get(i) for i in d])

这里是使用了collections中的方法,这里面还拥有很多有用的方法,我们有时间在继续进行深入了解。

上面代码运行结果:

defaultdict(, {})
defaultdict(, {'b': [4, 5, 6], 'a': [1, 2, 3]})
[1, 2, 3]
dict_keys(['b', 'a'])
[[4, 5, 6], [1, 2, 3]]

我们将数据填入之后,相当于进行快速分组,然后遍历每个组就可以统计一些我们需要的数据。

2.迅速转换字典键值对

data = {...}
zip(data.values(), data.keys())

data是我们的格式数据,使用zip后进行快速键值转换,然后可以使用max,min之类函数进行数据操作。

3.通过公共键对字典进行排序

from operator import itemgetter
data = [
  {'name': "bran", "uid": 101},
  {'name': "xisi", "uid": 102},
  {'name': "land", "uid": 103}
]
print(sorted(data, key=itemgetter("name")))
print(sorted(data, key=itemgetter("uid")))

数据格式就是data,我们想要对name或者uid进行排序我们就是用代码中的方法。
运行结果:

[{'name': 'bran', 'uid': 101}, {'name': 'land', 'uid': 103}, {'name': 'xisi', 'uid': 102}]
[{'name': 'bran', 'uid': 101}, {'name': 'xisi', 'uid': 102}, {'name': 'land', 'uid': 103}]

正如我们期望中的一样

4.对列表中的多个字典根据某一字段进行分组

注意注意,在进行分组前要首先对数据进行排序处理,排序字段根据实际要求来选择

即将处理的数据:

rows = [
  {'name': "bran", "uid": 101, "class": 13},
  {'name': "xisi", "uid": 101, "class": 11},
  {'name': "land", "uid": 103, "class": 10}
]

期望处理结果:

{
101: [{'name': 'xisi', 'class': 11, 'uid': 101},{'name': 'bran', 'class': 13, 'uid': 101}],
103: [{'name': 'land', 'class': 10, 'uid': 103}]
}

我们按照uid进行分组,这里只是演示,uid一般也不会重复。

这个比较复杂一点,我们一部一步来分解

some = [('a', [1, 2, 3]), ('b', [4, 5, 6])]
print(dict(some))

结果:

{'b': [4, 5, 6], 'a': [1, 2, 3]}

这里我们的目的是将元组转换成字典,这个很简单,应该都能看懂。接着我们来下一步对待处理数据进行排序:

data_one = sorted(rows, key=itemgetter("class"))
print(data_one)
data_two = sorted(rows, key=lambda x: (x["uid"], x["class"]))
print(data_two)

这里我们提供两种排序方式原理相同,只是样式稍有区别,第一种data_one是直接使用itemgetter,按照我们前面使用过得,直接按照某一字段进行排序,可是有时候我们会有另一种要求:

先按照某一字段排序,当第一字段重复时,再按照另一字段排序。

这时我们就用第二种方法,进行多字段值排序。
排序结果如下:

[{'name': 'land', 'class': 10, 'uid': 103}, {'name': 'xisi', 'class': 11, 'uid': 101}, {'name': 'bran', 'class': 13, 'uid': 101}]
[{'name': 'xisi', 'class': 11, 'uid': 101}, {'name': 'bran', 'class': 13, 'uid': 101}, {'name': 'land', 'class': 10, 'uid': 103}]

结果大家慢慢看一下,还是略有差别。

接下来就进行最后一步了,将我们刚才讲的两种方式结合起来使用:

data = dict([(g, list(k)) for g, k in groupby(data_two, key=lambda x: x["uid"])])
print(data)

我们对排序好的数据进行分组,然后生成元组列表,最后将其转换成字典,这里大功告成,我们成功将数据进行分组。

python数据统计的一些小技巧就分享到这,有需要的可以参考学习。

Python 相关文章推荐
pycharm 使用心得(四)显示行号
Jun 05 Python
python正则表达式re模块详解
Jun 25 Python
教你用python3根据关键词爬取百度百科的内容
Aug 18 Python
使用Python监视指定目录下文件变更的方法
Oct 15 Python
Flask框架单例模式实现方法详解
Jul 31 Python
Python求解正态分布置信区间教程
Nov 20 Python
Python sys模块常用方法解析
Feb 20 Python
Python itertools.product方法代码实例
Mar 27 Python
Python如何读取、写入CSV数据
Jul 28 Python
Python3如何使用多线程升程序运行速度
Aug 11 Python
Python将QQ聊天记录生成词云的示例代码
Feb 10 Python
Python中的 Set 与 dict
Mar 13 Python
python中print的不换行即时输出的快速解决方法
Jul 20 #Python
Python全局变量用法实例分析
Jul 19 #Python
python对象及面向对象技术详解
Jul 19 #Python
python异常和文件处理机制详解
Jul 19 #Python
python线程、进程和协程详解
Jul 19 #Python
浅谈python字符串方法的简单使用
Jul 18 #Python
python读取oracle函数返回值
Jul 18 #Python
You might like
超神学院:鹤熙已踏入神圣领域,实力不比凯莎弱
2020/03/02 国漫
Laravel重写用户登录简单示例
2016/10/08 PHP
jQuery一步一步实现跨浏览器的可编辑表格,支持IE、Firefox、Safari、Chrome、Opera
2009/08/28 Javascript
JS 动态获取节点代码innerHTML分析 [IE,FF]
2009/11/30 Javascript
人人网javascript面试题 可以提前实现下
2012/01/05 Javascript
javascript学习笔记(八) js内置对象
2012/06/19 Javascript
深入解析contentWindow, contentDocument
2013/07/04 Javascript
jquery选择器之内容过滤选择器详解
2014/01/27 Javascript
js中document.write使用过程中的一点疑问解答
2014/03/20 Javascript
$(document).ready(function() {})不执行初始化脚本
2014/06/19 Javascript
JQuery的ON()方法支持的所有事件罗列
2015/02/28 Javascript
JavaScript简单修改窗口大小的方法
2015/08/03 Javascript
基于Flowplayer打造一款免费的WEB视频播放器附源码
2015/09/06 Javascript
轻松掌握JavaScript单例模式
2016/08/25 Javascript
jQuery基于排序功能实现上移、下移的方法
2016/11/26 Javascript
angular2 ng build部署后base文件路径问题详细解答
2017/07/15 Javascript
node使用Koa2搭建web项目的方法
2017/10/17 Javascript
轻松理解vue的双向数据绑定问题
2017/10/30 Javascript
layer弹出层 iframe层去掉滚动条的实例代码
2018/08/17 Javascript
vue与django集成打包的实现方法
2019/11/11 Javascript
JavaScript运行机制实例分析
2020/04/11 Javascript
JS实现简单贪吃蛇小游戏
2020/10/28 Javascript
[43:48]Ti4正赛第一天 VG vs NEWBEE 2
2014/07/19 DOTA
Python sqlite3事务处理方法实例分析
2017/06/19 Python
《Python学习手册》学习总结
2018/01/17 Python
wxPython多个窗口的基本结构
2019/11/19 Python
python使用QQ邮箱实现自动发送邮件
2020/06/22 Python
Python根据字符串调用函数过程解析
2020/11/05 Python
使用django自带的user做外键的方法
2020/11/30 Python
Python调用系统命令os.system()和os.popen()的实现
2020/12/31 Python
canvas如何绘制钟表的方法
2017/12/13 HTML / CSS
使用canvas压缩图片上传的方法示例
2020/02/07 HTML / CSS
中学运动会广播稿
2014/01/19 职场文书
python使用XPath解析数据爬取起点小说网数据
2021/04/22 Python
pytorch通过训练结果的复现设置随机种子
2021/06/01 Python
分享python函数常见关键字
2022/04/26 Python