分享python数据统计的一些小技巧


Posted in Python onJuly 21, 2016

最近在用python做数据统计,这里总结了一些最近使用时查找和总结的一些小技巧,希望能帮助在做这方面时的一些童鞋。有些技巧是很平常的用法,平时我们没有注意,但是在特定场景,这些小方法还是能带来很大的帮助。

1.在字典中将键映射到多个值上面

{'b': [4, 5, 6], 
'a': [1, 2, 3]}

有时候我们在统计相同key值的时候,希望把所有相同key的条目添加到以key为键的一个字典中,然后再进行各种操作,这时候我们就可以使用下面的代码进行操作:

from collections import defaultdict
d = defaultdict(list)
print(d)
d['a'].append(1)
d['a'].append(2)
d['a'].append(3)
d['b'].append(4)
d['b'].append(5)
d['b'].append(6)
print(d)
print(d.get("a"))
print(d.keys())
print([d.get(i) for i in d])

这里是使用了collections中的方法,这里面还拥有很多有用的方法,我们有时间在继续进行深入了解。

上面代码运行结果:

defaultdict(, {})
defaultdict(, {'b': [4, 5, 6], 'a': [1, 2, 3]})
[1, 2, 3]
dict_keys(['b', 'a'])
[[4, 5, 6], [1, 2, 3]]

我们将数据填入之后,相当于进行快速分组,然后遍历每个组就可以统计一些我们需要的数据。

2.迅速转换字典键值对

data = {...}
zip(data.values(), data.keys())

data是我们的格式数据,使用zip后进行快速键值转换,然后可以使用max,min之类函数进行数据操作。

3.通过公共键对字典进行排序

from operator import itemgetter
data = [
  {'name': "bran", "uid": 101},
  {'name': "xisi", "uid": 102},
  {'name': "land", "uid": 103}
]
print(sorted(data, key=itemgetter("name")))
print(sorted(data, key=itemgetter("uid")))

数据格式就是data,我们想要对name或者uid进行排序我们就是用代码中的方法。
运行结果:

[{'name': 'bran', 'uid': 101}, {'name': 'land', 'uid': 103}, {'name': 'xisi', 'uid': 102}]
[{'name': 'bran', 'uid': 101}, {'name': 'xisi', 'uid': 102}, {'name': 'land', 'uid': 103}]

正如我们期望中的一样

4.对列表中的多个字典根据某一字段进行分组

注意注意,在进行分组前要首先对数据进行排序处理,排序字段根据实际要求来选择

即将处理的数据:

rows = [
  {'name': "bran", "uid": 101, "class": 13},
  {'name': "xisi", "uid": 101, "class": 11},
  {'name': "land", "uid": 103, "class": 10}
]

期望处理结果:

{
101: [{'name': 'xisi', 'class': 11, 'uid': 101},{'name': 'bran', 'class': 13, 'uid': 101}],
103: [{'name': 'land', 'class': 10, 'uid': 103}]
}

我们按照uid进行分组,这里只是演示,uid一般也不会重复。

这个比较复杂一点,我们一部一步来分解

some = [('a', [1, 2, 3]), ('b', [4, 5, 6])]
print(dict(some))

结果:

{'b': [4, 5, 6], 'a': [1, 2, 3]}

这里我们的目的是将元组转换成字典,这个很简单,应该都能看懂。接着我们来下一步对待处理数据进行排序:

data_one = sorted(rows, key=itemgetter("class"))
print(data_one)
data_two = sorted(rows, key=lambda x: (x["uid"], x["class"]))
print(data_two)

这里我们提供两种排序方式原理相同,只是样式稍有区别,第一种data_one是直接使用itemgetter,按照我们前面使用过得,直接按照某一字段进行排序,可是有时候我们会有另一种要求:

先按照某一字段排序,当第一字段重复时,再按照另一字段排序。

这时我们就用第二种方法,进行多字段值排序。
排序结果如下:

[{'name': 'land', 'class': 10, 'uid': 103}, {'name': 'xisi', 'class': 11, 'uid': 101}, {'name': 'bran', 'class': 13, 'uid': 101}]
[{'name': 'xisi', 'class': 11, 'uid': 101}, {'name': 'bran', 'class': 13, 'uid': 101}, {'name': 'land', 'class': 10, 'uid': 103}]

结果大家慢慢看一下,还是略有差别。

接下来就进行最后一步了,将我们刚才讲的两种方式结合起来使用:

data = dict([(g, list(k)) for g, k in groupby(data_two, key=lambda x: x["uid"])])
print(data)

我们对排序好的数据进行分组,然后生成元组列表,最后将其转换成字典,这里大功告成,我们成功将数据进行分组。

python数据统计的一些小技巧就分享到这,有需要的可以参考学习。

Python 相关文章推荐
python网页请求urllib2模块简单封装代码
Feb 07 Python
Python中使用md5sum检查目录中相同文件代码分享
Feb 02 Python
Python实现SMTP发送邮件详细教程
Mar 02 Python
教你学会使用Python正则表达式
Sep 07 Python
使用Turtle画正螺旋线的方法
Sep 22 Python
Python自定义函数定义,参数,调用代码解析
Dec 27 Python
flask中使用蓝图将路由分开写在不同文件实例解析
Jan 19 Python
pandas 小数位数 精度的处理方法
Jun 09 Python
pandas 数据索引与选取的实现方法
Jun 21 Python
python 接口实现 供第三方调用的例子
Aug 13 Python
python pycharm最新版本激活码(永久有效)附python安装教程
Sep 18 Python
pytorch 修改预训练model实例
Jan 18 Python
python中print的不换行即时输出的快速解决方法
Jul 20 #Python
Python全局变量用法实例分析
Jul 19 #Python
python对象及面向对象技术详解
Jul 19 #Python
python异常和文件处理机制详解
Jul 19 #Python
python线程、进程和协程详解
Jul 19 #Python
浅谈python字符串方法的简单使用
Jul 18 #Python
python读取oracle函数返回值
Jul 18 #Python
You might like
thinkphp模板用法和内容输出实例
2014/11/28 PHP
php+mysql实现用户注册登陆的方法
2015/01/03 PHP
Symfony生成二维码的方法
2016/02/04 PHP
PHPCMS忘记后台密码的解决办法
2016/10/30 PHP
php过滤输入操作之htmlentities与htmlspecialchars用法分析
2017/02/17 PHP
PHP registerXPathNamespace()函数讲解
2019/02/03 PHP
PHP使用观察者模式处理异常信息的方法详解
2019/09/24 PHP
用javascript实现兼容IE7的类库 IE7_0_9.zip提供下载
2007/08/08 Javascript
js 巧妙去除数组中的重复项
2010/01/25 Javascript
IE event.srcElement和FF event.target 功能比较
2010/03/01 Javascript
jquery星级插件、支持页面中多次使用
2012/03/25 Javascript
通过jQuery源码学习javascript(三)
2012/12/27 Javascript
JS获取IP、MAC和主机名的五种方法
2013/11/14 Javascript
js图片向右一张张滚动效果实例代码
2013/11/23 Javascript
javascript制作坦克大战全纪录(1)
2014/11/27 Javascript
js文本框走动跑马灯效果代码分享
2015/08/25 Javascript
使用Function.apply()的参数数组化来提高 JavaScript程序性能的技巧
2015/12/23 Javascript
借助FileReader实现将文件编码为Base64后通过AJAX上传
2015/12/24 Javascript
轻松实现javascript图片轮播特效
2016/01/13 Javascript
JSON 对象未定义错误的解决方法
2016/09/29 Javascript
jQuery实现优雅的弹窗效果(6)
2017/02/08 Javascript
使用JS编写的随机抽取号码的小程序
2017/08/11 Javascript
详解关于vue-area-linkage走过的坑
2018/06/27 Javascript
vue插件draggable实现拖拽移动图片顺序
2018/12/01 Javascript
用smtplib和email封装python发送邮件模块类分享
2014/02/17 Python
Python标准库之sqlite3使用实例
2014/11/25 Python
怎样使用Python脚本日志功能
2016/08/14 Python
Python实现基于多线程、多用户的FTP服务器与客户端功能完整实例
2017/08/18 Python
Python学习pygal绘制线图代码分享
2017/12/09 Python
Python实现读取及写入csv文件的方法示例
2018/01/12 Python
python随机取list中的元素方法
2018/04/08 Python
python3.6使用urllib完成下载的实例
2018/12/19 Python
Pandas时间序列:时期(period)及其算术运算详解
2020/02/25 Python
母亲七十大寿答谢词
2014/01/18 职场文书
绩效管理实施方案
2014/03/19 职场文书
Win11怎么修改电源模式?Win11修改电源模式的方法
2022/04/05 数码科技