分享python数据统计的一些小技巧


Posted in Python onJuly 21, 2016

最近在用python做数据统计,这里总结了一些最近使用时查找和总结的一些小技巧,希望能帮助在做这方面时的一些童鞋。有些技巧是很平常的用法,平时我们没有注意,但是在特定场景,这些小方法还是能带来很大的帮助。

1.在字典中将键映射到多个值上面

{'b': [4, 5, 6], 
'a': [1, 2, 3]}

有时候我们在统计相同key值的时候,希望把所有相同key的条目添加到以key为键的一个字典中,然后再进行各种操作,这时候我们就可以使用下面的代码进行操作:

from collections import defaultdict
d = defaultdict(list)
print(d)
d['a'].append(1)
d['a'].append(2)
d['a'].append(3)
d['b'].append(4)
d['b'].append(5)
d['b'].append(6)
print(d)
print(d.get("a"))
print(d.keys())
print([d.get(i) for i in d])

这里是使用了collections中的方法,这里面还拥有很多有用的方法,我们有时间在继续进行深入了解。

上面代码运行结果:

defaultdict(, {})
defaultdict(, {'b': [4, 5, 6], 'a': [1, 2, 3]})
[1, 2, 3]
dict_keys(['b', 'a'])
[[4, 5, 6], [1, 2, 3]]

我们将数据填入之后,相当于进行快速分组,然后遍历每个组就可以统计一些我们需要的数据。

2.迅速转换字典键值对

data = {...}
zip(data.values(), data.keys())

data是我们的格式数据,使用zip后进行快速键值转换,然后可以使用max,min之类函数进行数据操作。

3.通过公共键对字典进行排序

from operator import itemgetter
data = [
  {'name': "bran", "uid": 101},
  {'name': "xisi", "uid": 102},
  {'name': "land", "uid": 103}
]
print(sorted(data, key=itemgetter("name")))
print(sorted(data, key=itemgetter("uid")))

数据格式就是data,我们想要对name或者uid进行排序我们就是用代码中的方法。
运行结果:

[{'name': 'bran', 'uid': 101}, {'name': 'land', 'uid': 103}, {'name': 'xisi', 'uid': 102}]
[{'name': 'bran', 'uid': 101}, {'name': 'xisi', 'uid': 102}, {'name': 'land', 'uid': 103}]

正如我们期望中的一样

4.对列表中的多个字典根据某一字段进行分组

注意注意,在进行分组前要首先对数据进行排序处理,排序字段根据实际要求来选择

即将处理的数据:

rows = [
  {'name': "bran", "uid": 101, "class": 13},
  {'name': "xisi", "uid": 101, "class": 11},
  {'name': "land", "uid": 103, "class": 10}
]

期望处理结果:

{
101: [{'name': 'xisi', 'class': 11, 'uid': 101},{'name': 'bran', 'class': 13, 'uid': 101}],
103: [{'name': 'land', 'class': 10, 'uid': 103}]
}

我们按照uid进行分组,这里只是演示,uid一般也不会重复。

这个比较复杂一点,我们一部一步来分解

some = [('a', [1, 2, 3]), ('b', [4, 5, 6])]
print(dict(some))

结果:

{'b': [4, 5, 6], 'a': [1, 2, 3]}

这里我们的目的是将元组转换成字典,这个很简单,应该都能看懂。接着我们来下一步对待处理数据进行排序:

data_one = sorted(rows, key=itemgetter("class"))
print(data_one)
data_two = sorted(rows, key=lambda x: (x["uid"], x["class"]))
print(data_two)

这里我们提供两种排序方式原理相同,只是样式稍有区别,第一种data_one是直接使用itemgetter,按照我们前面使用过得,直接按照某一字段进行排序,可是有时候我们会有另一种要求:

先按照某一字段排序,当第一字段重复时,再按照另一字段排序。

这时我们就用第二种方法,进行多字段值排序。
排序结果如下:

[{'name': 'land', 'class': 10, 'uid': 103}, {'name': 'xisi', 'class': 11, 'uid': 101}, {'name': 'bran', 'class': 13, 'uid': 101}]
[{'name': 'xisi', 'class': 11, 'uid': 101}, {'name': 'bran', 'class': 13, 'uid': 101}, {'name': 'land', 'class': 10, 'uid': 103}]

结果大家慢慢看一下,还是略有差别。

接下来就进行最后一步了,将我们刚才讲的两种方式结合起来使用:

data = dict([(g, list(k)) for g, k in groupby(data_two, key=lambda x: x["uid"])])
print(data)

我们对排序好的数据进行分组,然后生成元组列表,最后将其转换成字典,这里大功告成,我们成功将数据进行分组。

python数据统计的一些小技巧就分享到这,有需要的可以参考学习。

Python 相关文章推荐
用python实现的可以拷贝或剪切一个文件列表中的所有文件
Apr 30 Python
python多线程抓取天涯帖子内容示例
Apr 03 Python
Python中使用PIPE操作Linux管道
Feb 04 Python
使用Python批量修改文件名的代码实例
Jan 24 Python
10 分钟快速入门 Python3的教程
Jan 29 Python
使用python分析统计自己微信朋友的信息
Jul 19 Python
Django 项目重命名的实现步骤解析
Aug 14 Python
python递归下载文件夹下所有文件
Aug 31 Python
python如何写出表白程序
Jun 01 Python
python自动化测试三部曲之request+django实现接口测试
Oct 07 Python
Python在后台自动解压各种压缩文件的实现方法
Nov 10 Python
详解Python描述符的工作原理
Jun 11 Python
python中print的不换行即时输出的快速解决方法
Jul 20 #Python
Python全局变量用法实例分析
Jul 19 #Python
python对象及面向对象技术详解
Jul 19 #Python
python异常和文件处理机制详解
Jul 19 #Python
python线程、进程和协程详解
Jul 19 #Python
浅谈python字符串方法的简单使用
Jul 18 #Python
python读取oracle函数返回值
Jul 18 #Python
You might like
发布一个用PHP fsockopen写的HTTP下载的类
2007/02/22 PHP
mysql+php分页类(已测)
2008/03/31 PHP
PHP常用特殊运算符号和函数总结(php新手入门必看)
2013/02/02 PHP
使用php方法curl抓取AJAX异步内容思路分析及代码分享
2014/08/25 PHP
初识通用数据库操作类――前端easyui-datagrid,form(php)
2015/07/31 PHP
php5.2的curl-bug 服务器被php进程卡死问题排查
2016/09/19 PHP
thinkPHP中session()方法用法详解
2016/12/08 PHP
PHP实现转盘抽奖算法分享
2020/04/15 PHP
PHP7内核CGI与FastCGI详解
2019/04/14 PHP
在laravel中实现事务回滚的方法
2019/10/10 PHP
jQuery插件的写法分享
2013/06/12 Javascript
php与js的区别是什么
2013/08/05 Javascript
jquery购物车实时结算特效实现思路
2013/09/23 Javascript
一个小例子解释如何来阻止Jquery事件冒泡
2014/07/17 Javascript
angularJS提交表单(form)
2015/02/09 Javascript
javascript封装的sqlite操作类实例
2015/07/17 Javascript
简单解析JavaScript中的__proto__属性
2016/05/10 Javascript
第九篇Bootstrap导航菜单创建步骤详解
2016/06/21 Javascript
详解js前端代码异常监控
2017/01/11 Javascript
easyui 中的datagrid跨页勾选问题的实现方法
2017/01/18 Javascript
jQuery实现在新增加的元素上添加事件方法案例分析
2017/02/09 Javascript
JavaScript实现的搜索及高亮显示功能示例
2017/08/14 Javascript
Vue打包后出现一些map文件的解决方法
2018/02/13 Javascript
react用Redux中央仓库实现一个todolist
2019/09/29 Javascript
查找Vue中下标的操作(some和findindex)
2020/08/12 Javascript
在Python的Django框架中使用通用视图的方法
2015/07/21 Python
Python 机器学习库 NumPy入门教程
2018/04/19 Python
Sanic框架应用部署方法详解
2018/07/18 Python
python实现滑雪游戏
2020/02/22 Python
pyspark 随机森林的实现
2020/04/24 Python
什么是python的id函数
2020/06/11 Python
优秀士兵个人事迹材料
2014/01/19 职场文书
应届生求职信
2014/05/31 职场文书
毕业典礼邀请函
2015/01/31 职场文书
接待员岗位职责范本
2015/04/15 职场文书
Ajax 的初步实现(使用vscode+node.js+express框架)
2021/06/18 Javascript