分享python数据统计的一些小技巧


Posted in Python onJuly 21, 2016

最近在用python做数据统计,这里总结了一些最近使用时查找和总结的一些小技巧,希望能帮助在做这方面时的一些童鞋。有些技巧是很平常的用法,平时我们没有注意,但是在特定场景,这些小方法还是能带来很大的帮助。

1.在字典中将键映射到多个值上面

{'b': [4, 5, 6], 
'a': [1, 2, 3]}

有时候我们在统计相同key值的时候,希望把所有相同key的条目添加到以key为键的一个字典中,然后再进行各种操作,这时候我们就可以使用下面的代码进行操作:

from collections import defaultdict
d = defaultdict(list)
print(d)
d['a'].append(1)
d['a'].append(2)
d['a'].append(3)
d['b'].append(4)
d['b'].append(5)
d['b'].append(6)
print(d)
print(d.get("a"))
print(d.keys())
print([d.get(i) for i in d])

这里是使用了collections中的方法,这里面还拥有很多有用的方法,我们有时间在继续进行深入了解。

上面代码运行结果:

defaultdict(, {})
defaultdict(, {'b': [4, 5, 6], 'a': [1, 2, 3]})
[1, 2, 3]
dict_keys(['b', 'a'])
[[4, 5, 6], [1, 2, 3]]

我们将数据填入之后,相当于进行快速分组,然后遍历每个组就可以统计一些我们需要的数据。

2.迅速转换字典键值对

data = {...}
zip(data.values(), data.keys())

data是我们的格式数据,使用zip后进行快速键值转换,然后可以使用max,min之类函数进行数据操作。

3.通过公共键对字典进行排序

from operator import itemgetter
data = [
  {'name': "bran", "uid": 101},
  {'name': "xisi", "uid": 102},
  {'name': "land", "uid": 103}
]
print(sorted(data, key=itemgetter("name")))
print(sorted(data, key=itemgetter("uid")))

数据格式就是data,我们想要对name或者uid进行排序我们就是用代码中的方法。
运行结果:

[{'name': 'bran', 'uid': 101}, {'name': 'land', 'uid': 103}, {'name': 'xisi', 'uid': 102}]
[{'name': 'bran', 'uid': 101}, {'name': 'xisi', 'uid': 102}, {'name': 'land', 'uid': 103}]

正如我们期望中的一样

4.对列表中的多个字典根据某一字段进行分组

注意注意,在进行分组前要首先对数据进行排序处理,排序字段根据实际要求来选择

即将处理的数据:

rows = [
  {'name': "bran", "uid": 101, "class": 13},
  {'name': "xisi", "uid": 101, "class": 11},
  {'name': "land", "uid": 103, "class": 10}
]

期望处理结果:

{
101: [{'name': 'xisi', 'class': 11, 'uid': 101},{'name': 'bran', 'class': 13, 'uid': 101}],
103: [{'name': 'land', 'class': 10, 'uid': 103}]
}

我们按照uid进行分组,这里只是演示,uid一般也不会重复。

这个比较复杂一点,我们一部一步来分解

some = [('a', [1, 2, 3]), ('b', [4, 5, 6])]
print(dict(some))

结果:

{'b': [4, 5, 6], 'a': [1, 2, 3]}

这里我们的目的是将元组转换成字典,这个很简单,应该都能看懂。接着我们来下一步对待处理数据进行排序:

data_one = sorted(rows, key=itemgetter("class"))
print(data_one)
data_two = sorted(rows, key=lambda x: (x["uid"], x["class"]))
print(data_two)

这里我们提供两种排序方式原理相同,只是样式稍有区别,第一种data_one是直接使用itemgetter,按照我们前面使用过得,直接按照某一字段进行排序,可是有时候我们会有另一种要求:

先按照某一字段排序,当第一字段重复时,再按照另一字段排序。

这时我们就用第二种方法,进行多字段值排序。
排序结果如下:

[{'name': 'land', 'class': 10, 'uid': 103}, {'name': 'xisi', 'class': 11, 'uid': 101}, {'name': 'bran', 'class': 13, 'uid': 101}]
[{'name': 'xisi', 'class': 11, 'uid': 101}, {'name': 'bran', 'class': 13, 'uid': 101}, {'name': 'land', 'class': 10, 'uid': 103}]

结果大家慢慢看一下,还是略有差别。

接下来就进行最后一步了,将我们刚才讲的两种方式结合起来使用:

data = dict([(g, list(k)) for g, k in groupby(data_two, key=lambda x: x["uid"])])
print(data)

我们对排序好的数据进行分组,然后生成元组列表,最后将其转换成字典,这里大功告成,我们成功将数据进行分组。

python数据统计的一些小技巧就分享到这,有需要的可以参考学习。

Python 相关文章推荐
在Python下使用Txt2Html实现网页过滤代理的教程
Apr 11 Python
编写自定义的Django模板加载器的简单示例
Jul 21 Python
Python Tkinter模块实现时钟功能应用示例
Jul 23 Python
提升Python效率之使用循环机制代替递归函数
Jul 23 Python
python os.fork() 循环输出方法
Aug 08 Python
Python实现图片识别加翻译功能
Dec 26 Python
Python下利用BeautifulSoup解析HTML的实现
Jan 17 Python
pytorch masked_fill报错的解决
Feb 18 Python
matlab、python中矩阵的互相导入导出方式
Jun 01 Python
BeautifulSoup中find和find_all的使用详解
Dec 07 Python
python 可视化库PyG2Plot的使用
Jan 21 Python
Python使用scapy模块发包收包
May 07 Python
python中print的不换行即时输出的快速解决方法
Jul 20 #Python
Python全局变量用法实例分析
Jul 19 #Python
python对象及面向对象技术详解
Jul 19 #Python
python异常和文件处理机制详解
Jul 19 #Python
python线程、进程和协程详解
Jul 19 #Python
浅谈python字符串方法的简单使用
Jul 18 #Python
python读取oracle函数返回值
Jul 18 #Python
You might like
php通过递归方式复制目录和子目录的方法
2015/03/13 PHP
Laravel使用Caching缓存数据减轻数据库查询压力的方法
2016/03/15 PHP
PHP实现可精确验证身份证号码的工具类示例
2018/05/31 PHP
PHP标准库(PHP SPL)详解
2019/03/16 PHP
接收键盘指令的脚本
2006/06/26 Javascript
检测input每次的输入是否合法遇到汉字输入就有问题
2012/05/23 Javascript
让复选框只能选择一项的方法
2013/10/08 Javascript
Javascript实现真实字符串剩余字数提示的实例代码
2013/10/22 Javascript
zepto中使用swipe.js制作轮播图附swipeUp,swipeDown不起效果问题
2015/08/27 Javascript
在Javascript操作JSON对象,增加 删除 修改的简单实现
2016/06/02 Javascript
JS中this上下文对象使用方式
2016/10/09 Javascript
Bootstrap分页插件之Bootstrap Paginator实例详解
2016/10/15 Javascript
Angular中响应式表单的三种更新值方法详析
2017/08/22 Javascript
vue以组件或者插件的形式实现throttle或者debounce
2019/05/22 Javascript
[44:21]Ti4 循环赛第四日 附加赛NEWBEE vs LGD
2014/07/13 DOTA
Python3基础之函数用法
2014/08/13 Python
python字符串连接方式汇总
2014/08/21 Python
Python cookbook(数据结构与算法)根据字段将记录分组操作示例
2018/03/19 Python
对python遍历文件夹中的所有jpg文件的实例详解
2018/12/08 Python
python将pandas datarame保存为txt文件的实例
2019/02/12 Python
python实现两张图片的像素融合
2019/02/23 Python
PyCharm刷新项目(文件)目录的实现
2020/02/14 Python
Anconda环境下Vscode安装Python的方法详解
2020/03/29 Python
在python中求分布函数相关的包实例
2020/04/15 Python
Python的控制结构之For、While、If循环问题
2020/06/30 Python
10分钟理解CSS3 Grid布局
2018/12/20 HTML / CSS
英国时尚优质的女装:Hope Fashion
2018/08/14 全球购物
耐克波兰官方网站:Nike波兰
2019/09/03 全球购物
what is the difference between ext2 and ext3
2015/08/25 面试题
带香烟到学校抽的检讨书
2014/09/25 职场文书
入党积极分子党支部意见
2015/06/02 职场文书
千与千寻观后感
2015/06/04 职场文书
建议书的格式及范文
2015/09/14 职场文书
小学班主任心得体会
2016/01/07 职场文书
建国70周年的心得体会(2篇)
2019/09/20 职场文书
spring IOC容器的Bean管理XML自动装配过程
2022/05/30 Java/Android