Python3.5 Pandas模块缺失值处理和层次索引实例详解


Posted in Python onApril 23, 2019

本文实例讲述了Python3.5 Pandas模块缺失值处理和层次索引。分享给大家供大家参考,具体如下:

1、pandas缺失值处理

Python3.5 Pandas模块缺失值处理和层次索引实例详解

Python3.5 Pandas模块缺失值处理和层次索引实例详解

Python3.5 Pandas模块缺失值处理和层次索引实例详解

import numpy as np
import pandas as pd
from pandas import Series,DataFrame

df3 = DataFrame([
  ["Tom",np.nan,456.67,"M"],
  ["Merry",34,345.56,np.nan],
  [np.nan,np.nan,np.nan,np.nan],
  ["John",23,np.nan,"M"],
  ["Joe",18,385.12,"F"]
],columns = ["name","age","salary","gender"])

print(df3)
print("=======判断NaN值=======")
print(df3.isnull())
print("=======判断非NaN值=======")
print(df3.notnull())
print("=======删除包含NaN值的行=======")
print(df3.dropna())
print("=======删除全部为NaN值的行=======")
print(df3.dropna(how="all"))

df3.ix[2,0] = "Gerry"    #修改第2行第0列的值
print(df3)

print("=======删除包含NaN值的列=======")
print(df3.dropna(axis=1))

运行结果:

   name   age  salary gender
0    Tom   NaN  456.67      M
1  Merry  34.0  345.56    NaN
2    NaN   NaN     NaN    NaN
3   John  23.0     NaN      M
4    Joe  18.0  385.12      F
=======判断NaN值=======
    name    age salary gender
0  False   True  False  False
1  False  False  False   True
2   True   True   True   True
3  False  False   True  False
4  False  False  False  False
=======判断非NaN值=======
    name    age salary gender
0   True  False   True   True
1   True   True   True  False
2  False  False  False  False
3   True   True  False   True
4   True   True   True   True
=======删除包含NaN值的行=======
  name   age  salary gender
4  Joe  18.0  385.12      F
=======删除全部为NaN值的行=======
    name   age  salary gender
0    Tom   NaN  456.67      M
1  Merry  34.0  345.56    NaN
3   John  23.0     NaN      M
4    Joe  18.0  385.12      F
    name   age  salary gender
0    Tom   NaN  456.67      M
1  Merry  34.0  345.56    NaN
2  Gerry   NaN     NaN    NaN
3   John  23.0     NaN      M
4    Joe  18.0  385.12      F
=======删除包含NaN值的列=======
    name
0    Tom
1  Merry
2  Gerry
3   John
4    Joe

Python3.5 Pandas模块缺失值处理和层次索引实例详解

import numpy as np
import pandas as pd
from pandas import Series,DataFrame

df4 = DataFrame(np.random.randn(7,3))
print(df4)

df4.ix[:4,1] = np.nan    #第0至3行,第1列的数据
df4.ix[:2,2] = np.nan
print(df4)

print(df4.fillna(0))    #将缺失值用传入的指定值0替换

print(df4.fillna({1:0.5,2:-1}))   #将缺失值按照指定形式填充

运行结果:

          0         1         2
0 -0.737618 -0.530302 -2.716457
1  0.810339  0.063028 -0.341343
2  0.070564  0.347308 -0.121137
3 -0.501875 -1.573071 -0.816077
4 -2.159196 -0.659185 -0.885185
5  0.175086 -0.954109 -0.758657
6  0.395744 -0.875943  0.950323
          0         1         2
0 -0.737618       NaN       NaN
1  0.810339       NaN       NaN
2  0.070564       NaN       NaN
3 -0.501875       NaN -0.816077
4 -2.159196       NaN -0.885185
5  0.175086 -0.954109 -0.758657
6  0.395744 -0.875943  0.950323
          0         1         2
0 -0.737618  0.000000  0.000000
1  0.810339  0.000000  0.000000
2  0.070564  0.000000  0.000000
3 -0.501875  0.000000 -0.816077
4 -2.159196  0.000000 -0.885185
5  0.175086 -0.954109 -0.758657
6  0.395744 -0.875943  0.950323
          0         1         2
0 -0.737618  0.500000 -1.000000
1  0.810339  0.500000 -1.000000
2  0.070564  0.500000 -1.000000
3 -0.501875  0.500000 -0.816077
4 -2.159196  0.500000 -0.885185
5  0.175086 -0.954109 -0.758657
6  0.395744 -0.875943  0.950323

2、pandas常用数学统计方法

Python3.5 Pandas模块缺失值处理和层次索引实例详解

Python3.5 Pandas模块缺失值处理和层次索引实例详解
Python3.5 Pandas模块缺失值处理和层次索引实例详解

Python3.5 Pandas模块缺失值处理和层次索引实例详解

import numpy as np
import pandas as pd
from pandas import Series,DataFrame

#pandas常用数学统计方法

arr = np.array([
  [98.5,89.5,88.5],
  [98.5,85.5,88],
  [70,85,60],
  [80,85,82]
])
df1 = DataFrame(arr,columns=["语文","数学","英语"])
print(df1)
print("=======针对列计算总统计值=======")
print(df1.describe())
print("=======默认计算各列非NaN值个数=======")
print(df1.count())
print("=======计算各行非NaN值个数=======")
print(df1.count(axis=1))

运行结果:

     语文    数学    英语
0  98.5  89.5  88.5
1  98.5  85.5  88.0
2  70.0  85.0  60.0
3  80.0  85.0  82.0
=======针对列计算总统计值=======
              语文         数学         英语
count   4.000000   4.000000   4.000000
mean   86.750000  86.250000  79.625000
std    14.168627   2.179449  13.412525
min    70.000000  85.000000  60.000000
25%    77.500000  85.000000  76.500000
50%    89.250000  85.250000  85.000000
75%    98.500000  86.500000  88.125000
max    98.500000  89.500000  88.500000
=======默认计算各列非NaN值个数=======
语文    4
数学    4
英语    4
dtype: int64
=======计算各行非NaN值个数=======
0    3
1    3
2    3
3    3
dtype: int64

Python3.5 Pandas模块缺失值处理和层次索引实例详解

Python3.5 Pandas模块缺失值处理和层次索引实例详解

import numpy as np
import pandas as pd
from pandas import Series,DataFrame、

#2.pandas相关系数与协方差
df2 = DataFrame({
  "GDP":[12,23,34,45,56],
  "air_temperature":[23,25,26,27,30],
  "year":["2001","2002","2003","2004","2005"]
})

print(df2)
print("=========相关系数========")
print(df2.corr())
print("=========协方差========")
print(df2.cov())
print("=========两个量之间的相关系数========")
print(df2["GDP"].corr(df2["air_temperature"]))
print("=========两个量之间协方差========")
print(df2["GDP"].cov(df2["air_temperature"]))

运行结果:

 GDP  air_temperature  year
0   12               23  2001
1   23               25  2002
2   34               26  2003
3   45               27  2004
4   56               30  2005
=========相关系数========
                      GDP  air_temperature
GDP              1.000000         0.977356
air_temperature  0.977356         1.000000
=========协方差========
                   GDP  air_temperature
GDP              302.5             44.0
air_temperature   44.0              6.7
=========两个量之间的相关系数========
0.97735555485
=========两个量之间协方差========
44.0

Python3.5 Pandas模块缺失值处理和层次索引实例详解

Python3.5 Pandas模块缺失值处理和层次索引实例详解

Python3.5 Pandas模块缺失值处理和层次索引实例详解

Python3.5 Pandas模块缺失值处理和层次索引实例详解

import numpy as np
import pandas as pd
from pandas import Series,DataFrame

#3.pandas唯一值、值计数及成员资格

df3 = DataFrame({
  "order_id":["1001","1002","1003","1004","1005"],
  "member_id":["m01","m01","m02","m01","m02",],
  "order_amt":[345,312.2,123,250.2,235]
})

print(df3)

print("=========去重后的数组=========")
print(df3["member_id"].unique())

print("=========值出现的频率=========")
print(df3["member_id"].value_counts())

print("=========成员资格=========")
df3 = df3["member_id"]
mask = df3.isin(["m01"])
print(mask)
print(df3[mask])

运行结果:

 member_id  order_amt order_id
0       m01      345.0     1001
1       m01      312.2     1002
2       m02      123.0     1003
3       m01      250.2     1004
4       m02      235.0     1005
=========去重后的数组=========
['m01' 'm02']
=========值出现的频率=========
m01    3
m02    2
Name: member_id, dtype: int64
=========成员资格=========
0     True
1     True
2    False
3     True
4    False
Name: member_id, dtype: bool
0    m01
1    m01
3    m01
Name: member_id, dtype: object

3、pandas层次索引

Python3.5 Pandas模块缺失值处理和层次索引实例详解

Python3.5 Pandas模块缺失值处理和层次索引实例详解

Python3.5 Pandas模块缺失值处理和层次索引实例详解

Python3.5 Pandas模块缺失值处理和层次索引实例详解

import numpy as np
import pandas as pd
from pandas import Series,DataFrame

#3.pandas层次索引
data = Series([998.4,6455,5432,9765,5432],
       index=[["2001","2001","2001","2002","2002"],
       ["苹果","香蕉","西瓜","苹果","西瓜"]]
       )
print(data)

df4 = DataFrame({
  "year":[2001,2001,2002,2002,2003],
  "fruit":["apple","banana","apple","banana","apple"],
  "production":[2345,5632,3245,6432,4532],
  "profits":[245.6,432.7,534.1,354,467.8]
})

print(df4)
print("=======层次化索引=======")
df4 = df4.set_index(["year","fruit"])
print(df4)
print("=======依照索引取值=======")
print(df4.ix[2002,"apple"])
print("=======依照层次化索引统计数据=======")
print(df4.sum(level="year"))
print(df4.mean(level="fruit"))
print(df4.min(level=["year","fruit"]))

运行结果:

2001  苹果     998.4
      香蕉    6455.0
      西瓜    5432.0
2002  苹果    9765.0
      西瓜    5432.0
dtype: float64
    fruit  production  profits  year
0   apple        2345    245.6  2001
1  banana        5632    432.7  2001
2   apple        3245    534.1  2002
3  banana        6432    354.0  2002
4   apple        4532    467.8  2003
=======层次化索引=======
             production  profits
year fruit
2001 apple         2345    245.6
     banana        5632    432.7
2002 apple         3245    534.1
     banana        6432    354.0
2003 apple         4532    467.8
=======依照索引取值=======
production    3245.0
profits        534.1
Name: (2002, apple), dtype: float64
=======依照层次化索引统计数据=======
      production  profits
year
2001        7977    678.3
2002        9677    888.1
2003        4532    467.8
        production     profits
fruit
apple         3374  415.833333
banana        6032  393.350000
             production  profits
year fruit
2001 apple         2345    245.6
     banana        5632    432.7
2002 apple         3245    534.1
     banana        6432    354.0
2003 apple         4532    467.8

希望本文所述对大家Python程序设计有所帮助。

Python 相关文章推荐
Python的几个高级语法概念浅析(lambda表达式闭包装饰器)
May 28 Python
利用Python开发实现简单的记事本
Nov 15 Python
Python实现模拟分割大文件及多线程处理的方法
Oct 10 Python
python编程线性回归代码示例
Dec 07 Python
Python实现的随机森林算法与简单总结
Jan 30 Python
关于python之字典的嵌套,递归调用方法
Jan 21 Python
详解python实现交叉验证法与留出法
Jul 11 Python
python监控nginx端口和进程状态
Sep 06 Python
python框架flask表单实现详解
Nov 04 Python
python获取栅格点和面值的实现
Mar 10 Python
django 实现手动存储文件到model的FileField
Mar 30 Python
基于Python实现对比Exce的工具
Apr 07 Python
Python3.5 Pandas模块之DataFrame用法实例分析
Apr 23 #Python
Python3.5 Pandas模块之Series用法实例分析
Apr 23 #Python
使用Python控制摄像头拍照并发邮件
Apr 23 #Python
详解Python静态网页爬取获取高清壁纸
Apr 23 #Python
Python matplotlib画图与中文设置操作实例分析
Apr 23 #Python
Python实现的删除重复文件或图片功能示例【去重】
Apr 23 #Python
详解Python 函数如何重载?
Apr 23 #Python
You might like
通过具体程序来理解PHP里面的抽象类
2010/01/28 PHP
php伪静态之APACHE篇
2014/06/02 PHP
PHP按符号截取字符串的指定部分的实现方法
2018/09/10 PHP
破解Session cookie的方法
2006/07/28 Javascript
Javascript 错误处理的几种方法
2009/06/13 Javascript
JavaScript 盒模型 尺寸深入理解
2012/12/31 Javascript
Javascript判断对象是否相等实现代码
2013/03/18 Javascript
jQuery 仿百度输入标签插件附效果图
2014/07/04 Javascript
AngularJS递归指令实现Tree View效果示例
2016/11/07 Javascript
js实现界面向原生界面发消息并跳转功能
2016/11/22 Javascript
NodeJS读取分析Nginx错误日志的方法
2019/05/14 NodeJs
使用p5.js临摹动态图形
2019/10/23 Javascript
原生js实现随机点名功能
2019/11/05 Javascript
浅谈js中的attributes和Attribute的用法与区别
2020/07/16 Javascript
javascript实现点击按钮切换轮播图功能
2020/09/23 Javascript
python网络编程学习笔记(二):socket建立网络客户端
2014/06/09 Python
Python模仿POST提交HTTP数据及使用Cookie值的方法
2014/11/10 Python
你所不知道的Python奇技淫巧13招【实用】
2016/12/14 Python
Python编程实现蚁群算法详解
2017/11/13 Python
CentOS 6.5中安装Python 3.6.2的方法步骤
2017/12/03 Python
Python中实现switch功能实例解析
2018/01/11 Python
学习Python selenium自动化网页抓取器
2018/01/20 Python
Django rest framework jwt的使用方法详解
2019/08/08 Python
python数据持久存储 pickle模块的基本使用方法解析
2019/08/30 Python
python将print输出的信息保留到日志文件中
2019/09/27 Python
将tensorflow.Variable中的某些元素取出组成一个新的矩阵示例
2020/01/04 Python
python数据分析工具之 matplotlib详解
2020/04/09 Python
HTML5全屏(Fullscreen)API详细介绍
2015/04/24 HTML / CSS
Foot Locker英国官网:美国知名运动产品零售商
2019/02/21 全球购物
行政部主管岗位职责
2013/12/28 职场文书
表演方阵解说词
2014/02/08 职场文书
新年团拜会主持词
2014/04/02 职场文书
党员创先争优心得体会
2014/09/11 职场文书
中学生纪念九一八事变演讲稿
2014/09/14 职场文书
六五普法学习心得体会
2016/01/21 职场文书
MySQL数据库 安全管理
2022/05/06 MySQL