首页 > 其他分享 >pandas里的缺失值(理解与相关方法)

pandas里的缺失值(理解与相关方法)

时间:2022-10-22 20:55:37浏览次数:49  
标签:df dtype nan 缺失 理解 np pandas out

由于数据库或数据集中存在大量缺失数据和空值,这时在pandas中经常用NAN代替。

pandas用标签方法表示缺失值:

一:浮点数据类型的NaN值

二:python的None对象

其中,None是一个python对象,所以不能作为任何Numpy/pandas数组类型的缺失值,只能用于'object'数组类型(即由python对象构成的数组)

1 in:np.array([1,None,3,4])
2 out:array([1,None,3,4],dtype=object)

而NaN属于数值类型的缺失值,是一种按照IEEE浮点数标准设计,在任何系统中都兼容的特殊浮点数。

1 in:vals1=np.array([1,np.nan,3,4])
2 vals1.dtype
3 out:dtype('float64')

并且在数组运算中,NaN可看作是一个数据类病毒,可以把与它接触过的数据同化,例如:

1+np.nan与1*np.nan结果均为nan,这是需要注意的。

但在实际运算中,NaN这一特性并不能让我们得到满意的结果,如下实例可看:

1 in:vals2=np.array([1,np.nan,3,4])
2 vals2.sum(),vals2.min(),vals2.max()
3 out:(nan,nan,nan) 

特殊的累计函数,可以忽略缺失值的影响

1 in:vals3=np.array([1,np.nan,3,4])
2 np.nansum(vals3),np.nanmin(vals3),np.nanmax(vals3)
3 out:(8.0,1.0,4.0)

注意:这里结果是浮点类型 dtype='float64'

NaN与None:

在pandas中它们两个是可以等价交换的

pd.Series([1,np.nan,2,None])

out:

0 1.0

1 NaN

2 2.0

3 NaN

dtype:float64

注意:其中np.nan是强制转换成浮点数缺失值NaN,pandas会将没有标签值的数据类型自动转换为NA

转换规则如下:

类型 缺失值转换规则 NA标签值
floating浮点型 无变化 np.nan
object对象类型 无变化 np.nan或None
integer整数类型 强制转换成float64 np.nan
Boolean布尔类型 强制转换成object np.nan或None

 

关于pandas发现、剔除、替换数据结构中的缺失值

isnull(),notnull()#返回布尔类型,创建一个布尔类型的数组,isnull():若是缺失值,则返回true,否则false,而在notnull中则相反

dropna():不传参数时,默认删除所有含缺失值的行,若传入axis=1或axis='columns',则它会删除所有包含缺失值的列

以上会把一些非缺失值一并剔除,为避免这个情况发生,可通过设置how和thresh参数满足

例如:

df.dropna(axis=1,how='all')则是删除全部为缺失值的列

df.dropna(axis='rows',thresh=2)则删除的行中非缺失值至少为2个,thresh用于设置行或列中非缺失值的最小数量

fillna()用于填充缺失值,将其换成有效数值

(可返回填充了缺失值的数组副本)

在Series中

df.fillna(0) 用0来替换缺失值

1 in:df=pd.Series([1,2,np.nan,4,5])
2 df.fillna(0)
3 out:
4 0 1.0
5 1 2.0
6 2 0.0
7 3 4.0
8 4 5.0
9 dtype:float64

 

df.fillna(method='ffill') 从前往后填充

1 in:df=pd.Series([1,2,np.nan,4,5])
2 df.fillna(method='ffill')
3 out:
4 0 1.0
5 1 2.0
6 2 2.0
7 3 4.0
8 4 5.0
9 dtype:float64

 

df.fillna(method='bfill') 从后往前填充

1 in:df=pd.Series([1,2,np.nan,4,5])
2 df.fillna(method='bfill')
3 out:
4 0 1.0
5 1 2.0
6 2 4.0
7 3 4.0
8 4 5.0
9 dtype:float64

 

在DataFrame中

df.fillna(method='ffill',axis=1)与series用法类似,但需表明行或列

1 in:df=pd.DataFrame([[1,2,np.nan],[3,6,7],[4,np.nan,np.nan]],columns=['a','b','c'])
2 df.fillna(method='ffill',axis=0)
3 out:
4     a    b    c
5 0 1.0 2.0 2.0
6 1 3.0 6.0 7.0
7 2 4.0 4.0 4.0
8 dtype:float64

 

标签:df,dtype,nan,缺失,理解,np,pandas,out
From: https://www.cnblogs.com/TiAmo-bai/p/16817272.html

相关文章

  • String == 理解
    1.下面的结果是falseStringstr=newString("aa");Stringstr1=newString("aa");System.out.println(str==str1);new出来的对象都是在堆上分配对象,==此时比较的是......
  • 对函数重载的理解
    函数重载其实是方法的多态性的一种体现函数重载其实严格来说是一种方法名称重用的功能,利用特定的机制可以让一个方法实现不同的功能方法重载的实现方法的名称相同(强......
  • c语言基础理解(原创)
        家中小女初上大学开学计算机课程,学习C语言时遇到困难,为帮助她尽快入门,特写了这篇基本概念理解,希望帮她快速认识清楚C语言的本质。发到博客园上,也帮助同样的C语言......
  • cat userlist的理解
    学习要求Linux文件系统的三层抽象是什么?写出Catuserlist的过程,要详述目录文件,i-node.数据块,要画图示意假设块大小为4k,userlist的大小不小于10k,自己假设大小Linux......
  • This:从执行上下文的角度来理解这个
    This:从执行上下文的角度来理解这个。这在全局执行上下文中让我们首先看看这在全局执行上下文中是什么。可以在控制台输入console.log(this)在全局执行上下文中打印出这......
  • Python pandas 通过时间计算统计每月数据记录数
    在Python中进行数据统计时,有些数据我们可能需要统计每月或指时间范围的数据记录数,本文主要介绍Pythonpandas中通过时间计算统计每月数据记录数的方法,以及相关的示例代码。......
  • ModuleNotFoundError: No module named 'pandas'
     001、问题ModuleNotFoundError:Nomodulenamed'pandas'  002、解决方法pipinstallpandas-ihttp://pypi.douban.com/simple/--trusted-hostpypi.dou......
  • 深度学习模型训练的过程理解(训练集、验证集、测试集、batch、iteration、epoch、单步
    呜呜呜呜,感谢大佬学弟给我讲干货.本来是讨论项目的,后面就跑偏讲论文模型了. 解答了我一直以来的疑问:数据放模型里训练的过程. 假设我们有一个数据集26304条数据,假设设置模......
  • 一张图来帮你理解 SOA
    SOA曾经一度是技术领域中最难以理解的一个概念。SOA似乎让很多人感到困惑-一般来讲这是由于人们认为它拥有几乎神奇的力量。事实上SOA只是一个很......
  • 嵌入式-C语言基础:理解形参和实参的区别
    #include<stdio.h>//实参:函数原型中声明函数后面带的参数inttest(intx)//函数原型{//函数体printf("test里面的x地址=%p",&x);returnx;}//变量......