数据分析应用项目化教程(Python) 课件 任务6.1 数据清洗_第1页
数据分析应用项目化教程(Python) 课件 任务6.1 数据清洗_第2页
数据分析应用项目化教程(Python) 课件 任务6.1 数据清洗_第3页
数据分析应用项目化教程(Python) 课件 任务6.1 数据清洗_第4页
数据分析应用项目化教程(Python) 课件 任务6.1 数据清洗_第5页
已阅读5页,还剩7页未读 继续免费阅读

付费下载

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

第六章使用pandas进行数据清洗和整理

任务6.1数据清洗数据清洗概述缺失值检测与处理重复值检测与处理异常值检测与处理数据清洗概述数据分析结果的好坏依赖于数据的好坏。很多数据集存在数据缺失,或数据格式不统一(畸形数据),或错误数据的情况。在处理任何数据之前,我们的第一任务是理解数据以及数据是干什么用的。我们尝试去理解数据的列/行、记录、数据格式、语义错误、缺失的条目以及错误的格式,这样我们就可以大概了解数据分析之前要做哪些“清理”工作。数据清洗阶段的主要任务就是处理缺失值、处理重复值、删除离群点和解决属性的不一致性等。缺失值检测与处理缺失值检测isnull()和notnull()函数可以判断数据集中是否存在空值和缺失值。案例df.isnull().sum()#统计各列有多少缺失值df.isnull().sum().sum()#整个dataframe有多少缺失值df.isnull().any()#各个列是否存在缺失值df.isnull().values.any()#整个dataframe是否存在缺失值df['A'].isnull()#检查缺失值df['A'].notnull()#检查非缺失值df['A'].isnull().values.any()#指定列是否存在缺失值df['A'].isnull().sum()#指定列有多少缺失值缺失值检测与处理缺失值处理删除存在缺失值的:dropna(axis=0)默认(axis=0)是逢空值剔除整行,设置关键字参数axis=1表示逢空值去掉整列不会修改原数据,需要接受返回值。案例:df.dropna()#舍弃含有任意缺失值的行df.dropna(axis=1)#舍弃含有任意缺失值的列df.dropna(how='all')#how='any'如果一行(或一列)里任何一个数据有任何出现Nan就去掉整行,'all’一行(或列)每一个数据都是Nan才去掉这整行df.dropna(thresh=2)#舍弃超过两栏缺失值的行缺失值检测与处理替换缺失值:fillna(value,inplace=True)value:替换成的值inplace:True:会修改原数据,False:不替换修改原数据,生成新的对象案例:df.fillna(0)#用0填补df['age'].fillna(df['age'].mean())#用平均值填补缺失值df['age'].fillna(df.groupby('gender')['age'].transform('mean'),inplace=True)#根据各性别平均年龄填补缺失值df.fillna(method='pad')#用前向后填补缺失值(pad或者ffill)df.fillna(method='bfill',limit=2)#用后向前填补缺失值(bfill或者backfill)缺失值检测与处理插值法填补缺失值:interpolate()Series和DataFrame对象都有interpolate()方法,默认情况下,该函数在缺失值处执行线性插值。这个方法是利用数学方法来估计缺失点的值,对于较大的数据非常有用。插值就是在已知数据之间计算估计值的过程,是一种实用的数值方法,是函数逼近的重要方法。在信号处理和图形分析中,插值运算的应用较为广泛。重复值检测与处理重复值检测duplicated():用于标记Pandas对象的数据是否重复,重复则标记为True,不重复则标记为False,该方法返回一个由布尔值组成的Series对象,它的行索引保持不变,数据则变为标记的布尔值。所有列作为依据进行查找的,每一列的值都必须一致才会被标记为重复值。案例df[df.duplicated()]#筛选出重复行df[df.duplicated()==False]#筛选出非重复行重复值检测与处理重复值处理删除重复值案例df.drop_duplicates()#删除重复值df.drop_duplicates(['sex','year'],keep='last')#keep='last'参数就是让系统从后向前开始筛查,这样索引小的重复行会返回'True‘替换值案例df.replace('','不详')

异常值检测与处理异常值:是指样本中的个别值,其数值明显偏离它所属样本的其余观测值,这些数值是不合理的或错误的。要想确认一组数据中是否有异常值,则常用的检测方法:3σ原则(拉依达准则)箱形图3σ原则(拉依达准则)

根据正态分布函数图可知,3σ原则在各个区间所占的概率如下所示:(1)数值分布在(μ-σ,μ+σ)中的概率为0.682。(2)数值分布在(μ-2σ,μ+2σ)中的概率为0.954。(3)数值分布在(μ-3σ,μ+3σ)中的概率为0.997。σ=np.s

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论