数智化人力资源管理-课件 05-数据清洗_第1页
数智化人力资源管理-课件 05-数据清洗_第2页
数智化人力资源管理-课件 05-数据清洗_第3页
数智化人力资源管理-课件 05-数据清洗_第4页
数智化人力资源管理-课件 05-数据清洗_第5页
已阅读5页,还剩40页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

数智化人力资源管理主编徐明霞

唐玉洁数据清洗第五章第二篇方法篇1.了解数据关联、数据合并2.了解数据转换与数据规约3.理解数据质量评估的标准4.掌握数据集成的内涵5.掌握数据清洗的内涵和方法学习目标知识结构图引导案例大数据也要“清洗”专家建议加快大数据清洗基地建设,保护信息安全据新华社电(记者张辛欣张旭东)大数据也要清洗?是的,你没看错。数字化、智能化时代,大数据产业急需通过“清洗”技术对数据进行甄别、筛选和应用,剔除无效信息,加强隐私保护。在青岛召开的2016全球大数据应用研究论坛上,多位业内专家建议我国加快大数据清洗基地建设。大数据应用于生活,信息的甄别和提取是第一步。大数据清洗,就是用电脑把不规则的数据制作成规则的数据,让它们发挥价值。“如同河水必须经过净化才能饮用一样,过滤、漂白、杀毒的过程,就是大数据的‘清洗’过程。”中国大数据行业领军人物、贵阳大数据交易所执行总裁王叁寿在会上说。专家认为,大数据的清洗,不仅有利于提高搜索处理效率,还能加速大数据产业与各行各业的融合,加快应用步伐。比如,通过对家电、物流等多个行业数据整合、过滤,能更好地设计出智能家居方案等。“大数据清洗也是安全使用的前提。”科大讯飞高级副总裁张友国说。加强大数据清洗,将对用户信息多一层保护。与会专家认为,随着大数据产业快速发展,数据清洗的重要性与日俱增,建议加快大数据清洗基地建设,同步构建大数据安全体系,用新方法来解决大数据安全问题。思考:如何来提高人力资源数据的质量?第一节数据集成第二节数据转换与数据规约第三节数据清洗的内涵与方法目录第四节人力资源数据清洗第一节数据集成第一章第二篇方法篇一、数据关联数据关联的神奇之处就在于,它很容易就能够与其他关联数据组合在一起,从而构成新的知识,这也是探索并使用关联数据的最好理由。它打破了传统的数据管理技术的封闭、不宜重组的问题,让数据从原来的孤岛中解放出来,使数据关联成为数据共享中一种奇妙的新技术。二、数据合并数据合并其实是数据文件的合并。在实际操作过程中,有时候需要把多个数据文件合并为一个数据文件。例如,一个公司在全国各地有30多个分公司,每个月公司总部需要把各分公司的人员工资情况合并到一个数据文件中,这就是一个数据合并的过程。每个子公司的人员工作情况数据文件中的变量(或者属性)都相同,不同的只是人员。合并数据文件一般分为添加变量(或称为合并变量)和添加个案(或称为合并记录、合并个案)。三、数据集成数据集成,即将来自多个数据源的数据,如数据库、数据立方(多维数据库)、普通数据文件等,结合在一起形成统一的数据集合,以便为后续的数据分析提供完整的数据基础。数据集成一般有三种基本策略,分别是联邦数据库(federateddatabase)、数据仓库(datawarehousing)、中介者(mediation)。数据表的连接方式包括以下四种(图5-1)。第二节数据转换与数据规约第一章第二篇方法篇一、数据转换(一)数据类别转换数据的字段类型包括数值型、文本型和日期时间型。一般来讲,最常见的是将文本型转换为数值型,以方便机器学习算法的后续处理。定类数据也称定性数据,用于标明数据所描述的主题对象的类别或者属性、名称,如人名、事物名等。定序数据也称序列数据,用于对事物所具有的属性顺序进行描述,可以用数字或序号进行排序,进行比较。转换数据分类一、数据转换(二)数据规范化数据规范化是指将数据按比例缩放,使其落入一个小的特定区间(如“-1,1”或“0,1”),以利于进行数据挖掘。常见的数据规范化方法包括:1.小数缩放2.最小—最大规范化3.标准差规范化一、数据转换(三)数据泛化数据泛化,指的是用更抽象(更高层次)的概念来取代低层次的数据对象。例如,员工基本信息中的年龄,原始数据是连续性的数值,如20—60岁,可以映射到更高层次的概念,如20—30岁、31—40岁、41—50岁、51—60岁。二、数据规约1.KMO检验2.巴特利(Bartlett)球形检验因子分析的一般过程(一)判断数据是否符合因子分析的要求(二)确定因子个数(三)确定公因子并进行赋值数据规约的主要目的就是从原有巨大数据集中获得一个精简的数据集,并使这一精简数据集保持原有数据集的信息完整性。第三节数据清洗的内涵与方法第一章第二篇方法篇一、数据清洗的内涵数据清洗通常是通过清洗脏数据、填写缺失的值、光滑噪声数据、清洗重复数据、识别或删除离群点并解决不一致性来“清理”数据。数据清洗的主要目标有格式标准化、异常数据清除、错误纠正、重复数据的清除。二、数据质量评估标准在清洗数据之前,要对已经获得的数据质量进行评估,高质量的数据有着不同的评判标准,比较实用的标准是特定用户对数据的期望程度。在这个标准之下结合数据分析要求,将数据质量的评估标准具体化为以下四个方面:1.准确性2.完整性3.一致性4.及时性三、数据清洗的方法1.脏数据处理脏数据也叫作坏数据,通常是指与期待的数据不一样、会影响系统正常行为的数据。比如,源系统中的数据不在给定的范围内或对于实际业务毫无意义,或数据格式非法,以及在源系统中存在不规范的编码和含糊的业务逻辑。对于脏数据的处理,一般用结构化、规范化和可关联的方法。三、数据清洗的方法2.缺失值处理(1)直接删除(2)填补(3)重新获取三、数据清洗的方法2.缺失值处理(1)直接删除(2)填补(3)重新获取三、数据清洗的方法2.缺失值处理(1)直接删除(2)填补(3)重新获取如果在某些指标非常重要且缺失率比较高的情况下,就需要向相关人员了解是否通过其他渠道获得相关数据,甚至某些情况下可能要重新组织数据的采集。三、数据清洗的方法3.噪声数据处理(1)分箱法(2)聚类法(3)回归法(4)估算分析法(5)3σ原则分箱法一般有三种,等深分箱法、等宽分箱法(图5-2)和用户自定义分箱法(图5-3)。三、数据清洗的方法3.噪声数据处理(1)分箱法(2)聚类法(3)回归法(4)估算分析法(5)3σ原则聚类法是指将数据集合分组为若干个簇,在簇外的值即为孤立点,这些孤立点就是噪声数据,应当删除或替换。聚类法可以发现异常数据,如图5-4所示。三、数据清洗的方法3.噪声数据处理(1)分箱法(2)聚类法(3)回归法(4)估算分析法(5)3σ原则回归法试图发现两个相关变量之间的变化模式,通过使数据符合一个函数来平滑处理数据,即通过建立数学模型来预测下一个数值,包括线性回归和非线性回归。利用回归分析方法所获得的拟合函数,能够帮助平滑数据及去除其中的噪声,如图5-5所示。三、数据清洗的方法3.噪声数据处理(1)分箱法(2)聚类法(3)回归法(4)估算分析法(5)3σ原则对于极个别的异常数据,还可以采取估算分析法,例如,可以使用平均值、中值、mode估算方法等来实现。此外,在估算之前,应该首先分析该异常值是自然异常值还是人为的。如果是人为的,则可以用估算值来估算,除此之外还可以使用统计模型来预测异常数据观测值。三、数据清洗的方法3.噪声数据处理(1)分箱法(2)聚类法(3)回归法(4)估算分析法(5)3σ原则3σ原则是指如果数据服从正态分布,那么在3σ原则下,异常数据为一组测定值中与平均值的偏差超过3倍标准差的值。因此,如果数据服从正态分布,那么距离平均值3σ之外的值出现的概率为p(│x-μ│>3σ)≤0.003(属于小概率事件),即可以认为是异常数据。如果数据不服从正态分布,也可以用远离平均值的多少倍标准差来描述,如图5-6所示。三、数据清洗的方法4.冗余数据处理冗余有两层含义,第一层含义是指多余的不需要的部分,第二层含义是指人为增加的重复部分。因此冗余数据既包含与分析处理的问题无关的数据,也包含重复的数据,通常采用过滤数据的方法来处理冗余数据。(1)重复过滤(2)条件过滤三、数据清洗的方法5.数据格式与内容处理在数据集中,如果数据是由系统日志而来,那么通常在格式和内容方面与元数据的描述一致。而如果数据是由人工收集或用户填写而来,则有很大可能在格式和内容上存在一些问题。数据格式与内容的问题包含以下几类。(1)时间、日期、数值、全半角等显示格式不一致(2)内容中有不该存在的字符(3)内容与该字段应有内容不符三、数据清洗的方法6.逻辑错误处理在数据清洗时,会发现一些使用简答逻辑推理就可以直接发现问题的数据,这部分数据也要进行处理,防止数据分析结果出现偏差。这些数据的问题是不符合逻辑的,如重复记录、异常值和极端值等,通常称其为逻辑错误。逻辑错误处理主要包含以下三种情况:(1)去重(2)去除不合理值(3)修正矛盾内容第四节人力资源数据清洗第一章第二篇方法篇一、缺失值填补图5-7选中数据区域以图5-7为例,表中为某地区高校学生的平均身高数据,其中,男女性身高都有缺失值。选中男性身高的数据区域,可以使用快捷键“Ctrl+G”,也可以采用选择菜单。一、缺失值填补图5-8定位使用快捷键“Ctrl+G”,会弹出“定位”对话框(图5-8),选中“定位条件”;采用选择菜单:单击“开始”—“查找和选择”—“定位条件”。一、缺失值填补在弹出的“定位条件”对话框,选择“空值”(这里示例的表格中缺失值处是空值,可以根据实际需求对应选择)。单击“确定”,如图5-9所示。图5-9定位条件一、缺失值填补回到数据表,会发现所有缺失值处出现灰色的底色(图5-10),则证明所有缺失值都被选中。那么如何填充这些空值呢?图5-10选中缺失值一、缺失值填补一般会选择采用样本的平均值来代替缺失值,假设这里的平均值为178,使用键盘输入“178”,然后按“Ctrl+Enter”组合键。这样,刚才所有被选中的缺失值所处的单元格里都变成了178,如图5-11所示。图5-11填充缺失值①Left函数,用于从左截取字符串,公式为=Left(值所在单元格,截取长度)②Right函数,用于从右截取字符串,公式为=Right(值所在单元格,截取长度)③Mid函数,用于从中间截取字符串,公式为=Mid(值所在单元格,开始位置,截取长度),如根据身份证号提取出生年月。二、数据截取或分列(一)采用函数截取字段二、数据截取或分列(二)采用分列功能进行分列以图5-12为例,从网上爬取的岗位薪资表中,薪资信息是文本形式,但下一步进行的数据分析需要数值型的薪资信息,我们需要从文本中提取数字并进行相应的处理。图5-12岗位薪酬表二、数据截取或分列(二)采用分列功能进行分列如图5-13所示,选择要进行清洗的数据B列,单击“数据”—“分列”。图5-13选择数据二、数据截取或分列(二)采用分列功能进行分列如图5-14所示,在弹出向导窗的第1步选择“分隔符号”选项,单击“下一步”;在第2步选择分隔符号的“其他”选项并填入“/”,单击“下一步”;在第3步选择“常规”,单击“完成”,即完成了第一次数据分列。图5-14第一次数据分列二、数据截取或分列(二)采用分列功能进行分列再次选择B列数据,依照上述操作以“-”为分隔符号完成第二次数据分列并替换C列的内容。将D列命名为单位,在D2单元格中输入函数=RIGHT(C2,1),双击填充柄向下完成填充,复制D列数据在D列粘贴为“值”。选择C列数据,单击“查找和选择”—“替换”,在“查找内容”输入“万”,单击“全部替换”,将“查找内容”换成“千”,单击“全部替换”。替换完成后,依次将E、F、G列命名为最低薪资、最高薪资和平均值,分别在E2、F2、G2中输入函数=IF(D2=“万”,B2*10000,B2*1000)、=IF(D2=“万”,C2*10000,C2*1000)、=AVERAGE(E2:F2),双击填充柄向下完成填充。最终结果如图5-15所示。图5-15分列完成结果三、去除重复项以人员花名册中的姓名重复项为例。先选中姓名所在列,切换到“开始”选项卡,在“样式”组中,单击“条件格式”的下三角按钮,在弹出的下拉列表中,单击“突出显示单元格规则”,在弹出的菜单中单击“重复值”,弹出“重复值”对话框,可编辑背景填充颜色等格式设置(图5-1

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论