SPSS 数据分析与应用课件 第2章 SPSS数据预处理_第1页
SPSS 数据分析与应用课件 第2章 SPSS数据预处理_第2页
SPSS 数据分析与应用课件 第2章 SPSS数据预处理_第3页
SPSS 数据分析与应用课件 第2章 SPSS数据预处理_第4页
SPSS 数据分析与应用课件 第2章 SPSS数据预处理_第5页
已阅读5页,还剩24页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

第2章SPSS数据预处理学习目标1.掌握数据排序、变量计算的具体操作步骤2.掌握数据去重的方法和具体操作步骤3.掌握重新编码的具体操作步骤4.理解各种数据分组的特点和适用场合,并掌握组距分组的具体操作步骤5.掌握数据选取的方法和具体操作步骤学习导读与引导案例数据预处理:初学者易忽视却极为关键的一环原始数据常存在缺失、异常、格式不统一或结构混乱等问题。本章系统讲解数据排序、去重、变量计算、重新编码、数据分组与选取等核心预处理方法的原理与SPSS操作。图2-1大学生恋爱数据.sav(部分)引导案例问卷调查获得大学生恋爱情况数据,含很多“噪声数据”,需去除不相关数据或衍生新变量。思考有的数据重复填写,有的有明显错误——如何预处理得到一份高质量的数据文件?预处理是得到准确、可靠分析结论的前提:先加工数据,再谈分析。本章六大预处理操作总览从“原始数据”到“高质量分析数据”的加工流水线2.1数据排序重排个案次序,浏览取值、发现异常2.2数据去重按关键变量识别并删除重复个案2.3变量计算表达式/函数派生新变量、变换分布2.4重新编码重设变量值,覆盖或生成新变量2.5数据分组组距分组“粗化”数值,把握分布2.6数据选取按条件/随机抽取部分样本参与分析Part2.1数据排序2.1.1数据排序的作用排序是浏览数据、发现问题的第一步便于浏览排序后更便于浏览,有助于了解数据的取值状况、缺失值数量等把握离散程度快速找到最大值和最小值,计算全距,把握和比较数据的离散程度发现异常值快速发现数据中可能的异常值,判断其是否会对分析结果产生重要影响个案次序原本由录入先后决定;按“基本工资从低到高”或“职称从高到低”重排,能让数据结构一目了然。2.1.2数据排序的SPSS实现【数据(D)】>【个案排序(O)】:按“年级+每月话费”多重升序步骤1打开数据文件,选择【数据(D)】>【个案排序(O)】步骤2指定主排序变量到【排序依据(S)】,选择升序或降序步骤3多重排序:依次指定第2、第3排序变量及排序规则完成可勾选【保存带分类数据的文件】将结果另存为.sav图2-2“排序个案”对话框注意1整行排序排序是对整行数据排序,而非只对某列变量排序注意2次序关键多重排序中先指定的变量优先于后指定的变量注意3保留原序时间序列数据若无时间变量,注意保留原始排列顺序Part2.2数据去重2.2数据去重按关键变量排序找出重复个案,再从数据中删除为什么去重数据中不应出现关键变量值相同的个案;重复多因录入疏忽或不合理编码导致,需要删除以保证分析质量。SPSS如何查找自动查找的主要方法是排序:按指定关键变量排序后,关键变量值相同的重复个案将被排到一起,便于识别。步骤1【数据(D)】>【标识重复个案(U)】步骤2关键变量选入【定义匹配个案的依据】:本例为“每周自习时间”“每月话费”步骤3生成“主个案指示符”变量:1=唯一或基本,0=重复步骤4-5勾选“连续计算匹配个案”生成“匹配顺序”;重复个案移至文件开头图2-3“标识重复个案”对话框2.2.2数据去重结果解读标识变量让重复个案“现形”,确认后即可删除图2-4重复个案结果(部分)主个案指示符取值1表示唯一或基本个案;取值0标识的就是重复个案匹配顺序取0为非重复个案;取1、2…表示重复组内的出现次序移至开头重复个案集中排列在文件开头,便于人工复核后删除操作要点:先“标识”再“删除”——用指示符变量筛选出重复个案(0值),人工确认无误后再删除,避免误删有效数据。Part2.3变量计算2.3.1变量计算的目的在原有数据基础上,用算术表达式与函数生成新数据①派生新变量通过计算产生信息更丰富的新数据:由基本工资、失业保险、奖金计算实际月收入;由贷款总额和按揭方案计算月供;由身高体重计算体质指数。②变换原有分布有些模型对变量分布有要求:对非正态变量做对数变换;对时间序列数据做平稳化处理等。注意事项:①变量计算针对所有个案(或指定部分个案)进行,每个个案都有自己的计算结果;②计算结果应保存到指定变量中,且该变量的数据类型应与计算结果一致。2.3.2–2.3.4表达式与函数变量计算的三大工具:算术表达式、条件表达式、SPSS函数SPSS算术表达式由常量、变量、算术运算符、圆括号、函数组成。运算符:+−*/**(乘方);先乘方、再乘除、后加减;同一表达式中常量与变量数据类型须一致;字符型常量用英文引号。SPSS条件表达式对条件判断取真/假。简单式:>、<、=、~=、>=、<=;复合式(逻辑表达式):&/AND、|/OR、~/NOT,NOT优先级最高。用于对不同组个案分别计算。SPSS函数:书写形式为“函数名(参数)”。按功能分为8类——算术函数、统计函数、与分布相关的函数、查找函数、字符串函数、缺失值函数、日期函数和其他函数。三者常组合使用:条件表达式圈定个案范围,算术表达式与函数完成具体计算。2.3.5变量计算的SPSS实现案例:由“身高”“体重”计算体质指数(BMI)步骤1【转换(T)】>【计算变量(C)】,打开“计算变量”对话框步骤2【数字表达式】中输入体重/身高**2(可手动或点选函数)步骤3【目标变量】输入新变量名“体质指数”,默认数值型步骤4如需限定个案范围,单击【如果(I)】输入条件表达式图2-5“计算变量”对话框图2-6“计算变量:If个案”对话框2.3.5计算条件与结果注意事项不满足条件的个案如何处理?图2-7计算变量数据结果(部分)结果存到新变量新变量自动创建;不满足条件的个案取系统缺失值。结果覆盖旧变量已存在变量会询问是否覆盖;不满足条件的个案保持原值不变。计算规则:体质指数=体重÷身高的平方,结果命名为“体质指数”。Part2.4重新编码2.4.1重新编码的目的将变量的原始值重新设定:覆盖原变量或生成新变量重新编码为相同变量变量的值改变后直接覆盖原变量的值;或变量重新分组后,直接将分组信息覆盖原变量。适合确定不再需要原始值的场景。重新编码为不同变量将原变量的某一值或某一值范围变成一个新的数值,生成新变量保存结果,原始变量保留,安全可追溯,教学与实务中更常用。典型应用:分组处理(如生活费划分等级)、改变变量值(如合并类别)、改变数据类型。本案例对“生活费_百元”重新编码,生成新变量“生活费等级”。2.4.2重新编码的SPSS实现【转换(T)】>【重新编码为不同变量(R)】,6步完成步骤1【转换(T)】>【重新编码为不同变量(R)】,选入“生活费_百元”步骤2【输出变量】名称输入“生活费等级”,单击【变化量(H)】确认步骤3单击【旧值和新值(O)】打开规则定义对话框步骤4旧值“范围,从最低到值”输入20→新值1,单击【添加(A)】步骤5依次定义:21~40→2,41~60→3,61~80→4,81到最高→5步骤6【继续】→【确定】,数据窗口新增“生活费等级”变量若选【重新编码为相同变量(S)】将直接替换原变量数据,请谨慎使用。2.4.2对话框与结果逐条添加“旧值→新值”规则,结果自动新增一列图2-8“重新编码为不同变量”图2-9“旧值和新值”对话框图2-11添加旧值和新值图2-12重新编码结果窗口(部分)结果解读:原数据基础上新增“生活费等级”列;若小数点后含两位小数,可通过修改变量属性(小数位数)去掉。Part2.5–2.6数据分组与数据选取2.5.1数据分组的目的与组距分组把细致数值“粗化”为若干组,直观呈现分布特征为什么分组分组基础上做频数分布,能概括体现数据分布特征,还可实现数据离散化。成绩等细致原始值不利于直观呈现整体分布。①确定分组数目以能清楚显示数据分布特征为原则;可用经验公式K≈1+3.322lg(n)估算(本例n较大,理论约9组)。②确定组距组距=上限−下限≈(最大值−最小值)/组数。成绩0~100分,组距约11;实际结合业务取整。关键因素组距分组两关键:分组数目与组距。分组区间须遵循“不重不漏”:每值只属于一组,且所有值都有归属。表2-1数据分组举例:60分以下216人(73.7%)|60~69分19人|70~79分17人|80~89分15人|90分以上26人(8.9%)2.5.2组距分组的SPSS实现用“重新编码为不同变量”实现成绩水平分组图2-13“重新编码为不同变量”图2-14定义分组区间图2-15数据分组结果窗口(部分)操作流程:选入“成绩水平”→输出变量命名“成绩水平等级”→【旧值和新值】逐个定义区间(最低~59→1,60~69→2,…,90~最高→5)→确定生成新变量。若仅对部分个案分组,可单击【如果(I)】输入条件表达式。2.6.1–2.6.2数据选取的目的与方法从大批量总体数据中按规则抽取部分样本参与分析目的①提高分析效率大数据量影响计算与建模效率,抽取少量样本后分析只针对样本进行。目的②检验模型只用部分样本建模,用未参与建模的数据验证模型的完整性与预测能力。选取方法说明按指定条件选取以条件表达式筛选,条件为真的个案被选中随机选取·近似给出百分比,随机抽取相应数目个案(数目为近似)随机选取·精确指定个案数与范围,在前若干个案中精确随机抽取选取某一区域内样本指定个案号上下限,常用于时间序列数据通过筛选器变量选取筛选器变量非0且非系统缺失的个案被选中,常用于排除缺失2.6.3数据选取的SPSS实现案例:仅分析“生活费_百元≤10”的学生步骤1【数据(D)】>【选择个案(S)】步骤2【选择】框选【如果条件满足(C)】,输入条件生活费_百元<=10步骤3【输出】指定未选中个案处理方式说明随机选取前可用【转换】>【随机数生成器】设固定种子以重现结果图2-18条件筛选对话框图2-19输出方式设置2.6.3未选中个案的两种处理方式“过滤”可恢复,“删除”不可逆图2-20数据选取结果窗口(部分)过滤掉未选定的个案未选中个案号码加“\”标记,暂时筛掉,可随时恢复,推荐。删除未选定的个案未选中个案直接从数据中删除,不可恢复,操作前请先备份。选中后,后续所有分析只针对选出的个案,直到取消选取。本章小结六大操作构成数据预处理完整工具箱数据排序整行重排:浏览取值、找极值、发现异常数据去重关键变量排序标识重复个案,确认后删除变量计算表达式+函数派生新变量、变换分布重新编码旧值→新值规则,建议生成新变量数据分组组距分组:定组数、定组距、不重不漏数据选取条件/随机/区域/筛选器,过滤优于删除本章习题(节选)检验对核心概念的掌握单选1SPSS提供的数据选取方法有4种单选4SPSS自动查找重复个案的主要方法是排序单选5随机选取数据的方法是近似选取判断1数据排序可分为单变量排序与多重排序(√)判断4表达式中常量与变量类型不一致也可计算(×)判断5数据选取中精确选取包括随机选取(×)本章实训:某银行信用卡用户逾期行为分析综合运用六大预处理操作实训背景信用卡业务爆发式增长,持卡人消费、还款行为已成为个人征信的重要依据,不良使用行为将影响持卡人

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论