数据基础分析及研究6_第1页
数据基础分析及研究6_第2页
数据基础分析及研究6_第3页
数据基础分析及研究6_第4页
数据基础分析及研究6_第5页
已阅读5页,还剩25页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

马秀麟数据分析方法及应用2018年3月第2讲数据采集与规范化处理一、数据来源1.社会调查、测量与评价评价指标体系调查问卷量表方法网上调查纸质问卷实名问卷/匿名问卷测量数据成绩单、各社会现象的测量(温度、生长、水文等)一、数据来源2.内容分析文本内容获取编码数据的数值化3.外部导入MIS系统例如:学生评教例如:学生成绩单二、数据的质量1、评价与调查指标设计关键问题指标来源——(调查、评价)自设指标体系量表指标的科学性?——自编问卷信度效度指标的客观性?调查问题的客观性要求问卷能否准确、完整地反应调查问题二、数据的质量对自设指标的要求指标内容尽可能清晰、没有误解避免二义性指标中要尽量采用单选题(五级指标),慎用多选题指标的信度与效度保证指标要经过两轮以上的试用并完善进行信度与效度检验通过专家评价法(德尔菲方法)论证问卷的效果适当设置验证性问题筛选无效的数据记录注意其编码二、数据的质量2、数据的采集调查对象的选择调查对象的代表性调查对象应分布均匀,代表性强调查对象的状态、态度与精神风貌调查中校验项的设计调查问卷的填写质量缺失值不规范的填写无效问卷调查中的校验项实验组对照组模式实验组、对照组前测状态——无显著性差异——独立样本检验实验组、对照组后测状态——最好有显著性差异——独立样本检验三、数据获取与清理1、数据输入(1)规范的数据表结构二、数据的质量3、数值型变量的三种类型定距变量即描述距离型信息的变量,其特点为:取值为连续型数值的变量。例如学生成绩。别名:度量型变量、连续型变量。特征:高测度数据定序变量即描述具有一定顺序关系的变量。其特点为:取值为离散型数值。例如:1—不好,2—一般,3—很好。别名:序号型变量特征:离散型取值中低测度数据。在取值范围大于或等于5时,其均值才有意义。二、数据的质量定类变量即仅描述记录的所属类型的变量,其大小无意义。其取值仅仅表达不同的类别别名:名义型变量特征:离散型取值。中低测度数据。其均值无意义。二、数据的质量4、数据规范化要求(1)尽量多采用数值型数据直接编码为数值型数据录入后转码为数值型数据(2)对于离散型数值量尽量使用定序类型,少用定类类型尽可能设计有序类别(3)所有问题的编码方向应一致多问题尽可能保持一致性校验项的方向要纠正过来(4)以特殊记号标注缺失值三、数据获取与清理1、利用Excel输入数据并清理(1)借助Excel输入数据基本格式规范在首行输入字段名其他行输入数据记录三、数据的获取与清理(2)Excel中的数据清理数据类型规范化处理=Text(单元格,“格式”)=value(单元格)粘贴值(复制—粘贴值)数据行(垃圾行)的清理排序筛选清理特定数据例如:不允许55-60之间的成绩出现多余空白行的删除三、数据的获取与清理数据编码带有条件的数据编码=IF(条件式,式子1,式子2)以“查找/替换”实现重新编码秩分计算Rank(数值,参考区域)三、数据的获取与清理数据计算基于公式的计算计算总分、计算平均分、加权计算式方差、标准差频度分析Frequency(数据区,分段区)<Ctrl>+<Shift>-<Enter>绘制统计图条件计算式:Countif()Sumif()AverageIF()三、数据的获取与清理(3)不同数据表的拼合拼合个案的操作预处理各列,使之对应直接复制拼合变量的操作特点两个针对同一组个案的不同数据表把两个表的内容拼合在一起方法VLOOKUP函数的使用VLOOPUP(标记变量,提供数据区域,数据列,类型)例如:Vlookup(某一学号,首列为学号列的区域,历史列,false)三、数据的获取与清理2、SPSS下的数据文件的编辑(1)变量视图作用:定义数据表的每一列及其含义强调:变量名应尽可能使用“简短的英文”或“拼音缩写”(2)变量视图的操作名称:简短英文缩写或中文缩写类型:数值/字符串宽度标签:可使用完整的中文值:对取值的中文说明缺失:缺失值标记度量类型:度量型、序号型、名义型三、数据的获取与清理(3)直接在SPSS中输入数据先在“变量视图”中定义列类型缺失值标记某些特定值为缺失值数值类型补充说明:定距(定比)变量、定序变量、定类变量文字标签值标签在“数据视图”中输入记录三、数据的获取与清理(4)数据的导入与导出数据导入导入Excel文件低版本Excel,首行为字段名(标题)导入后请重新进行“变量定义”数据导出文件——另存为——文件类型(*.xlsx)输入文件名——保存三、数据的获取与清理(5)文件合并合并变量——不同数据表之间列的拼合含义为当前数据表添加变量列要求被合并文件必须按照关键字升序排列方法数据——合并文件——添加变量声明按照关键字合并,指定合并关键字。三、数据的获取与清理3、SPSS的数据处理个案排序数据——排序个案个案转置数据——转置选择个案数据——选择个案注意:执行“选择个案”后,只有符合条件个案才参与数据分析加权个案含义以特定变量作为频数,用于说明某个量比较多。方法数据——加权个案,声明作为频数的变量。三、数据的获取与清理4、数据的分类汇总含义针对数据分组,并基于分组进行统计方法数据——分类汇总在分类汇总对话框中,选择“分组变量”选择“汇总变量”单击“函数”按钮,设置汇总的计算方式最后,“确定”补充说明:汇总结果默认附加在当前数据集右侧用户可把汇总结果指定到独立的数据集(效果更好)四、SPSS中的数据变形1、秩分变量的生成含义为数据列添加序号(名次)秩分值的方向升序、降序秩分值形式:最大、最小、均值、连续值高级应用秩分变量、指数分布变量、秩分数/权重、秩分数/权重的百分比四、SPSS中的数据变形方法转换——个案排秩选择“变量”(少量情况下需要分组求秩分,比如分别按性别排名)从左下角选择:升序/降序在右上角选择“秩的类型”秩分变量、指数分布变量、秩分值/总权重、秩分值/总权重的百分比在右上角选择“结果的类型”赋予:最低序号、最高序号、均值序号实例补充转换—自动重编码四、SPSS中的数据变形2、对数据的重编码含义对于已有个案的特定列,重新根据规则进行编码。比如:性别——性别码民族——民族码方法转换——重新编码为相(不)同变量选择“变量名”单击“旧值和新值”按钮,启动对话框,设置旧值条件,设置对应的新值最后,单击“确定”按钮。四、SPSS中的数据变形3、分段变量的生成含义把数据分为几个段,对于每段内的个案给予相同编号关键问题如何分段?如何标记?分段方式直接指定分段区:比如:从8开始,按照步长10递增,共10段。按照百分位数进行分段比如:个案分为5份,每份25%,标记出序号和每段值的断点。按照标准差取值进行分段序号反应离散程度四、SPSS中的数据变形方法转换——可视离散化选择数据列——继续,进入“可视化封装”对话框在“可视化封装”对话框中选择“生成分割点”添加标签最后,“确定”结果生成新的列,列内数据为:每个个案所在的段号四、SPSS中的数据变形4、水平计算含义基于函数和运算要求,撰写计算公式,实现列间的计算例如:基于“语文、数学、外语”计算总分或者平均分基于“基本工资、奖励”等计算工资总额方法转换——计算变量输入“目标变量名称”【即:新列的列名】输入计算公式(可以使用函数)最后,“确定”。说明可以利用底部的“if”选择参与计算的个案。四、SPSS中的数据变形5、水平计数含义统计每个个案的指定列集

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论