版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
数据分析方法及应用2018年11月课程简介一、课程内容课程内容简介综述数据采集与准备清理与规范化,数据统计与数据描述统计推断与分析检验归因与归类分类与降维技术一、课程内容数据描述数据的基本类型定距变量(度量型)——连续数据定序变量(序号型)——离散数据定类变量(名义型)——离散数据数据的关键特征集中性离散性分布形态正态分布、泊松分布指数分布等一、课程内容数据差异显著性分析参数检验(近正态分布且高测度数据)T检验方差分析、非参数检验(非正态数据或低测度数据)定距数据的非参数检验定类数据的卡方检验一、课程内容关联性分析相关性分析回归分析——预测与趋势线性回归曲线回归逻辑回归归因分析相关性分析回归分析方差分析主成分分析等一、课程内容归类与聚合聚类分析判别分析因子分析主成分分析可靠性分析信度保证与检验效度保证与检验2018年2月教师简介教师简介1.基本信息姓名,男,教育技术学博士副教授,硕士生导师个人经历1992年,走上大学讲台1997年,讲师2003年,副教授联系方式Email:maxl@教师简介2.教学经历主讲的主要课程(三轮以上):《多媒体技术与网页制作》、《信息技术与课程整合》《数据结构》、《动态网站开发》、《Java语言》《数据分析方法及应用》、《教育管理信息系统》、教学成果出版高校教材15部,出版教学类专著3部已经指导硕士研究生32名(已毕业),目前在读硕士11名教师简介教学奖励2004年,北京师范大学十佳教师2006年,北京师范大学本科教学优秀奖2010年,北京师范大学多媒体网络课程大赛二等奖2014年,北京师范大学钱瑗教育基金奖2015年,北京师范大学多媒体课件比赛一等奖、全国多媒体教学课件大赛一等奖2016年,北京师范大学教学名师奖学习资源、教材与教学一、教材与资源1、教材《数据分析方法及应用》,等编著人民邮电出版社,2015年一、教材与资源2、参考书《SPSS
forWindows数据统计分析工具应用教程》,衷克定编著,北京师范大学出版社,2008年一、教材与资源2、参考书SPSS统计分析方法及应用薛薇编著电子工业出版社2009年11月一、教材与资源2、参考书统计数据分析基础教程——基于SPSS和Excel的调查数据分析,叶向编著,中国人民大学出版社,2009年出版一、教材与资源3、网络课程教学服务平台:/,请正确地登录;本科生登录硕士生登录选择课程《数据分析方法及应用》。二、教学方式课堂讲授教师讲授,学生倾听与讨论上机实践本科生在机房完成上机作业硕士生课外自行完成各种作业通过上机实践获得感性认识,强化理解大型作业(机动)自行完成一份基于社会调查的大型作业三、评价方式1、总体设计考核采用平时成绩与期末成绩相结合的形式:综合评价成绩构成:平时40%,期末考试60%。2、具体要求平时作业:包括上机实验、作业等;大型的社会调查与分析报告(机动)自行选题,设计调查问卷,完成数据分析期末考试期末考试采用无纸化上机考试的形式(60%)。第一章数据处理概述一、课程背景1.大数据时代的来临背景信息系统的广泛应用商业、政务经济、社会学教育信息爆炸——数据爆炸数据需要发挥价值数据内部隐藏规律数据的商业价值一、课程背景1.大数据时代的来临大数据的特点——4个“V”。①数据体量(Volumes)巨大。大型数据集,从TB级别,跃升到PB级别。②数据类别(Variety)繁多。数据来自多种数据源,数据种类和格式冲破了以前所限定的结构化数据范畴,囊括了半结构化和非结构化数据。③价值(Value)密度低。以视频为例,连续不间断监控过程中,可能有用的数据仅仅一两秒钟。④处理速度(Velocity)快。包含大量在线或实时数据分析处理的需求,1秒定律。一、课程背景大数据时代的特点数据的服务模式和构建过程越来越趋向于个性化、自主化、虚拟化、智能化、透明化和体验化;知识创造模式、组织模式、传播模式和应用模式呈现出规模化、集约化、数字化和网络化的趋势。基于时间序列的分析与趋势分析日益重要一、课程背景大数据时代的物质基础大数据时代的技术基础高性能计算机、高速网络、大容量存储大数据时代的数据基础各类信息系统的大量积累信息的高速处理与传递大数据时代对数据处理的要求从大数据中挖掘规律——数据分析与数据挖掘避免在数据海洋迷航——数据推送一、课程背景2.计算机科学思维方式的价值(1)计算思维拓展了其他学科的研究方法体系不同学科所形成的科学研究方法在学科自身发展的推动下迅速发展,在计算机科学与技术的支持下,自然科学研究的主流研究方法范式----实证研究的量化数据处理,发展出了一整套形式语言理论、编译理论、检验理论以及优化理论。人文社会科学研究的主流研究方法范式----思辨研究质性分析,则受到了计算机科学冲击,从基本文本分析到语义分析、语料分析处理,也都可借助计算机将原本只有人工才能分析的复杂内容形式化、程序化和机器化。一、课程背景(2)计算思维丰富和深化了其他学科的研究范畴计算机科学与技术作为发展最快的学科开创了信息时代,其方法论特性直接渗透和影响到一些学科,并延伸到各个基础研究领域。(3)计算思维改变了各个学科的发展模式由于学科知识体系的有机关联,计算思维在理论和实践上的成果带来了相关学科的活跃与繁荣。尤其是其方法论意义对各个学科的启发和促进作用异乎寻常。现代科学发现了一系列原有科学理论体系不能解释和说明的新的事实,出现了一些佯谬,破坏了科学体系已有原则和思维前后逻辑的一贯性和严密性,产生了现代科学范畴体系的许多带有根本性的变化,同时也促使思维模式、逻辑方法向前发展。一、课程背景3.人才培养面临的新形势学科的交叉与融合数据采集与处理能力的变化网络化Internet化研究方法的信息化数据采集能力数据检验能力数据分析能力数据推送能力定量与实证日益重要一、课程背景4、存在的问题数据分析技术能做什么?不清楚何时、何地能用数据分析技术?不恰当地使用滥用数据分析技术简单、重复地应用做了一大堆的百分比错误应用?(对应用的描述恰当否)分析方法错误解读结果错误缺乏高水平使用二、数据处理简介1.数据处理的两个层次服务于事务性活动服务于业务活动例如:教务系统中的成绩管理、选课管理学生系统中的学籍管理等表现形态各类信息系统数据分析与应用分析数据的内在规律,进一步应用数据例如:对成绩情况的挖掘对学生评教情况的挖掘二、数据处理简介2.数据分析的两种模式静态的数据分析技术——数据分析技术基于社会科学统计分析软件面向静态数据开展各类分析(关联性、差异性、归因等)动态的数据分析技术——数据挖掘技术(DM)基于动态变化的信息系统,设计数据挖掘模块针对动态数据实时分析其内在联系二、数据处理简介3.数据分析技术在科研中的主要应用研究方法质性研究定量研究——实证性研究,调查与分析主要形式社会调查与分析教育学、心理学、经济学、社会学、哲学、法律内容分析法、文献研究法中文、历史、法律二、数据处理简介4.数据分析(数据挖掘)的主要技术数据情况描述——数据的类型定距变量——连续数据定序变量——离散数据定类变量——离散数据(大小无关性)——数据特征描述集中性均值、众数、中数离散性标准差、标准误、方差、全距(极差)、四分位差异众比率——分布情况正态分布?泊松分布、指数分布二、数据处理简介差异性检验——均值差异性(T检验、方差分析)——分布差异性关联性分析——相关性分析(相关系数、检验概率)——回归分析归因分析——回归分析、方差分析、主成分分析归类与聚合——聚类分析、判别分析等可靠性分析二、数据处理简介5、数据分析与挖掘的软件数据分析软件专业化SPSS(StatisticalProductandServiceSolutions)或(StatisticalPackageforSocialScience)——广泛应用于社会科学,SAS(StatisticalAnalysisSystem)——应用于化学、生物、心理、农医等领域的统计分析软件Systat(SystemStatistical)——广泛应用于各类统计分析二、数据处理简介业余软件Excel的数据统计与分析函数统计函数SumCountIFCountIF等分析函数TtestFtestCorrel等Excel的数据分析工具库Excel的重要组件已经成为默认安装组件,但需要人工打开必要的开关项。二、数据处理简介数据挖掘(DM)体系对于信息的挖掘,可分为两类:数据挖掘(Mining
for
Data)工具:其所用的数据都存储在已经有了明确字段定义的数据库或文本文件里,我们称之为结构化的数据挖掘工具。它主要是用来进行预测、聚类分析、关联分析、时间序列分析以及统计分析等。文本挖掘(Text
Mining)工具:它是用来从非结构化的文档中提取有价值的信息,这些信息都隐藏在文档里并且没有清晰的字段定义。文本挖掘主要是应用在市场调研报告中或呼叫中心(Call
Center)的客户定级、专利的分类、网页的分类以及电子邮件分类等。二、数据处理简介数据挖掘的特点集成于数据库管理系统之中,需要数据仓的支持补充知识数据库与数据仓示例微软公司BusinessIntelligenceDevelopmentStudio中的AnalysisServices大型网络平台的内置数据挖掘功能购物网站的商品推送新浪网的“猜你喜欢”三、SPSS与Excel简介1、Excel的数据分析功能与SPSSExcel简介Excel的简单数据统计与分析函数Excel的专业化数据分析工具SPSS简介专业化的社会科学统计分析工具目前常用版本:V18.0—V21.0。三、SPSS与Excel简介2、启用Excel的数据分析工具启用分析工具的方法在界面左上角找到“文件”按钮。单击此按钮,并从中选择“Excel选项”,以便启用“Excel选项”界面;从界面左侧选中“加载项”,然后在其面板底部选择“Excel加载项”,并单击“转到”按钮;在弹出的对话框中选择把“分析工具库”复选框选中,然后单击“确定”。应用分析工具选用选项卡“数据”;在功能区中右侧找到“数据分析”按钮,单击之后即可获得数据分析对话框。三、SPSS与Excel简介3、安装SPSS的系统首先,下载SPSS系统软件从教学服务平台下载软件其次,安装SPSS18.0软件单击其中的安装文件SETUP.EXE,启动安装过程(建议安装在默认文件夹,选用个人用户)安装完毕后,在弹出的产品授权对话框中,点击“取消”关闭该对话框。对已安装的软件实施和谐化将解压缩所得到的目录EQX下的所有文件复制到SPSS安装目录中,覆盖原有文件。如果在安装过程中没有改变目录,则应该是复制到目录: “C:\ProgramFiles\SPSSInc\PASWStatistics18\”。数据分析方法及应用2018年3月第2讲数据采集与规范化处理一、数据来源1.社会调查、测量与评价评价指标体系调查问卷量表方法网上调查纸质问卷实名问卷/匿名问卷测量数据成绩单、各社会现象的测量(温度、生长、水文等)一、数据来源2.内容分析文本内容获取编码数据的数值化3.外部导入MIS系统例如:学生评教例如:学生成绩单二、数据的质量1、评价与调查指标设计关键问题指标来源——(调查、评价)自设指标体系量表指标的科学性?——自编问卷信度效度指标的客观性?调查问题的客观性要求问卷能否准确、完整地反应调查问题二、数据的质量对自设指标的要求指标内容尽可能清晰、没有误解避免二义性指标中要尽量采用单选题(五级指标),慎用多选题指标的信度与效度保证指标要经过两轮以上的试用并完善进行信度与效度检验通过专家评价法(德尔菲方法)论证问卷的效果适当设置验证性问题筛选无效的数据记录注意其编码二、数据的质量2、数据的采集调查对象的选择调查对象的代表性调查对象应分布均匀,代表性强调查对象的状态、态度与精神风貌调查中校验项的设计调查问卷的填写质量缺失值不规范的填写无效问卷调查中的校验项实验组对照组模式实验组、对照组前测状态——无显著性差异——独立样本检验实验组、对照组后测状态——最好有显著性差异——独立样本检验三、数据获取与清理1、数据输入(1)规范的数据表结构二、数据的质量3、数值型变量的三种类型定距变量即描述距离型信息的变量,其特点为:取值为连续型数值的变量。例如学生成绩。别名:度量型变量、连续型变量。特征:高测度数据定序变量即描述具有一定顺序关系的变量。其特点为:取值为离散型数值。例如:1—不好,2—一般,3—很好。别名:序号型变量特征:离散型取值中低测度数据。在取值范围大于或等于5时,其均值才有意义。二、数据的质量定类变量即仅描述记录的所属类型的变量,其大小无意义。其取值仅仅表达不同的类别别名:名义型变量特征:离散型取值。中低测度数据。其均值无意义。二、数据的质量4、数据规范化要求(1)尽量多采用数值型数据直接编码为数值型数据录入后转码为数值型数据(2)对于离散型数值量尽量使用定序类型,少用定类类型尽可能设计有序类别(3)所有问题的编码方向应一致多问题尽可能保持一致性校验项的方向要纠正过来(4)以特殊记号标注缺失值三、数据获取与清理1、利用Excel输入数据并清理(1)借助Excel输入数据基本格式规范在首行输入字段名其他行输入数据记录三、数据的获取与清理(2)Excel中的数据清理数据类型规范化处理=Text(单元格,“格式”)=value(单元格)粘贴值(复制—粘贴值)数据行(垃圾行)的清理排序筛选清理特定数据例如:不允许55-60之间的成绩出现多余空白行的删除三、数据的获取与清理数据编码带有条件的数据编码=IF(条件式,式子1,式子2)以“查找/替换”实现重新编码秩分计算Rank(数值,参考区域)三、数据的获取与清理数据计算基于公式的计算计算总分、计算平均分、加权计算式方差、标准差频度分析Frequency(数据区,分段区)<Ctrl>+<Shift>-<Enter>绘制统计图条件计算式:Countif()Sumif()AverageIF()三、数据的获取与清理(3)不同数据表的拼合拼合个案的操作预处理各列,使之对应直接复制拼合变量的操作特点两个针对同一组个案的不同数据表把两个表的内容拼合在一起方法VLOOKUP函数的使用VLOOPUP(标记变量,提供数据区域,数据列,类型)例如:Vlookup(某一学号,首列为学号列的区域,历史列,false)三、数据的获取与清理2、SPSS下的数据文件的编辑(1)变量视图作用:定义数据表的每一列及其含义强调:变量名应尽可能使用“简短的英文”或“拼音缩写”(2)变量视图的操作名称:简短英文缩写或中文缩写类型:数值/字符串宽度标签:可使用完整的中文值:对取值的中文说明缺失:缺失值标记度量类型:度量型、序号型、名义型三、数据的获取与清理(3)直接在SPSS中输入数据先在“变量视图”中定义列类型缺失值标记某些特定值为缺失值数值类型补充说明:定距(定比)变量、定序变量、定类变量文字标签值标签在“数据视图”中输入记录三、数据的获取与清理(4)数据的导入与导出数据导入导入Excel文件低版本Excel,首行为字段名(标题)导入后请重新进行“变量定义”数据导出文件——另存为——文件类型(*.xlsx)输入文件名——保存三、数据的获取与清理(5)文件合并合并变量——不同数据表之间列的拼合含义为当前数据表添加变量列要求被合并文件必须按照关键字升序排列方法数据——合并文件——添加变量声明按照关键字合并,指定合并关键字。三、数据的获取与清理3、SPSS的数据处理个案排序数据——排序个案个案转置数据——转置选择个案数据——选择个案注意:执行“选择个案”后,只有符合条件个案才参与数据分析加权个案含义以特定变量作为频数,用于说明某个量比较多。方法数据——加权个案,声明作为频数的变量。三、数据的获取与清理4、数据的分类汇总含义针对数据分组,并基于分组进行统计方法数据——分类汇总在分类汇总对话框中,选择“分组变量”选择“汇总变量”单击“函数”按钮,设置汇总的计算方式最后,“确定”补充说明:汇总结果默认附加在当前数据集右侧用户可把汇总结果指定到独立的数据集(效果更好)四、SPSS中的数据变形1、秩分变量的生成含义为数据列添加序号(名次)秩分值的方向升序、降序秩分值形式:最大、最小、均值、连续值高级应用秩分变量、指数分布变量、秩分数/权重、秩分数/权重的百分比四、SPSS中的数据变形方法转换——个案排秩选择“变量”(少量情况下需要分组求秩分,比如分别按性别排名)从左下角选择:升序/降序在右上角选择“秩的类型”秩分变量、指数分布变量、秩分值/总权重、秩分值/总权重的百分比在右上角选择“结果的类型”赋予:最低序号、最高序号、均值序号实例补充转换—自动重编码四、SPSS中的数据变形2、对数据的重编码含义对于已有个案的特定列,重新根据规则进行编码。比如:性别——性别码民族——民族码方法转换——重新编码为相(不)同变量选择“变量名”单击“旧值和新值”按钮,启动对话框,设置旧值条件,设置对应的新值最后,单击“确定”按钮。四、SPSS中的数据变形3、分段变量的生成含义把数据分为几个段,对于每段内的个案给予相同编号关键问题如何分段?如何标记?分段方式直接指定分段区:比如:从8开始,按照步长10递增,共10段。按照百分位数进行分段比如:个案分为5份,每份25%,标记出序号和每段值的断点。按照标准差取值进行分段序号反应离散程度四、SPSS中的数据变形方法转换——可视离散化选择数据列——继续,进入“可视化封装”对话框在“可视化封装”对话框中选择“生成分割点”添加标签最后,“确定”结果生成新的列,列内数据为:每个个案所在的段号四、SPSS中的数据变形4、水平计算含义基于函数和运算要求,撰写计算公式,实现列间的计算例如:基于“语文、数学、外语”计算总分或者平均分基于“基本工资、奖励”等计算工资总额方法转换——计算变量输入“目标变量名称”【即:新列的列名】输入计算公式(可以使用函数)最后,“确定”。说明可以利用底部的“if”选择参与计算的个案。四、SPSS中的数据变形5、水平计数含义统计每个个案的指定列集内,满足条件的列有几个是水平计数,不是垂直计数。例如:学生们考了8次试,成绩被放在了8列中,统计每个学生达到80分以上的考试次数。方法转换——对个案内的值计数,从而打开对话框设置目标变量名,设置目标标签名单击按钮“定义值”,启动“统计条件”,设置统计规则要注意把统计条件添加到右侧的列表框中最后,“确定”。感谢认真聆听谢谢大家数据分析方法及应用2019年3月第3讲基本统计分析——统计描述一、数据统计描述中的概念0.综述基本特点数据统计分析中的数据都是数值型的。四个方面数值型量的类型定类变量(名义变量)——整型定序变量(序号变量)——整型定距变量(度量变量)——连续变量。(实数)基本统计量集中性量、离散性(波动性)量、偏离性分布形态描述正态、泊松、指数等缺失值一、数据统计描述中的概念1、关于测量的描述&概念不同的测量及语境对同一实物的多次测量真值,测量值(观察值)、误差对一类事物中不同个体的测量均值、测量值(观察值)、离差对理想状态(计算状态)与现实状态的描述期望值、测量值(观察值)、残差一、数据统计描述中的概念2.三类数值型变量度量型变量(定距变量、连续变量)高测度、连续取值序号变量(定序变量)低测度、离散型取值、有大小之分例如:5级量表的取值名义变量(定类变量)低测度、离散型取值、无大小之分例如:性别、单位编号、学号等在统计中通常不作为统计量,常用作分组依据一、数据统计描述中的概念3、对定距变量的描述方式(1)集中性描述均值(Mean)中位数(Medium)排序后位于正中间的数。如果有偶数个数据,则为中间2个数的均值。一、数据统计描述中的概念3.对定距变量的统计描述技术(2)离散性描述概念:反映数据序列的波动程度,或者说偏离均值的程度。关键技术离差:当前数据与均值的差。全体数据的离差之和为0.一、数据统计描述中的概念3.对定距变量的统计描述技术(2)离散性描述方差:方差是离差平方和的均值。两种算法:离差平方和/样本数n——基于总体数据Varp(数据序列)离差平方和/自由度——基于样本估算总体方差Var(数据序列)一、数据统计描述中的概念标准差(Std.Deviation):方差的算术平方根。反映样本量偏离均值的程度。两种算法:基于总体数据的标准差STDEVP(数据序列)基于样本估算的标准差STDEV(数据序列)正态分布的数据68.3%在正负1倍的标准差范围之内一、数据统计描述中的概念扩展概念均值的标准误(Std.ErrorMean)——SE.Mean含义:多个样本组的均值的波动程度(以均值为基准的标准差)在等精度多次测量中:反应样本组均值偏离真值的程度在多次抽样测量中:反应样本组均值偏离总体均值的程度公式:标准误=平方根(方差/样本数n)标准误(SE)=标准差/平方根(n)一、数据统计描述中的概念补充说明标准差与标准误的对比基本作用标准差反映样本量偏离均值(真值)的程度(或样本个体变异量的大小),是数据精密度的衡量指标;标准误反映样本组均值偏离总体均值的程度,是测量精准度(或抽样波动性)的衡量指标——反应量度精度。实际应用标准差用来描述样本针对均值的偏离水平:M±SD;标准误是对一组测量数据可靠性的估计。标准误越小,测量的可靠性大一些,反之,测量就不大可靠。标准误常常与置信度结合在一起使用。M±SE。一、数据统计描述中的概念标准差系数(CV):即均方差系数,离散系数;从相对角度观察的差异和离散程度,在比较相关事物的差异程度时较之直接比较标准差要好些。反映标志变动程度的相对指标原因:标准差受样本值域的影响(5分制成绩与百分制成绩计算标准差)标准差系数=标准差/均值。一、数据统计描述中的概念全距(极差)描述样本值的最大范围最大值与最小值的差——适应于定距变量,易受奇异值的影响四分位差(三分位的值)—(一分位的值)即75%处的值减去25%之处的值(箱体图的范围)奇异值与极端值一、数据统计描述中的概念4.对定序变量的统计描述(1)集中性描述中位数(medium)众数(mode)出现次数最多的数据(2)离散性描述高测度数据可借助定距变量的方差与标准差的概念。低测度数据四分位数四分位差一、数据统计描述中的概念5.对定类变量的统计描述(1)集中性描述众数(2)离散性描述异众比率计算非众值次数与样本数的比率。可最快求出一、数据统计描述中的概念6、缺失值概念数据采集中获得的“空白”或者“不合理”数据对数据分析的影响影响分析结果的准确性处理排除不允许带缺失值的个案参与运算预处理对缺失值数据进行适当填充一、数据统计描述中的概念7.数据的分布形态(1)正态分布是一种理想化的分布形态,也叫高斯分布。若随机变量服从一个位置参数为u、尺度参数为ð的概率分布,且其概率密度函数满足:则这个随机变量就称为正态随机变量,正态随机变量服从的分布就称为正态分布。理想化的正态分布满足u=0,ð=1。U是位置,ð是标准差。一、数据统计描述中的概念一、数据统计描述中的概念正态分布的标记变量偏度描述统计数据分布形态对称性的统计量相对于正态分布(或t分布形态)内涵:偏度大于0,为正偏——向左偏偏度小于0,为负偏——向右偏峰度描述变量值分布形态陡缓程度的统计量。相对于正态分布内涵:其值与正态分布标准曲线对比。大于0,更陡;小于0;较缓。一、数据统计描述中的概念(2)均匀分布(随机分布)也叫相等分布在各个区间的分布概率接近相等一、数据统计描述中的概念(3)泊松分布一种离散的概率分布形式:若随机变量X只取非负整数值0,1,2,...,且其概率分布服从则随机变量X的分布称为泊松分布,记作P(λ)。含义:在固定期望值的条件之下,单位时间内独立事件发生的概率,满足泊松分布。例如:大数据情况下,每分钟有10个人(不关联、独立)进入车站。但在具体的某一分钟内,进入车站的人数满足泊松分布。一、数据统计描述中的概念一、数据统计描述中的概念适应性描述适应于小概率发生的随机事件,事件发生概率满足二元规则。在实际事例中,泊松分布反应:对一个独立、具有固定期望的随机事件,其单位时间内发生的概率。其核心思想为:已知:总体固定期望(概率)、独立事件反应:具体某一时段内的发生概率例如:某电话交换台收到的呼叫;来到某公共汽车站的乘客;某放射性物质发射出的粒子;显微镜下某区域中的白血球等。一、数据统计描述中的概念(4)指数分布在统计学中,指某一时刻事件发生的概率满足以“入”为控制量、时间t为自变量的指数关系。一、数据统计描述中的概念一、数据统计描述中的概念其含义:适宜解决无记忆性的事情发生的概率。对于单一事件的发生而言,与时间无关。指数分布为“永远年青”的分布。例如:车站每分钟会来10个人。下一个人到来的时间间隔满足指数分布。具体应用。在学校门口等人,在7点来不来人与你等待的时间无关。如果把X解释为仪器寿命,这表明如果已知X的寿命大于t年,则它再活s年的概率与年龄t无关。总体分布满足指数关系。一、数据统计描述中的概念(4)对分布形态的总结正态分布、指数分布、泊松分布都是一种数学模型;在实际应用中,可先判断样本所满足的分布形态,然后再决定采取何种处理方法?基于数据形态可以做数据分析、数据挖掘与预测。一、数据统计描述中的概念8、小结(1)集中性描述量均值中位数众数适用于定距数据、定序数据适用于定序数据、定距数据适用于定类数据、定序数据计算时要用到全部数据只需中间数据可最快求出受极端值的影响对极端值不敏感有时对个别值的变动也很敏感分组变化时影响不大分组变化时有些影响分组变化时影响较大一、数据统计描述中的概念(2)离散性描述量标准差四分位差异众比率适用于定距数据适用于定序数据适用于定类数据计算时用到全部数据只需要其中两段的数据计算非众值次数与样本数的比率。可最快求出受极端值的影响大对极端值不敏感有时对个别值的变动也很敏感二、SPSS中的统计描述1、频数统计方案1:菜单:分析——描述统计——频率细项左下角“显示频率表格”选择“统计量”执行样本的抽样执行bootstrap设置置信区间抽样方式:简单抽样分层抽样二、SPSS中的统计描述方案2:菜单分析——报告——个案汇总细项左下角的“”选择“统计量”选择“分组变量”执行样本的抽样二、SPSS中的统计描述方案3:菜单分析—描述统计——交叉表细项选择“行”统计量;选择“列”统计量;执行“确定”。二、SPSS中的统计描述2、集中性描述内容均值众数与中位数方案1:菜单:分析——描述统计——频率细项选择“统计量”选择“计算项”二、SPSS中的统计描述方案2:菜单:分析——描述统计——描述细项选择“统计量”选择“计算项”二、SPSS中的统计描述3、离散性描述内容方差与标准差均值的标准误标准差除以样本数的平方根方案1:菜单:分析——描述统计——频率细项选择“统计量”选择“计算项”二、SPSS中的统计描述方案2:菜单:分析——描述统计——描述细项选择“统计量”选择“计算项”二、SPSS中的统计描述4、分布方式描述内容判断数据满足什么形态正态分布、t分布、指数分布、均匀分布等方法Q-Q图P-P图二、SPSS中的统计描述操作过程——方法1菜单分析——描述统计——Q-Q图(或QQ图)细项选择“统计量”;选择“分布类型”设置数据预处理方式执行“确定”观察运行结果现行散点与预期直线的吻合度。吻合度高:满足,吻合度低,不满足。二、SPSS的统计描述操作过程——方法2菜单分析——非参数检验——旧对话框——1样本k-S检验细项选择“被检验的变量”左下角选择“检验分布”类型常规——正态分布指数分布泊松分布执行“确定”结果检验概率大于0.05,符合正态分布检验概率小于0.05,不符合正态分布二、SPSS中的统计描述5、综合探索与统计图统计图箱体图中间的50%,奇异值茎叶图频数(叶宽),茎,叶(内容)统计数据分组统计频数分组计算M估算值等二、SPSS中的统计描述操作方案——绘制茎叶图或直方图菜单分析——描述统计——探索细项选定“因变量”统计量的设置——“统计量”统计图的设置——“绘制”(选中相应复选框)设置分组依据——“因子”变量设置“输出”类型执行“确定”二、SPSS中的统计描述操作方案——绘制箱体图菜单图形——旧对话框——箱图——定义细项选定“变量”选定“类别轴”执行“确定”按钮,得到箱体图二、SPSS中的统计描述阅读输出结果对箱体图的理解箱体(中部50%的样本,呈现中位线)奇异值、极端值对茎叶图的理解频数茎叶、茎宽其他的统计图条形图饼图直方图二、SPSS中的统计描述6、摘要报告(1)在线摘要报告——OLAP立方菜单分析——报告——OLAP立方细项选择“摘要变量”与“分组变量”设置“统计量”执行“确定”观察结果可双击结果项,然后选择不同的分组值二、SPSS中的统计描述(2)行汇总摘要用途对于指定列,统一以列表方式显示其个数、均值、最大值等统计信息操作方法菜单:分析——报告——描述细项选择多个“数据列”选择总摘要项目——右上角“摘要”按钮选作:添加“分组列”设置分组摘要项目——右下角的“摘要”按钮阅读结果二、SPSS中的统计描述(3)列汇总摘要用途对于指定的若干列,分别以不同的要求进行摘要(比如语文求和、数学求均值等)方法菜单分析—报告——按列汇总细项选择某个“数据列”,设置其“摘要”类型,设置列标题选作:选择“分组列”,以便分组摘要设置“分组摘要”的属性阅读结果三、SPSS中变量的高级变形1、秩分(1)秩分的概念与价值定义即依据某一种规则对数据序列中的数据重新编制序号,这个序号的值称为这种规则下的秩。价值在对非正态分布数据的处理中,将大量地使用秩分的概念。(2)秩分的类型秩分方向升序、降序秩分值的形式最小值、最大值、均值其他秩分类型指数分布变量秩分百分比(秩分/权重)三、SPSS中变量的高级变形1、秩分(3)创建秩分变量在Excel下,利用函数:Rank(单元格,绝对地址区域)在SPSS下,利用命令求取秩分:转换——个案排秩选择“变量”(少量情况下需要分组求秩分,比如分别按性别排名)从左下角选择:升序/降序在右上角选择“秩的类型”秩分变量、指数分布变量、秩分数/权重、秩分数/权重的百分比在右上角选择“结果的类型”赋予:最低序号、最高序号、均值序号三、SPSS中变量的高级变形
三、SPSS中变量的高级变形2、Z分数(3)创建Z分数菜单命令序列:【分析】—【描述统计】—【描述】,对话框设置选择被转换“变量”;单击右下角的【将标准化得分另存为变量】复选框;解读结果在原始表中获得以Z开头的新变量三、SPSS中变量的高级变形3、正态得分(1)正态得分的概念必要性和价值在各种研究中,常常需要面对非正态分布的定距变量。然而,很多数据分析方法都要求原始数据满足正态分布。为了解决数据的正态性问题,SPSS提供了秩分、正态得分等必要的转化手段。三、SPSS中变量的高级变形3、正态得分(2)创建正态得分变量菜单命令序列:【转换】—【个案排秩】,对话框设置:选择被转换的定距型“变量”;在【秩的类型】对话框中选中【正态得分】复选框。解读输出结果:在原表中新增列,显示出每个个案的“正态得分”值。感谢大家聆听124数据分析方法及应用125统计推断0、统计推断的基本概念1261、什么是统计推断定义:首先对统计分析的结果进行假设,并通过统计、计算与分析来判定假设是否正确的研究方法。基本思路假设数据满足某一特性(规范)——通常假设为“非目标”检查数据的类型与分布特点选择合适的分析工具,开展统计分析由计算结果获取假设的检验概率如果假设是个小概率事件,则假设不成立,否则假设成立。0、统计推断的基本概念1272、三个核心问题(1)统计推断的主要技术差异显著性、相关性、一致性基本含义差异显著性——测量差异性(拟合优度)两列或多列同类型(同值域)数据是否存在显著的差异数据可配对、可独立独立样本——因素与因变量之间的相关性相关性——测量关联性(独立性)——归因两列数据是否具有相关联的一致或相反的关系两列数据至少有序,最好为配对数据一致性——测量可靠性(信度)多列数据是否具有相关联的一致性关系0、统计推断的基本概念128(2)假设与检验概率先根据分析工具进行假设假设假设数据符合正态分布?假设两组数据之间没有显著差异?计算检验概率,并判定结论检验概率>0.05,假设成立。检验概率小于0.05,假设不成立。例如:假设数据符合正态分布,在对数据k-s检验后,发现p值为0.02,则假设失败,此数据不符合正态分布。假设两列数据没有显著性差异,在t检验后,发现p值为0.01,则假设失败,此两列数据之间存在显著性差异。0、统计推断的基本概念129(3)统计推断的两类错误TYPEI——第一类错误本该不显著的判断为显著无效看成有效——检验概率应大于0.05,但被判断为小于0.05TYPEII——第二类错误本该显著的判断为不显著实际有效但被判断为无效——检验概率应小于0.05,但被判断为大于0.05第一类错误造成的影响更严重,应尽量避免第一类错误。若把无效看成有效,将造成严重后果。0、统计推断的基本概念130(4)统计推断工具的选择研究问题检验的目标是什么?预期的结论是什么?需要考虑的数据条件数据类型高测度、低测度定距、定序与定类0、统计推断的基本概念131数据的分布形态正态分布否?高正——参数检验(明确分布参数的数据)高非正、低测度——非参数检验(不明分布的数据)数据的方差是否差距不大齐性(等方差)非齐性(异方差)0、统计推断的基本概念1323、差异显著性统计推断基本算法思路高测度变量(定距变量、高测度定序量)接近正态分布——参数检验两组数据两组配对样本——t检验两组独立样本——t检验总体数据(大样本)——z检验多组数据基于因子分组且方差齐性——方差分析非正态分布——非参数检验差异性:采用“基于分布差异性”的非参数检验0、统计推断的基本概念133低测度数据(定类量或低区分度定序量)以数据列作为因子制作交叉表利用”交叉表-卡方检验”推断差异显著性利用”交叉表-卡方检验”推断相关性SPSS对非正态数据的实际处理技术非参数检验算法——非正态高测度、低测度2-组相关数据的非参数检验(定距变量、定序变量、定类变量)K-组相关数据的非参数检验(定距变量、定序变量、定类变量)2-组独立数据的非参数检验(定距变量、定序变量、定类变量)K-组独立数据的非参数检验(基于因子分组)(定距变量、定序变量、定类变量)0、统计推断的基本概念1344.差异显著性检验实例面向双序列的差异显著性检验配对样本数据正态分布数据配对样本t检验非正态分布数据2-相关样本非参数检验2-分组样本数据正态分布数据独立样本t检验等方差异方差非正态分布数据2-独立样本非参数检验0、统计推断的基本概念135面向多序列的差异显著性检验成对样本正态分布数据两两做配对样本t检验非正态分布K-相关样本非参数检验多分组样本正态分布数据方差分析非正态分布数据K-独立样本非参数检验2019年3月136第四讲均值的差异显著性检验
之一(T检验)一、均值差异性检验的概念1371、什么是均值差异显著性?根据被试总体所获得的两组数据,如果存在统计学意义上的明显差别,代表二者存在着显著性的差异。定义:
对于定距正态型变量,通常借助于均值差异性衡量。解决方案假设两列数据没有显著性差异判断是否满足均值差异显著性条件执行统计分析计算获取检验概率p(sig),若p>0.05,则没有显著性差异若p<0.05,则存在显著性差异一、均值差异性检验的概念1382、均值差异显著性的原理基本条件对于总体接近正态分布的大量个案,多次(m次)从中随机抽取样本组,每个样本组包含n个个案。每个样本组可有自己的均值,可获得m个均值。m个均值应该满足正态分布,而且根据标准误的概念,这m个均值的标准差为整体测量的标准误SE。本次抽样测量(m*n个个案)的可靠性水平为M±SE。一、均值差异性检验的概念139原理依据正态分布的原理,在M附近±SE范围内,正态区域面积为68.26%;在M±1.96SE范围内,正态区域面积为95%,在M±2.58SE,正态区域面积为99%。反推若:均值差/SE>1,则置信度68.3%;若:均值差/SE>1.96,则置信度为95%;若:均值差/SE>2.58,则置信度为99%。核心问题如何针对样本计算SE?一、均值差异性检验的概念1403、t检验的实际应用范畴常见应用比较两组小样本是否差异显著例如:两个教学班的前测数据是否相同某教学班实施某种教学策略前后是否差异显著方法:均值的双侧检验施加某种干预之后,样本是否有所提升?例如:前测相同的两组病人,在一组试用了新药后,是否有效方法:均值的单侧检验一、均值差异性检验的概念141数据来源及特征配对样本数据数据的来源来自同一样本的两次有序测量计算SE的公式独立样本数据数据的来源纯独立样本基于因素分组的独立数据独立数据的方差是否齐性方差齐性方差非齐性一、均值差异性检验的概念1424、差异显著性检验的流程(1)数据特征的判定数据的类别定距、定序、定类判断数据分布的类型K-S拟合优度检验(或Q-Q图检验)一、均值差异性检验的概念143(2)均值差异性检验——参数检验基本条件高测度数据、接近正态分布(小容量样本满足t分布)执行参数检验过程主要技术T检验——两组样本的均值差异性检验配对样本独立样本(纯独立样本、基于因素分组的独立样本)Z检验——对总体数据的均值差异性检验(至少n>=50)方差分析——多组样本的均值差异性检验基于因素来分组(单因素、多因素)一、均值差异性检验的概念144(3)分布形态的差异显著性检验基本条件样本分布不满足正态分布、分布形态不清晰执行非参数检验两独立样本的差异性检验多独立样本的差异性检验两关联样本的差异性检验多关联样本的差异性检验二、T检验的实现1451、回顾对数据实施T检验的基本条件数据类型:定距数据或区分度较高的定序数据分布形态:满足t分布,或者接近于正态分布两组数据的均值比较类型配对样本的均值比较独立样本的均值比较等方差情况异方差情况一组数据与单个值的对比二、T检验的实现1461、配对样本的T检验例题:已知,初中三班学生的两次语文成绩如列表2所示,请检查初中三班的两次语文成绩是否存在显著性差异?分析:对两次语文成绩进行差异性检验,检查是否有明显差异。若用t检验,应该主要解决以下问题:语文成绩符合正态分布是针对同一组样本的两次考试,成绩之间有一一对应关系进行两次语文成绩的配对T检验二、T检验的实现147实现过程——基于SPSS功能(1)判断两次语文成绩是否满足正态分布(K-S检验)(3)执行配对样本的T检验:分析——比较均值——配对样本的T检验选择变量1:语文1选择变量2:语文2设置置信区间为95%最后“确定”(4)阅读输出结果观察sig值(即检验概率P值)二、T检验的实现148实现过程——基于Excel的函数功能(1)执行配对样本的T检验:在某一空闲单元格中,输入T检验函数:TTEST(语文分1区域,语文分2区域,2,1)(3)阅读输出结果观察函数运算结果(即检验概率P值)与已经求取的均值对比二、T检验的实现149实现过程——基于Excel的分析工具库(1)执行配对样本的T检验:数据——数据分析——T检验:平均值的成对二样本分析选择检验区域1:语文区域1选择检验区域2:语文区域2最后“确定”(2)阅读输出结果观察函数运算结果(即检验概率P值)与已经求取的均值对比二、T检验的实现150对配对样本T检验的补充说明两列数据具有一一对应关系两列数据都基本满足正态分布单尾与双尾检验若比较是否相同使用双尾检验(双侧检验)若比较是否一方优于另外一方可使用单尾检验检验概率的识别可规定检验概率的界值为0.05或者0.01结果:低于界值,存在差异高于界值,不存在显著性差异二、T检验的实现1512、独立样本的T检验例题:已知,初中三班学生的语文成绩如列表1所示,请检查初中三班的男女生的语文成绩是否存在显著性差异?分析:对一次语文成绩的男女生分组进行差异性检验,检查是否有明显差异。若用t检验,应该主要解决以下问题:语文成绩符合正态分布成绩之间没有一一对应关系,甚至个数都不同进行两次语文成绩的独立样本T检验注意:方差是否齐性,对分析方法和结果有影响?二、T检验的实现152实现过程——基于SPSS功能(1)判断两次语文成绩是否满足正态分布(K-S检验)(3)执行独立样本的T检验:分析——比较均值——独立样本的T检验选择变量:语文1选择分组变量:性别2设置置信区间为95%最后“确定”(4)阅读输出结果先看F的sig值,若大于0.05,则看第一行的sig值;若小于0.05,则看第二行的sig值。二、T检验的实现153实现过程——基于Excel的函数功能(1)执行配对样本的T检验:在某一空闲单元格中,输入F检验函数:FTEST(语文分1区域,语文分2区域)若F检验值>0.05输入T检验函数:TTEST(语文分1区域,语文分2区域,2,2)否则输入T检验函数:TTEST(语文分1区域,语文分2区域,2,2)(3)阅读输出结果观察函数运算结果(即检验概率P值)与已经求取的均值对比二、T检验的实现154实现过程——基于Excel的分析工具库(1)执行独立样本的T检验:在某一空闲单元格中,输入F检验函数:FTEST(语文分1区域,语文分2区域)若F检验值>0.05数据——数据分析——T检验:双样本等方差假设否则数据——数据分析——T检验:双样本异方差假设选择检验区域1:语文区域1选择检验区域2:语文区域2最后“确定”(2)阅读输出结果观察函数运算结果(即检验概率P值)二、T检验的实现155对独立样本T检验的补充说明两列数据没有一一对应关系两列数据都基本满足正态分布采用单尾与双尾检验?若比较是否相同使用双尾检验(双侧检验)若比较是否一方优于另外一方可使用单尾检验检验概率的识别可规定检验概率的界值为0.05或者0.01结果:低于界值,存在差异高于界值,不存在显著性差异二、T检验的实现1563、Z检验Z检验的概念Z检验(ZTest)是一般用于大样本(即样本容量大于30)平均值差异性检验的方法。它是用标准正态分布的理论来推断差异发生的概率,从而比较两个平均数的差异是否显著。在国内也被称作u检验。Z检验的条件总体样本,或者大样本量数据基本满足正态分布定距变量或区分度较高的定序变量Z检验的公式二、T检验的实现157Z检验的用法——Excel之中首先,分别利用var(区域)计算出两个区域的方差之值;其次:启动命令:数据—数据分析—Z检验:双样本平均差检验细项:选择:区域1选择:区域2输入区域1的方差值;输入区域2的方差值:最后,以“确定”执行;阅读检验结果:观察检验后的P值。二、T检验的实现1584、单样本的T检验例题:已知,初中三班学生的语文成绩如列表所示,请检查初中三班的语文成绩是否在80分附近(与80分无显著差异)?分析:以语文成绩与80分均值对比,检查是否优于80分,若用t检验,应该主要解决以下问题:语文成绩符合正态分布进行语文成绩与80分的单样本的T检验二、T检验的实现159实现过程——基于SPSS功能(1)先求取语文列的均值;(2)判断是否满足正态分布(K-S检验)(3)执行单样本的T检验:分析——比较均值——单样本的T检验输入检验变量:语文输入检验值:80最后“确定”(4)阅读输出结果观察sig值(即检验概率P值)与已经求取的均值对比二、T检验的实现160实现过程——基于Excel的函数功能(1)先求取语文列的均值;用averageif或Average函数(2)执行单样本的T检验:在某一空闲单元格中输入数值80。输入T检验函数:TTEST(语文分区域,80所在区域,1,3)(3)阅读输出结果观察函数运算结果(即检验概率P值)与已经求取的均值对比二、T检验的实现161实现过程——基于Excel的分析工具库(1)先求取语文列的均值;用averageif或Average函数(2)执行单样本的T检验:在某两个空闲单元格中输入数值80。数据——数据分析——T检验:双样本异方差假设选择检验区域:语文区域选择检验值区域:80—80最后“确定”(3)阅读输出结果观察函数运算结果(即检验概率P值)与已经求取的均值对比162谢谢大家社会科学统计软件及应用2019年5月第5讲均值的差异性检验
之二(方差分析)五、方差分析1、方差分析的概念什么是方差分析?方差分析也是一种均值的差异性检验,它研究某一因素的不同水平是否会对结果的均值产生显著性差异。方差分析研究的是多组样本之间的均值显著性差异,样本的分组由某一因素的不同水平组成。方差分析主要解决什么问题它研究在某一因素不同水平上的样本,其结果值是否会存在显著性差异。例如,研究成绩差、成绩合格、成绩良好与成绩优秀的学生在学习态度和自主学习能力方面是否存在显著性差异。拓展用途:研究某一因素是否会对结果变量产生影响(归因)其本质为均值差异性检验,但可用作归因分析。五、方差分析方差分析中的相关概念结果变量——因变量因素变量——自变量具有多个因素水平可控因素与不可控因素协变量对因变量有影响,但在方差分析过程中需要剔除其影响的变量五、方差分析方差分析的前提条件结果变量(因变量)基本满足正态分布,应该是定距变量,至少为测度较高的定序变量因素变量可以是定序变量或者数值型的定类变量,较少使用连续的定距变量。不同分组的方差应基本齐性(方差同质)注意:如果以接近定类变量的数据作为因素变量(比如性别、班级),最好统一编码,使之尽可能满足一定的顺序,变成定序变量。五、方差分析方差分析的类型单结果单因素方差分析(单因素有不同的因素等级)(系统可根据因素等级进行分组)单结果多因素方差分析(多个因素变量,每个因素变量都分为不同的等级)(系统可根据因素等级分组)协方差分析设置协变量,设置因变量和因素变量多结果多因素方差分析(多结果变量、多因素变量的分析)(考察了变量之间的交叉作用)五、方差分析2、单因素方差分析例题:某小学在一年级新生入学时测量了其智力水平,并调查了学生参加学前教育并获取知识的情况。现在需要了解学前教育情况是否对学生的智力水平产生了影响?分析本例是要分析学前教育水平不同的小学生的智力水平是否存在显著性的差异。本例中的原始数据符合正态分布。本例是一个典型的单因素方差分析:智力水平为因变量(结果变量)、学前教育水平为自变量(因素变量)。五、方差分析实现过程——SPSS技术菜单分析——比较均值——单因素ANOVA细则选择“因变量”(结果变量)选择“因素变量”设置“方差同质性”检验项设置其他统计参数“对比”选项——多项式对照分析方式:线性、二次式、三次式….“两两比较”选项——不同水平的多重对照分析方差齐性时:方差非齐性时:五、方差分析执行“确定”命令阅读分析结果观察sig值(即检验概率P值)。若P>0.05,则无显著性差异即此因素对结果无显著性影响。若P<0.05,则有显著性差异即此因素对结果有显著性影响。五、方差分析实现过程——Excel技术数据整理把单因素每个水平的结果值存储为一列各列按照因素的水平高低依次排列菜单数据——数据分析——方差分析:单因素方差分析细则选择“因变量”(整个数据区域)选择分组方式:“列”设置:标志位于第一行设置显著性参数:0.05。最后,“确定”之后阅读统计结果,观察检验概率P值。五、方差分析3、单结果多因素方差分析例题:某小学在一年级新生入学时测量了其智力水平,并调查了学生参加学前教育并获取知识的情况。现在需要了解学前教育情况和学生的来源(农村、乡镇、大城市)是否对学生的智力水平产生了影响?分析本例是要分析学前教育水平和来源不同的小学生的智力水平是否存在显著性的差异。本例中的原始数据符合正态分布。本例是一个典型的多因素方差分析:智力水平为因变量(结果变量)、学前教育水平为自变量(因素变量)、生源也是自变量。五、方差分析实现过程——SPSS技术菜单分析——一般线性模型——单变量(单结果量)细则选择“因变量”(即结果变量,只取一个)选择“固定因子”变量记录在每个水平上均有分布具有可明确区分水平的变量,选择“随机因子”变量记录在每个水平上未必有分布变量不具备明确的区分条件,无法区分为明确的几个等级,可为连续变量选用分析模型(可选)选择对比方式(可选)选择绘图方式(可选)执行“确定”命令。五、方差分析阅读分析结果观察sig值(即检验概率P值)。若P>0.05,则无显著性差异即此因素对结果无显著性影响。若P<0.05,则有显著性差异即此因素对结果有显著性影响。注意:多个因素交叉作用的效果,观察其p值。五、方差分析补充说明:选择分析模型全因子用户“设定”模型首先,选择进入模型的“主效应”项其次,选择交互效应类型(中部的选项)。若选定了2阶或3阶交互项后,还可同时从左侧选中2个或3个因素项,以便观察她们联合起来对最终结果的影响。第三,选择离差平方和的类型TYPEI:分层处理平方和TYPEII:对其他所有效应分析TYPEIII:系统缺省的模式TYPEIV:对于任何没有缺失单元格的情况。五、方差分析选择对比方式——即多项式对照分析的方法无:不进行比较(不同因素的每个水平之间)偏差:各因素的每个水平之间都进行比较简单:各因素的每个水平都与参考水平进行比较差值:每一水平的均值都与前面各水平的均值比较重复:只对相邻水平的均值进行比较多项式:比较各因素水平的均值的线性、二次、三次多项式。选择分布图形选择一个因素变量作为“水平轴”选择另外某个因素变量作为“单图”或者“多图”两两比较方式假定方差齐性、假定方差非齐性五、方差分析4、协方差分析概念在数据的均值差异性分析中,影响结果的因素可能非常多。在这些因素中:有的因素是我们关注的、是区分度较高的可控因素;有的因素是我们不关注的;有的因素是一些随机变量,区分度低,对结果的影响不可控。为了及时发现被关注因素的作用需要在方差分析过程中,屏蔽掉这些不受关注的、区分度低的因素对结果变量的影响。——协变量这种方差分析被称为“协方差”分析。五、方差分析例题:某小学在一年级新生入学时测量了其智力水平,并调查了学生参加学前教育并获取知识的情况、学生的生源情况、父母的文化程度。现在需要了解学前教育情况是否对学生的智力水平产生了影响?在此过程中,需要屏蔽生源情况和父母文化程度对学生智力因素产生的影响。分析本例是要分析学前教育水平的小学生的智力水平是否存在显著性的差异。本例中的原始数据符合正态分布。本例是一个典型的多因素方差分析:智力水平为因变量(结果变量)、学前教育水平为自变量(因素变量),而生源和父母的文化程度为需要屏蔽影响的自变量(即协变量)。五、方差分析实现过程——SPSS技术菜单分析——一般线性模型——单变量(单结果量)细则选择“因变量”(即结果变量,只取一个)选择“固定因素”变量具有明确区分条件的变量,比如此处的学前教育等级、生源等。选择“协变量”此因素的贡献不受关注或不好区分。选用分析模型(可选)选择对比方式(可选)选择绘图方式(可选)执行“确定”命令。五、方差分析阅读分析结果观察sig值(即检验概率P值)。若P>0.05,则无显著性差异即此因素对结果无显著性影响。若P<0.05,则有显著性差异即此因素对结果有显著性影响。注意:多个因素交叉作用的效果,观察其p值。五、方差分析5、多因变量多因素方差分析概念在数据分析过程中,如果系统中涉及到多个因变量,而且因变量之间还存在着相互影响的关系,而且还可能存在多因素需要一并分析。各个因变量之间无法独立若能独立处理,则可分别按单因变量方式处理在这种情况下,分析算法需要考虑因变量之间的内在关系,需要实施自动正交变换操作,从而解除各个因变量之间的相关关系。五、方差分析例题:某小学在一年级新生入学时测量了其IQ、入学综合测试成绩,并调查了学生参加学前教育并获取知识的情况、生源情况、父母文化程度。现在需要了解学前教育情况、学生的来源(农村、乡镇、大城市)、父母文化程度是否对学生的IQ和测试成绩产生了影响?分析本例是要分析不同学前教育水平、来源不同、父母文化程度不同的小学生的IQ和测试成绩是否存在显著性的差异(影响)。本例中的原始数据符合正态分布。本例是一个典型的多变量多因素方差分析:IQ和测试成绩为因变量(结果变量)、学前教育水平、生源和父母文化程度为自变量(因素变量)。五、方差分析实现过程——SPSS技术菜单分析——一般线性模型——多变量(多结果变量)细则选择“因变量”(即结果变量,可取多个)例如:选择IQ值、测试成绩选择“固定因素”变量具有明确区分条件的变量,比如此处的学前教育时数、生源、父母文化程度等。选择“随机因素”变量变量不具备明确的区分条件,无法区分为明确的几个等级,多为连续变量选用分析模型(可选)选择对比方式(可选)选择绘图方式(可选)执行“确定”命令。五、方差分析阅读分析结果观察sig值(即检验概率P值)。若P>0.05,则无显著性差异即此因素对结果无显著性影响。若P<0.05,则有显著性差异即此因素对结果有显著性影响。注意:多个因素交叉作用的效果,观察其p值。谢谢大家的耐心学习社会科学统计软件及应用2019年4月第6讲对不明形态数据的差异性检验
(非参数检验)线上模拟与自诊断系统利用学校提供的虚拟桌面下载虚拟桌面程序安装虚拟桌面运行“考试系统”程序以“msp学号”登录,目前:客观题和Excel题自动评分SPSS题人工阅卷。一、差异显著性检验基本算法0、差异显著性检验基本算法高测度正态数据——参数检验方法T检验方差分析高测度非正态数据通过技术手段转化为近正态分布,然后借助参数检验手段利用秩分(排列定距变量的秩分)利用符号利用频数(或百分比)正态得分——对定距变量计算其正态得分直接使用非参数检验算法一、差异显著性检验基本算法差异显著性检验的其他算法卡方期望检验——与期望值对比游程检验面向交叉表的卡方检验二项分布检验一、差异显著性检验基本算法
一、差异显著性检验基本算法(3)卡方检验的用法(1)面向期望值的卡方检验已有观测数据,然后还有期望比例,检验实际观测数据是否符合期望比例。操作方法:菜单分析—非参数检验—旧对话框—卡方细项选择“检测量”分区段的频数设置“期望值”数据输入数值添加新值执行,“确定”按钮注意:如果选中“所有类别相同”,则是“均匀”检验一、差异显著性检验基本算法2、卡方检验的推广(1)基于交叉列联表进行卡方(X2)检验基本条件对于不满足正态分布的变量或者变量为低测度的定序、定类变量不适合进行参数检验的变量目标实施多组数据(非正态数据)的差异性检验多组数据可来自同一个变量,此时需借助另外的变量进行分组一、差异显著性检验基本算法(2)低测度数据的特点及分析思路特点区分度低不便于用均值检查其差异性思路期望在各个分类上的频数是均匀的(交叉表频数均衡)计算其频数,分析频数间的逻辑关系(求其卡方距离)利用卡方值,决定两变量间的关系美术系中文系计算机系物理系艺术451120文学215731科学1152742一、差异显著性检验基本算法操作过程菜单分析—描述统计—交叉表细项选择行变量(定序或定类量)选择列变量(待分析差异性的量,定序或定类量)在“统计量”中选择“卡方”。还可以选择其他的复选框,比如:肯德尔系数等最后,执行“确定”按钮。注意:一定不能选择连续变量。例如:检测几个院系的男女生分布情况是否相同。检测几个院系在语文、数学成绩上是否没有显著性差异(应先对成绩进行分段、编码,基于编码分析)一、差异显著性检验基本算法3、游程检验(Run检验)(1)概念在变量序列中,连续出现的取值相同的数据称为游程。例如:
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 《大数据离线分析技术》课件-默认参数
- 2026年智慧农业创新报告:科技赋能农业现代化之路
- 2026年智能物流创新技术报告
- 国内货运代理公司生产经理述职报告
- 2026年除铁器行业新材料应用创新分析报告
- 2026年汽车产业自动驾驶报告
- 2026年智能制造创新分析报告:机器人领域创新展望
- 2026年新能源汽车充电网络创新报告
- 2026年新材料产业创新进展与应用报告
- 2026北师大三下讲故事新课标课件
- 第三章%20村集体经济组织会计一般业务会计处理
- 无人机驾驶员安全意识测试考核试卷含答案
- 熬汤技术培训课件
- 银行基金营销培训课件
- 2026年《必背60题》幼儿园保健医高频面试题包含详细解答
- 枪支安全理论培训课件
- 协会注销资金捐赠协议书
- 小学语文阅读理解错误分析可视化教学策略教学研究课题报告
- 2024CSCO恶性肿瘤患者营养治疗指南
- 沪教版三年级上册阶段考试数学试卷(含解析)2025-2026学年上海市普陀区校联考
- 拉森钢板桩支护专项施工方案
评论
0/150
提交评论