数据基础分析及研究4_第1页
数据基础分析及研究4_第2页
数据基础分析及研究4_第3页
数据基础分析及研究4_第4页
数据基础分析及研究4_第5页
已阅读5页,还剩70页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

马秀麟SPSS统计分析方法及实践马秀麟2019年5月第7讲数据的关联性分析一、数据关联性分析的概念1、统计学中的关联性分析什么是关联性分析?一致性(相关性)两高测度变量分析两组或多组数据是否存在一致升高或相反的关系(高测度)影响显著性一低一高变量基于低测度变量的分组,研究低测度变量对高测度变量的影响是否显著独立性检验两低测度变量基于交叉表的卡方检验一、数据关联性分析的概念基本特征两组数据或者多组数据数据之间存在一一对应关系(成对数据)可能来源来源于同一组样本的多次测量针对同一组样本不同视角的测量强调数据关联性分析是针对成对数据的分析待测试数据之间存在顺序关系不能对独立的无关样本数据进行关联性分析一、数据关联性分析的概念2、成对数据之间的关系数据之间不存在关联关系找不到趋势相同或者趋势相反的关联关系数据之间存在相关性数据之间有相关性,但关系比较模糊,仅仅是一种分布或者趋势关系数据之间存在明确的控制关系可以通过一个函数式来表达数据之间的逻辑关系即——回归分析一、数据关联性分析的概念3、数据关联性分析技术(1)散点图以某列数据作为X轴,以另一列数据作为Y轴绘制散点图,观察两列数据之间是否存在清晰的关系。一、数据关联性分析的概念相关性分析技术及类别通过相关性分析技术,分析数据之间的相关性普通相关性分析中高测度变量的相关性分析Pearson相关性分析——正态分布Spearman相关性分析——非正态分布低测度定序变量的相关性分析(一低一高)Spearman相关性分析肯德尔相关性分析双低测度变量的独立性分析(含定类)基于交叉表的相关性分析去掉控制变量的相关性分析偏相关分析一、数据关联性分析的概念数据回归分析目标查找关联性数据内部隐含的函数关系式用函数关系式描述数据之间的关系发展趋势及预测适应性对于关联性关系比较清晰的情形类型定距或高测度定序的结果变量线性关系曲线关系针对二元结果变量二元Logistic回归二、基于散点图观察数据关联性1、适应性两列关联性的数据数据类型定距或者高测度的定序数据对于定类数据,尽可能采取按序编码的方式转化为定序类型二、基于散点图观察数据关联性2、操作方法命令图形——旧对话框——散点图设置简单分布设置X轴变量、设置Y轴变量重叠分布设置X轴变量、设置Y轴变量观察效果显示点呈现为比较集中的直线显示点呈现为比较集中的曲线显示点混乱分布在整个区域二、基于散点图观察数据关联性二、基于散点图观察数据关联性相关关系二、基于散点图观察数据关联性3、补充说明——3D散点图命令图形——旧对话框——散点图设置3-D分布设置X轴变量、Y轴变量、Z轴变量观察效果三、数据的相关性分析1、数据相关性判定的基本概念基本概念相关系数:是变量间相关程度的量化统计量,用r表示。相关系数没有单位,其值在-1~+1之间。正相关:两变量变化方向相同,相关系数为正。负相关:两变量变化方向相反,相关系数为负。零相关(不相关):两变量相互独立,相关系数为0。三、数据的相关性分析存在的问题相关系数有一明显的缺点:接近1的程度与样本数n有关:当n较小时,相关系数波动较大,容易接近1;而n较大时,相关系数绝对值容易偏小。因此判断相关仅凭相关系数是不够的。个别序列中,奇异值会对相关系数产生较大的影响对相关性判定的补充说明——检验概率检验概率用于判定相关性存在的可能性,即概率。P<=0.05,则表示存在相关性P>0.05,表示不存在相关性。相关系数可用于描述存在相关性的程度。三、数据的相关性分析强调说明:数据之间存在相关性,只能说明两个数据列之间有一致(或相反)的分布关系,不能说明二者存在因果关系。数据之间存在相关性,不能说明二者何为因、何为果。对于二者的因果,需要借助数据分析的语义。三、数据的相关性分析2、四种基本的相关性分析技术(1)Pearson相关适应性对定距数据或中高测度定序数据数据满足正态分布基本思路积差相关系数直接利用原始数据进行差积的计算,判断相关性水平其中σxy2是指两个数据序列X和Y的协方差,即度量两个随机变量协同变化程度的方差。在概率论和统计学中,协方差用于衡量两个变量的总体离差水平,记为两个变量距其均值的内积之累加和。三、数据的相关性分析(2)Spearman相关适应性定距数据或中高测度定序数据数据顺序等距,或非正态,或分布不明基本思路先做秩分后,然后求积差相关系数即对两个变量先分别独立求秩分,然后针对秩分进行Pearson相关性分析三、数据的相关性分析(3)肯德尔相关分析适应性中测度定序数据,或非正态,或分布不明的数据基本思路对于两列变量,一列为X,另一列为Y当按照X排序后,利用“Y中与X的顺序一致的数对个数”与“Y中与X的顺序不一致的数对个数”之间的关系来判定相关性三、数据的相关性分析(4)基于交叉表的相关性分析适应性定类数据、低测度的定序数据基本思路按照定类(或低测度定序)分组计算频数检查频数与类别之间的关系三、数据的相关性分析3、操作实例(1)针对定距数据的检验要求针对如mydayaX.sav的文件,检测语文1、语文2、历史、数学、物理成绩之间的相关性。操作过程(a)先判定这些数据的分布特性(b)采用命令:分析—相关—双变量选择“两列数据”选择“相关性分析类型”三、数据的相关性分析观察分析结果三、数据的相关性分析补充说明对于PEARSON检验,可以选择“选项”—“统计”均值和标准差:显示均值、标准差和有效样本数叉积偏差与协方差为每对变量输出交叉矩阵和协方差矩阵。分析类型符合正态分布数据用Pearson相关不符合正态分布数据用Spearman相关三、数据的相关性分析(2)针对定比数据的相关性检验要求针对如MydataX.sav的数据,检测上网时间、游戏时间、作业得分、认知风格、爱好之间的相关性。操作过程(a)对字符串数据进行编码注意编码的科学性、做成定序数据(b)采取的命令分析—相关—双变量选择“两列数据”选择“相关性分析类型”三、数据的相关性分析(3)针对定类或低测度定比数据的相关性检验要求针对如MydataX.sav的数据,检测性别、籍贯、学习态度、专业、认知风格、爱好之间的相关性。操作过程(a)对字符串数据进行编码注意编码的科学性、做成定序数据(b)采取的命令分析—描述统计—交叉表选择“两列数据”在“统计量”按钮中选择“相关性”复选框适当设置计算方法三、数据的相关性分析补充说明——对计算方法的说明在“统计量”对话框中,有三个区块:“名义”区块,算法适合于“定类—定类数据”“有序”区块,算法适合于“定序—定序数据”“定距”区块,算法适合于“定类—定距数据”另外,Kappa用于分析两个等级相同的定序变量的相关性Risk用于分析某事件与因素之间联系的一致性McNemar用于检测两个有关联的二分变量之间的相关性Cochran’s用于检测两个独立二分变量之间的相关性三、数据的相关性分析4、偏相关分析(1)偏相关分析的概念相关分析中可能存在的问题变量间存在着错综复杂的相关关系,两变量间的关系中可能存在着其他变量所带来的影响。例如:不是上网影响了学习,可能是玩游戏影响了学生的成绩。偏相关分析概念的提出偏相关分析是在分析两变量的线性相关问题时,控制可能对结果有影响的变量,即固定其他因素而计算两变量的相关。(所有变量都应该是连续变量)三、数据的相关性分析(2)解决方案为了剔除非检验变量对结果变量的影响,可以借助于控制变量把其他因素去掉,以便检测关注变量是否与结果相关。例如:以学生成绩为果变量,以上网时间为自变量,以游戏时间为控制变量。在摈弃了游戏对学生成绩造成影响的情况下,检查上网时间是否对学生成绩产生影响。三、数据的相关性分析(3)实例要求针对如mydayaX.sav的文件,检测上网时间、游戏时间与作业情况、数学成绩、物理成绩之间的相关性。操作过程(a)先判定这些数据的分布特性(b)采用命令:分析—相关—偏变量选择“因变量”、自变量、控制变量最后“确定”。三、数据的相关性分析直接以上网时间、游戏时间等做相关性分析三、数据的相关性分析偏相关分析四、数据的回归分析1、回归分析的概念含义与适应性目标通过分析大量的样本数据,确定变量之间的数学关系式;最终目标获得一个回归方程式(函数式)对所确定的数学关系式的可信程度进行各种统计检验,并区分出对某一特定变量影响较为显著的变量和影响不显著的变量;利用所确定的数学关系式,根据一个或多个变量值来预测或控制另一特定变量的取值。适应性因变量与自变量之间有较好的关联性(注意:由于多自变量的相互作用,这种相关性也可能不太清晰)四、数据的回归分析回归分析的类型线性回归分析(特点所有自变量都是一次,函数式为一次方程式类型一元线性回归多元回归分析曲线回归二次回归三次回归指数回归.......四、数据的回归分析回归分析中容易出现的问题回归方程能否较好地反映因变量(果变量)与自变量之间的关系。回归方程的计算值与观察值(原始数据)能否较好地吻合。回归方程的计算值结果能够在多大程度上反映数据所隐藏的关系。定类变量在回归分析中造成的干扰——哑元变量尽量避免在回归方程中出现定类变量在变量规范化时尽量制作定序变量四、数据的回归分析2、一元线性回归(1)特点基本属性回归方程为一元一次函数式F(x)=ax+bY观察值=ax+b+ç(ç为残差)回归曲线为线性数据特点两列数据具有很强的相关性、奇异值较少散点图呈现为直线状四、数据的回归分析(2)对线性回归效果的输出与评价判定系数=回归平方和/总计平方和判定系数《1,以接近于1较好。F值=回归均方和/残差的均方和T值=自变量的B值/标准误差|T|》1.96四、数据的回归分析残差值:观察值与回归计算值之间的差。希望在Anova模型中占据较少的比例。残差值应该远小于回归值满足正态分布(在进行线性回归操作时,可通过“绘制”功能绘制出来相应图形)四、数据的回归分析F值与检验概率通过方差分析的方式检验回归方程的显著性。F值代表:F的值是回归方程的显著性检验,表示的是模型中被解释变量与所有解释变量之间的线性关系在总体上是否显著做出推断。可以把F值看作“效应项总值/误差项总值”。F值大,则表示方程所发挥的作用更显著。检验概率:整体检验概率说明该回归方程的有效性;局部检验概率说明该自变量在回归方程中的有效性(小于0.05代表该自变量的不同取值能够引起因变量的显著性差异,证明该自变量在方程中有价值)四、数据的回归分析判定系数(可决系数)——R2直接反应回归直线对观测数据的拟合程度其中:

R是复相关系数,表示因变量y与全体自变量之间的线性关系。在多元线性回归中,其符号由全体自变量与因变量决定。要求:判定系数值尽可能大,最好能在0.6以上。但在特殊研究中,如果没有更好的回归方程,较低的判定系数值也常常被接受。如果系统同时生成了多个回归方程,应该选判定系数较大的且自变量个数较少的方程。四、数据的回归分析T值:T的数值表示的是对回归参数的显著性检验值,即每个系数对回归方程的影响水平;每个参数的T值实际等于标准化系数与残差的比值,能反应相应自变量对解决残差的贡献。在多元回归方程中,带有自变量项对应的T值最好能有较大的取值。一般规定:|t|>1.96,否则此自变量的价值不大。获得最终的回归方程式选择最优的回归模型;通过输出结果中B值数据得到回归方程式。四、数据的回归分析(3)一元线性回归分析实例针对mydataX数据,分析数学成绩与作业情况的回归方程。方法先用散点图,呈现二者之间的关系,发现基本为线性。执行命令:分析——回归——线性选择“自变量”是“作业情况”选择“因变量”是“数学成绩”在“绘制”下要求绘制“残差图”。最后“确定”观察输出结果。四、数据的回归分析针对mydataX数据,分别分析物理成绩与游戏时间、上网时间的回归方程。针对mydataX数据,分别分析语文成绩与游戏时间、上网时间的回归方程。四、数据的回归分析3、多元线性回归分析(1)特点基本属性回归方程为一元一次函数式F(x)=ax+by+cz+……+kY观察值=ax+by+cz+…….+K+ç(ç为残差)回归曲线为线性数据特点一个因变量,多个自变量做3-D图等,观察散点图特点需要在回归分析过程中进行自变量筛选,排除对观察值作用小的变量。四、数据的回归分析(2)多元线性回归分析实例针对mydataX数据,分析数学成绩与作业情况、游戏时间、认知风格、专业的回归方程。方法执行命令:分析——回归——线性选择“因变量”是“数学成绩”选择“自变量”是“作业情况”、游戏时间、认知风格、专业。选择”进入”方式“逐步”(即stepwise)在“绘制”下要求绘制“残差图”。最后“确定”观察输出结果。四、数据的回归分析(3)自变量(多)进入方程的方法依据(标准)使用F的概率值:指定进入方程和移出方程的标准值,当显著性水平小于输入值则变量进入方程,当显著性水平大于移出值则变量剔除方程。如果希望有多一些变量进入方程,就加大进入值,如果希望多一些变量移出方程,就减小移出值。使用F值:F值大于进入标准值,变量进入方程;F值小于移去标准值变量移出方程。四、数据的回归分析具体方法强行进入Enter(一次性进入)不检验进入值和移出值,所有变量一次全部纳入回归方程。正向进入Forward逐个检验,逐个进入(与因变量具有最大正或负相关系数),直到没有进入方程的变量都不满足进入方程的标准反向剔除Backward先强行进入,再逐个剔除不合格变量(与因变量具有最小偏相关系数),直到所有方程中的变量都不满足移出条件。逐步进入Stepwise是Forward与Backward的组合,最为常用的方法每一步不在方程的具有最小F概率值且满足进入条件的自变量进入方程;已经进入方程的自变量,如果其F概率足够大(满足移出条件)将被移出方程强行剔除Remove(一次性剔除)一次检验,而后剔除全部变量。这种方法不能单独使用四、数据的回归分析(4)补充说明根据同一变量集合可以构造各种各样的回归模型一个最优的多元回归方程不但方程显著,每个自变量的偏回归系数也显著对输出结果的解释与一元线性回归过程相同。判定系数“R方”与“调整的R方”判定系数R方——直接反应(回归的效果)回归平方和/总体平方和1-(残差平方和/总体平方和)调整的R方——考虑变量个数对R方的影响某些情况下,增加变量个数会提升R方值,为此对R方进行调整。四、数据的回归分析绘制出反应回归方程效果的图表。在多元线性回归操作界面,选择“绘制”选择Y轴为:ZRESID(即残差量)选择X轴为:ZPRED(即标准化预测值)绘制出残差图,观察残差图是否满足正态分布。补充:ZRESID:标准化残差DRESID:剔除残差ADJPRED:调整预测值SRESID:经过t值化的残差SDRESID:经过t值化的剔除残差。四、数据的回归分析自变量的共线性问题共线性的概念自变量之间存在着高度相关,影响回归方程中自变量的系数甚至得出诡异的结论共线性的典型例子婴儿头围、体重、身高四、数据的回归分析共线性判断方法选择“共线性”复选框判断依据相关系数(容许度)——共线性统计量容许度<0.2(或VIF>5)项存在较严重的共线性特征根的值——共线性诊断表存在多个大于30的条件索引项;某行中出现多个方差比例较大的值(此行的成分在这几个变量上存在共线性问题)处理方式剔除(或选择)共线性的自变量利用“逐步”方式做自变量删选“岭回归”技术四、数据的回归分析(5)多层回归分析分层回归分析的含义利用SPSS的多元回归分析界面的“块”,同时制作出多个模型;对比各个模型之间的变化情况(R方的变化)。应用在多元回归分析中,比较关注某个影响变量导致的,可以使用多层回归分析。方法:在回归分析界面中,把非关注变量放在第一块,把关注的变量放在最后块;在“统计量”勾选“R方的变化”,检查最后块中的统计量引起的R方变化。四、数据的回归分析4、曲线回归分析(1)基本特点特点因变量与自变量之间不满足线性关系。希望找到因变量与自变量之间的函数关系。数据要求通常只处理只有一个自变量的情况。应用范畴在物理、化学中,常常用于对实验数据的分析四、数据的回归分析(2)思路可先用散点图观察自变量与果变量之间的关系,判定是否存在清晰的逻辑关系比较接近于一条曲线——可做曲线回归分析——观察曲线的形状,判定大概属于哪类曲线数据点分散很严重——无法做曲线回归分析对于可做曲线分析的数据执行曲线回归分析观察数据结果,选择最优曲线模型四、数据的回归分析(3)操作过程具体方法执行“分析”——回归——曲线估计选择“因变量”选择“自变量”选择“曲线类型”最后“确定”四、数据的回归分析(4)观察操作结果观察散点图——二次或者三次曲线四、数据的回归分析执行曲线回归分析观察结果,得到二次曲线方程。四、数据的回归分析5、二项Logistic回归分析(1)二项Logistic回归分析分析的概念特点结果变量的类型为二元变量,即只有0和1两个取值。怀疑或者需要找到影响结果变量取值的因素,并构造回归方程因变量可能是定序变量、定类变量,甚至低测度定距量。难点结果变量为二元变量,取值范围小,不便于计算残差值。不能用普通的回归方式来处理,需要专门的手段。四、数据的回归分析(2)二项回归分析的解决思路原因与解决方案原因线性回归方程希望结果变量的取值范围为-œ~œ结果为二分变量的分析不满足线性回归条件解决方案变形后的公式则满足这一条件(P为事件发生的概率)(把Ω定义为【发生概率与未发生概率之间的比值】)因此:四、数据的回归分析自变量筛选技术采用极大似然估计的方法筛选;基于极大似然估计方法决定每个待选自变量能否进入方程极大似然估计值(原理)采用Wald检验方法筛选自变量先进行数据转化后,然后借助于类似T检验(有学者称之为扩展的T检验)的方式检查不同因素对结果造成的差异性,从而确定某个自变量能否进入方程采取条件检验方式筛选自变量四、数据的回归分析自变量筛选流程进入方式所有给定自变量都进入方程向前——逐个进入法对于给定自变量,按照其检验概率p的显著性依次进入方程,然后按照选定的筛选技术进行自变量的判定向后——逐个剔除法对于给定自变量,先全部进入方程,按照其检验概率p的显著性水平依次选择最差的自变量,从方程中剔除。四、数据的回归分析(3)回归方程质量的评判①错判矩阵以矩阵方式显示正确判定的个案数、错误判定的个案数以正确判定率高为佳。(左上角——右下角)四、数据的回归分析②Cox&SnellR方值、NagelKerkeR方Cox&SnellR方值:伪R方值,反应似然值的拟合水平不直接反应结论拟合水平,可(间接)反应回归方程拟合质量NagelKerkeR方:改进的Cox&SnellR方,其取值范围为0~1,以接近于1较优;③-2的对数似然值拟合似然值的取值范围为0—1,(取值为1时,完全拟合)似然值取自然对数后为负数,乘以-2之后变成正数此数值较小时,表示拟合程度较高④Hosmer-Lemshow拟合度适合自变量较多且定距型量较多的情形;反应按期望值分组之后是否存在显著差异,以>0.05为佳。⑤各自变量系数的显著性Wald值越大越好,Sig值越小越显著。四、数据的回归分析(4)操作实例①题目要求对于文件mydatax_over.sav文档,以“喜欢物理否2”为因变量,以性别、认知风格、学习态度、爱好、专业、物理成绩等级为自变量开展回归分析,并解释回归分析结果。②操作过程分析——回归——二元Logistic回归。四、数据的回归分析选择因变量选择自变量选择筛选方法在“分类”下设置Sex为分类类型在”选项”下选择“hosmer-leme拟合度”(可选)最后“确定”四、数据的回归分析③观看输出结果整体说明个案数目二元数据的分类,百分比四、数据的回归分析初始情况所有自变量都没有进入方程,方程中仅有一个常数,而且其检验概率>0.05。此时可考虑把下表中sig为0的变量添加到方程中。四、数据的回归分析基于极大似然比方式(或Wald检验)对进入的自变量进行筛选,发现经历2个步骤后结束判定:结束进入(删除)的情况包括:找到了最优的拟合方案找不到满足条件的可进入自变量(或可删除自变量)迭代次数过多,系统强行终止。输出结果呈现:四、数据的回归分析对模型的综合判定将回归方程的全部自变量作为整体来判断自变量与

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论