spss回归分析相关分析ppt课件_第1页
spss回归分析相关分析ppt课件_第2页
spss回归分析相关分析ppt课件_第3页
spss回归分析相关分析ppt课件_第4页
spss回归分析相关分析ppt课件_第5页
已阅读5页,还剩50页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

1、相关分析相关分析 Correlations线性相关:当一个变量的值发生变化时,另外的一个变量也发线性相关:当一个变量的值发生变化时,另外的一个变量也发生大致一样的变化。生大致一样的变化。+ -+ -非线性相关:假设一个变量发生变动,另外的变量也随之变动,非线性相关:假设一个变量发生变动,另外的变量也随之变动,但是,其察看值分布近似的在一条曲线上。但是,其察看值分布近似的在一条曲线上。:假设仅仅研讨变量之间的相互关系的亲密程度和变化趋势,并用适当的统计目的描画。这就是相关分析。 假设要把变量间相互关系用函数表达出来,用一个或多个变量的取值来估计另一个变量的取值,这就是回归分析。 绘制散点图和计算

2、相关系数是相关分析最常用的工具,它们的相互结合可以到达较为理想的分析效果相关分析相关分析 Correlations:是将数据以点的方式画在直角坐标系上,经过察看散点图可以直观的发现变量间的相关关系及它们的强弱程度和方向。散点图:散点图:完全负相关负相关无相关完全正相关正相关无相关:实践操作:: 简单散点图:生成一对相关变量的散点图简单散点图:生成一对相关变量的散点图 重叠散点图:生成多对相关变量的散点图重叠散点图:生成多对相关变量的散点图 矩阵散点图:同时生成多对相关变量的矩阵散点图矩阵散点图:同时生成多对相关变量的矩阵散点图 三维散点图:消费成三个变量之间的三维散点图三维散点图:消费成三个变

3、量之间的三维散点图相关分析相关分析 Correlations: 表示一对变量间统计关系的散点图 将纵轴变量选入【Y 轴】, 将横轴变量选入【X轴】, 将分组变量选入【设置标志】:用该变量分组,并在一张图上用不同颜色绘制假设干个散点图。 将标志变量选入【标注个案】:将标志变量的各变量值标志在散点图相应点的旁边。简单散点图:简单散点图::计算相关系数: 利用相关系数进展变量间线性关系的分析通常需求完成以下两个步骤: 1.计算样本相关系数r; 相关系数r的取值在-1-+1之间 r0表示两变量存在正的线性相关关系;r0.8表示两变量有较强的线性关系; |r|4040 必需是延续变量必需是延续变量:多元

4、回归方程中的自变量选择多元回归方程中的自变量选择 强行进入法强行进入法enterenter,即普通所称的复回归分析法。强迫一切,即普通所称的复回归分析法。强迫一切变量有顺序地进入回归方程。在研讨设计中,假设研讨者事先建立假变量有顺序地进入回归方程。在研讨设计中,假设研讨者事先建立假设,决议变量的重要性层次,那么应运用设,决议变量的重要性层次,那么应运用enterenter法比较适宜。此法又法比较适宜。此法又称称“层次式进入法层次式进入法hierarchical enterhierarchical enter 后退法后退法BackwardBackward,将已纳入方程的变量按对因变量的奉献,将已

5、纳入方程的变量按对因变量的奉献大小由小到大依次剔除,每剔除一个自变量,即重新检验每一自变量大小由小到大依次剔除,每剔除一个自变量,即重新检验每一自变量对因变量的奉献。对因变量的奉献。 前进法前进法ForwardForward,对已纳入方程的变量不调查其显著性,直,对已纳入方程的变量不调查其显著性,直到方程外变量均达不到入选规范。到方程外变量均达不到入选规范。 强迫剔除法强迫剔除法RemoveRemove与后退法一样,只是挑选的是与后退法一样,只是挑选的是BlockBlock:逐渐回归法逐渐回归法 Stepwise Stepwise 运用很广,报告中出现的几率最高。结合了前进法和后退法的运用很广

6、,报告中出现的几率最高。结合了前进法和后退法的优点。第一,模型中先不包含任何预测变量,与因变量相关最优点。第一,模型中先不包含任何预测变量,与因变量相关最高者首先进入回归方程;第二,控制回归方程中的变量后,根高者首先进入回归方程;第二,控制回归方程中的变量后,根据每个预测变量与因变量的偏相关的高低来决议进入方程的顺据每个预测变量与因变量的偏相关的高低来决议进入方程的顺序;第三,已进入方程的自变量,每引入一个自变量,就对方序;第三,已进入方程的自变量,每引入一个自变量,就对方程中的每一自变量进展显著性检验,假设发现不显著,就剔除;程中的每一自变量进展显著性检验,假设发现不显著,就剔除;每剔除一个

7、自变量有也对留在方程中的自变量再进展显著性检每剔除一个自变量有也对留在方程中的自变量再进展显著性检验,再不显著,又剔除,直至没有自变量引入,也没有自变量验,再不显著,又剔除,直至没有自变量引入,也没有自变量剔除为止。剔除为止。在选择回归的方法时,留意专业上的要求要先于统计学检验的准那么。在选择回归的方法时,留意专业上的要求要先于统计学检验的准那么。HowerHower19871987建议:建议:1 1应优先运用应优先运用enterenter或或stepwisestepwise。2 2运用运用enterenter时,可根据研时,可根据研讨方案时的相关实际,决议变量投入的顺序。讨方案时的相关实际,

8、决议变量投入的顺序。: 经过样本数据建立回归方程后普通不能立刻用于对实践问题的分经过样本数据建立回归方程后普通不能立刻用于对实践问题的分析和预测,通常要进展各种统计检验析和预测,通常要进展各种统计检验. 包括回归方程的拟合优度检验包括回归方程的拟合优度检验 回归方程的显著性检验回归方程的显著性检验 回归系数的显著性检验回归系数的显著性检验 残差分析等残差分析等:拟合优度检验拟合优度检验 检验样本数据点聚集在回归线周围的密集程度,从而评价回归方检验样本数据点聚集在回归线周围的密集程度,从而评价回归方程对样本数据的代表程度。程对样本数据的代表程度。 以为以为y y各观测值的之间的差别主要由两个方面

9、的缘由呵斥:一是各观测值的之间的差别主要由两个方面的缘由呵斥:一是解释变量解释变量x x取值的不同呵斥的;二是由于其他随机要素呵斥的。取值的不同呵斥的;二是由于其他随机要素呵斥的。 SST=SSA+SSESST=SSA+SSE回归平方和剩余平方和回归平方和剩余平方和 假设假设SSASSA所占的比例远大于所占的比例远大于SSESSE所占的比例,那么回归方程的拟合所占的比例,那么回归方程的拟合优度会比较高。优度会比较高。: 拟合优度检验采用拟合优度检验采用R2统计量,该统计量称为断定系数或决议系数,统计量,该统计量称为断定系数或决议系数,它是它是SSA/SST 反映因变量的全部变异中可以经过回归关

10、系被自变量解释的比例,反映因变量的全部变异中可以经过回归关系被自变量解释的比例,即检验回归的效果如何。即检验回归的效果如何。 假设自变量的个数很多,有时要以调整后的决议系数替代原先的假设自变量的个数很多,有时要以调整后的决议系数替代原先的决议系数。由于添加新的自变量会使决议系数增大,这种决议系决议系数。由于添加新的自变量会使决议系数增大,这种决议系数会有高人为控制的机制在内,此时用调整后的决议系数更好数会有高人为控制的机制在内,此时用调整后的决议系数更好拟合优度检验拟合优度检验:显著性检验显著性检验 线性回归方程可以较好地反映被解释变量和解释变量之间统计关线性回归方程可以较好地反映被解释变量和

11、解释变量之间统计关系的前提应是,被解释变量和解释变量之间确实存在显著的线性系的前提应是,被解释变量和解释变量之间确实存在显著的线性关系。回归方程的显著性检验正是要检验被解释变量与一切解释关系。回归方程的显著性检验正是要检验被解释变量与一切解释变量之间的线性关系能否显著,用线性模型来描画它们之间的关变量之间的线性关系能否显著,用线性模型来描画它们之间的关系能否恰当。系能否恰当。 根本出发点与拟合优度检验非常类似。根本出发点与拟合优度检验非常类似。 检验采用检验采用F统计量。统计量。 主要目的是研讨回归方程中的每个解释变量与被解释变量之间能主要目的是研讨回归方程中的每个解释变量与被解释变量之间能否

12、存在显著的线性关系,也就是研讨解释变量可以有效地解释被否存在显著的线性关系,也就是研讨解释变量可以有效地解释被解释变量的线性变化,他们可以保管在线性回归方程中。解释变量的线性变化,他们可以保管在线性回归方程中。 是围绕回归系数估计值的抽样分布展开的,由此构造服从某种实是围绕回归系数估计值的抽样分布展开的,由此构造服从某种实际分布的检验统计量,并进展检验。际分布的检验统计量,并进展检验。: t t统计量:在一元线性回归分析中,回归方程显著性检验和回归统计量:在一元线性回归分析中,回归方程显著性检验和回归系数显著性检验的作用是一样的,两者可以相互替代,同时回归系数显著性检验的作用是一样的,两者可以

13、相互替代,同时回归方程显著性检验中方程显著性检验中F Ft2t2。 但在多元线性回归中的这两种检验通常不能相互替代。但在多元线性回归中的这两种检验通常不能相互替代。:残差分析 所谓残差是指由回归方程计算所得的预测值与实践样本值之间的所谓残差是指由回归方程计算所得的预测值与实践样本值之间的差距。差距。 残差分析是回归方程检验中的重要组成部分,其出发点是,假设残差分析是回归方程检验中的重要组成部分,其出发点是,假设回归方程能较好地反映被解释变量的特征和变化规律,那么残差回归方程能较好地反映被解释变量的特征和变化规律,那么残差序列中应不包含明显的规律行和趋势性。序列中应不包含明显的规律行和趋势性。

14、残差分析的主要义务可大致归纳为,分析残差能否服从均值为残差分析的主要义务可大致归纳为,分析残差能否服从均值为0 0的正态分布、分析残差能否为等方差的正态分布、分析残差序列的正态分布、分析残差能否为等方差的正态分布、分析残差序列能否独立、借助残差探测样本中的异常值等。能否独立、借助残差探测样本中的异常值等。 图形分析和数值分析是残差分析的有效工具图形分析和数值分析是残差分析的有效工具:如何看回归结果?如何看回归结果? 哪些自变量我们选定进入了回归方程哪些自变量我们选定进入了回归方程 对回归方程进展检验,看方程能否有意义对回归方程进展检验,看方程能否有意义 看回归效果,看回归效果, R2 R2:回

15、归分析的三个重要目的回归分析的三个重要目的 方差分析:方差分析:F F检验用于检验回归模型与数据的拟合程度。假设检验用于检验回归模型与数据的拟合程度。假设F F值值显著,阐明预测变量与目的变量之间存在很强的线性关系,也可显著,阐明预测变量与目的变量之间存在很强的线性关系,也可以说回归方程显著。以说回归方程显著。 回归系数的显著性检验:假设回归系数的显著性检验:假设b b显著,那么阐明预测变量与目的显著,那么阐明预测变量与目的变量之间存在强线性相关。变量之间存在强线性相关。 R2R2:解释回归平方和在总平方和中所占的比率,即解释回归的效:解释回归平方和在总平方和中所占的比率,即解释回归的效果。果

16、。:虚拟变量虚拟变量假设某个自变量是分类变量,那么须将分类变量转化为二进制虚拟变量假设某个自变量是分类变量,那么须将分类变量转化为二进制虚拟变量dummy variabledummy variable,每个虚拟变量只代表,每个虚拟变量只代表2 2级级0 0,1 1,即某一属性出,即某一属性出现时,虚拟变量取值为现时,虚拟变量取值为1 1,否那么为,否那么为0 0。设虚拟变量时,以一种取值作为对比程度根底程度,假设原自变量有设虚拟变量时,以一种取值作为对比程度根底程度,假设原自变量有几个程度,就应运用几个程度,就应运用n-1n-1个虚拟变量,实那么虚拟变量代表的是同一变量个虚拟变量,实那么虚拟变

17、量代表的是同一变量的不同取值如性别变量有男或女两类的不同取值如性别变量有男或女两类, ,可将两个类别分别以两个可将两个类别分别以两个0/10/1二值变二值变量的方式重新编码。设置变量量的方式重新编码。设置变量X1X1表示能否男,取表示能否男,取1 1表示男,取表示男,取0 0表示不是男。表示不是男。再设置变量再设置变量X2X2表示能否女,取表示能否女,取1 1表示是女,取表示是女,取0 0表示不是女。表示不是女。产生的回归方程中各虚拟变量回归系数的含义是,相对参照类,各个类对产生的回归方程中各虚拟变量回归系数的含义是,相对参照类,各个类对解释变量平均奉献的差,进而可进一步研讨各类别间对被解释变

18、量的平均解释变量平均奉献的差,进而可进一步研讨各类别间对被解释变量的平均奉献差别。奉献差别。:共线性诊断共线性诊断 Collinearity diagnostics Collinearity diagnostics复共线问题共线性,复共线问题共线性,collinearitycollinearity问题:由于自变量间的相关问题:由于自变量间的相关太高,呵斥回归分析之情境困扰。假设自变量间有共线性问题,表太高,呵斥回归分析之情境困扰。假设自变量间有共线性问题,表示一个预测变量是其他自变量的线性组合。假设有严重的共线性存示一个预测变量是其他自变量的线性组合。假设有严重的共线性存在,那么模型的参数就不

19、能完全被估计出来。在,那么模型的参数就不能完全被估计出来。:1 1VIF=5VIF=5,存在复共线。所以在回归分析中,最好先做个相关分析,存在复共线。所以在回归分析中,最好先做个相关分析,以讨论变量间的相关情形,假设某些变量间的相关系数太高,可思索挑以讨论变量间的相关情形,假设某些变量间的相关系数太高,可思索挑选一个较重要的变量投入回归分析。选一个较重要的变量投入回归分析。2 2容忍度容忍度tolerance=1-R2 tolerance=1-R2 ,其中,其中R2R2是此自变量与其他自变量间的多是此自变量与其他自变量间的多元相关系数的平方。容忍度界于元相关系数的平方。容忍度界于0 0和和1

20、1之间,假设一个自变量的容忍度太之间,假设一个自变量的容忍度太小,表示此变量与其他自变量间有共线性问题;其值假设接近小,表示此变量与其他自变量间有共线性问题;其值假设接近0 0,表示此,表示此变量几乎就是其他变量的线性组合。变量几乎就是其他变量的线性组合。3 3条件指针条件指针condition indexcondition index,CICI,CI CI 越大,越有共线性问题。越大,越有共线性问题。Eigenvalue condition indexEigenvalue condition indexk k假设假设k2=100k2=100表示存在复共线,假设表示存在复共线,假设k2=100

21、0k2=1000,表示存在严重的复共线。,表示存在严重的复共线。关于复共线问题,也有说法,即以为假设关于复共线问题,也有说法,即以为假设torrencetorrence降至降至0.50.5以下,而以下,而VIF VIF 上升到上升到2.02.0以上,就应检查自变量能否为自相关。以上,就应检查自变量能否为自相关。:对于一元回归,假设散点图的趋势不呈线性分布,可以利用曲线估对于一元回归,假设散点图的趋势不呈线性分布,可以利用曲线估计方便地进展线性拟合计方便地进展线性拟合(liner)(liner)、二次拟合、二次拟合(Quadratic)(Quadratic)、三次拟合、三次拟合(Cubic)(C

22、ubic)等。采用哪种拟合方式主要取决于各种拟合模型对数据的等。采用哪种拟合方式主要取决于各种拟合模型对数据的充分描画充分描画( (看修正看修正Adjusted R2 -1)Adjusted R2 -1):二项二项Logistic回归回归利用多元回归方法分析变量之间的关系或进展预测时的利用多元回归方法分析变量之间的关系或进展预测时的一个根本要求是,被解释变量应是延续定距变量。如课一个根本要求是,被解释变量应是延续定距变量。如课题数、教育支出题数、教育支出实践运用中这种要求未必可以得到较好的满足。例如,实践运用中这种要求未必可以得到较好的满足。例如,要分析消费群体的特征对汽车消费的影响中,职业、性要分析消费群体的特征对

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论