版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
常用相关统计量的计算
对于不同测量尺度的变量,其相关统计量的计算方法是不同的。如果是两个定距测量的变量,则可以根据两变量数值上的共同变化来理解它们之间的相关。这种基于共变基础上的相关统计量也就是一般数理统计上所说的相关系数。如果是两个定类或定序测量的变量,则可以从连同发生的角度来理解其相关关系,即当一个变量中的某种情况(类别)发生时,另一变量中的某种情况(类别)会更可能发生。
消减误差比例(PRE),是指当两个变量之间存在相关关系时,用其中一个变量X的取值分布去预测另一变量Y的取值,比不利用变量X的取值分布而直接预测变量Y的取值时所能够减少的误差与总误差之比。
PRE数值表示用一个变量去预测或解释另一个变量时能够消除百分之几的误差。消减误差比例越大,表明两变量之间的相关关系越强。定类或定序变量之间的相关计算公式大多建立在消减误差比例的基础之上。常用的相关统计量相关统计量Lambda适用于定类变量(或一个定类变量与一个定序变量)之间。其统计值介于0~1之间。基本逻辑是计算以一个定类变量的值去预测另一个定类变量的值时,如果以众值作为预测的准则,可以减少多少误差。消减的误差占全部误差的比重越大,表示两个变量的相关性越强。适用于不对称相关测量,要求在两个定类变量(或一个定类变量和一个定序变量)中能够区分自变量与因变量。其统计值介于0~1之间。由于值计算中包括全部边缘次数(即交互分类表中某个变量的某个取值的总次数)和条件次数(即交互分类表中两变量取值交叉项的次数),所以其敏感度高于Lambda相关测量法。相关统计量Gamma适用于测量两个具有对称关系的定序变量之间的相关程度。其统计值介于-1~1之间,在表示相关程度的同时又指明相关的方向。其基本含义是:根据任何两个个案在某一变量上的等级去预测他们在另一变量上的等级时,可以消减多少误差。
适用于测量两个具有对称关系的定序变量之间的相关程度。在横行与纵列数量相等的交互分类表中,系数的取值介于-1~1之间。与G系数不同的是,它在计算时既考虑了只在自变量X上同分(即两个个案在自变量X上取值一样,属于同一等级)的对,也考虑了只在因变量Y上同分(即两个个案在因变量Y上取值一样,属于同一等级)的对;而G系数在计算时则不考虑同分对。
适用于测量两个具有不对称关系的定序变量之间的相关程度。其统计值介于-1~1之间。
dy属于非对称相关测量
适用于以定类(或定序)变量为自变量,以定距(或定比)变量为因变量的两变量间相关关系的测量。相关比率以均值作为预测准则,其基本含义是:在知道自变量X取值分布的情况下,预测因变量Y的取值时能够消减的误差占总误差的比例。其统计值介于0~1之间
适用于测量两个具有对称关系的定距(或定比)变量之间的相关程度。其统计值介于-1~1之间,既表示相关的方向,又表示相关的程度。它是从两个变量共变的角度来分析相关关系的,其基本含义是:两个变量以其平均数为基准的平均共变程度与其标准差之比。本身不具有消减误差比例的意义,但其平方(被称为决定系数)具有消减误差比例的意义。
假设检验假设检验是指先对总体的某一参数作出某种假设(即虚无假设或原假设),再根据样本观察的数据去检验原假设是否正确,以决定是接受还是拒绝原假设。如果检验统计量大于等于临界值(或检验统计量的相伴概率小于等于给定的显著水平),则拒绝原假设。其理论依据是概率论中的小概率原理,该原理认为小概率事件在一次观察中是不可能出现的。总体均值和总体百分比的假设检验一般步骤(以Z检验法为例):假设检验统计量的计算公式适用于大样本(n≥30)下的总体均值假设检验适用于总体百分比假设检验适用于小样本(n<30)下的总体均值假设检验举例:总体均值和总体百分比的假设检验
例一:2009年某校学生的月均生活费支出为400元,2010年在该校抽取了100名学生进行调查,得到这100名学生的月均生活费支出为450元,标准差为60元。请问在0.05的显著水平上,该校学生2010年的月均生活费支出与2009年的有没有变化?
例二:某市市民2009年参加过慈善捐款的比例为65%,2010年该市社情民意调查中心电话访问了2000个市民,发现其中70%在2010年参加过慈善捐款。请问:在0.05的显著水平上,2010年该市有慈善捐款行为的市民的比例是否比2009年所有提高?三、注意事项
1.判断是接受还是拒绝原假设时,利用Z、t等统计量与其临界值进行对比,与利用其相伴概率和研究者所要求的显著性水平进行对比,二者是等价的。
2.SPSS已将一些常用值设定为了默认值,如果研究者没有特殊要求,可以直接使用系统默认值。练习1、某单位职工上月平均奖金为210元,本月调查了100名职工,平均奖金为220元,标准差为15元,问该单位职工平均奖金与上月相比是否有变化.2、一所大学全体学生中抽烟者的比例为35%,经过学习和戒烟宣传后,随机抽取100名大学生进行调查,结果发现抽烟者为25明,问戒烟宣传是否受到了成效1、(解)首先建立虚无假设(用H0表示)和研究假设(用H1表示),即有:H0:μ=210H1:μ≠210
选择显著性水平α=0.05,由Z检验表查得
Z(0.05/2)=1.96代入公式得到
Z=6.67
由于Z=6.67>Z(0.05/2)=1.96
所以.拒绝虚无假设,接受研究假设,即从总体上说,该单位职工月平均奖金与上月相比有变化.解1.建立假设:H0:P0=0.35H1:P0<0.35
2.选择显著性水平
α=0.05,由Z检验表查得Z0.05=1.65
3.根据公式计算统计量
0.25—0.35
=
0.35×(1-0.35)=-2.1100
4.将统计值与临界值进行比较做出判断由于│Z│=2.1>Z0.05=1.65
所以,拒绝虚无假设,接受研究假设,即从总体上说,戒烟宣传受到了成效,戒烟者的比例明显下降.
交互分类表与列联表交互分类就是将调查所得的一组数据按照两个不同的变量进行综合分类。通常以交互分类表(列联表)的形式出现,如表1:交互分析的作用如表3,我们只能得出赞成和反对的人大致相等的结论实际从不同性别来看,男性和女性之间存在很大的差异思考:两个表格所显示信息的差异交互分析的作用较为深入的描述样本资料的分布状况和内在结构。对变量之间的关系进行分析和解释交互分类表的形式要求每个表的顶端要有表号和标题线条规范、简洁,最好不用竖线百分比符号的处理:一种在表顶端的右角;另一种在表中每一列数字的上方表的下端用括号标出每一列的频数两个变量的安排:通常是将自变量、或被看作自变量或用来做解释的变量放在上面(列),将因变量、或被看作因变量、或被解释的那个变量放在表的左侧(行)。变量取值不宜太多。如4个自变量,5个因变量就是20个百分比少数点的位数要一致。如67.3和50.0必须要进行假设检验(多选变量的分析可以没有)(1)建立假设(2)求抽样分布(4)计算检验统计量(3)选择显著性水平和否定域(5)判定所所包有
含统的计步检骤验
概率分布不是一种研究者从资料中看到的分布,我们讨论它,不是出于对数学的爱好,而是因为统计推论的有关工作需要它。现在,我们要进入系统讨论统计假设检验的实际步骤的阶段。所有的统计检验都包含某些特定的步骤,这里先列示如下:
1.建立假设
统计检验是将抽样结果和抽样分布相对照而作出判断的工作。取得抽样结果,依据描述性统计的方法就足够了。抽样分布则不然,它无法从资料中得到,非利用概率论不可。而不对待概括的总体和使用的抽样程序做某种必要的假设,这项工作将无法进行。比如通过掷硬币的实验得到二项分布,必须假设:①样本是随机的,试验中各次抛掷相互独立;②硬币是无偏的(或称是诚实的),即p=q=0.5。概括地说,必须首先就研究总体和抽样方案都做出假设,再加上概率论,我们就可以对各种可能结果做具体的概率陈述了。
2.求抽样分布在做了必要的假设之后,我们就能用数学推理过程来求抽样分布了。比如在这一章开头,在硬币重复抛掷n次的理想实验中,我们计算了成功次数为x的宏观结果所具有的概率,得到二项分布。如果前提假设变动了,还可以求出其他形式的概率分布,如正态分布、泊松分布、卡方分布等等,它们都有特定的方程式。由于数学上已经取得的成果,实际上统计工作者要做的这项工作往往并不是真的去求抽样分布的数学形式,而是根据具体需要,确定特定问题的统计检验应该采用哪种分布的现成的数学用表。
3.选择显著性水平和否定域
在统计检验中,那些不大可能的结果称为否定域。如果这类结果真的发生了,我们将否定假设;反之就不否定假设。
在统计检验中,通常把被检验的那个假设称为零假设(用符号H0表示),并用它和其他备择假设(用符号H1表示)相对比。零假设与备择假设否定域
在统计检验中,无论是拒绝或者接受原假设,都不可能做到百分之百的正确,都有一定的错误。第一类错误是,零假设H0实际上是正确的,却被否定了。第二类错误则是,H0实际上是错的,却没有被否定。遗憾的是,不管我们如何选择否定域,都不可能完全避免第一类错误和第二类错误,也不可能同时把犯两类错误的危险压缩到最小。对任何一个给定的检验而言,第一类错误的危险越小,第二类错误的概率就越大;反之亦然。一般来讲,不可能具体估计出第二类错误的概率值。第一类错误则不然,犯第一类错误的概率是否定域内各种结果的概率之和。两类错误及其关系
被我们事先选定的可以犯第一类错误的概率,叫做检验的显著性水平(用α表示),它决定了否定域的大小。因此,有人也把第一类错误称之α错误。相应地第二类错误被人称为
错误。在原假设成立的条件下,统计检验中所规定的小概率标准一般取为α=0.05或α=0.01。由α所决定的否定域与接受域之间的分界值被称为临界值,如Zα。如果抽样分布是连续的,否定域可以建立在想要建立的任何水平上,否定域的大小可以和显著性水平的要求一致起来(后面的正态检验就如此)。如果抽样分布是非连续的,就要用累计概率的方法找出一组构成否定域的结果。显著性水平α
根据否定域位置的不同,可以将假设检验分为双侧检验和单侧检验。
在统计中,必须把否定域分配到抽样分布的两端的检验,被称为双侧检验。
在统计中,可以事先能预测偏差方向,因而可以把否定域集中到抽样分布更合适的一端的检验,被称为单侧检验。双侧检验和单侧检验4.计算检验统计量
在完成了上述工作之后,接下来就是做一次与理想试验尽量相同的实际抽样(比如实际做一次重复抛掷硬币的试验),并从获取的样本资料算出检验统计量。检验统计量是关于样本的一个综合指标,但与我们后面参数估计中将要讨论的统计量有所不同,它不用作估测,而只用作检验。5.判定
假设检验系指拒绝或保留零假设的判断,又称显著性检定。在选择否定域并计算检验统计量之后,我们完成最后一道手续,即根据试验或样本结果决定假设的取与舍。如果结果落在否定域内,我们将在已知犯第一类错误概率的条件下,否定零假设。反之,如果结果落在否定域外,则不否定零假设,与此同时,我们就有了犯第二类错误的危险。
相关关系(correlation)两变量间的相关关系指的是一个变量的值与另一个变量有连带关系。也就是,当一个变量发生变化时(或取值不同时),另一个变量也随之发生变化。如:文化程度收入期望女性的文化程度生育期望相关的性质(1)相关关系的强度相关程度,指的是相关关系的强弱或大小。相关关系的强弱或大小可以用统计法进行测量。变量间相关关系的统计结果称为相关系数。相关关系的程度介于[-1,1]之间,数值绝对值越大,表示相关的程度越强.正\负号表示的是相关关系的方向.0代表无相关,1代表全相关.见图9-1来说明.注意:社会调查中各相关系数的值不可能达到1相关系数只表示各变量间相关程度的指标,没有数量的关系。如0.5和0.25,并不表示0.5比0.25的相关大0.25,或者是0.25相关的两倍
图9-1X与Y的相关关系X和Y分别代表两个变量,各有二个取值(1,2),表中的a、b、c、d分别表示不同情况下个案的数目如果a=d=0或b=c=0,则表示X和Y全相关;如果a×d=b×c,即,则表示X和Y无关;如果a×d>b×c或a×d<b×c,则表示X和Y有相关关系。例1:a=d=0或b=c=0,两个变量全相关例2:a×d=b×c,对角线相等,则表示无相关例3:如果a×d>b×c或a×d<b×c,则表示X和Y有相关关系。(2)相关关系的方向(+、-)正相关关系和负相关关系正相关关系:一个变量的取值增加时,另一个变量的取值也增加,反之亦然;人们的文化程度越高,他们的收入水平也越高;文化程度较低的人,他们的收入水平也普遍较低。反之,那些收入水平较低的人,他们的文化程度一般来说也较低。
负相关关系:一个变量的取值增加时,另一个变量的取值减少;而一个变量的值减少时,另一个变量值的增加。在调查中发现,文化程度越高的被调查者,在回答问卷时,花费的时间越少,而文化程度较低的被调查者,填答问卷时花费的时间较长。在此,我们可以说文化程度和问卷填答时间之间存在着负相关关系。
注意:方向的分析只适用于定序以上层次的变量(3)相关关系的对称性与非对称性相关的两个变量,不一定有因果关系,可能是共同变化。不对称关系:自变量X影响因变量Y,但是因变量Y不会影响X---因果关系,如施肥量和小麦产量之间的关系对称关系:不能确定或区分两个变量的方向。如交往的多少与他们的互爱程度(4)相关的类型相关关系是一种数量关系上不很严格的相互依存关系如果这种关系近似地表现为一条直线,就称为直线相关,又称线性相关;如果这个关系近似地表现为一条曲线,则称为曲线相关,又称非线性相关。虽然在自然界和社会生活中,曲线相关现象远比直线相关更多,但由于数学手段上的局限性,社会统计研究中多以阐述线性(直线)相关为主。
相关关系的检验
等相关统计量是根据样本资料计算出来的,由于抽样误差的存在,所以即使样本中两个变量呈现出相关关系,在总体中,这两个变量也未必就一定存在相关关系。因此,需要对样本统计值所显示的相关关系进行检验,以确定在总体中两个变量是否也存在相关关系。
(一)相关关系检验的基本步骤(二)常用相关关系检验方法案例
[例3]
某校高中毕业班中理科97名学生毕业考试各科总成绩与瑞文推理测验分数的相关系数.84,文科50名学生各科总成绩与瑞文推理测验分数相关系数为.75,能否认为理科的这一相关系数大于文科。解:n1=97,r1
=.84
得Zr1=1.22n2=50,r2=.75
得Zr2=.793单侧检验,Z.05=1.6451.39<1.645,即p>.05因此r1并不显著地大于r2,不能认为理科毕业成绩与瑞文测验的相关系数明显大于文科。案例
随机抽取123名儿童进行某一项能力测验,同时算出能力测验结果与效标的相关系数是.54,研究者嫌该测验对于这组儿童来说效度不理想,在此测验的基础上又编制了一个新测验来测量该项能力(对同一组被试),结果新测验与同一效标分数的相关为.62,而且新旧测验的相关系数是.68,试问新测验的效度是否有显著的提高。
解:n
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- CI并发症预防及处理
- excle在财务管理中的应用第4章
- 公证员转正述职报告
- ETCO2监护培训资料
- 特殊传染病的防护措施
- 2026年注册建筑师考试《建筑规范》试卷
- 投资健康领域总结
- 2026年智能动漫设计类资格考试智能动漫设计师资格试卷
- 月度生产计划排程管理细则
- 质量与安全管理
- 湖南省衡阳市四校2025-2026学年下学期期末检测 七年级地理试卷(含答案)
- 2026年实验室设计标准规范
- 12.《公共财政概论》第十二章 财政体制 改
- 格力集团基层员工形薪酬满意度对离职意愿的影响研究
- DB35∕T 1894-2020 数字福建电子政务项目审查规范
- 二手车销售公司运营方案范文
- 2026年甘肃省武威市高职单招职业技能考试题库与答案详解
- (正式版)DB51∕T 1235-2011 《香樟用材林栽培技术规程》
- 中国抗病毒洗衣液临床效果验证与医疗渠道拓展战略报告
- 银行员工消保培训课件
- 区域供冷供热行业分析报告
评论
0/150
提交评论