版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
教育统计与SPSS运用教育学院康春花akang@参考资料1、张敏强编著《教育与心理统计学》人民教育出版社2002年11月第2版2、王孝玲编著《教育统计学》华东师范大学出版社2001年7月第1版3、张厚粲编著《心理与教育统计学》北京师范大学出版社1993年12月第1版4、吴明隆编著《SPSS统计应用实务》中国铁道出版社2000年9月第1版5、郭志刚主编《社会统计分析方法----SPSS软件应用》中国人民大学出版社先了解几个概念统计学数理统计学应用统计学工业统计学医学统计学教育与心理统计学等等统计学是研究如何搜集、整理、分析反映事物总体信息的数字资料,并以此为依据,对总体特征进行推断的原理和方法。几个关键词:搜集、整理、分析、总体信息、数字资料数理统计学是以概率论为基础,对统计数据数量关系的模式加以解释,对统计原理和方法给予数学证明。应用统计学是数理统计原理和方法在各个领域中的应用。数理统计学是应用统计学的理论基础,应用统计学是数理统计学的实践和应用教育与心理统计学教育与心理统计学是应用统计学的一个分支,是专门研究如何搜集、整理、分析在教育和心理方面由实验或调查所获得的数字资料,并如何根据这些数字资料所传递的信息,进行科学推论找出客观规律的一门科学。或者说是一门通过量化的手段来分析、认识教育与心理现象和规律的工具性学科。教育统计学中须掌握的统计分析法描述统计分析推断统计分析多元统计分析每一部分内容的教学安排均从以下三方面着手:1、统计分析基本原理2、实例讲解及SPSS数据处理3、结果解释学习之前须具备的预备知识一、随机现象与随机变量
教育或心理测量或测验中由于随机因素的存在,使得测量中存在着随机误差或偶然误差。而随机误差的存在,又使得在相同条件下观测的结果常常不只一个,并且事先无法确定,这是客观世界存在的一种普遍现象,人们称这类现象为随机现象。如考试、心理测验等均是随机现象。随机现象的各种结果总是可以用一定的数量来表现,而且表现为实验结果数值的不确定性,因而称为变量。这种变量受随机因素的影响,呈现随机变化,具有偶然性的一面,但也具有规律性的一面。通过大量的实验或观测,这种规律性可以揭示出来。我们把这种具有变化规律的表示随机现象各种结果的变量称为随机变量。如学生的身高、体重、性别、智商、成绩等等。随机变量具有离散性、变异性与规律性的特点。二、变量的类型(1)连续变量与非连续变量(间断变量、离散变量)
(2)因变量与自变量随机变量按性质分有如下四种:(1)称名变量(Nominal),用于说明某一事物与其它事物在属性上的不同或类别上的差异,但不说明差异的大小。如性别、年级等。(2)顺序(等级)变量(ordinal),指按事物的某一属性,把它们按多少或大小加以排列的变量。如名次、等级评定、喜爱程度、品质等级、能力等级等。(3)等距变量(interval),是指变量之间具有相等的距离,除了有量的大小外,还具有相等的单位,但没有绝对意义上的零。如天气温度、各种能力分数、智商等。只能加减,不能乘除。(4)比率变量(ratio),除了有量的大小,相等单位外,还有绝对意义上的零。如身高、体重、反应时等。可以加减乘除。三、总体个体样本
总体的性质是由组成总体的个体的性质而定,所以要了解总体的性质,必须对每一个个体进行观测,这是最好的办法,但实际上是不可能的。而只能通过对一部分个体进行观测,然后对总体加以推论。
四、统计量与参数
统计量又称统计特征数(样本统计量),是根据科研实验所获得的一组观测值计算出来的一些量数,它可以描述一组数据的情况,用英文字母表示。如,S,r等。从一个总体中抽取的不同样本的统计量是随机变量。参数又称总体参数,是指描述一个总体情况的一些统计指标,用希腊字母表示。如反映总体集中情况的统计指标称为总体平均数或期望值,用表示。其它如,等。总体参数是常数。
第一个专题:描述统计分析及其应用
主要研究如何将实验或调查得到的大量数据简缩成有代表性的数字,使其能客观、全面地反映这组数据的全貌,将其所提供的信息充分显现出来,为进一步统计分析和推论提供可能。其研究方法是通过绘制统计图表及计算各种统计量来描述这组数据的各方面特征,一般步骤为:对原始数据进行分类,作出次数分布表及次数分布图并算出峰度,以偏度系数反映数据的分布特征;计算平均数、中数、众数等集中量数,以表示一组数据的集中趋势;计算全距、平均差、四分差、标准差或方差等差异量数,以表示一组数据的分散程度;计算相关系数、回归系数或回归方程,以反映两列变量变化之间的关系或一致性程度。因而,描述统计学主要是描述事物的典型性、波动范围以及相互关系,揭示事物的内部规律。
第一章常用的统计分析图在教育与心理科学研究和实验中,一般都是先获得大量的观测数据(原始数据)。这些数据表面上是杂乱没有规律的,为此首先可以进行整理,以便能对资料的全貌有个初步的了解,而最常用的定量直观地整理、描述这些数据的手段之一就是把它绘制成统计分析图。
一、次数直方图(连续变量)Histograms次数直方图是由若干宽度相等,高度不一的直方条紧密排列在同一基线上构成的图形。如,在台湾的一项《夫妻对电视传媒介观念差距的研究》中,访问了三十对夫妻,其中丈夫所受的教育X(以年为单位)的数据如下:182016616171214161814141692018121513161621219162014141616作出次数分布的直方图如下:
二、条形图(Barcharts)
条形图是用宽度相同的长条来表示各个统计事项之间的数量关系。适用于离散变量。如描绘出“大五人格”调查中(bigfive1.sav)大学生样本的年级分布图三、圆形图(Piecharts)圆形图是以单位圆内各扇形面积所占整个圆形面积的百分比来表示各统计事项在其总体中所占相应比例的一种图示方法。适用于离散变量。如描绘出
“大五人格”调查中(bigfive1.sav)大学生样本的学校百分比结构图。
第二章常用的描述统计量数统计分析图让我们对调查所得到的数据有了一个直观的印象,为了进一步发现和表示一组数据的规律性,需要计算出一些能反映这组数据的特征的数字—统计量或特征数。要描述一组变量的全貌必须计算这组变量的两方面的特征量,既:中心位置:中心位置用以度量一组数据的集中趋势,描述这批数据分布的中心,故对其数量化描述称为位置度量中量数(集中量数)。集中量数可以作为这批数据一般水平的代表值。离散性:反映一组数据的分散程度即次数分布的离散程度。对其数量化描述称为差异量数。描述这批数据分布的形态。一、集中量数(分布的中心)定义分布的中心有许多不同的方式,我们这里介绍三种最常用的,即众数、中位数、平均数。(一)众数(mode)
一个分布的众数定义为次数出现最多的变量值如前述“丈夫教育水平”中16年出现了6次,因而可以用16年作为这一组变量一般水平的代表值。(二)中位数(median)
一组数据按大小顺序排列,位于中间位置的那个数,或者说有50%的数值在这个值以下。如在“丈夫教育水平”中,中位数为16。(三)平均数(mean)如“丈夫教育水平”中,其平均年限为15.4。(四)三种中心度量值的比较如在中央电视太举办的一次全国业余通俗歌手大赛中,假定11位裁判对某位歌手的评分按顺序排列为:9.9,9.3,9.3,9.3,9.2,8.9,8.8,8.8,8.7,8.5,8.4则这组数据的三种值分别为众数=9.3,中位数=8.9,均值=9.01。到底用哪个值最具有代表性呢?假定在复赛中这11名裁判对该歌手的评分如下:9.9,9.3,9.3,9.2,9.2,8.8,8.8,8.8,8.7,8.5,8.4这时众数=8.8,中位数=8.8,均值=8.99。可以看出均数最稳定,众数最不稳定,中数次之。因此,当分布比较有规则即不存在极端数据时,用均值代表分布的中心比较好;而在有极端值时,用中数更合适,当然这时如果把极端值去掉求其平均值也是可以的。二、差异量数(分布的形状)描述分布的中心,均值是最重要的一种统计量。如我们常用平均收入、平均身高、平均分数来描述数据资料,但,只从平均值来看待事物会不会片面呢?如1991年的《浙江调查》中的第22题“你昨天花了多少时间看电视?”假定在三个不同单位分别抽取的11名观众的回答为(单位:分钟)第一组:40,60,50,50,40,50,50,50,60,50,50第二组:70,40,50,60,30,60,50,40,30,50,70第三组:20,40,20,20,60,20,90,80,20,90,90这三个分布的形状不同(见“浙江调查第22题”)图一的数值很集中地围绕在均值周围;图二就分散多了,而图三则最分散。可见平均数同样的都为50,可其代表的可靠性却不同,这就需要考虑能描述分布形状即分布关于其中心的波动程度的统计量(差异量数)。(一)两极差(Range)或全距R=最大值-最小值,R1=60-40=20;R2=70-30=40,R3=90-20=70。极差容易受极端数据的影响,而中间数据的变化并未考虑,为了衡量所有数据偏离其平均数的程度,可以考虑每个观测值离开其均值的偏差。这就引出了另一个更为重要的差异量数。(二)方差和标准差(Variance)和(SD)方差和标准差所反映的是数据对其均值中心的某种离散程度,由此其值越小则数据越集中在均值附近,反之则越分散。上例中,三组数据的标准差分别为6.32,14.14,32.25。因此,一般来说,样本平均数是对分布中心最普遍的度量,而样本标准差则是对分布形状最常用的度量,并且,两者通常同时出现描述一组数据的全貌。在心理学中,常用两者建立量表的常模。如在SCL-90中,抑郁分量表的均值X为1.50,标准差SD为0.59,如果某人的得分偏离常模团体平均数达到两个标准差时,则可认为是异常。三、相关分析(描述两变量关系的量数)(一)什么是相关关系变量之间的关系可以分为两类:一类是确定的函数关系,比如销售额(M)、价格(P)和销售量(Q)之间的关系为:M=P*Q;它们之间为一一对应的关系,知道其中两个变量,就可以确定第三个变量。另一类是统计相关关系。相关关系指的是变量之间有联系,但其密切程度又没有达到一一确定的因果关系。比如不同地区家庭的人均食品支出与人均收入的关系,收入高的地区,往往食品支出也高,但是相同收入的地区,食品支出不一定相同,这是因为后者还与地区物价以及不易测量的消费习惯等随机因素有关。变量之间相关的密切程度可以用相关系数r来表示,其取值范围为[-1,+1],绝对值r越接近1表明相关密切程度越高,或者说一变量受另一变量的影响程度越高。可见具有函数关系的两变量,其相关系数一定为+1或-1。方向(性质):正相关:方向一致,如身高与体重成正比。负相关:方向相反,如初学打字,练习次数越多,错误越少。零相关:不存在线性相关,如成绩好坏与身高无关,不是不相关,因为有可能是曲线相关。(二)相关系数的计算计算相关系数一般要求成对的数据,即若干个个体中的个体要有两种不同的观测值。例如每个学生的数学和语文成绩;每个学生的智力分数与学习成绩;每个学生的英语听力水平和口语水平。(1)积差相关(积矩相关)皮尔逊(Pearson)(英)二十世纪初提出的,因而也叫皮尔逊相关1.适用条件连续变量成对出现正态分布:要求总体正态,至于用来计算的样本数据,并不要求一定为正态分布。2.定义公式
3.实例分析(身高与体重相关.sav)例如,被试的身高(cm)和体重(公斤)均服从正态分布,求其相关密切程度:(r=0.792)
被试1234567
身高(cm)170173160155173188178
体重(kg)50454744505350被试
8910
身高(cm)183180165
体重(kg)495245
(2)spearman等级相关(见学习与纪律相关分析.sav)1.适用条件两列变量都是等级或顺序变量的时候。
2.计算公式
D为等级相减之差例:学习
12345678910
纪律
SPSS10.0采用窗口标签把数据窗设置成两种形式:一种是数据窗口,用于输入与编辑数据,一种是变量窗口,用于编辑与修改变量。在左下角以Dataview和Variableview的字样出现。
因而在进行描述统计分析之前,必须先了解数据文件的建立。一、数据文件的建立要建立一个数据文件,一般先在变量窗口定义变量及其属性,然后在数据窗口录入数据,最后对数据文件保存命名(扩展名为*.sav)。也可以将数据保存为其他格式的数据文件,如数据库文件、Excel文件等。例如:“丈夫教育水平”数据文件的建立。其步骤为在变量窗口中建立变量,然后在数据窗口中输入数据,最后保存即可。数据文件建立以后,接下来就可以对这批数据进行处理和分析了。如:[1].对“丈夫教育水平”进行高低顺序排列
[2].绘制其直方图,并用描述统计量对其分布进行描述。其操作如下:问题[1]:data/SortCases对观测值进行排序问题[2]:Analyze/descriptivestatistics/frequencis
描述统计分析中的频数分析对于问题[2],如果不绘制直方图,其描述统计量也可以在Analyze/descriptivestatistics/descriptives中进行。二、描述统计分析实例讲解(一)统计分析图及统计量计算研究问题[1]:大五人格调查中浙江省大学生样本的年级分布图研究问题[2]:大五人格调查中浙江省大学生样本的学校百分比结构图研究问题[3]:计算出大学生在大五人格问卷中的总分,绘制其分布图,并用相应的统计量加以描述问题[1][2]的操作:Analyze/descriptivestatistics/frequencis
描述统计分析中的频数分析问题[3]设计到两个操作1.求量表总和:Transform/compute中求和函数完成。2.Analyze/descriptivestatistics/frequencis
描述统计分析中的频数分析(二)相关分析(Analyze/Correlate/Bivariate)对于相关分析,我们先计算出相关系数,还必须说明这个相关系数有无实际意义。相关系数统计意义的检验:由于抽样误差的存在,样本中两个变量间相关系数不为0,不能说明总体中这两个变量间的相关系数不为0,因此相关系数计算出来能否说明变量之间的关系密切程度还需要进行显著性检验(TestofSignificance)。
如果在相关系数的右上角标有*或其sig值小于0.05,则表明这个相关系数有实际意义。研究问题[1]:利用“身高与体重相关.sav”计算其相关系数。(Pearson)研究问题[2]:利用“学习与纪律相关.sav”计算其相关系数。(Spearman)练习:(bigfive1.sav)[1]计算大学生在各分量表上的总分[2]计算个各分量表的描述统计量[2]计算大学生在大五人格利他性和道德感两个分量表上的相关。(注:各分量表包含的题目见“大五”人格问卷.doc)第二个专题:推断统计分析及其应用推断统计是以描述统计为基础,以解决由局部到全体的推论问题,即通过对一组统计量的计算分析,推论该组数据所代表的总体特征。推断统计一般包括总体参数的估计和假设检验这两方面的内容。假设检验是一种统计的推理过程。其方法是首先对于所研究的问题建立假设,但检验时并不直接验证它,而是提出与此假设对立的假设,然后通过论证给出相应的显著性水平。
第一章平均数的假设检验(CompareMeans)心理与教育研究中,许多情况下都不可能对总体中的所有成员进行研究,这样就需要抽取样本,即从总体中随机抽取一定数量的样本,进行研究来推论总体的特征。均值比较就是看两个样本中某变量均值不同,其差异是否具有统计意义,即能否通过样本平均数之间的差异去推论总体之间确实存在差异.
如浙江省大学生在大五人格各分量表得分上有无性别差异?要解决这个问题,其步骤为:建立假设——检验假设——作出结论。一、关于假设:无性别差异
:有性别差异
虚无假设是统计推论的出发点,人们在进行研究时,总是从虚无假设出发,通过计算某一检验统计量来推翻虚无假设,从而得到希望证实的研究假设二、统计决策的原理
统计决策的原理是“小概率事件原理”。
在一次随机抽样中小概率事件不会也不可能发生,小概率事件的小概率记为,称为显著性水平(Levelofsignificant),所谓显著性水平就是研究者拒绝真的虚无假设之最大概率值,通常取0.10,0.05,0.01三个值比较多。
在spss中,如果sig<0.05或带有*(在文章中写作p<0.05),就可以拒绝原假设,从而接受研究假设。三、检验统计量值(t检验与t值)平均数差异的检验均可以采用t检验,t值的计算为:t=(平均数之差)/SEt值计算出来后,应该与临界值比较,如果t值大于临界值,此时sig<0.05(p<0.05),则拒绝原假设,接受研究假设,即认为平均数之间存在显著性差异。四、平均数假设检验的内容(Analyze/CompareMeans/)(一)单总体平均数差异显著性检验(onesamplettest)(二)两独立总体平均数差异显著性检验(independent-samplesttest)(三)两相关总体平均数差异显著性检验(paired-samplesttest)(四)单因素方差分析(One-WayANOVA)(一)单总体平均数差异显著性检验(onesamplettest)
这种检验是把一个样本平均数与总体平均数比较,检验其是否有显著性差异。(1)研究问题[1]:假定大五人格适应性分量表常模分为15,则浙江省大学生适应性与常模比较有无显著性差异?(原假设为:无显著差异)(2)操作过程:Analyze/comparemeans/OnesampleTtest把适应性从变量框中从入testvariable框中,在testvalue中输入15,15即为常模分数或称总体平均数。(3)结果说明:表格一是样本的描述统计量(样本容量、样本平均数、样本标准差、标准误);表格二是检验的结果(检验统计量t值、显著性水平sig)。结论为:t=-16(p<0.01),拒绝原假设,即认为浙江大学生在适应性上与常模有显著性差异。注:t=(样本平均数-总体平均数)/标准误=(13.01-15)/0.12=-16(二)两独立总体平均数差异显著性检验(independent-samplesttest)
这种检验是通过对两个独立样本的平均数的比较,看其来自的两个独立总体平均数是否有显著性差异。(1)研究问题[2]:大学生在大五人格的五个方面有无性别差异?(注:目的是通过浙江省大学生样本平均数检验大学生总体平均数有无性别差异,用性别这个变量把大学生分成独立的两部分。)(2)操作过程:Analyze/comparemeans/Independent-samplesTtest,把表示五个分量表的变量送入testvariable中,把sex变量送入groupingvariable中,点击definegroups按钮定义组别。(3)结果说明:表格一是两样本的描述统计量值(与前同);表格二是t检验的结果。这个结果需要分两步看,先看F检验(方差齐性检验)后面的sig,方差是否齐性决定了我们t检验的结果是看第一栏还是看第二栏。如果F值后面的sig<0.05,则表明方差不齐性,t检验的结果应该看第二栏的(如适应性:t=0.495,p>0.05;利他性:t=2.892,p<0.05),否则应该看第一栏的结果(如社交性、开放性、道德感)。经过检验发现大学生在利他性上存在性别差异,而在其他方面均不存在性别差异。如果1表示男大学生生,2表示女大学生的话,则男大学生倾向于高利他性,即信任的、谦虚的、合作的、坦白的、不喜冲突的;女大学生倾向于低利他性即怀疑的、攻击性的、坚韧的、自私自利的。(三)两相关总体平均数差异显著性检验(paired-samplesttest)
这种检验是通过对两个配对或相关样本的平均数的比较,看其来自的两个配对或相关总体平均数是否有显著性差异。(1)研究问题[3]:大学生在利他性与道德感分量表上得分有无显著性差异。(同一批人在两不同分量表上的得分是一一对应的。)(2)操作过程:Analyze/comparemeans/Paired-samplesTtest,同时选中利他性与道德感变量送入pariedvariable中。(3)结果说明:表格一是描述统计量的值;既然是相关样本则表格二就是相关系数的计算(r=0.642,p<0.01),表明两变量是相关的;表格三就是相关样本的t检验结果(t=2.059,p<0.05)。请你们解释!(四)单因素方差分析(One-WayANOVA)
T检验解决的是两个批平均数的比较问题,在教育和心理研究中会遇到比较三组、四组或多组平均数问题,这时如果用T检验,则需进行多次的比较如四个平均数的比较,如果用T检验则需要进行6次,比较烦琐且容易犯错误,而如果采用方差分析就可以一次性比较出多个平均数之间有无显著差异。方差分析又称变异数分析(AnalysisofVariance),其主要功能在于分析实验数据中不同来源的变异对总变异的贡献大小,从而确定实验中的自变量是否对因变量有重要影响。方差分析是检验多个样本均值间差异是否具有统计意义的一种方法。因此方差分析的目的就是多个平均数的比较(显著性检验)。(1)研究问题[4]:大学生在大五人格五个方面有无年级差异?(有四个年级,则是四个平均数的比较问题)
在具体操作之前,先了解一些方差分析的术语。1.因素(factor)与因素实验设计(factorexperimentaldesign)
因素指研究者在实验中感兴趣的一个变量(自变量),研究者通过操纵、改变它,来估计它对因变量(dependentvariable)的影响。变量的每个特定的值叫因素的水平(level),如因素性别有两个水平(男、女);本例中年级即是一个因素(自变量),该因素有四个水平(1,2,3,4分别表示大一、二、三、四)。因素设计通常指多于一个因素的实验设计,如一个含有三个因素、每个因素有两个水平的实验设计,称2×2×2三因素设计。2.处理(treatment)与处理水平的结合(treatmentcombinations)
处理与处理水平的结合都是指实验中一个特定的、独特的实验条件。如一个实验设计中有A和B两个因素,每个因素有两个水平,则实验中有4种处理水平的结合A1B1、A1B2、A2B1、A2B2。
在单因素实验设计中,自变量的每个水平就相当于一个实验处理。例如本例有四个实验处理。
3.主效应(maineffects)与交互作用(interaction)
实验中由一个因素的不同水平引起的变异叫因素的主效应。实验中有几个因素则需检验几个主效应。
在多因素实验中,研究者需要估计各因素的不同水平之间的复杂变化关系。当一个因素的水平在另因素的不同水平上变化趋势不一致时,则称两个因素之间存在交互作用。当一个因素的水平在另一个因素的不同水平上变化趋势一致时,表明两个因素是相互独立的,即不存在交互作用。如以性别与年级两个因素,对大五人格各层面进行差异性检验。4.处理效应(treatmenteffect)和误差变异(errorvariance)
处理效应指实验中的总变异中由自变量引起的变异,主效应、简单效应、交互作用都是处理效应。误差变异指总变异中不能由自变量或明显的无关变量解释的那部分变异。
5.方差分析的原理方差分析要解决的是自变量对因变量有无显著影响。在本例中自变量为年级,因变量为被试在分量表上的得分,以年级为自变量,把分数分成四组(四个实验处理),如果经过检验,四个平均数之间有显著差异,则结论为自变量对因变量有显著影响,即年级这个自变量存在主效应。如何进行检验呢?这需要对我们的数据(随机变量)进行分析。我们可以将实验数据的总变异分解为不同来源的变异,并依据不同来源的变异在总变异中所占比重对造成数据变异的原因作出解释。总体上来说,可以将实验数据的变异分为两块(或者说数据之所以存在变异性,来自于两方面的原因),一为自变量的影响(表现为组间变异),一为误差因素的影响(表现为组内变异)这里变异均采用方差来表示。如果组间变异远远大于组内变异(采用方差之比,F检验),则表明因变量(实验数据)的变化性主要来源于自变量,即存在主效应,各平均数之间存在显著性差异;反之,则表明不存在主效应。结合本例进行讲解方差分析的原假设为:年级不存在主效应(各年级平均数无显著性差异)。(2)操作过程:Analyze/CompareMeans/One-WayANOVA,把表示五个分量表的变量送入因变量列框(dependentlist),把表示因素或自变量的grade送入factor因素列框中;点击posthoc按钮,在多重比较中选择scheffe或tukey法;点击opitions按钮在statistics中选择第三项(方差齐性检验),选择meansplot.(3)结果说明:表格一是方差齐性检验的结果,sig>0.05表明适合进行方差分析,否则理论上不能进行方差分析.表格二就是方差分析的结果,它把对平均数的比较转化为方差之比,F值就是组间方差除以组内方差的结果,如果其后的sig<0.05则表明拒绝原假设,即认为各年级平均数存在显著性差异.因此我们的结论为:大学生在适应性(F=4.012,P<0.001)、开放性(F=5.633,p<0.001)、利他性(F=6.602,p<0.001)上存在年级差异,而在社交性和道德感上不存在年级差异。既然存在年级差异,那我们还想知道年级差异的实质,即进一步进行具体的分析。这就需要看表格三的结果了。表格三是平均数多重比较的结果,反映的是到底在哪些年级之间存在年级差异。只要看存在差异的分量表的比较即可。具体结论为在适应性上(2>1,p<0.05)、在开放性上(2>1,p<0.01;3>1,p<0.05)、在利他性上(2>1,p<0.01;3>1,p<0.05)。具体的解释可以参照“大五”人格量表的常模自己进行阐述。结果解释除上述外还可以附上各年级在分量表上的平均数描绘图。第二章一元线性回归分析(Analyze/Regression/Linear)一、回归分析的意义变量之间的关系从数量角度看,有确定性关系(函数关系)和不确定性关系。确定性关系如自由落体运动:(S表示距离,t表示时间);非确定性关系则不然,例如年龄与身高或身高与体重的关系不能找到一个函数关系来表达。表示变量之间的不确定性关系以及关系的密切程度,统计学上可以用相关关系来表达。相关系数能够对相关的密切程度作一总的定量描写,但对于不确定性关系的变量,如何通过自变量的值去估计和预测因变量的发展变化,相关系数却无能为力。如果把其中的一个或一些因素作为自变量,而另一些随自变量的变化而变化的变量作为因变量,研究他们之间的非确定性因果关系,看自变量对因变量是否有显著的预测作用,这种分析就称为回归分析。回归分析的目的就是确定变量之间数量关系的可能形式,并用一个数学模型来表示这种关系形式。二、一元线性回归的模型及模型的建立一元线性回归研究的是具有线性相关关系的因变量和一个自变量之间的回归问题。其模型为:其中称一元线性回归方程,称为变量y对变量x的一元线性回归方程。这个模型是针对总体而言的,但实际上我们经常调查的仅仅是从总体中抽取的样本,因而样本的回归方程为要建立回归方程实际上就是求a和b的值,其中a为常数,b为自变量的回归系数。如研究问题[1]:以大五人格总分为因变量,适应性分量表为自变量,建立一元线性回归方程,考察适应性分量表对总量表的贡献。就这个问题而言就是要建立一个这样的方程:sum=a+b适应性。从理论上讲,给出一组数据都能求出一个回归方程,但是所求出的方程有无实际使用价值,必须经过统计检验,这就是回归方程的有效性检验。经检验不具备有效性的回归方程是不能使用的。在回归分析中应用方差分析法对所建立方程进行有效性检验。
三、回归方程的有效性检验回归方程有效性检验的原假设是:所求回归方程无效。假设的实际上是由自变量决定的回归方差并不显著大于剩余方差。但是如果经过F检验发现回归方差远远大于剩余方差(由误差解释的方差)则必须拒绝原假设,即所建立的回归方程有效。SPSS结果体现在方差分析表中。
四、回归方程有效性高低的指标一元线性回归分析所建立的回归方程经方差分析后被判定为具有有效性,仅仅能说明这个回归方程有别于无使用价值的方程,并未指出这个方程有效性高到什么程度。因此还必须找到衡量回归方程有效性高低的指标。在回归分析中衡量回归方程有效性高低的指标称决定系数或测定系数在一元线性回归中决定系数是因变量与自变量积差相关系数的平方。回归分析是相关分析的继续与发展,回归分析对所建立回归方程进行的有效性检验,其本质还是对变量相关显著性的检验。决定系数表明了自变量对因变量的解释量,或者说因变量中有百分之多少是由自变量决定的,当然其值越大越好。结合实例进行讲解(1)研究问题见(2)操作过程:我们要建立的是线性回归方程,那么在分析之前有必要看看因变量与自变量之间是否具有线性关系,作出一散点图便知,其操作为:Graphs/scatter/选择simple点击Difine按钮,把sum送入y轴,适应性送入x轴即可。通过散点图可以看出两变量之间具有很好的线性关系,因而可以进一步进行回归分析。
Analyze/regression/linear,把sum作为因变量送入Dependent框中,适应性作为自变量送入independent框中,点击save,在predictedvalues中选中unstandardized和standardized要求建立含有未标准化和标准化的回归系数的回归方程。其他只要按默认的即可。(3)结果说明:表格一表明我们是采用enter法进行的回归分析。接下来按照写进论文中的先后顺序一一报告:我们所建立的回归模型为:未标准化模型为,sum=14.211+3.253适应性(p<0.001);标准化回归模型为sum=0.785适应性(p<0.001),数据是标准化的分数。经过检验这个回归方程是有效的(表格三方程有效性检验的方差分析表:F=1200.968,P<0.001)其有效性指数为0.616。第三章列联表的独立性检验(Analyze/descriptivestatistics/crosstabs)一、列联表的独立性检验指的是:对一批观测数据进行双向多项分类后,检验这两类特征之间是独立无关的还是具有相依相从、连带相关。它是对离散变量的检验(计数数据)。如研究问题:在社交性方面,得分为10(其对应的常模分为35)是低社交性(内向),得分为22(其对应的常模分为65)是高社交性(外向),问大学生社交性方面与性别有无关系。二、问题分析:这个问题要解决的是,高社交性、低社交型、中间型的人数与性别有无关系。因而是对各类型人数多少与性别有无关系的检验。三、检验的原假设为:社交性高低与性别无关。四、检验统计量值的计算
=其中是实际观测数据,是理论次数。因而检验是衡量实际测量数据与理论数据差异程度的指标。结合实例进行讲解(1)研究问题见(2)操作过程:首先必须对社交性变量进行重编码即低于10分的为低社交型用1表示,高于22分的为高社交型用3表示,其他为中间型用2表示。具体操作为:Transform/Recode/IntodifferentVariable,重编码为新变量shej。接下来再进行独立性检验:Analyze/descriptivestatistics/crosstabs,把sex送入row框中,shej送入column中;点击statistics选择chi-square(卡方值);点击cells选择observed(观测值)和expected(理论值)。(3)结果说明:表格一表明有效的数据个数即样本容量;表格二是性别不同各社交性类型人数的观测次数和理论次数;表格三就是用公式计算出来的卡方值=6.978,sig=0.323即p>0.05,因而接受原假设,认为社交性各类型人数的多少与性别无关。练习:可以自己检验大五人格其他分量表上,大学生的人格类型与性别有无关系,与年级有无关系。(人格类型的划分可以依据大五人格因素得分转换表)第三个专题多元统计分析及其应用主要研究超过两个因素的教育与心理的研究和实验。在教育与心理研究和实验中,可能会受到多个因素的影响,找出主要因素,相近或相关的因素的合并或归类,则是多元统计学的主要任务。多元统计学的主要内容有:多元方差分析、多元回归分析、因素分析。第一章多元方差分析(Analyze/GeneralLinearModel/Univariate)之前我们已经了解了单因素的方差分析其研究问题为:大五人格个各层面有无年级差异?在这里只有年级一个自变量(因素),因素有四个水平。因而是单因素方差分析。如果研究的因素不止一个,则是多因素方差分析的问题了。假如现在研究问题为:同时研究性别、年级这两个自变量(因素)对大五人格各层面的影响。
问题分析:在这个研究中,有两个自变量,一为年级(有四个水平),另一为性别(有两个水平),则称为4x2的两因素实验设计的方差分析。多因素的方差分析除研究因素的主效应外(有多少个因素则需进行多少个主效应检验),更关注的是因素之间有无交互效应。结合实例进行讲解(1)研究问题:大五人格各层面在性别和年级方面有无交互效应。检验的原假设为:无性别主效应无年级主效应性别与年级无交互效应(2)操作过程(以适应性为例,数据见bigfivecopy.sav):Analyze/GeneralLinearModel/Univariate,把是因变量适应性送入dependent框中,把自变量sex和grade送入fixedfactors中;点击Model在模型选择中有两项:fullfactorial全模型表示要分析出各个因素是否具有主效应,另外还要分析因素之间的交互效应,Custom自定义模型,可以选择自己想要分析的效应。由于性别差异及年级差异的检验我们在上讲中已经分析过,故选择Custom,仅仅分析两个因素之间的交互效应。点击plots,画出两因素之间的交互效应图。(3)结果说明:表格一为样本容量的说明;表格二为交互效应F检验的结果,sex*grade后的值为F=3.948,sig=.000即p<0.001,结论为拒绝原假设,认为存在交互效应。这也可以通过下面的图来反映。在因素实验中,一个因素的水平在另一个因素的某个水平上的变异叫简单效应(simpleeffects)。当方差分析中发现一个两次交互作用时,需要进一步做简单效应检验,以说明两个因素之间交互作用的实质。通过上图可以看出,各年级适应性水平在性别为1的大学生中存在显著性差异。经过分析(Data/selectcases中选择样本ifsex=1,对适应性进行年级的单因素方差分析)发现,4年级和2年级性别为1的大学生在适应性上得分显著高于1年级的大学生。为什么与3年级无显著性差异呢?这是因为与样本容量有关。练习:检验在其他分量表上是否存在性别与年级的交互作用?第二章多元线性回归(Analyze/Regression/Linear)根据多个自变量的最优组合建立回归方程来预测因变量的回归分析称为多元线性回归分析。多元线性回归分析的模型为:偏回归系数表示在控制其他自变量的情况下,某一个自变量变化引起因变量变化的比率。多元回归方程建立后,也需对方程有效性检验,采用的也是F检验。也要给出方程有效性高低的指标即多元决定系数与一元线性回归相比,多元线性回归还需明白一个重要概念共线性问题:在回归方程中,虽然各自变量对因变量都有意义,但某些自变量彼此相关,即存在共线性的问题。因此,需要对回归方程中的变量进行共线性(collinarity)诊断,所谓共线性指的是由于自变量间的相关太高,造成回归分析之情境困扰。两变量间的相关系数越接近1,表明变量间的共线性越强。在回归分析中,最好先呈现预测变量间相关矩阵,以探讨变量间的相关情形,如果某些变量间的相关系数太高,可考虑只挑选其中一个较重要的变量投入多元回归分析。自变量间是否存在共线性问题,可以由以下指标判断:1.容忍度(Tolerance)。容忍度的值界于0至1之间,如果一个自变量的容忍度太小,表示此变量与其他自变量间有共线性问题。2.方差膨胀因子(varianceinflationfactor;VIF)。为容忍度的倒数,它的值越大,自变量间存在共线性的可能性越大。线性回归的数据要求:自变量与因变量应该是数值型变量(连续型变量)。象宗教、研究方向、性别等分类变量,需要被重新编码为哑变量(虚拟变量)或者其他类别的对比变量。实例讲解(1)研究问题:探讨大五人格适应性与社交性对sum的贡献。(五个层面对其贡献肯定为1)回归分析一般用同一批被试在其他相关量表上的表现为因变量,而不在同一量表内部进行,这里仅仅作为举例需要。如人格对业绩的预测等等。(2)操作过程:Analyze/Regression/Linear,其操作与前面一元回归相同,只是在Independents中多了一个自变量,在statistics中选择共线性诊断collinearitydiagnostics。(3)结果说明:表四coefficients中各回归系数均显著:未标准化,常数项为5.749、适应性的回归系数为1.755,社交性的回归系数为2.389,因此回归方程为sum=5.749+1.755适应性+2.389社交性;标准化回归方程为sum=0.424适应性+0.597社交性。回归方程是有效的(表三F=1989.876,p<0.001)。两自变量对因变量的联合解释量为0.842(见表二)。第三章因素分析(Analyze/datareduction/factor)在问卷质量分析中讲解。第四个专题:问卷的质量分析问卷的质量分析包括项目分析、效度分析和信度分析。(对工作倦怠感问卷进行质量分析。数据文件为“工作倦怠感.sav”)该问卷由22个项目组成,其中9-16题为反向计分题(从反面提问,分数强弱方向与其他题目相反),对其质量分析包括以下几个方面(1)这22个题目是否都有效(有区分度)?;(2)如果有效,则这22个题目测量了工作倦怠感的哪些方面(问卷的结构如何?)或者说可以用几个因素来解释该问卷?;(3)总问卷及分问卷(每一个因素所包含的题目组成一个分问卷)的信度如何?
显然对问题(1)要进行的是项目区分度分析;对问题(2)要进行的是问卷的结构效度分析(因素分析);对问题(3)要进行的是问卷的信度分析。由于9-16题为反向计分题,故在具体分析之前必须对其进行重编码。transform/recode/intosamevariable)把a9-a16送入右边的框,点击oldandnewvalue按钮,在oldvalue的value中分别输入4、3、2、1,对应的在newvalue的value中输入1、2、3、4,每一一操作一次,均要点击一下add键。一、项目分析(区分度分析)进行项目分析的目的是删除没有区分力,效度不高的项目。项目分析可分为质的分析和量的分析,所谓质的分析是指分析测题的内容和形式。量的分析是采用统计方法来分析试题的质量,在设计态度量表时,剔除那些不合要求的项目,这样才能提高整个量表的信度和效度,因此,可以用项目分析的结果来作为筛选和修改测题的依据。(一)项目分与总分相关法也可以用来测量量表的内容效度。具体做法是计算每个项目分数和总分的相关,如果相关系数不显著,表明该项目鉴别力低,应剔除;如果相关系数的显著程度高,则该项目的鉴别力大,应保留,也可认为量表的效度越高。其操作与相关分析中的操作相同。当然求相关之前需求出量表总分。经过分析发现22道题目与总分相关均显著,故均有较高的区分度,可以保留。(二)高低组平均数差异检验法项目分析即在求出每一个题项的“临界比率”(criticalratio;简称CR值),其求法是将所有受试者在预试量表的得分总和依高低排列,得分在前25%或27%者为高分组,得分在后25%或27%者为低分组求出高低二组被试在每题得分平均数差异的显著性检验,如果题项的CR值达到显著性水平(<0.05或<0.01),即表示这个项目能鉴别不同受试者的反应程度。因此,可以看每个项目有无达到显著性水平而作为该题是否删除的条件。操作过程:
1.对被试总分按高到低排序(Data/sortcases),把高分组即从最高分开始总人数25%处(100*25%)被试对应的分数56分记下。
2.再对被试总分按低到高排序,把低分组即从最低分开始总人数25%处(100*25%)被试对应的分数
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 2026年二级建造师水利水电实务真题及答案解析
- 2026年六月市场营销策划活动实施方案
- 2026年人教版三年级英语下册专项训练卷
- 2026年初中美术创作专项训练
- 六年级下册数学北师大含答案 探索规律
- 中国材料考试题目与答案解析
- 趾骨骨折相关试题及参考答案
- 五年级下册数学北师大含答案 分数乘法(三)2
- 《智慧工地建设与评价标准》
- 2026年探索酒店的未知感营造方案
- 2025年城区小学数学教师选调进城考试试题(含答案)
- 皋埠中学分班考试试卷及答案
- 心理咨询师伦理培训课件
- 滴滴租车的电子合同范本
- 内热针治疗技术临床应用规范
- GB/T 1232.2-2025未硫化橡胶用圆盘剪切黏度计进行测定第2部分:初期硫化特性的测定
- JJG633-2024气体容积式流量计检定规程
- 骨人体解剖生理学讲解
- 高中常用成语积累800个
- 企业绿色发展管理制度
- 光伏能源管理合同三方协议书模板(2篇)
评论
0/150
提交评论