2023考研心理学专业基础综合心理统计与测量真题答案_第1页
2023考研心理学专业基础综合心理统计与测量真题答案_第2页
2023考研心理学专业基础综合心理统计与测量真题答案_第3页
2023考研心理学专业基础综合心理统计与测量真题答案_第4页
2023考研心理学专业基础综合心理统计与测量真题答案_第5页
已阅读5页,还剩37页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

2023考研心理学专业基础综合心理统计与测量练习题答案一、单项选择题:1~65小题,每小题2分,共130分。下列每题给出的四个选项中,只有一个选项是符合题目要求的。1.为了研究儿童亲社会行为的发展,研究者按年龄将儿童分为:3岁组、6岁组、9岁组,分别观察各组儿童在游戏中的亲社会行为频率。这种研究设计是()A.横断设计B.纵向设计C.交叉序列设计D.微观发生设计答案:A。解析:横断设计是指在同一时间点上选取不同年龄组的被试进行研究,比较不同年龄组被试在某一变量上的差异,从而得到发展规律,符合题干中同一时间选取不同年龄组的描述。纵向设计是对同一批被试在不同时间点进行追踪研究;交叉序列设计是横断与纵向设计结合,在横断基础上对不同组进行追踪;微观发生设计是对发生变化的个体进行高密度反复观察,分析变化过程,因此本题选A。2.下列选项中,属于construct的是()A.身高B.体重C.智力D.反应时答案:C。解析:构念(construct)是指心理学理论中抽象出来的、无法直接观察到的内在概念,需要通过间接的方式测量,智力属于抽象的心理构念,无法直接观测。而身高、体重、反应时都可以通过工具直接测量得到具体数值,属于可观测变量,因此本题选C。3.研究者想要考察三种学习方法的学习效果,招募了60名被试,按性别1:1比例匹配,将每种学习方法分配给20名被试,男女各10名,这种设计是()A.完全随机设计B.随机区组设计C.拉丁方设计D.重复测量设计答案:B。解析:随机区组设计是将被试按照某个额外变量(如性别)划分成不同区组,每个区组内的被试接受所有处理,或者每个区组内被试随机分配到不同处理,题干中按照性别匹配区组,每个性别区组内被试分配到不同学习方法,符合随机区组设计的特征。完全随机设计是将所有被试完全随机分配到不同处理,不进行区组匹配;拉丁方设计用于控制两个额外变量,每个处理在行和列中都仅出现一次;重复测量设计是所有被试都接受所有处理,因此本题选B。4.一组数据呈负偏态分布,则该组数据的平均数、中位数、众数的关系是()A.M<Md<MoB.Md<M<MoC.Mo<M<MdD.M<Mo<Md答案:A。解析:负偏态分布(左偏态)中,长尾向左延伸,极端小值拉低了平均数,平均数位置最靠左,中位数次之,众数位置最靠右,因此三者关系为平均数(M)<中位数(Md)<众数(Mo)。正偏态分布是Mo<Md<M,因此本题选A。5.有一组数据:34,35,36,37,38,39,39,40,41,42,其中位数是()A.38B.38.5C.39D.39.5答案:B。解析:中位数计算时,当数据个数n为偶数时,中位数为第n/2个数和第(n/2)+1个数的平均数。本题共10个数据,从小到大排序后,第5个数是38,第6个数是39,中位数为(38+39)/2=38.5,因此本题选B。6.假定X服从正态分布N(50,25),那么P(X<40)等于()A.Φ(2)B.1-Φ(2)C.Φ(10)D.1-Φ(10)答案:B。解析:正态分布标准化,Z=(X-μ)/σ=(40-50)/5=-2,因此P(X<40)=P(Z<-2)=Φ(-2)=1-Φ(2),因此本题选B。7.一个实验有三组被试,每组被试10人,用方差分析处理数据,其自由度是()A.组间自由度2,组内自由度27B.组间自由度3,组内自由度27C.组间自由度2,组内自由度29D.组间自由度3,组内自由度29答案:A。解析:方差分析中,组间自由度dfB=k-1,k为处理组数,本题k=3,因此dfB=3-1=2;总自由度dfT=N-1,N为总人数,N=3×10=30,因此dfT=29;组内自由度dfW=dfT-dfB=29-2=27,因此组间自由度2,组内自由度27,本题选A。8.在一元线性回归中,判定系数R²和相关系数r的关系是()A.R²=rB.R²=r²C.R²=√rD.R²=1-r²答案:B。解析:一元线性回归中,判定系数是回归平方和占总平方和的比例,等于两个变量相关系数的平方,即R²=r²,因此本题选B。9.有一个2×3的实验设计,第一个因素是被试间变量,第二个因素是被试内变量,做方差分析的时候,第一个因素的误差自由度是20,那么总人数是多少()A.21B.22C.23D.24答案:B。解析:对于混合设计方差分析,被试间因素A有a个水平,被试内因素B有b个水平,每个A水平下有n个被试,那么被试间部分的自由度:A的自由度dfA=a-1,被试误差自由度dfA残差=a(n-1)=a×n-a。本题中第一个因素A(被试间)a=2,误差自由度dfA残差=20,代入得20=2(n-1),解得n-1=10,n=11,即每个A水平下有11名被试,总人数为a×n=2×11=22,因此本题选B。10.从正态总体中抽样,样本容量增加,下列说法正确的是()A.样本方差增大B.样本均值的标准误增大C.总体方差的置信区间宽度变窄D.总体均值的置信区间宽度变宽答案:C。解析:当样本容量n增加时,标准误SE=σ/√n减小,因此B选项错误。标准误减小,总体均值的置信区间宽度为2×zα/2×SE,宽度会变窄,因此D错误。样本方差是总体方差的无偏估计,样本容量增加不会改变样本方差的期望,因此A错误。总体方差的置信区间为((n-1)S²/χ²α/2,(n-1)S²/χ²1-α/2),n增大时,(n-1)增大,χ²α/2和χ²1-α/2也增大,区间的宽度会随n增大而变窄,因此本题选C。11.真分数理论中,信度系数是()A.真分数方差与观测分数方差的比B.观测分数方差与真分数方差的比C.真分数方差与误差方差的比D.误差方差与观测分数方差的比答案:A。解析:根据真分数理论,观测分数X=T+E,方差关系为Sx²=St²+Se²,信度系数rxx=St²/Sx²,也就是真分数方差与观测分数方差的比值,因此本题选A。12.下列属于常模参照测验的是()A.教师资格证合格考试B.高考C.驾照考试D.计算机等级合格考试答案:B。解析:常模参照测验是将被试的分数与常模比较,以确定被试在群体中的相对位置,用于选拔和甄别,高考属于选拔性考试,目的是区分考生的水平,属于常模参照测验。标准参照测验是将被试的分数与预先设定的绝对标准比较,判断被试是否达到某个标准,教师资格证合格考试、驾照考试、计算机等级合格考试都属于标准参照测验,以判断是否合格为目的,因此本题选B。13.如果一个测验的效度是0.64,那么测验的误差分数方差占观测分数方差的比例是()A.0.36B.0.64C.0.8D.0.2答案:A。解析:效度系数是真分数方差中,由预测效标方差解释的比例,也就是rxy²=0.64,表示效标效度为0.64,即有效变异占总变异的0.64,误差变异的比例就是1-0.64=0.36,因此本题选A。14.克伦巴赫α系数计算的是()A.重测信度B.复本信度C.分半信度D.同质性信度答案:D。解析:克伦巴赫α系数是计算内部一致性信度(同质性信度)的指标,适用于题型非对即错、多重计分的测验,衡量项目之间的一致性程度。重测信度是用同一测验前后两次施测的相关计算,复本信度是两个平行测验施测的相关,分半信度是将测验分成两半后两半分数的相关,因此本题选D。15.下列四种不同长度的量表,测量误差最小的是()A.10题B.20题C.30题D.40题答案:D。解析:根据斯皮尔曼-布朗公式,测验长度越长,信度越高,测量误差越小。题目数量越多,随机误差相互抵消,测量的标准误减小,误差越小,因此40题比题目少的量表误差更小,本题选D。16.某智力测验测得分数离差智商IQ=100+15Z,Z=(X-M)/S,如果一个被试的IQ是115,说明他在群体中比多少人得分高()A.50%B.68%C.84%D.95%答案:C。解析:离差智商服从正态分布,IQ=115,μ=100,σ=15,所以Z=(115-100)/15=1,查正态分布表,P(Z<1)=0.84,说明比84%的人得分高,因此本题选C。17.下列哪个量表是基于因素分析法编制的()A.MMPIB.EPQC.16PFD.SCL-90答案:C。解析:16PF(卡特尔16种人格因素测验)是卡特尔通过因素分析法,对人格特质进行因素分析筛选出16个根源特质后编制的。MMPI是基于经验效标法编制;EPQ是艾森克依据人格结构理论,通过因素分析也有参与,不过核心是理论推导,而16PF是典型的因素分析法编制,因此本题选C。18.衡量一个测验能否预测效标行为,这个效度是()A.内容效度B.构想效度C.效标效度D.表面效度答案:C。解析:效标效度(实证效度)是指测验对效标预测的有效性,即测验分数能够预测被试在效标行为上的表现程度,符合题干描述。内容效度是测验内容对欲测领域的代表性;构想效度是测验测到所要测量的心理构念的程度;表面效度是被试主观上觉得测验是否测量到想要测的内容,不属于正式效度指标,因此本题选C。19.项目区分度是0.5,那这个题目的难度是多少的时候区分能力最好()A.0.5B.0.6C.0.7D.0.8答案:A。解析:项目难度和区分度的关系是,难度越接近0.5,项目的区分能力越大,区分度越高,因此当难度为0.5时,区分能力最好,因此本题选A。20.下列属于测量信度影响因素的是()①被试团体异质性②测验长度③测验难度④间隔时间A.①②B.①②③C.①②④D.①②③④答案:D。解析:信度的影响因素包括:被试团体异质性,异质性越高,分数分布越广,信度越高;测验长度越长,信度越高,因此长度影响信度;测验难度过高或过低都会使得分数分布范围变小,信度降低,因此难度影响信度;重测信度和复本信度的间隔时间会影响信度,间隔太长被试变化大,间隔太短练习效应都会影响信度,因此四个都是影响因素,本题选D。二、多项选择题:66~75小题,每小题3分,共30分。下列每题给出的四个选项中,至少有两个选项是符合题目要求的。多选、少选都不得分。66.下列关于统计量和参数的说法正确的有()A.参数是描述总体特征的量B.统计量是描述样本特征的量C.参数通常是常数D.统计量是随机变量答案:ABCD。解析:参数是根据总体全部数据计算出来的,描述总体特征的数值,总体固定的话参数就是常数,一般未知;统计量是根据样本数据计算出来的,描述样本特征的数值,样本不同,统计量的取值就不同,因此统计量是随机变量,四个选项的描述都正确,因此本题选ABCD。67.下列属于非参数检验方法的有()A.符号检验B.秩和检验C.符号秩检验D.t检验答案:ABC。解析:非参数检验是不依赖总体分布、不对总体参数进行推断的检验方法,符号检验、秩和检验(曼-惠特尼U检验)、符号秩检验(威尔科克森符号秩检验)都属于非参数检验。t检验是参数检验,依赖总体正态分布的假设,对总体均值参数进行检验,因此本题选ABC。68.下列关于皮尔逊相关和斯皮尔曼相关的说法,正确的有()A.皮尔逊相关是线性相关系数B.斯皮尔曼相关是等级相关系数C.皮尔逊相关对分布有要求D.斯皮尔曼可以处理非线性相关的等级数据答案:ABCD。解析:皮尔逊积差相关要求两个变量都是正态分布的连续变量,衡量的是两个变量之间的线性相关程度,因此A、C正确。斯皮尔曼等级相关是计算两个等级变量之间的相关,属于非参数相关方法,不要求变量正态分布,可以处理等级排序的数据,即使变量间非线性关系,只要是等级顺序,也可以用斯皮尔曼相关计算,因此B、D都正确,本题选ABCD。69.下列关于标准误的说法,正确的有()A.标准误是样本统计量分布的标准差B.标准误反映抽样误差的大小C.标准误和样本容量成反比D.标准误越大,抽样误差越大答案:ABD。解析:标准误是样本统计量(如样本均值、样本比例)的抽样分布的标准差,衡量抽样误差的大小,标准误越大说明样本统计量离总体参数的平均偏差越大,抽样误差越大,因此A、B、D正确。标准误的大小,以均值标准误为例,SE=σ/√n,是和根号n成反比,不是和n直接成反比,因此C选项错误,本题选ABD。70.能够用来假设检验的P值法说法正确的有()A.P值是原假设成立的条件下,出现当前检验统计量以及更极端情况的概率B.P值越小,拒绝原假设的理由越充分C.P值小于显著性水平α,拒绝原假设D.P值越大,说明犯一类错误的概率越小答案:ABC。解析:P值的定义就是在原假设H0为真的情况下,观测到的检验统计量大于等于(或小于等于)当前观测值的概率,也就是出现当前结果以及更极端结果的概率,A正确。P值越小,说明H0成立时得到当前结果的概率越小,越有理由拒绝原假设,因此B正确。当P<α时,说明小概率事件发生,因此拒绝原假设,C正确。一类错误的概率α是研究者预先设定的,和P值的大小没有直接关系,P值是计算出来的,α是预先设定的显著性水平,因此D错误,本题选ABC。71.效度受到哪些因素的影响()A.测验信度B.测验长度C.被试特征D.效标测量的可靠性答案:ABCD。解析:效度是测量的有效性,信度是效度的必要条件,信度越高效度才可能越高,因此信度影响效度。测验长度增加可以提高信度,也会提高效度,因此长度影响效度。被试的异质性、能力分布都会影响测验分数的变异,进而影响效度计算,因此被试特征影响效度。效标效度中,效标本身测量的可靠性越高,才能得到更高的效标效度,如果效标测量本身误差很大,计算出来的效标效度肯定会偏低,因此效标测量的可靠性也影响效度,四个都正确,本题选ABCD。72.下列关于导出分数,说法正确的有()A.百分等级是导出分数B.标准分数是导出分数C.离差智商是导出分数D.T分数是导出分数答案:ABCD。解析:导出分数是通过原始分数转换得到的具有参照点和单位的分数,能够反映被试在群体中的位置。百分等级是原始分数转换来的,表示比多少百分比的人好;标准分数是Z=(X-M)/S转换得到;离差智商是标准分数线性转换得到;T分数也是标准分数的线性转换,即T=50+10Z,四个都是导出分数,因此本题选ABCD。73.下列属于测验标准化环节的有()A.测验内容标准化B.施测过程标准化C.评分记分标准化D.分数解释标准化答案:ABCD。解析:测验标准化是指测验的编制、施测、评分以及解释分数的全过程都遵循统一的标准,具体包括测验内容的标准化,保证所有被施测者测到相同内容;施测过程标准化,统一指导语、时间、环境;评分记分标准化,统一评分规则;分数解释标准化,统一的解释规范,四个都属于测验标准化的环节,因此本题选ABCD。74.下列信度系数中,可以用来反映测验内部一致性的有()A.克伦巴赫α系数B.折半信度C.复本信度D.重测信度答案:AB。解析:内部一致性信度反映的是测验内部题目之间的一致性,即题目是否测的是同一个心理特质,折半信度(分半信度)和克伦巴赫α系数都属于内部一致性信度的计算指标。复本信度反映的是两个平行测验之间的一致性,重测信度反映测验跨时间的稳定性,因此本题选AB。75.下列关于项目反应理论的说法,正确的有()A.项目特征曲线描述被试能力和项目答对概率的关系B.项目参数不变,不受被试样本影响C.能力参数不变,不受项目样本影响D.可以对不同项目的能力进行等值答案:ABCD。解析:项目反应理论中,项目特征曲线(ICC)就是以被试能力为横轴,答对该项目的概率为纵轴的曲线,描述了被试潜在能力水平和项目答对概率之间的关系,A正确。项目反应理论的一个重要特点就是项目参数(难度、区分度、猜测参数)不变,具有样本不变性,也就是项目参数估计不依赖于所抽取的被试样本,B正确。同样,被试能力参数的估计也不依赖于所选取的项目样本,具有参数不变性,C正确。基于项目反应理论,不同测验的项目可以等值,被试即使做了不同的项目,也可以估计出相同量表的能力水平,因此可以进行测验等值,D正确,本题选ABCD。三、简答题:76~80小题,每小题10分,共50分。76.简述统计检验中两类错误的含义,以及两类错误的关系,并说明控制两类错误的方法。答:(1)两类错误的含义在假设检验中,我们需要对原假设是否成立做出判断,由于样本的随机性,判断可能出现两种错误:①第一类错误和第二类错误是在不同前提下发生的,α是H0为真时犯错误的概率,β是H0为假时犯错误的概率,二者之和不为1,不能说α+β=1。②在其他条件不变的情况下,α和β不可能同时增大或同时减小。当α增大时,β会减小;当α减小时,β会增大。要想同时减小α和β,只有增大样本容量n。③在给定α的情况下,通过合理选择检验统计量,可以使得β尽可能小,也就是在控制第一类错误的前提下减小第二类错误的概率。一般来说,研究者更重视控制第一类错误,通常会预先设定显著性水平α来控制第一类错误的大小。(3)控制两类错误的方法①控制第一类错误:研究者可以根据研究需要,预先设定显著性水平α的大小,如果研究更担心犯第一类错误,就把α设定得更小,比如α从0.05调整为0.01,从而减小第一类错误发生的概率。②控制第二类错误:为了减小第二类错误,可以通过增大样本容量n来减小标准误,从而在给定α的情况下减小β;另外,合理确定实验设计,控制额外变量,减小随机误差,也可以减小第二类错误;此外,合理选择检验方法,采用更灵敏的检验方法(如参数检验比非参数检验更灵敏)也可以减小第二类错误。③要同时控制两类错误,最有效的方法是增大样本容量,样本容量增大后,抽样误差减小,α不变的情况下β可以减小,从而同时降低两类错误发生的概率。77.简述简单线性回归中对整体回归模型进行方差分析F检验的原理。答:简单线性回归中,F检验用于检验自变量X和因变量Y之间的线性关系是否显著,其原理基于平方和的分解与自由度分解,具体如下:(1)平方和的分解因变量Y的总变异(总平方和SST)可以分解为两部分:由回归直线解释的变异(回归平方和SSR)和不能由回归直线解释的残差变异(残差平方和SSE),即SST=SSR+SSE。具体来说:①总平方和SST=Σ(Y-Y拔)²,表示Y的观测值相对于Y均值的总变异。②回归平方和SSR=Σ(Yhat-Y拔)²,表示Y的预测值相对于Y均值的变异,是由X和Y的线性关系解释的变异,SSR越大,说明回归能解释的变异越多,线性关系越显著。③残差平方和SSE=Σ(Y-Yhat)²,表示实际观测值和预测值的偏差,是X无法解释的随机误差带来的变异。(2)自由度的分解总平方和对应的自由度dfT=n-1,其中n是样本容量;回归平方和的自由度dfR等于自变量的个数,简单线性回归中自变量个数为1,因此dfR=1;残差平方和的自由度dfE=n-2,总自由度满足dfT=dfR+dfE,即n-1=1+(n-2),符合分解关系。(3)F统计量的构造将回归平方和除以自由度得到均方MSR,残差平方和除以自由度得到均方MSE,即MSR=SSR/dfR=SSR/1=SSR,MSE=SSE/dfE=SSE/(n-2)。构造F统计量:F=MSR/MSE,当原假设“线性关系不显著”成立时,也就是总体回归系数β1=0,此时X对Y没有线性解释作用,MSR和MSE都反映随机误差,F服从自由度为(1,n-2)的F分布。如果β1≠0,也就是X和Y存在线性关系,那么MSR会远大于MSE,F值会大于F分布的临界值。(4)检验逻辑原假设H0:β1=0,即X和Y之间没有显著的线性关系;备择假设H1:β1≠0,即X和Y之间存在显著的线性关系。根据计算得到的F值,计算对应的P值,如果P小于预先设定的显著性水平α,或者F大于临界值Fα(1,n-2),则拒绝原假设,认为回归模型的线性关系是显著的,X能够显著预测Y;否则不拒绝原假设,认为没有足够证据说明线性关系存在。综上,简单线性回归的F检验通过比较回归解释变异和残差变异的相对大小,判断线性回归关系是否显著,本质就是对整体回归模型的有效性检验。78.简述内容效度和表面效度的区别与联系。答:内容效度是指测验题目对欲测的内容领域或行为范围取样的适当程度,也就是测验内容是否覆盖了想要测量的所有方面,代表性是否足够;表面效度是指被试或测验使用者主观上认为这个测验是否测量到了想要测量的特质的程度。二者既有区别也有联系:(1)二者的区别①定义性质不同:内容效度是一种客观的效度指标,反映测验实际测量的内容和欲测内容的吻合程度,需要由领域专家对测验题目和内容范围的符合程度进行系统的评估,是基于专业判断得到的客观效度,是衡量测验有效性的重要正式指标。而表面效度是一种主观感受,是被试或者非专业人员从表面上看测验是否符合测量目的,是主观评价,不属于正式的心理测验效度指标。②评估角度不同:内容效度是从测量的专业角度,评估测验内容对欲测领域的代表性,关注的是测验实际测到的内容是否符合测量目标;而表面效度是从被试的角度,关注测验看起来像不像测量某个特质,不涉及实际测量的结果是否准确。③对测验的要求不同:内容效度是所有测验都必须具备的效度,尤其是成就测验和职业资格测验,必须有良好的内容效度,否则测验就无效。而表面效度虽然不要求一定很高,但对于不同测验要求不同,比如有些测量人格的测验,为了避免被试的反应偏差,会故意降低表面效度,让被试不知道测验在测什么,而对于能力测验和成就测验,需要较高的表面效度来提高被试的作答动机。④评估方法不同:内容效度的评估方法主要有专家判断法、复本法、再测法、经验法等,需要系统的内容范围梳理和专家等级评定,过程严格;而表面效度只需要通过定性的主观判断即可,不需要专业的定量评估。(2)二者的联系①二者都涉及对测验内容的评价,都和测验题目的表面内容有关,良好的内容效度往往会伴随较高的表面效度,因为如果测验内容确实代表性足够,通常看起来也会符合测量目的。②表面效度会影响内容效度的实际效果,如果一个测验有良好的内容效度,但表面效度很低,被试会对测验产生抵触,不认真作答,导致测验结果不准确,从而降低实际的内容效度;而如果表面效度合适,能够提高被试的作答动机,使得被试反应更真实,有利于保证内容效度的实现。③对于许多公开的标准化测验,在保证内容效度的同时,也会调整测验题目,提高表面效度,让被试更容易接受测验,二者都是编制高质量测验需要考虑的因素。79.简述目标参照测验的项目分析和常模参照测验的项目分析的区别。答:目标参照测验(标准参照测验)是将被试的分数和预先设定的绝对标准比较,判断被试是否达到了预定的能力标准,目的是区分合格和不合格;常模参照测验是将被试和常模比较,确定被试在群体中的相对位置,目的是区分被试的能力差异。二者在项目分析上存在明显区别:(1)难度分析的差异①常模参照测验分析难度的目的是为了筛选出难度适中的项目,提高测验的区分度,因此常模参照测验要求项目的平均难度接近0.5,难度分布在0.5左右,这样才能最大化区分不同被试的能力差异。难度计算通常采用极端分组法,将被试按照总分分为高分组和低分组,难度P=(高分组通过率+低分组通过率)/2,计算通过率作为难度指标。②目标参照测验分析难度的目的是检验项目是否符合教学目标和内容要求,目标参照测验很多是成就测验,项目难度由内容和教学目标要求决定,不需要刻意调整难度到0.5。如果教学目标要求掌握的内容比较简单,那么难度大(通过率低)反而说明项目不合适,难度低(通过率高)才说明被试掌握了内容;如果内容难度高,那么通过率低是正常的。难度计算不需要极端分组,直接计算所有被试的通过率即可。(2)区分度分析的差异①常模参照测验的区分度是指项目区分不同被试能力水平的能力,核心是区分被试之间的个体差异,通常用项目得分和测验总分的相关,或者极端分组法计算鉴别指数,鉴别指数越大,区分度越好,常模参照测验要求区分度越高越好,一般要求鉴别指数大于0.2,过低区分度的题目会被删除。②目标参照测验的区分度核心是区分被试是否掌握了目标内容,也就是区分达标者和未达标者,不关注个体的相对差异,因此常用的区分度指标是D=P上-P下,其中P上是达标组通过率,P下是未达标组通过率,D越大说明项目越能区分达标与否。另外,目标参照测验还会用项目信息函数、Δ系数等方法,也会对比教学前后被试通过率的差异(即差异度)来分析项目的区分性,不依赖于总分的排序,因为目标参照测验不强调被试的相对排名。(3)分析目的不同①常模参照测验项目分析的目的是通过难度和区分度筛选项目,保证测验能够最大程度区分被试的能力差异,得到每个被试在群体中的相对位置,因此会删除难度过高过低、区分度差的项目,保证测验的信度和效度。②目标参照测验项目分析的目的是检验项目是否符合测量目标,判断项目是否能够有效区分达标和未达标,对于符合内容目标、即使难度较低,只要能够有效区分掌握和未掌握,就可以保留,不需要因为难度低、区分度(相对区分)低就删除。(4)误差分析和参数含义不同常模参照测验的项目参数(难度、区分度)依赖于被试样本,被试样本能力分布不同,项目的难度和区分度估计值也会不同;而目标参照测验更关注项目和目标的对应关系,参数估计更关注是否符合目标,对样本的依赖性虽然也存在,但核心关注的是项目对目标的匹配程度,而非对被试的相对区分能力。80.简述评分者信度及其估计方法。答:(1)评分者信度的含义评分者信度是指不同评分者对同一组被试的测验作答进行评分时,不同评分者之间评分结果的一致性程度。当测验是主观性试题,比如开放性题目、面试、作文题、投射测验,评分结果受到评分者主观判断影响的时候,就需要估计评分者信度,考察评分者之间随机误差的大小,评分者信度越高,说明评分的一致性越高,随机误差越小,测验分数越可靠。(2)评分者信度的估计方法①斯皮尔曼等级相关法:当只有两个评分者,每个被试得到两个评分者的等级分数或连续分数时,可以计算两个评分者评分之间的斯皮尔曼等级相关系数,相关系数越高,说明评分者信度越高。如果两个评分者对多个被试评分,将评分转换为等级,计算等级相关,就是评分者信度的估计值。如果是多个被试,评分是连续分数,也可以用皮尔逊积差相关计算两个评分者的相关,作为评分者信度。②肯德尔和谐系数(W系数):当有三个或三个以上的评分者,对多个被试进行等级评定时,用肯德尔和谐系数估计评分者信度。肯德尔和谐系数的取值范围是0到1,越接近1说明评分者之间的一致性越高,评分者信度越高。具体分为两种情况:如果评分中没有相同等级(即没有相同等级出现),采用无相同等级的肯德尔和谐系数公式:W=12SS/(m²(n³-n)),其中m是评分者人数,n是被评对象的个数,SS是各被试等级和的离均差平方和;如果评分中有相同等级,需要对公式进行校正,计算校正后的肯德尔和谐系数Wc。③α系数和克伦巴赫α系数:当多个评分者对同一个特质进行评分,每个评分者相当于一个项目,可以将每个评分者的评分看作一个观测值,计算评分之间的内部一致性,用克伦巴赫α系数估计评分者信度,α系数越高,说明评分者之间一致性越高,评分者信度越好。④积差相关法:当两个评分者对同一组被试的评分都是连续变量时,可以计算两个评分结果的皮尔逊积差相关系数,该系数就是两个评分者信度的估计值,和斯皮尔曼等级类似,适用于连续评分的情况。⑤多层模型方法:现在也可以用概化理论估计评分者信度,将评分者作为一个测量侧面,估计由评分者带来的方差分量,进而计算G系数和Φ系数,得到更准确的评分者信度估计,概化理论可以处理多个侧面的误差,比如不仅有评分者,还有题目等多个来源的误差,可以将评分者误差分离出来,得到更精确的评分者信度。一般来说,当评分者信度达到0.9以上,认为评分是可靠的,不同评分者之间一致性足够,测验分数的误差较小。四、综合题:81~83小题,每小题30分,共90分。81.某研究者想要考察不同启动条件对人们内隐联想测验反应时的影响,研究者将60名被试随机分配到三种启动条件:积极启动、中性启动、消极启动,每种启动条件下20名被试,得到各组被试的反应时,研究者对数据进行了整理,得到部分结果如下表。变异来源平方和SS自由度df均方MSF组间2400ACE组内BD总平方和20400答:(1)计算表格中各值,并检验结果已知总共有k=3组,总被试N=60。①A是组间自由度:组间自由度df组间=k-1=3-1=2,所以A=2。②D是组内自由度:总自由度df总=N-1=60-1=59,组内自由度df组内=df总-df组间=59-2=57,所以D=57。③B是组内平方和:总平方和SS总=SS组间+SS组内,所以SS组内=SS总-SS组间=20400-2400=18000,所以B=18000。④C是组间均方:MS组间=SS组间/df组间=2400/2=1200,所以C=1200。⑤E是F值:MS组内=SS组内/df组内=18000/57≈315.79,F=MS组间/MS组内=1200/315.79≈3.80,所以E≈3.80。检验结果:已知F0.05(2,57)=3.16,计算得到的F=3.80>3.16,因此P<0.05,检验结果显著,说明不同启动条件下内隐联想测验的反应时存在显著差异。(2)不满足方差分析前提条件时的非参数检验方法及步骤当多个独立样本不满足方差分析的正态性、方差齐性前提条件时,应该使用克鲁斯卡尔-沃利斯H检验(也叫K-W秩和检验,属于多个独立样本的非参数检验),具体步骤如下:①提出假设:原假设H0:三种启动条件下反应时的总体分布相同;备择假设H1:三种启动条件下反应时的总体分布不同,至少有一个总体分布和其他不同。②编秩:将所有组的60个被试的反应时数据混合在一起,从小到大统一排序,每个数据得到一个秩次,如果有相同数据(结),取平均秩次。③计算各组的秩和Ri:分别计算出积极启动组、中性启动组、消极启动组三个组的秩次之和,记为R1、R2、R3,每组样本量n1=n2=n3=20,N=n1+n2+n3=60。④计算H统计量:如果没有相同秩次(结),公式为:H=12/(N(N+1))×Σ(Ri²/ni)3(N+1)如果有结,需要校正,校正公式为:Hc=H/(1-Σ(tj³-tj)/(N³-N))其中tj是第j个结的相同数据的个数。⑤确定临界值并做出决策:当组数k≥3,且每个组的ni≥5时,H统计量近似服从自由度为k-1的卡方分布,因此查卡方分布表,自由度df=k-1=2,得到临界值χ²α(2),如果计算得到的H(或校正后的Hc)大于临界值,则P<α,拒绝原假设,认为至少有一组总体分布和其他组不同,即不同启动条件下反应时存在显著差异;否则不拒绝原假设。(3)分析启动类型和反应时之间线性关系的方法与分析思路由于启动类型是分类变量,有三个水平:积极启动、中性启动、消极启动,本身是有序分类变量(从积极到中性到消极,具有顺序关系),因变量反应时是连续变量,要分析二者之间的线性关系,可以采用趋势检验(线性回归的趋势分析,或称为正交多项式趋势检验,也可以将启动类型编码为有序自变量后做回归分析),具体分析过程如下:方法选择:可以采用单因素方差分析中的线性趋势检验,或者将有序分类自变量编码后进行一元线性回归分析,两种方法本质一致,具体过程如下:①对自变量启动类型进行量化编码:因为启动类型是有序的,按照效价顺序将其编码为X,积极启动编码为X=1,中性启动X=2,消极启动X=3(或者反向编码,不影响结果显著性),因变量Y是反应时,每个被试都有一组(X,Y)数据。②构造回归模型:建立一元线性回归模型Y=b0+b1X+e,检验回归系数b1是否显著不为零,如果b1显著,说明启动类型和反应时之间存在线性关系,即随着启动类型从积极到消极,反应时呈现线性增加或线性减少的趋势。或者采用单因素方差分析的趋势分解,将组间平方和分解为线性趋势平方和、非线性趋势平方和,具体为:原来的组间自由度是2,分解为1个自由度的线性分量和1个自由度的非线性分量,计算线性分量的F值,检验线性趋势是否显著:SS线性=(ΣRiai)²/(nΣai²),其中ai是启动类型的正交系数,k=3组时,正交多项式系数线性分量为-1、0、1,R1、R2、R3是各组的和,n是每组人数,计算出SS线性,自由度1,MS线性=SS线性,然后F=MS线性/MS组内,进行F检验,如果F显著,说明线性趋势存在。③结果解释:如果检验结果显著,说明X(启动类型)的变化可以线性预测Y(反应时)的变化,比如回归系数b1为正,说明启动越消极,反应时越长;b1为负说明启动越消极,反应越短,从而说明启动类型和反应时之间存在线性关系。如果检验不显著,说明不存在线性趋势,二者的关系是非线性的。另外,如果想要同时检验线性和非线性趋势,也可以将分类自变量转换为两个虚拟变量,做多重回归,检验整体关系,但本题只关心是否存在线性关系,因此采用上述的有序编码回归或趋势检验即可,该方法可以有效检验有序分类自变量和连续因变量之间的线性关系。82.某智力测验原版本是120题,信度是0.88,现在想要把信度提高到0.95,需要增加多少个题目?假设所有题目都是平行题,方差不变,请问根据斯皮尔曼-布朗公式计算需要增加多少题,并简述提高测验信度的方法有哪些。答:(1)计算需要增加的题目数量斯皮尔曼-布朗公式用于估计测验长度变化后的信度,公式为:rnn=(nrxx)/(1+(n-1)rxx)其中rxx是原测验的信度,rnn是长度变为原测验n倍后的信度,n是新测验长度是原测验长度的倍数。已知原测验信度rxx=0.88,目标信度rnn=0.95,代入公式求n:0.95=(n0.88)/(1+(n-1)0.88)整理等式:0.95×[1+0.88n0.88]=0.88n0.95×[0.12+0.88n]=0.88n0.114+0.836n=0.88n0.114=0.88n0.836n=0.044nn=0.114/0.044≈2.59,也就是新测验的长度约为原来的2.59倍。原测验题目数量是120题,所以新测验总题量≈120×2.59≈311题,因此需要增加的题目数量是311-120=191题,约190-191题(计算过程中n≈2.59,因此增加约1.59×120≈191题)。(2)提高测验信度的方法①增加测验长度,增加同质题目:根据斯皮尔曼-布朗公式,增加测验长度,增加平行题,可以提高测验的信度,因为更多的题目可以使得随机误差相互抵消,减小测量标准误,从而提高信度。但是增加题目要注意,新增的题目需要和原来的题目同质,否则增加异质题目并不能有效提高信度,而且题目过多会导致被试疲劳和厌烦,反而降低信度,因此需要适度增加。②保持被试团体的异质性:在其他条件不变的情况下,被试团体异质性越高,测验分数的分布范围越广,样本方差越大,计算得到的信度系数越高。如果被试团体同质性过高,分数变异小,信度系数会降低。因此抽样的时候要保证被试团体的异质性符合测验的使用范围,避免抽样范围过窄导致信度估计偏低。③控制测验的难度,使得难度分布适中:测验难度过高或过低都会导致测验分数的范围缩小,变异减小,信度降低。对于能力测验和人格测验,一般来说平均难度接近0.5,难度分布在0.5左右,范围在0.2到0.8之间,可以最大化分数变异,提高信度。不同类型的测验难度要求不同,根据测验目的调整难度,保证分数有足够的变异,就可以提高信度。④提高测验项目的区分度:项目区分度越高,项目能够有效区分被试的差异,越能够减小测量误差,提高测验的信度,因此编制测验的时候要筛选出区分度高的项目,删除区分度过低的项目,从而提高信度。⑤标准化施测过程:统一指导语、统一施测时间、统一施测环境、统一评分标准,减少施测过程中的随机误差,比如不同被试的指导语不同,环境干扰不同,评分标准不同都会带来额外的随机误差,降低信度。标准化施测可以控制这些额外误差,提高信度。⑥主试和被试的控制:主试经过统一培训,按照标准流程施测,减少主试偏差;被试方面,通过指导语引导被试认真作答,减少作答的随机反应,提高被试作答的一致性,从而提高信度。对于人格测验等,适当加入测谎题,剔除随意作答的被试,也可以提高测验整体的信度。⑦选择合适的信度估计方法,减少误差来源:比如对于有多个评分者的主观性测验,提高评分者信度,通过统一培训评分者,制定详细的评分细则,提高评分一致性,从而提高整体测验的信度。83.什么是测验等值?为什么要进行测验等值?简述测验等值的条件,以及常用的测验等值方法。答:(1)测验等值的含义测验等值是指对测量同一心理特质的不同测验,或者同一测验不同版本,将它们的分数转换到同一个量尺上,使得不同测验得到的分数可以相互比较的过程。简单来说,就是不同形式的测验分数之间建立等价关系,使得从一个测验得到的分数可以转换为另一个测验的等值分数,从而让不同测验的分数具有可比性。比如同一测验有A、B两个平行版本,考生做了不同版本,需要把两个版本的分数转换到同一个量表,这样分数才能公平比较,这个过程就是测验等值。(2)进行测验等值的原因①实际测验使用的需要:很多大型考试为了安全,会开发多个平行版本,不同年度、不同考次的题目不同,难度不同,直接比较原始分数不公平,比如2022年考研题目难度大,2023年难度小,原始分数不能直接比较,需要等值把分数转换到同一个量尺,保证分数公平,才能进行录取。②题库建设的需要:大规模考试现在大多建立题库,从题库中抽题组卷,不同抽题结果得到的试卷难度不同,需要将不同抽题得到的分数进行等值,使得不同试卷的分数可比,保证测验公平。③测验修订的需要:经典测验修订的时候,新版和旧版之间需要建立分数的对应关系,方便使用者将旧版分数转换为新版分数,所以需要进行测验等值。比如韦氏智力量表修订了新版本,需要将旧版的IQ分数和新版分数等值,方便比较。④计算机化自适应测验的需要:计算机自适应测验中,每个被试做的题目不同,难度不同,每个被试答对的题目数量不同,原始分数不能直接比较,需要通过测验等值将不同题目组合得到的能

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

最新文档

评论

0/150

提交评论