第05章 信度课件_第1页
第05章 信度课件_第2页
第05章 信度课件_第3页
第05章 信度课件_第4页
第05章 信度课件_第5页
已阅读5页,还剩54页未读, 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

1、第05章 测量的信度Outline第一节 信度的理论第二节 测量误差的来源第三节 估计信度的方法第四节 影响信度系数的因素第五节 测量的标准误差第六节 概化理论简介第一节 信度的理论一、信度的操作性定义二、误差三、测量误差和真分数理论一、信度的操作性定义定义:测验结果一致性的判断 (一个测验可靠性和稳定性的指标) 一个好的测验在多次测量同一个人的时候结果应该是基本一致的.二、误差测量误差指的是在测量过程中由那些与测量目的无关的变化因素所产生的一种不准确或不一致的测量效应。系统误差:在相同的观测条件下作一系列观测,若误差的大小及符号表现出系统性,或按一定的规律变化,那么这类误差称为系统误差。只影

2、响准确性。随机误差:在相同条件下进行多次测量时,每一个单独的误差出现没有规律性,误差数值的大小和符号的正负不固定。由与测量目的无关的、偶然因素引起的、而又不易控制的误差。影响准确性和一致性。三、测量误差和真分数理论在实测分数中真分数所占的比率 实测分数=真分数+误差(X=T+E)公式:真分数模型经典测量理论假设,观察分数与真分数之间是一种线性关系,只相差一个随机误差。真分数公设:XT + E (X是实得分数,T是真实的分数,E为随机误差或测量的误差)此式定义:测量分数是真分数与误差分数之和。 对于同一被试用平行的测验反复多次测验,观察分数的平均值会接近真分数。真分数理论的3个假设误差分数的平均

3、数是零。因为误差是随机的误差分数与真分数相互独立,没有任何相关。如果有相关,那误差就不成为误差了两次测量的误差分数之间的相关为零。因为误差是随机的,所以测量之间没有必然的联系真分数模型的重要推论SX2= ST2SE2,测验观察分数的方差等于真分数方差与随机方差值和。测验的系统误差包含在真分数的变异中,可以分为:与测量目的有关的变异(SV2)和与测量目的无关的系统误差变异(SI2),于是:SX2= SV2 SI2 +SE2 ST2 =SV2 SI2 测量分数、真分数和误差分数的分布假设 学生 测量分数 = 真分数 + 误差分数 A 3 5 -2 B 17 15 +2 C 16 20 -4 D 2

4、3 25 -2 E 27 25 +2 F 25 25 0 G 35 25 +10 H 26 30 -4 I 33 35 -2 J 45 45 0 总数 250 250 0 平均数 25.0 25.0 0 方差 120.2 105.0 15.2 标准差 10.9 10.2 3.9 测量分数=真分数+误差分数误差之和为零测量分数的平均数=真分数的平均数测量分数的方差等于真分数的方差与误差方差之和(但标准差并没有如此之关系)因为每一次测量结果中都可能有误差的存在,所以一次测量不一定能准确反映真实的情况,而多次测量可以弥补这一不足,因为误差是随机出现的,所以理论上可以用多次测量结果的平均数来代表真分数

5、,而每一次测量分数与平均数的离差就是误差。一个测验结果的离散度越小说明误差也就越小。真正在心理测量中真分数是不可能直接获得的。可行的是探查一个测验的误差有多大,然后通过用测验分数与误差分数相减来求取真分数。四、信度的基本定义信度(reliability):测量结果的稳定性程度。定义1:一组测量分数的真分数的变异数与实得分数的变异数的比率定义2:一组测量分数的真分数的变异数与实得分数相关系数的平方定义3:一个测验与任一个平行测验的相关系数22TxxxSrS2xxTXrxxXXr第二节 误差及误差的来源定义:与测量目的无关的因素造成了测 验结果的不一致或不准确误差来源1.测验内部引起1)题目取样误

6、差2)题目用词模棱两可3)题目太难4)规定的测验时间太短5)题型的原因2.测验过程引起的1)物理环境2)主试方面3)意外干扰4)计分3.被试引起的1)动机2)焦虑3)练习4)经验5)生理因素第三节 估计信度的方法一、稳定系数 (重测信度)(跨时间的一致性)二、等值系数 (复本信度)(跨形式的一致性)三、内在一致性系数四、评分者信度一、稳定系数 (重测信度)稳定系数 (重测信度)(跨时间的一致性):对同一个测验前后做两次,然后计算两次测 验结果的一致性。 公式一:公式二:测验被 试12345678910 1112 13 14 15x116 15 1313 13 1110 10 10 998876

7、x216 15 1614 12 1113 12 10 1111910 87测验x x 2Sx1x2x1158178410.532.831946x2199214711.672.65统计值例题被试数学x阅读yxyx2y2xy14117+1-4116-423828-2+7449-1434822+8+1641843216-8-564254053418-6-33691863615-4-616362474124+1+319384320+3-191-394723+7+2494141040270+6036040021000244186864021例题2例题2计算采用重测信度需注意之处两次测验的时间应该是合理的

8、,即既不能太长又不能太短。相隔太长的时间被试在所测量的特征上可能会发生变化,相隔太短有记忆的效应。重测信度的使用局限性1.被试在这期间自身发生了变化2.第一次测验的经验对第二次测验产生影响。如第一次测验产生了焦虑就会影响第二次测验)3. 记忆的作用4.耗时耗精力,被试不好找 二、等值系数 (复本信度) 一个测验有A,B两个版本,对一组被试测试, 求取两个测验结果的一致性。两个版本连续施测称为等值性系数,如果两个版本间隔一段时间施测称为稳定性等值系数。三、内在一致性系数以一次测验的结果来估计测验的信度,用以估计测验内部的一致性。内部一致性信度的估计方法(1)分半信度(2)库德理查逊估计法(3)稳

9、定系数 分半信度把一次测验的结果人为地分成对等的两半,然后计算两半分数之间的相关。计算分半信度的一个重要之处是如何进行合理的分半。分半信度只是半个测验的信度,所以需加以校正。校正公式:库德理查逊估计法库德理查逊1937年提出了一种分析题目间一致性来估计信度的方法,即应用项目统计量来避免任意的两半分法导致产生的误差。常用KR20公式。公式:例题测题 答对人数 p q pq 1 15 0.50 0.50 0.25 2 20 0.67 0.33 0.22 3 12 0.40 0.60 0.24 4 10 0.33 0.67 0.22 5 6 0.20 0.80 0.16 pq=1.09 假设一个测验

10、有5个测题,施测于一个30个人的样本,结果求出标准差为2.5稳定系数稳定系数(克伦巴赫系数) 公式:内在一致性系数的使用局限性只适合于同质性的测验特别不适合于速度测验(一)2个评分者:二个评分者分别对一组被试的测验结果加以评分,然后求取两组人分数的一致性;另一种方法是求取完全相同评分的比例。(二)三个以上评分者对一组被试的测验结果评分,其一致性的求取采用肯特尔和谐系数。公式:四、评分者信度例:三个教师给6篇作文评分将分数值转换为得分等级(最高为1)然后求出每一篇作文所得等级之和(Ri )教师教师123456A253027202832B222621202530C15201814212212345

11、6A524631B425631C534621 Ri147131883例题计算Ri 14+7+13+18+8+363Ri2811K3N = 6被评对象在3-7人时,直接查表,w值大于表中数值说明信度是高的,如被评对象超过7人,则可计算2值,作2检验。2k (N-1) w df=N-1不同类型测验的信度要求标准化智力测验 0.90 (中等到高的信度)标准化成就测验 0.85标准化人格测验 0.80 (中等到低的信度)标准化团体测验 0.70某些投射测验 0.60 (低信度)第四节 影响信度的因素一、测验分数分布的范围对信度的影响二、测验的长度对信度的影响三、测验的难度对信度的影响一、测验分数分布的

12、范围对信度的影响分数分布的范围越大,信度就越高,分数分布的范围越小信度就越低。用异质团体的信度来推测同质团体的信度公式:例:二、测验的长度对信度的影响测题数量越多信度就越高以已有测题数量所得信度来预测达到某种信度水平需增加的题数公式:例:以增加题目的数量来推测所能达到的信度公式:例:进一步增加题数可达到的信度水平题数1050100200300400500相关系数0.500.830.910.950.968 0.9760.98三、测验的难度对信度的影响难度间接影响信度。即难度影响测验分数的分布,然后影响信度。第五节 测量的标准误差定义:误差分数分布的标准差标准误也可用来判断一个测验的稳定性程度。信

13、度系数是估计整个样本的误差程度,而标准误则是用来估计个人分数中的误差水平。标准误的计算公式标准误的用途确定分数的有效区间不评价两个同测验分数是否有明显的差异。标准误用于确定分数的有效区间 测量的标准误: 95%的置信区间: (X-1.96SEX-1.96SE) T(X+1.96SE)T(X+1.96SE) 例题一个儿童做韦氏智力测验测得智商120,已知韦氏测验的标准差为15,信度是0.95。以95%的置信水平来确定这个儿童智商分数的有效区间,那么真分数有95%的可能性会落在X+/- 1. 96 Se的范围内,即120+/-1.96 3.35 =113-127。标准误用于评价两个同测验分数是否有

14、明显的差异公式:置信度乘以标准误标准误公式:例题一个儿童的韦氏言语智商是102,操作智商为108,操作智商是否显著地高于言语智商呢?以标准误来检验,先算出差异分数的标准误两个分数差异大于9分以上才有显著性差别,现在108-102=6,所以这个儿童的两种智力没有差异。以图形也可辨认两种分数的差异以图形也可来辨认两种分数的差异。如果置信区间有重叠,尤其是一半以上重叠,那就不能说一个分数比另一个高。第六节 概化理论一、GT的基本原理及概念二、单侧面随机设计三、双侧面完全随机交叉设计概化理论概化理论是一种能够同时达到区分被试和评估被试真实水平的目的,并较好控制测验误差的现代测量理论。概化理论控制测验误

15、差的方法主要是通过统计控制技术实现,即把干扰测验分数的无关变量或因素引入测验模型中,然后用统计技术分别估计出这些因素以及因素之间交互作用对测验的影响程度。再通过分离这些影响后,显现出被试水平之间的真正差异,即控制了测验误差。概化理论的基础分数方差测量学:测量误差的来源多种多样,各种误差在误差总量中所占的比也不相同。测验情境关系:在不同的测验情境关系下,测量误差的结构不同,误差量也不同。由此测验编制者可以通过改变测验情境关系达到改善测量,降低测量误差的目的。概化理论认为,研究测量必须先研究测验情境关系。测验情境关系测验情境关系是由一个测量目标和若干个测量侧面构成的。测量目标:测量者希望通过测量用

16、测量数据描绘的那些实体。测量侧面:除了测量目标方差,其余的都是误差方差,这些误差的来源都称作为测量侧面。概化理论的基本原理首先,运用实验设计的思想,分析影响测验分数变异的各种来源;接着,运用方差分析的技术,分别估计各种变异来源对分数变异所做的贡献(方差分量)然后,根据不同研究目的,分别考察研究目标在测验总分变异中所占的比重。概化理论的全域分数经典测量理论运用真分数的概念来刻画被试潜在的心理特质的水平;概化理论则提出了全域分数的概念来刻画被试潜在的心理特质的水平。概化理论中,在根据行为样本的表现(得分)估计行为总体的水平时,必须同时指出测量条件样本是否也推论到了各自所对应的条件总体(全域)。这种

17、把被试的某种潜在特质水平定义在具体的测量条件全域(范围)上的分数,就叫全域分数概化理论中方差分量的估计当测验涉及被试和题目两个因素时,可以将总变异分解为题目效应(题目难度等差异)、被试效应(被试水平差异)以及题目与被试之间的交互作用概化理论中运用方差分析的思想,在求得各种均方的基础上,根据抽样理论,估计出有关的内在总体方差,即属于各主效应和交互作用的方差分量。概化系数与可靠性系数概化理论认为,测量的误差包括两种,其一为相对误差,其二为绝对误差相对误差是由所有随机误差引起的测量误差,即在概括全域上,被试p的样本得分与全体被试样本得分的均值之差值与被试p的全域分数与全体被试全域分数均值之差两者之间的差异。即被试在样本上的离均差与他的全域分数的离均差之差值即为测量的相对误差。绝对误差是指样本观测值与概化全域上的全域分数之差,即在概括全域上,所有无关因素即因素之间交互作用所致的测量误差都属于绝对误差。相对误差Vs.绝对误差相对误差,类似于CTT的信度定义,可以定义概化系数(G系数)为测量目标的有效变异占有效变异与相对误差变异之和的比值作为测验的精度指标。由于概括全域可以有多个,概化理论可以针对测

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论