心理基础及其测量 9_第1页
心理基础及其测量 9_第2页
心理基础及其测量 9_第3页
心理基础及其测量 9_第4页
心理基础及其测量 9_第5页
已阅读5页,还剩87页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

心理测量第五章经典测验理论Psychometrics李英武董妍中国人民大学心理学系第五章学习导航第一节经典测验理论起源从斯皮尔曼到古特曼、洛德与诺维克第二节真分数与测量误差区分观察分数、真分数以及随机与系统误差第三节真分数模型假设理解基本模型、三项假设、方差分解及理论局限核心框架内容提要观察分数可分解为真分数与误差分数,测量误差可被量化分析。理论价值用简明模型评价测量工具质量,为信度、效度研究奠定基础。主要局限样本依赖、个体测量精度不足、误差假设理想化,模型难以反映动态情境。记忆学习目标(一)识别真分数、误差分数及经典测验理论的基本假设。理解解释信度、效度如何反映测验结果的可靠性与有效性。应用使用斯皮尔曼修正相关技术评估测量误差导致的相关衰减。分析学习目标(二)探讨经典测验理论在教育、临床等情境中的适用性。评价审辩式分析其优势、局限以及提升测量效能的改进空间。真分数真分数理论误差分数关键词贯穿本章的问题:如何从一次观察分数推断相对稳定的真实水平?偶然事件如何改变观察分数业务攻坚工作负荷升高→临时加班负面情绪被激活→当场作答判断受即时状态影响→分数偏高未必等于稳定压力水平同一测量工具,在不同测量时点可能得到不同观察分数。平时状态小李的作答变化工作能力出众、应对从容;“疲惫不堪的频率”通常会选择“偶尔”。测量当日想到连续熬夜赶工,心情跌入谷底,选择了“经常”。测量学问题一次回答同时包含稳定压力水平与当天临时状态的影响。从经典测验理论解释案例观察到的部分在案例中的表现测量学归属相对稳定的职场压力小李平时应对工作游刃有余希望捕捉的真实水平当天加班引发的波动烦躁、焦虑、疲劳预期随机误差或情境干扰程序性偏差若所有人都在同类高压时点测量可能形成系统性偏差如何优化员工压力测量程序测量前避开重大节点;记录异常事件→测量中统一说明、环境与时限→测量后必要时复测;结合多源信息→解释时报告误差与适用边界优化目标:让观察分数更接近员工相对稳定的压力水平。第一节经典测验理论起源时间经典测验理论的诞生背景20世纪初,心理学对个体差异进行定量研究的需求迅速增长。成就一测量误差被认识为可用概率与统计方法处理的随机变量。成就二变量间相关性及相关系数的发展,使误差影响可以被量化。经典测验理论的发展脉络时期代表人物关键推进1904斯皮尔曼提出相关衰减修正与真分数思想随后尤尔、凯利扩展相关理论与个体差异测量标准1945古特曼提出六种信度下限估计1966—1968洛德、诺维克系统整合模型、信度与方差成分核心发现斯皮尔曼:经典测验理论的起点存在测量误差时,观察变量之间的相关往往低于无误差时的真实相关。方法贡献提出修正相关衰减的技术,并以信度指数评价测验稳定性。理论贡献把观察分数分解为真分数和误差分数。为什么测量误差会造成相关衰减真实特质相关变量之间存在真实联系→两个测量含误差无关波动混入分数→共同变异占比下降观察相关被削弱→修正相关估计去除误差后的联系斯皮尔曼的分数分解思想真分数研究者试图测量的个体真实特质水平。误差分数工具、环境、受试者状态等因素引入的随机波动。尤尔尤尔与凯利的推进扩展相关性理论,推动经典测验理论用于社会学与教育测量。凯利强调测量工具在评价个体差异中的作用,推进测量标准与信度研究的系统化。共同作用让经典测验理论从一个起点发展为可广泛应用的方法框架。关注问题古特曼:从“点估计”到信度下限真实信度难以直接得到,能否估计一个有依据的下限?变异来源分析个体、项目与测验实施次数三类变异。理论突破重新界定误差方差,不必完全依赖真分数与误差协方差为零的假设。方法成果古特曼六种信度下限的意义提出六种信度下限公式,可利用单次测验结果进行估计。历史影响其中一种成为后来克伦巴赫α系数的重要前身。实践价值为测验改进、优化及误差控制提供可操作的工具。发展阶段洛德与诺维克:系统整合诺维克在1966年前后的研究,以及与洛德合作的系统总结,使CTT走向成熟。模型推进更精确地解释信度、误差及测量中的方差成分。应用推进讨论不同测量情境下如何估计与解释信度。经典测验理论起源:贡献对照人物核心问题主要贡献斯皮尔曼误差为何削弱相关?相关衰减修正;真分数思想尤尔、凯利如何扩展应用?相关理论、测量标准与个体差异评价古特曼如何保守估计信度?信度下限与误差方差分析洛德、诺维克如何形成严谨体系?模型、信度及方差成分的系统整合第二节真分数与测量误差观察分数经典测验理论的核心概念一次具体测量直接得到的数值。真分数个体在目标特质上的相对稳定水平。误差分数使观察分数偏离真分数的测量波动。观察分数为何不等于真分数个体真实水平测量对象→工具与情境介入误差进入过程→得到观察分数真分数与误差共同作用→多次测量随机误差平均分散同一对象在相同条件下无数次测量结果的平均值真分数的操作定义它是理论上的期望值,不是某一次测量中可以直接观察到的分数。目标真分数V三类分数:V、I与E研究者希望测量到的心理特质实际水平。非目标真分数I由稳定的系统性误差产生,属于不希望测得的稳定成分。随机误差分数E由各种偶然、随机因素产生的波动成分。分数成分及其测量含义成分稳定性是否希望保留典型含义目标真分数V稳定是目标心理特质的真实水平非目标真分数I相对稳定否系统误差带来的稳定偏差随机误差分数E不稳定否偶然情境导致的上下波动三类成分的组合关系目标真分数V希望测到→非目标真分数I稳定但非目标→真分数T由目标与非目标成分构成→观察分数X由真分数与随机误差构成基本公式(5-1)X观察分数(实测分数)。T真分数。E随机误差分数。真分数构成(5-2)V目标真分数。I非目标真分数,即稳定的系统误差成分。分数分解(5-3)目标让V在观察分数中的作用尽可能大。控制尽量减小I与E,使解释更接近目标心理特质。随机误差测量误差的两种类别大小和方向随机变化,使结果在不同时间上下波动。系统误差大小和方向相对稳定,使结果持续偏高或偏低。共同点两者都会使观察分数偏离研究者希望测得的目标真分数。随机误差与系统误差比较比较维度随机误差系统误差方向与大小随机变化相对固定对多次测量均值可相互抵消不能靠重复自动消除在模型中的位置随机误差分数E非目标真分数I控制重点标准化、复测、增加代表性校准工具、修订程序、消除偏差测量误差的三类主要来源测验本身内容与形式→评分记分规则与评分者→受试者稳定特征与临时状态提高信度需要同时控制工具、实施者和受试者三个环节。样本代表性来源一:题目样本测验所包含的题目只是内容总体的一部分。题量影响项目过少或覆盖不足,个体真实水平难以被稳定反映。改进依据测验蓝图抽样,兼顾内容覆盖、难度及题型。理想要求来源一:不同版本或形式复本在内容、难度及分数分布上保持一致。现实困难逐题实现完全等同非常困难,形式差异会引入分数波动。改进开展项目分析、等值设计与复本质量检验。单一特质来源一:构念与题目设计若测验只测某一特质,每道题应尽量只反映该特质。个体偏好不同受试者对内容、题型及反应方式的熟悉度不同。风险题目可能同时测到非目标能力,形成稳定或随机偏差。题目与时限来源一:施测环境表述不清、时限过短会降低表现的稳定性。突发干扰断电、噪音等偶然事件会改变作答状态。控制原则统一指导语、场地、时间、设备及异常处置方案。关系因素来源一:主试效应主试与受试者的性别、个性、种族等互动因素可能影响得分。行为因素主试的表情、语气、言谈举止可能改变受试者表现。控制原则培训主试、使用标准话术并减少暗示性反馈。程序错误来源二:评分与记分计算、登记或录入错误会直接改变测验分数。标准不一主观题、人格测验和投射测验尤其依赖评分规则。后果不同评分者解释不一致,使结果的稳定性下降。状态来源二:评分者状态与偏差疲劳、情绪波动会改变评分严厉度与一致性。先入印象对受试者已有印象可能影响判断。改进明确评分锚点、双人复核、盲评并监测评分者一致性。知识水平来源三:受试者的稳定特征不同知识背景会影响对题目内容的理解与表现。考试技巧经验丰富者通常在不同测验中的表现更稳定。应试策略能力较低或缺少经验者可能因策略不佳产生额外波动。项目熟悉度来源三:项目熟悉度与反应定势个体对特定内容或题型的经验不同。反应定势对是非题、选择题等可能形成独立于内容的固定倾向。测量风险总分可能混入题型偏好,而不只是目标特质。生理状态来源三:临时生理与心理状态生病、疲劳会降低注意力与反应效率。情绪状态焦虑、烦躁会改变信息加工与作答判断。动机状态动机不足可能导致表现低于个体正常水平。焦虑与表现:并非简单线性关系焦虑过低动机与警觉不足→适度焦虑注意集中、反应加快→焦虑过高注意分散、表现下降解释分数时应记录测验当时的焦虑、动机和身体状态。误差来源与控制策略误差来源典型风险主要控制策略测验本身题目样本、复本、环境、主试效应蓝图与项目分析;标准化施测评分记分标准不一、疲劳、录入错误评分细则;培训;复核;一致性检验受试者知识经验、反应定势、临时状态适宜时点;状态记录;必要时复测测量前案例:误差控制方案预先设定避开重大项目节点的规则,记录加班等异常事件。测量中统一施测条件,收集疲劳、焦虑和近期负荷等状态指标。测量后异常高分结合访谈与复测解释,不以单次分数直接下结论。第三节真分数模型假设逻辑起点经典真分数模型的提出人类特质测量容易出现误差,观察相关低于真实客观值之间的相关。理论发展斯皮尔曼奠基,吉尔福特、洛德与诺维克等进一步明确框架。核心任务用数学模型区分真实差异与测量误差。考纲链接:经典测量(或测验)理论模型。X模型中的四个符号实测分数或观察分数。T真分数,由目标真分数与非目标真分数组成。V与I目标真分数V;非目标真分数I。E随机误差分数。经典真分数模型全景目标与非目标成分构成真分数T→真分数与随机误差构成观察分数X→三类成分合并得到完整分解三项基本假设假设公式表达核心含义误差期望为零均值为0重复足够多时,正负随机误差抵消真分数与误差独立相关为0误差不系统地随真分数变化不同测量误差独立相关为0一次测量的误差不预测另一次误差假设一:误差分数的期望值为零统计含义随机误差的平均数为零。测量含义单次分数可能高于或低于真分数,但长期平均围绕真分数波动。方向随机假设一为何成立误差由原因不明的偶然因素引起,影响有正有负。重复测量次数足够多时,正负误差可以相互抵消。分布假定通常设想测量误差服从均值为零的正态分布。假设二:真分数与测量误差无关(5-5)独立性T与E是相互独立的变量。判断标准若误差会系统反映被试水平差异,它就不再只是随机误差。要求假设二的解释边界高真分数者不应必然产生更大的正误差或负误差。风险若误差随能力、年龄等稳定变化,误差已包含系统性成分。实践检查分析残差是否随关键群体特征呈系统变化。假设三:不同测量误差之间相关0(5-6)独立性每次测量产生的误差是独立随机变量。含义第一次测量的误差不应与第二次测量的误差存在统计相关。符合假设假设三的解释边界一次偶发噪音只影响当次作答。违背假设持续存在的设备偏差、练习效应或记忆效应影响多次测量。实践启示安排适当复测间隔,并识别跨时点持续干扰。三项假设:对象、判断与风险假设对象理想状态违背时的风险误差均值长期均值为0观察分数持续偏高或偏低T与E相关为0不同能力者误差大小或方向不同两次测量误差相关为0重复测量共享同一干扰来源为什么能相加从基本假设到方差分解相关为零意味着各成分之间没有协方差项。真分数方差由目标真分数方差与非目标真分数方差构成。观察分数方差由真分数方差与随机误差方差构成。真分数方差分解(5-7)目标真分数方差反映目标心理特质的个体差异。系统误差方差反映系统误差造成的稳定个体差异。观察分数方差分解(5-8)真分数方差反映稳定的个体差异。随机误差方差反映偶然因素引起的分数波动。完整方差分解(5-9)解释观察分数的离散程度来自目标特质、系统误差与随机误差。用途比较各部分在观察分数方差中所占比例。方差含义如何解释方差大小方差表示分数的离散程度,也反映相应因素对个体评价的作用大小。因素作用某成分方差越大,它对观察分数差异的贡献越大。评价原则不能只看总分波动,还要问波动来自目标特质还是误差。理想的方差构成目标真分数方差越大越好→系统误差方差越小越好→随机误差方差越小越好关键不只是绝对大小,还要比较各自在观察分数方差中的比例。情境一课堂练习:分辨三类方差不同员工稳定压力水平不同——主要对应目标真分数方差。情境二问卷用词持续偏向某类岗位——可能对应系统误差方差。情境三测量当天临时加班——可能增大随机误差方差。三、真分数理论缺陷经验基础经典测验理论为何长期重要概念主要通过相关分析与实际测量数据操作化。技术简洁模型直观、统计方法易于掌握,便于测验工作使用。广泛应用长期指导心理与教育测量中的信度评价和工具改进。基本设想平行测验框架不同版本测量内容相同,且测量误差相等。可比较对象同一测验前后分数或平行复本之间的结果。现实限制严格平行的复本难以编制,也难以让同一受试者无限次测量。经典测验理论的四类局限局限核心问题样本依赖性难度、区分度、信度会随受试者样本改变标准误估计用同一测量标准误描述所有能力水平测验结果比较难以比较非平行但功能相同的测验项目反应组型同总分被视为同能力,忽略答对哪些题现象局限一:样本依赖性同一试卷在不同受试者群体中的难度、区分度和信度可能不同。原因CTT指标是特定样本中观察分数关系的函数。后果跨样本使用同一测验时,指标缺乏稳定一致性。假设局限二:统一标准误所有受试者的测量误差用同一测量标准误估计。忽视不同能力水平上的测量精度可能并不相同。风险对高能力者可能估计过大,对低能力者可能估计过小,或反之。可处理局限三:测验结果比较困难相同测验的前后比较,或严格平行复本之间的比较。难处理非平行但功能相同的测验之间缺少有效比较机制。现实矛盾真实测量中严格复本假设并不常见。CTT做法局限四:忽视项目反应组型主要依据原始总分估计能力。隐含假设原始得分相同就意味着能力水平相同。被忽视的信息受试者究竟答对了哪些题、答错了哪些题。同样总分,反应组型可能不同受试者易题1易题2中题3难题4总分甲√√××2乙××√√2CTT给出相同总分,但两人的作答信息与潜在能力线索并不相同。不同参照系能力与题目难度缺少共同量尺CTT中的能力量表与项目难度量表不在统一尺度上。参数不稳定项目统计量依赖具体样本,被试得分依赖具体测验形式。结果跨测验比较和标准化量尺的建立受到限制。题库管理对题库与组卷的影响难以依据稳定标尺比较不同试题参数。选题组卷难以精细控制不同能力水平上的测量误差。能力估计结果强烈依赖受试者恰好遇到的那组试题。CTT的局限如何推动后续理论样本与测验依赖参数不稳定→忽视反应组型题目信息未充分利用→个体精度不足统一标准误→项目反应理论寻求统一量尺与条件精度经典测验理论:优势与边界维度优势边界理解与操作模型简洁,易于解释和应用误差结构较粗略群体测验适合评价总体信度与工具质量指标依赖特定样本个体解释可给出总体测量误差概念难反映个体及能力区间差异跨测验使用平行测验可比较非平行测验比较受限适合经典测验理论的适用边界标准化程度较高、关注群体水平、需要简明信度评价的教育与临床测量。谨慎样本差异很大、需要个体精确诊断或跨测验等值时。基本原则任何信度与误差结论都对应特定测验、样本和测量情境。本章概念主线观察分数X一次直接获得→分解真分数与误差区分稳定与随机→识别V、I、E判断目标与误差→评价与改进控制误差说明边界真分数观察分数随机误差系统误差基本概念分别给出概念定义。要点一:起源与发展本章要点(一)CTT源于心理学定量化需求,以相关、误差和方差分析奠定现代心理测量基础。要点二:核心概念测验分数包括真分数与误差分数,分数解释必须说明测量误差。要点三:误差特点本章要点(二)随机误差通常设定为均值为零,不影响长期平均,但影响单次结果准确性。要点四:模型假设误差期望为零;误差与真分数无关;不同测量误差彼此独立。问题复习

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论