心理基础及其测量 4_第1页
心理基础及其测量 4_第2页
心理基础及其测量 4_第3页
心理基础及其测量 4_第4页
心理基础及其测量 4_第5页
已阅读5页,还剩102页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

心理测量第十章效度Psychometrics李英武董妍中国人民大学心理学系第十章学习导航第一节效度的概念效度定义、性质、测量学表达及其与信度的关系。第二节效度类型及估计方法内容效度、效标关联效度与构念效度。第三节效度的影响因素主试、被试、题目、环境、效标与评估方法。核心问题内容提要测验分数的特定解释和用途是否获得理论与证据支持。证据体系从内容、反应过程、内部结构、外部关系与测验后果收集证据。实践任务识别效度威胁,并通过测验修订和证据积累改进分数解释。记忆学习目标(一)识别效度、内容效度、效标关联效度和构念效度。理解解释效度的性质以及不同证据类型的含义。应用选择适合的效度验证方法解决具体测量问题。分析学习目标(二)识别效度验证中的关键环节、误差来源和方法限制。综合与评价设计效度验证方案并评估技术与伦理问题。关键词效度评价的对象是分数解释及其特定用途,而非脱离情境的测验名称。效度内容效度效标关联效度同时效度预测效度构念效度求职经历案例背景:性格测试成为招聘门槛候选人通过笔试和面试,却在性格测试后被淘汰。解释缺口招聘方只说明测验结果与岗位人才模型不匹配。核心疑问测验是否真正测量岗位相关人格,分数用途是否合理。招聘流程终止在性格测试图10-1招聘中的人格测验案例招聘人格测验需要回答的效度问题问题需要的证据错误使用风险题目是否代表目标人格内容与构念定义测到无关特征结果是否与岗位表现相关效标关联证据错误淘汰合适候选人不同群体解释是否一致公平性与测量等值证据形成群体偏差一票否决是否合理决策后果与增量效度放大单一测验误差第一节效度的概念早期提出效度研究的发展20世纪初用于描述测验分数与测量目标之间的关系。现代转向《教育与心理测验标准》强调分数解释的合理性。理论发展构念效度把测验分数置于理论网络中进行验证。效度同一测验用于不同目的、群体或情境时,需要重新积累相应效度证据。效度是指观察分数的有效程度,即测验能够提供适切数据以支持决策的能力(Thorndikeetal.,1991)。效度是支持测验分数在特定用途上进行解释的证据与理论的充分程度。解释对象性质一:效度针对分数解释评价某种分数解释是否适合当前测量目标。情境依赖同一工具用于人格测量可能合理,用于智力测量则无效。使用要求报告测验名称之外,还要说明对象、情境和决策用途。连续特征性质二:效度具有程度差异效度证据可以从薄弱到充分,不是简单的有效或无效。选择依据效度水平影响研究者是否采用测验以及如何限制解释。持续积累新的群体、用途和情境需要补充证据。理论基础性质三:效度需要理论与实证证据明确目标构念及其与行为、变量和任务的预期关系。数据支持通过内容审查、结构分析和外部关系检验预测。经验局限直觉、使用历史或表面印象不能替代科学验证。现代效度证据的五个来源证据来源核心问题常用方法测验内容题目是否代表目标领域测验蓝图与专家评审反应过程作答过程是否符合理论预期认知访谈、眼动与过程数据内部结构题目关系是否符合构念结构EFA、CFA与测量等值与其他变量的关系分数是否呈现预期相关与预测相关、回归与效标研究测验结果与后果使用是否产生合理且公平的结果决策分析、公平性与后果评估研究结论效度不足的研究与实践后果测量偏离构念会扭曲变量关系和理论检验。实际决策招聘、诊断与教育安置可能出现错误分类。伦理责任高风险应用需要更充分的证据、透明解释和申诉机制。效度的测量学含义方差分解有助于理解效度、独特性与误差在观察分数中的关系。观察分数中与目标构念或外在效标共同变异的有效部分。

观察分数的三类方差来源方差来源统计含义效度解释共同因素方差测验与目标构念或效标共享的变异构成有效变异独特性方差仅由该测验特定内容解释的变异稳定但不支持目标解释误差方差随机或系统测量误差形成的变异降低分数解释的准确性观察分数方差分解(10-1)共同方差反映测验与目标构念共享的有效变异。其余成分独特性方差与误差方差不直接支持目标解释。方差比例分解效度系数的方差表达(10-3)有效比例共同因素方差占观察分数方差的比例。损失来源独特性方差和误差方差都会降低效度。取值范围效度系数的解释理论上位于0至1之间,实际很少出现两个极端。高效度分数能够较准确地反映目标构念或效标。情境限制系数必须结合用途、样本、效标质量与后果判断。信度效度与信度关的关系测量结果能否保持一致和稳定。效度分数是否准确支持目标构念与特定用途的解释。逻辑关系稳定结果仍可能系统性偏离目标,因此高信度并不自动保证高效度。效度中的误差与独特性(10-4)第一部分1−误差方差比例对应信度。第二部分再扣除独特性方差比例才得到有效共同变异。效度与信度的关系(10-5)必要条件信度为效度提供上限和稳定性基础。非充分性即使误差较小,独特性或系统偏差仍会降低效度。

信度与效度的比较比较维度信度效度核心问题结果是否一致稳定解释是否准确且有证据支持主要误差随机误差随机误差与系统偏差评价对象特定样本与条件下的分数可靠性特定用途下的分数解释逻辑关系高信度不保证高效度高效度要求足够信度低信度会限制效度,高信度仍可能伴随系统性测量偏差信度是效度的必要非充分条件稳定地测错对象,依然缺乏效度。信度与效度的四种组合信度效度解释高高结果稳定,并且准确支持目标解释高低稳定地反映了错误或无关内容低低结果既不稳定,也不能支持目标解释低高理论上难以成立,效度受信度上限约束第二节效度类型及估计方法三类传统效度证据类型核心问题典型证据内容效度题目是否代表目标行为领域测验蓝图、专家评定效标关联效度分数是否关联或预测外在效标同时效度、预测效度构念效度分数是否符合理论构念及其关系因素结构、相关网络、实验与MTMM内容效度内容效度强调题目是否覆盖“应该测量的内容”。内容效度(Content-RelatedValidity)是指测验内容在多大程度上代表了它所要测量的行为领域。它主要关注的是测验项目是否充分涵盖了所要测量的内容范围,并且这些项目对于所测内容是否具有代表性。内容领域测验蓝图与内容代表性明确知识主题、技能成分和认知层级。比例配置按照教学目标的重要性分配题目数量。代表性抽样使有限题目能够代表更广的行为领域。艾肯内容效度系数(10-6)

艾肯V的符号说明符号含义注意事项Vj第j道题的内容效度系数结合专家人数判断不确定性rij专家i对题目j的原始评分评分等级需有明确锚点l0评分量表的最低值用于计算离差评分N与c专家人数与评定等级数影响系数分母专家任务内容效度的逻辑分析法判断题目是否覆盖目标内容并符合测验蓝图。评价重点代表性、适切性、清晰性以及无关因素干扰。判断结果专家意见用于保留、修改或删除项目。独立评审专家评级证据的设计多名专家依据统一标准分别评分。一致性检验报告专家间一致性和评分分布。透明记录保存项目定义、评语、修改依据与最终决策。内容效度与表面效度比较维度内容效度表面效度判断依据理论领域与专家证据表面印象与直观相关性科学地位正式效度证据不属于严格的科学效度主要价值保证内容代表性影响接受度、投入和作答真实性潜在风险专家判断可能主观过高会使被试识别测量意图提高接受度表面效度的双重作用内容直观相关时,被试更可能认真参与。诱发伪装测量目标过于明显时,被试可能迎合岗位或社会期待。设计平衡根据研究风险在透明度与反应真实性之间权衡。效标关联效度效标需要与目标行为相关、可靠、客观并且可获得。效标关联效度是通过实证分析方法研究观察分数与外在效标之间关联性的一项重要指标,也被称为“实证效度”或“统计效度”。其核心在于检验测验分数是否能够有效解释和预测外在效标所反映的行为或表现。建立效标关联效度的最大挑战在于选择适当的外在效标,即能够准确代表测验预测目标的某种行为或表现标准。优良外在效标的条件条件具体要求反例适切性与测验目标行为紧密相关用无关成绩评价岗位能力可靠性效标本身具有足够信度绩效评价受评分者偏差影响客观性评分规则清晰、证据可核验仅依赖单一主观印象可用性能够以合理成本获得未来结果难以持续追踪同时效度适合判断测验能否反映个体当前状态或表现。同时效度(ConcurrentValidity)是指测验分数与同时获得的效标测量值之间的相关程度。其核心目的是检验:在当前时点上,测验分数能否有效反映个体在效标上的真实表现。测验同时效度示例当前语言能力测验分数。效标同期课程成绩、教师评价或实际语言任务表现。解释相关越符合理论预期,越支持当前状态解释。预测效度适合选拔、安置和风险预测等需要推断未来结果的情境。预测效度(PredictiveValidity)是指测验分数对未来的效标表现的预测程度。这种效度的目的在于利用当前的观察分数预测个体在外在效标上的未来表现。教育选拔预测效度示例入学考试预测大学阶段学业表现。人员选拔能力或人格测验预测未来岗位绩效。时间要求效标在测验之后获得,需要控制流失与情境变化。同时效度与预测效度比较维度同时效度预测效度效标时间与测验同期测验之后主要用途反映当前表现预测未来表现典型场景诊断与替代现有工具选拔、安置与风险预测主要威胁共同方法与样本限制流失、时间变化与范围限制构念智力、动机、焦虑、自尊和人格都属于不能直接观察的构念。构念(Construct)是指一些抽象的、假设性的心理学或社会学特质,例如智力、动机、情绪、人格、社会性等。这些构念无法直接观察或测量,但被假设存在,用于解释和预测个体或群体的行为。

构念效度构念效度需要长期积累不同来源的证据,无法由单一系数证明。构念效度(ConstructValidity)是指一个测验能够测量到理论上所构建的心理特质或属性(即构念)的程度。构念是一种抽象的、假设性的概念,像智力、创造力、焦虑、自尊等都是心理构念。发展预测智力测验的理论预测示例智力表现随年龄和教育阶段呈现规律变化。外部关系智力分数应与学业成绩等相关变量关联。稳定性智商在一定时间范围内具有相对稳定性。构念效度的验证步骤定义构念明确理论内涵并设计项目→提出预测说明分数应呈现的关系→收集数据检验结构与外部关系→迭代修正调整理论、题目或模型理论网络相关法明确构念与行为、相近构念和不同构念的预期关系。实证检验比较实际相关模式与理论预测是否一致。解释边界单一相关不能证明构念,需要整体证据网络。探索性因素分析因素分析法从项目相关结构中发现潜在维度。验证性因素分析检验预先提出的构念结构与数据拟合。测量等值比较不同群体或时间点的结构和参数是否一致。理论操纵实验操作法通过实验改变目标构念或相关状态。分数反应检验测验分数是否按理论方向发生变化。多源证据可结合心率、皮肤电等生理指标。多特质多特质—多方法矩阵同时测量目标构念和若干相关或不同构念。多方法使用自评、他评、行为任务等不同测量方式。分析目标区分特质效应与方法效应,检验会聚与区分效度。会聚效度与区分效度证据类型理论预期示例会聚效度不同方法测量同一构念应有较高相关机械性向测验与机械任务成绩区分效度不同构念之间相关应明显较低机械性向与语文能力测验方法效应同一方法不应制造过高的无关相关自评问卷的共同方法偏差题—总相关内部一致性证据检查每道题与测验总分的一致程度。分测验关系比较各维度与总分之间的结构关系。高低组比较检验项目是否能够区分总体水平不同的被试。构念效度验证方法比较方法主要证据局限相关法理论网络中的关系模式容易受第三变量和测量误差影响因素分析内部结构与理论维度依赖样本量和模型设定实验操作对构念变化的敏感性操纵可能同时改变其他变量多特质—多方法会聚、区分与方法效应设计和分析成本较高内部一致性项目与总分的关系不能替代完整构念证据互补性效度证据需要整合内容、结构和外部关系分别回答不同问题。累积性一次研究只能提供部分证据,需要跨样本与情境重复。用途导向证据强度应与决策风险相匹配。第三节效度的影响因素效度的影响因素来源典型问题控制方向主试训练不足或暗示被试标准化培训与监督被试能力、经验、情绪与伪装样本匹配与反应质量控制题目内容偏离、难度失配或表述含混试测、项目分析与修订环境噪声、设备或社会压力统一物理与心理条件效标与方法效标不可靠或方法不适配改进效标并整合证据专业能力测验主试的影响主试需熟悉程序、指导语与异常情况处理。操作一致不同场次应保持时间、提示和互动方式一致。期望效应主试的表情、语气和暗示可能改变被试反应。主试因素的控制环节控制措施检查证据培训统一程序、示范和评分规则培训考核与操作手册施测使用标准指导语和时间控制场次记录与现场监督互动避免诱导、评价和差别对待录像抽查或双人监督异常处理预先规定迟到、设备故障等规则异常事件日志能力失配被试能力与样本范围题目远高于或低于被试水平会产生地板或天花板效应。范围限制样本过度同质会压缩相关并低估效标关联效度。样本设计应覆盖目标使用群体的能力与背景差异。练习与记忆测验经验的影响熟悉题型可能提高成绩,但未必反映目标能力变化。策略差异经验丰富者可能使用特定技巧完成任务。控制方法记录经验、设置平衡条件或使用新题。群体适配个体特征与文化背景年龄、教育、职业与语言水平影响题目理解。跨文化应用直接移用可能引入文化偏差和测量不等值。验证要求在目标群体中检验结构、项目功能与解释边界。状态影响被试情绪状态焦虑、抑郁、疲劳或过度兴奋可能改变作答。效度威胁分数混入当前状态,而非稳定目标特质。控制方法统一时间与环境,并记录重要状态变量。产生情境社会称许性偏差人格、自陈态度与招聘测验中更为常见。主要表现被试选择社会认可而非真实符合自身的答案。控制方法保证保密、降低评价压力并使用效度量表或多源数据。被试因素及其效度影响被试因素分数中混入的无关成分控制策略能力范围地板、天花板与范围限制匹配难度并扩大样本范围测验经验练习、记忆与策略熟悉记录经验或平衡练习文化语言题意理解与文化知识差异本土化与等值检验情绪状态焦虑、疲劳与动机波动标准化情境并记录状态社会称许伪装与印象管理保密、多方法与效度指标目标一致测验题目是效度的直接载体题目必须反映目标构念及其重要成分。可理解性题干与选项需要清晰、准确并符合目标群体语言。评分一致项目形式应与明确、客观的评分标准配套。覆盖不足题目内容的适配性遗漏构念成分会缩小测验解释范围。构念污染加入无关知识或技能会降低分数纯度。控制方法依据理论和测验蓝图系统抽样。形式匹配题目形式的科学性知识、技能和复杂心理特质需要不同任务形式。语言质量歧义、双重否定或模糊选项会引入理解误差。试测证据认知访谈与项目分析可发现题目设计问题。难度梯度题目难度的合理分布覆盖目标群体从低到高的能力范围。极端难度过难或过易会压缩分数差异并降低区分能力。目标匹配难度分布应服从测验用途,而非机械追求平均难度。覆盖收益题目数量与测验时间适量增加题目可扩展内容覆盖并提高精度。疲劳成本测验过长会引发注意下降与猜测作答。设计原则在内容代表性、精度与被试负担之间平衡。文化偏差文化背景与语言适配特定文学、习俗或表达可能给部分群体额外优势。翻译风险直译可能改变项目难度与构念含义。控制方法采用回译、认知访谈与差异项目功能分析。一致性题目间一致性与内容多样性相关题目共同反映目标构念。多样性过度相似会形成冗余并缩窄内容覆盖。平衡原则保证构念一致,同时保留有意义的内容广度。同步设计题目与评分标准的契合开放题应在编题阶段同时开发评分量规。评分培训通过锚定样例和反馈提高评分一致性。质量监控使用复核、双评或评分者模型检查偏差。理论上限题目信度对效度的制约测验与效标的可靠性限制可观察的最高相关。主要来源项目稳定性、内部一致性和评分一致性。改进方向优化项目、统一评分并开展充分试测。题目因素的诊断清单检查维度主要问题改进方向内容是否覆盖目标构念依据蓝图补充或删减形式是否引入无关能力调整题型与语言难度是否匹配目标群体形成合理梯度长度是否兼顾覆盖与负担控制题量和时间文化是否存在语言和背景偏差本土化与公平性检验评分标准是否清晰稳定量规、培训与复核物理条件施测环境影响效度噪声、光线、温度、空间和设备影响注意与表现。社会心理条件主试态度、评价压力与团体氛围影响作答。指导语模糊或不一致的说明会改变任务理解。认知影响噪声与外界干扰干扰注意资源并增加复杂任务错误率。系统偏差若部分场次更嘈杂,环境差异会进入分数。控制方法选择安静场地并记录异常噪声事件。视觉舒适光线与温度过暗或过亮会造成视觉疲劳。身体状态过冷或过热会降低舒适度与注意水平。标准化保持适宜环境,并在跨场地测验中统一条件。空间密度空间布置与设备过度拥挤增加压力,过于空旷可能分散注意。设备质量延迟、故障或不同屏幕会改变作答过程。技术记录电脑化测验应保存设备、时延与中断日志。情绪传递施测者行为与态度紧张、不耐烦或评价性反馈会增加被试压力。支持边界鼓励应保持中性,避免暗示答案或表现期待。操作一致统一语言、表情和答疑规则。情境特征社会评价与高风险压力高考、招聘和临床诊断具有较高决策后果。心理反应失败担忧和评价焦虑可能抑制真实表现。解释要求区分目标特质与考试压力造成的分数变化。同伴互动团体施测的影响测验前交流可能改变情绪与准备状态。竞争氛围对不同被试可能产生激励或压力。控制方法统一候考、座位与交流规则。清晰性施测指导语说明任务、时间、作答方式与异常处理。一致性不同场次和主试应使用相同版本。可理解性特殊群体需要经过验证的语言调整。施测环境的标准化控制环境方面统一要求记录内容物理条件噪声、光线、温度与座位场地检查表设备硬件、软件与网络状态型号、延迟与故障日志社会互动主试行为与候考规则异常互动事件指导语固定文本与答疑边界版本和执行偏差适配性效标质量决定效标效度的上限效标需要准确代表测验希望解释或预测的行为。可靠性效标自身不稳定会压低测验与效标的相关。选择后果不同效标可能产生不同效度结论。效标关联效度的信度上限(10-7)测验信度rxx越低,可观察效标相关的上限越低。效标信度ryy不足同样会造成效度低估。

效度评估方法的选择测验目的主要证据典型方法教育内容掌握内容效度蓝图、专家评审与艾肯V当前诊断同时效度与同期标准或表现相关人员选拔预测效度追踪未来绩效或结果人格、能力与动机构念效度CFA、理论网络、实验与MTMM优先审查低效度测验的补救原则先检查构念定义、题目内容、效标与模型是否合理。实质修订修改或删除低效度题目,并重新验证。谨慎校正统计校正只处理部分测量误差,不能替代测验改进。少量问题放弃、修改或重新编拟试题修改表述、内容或评分标准后重新试测。系统问题若大量项目偏

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论