版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
心理测量第十二章测量等价与测验等值Psychometrics李英武董妍中国人民大学心理学系第十二章学习导航第一节测量等价性的概念定义、层级、理论基础及其与信效度的关系。第二节测量等价性的检验方法六类统计方法、检验步骤与选用建议。第三节测验等值与检验方法基本假设、CTT与IRT等值方法及概念辨析。核心问题内容提要不同群体、情境、时间点或测验版本的分数能否公平比较。测量等价检验同一工具跨群体或跨时间的结构与参数是否一致。测验等值把不同版本的测验分数转换到具有共同意义的量尺。记忆学习目标(一)识别形态、度量、标量和残差方差等价的含义。理解解释测量等价对跨文化与群体比较的必要性。应用按数据结构选择并实施测量不变性与测验等值方法。分析学习目标(二)判断单维、多维、嵌套与潜在异质数据的检验策略。评价权衡严格不变假设、样本量、模型复杂度和解释风险。迁移把公平比较原则应用于跨文化、教育与组织测评。测量等价性
形态不变性
度量不变性
标量不变性
测验等值关键词比较之前先确认:量尺是否在不同条件下仍表达同一个构念。章节导读:CBCL双因素模型的可重复性症状共现青少年精神病理评估中的问题一种精神病理症状可能增加另一种症状出现的概率。常用工具儿童行为检查表(CBCL)广泛用于儿童青少年精神病理评估。建模分歧不同研究使用不同条目和维度,双因素模型的对应关系并不确定。国际合作可重复脑图表计划巴西、中国和美国团队共同推动可重复脑图表计划。数据基础整合包括“彩巢计划—成长在中国”在内的6个大型发育队列。研究目标系统检验CBCL模型的信度、效度、测量不变性与相关性。“彩巢计划—成长在中国”研究图12-1“彩巢计划—成长在中国”研究中的测量不变性(Liuetal.,2021)研究设计:大样本、多模型、多条件维度研究设置检验价值样本5—22岁儿童青少年,7005次重复测量覆盖发展阶段并支持纵向比较模型39—116个条目,构建11个双因素模型检验不同建模策略的可重复性分组年龄、性别、研究地点判断模型是否可跨条件比较总体拟合案例结果:达到标量不变性11个模型的总体拟合度相似。测量质量P因子及多数内化、外化、躯体化因子具有较高信度。不变性证据各模型跨年龄、性别与研究地点均满足标量不变性。比较资格案例思考标量不变性为何使不同年龄、性别和地点的潜在均值比较更可信?解释边界若只达到度量不变性,哪些比较可以做,哪些不能直接做?应用意义该结果如何支持精神病理评估在不同环境中的使用?第一节测量等价性的概念不同领域对“等价”的关注领域主要关注典型表现社会学与心理学观测变量—潜在特质关系及潜在特质间关系跨文化、跨年龄、跨情境比较教育测验观测变量—潜在特质关系是否相同项目参数、项目功能差异单维测验相同能力下项目反应是否相同DIF检验多维测验项目关系与潜在维度关系是否一致多维不变性检验跨群体或跨时间,工具对同一潜在构念的测量方式和结果具有一致性与可比性测量等价性潜在特质相同的个体,应具有相同的观测得分期望。控制真实特质测量等价性的判别逻辑先考虑被试在潜在构念上的真实水平。比较测量机制观察项目结构、载荷、截距与误差是否随群体变化。解释观测差异只有测量机制稳定,组间得分差异才可解释为真实差异。为什么比较之前必须检验等价性观测差异看到组间分数不同→排除偏差检验工具是否同样工作→确认资格确定可比较的统计量→解释差异归因于潜在特质测量等价性的四个层级形态结构与题项归属相同→度量因子载荷相同→标量截距或阈值相同→严格残差方差相同不同群体具有相同的因子数量与“题项—因子”加载模式形态等价(Configural)它回答“测量的结构是否相同”,是后续更严格检验的起点。形态等价的约束表达约束内容各组载荷矩阵具有相同的固定/自由参数模式。允许差异具体载荷值、截距和残差暂时可以不同。共同结构形态等价示例群体1和群体2均由F1解释X1、X2和X3。检验重点每个题项在两组中都归属于同一潜在因子。可得结论两组对构念的基本组织方式相同。在形态等价基础上,各群体的因子载荷相等度量等价(Metric)它回答“同一潜在特质变化一个单位,题项反应的变化是否相同”。度量等价的约束表达参数含义因子载荷代表题项与潜在构念的关联强度。比较资格成立后可比较相关、回归路径等变量关系。在度量等价基础上,各群体的项目截距或阈值相等标量等价(Scalar)它使群体间潜在均值的比较具有明确含义。标量等价的约束表达新增约束在载荷相等之外,再要求截距或阈值相等。比较资格成立后才能把潜在均值差异解释为真实水平差异。在标量等价基础上,各群体的项目残差方差相等残差方差等价(Strict)它要求不同群体受到的测量误差干扰具有相同大小。严格等价的约束表达新增约束载荷、截距及残差方差均跨组相等。使用原则要求最高,实践中是否需要取决于研究目的。四级测量等价:约束与意义层级新增约束主要解释资格形态相同因子结构确认构念组织形式一致度量因子载荷相等比较关联、回归与结构路径标量截距/阈值相等比较潜在均值严格残差方差相等比较误差控制后的观测表现达到什么层级,能做什么比较研究问题最低常用要求注意事项构念结构是否相同形态等价只能确认结构相似变量关系是否不同度量等价可比较相关与路径群体平均水平是否不同标量等价潜在均值比较需要截距等价观测分数与误差是否完全可比严格等价实践中较难达到时间变化纵向比较的最低警戒线同一工具在不同时间点也可能改变测量方式。均值变化只有更严格层级成立,平均分变化才不易混入量尺漂移。应用后果发展研究与干预评估都应先建立纵向不变性。理论基础:IRT与概化理论跨条件稳定理论基础的共同目标确保构念结构和测量特性不随群体、情境或时间改变。识别误差把不等价定位到项目参数或具体测量条件。建立共同量尺支持公平、一致且可解释的比较。用项目反应函数连接题目参数、潜在特质与作答概率IRT视角项目难度、区分度和猜测度可与被试能力置于同一潜在尺度。相对独立性IRT支持等价性检验的两项优势项目参数对具体样本具有相对独立性,便于跨群体比较项目功能。可比性链接与等值程序可把不同版本或时间点映射到共同潜在维度。诊断颗粒度能够在项目层面识别难度、区分度或猜测参数的异常。共同题目项目参数相对独立:阅读测验示例青年组与中年组完成相同的科技、文学、历史阅读题。参数估计分别估计同一题目在各组的项目特征参数。差异判断若同等能力下反应函数不同,则提示项目功能差异。IRT中的链接与等值不同施测群体/语言/时间不同→估计参数题目和潜在能力→量尺链接选择锚点与转换关系→共同尺度进行可比解释把测量误差分解为项目、评分者、场合等多个可识别来源概化理论视角它扩展了经典测量理论中“单一误差项”的处理。概化理论关注的方差来源来源可能表现对等价性的影响项目内容或难度变化不同版本题目不可比评分者宽严标准不同群体或时间得分系统偏移测量场合环境、时间与程序变化引入跨条件误差文化/语言翻译与背景知识差异形成特定群体偏差G研究与D研究的作用G研究估计多种方差成分→定位来源识别不等价条件→D研究比较备选测量设计→优化方案提高信度与等价性纵向条件概化理论与跨时间等价测验内容、施测情境和评分条件可能随时间改变。方差诊断分离题目难度变化与评分者主观差异。设计优化通过G研究和D研究选择更稳定的测量安排。多维分解概化理论与多维构念对人格、复杂认知或社会情感能力的各维度分别估计方差。定向修订定位某一维度在特定文化或条件中的不等价来源。条件控制据此修订量表并控制施测环境。IRT与概化理论的互补比较维度IRT概化理论主要单位项目与个体个体、项目、评分者、场合等侧面核心问题同等特质下项目反应是否一致哪些误差来源破坏可比性典型用途DIF、链接、等值方差分解、测量设计优化测量等价性与信度、效度信度等价性是信效度解释的前提工具在不同群体或条件下应保持一致、稳定。效度工具应在各群体中都测量目标构念,而非群体特有因素。结构性偏差若测量机制变化,信度和效度证据都会被削弱。项目语境GHQ-12跨年龄使用:不等价来源涉及职场压力的表述可能不适用于青少年。理解差异青少年与中老年人对同一项目的经验基础不同。测量后果量表不能以相同方式反映两组心理健康水平。随意作答GHQ-12:对信度的影响不理解或缺乏生活经验时,作答波动可能增加。跨时不稳同一青少年在不同时间的答案可能不一致。结论项目不适配会降低该群体的内部一致性与稳定性。目标构念GHQ-12:对效度的影响量表意在测量心理健康状况。实际反应部分项目反映的是生活情境适配,而非心理健康。结论得分不能充分代表青少年真实心理状态。识别提升信度:先控制不等价源头用IRT寻找项目反应异常,用G理论定位条件误差。修订删减偏差项目、增加平衡题项并改善编制程序。复核再次检验各群体的内部一致性、重测信度和等价性。大型企业员工满意度:企业规模造成情境差异层级多、部门复杂,沟通效率更易得到负面评价。小型企业结构简单、渠道直接,沟通项目更易得到积极评价。风险同一项目混合了满意度与组织结构差异。IRT员工满意度:多方法诊断比较不同规模企业的项目特征曲线与区分度。G理论估计企业规模与组织架构带来的条件误差。结论沟通效率项目是影响跨企业信度的重要来源。删除员工满意度:修订策略删减过度笼统且不适配企业规模的项目。平衡为不同规模企业增加更具情境针对性的沟通体验项目。标准化在编制程序中明确跨规模适用要求。截距等价效度检验:等价性与构念解释使均值差异可归因于潜在特质而非项目偏差。结构一致使各群体对同一构念的维度解释保持一致。证据整合把不变性检验纳入构念效度证据链。西方群体多元文化素养量表:结构变异认知、理解、尊重和跨文化交流等维度较清晰。东方群体集体主义与文化传承方式影响部分项目的加载关系。效度风险同一总分在两类文化群体中可能代表不同构念组合。多组SEM多元文化素养量表:诊断方案直观比较两类文化群体的构念结构。IRT检验各项目在不同文化群体的反应特征。G理论分解文化背景带来的误差方差。删减多元文化素养量表:优化方案移除受特定文化观念影响过大的项目。补充增加兼顾文化特色与共同构念的平衡题项。再验证重新收集跨文化信度、效度与不变性证据。等价性—信度—效度的证据链测量机制结构与参数稳定→误差控制各群体误差可接受→信度证据结果一致稳定→效度解释差异代表目标构念层级递进第一节小结形态、度量、标量与严格等价对应逐步增加的约束。理论互补IRT定位项目功能,G理论分解多来源误差。解释原则先确认量尺工作方式一致,再比较关系或均值。第二节测量等价性的检验方法六类检验方法概览方法最适合的数据/问题核心输出MG-CFA少量明确群体载荷、截距、残差约束比较ML-CFA个体嵌套于班级/组织组内与组间测量模型ML-FMM嵌套数据且存在潜在类别类别识别与类别特定参数DIF关注单个项目公平性项目反应函数差异贝叶斯近似小样本、复杂模型、允许微小差异参数后验与近似不变性对齐优化群体数量很多非不变项目与对齐后的均值/方差在多个已知群体中逐步施加参数相等约束,检验测量结构是否保持一致多组验证性因素分析(MG-CFA)这是测量不变性研究中应用最广泛的方法之一。MG-CFA基本测量模型(12-1)观测分数由项目截距、潜在因子的载荷贡献和残差共同构成。跨组检验比较各群体的载荷、截距与残差参数是否相等。公式(12-1)符号说明符号含义不变性角色j/n/i群体、被试与题项编号标记参数所属层次观测分数群体j中被试n在题项i的得分模型解释对象截距或阈值潜在因子为零时的期望得分标量等价约束因子载荷题项与潜在因子的关联强度度量等价约束残差测量误差或独特性严格等价约束MG-CFA的嵌套检验顺序形态模型相同结构→度量模型约束载荷→标量模型再约束截距→严格模型再约束残差模型设定步骤一:形态等价性各群体使用相同因子数量与题项—因子对应关系。参数状态载荷、截距和残差暂不要求数值相等。判定各组模型均拟合良好,支持共同结构。新增约束步骤二:度量等价性令不同群体对应题项的因子载荷相等。模型比较比较度量模型与形态模型的拟合变化。解释资格成立后可比较潜变量与外部变量的关系。新增约束步骤三:标量等价性在载荷相等基础上令项目截距或阈值相等。模型比较比较标量模型与度量模型的拟合变化。解释资格成立后可比较群体的潜在均值。前提潜在均值比较不是一个不变性层级先建立标量等价性。识别把参照群体潜在均值固定为0,估计其他群体均值。性质这是等价建立后的推断分析,而非新增层级。新增约束步骤四:残差方差等价性令不同群体对应项目的残差方差相等。含义各群体受到的测量误差大小一致。实践原则要求较高,可根据研究目的决定是否检验。常见拟合证据与解释证据关注点解释提醒整体拟合χ²、CFI、TLI、RMSEA等先确认每一级模型可接受嵌套比较Δχ²与拟合指数变化样本大时χ²可能过度敏感示例阈值CFI/TLI>.90,RMSEA<.08属于经验性参考,不能机械套用实质判断参数差异大小与研究后果统计显著不等于实践重要逐级比较MG-CFA的判断原则每次只增加一类约束,定位拟合恶化来源。目的导向关系比较重视度量等价,均值比较要求标量等价。综合证据结合整体拟合、拟合变化、参数差异与内容解释。直观MG-CFA的优势约束层级清晰,便于展示结构相似性。成熟在教育、心理与社会科学中应用广泛。可解释能够明确指出载荷、截距或残差在哪一级失配。复杂度MG-CFA的局限群体、因子和约束增多时计算负担迅速上升。收敛复杂模型可能出现不收敛或不恰当解。样本敏感小样本使估计不稳定,大样本又使χ²过度敏感。MG-CFA实践流程确认结构各组先独立拟合→逐级约束载荷→截距→残差→定位失配参数与内容复核→报告结论说明允许的比较把CFA扩展到个体嵌套于班级、学校、部门等层次结构的数据多层验证性因素分析(ML-CFA)模型同时解释群体内差异与群体间差异。独立性被破坏为什么普通CFA不够同一班级或组织中的个体往往彼此更相似。混合效应单层模型把群体内与群体间关系合并,可能产生错误解释。解决方案在不同层级分别建立测量模型并检验不变性。ML-CFA的两个层次层次分析单位示例变量Level1:个体层群体内部的个人差异学生成绩、个体行为、员工态度Level2:群体层班级、学校、部门等聚类差异班级均值、学校资源、组织氛围个体层测量模型(12-2)分解个体观测值由群体层成分、组内潜在因子和组内残差组成。W下标表示within,即群体内部层级。群体层测量模型(12-3)分解群体题项均值由总体截距、组间潜在因子和组间残差组成。B下标表示between,即群体之间层级。公式(12-2)与(12-3)符号符号含义层级j/n/i聚类、群体内个体、题项编号索引λW/ηW/εW组内载荷、潜变量与残差Level1λB/ηB/εB组间载荷、潜变量与残差Level2群体题项均值群体层面的题项成分连接两个层级组内模型与组间模型不能混为一谈比较维度个体层(Within)群体层(Between)解释对象同一群体内谁更高哪些群体整体更高载荷含义题项对个体差异的反映题项对群体差异的反映误差来源个体作答误差群体均值与聚类误差ML-CFA不变性检验顺序形态两层结构一致→度量层内载荷相等→标量层内截距相等→严格层内残差相等结构ML-CFA:形态不变性各比较群体具有相同因子数与题项加载模式。拟合同时检查个体层与群体层模型是否合理。示例男女组均用焦虑和抑郁因子解释同一组项目。约束ML-CFA:度量不变性对应群体或层级的因子载荷相等。检验比较约束前后的χ²与CFI、TLI、RMSEA变化。意义同一单位的潜在特质在各组引起相近题项变化。约束ML-CFA:标量不变性在载荷相等基础上进一步约束项目截距。检验评估模型拟合是否出现不可接受恶化。意义成立后可比较不同群体的潜在平均水平。约束ML-CFA:严格不变性在标量模型上令误差方差相等。意义不同群体受到的测量误差具有相似特性。选择不一定所有研究都需要达到该层级。研究目的决定最低不变性层级研究目的常用最低要求可支持的结论比较相关或回归关系度量不变性潜变量关系可比比较潜在均值标量不变性群体平均水平可比比较观测分数且强调误差一致严格不变性更强的观测可比性计算复杂ML-CFA的局限与挑战多层方差、协方差与参数估计提高计算难度。潜在异质群体内部可能存在未观察到的类别,单一模型不足。相似性假设文化与社会环境差异可能使共同结构难以成立。Level1学校教育质量量表:ML-CFA示例学生对课堂体验的个体差异。Level2班级资源、教师与学校环境造成的群体差异。检验目标判断量表在学生层与班级层是否测量同一构念。在多层结构中结合因素分析与潜在类别分析,识别未被观察到的群体异质性多水平因子混合模型(ML-FMM)同一模型同时回答“测什么”和“存在几类测量模式”。ML-FMM整合的两类模型因素分析估计潜变量与题项关系→潜在类别识别相似反应模式群体→多水平结构处理个体嵌套→不变性判断比较类别特定模型ML-FMM的关键特征特征解决的问题带来的价值多水平结构个体嵌套在群体中同时考虑个体与群体差异潜在类别识别类别事先未知发现相似测量模式的群体类别特定参数不同类别可有不同载荷与截距定位非不变性来源ML-FMM个体层模型(12-4)条件模型群体j属于类别k时,题项使用类别特定截距与载荷。目的允许不同潜在类别具有不同的测量机制。ML-FMM类别层模型(12-5)类别概率每个聚类单位具有属于各潜在类别的概率。概率约束K个类别概率之和为1。ML-FMM公式符号符号含义作用n/i/j个体、题项、聚类单位数据索引k/K潜在类别及类别总数异质性结构cj群体j所属潜在类别类别成员关系τik/λik类别k中的项目截距与载荷类别特定测量参数潜在因子/残差个体特质与未解释部分测量模型成分ML-FMM的基本步骤模型设定类别特定因子结构→类别识别估计类别数与成员概率→模型估计EM等算法与拟合指标→比较诊断检验参数差异与DIF理论结构步骤一:设定类别特定测量模型指定每个类别的因子数量与题项加载关系。参数自由允许不同类别具有不同载荷、截距和残差。识别要求模型复杂度必须与样本信息相匹配。估计步骤二:识别潜在类别通过潜在类别模型计算类别数量与成员概率。算法可使用期望—最大化(EM)等迭代估计方法。解释结合统计拟合与类别的实质意义决定类别数。指标步骤三:模型拟合与选择比较χ²、AIC、BIC等拟合信息。稳定性检查收敛、局部最优与多组起始值。简约性在拟合改善与模型可解释性之间权衡。类别比较步骤四:测量不变性与DIF检验不同类别的因子结构和项目参数是否一致。项目诊断定位类别间载荷、截距或反应函数不同的项目。处理根据理论修订、剔除或实施类别特定评分。灵活ML-FMM的优势同时处理层次结构与群体内部潜在异质性。精确避免把不同反应模式强行平均为一个模型。诊断可识别潜在类别与类别特定非不变项目。计算负担ML-FMM的不足需要较大样本与较高计算资源。设定严格类别数和因子结构不当会造成拟合偏差。数据敏感缺失值、异常值与局部最优会影响结果。MG-CFA、ML-CFA与ML-FMM维度MG-CFAML-CFAML-FMM群体信息已知少量群体已知嵌套层级潜在类别可未知内部同质假设较强层级内通常同质允许潜在异质关键步骤逐级跨组约束分离组内/组间模型先识别类别再比较参数复杂度中等较高最高在控制潜在特质后,检验不同群体对同一项目的反应概率是否仍存在系统差异项目功能差异(DIF)DIF定位的是项目层面的不公平,而不只是群体均值不同。DIF的无差异假设同等特质比较对象必须具有相同的潜在能力或特质水平。无DIF在条件相同后,群体身份不应再改变答题概率。先控制θDIF的条件独立性把群体真实能力差异从项目反应中分离出来。再比较群体检查组别是否仍能预测项目得分。识别偏差若仍有差异,项目可能包含群体特有因素。逻辑回归DIF模型群体主效应β₂反映均匀DIF:差异在各能力水平大致一致。交互效应β₃反映非均匀DIF:差异随能力水平变化。均匀DIF与非均匀DIF类型项目反应差异常见参数表现均匀DIF某群体在所有能力水平持续更有利难度/截距差异非均匀DIF群体差异随能力水平改变区分度或群体×能力交互DIF分析的基本流程准备数据群体、题项与能力信息→拟合IRT选择1PL/2PL/3PL→比较项目反应函数与参数→修订复核解释、修改或替换分组步骤一:数据收集与预处理明确性别、文化、年龄等参照组和焦点组。质量处理缺失值、异常值与不合理反应。可比保证各组的样本覆盖和测量条件可比较。模型选择步骤二:拟合IRT模型依据计分形式和理论选择1PL、2PL或3PL。参数估计估计项目难度、区分度与猜测度。拟合检查确认模型能有效描述各组反应数据。函数比较步骤三:DIF检验比较同等潜在特质水平下的项目反应函数。统计检验可使用卡方等方法检验项目参数差异。效应大小同时判断差异是否具有实际影响。内容复核步骤四:结果解释与修正寻找语言、文化、制度或角色约束等原因。处理选择修订、替换、剔除、分组标定或分组解释。重新验证再次评估工具的公平性、信度和效度。精细DIF方法的优势直接定位导致群体差异的具体项目。条件控制避免把真实能力分布差异误判为项目偏差。复杂适用IRT框架可处理多维数据与复杂项目结构。样本需求DIF方法的局限样本较小时统计功效和参数稳定性不足。计算要求复杂IRT模型的估计与链接较繁琐。分布假设群体潜在特质分布差异过大时解释更困难。主要维度多维性会改变DIF的解释测验希望测量的核心能力或特质。次要维度项目还可能调用语言、策略或情境经验。关键问题次要维度究竟补充构念,还是引入无关干扰?辅助维度与噪声维度维度类型与目标构念的关系DIF解释辅助维度与目标相关,补充核心维度可能增强构念覆盖,不必然是不公平噪声维度与目标无关,反映语言、文化或策略造成虚假群体差异并削弱公平性正确解释DIF:先结构、后项目评估维度EFA/CFA/双因素/MIRT→识别来源主要、辅助与噪声维度→实施DIF选择恰当控制模型→内容解释修订并再验证项目DIF适用示例:5G满意度“你对手机的5G网络功能是否满意?”潜在偏差日本与巴西的网络覆盖和体验成熟度不同。解释策略结合当地网络可用性,避免把环境差异归因于产品能力。项目DIF适用示例:社交活动项目“你是否经常喜欢尝试新的社交活动?”潜在偏差年龄伴随时间资源、家庭责任和社交机会变化。处理增加情境限定、使用替代项目或采用DIF校正评分。允许跨群体参数存在小幅差异,并通过先验分布与后验推断判断差异是否可接受贝叶斯近似测量不变性适合“完全相等”过于严格、小样本或复杂模型的情境。贝叶斯基本测量模型(12-6)测量关系观测值由因子载荷、潜在因子与正态误差构成。近似思想跨组差异不必固定为零,可在零附近小幅变化。先验贝叶斯方法的基本思想用理论或既有研究表达参数在观察数据前的信念。似然描述当前数据对参数的支持。后验整合先验与数据,获得参数的不确定性分布。贝叶斯更新左侧后验分布:观察数据后对参数的认识。右侧似然与先验共同决定后验。近似不变性的先验表达中心载荷和截距的跨组差异以0为中心。宽度较小先验方差表达“允许微小但不允许任意差异”。贝叶斯近似不变性的步骤建立模型CFA/SEM结构→设定先验不变参数差异近零→估计后验MCMC抽样→比较决策BF/后验预测检查测量模型步骤一:建立模型与先验依据理论确定因子与观测变量关系。先验来源可来自理论、既有研究或弱信息设置。透明报告说明先验选择及其对“不变”的实际含义。计算步骤二:估计后验分布使用MCMC等方法从参数后验分布抽样。诊断检查链的收敛、混合与有效样本量。输出得到参数的完整分布与可信区间。近似判断步骤三:检验与模型比较检验跨组参数差异是否集中在可接受区间。模型证据使用贝叶斯因子量化不同假设的相对支持。预测检查比较模型生成数据与实际数据的吻合程度。稳健贝叶斯近似方法的优势不必依赖大样本和严格正态分布。灵活易纳入缺失数据、非线性与复杂层次结构。信息完整后验分布直接呈现参数不确定性。计算贝叶斯近似方法的挑战MCMC可能耗时,复杂模型需要较高资源。先验敏感不恰当先验会改变估计与不变性结论。门槛需要收敛诊断、敏感性分析与专业解释。先验信息适用示例:疾病风险预测年龄、性别、吸烟和家族史已有临床证据。现实要求不同群体允许存在小幅生理差异,不必强求精确相等。方法价值把先验与新数据结合,评估模型的跨群体稳定性。通过重新标定各群体的因子均值与方差,最小化载荷和截距的跨组差异对齐优化(AlignmentOptimization)适合群体数量很多、完全不变难以成立的研究。对齐优化基本模型(12-7)群体模型群体g的观测值由群体特定载荷、共同潜在因子和误差构成。对齐目标寻找使大多数参数尽可能接近不变的量尺。对齐优化的目标函数示意最小化让群体间载荷与截距差异的总体复杂度尽可能小。解释少数非不变项目可以被识别,而无需强迫全部参数相等。对齐优化的基本步骤选择基准参考组与目标组→因子对齐调整均值与方差→迭代优化最小化参数差异→评估报告拟合与非不变项目参考组步骤一:选择参考组并进行因子对齐通常选择样本量较大、测量质量稳定的群体。目标组其余群体与参考组共同进入对齐过程。调整优化各组因子均值和方差,使参数具备共同参照。迭代步骤二:优化与模型评估最小化载荷、截距等参数的群体差异。定位识别对齐后仍明显非不变的项目。评估结合拟合、参数稳定性与实质解释判断可比性。高效对齐优化的优势减少大量群体逐级施加约束的工作量。适应能够同时处理多个群体。容错允许少数载荷或截距不完全相同。参数敏感对齐优化的挑战基准与优化设置会影响结果。模型依赖错误的潜在因子结构会造成对齐偏差。精度边界高精度参数检验仍可能需要MG-CFA或IRT补充。难题适用示例:20国消费者满意度逐一比较20个国家会产生大量模型与参数约束。对齐价值一次识别大多数不变项目及少数异常项目。应用定位外观偏好等文化敏感项目并调整量表或产品策略。测量等价检验方法的选用按研究问题选择方法如果研究具有……优先考虑理由少量、明确的比较群体MG-CFA层级清晰、解释成熟学校—班级—学生等嵌套结构ML-CFA区分组内与组间测量模型嵌套结构且内部存在未知类别ML-FMM同时识别类别和测量差异需要定位单个偏差项目DIF直接比较项目反应函数小样本、复杂模型或允许微小差异贝叶斯近似以先验和后验表达不确定性十几个或更多群体对齐优化减少多群体逐级比较负担按数据结构选择方法数据结构关键风险建议方法独立样本、已知组别参数跨组漂移MG-CFA/多组IRT聚类或嵌套数据组内相关被忽略ML-CFA潜在异质群体平均模型掩盖子群差异ML-FMM项目级二分/多分反应具体项目不公平DIF/IRT群体很多模型数量与约束爆炸对齐优化MG-CFA三类CFA方法:检验重点不同按照形态—度量—标量—严格的顺序比较已知群体。ML-CFA同时考虑个体层和群体层的方差、协方差与潜变量。ML-FMM先识别潜在类别,再比较类别特定测量参数。MG-CFA模型灵活性与复杂度结构较直接,适合简单群体比较。ML-CFA参数更多,但能正确处理层次嵌套。ML-FMM灵活性最高,也最依赖样本量、计算与解释。方法选择的四个判断研究目的关系/均值/项目公平→数据结构独立/嵌套/潜在类别→群体规模少量/大量群体→可用资源样本、软件与专业能力结构证据组合方法往往更稳健先用CFA类方法确认整体因子结构。项目证据再用DIF或IRT定位具体非不变项目。复杂情境必要时用贝叶斯或对齐优化处理近似不变与多群体。没有万能方法第二节小结群体数量、嵌套结构和潜在异质性决定建模框架。结论要具体报告达到的层级、非不变参数及允许进行的比较。公平靠解释统计显著、效应大小与项目内容机制需要共同判断。第三节测验等值与检验方法通过统计或测量技术,使两个或多个测验版本的分数具有共同意义和可比性测验等值(TestEquating)目标是消除形式、难度或内容差异,而非消除真实能力差异。测验等值的核心思想不同版本题目与难度不同→建立联系共同项目/共同被试→量尺转换CTT或IRT方法→共同解释等值分数可比较现实大学英语四六级考试示例每年试卷不同,原始分数分布也可能变化。要求相同英语能力的考生不应因年份或版本不同而获益或受损。等值目标把不同版本分数置于统一尺度,使成绩含义保持稳定。测验等值的四项基本假设公平性版本不影响等值分数→组间无关样本无系统能力差异→信度相等测量精度相当→构念同质测量同一心理特质具有相同能力的被试,无论参加哪个版本,等值后的分数都应相同公平性假设这是等值的根本目的,也是升学、招聘等决策公平的基础。要求样本组间无关性假设用于等值的样本组在能力分布等因素上不存在系统差异。风险组间能力差异可能被错误归因于测验版本难度。控制通过随机分配、代表性抽样或合理等值设计减少混淆。信度相等信度相等与构念同质不同版本的测量精度与误差波动应大致相当。构念同质各版本必须测量相同心理特质。反例数学逻辑推理与语文阅读理解不能仅凭分数相关进行等值。违反等值假设会发生什么被违反的假设直接后果决策风险公平性相同能力得到不同等值分数版本造成机会不平等样本组间无关能力差异被当作版本差异转换关系偏斜信度相等两版本误差幅度不同等值精度被高估构念同质分数含义不同建立无意义的对应关系测验等值方法地图理论框架主要方法核心信息CTT均值—标准差、线性、等百分位总分分布与分数对应关系IRT共同项目、共同被试、混合等值项目参数与被试能力的共同量尺按目标测验的均值和标准差,对原始分数进行线性位置与尺度调整均值—标准差法适合分数分布形状相似、关系近似线性的测验。均值—标准差转换(12-8)位置调整先以原测验均值为中心表示相对位置。尺度调整再按两测验标准差比例伸缩并平移到目标均值。公式(12-8)符号与假设符号/条件含义解释X原始测验分数待转换分数Yₓ与X对应的目标量尺分数等值后结果X̄/Ȳ两测验均值调整分布位置Sₓ/Sᵧ两测验标准差调整分布尺度核心假设分布形状相似、关系近似线性偏离越大,误差越明显均值—标准差法示例已知X量尺均值64、标准差8;Y量尺均值75、标准差10。转换X=68对应的Y量尺等值分数为80。优势均值—标准差法的优势与局限计算简单,能快速消除均值与标准差差异。局限无法处理明显非线性关系或分布形状差异。使用适用于内容相似、难度略有差异的测验版本。用线性函数把测验X的分数转换为测验Y量尺上的分数线性等值法参数a控制尺度伸缩,参数b控制整体平移。线性等值公式(12-9)比例因子a决定分数单位放大或缩小的程度。常数项b决定转换后分数整体向上或向下平移。线性转换参数a由两测验标准差之比确定。b由目标均值减去a倍原测验均值确定。分布要求线性等值法的适用情境两测验分数形状相似,均值与标准差差异不大。应用标准化考试、课堂测评与职业资格认证。限制分数关系显著弯曲时,单一直线不能准确对应。把两个测验中处于相同累计百分位的分数视为等值分数等百分位法它不要求两测验分布形状相同,可表达非线性对应。等百分位转换累计位置先求分数x在X分布中的累计百分位。反向映射再寻找Y分布中处于同一百分位的分数y。测验A等百分位法示例分数70位于第85百分位。测验B分数75同样位于第85百分位。等值结论在该群体分布中,A卷70分与B卷75分等值。非线性等百分位法的优势可以适应分布形状不同与弯曲的分数关系。少假设不必假设两测验分布都近似正态。直观“同一百分位”便于向使用者解释。样本量等百分位法的局限需要足够样本才能稳定估计分布与百分位。边界最低分和最高分附近的转换更不稳定。平滑实际计算常需统计平滑和专门软件。三类CTT等值方法方法关系假设主要优点主要限制均值—标准差形状相似、线性简单快速只校正位置与尺度线性等值线性对应参数清晰、易应用难处理非线性等百分位同百分位等值可处理非线性和不同形状样本要求高、边界不稳利用项目参数和被试能力的共同潜在尺度,对不同测验版本进行链接与等值IRT测验等值比只使用总分分布更能解释项目难度与能力差异。IRT量尺转换示意能力参数用A和B把X量尺上的能力转换到Y量尺。项目参数区分度与难度随量尺转换作相应调整。以两个测验中共享的锚题目为桥梁,对项目参数与分数尺度进行链接共同项目等值锚题必须稳定、覆盖内容且在各版本中具有相同功能。共同项目的两种设计设计共同项目的位置主要特点内嵌共同题目锚题直接包含在两个正式测验中施测自然,但锚题可能被识别独立共同题目锚题形成单独的小型模块便于控制,但增加施测安排优势共同项目等值:优势与要求能应对分布形状不同和非线性关系,参数解释细致。质量要求锚题数量、内容代表性与参数稳定性必须充分。开发要求应在测验开发初期规划共同题目。让同一组被试参加两个测验,以稳定的个体能力作为版本之间的连接共同被试等值适合缺少共同题目的测验,但必须控制顺序、练习与疲劳效应。优势共同被试等值:优势与局限无需共同题目,避免锚题质量不足带来的偏差。样本要求共同被试应具有足够规模和代表性。施测风险
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 医患冲突案例分析及预防
- 复合材质文物修复师操作管理测试考核试卷含答案
- 涂料调配工岗前评审考核试卷含答案
- 苯乙烯类热塑性弹性体(SBCs)装置操作工风险识别测试考核试卷含答案
- 船舶货运员岗前技能认知考核试卷含答案
- 船舶木塑工安全防护强化考核试卷含答案
- 飞机任务系统装调工岗前技能安全考核试卷含答案
- 纺织品文物修复师岗前安全教育考核试卷含答案
- 石墨化工安全培训考核试卷含答案
- 金属船体制造工岗中基础晋升考核试卷含答案
- 蓄热式热力焚化炉阀门切换时序检查作业指导书
- 基坑深层水平位移监测施工方案及工艺方法
- GB/T 5124.1-2026硬质合金化学分析方法第1部分:总碳量的测定重量法和气体容量法
- 华为运输包装设计规范(内容系统全面)
- 2026年上半年教师资格证考试信息技术学科真题及解析附答案
- 隐翅虫皮炎防控科普
- 通辽医院医疗垃圾原位处理建设项目环境影响报告表
- 涉氨考试题(ABC及答案)
- 跨境电商直播内容设计与互动策略
- 设备点检制度规范
- 市政排水管道施工土方开挖方案
评论
0/150
提交评论