心理基础及其测量 8_第1页
心理基础及其测量 8_第2页
心理基础及其测量 8_第3页
心理基础及其测量 8_第4页
心理基础及其测量 8_第5页
已阅读5页,还剩121页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

心理测量第七章概化理论Psychometrics李英武董妍中国人民大学心理学系第七章学习导航第一节概化理论概述测量目标、测量侧面、全域分数、误差观点及G研究与D研究。第二节单侧面与双侧面设计交叉与嵌套结构、方差分量估计、概化系数与依赖度指数。第三节其他测量设计固定侧面、随机侧面、交叉设计、嵌套设计与混合设计。核心问题内容提要复杂测量中,如何区分试题、评分者、时间与情境等多种误差来源。基本方法把实验设计与方差分析引入测量理论,对不同侧面及其交互作用进行分解。决策价值先用G研究诊断误差,再用D研究比较测量方案与资源配置。记忆学习目标(一)识别概化理论、测量目标、测量侧面、全域分数、G研究与D研究。理解解释概化理论如何扩展经典测验理论的误差观点。应用根据测量情境识别侧面,并选择单侧面或双侧面设计。分析学习目标(二)比较交叉、嵌套与混合设计的结构及方差分解特点。评价利用方差分量与概化系数判断测量设计的精度和成本。概化理论

测量目标

测量侧面

全域分数

G研究

D研究关键词测量目标案例背景:高二化学能力测验教师希望评估学生相对稳定的化学学科能力。传统做法使用内部一致性或重测信度估计总体随机误差。现实问题测验结果还会受到题目、评分者、环境和学生状态的影响。经典测验理论容易合并的误差来源误差来源案例表现可能后果测验环境教室嘈杂程度不同同一学生在不同场所表现不一致评分者实验设计题的评分标准不同主观题得分受评委影响试题知识点与题目难度不均总分偏向特定内容学生状态焦虑、疲劳或身体不适偶然波动混入能力评价教学资源学校实验设备与课程条件不同外部情境产生系统差异概化理论的案例分析思路界定目标化学学科能力→确定侧面题目、评分者和环境→分解方差估计各来源的贡献→优化设计调整题量和评分者配置案例思考:哪些条件需要概化,哪些条件应固定在当前测验中?第一节概化理论概述理论基础概化理论的提出概化理论在经典测验理论基础上,融合实验设计和方差分析。代表学者克伦巴赫等人系统提出并发展了概化理论框架。关注重点测量分数能否从当前条件推广到更广泛的测量全域。概化理论的三项特点特点基本含义测量价值随机平行测验测量条件可从全域中随机抽取比严格平行测验更符合实际方差分量分析把总变异分解到不同侧面及交互作用识别具体误差来源关注测量情境分数解释对应明确的条件范围支持更广泛的概化推论总体设想随机平行测验思想当前题目、评分者或测量场合来自更大的可接受条件全域。重复可能若重新随机抽取条件,可形成另一组随机平行观测。推论目标评价当前分数能否推广到这些可能条件。总变异方差分量分析观测分数差异由测量目标、各侧面及交互作用共同构成。分量估计研究者估计每一种来源对总方差的贡献。误差控制针对贡献较大的误差来源调整测量设计。条件依赖测量情境进入分数解释同一被试在不同试题、评分者或场合下可能得到不同分数。推论范围分数能概化到多大的条件范围,取决于设计与误差结构。解释要求报告测量结果时需要说明目标、侧面和推论全域。测量者希望通过测量工具和程序评估的心理特质或行为特征。

测量目标在多数教育测量中,测量目标是被试及其能力差异。间接性测量目标的三个属性心理特质本身不可直接观察,需要通过行为或反应推断。稳定性目标特质通常在一定时间范围内保持相对稳定。抽象性目标属于心理层面的构念,不能像物理量一样直接测得。测量侧面是指那些除了受试者(或考生)之外,所有可能影响测验得分的条件因素除测量目标外,所有可能影响观测分数的条件因素测量侧面常见侧面包括试题、评分者、时间、场合和测量形式。测量目标与测量侧面比较维度测量目标测量侧面研究角色希望区分和评价的对象影响分数的条件因素阅读测验例学生的阅读能力试题、文本类型、评分者方差解释有效的个体差异可能形成误差或条件差异设计处理通常作为分化对象可随机、固定、交叉或嵌套概化理论的分解逻辑观测分数当前条件下得到的结果→目标效应希望保留的真实差异→侧面效应题目、评分者等条件差异→交互与残差特定组合与偶然影响全域分数是指个体在一个完整的、所有可能的测量领域(全域)中的真实分数。全域分数全域分数对应明确的测量目标与概化全域。全域含义可接受的观察全域某个测量侧面所有可以接受的水平或条件集合。题目例所有符合测验蓝图要求、可用于测量同一能力的题目。评分者例经过培训并达到评分标准的全部潜在评分者。全域分数与经典真分数比较维度经典真分数全域分数基本含义无限重复测量的期望分数特定全域条件下的期望分数条件处理常把误差合并处理明确区分多个测量侧面稳定性理解强调相对恒定的真实水平强调目标与条件的依赖关系设计用途主要估计总体信度可比较不同测量方案条件数量全域分数的条件依赖性题目、评分者与场合数量会影响测量精度。条件结构交叉还是嵌套、随机还是固定会改变方差分解。概化程度推论范围越广,通常需要面对更多潜在误差来源。局部变化测量目标变化与全域分数从一般阅读理解转向科技说明文理解,目标范围缩小。目标转移作文评分若过度受评分标准支配,结果可能更多反映评分者。实践要求在解释同一数据前,先明确当前决策真正关注的测量目标。概化理论的数学模型总方差数学模型的基本思想把观测分数的总变异分解为多个主效应和交互效应。侧面来源试题、评分者、场合和时间都可形成独立方差分量。设计作用测量设计决定哪些效应可以分离,哪些效应只能合并。测量目标单侧面交叉设计示例30名中学生的数学推理能力。测量侧面从题库随机抽取10道试题。交叉结构每名学生都回答相同的10道题。单侧面交叉设计的分数成分成分统计含义测量解释总均值全体学生在全部试题上的平均总体基准被试效应学生平均表现的差异测量目标的个体差异试题效应题目平均得分的差异项目难度或质量差异交互与残差特定学生对特定题目的偏离个体与题目匹配及偶然误差单侧面交叉模型(7-1)分解观测分数由总均值、被试效应、试题效应和交互残差构成。识别完全交叉数据允许分别估计被试与试题效应。被试方差单侧面交叉设计的方差来源反映测量目标在个体之间的稳定差异。试题方差反映不同项目的平均难度或质量差异。交互方差反映特定被试对特定题目的特殊反应,并包含残余误差。单侧面方差分解(7-2)总变异等于被试、试题和被试与试题交互三个方差分量之和。G研究估计这些分量即完成当前设计的误差诊断。G研究结果从G研究转向D研究得到当前样本和设计下的方差分量估计。概化全域明确希望把结果推广到哪些题目或测量条件。D研究任务根据新的题量或条件配置重新计算误差与信度。D研究中的单侧面模型(7-3)符号变化大写侧面符号表示在概化全域条件样本组上求取的均值。全域分数被试在全部随机平行条件组上的期望表现。嵌套条件单侧面嵌套设计不同被试面对不同的题目样本,题目不被所有被试共同分享。典型情境每名学生从大题库中随机得到一套个性化题目。识别限制无法把试题主效应与被试和试题的特定交互完全分开。单侧面嵌套模型(7-4)模型结构观测分数分解为总均值、被试效应与嵌套残余效应。关键差异模型中不再单独估计所有人共享的试题主效应。嵌套设计的方差分解(7-5)被试方差反映测量目标的个体差异。嵌套残余方差合并题目差异、被试与题目关系及随机误差。嵌套设计的D研究模型(7-6)应用改变每名被试抽取的题目数量,预测新方案的测量精度。限制嵌套结构减少共同题目,也减少部分效应的可分离性。概化理论的误差观点简化方式经典测验理论的误差处理使用一个总体误差项代表多种未解释影响。主要问题无法说明误差来自题目、评分者、时间还是其他条件。实践限制难以针对具体来源调整题量、评分程序或施测安排。经典测验理论与概化理论的误差观比较维度经典测验理论概化理论误差来源通常合并为总体误差区分多个侧面及交互作用统计方法相关与单一方差分解实验设计与多方差分量分析分数推论聚焦特定测验条件评价向更广条件概化的程度改进方式提高总体信度针对主要误差来源优化设计概化理论中的误差来源侧面主效应评分者、题目或内容差异→目标与侧面交互特定被试在特定条件下偏离→侧面间交互多种条件组合产生差异→残余效应未分离的偶然影响测量目标被试差异属于有效变异不同被试在目标特质上的差异是研究者希望保留的变异。心理健康例被试抑郁水平不同,应在观测分数中形成可区分差异。解释原则有效变异与误差的界定取决于当前测量目标。误差性质评分者跨时间差异同一评分者在不同时间对同一作品评分不一致,主要反映随机波动。可能原因情绪、注意力和疲劳状态随时间改变。控制方法评分培训、评分锚点、分批平衡与重复评分。误差性质评分者之间的系统差异不同评分者长期采用不同严格程度,形成系统误差。可能原因评分标准理解、经验和个人偏好存在差异。分析方法把评分者作为独立侧面,估计其主效应与交互效应。试题差异试题与测量内容差异题目难度和设计质量不同,会形成试题侧面方差。内容差异语言、数学与逻辑等内容领域不平衡,会改变综合分数。控制方法依据测验蓝图抽样,并在G研究中分离题目或内容侧面。临考状态被试状态与外部条件身体不适、焦虑或注意力波动会造成随机误差。施测条件初测与复测环境、设备和时间安排可能产生系统差异。设计建议把重要条件纳入测量侧面,而不是全部留在残余误差中。排序关注相对误差达标判断关注绝对误差相对误差与绝对误差两类决策纳入误差方差的成分不同。相对误差与绝对误差的区别比较维度相对误差绝对误差决策目的区分个体在群体中的相对位置判断个体是否达到固定标准关注效应目标与侧面的交互及残余还包括侧面主效应与侧面间交互常见应用排名、选拔与常模解释合格判定、诊断与标准参照解释对应指标概化系数依赖度指数相对决策两类误差的直观理解若所有被试都被某位严格评分者同等压低,排名可能保持不变。绝对决策同一系统性压低会改变是否达到合格线,因此必须计入误差。选择原则先确定分数用途,再决定哪些方差分量属于误差。G研究与D研究识别并量化当前测量设计中的方差来源G研究G研究回答“误差主要来自哪里”。G研究的基本流程设计与收集界定目标、侧面和数据结构→方差估计分解主效应与交互效应→误差诊断识别贡献较大的误差来源→系数计算评价当前设计的精度拆解总变异方差分量估计的作用把被试、试题、评分者和情境等影响分开估计。确定薄弱环节比较不同方差分量,定位主要误差来源。支持设计调整为增加题目、评分者或测量次数提供量化依据。基本含义概化系数衡量当前设计区分个体真实差异的能力。数值解释系数越高,观测差异中可概化的目标差异比例越大。使用边界系数只对应特定目标、侧面结构和决策类型。识别主要来源G研究的实践意义例如评分者方差较大,提示评分标准不一致。比较误差结构判断题目、评分者还是交互作用更值得优先控制。提供D研究输入所有方案预测都以G研究的方差分量为基础。利用G研究结果预测并优化新的测量方案D研究D研究回答“怎样配置条件更有效”。G研究与D研究的分工比较维度G研究D研究核心问题误差来自哪些侧面如何配置侧面水平主要输入当前观测数据G研究方差分量主要输出各方差分量及当前系数备选方案的误差与系数典型操作估计题目和评分者效应改变题量、评委数或测量次数从G研究到D研究诊断当前设计估计各方差分量→提出备选方案调整题量或评分者数→预测测量精度计算误差与系数→权衡资源成本选择可实施方案第二节单侧面设计测量目标单侧面设计的符号约定通常记为p,可代表被试,也可代表其他分化对象。G研究侧面题目侧面使用小写i表示。D研究侧面概化全域中的条件组使用大写I表示。单侧面交叉设计与嵌套设计比较维度交叉设计嵌套设计条件安排所有被试面对相同项目不同被试面对不同项目样本项目主效应可单独估计与交互残余合并数据完整性每个被试与每个项目都有观测只观察部分被试与项目组合适用情境统一试卷或统一评分任务个性化题目或分工评分单侧面设计的可分离效应设计测量目标主效应侧面主效应目标与侧面交互单侧面交叉可估计可估计可估计并含残余单侧面嵌套可估计不能单独分离与侧面主效应合并交叉结构提供更多效应分离信息,嵌套结构更接近部分实际测量安排。被试例题:15名学生回答10道英语题从高一学生中随机抽取15人。试题每名学生回答相同的10道英语选择题。设计学生为测量目标,试题为单一侧面,构成完全交叉设计。学生作答数据(一)学生12345678910均值110000000000.10211000000000.20310100000000.20411010000000.30511100000000.30611111000000.50711110000000.40学生作答数据(二)学生12345678910均值811111100000.60911111110000.701011111101000.701111111111000.801211111111000.801311111111100.901411111111100.901511111111111.00题均1.00.87.80.73.60.53.40.40.20.07测量目标第一阶段:G研究设置15名学生,记为被试因素。测量侧面10道试题,所有学生共同作答。估计内容被试方差、试题方差及被试与试题交互残余方差。例题的平方和与自由度结果三个来源的平方和分别为12.160、11.994和12.806。G研究方差分量方差来源dfSSMS方差分量估计学生1412.1600.86860.0851试题911.9941.33300.0879交互与残余12512.8060.10240.1024被试、试题和交互残余三个来源均对总变异作出贡献。保持不变第二阶段:D研究设置继续使用G研究估计的方差分量。改变题量分别预测5、10、15、20和25题的测量结果。比较指标计算相对误差、绝对误差、概化系数和依赖度指数。D研究中的误差方差题目数510152025相对误差方差.0205.0102.0068.0051.0041绝对误差方差.0381.0190.0127.0095.0075题目数增加时,两类误差方差持续下降。D研究中的信度指标题目数510152025概化系数.8059.8930.9352.9435.9540依赖度指数.6907.8175.8701.8996.9190书稿示例显示,增加题量同时提高相对决策与绝对决策的稳定性。基本规律题目数量与误差变化题目数量增加后,题目效应与交互残余在平均分中的影响被稀释。边际收益题量较少时增加题目带来的精度提升更明显。成本约束题量继续增加会带来时间、疲劳和施测成本。共同趋势概化系数与依赖度指数的变化题量增加后,两类系数都逐步提高。数值差异依赖度指数纳入更多系统侧面效应,通常低于概化系数。设计判断应根据排名或达标用途选择目标系数,而不是只追求题量最大。单侧面D研究的决策步骤设定用途相对排序或绝对判定→提出题量形成多个可行方案→预测系数计算误差与精度→选择方案权衡精度、时间与成本双侧面设计一个测量目标与两个随机测量侧面组成的设计随机双侧面设计侧面可以完全交叉,也可以形成嵌套或混合关系。测量目标无领导小组讨论测评示例被试的综合能力。侧面一6个评价特质维度,如沟通、分析与团队表现。侧面二从评分者全域随机抽取7名评委。数据结构每名评委在每个特质维度上评价每名被试。双侧面交叉设计的七个方差分量类型方差分量测量解释主效应被试、特质、评分者三个因素各自的平均差异二重交互被试与特质、被试与评分者、特质与评分者特定两因素组合产生的差异三重交互与残余被试、特质与评分者未进一步分离的组合差异与随机误差双侧面方差分解(7-7)构成总方差由三个主效应、三个二重交互和一个三重残余分量组成。目标方差被试方差反映希望区分的综合能力差异。双侧面G研究的计算顺序计算均值获得边际、交互与总平均→计算平方和分解各效应的变异→计算均方平方和除以自由度→估计方差利用期望均方方程求解各层次与交互组合的平均数(7-8)用途这些平均数是计算各效应平方和与均方的基础。主效应平方和的计算原则比较每个因素的边际均值与总平均之间的差异。二重交互扣除两个主效应后,计算组合均值的额外偏离。三重残余扣除主效应和二重交互后,保留剩余变异。各效应平方和(7-9)说明每个平方和对应一个主效应、交互效应或三重残余来源。基本含义总平方和所有观测分数相对总平均的离差平方和。分解关系总平方和可以分解为各主效应、交互效应与残余平方和。检查作用各来源平方和之和应与总平方和保持一致。总平方和(7-10)计算对所有被试、特质维度与评分者组合的离差平方进行求和。计算均方的统计含义每个效应的均方等于对应平方和除以自由度。用途均方进入期望均方方程,用于求解方差分量。注意不同设计结构对应不同自由度和期望均方关系。各效应均方(7-11)说明主效应、二重交互和三重残余均有相应的均方。求解基础方差分量估计使用各效应均方的期望表达式建立方程。无偏估计通过均方的线性组合分离每个随机效应的方差。设计参数被试数、特质数和评分者数进入估计公式。主效应方差分量估计(7-12)主效应分别估计被试、特质维度和评分者的方差分量。交互效应方差分量估计(7-12)交互效应分别估计三个二重交互与三重残余方差。决策目标双侧面D研究:相对决策按综合能力对被试排序。分化对象被试是需要区分的测量目标。误差范围主要纳入被试与特质、被试与评分者及三重残余。相对误差方差(7-13)题目数量增加特质维度数可降低相关交互误差。评分者数量增加评分者数可降低评分者相关交互误差。概化系数(7-14)分子被试方差代表可概化的目标差异。分母由被试方差与相对误差方差共同构成。相对决策的方案比较备选方案测量成本比较重点6个特质、7名评委基准方案当前概化系数5个特质、7名评委减少一个特质特质数量减少的精度损失5个特质、5名评委同时减少两个侧面水平成本下降与信度下降的平衡增加评委或特质成本上升哪一种投入带来的系数提升更大决策目标双侧面D研究:绝对决策依据统一标准判断被试是否合格。新增误差还需纳入特质、评分者和特质与评分者交互的系统差异。结果特点绝对误差通常大于相对误差,绝对决策系数也更低。绝对误差方差(7-15)包含范围侧面主效应、侧面间交互、目标与侧面交互及三重残余都进入绝对误差。依赖度指数(7-15)分子被试方差表示目标差异。分母由被试方差与绝对误差方差组成。概化系数与依赖度指数比较维度概化系数依赖度指数决策类型相对决策绝对决策主要用途排序、选拔、常模解释达标、诊断、标准参照解释误差范围不含纯侧面主效应纳入所有影响绝对水平的侧面效应通常大小相对较高相对较低第三节其他测量设计固定侧面与随机侧面比较维度固定侧面随机侧面全域关系观察样本等于目标条件全域观察样本来自更大条件全域替换性当前水平不可被任意替换未抽中水平可同等替换当前样本推论范围只解释当前固定水平推广到侧面全域典型例高考的固定科目组合从大题库随机抽取试题样本比例随机侧面的两个条件实际观察的侧面水平数远小于侧面全域容量。随机抽取当前水平从全域中随机选择,未抽中水平可同等替换。理论结果概化模型采用随机效应,并支持向侧面全域推广。每个侧面水平都与其他侧面的每个水平相互接触交叉设计完全交叉设计提供所有因素组合的观测。高考科目固定侧面示例数学、语文、英语和综合构成预先确定的测量内容。观察全域研究者只关心这些固定科目,不推论到其他科目组合。解释要求固定侧面效应是否属于误差,仍取决于具体决策目的。被试交叉设计示例10名考生。试题10道题目。组合每名考生都回答全部10道题,因此每个被试与每个项目都有观测。交叉设计模型(7-16)成分观测分数由总体均值、考生效应、试题效应和随机误差构成。用途可分别分析考生与试题对分数变异的贡献。一个侧面的每个水平只与另一侧面的特定水平接触嵌套设计嵌套结构缺少部分因素组合,某些效应无法单独分离。任务嵌套设计示例10名考生只完成两篇作文题中的一篇。分组5人完成第一题,另外5人完成第二题。关系每名考生只与一个特定作文题发生组合,形成嵌套结构。嵌套设计模型(7-17)嵌套效应考生效应在特定试题条件下定义。残余未解释的组合差异进入随机误差项。同一测量中同时存在交叉关系和嵌套关系混合设计适用于评分分工、分组施测等复杂条件。交叉关系混合设计示例每名考生都完成两篇作文。嵌套关系一半考生由评分员A评分,另一半由评分员B评分。分析价值

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论