版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
/纳入协变量信息的多级计分认知诊断模型【摘要】在多级计分协变量认知诊断框架下,提出了一种可同时纳入连续协变量信息和多类别协变量信息的多级计分认知诊断模型GPDM-C,实现了其DINA形态的GPDINA-C的MCMC参数估计。模拟研究的结果显示,GPDINA-C拥有较好的属性/模式判准精度和参数估计能力,相较于未纳入协变量信息的GPDINA,GPDINA-C有更好的模型表现,在参数估计精度上有较大优势。实证研究的结果同样表明,GPDINA-C相比于未纳入协变量信息的多级计分认知诊断模型,能更好拟合实证数据,估计得到的协变量影响参数能客观反映真实情况。 1引言 在心理和教育学研究中,除了感兴趣的变量外,研究人员同时还会收集许多协变量信息,通常包括性别、年龄、地域、家庭社会经济地位等。Li,Hong和Macready(2015)认为协变量信息与我们所关注的建模变量具有重要关系。这些协变量信息常作为调节因子调节自变量对因变量的影响,或是作为控制变量加以控制,许多心理学研究均涉及协变量信息。例如,张莉、薛香娟和赵景欣(2019)以家庭社会经济地位作为协变量控制,构建纵向中介模型,发现农村留守儿童先前的学业成绩能预测随后的歧视知觉,但先前的歧视知觉不能预测随后的学业成绩,并且农村留守儿童的抑郁在学业成绩和歧视知觉之间起纵向中介作用。王玲晓、张丽娅和常淑敏(2019)在控制性别、年级和家庭社会经济地位后,发现母亲拒绝对儿童的同伴拒绝有显著正向预测作用,家庭环境纷杂度调节了母亲拒绝与同伴拒绝之间的关系,儿童外化问题行为在家庭环境纷杂度对母亲拒绝和同伴拒绝关系的调节效应中起完全中介作用。在项目反应理论(itemresponsetheory,IRT)中,考虑了协变量的影响后,可以对个体能力的估计和题目参数的估计起到积极作用。研究者们提出了一些纳入协变量信息的项目反应模型,例如,Li等(2015)比较了多种包含协变量信息的混合Rasch模型(mixtureraschmodel,MRM),发现在MRM中纳入二分类协变量时,被试能力估计精度有所提高,在纳入连续协变量时,被试能力和项目参数的估计都有所提高。Kahraman(2014)使用解释性IRT模型对计算机模拟病例考试(computer-basedcasesimulationtest,CCS)考生作答数据进行分析,分别以性别、反应时、项目顺序、选择题得分作为协变量纳入解释性IRT模型中,发现这些协变量信息均能提高模型对数据的拟合度。上述研究均表明,当纳入协变量信息后,模型参数的估计精度将得到提升,更拟合实证数据。 然而,在认知诊断评估(cognitivediagnosticassessment,CDA)相关的研究中,少有研究者考虑了协变量信息的作用。CDA是结合认知心理学和心理测量学优势而开发的新一代测验理论(陈秋梅,张敏强,2010;郭磊,张金明,宋乃庆,2019),可用于评估个体知识掌握结构和加工技能(Leighton&Gierl,2007),向学生和老师提供个性化指导和反馈(Rupp,Templin&Henson,2010),受到国内外研究者的广泛关注。认知诊断模型(cognitivediagnosticmodels,CDMs)作为CDA的关键,可以实现对个体知识状态的估计,正确选择CDM可以有效提高参数估计精度。绝大多数CDMs开发关注如何更好利用个体作答信息和题目信息提升个体知识状态的估计精度,例如为了更加拟合不同题目的属性连接形式而开发的不同属性连接规则的约束模型(DINA,Junker&Sijtsma,2001;DINO,Templin&Henson,2006;LLM,Maris,1999),以及包含多数约束模型的饱和模型(GDM,vonDavier,2005;LCDM,Henson,Templin,&Willse,2009;G-DINA,delaTorre,2011),能够处理多级计分测验数据的多级计分模型(seq-GDINA,Ma&delaTorre,2016;GPDM,Chen&delaTorre,2018;GPCDM,高旭亮,汪大勋,王芳,蔡艳,涂东波,2019),能够处理属性包含多水平信息的多分属性模型(pGDINA,Chen&delaTorre,2013)。但这些CDMs都忽略了协变量信息的重要作用。 在认知诊断框架下纳入协变量信息不仅可以在宏观层面更好估计个体能力值,还能在微观层面对个体的知识状态实现更精准的分类。研究能够有效提升分类算法精度的模型具有重要意义,因此,很有必要开发可处理协变量信息的CDMs。当前,仅有个别研究探讨了协变量信息在CDMs中的作用。Ayers,Rabe-Hesketh和Nugent(2013)以DINA模型为基础,利用logistic回归表征了协变量信息对属性掌握概率的影响,构建模型如下:为考生i在属性k上的掌握概率,分别为考生的性别信息(二分协变量)和前测成绩(连续协变量),是协变量对掌握概率的影响大小,是属性k的难度参数。之后,Park和Lee(2014)提出的协变量DINA模型(thecovariateextensionoftheDINAmodel)使用协变量信息分别对考生属性掌握概率和题目正确作答概率进行表征,其思路与Ayers等(2013)研究相似。Park,Xing和Lee(2017)构建的解释性认知诊断模型(explanatoryCDM)以IRT模型估计得到的能力参数作为潜在变量,与观测变量共同作为协变量表征了属性掌握概率和题目正确作答概率。上述研究结果表明,在加入协变量信息时,提高了个体的属性/模式判准率,以及题目参数的估计精度。 但这些研究存在以下不足,缺乏更广泛的普适性:(1)从大型测验(PISA,TIMSS,高考)到小型测验(班级测验),这些测验中存在大量多级计分题目(Chen&delaTorre,2018;Ma&delaTorre,2016),多级计分题目比二级计分题目能够提供更多信息,而目前的模型均基于二级计分DINA模型开发,不能在多级计分测验中处理协变量信息。(2)这些研究中包含的类别协变量仅为二分变量(如性别),不能处理诸如班级、年级、家庭社会经济地位等多类别协变量信息。因此,本研究旨在开发同时可以处理不同类型协变量的多级计分CDM,以推动CDA在处理协变量信息层面的研究。 2协变量多级计分认知诊断模型的构建 2.1基础模型的选择 对多级计分CDMs进行协变量拓广涉及对多级计分CDMs的选择。目前多级计分CDMs包括基于等级反应模型(gradedresponsemodel)开发的P-DINA(polytomousDINA,涂冬波,蔡艳,戴海琦,丁树良,2010)和GPDM(generalpolytomousdiagnosismodel,Chen&delaTorre,2018),基于连续比率模型(continuationratiomodel)开发的序列GDINA模型(sequentialGDINA,Ma&delaTorre,2016)以及基于分布评分模型(partial-creditmodel)开发的GPCDM(generalpartialcreditdiagnosticmodel,高旭亮等,2019)等。本研究选择GPDM作为协变量拓广的基础模型,其原因在于:相比于将题目参数设置在累计概率的P-DINA,GPDM将题目参数设置在条件概率上,这种表示方式更直接(Chen&delaTorre,2018),因为条件概率可以直接表示被试i在题目j上得分等级为c的概率,而累计概率表示得分从0至c的概率和,需要通过计算得到对应每个等级的概率值。GPDM、序列GDINA、GPDCDM的加工函数都是GDINA,但仅有GPDM满足GDINA的单调性假设,即掌握更多所需属性的考生不会降低正确作答的可能性(Chen&delaTorre,2018;Hong,Chang&Tsai,2016)。同时,GPDM的Q矩阵界定在题目水平上,而序列GDINA与GPCDM均将Q矩阵定义在类别上,得分步骤顺序要求严格,并且每个类别要求明确地与特定属性相关联,类别Q矩阵不总是适用在现实情境中(Chen&delaTorre,2018)。 2.2GPDM-C的测量模型 2.3GPDM-C的结构模型 利用logistic回归用连续协变量信息和分类协变量信息表征属性掌握概率,并将二分类协变量拓展为多类别协变量,表示为: 2.4缩减模型GPDINA-C与参数估计 由于GPDM本质是基于GDINA的多级计分拓广,所以GPDM-C也可以约束为各种简约模型以满足不同研究和现实情景的需求。本文基于模型简约性、更易使大众理解的考虑,通过对GPDMC约束,采用更易理解的题目猜测参数和失误参数,提供一种DINA形式的缩减协变量多级计分模型GPDINA-C,并采用MCMC算法基于R与JAGS软件,对GPDINA-C模型进行参数估计,GPDINA-C的JAGS代码见附录。GPDINA-C的表达式为: 3研究1:模拟研究 3.1研究目的 本研究有两个目的:(1)验证MCMC参数估计方法是否能精准估计GPDINA-C的模型参数,即模型的可识别性,以及在多级计分情景下的属性/模式判准率。(2)展示当数据存在协变量影响,而错误使用未能处理协变量信息的诊断模型时,会给参数估计结果带来的影响。 3.2研究设计 3.3结果 3.3.1GPDINA-C平均属性判准率和模式判准率 如表3所示,当题目质量为高或中等时以及测验长度较长时,GPDINA-C有着较好的属性判准率和模式判准率。纳入协变量信息的GPDINAC在高质量题目条件下,AACCR和PCCR在20题时的范围分别在0.961~0.970和0.844~0.871,当测验长度增加到40题时,AACCR和PCCR的范围分别提升至0.989~0.992和0.947~0.963;题目质量为中等时,AACCR和PCCR在20题时的范围分别在0.896~0.934和0.622~0.740,当测验长度增加到40题时,AACCR和PCCR的范围分别提升至0.0.952~0.961和0.813~0.841;题目质量为低时,AACCR和PCCR在20题时的范围分别在0.812~0.887和0.382~0.590,当测验长度增加到40题时,AACCR和PCCR的范围分别提升至0.873~0.923和0.552~0.708。题目质量和测验长度大幅度影响了模型的判准率。在相同题目质量情况下,协变量影响越大,模型的判准精度越高。例如,在测验长度均为20题、题目质量均为中等时,在低协变量影响下的AACCR为0.896,PCCR为0.622,中等协变量影响下的AACCR为0.909,PCCR为0.658,高协变量影响下的AACCR为0.934,PCCR为0.740。 在所有实验条件下,相比于未纳入协变量信息的GPDINA,GPDINA-C的平均属性判准率和模式判准率都更高,尤其是在题目质量中等或者较差的情况下,该结果表明,当数据受到了协变量影响后,使用未能处理协变量信息的GPDINA模型,将会对被试的知识状态估计精度带来恶化影响。协变量效应也影响了GPDINA-C相较于GPDINA的属性/模式判准精度的提升程度。具体而言,当协变量的影响越大时,GPDINA-C对GPDINA的属性/模式判准精度的提升越大。例如,在测验长度为20题、题目质量均为中等时,在低协变量影响下,AACCR提升了0.07%,PCCR提升了3.7%,在中等协变量影响下,AACCR提升了1.6%,PCCR提升了7.2%,在高协变量影响下,AACCR提升了2.9%,PCCR提升了11.6%;在题目质量均为低时,在低协变量影响下,AACCR提升了2.8%,PCCR提升了13.4%,在中等协变量影响下,AACCR提升了5.8%,PCCR提升了24.0%,在高协变量影响下,AACCR提升了8.0%,PCCR提升了27.4%。以上表明,在有协变量影响的测验中,GPDINA-C能够得到较高的属性/模式判准精度,参数估计方法有效。 3.3.2GPDINA-C模型题目参数估计精度 如表4所示,GPDINA-C在各实验条件下的题目参数估计精度均较好,bias范围为-0.0017~0.0011,RMSE范围为0.0119~0.0262。在绝大多数情况下,GPDINA-C的题目参数估计精度优于GPDINA,bias更接近0,RMSE更小,说明在有协变量影响的情景下,使用未能处理协变量信息的GPDINA模型,将会降低对题目参数估计的精度,这与前人在IRT领域的研究结果保持一致。当题目质量提高、协变量影响变大或题目长度增加时,GPDINA-C题目参数的估计精度会更好。 3.3.3GPDINA-C模型结构参数估计精度 如表5所示,GPDINA-C在各实验条件下的结构参数估计精度良好。连续协变量影响参数(β)的bias范围为-0.058~0.045,RMSE范围为0.016~0.068;分类协变量影响参数(γ)的bias范围为-0,086~0.088,RMSE范围为0.053~0.135;属性难度参数(δ)的bias范围为-0.060~0.077,RMSE范围为0.043~0.231。协变量参数(β、γ)的估计精度与题目质量和协变量大小有关,当题目质量越好或协变量影响越小时,协变量参数的估计精度越好。属性难度参数(δ)的估计精度与题目质量和协变量大小有关,当题目质量越好或协变量影响越大时,协变量参数的估计精度越好。 4研究2:实证研究 4.1研究目的 比较GPDINA-C与GPDINA在真实测验中的模型表现,验证纳入协变量信息的多级计分认知诊断模型在实际应用中的优势和适用性。 4.2实证数据 选择国际数学与科学趋势研究(TrendsinInternationalMathematicsandScienceStudy,TIMSS)2007年四年级数学评估测验考生的数据,共有1760名考生,包含10道二级计分题目和2道三级计分题目(第3和第10题)。考察了8个属性,测验Q矩阵由Lee,Park和Taylan(2011)所界定,如表6所示。 Park和Lee(2014)指出,数学和科学具有结构和功能上的关系,数学可以作为科学中的工具,科学也可以进一步刺激数学的发现(Li,Shavelson,Kupermintz,&Ruiz-Primo,2002),因此,科学成绩可以作为数学成绩的预测变量。在本测验中,考生的数学成绩和科学成绩存在显著正相关(r=0.83,p<0.001),所以本研究选择考生在科学评估测验的标准化成绩作为连续协变量信息用于预测考生的属性掌握程度。分类协变量是考生所在地区,共五组,这些地区的考生成绩有显著的差异(F(4,1757)=63.64,p<0.001,=0.13),这种地区的成绩差异也能作为被试属性掌握的预测工具。其中,270名考生来自中国香港地区(四年级数学评估测验成绩排名第一),294名考生来自中国台湾地区(排名第三),320名考生来自日本(排名第五),312名考生来自英国(排名第九),564名考生来自美国(排名第十三),美国作为基准组别。 4.3结果 4.3.1模型拟合比较 在贝叶斯方法下评价模型数据拟合的指标为偏差信息准则DIC(devianceinformationcriterion),该指标可由JAGS软件直接计算得出,公式如下: DIC的大小可以判断模型拟合的相对优劣,值越小说明模型对数据更拟合。分析得到,未纳入协变量信息的GPDINA的DIC值为32809.2,纳入协变量信息的GPDINA-C的DIC值为31518.7,说明纳入协变量信息的多级计分模型对这批真实数据的拟合表现更优。 4.3.2GPDINA-C的协变量参数 GPDINA-C的协变量影响参数β和γ的大小分别反映了连续协变量(科学成绩)与分组协变量(考生所在地区)对考生属性掌握程度的贡献。结果表明,科学成绩对考生属性掌握的影响大小β=2.16(SD=0.11),p<0.001,说明科学成绩可以显著正向预测考生的数学能力掌握程度;表7展示了分组协变量(即地区)对考生属性掌握的影响,即γ参数,以及各地区考生在这12题的平均得分。地区对考生属性掌握的影响与各地区的测验均值有显著正相关(r=0.97,p=0.006),表明GPDINA-C能很好估计分类协变量的取值,GPDINA-C能很好地拟合实际情况中分类协变量对属性掌握的影响作用。以上结果均表明纳入协变量信息的GPDINA-C可以提供GPDINA所不能提供的协变量影响参数信息,并且GPDINA-C能很好估计协变量影响大小,其估计值可以作为协变量影响考生属性掌握的评价指标。 4.3.3考生知识状态 GPDINA-C从28=256种知识状态中识别出1760名考生各自所属的知识状态。图6展示了考生数最多的前十类知识状态,属于这十类知识状态的考生占总考生数的95.5%。 图6考生各知识状态占总考生比例(前十类) 5讨论 5.1不足与展望 尽管本研究开发了能够处理多种协变量信息的GPDM-C模型,并给出其简约模型GPDINA-C的参数估计的MCMC算法,但仍有一些值得完善和思考的研究方向。 (1)在实证研究中,何时需要考虑协变量的信息,本研究给出如下建议:若协变量与测验所考察能力或属性有显著的相关关系,此时可以将该协变量信息纳入认知诊断模型中,在控制协变量信息的基础上,提高认知诊断模型的估计精度;若协变量与属性之间不存在相关关系,可以不纳入协变量,这也是结构方程模型,纵向数据分析,项目反应理论等研究中的常见做法。此外,也可从模型与数据拟合指标的角度去判断协变量信息是否应纳入,若纳入协变量信息后模型拟合指标变小,则说明纳入协变量信息后,模型更加拟合该批数据,理应纳入协变量信息,获得更精确的估计结果;反之则可以不纳入协变量。考虑到文章篇幅和研究的聚焦性,本研究未以GPDINA作为真模型进行探讨,未来可尝试模型的交叉比较。 (2)GPDM-C是对以等级计分思想为基础的GPDM进行的开发,而目前存在如基于连续比率模型(continuationratiomodel)的seq-GDINA,基于分布评分模型(partial-creditmodel)的GPDCDM等其他多级计分思想的模型,它们的计分逻辑不同,未来可基于不同计分逻辑探讨纳入协变量的影响。 (3)本研究在模拟和实证研究中约束了模型中的协变量影响参数(β,γ)在属性水平上相等,即协变量在所有属性上有相同的作用,这更适用于属性粒度较小的测验,例如同一个协变量对小属性加法和减法的掌握程度的影响相似,而可能不适用于属性粒度较大的测验;同一个协变量对大属性数学和语文的掌握程度的影响差异很大。未来研究中可以放松该限制,考察协变量在各属性上的不同影响。 (4)本研究涉及的协变量仅为一种连续协变量信息和一种类别协变量信息的影响,而在现实测验情境下,研究者收集了大量协变量信息,未来可以探讨纳入更多协变量信息时模型的表现,以及加入协变量交互作用时模型的表现。 (5)GPDM-C设定的协变量影响在属性水平,即协变量影响属性掌握程
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 2025年江西省吉安市中小学教师招聘考试试题及答案详解
- 2026辽宁盘锦市大洼区人民医院招聘合同制工作人员49人考试备考试题及答案详解
- 2026年山东省枣庄市街道办人员招聘笔试参考题库及答案详解
- 2026安徽安庆市安汇新能源科技有限公司招聘劳务派遣人员考试(项目建设部市场推广工程师)笔试模拟试题及答案详解
- 2026年常德市武陵区中小学教师招聘笔试参考题库及答案详解
- 2026年江西省抚州市街道办人员招聘考试参考试题及答案详解
- 跨境电算协同中算力负载跨国柔性迁移碳排放双重核算避免-基于国际碳排放双重核算避免协议与算力绿电碳核算互认机制规范分析
- 四川彝语考试题目及答案
- 2026年麻醉呼吸技能考试试题及答案
- 华夏航空支线龙头再启扩张
- 2026年重庆市“五方面人员”选拔乡镇领导班子考试历年参考题库(含完整答案)
- 家政保姆入户服务标准化礼仪规范
- 2026秋新教科版科学五年级上册教学课件:第四单元 第5课 岩石的类别与变化 有2个微课视频
- 2026年浙江基层法律服务工作者执业核准考试试题及答案
- 2026年幼儿园课程故事培训会
- 2025年全国检察官遴选考试真题及参考答案
- 2026年中国石油辽阳石化分公司校园招聘笔试参考试题及答案解析
- 2026年新水利安全员b证考试试题及答案
- 二年级上册数学【应用题乘法】80题(含答案)
- 2026年全国中考语文试题汇编-议论文阅读及答案
- 冶金安全评价标准考试试题及答案
评论
0/150
提交评论