认知诊断模型中被试参数估计方法的选择_第1页
认知诊断模型中被试参数估计方法的选择_第2页
认知诊断模型中被试参数估计方法的选择_第3页
认知诊断模型中被试参数估计方法的选择_第4页
认知诊断模型中被试参数估计方法的选择_第5页
已阅读5页,还剩2页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

/认知诊断模型中被试参数估计方法的选择【摘要】根据被试的反应数据获得精细化诊断信息,为研究者提供个性化的指导是CDM的主要目的之一。以往研究在DINA模型下比较了被试参数估计方法(MLE、MAP和EAP)的表现,但在实践中如何选择最有效的方法仍有待研究。本文从理论角度探讨了不同知识状态分布对被试参数估计方法的影响,并进行了模拟研究。结果发现:当属性之间相关时,EAP和MAP方法的分类结果相似并高于MLE。鉴于实践中属性一般呈中等或高相关,建议选择EAP/MAP作为被试参数估计方法。 1引言 认知诊断模型(cognitivediagnosticmodel,CDM),又称诊断分类模型(diagnosticclassificationmodel),是多维、离散的潜变量模型。CDM的主要目的之一是根据被试在诊断测验上的作答,对其在多维、细粒度属性(例如知识、技能或问题解决策略等)水平上进行分类,便于个性化的指导或干预(Ruppetal.,2010)。近几十年来,CDM广泛应用于心理与教育测量、精神疾病诊断等领域(李令青等,2019;Chenetal.,2015;Templin&Henson,2006)。CDM中对被试进行分类的方法就是被试参数估计,也称为潜在属性掌握模式或知识状态(knowledgestate,KS)估计。目前常用的被试参数估计方法有三种(汪文义等,2016;Huebner&Wang,2011):极大似然估计(maximumlikelihoodestimation,MLE;Bimbaum,1968)、极大后验估计(maxunumaposteriori,MAP;Samejima,1969)和期望后验估计(expectedaposteriori,EAP;Bock&Mislevy,1982)方法。 CDM中有三个重要部分:Q矩阵、项目反应模型和KS的估计(刘彦楼等,2017;Wang,2018)。Q矩阵指定了正确作答每个项目所需的属性,一般通过特定领域的专家进行经验设定或通过Q矩阵的估计及修正方法进行设定(蔡艳等,2015)。Q矩阵错误设定会对模型的参数估计值、拟合优度及被试参数的估计准确性产生严重影响(涂冬波等,2012;王晓庆等,2019;delaTorre&Chiu,2016;Liuetal.,2016;Rupp&Templin,2008)。项目反应模型描述了被试的属性掌握状况与正确反应行为之间的概率关系,可以分为一般化的与特殊的CDM两大类。G-DINA模型(delaTorre,2011)、LCDM模型(Hensonetal.,2009)等属于一般化的CDM,DINA模型(delaTorre&Douglas,2004;Junker&Sijtsma,2001)、DINO模型(Templin&Henson,2006)和A-CDM模型(delaTorre,2011)等属于特殊的CDM,对一般化的CDM加以适当约束可以获得特殊的CDM。Wang(2018)通过理论及模拟研究的方式探讨了Q矩阵正确但CDM错误设定时,使用MLE方法估计被试参数的表现,其研究结果表明Q矩阵的结构会影响被试分类结果的一致性。 Huebner和Wang(2011)在DINA模型下比较了MLE、MAP和EAP在估计被试参数时的表现。结果发现,就单个属性的分类准确率而言,EAP有较好的表现;就KS的判准率而言,MLE/MAP优于EAP。然而,其研究并没有解决在实践中如何选择恰当的被试参数估计方法问题。另外,研究中还存在两个主要问题:首先,其研究中假设项目参数和被试的KS分布是已知的。但在实际测验环境中,模型参数中的项目参数和包含被试KS分布的结构参数未知(Liuetal.,2021),都需在指定模型下从所观察到的被试反应数据中估计获得(刘彦楼等,2016;刘彦楼等,2017;Liuetal.,2016;Liu,Andersson,etal.,2019;Ruppetal.,2010)。其次,不恰当的前提假设使他们的研究在一定程度上混淆了MLE与MAP估计方法的差异,研究中使用均匀分布作为先验分布比较了MLE和EAP的表现,使用“高能力”(指掌握更多属性的被试比未掌握属性的被试占更大的比例)分布作为先验分布比较了MAP和EAP的表现,并没有在两种KS分布形态下直接比较MLE与MAP的分类结果。当KS为均匀分布时(需要说明的是,在实践中这几乎是不可能存在的),MLE和MAP的分类结果可能相等。但当被试的KS分布需要从反应数据中估计时,由于估计误差的存在,两者的分类结果不一定一致。 以往研究发现,在被试参数估计方法的选择中,通过被试作答数据估计获得的KS分布发挥着重要作用(刘彦楼等,2017;Liuetal.,2016;Liu,Andersson,etal.,2019)。由于CDM在实践中所考察的属性间一般存在中等或较高相关,意味着被试倾向于掌握或未掌握大多数属性,即被试的KS概率分布呈现两侧高而中间低的形态。本研究重点关注不同属性相关水平条件下的KS分布对被试参数估计方法分类准确性的影响,以下部分将首先具体阐述CDM中的MLE,MAP及EAP估计方法,并从理论上说明KS分布信息在以上三种估计方法中的作用,最后通过模拟和实证研究说明如何选择有效的被试参数估计方法。 2CDM中的被试参数估计方法 2.1MLE估计方法 Bimbaum(1968)首次使用MLE在项目反应理论中估计被试的能力值。设在CDM中被试所有可能的L种KS分布为α=(α′1…,α′l…,α′L)′,对于饱和的结构参数模型而言L=2K,K表示测验项目中全部属性的数量。xi=(xi1,…,xiJ)′表示被试i在所有J个项目上的二值作答反应,Pij代表被试i在项目j上的正确作答概率,其项目反应条件似然函数为: 在L种KS分布所对应的αl似然函数值中找到最大值,该值所对应的就是被试的被试参数估计值: 可以看出,使用MLE方法的估计过程并没有结构参数的参与,也就是说,MLE仅使用了被试的作答信息而没有考虑结构参数中所蕴含的被试整体分布信息。 2.2MAP估计方法 Samejima(1969)利用贝叶斯理论将被试的能力参数分布信息纳入到后验概率的估计中,提出了MAP。MAP也是基于单个被试作答反应的似然函数来估计被试参数,但不同于MLE方法之处在于,MAP综合考虑了被试的作答反应与结构参数信息。令模型中描述被试KS分布的概率表示为η=(η1,…,ηl,…,ηL),当使用同一链接函数时可直接简单表示为p(αl)=ηl。MAP将被试KS分布信息p(αl)融入到似然函数式中,构建出给定被试作答反应后每种KS的后验概率: 同样,在L种KS分布的后验概率中找到最大值,将其对应的αl作为被试i的被试参数估计值: 2.3EAP估计方法 Bock和Mislevy(1982)提出在项目反应理论和计算机自适应测验中使用EAP方法估计被试的能力参数值。不同于MLE和MAP使用似然函数或后验概率直接估计被试参数,EAP通过对各KS分布的后验概率求期望的方法,计算出每个属性的掌握概率的期望值,并以.5(也可根据研究目的自行修改)为切点将各个属性的掌握概率转换为被试参数估计值(李令青等,2019;Huebner&Wang,2011)。EAP方法中,每个属性的掌握概率可以通过如下矩阵乘法计算: 其中,α=(α1′,…,αL′)′是所有可能的KS向量组合而成的L×K维矩阵,P(α|xi)是L种KS后验概率的向量。 可以发现,EAP和MAP方法都将KS分布信息P(αl)考虑到了估计过程中,该分布信息会影响EAP和MAP估计方法的表现。从理论上而言,当KS分布为均匀分布时,MLE与使用.5为切点的EAP估计方法获得的结果近似一致,甚至可能出现MLE优于EAP的情况;当KS分布不是均匀分布时,EAP和MAP估计方法获得的结果可能优于MLE。 3模拟研究 3.1研究目的 通过模拟研究探讨被试KS分布对MLE、MAP和EAP方法的影响,并在多个评价指标下比较被试参数估计方法的准确率。 3.2研究设计 研究共操纵了五个自变量:属性相关水平、样本量、数据生成模型、属性数量和Q矩阵类型。属性相关水平有三种(ρ=0,.5,.8),分别对应于独立、中等和高度相关(Kunina-Habenichtetal.,2012;Liu,Xin,etal.,2019)。样本量有三个水平(N=300,1000,5000),分别对应于小、中、大样本量(Liu,Andersson,etal.,2019)。选择CDM中最具有典型性的四种项目反应模型生成数据:完全非补偿型模型DINA,完全补偿型模型DINO,非完全补偿型模型A-CDM以及可包含以上模型作为特例的饱和G-DINA模型。Q矩阵类型有两种:正确设定的Q矩阵及部分元素错误设定的Q矩阵。图1和图2分别呈现了本研究使用的有代表性的两个(K=3,5)Q矩阵(Liu,2018)。分别在两个Q矩阵中对部分元素进行错误设定,包括过度设定(将元素0改为1)、吝啬设定(将元素1改成0)和双重错误设定(将o和1互换),得到错误设定的Q矩阵(汪大勋等,2020;Kunina-Habenichtetal.,2012)。 图1K=3的Q矩阵 图2K=5的Q矩阵 模拟研究中猜测参数g从均匀分布(.1,.3)中随机生成,掌握了项目所需全部属性的被试的正确作答概率P(αi≥qj)从均匀分布(.7,.9)中随机生成(delaTorre&Douglas,2004;Liu,Yin,etal.,2019;Wang,2018),且假设所有主效应及交互效应参数相等。使用CDM包(Robitzschetal.,2020)生成被试作答反应矩阵,在GDINA包(Ma&delaTorre,2020)中使用同一链接函数下的G-DNA模型对反应数据进行拟合,使用MMLE-EM(maximummarginallikelihoodestimationviatheexpectation-maximization)算法对模型参数进行估计。迭代收敛后,分别采用MLE、MAP和EAP方法估计被试参数,每种实验条件重复1000次以获得稳定的模拟结果。 3.3评价指标 采用模式正确分类率(patterncorrectclassificationrate,PCCR),属性正确分类率(attributecorrectclassificationrate,ACCR),单个属性正确分类率(Skillk)及所有属性正确分类率的均值(Total)作为评价指标,值越大越好。其中,I(.)是一个向量函数,表示估计的属性掌握模式和真正的属性掌握模式是否相等。Skllk是属性正确分类率的κ值,pc表示偶然机会的一致率,取值.5。Total指在单个属性上的掌握模式正确分类率占所有属性的比率的均值。 图3当K=3时MLE、MAP和EAP在DINA模型中的表现 3.4研究结果 3.4.1属性之间独立时的结果 尽管以往研究发现属性之间呈中等或高相关(Kunina-Habenichtetal.,2012;Liu,Xin,etal.,2019),但为明确说明本研究的价值以及Huebner和Wang(2011)研究中存在的问题,首先呈现属性之间独立时的研究结果。图3中呈现的是在属性数量为3时,MLE、MAP和EAP在DINA模型下的表现。图4呈现的是在属性数量为5时,MLE、MAP和EAP在G-DINA模型下的表现(三种方法在G-DINA模型中的表现和A-CDM模型的相似,在DINO模型中的表现和DINA模型相似。由于篇幅原因,其余图可联系作者索取)。 根据图3,Q矩阵正确设定时,各样本量下MLE的PCCR较高,其他条件下EAP表现较好。Q矩阵错误设定时,在DINA模型中,MLE的PCCR,Skill2和Total优于其他两种方法,其他指标下三种方法结果相似。根据图4,无论Q矩阵正确设定还是错误设定,MLE的PCCR及在小样本量下的各指标优于EAP和MAP,其他条件下EAP表现较好。 图4当K=5时MLE、MAP和EAP在G-DINA模型中的表现 3.4.2属性之间存在相关时的结果 根据图3,无论Q矩阵正确设定还是错误设定,随着属性相关的增加,MLE、MAP和EAP的准确率都有所提升,且EAP和MAP的各指标高于MLE,属性相关越高,差值越大。唯一需要说明的是,Q矩阵错误设定时、中等相关下,MLE在Skill2上的准确率高于EAP和MAP,这主要是因为属性2发生了过度设定(Liuetal.,2021);高度相关下EAP表现最好。根据图4,无论Q矩阵正确设定还是错误设定,随着属性相关的增加,MLE、MAP和EAP的准确率都有所提升,且EAP和MAP的各指标高于MLE。 项目质量也是影响被试参数估计精度的一个重要因素。为提高研究结果的参考性,研究继续探索了项目质量对被试参数估计方法的影响,固定为三个水平:高质量项目参数(P(αi≥qj)=.9;g=.1),中等质量项目参数(P(αi≥qj)=.8;g=.2)和低质量项目参数(P(αi≥qj)=.7;g=.3)。结果发现,项目质量越高,MLE、MAP和EAP的准确率越高且三种方法之间的差异减小。Q矩阵正确设定时,无论项目质量高或低,MLE在属性独立时表现较好,属性相关时,EAP和MAP优于MLE;Q矩阵错误设定、属性之间独立时,无论项目质量高低,小样本量下,MLE表现最优;其他样本量下,MLE在PCCR和Skill2上最优,其他指标上EAP表现较好。属性相关时,中等质量条件下,MLE/MAP在PCCR和Skill2上表现较好,其他条件下EAP最优。 4总结与讨论 在CDM的实践中,结构参数对被试参数估计方法带来的影响是一个不容忽视的关键因素。本研究探讨了不同KS分布(结构参数)对被试参数估计的影响,得出了与Huebner和Wang(2011)有较大差异的结论,明确说明了在实践中应该如何选择恰当的被试参数估计方法。 刘彦楼等人(2017)从MMLE-EM算法和MLE-EM算法估计认知诊断模型参数的理论角度指出CDM中有两类参数:项目参数和结构参数。本研究从CDM实践应用角度出发,首次在项目参数和结构参数均从被试的反应数据中估计获得的前提下对MLE、MAP和EAP进行了比较。从理论上而言,MAP与MLE在均匀分布下的估计结果会比较接近,但因MAP和EAP中KS分布的估计值存在估计误差,而MLE不考虑KS分布的估计值,所以会出现MLE的估计值优于MAP和EAP中估计值的情况。当属性之间存在相关时,各指标下EAP和MAP的正确分类率优于MLE。这主要是因为,属性之间存在的中等或较高的相关使KS分布不再是均匀分布。在进行被试参数的估计时,EAP和MAP包含了被试KS分布的信息,从而使EAP和MAP估计方法的准确性会优于MLE。 研究结果同样表明,在固定测验长度后,随着属性数量的增加,所有评价指标下的准确率都有所下降。当Q矩阵错误设定时,MLE、MAP和EAP方法的准确率相对于Q矩阵正确设定时较低,原因是Q矩阵被错误设定会导致参数估计误差增大及诊断正确率的下降(Rupp&Templin,2008)。DINA和DINO模型下的分类率高于A-CDM和G-DINA模型下的分类率。这可能是因为DINA和DINO模型是仅包含两个项目参数的简化模

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论