具有认知诊断功能的区块化自适应测验的提出及验证_第1页
具有认知诊断功能的区块化自适应测验的提出及验证_第2页
具有认知诊断功能的区块化自适应测验的提出及验证_第3页
具有认知诊断功能的区块化自适应测验的提出及验证_第4页
具有认知诊断功能的区块化自适应测验的提出及验证_第5页
已阅读5页,还剩2页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

《心理学》2021年第02期/具有认知诊断功能的区块化自适应测验的提出及验证【摘要】CD-CAT以Q矩阵理论为基础,随着属性个数的增加,理想掌握模式的数量以指数的形式增加,这大大提高了计算难度,计算速度缓慢,判准率大幅降低。为了解决该问题,本文提出了具有认知诊断功能的区块化自适应测验(CD-BAT)。CD-BAT将单个的CD-CAT作为区块进行处理,把前一区块的信息作为先验信息用于后一区块的估计过程,并不断更新和修正前一区块的估计结果。模拟研究表明,CD-BAT的判准率略优于CD-CAT,题库质量下降时,这种优势逐渐加大。随着CD-BAT的区块的增加,其属性判准率呈现上升趋势。【关键词】CD-CAT;CD-BAT;区块化;“动态的”属性掌握模式 1前言 美国新的教育法案——《每个学生都成功法(EveryStudentSucceedAct)》提出根据儿童的学习需要使用适合年龄的、有效的、可信的筛选评价、诊断性评价、形成性评价和总结性评价。这是认知诊断评价(cognitivediagnosticassessment,CDA)从理论研究转向实践的重要契机。现有CDA的研究主要集中在模型的建构、Q矩阵的估计、在线标定等(高椿雷,罗照盛,喻晓锋,彭亚风,郑蝉金,2016;郭磊,杨静,宋乃庆,2018;汪大勋,高旭亮,蔡艳,涂冬波,2018;汪文义,宋丽红,丁树良,2018;詹沛达,陈平,边玉芳,2016;Chen&Wang,2016;delaTorre,2011;Li,Cohen,Bottge,&Templin,2015;Zhan,Wang,Jiao,&Bian,2018),其中具有认知诊断功能的计算机化自适应测验(cognitivediagnosticcomputerizedadaptivetesting,CD-CAT)是采用计算机化自适应的方式实现CDA。这种测验方式同时具有认知诊断和自适应的特点,可以使用较少的题目、较短的时间评价考生知识状态的掌握情况,这种及时、即时的评价适用于课堂练习,为教师的补救教学、学生的自我学习提供依据(刘舒畅,涂冬波,蔡艳,赵洋,2018;罗芬,王晓庆,丁树良,熊建华,2018;Chang,2015;Hsu&Wang,2015;Liu,Ying,&Zhang,2015;Zheng,2015)。 2问题的提出 现有CD-CAT的研究中,每个测验一般考察4~10个属性(高椿雷等,2017;罗照盛等,2015;Cheng,2009;Kaplan,delaTorre,&Barrada,2015;Zheng&Chang,2016;Zheng&Wang,2017;Zheng,He,&Gao,2018)。CDA以Q矩阵理论为基础,它将潜在多维空间划分为更细粒度的、离散的或者是二分的认知技能或潜在属性,从而评估学生在每个属性上的能力水平(涂冬波,蔡艳,丁树良,2012)。这种潜在属性的可能情况是有限的,例如当属性个数是3个时,理想掌握模式(idealmasterypattern)共8种情况,所有被试被分配到各种理想掌握模式中。随着属性个数的增加,理想掌握模式的数量以指数的形式增加的,如测验包含5个属性,所有可能的属性掌握模式的个数是2[5]=32种;当属性个数是12个时,这一数字增加到了2[12]=4096种,现有的CDCAT模拟研究很少涉及这种情况。在教学实践中属性个数超过10个的现象普遍存在。当对几个单元的内容统一考察时,一个单元包含5-8个属性,两个或三个单元则包含15~24个属性,随着属性个数增加,理想掌握模式的数量增加(如15个属性时,理想掌握模式增加到了32678个),在均匀分布的情况下将考生分配到各种属性掌握模式的计算难度增加,计算速度减慢,准确性大幅降低。这种计算所有可能属性掌握模式并将被试分配到其中一种的CD-CAT本文称为传统CD-CAT,当属性数量较多时,这种CD-CAT在现有的属性粒度水平下很难实现。为了解决CD-CAT考察属性个数限制的缺点,本研究提出了一种新的测验方式——具有认知诊断功能的区块化自适应测验(cognitivediagnosticblockedadaptivetesting,CD-BAT)。 2.1CD-BAT CD-BAT将单个CD-CAT作为区块进行管理,用来处理较少数量的属性,并将这些属性的处理结果作为先验信息用于下一个区块的CD-CAT的计算,从第二区块开始每个被试拥有一个“动态的”“独特的”理想掌握模式,减少了理想掌握模式的个数。几个不同区块的CD-CAT使用先验信息相联系,实现使用较少题目,处理更多属性、同时尽量保证不降低测验判准率的目的。 在对CD-BAT介绍之前,我们需要介绍一下CDA中的“理想掌握模式”的概念。 理想掌握模式也称为所有可能的属性掌握模式,它是指根据属性间的关系,符合逻辑的掌握模式,是一个0-1矩阵,“1”代表掌握了该属性,“0”代表未掌握。例如一个测验包含有4个属性,属性之间相互独立,则被试的理想掌握模式共2[4]=16种(涂冬波等,2012)。下表就是4个属性时的理想掌握模式。 在CD-BAT中,为了解决理想掌握模式数量过多的情况,提出了“动态”的理想掌握模式,即根据每个被试在之前测验中的表现,给予他不同的理想掌握模式,例如区块二包含8个属性时,将区块一所获得的被试的属性掌握模式作为先验信息,给每个被试一组理想掌握模式。这个“动态的”理想掌握模式是依据被试在之前区块的估计值和理想掌握模式获得的,因此是独特的,如区块一中被试最终的属性掌握模式是[0,0,0,0],在模块二中该被试理想掌握模式如表2,前4个属性是被试在之前模块中的估计值,后4个属性是2[4]=16种理想掌握模式。这样,每个被试的理想掌握模式的个数缩减为16种,不尽相同。“动态”的方式可以实现使用更少题目,诊断更多属性的目的。 2.2CD-BAT的实施过程 假设整个测验包含12个属性,CD-BAT的区块一只考察前4个属性,测验长度10题。将题库中只包含前4个属性的项目挑选出来,随机生成被试对前四个属性的初始的掌握模式,先验信息采用均匀分布生成,理想掌握模式种类是2[4]=16种。根据某一个选题策略选择出适合的题目,生成作答,采用最大后验概率(maxinumaposteriori,MAP)估计被试的属性掌握模式。依次循环往复直至10个题目完成,计算最终的被试的属性掌握模式。 CD-BAT的区块二考察了前8个属性,其中前4个属性的掌握模式在区块1中已经估计,测验长度10题。从题库中挑选出只考察前8个属性的题目作为这一区块的题库,区块一做过的题目不在挑选之列。将已经估计了的前4个属性的属性掌握模式作为真值代入到区块二中,采用伯努利分布生成后面4个属性的初始值。区块二中被试的先验分布不再是2[8]=256种,而是针对每位被试有一个独特的“动态的”理想掌握模式。采用选题策略选出题目,MAP估计被试的属性掌握模式。第一题作答结束后获得被试对8个属性的属性掌握模式估计值,需要注意的是前4个属性的掌握情况是根据区块一的估计所获得的,并不一定是正确的,需要在区块2中对前4个属性的掌握情况进行修正。测验依次进行,直到10题结束。 区块三考察了12个属性,题长10题。每个被试拥有独特的“动态的”理想掌握模式,由于前4个属性已经在区块二中进行了修正,为了减少对题库的要求,降低估计的难度,简化测验的过程,固定前4个属性的属性掌握模式,估计最后4个属性的掌握模式时修正中间4个属性的掌握情况。测验依次进行,最终获得被试对12个属性的属性掌握模式。每个模块的属性个数可以根据测验的情况灵活安排。在教学实践中,很多教学内容具有前后衔接的情况,如“加减乘除四则运算”,加法和减法相对简单,乘法和除法相对较难,在CD-BAT中,随着区块数量的增加,考察的属性个数越多,考生答对的概率降低,这同教学实践相吻合。 使用两个模拟研究对CD-BAT的效果进行验证,实验一是CD-BAT和传统CD-CAT进行比较;实验二计算三个区块的CD-BAT的判准率。 3实验 3.1实验1CD-BAT同传统CD-CAT比较 3.1.1实验条件 使用matlabR2015b自编程序。考察在相同实验条件下CD-BAT和传统CD-CAT判准率的差异。在众多认知诊断模型中,DINA模型相对简单,应用较为广泛,因此使用DINA模型进行模拟研究。 为了对两者之间进行比较,将测验的属性个数定为8个,属性之间的关系形式多种多样,这里只考虑属性之间相互独立的情况。测验长度20题。CD-BAT测验包含两个区块,每个区块考察4个属性,长度10题。 项目中每个属性的考察概率对测验的判准有影响,为此题库建设时考虑两种情况:简单Q矩阵和复杂Q矩阵。简单Q矩阵的设计是项目的每个属性被考察的概率为.2(Cheng,2009)。复杂Q矩阵中每个属性被考察的概率为.4,这种情况下每个项目考察的属性个数较多。从实际情况来说,项目考察的属性个数越多则测验的难度越大,判准的效果也会相应变差。项目的质量对测验的判准同样影响深远。为了考察不同项目质量下CD-BAT和传统CDCAT的表现,设置三种项目质量,三种题库中的项目参数S和G服从均匀分布,取值范围:优—U(.00,.15),良—U(.05,.25),差—U(.1,.3)。为了考察选题策略对CD-BAT的影响,选择两种选题策略PWKL和SHE。实验条件共包含2(CD-BAT,传统CD-CAT)2(简单Q矩阵,复杂Q矩阵)3(题库质量优,良,差)=24种。 题库中包含1000道题。被试人数为2000人,被试对于每个属性的掌握服从参数为.5的Bernoulli分布,随机生成2000个被试的真值。使用DINA模型计算被试正确作答概率,生成[0,1]之间的随机数,正确作答概率大于该随机数则作答为1,反之为0。MAP计算被试的属性掌握模式。 评价指标采用属性平均判准率(attributecorrectclassificationrate,ACCR)和模式判准率(patterncorrectclassificationrate,PCCR)。 3.1.2实验结果 表3是CD-BAT和传统CD-CAT的PCCR和ACCR。为了考察区块二对区块一的修正效果,同时报告了第一个区块结束后的四个属性的判准率。 从总体上来说,PWKL和SHE下CD-BAT和传统CD-CAT的判准率受到题库的属性查考概率和项目质量的影响,随着属性考察概率的增加和项目质量的下降,CD-BAT的优势逐渐显现。 首先对CD-BAT和传统的CD-CAT的判准率进行比较。在使用PWKL进行选题时,当题库质量是00,.15时,CD-BAT和传统的CD-CAT的PCCR没有差异,题库质量是05,.25属性的考察概率为20%时,二者的PCCR也没有差异。在其他三种情况下(.05,.25,40%、.1,.3,20%、.1,.3,40%),CD-BAT的PCCR值比传统的CD-CAT分别高出.046、.048和.021。当使用SHE进行选题时,判准率同PWKL非常接近,变化趋势也一致。 在CD-BAT实施过程中,为了提高测验的判准率,在第二个区块选题过程中同时对第一个区块的被试属性掌握模式进行修正从而提高对整个属性掌握模式的判准。为了考察这种修正的效果需要对四个属性和八个属性的判准率进行比较。通过数据分析可以发现题库质量对于这种修正起着至关重要的作用。以PWKL为例,当项目参数为00,.15时,四个属性和八个属性的判准率基本相同。随着题库质量的下降,两者差异逐渐增加。尤其是到了.1,.3,20%和.1,.3,40%时,四个属性比八个属性的判准率高了.1以上,差异较大。在对ACCR和PCCR进行分析时发现了一个有趣的现象。随着属性个数的增加,PCCR呈现下降趋势,ACCR却呈现上升趋势。通常情况下ACCR同PCCR的变化趋势是一致的,相较于PCCR,ACCR要舒缓很多。以传统CD-CAT为例,当采用PWKL作为选题策略时,.00,.15,20%下的PCCR是.9710、ACCR是.9960,.05,.25,20%下PCCR为.8720、ACCR为.9806,两个PCCR的差距为.1,ACCR的差距是.0154。由此可见ACCR之间的差异是非常小的,这种情况下,ACCR的一点儿提升就更加有意义。对上表中的结果分析可以发现,使用PWKL选题题库质量是.05,.25,40%下,四个属性的ACCR是.9619,八个属性的ACCR是.9779,提高了.016。.1,.3,20%下,提高了.0107。 图1PWKL和SHE下四个属性减去八个属性的ACCR和PCCR结果对比 注:横坐标1、2、3、4、5、6分别对应着题库0.00,0.15,20%、0.00,0.15,40%、0.05,0.25,20%、0.05,0.25,40%、0.1,0.3,20%和0.1,0.3,40%。 为了显示PCCR和ACCR的结果的反差,采用图例进行分析,使用四个属性减去八个属性的结果绘图。 上图是PWKL和SHE下四个属性减去八个属性的ACCR和PCCR结果对比。对PWKL图分析可以发现,四个属性的PCCR比八个属性要高,而ACCR则相反,八个属性比四个属性的要高。 六种题库质量具有非常明显的层次。首先项目的质量对判准率影响明显。通过分析还可以发现,属性考察概率对测验的判准率影响相对较小。 3.2实验2三个区块的CD-BAT 3.2.1实验条件 为了考察多个区块下CD-BAT的表现,将属性个数设定为12,分为3个区块,每个区块考察4个属性,测验长度30题。题库包含2000题。同样将题库划分为简单Q矩阵和复杂Q矩阵。简单Q矩阵中每个项目考察每个属性的概率为.2,复杂Q矩阵中每个项目考察每个属性的概率为.4。设置三种项目质量:优—U(.00,.15),良—U(.05,.25),差—U(.1,0.3)。被试的模拟,属性掌握模式的估计方法和评价指标同实验一。 3.2.2实验结果 表4显示的是三个区块CD-BAT包含12个属性时的测验判准率,同样报告每个区块的判准率。 当属性个数超过10个时,理想掌握模式的计算复杂,属性掌握模式的个数庞大,处理起来存在很大困难,因此传统CD-CAT的属性个数都控制在10个以内。为凸显CD-BAT的优势和特点,这个部分的研究是模拟三个区块12个属性时CD-BAT的表现。 为了清晰的显示三个区块的表现,报告了四个属性、八个属性和十二个属性下的PCCR和ACCR结果。当题库质量较好时(.00,.15,20%),三个区块的判准率是没有差异的,随着题库质量的下降,十二个属性的PCCR逐渐走低。如使用PWKL选题时,题库质量.05,.25,20%下,四个属性、八个属性和十二个属性的PCCR分别是.92、.8940和.8480,十二个属性比四个属性降低了.072。而三者的ACCR分别是.9790、.9855和.9860,十二个属性比四个属性的ACCR提升了.0070。.05,.25,40%下,四个属性的ACCR为.9595,八个属性的ACCR为.9798,提高了.0203。.1,.3,40%下,这个差异越来越大,十二个属性的ACCR比四个属性的高了.0388。对于ACCR这个差异是显著的。 图2.1,.3,40%时PWKL和SHE下ACCR和PCCR结果 为了清晰的说明PCCR和ACCR的相反的变化趋势,以.1,.3,40%为例进行绘图。 图2是以项目质量最差、考察属性最多的情况(.1,.3,40%)为例,展示出ACCR和PCCR随着区块个数的增加的变化趋势。随着区块个数的增加,ACCR逐渐提高,上升趋势明显,而PCCR逐渐下降。 4总结与讨论 传统CD-CAT随着属性个数的增加,理想掌握模式的类别以指数的形式增加,当属性个数过多时,很难准确的将被试分配到某一种理想掌握模式中,因此可以处理的属性个数一般不超过10个。在实际教学情境下,某一单元包含的属性个数可以控制在4~8个,当几个单元联合考察时,在原有粒度水平下就很难实行了。本研究提出了CD-BAT,采用给予每个被试独特的“动态的”理想掌握模式的思想,解决了以上问题。 通过对八个属性下两者进行比较发现,在题库质量较差时,CD-BAT要略优于传统CD-CAT。CDBAT首先使用题目对被试的前四个属性进行了考察,并将考察的结果作为真值代入到第二个区块中的八个属性的考察。在第二个区块实施过程中,会根据被试的作答对第一个区块所考察的四个属性的结果进行重新修正,这个过程有效地减少了前四个属性的误判率,提高了测验的判准率。因此CD-BAT判准率要高于传统CD-CAT。 在对数据进行分析的过程中发现了一个有趣的现象。传统CD-CAT实施过程中,PCCR和ACCR的变化趋势是一致的,PCCR降低,ACCR也会随之减低,ACCR的降低趋势要舒缓很多。以本文中的传统CD-CAT中,PCCR降低.

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论