分析计算机辅助英语口试中评分信度_第1页
分析计算机辅助英语口试中评分信度_第2页
分析计算机辅助英语口试中评分信度_第3页
分析计算机辅助英语口试中评分信度_第4页
分析计算机辅助英语口试中评分信度_第5页
已阅读5页,还剩10页未读 继续免费阅读

付费下载

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

PAGEPAGE1分析计算机辅助英语口试中评分信度1.引言主观题的评分方法重要有整体评分法〔holisticscoring〕和分析评分法〔analyticscoring〕。整体评分要求评卷员对考生的答题质量进行全面的评估,给出一个整体分数;分析评分则要求评卷员对试题考察的每种技能给出单独的分数〔Chi2001〕。评分信度是两种评分法的关重视点,相关研究结果也不尽一样。Klein等〔1998〕发现两种评分法信度相当,对学生排名影响甚少。Barkaoui〔2010a〕使用定性分析法观察评卷员的表现,发现整体评分让评卷员更关注学生的答卷,而分析评分使评卷员更留意评分细则;Barkaoui〔2011〕的研究还显示整体评分具有更高层次评卷员间信度,分析评分虽出现更大评分差别,但评卷员内信度更高层次。穆倩倩〔2010〕以为,分析评分在测试低水平学习者的写作能力时有更高层次的评分信度,而整体评分则在测试高水平学习者时信度更高层次。一些研究则表示清楚分析评分优于整体评分,这些研究发现分析评分法具有更高层次信度〔Goulden1994;洪佳敏2010〕,能为老师提供更多信息〔Bacha2001〕,评分严厉度更稳定〔Chi2001〕,能更好地促进学生白话能力发展〔Tuan2012〕,很好区分出考试的写作能力〔Wiseman2012〕等;HarschMartin〔2013〕的研究还表示清楚整体评分会掩盖一些差别,尤其是评卷员怎样使用各种评分指标的细节。当然,Xi〔2007〕也发现托福口试中分析评分实际上不能提供比整体评分更多的考生能力信息。冯蕾、高淑芬〔2012〕则建议写作评分宜整体评分和分析评分相结合。总的来说,分析评分法使评卷员更重视考察技能的每个方面,具有更高层次的信度,但费时费力〔Weigle2002〕;整体评分法操作简单,效率较高,但评卷员的评分着重点往往不同〔Nakamura2002〕。在使用方面,试题强调考生的全面能力时,人们常用整体评分法;试题着重检覆按生对完成任务的各种技能的把握情况时,分析评分更为适宜〔Kleinetal.1998〕。实际运用中,整体评分法多用于大规模考试,因培训评卷员更为方便且评分速度相对较快;而分析评分法常用于课堂测试,因评分结果可帮助老师诊断学生的学习情况〔Chi2001〕。当前国内外的一些大规模考试都含有白话考试。〔IELTS〕口试使用分析评分,重要包含流利连贯、词汇使用、语法使用和语音语调四个方面,关注语言质量〔BrownTaylor2006〕。托福〔TOEFL-iBT〕口试采取整体评分法,包括四项评价指标〔综合描绘叙述、表达传递、语言使用和主题发展〕〔Alderson2009〕。大学英语四级考试白话考试〔CET-SET〕采取分析评分法,从语言精确性和范围、话语的长短和连贯性、语言灵敏性和适切性,分四个等级对考生参与不同形式的口头交际的表现打分。英语专业四级口试也采取分析评分,从内容、语音语调、语法与词汇三个方面,分别评定考生等级〔优秀、良好、及格、不及格〕。现有研究重要讨论写作考试的评分,讨论口试,十分是基于计算机口试评分的研究还很少。国内一些大型考试已增长口试,考试形式也由过去的考官和考生面对面考试改为基于计算机的人机对话考试。评分根据考生的答题录音进行,评分方式也由以前的当面打分改为在专门的计算机平台上打分,降低了评分耗时。英语口试一般需要人工评分,评分标准是影响评分结果的重要因素,而且评分带有一定的主观性,评分信度一直是人们关注的焦点。分析评分信度较好〔Weigle2002〕,因而,有需要研究分析评分在大型计算机辅助英语口试中能否也具有较好信度。本文旨在回答下面三个问题:1〕分析评分与整体评分的结果能否有差别?2〕分析评分的评分员一致性怎样?3〕分析评分的分数维度差别怎样?2.研究方法2.1参与对象本研究的数据为国内某大型计算机辅助英语口试的评分记录。参与该考试的考生为某省报考高校外语专业的高三学生,英语总体水平偏高。每年考试人数约为5万人。该考试为能力水平考试,分为两部分:听力和白话。白话部分第一题为模拟朗读,除了考察考生的语音语调,还考察考生模拟录音朗读的能力;第二题为口头表达,考察考生用英语进行思维和表达的能力,考生根据某一话题下的三个引导性问题进行叙述或讨论。由于英语表达能力是该考试考察的重点,本文仅讨论口头表达部分的评分情况。考生使用专门考试软件加入考试,其白话录音被考试软件记录并上传至效劳器,由评卷员在专门评分软件平台上打分。考生录音由电脑随机分配给每位评卷员。整体评分量表分为五个等级,每个等级从内容完好性、语言正确性、语音语调、流畅度四个方面进行描绘叙述;分析评分量表分别对四个方面进行描绘叙述,每个方面的描绘叙述分为五个等级,例如,语言正确性在每个等级的描绘叙述分别为:1〕能用适宜的词汇、短语、语法构造组织话语;2〕基本能用适宜的词汇、短语、语法构造组织话语,只要个别地方出现毛病;3〕有时不能使用适宜的词汇、短语、语法构造组织话语;4〕使用的词汇、短语、语法构造大部分不正确;5〕不能使用适宜的词汇、短语、语法构造组织话语。16位评卷员对5216名考生口头表达部分进行评分。16位评卷员均为非英语本土语大学英语老师,其年龄、教龄各异,英语水平均达纯熟水平,大部分为女性,平均分为两组,一组使用整体评分法评分,另一组使用分析评分法评分。该口试以往一直使用整体评分,大部分评卷员未有使用分析评分的经历。2.2评分经过正式评分前,对两组评卷员分别集中进行了培训。培训内容包含评分量表讨论和范文试评。要求组长把握好其组员对评分标准的理解,由组长带动所有组员参与评分标准的讨论,组长从组员的反应中了解组员对评分标准的理解。在讨论之初,评卷员以为分析评分比较耗时、复杂,且难操作,在对某个方面打分时,容易不自发同时考虑其它方面。经过较长时间的讨论,评卷员逐步熟悉分析评分量表。组长确保每位组员对评分标准达成共鸣后开展试评。为了帮助评卷员养成对每个方面单独打分的思维习惯,试评时选择了一些分项差别较大的范文,比方语音语调欠佳,内容较完好的范文。组长确保每位组员正确评价范文的情况下允许其正式评分。培训后,8位评卷员对2030名考生进行分析评分,其余8位评卷员对3186名考生进行整体评分。每位评卷员的评卷量在150-400份试卷之间。为了研究不同评分方法结果的一致性,对部分试卷使用了两种评分法评分,部分试卷进行了双评,评卷结果通过SPSS和Facets〔Linacre2012〕软件进行分析。3.结果3.1评分结果差别分析表示清楚,两种评分法下考生能力值的一致度不高,Pearson相关度为0.402.为了找出差别所在,我们将考生的整体评分和分析评分各分项得分进行多元回归分析。结果显示,分析评分法各项得分都有意义地解释了整体评分法得分的变化〔p.01〕。内容分项的相关系数为0.284;语言分项为0.509;流畅度分项为0.873;语音语调分项为0.438.这表示清楚评卷员使用整体评分量表时可能对流畅度考虑较多,对内容关注较少。该结果与已有研究结果类似,在使用整体评分时评卷员总会根据自己的喜好侧重某些方面,尤其语言精确度〔Barkaoui2010b;Huang2010〕。Eckes〔2012〕就指出评卷员以为主要的部分往往评分较严厉,而不是很主要的部分偏宽松。JinMak〔2013〕的研究也发现,在测试汉语白话能力时发音、词汇和语法起着最重要的作用。Sawaki〔2007〕发现某白话分析评分中,语法对整体分数的影响最高。3.2评分员一致性口试的评卷信度重要表现为评卷员一致性,包含评卷员间一致性〔inter-raterreliability〕和评卷员内一致性〔intra-raterreliability〕。评卷员间一致性指评分严厉度能否存在差别;评卷员内一致性指同一评卷员的严厉度能否受评分时段、疲惫度、评分对象等因素影响〔Bachman2000〕,由评卷员均方拟合统计量〔InfitMnSq和OutfitMnSq〕反映〔MyfordWolfe2004〕。如表1所示,8位分析性评卷员的分隔指数〔15.09〕、信度〔0.99〕以及8位整体评卷员的分隔指数〔10.29〕和信度〔0.99〕均表示评卷员的严厉度有差别。卡方检验显示,分析性评卷员间差别〔2=1264.9,df=7,p0.00〕和整体评卷员间差别〔2=815.4,df=7,p0.00〕均有显著统计意义,表示清楚两组评卷员的严厉度都有明显差别。当评卷员内一致性较高时,加权的均方拟合统计量的数值接近1,对于高风险考试的主观题评分〔Yang2010〕,均方拟合统计量过大〔非拟合〕表示评分行为不符合模型预测,过小〔过度拟合〕表示评卷员集中使用评分量表的某些等级。两种评分方法下,加权的均方拟合统计量的平均值都接近1,但使用分析评分法的评卷员的内一致性略高。评卷员2、11和13出现较明显的非拟合情况。评卷员2与模型预测结果差别较大的18项评分记录中,12项为语言分项,由此可见评卷员2没有能较好判定考生的语言能力。评卷员11和13〔整体评分法〕的评分记录中也有较多与模型预测差异不同较大的记录,两位评卷员都提供了一些不太可能的评分。评卷员11偏宽松〔严厉度-0.43〕,评卷员13偏严厉〔严厉度1.47〕,对部分考生的分数定级存在明显偏差。评卷员4、9的均方拟合统计量远小于1,两位评卷员可能过度使用了某些评分等级〔Linacre2012〕。统计分析表示清楚〔表2〕,评卷员4比较多使用等级四〔内容、语言、流畅度、语音语调的次数分别为213、246、162、213,均接近或跨越80%〕,尤其是对语言分项打分时,基本只使用等级四〔92%〕;评卷员9则太多使用等级三和四,使用次数分别为149〔32%〕和276次〔60%〕,两个等级加起来占了总数的92%.3.3维度和等级差别分析评分中,内容和语言分项双评记录的难度差别显著比语音语调和流畅度分项大。除此之外,内容和语言分项双评记录的难度值均有显著差别〔p.05〕,而流畅度和语音语调分项的双评记录难度差别并不显著〔p0.05〕,因而造成评卷员间差别的最大来源是内容和语言。测量误差决定试卷信度〔Bachman2000〕。古典测试理论假定所有考生的测量误差一样,但Rasch模型能够为每个考生提供单独的标准测量误差,测量误差能够通过信息函数得出〔余民宁1993〕。考试提供的信息越多,信度越高,测量误差越小〔Baker2001〕。分析评分法各分项的信息量分布较均匀;而整体评分的信息函数在4-6logits的范围内信息量几乎为0,说明考试对该范围考生的测量误差较大,评卷员不能很好地判定该能力水平段的考生。低能力水平考生的信息量比高能力水平考生的信息量高。由评分量表中各等级提供的信息量大小可发现,第一至三等级提供的信息量均比第四、五等级提供的信息量大,说明评卷员使用第一至三等级进行评分比使用第四、五等级更精确。评卷员对高水平考生的评卷精确度把握相对较差。分析还发现,获得语言侧面等级五的人数相对较少〔表3〕,反映出现今我们国家英语学习者比较难用适当的语言说话表达的特点。表4给出各维度间分数的相关度,各维度间相关度均不高,语言与其他三个维度的相关度相对较高,从某种水平反映出语言是考生在其他维度得分的关键因素。4.讨论4.1分析评分结果与整体评分结果能否有差异不同分析评分结果与整体评分结果一致度不高,但评卷员使用两种评分方法评分时基本上都围绕内容、语言、语音语调及流畅度四个方面来进行。评卷员在使用整体评分量表时更多关注语言、语音语调和流畅度,对流畅度关注最高,对内容的关注度相对较低。原因可能是判定内容完好性费时耗力,是口试评分的难点。然而,内容完好性是判定口头表达很主要的一部分,所以使用整体评分量表时应要求评卷员加强对内容侧面的看重。当前对白话考试评卷员行为的研究一般是基于研究者通过实验采集到的评分数据〔吕长竑等2008〕,使用真实考试数据研究评卷员行为的文献还不多。在正式口试评卷中,评卷员的工作量往往较大,由于考试具有较大风险,评卷员蒙受的压力也大,评卷员在这样的评卷条件下的评分行为、评分策略可能有所变化。例如,为了完成评卷任务,评卷员需要在短时间内评阅完多份试卷,由此造成的压力和评分策略和行为的改变还需进一步进行研究。4.2分析评分的评分员一致性怎样评卷结果总体上是可信的,但不同评卷员在使用两种评分方法时存在各种差别。要提升评卷员的评分质量,培训非常主要,及时的偏差分析结果反应能有效提升评卷质量〔Schaefer2008〕。本研究中,可与评卷员2讨论语言分项各评分等级的描绘叙述,了解该评卷员能否已正确理解各等级描绘叙述,并试评数篇范文。可与评卷员11和13重评有问题的试卷,并找出评分失误的原因。在8位分析评分评卷员中,评卷员4最宽容,严厉度为-2.19〔表1〕,因此应提醒该评卷员适当增长评分严厉度。评卷员9太多使用了第三、四等级,存在明显集中趋势。集中趋势是评卷员评分时采用的一个比较常见的安全策略,为了避免给出可能不恰当的极端分数,只使用中间等级分数〔MyfordWolfe2004〕。可邀请评卷员9试评数篇分数较低和较高的范文,并与其讨论评分结果。4.3分析评分的分数维度差别怎样内容和语言差别明显比流畅度和语音语调差别大。有评卷员反映,判定考生能否回答了所要求的内容比较考验评卷员的记忆力,听的时间越长,越容易忘记考生前面的讲话,回过头再听又费时,操作麻烦。对语言项打分时,有的评卷员往往只根据考生的前面几句话作出判定。相反,考生的流畅度和语音语调很快能够判定精确,较为容易打分。因而,评卷员培训的重点应该放在内容和语言两个分项上,采用技术手段协助或需要时强迫要求评卷员听完考生所有录音。与整体评分相比,评卷员使用分析评分各等级精确度更高层次。但评卷员对高水平考生判定精确度不如低水平考生。评卷员的英语纯熟水平可能是影响其评分误差的因素之一〔Lee2009〕,英语水平不高的评卷员可能没法精确区分能力较高的考生。因而,整体评分法对评卷员的英语水平要求可能比分析评分高,需要进一步研究确认该推断。考生最难获得最高等级分数的维度是语言。然而,数据分析结果显示语言在一定水平上决定了考生在其他侧面的分数。5.结论传统的做事测试的评卷方式是评卷员基于纸笔进行评分,随着现代技术的发展,基于计算机的评卷系统不断出现。研究也表示清楚基于计算机的评卷不只有与纸笔评卷同样好的信度,而且能够提升评卷质量,更有利于评卷质量的监控,加强试卷分发的随机性、隐蔽性〔Chuangetal.2008〕。本文使用真实考试数据,分析某大型计算机白话考试分析评分的效果。该白话考试举行集中评分,有利于对评卷员进行统一培训,评卷工作在数天内完成。评卷员在适当的培训后基本能较好适应和使用计算机评卷平台,使用分析评分比整体评分耗时较多,但在纯熟把握评卷技巧后,这种差距明显减少。进行整体评分时,评卷员没有能足够关注话题陈述的完好性,评卷员在两种评分方法下都具有显著差别,使用分析评分时差别较小,评卷员内部一致性也较高,使用整体评分法时较易出现集中趋势;评卷员在内容和语言分项较难达成一致,对高水平考生评分的精确度较低。今后评卷

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论