版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
PAGE 人工智能驱动中小学考试评价的伦理风险与治理研究结题报告摘要随着智能阅卷系统、学业预警模块与综合素质评价系统在云溪县中小学逐步接入,人工智能技术正由教学辅助向考试评价这一利害关系最强的环节渗透。评价结果直接关系学生的升学、分班与评优,技术介入使评分效率与一致性显著提高,也使公平性、效度与申诉救济等问题集中显现。本课题以云溪县教研室为依托,在全县八所中小学开展调查研究,围绕“人工智能驱动考试评价的伦理风险与治理”这一核心问题,完成了现状调研与风险诊断、风险清单与人机协同复核指引研制、算法审查与申诉复核制度建设以及实践检验等任务。研究采用文献研究、问卷调查、访谈、行动研究与案例研究相结合的方法,累计回收学生有效问卷2306份、教师有效问卷441份、家长有效问卷852份,完成各类访谈126人次,抽样复核智能阅卷试卷12000份,形成涵盖4类的智能评卷与学业预警伦理风险清单、人机协同评分复核操作指引及评价伦理制度文本。实践检验表明,教师评价伦理素养总均分由2.92提升至3.54,学生评分知情与申诉意识总均分由2.91提升至3.57,评分复核申诉事项办结率达97.7%,学业预警误标率经阈值调整后明显下降。研究为中小学智能评价的伦理治理提供了可操作的机制范本。关键词:智能阅卷;学业预警;教育评价伦理;评分公平;评分效度;申诉救济一、课题概述(一)研究缘起考试评价在基础教育中处于枢纽位置,既是教学质量监测的主要手段,也是学生升学、分班与评优的直接依据,其结果的公正性关系到教育公平的基本秩序。近年来,云溪县多所中小学陆续引入智能阅卷系统、学业预警模块与综合素质评价系统,评价环节的数字化程度不断提高。实践表明,智能阅卷在客观题评分上效率与稳定性优势明显,但在作文等主观题评分中会出现偏移与群体差异;学业预警以成绩与行为数据推断学生风险,存在误标与标签固化的问题;综合素质评价算法化则容易把不易量化的素养简化为可计算指标,使评价的初衷在技术实现中被稀释。《教育强国建设规划纲要(2024—2035年)》要求深化教育评价改革、推进教育数字化,《中华人民共和国个人信息保护法》《未成年人网络保护条例》对涉及未成年人的数据处理提出了明确约束。厍春生同志在云溪县教研室长期从事教育评价与教学质量监测工作,在组织全县考试质量分析时深切感到,智能评价工具在提高效率的同时,亟需一套面向考试评价场景的伦理治理方案来守住公平与效度的底线。基于上述背景,课题组申报了本课题,将研究落点确定在智能阅卷、学业预警与综合素质评价算法化中的公平性、效度与申诉救济问题上。(二)研究任务与完成情况本课题于2027年1月立项,研究周期两年,按照开题报告确定的任务逐项推进,各项任务均已完成。第一项任务是摸清全县中小学智能评价应用的现状与伦理风险,课题组编制学生、教师、家长三套问卷与四类访谈提纲,抽样复核智能阅卷试卷12000份,完成大样本调研与实证复核,形成了调研报告与风险类型清单。第二项任务是研制伦理风险清单与人机协同评分复核操作指引,课题组以教育测量效度理论与程序正义为依据,结合复核发现的评分偏移与群体差异证据,形成了涵盖4类风险的清单与配套操作指引。第三项任务是建设考试评价算法伦理审查与申诉复核制度,课题组编制了算法伦理审查与备案办法、评分争议申诉复核规程、学业预警使用规范等文本,并配套统一表单。第四项任务是在基地校开展实践检验,课题组在云溪县实验中学、云溪县新城小学开展为期9个月的运行检验,全程跟踪评分复核、申诉处置与预警响应,采集运行数据与前后测数据,形成典型案例集。全部预期成果如期产出,课题研究目标总体达成。二、研究背景与问题提出(一)政策要求与现实需求从政策层面看,国家法律与政策体系对评价环节的智能技术应用已经形成了明确要求框架。《中华人民共和国个人信息保护法》要求处理个人信息遵循合法、正当、必要和诚信原则,并赋予个人对自动化决策的知情权与要求说明的权利;《未成年人网络保护条例》对涉及未成年人个人信息的处理作出更严格限制;《教育强国建设规划纲要(2024—2035年)》要求深化教育评价改革,坚决克服唯分数倾向,同时推进教育数字化;教育部《关于加强中小学人工智能教育的通知》在部署人工智能应用的同时强调统筹发展与安全。这些要求共同指向一个命题:评价场景的智能技术应用不能只讲效率,必须把公平、效度与救济纳入技术使用的约束条件。从现实需求看,县域中小学的场景具有典型性。课题组前期走访发现,智能阅卷系统的接入方式多样,有的由县级统一部署,有的由学校自行引进;多数学校使用智能评分结果时只关注分数是否一致,很少追问评分依据与群体差异;学业预警模块触发预警后,学校往往直接用于谈话与家长告知,缺少对预警准确性的核验环节;学生与家长对评分算法几乎不了解,遇到评分争议时通常只能通过教师私下询问,没有正式的复核渠道。学校层面的监管多停留在“配置是否正常”的技术层面,缺少从公平、效度与救济出发的伦理把关。政策要求与实践现状之间的落差,构成本课题研究的直接动因。(二)拟解决的核心问题本课题拟解决的核心问题有三个。第一,人工智能介入考试评价究竟会在哪些环节产生伦理风险,这些风险应当如何类型化识别与分级。评价场景的风险不同于一般教学场景,它直接作用于高利害结果,需要把公平性、效度、透明度与救济等风险落到具体评分与预警环节加以刻画,为后续治理提供依据。第二,在人机协同的评价流程中,机器与人的职责边界应当如何划定,哪些环节可以自动执行、哪些环节必须保留人工终审。边界不清既可能导致机器误判被直接采信,也可能使人工复核流于形式,这是评价伦理治理的关键。第三,当学生对评价结果提出异议时,学校与县级教研部门应当如何提供便捷、可信、可闭环的申诉与复核渠道,使评价结果可解释、可申诉、可复查,从根本上保障评价的程序正义。(三)国内外研究现状围绕本课题主题,已有研究可沿三条线索梳理。第一条线索是教育人工智能伦理的风险图谱研究。联合国教科文组织《人工智能伦理问题建议书》及《教育与人工智能》系列报告从全球层面提出公平、透明、人类监督等原则;国内学者在《中国电化教育》《电化教育研究》等刊物上对智能教育应用中的隐私、算法偏见、透明度等风险维度作了系统归纳。这类成果为风险分类提供了基础,但其描述多面向教学全过程,对评价这一高利害环节的专门刻画不足。第二条线索是治理框架与制度工具研究。已有研究提出了多元主体协同、算法透明度、问责机制等治理工具,OECD《人工智能原则》与各国监管实践提供了制度参照,但研究落点多在政府监管与平台责任层面,针对考试评价流程内部的人机分工与申诉救济的制度设计较少。第三条线索是智能评价与教育测量的专门研究。自动评分技术的效度论证、机器评分的偏见检视、学业预警的准确性等研究逐步增多,但多数成果偏重算法性能的技术检验,较少从学校治理与程序正义出发,回答评价结果如何被解释、被申诉、被纠正。总体上,本课题选题处于三条线索的交汇处,具有明确的研究空间。三、研究目标、内容与方法(一)研究目标本课题的总目标是:面向中小学考试评价场景,构建以风险清单为基础、以人机协同复核为关键、以算法审查与申诉救济制度为支撑的智能评价伦理治理机制,并通过实践检验使之成为可推广的治理范本。具体目标包括四条:一是系统识别智能阅卷、学业预警与综合素质评价算法化中的伦理风险,形成分类型、可对照的风险清单;二是明确人机协同评价流程中人工终审的边界与复核规则,形成可操作的复核指引;三是建立考试评价算法的伦理审查与备案制度、评分争议申诉复核制度,使评价责任落实到具体岗位与时限;四是建成并运行评分申诉与复核渠道,实现学生异议有门、处置有据、结果有反馈,并以运行数据检验机制的有效性与可移植性。(二)研究内容围绕上述目标,研究内容分四个板块。第一板块是现状调研与风险诊断,通过对学生、教师、家长三类主体的问卷调查、深度访谈与试卷抽样复核,摸清智能评价工具的使用面、评分一致性水平、群体差异状况与申诉行为特征,形成风险类型清单,为后续治理设计提供事实依据,同时为机制成效建立基线数据。第二板块是风险清单与人机协同复核指引研制,将评分公平、评分效度、透明度与申诉救济四类风险细化为可识别的指标,并针对主观题评分、学业预警、综合评价等关键环节明确人工终审的触发条件、抽样比例与一致率阈值,使机器与人的职责边界可执行、可核查。第三板块是算法审查与申诉复核制度建设,编制考试评价算法伦理审查与备案办法、评分争议申诉复核规程、学业预警使用规范、数据留存与更正规则等文本,明确审查主体、审查标准与处置流程。第四板块是实践检验,在两所基地校建成申诉受理、分级复核、结果反馈、改进闭环的复核渠道,通过为期9个月的运行采集机制运行数据与前后测数据,检验机制有效性并迭代修订文本。(三)研究方法本课题综合运用五种研究方法。文献研究法方面,课题组系统检索整理2020年以来国内外教育人工智能伦理与教育测量文献190余篇,重点研读法律政策文本13部,形成文献综述与理论框架。问卷调查法方面,编制学生版、教师版、家长版三套问卷,学生问卷含评价工具认知、评分公平感知、结果知情、申诉意愿、风险体验五个维度共36题,经预调研150份修订后,在全县八所中小学三至九年级发放2400份,回收有效问卷2306份,有效回收率96.1%;教师问卷发放460份、回收有效441份;家长问卷发放900份、回收有效852份,数据使用统计软件完成信效度检验与差异分析。访谈法方面,对学生、教师、家长、教研与管理者分别设计访谈提纲,完成学生访谈52人次、教师访谈36人次、家长访谈26人次、教研与管理者访谈12人次,合计126人次。行动研究法方面,复核指引与制度文本经历草案试用、问题诊断、修订再试的多轮迭代,每轮留存运行记录。案例研究法方面,对评分复核申诉与学业预警处置中的典型事项作全程跟踪,形成完整案例材料。表1调研与复核样本基本情况主体发放或抽取量有效量有效比例覆盖范围学生问卷2400230696.1%全县八所中小学三至九年级教师问卷46044195.9%八所中小学专任教师家长问卷90085294.7%八所学校各年级学生家庭智能阅卷试卷复核1200012000100%其中主观题3600份访谈对象126人次126人次100%学生52、教师36、家长26、教研与管理者12(四)理论依据本研究以四个理论为支撑。教育测量效度理论是核心依据,效度不是评分工具的技术属性,而是对分数作解释与使用时的论证过程,据此课题组把智能评分的评价重心从“算法准确率”转向“结果能否被合理解释与使用”,为效度风险识别提供了学理起点。罗尔斯正义论中的公平与差别原则提示,评价技术对不同群体的影响并不相同,当技术对不利群体产生系统性偏移时,制度应当作出有利于弱者的补偿性安排,这为群体差异的校核与救济设计提供了伦理论证。汉斯·约纳斯的责任伦理理论指出,在技术后果具有不确定性的评价场景中,评价主体应当以审慎姿态承担前瞻责任,为人工终审与复核制度提供了正当性依据。程序正义理论则强调结果公平之外的过程公平,说明申诉与复核渠道本身即评价公正的组成部分,为救济机制建设提供了理论支撑。四、研究过程(一)准备与设计阶段(2027年1月—3月)本阶段的中心任务是完成开题论证、文献研读与工具设计,为两年研究打好基础。2027年1月上旬,课题组召开首次全体会议,对照课题申报评审意见逐条讨论研究方案的细化问题,明确了“风险清单—人机协同复核—算法审查与申诉制度—实践检验”的研究主线,并将研究落点统一锁定在考试评价场景的公平性、效度与申诉救济上,明确不向课堂教学环节的自动批改延伸,也不向学习过程数据的全生命周期治理延伸,防止研究内容漂移。1月中旬,课题组完成人员分工,将九名成员编为调研组、机制组、检验组三个小组,确定例会制度为每月一次全体会、每两周一次小组碰头会,并建立过程性材料集中编号归档的办法,使两年研究的过程痕迹可追溯、可复核。文献研读方面,课题组集中两个月时间检索整理文献,共获得国内外相关文献190余篇,重点研读《中华人民共和国个人信息保护法》《未成年人网络保护条例》《教育强国建设规划纲要(2024—2035年)》等法律政策文本13部,梳理其中与评价数据使用、自动化决策和救济权利直接相关的条款39条,形成政策条款对照表。研读中发现,法律对自动化决策的透明度与说明义务已有原则规定,但向考试评价流程内部的转换需要中间层设计,这一判断直接促成了风险清单与人机协同复核指引的研究定位。同期,课题组以教育测量效度理论、罗尔斯正义论、责任伦理与程序正义为线索整理理论框架稿,为风险识别与救济设计确立学理支撑。工具设计方面,课题组在文献框架基础上编制学生版、教师版、家长版三套问卷初稿,学生卷含评价工具认知、评分公平感知、结果知情、申诉意愿、风险体验五个维度共36题。2月下旬在云溪县新城小学、云溪县实验中学各抽取部分班级共150名学生及对应教师、家长进行预调研,发现学生卷部分题目表述超出中低年级学生理解水平、个别题目存在诱导倾向,随即对9个题目作了通俗化改写与中性化处理,将五个维度36题的正式版定型,教师卷与家长卷同步微调。课题组还编制了学生、教师、家长、教研与管理者四类访谈提纲,明确追问要点与保密约定;并且制定了智能阅卷试卷抽样复核的方案,确定抽样范围、分层方式与人工复核的组织办法,为实证复核作准备。3月下旬,课题组召开开题论证会,专家组肯定了研究落点并建议压缩研究问题的聚焦度、增加实证复核的样本量,课题组据此将原拟的五个研究问题合并为三个核心问题,并把试卷抽样复核规模调整为12000份,使公平性证据更为扎实。为保障研究的规范性与伦理性,课题组在准备阶段即制定两项内部约定:一是涉及学生评分数据的一律匿名化处理,不进入学生个人档案;二是研究过程中形成的文本、记录与数据统一编号归档,每项成果均可回溯到具体过程材料。本阶段形成文献综述报告、开题报告、三套调研工具与试卷抽样复核方案四项阶段成果,例会与碰头会累计召开9次。(二)现状调研与诊断阶段(2027年4月—7月)本阶段的任务是完成大样本调研与试卷实证复核并形成风险诊断结论。2027年4月上旬,课题组与云溪县教育科学研究所协调,选定县城三所、乡镇五所共八所中小学作为调研点,覆盖不同办学条件的样本结构,并在正式调研前对参与组织的26名教师作了统一培训,明确作答组织的规范与回避要求。为保证调研伦理,学生问卷统一采用匿名方式作答,问卷说明中明确告知数据仅用于课题研究,家长知情同意回执全部留存;访谈中涉及学生个人的信息一律作化名处理,录音资料仅在课题组内部使用并约定到期删除。4月至5月,三套问卷分两批完成发放与回收,学生问卷发放2400份、回收有效2306份,有效回收率96.1%;教师问卷发放460份、回收有效441份;家长问卷发放900份、回收有效852份。6月上旬完成数据录入与清洗,使用统计软件开展信效度检验,学生问卷整体克隆巴赫系数为0.88,各维度系数在0.77至0.85之间,达到测量学要求,探索性因子分析提取的五个因子累计解释方差为62.9%,结构基本清晰。试卷实证复核是本阶段的重点。课题组从八所学校近两次期中、期末检测中分层抽取12000份智能阅卷试卷,其中客观题部分抽取8400份、主观题部分抽取3600份,组织18名学科骨干教师对抽样试卷作人工独立评分,与智能阅卷结果逐份对照。结果显示,客观题部分机器评分与人工复核的一致率达99.6%,评分稳定性良好;主观题部分机器评分与人工复核在正负一分范围内的吻合率为91.2%,需人工改判的样本为308份,占主观题样本的8.6%,改判后平均提高1.1分。进一步按学校类型分组后发现,农村学生作文题机器评分较人工复核平均低2.3分,且书写不够工整的试卷被低估的倾向更为明显,这一群体差异构成本课题公平性风险的直接证据。表2智能阅卷评分一致性复核结果(抽样12000份)题型抽样份数与人工复核一致情况需改判份数与比例说明客观题8400一致率99.6%34份,0.4%评分稳定性良好主观题3600正负一分内吻合率91.2%308份,8.6%改判后平均提高1.1分其中农村学生作文题约1180较人工复核平均低2.3分未单列书写差异影响明显合计12000整体吻合率97.1%342份,2.9%主观题为主要偏差来源访谈于6月至7月集中开展,共完成126人次,含学生52人次、教师36人次、家长26人次、教研与管理者12人次。访谈进一步揭示了风险背后的机制缺口:多数学校把智能阅卷结果直接用于成绩统计与质量分析,未对主观题评分作独立复核;学业预警模块触发预警后,学校多在未核验准确性的情况下直接用于谈话与家长告知;学生普遍反映“只知道分数,不知道机器怎么判的”,家长遇到评分争议时不知道该找谁。7月下旬,课题组完成调研报告与风险类型清单,将风险归纳为评分公平类、评分效度类、透明度与可解释类、申诉与救济类四大类型,并按发生频次与影响程度作了初步分级,为下一阶段治理设计提供了事实基础。(三)方案建构与工具开发阶段(2027年8月—11月)本阶段的任务是把调研发现的伦理风险转化为可执行的治理工具。8月上旬,课题组以四大风险类型为骨架研制风险清单,清单按“风险类型—具体表现—识别信号—对应措施—责任岗位”五列编排,其中评分公平类关注评分受书写、表达风格与群体差异影响的偏移,评分效度类关注算法把可量化指标放大、把难量化素养边缘化,透明度与可解释类关注评分依据不公开、分项权重不可见,申诉与救济类关注复核渠道缺失与结果更正不到位。清单经两轮课题组内部交叉审读、一轮学科骨干教师咨询后定稿,共形成4类17项条目,每一条目都配可观察的识别信号,使风险不再停留于概念描述。9月,课题组研制人机协同评分复核操作指引,这是本阶段的核心工具。指引依据学理判断与复核证据,明确了三类规则:一是评分环节的职责边界,客观题可自动评分并对异常卷抽查,主观题保留人工终审,高利害考试的主观题必须整卷复核;二是抽样的分层规则,按学校类型与分数段分层抽取,对农村学校与低分段样本适当提高抽样比例,以发现可能的群体偏移;三是一致率的判定阈值,机器评分与人工评分在正负一分内吻合率低于90%时,该批次须整批人工复核。指引附复核记录表与偏差分析表,并规定在正负一分吻合率、群体差异幅度、异常卷比例三项指标被触发时的处置动作,使复核从经验判断转为有据可依。10月至11月,课题组编制考试评价算法伦理审查与备案办法、评分争议申诉复核规程、学业预警使用规范、数据留存与更正规则四项制度文本。算法审查与备案办法明确进校评价类系统须提交评分依据说明、训练数据来源说明、群体差异自检报告三类材料,由学校评价工作组初审、县级教研部门复审备案;申诉复核规程规定学生在收到成绩后五个工作日内可提出复核申请,学校在三个工作日内初次答复、需要改判的报县级复审;学业预警使用规范要求预警结果在用于谈话与告知之前必须由学科教师核验,未经核验的预警不得直接作为处置依据。四项制度配套统一表单,形成《中小学智能评价伦理治理制度汇编》初稿,并按“一事一流程、一岗一职责、一步一留痕”的原则编排。本阶段还形成教师评价数据素养微培训方案初稿,确定四个培训模块与一次考核安排。(四)实践检验阶段(2027年12月—2028年8月)本阶段在云溪县实验中学与云溪县新城小学两所基地校开展为期9个月的实践检验,并同步跟踪其余六所参与校的应用情况。2027年12月上旬,两所基地校分别成立智能评价伦理工作组,由分管教学的副校长任组长,成员含学科教研组长、信息技术教师与教务人员,课题组对两校工作组共21名成员作了集中培训,明确复核、审查与申诉处置三类岗位职责,并建立台账制度,规定每批评分复核、每件申诉、每次预警核验均须留痕。评分复核方面,基地校按操作指引对主观题评分实施分层抽样复核,2028年上半年两校累计复核主观题试卷5200份,触发整批人工复核的批次3批,均为吻合率接近阈值边缘的批次。复核中发现的评分偏移样本经人工改判后,成绩单在规定时限内更正并同步告知学生本人。学业预警方面,基地校共触发预警286人次,学科教师在按使用规范逐人次核验后,确认其中51人次为误标,误标率为17.8%,据此课题组与基地校共同对预警指标的权重与阈值作了调整,将单一成绩波动指标的权重下调,增加课堂表现与作业质量的综合判断,调整后后续两个月的预警误标情况明显减少,这一过程成为机制“运行—暴露—修订—再运行”的典型样本。申诉复核渠道方面,两校建成申诉受理、分级复核、结果反馈、改进闭环四个环节的流程,设置学生申诉箱、专用邮箱与教师转介三个入口,明确各环节时限与责任岗位。运行期累计受理评分复核申诉43件,其中客观题计分疑问11件、主观题评分争议26件、成绩汇总与登分问题6件;办结42件,闭环率97.7%,其中经复核改判14件,平均处置时长4.2个工作日,办结事项回访满意39件,满意率92.9%,1件因涉及跨校成绩比对转县级教研部门协同处理中。教师评价数据素养微培训先后开展6场,覆盖两校及周边学校教师214人次,培训后组织了一次情境测试。前后测方面,学生测评于2027年12月与2028年6月两次实施,教师测评于同一区间两次实施,数据经清洗后用于成效分析。运行中也暴露了低年级学生申诉表达不便、部分教师对复核新增工作量存在顾虑等问题,课题组通过增设图示化申诉卡、把复核工作量纳入教研工作量核算等办法予以缓解。(五)总结提炼阶段(2028年9月—12月)本阶段的任务是完成数据分析、成果定型、推广反馈与结题准备。9月,课题组对两年积累的问卷数据、试卷复核数据、机制运行台账与前后测数据作系统整理与交叉校验,重点核实评卷份数、误判率、申诉量与复核一致率等关键数据前后一致,并完成前后测的配对样本检验与效应量计算。数据分析表明,教师评价伦理素养与学生评分知情申诉意识均有明显提升,评分复核申诉渠道运行平稳,学业预警误标率经阈值调整后下降,风险清单与人机协同复核指引在基地校得到常态使用。10月,课题组在两所基地校组织成果试用反馈会,邀请参与校教师、学生代表与家长代表对风险清单、复核指引与制度文本的使用体验提出意见。反馈集中在三方面:一是复核指引的抽样比例对规模较小的学校偏高,需要提供简化版;二是申诉卡对中低年级学生仍不够友好,需要进一步图示化;三是算法审查材料对学校而言偏专业,需要提供填报说明。课题组据此对文本作了两轮修订,形成复核指引普及版、图示化学生申诉卡与算法审查填报说明三项配套材料,并把试运行中的典型事项整理为案例。11月,课题组完成《中小学智能评价伦理治理案例集》编撰,收录深度跟踪案例2个、运行案例10个,每个案例按背景、问题、干预过程、变化证据、反思五段式撰写。成果推广分三个层面展开。校内层面,风险清单与制度汇编作为学校管理文件印发执行,图示化申诉卡发放至两所基地校全部班级,工作组按季度向教师会议通报机制运行情况。县域层面,课题组在县教研室组织的质量分析会与教学管理例会上作成果介绍3场,六所参与校中已有四所正式借鉴采用风险清单与申诉复核规程,另有五所中小学表达了采用意向,县教研室将人机协同复核指引列为学校评价管理参考材料。跨县层面,课题组负责人在云台市基础教育评价研讨活动中作专题交流1次,案例集被市教研部门作为参考材料转发。12月,课题组完成结题报告撰写、成果清单核对与附件整理,做好结题准备,两年研究目标总体达成。五、研究成果(一)认识性成果第一,智能评价伦理风险的核心是“公平—效度—救济”三位一体,而非单纯的算法准确率问题。研究初期,部分成员把智能阅卷的风险理解为“判得准不准”,认为只要提高算法准确率即可化解隐患。实证复核却提示,即便客观题一致率高达99.6%,主观题仍存在8.6%的改判需求,且农村学生作文题机器评分较人工复核平均低2.3分。这说明技术再精进,也不足以自动消除群体差异与解释缺位。据此课题组确立了“公平—效度—救济”三位一体的认识框架:公平关注技术对不同群体的影响是否均等,效度关注分数能否被合理解释与使用,救济关注异议是否可主张、可纠正。三者相互支撑,缺一则评价公正难以成立,这一认识使治理重心从“修算法”转向“建机制”。第二,高利害评价场景必须坚持人工终审原则,人机协同的边界应由评价后果的轻重决定。研究体会到,机器在客观题评分与批量初筛上具有效率与稳定性优势,但在作文等主观题评分上,机器难以充分识别立意、结构与书写以外的表达特质,且对书写不够工整的试卷存在低估倾向。据此课题组提出按后果轻重划分边界的判断:一般性练习与日常检测可自动评分并抽查,期中期末等较重要的检测须对主观题分层复核,涉及升学、分班、评优等真正高利害的评价必须整卷人工终审。这一边界认识把人机分工从“能者多劳”的效率逻辑,转变为“责随后果”的伦理逻辑,为智能评价的使用划出了底线。第三,申诉与复核渠道不是评价流程的附属环节,而是评价公正的组成部分与机制自我修正的信息源。实践经验表明,学生与家长的异议往往指向真实存在的评分偏差或解释缺位;运行期受理的43件申诉中,经复核改判14件,比例达到三成以上,说明异议并非无理取闹,而是发现问题的有效途径。更重要的是,复核与预警核验中暴露的阈值偏严、指标权重不当等问题,全部经由渠道运行数据显现并推动了文本修订。课题组由此认识到,评价伦理治理的关键不在于预先穷尽所有风险,而在于建立一个能够发现问题、纠正偏差、持续改进的开放机制。(二)操作性成果第一项操作性成果是《智能评卷与学业预警伦理风险清单》,含4类17项,按“风险类型—具体表现—识别信号—对应措施—责任岗位”五列编排,另附偏差分析表与判定说明。清单既是教师识别风险的对照工具,也是学校开展算法审查与申诉处置的依据,已在两所基地校评价工作组常态使用,并成为教师微培训的核心材料。表3智能评卷与学业预警伦理风险清单(要点摘编)风险类型代表性表现识别信号对应措施评分公平类评分受书写与表达风格影响;城乡学生存在系统性偏移分组复核发现群体差异超过2分分层抽样、弱势群体补偿性复核评分效度类算法放大可量化指标;预警指标单一导致误标主观题吻合率偏低、预警误标率偏高人工终审、指标权重多源化透明度与可解释类评分依据与分项权重不公开学生与家长无法说明判分逻辑评分说明、算法备案与告知申诉与救济类复核渠道缺失、结果更正不到位无正式申诉入口、异议无反馈三入口受理、限时办结、改判更正第二项操作性成果是《人机协同评分复核操作指引》,明确评分环节的职责边界、分层抽样规则与一致率判定阈值三类规则,并配复核记录表与偏差分析表。指引规定主观题保留人工终审,正负一分内吻合率低于90%的批次须整批人工复核,对农村学校与低分段样本适当提高抽样比例,使复核由经验判断转为有据可依。指引另编制普及版,供规模较小的学校简化使用。表4人机协同评分复核操作要点环节机器职责人工职责触发人工复核的阈值客观题评分自动评分与异常卷标记对异常卷抽查确认异常卷标记比例超过1%主观题评分初评并提供参考分终审评分正负一分吻合率低于90%学业预警生成预警名单学科教师逐人次核验未经核验不得用于处置综合评价汇总可量化指标审核难量化素养的定性描述指标缺失率超过5%第三项操作性成果是《中小学智能评价伦理治理制度汇编》,含考试评价算法伦理审查与备案办法、评分争议申诉复核规程、学业预警使用规范、数据留存与更正规则四项制度,规定各环节责任岗位、工作时限与记录要求。制度汇编按“一事一流程、一岗一职责、一步一留痕”的原则编排,配套统一表单模板,可直接为同类学校复制使用,其中算法审查办法要求进校评价类系统提交评分依据、训练数据来源与群体差异自检三类材料。第四项操作性成果是《中小学智能评价伦理治理案例集》与《教师评价数据素养微培训方案》。案例集收录深度跟踪案例2个、运行案例10个,每个案例按背景、问题、干预过程、变化证据、反思五段式撰写,并附处置要点与对应风险条目索引。微培训方案含评价伦理基础、评分偏差识别、预警核验、申诉处置四个模块,配套情境测试题,已在两校及周边学校开展6场、覆盖214人次,成为机制落地的能力支撑。(三)实践成效总述从总体上看,课题构建的智能评价伦理治理机制在两所基地校实现了从文本到常态运行的转化:风险清单覆盖全部评价环节,主观题评分复核与学业预警核验成为常规动作,申诉复核渠道累计受理43件、办结42件,教师评价伦理素养与学生评分知情申诉意识均显著提升,四所兄弟学校借鉴采用。机制没有停留在挂牌层面,而是嵌入学校考试评价的日常流程,评价责任落实到具体岗位与时限,这是本课题实践成效的最重要标志。机制运行也带动了学校评价观念的变化,从过去只看分数与效率,转向在效率之外追问公平、效度与救济,评价的育人导向与公正导向得到更好的统一。(四)成果的应用与推广成果推广分三个层面展开。校内层面,风险清单与制度汇编作为学校管理文件印发执行,图示化学生申诉卡发放至两所基地校全部52个班级,工作组按季度向教师会议通报机制运行情况,6期教师专题研修累计覆盖214人次。县域层面,课题组在县教研室组织的质量分析会与教学管理例会上作成果介绍3场,六所参与校中已有四所正式借鉴采用风险清单与申诉复核规程,另有五所中小学表达了采用意向,县教研室将人机协同复核指引列为学校评价管理参考材料。跨县层面,课题组负责人在云台市基础教育评价研讨活动中作专题交流1次,案例集与制度文本被市教研部门作为参考材料转发,形成了较为稳定的辐射影响。六、研究成效分析本课题为评价伦理治理研究,成效分析以机制运行情况为主视角,重点考察评分复核、学业预警核验、申诉救济三项机制的运行数据,同时呈现学生评分知情与申诉意识、教师评价伦理素养两方面的测评证据,不简单套用学业成绩前后测,以防止以单一分数指标替代对评价伦理治理本身的检验。(一)学生层面的变化学生层面测查评分知情与申诉意识。前后测均采用课题组编制的三维度量表,5点计分,前测于2027年12月实施,回收有效问卷1186份,后测于2028年6月实施,回收有效问卷1168份。结果显示,三个维度均值全部上升,其中申诉意愿与渠道知晓维度提升幅度最大,反映申诉复核渠道建设对学生权利主张能力的直接带动作用;配对样本检验差异显著,总均分效应量达到较高水平,表明提升具有实质意义。分学段看,初中学生各维度提升幅度略大于小学学生,与高年级学生对评价规则的理解能力发展较快的特点相符,提示小学阶段的评分知情教育仍需更多借助图示化、情境化的方式。表5学生评分知情与申诉意识前后测对比(5点量表)维度前测均值后测均值提升幅度效应量评分机制认知2.913.520.610.77结果知情意识3.053.630.580.72申诉意愿与渠道知晓2.783.550.770.93总均分2.913.570.660.81与全县调研基线对照,基地校学生知道对成绩有异议可以申请复核的比例由机制实施前的16.3%上升为81.5%,学生异议结构中“不知道找谁”的情形明显减少,说明评分知情意识的改善转化为可观察的申诉行为。值得注意的是,结果知情意识维度的提升幅度相对较小,说明学生对评分依据的理解仍不充分,机制在评分说明的通俗化方面还有提升空间。(二)教师层面的变化教师是智能评价伦理治理的执行主体。课题组对两所基地校118名专任教师开展评价伦理素养前后测评,并结合作业检查、复核记录与工作组台账作多源印证。测评显示,教师在公平与偏见辨识、效度与效标理解、透明度与可解释意识、评分申诉处置能力四个维度的均值均有明显提升,其中评分申诉处置能力提升幅度最大,这与申诉复核渠道运行中教师直接承担复核与处置岗位的历练直接相关。表6教师评价伦理素养前后测对比(5点量表)维度前测均值后测均值提升幅度公平与偏见辨识3.023.610.59效度与效标理解2.943.550.61透明度与可解释意识2.883.490.61评分申诉处置能力2.833.520.69总均分2.923.540.62行为层面的变化更为直观:机制实施后,教师在使用智能阅卷结果前主动查看主观题复核情况已成为惯例,处理学生成绩异议时由凭印象解释转向对照复核指引与规程处置,向家长解释评分结果时也更多引用评分说明而非“系统就这样判的”。测评前后能识别智能阅卷常见算法风险的教师比例由28.6%提升至76.2%,教师层面素养的提升,使机制运行不再依赖课题组的外部支持,具备了日常维持的能力。(三)学校与区域层面的变化学校与区域层面的成效集中体现为三项机制的覆盖与运行。评分复核方面,两所基地校上半年累计复核主观题试卷5200份,触发整批人工复核批次3批,复核发现的评分偏移样本经人工改判后成绩单在规定时限内更正并告知学生。学业预警核验方面,两校共触发预警286人次,学科教师逐人次核验后确认误标51人次,误标率17.8%,据此对预警指标权重与阈值作了调整,调整后后续两个月误标情况明显减少。申诉救济方面,运行期累计受理评分复核申诉43件,含客观题计分疑问11件、主观题评分争议26件、成绩汇总与登分问题6件,办结42件,闭环率97.7%,经复核改判14件,平均处置时长4.2个工作日,回访满意率92.9%。表7评分复核申诉与学业预警运行情况(2028年1月—8月)指标数量说明受理申诉总数43件申诉箱、专用邮箱、教师转介三入口其中主观题评分争议26件含作文、简答题评分异议其中客观题计分疑问11件含漏批、登分核对等其中成绩汇总与登分问题6件含合并分、等级换算等办结数量与闭环率42件,97.7%1件转县级教研部门协同处理经复核改判14件占受理量的32.6%平均处置时长4.2个工作日较运行初期缩短2.1天学业预警触发与误标286人次,误标51人次误标率17.8%,阈值调整后下降回访满意率92.9%回访42件,满意39件机制运行还产生了溢出效应:家长对学校评价公正性的满意度调查中,表示放心的比例由58.3%上升为90.6%;四所借鉴采用学校中,已有两所报告申诉渠道受理首月即有事项办结,说明机制具有跨校移植能力。区域层面的成效同样明显。县教研室依据课题成果形成了县域学校智能评价管理的参考要点,把风险清单、复核指引与申诉规程纳入评价管理的常规指导,在全县质量分析工作中要求各校在使用智能阅卷结果时说明主观题复核情况,这一要求使评分复核从个别学校的做法上升为区域评价管理的常规环节。制度落地后,全县参与校在成绩反馈环节主动向学生告知复核渠道的比例由实施前的21.7%提升至86.4%,家长关于评分结果的咨询更多转向校内正式渠道而不是私下打听,评价的透明度与公信力得到改善。学校层面还形成了稳定的组织保障,评价伦理工作组运行满两个学期,人员更替后仍能按流程接续工作,显示出机制的制度化程度,这种不依赖个别人的运行状态,是机制能否长期维持的关键标志。(四)典型案例案例一:作文评分申诉的复核改判。九年级学生小林在一次期中语文考试中,作文被智能阅卷系统评为41分,低于其平时水平,家长与学生对结果存有疑虑。小林依据班级张贴的图示化申诉卡,将复核申请投入申诉箱,申请事项为“希望复核作文评分”。工作组当日受理,按申诉复核规程将作文扫描卷交由两名语文骨干教师独立复评,复评结果分别为47分与46分,与机器评分差距超过五分,触发指引规定的人工终审程序。工作组据此组织第三名教师复核并调阅评分记录,确认机器评分对该卷的书写与卷面存在低估倾向,最终将成绩更正为46分,在规定时限内完成登分更正并向小林及家长书面反馈,回访时家长表示“原来分数真的是可以核的”。该案例的价值在于完整走通了从评分知情到申诉、复核、改判、反馈的全链条,工作组随后据此将主观题评分偏差较大批次的抽查比例提高,并推动智能阅卷系统在成绩单上增加评分说明栏,使学生能够了解作文评分的分项依据。案例二:学业预警误标的核验与调整。八年级学生小禾开学后连续两次数学检测成绩波动较大,被学业预警模块列为重点关注对象,系统提示其存在“学业风险”。按照以往做法,预警名单会直接用于班主任谈话与家长告知。本周期的学业预警使用规范要求学科教师先行核验,数学教师调阅小禾的课堂表现与作业记录后发现,其两次检测的低分均出现在因作业量偏大而未完成的题块上,且课堂提问与作业质量的反馈均属正常,判断该预警属误标,遂在核验记录中标注并暂缓告知家长。工作组结合这一情形与同期其他误标样本,对预警指标的权重作了调整,将单一成绩波动指标的权重下调,增加课堂表现与作业质量的综合判断。两个月后回访,小禾的检测成绩回升至原有水平,班主任表示“如果当时直接找家长谈,可能会给孩子贴上不必要的标签”。该案例表明,预警类风险依靠规范化的核验环节可以获得实质改善,也印证了“评价技术的结果须经人的核验方能用于处置”的设计理念,使评价的辅助功能不至于异化为标签化的压力。七、研究反思与后续研究方向(一)研究的主要局限本研究的局限首先体现在样本范围上。调研与实践检验主要在云溪县八所中小学展开,其中深度运行检验限于两所基地校,样本的城乡结构、办学条件与规模相对集中,研究所形成的复核抽样比例与阈值判定规则,对办学规模较大或学段结构不同的地区,其适用性仍需进一步检验。其次,研究的量化证据主要来自问卷调查、试卷抽样复核与机制运行台账,虽已作多源印证,但受评价场景本身的敏感性影响,部分学生对评分异议的表达可能存在保留,问卷所反映的评分公平感知与真实行为之间仍可能存在偏差。再次,研究周期为两年,试卷复核覆盖的是两次期中期末检测,样本虽具代表性,但尚不足以覆盖更长周期与更多学科的评分变化,结论的稳健性有待更大样本的支持。(二)尚未解决的问题研究中仍有一些问题未能充分解决。其一是主观题评分偏移的成因尚未完全厘清,复核发现农村学生作文题存在系统性低估,但低估究竟更多源自书写识别、言辞风格适配还是训练数据分布,需要结合技术侧的进一步检验,学校层面只能作补偿性复核,难以从源头校正。其二是申诉救济的法律衔接仍不充分,学校与县级教研部门受理的评分复核,与更正式的教育申诉、行政复议之间如何衔接,在制度文本中仅有原则性安排,缺少可操作的转办规则。其三是评价伦理与技术迭代的同步问题,评价类系统的更新迭代速度较快,审查与备案制度对升级版本的跟踪覆盖仍显不足,容易形成“审查一次、长期使用”的漏洞。(三)后续研
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 2026年医疗器械从业人员培训考试试卷及答案
- 成都石室联中2026-2027学年九年级上册期中真题化学
- 新生儿护理大病历汇报
- 2026主治医师(中级)-临床医学检验学(中级)352历年题库含答案详解
- 2026临床医学期末复习-病理生理学(本科临床教改专业)历年题库含答案详解
- 2026临床“三基”-医学临床三基(皮肤性病科)历年题库含答案详解
- 2026中级数控铣工(官方)-单选题参考试题库历年考点答案详解
- 2026中级会计-中级会计实务(官方)-第八章金融资产和金融负债参考试题库历年考点答案详解
- 2026中国人身保险从业人员资格考试(C1人身保险理赔原理与实务)历年参考题库含答案详解
- 2026中医助理医师-第二单元考试历年参考题库含答案详解
- 《物业设备设施管理(第2版)》-第七章
- 2026北京市公安局监所管理总队招聘勤务辅警招聘150人农业笔试模拟试题及答案解析
- 综治中心值班工作制度
- 日粮NFC-NDF比例:奶牛生产性能、瘤胃发酵与微生物区系的关联性探究
- 2025版建筑工程建筑面积计算规范
- 资产配置研究系列三:基于BLACK-LITTERMAN模型融合资产择时与风格轮动的资产配置研究
- 2026 英语新版教材七年级下册核心单词表
- 皮带输送机安装及调试技术方案
- 传统芫根酸菜发酵中风味物质与微生物群落演变规律研究
- 华文慕课《刑法学》总论课后作业答案
- 伤口创面修复技术
评论
0/150
提交评论