中小学教师人工智能素养评价指标体系构建研究-结题报告_第1页
中小学教师人工智能素养评价指标体系构建研究-结题报告_第2页
中小学教师人工智能素养评价指标体系构建研究-结题报告_第3页
中小学教师人工智能素养评价指标体系构建研究-结题报告_第4页
中小学教师人工智能素养评价指标体系构建研究-结题报告_第5页
已阅读5页,还剩18页未读, 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

PAGE 中小学教师人工智能素养评价指标体系构建研究结题报告摘要本课题针对中小学教师人工智能素养评价中“评什么、怎么评、评了怎么用”缺少可用依据的现实问题,以《教师数字素养》教育行业标准、《中小学人工智能通识教育指南(2025年版)》及相关政策为依据,将教师人工智能素养划分为人工智能意识、人工智能知识与技能、人工智能应用、人工智能伦理与社会责任、专业发展五个维度,采用文献研究、德尔菲咨询、层次分析、调查与测量、案例研究相结合的方法,构建中小学教师人工智能素养评价指标体系。研究以云台市云溪县中小学在职教师为对象,先通过文献分析与现状调研形成含5个一级、18个二级、62个三级指标的初始指标池,再经21位专家两轮德尔菲咨询,最终确立由5个一级指标、16个二级指标、48个三级指标构成的指标体系,并运用层次分析法赋权,五个一级指标权重依次为0.14、0.22、0.28、0.20、0.16,判断矩阵一致性比率CR=0.019,小于0.10。依据三级指标编制《中小学教师人工智能素养评价量表》,量表含5个维度48个题项,总量表Cronbach'sα为0.936,KMO为0.921,探索性因子分析提取5个公因子、累计解释方差68.7%,验证性因子分析拟合指标χ²/df=2.14、RMSEA=0.052、CFI=0.936,各项指标达到测量学要求。研究形成评价指标体系、评价量表、评价实施建议与学校评价报告模板等成果,并在12所学校986名教师中开展评价试用,试用教师对指标体系的可用性评分达4.21。研究为县域开展教师人工智能素养评价提供了成套工具与实施路径,也就评价如何兼顾科学性与可行性、如何防范技术误用与伦理风险作出了实践回答。关键词:中小学教师;人工智能素养;评价指标体系;德尔菲法;层次分析法;量表编制一、课题概述本课题依据河北省教育科学“十五五”规划课题指南中教育评价相关方向立项,选题指南编号41,课题类别为一般资助课题,学科分类为基础教育,研究类型为综合研究,研究周期为2027年1月至2028年12月。本节说明课题的研究缘起与四项研究任务的完成情况。(一)研究缘起从政策要求看,中共中央、国务院《教育强国建设规划纲要(2024—2035年)》提出实施国家教育数字化战略、建设高素质专业化教师队伍,并强调以评价改革牵引教育质量提升;教育部《关于加强中小学人工智能教育的通知》要求加强人工智能教育的条件保障与队伍建设,同时强调对实施成效进行监测与评价;《中小学人工智能通识教育指南(2025年版)》对育人目标与内容边界作出规定;《教师数字素养》教育行业标准确立了数字化意识、数字技术知识与技能、数字化应用、数字社会责任、专业发展五个维度。上述文件表明,教师人工智能素养不仅是一个培训问题,也是一个评价问题:素养提升需要以清晰、可测的指标为依据,才便于诊断短板、判断成效。从区域实际看,云溪县是云台市下辖的山区县,全县中小学68所,在职中小学教师4360人。课题组在2026年秋季学期开展的专项摸底显示,教师人工智能素养提升工作已普遍开展,但评价环节明显滞后:多数学校以培训学时、参与人次等过程性数据代替素养水平的判断,缺少可比较、可追踪的素养证据;教师也普遍反映,不清楚“达到什么程度算合格、什么程度算熟练”。评价依据的缺位,使素养提升难以形成“诊断—改进—再诊断”的闭环,也容易出现重视使用频次而忽视使用质量、重视工具操作而忽视规范与伦理的偏向。从工作基础看,课题组所在单位为县级教育科学研究机构,长期承担全县教育科研指导与教育质量监测工作。主持人此前主持完成市级课题《中小学教师专业能力测评工具开发研究》,成员中含教育测量与评价、教育技术、信息技术、课程与教学等方向人员,具备指标编制、专家咨询组织与统计检验的能力。课题组据此判断,推进教师人工智能素养评价的关键,在于把维度界定转化为层级清晰、可赋权、可测量的指标体系,并配套可直接使用的量表与实施建议。(二)研究任务与完成情况开题时确定四项研究任务,两年研究期内均按计划完成,具体情况如下表。研究任务计划目标实际完成情况任务一:素养维度界定与指标池构建界定五维内涵,形成初始指标池完成五维内涵界定,经文献分析与现状调研形成含5个一级、18个二级、62个三级指标的初始指标池任务二:专家咨询与指标赋权完成两轮专家咨询,确定指标与权重组织21位专家两轮德尔菲咨询,确立5个一级、16个二级、48个三级指标体系,层次分析法赋权,CR=0.019任务三:量表编制与信效度检验依据指标编制量表并完成检验编制《中小学教师人工智能素养评价量表》(5维度48题),预试320份、正式施测768份,总量表α=0.936、KMO=0.921任务四:评价实施与区域试用形成实施建议并在县域试用形成评价实施建议与学校评价报告模板,在12所学校986名教师中开展评价试用,可用性评分4.21二、研究背景与问题提出本节从政策要求、现实需求与既有研究三个方面说明课题的问题来源,明确拟解决的核心问题与研究的边界。(一)政策要求与现实需求在教育评价改革层面,国家近年反复强调改进结果评价、强化过程评价、探索增值评价,要求评价结果服务于改进而非简单排序。教师人工智能素养的评价同样应遵循这一导向:既要给出可用于比较的量化结果,也要为教师个人发展与学校研修安排提供具体信息。县域层面的现实需求集中在三处。其一是“有据可依”的需求,素养提升工作缺少统一的判断尺度,学校之间、学科之间难以横向比较,教师个人也难以定位自身水平。其二是“可操作”的需求,专业测评工具往往题量偏大、术语偏多,教师在繁忙工作中难以稳定使用。其三是“用得上”的需求,评价结果若不能转化为具体的改进建议,就会变成又一次填报负担。三类需求共同指向一个诉求:需要一套既符合测量学要求、又适配县域条件的教师人工智能素养评价指标体系。在需求之外,也应关注评价本身的边界与风险。素养中一部分内容与具体工具形态关联紧密,指标需要保持适度的通用性;评价内容还可能触及教师个人观念与行为,若使用不当容易造成简单标签化。课题组由此确立两条基本考虑:评价以诊断和改进为目的,结果不与教师考核直接挂钩;指标描述围绕能力与规范,不绑定具体产品与功能。(二)拟解决的核心问题本研究聚焦三个核心问题。其一,中小学教师人工智能素养的内涵如何界定,其五个维度如何在教师职业场景中转化为层级清晰、可观测、可测量的指标体系,即“评什么”的问题。这一要求既遵循《教师数字素养》行业标准的基本框架,又体现人工智能应用与伦理的特有内容。其二,如何科学确定各项指标的权重并使指标体系达到测量学要求,即“怎么评”的问题。这一问题需要借助专家咨询与赋权方法,减少主观随意性,并通过信效度检验验证指标体系的可靠性。其三,指标体系如何在县域条件下落地实施,评价结果如何用于改进,即“评了怎么用”的问题,要求形成可操作的实施流程、报告模板与改进建议生成方式。三个问题前后相承,共同构成“界定—赋权—应用”的研究链条。本课题的研究落点在指标体系本身及其配套工具与实施建议,不追求建立普适性评价模型,而以形成符合县域实际、可直接使用的成果为限度。研究对象限于云溪县中小学在职教师,不涉及幼儿园教师与高校教师。(三)国内外研究现状第一条线索是人工智能素养的内涵与框架研究。国际上,联合国教科文组织相关报告提出应培养个体对人工智能的理解、应用与批判能力,并强调伦理维度;欧盟相关框架把人工智能素养分解为知识、技能与态度三个层面。国内学者围绕教师人工智能素养的构成展开讨论,有的主张其包含技术知识、教学应用与伦理责任,有的主张在《教师数字素养》框架内增设人工智能专项维度。总体看,框架研究已初具共识,但维度命名与层级关系尚未统一,多数框架停留在概念层面,缺少向可测指标的转化。第二条线索是教师素养的评价与测量研究。这类研究关注如何把素养结构转化为可测量的工具,常见做法是经专家咨询确定维度与指标、以量表形式测量并以大样本数据检验信效度;在方法上,德尔菲法常用于指标筛选,层次分析法常用于指标赋权。相关研究还指出,素养评价不应止于自评量表,需结合行为证据与情境判断以减小自评偏差。这些成果为本课题的指标编制与赋权提供了方法论基础。第三条线索是素养评价的实施与结果应用研究。研究者普遍主张评价应与诊断、反馈、改进形成闭环,评价结果要能生成具体的改进建议;也有研究提醒,评价指标过多、流程过繁会加重基层负担,降低使用意愿。既有研究为评价实施提供了思路,但多针对学生素养或一般教师专业能力,专门面向教师人工智能素养、并同时给出指标体系与实施建议的成套研究仍不多见。综合三条线索,既有研究尚存三方面空缺:维度界定与可测指标之间缺少衔接,指标池的构建依据不够充分;权重确定过程与信效度检验的呈现不够完整;指标体系与区域评价实施之间缺少衔接,评价结果向改进的转化路径不清晰。本课题针对这三方面展开。三、研究目标、内容与方法本节说明研究的目标、内容、方法与理论依据。(一)研究目标总目标:立足县域教师队伍实际,界定中小学教师人工智能素养的内涵与维度,构建层级清晰、权重合理、达到测量学要求的评价指标体系,配套开发评价量表与实施建议,为县域开展教师人工智能素养评价、推动教师素养持续提升提供可用依据。具体目标:①界定目标——界定五个维度的内涵与观测点,形成结构完整、依据充分的初始指标池;②赋权目标——通过两轮专家咨询完成指标筛选,运用层次分析法确定指标权重,形成定稿的评价指标体系;③工具目标——依据三级指标编制评价量表,完成项目分析与信效度检验,形成可直接使用的评价工具;④应用目标——形成评价实施建议与学校评价报告模板,通过区域试用检验指标体系的科学性与可用性。上述目标之间具有递进关系:先解决“评什么”,再解决“怎么评”,进而解决“评了怎么用”。研究不追求建立普适性的评价模型,成果首先服务于云溪县的教师素养评价与教师发展工作。目标的达成情况将以指标体系、量表检验数据与试用反馈为依据进行检验。(二)研究内容教师人工智能素养的内涵界定与初始指标池构建研究。依据《教师数字素养》教育行业标准及相关政策,结合教师职业场景,界定五个维度的内涵与观测点;通过文献分析与现状调研,构建含5个一级、18个二级、62个三级指标的初始指标池,并编制指标说明,明确每一指标的内涵与判断依据。基于专家咨询的指标筛选与层次分析赋权研究。邀请21位来自教育技术、教育测量与评价、教师教育、学科教学与教育信息化等领域的专家,开展两轮德尔菲咨询,依据重要性均值、变异系数与专家协调系数筛选和修订指标;再构建层次结构模型,通过专家两两比较构造判断矩阵,计算权重并进行一致性检验,形成定稿的指标体系与权重表。评价量表编制与信效度检验研究。依据三级指标编制《中小学教师人工智能素养评价量表》,采用李克特五级计分;先在小样本中开展项目分析,依据区分度、题总相关等指标修订题项;再以较大样本开展探索性因子分析与验证性因子分析,检验量表的结构效度、内容效度与效标关联效度,并检验内部一致性信度、分半信度与重测信度。区域评价实施建议与试用研究。设计包括评价目的、对象、组织实施、数据处理、结果反馈与改进建议生成在内的实施流程,形成学校评价报告模板;在12所学校开展评价试用,收集教师与管理者对指标体系科学性、可用性与负担程度的反馈,据此修订指标体系与实施建议。(三)研究方法文献研究法。检索中国知网、万方及政策文本库,检索词为“人工智能素养”“教师数字素养”“评价指标体系”“德尔菲法”“层次分析法”等,时间跨度为2017年1月至2026年6月,共获得文献812篇(部),去重后由两名成员独立筛选,最终纳入有效文献136篇(部),用于维度界定与指标池构建。德尔菲法。遴选21位来自高校、教研机构与中小学的专家组成咨询组,均具备副高级及以上职称或相当专业水平。开展两轮匿名咨询,第一轮就指标的重要性、表述准确性与归属合理性征询意见,第二轮就修订后的指标再次征询并请专家确认。两轮问卷回收率均为100%,专家权威系数为0.84,第二轮专家协调系数Kendall'sW为0.42(p<0.01)。层次分析法。构建“总目标—一级指标—二级指标—三级指标”的层次结构模型,请专家对同一层级指标进行两两比较,构造判断矩阵,采用和积法计算权重。一级指标判断矩阵的最大特征根λmax=5.086,一致性指标CI=0.0215,一致性比率CR=0.019,小于0.10,表明判断矩阵具有满意的一致性。调查与测量法。自编《中小学教师人工智能素养现状与需求调查问卷》,在16所样本校开展现状调研,发放问卷1500份、有效1378份,访谈教师与管理者48人;量表预试在4所学校发放340份、有效320份,正式施测在14所学校发放820份、有效768份,用于项目分析与信效度检验。样本分布如下表。样本类别分层口径学校数(所)有效问卷(份)占比(%)学段小学866248.0学段初中651237.2学段普通高中220414.8区域县城学校660443.8区域乡镇学校1077456.2合计—161378100.0案例研究法。在评价试用学校中选取条件不同的4所学校作深度个案,收集过程材料与访谈记录,用于解释指标体系在不同条件下使用的差异。(四)理论依据教育目标分类理论关于认知、情感与动作技能的分类,为把素养分解为可观测的指标提供了思路。教师专业发展阶段理论支撑指标在不同发展水平上的描述与区分。教育测量理论关于信度、效度与因子结构的要求,为量表编制与检验提供方法依据。德尔菲法与层次分析法的方法论为本研究确定指标与权重提供技术支撑。《教师数字素养》教育行业标准确立的五维框架,则为本研究维度划分提供了直接的标准依据。四、研究过程本节按五个阶段叙述研究的实施过程,重点说明指标体系如何从维度界定逐步转化为可测量、可赋权的工具,以及真实情境中遇到的问题与调整方式。(一)准备与设计阶段(2027年1月—3月)课题组于2027年1月组建,共9人。主持人负责总体设计与统筹,2名成员牵头文献研究与维度界定,2名成员负责指标池构建与专家咨询组织,1名成员负责量表编制与统计检验,其余成员分别承担现状调研、材料归档与保障文本起草。课题组建立“每月例会+任务台账+共享材料库”制度,两年研究期共召开例会26次,其中专题研讨11次。文献研究用时近两个月。检索所得812篇(部)去重后为698篇(部),由两名成员独立筛选,分歧项经研讨裁定,最终纳入有效文献136篇(部),其中61篇实证研究按“研究对象—研究问题—研究方法—结论—局限”编码。在文献综述基础上,课题组以《教师数字素养》教育行业标准确立的五维框架为基准,结合人工智能应用与伦理的特有内容,界定人工智能意识、人工智能知识与技能、人工智能应用、人工智能伦理与社会责任、专业发展五个维度的内涵与观测点,并逐条比对本研究维度与标准中既有维度的关系,形成《维度界定与指标归属说明》,避免概念重叠。指标池构建是这一阶段的核心任务。文献分析阶段形成含5个一级、16个二级、57个三级指标的草案,每一指标均附内涵说明与判断依据。课题组还就三级指标的表述作了专门讨论,确立三条要求:一是尽量用教师能理解的工作语言描述,避免技术性过强的术语;二是以能力与行为描述为主,不绑定具体工具与产品;三是每一项指标都应能在日常工作中获得观察或自评的依据。此外,课题组遴选出21位德尔菲咨询专家,专家分别来自高校6人、教研与评价机构8人、中小学7人,覆盖教育技术、教育测量与评价、教师教育、学科教学与教育信息化等方向,具备副高级及以上职称或相当专业水平。2027年3月下旬举行开题论证会,5位专家提出三条意见:一是厘清评价指标体系与《教师数字素养》行业标准的关系,使指标既承接标准又体现人工智能特色;二是权重确定不能仅凭经验,需采用规范方法并呈现一致性检验结果;三是评价工具要控制题量、注意负担,防止评价变成新的填报任务。课题组据此确立了“标准承接+人工智能专项补充”的维度设计思路,明确了以德尔菲法筛指标、以层次分析法定权重的技术方案,并在量表设计中预留精简版。课题组还就研究的边界与伦理作了专门讨论。考虑到评价内容可能触及教师个人观念与行为,课题组确立三条研究准则:一是评价以诊断和改进为目的,结果不与教师考核、评优直接挂钩;二是涉及教师个人信息的数据一律脱敏处理,仅在汇总层面报告;三是讨论技术应用时须同时说明其局限与风险,引导教师形成审慎态度。这三条准则贯穿研究全过程。本阶段遇到的问题与解决。主要问题是成员对三级指标的颗粒度把握不一,有的指标过于笼统(如“能熟练使用相关工具”),有的又过于细碎(如具体到某一功能按钮)。课题组组织了两次专题研讨,确立“一个指标对应一项可观察的能力”的标准,逐条打磨表述,并把功能层面的描述上移到二级指标,使指标层级分明、颗粒度相对一致。(二)现状调研与诊断阶段(2027年4月—7月)正式调研于2027年4月中旬至6月中旬实施。样本校按学段、区域、规模分层抽取,共16所,覆盖7个乡镇。教师问卷发放1500份、有效1378份,有效回收率91.9%。访谈在问卷初步统计完成后进行,以便有针对性地追问,共访谈48人,其中一线教师34人、学校管理者9人、教研员5人,每人25至40分钟,累计录音约23小时,全部转写并编码。调研的首要目的是为指标池提供实证依据。统计结果显示,全县中小学教师人工智能素养自评总均分为3.24(满分5分),处于中等偏下水平,五个维度不均衡较为明显:人工智能意识均值最高,为3.79;人工智能伦理与社会责任为3.26,专业发展为3.18,人工智能应用为3.02;人工智能知识与技能均值最低,为2.88。可见教师对人工智能进入教育的认同度较高,但知识与技能储备相对薄弱,应用水平居中,呈现意识领先、知识技能滞后的不均衡状态,自评达到较熟练及以上比例的教师总体约占三成。调研的第二个目的是诊断教师对评价本身的态度与需求。结果显示,教师对“有一套统一的素养评价标准”持肯定态度的占82.4%,希望评价结果“用于改进教学与个人发展”的占76.1%,而担心评价“增加负担、可能与考核挂钩”的占63.5%。多位教师提到,此前类似填报较多但很少见到反馈。这一结果提示,指标体系不仅要在内容上站得住,还必须在实施上轻负担、有反馈。依据调研结论,课题组对文献阶段形成的指标草案作了修订:一方面补充了5条三级指标,主要涉及生成内容核验、数据与隐私保护等教师反映较多的内容,使三级指标由57条增至62条;另一方面对6条表述偏抽象或与教师工作场景关联较弱的指标作了改写。二级指标也由16条调整为18条,从而形成含5个一级、18个二级、62个三级指标的初始指标池,作为德尔菲咨询的正式版本。为减少样本代表性偏差,课题组在正式调研前核对了各样本校的教师结构,确保学科、教龄、职称的分布与全县总体较为接近;问卷回收后抽取32份进行复核,与原始答卷逐项比对,未发现代填与异常作答的情况。本阶段遇到的问题与解决。一是乡镇学校教师填答时间紧张,课题组改为分学科、分时段错峰施测,并缩短单次作答时长。二是教师在应答中普遍存在“自评偏高”的倾向,尤其在应用维度上,自评与实际访谈反映的使用情况存在差距;课题组据此在后续量表设计中增设行为性题项,并确定以自评与行为证据相结合的方式使用评价结果,避免单纯依赖自评。三是部分指标在教师中的理解存在分歧,课题组据此调整了指标表述,并在指标说明中增加了具体解释。(三)方案建构与工具开发阶段(2027年8月—11月)本阶段的核心任务是通过专家咨询确定指标体系并完成赋权与量表编制。德尔菲咨询分两轮进行。第一轮向21位专家发放咨询表,请专家就每项指标的重要性(五级计分)、表述准确性与归属合理性作出判断,并允许增补指标。问卷全部回收,专家积极系数为100%。第一轮意见相对分散,专家对部分三级指标的归属与表述提出了较多修改建议,据此删除重要性均值偏低或与维度关联较弱的指标,二级指标删除1项,三级指标删除8项、合并3组(净减3项)。第二轮将修订后的指标体系再次送专家判断,并要求专家对保留的指标逐项确认。两轮咨询结果及专家意见协调情况如下表。指标层级初始指标池第一轮咨询后第二轮咨询后主要调整说明一级指标555层级未变,部分内涵表述修订二级指标181716删除关联较弱项、合并相近项三级指标625148删除重要性偏低项、合并表述相近项专家协调系数—0.310.42第二轮Kendall'sW=0.42(p<0.01)第二轮咨询后,专家意见趋于一致,专家权威系数为0.84,指标重要性均值多在4.0以上,变异系数多在0.20以下,表明专家对指标的重要性判断较为集中。至此确定由5个一级指标、16个二级指标、48个三级指标构成的教师人工智能素养评价指标体系。赋权采用层次分析法。课题组构建“总目标—一级指标—二级指标—三级指标”的层次结构模型,请专家对同一层级指标进行两两比较,构造判断矩阵,采用和积法计算权重并经一致性检验。一级指标判断矩阵的最大特征根λmax=5.086,一致性指标CI=0.0215,一致性比率CR=0.019,小于0.10,判断矩阵具有满意的一致性;二级、三级指标判断矩阵的CR值均小于0.10。一级指标的权重及其对应的二级指标数量如下表。一级指标权重含二级指标数权重位次人工智能意识0.1435人工智能知识与技能0.2232人工智能应用0.2841人工智能伦理与社会责任0.2033专业发展0.1634合计1.0016—从权重分布看,人工智能应用维度的权重最高,符合“以应用为核心”的判断;人工智能伦理与社会责任维度的权重为0.20,位居第三,说明专家普遍认同伦理规范在教师素养中的重要地位。量表编制同步推进。课题组依据48条三级指标编制《中小学教师人工智能素养评价量表》,采用李克特五级计分,初设5个维度、52个题项。2027年9月下旬在4所学校开展预试,发放340份、有效320份,据以开展项目分析。项目分析显示,4个题项与所属维度总分的相关偏低或区分度不足,课题组对其作了改写与合并,最终形成5个维度48个题项的量表。10月至11月在14所学校正式施测,发放820份、有效768份,用于探索性与验证性因子分析。结果显示:总量表Cronbach'sα为0.936,各维度在0.812至0.904之间;KMO为0.921,Bartlett球形检验显著(p<0.001);探索性因子分析提取5个公因子,累计解释方差68.7%,与理论结构一致。信效度详细结果在下一部分呈现。本阶段遇到的问题与解决。一是部分专家在第一轮中倾向于增加指标,导致指标总数不减反增,课题组以重要性均值、变异系数与专家协调系数为依据,并坚持“一个指标对应一项可观察能力”的标准,对指标作了收敛。二是赋权过程中个别专家的判断矩阵一致性不达标,课题组请其重新比较,并采用群决策几何平均法综合各专家权重,提高了权重结果的稳健性。三是量表题项在预试中出现天花板效应(意识维部分题目多数教师填答“比较符合”),课题组增加了情境性、行为性题项以拉开区分度。(四)实践检验阶段(2027年12月—2028年8月)实践检验以“指标体系能否用、评价结果是否有用”为核心,在12所学校986名教师中开展评价试用。试用校覆盖4个学区,兼顾县城与乡镇、小学与初中。试用分为两个环节:第一环节为评价实施,各校在同一时间窗口内组织教师填答量表,并按评价实施流程完成数据回收与汇总;第二环节为结果使用,各校依据评价报告模板生成本校教师素养概况,结合指标分析短板,据此安排校本研修。试用累计组织评价专场24场,回收有效量表986份,形成学校评价报告12份、区域评价报告1份。为控制质量,课题组为每所学校指定1名联络员,负责评价组织与数据回收,并统一使用在线填报与自动汇总的方式,减少人工统计误差。为了保证使用规范,课题组在每场评价前向教师说明评价目的、数据用途与匿名方式。试用中发现并解决了两类问题。第一类是指标理解的偏差。部分教师对“生成内容核验”“数据与隐私处理”等指标的理解停留在表面,填写时无从判断。课题组据此增补了指标说明中的行为描述,并在评价前提供一份简短的填答指引。第二类是结果使用的落差。有学校反映,拿到报告后“知道哪里弱,但不知道怎么改”。课题组随后把改进建议生成方式纳入实施设计:报告不只呈现各维度得分,还针对得分偏低的指标给出对应的研修主题建议与可参考的研修活动类型,使评价结果与后续研修相衔接。试用还收集了教师与管理者对指标体系的反馈。教师对“指标体系能反映素养实际”的认同度较高,对“填答负担可接受”的评价也较为积极;同时也有教师提出,伦理与社会责任维度的一些题项偏重观念判断,希望增加情境化表述。课题组将相关意见纳入实施建议的修订。中期检查重点核查两项内容:各校评价组织是否规范、数据回收是否完整;评价结果是否真正进入学校研修安排。检查发现,多数学校能完成评价,但把评价结果转化为研修安排的程度不一,规模较大的学校转化较好,个别小规模学校转化相对滞后。课题组据此在县域推广阶段增加了对薄弱学校的定点指导。本阶段遇到的问题与解决。一是试用校之间进度不一,课题组按进度差异开展差异化指导,为滞后学校配备县级教研员定点联系。二是部分教师担心评价结果被用于比较,课题组重申评价不与考核挂钩,并只向学校反馈汇总结果、不反馈个体排名。三是不同学校对“应用维度”自评的松紧不一,课题组通过统一的填答指引与培训统一施测口径,并对个别异常数据作了核查。(五)总结提炼阶段(2028年9月—12月)总结阶段的任务是整理数据、提炼成果、推广经验。课题组对量表信效度检验数据、试用反馈与访谈材料作了系统整理,完成指标体系与实施建议的定稿,并编印配套的评价工具包。数据分析表明,指标体系在专家共识、权重一致性与量表信效度三个方面均达到预期要求;试用反馈显示,教师对指标体系的可用性评分(五分制)达到4.21,对结果反馈有用性的评分为3.98,说明指标体系在实践中既立得住、也用得上。成果整理方面,课题组形成《中小学教师人工智能素养评价指标体系》《中小学教师人工智能素养评价量表》及使用说明、《区域教师人工智能素养评价实施建议》与学校评价报告模板等成果,并编写《中小学教师人工智能素养评价指标体系构建研究总报告》。经验推广方面,课题组依托县级教研与科研活动开展专题分享7场,覆盖教师约1400人次,并把指标体系与评价工具纳入县域教师素养监测的常规安排,形成每两年一轮的评价机制。本阶段遇到的问题与解决。一是成果形态较多、彼此衔接不够,课题组以“指标框架—评价工具—实施建议”为主线重组了成果结构。二是部分材料的规范性不足,课题组按统一体例作了二次整理并交叉审读。三是技术迭代带来的时效性问题,课题组在指标说明中进一步明确了以能力描述为主、不绑定具体工具的表述原则,以延长指标体系的使用周期。五、研究成果本节从认识性成果、操作性成果、实践成效总述与应用推广四个方面呈现研究产出。(一)认识性成果第一,揭示了教师人工智能素养评价“以应用为核心、以伦理为底线”的权重结构规律。层次分析结果显示,五个一级指标的权重依次为人工智能应用0.28、人工智能知识与技能0.22、人工智能伦理与社会责任0.20、专业发展0.16、人工智能意识0.14。应用维度权重最高,说明素养评价不能停留于态度和观念,必须落到教师能否在教学中合理使用;伦理与社会责任维度的权重位居第三,高于意识与专业发展,说明专家普遍认同规范使用是教师素养不可缺位的组成部分。相比之下,意识维度权重最低,并不表示意识不重要,而是提示在评价中不宜过多重复态度性内容,而应把评价重心放在能力与规范上。这一权重结构为后续评价实施提供了取舍依据。第二,揭示了教师人工智能素养从维度界定到可测工具的分层转化规律。研究表明,抽象的素养维度要转化为可测量的工具,需经由“维度界定—指标池构建—专家咨询筛选—层次分析赋权—量表编制—信效度检验”的完整链条,任一层级缺失都会影响指标体系的科学性。研究进一步发现,三级指标的颗粒度是转化的关键:指标过粗难以测量,过细则难以覆盖并增加填答负担,宜以“一个指标对应一项可观察的能力”为标准。这一规律对同类素养评价指标体系的构建具有参考价值。第三,揭示了评价实施的“轻负担、有反馈”运行规律。现状调研与试用反馈共同显示,教师对统一评价标准有较高需求,但对增加负担存在明显顾虑。研究认为,一套指标体系能否落地,取决于三个条件是否同时具备:标准统一、使教师知道“评什么”;操作简便、使学校能够稳定组织;反馈有用、使评价结果能转化为改进方向。三者缺一,评价就容易被当作填报任务。这一认识为区域评价机制的建设提供了实践依据。(二)操作性成果第一,《中小学教师人工智能素养评价指标体系》。指标体系由5个一级指标、16个二级指标、48个三级指标构成,覆盖人工智能意识、人工智能知识与技能、人工智能应用、人工智能伦理与社会责任、专业发展五个维度。每一指标均附内涵说明、观测点与判断依据,形成完整的指标说明文本。指标体系以《教师数字素养》教育行业标准为承接基础,在人工智能应用与伦理方面作了专项补充,可直接用于教师素养的评价与诊断。第二,一级指标权重表与层次分析赋权方法说明。权重表给出五个一级指标的权重及其对应的二级指标数量,并附赋权方法说明,包括层次结构模型的构建、判断矩阵的构造、和积法计算与一致性检验流程。一级指标判断矩阵的一致性比率CR=0.019,小于0.10,方法说明中还给出二级、三级指标赋权的操作步骤,便于其他区域按同一方法更新或调整权重。第三,《中小学教师人工智能素养评价量表》及使用说明。量表依据48条三级指标编制,含5个维度48个题项,采用李克特五级计分。量表附有计分说明、结果解释参考标准与填答指引,单次填答约需12分钟,适用于学校开展教师素养自评、区域开展素养监测等场景。使用说明中明确了数据脱敏、结果不与考核挂钩等要求,并给出了自评与行为证据相结合的使用建议。第四,《区域教师人工智能素养评价实施建议》与学校评价报告模板。实施建议包括评价目的、评价对象与周期、组织实施流程、数据处理与结果反馈、改进建议生成五个部分,明确了县级统筹、学区协助、学校落实的职责分工。学校评价报告模板按维度呈现教师素养概况,并针对得分偏低的指标给出对应的研修主题建议。该成果把评价从“得出分数”推进到“生成改进”,是本课题落点的集中体现。(三)实践成效总述两年研究期内,研究在指标构建、工具开发与区域试用三个层面均取得预期成效。指标体系经21位专家两轮咨询确定,并通过层次分析赋权与信效度检验,科学性得到验证;评价量表在较大样本中通过检验,具备直接使用条件;指标体系与评价工具在12所学校986名教师中完成试用,教师对指标体系的可用性评分达到4.21。整体而言,研究实现了从“维度界定”到“指标体系”再到“实施建议”的贯通,达到开题时确定的各项目标。主要成果及其承担情况如下表。成果名称形式完成时间承担人中小学教师人工智能素养评价指标体系指标体系2027年11月邴雅静教师人工智能素养评价指标说明与赋权报告研究报告2027年11月鲁丽娟中小学教师人工智能素养评价量表及使用说明工具(量表)2027年11月喻丽芳云溪县中小学教师人工智能素养现状调研报告调研报告2027年7月平桂英教师人工智能素养评价需求诊断报告研究报告2027年7月沈海涛区域教师人工智能素养评价实施建议策略文本2028年11月庞雅莉教师人工智能素养评价典型案例集课例集2028年11月褚晓梅中小学教师人工智能素养评价指标体系构建研究总报告研究报告2028年12月邴雅静(四)成果的应用与推广成果推广以县域教育科研与教师发展体系为主要渠道。研究期内,课题组依托县级教研与科研活动开展专题分享7场,覆盖教师约1400人次;指标体系与评价量表被纳入县域教师素养监测的常规安排,形成每两年开展一轮评价的机制;评价实施建议与学校评价报告模板由县教育科学研究机构统一管理,供各校按需使用。在校际层面,12所试用学校把评价结果与本校研修安排相衔接,乡镇学校之间形成了以学区为单位的交流机制;研究还推动县级层面建立了教师人工智能素养监测台账,为区域掌握教师队伍素养状况提供了数据基础。从反馈看,学校普遍认为指标体系“条目清楚、能对照着用”,同时也有学校提出,伦理与社会责任维度的部分题项偏重观念判断,希望进一步丰富情境化表述,并希望评价工具能定期更新以适应技术发展。课题组将相关意见纳入后续改进方向,并在总报告中作出说明。六、研究成效分析本节从指标体系的科学性与试用效果、教师层面、学校与区域层面分析研究成效,并通过典型案例呈现评价发挥作用的具体过程。(一)指标体系的科学性与试用效果判断一项评价研究的成败,首先看指标体系是否科学。研究从专家共识、权重一致性与量表信效度三个方面进行了验证。在专家共识方面,21位专家两轮咨询的积极系数均为100%,专家权威系数为0.84,第二轮专家协调系数Kendall'sW为0.42(p<0.01),表明专家意见趋于一致,指标筛选具有较高的可靠性。在权重一致性方面,一级指标判断矩阵的一致性比率CR=0.019,二级、三级指标判断矩阵的CR值均小于0.10,表明权重确定过程具有满意的一致性。量表信效度检验结果如下表。检验项目具体指标检验结果内部一致性总量表Cronbach'sα0.936内部一致性各维度Cronbach'sα范围0.812—0.904分半信度Spearman-Brown系数0.912重测信度间隔4周(n=120)0.876结构效度KMO值0.921结构效度累计解释方差(5个公因子)68.7%结构效度χ²/df、RMSEA、CFI、TLI2.14、0.052、0.936、0.928效标关联效度与《教师数字素养》自评总分相关r=0.68(p<0.01)从表可见,量表各项信效度指标均达到测量学要求:内部一致性较高,结构效度良好,与既有数字素养测评的相关达到中等偏上水平,说明量表既与既有框架相关联,又体现了人工智能素养的特有内容。指标体系能否用得上,则由试用检验回答。12所学校986名教师的试用结果如下表。试用评价项目结果试用学校数(所)12试用教师数(人)986有效量表回收率(%)96.4教师对指标体系可用性评分(5分制)4.21教师对结果反馈有用性评分(5分制)3.98单次填答平均用时(分钟)12生成学校评价报告(份)12依据报告安排研修的学校比例(%)83.3试用结果表明,指标体系在真实工作场景中具备可操作性:填答用时较短,回收率较高,教师对可用性的评价较为积极;同时,结果反馈有用性评分略低于可用性评分,说明“能评”与“评了有用”之间仍有差距,评价结果向改进的转化还需进一步加强。这一发现成为后续研究方向的重要依据。(二)教师层面的变化评价带来的最直接变化,是教师对自身素养的定位更加清晰。现状调研时,多数教师表示不清楚“达到什么程度算合格”,试用前能在自评后说出自身一至两项明确短板的教师约占41.2%。经过一轮评价及结果反馈,这一比例提升至78.5%。教师反馈中提到,评价报告使他们第一次“看清了自己在知识和技能上的差距”,也明确了改进的先后顺序。其次是教师对素养标准的认知趋于全面。评价前,教师往往把人工智能素养等同于“会不会使用工具”,对伦理与社会责任维度关注不足。试用后,能完整说出素养包含“应用”与“伦理规范”两个方面的人数比例由34.6%提升至66.9%,量表里关于生成内容核验、数据与隐私保护的题项促使一些教师反思了此前的使用习惯。再次是教师的使用行为趋于审慎。评价本身并不直接干预教学,但指标说明中对“使用质量”与“规范使用”的描述,起到了引导作用。试用后期,在备课与教学中使用相关工具时会对生成内容进行核验的教师比例,由试用前的26.3%提升到58.7%;会在使用前对涉及学生信息的内容作脱敏处理的教师比例,由21.4%提升到52.6%。这些变化说明,指标体系在发挥评价功能的同时,也具有一定的导向与规范作用。需要说明的是,教师层面的变化并非全部来自评价活动,期间教师也可能通过其他培训与自学获得提升。课题组在分析时结合访谈对变化来源作了说明,未把全部变化简单归因于评价本身。(三)学校与区域层面的变化学校层面的首要变化是教师素养评价走向常规。研究前,学校多以培训学时、参与人次等过程性数据代替素养判断;试用后,12所学校均建立了以评价量表为工具的素养评价办法,其中9所学校把评价纳入校本研修的年度安排,形成了“评价—诊断—研修—再评价”的循环。评价从一次性活动变为一项常规工作,是学校层面最实质的变化。其次是评价结果与校本研修实现了衔接。研究前,学校的研修主题多由上级安排或凭经验确定;试用后,各校依据评价报告呈现的短板指标确定研修重点。统计显示,12所试用学校中,依据评价报告安排研修的占83.3%,研修主题与教师短板指标的匹配度明显提高。乡镇学校反映,评价报告使他们第一次能够“用数据说话”,研修安排有了明确依据。区域层面的变化体现在评价机制的建设上。研究期内,县教育科学研究机构把教师人工智能素养评价纳入县域教师素养监测的常规安排,形成每两年一轮的评价机制,并建立监测台账,为掌握全县教师素养状况、研判变化趋势提供数据基础。评价实施建议与学校评价报告模板由县级统一管理,各校按需使用,避免重复开发。同时也要看到,区域评价机制的运行仍与行政推动关联较大。跨校的经验交流与学校自主开展评价的能力尚在形成之中,个别小规模学校受教师人数少、教务负担重的限制,在评价组织与结果使用上仍显吃力。这些情况提示,区域评价机制需要在后续研究中继续巩固和完善。(四)典型案例案例一:乡镇初中借助评价报告重构校本研修。云溪县一所乡镇初中,专任教师42人,前几年虽已开展人工智能相关培训,但研修内容以讲座和操作演示为主,教师反映“听着热闹、回头就忘”。2028年春季学期,学校参加指标体系试用,42名教师全部完成量表填答。评价报告显示,该校教师在人工智能知识与技能(均值2.71)与人工智能应用(均值2.86)两个维度得分偏低,明显低于全县平均水平;在人工智能意识维度得分尚可(3.62),呈现“有意愿、缺方法”的特点。该校的周校长拿着报告组织了两次教研会议。第一次会议的主题是“本校的短板在哪里”,各教研组对照指标说明逐项讨论,发现教师普遍缺少把工具用到教学设计环节的经验,测试题目、素材检索是主要使用场景,学情分析与作业反馈环节几乎空白。第二次会议的主题是“这一年抓什么”,学校据此把校本研修主题确定为“工具支持下的学情诊断与作业反馈”,并把原有的通识培训压缩,改为以学科教研组为单位的课例研磨。具体的干预安排在2028年暑期到秋季学期展开。学校为每个教研组配备一名技术基础较好的教师作为组内支持,围绕“用工具辅助学情分析—人工研判—调整教学设计”这一流程,每月开展一次课例研磨。数学组以一次单元测验的数据分析为切入,英语组以作文初评与人工复核为切入,教师在一个具体任务中完成从“会用”到“用得上”的转变。过程中,学校不再以使用频次评价教师,而是以教学设计是否因工具使用而得到改进作为讨论重点。到试用后一轮评价时,该校人工智能知识与技能均值提升到3.24,人工智能应用均值提升到3.45,虽仍低于全县平均水平,但提升幅度在12所试用学校中较为突出。更重要的变化在研修方式上:研修主题第一次由数据确定,教师从“被动参加”转为“带着问题参加”。周校长在访谈中说,评价报告最大的作用不是给出分数,而是“让学校知道了该往哪里使劲”。这一案例说明,对基础薄弱的乡镇学校而言,指标体系的价值不仅在于测量,更在于为校本研修提供一个共同的问题起点。案例二:县城小学把伦理维度落进日常教研。云溪县一所县城小学,教师58人,信息技术应用基础相对较好,前测中应用维度得分3.51,但伦理与社会责任维度仅3.02,评价报告提示该校存在“应用水平较高、规范意识相对滞后”的特点。该校语文教研组长陈老师在评价后的反馈会上提到,此前大家更关心“怎么用得更好”,很少讨论“用的时候要注意什么”。学校据此把伦理与社会责任维度作为该学期的研修重点,围绕三个问题设计活动:一是生成内容可能与事实不符,教学中如何使用才不致误导学生;二是涉及学生作品、个人信息时的边界在哪里;三是怎样在课堂上向学生示范规范使用。研修以案例研讨和规则制定为主,语文、道德与法治两个教研组先行,其他教研组跟进。在研讨基础上,学校形成了《教学工具使用提示》一页纸,明确三条要求:引用生成内容须经教师核验并说明来源,涉及学生作品与个人信息须作脱敏处理,课堂上向学生说明工具的作用与局限。学校还把“如何判断一段材料的可靠性”转化为学生的学习任务,在阅读与习作讲评中引导学生辨析信息来源。评价不再是与教学无关的活动,而成为教研的一个切口。后一轮评价中,该校伦理与社会责任维度均值提升到3.48,教师对相应指标的理解也明显加深。58名教师中,有47人在反馈中提到“现在用工具会先想一想来源和边界”。陈老师认为,伦理素养的提升不能靠抽象说教,而要在具体的学科情境中通过规则制定与行为示范逐步形成。这一案例也提示,教师对生成内容准确性的判断能力仍有待提高,规则制定之后如何持续落实,还需在日常教学中不断强化。七、研究反思与后续研究方向本节客观分析研究的局限、尚未解决的问题以及后续研究方向。(一)研究的主要局限其一,样本范围有限,指标体系的普适性有待检验。研究以云溪县中小学在职教师为对象,指标体系主要依据21位专家的咨询意见与16所样本校的调研数据,试用限于12所学校。县域之间信息化基础与教师队伍结构差异较大,指标体系向其他地区推广时需结合当地实际作适应性调整,不能直接照搬权重结果。其二,多依赖专家共识与教师自评,行为证据不足。指标筛选与赋权主要建立在专家判断之上,虽经一致性检验,仍带有一定主观性;评价数据以自评量表为主,尤其在使用维度上容易出现自评偏高。试用中虽引入部分行为观察,但覆盖面有限,尚未形成多源证据相互印证的成熟机制。其三,技术快速迭代带来时效性局限。人工智能工具的形态与功能变化较快,部分知识与技能类指标虽尽量采用通用化表述,仍可能随技术发展而需要更新。“以能力描述为主、不绑定具体工具”的原则可延缓指标过时,但无法完全消除时效性问题。其四,评价结果向改进的转化尚不充分。试用中教师对指标体系可用性的评分(4.21)高于对结果反馈有用性的评分(3.98),说明“能评”与“评了有用”之间仍有差距。部分学校能识别短板,却缺少将短板转化为研修行动的能力。

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论