基于大模型启发式提问的学生元认知能力提升研究_第1页
基于大模型启发式提问的学生元认知能力提升研究_第2页
基于大模型启发式提问的学生元认知能力提升研究_第3页
基于大模型启发式提问的学生元认知能力提升研究_第4页
基于大模型启发式提问的学生元认知能力提升研究_第5页
已阅读5页,还剩7页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

/基于大模型启发式提问的学生元认知能力提升研究【摘要】元认知能力指个体对自身思维过程的察觉、反思与调节,有助于学习者自主监测学习过程。启发式提问被认为是提升元认知的有效手段,但传统课堂中实施难度大,结合大语言模型后仍面临模板化、缺乏逻辑递进与评估机制不足等问题。为此构建了基于错因的启发式问题库,并设计多种策略引导大模型提问,推动其从“问题百科”转变为“提问导师”。同时引入人工与大模型双重评分机制评估提问效果。结果显示:(1)基于错因的问题库能有效提升学习者的元认知能力;(2)多种提问策略中,半自由提问策略(即基于错因提问,其余自由发挥)表现优于完全自由或严格策略;(3)通过多维度评价,证明提出的智能启发式提问机制能有效促进学习者元认知发展。 1引言 元认知由美国发展心理学家约翰·弗拉维尔提出,他将其定义为“认知的认知”,是对自己认知的进一步认识,包括对自身思维方式、学习策略、知识掌握程度等方面的认识和理解(Flavell,1979)。元认知对于学习和生活均有重要的影响(Kuhn,2022)。已有大量研究证实,元认知对学业成就具有积极影响。例如,元认知与数学学业成绩的正相关关系已在元分析中得到验证(Xieetal.,2024);元认知技能(如理解记忆、总结、可信度评估)与阅读成绩的正相关也被证实(Ghimire&Mokhtari,2025)。元认知的作用机制主要体现在三方面:一是优化学习过程,学生可借助元认知监控思维过程、识别学习难点,并通过策略调整提升学习效率(Anetal.,2024;Schunk,2012);二是对自主学习与思维发展意义深远,元认知促使学生从多角度看问题,如读书时运用元认知,不仅能掌握知识,还能学习作者的思考方式,实现从知“学什么”到懂“怎么学”“为什么学”的转变(Veenmanetal.,2006);三是影响学习者感知环境、洞察问题本质和管理情绪的能力,学生可通过元认知及时察觉沮丧等负面情绪,采取自我激励或寻求外界支持等措施,保持积极学习状态(Drigasetal.,2021)。此外,有研究表明,元认知在调节思维游离方面也发挥着重要作用。自发性思维游离与刻意思维游离都受元认知的影响(刘兆敏等,2017),凸显了元认知在学习者认知活动中的关键价值。鉴于元认知在多方面表现出的教育价值,当前亟需探索更具实效与可行性的元认知提升路径。 然而,当前提升学习者元认知的方式仍各有其局限性。传统教育中常采用基于反思的方法,如在两次考试之间人为插入对考试结果的分析与反馈,以引导学习者反思学习过程,从而在一定程度上提升元认知能力(Callenderetal.,2016)。然而教师群体在对元认知的理解和应用能力方面存在较大差异。部分教师所掌握的元认知知识并不充足,这使得他们在将元认知教学融入日常课程时面临诸多困难,导致元认知教学难以系统、全面地在教学活动中落实(Veenmanetal.,2006)。此外,与认知训练面临的挑战类似(王梓宇等,2024),针对元认知本身的干预训练(如元认知策略指导、反思训练等)在提升元认知指标时,同样存在效果不稳定、迁移性有限等问题,限制了元认知训练在大规模教育场景中的应用。 在此背景下,启发式提问作为一种简单高效的元认知提升手段受到关注。其主要通过引导学生反思认知过程,有效促进学生的理解、记忆与知识建构(King,1992),从而提升学生问题解决能力(Zohar&Dori,2003)、知识整合能力(Paul&Elder,2019)、独立思考(朱莎莎等,2015)与深层学习等能力(李志厚,2004)。教育聊天大模型因其具有的随时随地、一对一的对话交互能力,为普及启发式提问教育提供了合适的“土壤”。然而目前的大模型的主要功能仍是“回答”,而非“提问”。尽管它们在回答问题方面表现出色,但在深度启发和提出发人深省问题的能力上仍有待提高,无法充分发挥智能启发式提问在提升学习者元认知方面的全部潜力。已有研究尝试借助大语言模型自动生成启发式提问。例如,一种用于辅助数学应用题教学的苏格拉底式子问题生成方法已被提出(Shridharetal.,2022)。然而,该框架的应用目前仍局限于数学领域,尚未探讨启发式提问在引导元认知过程中的作用。这也为后续研究指明了方向,即如何优化大语言模型,使其更好地提出启发式问题,从而有效提升学习者的元认知能力。 随着技术的发展,大语言模型(LLMs)为以提升元认知为目标的智能启发式提问的推广应用带来了新的机遇。现有研究已初步探索了其在错误纠正与问题生成中的应用。在错误纠正方面,LLMs在相关任务中的有效性已被验证。例如,有研究者提出一种基于混合注释数据集微调、针对中文母语语法错误的开源LLM框架GrammarGPT(Fanetal.,2023),显示出大模型在纠错领域的潜力。在问题生成方面,当前研究主要聚焦于“出题”功能而非“引导式提问”。例如,LLMs被应用于自动生成阅读理解题目(Xiaoetal.,2023),亦有研究致力于生成多样化的数学应用题(Zhouetal.,2023)。然而,这些研究更侧重于优化题目的生成性能,尚未深入探讨提问在引导学习者认知加工、尤其是元认知过程中的作用。 让大模型能提供更实时、生动的教学反馈与互动,模拟课堂“提问”与“回答”的真实场景,理论上有助于激发元认知思维(Sáiz-Manzanaresetal.,2023;Winkler&Sllner,2018;Wollnyetal.,2021)。先前研究(Yinetal.,2024)设计了一款可提供元认知反馈的教育聊天机器人,通过让聊天机器人依据学习者对知识理解的自我评估,给出不同的元认知反馈提问(如学习者表示理解,机器人提问为“你能向别人解释上述概念吗?”;表示不理解则问“有哪些概念你不理解呢?”)。实验证明引入元认知反馈的提问可以有效提升元认知。 即便如此,结合大语言模型的启发式提问仍面临诸多挑战。首先,从提问内容来看,目前主要采用预设问题的方式,导致提问缺乏针对性,模板化现象严重(Woolf,2010),难以有效满足学生的多样化学习需求。其次,元认知能力的发展依赖于学生在学习过程中有意识地对自己的认知过程进行监控、调节和反思(Veenmanetal.,2006),而目前的启发式提问问题之间缺乏连贯性与递进逻辑,难以构建支持这一过程的认知引导链条。此外,目前智能启发式提问的评价机制尚不完善,难以准确衡量启发式提问在促进学生学习、提升元认知能力等方面的成效。 为解决上述问题,本研究以提升学习者元认知能力为目标,设计了一套智能启发式提问机制。首先,构建基于错因分析的问题库。依据错因生成一组逻辑连贯、循序渐进的提问,旨在提升大模型提问内容的针对性及问题间的递进关系。其次,在已有问题库的基础上,提出多种与问题库关联程度不同的提问策略并从中遴选最优策略,致力于将“问题百科全书”转化为“有经验的启发式提问导师”,为学习者提供更具智慧和策略性的引导。最后,设计一套人机共测的评价机制,从元认知引导效果、问题本身启发性等多个关键角度出发,对提出的方法进行系统验证,证明其在实际应用中的可行性和有效性。 2基于错因分析的问题库设计 传统智能教育系统依赖标准答案库进行知识传递,但缺乏对学习者易错问题的系统性分析。因而更多表现为“答案库”,而非真正的“问题库”。为此,本研究改变思路,从错因出发构建问题库。以数学、英语和常识三科为例,整理常见错因形成错因库,结合大模型生成层次化的元认知启发式提问,建立“题目-错因-提问”映射关系的“启发式问题库”。 最终构建的问题库涵盖数学、英语、常识三个学科,每学科包含300道题目。每道题目配有4个选项(包括1个正确答案和3个错误答案),每个选项对应3条提问。具体而言,对于正确答案设计巩固与反思式提问;而对于错误答案,则会明确错因,并根据错因提出3个启发式问题。问题库结构示例如图1所示。 图1问题库结构示例 2.1多学科错因分类体系 本研究围绕错因,构建了基于错因分类的问题库,以支持后续的启发式提问机制。在基础错因整理阶段,首先通过文献查阅(贾龙才,2024;姚欣雨,李文兵,2024)及参考现有错因诊断数据库(TheLearningAgencyLab,2024),构建了涵盖数学、英语、常识学科的初始错因集合。随后,借助大语言模型对其进行归纳与扩充,由模型基于数据特征进行多学科易错类型的自动聚类与维度拓展。最终通过人工校验环节,对模型输出结果进行系统性筛查、修正及整合,形成兼具理论依据与数据驱动特征的多学科错因分类体系。部分错因分类如表1所示。 2.2启发式问题库生成机制 错因库构建完成后,研究的核心任务转向基于错因生成具备针对性与引导效能的启发式提问,其中本研究重点关注了提问的循序渐进性和元认知能力培养。 循序渐进的提问有助于从基础概念向深入应用逐步推进,强化知识掌握。本研究在问题生成中采用“基础概念→深入应用→举一反三”三级提问设计(Borich,2000),以促进学生形成链式的思考与回答路径。研究表明,采用“思维链”提示能够显著改善模型在推理任务中的表现(Weietal.,2022)。例如,针对数学“勾股定理混淆”这一错因,三级提问依次为:(1)“勾股定理的标准表达式是什么?”激活概念记忆;(2)“边长为3和4的直角三角形斜边长度是多少?”推动知识应用;(3)“若将公式改为先相加后平方,结果会如何变化?”引发认知冲突与深度思考。这种设计符合层次递进规律,使问题从记忆层级逐步提升至应用与分析层级。 至于元认知驱动方面,本研究则通过在生成时和生成完成后的问题中嵌入不同元认知导向提问提升反思深度。如反思性提问(“你的解题步骤是否具有通用性?”)促使学生梳理思维路径;评估性提问(“有没有更好的解法?”)引导策略优化;自我监控提问(“是否遗漏关键信息?”)强化条件自查。 上述提问内容基于GPT-4大语言模型自动生成。研究为模型设计了包含任务说明、题目信息、学生错误答案及错因分析的系统性提示词,引导其产出围绕错因的高质量、层级递进的启发式提问。 为验证效果,本研究邀请三位具备教学经验的领域专家对生成结果进行人工评估。评估结果显示,生成的问题在引导性、递进性和反思性方面表现良好,能有效支持学生发现错误、理解概念并优化思维路径。 3启发式提问策略设计与效果评测 尽管本研究已构建启发式问题库,但单纯堆砌问题资源难以实现理想的教学引导效果。要实现元认知引导目标,还需以系统化的提问策略为依托。在此背景下,厘清不同提问策略在引导效能、与学科认知规律的适配性等方面的差异,成为研究的核心挑战。本研究聚焦以下目标:探讨不同策略在元认知引导和问题启发性方面的作用机制;比较各策略在不同学科中的适用性与效果以及通过与基础大语言模型的对比实验,验证所提出智能启发式提问体系的有效性与优势。 3.1研究问题 为了寻找最优策略,让大模型成为“有经验的启发式提问老师”,并验证所提出的提问推荐对元认知提升的有效性,本研究设计了以下四种策略进行对比,按照策略1~4进行编号。 策略1-自由无问题库:不使用问题库,仅告知大模型基础任务,即作为启发式老师进行引导性提问。其余依靠大模型自身的生成能力,不施加额外约束。 策略2-自由有问题库:使用问题库进行检索增强生成,仅告知大模型基础任务。其余依靠大模型自身的生成能力,不施加额外约束。 策略3-半自由有问题库:使用问题库进行检索增强生成,告知大模型基础任务,并额外要求每次提问前输出错因分析,并基于此进行启发式提问。 策略4-不自由有问题库:使用问题库进行检索增强生成,告知大模型基础任务,并给出严格策略要求:每次提问前输出当前的错因分析;若错因未发生变化,则按照“基础概念→深入应用→举一反三”的顺序递进提问;若检测到错因发生变化,则需基于新的错因重新生成基础概念类问题,并重新启动递进提问流程。 本研究进一步提出以下两个核心研究问题: (1)基于问题库的提问策略(包括自由有问题库、半自由有问题库、不自由有问题库三种库依赖策略)相较于无外部知识库的自由无问题库策略,在元认知引导效果与问题启发性上是否存在优势? (2)不同的策略对元认知提升的效果如何,何种策略最优,且在数学、英语、常识等不同学科间是否存在差异性? 3.2人机共测的评估方法 本研究基于多维度评估理论,创新性地结合人工评测与大模型评测,通过对比两者异同进行多方面验证,力求为策略的优劣评判与优化方向提供数据支撑和理论依据。 3.2.1人工端评估 (1)被试 本研究采用被试内设计,所有被试参与4种提问策略与3类学科(数学、英语、常识)的评估。根据G*Power3.1软件计算(重复测量方差分析模型,设定中等效应量f=.25、显著性水平α=.05、检验力power=.95),预计需36名被试。实际招募自愿参与本实验的大学以上学历被试52名,经数据筛查①剔除无效作答后,最终保留有效样本41份。值得指出的是,近期研究(Yinetal.,2024)验证了智能教育在提升元认知方面的有效性,并报告了较大的效应量(η2=.17,对应f≈.45),为本研究关注的问题提供了初步背景支持。然而,考虑到本研究的具体任务(多策略、多学科评估)、测量方法以及潜在的样本差异,直接引用该研究的较大效应量进行样本量估算可能存在高估风险。为确保估算的稳健性并为实际效应量可能低于预期的情况留有余地,本研究最终采用了心理学研究中更为审慎的中等效应量标准(f=.25)作为计算依据。 (2)实验材料 实验主要采用问卷形式对使用不同策略生成的对话进行人工评测。问卷通过“问卷星”平台分阶段实施,首页呈现伦理声明与联系方式,明确告知评测者研究目的、匿名处理原则及数据用途。任务描述部分详细说明:“您将看到四组智能对话,每组对话对应不同提问策略。请根据对话中学生的元认知表现、提问的启发性以及整体体验进行评分。”题目中对“元认知”“启发性”等专业术语提供解释并举例说明。 问卷包含3道题目×4个策略=12条长对话记录,题目分别来自数学、英语和常识三个学科。初始阶段,本研究为每个学科各生成了10道题目的对话样本,随后邀请3名领域专家对这些对话进行评审,从内容难度、表达清晰度、策略区分度与对话长度等方面综合评定,最终筛选出各学科1条对话用于正式测评。鉴于本实验包含长篇对话阅读及陌生概念理解,流程较为耗时,为降低评测者疲劳、提升完成率,实验将题量控制为3道。 具体任务中,每位被试需要对3个维度(元认知引导效果、问题启发性、被试总评)进行评分,评分采用10分制,其中1分代表评分维度中的最低水平,10分代表评分维度中的最高水平。自变量为提问策略和学科类型,因变量为元认知能力引导效果、问题启发性、被试总评。另外在每道大题最后,设置开放题收集被试意见。 为确保实验结果的可靠性与可重复性,本研究评测对象并非真人与大模型的交互生成内容,而是使用了基于双智能体协同生成的对话。原因在于,真人在知识储备、表达习惯等方面存在个体差异,易对实验结果造成干扰;更为关键的是,问卷需针对同一题目生成四种不同策略的对话,若由真人参与生成,后续策略难以避免受到前序内容的影响;而大模型则具备“失忆”能力,能够在生成每轮对话时清空上下文,从而确保四种策略对话在质量与独立性上的一致性。 具体对话生成过程中,设置教师智能体与学生智能体分别承担不同任务。其中,教师智能体依据预设策略生成引导性问题,学生智能体模拟典型错误回答。针对一道题目,通过调整教师智能体的策略,共生成四组对话。每组对话包含至少3轮交互,且生成后均经人工复核,确保策略执行符合实验设计要求。 为确保实验结果的客观性与可靠性,研究采取多重措施控制潜在偏差:(1)对话记录经去标识化处理,打乱策略顺序,实验人员不知晓策略对应关系;(2)实施严格的流程控制,每页仅展示同一题目下的四组对话,防止策略受干扰;(3)生成参数标准化,且每生成一种策略后冷却5分钟并重新开启对话以消除模型记忆;(4)剔除非认真做答问卷,确保样本可靠性。 3.2.2大模型评估 本实验旨在通过大模型对不同提问策略下的对话进行智能量化评估,与人工评分形成对照。大模型评测实验材料共计60条对话记录,来自数学、英语、常识3个学科,每个学科各5题,每题4种策略(=3*5*4),所有对话经人工复核确保策略执行合规性。研究基于对话中学生的元认知表现和提问的启发性两个维度,对三类学科的对话记录进行评测。本研究具体流程如下: (1)策略对话生成:使用GPT-3.5生成数学、英语、常识三科目的多轮对话,每生成一种策略后冷却5分钟并重启对话,以降低潜在的记忆干扰。对话经人工复核确保策略执行合规性。 (2)智能模型评测:采用更高阶更智能的GPT-4.0构建自动化评估体系,元认知评分范围0~52分,启发性评分0~50分,为与人工评测统一,最终等比例缩放至10分制。 (3)数据整合:整合评测数据,分析各策略效果的学科差异与评测一致性。 在本研究中,大模型的任务被设定为模拟一位心理学评测专家,依据预先设计的量表对师生对话进行评分。量表内容具体包括元认知引导效果、问题的启发性。为帮助模型理解评分标准,在任务中提供了题目与评分示例,题目对话展示了教师智能体如何通过提问引导学生智能体进行思考与回应;评分示例则详细展示了各维度的小分及最终总评分。实际评测阶段,模型将逐条接收待评估的对话数据,并按照量表要求完成对每一条对话的打分任务。 对于元认知评估量表,采用改编自MAI量表(Schraw&Dennison,1994)的他评量表。鉴于原始MAI量表为自评式工具,而本研究所关注的是教师智能体提问对学生智能体认知调节的影响,因此对量表条目进行了形式上的改编,使其适用于外部观察与分析。在量表改编过程中,本研究一方面借鉴了已有研究对MAI量表在教育情境中的适应性转化,特别是MAIT(metacognitiveawarenessinventoryforteachers)在结构与内容上的调整逻辑(Balcikanli,2011)。另一方面,也参考了现有关于他评量表设计的实践路径,如构建大学生心灵痛苦观察者评定量表时所采用的量表设计方法等(Houetal.,2021)。部分原量表与改编量表问题对如表2所示。 尽管所依据的量表原文为英文版本,但本研究是对中文任务作答进行评分。因此,本研究在将量表引入模型时,采用了经质量控制的中文翻译版,以确保模型在与被试一致的语言情境下进行理解与判断。 为了评价提问内容的启发性水平,本研究参考了经济合作与发展组织(OECD)在其职业教育与培训教师研究报告中对“认知激活”教学策略的相关描述(OECD,2021),并据此提炼出五个关键维度作为评分依据。具体包括:鼓励学生解释复杂问题的思考过程、鼓励学生用多种方法解决问题、要求学生书面表达解题过程、将概念与现实世界相联系,针对学生未能解决的问题进行讲解。评测中要求大模型从这五个维度分别进行评分,每个维度分值为10分,总分为50分,以综合反映对话内容在启发学生思维和方面的有效性。 3.3实验结果 3.3.1定量结果 为分析不同提问策略对学生元认知能力的影响,本研究采用了重复测量方差分析(Girden,1992)对四种策略在元认知评估维度上的得分进行总体比较。进一步采用事后成对比较方法(Field,2024),明确不同策略之间的显著性差异。与此同时,结合均值、标准差与百分比提升等描述性统计指标(Lakens,2013),综合呈现不同策略在大模型评测与人工评测下的表现差异。以上统计分析均借助IBMSPSSStatistics28.0软件完成。本小结主要展示实验结果,具体原因的剖析和讨论请见第4节。 图2各维度评分平均值 注:为方便对比,该图中所有评分数据等比缩放为10分制。 为更直观地展示不同策略在各维度的表现,绘制了元认知引导效果、问题启发性和总评(以下简称为元认知、启发性、总评维度)3个维度下四种策略平均值图,如图2所示。需说明,总评维度反映被试对对话体验的整体主观感受,属高度主观的体验性评估,难以被大模型客观量化,故仅采用人工评分。最终可以看到三个维度均呈现策略1<策略2<策略4<策略3的趋势。 (1)元认知引导效果 “元认知引导效果”主要关注对话中学生体现出的元认知能力。策略影响方面,大模型评分的主效应显著,F(3,48)=2.824,p<.05,η2=.150,表明不同策略在元认知促进效果上存在一定差异。学科主效应以及策略与学科的交互效应均未达到显著水平,说明不同策略在各学科中的表现较为一致。进一步的成对比较显示,策略3(半自由有问题库,含错因分析)得分显著高于策略1(自由无问题库)(p<.05),且在三种有库策略中也表现最优。相比之下,人工评分在主效应与交互项上均未达到显著水平,但评分趋势与大模型评分一致。在具体学科中,策略3在常识、数学和英语中的元认知得分较基准策略1分别提升了9.65%、6.70%、8.69%(大模型评分)以及10.25%、3.00%、4.19%(人工评分)。标准差方面,人工评分标准差(SD=1.327)高于大模型评分标准差(SD=.735),在一定程度上反映出大模型在评分过程中可能具有更高的一致性。 (2)问题启发性 “问题启发性”维度关注的是教师在对话中提出的问题是否能够有效激发学生的思考、促使其进行深入反思与知识迁移。该维度上,人工评分与大模型评分表现出差异。 大模型评分中,策略编号和学科主效应均达显著水平(F(3,48)=8.595,p<.001;η2=.349,F(2,48)=12.198,p<.001,η2=.337),交互效应不显著,表明策略和学科因素对评分均产生独立影响。策略方面,策略3在三门学科中的启发性评分均明显优于策略1,提升幅度分别为8.16%(常识)、9.66%(数学)、13.24%(英语);说明加入“错因分析”机制能显著提升大模型生成问题的启发性。从均值来看,大模型在数学(M=8.75)和英语(M=8.64)学科中的启发性评分高于常识(M=8.08)。可能是因为常识问题的解答更侧重于快速反应和直觉判断,类似脑筋急转弯类型的题目,而大模型在这类题目中较难逐步引导学生深入思考。 相比之下,人工评分在各主效应和交互项上均不显著,但总体仍符合上述趋势。策略3在三门学科中的启发性评分均优于策略1,提升幅度为5.71%(常识)、2.38%(数学)、3.15%(英语)。常识学科的启发性评分(M=7.98)相对较低,而数学(M=8.09)和英语(M=8.01)的评分则较高。 稳定性方面启发性维度与元认知维度一致,人工评分标准差(SD=1.338)高于大模型评分标准差(SD=.601),显示出更大的评分波动性。 (3)总评 总评维度仅包含人工评测数据,主要反映被试对整段对话的主观评价,兼顾了对提问内容、交互过程与学习体验的综合感受。从结果来看,它延续了前述“元认知能力提升”和“问题启发性”的共同特征。在人工评分下,策略3的总评分依然高于其余三种策略,成对比较虽未达显著,但平均值的排序稳定,支持上述判断:策略3略优于策略4(ΔM=.033)、策略2(ΔM=.146)且明显优于策略1(ΔM=.350)。 3.3.2定性分析 在每一道题目的四组策略评分完成后,问卷额外设置了一道开放题收集评测者的具体感受与建议。开放题的问题是:“请您结合之前的四段对话,谈谈您的整体感受:哪些对话表现较好,哪些表现不够理想?请说明您的判断依据以及这些对话的优点和不足之处。”开放题词云图如图3所示。 图3开放题词云图 开放题共收集41×3=123条反馈,去除其中空白与意义不明回答后剩余有效回答92条。策略3(错因判断)被提及次数最多(23次),典型评价为“逻辑清晰”“联想发散很好”等。策略4(严格流程)提及15次,但因“步骤过多易疲劳”与“语气生硬”(9次)受到批评,策略1和2(自由发挥)则因“空洞”和“过于繁琐”获负面评价。被试提的主要建议有:把不同策略结合起来(既能灵活引导,又能系统总结)、让对话更人性化(别太死板),希望能有更多形式辅助(比如标注公式、用图形)帮助理解。 3.3.3人机评测对比 本研究采用皮尔逊相关分析检验人工评分与大模型评分在元认知引导效果和问题启发性两个维度的相关性。人工评测与大模型评测对比如图4所示。 图4人工评测与大模型评测趋势对比 (1)评测一致性验证 皮尔逊相关分析结果显示,人工评分与大模型评分在元认知维度上的相关系数为.567(p<.05),在启发性维度上为.630(p<.05),均为显著正相关,呈现中等及以上的一致性(.4<r<.6表示中等正相关)(Cohen,2013)。这说明尽管评分方式不同,两个系统在策略优劣排序上的判断方向较为一致。 (2)评测差异 尽管趋势一致,但仍存在差异。在启发性维度上,大模型评分中策略编号与学科主效应显著,而人工评分未能区分策略或学科间差异。原因可能在于评分机制不同:大模型依据明确设定的五个评分维度进行结构化评估,具备更强的判断标准与一致性;人工评分虽然题干说明了启发性含义,但评分仍受评审者主观判断影响较大。 评分稳定性方面,大模型评分在多数情境下标准差更小,尤其在策略3中表现稳定;而人工评分对语言表达的敏感性更高,评分波动性也更大。 4讨论与分析 本研究旨在通过设计智能启发式提问机制,提升学习者的元认知能力,并构建了由错因分析、策略设计与人机评测三大模块组成的研究框架。首先,本研究整理了数学、英语、常识三科的常见错因,并据此构建了一个面向元认知能力提升的启发式问题库。在此基础上,进一步探讨了大模型采用不同的提问策略时,对学习者元认知能力提升和问题启发性等多维度的影响。通过人工与大模型联合展开的评估实验发现,使用本研究所构建问题库的大模型对比原始模型,在增强学习者元认知能力、提升问题启发性、主观总体评价上都表现更优。 在本研究设计的四种提问策略中,策略3(半自由、有问题库)表现最佳。这一表现可从两个层面加以解释:其一在内容支持维度,策略3借助问题库对提问内容进行优化,能够生成质量更高、层次性更强的启发性提问。特别是问题库中由浅入深的层次设计,可引导大模型生成层层推进的提问序列,进而有效激发学生的理解与思考能力。这一发现与Shridhar等人(2022)的研究结论一致,其研究表明,自动生成苏格拉底式子问题,能够帮助学生以分步骤方式理解复杂题目,从而支持其认知过程。与之形成对比的是,无问题库的策略所生成的问题往往缺乏针对性与层次性,难以有效激发学生的认知表达。其二从生成机制来看,策略3借鉴了“思维链”(chain-of-thought)提示的核心理念,将错因作为关键节点,在设定明确生成目标的同时,保留了大模型生成的自由度。正如Wei等人(2022)的研究所指出的,这种链式机制能够引导大语言模型生成逻辑性与层次性更强的内容,进而促进学生与模型之间更深入的交互,提升问题生成质量。相比之下,完全自由的策略(策略2)虽灵活性更高,但在问题设计上缺乏系统性推进的能力,并且容易产生冗余内容;而约束性更强的策略(策略4)尽管在逻辑性方面表现更稳定,但启发性相对不足。 进一步分析表明,半自由提问策略在逻辑性、灵活性和针对性等维度都体现出了优势。在逻辑性方面,该策略通过结合知识库与生成提示,建立了明确的语境边界。研究表明(Kojimaetal.,2022),这种结构化的思维链输入能显著提升大模型推理输出的逻辑条理性。例如,通过示例问题中引导性提示词限定问题的认知层次(如“为什么”“如何改进”“有什么替代方法”),大模型在内容展开时能更系统地引导学生梳理思路、回顾错误并提出对策。在灵活性方面,半自由策略区别于模板驱动或纯检索式问答,其设计理念契合检索增强生成(RAG)技术的核心逻辑,即通过外部知识检索与语言模型生成能力的结合,提升回答的准确性和信息丰富度(Lewisetal.,2020)。教育场景的应用研究显示(Henkeletal.,2024),用户对融合检索内容的大模型生成回答接受度更高。此外,该策略赋予模型根据具体情境灵活调整措辞、添加例证和多角度探讨的能力,进一步丰富了回答的表达方式。在针对性方面,半自由策略的核心优势在于其“条件生成”机制,即模型在已知学习者错误类型或知识点背景的前提下生成具有针对性的问题。这种机制有效避免了自由生成中常见的泛化与无关内容,提高了问题对学习者当前认知状态的适配度。具体来说,策略3依托错因知识库生成问题,确保问题内容紧贴学习者的实际错误,从而更有效地触发元认知监控与调节行为。 近年来,相关研究指出大语言模型在部分文本生成任务的评估中,其结果与人工专家评估具有较高一致性,展现出一定的替代潜力(Chiang&Lee,2023)。例如Lee等人(2024)的研究表明,G

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论