版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
/算法时代的教育预测及其研究范式转变【摘要】教育研究具有描述、解释、预测等基本功能,受数据、算法和算力的限制,多年来教育研究的主要取径是理论思辨和统计验证,而对教育预测则可望不可即。算法时代的到来,为处于学科交叉前沿的定量社会科学研究带来新的曙光,也为开展真正意义上的教育预测研究提供了新的可能。该研究对教育预测的概念和前提进行了解析,提出了在算法时代实现教育预测的原理和方法,从宏观、微观两个方面分别阐明了算法时代教育预测的应用价值,同时对算法时代教育预测研究的范式特征进行了探讨,展现研究取向从“始于假设”向“基于数据”转变,研究数据从“人为设计”到“全量真实”转变,预测方法从传统回归向机器学习转变,研究模式从单一路径到多元融合转变的整体特征。随着算法时代大数据的广泛应用和机器学习算法的不断普及,教育预测研究将助推教育定量研究乃至整个教育研究的范式实现突破。【关键词】教育预测;算法时代;机器学习;深度学习;教育大数据;研究范式 科学研究的目的在于发现真理、揭示规律,它具有描述、解释、预测三大基本功能(袁振国,2017)。根据科学研究这一旨趣,教育研究的目的是对教育现象提供诠释性理解并对教育过程、结果进行因果性解释,以期廓清诸种教育现象之间的相互关系,并预测教育的发展路向(刘铁芳,等,2018)。长期以来,教育研究以描述、诠释和统计验证为主流方法,无论是“思辨主义”研究取向还是“实证主义”研究取向,均不擅长预测,致使预测似乎无关教育研究要旨(陈云松,等,2020)。出现这一现象并非悖论,教育是介于完全结构化与混沌之间的复杂系统,具有确定性与随机性、有序性与无序性交混的性质,“教育活动的因素、过程与其结果之间的相关关系是概率论的,而不是决定论的”(唐德海,等,2006),这就造成了教育研究对预测的可望不可即。 对教育现象或过程进行预测,在教育学研究中曾经昙花一现。在20世纪80年代,苏联学者盖尔顺斯基出版著作《教育预测学:方法论·理论·实践》,指出教育预测学是教育学和预测学相结合的一门新兴学科(张定璋,1993)。同一时期,我国学者宁虹出版著作《教育预测学》,对教育预测的理论基础和方法论体系进行了较系统地介绍。然而,受数据可得性和预测方法的限制,实质性的教育预测并未得到大规模推广,难以引起学术界的普遍共鸣。 随着信息技术的飞速发展,各类计算机算法不断涌现,社会科学研究者逐渐有能力处理各种规模的复杂数据,教育研究领域开始迎来预测研究的新曙光。近年来兴起的社会化媒体、移动终端、大数据、云计算、人工智能、物联网等一系列新兴技术,从不同方向进一步推动了计算机算法的应用。何谓算法?在技术层面,算法可以被描述为解决某一具体问题或达成特定目标的程序(蒋晓丽,等,2022)。而当算法以解决人的现实问题为目的时,算法便具备了社会属性,影响着人们的行为和认知,比如,通过算法推荐感兴趣的资讯、帮助人们规划行车路线及寻找停车位等(王敏芝,2021)。现阶段,算法正日益渗透到人们工作及生活的方方面面,并不断内嵌入各种社会机构的组织运行之中,越来越多的认知与决策是在算法的辅助甚至主导下完成(彭兰,2021)。我们正在步入且已经步入一个新时代——算法时代。 算法时代的到来,为开展真正意义上的教育预测研究,提供了新的可能性和可行性,也为教育研究新范式的形成创造了条件。基于此,本研究将对教育预测的概念与前提进行解析,讨论在算法时代实现教育预测的具体原理和方法,发掘算法时代教育预测的应用价值,剖析算法时代教育预测研究的范式特征。随着算法时代大数据的广泛应用和机器学习算法的不断普及,教育预测研究将助推教育定量研究乃至整个教育研究的范式实现突破。 一、教育预测的概念与前提 (一)教育预测的概念 古语有云:“凡事预则立,不预则废”。预测是人类自古以来就具备的一种行为,是人类认识活动的重要组成部分。教育预测作为社会预测的一个分支,其主要回答的问题包括:(1)在未来一定时间里,教育领域将要发生哪些变化?为什么会发生这些变化?这些变化具有何种性质?(2)这些变化将达到何种程度和范围?(3)这些变化大致在何时发生?(4)发生这些变化的可能性有多大?(宁虹,1989)教育预测具有三个基本原理:(1)连续性原理,即在教育发展过程中,只要其本质不发生变化,则其发展规律就是连续的;(2)因果性原理,即在一定的因果作用范围内,只要把握了教育发展的根本原因,就可以推知其未来发展结果;(3)相似性原理,即不同的教育过程只要发展程度及内外条件相似,则其未来的发展结果也相似(刘永政,1992)。 按照宁虹等学者的观点,教育预测按预测对象范畴的不同,可分为宏观教育预测和微观教育预测两大类(宁虹,1989)。宏观教育预测是从教育与社会、经济发展的相互联系、相互作用的角度进行的预测活动,而微观教育预测则是对受教育者个体在教育、教学活动作用下的成长过程和成就作出预测。教育预测按预测活动性质的不同,又可以分为探索型预测、规范型预测和反馈型预测三种(宁虹,1989)。探索型预测是从教育发展的历史和现状出发,通过分析教育发展的规律性来预测未来教育的可能性;规范型预测是从未来社会、经济发展对教育的需要出发,预先设定教育发展目标,预测达到这一目标的可能时间和顺序;反馈型预测是探索型预测和规范型预测的综合应用,在两种预测形式之间建立起往复循环的反馈联系。 教育活动和过程的高度复杂性,导致教育预测也具有高度复杂性,使其实现难度极大。其一,教育预测现实客体具有复杂性,它们依存于许多难以估计的、往往是矛盾的因素;其二,教育现象的影响因素具有复杂性,其受诸多因素的共同作用,这些因素有些是明显的,但更多是潜藏的、隐蔽的和偶然性的;其三,教育生活情境具有复杂性,其因时、因地、因人而异,具有不可重复、不可替代的特性(岳伟,2006)。自教育预测这一概念提出以来,曾有部分研究者围绕教育结构、教育规模、教育产出开展了一定形式的预测研究。不过,与之相关的研究方法主要还是基于传统回归分析与趋势预判。一直以来,受到数据体量、预测方法、计算能力三方面的限制,教育研究者们在开展具有科学标准的教育预测研究方面,尚未取得实质性的突破。 (二)教育预测的前提 因果关系是理解世界和揭示世界本质的重要认知方式(宋文婷,等,2021)。其实质是在所有其他变量不变的条件下,改变一个变量(X)是否会导致另一个变量(Y)的改变,如果有,则称存在从X到Y的因果关系(洪永淼,等,2021)。判定变量间因果关系的要点包括:第一,两个变量具有“共变关系”,即如果X发生变化,则Y也应该呈现相应的变化;第二,要确定因果关系,必须考虑并控制可能同时影响因果关系的其他一切变量。一直以来,科学研究秉持“凡事必有因”这一理念,将因果性作为发现科学知识的终极目标,认为只要掌握了事物发展变化的因,便可以确定性地预测其果。 相关关系是指客观现象之间确实存在的,但在数量上表现为不确定的相互依存关系(宋文婷,等,2021)。因果关系和相关关系虽然刻画的内容不同,但彼此之间并非完全独立,两者的关系可以概括为:相关关系包含确定性的因果关系和不确定的概率性因果关系。因果关系可以表现为某种相关关系,但具有相关关系的现象并不一定呈现因果性。相比于过去的科学研究一味追求因果关系的发现和阐释,随着数据科学研究和应用的兴起,人们对事物之间相关性的重视程度越来越高,甚至出现了追求因果性与追求相关性并驾齐驱的格局。尤其是在探究复杂的社会现象和本质过程中,厘清事物发展的相关关系在许多场合对开展预测来说已然足够,不必进而探寻其间是否存在因果关系。 在社会科学研究中,“解释”往往与探求因果有关,试图揭示已发生事件的影响因子和致因机制,而“预测”则是根据当前已掌握的信息去研判事件未来可能出现的结果,因果关系与相关关系均可以作为其预判的前提。长期以来,教育学研究主要专注于“向后看”的现象描述、因果识别和假设检验等,而对“向前看”的教育预测研究则缺乏热情(王中原,等,2020)。但解释和预测并非孤立的,更不是对立的,相反可以相互助益、互为补充。 概括起来,在相关、因果和预测之间,具有相关性是判别因果与进行预测的前提条件,因果则是预测的充分而非必要条件(陈云松,等,2020)。当研究目标是较为简单的研究情境下通过X对Y进行预测时,完全可以通过传统因果判断方法来解决。但如果是对未来某一复杂多变的教育现象出现的可能性、时间和强度等进行预测,那么传统的预测方法论将很难胜任这一任务。 二、算法时代教育预测的实现 在算法时代,随着各种人工智能算法的不断成熟、教育数据体量的不断增长、计算机计算能力的不断提升,制约教育预测的三大瓶颈问题已获得突破,为实现具有科学标准的教育预测提供了可能。 (一)算法时代教育预测的技术基础 1.大数据 大数据是数据概念的延伸和扩展,其数量和体量巨大,且难以用传统数据库技术与软件技术来进行处理。与传统数据相比,大数据具有四个典型特征:(1)容量巨大。大数据计量单位从我们所熟知的GB不断跃升到TB、EB、ZB甚至是YB,每两个单位逐级递增1024倍。(2)类型复杂。其数据类型除了传统结构性数据外,还包括各种半结构或非结构化数据。(3)处理速度快。大数据处理技术可以在短时间内完成TB级甚至ZB级数据集的运算。(4)价值离散。大数据强调全样本、相关性和模糊性,数据价值密度相对较低。 教育大数据是教育场景中生成的大数据,是整个教育活动过程中所产生的一切可采集到的数据集合。教育大数据可分为基础型、状态型、资源型和行为型四种。基础型数据主要指教职工与学生的人口学基本信息和人事档案数据,状态型数据涉及各种教育基础设施信息以及教育活动的运行状态信息,资源型数据涉及各类教学资源信息,行为型数据涵盖所有教育用户的行为信息(郑永和,等,2020)。 2.机器学习 所谓“机器学习(MachineLearning)”,是指一系列带有模拟人类学习行为的算法程序组合(董青岭,2017)。机器学习算法的原理是从大量已有数据中学习规律,自动发现数据中潜藏的模式并用于预测(余明华,等,2017)。机器学习算法从数据中习得模型的过程,称为“学习”或“训练”。根据训练数据是否具有标签信息,机器学习可以分为三个主要类别:监督学习(SupervisedLearning)、无监督学习(UnsupervisedLearning)和强化学习(ReinforcementLearning)。监督学习算法接受已知的输入数据集(包含预测变量)和对该数据集的已知响应(响应变量),然后训练模型,使模型能够对新输入数据的响应做出合理地预测。无监督学习直接从输入数据中找出隐藏模式或内在结构,可根据未做标记的输入数据集得到推论。强化学习算法通过与动态环境下的数据进行相互作用,不断将数据反馈作为输入,直到通过学习算法得到目标的最优解。 深度学习(DeepLearning)是机器学习算法发展的最新阶段,代表了机器学习的前沿领域,其核心思想是通过数据驱动的方式,采用一系列的非线性变换,从原始数据中提取由低层到高层、由具体到抽象、由一般到特定语义的特征(张军阳,等,2018)。因其能逐层挖掘复杂、高级、抽象特征,深度学习被形象地称为“特征学习”。与一般机器学习算法相比,其核心优势是善于挖掘高维数据中的复杂结构而不依赖于先验知识,其在金融预测等领域得到了广泛应用。 整体上,机器学习对数据本身的前提假设要求较低,通过设置训练数据对实际数据进行深度挖掘,并通过独立的验证集来验证模型的泛化能力(陈涛,等,2019)。同时,机器学习模型对因变量和自变量之间的关系没有严格限定,能更好地利用非数值变量中所蕴含的信息来提升预测的准确性。此外,机器学习算法还可以通过集成多种预测模型来提升预测准确度,以有效避免传统预测方案中使用单一预测方法所产生的预测偏差(钱浩祺,等,2021)。因而,与传统预测方法相比,机器学习拥有更为优异的预测性能。 (二)算法时代教育预测的初步探索 算法时代对教育预测的初步探索主要体现在学习分析领域。学习分析作为教育教学领域的一种新兴技术和分析手段,自诞生以来就受到广大教育研究者的青睐。自2011年起《地平线报告》曾连续两年将其列为未来2-3年的关键技术。学习分析作为收集、分析、测量和解读学习行为及学习环境数据的有效手段,可以帮助学校和学生理解和优化学习及其发生的环境(常桐善,2021)。学习分析在发展过程中,借鉴了诸多领域的分析方法和分析技术,如数学与统计方法、商业智能分析、网站分析、学业分析等;此外,数据挖掘、文本与语义分析、社会网络分析、可视化分析等也成为学习分析的关键技术(郭炯,等,2017)。学习分析领域知名学者西蒙斯(GeorgeSiemens)教授认为,预测、干预、个性化与自适应是学习分析的最终落点,可见预测是学习分析领域的重要任务之一(郭炯,等,2017)。可以预见的是,随着算法时代学习分析技术的不断成熟和普及,其在教育预测领域的应用也将“渐入佳境”。 当前,基于学习分析的教育预测研究主要集中在对学习者学习的预测上,即通过构建预测模型,识别学习者未来的学习状态。预测模型一般由预测变量、预测指标和预测算法三要素构成,预测变量用于表征学习者的学习状态,指向学习成效;预测指标用于描述学习者的学习过程,阐明学习数据价值;预测算法用于精准预测学习者未来的学习状态,揭示其学习规律(田浩,等,2020)。通过对已有相关研究中的预测模型进行梳理,发现现有学习预测模型中的主要预测变量包括学习成绩、成绩等级、学习投入度等;主要预测指标包括学习时长、人口统计学信息、学业表现、初始知识、学习者情感、人际交互、知识表征事件、学习行为序列等(范逸洲,等,2018);所使用的预测算法主要包括分类算法、回归算法和聚类算法等,且多数研究结果显示,机器学习算法的预测效果优于传统统计方法(田浩,等,2020)。 学习分析作为算法时代开展教育预测的有效手段,已被众多研究者应用于学习预测研究中,但该方法仅限于学习预测领域,尚不足以对更为宏观和复杂的教育系统进行预测。此外,在预测模型中一般存在两种导向:一种是数据导向,侧重于解释预测指标与预测变量之间的作用关系;另一种是算法导向,侧重于实现精准层面的预测和预警(田浩,等,2020)。而数据和算法正好代表了算法时代教育预测的两大技术基础,在进行教育预测时如何兼顾数据和算法这两种导向,也是算法时代开展教育预测必须考虑的关键问题。 (三)算法时代教育预测的实现过程 算法时代的教育预测方法与逻辑推演、趋势预判和传统回归等传统预测方法相比,其前提是充分承认并尊重教育系统的开放性、研究变量的非控制性以及测量对象偏好的可变性,力图充分映射教育系统的真实情景。其实现核心是在非过滤、非控制信息情形下,将教育大数据与机器学习算法进行无缝融合,利用算法习得的模式或规律去预测教育研究对象未来的行为和表现(董青岭,2017)。 1.基于传统机器学习算法的教育预测实现过程 传统机器学习算法包括决策树、随机森林、KNN(KNearNeighbor)算法、支持向量机(SupportVectorMachine,SVM)、朴素贝叶斯、逻辑回归、人工神经网络(ArtificialNeuralNetwork,ANN)、K均值(K-means)算法、主成分分析等。基于传统机器学习算法的教育预测实现过程一般如下:第一步,明确教育预测问题,采集与预测目的相关的教育大数据,包括已发生的数据和需要预测的新数据。第二步,数据预处理与特征工程。采集到的教育大数据或多或少会存在数据缺失、个别数据异常、混杂有不相关数据等问题,此时需要对数据进行预处理,包括数据清洗(处理缺失值和噪声数据)、数据集成、数据归约、数据变换、数据规范化、数据转换等操作。特征工程是指从原始教育大数据中提取数据特征,以便更好地表达教育问题本质,提高对教育领域不可见维度的预测精度(正阳,2020)。特征工程具体包括探索性数据分析、特征理解、特征增强、特征构建、特征提取、特征选择等操作。第三步,数据集切分。将处理好的教育大数据切分为训练数据集和测试数据集,分别用于模型训练和模型验证评估。有时根据需要也会将样本数据切分为三个独立的数据集:训练集、验证集和测试集。第四步,教育预测模型的选择与训练。首先,对数据集进行初步分析,判断训练集数据是否有标记,若有标记应考虑使用监督学习模型,若无应选择非监督学习模型;其次,分析预测问题类型是属于分类问题还是回归问题,以上二者都确定后权衡预测模型的优缺点选定具体的教育预测模型,使用训练集数据对预测模型进行训练,常见预测模型的优缺点比较如表1所示。第五步,使用测试集数据评估候选预测模型的性能,评估指标包括预测准确率(Accuracy)、精确率(Precision)、召回率(Recall)、ROC曲线(ReceiverOperatingCharacteristicCurve)等。根据评估结果,可以通过调节模型参数来优化已有预测模型,也可以考虑重新选择新的预测模型,经过多轮训练和评估,最终得到符合精准预测要求的预测模型。第六步,部署预测模型,输入需要预测的教育数据,得到教育预测结果。其具体过程如图1所示。 以人工神经网络算法来预测学生的学习绩效为例。人工神经网络是模仿生物神经元对等物,由被称为神经元的处理单元相互连接而组成的一套机器学习方法。神经网络的结构是分层的,神经元在连续的层中进行组装,每一层的输出均被输入到连续的层中,在输入层、隐藏层和输出层上部署非线性函数的组合(胡航,等,2021)。 开展学生学习绩效预测的具体流程为:第一,模型构建。根据预测目的和内容合理设计人工神经网络预测模型,确定输入层、隐藏层和输出层的神经元数和有关模型参数,输入层的参数包括学生学习行为指标、日常生活行为指标等,输出层参数包括学生平时作业成绩、课程考试成绩等指标。第二,样本分组。将采集到的教育大数据样本随机分为训练组和测试组两个组别,两个组均包括完整的输入层和输出层数据。第三,模型训练与评估。输入训练组中的样本数据,对预测模型进行训练。首先,将测试组中学生学习行为和日常生活行为指标数据输入模型,并将模型在学生学习绩效指标的仿真输出值与真实值进行比较。再次,根据误差进行模型调整和权值调优,如此循环往复,直至全部仿真输出结果逼近真实学习绩效结果时训练才算结束,最终得到一个较为稳定的预测模型。进而,对预测模型的预测性能进行评估,以确定最终预测模型。最后,结果预测。研究者将最新数据或样本外数据输入最终预测模型,得到有关学生学习绩效的预测输出结果。 2.基于深度学习的教育预测实现过程 深度学习作为人工神经网络的一个分支,其常用预测模型包括限制玻尔兹曼机(RestrictedBoltzmannMachine,RBM)、深度神经网络(DeepNeuralNetwork,DNN)、卷积神经网络(ConvolutionalNeuralNetwork,CNN)、循环神经网络(RecurrentNeuralNetwork,RNN)、长短期记忆网络(LongShort-TermMemory,LSTM)等(刘波,等,2021)。基于深度学习的教育预测流程与基于传统机器学习算法的教育预测流程大致相同,包括明确预测问题、数据选择、特征工程、模型选择、模型训练、模型评估、实施预测等步骤。两者的主要区别在于深度学习在处理高维稀疏数据方面具有天然优势,更适合对维度较高且结构较为复杂的教育大数据进行处理和分析,这大大减少传统机器学习中特征工程环节的工作量,可以提高预测的效率。 图1基于机器学习的教育预测一般过程 本研究同样以预测学生的学习绩效为例,使用CNN-LSTM混合神经网络预测模型,来对学生的学习绩效进行预测。对CNN而言,其由输入层、卷积层、池化层、全连接层和输出层构成,其中,卷积层和池化层用于特征工程,全连接层用于特征加权,该模型用来自动提取学生学习行为特征;LSTM通过输入门、遗忘门、输出门三个组件,与记忆细胞互相配合,使时间序列信息可以更好地向后传递,该模型用来提取学习数据的时序特征(邢红涛,等,2022)。参考相关研究,基于CNN-LSTM混合神经网络的学习绩效预测模型结构及运行流程如图2所示(邢红涛,等,2022)。在具体运行过程中,数据输入层实现对教育大数据的清洗、转换和归一化处理,输入的变量和数据包括学生基本属性、学习行为指标、日常生活行为指标、历史成绩等(杜晓明,等,2021);卷积层接收到预处理后的学习数据后,采用Same方式进行多层卷积(本示例为3层卷积),卷积后使用池化层提取学生学习数据特征并进行降维处理。然后通过LSTM模型提取学习数据的时序特征,并交由全连接层进行特征加权处理。输出层对整合后的特征进行计算并输出学习绩效预测值(邢红涛,等,2022)。 图2基于CNN-LSTM混合神经网络的学习绩效预测模型结构及运行流程 三、算法时代教育预测的应用价值 既然在算法时代能够通过大数据和机器学习,实现具有科学标准的教育预测。那么,算法时代的教育预测到底有何应用价值呢?其应用价值包括宏观应用价值和微观应用价值两个方面。 (一)宏观应用价值 1.有助于教育规划编制科学化 通过编制教育规划引导教育全面协调、可持续发展是一种有效的教育治理方式。教育规划的实施周期一般较长,影响规划内容的变量比较复杂且处于不断变化之中,如何克服这些不确定性,正确预测未来教育事业发展的目标和方向,是教育规划编制面临的首要问题。基于此,教育预测是教育规划不可或缺的基础和前提,旨在解决未来教育的“需要”问题,从而使教育规划达到“需要”与“可能”的统一。当前教育规划中所采用的预测方法,包括结构化预测和非结构化预测两类。结构化预测主要借助数学方法建立预测模型,非结构化预测主要通过定性分析和经验判断给出预测结论(戚业国,2010)。由于教育本身是一个复杂系统,在使用传统预测方法的过程中,信息数据的不全面性加大了教育预测的难度,致使规划编制可能出现偏差。比如,一些潜在的创新性行动、偶然因素对教育发展具有重要影响,但受制于信息数据和预测方法,很有可能未被意识和发现,未能进入规划编制考虑范围(高淮微,2016)。算法时代的教育预测将教育大数据与机器学习算法相融合,用于预测的数据集能够最大程度地保证信息数据的全面性、真实性和稳定性,通过不间断训练和改进教育预测模型,能够“实时”且“动态”地反映教育世界的变化,一些通过传统预测手段难以捕捉的偶然因素或小概率因素,也会被挖掘并以可视化形态展示出来,从而使教育规划编制者能从“全局”和“细节”两个方面来把握教育系统在未来一定时间内的动态变化图景,进而在规划编制过程中达到“需求”与“可能”的动态匹配和统一。 2.有助于教育决策精准化 在推进教育治理体系和治理能力现代化的过程中,教育决策科学化和精准化的重要性越来越得以彰显。传统的教育决策主要依赖于决策者的个人预判,决策者常常依据直觉、冲动或流行的趋势来进行决策,易出现决策主观化、片面化、随意化的现象(顾小清,等,2016)。近年来,随着问卷调查、专家访谈、抽样分析等手段被逐步应用于教育决策过程,促使教育决策的科学化和专业化程度有所提升。但这种基于抽样调查的决策方法,无法让决策者对教育现象形成全面、系统、准确的认识,且在决策时效性和适应性上均存在不足(钟婉娟,等,2016)。对某一决策可能引发的结果进行预测是做出正确决策的基础和依据,可以减少教育决策的盲目性,降低决策可能遇到的风险。基于大数据和机器学习的教育预测,能够借助教育大数据的实时收集和更新,以循证决策为导向,破解教育决策中选择性偏差和时效性制约,发挥大数据的循证价值,为决策者提供全局化视野,以有效弥补教育决策者在主观决策上存在的片面化倾向。同时,通过运用机器学习算法对教育大数据的分析和预测,将教育决策需要考虑的多方面因素进行量化和可视化,使教育决策者能够对潜在的教育管理问题进行提前感知,使其更清晰地掌握教育的“将来时”状态,从而使教育决策过程更加科学化和精准化(万力勇,等,2022)。 (二)微观应用价值 1.有助于学生学业预警 学业预警是化解学生学习风险的重要机制,即在学生学习过程中密切关注其学习行为,评估其学习状态,识别和判断其学习风险,并根据评估结果向学生、教师等发出预警信号,及时向其提供支持性策略和指导性活动建议,从而帮助其有效规避学业风险(晋欣泉,等,2021)。基于教育大数据和机器学习的教育预测,可以为学生学业预警提供快速、高效、低成本、高精度的技术支持,可助力学生课程成绩预警、人际交互预警、努力程度预警等。以课程成绩预警为例,其主要是对学生在未来某个特定课程中将会取得的成绩进行预测,若预测成绩低于平均水平或未达到相应的学习目标与期望,则该学习者会被标记为处于风险中,从而触发学习预警机制并启动相应的干预措施,以帮助学生有效规避风险。如廖等人(Liao,etal.,2019)提出了一种使用支持向量机进行二分类(Lower和upper)的预测方法,在课程的一个学期进行训练,从而预测和识别下一学期有可能在课程中表现不佳的学生并进行干预。努力程度预警在原理上与课程成绩预警相似,即通过对学生学习过程大数据的分析,预测其在未来学习中的努力程度,并对可能偏离正常学习状态的学生进行预警。人际交互预警则是通过分析在线或者混合式学习环境下学生之间的连接性、集群性和关联强度,重点发现并标记游离在互动性学习活动之外的学习者,以帮助教师优化其社交意识和交互行为(晋欣泉,等,2021)。 2.有助于学生学习路径规划 学习路径是指一系列具有既定目标的活动和资源组合,以帮助学习者在某个学习主题上积累知识和技能(孔维梁,等,2020)。同时,学习路径也可以被抽象化为学习行为节点的组织序列及在此基础上形成的数学建模,影响学习路径生成的因素,包括知识特征、学习者特征及学习环境特征等(崔萌,等,2020)。为学习者规划与其认知水平和风格相匹配的学习路径,有利于学习者明晰自身学习计划、合理安排学习进度及提高学习效率等(刘三,等,2016)。学习路径规划的前提条件是学习路径挖掘与预测。所谓学习路径挖掘是指从学习者学习数据中发现典型的学习路径模式,包括群体(一般)模式和个人(特殊)模式两种。学习路径挖掘可以帮助管理者、教师及学习者更加精准地掌握学习者的学习行为模式并发现存在的问题(赵蔚,等,2018)。而学习路径预测是指根据学习者已发生的学习路径数据预测其在未来学习中可能采纳的学习路径,提前对该学习路径进行诊断,并据此生成既能契合学习者个性化学习特点,又能实现最优学习绩效的学习路径。在具体实现上,学习路径挖掘主要基于学习者的学习风格、学习成绩和学习偏好,采用相关聚类算法,进行群体或个体学习路径模式挖掘;学习路径预测主要基于传统机器学习预测模型或深度学习预测模型,对学习者即将发生的学习路径进行预测,根据预测和诊断结果将最优学习路径推荐给学生。 3.有助于学生异常行为监测 异常行为是指学生在一定时间范围内的不规律行为或异于群体规律的个体行为(万力勇,等,2022)。离群点检测是学生异常行为监测的主要方式,即通过对学生学习数据间隐藏的规律进行探索,对现有及历史数据进行分析,找出异常离群数据,从而发现异常行为。辍学行为是较为普遍的学生异常行为之一。辍学行为监测的主要方法是建立辍学预测模型,基于教育大数据,利用机器学习算法,实时追踪学生的学习状态,识别有辍学风险的学习者。如钟等人(Chung,etal.,2019)以韩国165715名高中生为大数据样本,使用机器学习中的随机森林算法,来预测有辍学风险的学生,结果证实该预测模型在学生辍学行为预测方面具有出色的性能;肯珀等人(Kemper,etal.,2020)使用逻辑回归和决策树方法,基于学生公共数据,来预测德国卡尔斯鲁厄理工学院学生的辍学行为,预测准确率高达95%。近年来,大学生自杀行为已成为高校学生工作中一个较为突出和敏感的问题,引发了广泛的社会关注。使用机器学习算法对大学生自杀行为风险进行预测并及时干预,有助于降低其自杀行为发生的概率。如马卡利等人(Macalli,etal.,2021)构建了一个包含70个潜在预测因素的随机森林算法模型,对5066名被试大学生进行了自杀行为风险评估,通过与随访结果进行比较,显示出良好的预测性能。 四、算法时代教育预测的研究范式转变 随着大数据和机器学习方法在社会科学研究中的日益勃兴,算法时代的教育预测与传统定量教育研究相比,在研究范式上的差异体现为:研究取向从“始于假设”向“基于数据”转变,研究数据从“人为设计”到“全量真实”转变,预测方法从传统回归向机器学习转变,研究模式从单一路径到多元融合转变。 (一)研究取向从“始于假设”向“基于数据”转变 传统教育研究通常始于假设,这种研究路径有助于在简单可控的环境中探究普遍规律。以实证研究为例,其一般步骤是先在理论指导下提出研究假设,随后通过随机抽样等方式,获取研究数据并进行假设检验,若检验通过,则对教育现象进行进一步描述与解释;若验证失败,则必须修正假设或重新开展验证。这是一种自上而下的研究过程,但研究结论往往局限于特定的区域和时间内,普适性和时效性不佳。算法时代的教育预测强调从客观数据出发,不再仅仅热衷于追求难以捉摸的因果关系和繁琐的科学论证,也不再预设某种假设,而是通过机器学习算法,直接对底层海量数据进行对比分析、交叉检验、聚类统计和模式识别,从而发现既有问题、把握内在规律和预测相关客体的发展趋势。与基于经验的研究预设相比,研究者不必追求学术热点,可以凭借自己的专业敏感度,从海量数据集中发掘出更为宽广的问题域和新的研究问题(朱波,等,2019)。这是一种以“收集数据→分析数据→挖掘数据→结果预测”为流程的知识发现过程,相对于“始于假设”的研究取向来说,研究效率更高、研究结论的适用范围更广(邹太龙,等,2017)。这种研究进路,改变了传统教育研究追求因果推论的逻辑,不必拘泥于某种理论前提和假设,优先在整个系统层面获得更多变量间相关关系的“回路”,强化对这些回路及其节点的把握(朱波,等,2019),专注于挖掘变量之间的潜在关系和规律,最大程度地减少研究者主观因素对研究的干扰,为研究者开展原创性探究,提供了可行性。 (二)研究数据从“人为设计”到“全量真实”转变 传统社会科学研究方法备受诟病之处,在于研究数据的不完备、不科学、不公开、不透明,部分研究甚至存在数据滥用、数据造假等问题。算法时代基于大数据的教育预测研究,有望克服以上弊端。第一,大数据是“真实数据”而非“被设计的数据”。传统定量或定性研究所使用的数据采集方式强调人为设计,在理论先行和研究设计基础上有目的、有选择、有裁剪地采集研究数据,人为因素在一定程度上妨碍了研究数据映射教育真实的努力(孟天广,2018)。而教育大数据是在不干预、不介入教育活动的前提下,对教育过程和教学行为的原始记录采集,是不被设计的、不被裁剪的数据记录,数据本身可确保真实可靠。第二,大数据是“全量数据”而非“样本数据”(孟天广,2018)。大数据是接近研究对象总量或全量的数据,与传统教育研究中的抽样数据相比,“面向全体”的大数据,可以减少因抽样带来的选择性偏差和统计性误差。同时,庞大的数据样本规模,有助于发现和分析教育过程中的“小概率事件”,捕捉到传统教育研究中容易忽略的因素或变量。第三,大数据是“厚数据”而非“浅数据”。大数据不仅同时包含一般意义上的结构性数据和半结构性数据,而且还蕴含着丰富的时空结构信息,是名副其实的“厚数据”,有助于研究者从时空演变角度获得对教育现象的独到解析。第四,大数据是“开放性数据”而非“独占性数据”。研究数据的公开化和研究过程的透明化,已成为教育实证研究的大趋势。大数据具有很强的开放性和共享性,其开放共享后可供其他研究人员引用或重现研究过程,以检验研究设计是否合理;同时,还可以有效提升研究成果的学术影响力,以大幅提升教育研究的科学化水平。 (三)预测方法从传统回归向机器学习转变 在机器学习算法出现之前,教育研究者主要依赖最小二乘回归(OLS)等传统回归方法,开展定量化预测研究。即将研究情境进行简化,提取自变量和因变量利用回归模型,来确定自变量X的变化是如何与因变量Y的变化相关联的,并据此作出预测(陈云松,等,2020)。将复杂的教育系统要素高度简约化为几个自变量和因变量,并进行回归分析,所使用的信息多为替代变量,而不是可靠的直接变量,计算模型对教育对象和教育过程的过度简化,使得预测本身很容易存在偏差,并具有一定的形式化风险(谭维智,2019)。而机器学习算法通过解构和模拟人类思维和人类认知策略,通过算法的自我“训练”和“学习”,可极大提升算法模拟和预测复杂教育系统的能力。如决策树递归算法的本质是把一个较复杂问题分解为几个较为简单的子问题,然后通过找出局部的或阶段的最优解,再堆叠出全局的或整个阶段的最优解,
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 银行保卫年终个人工作总结报告
- 2025届阳江市阳春市数学四年级下学期期末学业水平测试试题含答案解析
- 2026年泰康保险秋招面试题及答案
- 立基础常见试题及答案
- 2026年申明食品集团招聘试题及答案
- 2026年上海电气秋招面试题及答案
- 2026年天津市人教版初中英语上册第3单元词汇巩固习题
- 2025-2026年广东省苏教版小学五年级科学上册第10单元课后练习题
- 2025-2026年云南省人教版初中英语第8章课后练习题
- 2025届铅山县四下数学期末教学质量检测试题含答案
- 华东五校深度解析课件
- 二级管配筋设计图册
- 3.1《一切靠劳动》课件 统编版道德与法治三年级下册
- 学生营养知识
- 奇山异水云之南课件
- 烙铁焊接知识培训课件
- 汽车营地行业分析报告
- 海洋工程装备与电子信息:助力海洋开发技术革新
- 2025-2026学年人教版三年级美术上册全册教案
- 2025-2026学年北师大版八年级生物上册全册教案
- 屋面木结构框架施工方案
评论
0/150
提交评论