前沿元分析模型及教育研究应用_第1页
前沿元分析模型及教育研究应用_第2页
前沿元分析模型及教育研究应用_第3页
前沿元分析模型及教育研究应用_第4页
前沿元分析模型及教育研究应用_第5页
已阅读5页,还剩6页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

/前沿元分析模型及教育研究应用【摘要】元分析在教育领域已得到广泛应用。然而,随着教育问题的日益复杂化,传统的元分析方法在应对复杂数据结构时显得力不从心。在国外,面向不同情境的前沿元分析模型方兴未艾。但在我国教育领域,新元分析模型的应用却显得相对滞后。鉴于教育领域面临的问题具有其他学科不具备的特殊挑战,亟须引入一些前沿的元分析模型,以缩小国内外相关研究领域的差距,并拓展国内元分析者解决问题的范畴:三层次元分析,它能处理具有相关性的效应量;网络元分析,它能同时比较多种干预措施的效果;二阶元分析,它能整合一阶元分析冲突的结果,从而获得更精确的结论。文章详细阐述了这些前沿元分析模型的原理、特点及其适用范围,深入探讨了它们在教育学中的具体应用,以及可能带来的机遇与潜在挑战。【关键词】三层次元分析;网络元分析;二阶元分析;效应量;教育统计模型

一、引言 元分析起源于1976年,由格拉斯(Glass)首次提出,旨在通过合并效应量来评估不同研究结果的一致性和差异性。[1]元分析属于系统评价中定量研究的方法,能将特定领域内多项研究的结果进行整合分析,从而获得更加准确、更具普适性的结论。[2]传统文献综述受限于其主观性和非量化特性,难以提炼出具有普遍意义的结论,更无法对研究质量与样本特征给予充分考量。因此,文献综述虽然数量庞大,却难以提供令人信服的定量证据。最初,元分析应用于循证医学领域,旨在解决临床试验结果的不一致性难题,评估特定医疗干预的有效性。随后,其应用范围迅速扩展至心理学、教育学等多个学科领域,特别是在教育领域,近年来元分析的应用更是呈现出井喷式增长。在"WebofScience"网站上联合搜索"meta-analysis"和"education",可以搜索到一万七千多篇相关文献。在2000-2010年期间,每年只有一百多篇到三百多篇的教育类元分析文章发表;然而自2019年起,年发表数量突破千篇,并保持持续增长的强劲势头。这一数据不仅直观反映了元分析在教育研究中的重要性,也预示着其在未来教育研究中的广阔应用前景。 为何众多学者纷纷将元分析从医学、心理学领域引入教育领域?其根源在于元分析能够精准击破传统文献综述难以触及的难题与挑战。在教育领域,元分析的价值尤为显著,主要体现在三大方面:其一,元分析是解决教育领域争议性问题的利器。教育领域常面临研究结论相互矛盾的情况,如游戏化学习对学生批判性思维的影响,既有支持者亦不乏反对声。通过汇总并分析21项研究的效应量,毛(Mao)等人的元分析明确揭示了游戏式学习对学生批判性思维具有显著的正面效应,为这一争议提供了确凿的量化依据。[3]其二,元分析能够深入剖析同一教育主题下不同研究结果的差异性,揭示其背后的原因与程度,这是传统文献综述无法做到的。例如,在探讨数字工具对教学效果的影响时,不同研究间的结果大相径庭。那么,不同的研究结果之间存在多大程度的差异?这些差异可能的原因是什么?雷浩等通过对一百多项数字工具对教学影响的相关实证研究进行元分析发现,不同研究间的差异高达77.4%,并通过亚组分析明确了文化背景等调节变量的具体影响,为理解这些差异提供了深刻的洞见。[4]其三,从统计学视角审视,元分析其优势在于采用定量方法非主观地整合多个实证研究结果,从而增强了统计效力,确保了结论的精确性与可信度,受单个实验本身的随机误差和实验条件限制的影响较小。元分析具备明确的操作流程、透明的搜索与操作策略,任何人都可以自行验证,因此它的结果更加客观。[5]同时能有效评估研究偏倚,为研究者全面把握研究领域现状提供了有力支持。 然而,随着元分析在教育领域的欣欣向荣,潜藏的危机也悄然浮出水面。目前国内教育领域关于元分析的研究大多采用固定效应模型或随机效应模型,这些模型虽然为早期的元分析研究提供了基础,但是在处理具有复杂结构的数据时,会难以反映真实的数据情况,使结果解释不准确,影响研究的有效性和可靠性。它们难以处理纳入研究中效应量之间的相关性,难以同时系统地评估多种干预措施的效果,难以剖析元分析自身结论间存在差异的情况。面对传统元分析的局限性,国外的研究者们已经开始向更加前沿的元分析模型转移,以更好地适应教育研究的需求。以三层次元分析、网络元分析、二阶元分析为代表的前沿元分析模型,喻示了元分析方法学在教育领域的重要进步。截至2024年10月,在中国知网以“三层次元分析/三水平元分析”“网络元分析”及“二阶元分析”为关键词,在教育领域的期刊论文中进行“篇关摘”搜索,结果显示:仅检索到两篇关于三层次元分析的论文,一篇二阶元分析论文,而网络元分析论文数为零。这一数据与其在国外教育学领域的广泛应用形成了鲜明对比,凸显了国内教育领域在前沿元分析模型应用上的相对滞后。 随着教育研究的不断深化,面对的问题日益复杂化,传统元分析模型的局限性愈发凸显。然而,国内教育领域内关于前沿元分析模型的研究尚显薄弱,原因之一就是缺乏方法论的研究,目前国内还没有专门探讨前沿元分析方法学的文章。为了应对教育研究的复杂性挑战,降低元分析应用的门槛,助力研究者选择适用的元分析模型,本文旨在详尽阐述三种前沿元分析模型的核心内涵与作用机制,明确它们所能解决的教育问题范畴及适用场景,同时探讨这些模型为教育领域带来的潜在机遇与挑战。 二、三层次元分析模型 (一)三层次元分析模型的作用机制 三层次元分析是一种统计技术,用于处理多层次结构的效应量。它在传统元分析只分析抽样误差(层次一)与研究间异质性(层次二)的基础上,额外增加了一个层次:研究内异质性(层次三)。这使得它能解决传统元分析无法解决的效应量存在依赖性的问题,提高了统计效力。[6]实际问题中,效应量存在相关性的情况更为普遍。此时,效应量之间就会有重叠的部分,这些部分就会让结果被过度信赖,从而影响结果的准确性与可靠性。当同一研究报告了多个效应量时,如果这些效应量互相独立,那自然可喜,但是如果它们有相关性,那如何妥善处理这一挑战显得尤为重要。 针对这一问题,范(Van)等人指出了实践中存在的三种情况以及应对的方法:一是无视相关性,还把它们当独立变量处理;二是避免相关性,只选一个有代表性的效应量;三是建立相关性之间的联系,比如构建多变量元分析模型。[7] 接下来剖析这三种策略的优劣:第一种方法,忽视相关性。如果效应量存在相关性,它们提供的信息会存在重叠。这就会导致同样的信息被使用多次。那么标准误差就会被低估,进而窄化了置信区间,高估了结果的置信度,最终影响元分析结果的准确性。[8]第二种方法,在单个研究中只选取一个有代表性的效应量。这种做法固然避免了相关性问题,但会导致数据信息的缺失,致使元分析的估计不够准确,降低了统计功效。[9]第三种方法,建立相关性联系。如多变量混合效应元分析。然而,它实施的门槛较高。多变量元分析需要用到协方差矩阵,但是原始研究很少(几乎不)会报告研究结果之间的相关性,也几乎不提供能用于计算协方差的数据,这就导致多变量元分析难以进行。[10] 面对多变量元分析面临的挑战,范等人[11]提出了三层次元分析,以更有效地处理效应量间的相关性问题。它不需要用到实践中鲜少报告的抽样协方差,从而避免了多变量元分析面临的实施困境。这种方法为元分析领域提供了新的视角和工具,有助于在复杂的数据结构中获得更加准确、可靠的研究结论。三层次元分析模型主要用于解决效应量间存在相关性的问题,它将数据分为三层的嵌套结构:层次一关注效应量的差异,层次二关注同一研究内部的差异,层次三关注不同研究之间的差异。 层次一(效应量层):建模单个效应量的抽样误差,表现为效应量自身的变异。层次一反映了单个研究中每个效应量的抽样波动,可以包含效应量层面的预测变量。 层次二(研究内层):本层量化同一研究内多个效应量间的真实变异。这是三层次元分析的创新之处,能够处理同一研究多个效应量间的相关性。该层次可引入研究内的特征变量,解释研究内效应量的异质性来源。 层次三(研究间层):本层关注不同研究之间的真实效应量差异。研究间层次也可以包括研究层面的调节变量,用于探讨不同研究之间效应量差异的来源。 (二)三层次元分析在教育领域的应用与步骤 国外教育学领域的前沿探索中,三层次元分析模型已展现出其强大的应用潜力。以胡(Hu)等人的研究为例,该研究首次将三层次元分析模型应用于基于游戏的学习(GBL)的教育效果分析中。通过对842篇文献的筛选,纳入了34个研究,系统地评估了GBL在化学教育中相对于非GBL(媒体对照组)在认知、动机和情感层面的综合效应。研究结果表明,相比于传统教学方法,GBL在提高学生的认知和动机方面具有显著优势。此外,该研究还探讨了教学设计特征和方法特征作为潜在的调节变量对教育效果的影响,结果发现GBL对认知(g=0.70)、记忆(g=0.59)和动机(g=0.35)均具有显著促进效果,且三层次元分析模型更为精准地刻画了研究内(I2=33%;22%;49%)与研究间(I2=53%;70%;12%)的异质性水平,这些详尽的分析为结果的稳健性和可靠性提供了有力支撑。[12]相比之下,卡拉科奇(Karakoç)等人采用传统元分析模型探讨了游戏化学习对学习成绩的影响,得到的效应量(g=1.70)虽然更大,但他们的研究仅报告了Q统计量(Q=859.67),未能深入分析研究内部的异质性[13],这可能是因为某些相关的效应量被重复使用,导致高估了结果的置信度,使得研究结论的可信度和准确性受到质疑。 进行三层次元分析的步骤如下:第一步,确定元分析主题,制定纳入准则。第二步,检索文献,根据纳入准则筛选出需要的一手文献,评估它们的文献质量。第三步,在提取数据的过程中,编码数据的层级结构。假设一共有4个研究,却有7个效应量,此时有的研究报告了多个效应量而有的没有,则要同时给研究和研究内的效应量编号。研究编号为1—4放在第一列,效应量编号为1—7放在第二列,具体效应量的值放在第三列。每个研究的所有效应量从属于该研究。这里的目的是确定好效应量与对应研究间的嵌套关系,以便后续处理多重效应量。第四步,构建元分析模型的三个层次。层次一是单个效应量,层次二是同一研究内部的效应量,层次三是不同研究间的效应量。第五步,数据提取完毕后,需要用R软件进行编程计算。在这一步,元分析者需要进行发表偏倚检验、异质性检验、模型拟合度检验、主效应检验、调节效应分析,并绘制森林图和漏斗图。对于具体的软件操作步骤,研究者可以参考阿辛克(Assink)等人提出的关于使用R语言进行三层次元分析的指南。[14]第六步,报告编程获得的结果,包括总体效应量估计及其置信区间和p值;三个层次的方差估计值;不同层次的异质性统计量(I2)及方差估计值(τ2);模型拟合指标,包括AIC、BIC、对数似然值等指标,比较模型拟合优度,若三层次模型的拟合度更优才会选三层次模型;发表偏倚检验的结果,包括egger's回归的结果和漏斗图;调节变量的效应量、置信区间、标准误差、p值等相关数据;森林图。 (三)对三层次元分析方法的分析与述评 三层次元分析在教育研究中展现出良好的应用前景,特别适用于解决效应量存在相关性的复杂教育问题。首先,三层次元分析能解决教育研究中,同一文献报告多个相关效应量的问题,如一篇文献同时测试并报告了学生在不同科目上的学业成绩。三层次元分析能够有效处理这些效应量之间的依赖性,因为它考虑了数据的分层结构。此时,研究报告的效应量的多少并不会对总体效应量的估计产生过大的影响。之前提到,使用有相关性的效应量会让同一个信息被过度信赖,从而高估置信度,让总体效应量的估计产生误差。但是在三层次元分析模型中,某个提供了10个效应量的研究对平均效应量的贡献不会比只提供1个效应量的研究大10倍。[15]传统元分析在这种情况下可能会因忽略效应量的相关性而导致结果偏差,而三层次元分析则通过引入研究内异质性的方式,准确估计总体效应。其次,三层次元分析特别适用于传统元分析无法解决的数据具有层次结构的问题。三层次元分析模型能够充分利用这种嵌套数据结构,考虑不同层次上的变异,进而深入探讨影响教育结果的因素。这对于理解教育干预措施在不同层面上的效果差异具有重要意义。[16]最后,即便所有研究报告的效应量的数量不一致,也能把这些效应量合并进三层次元分析模型进行运算、分析。[17]有的研究只报告了一个效应量,有的研究却报告了多个,传统元分析的做法是合并平均效应量,或者是多个中选一个。而三层次元分析引入“研究内方差层”,建模研究内部的相关性,合理利用全部数据。 三层次元分析模型不仅能考虑研究内部的抽样误差和真实变异,还能引入预测变量来解释效应量的差异来源。它同时建模同一研究内部多个效应量之间的相关性,以及不同研究之间的异质性,从而更全面地揭示效应量的变异结构。然而,三层次元分析带来的不仅是机遇,也会为教育研究者带来一些挑战。运用三层次元分析时,我们需要注意以下问题:第一,其计算复杂度超出CMA等常规软件处理能力,必须依赖R语言的meta、metafor语言包进行编程实现,这对非计算背景研究者构成显著的技术壁垒;第二,模型中预测变量的层级归属直接影响结果的有效性,若误将个体层变量纳入研究层变量,错误的归因会产生误导性结论;第三,尽管三层次元分析模型能较好地处理相关的效应量和多层数据结构,但不恰当地使用可能会导致过度拟合的问题。传统的随机(固定)效应模型是三层次模型在固定第三层的方差为0的特例。如果通过似然比检验发现零假设的检验统计量不显著,那说明三层次模型在拟合度上并不比传统模型更高,此时要根据目的谨慎选择模型。[18]在使用三层次元分析模型时,应慎之又慎,避免陷入以上误区。 三、网络元分析模型 (一)网络元分析模型的作用机制 网络元分析作为一种前沿元分析方法,通过合成随机试验网络中的证据,来评估多种干预措施的相对效果。这种方法基于同时分析直接证据和间接证据,即使这些不同的干预措施没有在同一个研究中直接进行过比较。网络元分析可以合成整个证据网络,获取所有比较的相对效果以及相对效果的排名。[19] 下面以三个干预措施的情况为例,介绍网络元分析的思路:假设一个比较B、A的实验得出B比A的平均值高3.1分,记为BAdirectcomparison=3.1;一个比较B、C的实验得出B比C的平均值高1.7分,记为BCdirectcomparison=1.7;那么通过间接比较,可以得出C比A的平均值高1.4分,记为CAindierctcomparison=1.4。除此以外,如果有实验直接比较了C、A,那么网络元分析可以通过加权平均的方式计算直接效应值和间接效应值,从而计算出混合效应值,这种方式也称为混合比较。比如,假设直接比较C、A的实验得出C比A的平均值高1.5分,记为CAdirectcomparison=1.5,那么可以简单的假设C对A间接比较的权重为w1=0.5,C对A直接比较的权重为w2=0.5,则最终的混合效应值为: CAMixedcomparison=w1*CAindirectcomparison+w2*CAdirectcomparison=1.45 这个计算效应值的方程也可以添加相应的权重,使其拓展到n个直接比较、间接比较的情况。 值得注意的是,与直接比较不同,间接比较有效的前提为:除了进行比较的干预措施之外,其余控制变量之间没有明显差异,并且干预措施在不同的比较中出现时不存在实质性差异。[20]这就是网络元分析的一大前提——“相似性”假设。除此以外,网络元分析还应注意以下几个前提:第一,纳入的实验应当是随机对照实验。第二,网络元分析的网络图应为连通图,即任意两个节点之间都有一条通路。这确保了纳入的所有研究都是可比的。第三,符合传递性(及物性)假设。相似性假设是局部条件,是对进行间接比较的两种干预措施(如A、C)而言的,它要求的是AB、BC组研究的潜在调节变量相似。但是这并不能保证其余干预措施的潜在调节变量和A、C也相似。传递性假设要求所有进行比较的研究组(以及网络图中连接它们的节点)的潜在调节变量都应该是相似的,差距并不会大到使网络失效,即不会使得任意两种干预之间的差距大到不可比较。第四,为网络元分析选择贝叶斯框架或是频率主义框架。一般而言网络元分析会选择前者,因为贝叶斯框架能提供不同干预措施的排名及其可信区间,相比频率主义更为灵活、结果更具可解释性。 (二)网络元分析在教育领域的应用与步骤 当前,网络元分析已在教育研究中落地,尤其用于对比不同教育方法对学生学习结果造成的影响。它不仅打破了直接比较的局限性,还能综合直接与间接证据,全面评估多种干预措施对目标群体的相对影响,即便这些干预措施在单一研究中并未直接交锋。[21]这就有助于研究者利用所有的相关研究,选出效果最好的干预措施。 以支架式教学为例,这种教学方法已广泛应用于多种教学模式中,如基于问题的学习、项目式学习、设计式学习和探究式学习。传统元分析模型多聚焦于比较使用与未使用支架式教学的学生之间的差异,通常采用两两比较的方式。比如,张(Zhang)和马(Ma)的元分析表明,与传统教学模式相比,项目式学习显著提升了学生的学习成果,对学业成就、情感态度和思维能力均产生了积极影响。[22]多希(Dochy)等人探讨了与传统教学相比,基于问题的学习对高校学生的知识与技能这两大学习成果是否有更好的影响。结果表明,基于问题的学习对学生技能的提升有显著的正向影响,对知识的影响结果则存在争议。[23]从上述例子可以看出,传统元分析无法对比支架式教学在不同应用场景下对学生认知能力提升的差异。他们不能同时比较到底是基于问题的学习对学生的提升更大,还是项目式学习对学生提升更大。为了解决这一难题,贝兰德(Belland)等人通过网络元分析方法,全面比较了支架式教学在不同使用环境、不同学生群体以及不同STEM学科中的认知效益,为该领域的研究提供了新的视角。[24]该研究结果表明,无论是在大学生、研究生还是学习障碍生中,支架式教学均能显著提高学生的认知能力,尤其在项目式学习、技术和数学学科中效果最为显著,提高的效应量至少一个标准差。这一发现突出了支架式教学在多种教育情境中的普遍有效性。贝兰德等人的研究填补了支架式教学领域缺乏网络元分析的空白,在统一的框架内比较了多种教学环境下支架式教学带来的不同收益,并对多种干预措施的效果进行了排序,让读者知道支架式教学究竟运用于何种教学环境下更有效。这充分利用了直接与间接证据,提升了研究结果的可信度。 除去传统元分析需要的制定纳入准则、收集文献等环节,在教育研究中进行网络元分析的流程可归纳为以下步骤:第一步,构筑网络图并评估证据质量。依据GRADE指南构建网络图,图中节点代表不同干预措施,大小反映研究数量或样本量,线条粗细表示成对比较的研究数量。[25]在绘图过程中应同步评估证据质量与置信度。布里尼亚尔德洛(Brinardello)等人基于GRADE2014提出了适用于网络元分析的新评估方案,可评定每一比较证据的确定性。[26]第二步,验证相似性和传递性假设,确保网络图中干预措施的可比性。通过比较特定循环中的直接效应与间接效应来检验网络的传递性。[27]若发现潜在调节变量分布不平衡导致网络的传递性假设不满足,可采用网络元回归调整。若调整完后仍存在直接与间接效应量的不一致性,可通过亚组分析或元回归解释其来源,类似传统元分析中对异质性的处理。[28]第三步,用软件实现网络元分析。使用STATA和R等统计软件,根据柴玛尼(Chaimani)和纽帕内(Neupane)等人的操作指南完成网络元分析的运算与结果输出。[29-30]第四步,网络元分析可得出平均效果排名及成为最佳干预的概率。例如,贝兰德(Belland)等人的研究展示了支架式教学在六种教学模式中的影响排名及其获得最佳效果的概率。平均排名表示某种干预在所有干预中相对效果的平均名次,数字越小,说明它的干预效果越好。成为最佳干预的概率是指在所有模拟中,某种干预被评为最好的概率。在干预排名中,项目式学习的平均排名为2.81,成为最佳干预的概率为44%;探究式学习的平均排名为5.08,成为最佳干预的概率仅为6%。这表明项目式学习在所有干预中的效果最好,最有可能成为最有效的干预手段;而探究式学习在本次元分析中效果最差。 (三)对网络元分析方法的分析与述评 网络元分析尤其擅长解决需要同时比较多种干预措施的复杂教育问题,而传统元分析模型只能进行两两比较。在贝叶斯框架下,网络元分析能够对不同干预措施的效果进行概率排序,给出每种干预措施位于各个排名位置的概率。[31]这样就能全面比较不同干预措施的优劣,为政策制定者和教师提供选择最佳干预措施的依据。[32]网络元分析还能解决存在许多间接证据的教育问题。相比传统元分析只能进行直接比较,网络元分析可以同时进行直接比较与间接比较,从而整合碎片化的研究证据。只要被比较的干预措施在网络图中是连通的,它们就能进行间接比较,哪怕这些干预措施从未直接比较过。在网络元分析中,干预效果的最终效应值由直接比较、间接比较的效应值共同得出。某些情况下,间接比较能比直接比较提供质量更高的证据,特别是当直接比较的文献质量评估较差或样本量较小时。[33]这使得网络元分析能够最大化地利用所有相关研究数据,得出更加科学准确的结论。网络元分析通过一个统一的统计模型来综合所有相关证据,用一致性检验评估直接比较与间接比较的一致性[34],从而提高了结果估计的可信度和精准度。 因此,网络元分析在教育研究中具有广泛的应用前景,能用于多个干预措施的比较、综合直接与间接证据、给出干预措施的相对排名。其方法学优势为教育理论的发展和实践改进提供了强有力的工具,有助于推动基于证据的教育决策和教学改革。 然而,在使用网络元分析时,也要注意一些相应的问题,避免踏入误区:第一,网络元分析经常会出现一些直接证据与间接证据互相矛盾的情况,这对研究者解释不一致性、采纳何种证据造成了巨大挑战。比如,对比翻转课堂(A)和项目式教学(B)的混合效应值ABMC=0.5,95%CI=[-0.7,1.1],而A和B的直接比较得出的效应值为ABIM=-0.5,95%CI=[-1.0,0.6]。虽然二者的置信区间是存在重叠的,但是效应量的估计方向却是相反。此时应该对它们的一致性进行检验,如果发现p>0.05,说明直接证据与间接证据确实存在矛盾。此时是应该采纳直接证据,还是试图找出矛盾的原因,就较为考验元分析者的功底。第二,相较于传统元分析,网络元分析在执行和结果解释上具有更高的复杂性。常见的误区包括研究者经常对研究结果进行过度解释,错误地认为研究结果能明确地确定不同干预措施的效果或排名,高估了其统计效力。[35]网络元分析独有的传递性和不一致性评估也需要丰富的教育研究知识和专业的统计知识才能判断。 四、二阶元分析模型 (一)二阶元分析模型的作用机制 元分析作为一种科学的定量统计手段,旨在系统整合多项原始研究数据,以深化对特定议题的理解,确保结论的全面性与准确性。在此基础上,二阶元分析进一步升华。二阶元分析又可称为“元分析的元分析”,是对相似主题的一阶元分析研究结果进行定量综合。它通过合并不同一阶元分析的结果,估算其总体效应量,降低二阶抽样误差对结果的影响。[36]二阶元分析能够提供比单一元分析更精确的结果,解释相同主题下元分析结果的差异,并深入探讨其异质性的来源。由于一阶元分析之间可能存在样本特征、效应量等差异,二阶元分析利用先进的统计模型量化这些差异,从而评估影响总体效应量的高层次因素。通过综合多个一阶元分析的结果,二阶元分析能减少单个元分析的偏倚,提高效应量估计的可靠性。因此,当某一领域积累了大量元分析且存在争议时,二阶元分析成为重要的分析工具。二阶元分析要求一阶元分析之间具有统计独立性,即不同一阶元分析中的研究样本不能重复出现在其他一阶元分析中,以免造成偏差。若此条件难以满足,需尽量减少非独立性的影响,如剔除重叠研究。 施密特(Schmidt)等人[37]将二阶元分析分为基本框架二阶元分析与心理测量二阶元分析。后者又可细分为三种类型:(1)逐一校正法:要求一阶元分析中的每个相关系数均已独立校正了测量误差与偏差。这种方法精度高,但在实际应用中需要原始研究提供足够多的信息。(2)模拟误差分布法:由亨特[38]等人提出,利用来自其他可靠来源(如测量工具的信度)的数据,构建误差分布对效应量进行整体校正。该方法操作性强,但精度取决于分布构建的合理性。(3)混合型方法:结合了前两者的优点,对提供完整信息的研究进行单独校正,对信息不足的研究则采用人工分布校正。这种方式能最大程度整合信息,提高效应量估计的准确性与实用性。 (二)二阶元分析在教育领域的应用与步骤 在线学习领域经过多年的发展,不仅积累了海量的实证研究,更有大量的元分析文献。然而,该领域的元分析研究结果却存在着冲突。卡瓦诺(Cavanaugh)等人分析了1999年至2004年间14个基于网络的K-12远程教育项目的116个效应量,发现总体效应量Cohen'sd=-0.028,可以说在线学习和传统教学对学生学业成绩的影响没有显著区别。[39]伯恩斯(Burns)和昂格莱德(Ungerleider)的元分析也支持了这个论断,网络教育与传统教育在学业成绩方面没有显著差异,学生对传统教育的满意度还要高于网络教育(g=-0.509,p<0.001)[40];然而,裴(Pei)和吴(Wu)却对此有不同的结论,他们整合了16项2000-2017年间的在线学习文献,以评估在线学习与线下学习在本科医学教育中的效果差异。他们发现,在线学习在提升本科医学生的知识和技能方面具有显著优势,并且提升的强度较大(SMD=0.81,p<0.001)。[41]当元分析的结果出现分歧时,该如何处理呢?此时,二阶元分析便应运而生。为了整合在线学习领域一阶元分析冲突的结论,马丁(Martin)等人利用二阶元分析深入探讨了在线学习与线下学习在学习成效上的差异。该研究综合了19个一阶元分析,全面评估了在线与线下学习对学生的认知、情感和行为方面的影响。他们检验了在线学习的发展阶段和教学环境作为调节变量的作用,并对一阶元分析的方法学质量进行了评估。使用二阶元分析,他们不仅能比较不同元分析的效应量差异,还能探索哪些外部因素可能影响这些效果。[42]他们发现,在线学习在认知、情感和行为结果上总体上优于线下学习,具体效应量为g=0.156(p<0.001)。特别是在高等教育与K-12教育的对比中,在线学习在高等教育中的成效更为显著。此外,研究还显示,在线学习的不同阶段对学习效果的影响并无显著区别,这为政策制定者决定在哪些教育阶段推广在线教育提供了重要参考。马丁等人还指出,他们纳入的一阶元分析中,总体效应量间存在相当大的异质性,这证明了这些一阶元分析应当使用随机效应模型。这正是二阶元分析的一大优势所在:它能够提供更为可靠的结论,并解释一阶元分析无法阐明的内容。 下面阐述使用二阶元分析进行教育研究的具体步骤[43]:第一步,明确研究目标,收集一阶元分析中的数据,如每个一阶元分析的效应量、标准误差、样本量、测量工具的信效度等信息。可能的调节变量和研究质量指标也要录入数据。要注意每个研究是否提供了足够的信息进行单独校正。第二步,选择恰当的效应量,比如相关系数、标准化均差、风险比等。第三步,对纳入的一阶元分析进行质量评价和校正。对于提供了足够信息的研究,单独校正其相关系数;对于没有提供足够信息的研究,使用来自外部文献或可靠来源的校正参数(如测量工具的信度系数、范围限制等),利用模拟误差分布法对整体效应量进行校正。第四步,将单独校正和基于人工分布校正后的效应量合并,进行整体的二阶元分析。此时,混合二阶元分析会考虑到每个研究的独特贡献和校正后的整体效应。在数据分析层面,二阶元分析与一阶元分析的方法有着诸多相似之处。研究者只需从一阶元分析中提取出样本量、效应量和标准误差等关键数据,然后依据斯廷伯根(Steenbergen)等人提出的二阶元分析效应量计算公式进行计算即可。[44]如果异质性指标较高,则使用随机效应模型;否则,使用固定效应模型。包括计算总体效应量、评估发表偏倚、检验调节变量等在内的所有操作,均可在CMA软件中便捷完成,其方法与一阶元分析相差无几。第五步,报告数据分析的结果,包括异质性检验结果,总体效应量,发表偏倚的Egger's回归结果,调节效应分析的效应量、标准误差与置信区间等相关数据。 (三)对二阶元分析方法的分析与述评 二阶元分析在教育研究中具有重要的应用价值,尤其适用于解决以下教育问题:首先,当某一教育主题已有多项一阶元分析,但其结果存在差异甚至矛盾时,二阶元分析能够有效地综合这些研究,提供更为精确的效应量估计。它的结论建立在更为庞大的样本群体之上,因此更为可靠。[45]通过二阶元分析,可以整合一阶元分析的结果,降低二阶抽样误差的影响,从而得出更为稳健和可信的结论。这让教育实践者在面对纷繁复杂的研究结果时,提供了明确的指导。其次,二阶元分析有助于深入探讨异质性的来源。当不同元分析之间仍存在异质性时,二阶元分析可以在更高层次上考察影响效应量的调节变量。它提供了一种同时测试多个调节变量的方法,若二阶抽样误差解释了元分析的平均效应量的所有异质性,这说明观察到的元分析平均效应量之间的差异并不代表真实的调节效应。[46]第三,二阶元分析不仅能够量化在多大程度上二阶抽样误差方差解释了一阶元分析中平均效应量之间的差异,还能解释这些差异中有多少是由真实的、系统性的变异因素(即非随机的方差)所引起的,这为理解效应量差异的本质提供了新的视角。第四,二阶元分析可以计算元分析在平均效应量之间的差异的可靠性。这反过来又可以比较不同一阶元分析研究之间的差异,检验各一阶元分析研究结果的一致性。[47] 在运用二阶元分析时,不能忽略它带来的挑战,应注意以下问题:二阶元分析要求一阶元分析之间的统计独立性。由于实践中难以做到,因此,只要将每项一阶元分析研究的样本重叠比例控制在25%以内即可。如果超过这个比例,则依次去掉重复率最高的一阶元分析。[48]这就对样本的收集提出了挑战:二阶元分析要求纳入的一阶元分析是同一主题的,但同一主题下的一阶元分析往往会搜集重复的样本,这就容易违背独立性原则。而为了满足独立性原则,又易使纳入的一阶元分析数量不足。此中过程,还需元分析者多加琢磨。另外,二阶元分析的过程中还应对纳入的一阶元分析进行质量评价,评估其在文献检索范围、纳入标准、统计方法等方面的差异。低质量的一阶元分析应该考虑不纳入数据集中。 五、总结 在元分析领域,固定效应模型与随机效应模型作为经典模型,长期以来占据重要地位。然而,随着教育研究的不断深入与复杂化,这些传统模型在应对新兴问题与挑战时显得力不从心。若忽视实际情境,盲目依赖旧有模型,将导致研究结果偏离现实,严重损害教育研究的精确性与科学性。因此,国内教育学界亟须引入并探索前沿元分析模型,以适应愈发复杂的教育研究现状,缩小国内外教育领域元分析方法学的“代沟”。针对多样化的教育问题,应摒弃“一刀切”的元分析模型应用方式,转而依据研究目的、研究假设、数据结构特性及问题本质,灵活选择并细分至最适合的前沿元分析模型。从而减少分析误差,避免南辕北辙的方向性错误。 本研究系统阐述了三层次元分析、网络元分析和二阶元分析三种前沿元分析模

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论