版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
统计学方差分析Statisticalbasis第九章9第一节
方差分析概述第二节
单因素方差分析的步骤第三节
双因素方差分析第四节
方差分析在Excel和SPSS中的操作理解方差分析的思想与原理,能够完成误差分解与统计量的构建;掌握单因素和双因素方差分析的步骤;理解多重比较的意义与方法。能够使用Excel完成方差分析,并解释检验结果的意义;能够根据实际问题灵活使用方差分析。
学习目标学习目标通过方差分析发展史体会和学习统计学家以问题为导向,相互协作、谦虚严谨的研究精神。领会方差分析在公共政策、经济与社会管理中的广泛应用。
素养目标思维导图思维导图背景启题
党的二十大报告提出:“教育是国之大计、党之大计。”2023年居民收入和消费支出为情况显示,居民人均教育文化娱乐消费支出为2460元,增长16%,占人均消费支出比重的9.2%。
劳动力能够通过金融市场配置金融资产及产生金融负债,从而影响个体教育决策,我们想要验证家庭金融市场参与程度对家庭教育支出规模可能产生的影响,CHFS为我们提供了数据,其中包含了家庭金融市场参与程度与家庭教育支出两个指标,其中家庭金融市场参与程度为定序数据,家庭教育支出为数值型变量,如何检验家庭金融市场参与程度对家庭教育支出的影响呢?背景启题
在第七章“假设检验”中,我们为大家介绍了比较总体中抽出两个样本的方法;在第八章“列联分析”中介绍了检验两个及以上类别变量之间关系的方法。但如果需要对3个或者更多的样本数值型指标进行比较,那应该怎么办呢?
尽管可以对5个或者更多的样本组进行两两z检验或者t检验。然而这至少会产生两方面的问题。首先如果我们想要通过假设检验的方法来彻底考查变量之间的关系,我们需要完成多次z检验或t检验;其次,正如前面提到的,每次当对抽取的样本进行假设检验时,误差就会出现。通过多次z检验或t检验,会加大犯第Ⅰ类错误的概率。
请思考:
要同时解决检验多个样本的数值型变量均值是否存在显著差异,或分类变量是否显著影响了数值型变量,应该采用什么方法呢?【讨论主题】
结合家庭教育支出与家庭金融市场参与程度的研究案例,分析方差分析相比多次两两t检验的优势,以及单因素与双因素方差分析的适用场景差异。【讨论方向】1.为什么比较3组及以上均值时,方差分析比两两t检验更可靠?2.除了家庭金融参与程度,还有哪些因素可能影响家庭教育支出,适合纳入双因素方差分析?3.方差分析的三个基本假定如果不满足,会对结果产生什么影响,如何补救?【要求】每组总结2条方差分析的应用原则,结合具体研究问题说明。小组讨论方差分析概述Statisticalbasis第一节1第一节方差分析概述一、方差分析及相关术语方差分析是分析各类别自变量对数值因变量影响的一种统计方法。自变量对因变量的影响也称为自变量效应,而影响效应的大小则体现为因变量的误差里有多少是由于自变量造成的。因此,方差分析是通过对数据误差的分析来检验这种效应是否显著。表面上看,方差分析是检验多个总体均值是否相等的统计方法,但本质上研究的是分类型自变量对数值型因变量的影响,如变量之间有没有关系、关系的强度如何等。方差分析就是通过检验总体的均值是否相等来判断分类型自变量对数值型因变量是否有显著影响。(一)方差分析的含义与核心思想第一节方差分析概述
【例9-1】我们想要验证家庭金融市场参与程度可能会影响家庭教育支出规模,选取了CHFS2015的数据,随机抽取100个样本单位。选取相应指标作为替代变量,其中家庭金融市场参与程度为定序数据,家庭教育支出为数值型变量。
为了判断家庭金融市场参与程度对家庭教育支出的影响,即6个总体均值是否相等。如果均值相等,就表明不同的家庭金融市场参与程度对家庭教育支出没有影响,即不同的家庭金融市场参与程度对家庭教育支出的影响不显著;如果均值不全相等,则意味着不同的家庭金融市场参与程度对家庭教育支出有影响,即不同的家庭金融市场参与程度对家庭教育支出的影响是显著的。(二)方差分析的相关术语1.实例描述表9-1展示了按家庭金融市场参与程度分组的家庭教育支出。第一节方差分析概述表9-1展示了按家庭金融市场参与程度分组的家庭教育支出。(续表)第一节方差分析概述
在方差分析中,把所要检验的对象称为因素或因子,把因素变化的各种状态或等级称为水平或处理。如果只考虑一个因素对试验结果的影响,则称该试验为单因素试验。该因素的每一个水平可以看成一个总体,从中随机抽取一个样本观测到的数据称为观测值。我们把只有一个因素的方差分析方法称为单因素方差分析。
在【例9-1】中,家庭金融市场参与程度(因素或因子)共6个状态,因此家庭金融市场参与程度有6个水平或处理,“0”“1”“2”“3”“4”“5”就是这一因素的具体表现,每一水平可以看成一个总体,不同水平家庭金融市场参与程度的样本数据就是从这6个总体中独立抽取出来的。如果仅考虑家庭金融市场参与程度对家庭教育支出的影响,这就构成一个单因素试验。2.核心术语定义第一节方差分析概述第一节方差分析概述(三)单因素方差分析的变量
单因素的方差分析中涉及两个变量:一个是分类型自变量,即“家庭金融市场参与程度”;另一个是数值型因变量,即“家庭教育支出”。每个样本家庭用于教育的支出金额就是因变量的取值,而检验家庭金融市场参与程度的不同水平对家庭教育支出的影响是否显著,这一探究过程将借助单因素方差分析来实现。第一节方差分析概述(四)双因素方差分析的意义
如果在研究中,除了考虑一个因素(如家庭金融市场参与程度)外,还想同时检验另一个因素(如受访者对经济金融信息的关注程度)对因变量(家庭教育支出)的影响,则需使用双因素方差分析。如果只分析家庭金融市场参与程度和经济金融信息关注程度两个因素对销售量的单独影响,而不考虑它们对家庭教育支出的交互作用,则称为只考虑主效应的双因素方差分析(或称无重复双因素方差分析)。如果不仅考虑主效应,还要检验这两个因素对家庭教育支出的交互效应,则属于考虑交互作用的双因素方差分析(或称可重复双因素方差分析)。方差分析的历史由来
20世纪科学技术的发展速度远超过之前的时代,以描述性方法为核心的近代统计已无法满足需求,统计学的重心转为推断性统计,进入了现代统计学阶段。随着20世纪初细胞学的发展,农业育种工作全面展开,基于概率论和数理统计的随机试验设计技术及方差分析等一系列推断统计理论和方法应运而生,对农业生产和科学研究起到了极大的促进作用。
1918年,方差分析由费舍尔在《孟德尔遗传试验设计间的相对关系》一文中提出,相关成果见费舍尔和麦克肯兹(Mackenzie)共同发表的《对收获量变化的研究》一文。1923年,费舍尔把他的公式和看法交由威廉·戈塞特——笔名为Student的伟大统计学家提炼和改进。虽然威廉·戈塞特经常被人们认为是最早提出“方差”和“方差分析”术语的人,但他明确指出是费舍尔为这两个术语命名的。1925年,费舍尔在《研究工作者的统计方法》中对方差分析及协方差分析进一步作了完整的叙述,“方差分析法是一种在若干能相互比较的资料组中,把产生变异的原因加以区分开来的方法与技术”。1935年,《实验设计》出版,为方差分析建立起基本框架。知识拓展方差分析简单实用,能显著提高试验分析效率,适用于大样本和小样本。该方法在比较不同生产工艺或设备条件下的产量、质量差异,分析不同计划方案的效果优劣,以及判断不同地区、不同人员相关数量指标的差异显著性时都非常有用。知识拓展二、方差分析的基本思想与原理第一节方差分析概述(一)图形描述
方差分析的基本思想是通过分解数据的总变异,研究不同来源的变异对总变异的贡献大小,从而确定可控因素对研究结果影响力的大小。
怎么判断“家庭金融市场参与程度”这一因素是否对家庭教育支出有显著影响呢?根据【例9-1】提供的数据,绘制出家庭金融市场参与程度与家庭教育支出的散点图(见图9-1),图中的每一个散点是一个观测值,可以看出同一水平中各单位的家庭教育支出观测值是不同的。例如,在第5级中,家庭教育支出最大的样本观测值为300000元,最小的样本观测值为3000元。折线由家庭金融市场参与程度的6个水平对应的样本观测值所计算的均值连接而成,显示出不同家庭金融市场参与程度所对应的家庭教育支出水平也存在差异。图9-1。第一节方差分析概述第一节方差分析概述(二)误差分解
从表9-1可以看出,家庭金融市场参与程度6种不同的水平得到了6组有差别的家庭教育支出,在同一水平,如家庭金融市场参与程度为“0”时,随机抽取的7个家庭的教育支出是不同的,可以将它们之间的差异看成是因为随机抽样所造成的随机误差,这种同一水平内部的数据误差也称为组内误差。组内误差反映的是来自同一总体的一个样本内部数据的离散程度,因此组内误差只包含随机误差。第一节方差分析概述
不同家庭金融市场参与程度下家庭教育支出的观测值也是不同的。这种差异可能来源于抽样本身所形成的随机误差,也可能是因为家庭金融参与程度的不同所产生的系统误差,这种不同水平之间的误差称为组间误差,由随机误差与系统误差构成。例如,家庭金融市场参与程度6个水平的家庭教育支出的差异就是组间误差,反映的是来自不同总体的样本之间数据的离散程度。
所抽取的全部100个家庭教育支出观测值也存在差异,其离散程度称为总误差。第一节方差分析概述(三)误差分析
如果不同家庭金融市场参与程度对家庭教育支出的影响相同,那么此时仅用程度为“0”时的平均家庭教育支出水平估计总体均值,组间误差只包含随机误差,而没有系统误差,因此组间误差与组内误差经过平均后的数值就应该非常接近。
因此,判断家庭金融市场参与程度对家庭教育支出是否存在显著影响这一问题,转化为检验家庭教育支出的差异是由什么原因引起的,如果差异产生的来源主要是系统误差,就认为不同家庭金融市场参与程度对家庭教育支出有显著影响。从形式上也就转化为检验家庭金融市场参与程度的6个水平对应的家庭教育支出均值是否相等。三、方差分析的基本假定及其作用第一节方差分析概述(一)方差分析的基本假定
(1)正态性假定。每个总体都服从正态分布。也就是说,对于因素的每个水平,其观测值是来自正态分布总体的简单随机样本。在【例9-1】中,不同水平家庭金融市场参与程度下的家庭教育支出金额必须服从正态分布。
(2)方差齐性假定。各个总体的方差必须相同,也就是说,各组观测值是从具有相同方差的正态总体中抽取的。在【例9-1】中,要求每个水平家庭金融市场参与程度下的家庭教育支出的方差都相同。
(3)独立性假定。观测值是独立的。在【例9-1】中,每个被抽中的家庭的教育支出与其他家庭教育支出相互独立。第一节方差分析概述(二)基本假定的作用与意义(1)正态性假定为方差分析利用F统计量构造检验统计量的适用性提供了理论基础。(2)方差齐性假定主要保证F检验的有效性。(3)独立性假定是许多统计推断方法的基础。1.下列哪项不是方差分析的基本假定?(
)A.正态性假定 B.方差齐性假定
C.独立性假定 D.相关性假定2.仅考虑一个因素对因变量的影响,这种方差分析称为(
)A.单因素方差分析 B.双因素方差分析
C.多因素方差分析 D.交互作用方差分析答案:1.D2.A随堂测试单因素方差分析的步骤Statisticalbasis第二节2第二节
单因素方差分析的步骤一、提出假设在单因素方差分析中,原假设所描述的是在按照自变量的取值分成的类中,因变量的均值相等。因此,检验因素的k个水平(总体)的均值是否相等,需要提出如下形式的假设。式中,μi表示第i个总体的均值;k为水平数。如果拒绝原假设H0,则意味着自变量对因变量有显著影响;如果无法拒绝原假设H0,则没有证据表明自变量对因变量有显著影响。第二节
单因素方差分析的步骤
(一)计算样本均值
第二节
单因素方差分析的步骤二、构造检验统计量(二)计算全部观测值的总均值
第二节
单因素方差分析的步骤【例9-2】
沿用【例9-1】的数据,计算家庭金融市场参与程度为0级水平下的样本均值。
第二节
单因素方差分析的步骤【例9-3】
沿用【例9-2】的数据,计算所有家庭金融市场参与程度级别的总均值。
(三)计算误差平方和第二节
单因素方差分析的步骤数据的误差通过平方来量化表达。构造检验统计量需要分别计算3个误差平方和:总平方和(sumofsquaresfortotal,SST)、组内平方和(sumofsquaresforerror,SSE)、组间平方和(sumofsquaresforfactorA,SSA)。总平方和衡量所有观测值相对于总均值的总体变异程度,其数值大小直接反映了数据集的整体离散状况;反映组内误差大小的平方和称为组内平方和,也称误差平方和,它反映了每个样本内部各观测值对样本均值的偏离程度;组间平方和也称处理平方和,反映了不同处理组样本均值之间的变异程度。这样,总误差平方和被分解成两部分,即组内平方和与组间平方和。第二节
单因素方差分析的步骤1.总平方和总平方和是全部观测值与总均值的误差平方和,其计算公式如下。2.组内平方和组内平方和是每个水平或组的各样本数据与其组均值的误差平方和。组内平方和反映了随机误差的大小,其计算公式如下。第二节
单因素方差分析的步骤【例9-4】
沿用【例9-1】和【例9-3】的数据,计算所有家庭金融市场参与程度的总平方和。
【例9-5】沿用【例9-1】和【例9-2】的数据,先求出每个水平家庭金融市场参与程度下的家庭教育支出的误差平方和,然后将6个水平的误差平方和加总,即可得误差平方和。
第二节
单因素方差分析的步骤
第二节
单因素方差分析的步骤
第二节
单因素方差分析的步骤3.组间平方和
4.总平方和、组间平方和、组内平方和的关系总平方和、组间平方和、组内平方的关系如下。即SST=SSA+SSE第二节
单因素方差分析的步骤【例9-6】
沿用【例9-2】和【例9-3】的数据,计算所有家庭金融市场参与程度的组间平方和。
第二节
单因素方差分析的步骤即SST=SSA+SSE数据误差的来源及其分解过程可用图9-2表示。(四)计算均方第二节
单因素方差分析的步骤1.与误差平方和相对应的自由度总平方和的自由度为n-1,其中n为全部观测值的个数。这是因为在计算SST时,需要先计算样本的均值,这个均值相当于给数据施加了一个约束条件,使得自由度为n-1。组间平方和的自由度为k-1,其中k为因素的水平数(组数)。这是因为在计算组间平方和时,需要计算每个组的均值,这些组均值相对于总均值(所有观测值的平均值)的误差平方和构成了组间平方和。相当于这k个水平的均值受到了总均值的约束,因此自由度损失1,为k-1。组内平方和的自由度为n-k。组内平方和的自由度由样本容量n和因素的水平k共同决定,这是因为在计算组内平方和时,需要计算每个组内的观测值相对于该组均值的误差平方和,先计算每组误差平方和,这受到该组均值的约束,损失一个自由度,由于共有k组,所以组内平方和的自由度为n-k。第二节
单因素方差分析的步骤2.组间均方与组内均方在方差分析中,直接比较平方和可能会因为自由度不同而无法比较,计算均方是为了消除自由度对平方和的影响,从而更准确地比较不同来源的变异。组间平方和(SSA)的均方(meansquaretofactorA,MSA)也称组间均方,其计算公式如下。组内平方和(SSE)的均方(meansquareerror,MSE)也称组内均方(或均方误差),其计算公式如下。将MSA和MSE进行对比,可得到一个检验统计量。当H0为真时,MSA和MSE的比值服从分子自由度为k-1、分母自由度为n-k的F分布,该统计量记作F统计量,其计算公式如下。关于F值,可以这样思考:F值(MSA和MSE的比值)较大,则代表组间的差异远大于组内的差异,也就意味着在这组数据中大部分的差异是由处理水平的不同(组的不同)造成的,组与组之间存在显著差异,因此因素对组均值产生较大的影响;相反,F值若很小,则说明组间的差异与组内的差异相差较小,甚至组间差异小于组内差异,也就意味着大部分差异来自随机因素,分类型自变量的各个水平间数值型因变量的观测值没有什么区别,因此在F值较小的情况下原假设就不能被拒绝。第二节
单因素方差分析的步骤三、计算检验统计量第二节
单因素方差分析的步骤【例9-7】
沿用【例9-6】的数据,计算组间均方。
(一)方差分析表上面介绍了方差分析的假设和统计量,为使计算过程更加清晰,通常将上述过程的内容列在一张表内,这就是方差分析表。单因素方差分析表的一般形式如表9-2所示。第二节
单因素方差分析的步骤四、方差分析表与统计决策第二节
单因素方差分析的步骤【例9-8】
沿用【例9-4】至【例9-7】的数据,将引例的计算结果列成方差分析表,如表9-3所示。(二)统计决策第二节
单因素方差分析的步骤
第二节
单因素方差分析的步骤
第二节
单因素方差分析的步骤【例9-9】
如果家庭金融市场参与程度对家庭教育支出没有影响,那么不同水平家庭金融市场参与程度下的家庭教育支出的均值之间的差异与任一水平下家庭金融市场参与程度下的家庭教育支出的内部差异相比,不会相差很大;反之,则意味着家庭金融市场参与程度对家庭教育支出有影响。沿用【例9-7】的数据,做出统计决策。
(一)关系强度的检测表9-3中给出了组间平方和,度量了自变量对因变量的影响效应,即处理效应。还存在一部分未能被自变量解释的那部分变异,称为残差效应,通常由组内平方和来度量。处理效应是研究者在方差分析中关注的重点。当组间平方和相对于组内平方和大到一定程度时,意味着两个变量之间的关系显著。且组间平方和越大,表明它们之间的关系就越强;相反,如果自变量对因变量的影响很小,那么由处理效应引起的系统误差就会很小,导致组间平方和主要反映随机误差。在这种情况下,组间平方和可能会接近甚至小于组内平方和,意味着两个变量之间的关系不显著,表明它们之间的关系就越弱。那么,怎样度量它们之间的关系强度呢?可以用组间平方和占总平方和的比例大小来反映,将这一比例记为R2,其计算公式如下。第二节
单因素方差分析的步骤五、关系强度的检测与多重比较第二节
单因素方差分析的步骤R2的值为0~1,越接近1表示自变量对因变量的解释能力越强,关系强度越高;越接近0表示自变量对因变量的解释能力越弱,关系强度越低。根据表9-3中的结果计算可得这表明家庭金融市场参与程度对家庭教育支出差异解释的比例超过22%,而其他因素(残差变量)所解释的比例接近78%。尽管R2并不高,但家庭金融市场参与程度对家庭教育支出的影响已经达到统计上显著的程度。LSD是最小显著差异的缩写,该检验方法是由统计学家费舍尔提出来的。最小显著差异法敏感性高,适用于那些需要检测出较小差异的研究场景。另外,在组间样本数量不均等的情况下也可以使用,但当各组样本数量相近时,性能更好。因为LSD法没有对犯Ⅰ类错误的概率进行特别控制,当进行多次比较时,它会增加犯Ⅰ类错误(即错误地拒绝原假设)的概率。在组别不多时,其检验效能较高,但在需要多次对比的情况下,需要考虑使用其他更保守的方法。(1)使用LSD法进行比较检验的具体步骤。第一步:提出假设。第二节
单因素方差分析的步骤1.最小显著差异(二)多重比较第二节
单因素方差分析的步骤
第二节
单因素方差分析的步骤(2)假定要对家庭金融市场参与程度为0级和1级的家庭教育支出进行比较,看这两个水平下的家庭教育支出之间是否有显著差异(α=0.05)。第一步:提出如下假设。第二步:计算检验统计量。第二节
单因素方差分析的步骤第三步:计算LSD。自由度n-k=94,查t分布表可得tα/2=2.093,各检验的LSD如下。第四步:做出决策。因为所以无法拒绝H0。在0.05的显著性水平下,没有证据表明家庭金融市场参与度为“0”与“1”的家庭教育支出之间存在显著差异。按照以上步骤,计算两两之间的差值与LSD进行比较,则可得出家庭教育支出的差异存在于哪些级别的家庭金融市场参与度之间。真实显著差异(honestlysignificantdifference,HSD)由约翰·图基(JoneTukey)于1953年提出,因此也称图基的HSD方法。由于图基的HSD方法要求各处理的样本量相同,当各处理的样本量不同时,该方法就不适用。20世纪50年代末中期,克莱默(Kramer)对约翰·图基的HSD方法做了一些修正,使其适用于样本量不同的情形。修正后的HSD方法称为Tukey-Kramer方法,简称HSD法。(1)HSD法概述。与LSD法相比,HSD法在各组样本量不相等的情况下表现良好,且考虑了误差项,更适用于各组样本量不同的情况;在保持较高检验效能的同时,能够控制整体错误率,提供了比LSD法更加保守的比较结果;对所有组别进行两两比较,因此当研究者希望探索所有可能的组别组合之间的差异时,HSD法是更合适的选择。第二节
单因素方差分析的步骤2.真实显著差异
第二节
单因素方差分析的步骤
第二节
单因素方差分析的步骤表9-4。第二节
单因素方差分析的步骤第三步:计算临界值ω。第二节
单因素方差分析的步骤
双因素方差分析Statisticalbasis第三节3一、双因素方差分析的类型(一)无交互作用的双因素方差分析第三节
双因素方差分析不考虑两个因素的交互作用,即无交互作用的双因素方差分析。如果两个目标因素对观测变量的影响是独立的,则此类双因素方差分析称为无交互作用的双因素方差分析或无重复因素的方差分析。(二)有交互作用的双因素方差分析考虑两个因素的搭配对因变量产生的交互作用,即有交互作用的双因素方差分析。如果两个目标因素不同水平的搭配对观测变量的影响显著不同,则说明两个目标因素是不独立的,会彼此影响,从而对观测变量产生交互作用,此类双因素方差分析称为有交互作用的双因素方差分析或可重复双因素方差分析。第三节
双因素方差分析【例9-10】
某商品有5种不同的包装方式(因素A),在4个不同的地区销售(因素B)。现从每个地区随机抽取一个规模相同的百货商店,得到该商品在不同包装方式条件下的销售资料,如表9-5所示。试问:在0.05的显著性水平下,销售地区和包装方式是否对销售量有显著影响?第三节
双因素方差分析在【例9-10】中,销售地区和包装方式是两个分类型自变量,销售量是一个数值型因变量。在分析销售地区和包装方式对销售量的影响时,分析内容包括单个因素对观测变量的影响是否显著和两个因素对观测变量的影响是否独立等问题。如果各个地区的包装方式没有显著不同,两因素对销售量的影响是独立的,就应该采用无交互作用的双因素方差分析方法进行分析。如果某个地区的消费者对某种包装方式有特殊偏好,这就是两个因素结合后产生的新效应,这一效应会对销售量产生影响,就应该采用有交互作用的双因素方差分析。二、双因素方差分析的数据结构双因素方差分析有两个目标因素,数据结构需要将一个目标因素安排在行的位置,称为行因素;另一个安排在列的位置,称为列因素。行因素和列因素的每个水平相互搭配形成一个区组。双因素方差分析的数据结构如表9-6所示。第三节
双因素方差分析第三节
双因素方差分析
第三节
双因素方差分析
三、无交互作用的双因素方差分析的步骤(一)提出假设第三节
双因素方差分析
1.行因素假设
第三节
双因素方差分析2.列因素假设(二)构造检验统计量第三节
双因素方差分析
1.计算误差平方和第三节
双因素方差分析
在上述误差平方和的基础上计算均方,也就是将平方和除以相应的自由度。(1)与误差平方和相对应的自由度。第三节
双因素方差分析2.计算均方自由度
(2)行因素、列因素、随机误差的均方。①行因素(B因素)的均方(meansquaretofactorB,MSB)的计算公式如下。②列因素(A因素)的均方的计算公式如下。③误差均方的计算公式如下。第三节
双因素方差分析(三)计算检验统计量第三节
双因素方差分析
1.行因素(B因素)的F检验2.列因素(A因素)的F检验
(四)方差分析表与统计决策第三节
双因素方差分析
第三节
双因素方差分析【例9-11】
我们把以上计算公式整理到方差分析表,如表9-7所示。根据【例9-10】的数据,分析包装方式和销售地区对销售量是否有显著影响(α=0.05)。(1)提出假设。①列因素假设。第三节
双因素方差分析②行因素假设。(2)计算误差平方和。(3)计算均方。第三节
双因素方差分析(4)计算检验统计量。双因素方差分析结果如表9-8所示。第三节
双因素方差分析
(五)关系强度的检测第三节
双因素方差分析
第三节
双因素方差分析
三、有交互作用的双因素方差分析的步骤(一)概述第三节
双因素方差分析在前面的分析中,假定因素A和因素B对因变量的影响是独立的,但如果两个因素搭配在一起会对因变量产生一种新的效应,就需要考虑交互作用对因变量的影响,这就是有交互作用的双因素方差分析。根据误差分解原理,有交互作用的双因素方差分析可以构建用于F检验的统计量,其原理与只考虑主效应的双因素方差分析类似。与无交互作用的方差分析方法类似,有交互作用的双因素方差分析也需要提出假设、构造检验的统计量、计算检验统计量和做出统计决策等步骤。其中,在提出假设时,需分别对行变量、列变量和交互作用变量提出假设。(二)示例第三节
双因素方差分析【例9-12】
城市道路交通管理部门为研究不同的路段和不同的时段对行车时间的影响,让一名交通警察分别在两个路段的高峰期和非高峰期亲自驾车进行试验,通过试验共获得20个行车时间(单位:分钟)的数据,如表9-9所示。试问:路段、时段及路段和时段的交互作用对行车时间是否有影响?(α=0.05)第三节
双因素方差分析有交互作用的双因素方差分析表的数据结构如表9-10所示。1.数据结构第三节
双因素方差分析2.符号设定与变量定义
3.提出假设
第三节
双因素方差分析
第三节
双因素方差分析4.构造与计算检验统计量(1)行变量平方和(sumofsquaresforrows,SSR)的计算公式如下。(2)列变量平方和(sumofsquaresforcolumns,SSC)的计算公式如下。(3)交互作用平方和(sumofsquaresfortherow-columnsinteraction,SSRC)的计算公式如下。第三节
双因素方差分析(4)总平方和(SST)的计算公式如下。(5)误差平方和(SSE)的计算公式如下。根据以上公式计算可得,有交互作用的双因素方差分析结果如表9-11所示。第三节
双因素方差分析
5.做出统计决策第三节
双因素方差分析
方差分析在Excel和SPSS中的操作Statisticalbasis第四节4我们采用随机抽样的方法,从CHFS2015数据中随机抽取100个样本单位,样本数据如表9-1所示。第一行为家庭金融市场参与程度(0~5级),每级对应各样本单位的家庭教育支出。试问:不同家庭金融市场参与程度的家庭教育支出均值是否存在显著差异?(α=0.05)由于家庭金融市场参与程度为定序数据,家庭教育支出为数值型变量,因此可以在Excel中采用单因素方差分析的方法来检验不同家庭金融市场参与程度的家庭教育支出均值是否存在显著差异,从而推断家庭金融市场参与程度对家庭教育支出是否均有显著影响。第一步,选择“数据”选项卡并单击“数据分析”,打开“数据分析”对话框,如图9-3所示。第四节
方差分析在Excel和SPSS中的操作一、单因素方差分析在Excel和SPSS中的操作(一)单因素方差分析在Excel中的操作第四节
方差分析在Excel和SPSS中的操作在数据分析对话框中,分析工具下拉菜单包括“方差分析:单因素方差分析”“方差分析:可重复双因素分析”“方差分析:无重复双因素分析”等选项。因为只有一个分类变量和一个数值型变量,所以单击“方差分析:单因素方差分析”。随后,打开“方差分析:单因素方差分析”对话框,如图9-4所示。第四节
方差分析在Excel和SPSS中的操作第二步,在输入区域后面的文本框内,输入数据单元格区域(如“G1:L36”)或拖拽选定单元格区域。对于分组方式,如果按列分组,需选中“列”前面的复选框,否则需选中“行”前面的复选框。如果数据单元格区域第一行为标志,还需勾选“标志位于第一行”复选框。其余则根据需求选择或直接选择“默认”,如图9-5所示。第四节
方差分析在Excel和SPSS中的操作第三步,单击“确定”按钮后,可得到家庭金融市场参与程度和家庭教育支出的方差分析结果,如图9-6所示。第四节
方差分析在Excel和SPSS中的操作输出结果分为以下两个部分。(1)“SUMMARY”部分是有关各样本的一些描述性统计量,其可以作为方差分析的参考信息。(2)“方差分析”部分是单因素方差分析的结果。①差异源标明差异是来自“组间”“组内”,还是来自“总计”。②SS表示平方和。③df为自由度。④MS为均方。⑤F为F检验的统计量。⑥P-value为F检验的P值。第四节
方差分析在Excel和SPSS中的操作
第四节
方差分析在Excel和SPSS中的操作(二)单因素方差分析在SPSS中的操作下面主要介绍单因素方差分析在SPSS中的操作,沿用【例9-1】的数据来比较家庭金融市场参与程度对家庭教育支出的影响。第一步,导入所需数据。主要包括自变量家庭金融市场参与程度(jtjrcycd)和因变量家庭教育支出(jtjyzc),如图9-7所示。第二步,单击菜单栏中的“分析”选项,然后选择“比较平均值”,再单击“单因素ANOVA检验”,如图9-8所示。第四节
方差分析在Excel和SPSS中的操作图9-8。第四节
方差分析在Excel和SPSS中的操作第三步,设置因变量和因子。在打开的对话框中,将因变量jtjyzc(家庭教育支出)选入“因变量列表”框,将自变量jtjrcycd(家庭金融市场参与程度)选入“因子”框,如图9-9所示。第四节
方差分析在Excel和SPSS中的操作第四步,选择多重比较方法。如果需要进一步比较各组之间的差异,单击“事后比较”按钮,选择合适的事后检验方法,如LSD、TukeyHSD等,单击“继续”按钮,如图9-10所示。第四节
方差分析在Excel和SPSS中的操作第五步,选择选项。单击“选项”按钮,选择需要输出的统计量,如描述性统计、方差齐性检验等,单击“继续”按钮,如图9-11所示。第四节
方差分析在Excel和SPSS中的操作图9-12显示了描述性统计的结果,通过该表能够查看自变量各水平的基本统计量,如均值、标准差等。图9-12显示的表格中,第一列为因变量家庭教育支出(jtjyzc)的“0~5”共6个水平,以后各列分别为家庭教育支出(jtjyzc)在各水平下的基本统计量。第四节
方差分析在Excel和SPSS中的操作图9-13为单因素方差分析的结果,与Excel的方差分析结果相同。二、双因素方差分析在SPSS中的操作第四节
方差分析在Excel和SPSS中的操作在本次案例中,我们要比较家庭金融市场参与程度与经济金融信息关注度对因变量家庭教育支出的影响。第一步,单击“分析”按钮,然后选择“一般线性模型”→“单变量”,如图9-14所示。第四节
方差分析在Excel和SPSS中的操作第二步,设置因变量和因子,在打开的对话框中,将因变量jtjyzc(家庭教育支出)选入“因变量列表”框,将自变量jtjrcycd(家庭金融市场参与程度)与jjjrxxgzd(经济金融信息关注程度)选入“固定因子”框,如图9-15所示。第四节
方差分析在Excel和SPSS中的操作第三步,设置“模型”,在“单变量模型”对话框中勾选“构建项”,在“因子与协变量”框下分别单独把自变量jtjrcycd(家庭金融市场参与程度)与jjjrxxgzd(经济金融信息关注度)选进右侧的“模型”中,取消勾选“在模型中包括截距”复选框,单击“继续”按钮,如图9-16所示。第四节
方差分析在Excel和SPSS中的操作如果要在模型中设置交互项,再将两个变量一起选中,在“构建项”的“类型”下拉列表中选择“交互”,就会出现“jjjrxxgzd*jtjrcycd”的字符,代表分析这两者的交互作用,如图9-17所示。第四节
方差分析在Excel和SPSS中的操作单击“继续”按钮返回上一级对话框,如果不需要做其他设置,直接单击“确定”按钮就可以获得双因素方差分析的结果。无交互作用双因素方差分析结果如图9-18所示。第四节
方差分析在Excel和SPSS中的操作有交互作用双因素方差分析结果如图9-19所示。第四节
方差分析在Excel和SPSS中的操作从图9-18与图9-19显示的结论来看,根据第一列的变量对应最后一列的“显著性”均小于“0.05”,所以,可以认为家庭金融市场参与程度“jtjrcycd”、经济金融信息关注度“jjjrxxgzd”及交228互项“jjjrxxgzd*jtjrcycd”对家庭教育支出均有显著影响。此外,在做有交互作用双因素方差分析时,还可以设置“模型”,指定模型时选择“全因子”,取消勾选“在模型中包括截距”复选框,单击“继续”按钮返回上一级对话框。也可以在单击“确定”按钮后获得有交互作用双因素方差分析结果,与图9-19完全相同,如图9-20所示。第四节
方差分析在Excel和SPSS中的操作
软件操作的实操技巧1.Excel操作要点
单因素方差分析:通过“数据→数据分析→方差分析:单因素方差分析”,需注意分组方式(行/列)和标志行勾选;
结果解读:重点关注“方差分析”表中的F值、P-value和Fcrit,P-value<α则拒绝原假设;2.SPSS操作要点
单因素方差分析:“分析→比较平均值→单因素ANOVA”,可通过“事后比较”选择多重比较方法;
双因素方差分析:“分析→一般线性模型→单变量”,将两个因素纳入“固定因子”,需设置模型类型(主效应/交互作用)。知识链接问题思考1.方差分析的三个基本假定是什么?有什么意义?2.对比单因素方差分析与两独立总体的t检验,为什么说单因素方差分析比两独立总体的t检验效率更高?3.设计一个研究项目,并讨论如何运用方差分析来分析数据。在这个过程中可能会遇到什么问题?实战演练深入研究【例9-1】的内容,除了家庭金融市场参与程度外,教育支出可能在地区间也存在显著差异。请利用【例9-1】的数据解答以下问题。(1)完成地区的单因素方差分析。(2)考虑地区与家庭金融参与程度的交互效应,完成双因素方差分析。谢谢统计学相关关系与回归分析Statisticalbasis第十章10第一节
相关关系第二节
多元回归与回归方程第三节
多元回归:Logistic回归第四节
回归分析在Excel和SPSS中的操作理解相关分析与回归分析的概念、联系与区别,理解并掌握最小二乘法的思想、经典假定与方法,理解并掌握多元线性回归模型的构建、拟合优度、显著性检验,理解并掌握多重共线性,了解logistic回归。能够构建多元线性回归模型,并用Excel完成参数估计与相关假设检验,并能够解释回归结果。
学习目标学习目标利用宏观经济和社会数据说明回归分析的具体应用,阐述回归分析在国家经济和社会政策制定中的作用。
素养目标思维导图思维导图背景启题
在新时代背景下,我国经济已经从高速增长阶段向高质量发展阶段转变,经济增长动力也随之发生转变。以资本积累和劳动力为主导的传统增长方式逐渐失去比较优势,新的经济驱动力正向以人力资本为核心的全要素转变。在此过程中,家庭教育支出作为一种兼具消费和投资属性的支出形式,不仅是现阶段我国人力资本投资的重要途径,也是家庭消费中比重较大的一个部分。
已有研究表明,劳动力能够通过金融市场配置金融资产并形成金融负债,从而影响个体的教育决策。在第九章“方差分析”中,我们已对家庭金融市场参与程度与家庭教育支出之间的关系进行了显著性检验。在教育经济学相关理论与实践经验的指导下,我们进一步推测,除了家庭金融市场参与程度,还有其他可能影响家庭教育支出的因素,如受访者对经济金融信息的关注程度、家庭总资产、父母的政治面貌及户口性质等,这些因素都可能对教育支出决策产生影响。
背景启题CHFS2015为我们提供了验证这些假设的可靠数据基础。
请思考:
如果我们希望检验多个自变量对一个因变量的影响,应如何进行?【讨论主题】
结合家庭教育支出的影响因素研究,分析相关分析与回归分析的区别与联系,以及多元回归模型中多重共线性的应对策略。【讨论方向】1.相关分析与回归分析的核心差异是什么?为什么说“相关不一定因果”?2.多元回归中,若“家庭总资产”与“家庭金融参与程度”高度相关,会产生什么问题?如何处理?3.除了教材提到的因素,还有哪些变量可能影响家庭教育支出,适合纳入回归模型?【要求】每组结合一个实际研究问题,设计回归模型的自变量和因变量,并说明模型构建的注意事项。小组讨论相关关系Statisticalbasis第一节1第一节相关关系一、简单相关关系(一)变量间依存关系的类型1.确定性函数关系
2.不确定性相关关系
第一节相关关系(二)相关关系的分类(1)简单相关关系。只有两个变量的相关关系称为简单相关关系。(2)多重相关或复相关。三个及以上变量的相关关系称为多重相关或复相关。1.按涉及的变量数量分类(1)线性相关。当变量之间相关关系的散点图近似一条直线时,称为变量之间线性相关。(2)非线性相关。当变量之间相关关系的散点近似一条曲线时称为变量之间非线性相关。2.按表现形式分类第一节相关关系(1)正相关。两个变量趋于向同一个方向变化时,即同增或同减,称为变量之间正相关。(2)负相关。两个变量趋于向相反方向变化时,即当一个变量增加时,另一个变量却在减少,称为变量之间负相关。3.按变化方向分类(1)完全相关。当一个变量的变化完全由另一个变量的变化确定时,称为变量之间完全相关,在这种情况下,相关关系实际成了函数关系。(2)不相关。当两个变量的变化相互完全没有关系,即彼此互不影响时,称为二者不相关。(3)不完全相关。两个变量的关系如果介于完全相关和不相关之间时,称为变量之间不完全相关。我们研究的相关关系通常是不完全相关。4.按相关程度分类二、相关关系的图示第一节相关关系
沿用【例9-1】的数据,若我们要了解家庭金融市场参与程度与家庭教育支出的关系,则从CHFS2019中随机抽取100个受访者构成研究样本,绘制家庭金融市场参与程度和家庭教育支出的散点图,并拟合趋势线,如图10-1所示。第一节相关关系
在考虑两个变量的关系时,为了对变量之间的关系有一种直观的、大致的了解,我们通常将变量所对应的点在坐标系中描出来,这些点(xi,yi)就组成了变量之间的一个图,由这个坐标及散点形成的二维数据图就是散点图。图10-2展示了不同相关关系的散点图。
第一节相关关系三、相关系数的计算(一)基本概念:Pearson相关系数1.总体相关系数总体相关系数对于我们所研究的总体,两个相互联系的变量的相关系数称为总体相关系数,通常用ρ表示,可以用下列公式计算。式中,Var(X)是变量X的方差;Var(Y)是变量Y的方差;Cov(X,Y)是变量X和Y的协方差。第一节相关关系2.样本相关系数
(二)相关系数的特点第一节相关关系1.取值范围相关系数的取值为-1~1。2.相关性判断
第一节相关关系3.对称性
4.局限性相关系数只反映变量之间的线性相关程度,不能说明非线性相关关系;相关系数不能确定变量的因果关系;相关系数不能说明相关关系具体接近于哪条直线。第一节相关关系
(三)注意事项相关系数为0能说明什么
相关系数反映的是两个变量之间的线性相关关系,但变量之间除了线性关系,还可能存在其他类型的关系。在这种情况下,相关系数就不能作为衡量变量关系的有效指标。
图10-3展示了不同相关关系的情形,可归纳为以下几点。(1)第一行,X和Y的点图显示出不同程度的线性关系,线性相关关系越强,相关系数绝对值越大。(2)第二行,X和Y之间呈现更加明显的线性关系。(3)第三行,X和Y之间的相关系数为0,表示它们不存在线性相关关系,但明显存在某种非线性关系,说明X和Y并不独立。知识拓展
图10-3。知识拓展1.Pearson相关系数的取值范围是(
)A.[0,1] B.[-1,1]C.(-∞,∞) D.[0,∞)2.下列关于相关系数的说法,错误的是(
)A.相关系数的绝对值越大,线性相关程度越强B.相关系数的正负号表示相关的方向C.相关系数可以判断变量间的因果关系D.相关系数仅适用于线性相关关系答案:1.B2.C随堂测试多元回归与回归方程Statisticalbasis第二节2回归的起源
回归是高尔顿在1885年发展起来的。他在1869年研究遗传学时,就开始了回归工作的初步探索。到了1877年,高尔顿在统计方法研究上取得了进展,并将其称为回归经验规律。1885年,基于他的研究,他将这个方法的名字改为回归。这项研究表明中等大小的甜豌豆趋向于回归到平均状态,而且它们的方差相等(正如他在1885年演讲中所说的一样)。从那以后,回归经历了几次迭代变化,最终演进为当前的形式,这种形式由尤尔在1897年提出。现在我们虽然沿用“回归”这个词语,但现代意义的回归分析与过去已有很大的区别。知识拓展第二节
多元回归与回归方程一、一元线性回归模型及基本假定
(一)一元线性回归模型的概念(二)一元线性回归模型的基本假定第二节
多元回归与回归方程
第二节
多元回归与回归方程
二、最小二乘准则第二节
多元回归与回归方程
第二节
多元回归与回归方程
第二节
多元回归与回归方程【例10-1】
沿用【例9-1】的数据,我们采用简单线性回归方法检验家庭金融市场参与程度对家庭教育支出的影响。其中家庭金融市场参与程度由变量participation替代,家庭教育支出由变量eduspending替代,构建以下一元线性回归模型。
第二节
多元回归与回归方程
(一)多元线性回归模型的概念第二节
多元回归与回归方程三、多元线性回归模型的构建简单线性回归模型主要讨论一个因变量和一个自变量之间的线性关系,但是,由于实际经济问题的复杂性,一个变量可能会与多个变量相联系。因此,有必要将只有一个自变量的一元回归模型推广到有多个自变量的情况。多元线性回归分析的原理与一元线性回归基本相同,但计算上要复杂得多,常需要借助计算机来完成。第二节
多元回归与回归方程
第二节
多元回归与回归方程
(二)多元线性回归方程的一般形式第二节
多元回归与回归方程在多元线性回归模型中,有零均值假定、同方差假定、无自相关假定、正态性假定、随机扰动项与解释变量不相关五个基本假定。除此之外,还有无多重共线性假定。根据假定,则有
(一)多重判定系数第二节
多元回归与回归方程四、多元回归模型的拟合优度检验
1.变差的来源与表示第二节
多元回归与回归方程2.样本相关系数n次观测值的总变差可由这些离差的平方和来表示,称为总平方和,记作SST,公式如下。3.总平方和的分解
第二节
多元回归与回归方程4.三个平方和的含义与关系
第二节
多元回归与回归方程5.多重判定系数的定义与意义
第二节
多元回归与回归方程5.多重判定系数的定义与意义
(二)修正的多重判定系数第二节
多元回归与回归方程
第二节
多元回归与回归方程因此,在多元回归分析中,通常使用修正的多重判定系数。我们可以打个比方,把回归模型看作一件衣服,用平均值y-来解释Y也像是穿了一件衣服———只不过是件高度简化的衣服。这两件衣服都是给同一个“身体”(也就是我们的数据)穿的,都不怎么合身,回归模型这件衣服显然比仅用平均值的那件更合身一些。例如,有一件刘翔的衣服,还有一件姚明的衣服,穿在我身上肯定都不合适。但相比之下,刘翔的衣服可能稍微贴合一点,因为误差更小。同样地,二元回归就像是一件裁剪比较简单的衣服,而多元回归则更复杂一些,肩膀、腰身等部位都做了相应调整,所以更合身一些。需要强调的是,我们计算得到的多重判定系数R2和修正的多重判定系数R2a,其实也是随抽样而变动的随机变量。第二节
多元回归与回归方程
(一)线性关系的显著性检验(F检验)第二节
多元回归与回归方程五、多元回归模型的参数估计的显著性检验1.提出假设2.计算检验统计量第二节
多元回归与回归方程3.做出统计决策
(二)回归系数的显著性检验(t检验)第二节
多元回归与回归方程1.提出假设2.计算检验统计量
第二节
多元回归与回归方程3.做出统计决策
第二节
多元回归与回归方程六、多重共线性(一)多重共线性产生的背景2.模型包含滞后变量4.样本数据自身的原因3.截面数据建模中的多重共线性问题1.变量之间具有共同变化的趋势加入控制变量后结果悲催了在构建多元线性回归模型的实践中,我们将除了自变量以外的所有影响因变量的变量称为控制变量,这些变量不是本次研究关注的变量,但又是构建模型所必需的,是解释变量的一种。加入控制变量后,我们关心的估计系数是否会产生变化,取决于自变量与控制变量之间的独立性。下面,我们列出将会出现的四种情形。第一种情形:自变量与控制变量之间完全独立,加入控制变量对估计系数无影响,如图10-4所示。知识拓展第二种情形:自变量与控制变量之间相关,且完全通过控制变量的途径来影响被解释变量,加入控制变量后,估计系数不显著,如图10-5所示。第三种情形:自变量与控制变量之间高度相关,加入控制变量后,估计系数都不显著,如图10-6所示。知识拓展
知识拓展(二)多重共线性的检验第二节
多元回归与回归方程1.直观判断法根据经验,如果出现下列情况,则可能暗示存在多重共线性的影响。(1)当增加或剔除一个自变量,或改变一个观测值时,回归参数的估计值发生较大变化。(2)有的自变量的回归系数所带正负号与预期结果违背。(3)模型的判定系数较高,F检验显著,但几乎所有回归系数βi的t检验都不显著。2.相关系数检验法相关系数检验法是利用自变量之间的线性相关程度去判断是否存在严重多重共线性的一种简便方法。一般来说,如果每两个自变量的相关系数比较高,如大于0.8,则可以认为存在较严重的多重共线性。第二节
多元回归与回归方程3.方差扩大因子法
(三)多重共线性问题的处理方法第二节
多元回归与回归方程
当回归方程中存在严重的多重共线性时,可以删除引起多重共线性的不重要的变量,使保留的自变量尽可能不相关。一般在选择回归模型时,可以将回归系数的显著性检验、方差扩大因子的多重共线性检验与自变量的经济含义结合起来考虑。1.剔除变量法
变量变换是指将总量指标进行对数变换。总量指标进行对数变换后,可将原来建立的线性回归模型转换为双对数模型,分析各个自变量的增减率对被解释变量增减率的影响。需要注意的是,在建立多元线性回归模型时,不要试图引入更多的自变量,除非确实有必要。2.变量变换法多元回归:Logistic回归Statisticalbasis第三节3第三节
多元回归:Logistic回归
在建立模型时,有时需要将定量因素和定性因素同时纳入模型之中。定量因素是指那些可以直接测度的数值型因素。定性因素是指说明某种属性或状态存在与否的非数值型因素,属性因素的类型或水平往往是“非此即彼”的,不能直接用可观测的数据精确测度与描述。
因此,为了在模型中反映定性因素,可以引入虚拟变量作为表现定性因素的变量。虚拟变量是人工构造的作为属性因素代表的变量,通常用D表示。一般情形下,取值为0和1。当虚拟变量取值为0,即D=0时,表示某种属性或状态的类型或水平不出现或不存在;当虚拟变量取值为1,即D=1时,表示某种属性或状态的类型或水平出现或存在。这种做法实际上是一种变换或映射,将不能精确计量的定性因素的水平或状态变换为用0和1来描述。一、虚拟变量及设置规则(一)虚拟变量的基本概念(二)虚拟变量的设置规则1.0-1取值原则第三节
多元回归:Logistic回归在模型中引入虚拟变量可以使我们同时兼顾定量因素和定性因素的影响与作用,但是,由于定性因素通常具有多种类型或水平,在设置虚拟变量时应该遵循一定的规则。取值原则:虚拟变量D到底是取值为0还是取值为1,应该从分析问题的目的出发予以界定,要注意区分所代表的是基础类型还是比较类型。虚拟变量取值为0,通常代表作为比较的基础类型;取值为1,通常代表与基础类型相比较的比较类型。
如果一个定性因素有m个相互排斥的类型,按照模型设定中有无截距项,虚拟变量个数的设置规则分为两种。(1)在有截距项的模型中,只能引入m-1个虚拟变量,否则会陷入所谓的“虚拟变量陷阱”,产生完全的多重共线性。(2)在无截距项的模型中,可以引入m个虚拟变量,而不会导致完全的多重共线性。2.避免落入“虚拟变量陷阱”第三节
多元回归:Logistic回归第三节
多元回归:Logistic回归
第三节
多元回归:Logistic回归
第三节
多元回归:Logistic回归
二、Logistic回归分析概述(一)Logistic回归引论如果直接以上大学的概率为因变量,那么根据线性回归分析的结果,当自变量家庭教育支出取一定值时,上大学的概率可能小于0或大于1,二者在逻辑上都是荒谬的。那么进行第二次转变,把概率转换成发生率的自然对数,就不会做出荒谬预测了。如图10-8所示,转变后,与无限趋近0的概率相对应的发生率的自然对数是负无穷,与五五开的概率相对应的发生率的自然对数是0,与无限趋近1的概率相对应的发生率的自然对数是正无穷。第三节
多元回归:Logistic回归(二)Logit模型1.Logit模型对二元因变量的适用性第三节
多元回归:Logistic回归当我们研究二分因变量时,线性模型的统计方法就不再适用,因此需要专门处理二分因变量的模型,最常用的统计工具就是Logistic回归,常见的模型就是Logit模型。对二分因变量进行Logistic回归时,首先需要对事件发生概率P进行转换处理。Logit转换可以理解为事件成功对失败的发生比率(odds,记作ω)的自然对数,成功概率P的Logit转换表示为概率P的非线性函数通过Logit转换后得到一个关于P的单调函数,且该函数与自变量呈线性关系。因此,Logit函数与自变量的线性组合就可以共同构成一个完整的Logit模型,如被告胜诉概率Pi的对数比率Logit(Pi)函数、诉讼当事人特征等自变量xi、常数项和误差项共同组成估计和预测被告胜诉概率Pi的Logit模型。式中,βi表示自变量xi每增加1单位,对数比率发生的变化量。在Logit转换前,首先假设研究对象符合某种特性、产生某种结果或某个事件成果的概率为Pi。因变量只有0和1两个取值,因此Pi是估计值,这样的假设有助于将观察结果转化成概率的形式。在诉讼中,如果假设被告胜诉的概率为Pi,那么被告败诉的概率就为1-Pi。第三节
多元回归:Logistic回归2.Logit转换的作用第三节
多元回归:Logistic回归给定概率Pi,Logit转换则涉及以下两个步骤。(1)取Pi和1-Pi之比,称为发生比率。(2)取发生比率的自然对数,简称对数比率。Logit模型的重点从事件发生的概率转移到了事件的发生比率。发生比率表示的是发生的概率与不发生的概率之比。发生比率克服了概率估计值在[0,1]取值的值域限制:与概率不同,发生比率没有上限。当概率Pi趋近于0时,对应的Logit(Pi)将趋近于负无穷;当概率Pi趋近于1时,对应的Logit(Pi)将趋近于正无穷。此外,得益于对数的性质,Logit函数延展了概率在极限的值,使得自变量x上任意一个单位的改变都能在Logit函数上产生相同的效果。换言之,Logit转换拉直了自变量x与最初概率P之间的非线性关系。表10-1关于概率、比率和对数比率的对应关系能够直观地说明Logit转换的上述逻辑关系。第三节
多元回归:Logistic回归
Logistic回归与虚拟变量的实际应用场景1.虚拟变量将定性变量量化,如性别(男=1,女=0)、户口性质(城镇=1,农村=0),适用于纳入回归模型;2.Logistic回归用于因变量为二元分类变量的场景,如“是否录取(是=1,否=0)”“是否患病(是=1,否=0)”,通过Logit转换解决概率取值范围限制。知识链接回归分析在Excel和SPSS中的操作Statisticalbasis第四节4一、回归分析在Excel中的操作第四节
回归分析在Excel和SPSS中的操作(一)一元线性回归问题我们可以用Excel构建【例10-1】的一元线性回归模型,单击“数据分析”功能,打开“数据分析”对话框,选择“回归”功能,如图10-9所示。第四节
回归分析在Excel和SPSS中的操作单击“确定”按钮后打开“回归”对话框,在“输入”选项中,“Y值输入区域”框选变量“eduspending”的数据,“X值输入区域”框选变量“participation”的数据,第一行如为标志名则需勾选“标志”复选框,其余可选择默认。输出选项中,选择结果输出区域,如果选择在原表中输出,那么在“输出区域”中应注意不要覆盖原数据区域。如图10-10所示,本例选择输出至“新工作表组”单选按钮。第四节
回归分析在Excel和SPSS中的操作单击“确定”按钮后,在指定输出区域得到回归结果,如图10-11所示。(二)多元线性回归问题第四节
回归分析在Excel和SPSS中的操作
我们还可以用Excel处理多元线性回归问题,沿用【例10-1】的数据,在教育经济学相关理论与实践经验的双重指引下,我们能够推测分析,对于家庭来说,除了家庭金融市场参与程度会对家庭教育支出产生影响外,可能还存在其他的影响因素。
构建多元线性回归模型为
式中,attention为受访者对经济金融信息的关注程度;lngross_asset为对数后家庭总资产;fd_political为父辈或母辈是否为中共党员,用以替代政治面貌;fd_hklx为父辈或母辈是否为农村户口,用以替代户口性质;u为随机扰动项。第四节
回归分析在Excel和SPSS中的操作类似一元线性回归的操作,单击“数据分析”功能打开“数据分析”对话框,选择“回归”功能,打开“回归”对话框。需要注意的是,与简单线性回归不同,多元线性回归需要在“X值输入区域”选定所有解释变量,如图10-12所示。第四节
回归分析在Excel和SPSS中的操作单击“确定”按钮后,Excel多元线性回归结果如图10
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 社区健康宣教档案管理
- 2026下半年初中地理教资面试地图知识专项题库
- 2026年广西金融投资集团有限公司人员招聘参考题库及答案详解
- 2026年厦门市翔安区公务员人员招聘考试备考试题及答案详解
- 2026年青岛国际投资有限公司人员招聘参考题库及答案详解
- 2026年中国移动上海分公司人员招聘笔试参考试题及答案详解
- 2026年中国铁路经济规划研究院有限公司人员招聘考试备考题库及答案详解
- 2026年国家电网有限公司大数据中心人员招聘笔试参考题库及答案详解
- 2026年河源市烟草专卖局人员招聘考试题库及答案详解
- 2026年国网经济技术研究院有限公司人员招聘参考题库及答案详解
- 中国热射病诊断与治疗指南(2026版)解读
- 项目复盘总结报告撰写模板
- 《殡葬服务机构遗体处置突发事件应急预案评估指南 (试行)》
- 客户满意度调查分析报告范本
- 长江存储在线测评题库
- 2025年UOM无人机理论培训合格证题库及答案
- 2026年河北单招语文应用文写作专项通知书信倡议书经典题
- k近邻算法教学课件
- 安徽省大联考2025-2026学年高一上学期十月调研考试英语试题(解析版)
- 《长征》读书分享演讲
- A级注册验船师考试题库及答案
评论
0/150
提交评论