版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
第三章线性回归第三章线性回归线性回归是研究和应用最为广泛的统计与计量经济学技术之一,这得益于诸多原因。首先,线性回归适用于建模多种变量间的关系。此外,线性回归模型的假设在许多实际应用中通常能得到合理满足。再者,回归模型的输出相对易于解释和沟通,模型的数值估计较为简便,且许多“非专业”软件包中都配备了模型估计工具。当然,线性回归也可能被过度使用或误用。在某些情况下,模型假设未必严格成立,而合适的替代方法却未被了解、理解或应用。此外,更高级的技术可能需要专业软件和知识才能进行估计。线性回归作为说明统计模型估计程序的起点不足为奇。尽管它是一种灵活且有用的工具,但在其他方法更为适用时,应避免使用线性回归。本章阐述线性回归模型的估计方法,解释线性回归模型的适用场景,说明如何解读线性回归模型的输出结果,并讨论如何在一组竞争的线性回归模型中进行选择。本章全程使用矩阵代数来阐释相关概念,但仅局限于说明最重要的分析层面所需的内容。•3.1线性回归模型的假设•3.2回归分析基础•
3.3回归中的变量处理•3.4估计单个β参数•3.5针对变量区间估计β参数•3.6为变量m个水平中的m−1个估计单个β参数•
3.7检验回归假设章节目录•
3.8回归离群值•
3.9回归模型拟合优度度量•3.10回归中的多重共线性•3.11回归模型构建策略•3.12估计弹性•3.13删截因变量——Tobit模型•3.14Box-Cox回归3.1线性回归模型的假设3.1线性回归模型的假设线性回归用于对连续因变量与一个或多个自变量之间的线性关系进行建模。大多数回归应用旨在识别一组被认为与因变量共变的解释变量。一般来说,解释性或“因果”模型基于受控实验(如实验室中进行的实验)获得的数据,预测模型基于观察性研究获得的数据,而质量控制模型则基于受控过程或系统获得的数据。解释变量是导致因变量变化还是仅仅与因变量变化相关,取决于众多因素,无法仅通过统计建模来确定。线性回归模型存在诸多假设(或要求)。当任何假设未得到满足时,需采取补救措施,在某些情况下还需采用替代建模方法。以下是线性回归模型的一些假设。3.1线性回归模型的假设1.连续因变量Y回归分析的一个假设是,因变量(或响应变量)是连续的,即它可以在某个数值范围内取任何值。连续变量是在区间尺度或比率尺度上测量的。尽管常有人这么做,但对有序尺度的响应变量进行回归分析存在问题。2.
Y与x之间的参数线性关系这一要求常常会引起混淆。回归模型的形式要求变量之间的关系本质上是线性的——即因变量Y与解释变量之间存在直线关系。简单线性回归模型可表示为:在大多数应用中,响应变量是多个解释变量的函数。在这些多元情形下,用矩阵形式表示线性回归模型更为高效,即:3.1线性回归模型的假设3.观测值独立且随机抽样尽管采取补救措施后这一要求会有所放宽,但若要对目标总体进行推断,一个必要假设是数据需从总体中随机且独立抽样。独立性意味着某个观测被选中的概率不受先前已选观测的影响。在某些情况下,会使用随机分配代替随机抽样,而分层抽样、整群抽样等其他抽样方案则需通过修正措施纳入回归建模框架。4.变量之间的不确定关系直线方程与线性回归模型的区别在于后者增加了一个随机项、误差项或扰动项。扰动项由若干部分组成:首先,它可能包含模型中遗漏变量的影响——假设这些影响是许多微小、单独来看不重要(次要)的效应之和,其中一些为正、另一些为负;其次,它包含因变量的测量误差,即测量Y时的不精确性,同样假设为随机误差;最后,它包含基础数据生成过程中固有的随机变异。3.1线性回归模型的假设5.与x无关且期望值为零的扰动项平均而言,模型的高估量等于低估量——即模型扰动项的总和为零。而扰动项的方差在各观测值之间是独立的。这一性质被称为同方差假设,它意味着模型不确定性的净效应(包括未观测效应、测量误差和真实随机变异)在观测值之间并非系统性存在,而是在观测值和协变量之间随机分布。当扰动项存在异方差(即系统性地随观测值变化)时,可能需要采用加权最小二乘法或广义最小二乘法等替代建模方法。6.非自相关的扰动项扰动项在观测之间相互独立。当对个体进行重复观测时,这一假设常被违反,此时扰动项中的未观测异质性部分会在个体内部产生相关性。空间数据也可能因位置关系表现出观测间的依赖性。然而,跨时间的观测可能是扰动项相关最常见的情形。当扰动项在观测间存在相关性时,广义最小二乘法或时间序列方法(见第7章和第8章)通常最为适用。3.1线性回归模型的假设7.解释变量与扰动项不相关这一性质被称为解释变量的外生性(exogeneity)。当解释变量为外生时,它们与扰动项不相关。外生性意味着解释变量的值由“模型外”的因素决定,因此因变量Y不会直接影响外生解释变量的取值。当某个重要变量为内生变量(依赖于Y)时,需采用替代方法,如工具变量法(instrumentalvariables)、两阶段或三阶段最小二乘法(twoorthreestageleastsquares)或结构方程模型(structuralequationsmodels)。8.扰动项近似正态分布尽管扰动项的正态分布并非线性回归模型估计的必要条件,但为了对模型参数进行推断,仍要求扰动项近似服从正态分布。在此方面,中心极限定理(centrallimittheorem)使得对统计参数的性质进行精确推断成为可能。结合独立性假设,这一假设意味着扰动项服从独立同分布正态分布(independentlyandidenticallydistributednormal,i.i.d.normal)。3.1线性回归模型的假设回归模型的分析假设总结见下表。该表列出了前文所述的各项假设。谨慎起见,应将表中的假设视为需要满足的建模要求。若这些要求未得到满足,则必须采取补救措施。在某些情况下,采取补救措施后可继续在线性回归建模框架内对数据进行建模;在另一些情况下,则需采用替代建模方法以有效处理非理想条件。第4章将详细讨论回归假设不成立时的补救措施。3.2回归分析基础3.2回归分析基础线性回归的目标是对因变量Y与一个或多个自变量X之间的关系进行建模。我们通过回归模型中的参数(即系数)来阐述X对Y的影响方式。回归分析旨在通过考察样本估计的系数的性质(如它们的表现、能揭示的样本特征以及由此推断的总体特征),来提供关于总体模型参数的信息和性质。针对整个目标总体的线性回归模型可表示为:真实总体模型是从理论考量、过往研究发现和假设理论中构建的。给定协变量向量时的期望值是一个条件期望。总体回归模型的未知扰动项定义为:将总体模型表示为矩阵形式(省略条件期望符号,用帽符号表示估计值),可得:3.2.1最小二乘估计最小二乘估计(OrdinaryLeastSquares,OLS)是回归分析中常用的参数估计方法,其核心是利用样本数据估计回归模型参数。以简单回归模型为例,通过标准代数和矩阵代数推导OLS估计,具体步骤如下:OLS要求最小化扰动项平方和的解。OLS寻求使函数Q最小化的解:使函数Q达到最小值的和的值即为最小二乘估计参数。当然,和是总体参数,是未知的,因此需要得到估计量和,它们是随样本不同而变化的随机变量。通过令Q关于和的偏导数等于零,可得到最小二乘估计参数和使用和分别表示和的估计量,求解上述方程并整理项后可得:3.2.1最小二乘估计通过二阶偏导数为正可以验证这些方程对应最小值。正如预期,模型中的每个参数都会生成一个最小二乘正规方程,因此一个具有个参数的线性回归模型会产生五个正规方程。通过联立求解这两个方程中的系数可得:简单回归情形下最小二乘正规方程的矩阵代数推导也十分直接。在简单回归中,表达式对应的矩阵形式为:求解系数的矩阵运算步骤如下:3.2.2最大似然估计前一节通过最小化函数Q展示了OLS估计量的推导过程。另一种常用且有时非常有用的统计估计方法称为最大似然估计(maximumlikelihoodestimation,MLE),其结果为最大似然估计量(MLEs)。似然函数的一般形式在附录A中描述为:从具有参数向量β的统计分布中观测到样本数据的联合密度,即:对于回归模型,假设n个扰动项独立同分布且服从正态分布,其似然函数为:通常,对上面的方程取对数(即对数似然函数)比直接求解似然函数更简单,因此对L取对数得:对和求对数似然的极大值,得到的估计解与OLS估计量等价。因此,对于满足3.1节假设的回归模型,MLE和OLS估计量是等价的。需要注意的是,MLE基于渐近理论,随着样本量增大,MLE估计量具有一致性。3.2.3普通最小二乘法和极大似然估计法估计量的性质前一节表明,对于满足表3.1假设的回归模型,MLE和OLS估计量是等价的。MLE和OLS估计量的期望值推导如下:因此,MLE和OLS估计量是的无偏估计量。在不假设正态性的经典线性回归模型中,高斯-马尔可夫定理证明了β的OLS估计量是最佳线性无偏估计量(BLUE),即在所有线性无偏估计量中具有最小方差。该定理指出,在经典回归假设(不含正态性)下,MLE和OLS估计量在线性无偏估计类中具有最小方差。这意味着只有使用有偏估计量才能获得更小的方差。若加入正态性假设(除独立性和外),则OLS和MLE估计量在所有无偏估计量中具有最小方差(不再限于线性估计)。在正态理论回归模型中,MLE和OLS估计量(二者等价)均为基础总体参数的最佳线性无偏估计量。3.3回归中的变量处理3.3 回归中的变量处理在回归分析中,变量处理有诸多动机和技术。标准化回归模型允许直接比较自变量的相对重要性。变量变换有助于满足回归假设,指标变量允许对名义尺度和顺序尺度变量进行适当表达,而交互作用则能够对变量之间的协同效应进行建模。1.标准化回归模型人们常常关注自变量对因变量Y的相对影响。然而,使用变量的原始测量单位无法直接表明哪些变量对Y的相对影响最大。例如,在描述每日预期出行链数量的模型中,若两个自变量分别为孩子数量和家庭收入,其估计参数无法直接比较——前者的单位是“每单位孩子带来的每日出行链数量的边际变化”,后者是“每单位收入带来的每日出行链数量的边际变化”。孩子数量和家庭收入的量纲截然不同,缺乏直接可比性。家庭中孩子数量通常在0到8之间,而收入范围可能从5000人民币到500,000人民币,这使得对这些变量相对影响的有效比较变得困难。3.3 回归中的变量处理标准化回归模型通过对所有自变量进行标准化处理得到。标准化严格适用于连续变量(即基于间隔或比率尺度测量的变量)。通过对所有连续自变量应用标准化公式:生成新变量,其中标准化后的变量具有期望值为0且方差为1的特性。由此,所有连续自变量被转换为同一尺度,从而使得跨标准化单位的比较成为可能。标准化回归模型中的估计回归参数可解释为:自变量每变化一个标准差,因变量的变化量。大多数统计软件包会在普通最小二乘回归(OLS)中提供生成标准化回归模型输出的选项。若该选项未直接提供,大多数软件也支持对变量进行标准化处理,进而将其用于回归分析。3.3 回归中的变量处理2.变量变换线性回归的应用要求变量间关系为线性(少数例外如多项式回归模型)。这种线性是参数线性限制的直接结果。然而,物理、工程或社会现象未必总能以线性关系最佳表示,非线性关系往往更为合适。幸运的是,非线性关系可在线性回归框架内得到处理。能够容纳非线性关系为寻找两个或多个变量间合理且合适的关系提供了极大的灵活性。我们将介绍并讨论两种示例变换在回归中的应用及其带来的后果和影响。在线性回归建模框架中使用变量变换的一些基本准则值得注意:1.变量间的线性关系要求:回归建模框架要求因变量与所有自变量之间为线性关系,少数例外是变量的多项式表达。2.研究关注原始测量单位:研究兴趣通常聚焦于原始测量单位的因变量,而非变换后的单位。3.变换的本质是数据重缩放:对Y、X或两者进行变换,仅是对观测数据进行重缩放以识别线性关系的一种方式。3.3 回归中的变量处理假设使用线性回归建模变量Y和X的关系,为满足线性回归所需的线性关系,计算Y和X的倒数,使估计模型形式为:为还原Y的原始测量单位并明确此变换所假设的潜在真实模型形式,对等式两边取倒数可得:通过对其取倒数,假设未知的真实关系为上述方程所示形式,其中,且扰动项是X的函数。需注意的是,此变换隐含的潜在模型比线性回归假设的模型(线性加性参数和加性扰动项)更为复杂。3.3 回归中的变量处理类似推导适用于广泛应用于因变量和自变量的多种变换。附录C描述了多种典型变换及其变体。使用变量变换隐含了对潜在未知真实模型的不同假设,需注意以下警示:1.理论一致性:隐含的潜在模型应与所研究现象的理论预期一致。2.扰动项性质变化:加性扰动项可能通过变换转化为乘性扰动项。3.模型设定检查:若扰动项在线性回归框架中表现不佳,可能尚未找到正确的模型设定。4.非线性回归的优势:有时直接使用非线性回归技术估计潜在真实模型形式,比对原始数据进行一系列变换更简单且有效。人们常常关注对有序和名义尺度变量的效应进行建模。回归模型中名义和有序尺度变量的解释方式与连续变量不同。对于名义尺度变量,必须创建个指示变量以在回归模型中表示该变量的全部m个水平。这个指示变量代表因变量的不同类别,未被纳入的水平则隐含在回归的截距项中。理论上无意义或统计上不显著的指示变量应从回归中剔除,仅保留名义尺度变量中重要的水平,而将其他水平归入“基准”条件。3.4 估计单个β参数3.4 估计单个β参数这种方法的假设是,随着变量水平的增加,其边际效应是相同的。例如,考虑一个反映调查问题回答的变量:“你是否支持在I-10高速公路上实施拥堵收费?”该问题的回答包括:1=不支持;2=不太可能支持;3=中立;4=可能支持;5=强烈支持。这个变量反映了一个有序响应,其有序类别之间(无论是个体间还是个体内)并不存在等距间隔。如果为该变量估计单一的β参数,就相当于假设变量的每个单位增加(或减少)对响应变量的影响是相同的。这一假设往往并不成立。因此,对有序变量进行分解处理更为合适。3.5 针对变量区间估计β参数3.5 针对变量区间估计β参数假设一个有序变量存在两种不同的效应,一种体现在变量取值范围的某一部分,另一种体现在变量的剩余部分。在这种情况下,可创建两个指示变量,每个变量区间对应一个指示变量。以变量NUMLANES(车道数)为例,尽管该变量各水平之间的间隔是均等的,但可以认为不同车道数水平对AADT(年平均日交通量)存在根本不同的影响。因此,可创建两个指示变量,使得这两个指示变量将允许估计两个参数,一个针对变量NUMLANES的低区间,另一个针对其高区间。如果基于理论、行为或实证考量,存在先验理由认为这些区间的效应会有所不同,那么回归分析将提供证据,检验NUMLANES的这些独立区间是否支持不同的回归参数。需注意的是,这两个指示变量与原变量NUMLANES之间存在线性依赖关系。3.6为变量m个水平中的m−1个估计单个β参数3.6 为变量m个水平中的m−1个估计单个β参数对有序变量最复杂的第三种处理方法等同于对名义尺度变量的处理。在这种方法中,针对有序尺度变量的m个水平创建个指示变量。这种方法的合理性在于,变量的每个水平对响应变量具有独特的边际效应。该方法通常适用于响应类别较少且具有理论依据的有序尺度变量。例如,对于变量NUMLANES(假设其取值范围为1到4),可创建以下三个指示变量:该变量现在在回归中表示为三个指示变量,分别对应该变量的前三个水平。与之前一样,线性回归用于评估证据,判断变量NUMLANES的每个水平是否需要单独的β参数。这一过程通过本章后文介绍的F检验从统计上进行评估。3.6.1回归模型中的交互作用回归模型中的交互作用表示两个或多个变量的联合效应或协同效应,即因变量依赖于两个或多个变量的共同取值。三阶效应是三个变量的交互作用,依此类推。一般来说,效应的阶数越低(一阶效应为无交互的单个变量),变量在回归中对因变量的影响越直接。此外,高阶效应通常仅在其对应的低阶效应已被纳入模型时才被加入。例如,回归中的二阶交互项应伴随一阶效应和同时存在。为理解引入指示变量和交互变量的影响,假设是模型中的连续变量,另有三个指示变量代表名义尺度变量的三个水平,在模型中记为至。得到如下估计回归函数(为方便省略观测下标i):仔细观察模型可知,对任意观测值,最多只有一个新指示变量取值为1(其余为0),这是0-1编码的结果:当时,和必然为0。3.6.1回归模型中的交互作用因此,该回归模型可拆分为四个子模型,对应指示变量的四个可能水平:分析这些子模型可发现一个重要结论:根据指示变量的取值(1或0),回归直线关于的斜率保持不变,而Y截距项会根据指示变量的参数值调整。因此,以简单形式纳入回归模型的指示变量,本质上是对Y截距项的边际调整。3.6.1回归模型中的交互作用假设每个指示变量被认为与变量存在交互作用,即指示变量的每个水平与结合时对Y有独特影响。为纳入这些交互作用,模型修订为:这一复杂模型可拆分为以下回归方程:此时,指示变量的每个水平不仅影响Y截距,还影响回归函数关于的斜率。3.6.1回归模型中的交互作用该模型的核心作用是:名义尺度变量的每个水平对应一个独立的回归函数,具有独特的斜率和Y截距。下图以图形形式展示了这一模型表示具有四个水平指示变量的回归函数3.6.1回归模型中的交互作用当两个或多个连续变量之间存在交互作用时,回归方程会变得更为复杂。考虑以下回归模型,其中变量和为连续变量需注意,此模型中的因变量不仅依赖于和的单独取值,还依赖于它们的联合取值。该模型包含一个交互项,用于解释和对Y的影响并非独立这一事实。回归函数表明,与Y的关系依赖于的取值,反之,与Y的关系也依赖于的取值。变量对Y的依赖性质取决于一个或多个自变量的取值。交互项通常反映变量关系的重要特征,应纳入回归模型。尽管它们可能无法解释因变量的大量变异,但可能体现关系的重要理论内涵,也可能代表统计上高度显著的效应。3.7 检验回归假设3.7 检验回归假设回归假设应被视为模型的必要条件。回顾普通最小二乘(OLS)回归模型的基本要求:1.假设一要求因变量与预测变量之间存在参数线性关系(即模型对参数为线性形式)。2.假设二是OLS估计的必然结果(即扰动项的条件均值为零)。3.假设三要求扰动项在所有观测值中具有相同方差(即同方差性)。4.假设四要求观测值之间不存在时间趋势(即无序列相关性,适用于时间序列数据场景)。5.假设五要求自变量(X项)具有外生性,即其取值由回归模型外的因素决定。6.假设六要求扰动项的分布近似服从正态分布。大多数回归假设是通过非正式的图形分析来检验的。需要强调的是,非正式绘图仅仅是识别严重、极端或显著违反回归假设的方法。在大多数情况下,回归假设的中等程度违反带来的影响可以忽略不计,因此非正式方法已足够且合适。当情况不明确时,应进行更正式的统计检验。下面我们将讨论每种非正式检验方法以及一些更正式的检验方法。3.7 检验回归假设1.线性假设线性假设可通过几种图形进行非正式检验。这些图形包括以每个自变量为X轴、残差(disturbances)为Y轴的散点图,以及以模型预测值(拟合值)为X轴、残差为Y轴的散点图。如果回归模型设定正确且变量间关系为线性,那么图形结果应显示残差无曲线趋势。此类图形旨在识别严重、极端的假设违反情况,因此若存在曲线趋势,应明显可辨。拟合:残差拟合值与残差观测值3.7 检验回归假设2.同方差扰动项扰动项方差恒定称为同方差性(homoscedasticity)。若扰动项不满足同方差性,则称其具有异方差性(heteroscedasticity)。这一要求源于回归模型中的方差项,该方差项假定在整个回归中保持恒定。例如,可能存在方差是某一自变量的递增函数的情况,但这违反了OLS回归假设,需要特殊处理。异方差回归的后果是β参数估计的精度降低,即与同方差扰动项相比,异方差情况下回归参数的估计效率更低。这一结论是直观的:由于均方误差(MSE)用于估计,异方差回归中的MSE更大,因此在计算β参数精度时使用的MSE也会导致更大的估计值。散点图常用于评估同方差性。通常首先检查模型拟合值与残差的散点图。若检测到异方差性,则需进一步绘制残差与自变量的散点图,以确定导致异方差的具体变量。3.7 检验回归假设3.不相关扰动项当观测值在个体、时间或空间上存在依赖关系时,可能会产生扰动项的相关性。跨时间的扰动项相关性称为序列相关性(serialcorrelation)。检测序列相关性的标准图形是“残差-时间”散点图,或“残差-有序观测值”散点图(针对空间数据)。近似正态分布、同方差且无序列相关的扰动项在此类图形中不会显示任何模式,而存在序列相关的扰动项会呈现随时间变化的趋势,残差的波峰和波谷通常在固定间隔内重复出现。一个常见的例子是心脏随时间产生的电压图:每次心跳会导致高电压输出,随后在两次心跳之间出现低电压读数。对自相关性的正式检验基于杜宾-沃森统计量(Durbin–Watsonstatistic),该统计量由大多数回归软件直接输出,通过OLS回归的残差计算得出。当无自相关性时,杜宾-沃森统计量的值为2.0;当统计量偏离2.0越远,我们对“无自相关性”的信心就越弱。处理序列相关性的标准补救措施包括广义最小二乘法(generalizedleastsquares)或时间序列分析,这两种方法均显式考虑了扰动项之间的相关性。3.7 检验回归假设4.外生自变量外生性假设,即回归模型中的所有自变量均为外生变量。外生性可能是回归分析中最难描述和理解的假设之一。“变量是外生的”意味着该变量的变化是“自主的”,或独立于模型中的其他变量,其取值由模型外的因素决定。相反,内生变量的变化由模型中的其他外生或内生变量(一个或多个自变量,或因变量)所导致。需注意,外生性并不意味着回归中的两个自变量不能共变——许多变量确实存在共变关系,尤其是在基于观测数据的回归中。若变量间缺乏明确的理论因果关系,回归中相关的变量仅被假定为“关联”而非“因果关系”。若模型中自变量之间存在因果关系,则需要采用替代模型结构,如多方程模型(见第5章)或结构方程模型(见第8章)。忽略内生性导致的“反馈效应”会使统计推断产生偏差。3.7 检验回归假设5.正态分布的扰动项扰动项近似服从正态分布是一项仅为支持回归参数推断而设定的假设。此外,扰动项(或残差)的期望值需为零。回顾可知,正态性假设使得回归参数近似服从t分布,而t分布是对潜在真实参数值进行概率推断的基础。若推断并非建模目的(例如,若建模仅用于预测未来均值响应),则可忽略正态性假设而不产生后果。然而,除预测外,建模通常还关注对β参数值的推断,因此必须检验正态性假设。评估正态性的方法包括非图形法、图形法和非参数法,具体选择取决于对非正式方法的满意程度。若图形法显示严重偏离正态性,需采用更复杂的方法进一步检验假设。常用方法如下:1.扰动项的描述性统计量:包括最小值、第一和第三四分位数、中位数及最大值。正态分布具有对称性,均值与中位数应相等且近似为零。因此,检查描述性统计量是否关于零点对称具有参考价值。大多数统计软件默认提供扰动项的描述性统计量,或可通过简单命令生成。3.7 检验回归假设2.扰动项直方图:直方图应呈现常见的钟形正态曲线,零点上下的观测值数量应大致相等,且分布呈镜像对称。直方图虽能显示对称性,但无法提供正态分布尾部概率的具体信息。3.扰动项正态概率分位数-分位数图(Q-Q图):正态分布中约67%的观测值位于均值±1个标准差内(扰动项均值为0),95%位于±2个标准差内,99%位于±3个标准差内。正态Q-Q图的构建原理是:若扰动项服从正态分布,其散点应完美落在一条直线上;偏离正态性会表现为散点偏离直线。4.非参数方法:如卡方拟合优度(GOF)检验或柯尔莫哥洛夫-斯米尔诺夫拟合优度检验。尤其在样本量较小时,这些方法可能显示严重偏离正态性。此类检验本质上是通过概率证据判断数据是否可能来自正态分布。样本量直接影响扰动项呈现“正态”行为的程度:小样本的正态分布数据通过诊断工具可能显示非正态特征,样本量小于30时,评估正态性假设可能存在困难;反之,大样本(如大于100)的扰动项若确实服从正态分布,其行为应与正态性一致。3.8 回归离群值3.8回归离群值识别有影响的观测值至关重要,因为这类观测值可能对回归线的拟合产生不成比例的影响。若某个有影响的观测值因已知或未知原因偏离了变量间的潜在真实关系,它将导致变量间的真实关系被误判。其风险在于,一个“异常”观测值可能主导回归线的拟合,进而影响统计推断的结果。因此,建议系统检查具有离群性质的有影响观测值,确保其为合法观测值。一个观测值的影响可能体现在Y轴位置、X轴位置,或两者兼具。回顾可知,普通最小二乘法(OLS)通过最小化残差平方和进行拟合,因此,一个距离拟合回归线两倍于其他观测值的点,在拟合回归中占四倍的权重。一般而言,既远离X均值又远离Y均值的观测值对回归拟合的影响最大,需重点审视。下图展示了一条基于包含三个离群观测值的数据拟合而成的假设回归线:观测值a远离Y均值,观测值b远离X均值,观测值c则同时远离和。3.8回归离群值带有三个有影响观测值a、b和c的回归线3.8.1用于识别离群观测值的帽子矩阵通常使用一个称为“帽子矩阵”的矩阵来识别离群观测值。因此,维的帽子矩阵形式为:通过帽子矩阵,因变量的拟合值可表示为观测值Y的线性组合。残差e也可通过帽子矩阵表示为观测值Y的线性组合:由于,易证方差-协方差矩阵可通过帽子矩阵表示为:最后,对第i个观测值,残差的方差计算为:其中是帽子矩阵主对角线上的第i个元素,可直接通过关系式计算,此处对应于从自变量矩阵X的第i行(第i个观测值)导出的向量。对角元素具有以下实用性质,首先其值始终介于0和1之间;其次所有对角元素之和等于回归模型参数个数p
3.8.2量化异常值影响的标准度量评估观测值影响力最常用的指标或许是库克距离。库克距离量化了从回归拟合中移除第i个观测值后,对回归函数参数估计的影响。若影响越大,则值也越大。因此,库克距离为回归中的观测值提供了一种相对影响力度量。从代数形式上,库克距离的表达式为:这一计算较为繁琐,因为需要为每个i观测值单独计算平方和。第二种等价形式利用了前文讨论的帽子矩阵,大大简化了计算:库克距离依赖于两个因素:第i个残差的大小和杠杆值。残差越大、杠杆值越高,或两者兼具,都会导致值增大。尽管库克距离是统计软件中常用的度量,但也存在其他评估观测值影响力的方法。所有方法均基于类似原理评估离群值的影响。3.8.3从回归中剔除有影响的数据点到目前为止,我们已经讨论了量化有影响观测值的方法。有许多可能导致离群值的情况,下面将描述这些情况如何产生以及应采取的适当措施。1.模型设定错误(MisspecificationError)指定的模型可能不恰当,未能捕捉某些重要效应,尤其是对有影响的观测值而言。若该遗漏特征可获取或后续可测量,应将其纳入模型。另一种模型设定错误可能是回归中的非线性问题——可通过变量变换或非线性回归技术改善。若怀疑离群观测值具有(或共享)无法识别的特征,决策将变得棘手:剔除观测值可能招致外部批评,被指责“数据适配模型”;保留观测值会导致模型明显不理想,因“拟合不足”受诟病。此时,最合理的做法或许是将离群观测值保留在模型中,并解释其异常的可能原因。若离群观测值对回归拟合影响显著,可采用稳健回归技术降低其相对影响。2.编码错误(CodingError)有影响的数据点可能在数据收集阶段被错误记录。从观测数据到记录数据的中间环节易出现记录或编码错误。3.8.3从回归中剔除有影响的数据点3.数据收集错误(DataCollectionError)有影响的观测值可能源于设备故障、人为失误或数据收集过程中的其他错误。此类错误导致的离群值通常难以诊断,因部分情况下缺乏足够信息判断是否发生错误。通常,将此类离群值保留在模型中更具说服力,因无明确理由剔除它们会降低研究的可信度。4.计算错误(CalculationError)分析前通常需对数据进行大量处理,人为错误易在非自动化处理过程中渗入,导致数据错误。对此,最佳补救措施通常不是丢弃离群值,而是修正计算错误,并使用校正后的观测值重新运行回归。从回归中剔除离群值可能引发对回归结果的质疑。实际上,剔除离群值会“改善”数据对模型的拟合,而回归的目标本应是让模型拟合数据。无正当理由剔除离群值可能被视为操纵数据以支持特定假设或模型。因此,完整记录并合理解释分析中剔除任何数据的原因是良好的研究实践。3.9回归模型拟合优度度量7.8动态模型诸如之前方程的动态模型规避了前文列举的特设分布滞后模型的三个主要问题。自由度得到很大的提升,多重共线性问题也不存在了。如果性质良好,那么在大样本条件下,方程的普通最小二乘估计值将具有理想特性。样本容量要多大才够呢?本书认为样本容量应不低于50,更多的是基于经验而非论证。样本容量越小,越容易产生偏误。样本容量不应低于30,部分原因在于可能产生偏误,部分原因在于过小的样本容量会使假设检验不可信。除样本容量的问题外,动态模型还面临另外一种严重问题。无论样本容量多大,序列相关性几乎都会使动态模型的普通最小二乘估计产生偏误。这个问题将会在7.9节中讨论。7.9 序列相关性和动态模型序列相关性的后果主要取决于模型的类型。对于类似分布滞后模型来说,第7.3节列举出了序列相关性的后果:序列相关性使普通最小二乘估计量不再是最小方差无偏估计量;序列相关性使产生偏误;序列相关性不会使普通最小二乘估计量有偏。然而,对于类似的动态模型来说,情况发生了变化,序列相关性确实会导致普通最小二乘估计量有偏。更为复杂的是,在面临滞后被解释变量模型时,之前讲述的序列相关性的后果、检验、补救等内容并非完全适用,需要进行修正。7.9.1序列相关性使动态模型产生偏误如果以滞后被解释变量为解释变量的方程的误差项序列相关,那么,即使在大样本条件下采用普通最小二乘法估计出的参数估计值也是有偏的。为了了解偏误的来源,从动态模型开始,滞后1期的情况:注意方程上的箭头,如果为正,则会更大。另外,如果序列相关,则:仔细观察方程的箭头就会发现,和是相关的!这种相关性违背了古典假设,即误差项与所有解释变量均不相关。这种相关性的后果是导致参数估计量有偏,特别是参数,因为普通最小二乘法会把一些对的影响归因于。从本质上讲,这种未修正的序列相关性的后果跟遗漏变量的后果一样。因为当遗漏变量与解释变量相关时,会使参数估计值有偏,因而,当与相关时,滞后被解释变量与序列相关性的结合就会使参数估计值有偏。偏误在之前有所提及。7.9.2动态模型的序列相关性检验如果动态模型的序列相关性导致参数估计量的偏误,那么序列相关性的检验就非常重要了。不幸的是,杜宾-沃森d检验对以滞后被解释变量为解释变量的方程来说,可能是无效的。第7.4节中使用的拉格朗日乘数序列相关性检验在面对滞后被解释变量时依然有用。使用拉格朗日乘数检验动态模型的序列相关性包含3个步骤:(1)获取估计出的方程的残差:(2)以残差作为辅助回归方程的被解释变量,辅助回归方程包含原始方程的右边所有的解释变量以及残差的滞后项:(3)采用普通最小二乘法估计方程(2),用以下统计量检验原假设:7.9.3动态模型序列相关性的修正如果拉格朗日乘数检验指出动态模型有序列相关性,第一步就是要考虑序列相关性是否是非纯的,即序列相关性产生于遗漏变量,或者没能准确把握实际的分布滞后特征。如果序列相关是纯的,理论上来说较好的办法是改变方程来消除序列相关性重新估计模型。由于对方程的迭代非线性估计超过了它的检验范围,因此,建议使用两种替代方法。如果理论指出只有少数X的滞后值对解释有帮助,那么,避免因序列相关性引起的偏误的潜在方法是估计分布滞后而不是动态模型。分布滞后模型会有潜在的多重共线性但不会出现其他问题,因为p很小。在小样本中,即使面对动态模型中的序列相关性,最好的方法还是采用普通最小二乘法。对于真实世界实例的这种小样本的非平凡子集,最小二乘法比其他复杂的方法更好。总的来说,除非你倾向于使用非线性最小二乘法迭代,否则,我们对于处理动态模型中序列相关问题的建议还是取决于理论及样本大小。如果理论设定中只有几个滞后X,我们建议分布滞后法。如果样本容量很小,我们将使用普通最小二乘法,即使是面对序列相关,普通最小二乘法也能起到最好的作用。在样本容量和有意义的滞后X都很大的情况下,由于工具变量的优势,我们推荐用分布滞后模型。7.10Granger因果关系7.10
Granger因果关系Granger因果关系(Grangercausality),也称前定关系,描述的是这样一种情形,即若某时间序列变量变动,另一个时间序列变量会发生一致的可预测的变化。Granger因果关系非常重要,因为它能分析出究竟哪个变量前定或“引导”(leading)另外一个变量,后面会讲到,这种引导变量在预测时非常有用。尽管Granger因果关系很有价值,但并不能受其误导,认为它能在严格意义下证明经济中的因果关系。即便一个变量前定另外一个变量,也不能认为是第一个变量的变动引起了另外一个变量的变动。因此,即使能确定事件A先于事件B发生,也不能认为事件A“导致”了事件B。Granger因果关系有多种检验方法,但所有方法都或多或少与分布滞后模型有关。本书更多使用的是Granger提出的原始检验模型的一个扩展。Granger认为,如果A是Y的Granger原因,那么:7.10
Granger因果关系检验原假设:所有A的滞后项的系数均为0。若F检验拒绝原假设,则认为A是Y的Granger原因。值得注意的是,若,之前的方程就类似于动态模型。应用Granger因果关系检验时需要检验两个方程,每个方程代表一个方向。换句话说,估计之前方程的同时也要估计:再检验原假设:所有Y的滞后项Ys(又是)的系数均为零,即可实现Granger因果关系两个方向的检验。如果之前方程的F统计量显著而如今方程的F统计量不显著,那么,就认为A是导致Y的Granger原因。7.11谬误相关和非平稳性7.11谬误相关和非平稳性时间序列数据的一个问题是,如果解释变量与被解释变量具有相同的趋势,那么,解释变量的显著性可能高于实际情况。例如,在具有恶性通货膨胀的国家,几乎所有的名义变量都与其他名义变量高度相关。为什么呢?名义变量没有经过通货膨胀调整,因而,每个名义变量都包含严重的通货膨胀因素。通货膨胀因素的影响通常大于真实因果关系的影响,使名义变量看起来相关,即使它们本来不相关。这就是谬误相关(spuriouscorrelation),即两个或两个以上变量高度相关,但并非由真实的潜在因果关系所致。被解释变量与一个或多个解释变量谬误相关的回归称为谬误回归。谬误回归会使t统计量和整体拟合优度偏大、不可信。导致谬误相关的原因很多。例如,对截面数据来说,若解释变量和被解释变量都除以第三个变量,且第三个变量的变化范围大于前两个变量,就可能会产生谬误相关。然而,本节主要考察时间序列数据,以及由非平稳时间序列导致的谬误相关。7.11.1时间序列的平稳性与非平稳性平稳序列是指这个序列基本统计特征(如均值和方差)不随时间发生变化。相反,非平稳序列有一个或多个基本统计特性会随时间发生变化。例如,一般来说,一个经济体的实际人均年产出会随时间而增长,所以,它是非平稳的。然而,实际人均年产出的增长率不会随时间而提高,所以,即便这个变量是基于实际人均年产出这个非平稳变量计算出来的,但它仍旧是平稳的。即使均值是常数,但只要其他统计特性(例如方差)随时间发生变化,也认为时间序列是非平稳的。更为一般的是,如果时间序列变量是平稳的(stationary),那么:(1)的均值不随时间发生变化;(2)的方差不随时间发生变化;(3)与之间的简单相关系数取决于滞后长度(k),而与其他变量无关(对所有k来说)。这些性质中,如果1个或1个以上没有满足,那么,就是非平稳的(nonstationary)。如果序列非平稳,那么,就认为它具有非平稳性(nonstationary)。7.11.1时间序列的平稳性与非平稳性虽然,前文的定义集中于变量的平稳性与非平稳性,但值得注意的是,误差项(或者残差)也可能是非平稳的。事实上,前文已经遇到过误差项非平稳的情况。在许多时间序列数据存在异方差的例子中,会涉及误差项的方差随时间的推移而变大。这种存在异方差的误差项就是非平稳的。对回归分析来说,非平稳性的主要后果是导致谬误相关,使判定系数和非平稳解释变量的t统计量偏大,这反过来又会导致模型设定偏误。这是因为,回归估计程序把一些因素(例如,趋势)对的影响归因于非平稳变量的变动对的影响,而这些因素同时也影响。因此,由于存在非平稳性,各个变量往相同的方向变动,增大了判定系数以及相应的t统计量。这在宏观计量经济学中尤为重要,检验各种序列的非平稳性的文献已在宏观经济学文献中占主导地位。有些变量是
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- MT/T 1313-2025煤矿用湿度传感器通用技术条件
- 科学心态助力成长健康防护护航未来小学主题班会课件
- 职场人士时间管理高效工作指南
- 沉浸式学习环境构建与VR技术应用指南
- 通信网络工程师网络维护稳定绩效衡量表
- 电视节目制作与播出管理预案
- 酒店旅游业在线预订平台建设方案
- 跨境电商智能物流与供应链解决方案
- 职场时间管理减少拖延规划方案
- DB61-T 5072-2023 纤维增强耐热聚乙烯低温直埋复合供热管道应用技术规程
- 快检知识培训课件
- CNC注塑钣金冲压过程审核表
- 红外热成像测温原理与技术阅读札记
- 质点+参考系-2025-2026学年高一上学期物理人教版(2019)必修第一册
- 汽车事故线索管理办法
- 2025年安徽安庆市文化旅游产业发展集团有限公司招聘笔试参考题库含答案解析
- JG/T 491-2016建筑用网格式金属电缆桥架
- 检验科带教工作报告
- 《城市综合管廊智能运行维护管理标准》
- 流沙处理方案
- 重性精神疾病患者管理服务规范
评论
0/150
提交评论