版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
1、1,第3章 两变量线性回归,2,引 言,本章介绍古典线性回归分析中的两变量线性回归(一元线性回归),包括两变量线性回归模型,两变量线性回归分析思路,最小二乘参数估计方法及其性质,基于参数估计的检验推断和预测分析方法等。,3,两变量线性回归,两变量线性回归模型 参数估计 最小二乘估计量的性质 回归拟合度评价和决定系数 统计推断 预测,4,古典线性回归分析三个基本特征: 1、分析框架是“古典框架”,认为经济变量之间存在确定的函数关系,计量经济分析就是发现或推断这种关系; 2、分析方法主要是对因果关系的回归分析; 3、需要确定的参数是线性模型中的线性参数,即线性函数的系数。,5,先讨论两变量线性回归
2、分析的原因:,1、两个变量之间的线性因果关系在现实经济中相当普遍。 2、虽然许多经济问题涉及到多变量关系或不是线性的,但多变量关系与两变量线性关系分析方法相似,非线性关系多数可转化为线性关系,因此先讨论两变量线性回归有方便之处。 3、两变量线性回归分析的原理和方法,正是所有计量经济分析的基本原理和方法,对理解计量经济分析的思想方法,进一步学习各种复杂的计量经济分析技术有很大帮助。,6,第一节 两变量线性回归模型,一、变量和函数式 二、变量关系的随机性 三、模型的假设,7,一、变量和函数式(模型变量、关系式确定),若两变量是确定的函数关系: Y = + X Y被解释变量 X解释变量 、待定参数
3、但由于变量之间通常只是相关关系: Y = + X +,8,1、模型设定、关系式选择根据: (1)研究问题的需要(GDP、增长率、入WTO对行业冲击、就业等); (2)经济理论和观点; (3)数据分布、散点图(数据是规律的表现形式、信息载体); (4)非线性函数和线性变换。,9,2、例3.1:中国旅游业总收入将超过3000亿美元吗?从2004中国国际旅游交易会上获悉,到2020年,中国旅游业总收入将超过3000亿美元,相当于国内生产总值的8%至11%。 1)是什么决定性的因素能使中国旅游业总收入到2020年达到3000亿美元? 2)旅游业的发展与这种决定性因素的数量关系究竟是什么? 3)怎样具体
4、测定旅游业发展与这种决定性因素的数量关系?,10,应当考虑的问题:,1.确定作为研究对象的经济变量 (中国旅游业总收入) 2.分析影响研究对象变动的主要因素 (中国居民收入的增长等) 3.分析各种影响因素与所研究经济现象的相互关系(决定相互联系的数学关系式) 4.确定所研究的经济问题与影响因素间具体的数量关系(运用计量经济学方法进行参数估计),11,应当考虑的问题:,5.分析并检验所得数量结论的可靠性 (数理统计检验) 6.运用数量研究结果作经济分析和预测 (对数量分析的实际应用),12,例3-2 上海经济的消费规律研究,13,例3-2 上海经济的消费规律研究,14,二、变量关系的随机性,1、
5、在经济问题中精确的因果关系实际上是不存在的。 因为人类经济行为本身的随机性;忽略的其他众多因素的影响;忽略的高阶项(非线性项);非实验数据。 2、正确的计量经济模型应该是随机模型: Y = + X + 的重要性:,15,随机误差项主要包括下列因素的影响:即的重要性,1)在解释变量中被忽略的因素的影响; 2)变量观测值的观测误差的影响; 3)模型关系的设定误差的影响; 4)其它随机因素的影响。,产生并设计随机误差项的主要原因: 1)理论的含糊性; 2)数据的欠缺; 3)节省原则。,16,三、线性回归模型的基本假设,为什么要作基本假定? 模型中有随机扰动项,估计的参数是随机变量,只有对随机扰动项的
6、分布作出假定,才能确定所估计参数的分布性质,也才可能进行假设检验和区间估计。 只有具备一定的假定条件,所作出的估计才具有较好的统计性质。,17,线性回归模型的基本假设:,6条假设: (1)变量间存在随机函数关系Y= + X + 该假设是对模型随机线性函数关系的归纳。 (2)误差项均值为0。 对i=1,2,,n都成立,该假设的含义是如果两变量之间确实是线性趋势占主导地位,随机误差只是次要因素时,那么虽然随机扰动会是个别观测值偏离线性函数,但给定解释变量时多次重复观测被解释变量,概率均值会消除随机扰动的影响,使符合线性函数的趋势。,18,(3)误差序列同方差。,对i=1,,n成立。,该假设的含义是
7、对应不同观测数据组误差项分布的发散趋势相同,或者有相同形状的概率分布密度。 (4)误差序列不相关。,对任意i不等于j都成立。,19,假设(4)的意义是对应不同观测值的误差项之间没有相关性。 (5)X是确定性的,非随机变量。 (6)误差项服从正态分布 假设(5)和假设(6)都是为了回归分析和统计推断的方便而要求的、人为性较大的假设。因为非随机意味着解释变量取值像实验数据那样可控制和重复,而且没有观测误差。在解释变量与误差项不相关或渐近不相关的情况下,解释变量随机性不会影响回归分析的性质,而且误差项服从正态分布的前提下,相关检验推断也仍然成立。,20,6个基本假设:,误差项服从正态分布的假设在参数
8、估计时不一定需要,也不会影响最小二乘估计量的性质,但对参数估计量分布性质和相关统计推断有意义。 如果误差项偏离正态分布的情况比较严重,那么小样本情况下相关统计推断和检验不再有效,但在样本容量较大时,参数的最小二乘估计量仍是渐近正态分布的,因此统计检验和推断仍然基本有效。,21,第二节 参数的最小二乘估计,一、参数估计的基本思路 二、样本趋势的拟合和回归残差 三、最小二乘法,22,一、参数估计的基本思路,含义:求Y= + X + 中 、 的近似值,以及中隐含的分布参数 。 参数估计是计量经济分析的核心步骤。 参数估计的困难是如何找出估计值,如何评价估计值。 基本思路:用拟合样本趋势的方法,找出样
9、本回归直线,拟合、近似总体回归直线(期望直线),得到参数近似值。,23,二、样本趋势的拟合和回归残差,两点法、分组求和 关键是建立好的拟合标准 回归残差是核心回归残差的总体水平最小二乘法。 最小二乘估计是最基本、重要的计量经济参数估计方法。具有许多好的性质。是其他多种估计、推断、分析的基础。多种计量经济分析方法与OLS有内在一致性。,24,样本回归函数(SRF),问题:能从一次抽样中获得总体的近似的信息吗?如果可以,如何从抽样中获得总体的近似信息?,问:能否从该样本估计总体回归函数PRF?,回答:能,例3:在总体中有如下一个样本,,总体的信息往往无法掌握,现实的情况只能是在一次观测中得到总体的
10、一个样本。,25,该样本的散点图(scatter diagram):,样本散点图近似于一条直线,画一条直线以尽好地拟合该散点图,由于样本取自总体,可以该线近似地代表总体回归线。该线称为样本回归线(sample regression lines)。,记样本回归线的函数形式为:,称为样本回归函数(sample regression function,SRF)。,26,三、最小二乘法,最小化:即找到使得残差平方和最小的参数近似值。,线性回归模型参数的最小二乘估计的特点是根据随机变量理论值和实际值的拟合程度估计参数的。线性回归模型的理论值可以用样本回归直线上的点的坐标表示,实际值就是样本观测数据,因此
11、线性回归模型理论值与实际值的拟合,就是样本回归直线对观测数据的拟合。,27,最小二乘法,若两变量线性回归模型为 Y = + X + 参数估计就是找到很好拟合样本数据的样本回归直线,问题是怎样算是很好的拟合样本数据呢?就必须先确定评判拟合程度的标准。 判断拟合程度最基本的标准是样本点与回归直线的偏差,其中i=1,n. 回归残差越小,回归直线离样本点越近,如果所有样本点的回归残差都较小,回归直线对样本点的拟合就最好。,28,最小二乘法,由于各样本点残差的算术和 存在正负抵消因而不能客观评价残差总体水平,而绝对值之和 又不方便分析,因此一般采用残差平方和作为评判回归直线对样本数据的拟合标准。 残差平
12、方和越小,就认为拟合程度越好。,29,参数的普通最小二乘估计(OLS),给定一组样本观测值(Xi, Yi)(i=1,2,n)要求样本回归函数尽可能好地拟合这组值. 普通最小二乘法(Ordinary least squares, OLS)给出的判断标准是:二者之差的平方和,最小。,30,31,消费函数参数估计相关指标计算表,32,因此,由该样本估计的回归方程为:,33,用Eviews软件回归的结果 Dependent Variable: Y Method: Least Squares Date: 02/24/08 Time: 19:48 Sample: 1981 2002 Included ob
13、servations: 22 Variable Coefficient Std. Errort-StatisticProb. X 0.751089 0.010396 72.244720.0000 C 237.7530 68.35517 3.478200 0.0024 R-squared0.996183 Mean dependent var3975.000 Adjusted R-squared0.995992S.D. dependent var3310.257 S.E. of regression 209.5727Akaike info criterion13.61453 Sum squared
14、 resid878414.7Schwarz criterion13.71371 Log likelihood -147.7598F-statistic 5219.299 Durbin-Watson stat1.287765Prob(F-statistic)0.000000,34,第三节:最小二乘估计量的性质,当模型参数估计出后,需考虑参数估计值的精度,即是否能代表总体参数的真值,或者说需考察参数估计量的统计性质。,一个用于考察总体的估计量,可从如下几个方面考察其优劣性: (1)线性性,即它是否是另一随机变量的线性函数; (2)无偏性,即它的均值或期望值是否等于总体的真实值; (3)有效性,即它
15、是否在所有线性无偏估计量中具有最小方差。 (4)一致性,即当样本容量不断增大时,最小二乘估量是以真实值为极限的一致估计。,35,线性性:,参数估计量可以表示为被解释变量观测值的线性组合。 意义:参数估计量与被解释变量服从相同名称的分布,与误差项服从相同的分布。 证明只要把参数估计量表达式作适当的变形即可。 两个线性组合表达式对于其他性质的分析等还有作用。,36,高斯马尔可夫定理(Gauss-Markov theorem) 在给定经典线性回归的假定下,最小二乘估计量是具有最小方差的线性无偏估计量。,线性性:即最小二乘估计量a和b可以表示为Y的观测值的线性组合。,37,38,39,无偏性:即最小二
16、乘估计量a和b的期望为参数真实值,40,41,最小方差性(有效性):,42,43,44,一致估计:,定义:参数估计量的概率极限等于参数真实值。 意义:属于大样本性质。保证增加样本容量可以逼近参数真实值。 最小二乘估计在模型假设下是一致估计。 证明利用参数估计的方差极限为0和切比雪夫不等式。 概率极限定义。,45,第四节 回归拟合度评价和决定系数,一、拟合度评价的意义 二、离差分解和决定系数,46,一、拟合度评价的意义,拟合度指回归直线与样本数据趋势的吻合程度。 虽然OLS有好的性质,即它是BLUE估计和一致估计,这些性质保证OLS是两变量线性回归参数比较理想的估计,但这些性质只能说明参数估计量
17、的相对优劣,而不能说明它的绝对优劣。因此它并不保证具体模型的参数估计结果理想。因为模型假设不一定真正成立,模型设定可能存在错误,而且数据等情况也有差异,所以并不能保证以最小二乘估计为核心的回归分析的可靠性和价值。,47,拟合度评价的意义,拟合度取决于(1)回归直线的选择;(2)样本数据的分布。 数据分布取决于(1)变量关系;(2)扰动因素。 拟合度是判断模型变量关系真实性、模型假设是否成立的重要指标。拟合度较好是对模型的支持,否则意味着必须对模型进行修改。 拟合度的评价标准:残差平方和的问题受样本容量影响,同时还受样本数值本身的影响,没有横向可比性也就不能建立拟合度好坏的临界标准。 应建立新的
18、指标。,48,二、离差分解和决定系数,离差决定的程度作为拟合度判断标准Y的离差 被回归值 或解释变量X决定的程度。 离差分解:根据模型的基本假定,Y与X之间的线性关系是主要关系,X是以线性方式决定Y的最主要因素,那么Y的离差应该主要被回归值的离差或X的离差决定,因此可以在回归分析的基础上,用Y的离差被回归值或X的离差决定的程度作为评价拟合度的标准。,49,决定系数,决定系数 决定系数与残差平方和既有区别,又有联系。 例消费模型的决定系数。 一般计量软件都直接输出,50,1、总离差平方和的分解,已知由一组样本观测值(Xi, Yi),i=1,2,n得到如下样本回归直线,51,如果Yi=i 即实际观
19、测值落在样本回归“线”上,则拟合最好。 可认为,“离差”全部来自回归线,而与“残差”无关。,52,对于所有样本点,则需考虑这些点与样本均值离差的平方和,可以证明:,记,总体平方和(Total Sum of Squares),回归平方和(Explained Sum of Squares),残差平方和(Residual Sum of Squares ),53,TSS=ESS+RSS,Y的观测值围绕其均值的总离差(total variation)可分解为两部分:一部分来自回归线(ESS),另一部分则来自随机势力(RSS)。,在给定样本中,TSS不变, 如果实际观测点离样本回归线越近,则ESS在TSS
20、中占的比重越大,因此 拟合优度:回归平方和ESS/Y的总离差TSS,54,2、可决系数R2统计量,称 R2 为(样本)可决系数/判定系数(coefficient of determination)。,可决系数的取值范围:0,1 R2越接近1,说明实际观测点离样本线越近,拟合优度越高。,55,例3-4 用上面公式可以求出R2 0.994,也可直接在Eviews读出。,56,运用可决系数时应注意:,可决系数只是说明列入模型中的所有解释变量对应变量的联合的影响程度,不说明模型中每个解释变量的影响程度(在多元中) 回归的主要目的如果是经济结构分析,不能只追求高的可决系数,而且要得到总体回归系数可信的估
21、计量。可决系数高并不一定每个回归系数都可信任。 如果建模目的只是为了预测应变量值,不是为了正确的估计回归系数,一般可考虑有较高的可决系数的模型。,57,第五节 统计推断,统计推断:进一步检验模型,检验模型适用范围,检验参数,检验变量关系等。 一、最小二乘估计量的分布性质和标准化 二、误差方差的估计 三、参数的置信区间和假设检验,58,一、最小二乘估计量的分布性质和标准化,统计推断和假设检验的基础参数估计量的统计分布性质和特征。 根据对最小二乘估计量性质的分析,已知最小二乘估计量LSE服从以参数真实值为中心,以误差项方差的一个比例为方差的正态分布。 要利用参数估计量的分布性质进行统计检验、推断,
22、必须先标准化为正态分布。,59,变量的显著性检验,回归分析是要判断解释变量X是否是被解释变量Y的一个显著性的影响因素。 在一元线性模型中,就是要判断X是否对Y具有显著的线性性影响。这就需要进行变量的显著性检验。,变量的显著性检验所应用的方法是数理统计学中的假设检验。 计量经计学中,主要是针对变量的参数真值是否为零来进行显著性检验的。,60,假设检验,所谓假设检验,就是事先对总体参数或总体分布形式作出一个假设,然后利用样本信息来判断原假设是否合理,即判断样本信息与原假设是否有显著差异,从而决定是否接受或否定原假设。 假设检验采用的逻辑推理方法是反证法。 先假定原假设正确,然后根据样本信息,观察由
23、此假设而导致的结果是否合理,从而判断是否接受原假设。 判断结果合理与否,是基于“小概率事件不易发生”这一原理的,61,变量的显著性检验,对于两变量线性回归方程中的b,已经知道它服从正态分布,由于真实的 未知,在用它的无偏估计量 替代时,可构造如下统计量,62,二、误差方差的估计,1、标准状态分布中包含未知参数 必须先估计出来。 2、 本身也是线性回归模型的重要组成部分,是反映随机项性质、情况的重要隐含参数。 3、因为 详见P91证明。 因此 是 的无偏估计。 4、 称“残差的标准差”。 上海消费函数例。,63,5、用 代 ,得到的统计量服从t分布,而不是正态分布。 6、两个t统计量是统计推断检
24、验的基础。,64,三、参数的置信区间和假设检验,假设检验的逻辑基础:如果一个随机变量服从一个特定分布(包括种类、均值、方差等特征),那么其取值范围,取各种范围中值的机会(概率)是一定的。因此可以根据其实际值是否出现在通常(95%、99%概率等)会出现的范围内,而判断该值及相关变量、参数水平是否合理。 最小二乘估计的统计推断也是这个原理。可检验:置信区间(区间估计),参数特定值的假设检验。,65,构造参数的置信区间的重要性,因为参数估计量值是参数真实值的近似,不仅与参数真实值有偏差,而且本身不能说明偏差的大小,使用时必然会不放心。置信区间限定了参数估计量与参数真实值的偏差程度,使我们对变量关系的
25、了解更加深入和明确,对经济规律的可靠程度和适用情况更有把握。 区间估计常常比点估计更加重要,66,假设检验可以通过一次抽样的结果检验总体参数可能的假设值的范围(如是否为零),但它并没有指出在一次抽样中样本参数值到底离总体参数的真值有多“近”。 要判断样本参数的估计值在多大程度上可以“近似”地替代总体参数的真值,往往需要通过构造一个以样本参数的估计值为中心的“区间”,来考察它以多大的可能性(概率)包含着真实的参数值。这种方法就是参数检验的置信区间估计。,参数的置信区间,67,如果存在这样一个区间,称之为置信区间(confidence interval); 1-称为置信系数(置信度)(confid
26、ence coefficient), 称为显著性水平(level of significance);置信区间的端点称为置信限(confidence limit)或临界值(critical values)。,68,一元线性模型中, 和 的置信区间:,在变量的显著性检验中已经知道:,意味着,如果给定置信度(1-),从分布表中查得自由度为(n-2)的临界值,那么t值处在(-t/2, t/2)的概率是(1- )。表示为:,即,69,于是得到:(1-)的置信度下, 的置信区间是,在上述收入-消费支出例中,如果给定 =0.05,查表得:,由于,于是, 的置信区间分别为: (0.7283,0.7717),7
27、0,由于置信区间一定程度地给出了样本参数估计值与总体参数真值的“接近”程度,因此置信区间越小越好。,要缩小置信区间,需 (1)增大样本容量n,因为在同样的置信水平下,n越大,t分布表中的临界值越小;同时,增大样本容量,还可使样本参数估计量的标准差减小; (2)提高模型的拟合优度,因为样本参数估计量的标准差与残差平方和呈正比,模型拟合优度越高,残差平方和应越小。,71,假设检验检验步骤:,(1)对总体参数提出假设 原假设H0: =0, 备择假设 H1:0,(2)以原假设H0构造t统计量,并由样本计算其值,(3)给定显著性水平,查t分布表,得临界值t /2(n-2),(4) 比较,判断 若 |t| t /2(n-2),则拒绝H0 ,接受H1 ; 若 |t| t /2(n-2),则拒绝H1 ,接受H0 ;,72,对于两变量线性回归方程中的 ,可构造如下t统计量进行显著性检验:,在上述收入-消费支出例中,已经分别得知,73,t统计量的计算结果分别为
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 八年级道德与法治粤教版寒假第二单元同步测试卷基础版A卷
- 财务管理培训师职业发展
- 惠安消防安全检测服务报价
- ISO 9001-2026《质量管理体系-要求》之“8运行”条款审核不符合项清单(雷泽佳编制-2026A0)
- 2026届温州市鹿城区六年级语文小分班卷
- 从佛得角奇迹看成长的力量
- 2026年下教资笔试教育知识与能力易错题本(带解析)
- 2026年下半年中小学教师资格笔试学科知识真题模拟卷(含解析)
- 单招艺术考试题及答案
- 建筑设备采购清单核对申请函(4篇)
- 成都市金牛区卫生健康局所属事业单位2026年招募医务社会工作服务岗位(5人)笔试备考题库及答案详解
- 无粘结预应力钢绞线施工方案及工艺方法
- 【世界经济论坛】塑造学习的未来:人工智能时代的教育准备
- 2026年高考(浙江卷)历史试题及答案
- 电商运营流程与管理制度
- 痰湿体质的中医护理
- 2023-2024学年北京市海淀区九年级(上)期末数学试卷(含解析)
- 《反应器操作与控制》教学课件-04流化床反应器操作与控制
- DIY甜品创业计划书
- 心内科导管室进修汇报
- 微结构眼镜镜片 微透镜阵列镜片
评论
0/150
提交评论