【精品】相关与回归分析_第1页
【精品】相关与回归分析_第2页
【精品】相关与回归分析_第3页
【精品】相关与回归分析_第4页
【精品】相关与回归分析_第5页
已阅读5页,还剩29页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

1、第九章相关与回归分析通过本章的学习,找们应该知道:1如何判别相关关系 2.回归分析的基本假定3. 元线性回归分析的内容4. 如何做多元线性回归分桥5. 如何将非线性回归模型转换成线性模型相关与回归分析是现代统计学屮非常重要的内容,它在自然科学、管理科学和社会经济领域有着十分 广泛的应川。木章从介绍相关分析与回归分析的皋木概念与分类入手,以一元线性回归模型为基础,引出 包插多元线性冋归分析及非线性冋归分析中模型识别、参数估计、模型检验与预测等内容。在分析变量之间关系的时,常川的基木模型有两个,一是相关模型(correlation model), 一是回归模型 (regression model)

2、o实践屮到底使川哪种模型取决于研究者的研究丨i的和数据的收集方式和条件。在相关 分析中,变量x和丫都被视为随机变量,(x,y)服从二元分布;而冋归分析中,变量x不是随机变量, 它被假定为-般变量,在事先选好的已知值中取值,变量y是随机变量,在变量兀的给定取值处有相应的 观测值。例如,考虑太阳镜的日销售数量丫与日最高气温x之间的关系问题。如果我们随机地选择36天, 记录下这36天的太阳镜销售量和日最高气温21,36,它们是来自二维总体(随机变量)(x,y) 的独立同分布样木;在这种情况下,应用相关模型进行分析。另一情况是,假如研究者决定只在日最高气 温兀=25、30、33、35、36、37、38

3、、39、40°c的那些天收集数据,在h最高气温为上述事先设定的温度 的那些天中随机地抽取36天,然后测量记录下相应的太阳镜h销售量,如在每一个h最高气温取值处, 随机抽取4天进行测量记录;此时变量兀就不再是随机变量,变量丫是随机变量,往往应用回归模型进行 分析。有时这种区别并不是这么明显。第一节相关分析一、相关关系的概念及分类(一)相关关系的概念无论是在口然界还是社会经济领域,一种现象少另一种现象z间往往存在着依存关系,当我们川变量 来反映这些现象的特征时,便表现为变量之间的依存关系。如某种商品的销售额(y)与销售量(x)之间 的关系、商品销售额(y)与广告费支出(x)z间的关系以及

4、粮食亩产量(y)与遍月匮(坷)、降瞳(勺)、 温度(勺)之间的关系等。统计学的主要研究对象是随机变量,在多个变量的时候,至少佇一个变量是随 机变量,因此我们对变量z间关系的分析是随机变量z间的关系或随机变量与确定变量z间的关系。变量z间的依存关系可以分为两种:一是函数关系,指变量之间保持的严格的、确定的关系。如圆的 面积(s)与半径z间的关系可表示为s = nr2 ,当圆的半径r的值取定后,其圆的面积也随z确定。二是 相关关系,指变量z间保持着不确定的依存关系。即变量间关系不能用函数关系精确表达,一个变量的取 值不能由另一个变量唯一确定,当变量x取某个值吋,变量y的取值可能有儿个或无穷多个。例

5、如人的身 高与体重这两个变量,一般而言是相互依存的,但它们并不表现为确定的函数的关系。因为制约这两个变 量的还有其他因素,如遗传因素、营养状况和运动水平等,以至于同一身高的人可以有不同的体重,同一 体虫的人又表现出不同身高。变量间的这种不严格的依存关系就构成了相关与回归分析的对彖。(二)相关关系的分类1.按相关的程度可分为完全相关、不完全相关和不相关当一个变量的变化完全山另一个变量所决定时,称变量间的这种关系为为完全相关关系,这种严格的依存关系实际上就是函数关系。当两个变量的变化相互独立、互不影响时,称这两个变量不相关(与下面 的不线性相关或线性无关不同),实际上,这电的不相关就是(概率屮的)

6、独立,即变量间没有任何关系。当 变量之间存在不严格的依存关系时,称为不完全相关。不完全相关关系是现实当中相关关系的主要表现形 式,也是相关分析的主要研究对象。2.按相关的方向可分为正相关和负相关当一个变量随着另一个变量的增加(减少)而增加(减少),即两者同向变化时,称为正相关,例如 家庭收入与家庭支出之间的关系,-般随着家庭收入的增加,家庭支出也会随之增加。当一个变量随着另 个变量的增加(减少)而减少(增加),即两者反向变化时,称为负相关,如产殆产量与单位成本之间 的关系,单位成本会随着产量的增加而减少。3按相关的形式可分为线性相关和非线性相关当变量z间的依存关系大致呈现为线性形式,即当一个变

7、量变动一个单位时,另一个变量也按一个大 致固定的增(减)量变动,就称为线性相关。当变量间的关系不按固定比例变化时,就称之为非线性相关。上述的这些相关关系我们可以用图9来示意。图9.1相关关系分类示意图4.按研究变量的多少可分为单相关、偏相关和复相关两个变量z间的相关,称为单相关。一个变量m两个或两个以上其他变量之间的相关,称为复相关。 在复相关的研究中,假定其他变量不变,专门研究其中两个变最之间的相关关系时称其为偏相关。变量z间的相关关系需要用相关分析方法来识别和判断。相关分析,就是借助于图形和若t分析指标 (如相关系数)对变暈之间的依存关系的密切程度进行测定的过程。二、相关关系的识别(一)散

8、点图识别变量间相关关系最简单的方法是图形法。所谓图形法,就是将所研究变量的观察值以散点的形式 绘制在相应的坐标系屮,通过它们呈现出的特征,来判断变量之间是否存在相关关系,以及相关的形式、 相关的方向和相关的程度等。【例9.1在研究我国人均消费水平的问题时,把全国人均消费记为y,把人均国内牛产总值(人均gdp)记为x。根据数据集01摘录样本数据(£,”),心1,2,9,如农9.1所示,问两者之间存在什么样 的相关关系。表9. 1我国人均国内生产总值与人均消费金额数据单位:元年份人均国内生产总值人均消费金额19954854223619965576264119976054283419986

9、3082972199965513138200070863397200176513609200282143818200391014089【解】根据表9.1,画出(兀1=1, 2, n的散点图,见图9. 2。人均消螯人均gdp与人均消费的数点图图9. 2反映相关关系的散点图从上图中我们看到本例的样本数据(x, >.)大致分别落在一条直线附近,这说明变量x与y之间具 有明显的线性相关关系。另外,所绘制的散点图呈现出从左至右的上升趋势,它表明xljyz间存在着一 定的正相关关系,即随着人均gdp的上升,人均消费金额也会增加。图形法虽然有助于识别变量间的相关关系,但它无法对这种关系进行粕确的计量。

10、因此在初步判定变 量间存在相关关系的基础上,通常还要计算相关关系的度量指标。下面我们缩小研究的范围,仅仅研究两 个变量间的线性相关关系。两个变量间线性相关关系的度量指标有很多,应用最广泛的是相关系数。(二)相关系数相关系数是度量两个变量(现象)间线性关系强度的数量指标。我们先从直观上了解两个变量z间的相 关系数q的基本思想,然后给出相关系数的一般的、正式的定义,再考虑在不知道总体梢确分布的情况下, 如何rtl样本估计相关系数q,最后给出相关系数是否等于0的检验方法。1. 直线相关系数的设计思想为了从直观上了解相关系数的设计思想,我们考虑二元离散总体比较简单的一种情形。设二元离散总 体(x,y)

11、只有n对可能的取值(兀,开),i = ,,n ,且p(x =坷,y =)j = 1/n,由此可以计算岀随 机变量x和y均值分别为e(x) = “x和(丫)= ar,方差分别为var(x) = 和var(y) = b;。通过 点(“x,画两条平行于x轴和y轴的直线,将散点图分成四个部分,见图9. 3。hi :(x-x)(r-'f)=+ ivk图9. 3(“x,旳)分割散点图分布在i、iii部分的点有(%, - “x )3 -角)0,分布在ii、iv部分的点满足(兀一冷)3 -旳)v 0 , 如果使得(兀-“x)()'厂旳)为较大正值的点(")占有了总体分布的大部分概率,

12、则有 n工(兀-“x)(升-"j/n大丁-0,且取值较大,这时全部可能的取值点中,大多数都分布在i、iii部分,1=1所以x和y是正相关;如果使得a“x)(x -m)为较大负值的点(兀,必)占有了总体分布的大部分概率, n则有工(兀-“x)(%-/)/n小于0, 口其绝对值较大,这时全部可能的取值点中,大多数都分布在ii、/=1iv部分,所以x和y是负相关;如果使得a-“x)(”-“)为较大正值的点和较大负值的点占有的总体 n分布的概率人致相等,则有工(兀_冷)(必-m)/n很小或近似为0,这时点不规则地(有时是均匀地)1=1散布在四个部分,所以x与y不相关。因此£(兀厂冷

13、)( -旳)/n可用来衡量x与y的相关方向与程1=1n度,值人表示变量间关系密切,值小表示变量间关系不密切。但工a -“x)(x-“j/n的值与x、y的i=l计量单位及x、y h身的变异程度都有关,为了使不同总体的相关系数可以互相对比,将n工(兀-x)(x 除以x与y的标准差bx、以消除变量值大小和离差值大小不等的影响。这样得 /=到,n工(“ 一“x)(x-“y)/n在上述二元总体分布的假定下,工(兀- “x)(x“j/n正是x和¥的协方差c“(x,y)。/=12. 相关系数与pearson相关系数受到上述设计思想的启发,将共一般化为一般二维随机变量(包括离散型和连续型)。设二维随

14、机变量 (x,y)有二元分布,它可以视为总体;如果变量x和卩的方差var(x)和v"(y)都大于0,贝ucmx,y)g,y)(9.dy/var(x)var(y)称为变量x和丫的相关系数或总体相关系数,常常简记为q或qxy,艸 cov(x,y) = e(x -ex)(y -ey) 为变量x和y的协方差。可以证明:(1) 1°151; (2) p= 1的充分必要条件是存在常数g利0(工0)使 得y =a + px以概率1成立。上述性质说明:(1)相关系数°的取值范围是从1到1; p的人小揭示了变量x和丫间线性相关关系的强弱,变 量间的线性相关关系程度随着1°

15、丨的减小而减弱,p = ±时,变量x和y之间具有完全线性关系 y=a + /3x ,反之亦成立;p = 0说明变量x和丫之间没令线性相关关系,称为不线性相关或线性无关。(2)p的符号说明变量间的线性相关关系的方向,。大于0, x和丫正线性相关,°小于0, x和 y负线性相关。(3)相关系数是说明线性联系程度的,相关系数很小的变量间可能存在非线性联系,如图9.1的第三 幅图的变量间相关系数的绝对值是很小的。(4)需耍注意的是,变量x和y不线性相关与x和y独立是两个不同的概念。如果x和y独立, 则必有x和y不线性相关;但是若x和y不线性相关,却不一定有x和y独立,它们z间可能存

16、在着 非线性相关关系。然而,若(xv)服从二元正态分布,x和丫不线性相关和独立是等价的。如果二维随机变量(x")的概率分布完全知道,则变量x和y的相关系数。可以由(9.1)式计算出 來,这只是理想的情况,实际问题中,我们往往不知道要研究变量(x,y)的概率分布,有时至多知道它们 的分布类型,如仅知道服从二元正态分布,但分布中的参数却不清楚(如果(x, y)的概率分布完全知道了 , 它们间的关系自然很清楚了,就不需要做什么相关分析了!魏),这时将无法利用(9.1)式计算出相关系 数°。此时要得到变量x和y的相关系数q ,可以从总体(x,y)中随机地抽取容量为n的样本 (x諾)

17、,,(乙,匕),它们独立、同分布,和总体(x,f)的分布相同,如何由该样本估计总体变量x和y的相关系数。呢?变量x和y间的相关系数q,可以由样木通过£(x厂片口-歹)/= 1=1进行估计。(9.2)式中的统计量r是随机变量(注:相关系数°只是一个常数,不是随机变量),它是。的致估计量(相合估计量)和渐进无偏估计量,称为样本相关系数。山于(9.2)式中的统计量r是山英国统计学家皮尔逊(pearson)提出的,所以也常称为pearson相关系数。(9.2)式可以化为以下形式送x必(9.3)/ = !/ = !r=l逹x; (£x$ 卜£* 一(立yj )2i

18、=li=lv i=li=l(9.3)式在计算时较为简单,经常用于实际计算。该公式看上去复杂,但山于没有了 “积差”,计算要简 便得多,另外该公式也便于用计算器上的统计功能计算。把样本的观测值 (州),(£,儿)代入(9.3)式即得相关系数。的估计值工石兀一工兀工兀/=! /=1 /=1f = li=l(9.4)样本相关系数是根据样本观察值计算的,随着取样的不同,相关系数的值也会有所变化。【例9.2】根据例9.1的资料,计算人均消费与人均国内生产总值的ft线相关系数。【解】利用excel表计算出公式(9.4)中所需要的有关数据,见图94再带入公式计算:abcdef1年份人均国内生产总值

19、人均消费金额*b2xy31995485422362356131649996961085354441996557626413109177669748811472621651997605428343665091680315561715703661998630829723979086488327841874737671999655131384291560198470442055703882000708633975021139611539609240711429200176513609585378011302488127612459i 102002821438186746979614577124313

20、610521120039101408982828201167199213721398912合计613952873443305766794547496202299852图9.4相关系数的计算表心工宀(工$心工八(of=0.99389 x 202299852 - 61395 x 2873479 x 433057667 - 613952 9 x 94547496 - 287342学牛:哦,相关系数好大,这说明人均消费额与人均国内牛产总值高度相关吧。教师:现在可不能这样说!至于原因嘛,且看下面分解。3. 相关系数的检验例9.2计算的pearson相关系数r = 0.9938相对于0来说已经相当大了,是

21、否说明人均消费与人均国 内生产总值之间线性和关呢?仅仅看这个数值是不能确定二者之间的线性相关关系的。不要忘了这个数值 仅仅是基于9个样本点计算出來的,它要受到抽样误差的影响。为了说明抽样误差対pearson相关系数的 影响,请考虑图9.5所给出的二元总体(图中给出了总体的全部取值),实际上这两个变量z间没有线性相 关关系,总体相关系数p=0o假如现在从总体中抽取了一个随机样本,在图中用圆圈标出,这个样本显 示所考虑的两个变量之间有很强的线性关系,根据这个样木观测值计算pearson相关系数为r = 0.98o在 这种情况f,样本相关系数的值很人,但是两个总体变量却是独立的。因此总体的相关系数需

22、要经过正式 的假设检验,才能做出比鮫对靠、科学的判断和结论。在实际应用中,一般都是根据样本数据计算pearson 相关系数,然后在对总体相关系数进行检验。cm+ .4+1 1+ 3+ ©+十+ + +丄®+ +©+ ,+© +主©+ + +©4-®+ + + + + +卄+ + +4-f+ +1 + + +34567图9.5从二元总体屮抽取的一个随机样木假定总体变量(x,y)服从二元正态分布n(“x,角qxqy,/?), (x】,yj,(x”,;)是来自该总体的一个随机样木。要检验的假设为hq:p = q;(备择假设或者为h

23、 :p>0, /71:p<0)o则检验统计暈为(9.5)- 2j1 f这里r为(9.2)或(9.3)式中的统计量,可以证明在原假设成立的条件下,(9.5)式的统计量t服从白由度为 n-2的t分布。计算检验的t统计量/ =然后,根据给定的显著性水平&利自山度n-2,杏t分 布表中的相应临界值/2,若rn/2,就拒绝原假设,接受备择假设,认为总体相关系数。显著不为零, 总体变屋间确实存在线性相关关系;反之,则不能拒绝原假设。或者计算p值put> z),如果p值小 于显著性水平则拒绝原假设。若备择假设为h:p> 0,则当t>ta时,拒绝原假设,接受备择假设, 否

24、则不能拒绝原假设;若备择假设为h:p< 0,则当t<-tg时,拒绝原假设,接受备择假设,否则不能 拒绝原假设。【例9.3】根据上例结果,检验在a =0.05的显著性水平下,人均消费额与人均国内生产总值是否具有 线性相关关系。【解】若取显著性水平q = 0.05,查表得到临界值得:心2(9-2) = 2.3646,检验统计暈的值为:0 9938心=23.65v1-0.99382由于|>乙/2,所以否定原假设,接受备择假设,表明总体相关系数不为零,即人均国内生产总值与 人均销售金额之间确实存在着线性相关关系。自己试着检验:人均消费额与人均国内生产总值是否具冇正 线性相关关系。由(

25、9.2)或(9.3)式可知,统计量r是随机变量,它有自己的分布,但是/?的分布与总体(x,y)的二元 分布有关。另外,由(9.5)式可知,/?是t的函数,i大1此可以从t分布的分布密度推导出统计最/?的分布密 度和分布函数,这里不再给出/?的分布密度表达式。本书附表九相关系数临界值表实际上就是统计量/?分 布的临界值表。总体相关系数检验更简单的方法是,先计算pearson样本相关系数厂,然后再查相关系数 临界值表,查表时,要根据备择假设的情况和n-2与查出相应的临界值。 对备择假设0 “h0,若|r|>;z/2(h-2),则拒绝原假设,接受备择假设,否则不能拒绝原假设;(2)对备择假设h

26、p>0,若r>ra(n-2),则拒绝原假设,接受备择假设,否则不能拒绝原假设; 对备择假设w,:/7<0,若r <-,;(/!-2),则拒绝原假设,接受备择假设,否则不能拒绝原假设。对于例 9.3, n = 9,0 = 0.05;因为是双边检验,査得 a;/2(n - 2) = 025(7) = 0.666,& lrl=0.9938>0.666,故人均国内牛产总值与人均销售金额z间确实存在着线性相关关系。教师:从相关系数检验表中我们可以看出,在a为0.05的水平下,当样本容量为3时,即使 相关系数是0.996,也不能认为总体的两个变量是相关的。而当样本容量

27、为47时,即使相关 系数为0.288,也可以认为总体的两个变量之间是相关的。一切都是相对的哦。最后要给大家说明的是,线性相关关系与因果关系是不同的。相关系数很大未必表示变量间存在因果 关系,也町能两个变量同时受第三个变量的影响而使它们有很强的相关。比如,人的肺活量与人的身高会 呈现高度相关,其实肺活量和身高都受人的体重的影响,因此如果固定人的体重来研究肺活量与身高的关 系,则会发现相关性很低。这涉及偏相关系数的计算。乂如,我们计算1980-2004年期间某地猪肉销售量 与感冒片销售量的相关系数,它可能很大,但这并不说明猪肉销售量与感冒片销售量z间有线性相关关系, 因为它们都受这个时期人口增长因

28、素的影响,把两个从逻辑上不存在联系的两个变量放在一起做相关分 析,没有意义,在统计上称z为“虚假相关”。第二节一元线性回归分析一元线性回归(linear regression)是描述两个变量z间相互联系的最简单的回归模型(regression model)o 一元线性回归虽然简单,但通过一元线性回归模型的建立过程,我们可以了解回归分析方法的基 木统计思想以及它在经济问题研究屮的应川原理。木节将详细讨论一元线性回归的建模思想、最小二乘估 计及其性质、回归方程的有关检验、预测和控制的理论及应用。一、一元线性回归在许多问题的研究屮,经常需要研究某一现象为影响它的某一最主要因素z间的关系。警如,在消费

29、 问题的研究屮,影响消费的因索很多,但我们可以只研究国内生产总值与消费额之间的关系,因为它是影 响消费的最主要因素;通常我们对所研究的问题首先要收集与它有关的n组样本数据(兀,兀),i=l,2,.,n。 为了直观地发现样本数据的规律,我们把(£,”)看成是平面直角处标系中的点,画出这n个样本点的 散点图。图9.2就是我国人均国内生产总值与人均消费的散点图,而随后计算出的相关系数为0.9938,经 过检验表明人均消费y与人均国内牛产总值x z间有着密切的相关关系。为迹一步探讨变量y与x z间 的统计规律性,我们川下面的数学模型来描述它。y = % + 0x + £(9.6)(

30、9.6)式将问题屮变量y与x之i'可的关系用两个部分描述。一部分是由于x的变化引起y线性变化 的部分,叩0()+小 另一部分是由其他一切随机因素引起的,记为(9.6)式表达了变量x与yz间 密切相关,但密切程度又没有到由x唯一确定y的这种特殊关系。(9.6)式称为变量y对x的一元线性回 归总体模型。一般我们称y为被解释变量,或因变量(dependent variable); x为解释变量,或口变量(independent variable)。式中0()和0】是未知参数,称它们为冋归系数(regression coefficient)o £表示其他 随机因素的影响。在(9.6)

31、式中一般假定£是不可观测的随机误差,它是一个随机变量,通常假定£服从 期望为零、方差为"2的正态分布。在这个假定下,进一步有丫卜”(0()+0丿,/),它表示在x给定时 随机变量y也服从正态分布,且e(y|x) = 0o + 02 var(y)= o-(9.6)式从平均意义上表达了变量y与x的统计规律性。这一点在应用上非常車要,因为我们经常 关心的正是这个平均值。如上例在消费y与国内生产总值x的研究中,我们所关心的正是当国内生产总值 达到某个水平时,人均消费能达到多少。rh(9.6)式,只要估计出回归系数00和0就可以算出当x已知 吋e(y) = 0()+ 0丿的

32、值。通常e(丫卜)=0° + 0丿(9.7)称为一元线性回归方程,在图形上它表示一条截灰为0()、斜率为肉的立线,这条立线称为一元线性回归 直线。如果x=0,则0()是x=0时y概率分布的均值;0表示x每变动一个单位时y概率分布的均值的变 化,即当x每增加一个单位时,y平均变化a个单位。回归分析的主要任务z就是通过n样本观察值(旺j), i=l,2,.,n,对/j。,"和/进行估计。一般川久,人和肝分别表示/j。,几和/的估计值;称y =+ bx(9.8)为y关于x的一元线性经验回归方程。二、参数0(), a的最小二乘估计为了由样本数据得到回归参数0(),肉的佔计值,我们将

33、使用普通最小二乘估计(ordinary least square estimation,简记为olse)。对每一个样木观察值(无,兀),最小二乘法的基木思想就是希望线性冋归直 线与所有样本数据点都比较靠近,即要观察值(observed value)儿与其期望值e(yx =再)=0° + 0內的差 ),厂e(yx = %,) = % - (0。+ 0內)越小越好(图9.6是这种思想的立观表现),为防止差值正负抵消,于是考 虑这n个差值的平方和达到最小,即(9.9)2(apa)= e(x-a-)2/=1达到最小。所谓最小二乘法,就是求p(),a使得£ bi -(0o+0i 兀)

34、/=!(9.10)£y( -(a)+ 3i)f = min0(0(),0j = min/=!图9. 6 元线性冋归示意图求出(9.10)式中的p。和人是一个求极值点的问题,这只需求(9.9)式的关于0()和a的二元函数q(0(),0j =乞3 -0()-0內)2极小值点。由于q是关于0()和伙的ii顶二次函数,因而它的最小值总是 1=1存在的。根据微积分屮求极值的原理,让q(0(),0j分别对和求偏导,且令这两个偏导等于o得7 = -2yt -(0o + 0內)=01 op。/=i警=- 兀 -(0o+0“ )k = °i。"苗经整理后,得正规方程组:”0() +

35、 (工兀)01=xl(z兀)0o + (工斤)0严工i求解止规方程组,得:a二料工兀兀一为兀工x二工(兀元)(必一刃_吃斤-一 "可唇邑必2 = 了_不(9.h)nn(9.11)式中的po,p称为0o,0i的普通最小二乘估计,简称0(),0i的olse。可以证明,0(),0的最小 二乘估计九,e满足无偏性,即e(p() = 0o,e(b) = 0o我们记弓为实际观察值儿与其估计值 yt = bo + pxi的偏差'称为残差即ei =)';-%工e;称作残差平方和(residual sum of square )omil)式中关于a的表达式和上节(9.4)比较易得 9

36、x 433057667-613952= 0.4414287349-0.4414 x613959= 181.5830冋归系数的最小二乘估计b和总体相关系数的估计pearson相关系数厂具有上述关系式,从而可知b和r 同号,这和我们的直觉也是一致的。事实上,可以证明总体相关系数。和线性回归直线的斜率a具有关 系丑厂=肉,这里就不再推导了。最后我们给出误差项的方差/的无偏估计d2 =工=丑二,其平方根6-也称为估计标准 n-2n-2误差,有时也记作s 展开可得sv, = &几工y-a工小,在计算时有些情况下用它比较3vn-2简单。【例9.4】根据例9.1的资料,建立人均消费与人均国内生产总值

37、的回归方程。【解】利用上述公式就可具体计算回归方程的参数。根据图9.4已经计算好的有关数据,带入公式(91) 得:9 x 202299852-61395x 28734所以,冋归方程为:y = 181.5830 + 0.4414xo三、对一元回归方程的评价/aa获得经验回归方程'=0o+0】兀后,我们不能就用它去作分析和预测,因为$=0。+0“是否真正描 述了y与xz间的统计规律,还需必须通过统计检验。一元线性回归模型的评价分为拟合优度检验和方程 的显著性检验,它是利川统计学屮的抽样理论来检验回归方程的可靠性。(一)一元线性回归模型拟合优度的评价所谓拟合优度(goodness of仇),

38、是指样本观测值聚集在样本回归线周围的紧密程度。判断回归模型 拟合程度好坏的最常用的指标是可决系数/?2, 乂称判定系数,它是建立在对总变差平方和进行分解的皋 础之上的。我们把y的n个观察值之间的差异,川观察值x与其平均值了的偏差平方和來表示,称为总离差平方和 sst (total deviation sum of squares)sst =工(必 - y)2(9.12)z=l将sst分解成如下:n_n_nn_ n_sst 二工® - y)2 =工(x - z + 刃一 y)2 =工(兀 - z-)2 + 2工(x - 刃)(丸-刃 + 工(刃 - ?')2 /=1/=1/=1

39、/=1i=l其中z(z-zfe-?)=o (课后有时间自己证明哦!箜)这样有:i=l2 2 2z(z-y) =z(z-z) +f(913)f=l1=1f=l其中:2工(刃一')称为回归平方和ssr (regression sum of squares),-刃f称为残差平方和sse /=1 /=!(residual sum of squares),这样(9.13)即为:总偏差=回归偏差+剩余偏差,简记为:sst二ssr + sse,若两边同除以sst得:ssrsstsse+sst(9.14)显然,在总的离差平方和中回归平方和所占的比亜越大,则回归效果越好,说明回归真线与样本观察 值拟合得

40、好;如果残差平方和所占的比亜大,则回归宜线为样本观察值拟合得不理想。把回归平方和与总 离差平方和z比定义为可决系数(coefficient of determination), 乂称判定系数,即:(9.15)ss/?二工位-才丽才可决系数是対冋归模型拟合程度的综合度量,可决系数越大,冋归模型拟合程度越高。/j?表示全部偏差中有百分多少的偏差可山x与y的冋归关系來解释。口j决系数/j?具有非负性,取值范围在0到1z间,它是样本的函数,是一个统计量。等价地,1 r竺也可以作为反映冋归直线与样木观察值拟合sst好坏的一个指标,不同于可决系数的是,其值小,说明冋归方程的偏离度小,即冋归方程的代表性好。

41、(二)一元线性回归方程的显著性检验对线性回归模型的显著性检验包括两个方甸的内容:一是对整个回归方程的显著性检验(f检验),另一个是对各回归系数的显苦性检验(t检验)。就一元线性回归模型而言,上述两个检验是等价的。1.整个回归方程的显著性检验的步骤:(1)提出假设:ho : /?. = 0 ;卩不全为0;(2)这里的f检验其实就是方养分析的内容,见表9.2;表9.2 元线性回归方程的方差分析表方差来源平方和自由度均方f值冋归ssr1msr = ssr1误差ssen-2人心ssemse =n-2厂 msrf =(9.16)mse总计sstn-1(3) 给定显箸性水平a ,确定临界值化(1曲-2);

42、(4) 若f>f;(l,n-2),则拒绝h(),说明总体回归系数0严0,即回归方程是显著的。2.回归系数的显著性检验的步骤:(1) 提出假设:=0; 7:0严0;a(2) t检验的计算公式为:f =如,其中&是冋归系数估计量久的标准差sis =qvar(bj = . -y =(9.17)q工(x-兀亍(3) 给定显著性水平a ,确定临界值ta/2(n -2);(4) 若t >ta/2(n-2)f则拒绝h(),接受备择假设,即总体回归系数a h0;否则不能拒绝教师:就一元线性冋归方程而言,这两种检验是等价的,细心的你一定发现两种检验的原假 设都是一样的。哦?【例9.5】根据例

43、9的资料,计算可决系数、估计标准误差,并对回归方程进行检验(a =0.05)。aa【解】首先将每个x代入回归方程y = 181.5830 +0.4414%,得到一个y序列,再根据公式(9.15)、(9.16)、(9.17)和svx=a的公式,将有关数据带入计算,我们可以用excel辅助计算,见图9.7。abcdefg_ h ji1 j 1年份人均国内护总1s人斓鮭额/°a(r?(y-y)2(rd(w2xy 一y31995485422364999696108535442324.151104754319.283915211.11117770.617093871712. 111419965

44、57626416974881147262162642.837316302312.3152304336. 11113 375729071551685.4441997605428348031556171570362853.823478114814.7064128641.7778392.970289589312. 1111.61998<308 j29728832784_18747376 二2965.93746451406.1312748693.7777836.7543409263853.444471999655131389847044205570383073.1961214273.211532

45、988.4444444199.5428773260.44444820007086339711539609二24071142二3309.3417213613.0681341752. 11h17683.9740169872. 11111习200176513609_13024881_27612459zj3558.72913134001.727173333.44442527. 16038687793.77781020028214381814577124313610523807.233752377692.7027391041.7778115.912091938592. 11!11200391014089

46、16719921372139894198.7499161012203.504803413.444412045.0445195360.44412合计6139528734二94547496.00202299852.0028734.002774636.652809412.0034775. 3514241442.0013均個6821.66673192.6667图9. 7计算检验冋归方程统计量的辅助表可决系数:r2ssr2774636.652809412.00=0.9876估计标准误差:s;宅尹二同孚l厢聞= 70.4833或:工b -0()工y-0i丈兀yn - 2(94547496 - 181.58

47、30 x 28734 - 0.4414 x 2022998文v92j34735.40=70.44v学牛:这里的可决系数与第一节的直线相关系数有关系吗?用两种方法计算的w还是有点差别的,什么原因?教师:可决系数在数量上确实就是直线相关系数r的平方,算出了 r,就只要平方一下,就 可以得到可决系数了。我们推导计算公式主要是为了方便手工计算。两种方法计算的心戸有 差别是由于在手工的计算过程中我们是保留一定量的小数的,所以最终会有微小差别。如果 用计算机來算就没这个问题了。©下面进行检验:几 _ 0.44140.0187= 23.63a =0.05,2) = 5.025= 2.365,因为t

48、 = 23.63 >/a/2,所以拒绝原假设接受备择假设,即总体回归系数01工0。或者做f检验:msr=ssr=(y,. - y) =2774636.65 ;/=1mse =34775.359-2= 4967.9071f _msr mse2774636.654967.9071= 558.5122a =0.05,(1, n - 2) = f005 (1,7) = 559;因为 f=55&5122> 你(1/一2),所以拒绝原假设说明总图9.8 “回归”分析工具对话框体冋归系数肉工0。exce 1解决方案 将数据输入工作表中,见图9. 7 选择菜单“工具”-“数据分析”,打开“

49、数据分析”对话框。 选择其中的“回归”,打开对话框,见图9. 8 正确填写相关信息厉,点“确定”,结果在h1到n18这个区域内显示,见图9.9hijklmnisummary output23回归统计4multiple r0.993791648相关系数j5r square0.98762184可决系数6adjusted r square0.9858535327标准误差70.48338284估计标准误差8观测值9910方差分析11dfssmssignificance r2 3 41x 1x 1x归差辻1 2774636.649 2774636.649 558.51216746.17064e-08片

50、34775.350创也6工£07256828094121516coefficients标准l天差t statpvaluelower 95% upoer 95%17 intercept181.626349129.55714481.4019014490.203696268-124.7273983487.980096418 x0.4413936450.01867711323.632862026.17064e-080.3972293220.485557969图9.9 “回归”分析结果截图四、一元回归方程的预测区间建立回归模型的目的就是为了能够川它进行预测,经过检验的回归方程可以川以区间估计,

51、所谓回归 分析的预测区间(prediction intervbl)是指对于给定的x值,求出y的平均值的置信区间或y的一个个别值 的预测区间,如图9.10所示。图9.10冋归分析的区间估计当口变量给定要预测因变量时,先将x = x0代入公式(9.8),得 九。九是对应于兀°的点估计值,但 我们往往更希與能给出因变量的一个预测值范囤。1y的平均值£(y0)的置信区间估计残差为 =九一左(儿),&服从正态分布。心的期望是:e°) = ey0-e(y0) = (0。+ 0血)一(0。+ 0血)=0的方差是:var(<50) = ey0-e(y0)2=<

52、r2 丄 +n(兀0 兀)2-兀)2/=!这部分的公式推导比较复杂,可以参阅计量经济学教材。用叱替代/ ,则心的标准差是:b(心)=耳 丄+ 严 7丁1" %)2则e(y0)的1,的置信区间为:儿±心2 9(&),即:(9.18)八丄,i 1.(尤0 一尢)2)0±&/2注护打+v亍(兀-兀f1 »=12. y的个别值儿的置信区间估计残左为勺二儿'(),5服从正态分布。% 的期望是:e(eq) = eyq-yq = (0。+ 0氏)一0。+ 0血 + e) = 0a八勺的方差是:var(0) = var()?0- y0);因为儿与

53、)'o相互独立,且:aa: var(q) = var(y() + var(j0) = cr21(x0 - xin兀尸/=!用叱替代则的标准差是:a(eq) = syx+(j2 =cr2£(d2/=!-兀)2/=!var(y0) = ey0-e(y0)2 = var(0); var(y0) = var(0()+ 0丙 + £() = var(0) = a2则儿的1-u的置信区间为:y0±/2-<r(e0),即:(9.19)1+丄+严)一" n £(兀-兀)2 /=!归纳两个预测区间的特点:首先山于var(0) < vai(q)

54、,故总体均值的预测区间比个别值的预测区间 要窄;其次样本容量n越大,则残差的方差越小,预测粘度越高;最后在n定时,当预测点x0 =x时, 残差的方差最小,预测区间最窄,离;越远,残差的方差越人,预测区间越宽,预测可信度下降。【例9.6】根据例9.1的资料,若2004年的人均gdp为10000元,求人均消费95%的置信区间。a【解】将兀0 =10000代入回归方程得)1)=181.5830+0.4414x 10000=4595.5830 (元)查表得"二2.365,其它数据参见图9.7,代入公式(9.18)利(9.19):y的平均值的95%的置信区间:4595.583 ± 150.987 = 4444.596 4746.570(元)y的个别值的95%的置信区间:=4595.583 ± 224.908 = 4370.675 4820.491 (元)第三节多元线性回归

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论