计量经济学第六版_第1页
计量经济学第六版_第2页
计量经济学第六版_第3页
计量经济学第六版_第4页
计量经济学第六版_第5页
已阅读5页,还剩697页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

计量经济学(Econometrics)第一章绪论第一节什么是计量经济学?第二节计量经济学方法第三节计量经济模型及其应用第四节统计和计量经济分析软件

计量经济学(Econometrics)一词,又译经济计量学。从字面上说,该词含义是经济测量(Economicmeasurement),但实际上,其含义要广得多。下面引用几个比较权威的定义来说明这一点。第一节什么是计量经济学?一、计量经济学定义

计量经济学是一个迅速发展的经济学分支,其目标是给出经济关系的经验内容。

《新帕尔格雷夫经济学大词典》,1990

计量经济学可定义为实际经济现象的定量分析,这种分析根据的是由适当推断方法联系在一起的理论和观测的即时发展。计量经济学运用数理统计知识分析经济数据,对构建于数理经济学基础上的数学模型提供经验支持,并得出数量结果。(P.A.萨缪尔森等,1954)

计量经济学是将经济理论、数学和统计推断等工具应用于经济现象分析的社会科学。(A.S.戈德伯格,1964)综合性定义

综合以上定义,可以看出,计量经济学是一个有关经济关系的经验估计的经济学分支。计量经济学依据经济理论,使用数学和统计推断等工具,用观测数据对经济和商务活动进行实证研究,测度和检验经济变量间的经验关系,从而给出经济理论的经验内容,在经济理论的抽象世界和人类活动的具体世界之间搭建桥梁。计量经济学的理论基础经济理论、数学和统计学知识是在计量经济学这一领域进行研究的必要前提,这三者中的每一个对于真正理解现代经济生活中的数量关系是必要的,但不充分,只有结合在一起才行。因此,一个优秀的计量经济学家必须是合格的数学家和统计学家,他(她)还应该是一个经过系统经济学训练的经济学家。

计量经济学的三个要素计量经济学的三个要素是经济理论、经济数据和统计方法。对于解释经济现象来说,“没有计量的理论”和“没有理论的计量”都是不够的,正如计量经济学创始人之一的弗里希所强调的那样,它们的结合是计量经济学的发展能够取得成功的关键。

计量经济学是经济预测的科学计量经济学从根上说,是对经验规律的认识以及将这些规律推广为经济学“定律”的系统性努力,这些“定律”被用来进行预测,即关于什么可能发生或者什么将会发生的预测。因此,广义地说,计量经济学可以称为经济预测的科学。计量经济学的艺术成分计量经济学虽然以科学原理为基础,但仍保留了一定的艺术成分,主要体现在试图找出一组合适的假设,这些假设既严格又现实,使得我们能够使用可获得的数据得到最理想的结果,而现实中这种严格的假设条件往往难以满足。“艺术”成分的存在使得计量经济学有别于传统的科学,是使人对它提供准确预测的能力产生怀疑的主要原因。二、计量经济学的产生和发展1.产生年代○1926年挪威经济学家R.Frish提出Econometrics○1930年12月弗里希(R.Frisch)、丁伯根(J.Tinbergen)和费歇尔(I.Fisher)等经济学家在美国克利夫兰成立世界计量经济学会○1933年起定期出版《计量经济学》(Econometrica)杂志。弗里希在该杂志发刊词中明确提出计量经济学的范围和方法,指出计量经济学是经济理论、数学和统计学的综合,但它又完全不同于这三个学科中的每一个。2.时代背景

计量经济学的产生,与当时的时代背景是密切相关的。上世纪二十年代末期,在资本主义世界发生了严重的经济危机,原有的经济理论失灵,产生了所谓的“凯恩斯革命”。在这种背景下,各国政府出于对经济的干预政策的需要,企业管理层为了摆脱或减少经济危机的打击,在经济繁荣时期获取更多的利润,要求采用计量经济理论和方法,进行经济预测,加强市场研究,探讨经济政策的效果,因而计量经济学应运而生。3.学科发展环境

同时,随着科学技术的发展,各门学科相互渗透,数学、系统论、信息论、控制论等相继进入经济研究领域,使经济科学进一步数量化,有助于计量经济学的发展。高速电子计算机的出现和发展,为计量经济技术的广泛应用铺平了道路。4.计量经济学的发展过程

上世纪三十年代,侧重于个别商品供给与需求的计量,基本上属于个量分析或微观分析。自四十年代起,计量经济研究的范围扩大到整个经济体系,其特征是宏观经济总量的计量分析,亦即总量分析或宏观分析。

五十年代起,在计量经济学的理论和方法得到迅速发展的同时,宏观计量经济模型在计量经济学的应用中开始占重要地位。50年代末至60年代初是宏观计量经济模型蓬勃发展的时期。

八十年代后,计量经济学的研究取得了很多新进展,如单位根检验、协整、面板数据和面板数据模型、受限因变量模型、自回归条件异方差模型、广义矩估计等。与此同时,这些计量经济技术被日益广泛地应用于经济学的各个领域,成为很多经济学领域中实证工作的标准实践。5.我国计量经济学研究状况

由于认识上的原因,我国对计量经济学的广泛研究和应用起步较晚,始于20世纪70年代后期。

经过这些年的发展,已经取得了长足的进步,很多政府部门和学术机构建立了计量经济模型进行经济预测和政策分析。我们已大大缩小了在此领域与先进国家的差距。

可以预见,计量经济学在促进我国国民经济的发展中将发挥越来越大的作用。第二节计量经济学方法一、计量经济学方法的内容

任何计量经济研究包含两个基本要素:理论和事实,计量经济学的主要功能就是将这两个要素结合在一起。计量经济研究既使用理论,也使用事实,将二者结合起来,用统计技术估计经济关系,如图1.1所示。

理论

模型计量经济模型事实数据加工好的数据统计理论计量经济技术使用计量经济技术,用加工好的数据,估计计量经济模型结构分析

预测政策评价

图1.1计量经济学的研究方法●计量经济学所研究的经济关系具有两个特征:一是随机关系,二是因果关系。●计量经济研究的两个基本要素ーー理论和事实。理论以可用的模型形式给出,事实指的是现实世界中与所研究现象相联系的事件対应的一组数据,通过加工以可用的形式给出。●两要素的结合。用加工好的数据去估计计量经济模型。所谓估计模型就是估计参数。●一个估计好了的计量经济模型。可用于计量经济学的三个主要目的:结构分析、经济预测和政策评价。实证分析

二、计量经济分析的步骤(1)陈述理论(或假说)(2)建立计量经济模型(3)收集数据(4)估计参数(5)假设检验(6)预测和政策分析下面通过一个研究价格变动对空调需求量的影响的例子来说明上述步骤。第一步陈述理论

建立模型需要理论抽象。模型是对客观事物的基本特征和发展规律的概括,是对现实抓住本质的简化。这种概括和简化就是理论分析的成果。因此,在模型设定阶段,首先要注意基于经济理论的定性分析。

首先要做的是查找一下有关价格变动与需求量之间关系的经济理论,众所周知的需求定律告诉我们:

其他条件不变的情况下,一商品的价格上升,则对该商品的需求量减少;反之,价格下降,需求量增加。

简言之,一商品的价格与其需求量之间呈反向关系,即需求曲线斜率为负。第二步建立计量经济模型

模型应当反映客观经济活动,但是这种反映不可能也不应该是包罗万象,巨细无遗的。因此,需要合理的假设,删除次要关系和因素。将现实抽象为模型时必须进行必要的抽象与简化,既突出主要联系,又便于模型处理、运用。1.

需求函数的数学模型

尽管需求定律假定价格(P)与需求量(q)之间呈反向关系,但并没有给出二者之间关系的精确形式。例如,该定律并没有告诉我们价格与需求量之间关系是线性的还是非线性的,如图1.2中(a)和(b)所示。事实上,斜率为负的曲线有千千万万,在它们之中选择正确的函数是计量经济学家的任务。(a)(b)QPQP图1.2线性和非线性的需求函数

如果q和P之间的关系是线性的,如图1.2(a)所示,则数学上需求函数可表示为:

q=α+βP(1)α和β称为该函数的参数(parameters),它们是未知常数。

α亦称为截矩(intercept),它给出P为0时q的值。

β亦称为斜率(slope),它计量的是P的单位变动所引起的q的变动。

被解释变量或因变量解释变量或自变量因变量和解释变量

(1)式是反映q和P之间关系的数学模型,专业点儿说,是数理经济学模型。在这样一个模型中,等号左边的变量称为因变量(dependentvariable)或被解释变量(explainedvariable)。等号右边的变量称为自变量(independentvariable)或解释变量(explanatoryvariable)。在我们的例子中,q是因变量,P是解释变量,意味着我们用价格的变动来解释需求量的变动。2.由数学模型到计量经济模型(1)数学模型的缺陷

上段中(1)式假定价格(P)与需求量(q)之间的一种精确的或确定的关系,也就是说,对于一个给定的价格,就确定一个唯一的需求量。在现实的经济变量之间,极少存在这种关系,更常见的是不精确的关系。为了说明这一点,我们根据表1.1中q和P的假设数据画出一个散点图(图1.3)。数据表和散点图

表1.1PQ

0

78

170269363460558---iiiii

80Q

70

6012345xx

xxxxP

图1.3

图1.3显示的是一种近似线性而非严格线性的关系。为什么不是所有5个点都位于数学模型(1)所规定的直线上呢?这是因为我们在导出需求曲线时假定所有影响q的其它变量保持不变,而实际上它们通常要变,这种变动会对q产生一些影响。结果是,观测到的q和P的关系可能不精确。

结论:现实中经济变量之间的关系一般是一种不精确的关系,因此用(1)式这样的数学模型描述是不合适的,因为它不能正确反映客观实际情况。(2)扰动项(disturbance

term)为了解决这个问题,我们用一个“一揽子”变量u加进原数学模型中,u代表所有影响q的其它因素的影响,u称为扰动项或误差项。扰动项u可以理解为这样一个变量,它反映的是除了价格以外的其它所有帮助决定需求量的因素。这些因素包括相对而言不重要因而未引入模型的变量(如消费者的口味,他们的收入,替代商品的价格等),还包括纯粹的随机因素。(3)计量经济模型引入扰动项u后,将需求函数写为:

q=α+βP+u(2)

这是一个计量经济模型,这种类型的计量经济模型也叫做线性回归模型。在这样一个模型中,扰动项u代表所有那些影响q但未被显式地引入模型的因素以及纯粹的随机因素。没有扰动项的关系称为精确的或确定的关系,而有扰动项的关系称为随机的关系。当我们用一个随机关系式来预测被解释变量的精确值时,结果往往有误差,扰动项被用来估量这些“误差”的大小。第三步收集数据

在估计所设定的计量经济模型的参数之前,我们必须首先得到适当的数据。计量经济分析所需要的数据,既可来自各种官方统计资料,亦可通过调查获得。在经验分析中常用的数据有两种:

时间序列数据和横截面数据(timeseriesandcross-section)

时间序列和横截面数据

时间序列数据是按时间周期(即按固定的时间间隔)收集的数据,如年度或季度的国民生产总值、就业、货币供给、财政赤字或某人一生中每年的收入都是时间序列的例子。本例中就是时间序列数据。

横截面数据是在同一时点收集的不同个体(如个人、公司、国家等)的数据。如人口普查数据,世界各国2000年国民生产总值,全班学生计量经济学成绩等都是横截面数据的例子。

混合数据和面板数据

兼有时间序列和横截面成分的数据称为混合数据(pooleddata。

面板数据(paneldata)是混合数据的一种特殊类型,指对相同的一批横截面单元(如家庭或厂家)在时间轴上进行跟踪调查的数据。中国1978-2007国内生产总值的名义值和实际值图1.42009年中国31个省市的地区生产总值图1.5第四步估计参数

参数是模型中表示变量之间数量关系的常系数。参数具体说明解释变量对被解释变量的影响程度。在未经实际资料估计之前,参数是未知的。模型设定之后,依据可资利用的数据资料,选择适当的估计方法,(例如最小二乘)进行估计,得到参数的估计值。参数估计的意义:参数估计为经济理论提供了实际经验的内容,并验证经济理论。

有了如表1.1中的q和P数据,如何估计模型的参数α和β?也就是说,如何求出这些参数的数值呢?我们将在后面的课程中详细讨论估计方法,其基础是大家熟悉的最小二乘法。这里,假设我们用表1.1中q和P的数据估计(2)式的参数α和β后得到估计好的需求函数:

(3)其中表示Q的拟合值或预测值,76.05和–3.88是将P和q的数据代入最小二乘法公式计算得出的参数α和β的数值,称为α和β的估计值(estimates)。估计好的需求函数

图1.6=76.05-3.88PPQ

估计值和估计量(EstimatesandEstimators)

我们通常用希腊字母表示未知参数的真值。假设β是一个我们想知道的参数值,应用统计技术,我们可以得到β的合理估计值。在任何实际应用中,β的估计值就是一个数字,如β被估计为–3.88。一般来说,经济理论所关注的焦点并不是估计值,而是估计量,估计量是用于将数据转换成估计值的公式。之所以更关注后者,是因为从一特定样本计算的估计值是不是好,取决于估计方法(估计量)是不是好。β的估计量通常表示为

和。第五步假设检验

估计好需求函数后,我们可能想知道估计的模型是否有经济意义,即得到的结果是否符合所依据的经济理论。

例如,P的系数是否为预期的负数?(3)式表明确实如此。

有些假设就不那么容易验证,比如说,若假设为β=-2.0,我们能不能说-1.927的观测值实际上与假设值相同?也就是说我们的数据是否支持β=-2.0的假设?要检验这样一个假设,就需要使用统计学的工具。第六步预测和政策分析

现在回到估计好的需求函数(3),假设生产商要知道价格变为4.50千元时需求量是多少,换句话说,他想预测P=4.50千元时的Q值。由(3)式,可得到:

=76.05-3.88P=76.05-3.88*4.50=58.59万台

也就是说,若价格为4.50千元,则需求量的预测值为接近59万台。

由于计量经济模型包含扰动项,因此用上述估计好的模型所做预测总会存在误差,与此同时,由于76.05和-3.88仅仅是真实的α和β的估计值,

这将是我们的预测中存在的另一个误差源。计量经济分析的步骤

步骤例子1陈述理论(或假说)需求定律2建立计量经济模型Q=a+bP+u3收集数据表1.14估计参数5假设检验β<0?6预测和政策分析若P=4.5,Q为多少第三节计量经济模型及其应用一、单方程模型和联立方程模型

计量经济模型可分为两类:单方程模型和联立方程模型。单方程模型用于描述一个因变量和若干个自变量之间的结构关系,如上一节(2)式所示。联立方程模型则由多个方程组成,一般用于描述整个经济系统或子系统。如最简单的宏观经济模型:

Ct

=α0+α1Yt+u1tIt=β0+β1Yt+β2Yt-1+u2tYt=Ct+It+Gt其中,Yt=GDP,Ct=消费,It=投资,Gt=政府支出。

行为方程和恒等式

第一个方程是消费函数,第二个方程是投资方程,这类关系式描述的是消费者、投资者等的行为,因而称为行为方程(behavioralequation)。前面的需求函数(2)式也是一个行为方程,描述的也是消费者的行为。

第三个方程是GDP恒等式(identity),恒等式亦称定义式,是人为定义的一种变量间的恒等关系。

外生变量和内生变量

在我们的简单宏观经济模型中,C、I和Y是内生变量,G是外生变量。

内生变量(endogenousvariables)是其值在模型内部确定的变量。

外生变量(exogenousvariables)是其值在模型之外决定的变量。模型中使用它们,但不由模型决定它们的值。

二、计量经济模型的应用

图1.1还显示了计量经济学的三个主要目的:结构分析,预测和政策评价,或者说是计量经济学的三项应用。由于计量经济学的应用是通过计量经济模型实现的,因此,计量经济学的三项应用也就是计量经济模型应用的三个方面。

1.结构分析

结构分析是将估计好的计量经济模型用于经济关系的数量研究,即当一个或几个变量发生变化时会对其它变量以至整个经济系统产生什么样的影响。结构分析所采用的主要方法有弹性分析和乘数分析等。结构分析代表的是计量经济学的“科学”目的,即通过用模型和数据对理论经济关系的检验来理解现实世界的经济关系。

2.预测

预测是用估计好的计量经济模型去预测一些变量在实际观测的样本之外的数量值。预测往往是决策和行动的基础,市场预测和宏观经济预测都是如此。应用宏观计量经济模型进行经济预测,是经济预测的主要手段之一。西方发达国家主要宏观经济模型都定期发布预测报告,预测结果往往得到政府、企业和公众的重视。有专门机构对各主要模型的预测功能进行定期评估。

英、美很多模型班子有自己固定的客户,靠预测已经可以以战养战了。如英国的MDM和OEF,美国的WEFA、DRI和INFORUM。3.政策评价

计量经济模型的另一大应用是政策评价,也叫政策分析或政策模拟。政策评价是用估计好的计量经济模型在不同政策方案之间进行选择。常用作法是先用模型做一个基准运行,也就是现行政策不变的情况下,经济系统的运行结果,然后作一些政策假设,如利率提高一个百分点,再运行模型,比较前后两次运行的结果,如GDP、通货膨胀率等宏观经济变量值的变化,从而模拟出某项政策或政策组合的效果。第三章双变量线性回归模型

(简单线性回归模型)(SimpleLinearRegressionModel)第一节双变量线性回归模型的估计第二节最小二乘估计量的性质第三节拟合优度的测度第四节双变量回归中的区间估计和假设检验第五节预测第一节双变量线性回归模型的估计一、双变量线性回归模型的概念

我们在上一章给出的需求函数的例子

Q=α+βP+u(1)是一个双变量线性回归模型,模型中只有两个变量,一个因变量,一个解释变量,由解释变量的变动来解释因变量的变动,或者说用因变量对解释变量进行线性回归,因而称为双变量线性回归模型,亦称简单线性回归模型或是一元线性回归模型。

(3)式称为双变量线性回归模型或简单线性回归模型或一元线性回归模型。其中

为未知的总体参数,也称为回归模型的系数(coefficients)。下标i是观测值的序号。设我们有Y和X的n对观测值数据,则根据(1)式,变量Y的每个观测值应由下式决定:Yi=

+

Xi+ui,i=1,2,...,n (3)当数据为时间序列时,往往用下标t来表示观测值的序号,从而(3)式变成

Yt=

+

Xt+ut,t=1,2,...,n (3*)

为何要在模型中包括扰动项u

我们在上一章中已初步介绍了为什么要在模型中包括扰动项u,下面进一步说明之:(1)真正的关系是Y=f(X1,X2,…),但X2,X3,…,相对不重要,用u代表之。(2)两变量之间的关系可能不是严格线性的,u反映了与直线的偏差。(3)经济行为是随机的,我们能够用Y=α+βX

解释“典型”的行为,而用u来表示个体偏差。(4)总会出现测量误差,使得任何精确的关系不可能存在。

(一)双变量线性回归模型的统计假设

我们的模型是:

Yt=

+

Xt+ut,t=1,2,...,n

这里

为未知总体参数,下一步的任务是应用统计学的方法,由Y和X的观测值(即样本数据)来估计

的总体值,常用的估计方法就是最小二乘法。为了应用最小二乘法,得到好的估计量,双变量线性回归模型需要满足一些统计假设条件。二、普通最小二乘法(OLS法,OrdinaryLeastsquares)

(1)E(ut)=0,t=1,2,...,n

即各期扰动项的均值(期望值)为0.(2)COV(ui,uj)=E(uiuj)=0i

j

即各期扰动项互不相关.(3)Var(ut)=E(ut2)=

2,t=1,2,...,n

即各期扰动项方差是一常数.

双变量线性回归模型的统计假设(4)解释变量Xt为非随机量即Xt的取值是确定的,而不是随机的.(5)ut~N(0,2),t=1,2,...,n

即各期扰动项服从正态分布.

满足条件(1)--(4)的线性回归模型称为古典线性(或是经典线性)回归模型

(CLR模型)下面简单讨论一下上述假设条件。(1)E(ut)=0,t=1,2,…,n

即各期扰动项的均值(期望值)均为0。均值为0的假设反映了这样一个事实:扰动项被假定为对因变量的那些不能列为模型主要部分的微小影响。没有理由相信这样一些影响会以一种系统的方式使因变量增加或减小。因此扰动项均值为0的假设是合理的。(2)E(uiuj)=0,i≠j

即各期扰动项互不相关。也就是假定它们之间无自相关或无序列相关。实际上该假设等同于:

cov(ui,uj)=0,i≠j这是因为:cov(ui,uj)=E{[ui-E(ui)][uj-E(uj)]}=E(uiuj)——根据假设(1)(3)E(ut2)=

2,t=1,2,…,n

即各期扰动项的方差是一常数,也就是假定各扰动项具有同方差性。实际上该假设等同于:

Var(ut)=

2,t=1,2,…,n这是因为:

Var(ut)=E{[ut-E(ut)]2}=E(ut2)——根据假设(1)(4)

Xt为非随机量即Xt的取值是确定的,而不是随机的。事实上,我们后面证明无偏性和时仅需要解释变量X与扰动项u不相关,但不容易验证之,因而通常采用非随机量的假设。

(5)ut~N(0,

2),t=1,2,...,n

即扰动项服从正态分布。

(二)普通最小二乘法原理

通常真实的回归直线是观测不到的。收集样本的目的就是要对这条真实的回归直线做出估计。

我们的任务是,在给定X和Y的一组观测值(X1,Y1),(X2,Y2),...,(Xn,Yn)的情况下,求出Yt=

+

Xt+ut中

的估计值和,使得拟合的直线为最佳。直观上看,也就是要求在X和Y的散点图上穿过各观测点画出一条“最佳”直线,如下图所示。*****

et************

YXXt

图1

YtYt残差拟合的回归线拟合方程或估计方程

拟合的直线称为拟合的回归线.

对于任何数据点(Xt,Yt),此直线将Yt的总值分成两部分。第一部分是Yt的拟合值或预测值:

,t=1,2,……,n

第二部分,et代表观测点对于回归线的误差,称为拟合或预测的残差(residuals):

t=1,2,……,n

即t=1,2,……,n残差残差平方和我们的目标是使拟合出来的直线在某种意义上是最佳的,直观地看,也就是要求估计直线尽可能地靠近各观测点,这意味着应使残差总体上尽可能地小。

要做到这一点,就必须用某种方法将每个点相应的残差加在一起,使其达到最小。理想的测度是残差平方和,即

最小二乘法就是选择一条直线,使其残差平方和达到最小值的方法。即选择和,使得最小二乘法达到最小值。

运用微积分知识,使上式达到最小值的必要条件为:

即整理,得:此二式称为正规方程。解此二方程,得:.其中:离差样本均值估计量(5)式和(6)式给出了OLS法计算和的公式,和称为线性回归模型Yt=

+

Xt+ut的参数

的普通最小二乘估计量(OLSestimators)。

这两个公式可用于任意一组观测值数据,以求出截距和斜率的OLS估计值(estimates),估计值是从一组具体观测值用公式计算出的数值。一般说来,好的估计量所产生的估计值将相当接近参数的真值,即好的估计值。可以证明,对于CLR模型,普通最小二乘估计量正是这样一个好估计量。例1

设Y和X的5期观测值如下表所示,试估计方程

Yt=

+

Xt+ut

序号

12345Yt1418232530Xt

1020304050

解:我们采用列表法计算。计算过程如下:(三)例子序号YtXtyt=Yt-xt=Xt-xtytxt211410-8-2016040021820-4-1040100323301000425403103010053050820160400n=5110150003901000表3-154估计方程为:Eviews创建工作文件,输入数据并进行回归:Createu15dataxylsycxobsCUYUPUCUYUPU1985673.2739.110019974185.645160.3359.11986798.96899.610719984331.615425.1356.91987884.41002.2116.419994614.915854352.319881103.981181.4140.5200049986280355.119891210.951375.7163.320015309.016859.6357.619901278.891510.2165.420026029.887702.835419911453.811700.6173.820036510.948472.2357.219921671.732026.6188.820047182.19421.6369.001519932110.812577.4219.220057942.8810493374.888219942851.343496.2274.120068696.5511759.5380.476919953537.574283320.120079997.4713785.8397.615519963919.474838.9348.3例21985-2007中国城镇居民家庭人均生活消费支出(cu)与人均可支配收入(yu)Eviews创建工作文件,输入数据并进行回归:步骤:(1)建立workfileCreatea19852007(2)输入和编辑数据datacuyupuGenrcup=cu/pu*100Genryup=yu/pu*100(3)建立cup与yup的散点图scatyupcup

(4)回归输入命令:Lscupcyup

查看统计结果,检验模型。

对于满足统计假设条件(1)--(4)的线性回归模型Yt=

+

Xt+ut,,普通最小二乘估计量(OLS估计量)是最佳线性无偏估计量(BLUE)。或对于古典线性回归模型(CLR模型)Yt=α+β+Xt,普通最小二乘估计量(OLS估计量)是最佳线性无偏估计量(BLUE)。3.最小二乘估计量的特性:高斯--马尔柯夫定理(Gauss--MarkovTheorem)1.无偏性(已证明)2.线性

这表明,是诸样本观测值Yt的线性函数,故是线性估计量。

3.最佳性

即的方差在所有线性无偏估计量中是最小的。有兴趣的同学请参见教科书(P39-40)我们在前面列出的假设条件(5)表明,

ut~N(0,

2),t=1,2,...,n

即各期扰动项服从均值为0、方差为

2的正态分布。考虑到假设条件(4),即Xt为非随机量,则由前面结果:

=其中,4.和的分布

这表明,是N个正态分布变量u1,u2,…,un的线性函数,因而亦为正态分布变量,,即

∽类似的有:

5.

2的估计实际上,我们一般无法知道扰动项分布的方差

2

,而必须根据样本数据估计出

2

,然后再来考虑β的方差的计算问题。我们可以用残差来估计扰动项ut

的方差

2

:可以证明,

2的无偏估计量,称为误差均方。为了计算,我们可以直接从残差的定义式得到,也可以通过下面的公式求出:

=34

用最小二乘法得到的回归直线至少从残差平方和为最小这一意义上来说是所有可能直线中最佳的拟合线。它是对Y和X之间关系的一种描述,但该直线是不是Y和X之间关系的一种恰当的描述呢?如果各观测点紧密地聚集在这条直线的周围,则表明该直线对Y和X之间关系的描述是好的;否则,用直线来描述这两个变量之间的关系就未必恰当,如下图所示:四、拟合优度的测度1.拟合优度(Goodnessoffit)的概念

(a)恰当描述(b)不恰当描述图2

应该指出,对于任意两个变量的一组观测值,我们总是可以运用最小二乘法得到一条直线,问题是该直线能否较好地拟合所给定的观测值,这就是拟合优度问题。拟合优度是两变量之间关系强度的测度。在这里,指的是两变量间线性关系强度的测度。

让我们来考察一下Y的变差的组成情况。我们有Y的N个观测值,Y的总变差的一个测度是,Y的变差()中有一部分是可以由X的取值变动所解释的,还有一部分是不能由X所解释的变差:Y的变差=自变量X引起Y的变动部分+除X以外的因素引起Y的变动部分2.Y的变差(离差)的组成如下图所示:图3对于第t个观测值,有:

由于对于全部N项观测值平方求和,有:

(1)决定系数R2

决定系数是反映估计的回归曲线对观测的数据的解释能力或者说是反映两者拟合优度的尺度。我们将(8)式两端都除以总变差,得:3.拟合优度的测度用符号表示为:

决定系数R2计量了Y的总变差中可以归因于X和Y之间关系的比例,或者说Y的变动中可以由X的变动来解释的比例。它是回归线对各观测点拟合紧密程度的测度。我们有:

R2=1:完全拟合,

R2=0:X与Y完全不存在线性关系,

=

R2的值越高,拟合得越好。但什么是高?回归中使用时间序列数据还是横截面数据有不同的标准。(4)相关系数r

由R2很容易联想到我们在统计中学过的相关系数。相关系数r与决定系数的关系为:R2=(r2),相关系数的计算公式为:相关系数r也是拟合优度的测度,其符号取决于的符号(即的符号)我们有:

-1≤r≤1

r=1:完全正相关

r=-1:完全负相关

r=0:无线性关系

相关系数和决定系数的计算很简单,事实上,我们只要在原列表计算的表格中加上一个计算的栏目就行了。对于我们前面的例子,列表计算得:=154,因此:

r=R2=(0.9938)2=0.9876

它表明,在我们的例子中,X与Y存在着很强的线性关系,拟合甚佳,但由于观测点很少(5个),因而对此结论应持谨慎态度。yt26416196415422决定系数我们在上一节中已得出,在5条假设条件成立的情况下,有∽与估计量相联系的概率分布的标准差,通常称为标准误差,用Se表示。的标准误差为:Se()=如果σ为已知,则我们可以立即给出总体参数β的95%的置信区间为:

±1.96或±1.96Se()§2双变量回归中的区间估计和假设检验一、 β的置信区间

但实际上,我们一般无法知道扰动项分布的方差

2

,而必须根据样本数据估计出

2

,然后再来考虑β的置信区间的计算问题。1.

2的估计我们可以用残差来估计扰动项ut

的方差

2

:可以证明,

2的无偏估计量.为了计算,我们可以直接从残差的定义式得到,也可以通过下面的公式求出:

=我们重新定义标准误差为:Se()=则检验统计量t==∽t(n-2)故β的置信区间为:即2.β的置信区间

即为0.10至1.06。也就是说,我们有95%的把握说β在0.10至1.06之间。1.假设检验的方法有了上一段的重要结果

t=∽t(n-2)

我们进行有关总体参数β的假设检验就很容易了。假设检验的步骤:(1)建立关于总体的原假设和备择假设;(2)计算检验统计量,检验原假设(是否出现小概率事件);(3)得出关于原假设是否合理的结论.二、假设检验例1:仍用上一段例中的数据,我们要检验的是:原假设:H0:β=0.8

备择假设:H1:β<0.8

这是一个单侧检验的问题。我们有:

t===-1.05

=n-2=10-2=8查t表,截断左侧5%面积的t临界值

tc=-1.86∵t=-1.05›-1.86

故接受原假设H0,即β=0.8图4

在假设检验中,有关β是否为0的假设检验特别重要。如果通过检验,接受β=0的原假设,则表明X和Y没有关系,即X对Y的变动没有影响。在这种情况下,就应从模型中剔除X,寻找其他解释变量。这类检验称为系数的显著性检验。2.系数的显著性检验图2-6回归参数的显著性检验我们已得到原假设H0:β=0的t值:t===2.76同样可得出原假设H0::

α=0的t值:t===1.381. 回归结果提供提供回归分析结果一般有两种方式:(1)=6.70+0.58XR2=0.49

(1.38)(2.76)

这里6.70和0.58分别为α和β的估计值和。括号中数字是H0:

α=0和H0:β=0为真时的t值。三、回归结果的提供和分析2. 回归结果的分析结果的分析主要包括以下内容:

(1)系数的说明。首先是说明系数的符号是否正确,是否符合经济理论和常识。其次是说明系数的含义,斜率系数为0.58,表明X增加一个单位,Y增加0.58个单位(如收入X增加1元,消费Y增加0.58元);截距6.70的含义是X为0时Y的值。截距项有时有经济意义,大多数情况下无。

(2)拟合情况。R2不高,作为时间序列数据,拟合不理想。

(3)系数的显著性。斜率系数的t值为2.76,表明该系数显著异于0,X对Y有影响。(2)=6.70+0.58XR2=0.49

(4.86)(0.21)括号中提供的是和的标准误差。1985-2007城镇居民的消费和收入模型的标准格式

我们用OLS法对双变量模型的参数进行了估计之后,如果结果理想(拟合得较好,且系数估计值符合经济理论和常识),则可用估计好的模型进行预测。一、预测的概念预测通常指利用现有信息预测未来。在这里,预测指的是对自变量的某一具体值X0

,来预测与它相对应的因变量值Y0

。它既可以指对未来某个时期因变量值的预测,也可以是对未包括在横截面样本之中的某个实体数值的预测。

通常情况下,我们要预测的是与样本观测值范围之外的X值对应的Y值,如观测值为1985-2000年,预测2001,2002年的居民消费。但X0也可以在样本X值的范围内。§3预测

要进行预测,有一个假设前提应当满足。即对于样本观测值数据成立的X和Y之间的关系对于新的观测值也成立。即若双变量模型的原设定是:

Yt=α+βXt+ut,t=1,2,…,n

则要使此模型可以用来作为预测的依据,还应有:

Y0=α+βX0+u0

也成立。二、 预测的隐含假设

我们可以得到两种类型的预测值:点预测值和区间预测值。在实践中,如果没有某种精度指标的话,点预测值是没有多大用处的。所以,我们必须提供点预测值的预测误差。

点预测值由与X0对应的回归值给出,即而预测期的实际Y值由下式给出:其中u0

是从预测期的扰动项分布中所取的值。三、预测的误差

由此不难看出,预测误差产生于两个来源:

(1)模型中包含扰动项,点预测值是假定预测期扰动项u0

为0,而实际上一般不为0。

(2)点预测值公式中用的是

的估计值和,样本估计值和一般不等于总体参数

。预测误差的来源

预测误差的方差为:其它两项协方差等于0。这是因为u0独立于u1,u2,…un,而和均为u1,u2,…un

,的线性函数,因此它们与u0的协方差均为0。将我们在前面得到的和的方差及协方差代入上式,得:

从e0

的定义

可看出,e0为正态变量的线性函数,因此,它本身也服从正态分布。故

~N(0,1)由于

是未知的,我们用其估计值代替它,有四、Y0的置信区间

0X0X

Y图5

即15.24至21.76,也就是说,我们有95%的把握预测Y0

将位于15.24至21.76之间。例2且现有一对新观测值,试问它们是否可能来自产生样本数据的同一总体?

解:问题可化为“预测误差是否显著地大?”

当时,预测误差

原假设:H0:备择假设:H1:检验:若H0为真,则

对于n-2=8个自由度,查表得5%显著性水平检验的t临界值为:即结论:由于故接受原假设,即新观测值与样本观测值来自同一总体。上例的意义在于,我们可以通过从估计模型用的一组观测值中剔除最近期的一两对观测值,用它们来检验模型的预测功效。如果我们在上述检验中拒绝了原假设,则不管是什么原因,我们都要认真对待,回过头来检查模型的设定是否正确。例3教材例3.7第四章多元线性回归模型138

在许多实际问题中,我们所研究的因变量的变动可能不仅与一个解释变量有关。例如,对某商品的需求量不仅与该商品的价格有关,而且与其它因素有关,如与消费者的可支配收入和该商品的替代品的价格有关。因此,有必要考虑线性模型的更一般形式,即多元线性模型。

t=1,2,…,n

在这个模型中,Y由X1,X2,X3,…XK所解释,有K+1个未知参数β0、β1、β2、…βK.其中,“斜率”βj的含义是其它变量不变的情况下,Xj改变一个单位对因变量所产生的影响,也称为偏回归系数。第一节多元线性回归模型的概念139140上例中斜率系数的含义说明如下:价格不变的情况下,个人可支配收入每增加1元,人均食品消费支出增加0.152元。人均可支配收入不变的情况下,价格指数每上升一个点,人均食品消费支出减少5.02元。多元线性回归模型中斜率系数的含义141例2:

其中,Ct=消费,Dt=居民可支配收入

Lt=居民拥有的流动资产水平

β2的含义是,在流动资产不变的情况下,可支配收入变动一个单位对消费额的影响。这是收入对消费额的直接影响。收入变动对消费额的总影响=直接影响+间接影响。(间接影响:收入

流动资产拥有量

消费额)但在模型中这种间接影响应归因于流动资产,而不是收入,因而,β2只包括收入的直接影响。在下面的模型中:这里,β是可支配收入对消费额的总影响,显然β和β2的含义是不同的。偏回归系数bj就是xj本身变化对y的直接(净)影响。

142即对于n组观测值,有回到一般模型

t=1,2,…,143其矩阵形式为:

其中144

一、假设条件(1)E(ut)=0,t=1,2,…,n

(2)E(uiuj)=0,i≠j

(3)E(ut2)=σ2,t=1,2,…,n

(4)Xjt是非随机量,j=1,2,…kt=1,2,…n第二节多元线性回归模型的估计

多元线性回归模型的估计与双变量线性模型类似,仍采用最小二乘法。当然,计算要复杂得多,通常要借助计算机。理论推导需借助矩阵代数。下面给出最小二乘法应用于多元线性回归模型的假设条件、估计结果及所得到的估计量的性质。145

除上面4条外,在多个解释变量的情况下,还有两个条件需要满足:(5)(K+1)<n;

即观测值的数目要大于待估计的参数的个数(要有足够数量的数据来拟合回归线)。(6)各解释变量之间不存在严格的线性关系。146上述假设条件可用矩阵表示为以下四个条件:

(1)E(u)=0

(2)

这两个条件成立时才成立,因此,此条件相当前面条件(2),(3)两条,即各期扰动项互不相关,并具有常数方差。E(uiuj)=0,i≠jE(ut2)=σ2,t=1,2,…,n显然,仅当由于147

(3)X是 一个非随机元素矩阵。(4)Rank(X)=(K+1)<n.------相当于前面(5)、(6)两条即矩阵X的秩=(K+1)<n

当然,为了后面区间估计和假设检验的需要,还要加上一条:

(5)~,t=1,2,…n148我们的模型是:

二、最小二乘估计残差为:问题是选择,使得残差平方和最小。t=1,2,…n149要使残差平方和我们得到如下K+1个方程(即正规方程):为最小,则应有:150按矩阵形式,上述方程组可表示为:151即=152

我们的模型为

三、最小二乘估计量的性质1.的均值估计式为153

这表明,OLS估计量是无偏估计量。(由假设3)

(由假设1)

1542.的方差

这是一个(K+1)*(K+1)矩阵,其主对角线上元素即构成Var(),非主对角线元素是相应的协方差,如下所示:为求Var(),我们考虑155下面推导此矩阵的计算公式.156由上一段的结果,我们有因此,157

如前所述,我们得到的实际上不仅是的方差,而且是一个方差-协方差矩阵,为了反映这一事实,我们用下面的符号表示之:展开就是:158与双变量线性模型相似,

2的无偏估计量是这是因为我们在估计的过程中,失去了(K+1)个自由度。3.

2

的估计159

对于以及标准假设条件(1)-(4),普通最小二乘估计量是最佳线性无偏估计量(BLUE),具有无偏性、具有最小方差特性、具有一致性,渐近无偏性和渐近有效性。4.高斯-马尔科夫定理160

我们已在上一段中证明了无偏性,下面证明最小方差性。证明的思路与双变量模型中类似,只不过这里我们采用矩阵和向量的形式。161

现设为的任意一个线性无偏估计量,即其中是一个(K+1)*n非随机元素矩阵。则显然,若要为无偏估计量,即,只有,为(K+1)阶单位矩阵。162

的方差为:

从而将的任意线性无偏估计量与OLS估计量联系起来。我们可将写成163由可推出:

由从而,因此上式中间两项为0,我们有因而有即164

因此

最后的不等号成立是因为为半正定矩阵。这就证明了OLS估计量是的所有线性无偏估计量中方差最小的。至此,我们证明了高斯-马尔科夫定理。165

对于双变量线性模型

Y=α+βX+u其中,=残差平方和我们有第三节拟合优度一、决定系数R2166对于多元线性模型为方便计算,我们也可以用矩阵形式表示R2.我们可用同样的方法定义决定系数:167

我们有:残差,其中,残差平方和:168而这就是决定系数R2的矩阵形式。将上述结果代入R2的公式,得到:169

残差平方和的一个特点是,每当模型增加一个解释变量,并用改变后的模型重新进行估计,残差平方和的值会减小。由此可以推论,决定系数是一个与解释变量的个数有关的量:

解释变量个数增加

减小

R2

增大也就是说,人们总是可以通过增加模型中解释变量的方法来增大R2

的值。因此,用R2

来作为拟合优度的测度,不是十分令人满意的。为此,我们定义修正决定系数(Adjusted)如下:二、修正决定系数:170

是经过自由度调整的决定系数,称为修正决定系数。我们有:(1)(2)仅当K=0时,等号成立。即(3)当K增大时,二者的差异也随之增大。(4)可能出现负值。171

下面我们给出两个简单的数值例子,以帮助理解这两节的内容.

例1 Yt=

1+

2X2t+

3X3t+ut

设观测数据为:Y:31835X2:31524X3:54646

试求各参数的OLS估计值,以及。解:我们有三、例子172173174175176

例2.

设n=20,k=3,R2=0.10求。解:

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论