版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
第三章多元线性回归1XianghongShirleyWang-modifiedfromProfessorAnderson
模型的建立与假设模型的参数估计模型的统计检验非线性关系的处理模型的预测虚拟变量实例主要内容2XianghongShirleyWang3.1模型的建立与假设在实际经济问题中,一个经济变量往往受到多个因素的影响,仅用双变量模型是无法解决的,需要引入多元线性回归模型。多元线性回归模型表现为线性回归模型中的解释变量有多个,其一般形式为:3XianghongShirleyWang设有n组观测值则每组样本都满足:这样n组样本数据就组成一个线性方程组:5XianghongShirleyWang或者写成矩阵的形式:6XianghongShirleyWang回归参数的含义也被称为偏回归系数(partialregressioncoefficients),表示在其他解释变量保持不变的情况下,
每变化1个单位时,Y的均值E(Y)的变化。或者说
给出了
的单位变化对Y均值的“直接”或“净”(不含其他变量)的影响。
7XianghongShirleyWangE(ui)=0,i=1,2,…,n相应的矩阵表达式为:模型的假定假定1:随机误差项ui的数学期望(均值)为0,即8XianghongShirleyWang假设2和假设3的矩阵表达形式为:
Cov
(u)
=
2I(其中:I为n阶单位矩阵)10XianghongShirleyWang假设5:解释变量
之间不存在严格的线性关系,即解释变量的样本观测值矩阵是满秩的,应满足关系式:rank(X)=k+1<n。也就是样本容量n相对于解释变量的个数应足够大!因为自由度(n-k)与误差项的方差估计值有关。若(n-k)太小,误差项方差就比较大,参数估计量就不容易通过显著性检验。继而也会影响到被解释变量的估计与预测。12XianghongShirleyWang3.2模型的参数估计普通最小二乘估计参数估计量的性质随机误差项方差的估计14XianghongShirleyWang对于随机抽取的n组样本观测值估计模型:找到合适的参数估计值,使得残差平方和最小。残差的平方和为:一、普通最小二乘估计15XianghongShirleyWang要使“残差平方和”达到最小,则有即ei即得到k+1个方程,即正规方程:16XianghongShirleyWang
解该(k+1)个方程组成的线性代数方程组,即可得到(k+1)个待估参数的估计值$,,,,,bjj=012L。k将正规方程变形,得到:17XianghongShirleyWang正规方程组的矩阵形式即由于XX
满秩,故有
18XianghongShirleyWang使用矩阵的微分法,得到:由于XX
满秩,则(XX)-1存在,因此,参数的最小二乘估计值为:20XianghongShirleyWang二、参数估计量的性质在满足基本假设的情况下,其结构参数的普通最小二乘估计具有:线性性、无偏性和有效性。同时,随着样本容量增加,参数估计量具有:渐近无偏性、渐近有效性、一致性。21XianghongShirleyWang(二)无偏性23XianghongShirleyWang(三)有效性(最小方差性)
主对角线元素为各参数估计的方差,非主对角线元素为不同参数估计之间的协方差。24XianghongShirleyWang接着证明最小方差性假设是总体参数的任一线性无偏估计量,有:26XianghongShirleyWang27XianghongShirleyWang28XianghongShirleyWang三、随机误差项方差的估计
与双变量模型类似,多元模型中的随机误差项方差的无偏估计量为:
30XianghongShirleyWang31XianghongShirleyWang
这样,我们便找到了随机误差项方差的无偏估计量:32XianghongShirleyWang3.3模型的统计检验拟合优度检验方程的显著性检验变量的显著性检验33XianghongShirleyWang一、拟合优度检验
总离差平方和的分解拟合优度(可决系数)34XianghongShirleyWang在建立多元线性回归模型的过程中,我们发现:随着模型中解释变量的增加,
R2往往会随之增大。(为什么?)
这就给人一个错觉:要使得模型拟合得好,只要增加解释变量即可。——但是,现实情况往往是,由增加解释变量个数引起的R2的增大与拟合好坏无关——R2需要调整。35XianghongShirleyWang
调整后的可决系数(adjustedcoefficientofdetermination)
在样本容量一定的情况下,增加解释变量必定使得自由度减少,所以调整的思路是:将残差平方和与总离差平方和分别除以各自的自由度,以剔除变量个数对拟合优度的影响:其中:n-k-1为残差平方和的自由度,n-1为总体平方和的自由度。又被称为修正的拟合优度。36XianghongShirleyWang当增加一个对被解释变量Y有较大影响的解释变量时,残差平方和RSS的减小比(n-k-1)减小更显著,修正的拟合优度就增加。可见修正的拟合优度比一般的拟合优度更准确地反映了解释变量对被解释变量的影响程度。
如果增加一个对被解释变量Y没有多大影响的解释变量时,RSS的减小没有(n-k-1)减小明显,会减小。表明不应该引入这个不重要的解释变量。37XianghongShirleyWang由于因为n-1≥n-k-1
>
0,所以修正后的拟合优度不大于R²从而有:又1-R²0,即:38XianghongShirleyWang修正后的拟合优度可能为负值39XianghongShirleyWang赤池信息准则(Akaikeinformationcriterion,AIC)施瓦茨准则(Schwarzcriterion,SC)
赤池信息准则和施瓦茨准则
为了比较所含解释变量个数不同的多元回归模型的拟合优度,常用的标准还有:
这两准则均要求仅当所增加的解释变量能够减少AIC值或SC值时才在原模型中增加该解释变量。40XianghongShirleyWang二、方程的显著性检验(F检验)
方程的显著性检验,旨在对模型中被解释变量与解释变量之间的线性关系在总体上是否显著成立作出推断。
即检验模型Yi=0+1X1i+2X2i++kXki+ui
,i=1,2,,n中的参数j
是否显著不为0。
可提出如下原假设与备择假设:
H0:
1=2==k=0H1:j不全为041XianghongShirleyWang
F
检验的思想来自于总离差平方和的分解式:
TSS=ESS+RSS
如果这个比值较大,则X的联合体对Y的解释程度高,可认为总体存在线性关系,反之总体上可能不存在线性关系。因此,可通过该比值的大小对总体线性关系进行推断。42XianghongShirleyWang
根据数理统计学中的知识,在原假设H0成立的条件下,统计量
服从自由度为(k,n-k-1)的F分布。
给定显著性水平,可得到临界值F(k,n-k-1),由样本求出统计量F的数值,通过F
F(k,n-k-1)或F≤F(
k,n-k-1)来拒绝或接受原假设H0,以判定原方程总体上的线性关系是否显著成立。43XianghongShirleyWang拟合优度检验与方程显著性检验的关系拟合优度检验与方程显著性检验是从不同原理出发的两类检验。区别:前者是从已经得到估计的模型出发,检验它对样本观测值的拟合程度,不考虑统计量的概率分布;后者是从样本观测值出发,检验模型总体线性关系的显著性。联系:模型对样本观测值的拟合程度高,模型总体线性关系的显著性就强。44XianghongShirleyWang拟合优度与F值的重要关系式(1)由可推出:与当时,F为无穷大。当时,F=1;越大,F值也越大;F与同向变化:45XianghongShirleyWang拟合优度与F值的重要关系式(2)由可推出:46XianghongShirleyWang三、变量的显著性检验(t检验)方程的总体线性关系显著每个解释变量对被解释变量的影响都是显著的。因此,必须对每个解释变量进行显著性检验,以决定其是否可以作为解释变量被保留在模型中。这一检验是由对变量的t检验完成的。47XianghongShirleyWangt
统计量
由于,以Aii
表示矩阵
主对角线上的第i个元素,于是参数估计量的方差为:
其中2为随机误差项的方差,在实际计算时,用它的估计量代替:
48XianghongShirleyWangt
检验
设计原假设与备择假设:
H1:j
0
给定显著性水平,可得到临界值t/2(n-k-1),由样本求出统计量t
的数值,通过
|t|t/2(n-k-1)或|t|≤t/2(n-k-1)来拒绝或接受原假设H0,从而判定对应的解释变量是否应包括在模型中。
H0:j
=0
(j=1,2…,k)
49XianghongShirleyWang注意:一元线性回归中,t检验与F检验一致
一方面,t
检验与F检验都是对相同的原假设H0:1=0进行检验;
另一方面,两个统计量之间有如下关系:
50XianghongShirleyWang参数的置信区间
这意味着,如果给定置信度(1-),从t分布表中查得自由度为(n-k-1)的临界值,那么t值处在(-t/2,t/2)的概率是(1-)。i
的水平的置信区间就可以表示为:51XianghongShirleyWang在实际经济活动中,经济变量的关系是复杂的,直接表现为线性关系的情况并不多见。如著名的恩格尔曲线(Englecurves)表现为幂函数曲线形式、宏观经济学中的菲利普斯曲线(
Phillipscurves)表现为双曲线形式等。但是,大部分非线性关系又可以通过一些简单的数学处理,使之化为数学上的线性关系,从而可以运用线性回归模型的理论方法。3.4
非线性关系的处理52XianghongShirleyWang多项式函数模型形如的模型为多项式函数模型。令原模型可以转化为线性形式:53XianghongShirleyWang例如:描述税收与税率关系的拉弗曲线:抛物线s=a+br+cr2
c<0
s:税收;r:税率设X1=r,X2=r2,则原方程变换为
s=a+bX1+cX2
c<0
又如:企业的总成本曲线,总成本可用产量的三次多项式近似表示:54XianghongShirleyWang双曲线函数模型设变量X与Y之间具有双曲线函数形式令,即做倒数变换,原模型可以转化为线性形式:双曲线函数模型的特点是随着X的无限增大,Y将趋近于极值。有些经济现象,如平均固定成本曲线、菲利普斯曲线等都具有这样的变化特点。55XianghongShirleyWang实例YX00>01>0
0YX00<01>0
0平均固定成本曲线Y:平均固定成本X:产量菲利普斯曲线Y:货币工资变化率X:失业率56XianghongShirleyWang对数模型(双对数模型)半对数模型线性-对数形式对数-线性形式对数(半对数)模型
例如:时间价值模型或增长率模型Yt=Y0(1+r)t取对数,并变量代换得。57XianghongShirleyWang指数函数模型指数函数模型的一般形式为:两边取对数,原模型可以转化为:令则可将原模型转化为标准的线性回归模型:58XianghongShirleyWang幂函数模型
例如:C-D生产函数:Q=AKLQ-产出量,K-投入的资本;L-投入的劳动
方程两边取对数:ln
Q=ln
A+
ln
K+ln
L函数模型的一般形式为:两边取对数,得:令则可将原模型转化为标准的线性回归模型:59XianghongShirleyWang复杂函数模型两边取对数后,得到:
其中:A-效益系数,是技术进步水平的反映;-替代参数;-分配参数;m-规模报酬参数。例如,两要素不变替代弹性CES生产函数60XianghongShirleyWang
设式中ln[K-
+(1-)L-]=f(
),在=0处作泰勒级数展开,取关于的线性项,即取0阶、1阶、2阶项得到:代入取对数的函数后可得到:同样可以转化为线性模型的形式。61XianghongShirleyWang该方法的原则仍然是使残差平方和最小。计量经济软件包通常提供这类方法,这里给出有关非线性回归方法的大致步骤如下:1.首先给出各参数的初始估计值(合理猜测值);2.用这些参数值和X观测值数据计算Y的各期预测值;3.计算各期残差,然后计算残差平方和∑e2;4.对一个或多个参数的估计值作微小变动;
5.计算新的Y预测值和残差平方和∑e2;
6.若新的∑e2小于老的∑e2,说明新参数估计值优于老估计值,则以它们作为新起点;
7.重复步骤4,5,6,直至无法减小∑e2为止;
8.最后的参数估计值即为最小二乘估计值。非线性最小二乘法(NLS)62XianghongShirleyWangNLS估计量的性质非线性最小二乘估计量不是正态分布的,不是无偏的,而且没有最小方差。非线性回归中的回归系数的推断通常是以大样本理论为基础。
变量的显著性检验(t检验)和回归方程整体的显著性检验(F检验)失效。63XianghongShirleyWang确定非线性模型形式的方法根据散点图来确定类型。确定类型一般是把样本观测值画成散点图,由散点图的形状来大致确定模型的类型。根据一定的经济知识背景。如商品的销售量与广告费用之间的关系,一般用S型曲线来描述,这是由于广告费用只有在一定范围内才会对销售量有明显的影响。有时对一个问题需要用不同的模型来拟合,以找到效果最好的一个。比较时,首先要从经济学角度考虑,其次从统计分析的角度分析。64XianghongShirleyWang对于模型给定样本以外的解释变量的观测值X0=(1,X10,X20,…,Xk0),可以得到被解释变量的预测值:它可以是总体均值E(Y0)或个值Y0的预测。但严格地说,这只是被解释变量的预测值的估计值,而不是预测值。为了进行科学预测,还需求出预测值的置信区间,包括
E(Y0)和
Y0的置信区间。
3.5模型的预测65XianghongShirleyWangE(Y0)的置信区间66XianghongShirleyWang~~在给定了置信度(1-)之后,E(Y0)的(1-)置信区间为67XianghongShirleyWangY0的预测区间=
0预测误差为:容易证明:
68XianghongShirleyWang标量E(uu')=2I69XianghongShirleyWang~~在给定了置信度(1-)之后,Y0的(1-)置信区间为70XianghongShirleyWang在实际建模过程中,被解释变量不但受定量变量的影响,同时还受定性变量影响,例如需要考虑性别、地区、不同历史时期、季节差异等因素的影响,这些因素也应该包括在模型中。许多经济变量是可以定量度量的,如:商品需求量、价格、收入、产量等。但也有一些影响经济变量的因素无法定量度量,如:职业、性别对收入的影响,战争、自然灾害对GDP的影响,季节对某些产品(如冷饮)销售的影响等等。为了在模型中能够反映这些因素的影响,并提高模型的精度,需要将它们“量化”。3.6
虚拟变量回归模型71XianghongShirleyWang
定量化表示定性信息是通过引入“虚拟变量”来完成的,根据这些因素的属性类型,构造只取“0”或“1”的人工变量,通常称为虚拟变量(dummyvariables)。一般地,在虚拟变量的设置中:基础类型,肯定类型取值为1;比较类型,否定类型取值为0。
如:为比较性别差异,可以设男性为1,女性为0,变量名可以设为male。72XianghongShirleyWang一个回归模型的解释变量都是虚拟或定性变量,这种模型被称为方差分析(ANOVA)模型。一个回归模型同时包含定量和定性(虚拟变量)的解释变量,这种模型被称为协方差分析(ANCOVA)模型。73XianghongShirleyWang虚拟变量的使用——截距项变动
例1:一个以性别为虚拟变量考察企业职工薪金的模型:其中:Yi为企业职工的薪金,Xi为工龄,
Di=1,若是男性,Di=0,若是女性。企业女职工的平均薪金为:企业男职工的平均薪金为:74XianghongShirleyWang假定2>0,则两个函数有相同的斜率,但有不同的截距。意即,男女职工平均薪金对工龄的变化率是一样的,但两者的平均薪金水平相差2
。可以通过传统的回归检验,对2
的统计显著性进行检验,以判断企业男女职工的平均薪金水平是否有显著差异。几何意义02年薪Y
男职工女职工工龄X75XianghongShirleyWang例2:在横截面数据基础上,考虑个人保健支出对个人收入和教育水平的回归。
教育水平考虑三个层次:高中以下、高中、大学及其以上。这时需要引入两个虚拟变量:模型可设定如下:76XianghongShirleyWang
在E(ui)=0的初始假定下,高中以下、高中、大学及其以上教育水平下个人保健支出的函数:高中以下:高中:大学及其以上:77XianghongShirleyWang假定3>
2,其几何意义:
大学及以上教育保健
高中教育支出低于高中教育收入02378XianghongShirleyWang
还可将多个虚拟变量引入模型中以考察多种“定性”因素的影响。
比如在例1中的职工薪金模型中,再引入代表学历的虚拟变量D2:本科及以上学历本科以下学历职工薪金的回归模型可设计为:79XianghongShirleyWang女职工本科以上学历的平均薪金:女职工本科以下学历的平均薪金:则不同性别、不同学历职工的平均薪金分别为:男职工本科以下学历的平均薪金:男职工本科以上学历的平均薪金:80XianghongShirleyWang虚拟变量的使用——斜率项变动
Y
X
Y
X
思考:如果出现了这样的图形,我们该如何使用虚拟变量解决模型的问题?81XianghongShirleyWang例:根据消费理论,消费水平C主要取决于收入水平Y,但在一个较长的时期,人们的消费倾向会发生变化,尤其是在自然灾害、战争等反常年份,消费倾向往往出现变化。这种消费倾向的变化可通过在收入的系数中引入虚拟变量来考察。如,设消费模型可建立如下:82XianghongShirleyWang模型中虚拟变量D以与X相乘的方式引入了模型中,从而可用来考察消费倾向的变化。假定E(ui)=0,上述模型所表示的函数可化为:正常年份:反常年份:83XianghongShirleyWang比如消费函数的例子中模型按照上面的形式构造,则有:截距项和斜率项都变动如果虚拟变量代表的因素对模型的截距项和斜率项都产生影响,则一般设定模型的形式如下:正常年份:反常年份:84XianghongShirleyWang例:考察1990年前后中国居民总储蓄—收入关系是否发生变化。85XianghongShirleyWang
以Y为储蓄,X为收入,可令:1990年前:Yi=1+2Xi+u1i
i=1,2…,n1
1990年后:Yi=1+2Xi+u2i
i=1,2…,n2
(2)11,但2=2
,即两个回归的差异仅在其截距,称为平行回归(ParallelRegressions);(3)1=1
,但22
,即两个回归的差异仅在其斜率,称为汇合回归(ConcurrentRegressions);(4)11,且22
,即两个回归完全不同,称为相异回归(DissimilarRegressions)。(1)1=1
,且2=2
,即两个回归相同,称为重合回归(CoincidentRegressions);86XianghongShirleyWang于是有:可分别表示1990年后期与前期的储蓄函数。
在统计检验中,如果3=0的假设被拒绝,则说明两个时期中储蓄函数的斜率不同。将n1与n2次观察值合并,并估计以下回归:Di为引入的虚拟变量:87XianghongShirleyWang具体的回归结果为:
(-6.11)(22.89)(4.33)(-2.55)由2与3的t检验可知:参数显著地不等于0,强烈示出两个时期的回归是相异的,储蓄函数分别为:
=0.98361990年前:1990年后:88XianghongShirleyWang
许多变量展示出季节性的变异(如商品零售额、电和天然气的消费等),我们在建立模型时应考虑这一点,这有两种方法:(1)在估计前对数据进行季节调整;(2)采用虚拟变量将季节性差异反映在模型中。例:设Y=购买汽车的实际支出额
X=实际总消费支出使用美国1973(1)-1980(2)的季度数据(按1975年价格计算),得回归结果如下:季节虚拟变量的使用89XianghongShirleyWang
这一结果很不理想,低R2值,低t值,X的符号也不对。考虑到可能是季节性变异的问题,我们建立下面的模型:
其中,Q1={
Q2={
Q3={
注意:我们仅用了3个虚拟变量就可表示4个季度的情况。各季度的截距分别为:1季度:0+12季度:0+23季度:0+34季度:090XianghongShirleyWang估计结果如下:
所得到的实际总支出的参数估计值(0.1044)是一个不受季节变动影响的估计值。91XianghongShirleyWang虚拟变量的设置原则
每一定性变量所需的虚拟变量个数要比该定性变量的类别数少1,即如果定性变量有m个类别,只能在模型中引入m-1个虚拟变量。如果引入m个虚拟变量则会违背假设5,造成OLS无法估计,落入“虚拟变量陷阱”。一般不指定其虚拟变量的那一组被称为基组,所有其他的组都与基准组进行比较。92XianghongShirleyWang3.7实例我国居民人均消费支出与人均GDP科布-道格拉斯生产函数工资与工作经历93XianghongShirleyWang我国居民人均消费支出与人均GDP资料来源:根据《中国统计年鉴》(2001)整理94XianghongShirleyWang双变量模型的回归结果95XianghongShirleyWang加入上一年人均消费作为解释变量的回归结果96Xianghon
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 2026商业地产行业市场产业升级供需调研及商业投资规划前景讨论
- 2026中国手机配件行业市场发展态势与创新投资策略
- 2026农产品出口行业供需发展现状研究分析条件投资评估计划实施发展报告
- 2026日本汽车制造业技术革新竞争格局与发展趋势研究报告
- 2026中国新能源电池模组行业竞争格局与增长潜力研究报告
- 2026中国物流行业智能化转型趋势与投资战略分析报告
- 2026中国通信设备行业市场发展分析及行业前景预测与投资布局规划`
- 2026中国智能物流仓储系统设备制造行业市场供需调研及投资发展方向研究报告
- 2026 年夏季青少年网络追星周边购买诈骗防范课件
- 2026特冈教师面试题及答案
- 京东七鲜自有品牌运营
- 光伏电站现场工作管理流程
- 湖北省武汉市2026届高一数学第二学期期末监测试题含解析
- 2026年浙江省杭州市技能人才评价考评员考试题库及答案
- 代理记账业务内部规范
- XX镇(乡)卫生院医院感染管理责任制实施细则
- 2025中国银行社会招聘笔试历年典型考题及考点剖析附带答案详解
- 电力公司总经理面试题及答案
- 2022电力现货市场问答101条编
- 汇川变频器培训课件
- 华润电力控股有限公司招聘笔试题库及答案2025
评论
0/150
提交评论