7 补充专题.ppt_第1页
7 补充专题.ppt_第2页
7 补充专题.ppt_第3页
7 补充专题.ppt_第4页
7 补充专题.ppt_第5页
已阅读5页,还剩43页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

1、卞,中央财经大学统计学院,1,第7章补充课题,卞,中央财经大学统计学院,2,面板数据模型定性选择模型,主要内容,卞,中央财经大学统计学院,3,7.1面板数据模型,集合数据是横截面数据与时间序列数据相结合的数据。如果混合数据中包含的观测值来自同一批地区、公司、个人或其他个人的不同数据,这种混合数据称为面板数据。基于面板数据的回归模型称为面板数据模型。面板数据模型已经成为计量经济学的一个独立分支。卞,中央财经大学统计学院,4,面板数据在经济分析,宏观经济分析中的应用:目前应用广泛,数据容易获取。例如,在对许多地区的时间序列数据进行微观经济分析时,很难获得微观个人(家庭和个人)的时间序列数据,中央财

2、经大学统计学院卞静雅5就是一个例子。格伦菲尔德提出的投资理论研究数据引自古扎拉蒂教科书,是1935年至1954年间四家公司(通用电气、通用汽车、美国钢铁、西屋电气)的制造商价值。三个变量的信息见表161:工厂设备库存(pl)和总投资(I)。我们用这个面板数据具体分析:企业的实际价值和股本如何决定实际总投资。卞静雅,中央财经大学统计学院,6。在面板数据模型的三种情况下,即情况1中,当横截面中没有个体影响或结构变化时,公共最小二乘估计给出了一致的有效总和估计。相当于将多个时期的横截面数据放在一起作为样本数据。卞,中央财经大学统计学院,7,案例2,具有可变截距的面板数据模型。个人影响在横截面上是不同

3、的。个体影响由模型中反映个体差异的被忽略变量表示,这些变量分为固定影响和随机影响。卞,中央财经大学统计学院,8,案例3,变系数面板数据模型。除了个人的影响,横截面上的经济结构也在变化,因此不同横截面单位的结构参数是不同的。边,中央财经大学统计学院,9,表观非相关回归(SUR)是一组看似不相关但实际相关的回归方程。在看似不相关的回归中,每个回归实际上都是相关的。它允许每个回归方程的扰动项之间的交叉方程相关,因此SUR估计程序可以利用扰动项的相关性来提高估计值。各种回归之间的任何相关都是有价值的信息,可以被SUR程序用来改进系数估计。卞,中央财经大学统计学院,10,表面不相关回归的具体步骤,用方法

4、分别估计各方程,计算并保存回归得到的残差;这些残差用于估计不同回归方程的扰动项的方差和扰动项之间的协方差;在前一步骤中估计的干扰项的方差和协方差被用于执行广义最小二乘法,以获得每个方程的系数的估计值。卞,中央财经大学统计学院,11 .通过表面不相关回归得到的估计值是一致的。在以下两种情况下,表面不相关回归的结果与OLS回归的结果相同:如果每个方程的扰动项之间的协方差等于0;如果每个方程的自变量是相同的,并且每个自变量的每个观测值是相同的。边,中央财经大学统计学院,12,固定效应模型和随机效应模型,固定效应模型(FEM)解释了不同截距和相同斜率系数的横截面上个体之间的差异。处理地区、公司、人员或

5、其他跨部门个人之间差异的想法是允许截距发生变化。不同横截面个体的截距不同,但每个行业的截距保持不变像固定影响模型一样,随机效应模型通过允许截距改变来处理个体之间的差异,但是改变的数量是随机的。如果横截面个体被随机选择来代表更大的群体,则采用随机影响模型更合适。具有不同横截面的个体的不同截距被认为是从正态分布群体中随机选择的。卞,中央财经大学统计学院,13,固定影响模型。固定影响模型的一般形式是:具体到我们的例子,模型可以设置如下:固定影响模型通过使用虚拟变量来解决截距变化问题。固定影响模型的一般形式是:具体到我们的例子,模型可以设置如下:固定影响模型通过使用虚拟变量解决截距变化的问题。卞,中央

6、财经大学统计学院,14岁。设置虚拟变量。对于我们的例子,有4个企业,我们应该设置3个虚拟变量,因为设置3可以区分4个行业的截距,如果设置4个虚拟变量,我们就会陷入所谓的“虚拟变量陷阱”,导致完全多重共线性。在固定影响模型中,有另一种方法可以避免虚拟变量的陷阱,即去掉模型中的常项,然后为每个区间设置一个虚拟变量,例如D11的观测值属于GE;否则,0 D21观测值属于GM;否则,0 D31观测值属于我们;否则,0 D41观测值属于西部;否则,是0,卞静雅,中央财经大学统计学院,15。因为我们使用虚拟变量,固定影响模型也被称为LSDV(最小二乘虚拟变量)模型,或协方差模型。因为截距项的虚拟变量捕捉了

7、横截面中个体之间的差异,所以LSDV模型拟合的结果通常比情况1中估计的结果更好。中央财经大学统计学院的卞静雅(16岁)用f检验对变截距假说进行了检验。原始假设和替代假设分别为:通过估计约束模型得到残差平方和RSSR。估计无约束模型,得到残差平方和。使用f统计来判断:g是约束条件,在本例中是g3。边,中央财经大学统计学院,17,固定影响模型也可以通过添加斜率虚拟变量扩展到一般情况。然而,包含截距和斜率虚拟变量的模型几乎等同于每个行业的回归方法。它们之间的区别在于,在具有斜率虚拟变量的固定影响模型中,扰动项的方差对于整个样本必须是相同的,因为它是一个回归方程。如果单独进行回归,每个回归的扰动项的方

8、差可以不同,即每个行业或每个截面的个体的扰动项的方差可以不同。固定影响模型也可以设置为截距项随时间变化的形式(而不是随单个横截面变化)。固定影响模型的推广,边,中央财经大学统计学院,18,随机影响模型,固定影响模型假设不同企业的截距之间的差异是确定的,而不是随机的,它假设截距是不同的,因为每个企业都有一些不同的特点。随机影响模型假设示例中的每个企业都是从总体中提取的,截取之间的差异是由随机变化引起的。当具有横截面的个体是特定人群的样本时,通常使用随机影响模型,例如,从家庭调查获得的面板数据。边,中央财经大学统计学院,19,以随机影响模型的形式,随机影响模型把所有的数据放在一起进行回归,看起来像

9、常规的回归:没有截距虚拟变量,这使得其自由度大于固定影响模型。应当注意,上述公式中的截距项不同于OLS回归中的截距项,后者代表截距的平均值。实际截距因企业或其他横截面个人而异,企业间截距的差异反映在干扰项中。边,中央财经大学统计学院因此,单个企业的截距项可以表示为:即示例中的四个企业都是从更大的一组这样的企业中提取出来的,这些企业的截距都具有相同的均值,每个公司的截距项的个体差异都反映在误差项中。因此,随机扰动项由两部分组成,即。前者是横截面或特定个体的误差部分,而后者是时间序列和横截面的混合误差部分。因此,随机影响模型中的扰动项将不满足OLS假设,即每个周期中的扰动项是不相关的,这意味着不能

10、使用OLS。边,中央财经大学统计学院,21,随机影响模型回归的具体步骤,对整个横截面时间序列混合样本进行回归;利用第一步得到的残差估计扰动项的方差和协方差;用第二步得到的方差协方差估计值进行GLS回归,并给出随机影响模型的GLS估计值;一些软件使用第三步的结果来估计每个横截面个体的截距和平均截距之间的差异。边,中央财经大学统计学院,22岁。与有限元法相比,当时间序列较长,截面较小时,两种模型的参数估计值基本相同,因此采用有限元法更为方便。当截面较多、时间序列较短时,两种方法有显著差异。如果样品中的界面元素不是从较大的样品中随机选取的,则使用有限元法。如果单个误差与一个或多个解释变量相关,快速眼

11、动估计器是有偏差的,而从有限元法获得的估计器是无偏的。如果有更多的截面和更短的时间序列,并且遵循快速眼动估计的基本假设,那么快速眼动估计比有限元估计更有效。边,中央财经大学统计学院,23,7.2定性选择模型。在实际建模中,有时我们需要建立一个回归模型,其中被解释的变量是虚拟变量,即因变量描述的是无法量化的事情,如乘坐公交车或自己开车上班,考研。在这些情况下,因变量是定性变量,我们可以通过定义虚拟变量来描述它们。因变量为虚拟变量的模型称为定性选择模型或定性反应模型。边,中央财经大学统计学院,24,定性选择模型的分类,如果只有两种选择,它们一般分别用0和1来表示,如0乘公交车和1乘自驾。这种模型被

12、称为二元选择模型,线性概率模型,LPM)概率模型逻辑模型如果有两个以上的选择(如去工作和骑自行车),定性选择模型被称为多项式选择模型。卞静雅,中央财经大学统计学院,25,线性概率模型(LPM)。线性概率模型的一般形式如下:不同于一般的多元线性回归模型,它只能取0和1两个值。解释变量可以包括正常变量和虚拟变量,观察值可以是个人、公司、国家或任何其他跨部门个人做出的决策。中央财经大学统计学院卞,26岁,以是否上研究生院为例,设定模型如下:结果是:中央财经大学统计学院卞,27岁,结果分析,假设学生A的平均成绩为3.5,家庭年收入为5万美元,Y的拟合值为:拟合值可以解释为学生决定上研究生院的概率。在L

13、PM,对斜率系数的解释也是不同的。斜率系数可以表示当其他解释变量不变时,解释变量的单位变化引起因变量等于1的概率的变化。在LPM模型中,解释变量的变化与虚拟因变量的值为1的概率成线性关系,因此称为线性概率模型。卞静雅,中央财经大学统计学院,28,线性概率模型中的问题Q1: LPM假设有一条线假设学生乙的平均绩点为4.0,家庭收入为20万美元,Y的拟合值为:假设学生丙的平均绩点为1.0,家庭收入为5万美元,Y的拟合值为-0.20。解决这个问题的一种方法是使所有负拟合值等于0,所有大于1的拟合值等于1。边,中央财经大学统计学院,29,线性概率模型中的问题,Q3:随机扰动项不是正态分布,而是服从二项

14、分布。Q4:LPM存在异方差,扰动项的方差为p(1-p),其中p是因变量等于1的概率,这对于每个观测值是不同的,因此扰动项的方差不是常数,导致异方差。WLS方法可以使用,但它不是很有效,会改变结果的意义。边,中央财经大学统计学院,30,线性概率模型中的问题,Q5:它不再是合适的拟合优度度量。事实上,这个问题不仅是LPM的问题,也是所有定性选择模型的问题。可使用的替代指数是模型正确预测的观测值的百分比。每个预测可以分为1或0。如果拟合值大于或等于0.5,则因变量的预测值被认为是1。如果小于0.5,则认为因变量的预测值为0。然后,将这些预测值与实际情况进行比较,计算出正确的预测百分比:边,中央财经

15、大学统计学院,31。LPM经常被用来研究影响人们做出某种决定的因素,一个选举的例子。假设候选人A和B竞选某个城市的市长,我们可以用二元选择模型来研究影响选民决策的因素。该模型是:其中:卞,中央财经大学统计学院,32,拟合结果,观测值:30=0.58=0.53残差平方和=3.15 f-统计学=11.87,因变量:cand1,预测精度达到90,卞,中央财经大学统计学院,33,我们需要的是一个具有以下二分性质的概率模型:随着增加,它也增加,但永远不会超过00的关系也就是说,“当它变小时,概率趋向于零,当它变大时,概率趋向于1。” ,如何解决LPM的问题?从几何图形的角度看,边,中央财经大学统计学院,34。假设二元选择模型如下:罗技模型和概率单位模型的区别在于在上述公式中设置了扰动项的分布,概率单位模型设置为正态分布,罗技模型设置为逻辑分布。罗技模型和概率单位模型在这里是不可观测的,通常被称为潜在变量。我们能观察到的是虚拟变量:卞,中央财经大学统计学院,35。从总和可以知道,乘以任何正数都不会改变,所以习惯上在这里假设,从而固定比例。其中f是u的累积分布函数。如果u的分布是对称的,那么我们可以

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论