高级基础统计 11_第1页
高级基础统计 11_第2页
高级基础统计 11_第3页
高级基础统计 11_第4页
高级基础统计 11_第5页
已阅读5页,还剩39页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

count

data

models计数模型•

离散计数模型的提出•

泊松回归模型•截断泊松回归模型•零膨胀回归模型•随机效应计数模型一、离散计数模型的提出1、经济社会研究中的离散计数问题•计数变量是取值为非负整数的变量•许多经济、社会问题的描述变量都为计数变量–

一定时间内发生事故的次数–

一年中公司申请的专利数量–

一定时间内变换工作的次数–

一定时间内到医院就诊的次数–

家庭生育孩子的数量–

学生在本科4年中不及格课程门数•

以这些变量为被解释变量,研究它们的影响因素,构成了计量经济学的一类问题。2、计量经济学中的离散计数数据模型•假设

y

是计数变量,x

是一组解释变量•常见的建模方法是选用线性模型E(y

x)=

x

β,

用OLS进行回归–

由于

y

0

,E(y

x)应该对所有x都非负,矛盾。•选用自然对数变换

log(y)–

在计数数据应用中难以实现,因为相当比例的y取值为0。•

当y没有上界时,最常用的模型是指数函数E(y

x)=exp(x

β)•

非线性最小二乘方法(NLS)可以用于估计离散计数模型,但效果不理想–

NLS

估计量是无效的,除非

Var(y

x)

是常数–

所有计数数据的标准分布都意味着异方差•

因此,非负整数和异方差特征决定,有必要引进描述非负整数特征的概率分布分析离散计数模型。•七十年代末以来,许多学者在计数数据模型的处理方法方面作出了较大贡献,包括:–

Gilbert(1979)提出了泊松回归模型,–

Hausman,Hall和Griliches(1984)提出了负二项回归模型和Panel方法,–

Gourier

,Monfort和Trogonon(1984)提出了仿最大似然法。•其中,最先提出的泊松方法在研究计数数据模型问题中应用得非常广泛。二、泊松回归模型1、概念泊松回归模型假设回归模型的随机成分有一个特殊的概率分布,即泊松分布。泊松分布适用于计数数据。所谓计数数据,指在给定的一段时间内,一个特定事件发生的次数。下面的计数数据实例适用于泊松分布:在给定的一段时间内(如一年),某个繁忙的交叉路口所发生的交通意外事件数;接线总机在一小时内所接到的电话来电数目。概率密度函数为图表示在不同入值下的泊松分布。在不同λ值(0.5,2和7)下的泊松分布模型化的目标是要找到一个D值小的模型,因为它表示条件化平均数或期望值

与观察值

相近。对于泊松模型,因为所以,2、例题收集了某地的事故数据。这些数据是从原始研究中筛选出来的数据集,包括来自四个区域的多个时间段和五种不同交叉路口类型的数据。在小路有两条车道、大路有四条车道的三脚停车控制交叉路口上,对伤害事故使用了一套简化的解释变量。根据之前的相关研究(Miaou和Lum,1993年;Miaou,1994年;Shankar等人,1995年;Poch和Mannering,1996年;Milton和Mannering,1998年;Harwood等人,2000年),我们认为事故数据近似于泊松或负二项分布。表12.1概述了研究中的变量。表12.2显示了对事故数据进行泊松回归估计的参数估计值。该模型包含一个常数和四个变量:两个年平均日交通量(AADT)变量、中线宽度和车道数量。与预期相反,主干道年平均日交通量的影响似乎小于次干道年平均日交通量。此外,随着中间线宽度的增加,事故也会减少。最后,交叉口附近的车道数量会增加交叉口伤害事故的数量。估计参数的符号与预期相符。表变量描述最大/最小值观测平均值观测标准差区域指标(如果数据来自区域1,则为

1,如果来自区域2,则为

0)1/00.290.45在观察期内发生的伤害事故次数13/02.623.36主要道路的年平均日交通量33058/2367128706798次要道路的年平均日交通量3001/15596679主要道路的中位宽度(米)12/01.252十字路口中心

80米范围内的车道数量15/03.103.90表12.1表表12.2变量描述估计参数t估计常数-0.826-3.57主干道年平均日交通量0.00008126.90次干道年平均日交通量0.0005507.38宽度中位数(米)-0.0600-2.7380米交叉路口的车道数0.07484.54观察数84

受限对数似然(仅常数项)-246.18

收敛时的对数似然-169.26

Chi-squared(相关p值)153.85(<0.0000001)

0.4792

176.5表泊松回归模型的数学表达式如下:三、截断泊松回归模型1、概念

在日常收集交通数据时可能会出现截断数据的情况。例如,通勤者每周因交通拥堵而改变下班时间(从工作地点到家庭的通勤)的次数将被截断为5次,这是任何一周内改变下班时间的最大次数。在估算泊松回归模型时,如果不考虑这种截断,就会导致参数向量β的估算出现偏差,从而得出错误的推论。幸运的是,泊松模型很容易调整以考虑这种截断。右截断泊松模型可写成2、例题请看前例中使用的通勤者样本。虽然我们从该地区进行的出行调查中获得了204名上班族的数据(见Mannering和Hamed,1990a),但其中只有96名上班族表示他们曾经推迟过从工作地点到家的出发时间。对于这96名通勤者,我们希望建立一个模型,计算他们在上周为避开交通拥堵而改变工作到家的出发时间的次数。请注意,尽管这96名乘客样本中的每个人都表示他们有时会推迟时间,但其中有些人在上周可能并没有推迟时间,因此会出现零。这些数据都是非负整数,因此非常适合采用泊松回归方法。不过,由于工作周只有5个工作日,因此数据是截断的。表12.4列出了可用于模型估计的变量。从因变量的汇总统计来看,每周出发时间变化的平均数为1.833,方差为1.877(标准差为1.37)。这些数字非常接近,可以肯定符合均值和方差相等的泊松假设。模型估计结果见表12.5,相应的平均边际效应见表12.6。表12.4可用于模拟每周出发时间变更次数的变量表12.4可用于模拟每周出发时间变更次数的变量(续)表12.5每周出发时间变更次数的截断泊松回归变量描述估计参数t估计常数-0.931-2.371号公路指标(如果上班到家的主要路线包括

SR-520,则为

1,否则为

0)-0.567-2.182号公路指标(如果上班到家的主要路线包括

I-5,则为

1,否则为

0)-0.377-1.99家庭中的汽车数量-0.124-1.47灵活工作时间指标(如果上班族有灵活的工作时间,则为

1,否则为

0)-0.397-2.22上班到家的距离(单位:公里)-0.0142-1.20汽车指标(如果上班族使用汽车,则为

1,否则为

0)0.2791.42年轻上班族指标(如果上班族不到

31岁,则为

1,否则为

0)0.2911.72观察数96

归零时的对数似然-187.24

收敛时的对数似然-149.02

0.204表12.6所示截断泊松回归模型的平均边际效应结果表明,上班到回家路线包括1号公路和2号公路的通勤者推迟出发时间的可能性较小。边际效应显示,1号公路用户每周平均发车时间变化减少了0.874次,2号公路用户减少了0.582次。研究还发现,家庭中汽车数量越多,出发时间变化越小,每增加一辆汽车,每周平均出发时间变化平均下降0.191。这一结果可能反映了汽车数量越多的家庭在时间安排上的灵活性越小。边际效应显示,工作时间灵活的通勤者每周平均出发时间变化平均下降了0.613。这可能是因为上班时间灵活的通勤者会调整上班时间,以避开下午的交通高峰,从而较少推迟上班到家的出发时间。研究还发现,随着上班地点到家的距离增加,每周平均出发时间变化也随之减少(平均每公里减少0.022)。最后,使用汽车的通勤者和年龄小于31岁的通勤者每周平均出发时间变化率都较高(如表12.6所示,分别为平均0.430和0.448)。四

负二项回归模型原理常见的分析错误是不满足泊松分布的属性,即当

时,限制均值和方差相等。如果不满足这一相等,则称数据分散不足(

)或分散过度(

),如果不采取纠正措施,参数向量将出现偏差。负二项模型是通过重写方程得出的,即对于每个观测值i,方差与均值关系如下原理负二项分布的形式为参数α通常被称为过度分散参数,

是一个伽马函数。由此得出似然函数原理负二项分布的形式为参数α通常被称为过度分散参数,

是一个伽马函数。由此得出似然函数原理例题考虑上一节例题中的截断泊松回归。回想一下,在这个例子中,每周出发时间变化的平均数为1.833,方差为1.877(标准差为1.37)。由于这些数字非常接近,我们预计泊松回归是正确的模型。事实上,当使用表12.7中的数据对截断负二项模型进行估计时,得出的α估计值为0.00000898,标准误差为0.1093(得出t统计量为0.000082)。由于这个α值显然与零无显著差异,我们可以断定泊松模型是合适的(在这种情况下,泊松模型和负二项模型收敛时的对数似然值之差也几乎为零,这再次反映了负二项模型在统计上是不合理的)。五

零膨胀泊松模型零膨胀模型(Zero-Inflated

Models)•在某些情况下,如问卷调查“上周有多少次网上购物?”

,

答案为零,可能从来不上网购物,或者恰好上周没有上网购物。•在上述情况下,被解释变量有较多的零值,上述数据产生过程没有被正确刻画,会导致过度离散(overdispersion)•

上述零值即多余数据零膨胀泊松模型为了解决零膨胀计数过程的现象,人们开发了零膨胀泊松(ZIP)和零膨胀负二项(ZINB)回归模型。ZIP模型假定事件

是独立的,模型为pi是处于零状态的概率,y是每周期的事件数。最大似然估计用于估计ZIP回归模型的参数,并可通过似然比检验构建置信区间。零膨胀泊松模型ZINB回归模型采用类似的表述方式,事件是独立的,并且零膨胀泊松模型为了检验使用零膨胀模型而不是传统模型是否合适,Vuong(1989年)提出了一种非嵌套模型的检验统计量,该统计量非常适合指定分布(泊松或负二项)的情况。该统计量的计算公式为(对于每个观测值i)。

是模型1的概率密度函数

是模型2的概率密度函数零膨胀泊松模型由于过度离散几乎总是包括过量零点,要确定过量零点是来自真正的过度离散还是来自潜在的分裂机制并非易事。这可能导致人们错误地选择负二项模型,而正确的模型可能是零膨胀泊松模型。例如,简单的负二项分布给出了对于零膨胀泊松模型,可以证明因此pi(1-pi)可能被误解为α,需要比较ZINB和负二项的Vuong统计表12.8使用Vuong统计量和过度分散参数α在负二项(NB)、泊松、零膨胀泊松(ZIP)和零膨胀负二项(ZINB)模型中选择模型的决策指南(使用97.5%置信水平)例题仍然使用截断泊松回归的通勤者样本例题。在该地区的204名通勤者样本中,有108人(见Mannering和Hamed,1990年)表示,他们从未因拥堵而改变过从工作地点到家庭的出发时间。此外,在这些表示有时会推迟行程的通勤者中,有96人在上周并未因拥堵而改变其正常的出发时间。当使用全部204名乘客时,零膨胀泊松模型是合适的,因为我们知道有108人表示处于“零状态”,其余96人在上周改变出发时间的次数遵循泊松过程(截断泊松回归的例题)。例题表12.9列出了零膨胀泊松估计结果(由于出发时间变化的最大次数为5,因此进行了右截断)。变量描述估计参数t估计Poisson出发-时间变化计数(州)

常量0.8144.221号公路指标(1,如果通勤者的主要工作到家路线包括SR-520,否则为0)-0.602-2.522号公路指标(1,如果通勤者的主要工作到家路线包括I-5,否则为0)-0.295-1.36低收入指标(如果通勤者的家庭年收入低于

12

万元,则为

1,否则为0)0.2811.37灵活工作时间指标(如果通勤者有灵活的工作时间,则为

1,否则为0)-0.263-1.31零出发-时间变化状态

常量11..0515.34汽车指标(如果通勤者使用汽车,则为

1,否则为0)-1.111-1.65D级服务水平指标(如果通勤者在从工作地点到家庭的通勤过程中面临D级或更差的服务水平,则为1、0否则为0)-2.941-2.45上班到家通勤的实际旅行时间与自由流动旅行时间之比-4.753-3.29观测数据的数量204

收敛时的对数似然比(泊松)-288.62

收敛时的对数似然比(零膨胀泊松)-187.18

用于检验零膨胀泊松与正常计数泊松模型的

Vuong统计量8.95例题结果显示,在计数州,上班到回家的路线包括1号公路和2号公路的通勤者推迟出发时间的可能性较小。结果还显示,家庭年收入低于30,000美元的通勤者更有可能改变出发时间,而那些工作时间灵活的通勤者每周改变出发时间的可能性较小。年薪为210000元的通勤者更有可能改变他们的出发时间,而那些有灵活工作时

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论