高级基础统计 2_第1页
高级基础统计 2_第2页
高级基础统计 2_第3页
高级基础统计 2_第4页
高级基础统计 2_第5页
已阅读5页,还剩41页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

RandomParametersModels

随机参数模型•随机参数多项式逻辑模型•随机参数有序概率模型•随机参数计数模型•随机参数持续时间模型•随机参数线性回归模型•均值和方差具有异质性的随机参数一、随机参数多项式逻辑模型虽然第1章揭示了多项式logit模型适用于许多应用,但它也描述了一些弱点,如果不

满足基本假设,这些弱点可能导致错误的参数估计。随机参数logit解决了标准多二项logit(MNL)模型的几个弱点,允许参数值在不同的观测值之间变化。在标准多二项logit的推导和应用中,所做的假设是参数在所有观测值中都是固定的。如果这一假设不正确,就会导致参数和结果概率的估计值不一致。为了考虑到参数在不同观测结果之间可能存在的差异,采用随机参数或混合对数模型是合适的。考虑一个确定离散结果概率的函数,如16.1所示,βi是离散结果i的可估计参数向量,Xin是决定观察n的离散结果的可观察特征(协变量)向量,εin是干扰项。16.1假设扰动为极值I型分布,则标准多项式对数形式为

Pn(i)是观测值n产生离散结果i的概率现在定义一个混合模型(具有混合分布的模型),其结果概率定义为

是β的密度函数,ψ指的是该密度函数的参数向量16.216.3将方程16.2代入方程16.3即可得到混合logit模型,对数似然函数为N是观测值总数,I是结果总数,δin的定义是:如果观测值n的离散观测结果为i,则δin等于1,否则为0例题1.采用随机参数logit模型进行估计,以确定警方报告的事故中被归类为仅造成财产损失、可能造成伤害和明显造成伤害的事故比例。某地高速公路的事故数据被用来估算该模型。这些事故数据是针对特定路段收集的,其长度由高速公路的中间隔离带(安全护栏、缆绳或地形护栏)决定。因此,一个路段的起点被确定为上一个隔离栅的终点(或起点),而终点则被确定为下一个隔离栅的终点(或当前隔离栅的终点)。数据包括275个不同长度的路段,平均路段长度约为2.4公里,标准偏差约为2.7公里。根据警方报告的1990年各路段发生的事故,确定了事故伤害-严重程度的比例。表16.1列出了可用于模型估计的变量。例题2.采用混合对数模型进行估计,以确定未造成人员伤亡、可能造成人员伤亡(警官在事故现场确定伤势最严重者可能受伤的事故)和明显造成人员伤亡(警官在事故现场确定伤势最严重者明显受伤的事故,包括非致残性伤亡、致残性伤亡和死亡事故)的事故比例。因变量是这些受伤严重程度类型的碰撞频率,通常使用最大似然法估算(Greene,2007年)。为了估算可能的混合分布(见公式(16.4)),根据Bhat(2003年)等人早期研究的建议,使用了200个Halton抽样。模型估计结果见表16.2(由于数据缺失,在最初的275个路段中,只有258个路段用于模型估计)。表16.1可用于建立事故严重程度比例模型的变量表16.1可用于建立事故严重程度比例模型的变量(续)变量编号变量描述21线路段中的最大坡度差(百分比22以英里为单位的路段切线长度23路段中水平曲线的数量24路段上的最小曲线半径(米)25路段出入口控制(0表示无,1表示部分,2表示全部)26中间线宽度(1表示小于10米;2表示10-13

米;3表示13-16米;4表示

16-19

米;5表示大于

19米)27摩擦值(0至

100,100为高值)28每条车道的日均行驶量(以辆为单位)29路段坡度(0表示平坦,1表示轻微,2表示中等,3表示较高)30表示路段中的互通式立交桥数量31每月平均降水量(厘米)32每月平均降雪量(厘米)表16.2显示了八个具有统计意义的模型参数,包括常数。其中四个参数根据正态分布在不同路段群体中变化(考虑的拟合度较低的分布为对数正态分布、均匀分布和三角形分布)。另外四个参数在整个路段人群中是固定的,因为其参数分布的估计标准偏差与零相比在统计上不显著(这些固定参数估计值包括无伤害和可能伤害函数的常数)。表16.2事故严重程度比例的混合对数估计结果变量描述参数估计t估计无伤害常数3.303.54每条车道的年均日行车量(每条车道的车辆数)0.150E-041.37路段最小曲线半径(千米)(参数分布的标准偏差)-0.0918(0.111)-1.57(3.44)可能造成的伤害常数3.463.24交通流中卡车(所有卡车类型)的百分比(参数分布的标准偏差)-0.164(0.132)-3.01(2.65)明显伤害摩擦值(0至

100,100为高值)0.05913.01每英里路段长度的互通式立交数量(参数分布的标准偏差)-2.22(4.07)-2.75(3.18)每英里路段长度上的坡道中断数量,由垂直曲线或垂直拐点的存在来定义,垂直曲线长度低于最小曲线长度的坡道变化除以路段长度(参数分布的标准偏差)-0.297(0.458)-2.25(2.45)观测点数量258零点对数似然

-5116.24收敛时的对数概率,-4457.39

0.13至于具体的估算结果,每条车道的年日行车量在无伤害函数中产生了一个正的固定参数,表明每条车道的车流量越大,事故不涉及伤害的概率就越大。这可能是交通拥堵造成的结果,因为车流量越大,车速越低,事故越不严重。为无伤害函数定义的路段最小半径产生了一个正态分布参数,其平均值为-0.0918,标准偏差为0.111。这表明,对于79.1%的路段来说,较高的最小半径(弯道最窄的路段不那么尖锐)会导致较低的无伤害事故概率和较高的严重事故概率。对于某些路段来说,驾驶员可能会通过更加谨慎地驾驶来补偿较急的弯道,从而降低其受伤概率。对于其余20.9%的路段,该参数为正值,表明最小半径越大,发生无伤害事故的可能性越大(发生更严重事故的可能性越小)。卡车在交通流中所占的百分比是为可能的伤害函数定义的,它产生了一个正态分布的负参数,平均值为-0.164,标准差为0.132,这表明在89.3%的路段中,卡车所占百分比越高,发生可能的伤害事故的可能性就越小,而发生其他类型伤害事故的可能性就越大。然而,在10.7%的路段中,卡车百分比的增加会提高可能发生伤害事故的概率。显然,卡车百分比的影响会因具体路段的不同而有很大差异。为证据-伤害函数定义的路段上的互通式立交密度(每英里互通式立交数量)产生了一个正态分布参数,其平均值为-2.22,标准偏差为4.07。这一结果表明,对于70.7%的路段而言,较高的互通式立交密度会降低发生明显伤害事故的概率(从而增加发生伤害严重程度较低的事故的可能性)。这可能反映了高互通密度对降低车速的影响。然而,在29.3%的路段中,增加互通式立交密度会增加发生明显伤害事故的可能性。这表明,对于某些路段来说,高互通式立交密度可能带来的车速降低并不足以克服因互通式立交增加车辆冲突路径而增加的碰撞风险。最后,为证据-伤害函数定义的路段断坡密度(该变量的详细说明见表16.1)产生了一个正态分布的随机参数,其平均值为-0.297,标准偏差为0.458。这意味着,对于74.2%的路段来说,较高的断坡密度会降低发生明显伤害事故的概率(从而增加发生伤害严重程度较低的事故的可能性),而对于25.8%的路段来说,较高的断坡密度会增加发生明显伤害事故的概率。在某些路段,较高的断坡密度降低了车速,从而降低了事故的严重程度,而在另一些路段,车速的降低不足以克服这种路面高差变化可能带来的额外危险。二、随机参数有序概率模型考虑一个有序结果,其可能结果为极不可能、不可能、不确定、可能和极可能,并将未观察变量z定义为解释变量的线性函数,μ是yn的可估计参数(阈值),与模型参数β共同估计。假设εin在各观测值之间呈正态分布,则每个观测值n的五个特定有序响应的概率为为了在这个有序概率模型中考虑随机参数,可估参数的写法如下βn是可估算参数的向量,可能在n个观测值中各不相同;β是所有观测值的平均参数估计向量;ωn是随机分布项的向量三、随机参数计数模型与logit模型的情况类似,计数数据模型中也可以引入随机参数。考虑前面介绍的基本泊松模型yn是非负整数计数,P(yn)是观测值n在某个时间段(如一年)内出现yn个计数的概率,λn是观测值n的泊松参数,等于观测值n每年的预期计数次数E(yn)泊松回归的估计方法为与有序概率模型一样,为了在计数数据模型中考虑这种随机参数,可估算的参数也可写为对数概率可写成例题对随机参数计数模型进行估计,以确定例16.1中描述的275个路段上发生的事故总数(表16.1中显示了可用于模型估计的变量,但表16.1中的变量2除外,现在是每年所有严重类型的事故总数)。表16.3年事故频率的随机参数负二项模型275个路段中有17个路段的事故数为零;275个路段的年事故数(所有严重程度类型)的平均值为16.87,标准差为21.39(方差为457.5)。平均值与方差之间的差异表明,很可能需要采用负二项来解释数据中反映出的超离散性。表16.3所示的负二项模型估计结果显示,有8个参数(包括常数)具有统计意义,其中4个参数在各路段是固定的(其参数分布的标准偏差在统计上与零无差异),4个参数根据正态分布在各路段群体中变化(考虑的其他分布有对数正态分布、均匀分布和三角形分布;但正态分布的统计拟合效果更好)。该表还显示,负二项分布离散参数与零有显著差异,这表明标准泊松模型不适合这些数据。最后,表16.3中显示的对数似然值表明模型的整体拟合度很高,收敛时的似然函数比零时的似然函数有很大的增加。研究结果表明,随着路段车辆行驶里程的增加(年平均日交通量乘以365,再乘以路段长度,即为每年1亿车辆行驶里程),平均事故率也随之增加。各路段的估计参数呈正态分布,几乎所有路段都是正值(只有两个路段的参数略为负值)。该变量在所有分段中的平均值为每年行驶25.8万英里。这个相对较低的平均值解释了为什么边际效应如此之高,1亿英里车辆行驶变量每增加1个单位(是平均值的几倍),所有分段每年的平均事故数量就会增加25.18起。年降水量少于18厘米的路段事故较少。这一变量在所有路段中都是固定的,年降水量少于18厘米的路段每年平均减少4.84起事故(如边际效应所示)。相比之下,年降雪量大于12厘米的影响呈正态分布,63.6%的路段为负(降低事故频率),37.4%的路段为正(增加事故频率)。该变量可能反映了多车道高速公路在除雪措施、当地驾驶员对雪的反应(减速等)以及驾驶员对全州雪情的熟悉程度(华盛顿州有些地区很少下雪,而其他许多地区则经常下雪)方面的差异。摩擦力变量产生了一个负的固定参数,摩擦力值每提高一个点,事故频率平均降低0.153次(如边际效应所示)。请注意,结合表16.2中关于严重性的研究结果,摩擦力的增加会降低事故发生的可能性,

但一旦事故发生,严重性就会增加。四、随机参数持续时间模型按照计数模型的相同程序,在持续时间模型中引入随机参数(有关这些模型的细节,请参阅第11章)。也就是说,解释变量的作用不再是

,而是引入一个随机分布项

,解释变量现在对危害的作用是

,其中β现在在n个观测值中变化。与前面介绍的两个随机参数模型一样,我们再次使用了基于模拟的最大似然法(哈尔顿抽样再次成为随机抽样的有效替代方法)例题如表11.1所示,利用该地区96名上班族从上班到回家的延误时间数据,对随机参数时间模型进行了估算,并在例11.1、11.2和11.3中使用。随机参数Weibull时长模型的结果如表16.4所示。表中显示,之前估算的5个固定参数中,有3个是随机参数(之前估算的固定参数见表10.5)。将表11.5中的Weibull固定参数模型与表16.4中的随机参数模型进行比较,发现随机参

数模型有明显改善,收敛时的似然比为-88.63,而固定参数时的似然比为-93.80。这一发现非常重要,因为比较这两个模型值的似然比检验得出的统计量χ2为10.34(自由度为3,基于随机参数情况与固定参数情况的三个估计标准差参

数),表明在98.4%的置信水平下拒绝了固定参数Weibull正确的零假设。具体估算结果如表16.4所示,男性指标变量在整个人群中呈正态分布,88.1%的通勤者的延误时间增加,11.9%的通勤者的延误时间减少。实际行车时间与自由行车时间之比呈正态分布,除2人外,其余乘客均为负值。最后,工作地点的常住人口在通勤者中呈正态分布,除一人外,其他通勤者均为负值。表16.4为避免拥堵,上班族从工作地点到家的延迟时间(分钟)的随机参数Weibull模型估计结果五、随机参数线性回归模型随机参数模型也很容易应用于普通最小二乘法回归。在这种情况下,因变量是连续的,随机参数的添加同样,模型是通过模拟最大似然法与Halton抽样进行估计的。例题每年都会对大学的工程学研究生项目进行评估。评估的内容之一是同行打分,要求系主任和院长对各个大学的工程学研究生项目进行1到5分的评价,1分代表边缘,5分代表优秀。这样的量表表明了一种有序概率模型,但只提供了同行评估的平均分,而且是以十分位数为单位(如3.1、3.2、3.3等)。因此,这是一个适合普通最小二乘法回归的连续变量。不过,需要注意的是,数据的边界仍然在1和5之间,这表明可以使用下删减和上删减的tobit模型(见第3章和下一节),但应用随机参数tobit模型得出的结果几乎相同,因为没有一所大学处于1或5的边界(1.9是同行评估平均分的最低值,4.9是最高值)。我们收集了147所大学工程学专业的信息,因变量是根据2018年工程学研究生专业评级得出的工程学研究生专业的平均同行得分。表16.5列出了可用于建立大学工科研究生项目平均同行分数模型的变量。使用1000个Halton抽样,模型估计结果见表16.6表16.5可用于模拟大学工程学研究生项目同行平均分的变量表16.5可用于模拟大学工程学研究生项目同行平均分的变量(续)表16.6同行评估平均得分的随机参数线性回归

估计结果显示,工学院教师人数少于200人对同行评估平均分有显著影响。这是一个随机参数,在大约68%的大学中,这个较小的师资指标为负,32%的大学为正。研究发现,提高每名工科教师的研究生入学率对同行评估平均分有负面影响,而国家工程院院士的百分比对同行评估平均分有正面影响,但这两个变量在不同大学之间的影响差异很大(如统计意义上的随机参数所示)。最后,在工程学院变量中,谷歌学术h指数排名第十的工程学院教师对同行评估平均分有正向影响。根据定义,一名教师的h-index值表示该教师发表了h篇论文,每篇论文至少被引用了h次。研究还发现,整个大学的属性也会影响工科研究生项目的同行评分。表16.6显示,如果一所大学有5名或5名以上教师的谷歌学术引用次数超过50,000次,则其同行评估得分会有所提高;如果一所大学每年平均聘用的博士后研究人员数量较多(过去15年的平均值),则其同行评估得分会有所提高;如果一所大学的学生入学时的学业能力测试数学加口语(最高1600分)的10年平均分较高,则其同行评估得分会有所提高。这些全校变量均未对入学学生的随机参数(最高1600分)产生具有统计学意义的影响。这些全校变量均未产生具有统计意义的随机参数。六、均值和方差具有异质性的随机参数随机参数均值的异质性是通过让矢量βn成为可估计的参数来引入的,这些参数在不同观测值之间的变化情况如下

β是所有观测值的平均参数估计向量,Zn是观测值n中影响βn平均值的解释变量向量,

是可估计参数向量,ξn是随机分布项向量。扩展到包括均值和方差的异质性β是所有撞车事故的平均参数估计值,Zn是反映平均值异质性的解释变量向量,

是相应的可估计参数向量,Wn是反映标准差σn异质性的解释变量向量,

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论