高级基础统计 7_第1页
高级基础统计 7_第2页
高级基础统计 7_第3页
高级基础统计 7_第4页
高级基础统计 7_第5页
已阅读5页,还剩31页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

OrderedProbabilityModels

有序概率模型第一节有序离散数据模型第二节具有随机效应的有序概率模型第三节有序概率模型的局限性第四节有序Probit模型和有序Logit模型第一节

有序离散数据模型有序概率模型是通过定义一个非观测变量z得出的,该变量被用作数据序排序建模的基础。这个非观测变量通常被定义为每个观测值的线性函数(省略n下标),即其中,X是决定观测值n离散排序的解释变量向量,是可估计参数向量,是随机扰动。利用该方程,每个观测值的观测序数数据y定义为其中,μ是定义y的可估计参数(称为阈值),对应于整数排序,I是最高整数排序响应。μ是与模型参数共同估算的参数。

然后,估计问题就变成了确定每个观测值n的I特定有序响应概率的问题。如果假定ε在各观测值之间呈正态分布,均值=0,方差=1,则会产生一个有序概率模型,其有序选择概率为其中

是累积正态分布图15.1举例说明了5种可能的有序结果。图15.1μ0=0的有序概率模型示意图在估算时,方程可以写为μi和μi+1表示结果上限和下限。对数似然为如果观测n的离散结果为i,则δin等于1,否则为0。该方程得出的对数似然为如果假设等式

中的ε在各观测值中呈对数分布,均值=0,方差=1,则会产生有序logit模型,推导过程与有序probit模型相同。由于有序probit模型不存在估计无序离散数据的多叉probit模型时所遇到的估计困难,通常选择有序probit模型而不是有序logit模型,因为其基本假设是正态性。就评估有序概率模型中各个估计参数的影响而言,图15.2显示,βk的正值意味着xk的增加将明确增加最高有序离散类别结果的概率(图14.2中的y=5),并明确降低最低有序离散类别结果的概率(图15.2中的y=1)有序概率模型的问题在于对中间类别(图15.2中的y=2、y=3和y=4)的解释。根据临界值的位置,的正负对这些

正内部

部类别概率的影响并不一定明确。出现这种困难的原因是,向左或向右移动后,移动临界值之间的区域可能会产生增加或减少的概率(见图15.2)。图15.2随着βk的增加(μ0=0),有序概率模型的图示为了了解对内部类别的影响方向,对每个类别都计算了边际效应。对于指标变量,其影响计算为指标变量从0变为1时估计概率的差异,而所有其他变量均等于其平均值。对于连续变量,效应是通过部分导数计算得出的例题在某地区对279名通勤者进行了调查。调查的目的是收集乘客对高乘员车辆(HOV)车道(仅限2人或2人以上车辆使用的车道)的意见。表15.1列出了这项研究获得的变量。表15.1可用于研究对高负载车辆(HOV)车道意见的变量在其他问题中,通勤者被问及他们是否同意

其他问题中车道应向所有车辆开放,无论车辆乘载水平如何”(表15.1中的变量编号29)。该问题提供了

。非常不同意”、“不同意”、“中立”、“同意”、“非常同意

常的有序回答,观察到这五个类别的回答频率分别为32.74、21.71、8.54、12.10和24.91。为了解决定通勤者意见的因素,该调查问题适合采用有序probit模型。有序probit估计结果见表15.2。结果显示,通常独自驾车且年龄在50岁或以上的乘客更有可能非常同意、较少可能非常不同意HOV车道应向所有车辆开放。调查结果还显示,如果家庭收入高或低,通勤者被观察到改变正常路线和出发时间的频率越高(可能是为了避开交通拥堵),则越有可能非常同意(不太可能非常不同意)。工作时间灵活的通勤者也很可能非常同意(较少可能非常不同意)。最后,通勤者家庭拥有的有牌照机动车辆越多,他们表示强烈同意的可能性越小(表示强烈不同意的可能性越大)。该模型的统计评估与其他最大似然模型相同(t统计量、ρ2、χ2、似然比检验等)。估计的临界值没有任何直接解释,但在计算结果概率和边际效应时需要用到。表15.2高乘员车辆(HOV)车道应向所有车辆开放,无论车辆乘员水平如何"问题的有序Probit估计结果

(非常不同意、不同意、中立、同意、非常同意)模型的边际效应见表15.3。每个通勤者都有自己的边际效应,边际效应取决于X的值,表15.3中的值是整个人口的边际效应平均值,给出了自变量变化一个单位所导致的类别概率变化。对于指标变量,这给出了变量从0变为1后类别概率的变化。观察表15.3并使用参数估计的符号时,只能说明极端(最高和最低)类别的情况。例如,对于通常独自驾车的通勤者来说,只能说他们更有可能强烈同意,而较少可能强烈不同意。表15.3中显示的边际效应提供了更多关于变化幅度以及

以内部

部概率类别情况的信息。对于独自驾车的通勤者(相对于不独自驾车的通勤者)来说,他们

率非常不同意

常的概率将(平均)降低0.4316。他们不同意的概率将增加0.0332,中立的概率将增加0.0491,同意的概率将增加0.0929,非常同意的概率将增加0.2564。表15.3表15.2所示参数估计值的边际平均效应计算结果[y=1(强烈不同意),y=2(不同意),y=3(中立),y=4(同意),y=5(强烈同意)变量描述边际效益

独自驾车指标(如果通勤者的通常模式是独自驾车,则为

1,否则为

0)-0.43160.03320.04910.09290.2564灵活工作时间指标(如果通勤者有灵活的工作时间,则为

1,否则为

0)-0.1124-0.01390.00810.02340.0947高收入指标(如果通勤者的家庭年收入高于

700,000元,则为

1,否则为

0)-0.1438-0.03050.00620.02690.1413低收入指标(如果通勤者的家庭年收入低于

21

万元,则为

1,否则为

0)-0.12230.02950.00400.02190.1258家庭中有牌照的机动车数量0.03560.0043-0.0026-0.0075-0.0297高龄指标(如果通勤者年龄在

50岁或以上,则为

1,否则为

0)-0.0910-0.01660.00490.01790.0847在过去

5次通勤中,通勤者改变正常路线或出发时间的次数-0.0334-0.00400.00250.00700.0279第二节有随机效应的有序概率模型1.概念与估算其他类型的模型一样,数据库中的数据观测结果有时可能具有明显的相关性。例如,在时间序列数据中,每个个体在不同时间点上都有多个观测值,就会出现这种情况。或者在横截面数据中,一个人被重复使用,从而产生多个观测值。在这两种情况下,干扰相关性都会引起关注,因为每个人的未观测特征很可能是相关的。这种干扰相关性会违反干扰独立性假设,导致错误的参数估计。这个问题可以用随机效应模型来解决,该模型除了总体扰动项之外,还允许有一个特定个体的扰动项,以考虑每个个体特有的随机扰动。通过重写方程(16.1),传统的干扰项可被视为两个:每个观测值独有的传统干扰项

和个体特异性随机效应干扰项

(假定为正态分布,均值为0,方差为)下标i表示个体,下标g表示每个个体产生的观测数据组,所有其他术语如前定义。2.例题在某地区的高速公路上对56名受试者进行了调查。每位受试者驾驶车辆经过40个高速公路路段(因此,如果没有数据缺失,每位受试者可产生多达40个观测值)。当他们驶过测试路段时,他们被问到

观如果用1到5分来表示路面的粗糙程度,1分表示最平滑(或最好),5分表示最粗糙(或最差),您会如何给路面的粗糙程度排序?收集的数据包括所使用车辆的类型(小型货车、皮卡等)、车内和车厢内的环境温度、车内和车厢外的环境温度以及车内和车厢外的环境温度。

路面结构状况(PSC)是根据各种损坏的数量和严重程度,分别计算出柔性路面和刚性路面的结构状况,其数值从100(路面状况良好)到0(路面完全损坏)不等。表14.4列出了可用于模型估算的变量。表15.4可用于研究路面粗糙度意见的变量估计结果见表15.5。关于随机效应的重要性,请注意随机效应(豪斯曼检验)参数(σ)与零有显著差异,参数估计值为0.678,t统计量为6.47。这种高度显著性清楚地表明,利用随机效应对模型进行估计是有效的,而忽略个体参与者路面评分之间的干扰相关性将导致严重的模型规范错误(参数估计不一致)。表15.5的结果显示,随着IRI的增加(表明路面更粗糙),路面的使用年限增加,当路面表面可见修补时,路面更有可能被评为非常粗糙,而不太可能被评为非常平整。这些发现都与路面老化的预期一致,同样,PSC指数的增加也会降低路面被评为非常粗糙的可能性,增加路面被评为非常平整的可能性。对于那些年龄小于41岁的参与者来说,车内噪音水平越高,他们越有可能将路面评为非常粗糙,而将路面评为非常平整的可能性越小,这表明年轻的参与者可能对噪音水平更加敏感。最后,如果从一个路段到下一个路段的噪音增加超过4分贝,参与者更可能将路面评为非常粗糙,而将路面评为非常平整的可能性较低,这表明声音的相对增加是一个重要因素。表15.5用户感知粗糙度排名的随机效应有序Probit模型[因变量答案为介于1(非常光滑)和5(非常粗糙)之间的整数]该模型的平均边际效应见表15.6。如前一节的例16.1所述,边际效应提供了所有概率类别变化幅度的信息。举例说明,路面内径指数增加一个单位(1m/km),参与者将路面评为非常粗糙(1-5级中的5级)的概率平均增加0.0193,将路面评为1-5级中的4级的概率平均增加0.1228,将路面评为1-5级中的3级的概率平均增加0.1206。

在1-5级评分中被评为3级的概率增加0.1206,在1-5级评分中被评为2级的概率减少0.1579,被评为非常光滑(在1-5级评分中被评为1级)的概率减少0.1047。请注意,在所有结果中,任何一个变量的边际效应总和必须为零。表15.6表15.4所示参数估计的计算平均边际效应[y=1(非常平滑)至y=5(非常粗糙)第三节有序概率模型的局限性第三节

有序概率模型的局限性并不是所有有序数据都应该使用有序概率模型来建模,因为有很

多时候,无序概率模型对有序数据的拟合效果是最好的。出现这种情况是因为有序概率模型对X变量如何影响结果概率施加了限制。例如,假设我们正在模拟车辆事故的严重程度,其结果包括财产损失、受伤和死亡。这些显然是有序数据。假设决定受伤程度的关键因素之一是安全气囊是否展开。在有序模型中,安全气囊展开指标变量要么会增加死亡概率(降低仅造成财产损失的概率),要么会降低死亡概率(增加仅造成财产损失的概率)。但实际情况可能是,安全气囊的展开减少了死亡事故,但(安全气囊展开造成的)轻伤却增加了,从而增加了受伤的概率。在无序离散模型框架中,这将导致安全气囊展开变量的参数在死亡结果的严重性函数中为负值,在仅财产损失结果中也为负值(在安全气囊展开的情况下,受伤结果的概率增加)。如果存在这种情况,有序概率模型就不合适,因为它不具备明确控制内部类别概率的灵活性。当考虑在有序概率模型和传统多项式对数(MNL)模型之间做出选择时,如果模型的假设条件(特别是无关替代方案的独立性(IIA)属性)成立,传统多项式对数模型可能具有许多优势。除了能考虑变量更普遍的影响(见上文)外,它还能处理基于结果的抽样,而不会对参数估计造成严重后果。也就是说,如果MNLIIA特性成立,非随机抽样的结果仍能给出除特定常数以外的正确参数估计。在有序模型中,如果存在基于结果的样本,所有参数的估计值都将是错误的。警方报告的车辆事故受伤严重程度就是一个例子。由于较低严重程度的事故(仅涉及财产损失的事故)不太可能向警方报告,因此大多数事故数据库中仅涉及财产损失的事故严重不足。使用MNL模型估算严重性结果模型(可选择仅财产损失、可能受伤、明显受伤、致残性伤害和死亡),除常数项外,所有变量的参数估计值都是正确的。使用有序probit或logit模型估计该模型将导致对所有模型参数的错误估计。总之,在选择有序模型和无序模型时必须谨慎。在承认反应的有序性与失去无序结果模型所提供的规格灵活性之间,必须做出权衡。第四节有序Probit模型和有序Logit模型1.模型模型是二分结果模型的另外一个自然的延伸

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论