第六章 二元选择模型_第1页
第六章 二元选择模型_第2页
第六章 二元选择模型_第3页
第六章 二元选择模型_第4页
第六章 二元选择模型_第5页
已阅读5页,还剩48页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

1、第六章第六章二元选择模型二元选择模型第一节 线性概率模型模型第二节 二元LogitLogit离散模型第三节 二元ProbitProbit离散模型模型第四节 受限TobitTobit模型 二元离散选择模型的经济背景二元离散选择模型的经济背景 实际经济生活中,人们经常遇到二元选择问题。实际经济生活中,人们经常遇到二元选择问题。 由于购买住房行为要受到许多因素的影响,不由于购买住房行为要受到许多因素的影响,不仅有家庭收入、房屋价格,还有房屋的所在环境、仅有家庭收入、房屋价格,还有房屋的所在环境、人们的购买心理等,所以人们人们的购买心理等,所以人们购买住房的心理价位购买住房的心理价位很难观测到,但我们

2、可以观察到是否购买了住房,很难观测到,但我们可以观察到是否购买了住房,即即 不购买住房不购买住房购买住房购买住房01iY研究家庭是否购买住房。研究家庭是否购买住房。 员工是否愿意跳槽到另一家公司,取决于薪员工是否愿意跳槽到另一家公司,取决于薪资、发展潜力等诸多因素的权衡。员工资、发展潜力等诸多因素的权衡。员工跳槽的成本跳槽的成本与收益与收益是多少,我们无法知道,但我们可以观察到是多少,我们无法知道,但我们可以观察到员工是否跳槽,即员工是否跳槽,即 不跳槽不跳槽跳槽跳槽01iY分析公司员工的跳槽行为。分析公司员工的跳槽行为。 建议对投票者的利益影响是无法知道的,但可建议对投票者的利益影响是无法知

3、道的,但可以观察到投票者的行为只有三种,即以观察到投票者的行为只有三种,即 弃权弃权反对反对支持支持321iY对某项建议进行投票。对某项建议进行投票。 从上述被解释变量所取的离散数据看,如果被从上述被解释变量所取的离散数据看,如果被解释变量只有两个选择,则建立的模型为二元离散解释变量只有两个选择,则建立的模型为二元离散选择模型,又称二元型响应模型;如果变量有多于选择模型,又称二元型响应模型;如果变量有多于二个的选择,则为多元选择模型。这种二元选择模二个的选择,则为多元选择模型。这种二元选择模型或多元选择模型,统称离散选择模型。型或多元选择模型,统称离散选择模型。主要介绍线性概率模型、主要介绍线

4、性概率模型、ProbitProbit模型、模型、LogitLogit模型。模型。第一节第一节 线性概率模型线性概率模型一、一、线性概率模型形式线性概率模型形式 NiuXYiii, 2 , 110 设家庭购买住房的选择主要受到家庭收入水平的影设家庭购买住房的选择主要受到家庭收入水平的影响,则用如下模型表示响,则用如下模型表示其中其中:Xi为家庭的收入水平,为家庭的收入水平,Yi为家庭购买住房的选择为家庭购买住房的选择 没有购买住房没有购买住房已购买了住房已购买了住房01iY令令 那么那么)1( iiYPP)0(1 iiYPP被解释变量被解释变量Yi 的分布为的分布为Yi 0 1概率概率 1-Pi

5、 Pi于是于是 iiiiPYPYPYE )0(0)1(1)(又因为又因为0)( iuE所以所以NiuXYiii, 2 , 110 iiiiXPYPYE10)1()( 家庭选择购买住房的概率是解释变量家庭选择购买住房的概率是解释变量- -家庭收入的一家庭收入的一个线性函数。我们称这一关系式为个线性函数。我们称这一关系式为线性概率函数。线性概率函数。根据经典线性回归,我们知道其总体回归方程是根据经典线性回归,我们知道其总体回归方程是条件期望建立的,这使我们想象可以构造线性概条件期望建立的,这使我们想象可以构造线性概率模型率模型 iiiiXYEYPP )()1(), 1(21 kiiiiXXXX),

6、(10 k iiikikiiuXuXXY 110Yi的的样本值是样本值是0 0或或1 1 。线性概率模型只能在线性概率模型只能在 范围内范围内进行估计。进行估计。01iiPX222()() (1)(1)(1)iiiiiiiE uXPXPPP 现在来分析线性概率模型随机干扰项现在来分析线性概率模型随机干扰项ui的分布的分布iiikikiiuXuXXY 110 011iiiiiiiYXYXXYu ui概率概率 1-Pi Pi iX iX 10)( iuE随机干扰项随机干扰项ui的方差的方差为为随机干扰项随机干扰项ui非正态且存在异方差性非正态且存在异方差性 由于由于随机干扰项具有异方差性。修正异方

7、差随机干扰项具有异方差性。修正异方差的一个方法就是使用加权最小二乘估计。但是加的一个方法就是使用加权最小二乘估计。但是加权最小二乘法无法保证预测值权最小二乘法无法保证预测值 在在 之之间间,这是线性概率模型的一个严重缺陷。这是线性概率模型的一个严重缺陷。iY1 , 0可能不成立可能不成立1)(0 iiiXYEPiiikikiiuXuXXY 110 iX iX -0.20.00.20.40.60.81.01.2051015202530XY 001110 iiiiiXXXXP效用模型效用模型 用用 表示第表示第 i个个体选择个个体选择1的效用,的效用, 表示第表示第 i个个个体选择个体选择0的效用

8、。其效用均为随机变量,于是有的效用。其效用均为随机变量,于是有1iU0iU )()(21000111iiiiiiuXUuXU 将将(1)-(2),得,得)()(010101iiiiiuuXUU 记记 01*0101*,iiiiiiuuuUUY 则有则有 *iiiuXY 格林称该模型为潜回归格林称该模型为潜回归 当效用差当效用差Yi*不大于零,则不大于零,则Yi 应该选应该选 “ 0 ”*iiiuXY 这是二元选择模型的切入点。称这是二元选择模型的切入点。称Yi*为潜在变量。为潜在变量。这个变量是不可观测的。这个变量是不可观测的。当效用差当效用差Yi*大于零,则大于零,则Yi 应该选应该选 “

9、1 ” 0001*iiiYYY作为研究对象的二元选择模型作为研究对象的二元选择模型Yi 和和Yi*的关系的关系为:为:则则)(1)()0()1(* iiiiiXFXuPYPYP 0001*iiiYYY*iiiuXY 很明显,我们要得到事件发生的概率就必须知很明显,我们要得到事件发生的概率就必须知道随机干扰项道随机干扰项ui*的概率分布,通常假定的概率分布,通常假定ui*服从下列服从下列二种分布,于是我们便得到了二种分布,于是我们便得到了Logit 、 Probit模型:模型:标准正态分布标准正态分布 xdzexxFz2221)()( 逻辑分布逻辑分布)()exp(1)exp()(xxxxF 其

10、中其中 为机会概率比(简称机会比),为机会概率比(简称机会比),即事件发生与不发生所对应的概率之比。即事件发生与不发生所对应的概率之比。第二节第二节 二元二元Logit离散模型离散模型在最终的效用模型在最终的效用模型中,假定中,假定ui*的分布为逻辑分布,则该模型称为的分布为逻辑分布,则该模型称为Logit模型。模型。*iiiuXY Logit模型的另一种表述为:模型的另一种表述为:)(1)()0() 1(*iiiiiXFXuPYPYP)exp(1)exp()( iiiXXXF (非线性)(非线性))exp()1(1)1( iiiXYPYP (广义非线性)(广义非线性) iiiXYPYP )1

11、(1)1(ln)1(1)1( iiYPYP逻辑斯蒂回归模型逻辑斯蒂回归模型 三、三、Probit模型模型在最终的效用模型在最终的效用模型中,假定中,假定ui*的分布为标准正态分布,则该模型称为的分布为标准正态分布,则该模型称为Probit模型。模型。*iiiuXY Probit模型的另一种表述为:模型的另一种表述为:)(1)()0()1(* iiiiiXXuPYPYP izXidzeX2221)(五、五、 Extreme 模型模型在最终的效用模型在最终的效用模型中,假定中,假定ui*的分布为极值分布,则该模型称为的分布为极值分布,则该模型称为Extreme模型。模型。*iiiuXY 第二节第二

12、节 二元离散选择模型最大似然估计二元离散选择模型最大似然估计下面我们来构造二元离散选择模型的似然函数。这下面我们来构造二元离散选择模型的似然函数。这是二元离散选择模型最关键的问题。是二元离散选择模型最关键的问题。 我们假设有以我们假设有以Y 轴为对称的概率密度函数轴为对称的概率密度函数f(.),则),则)()(1)1( iiiXFXFYP )(1)()0( iiiXFXFYP 于是模型的似然函数为于是模型的似然函数为 1021)()(1 )(iiYiYinXFXFYYYP ,模型的似然函数为模型的似然函数为 1021)()(1 )(iiYiYinXFXFYYYPL , iiYiYNiiXFXF

13、)()(111 iiYiYiPP 1)1(Yi 0 1概率概率 1-Pi Pi两边同时取自然对数,则两边同时取自然对数,则 NiiiiiXFYXFYL1)(ln)(1ln)1(ln NiiiiiXFYXFYL1)(ln)(1ln)1(ln 对数似然函数最大化的条件是对数似然函数最大化的条件是(*)()()(1)()1(ln1 NiiiiiiiiXXFXfYXFXfYL 于是我们选择于是我们选择F不同的形式得到不同的经验模型不同的形式得到不同的经验模型一一、 Logit模型模型的最大似然估计的最大似然估计对于对于Logit模型,我模型,我 们有:们有: 密度函数密度函数)()exp(1)exp(

14、)(xxxxF 分布函数分布函数)(1)()exp(1()exp()(2xxxxxf (*)()()(1)()1(ln1 NiiiiiiiiXXFXfYXFXfYL 带入带入( (* *) )式,我们得到:式,我们得到: 0ln1 NiiiiXXYL) )( ( 然后运用迭代法来估计系数然后运用迭代法来估计系数 。 Logistic回归参数的极大似然估计值有如下性质回归参数的极大似然估计值有如下性质 (1)极大似然估计为)极大似然估计为一致估计一致估计,当样本容量很大,当样本容量很大时,模型的参数估计值将比较接近真值时,模型的参数估计值将比较接近真值; (2)极大似然估计为)极大似然估计为渐进

15、有效渐进有效的,当样本容量的,当样本容量增大时增大时,参数估计的方差相对缩小参数估计的方差相对缩小,当样本容量当样本容量 时,极大似然的方差不大于用其它方法得到的参时,极大似然的方差不大于用其它方法得到的参数估计的方差数估计的方差; N (3)极大似然估计为)极大似然估计为渐进正态渐进正态的,当样本容量较的,当样本容量较大时,可以采用正态假设来构造模型参数的显著性大时,可以采用正态假设来构造模型参数的显著性检验与估计参数的置信区间等。检验与估计参数的置信区间等。, ,参数参数 的置信区间为的置信区间为 : : 由于超大样本条件下由于超大样本条件下 具有渐进正态分布,因此具有渐进正态分布,因此

16、j )(/ )(jjjSEZ 1j j )(),(22jjjjSEZSEZ 渐进服从标准正态分布,其中渐进服从标准正态分布,其中)(jSE 是是 的标准误差,对于给定的显著性水平的标准误差,对于给定的显著性水平二、二、 Probit模型、模型、Extreme 模型模型的最大似然估计的最大似然估计如果是正态分布,则对数似然函数为如果是正态分布,则对数似然函数为 NiiiiiXFYXFYL1)(ln)(1ln)1(ln NiiiiiXYXYL1)(ln)(1ln)1(ln Probit模型、模型、 Extreme 模型模型的最大似然估计就是的最大似然估计就是使使上式有最大值时的上式有最大值时的 。

17、具体求解过程这里不再赘。具体求解过程这里不再赘述。述。 如果是极值分布,则对数似然函数为如果是极值分布,则对数似然函数为 需要指出的是,不同的分布假设虽然给参数估需要指出的是,不同的分布假设虽然给参数估计带来了很大的不同,但对于研究者,他们所感兴计带来了很大的不同,但对于研究者,他们所感兴趣的估计效应则没有太大的差别趣的估计效应则没有太大的差别。 在例子中分析了某种教学方法对学生成绩的有效性。在例子中分析了某种教学方法对学生成绩的有效性。因变量因变量(Grade)表示学生在接受新教学方法后成绩是否得表示学生在接受新教学方法后成绩是否得到提高,如果提高到提高,如果提高, 则则Grade =1;未

18、;未提高,则提高,则Grade =0。同时使用学生平均学分成绩。同时使用学生平均学分成绩GPA、调查测试之前学生的、调查测试之前学生的期初考试分数期初考试分数SE和个性化教学系统和个性化教学系统PSI作为学生成绩的预作为学生成绩的预测单元,即解释变量。其中,如果对受调查学生采用新的测单元,即解释变量。其中,如果对受调查学生采用新的教学方法,则教学方法,则PSI=1;若若没有没有采用新的教学方法,则采用新的教学方法,则PSI=0。学校对。学校对32位学生进行了调查,得到表位学生进行了调查,得到表1所示的数据。所示的数据。例例1 考虑考虑Greene给出的斯佩克特和马泽欧给出的斯佩克特和马泽欧(1

19、980) 的例子。的例子。*3210*iiiiiiiuPSISEGPAuXGrade 根据这些解释变量,建立度量学习效果根据这些解释变量,建立度量学习效果模型模型其中,其中, 是是 的的不可观测的潜在变量。不可观测的潜在变量。 GradeGradeLogit模型估计结果表达式模型估计结果表达式iiiiPSISEGPAX*379. 2*095. 0*826. 2021.13 )exp(1)exp()1(,)1(1)1(ln iiiiiiXXGradePGradePGradePX 1. Logit模型的建立与估计模型的建立与估计Probit模型估计结果表达式模型估计结果表达式iiiiPSISEGP

20、AX*426. 1*052. 0*626. 1452. 7 )()1( iiXGradeP 2. Probit模型的建立与估计模型的建立与估计Extreme Value模型估计结果表达式模型估计结果表达式iiiiPSISEGPAX*616. 1*060. 0*584. 1140. 7 )exp(1)1( iXieGradeP 3. Extreme Value模型的建立与估计模型的建立与估计 线性回归模型中的可决系数线性回归模型中的可决系数R2不再适用于测度不再适用于测度离散选择模型的拟合优度。原因是离散选择模型的离散选择模型的拟合优度。原因是离散选择模型的R2不可能接近不可能接近1(因为因为Y

21、i的观测值只取的观测值只取0或或1,而,而Yi 的的预测值是概率预测值是概率) 。 目前目前最常用的是最常用的是McFadden(1974)提出的提出的McFadden-R2,它是一种替代,它是一种替代R2的度量拟合的度量拟合优度的较好方法。优度的较好方法。第三节第三节 二元离散模型的评价和参数的统计检验二元离散模型的评价和参数的统计检验一一、 模型的拟合优度检验模型的拟合优度检验(一)(一) McFadden-R2Mcfadden R-squared:麦克法登似然比率指数(麦克法登似然比率指数(likelihood Ratio Index)其被定义为其被定义为:0lnln1LL 其中:其中:

22、 是是当前模型对数似然函数的最大值当前模型对数似然函数的最大值(Log likelihood);); 仅仅包含常数项和误差仅仅包含常数项和误差项的零模型估计结果的对数似然函数的最大值项的零模型估计结果的对数似然函数的最大值(Restr. log likelihood)。)。Lln0lnL如果极大化过程显示所估计参数的任何变化都不会如果极大化过程显示所估计参数的任何变化都不会引起对数似然函数的变化,则引起对数似然函数的变化,则 ;如果所估计;如果所估计的似然函数对样本中每一个因变量的预测是完全准的似然函数对样本中每一个因变量的预测是完全准确的,则确的,则 。如果在方程定义对话框的解释。如果在方程

23、定义对话框的解释变量列表中不包含常数项,则估计结果中不显示变量列表中不包含常数项,则估计结果中不显示Mcfadden R-squared统计量。统计量。1lnln100 LL 0 1 看看模型预测模型预测值值 , 检查一下检查一下Y=1或或Y=0的概率的正确性的概率的正确性来判断模型拟合的好坏。来判断模型拟合的好坏。将将 与实际的与实际的Y值比较,就可以得到模型预测值比较,就可以得到模型预测的正确率。的正确率。当当 ,令,令 ,当,当 ,令,令 。(二)期望(二)期望- -预测表检验预测表检验检验原理:检验原理:检查的方法是,选取适当的截断值检查的方法是,选取适当的截断值10, PPPPi i

24、Y)( iiXFP PPi 1 iY0 iY 对于二元选择模型,与经典模型中采用的对于二元选择模型,与经典模型中采用的变量显变量显著性著性t 检验类似,可以通过极大似然估检验类似,可以通过极大似然估计计时给出的时给出的z 统计量检验系数的显著性。统计量检验系数的显著性。二、参数的显著性检验二、参数的显著性检验(一)(一)Z检验检验对模型中参数显著性检验对模型中参数显著性检验还可使用还可使用Wald检验,检验,其检验统计量为:其检验统计量为:(二)(二)Wald检验检验2)(jjseW 在在 下下,W 渐近服从自由度为渐近服从自由度为1 1的的 分分布。因此,可根据布。因此,可根据 分布表分布表

25、,在给定的显著性水在给定的显著性水平平 下,得到相应的临界值,从而判断参数的显下,得到相应的临界值,从而判断参数的显著性。著性。0:0 jH 2 2 统计学上已经证明,在大样本情况下,两个模型之统计学上已经证明,在大样本情况下,两个模型之间如果具有嵌套关系,则两个模型之间的对数似然间如果具有嵌套关系,则两个模型之间的对数似然值乘以值乘以-2的结果之差近似服从的结果之差近似服从 分布。这一统计分布。这一统计量就是似然比统计量。量就是似然比统计量。(三)(三)似然比检验似然比检验2 2 零假设零假设: : uXYH 10:备择假设备择假设: uXXYH 211:式中式中X1是保留的变量向量;是保留

26、的变量向量;X2是省略的变量向量。是省略的变量向量。 )ln(ln210LLLR 式中:式中: 分别为分别为H0情形和情形和 H1情形下的情形下的似然似然函数值的估计量函数值的估计量。 10LL 和和LR统计量服从统计量服从 分布,自由度为分布,自由度为 中的变量数目。中的变量数目。2X例例2 仍仍考虑考虑Greene给出的斯佩克特和马泽欧给出的斯佩克特和马泽欧(1980) 的例子。的例子。以以Logit模型的估计结果为例模型的估计结果为例类似类似R2类似类似F检验检验概率的预测值小于等于概率的预测值小于等于截断值截断值0.5的这一的这一组组中中观测数据共观测数据共21个,其中个,其中分组正确

27、的有分组正确的有18个,分个,分组不正确的有组不正确的有3个;个;概概率的预测值大于截断值率的预测值大于截断值0.5的这一的这一组组中中观测数观测数据共据共11个,其中分组不个,其中分组不正确的有正确的有3个,分组正个,分组正确的有确的有8个。个。因变量取因变量取0的观测值共有的观测值共有21个,个,根据根据Logit模型所模型所预测预测的概率,的概率,因变量因变量Grade=0预测正确的观测值是预测正确的观测值是18,模型分组恰当率为模型分组恰当率为85.71%;因变量取因变量取1的观测值共有的观测值共有11个,个,根据根据Logit模型所模型所预测预测的概率,的概率,因变量因变量Grade

28、=1预测正确的观测值是预测正确的观测值是8,模,模型分组恰当率为型分组恰当率为72.73%。同时,同时, Logit模型模型预测正确预测正确的总比率为的总比率为81.25%截断值截断值P=0.5期望期望- -预测表检验预测表检验Wald检验检验第第四四节节 二元离散选择模型系数的解释二元离散选择模型系数的解释一一、 参数估计量参数估计量 反映反映解释变量解释变量X对潜在变量对潜在变量Y*的边际影响的边际影响 二元选择模型中所估计的参数不能被解释为二元选择模型中所估计的参数不能被解释为自变量对因变量的边际效应,对系数的解释比较自变量对因变量的边际效应,对系数的解释比较复杂。复杂。 *iiiuXY

29、 解释变量解释变量X首先首先对潜在变量对潜在变量Y*产生影响,产生影响, Y*的大的大小影响小影响Y的取值。因此,的取值。因此,X是是间接影响观察到的间接影响观察到的Y的取值的取值。 0001*iiiYYYGPA系数估计值为系数估计值为2.826,意味着当其他解释变,意味着当其他解释变量保持不变时,量保持不变时,GPA每增加一个单位,每增加一个单位, Logit估估计值平均增加约计值平均增加约2.83个单位,同时个单位,同时GPA的系数为的系数为正也表明增加正也表明增加GPA,将增加,将增加Grade取取1的概率。的概率。iiiiPSISEGPAX*379. 2*095. 0*826. 202

30、1.13 例例3 以例以例1 1的的Logit回归回归模型估计结果为例模型估计结果为例方程中每个斜率系数都是一个方程中每个斜率系数都是一个偏斜率系数偏斜率系数,它度,它度量了在其余回归元不变的条件下,某个解释变量量了在其余回归元不变的条件下,某个解释变量的值变动一个单位所引起的的值变动一个单位所引起的Logit估计值的变化。估计值的变化。二、预测二、预测概率概率解释变量解释变量X是直是直接影响接影响Y 取值时的概率。取值时的概率。当当 被估计出来之后,我们可以对每个个体被估计出来之后,我们可以对每个个体i预测预测其其 Yi=1的概率,即的概率,即 )()()1(iiiiiYEPXFPYP 例例4 以例以例1 1的的Logit回归回归模型估计结果为例模型估计结果为例模型预测模型预测有两种选择:一是因变量有两种选择:一是因变量的拟合概率的拟合概率(Probability),即即 ;二是潜;二是潜变量的拟合值,即变量的拟合值,即

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论