(数量经济学专业论文)缺失数据对微观计量影响研究——以农民收入与消费为例.pdf_第1页
(数量经济学专业论文)缺失数据对微观计量影响研究——以农民收入与消费为例.pdf_第2页
(数量经济学专业论文)缺失数据对微观计量影响研究——以农民收入与消费为例.pdf_第3页
(数量经济学专业论文)缺失数据对微观计量影响研究——以农民收入与消费为例.pdf_第4页
(数量经济学专业论文)缺失数据对微观计量影响研究——以农民收入与消费为例.pdf_第5页
已阅读5页,还剩55页未读 继续免费阅读

(数量经济学专业论文)缺失数据对微观计量影响研究——以农民收入与消费为例.pdf.pdf 免费下载

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

西南交通大学硕士研究生学位论文第1 页 詈舅曼曼曼曼皇曼曼曼曼曼曼曼曼曼曼曼曼曼曼曼曼i i i l l l b r m - - :- 曼曼曼曼曼曼曼曼曼曼曼曼兰曼舅曼曼曼曼曼曼曼曼蔓! 曼曼曼曼曼曼舅舅 摘要 微观计量经济学是介于经济学和统计学之间的边缘科学,它是研究微观数据 最口大量个人、家庭或企业的经济信息的经济理论和统计方法。近些年内,国内微观经 济学的研究集中在模型、估计和检验理论与相关应用上,而对这些模型的基础数 据重视不够。经济理论、数学方法和数据是计量经济学模型成功的三大要素,样本信 息的质量直接关系到计量模型经济模型成功与否。其中,缺失数据是影响样本质量的 一个关键因素,在个人、团体或政府的社会调查中,常常面临着缺失数据的问题,然 而,虽然微观计量经济学已出现了大量的相关理论与方法,但对于缺失数据对模型估 计带来的问题,还没有引起研究者的足够重视。 基于上述原因,本论文从缺失数据( 无回答) 的入手,探讨了缺失数据产生的原因 与机制,论述了缺失数据给微观计量带来的影响。就调查项目而言,回答层与无回答 层是否在数量特征上存在差异,对抽样的影响是不一样的,这涉及到了样本代表性的 问题。如果数据的缺失完全是随机的,丢弃不完整的回答虽然会减少估计的精度但是 不会产生偏离。相反,如果无回答是故意造成的,或无回答集中于某类特殊群体,那 么无回答层与回答层之间就存在明显的非随机性差异,它们之间就不具有相同的数量 分布特征,那么仅采用完整数据的样本显然是不能代表总体特征的,这时,数据缺失 除了会增加估计量方差外,还会带来较严重的估计量偏差。 在本文中,采用了e m 算法来补救缺失数据给微观计量模型回归带来的影响。此方 法是根据观测数据的分布对缺失值进行填补,其估计的结果比较准确和有效。本文以 农民收入与消费为例,利用e m 算法,分别比较了在线性回归模型和二元选择模型的 回归过程中,是否对缺失数据进行插补的回归结果。比较结果得出,采用了e m 算法 后,模型的回归效果要好于直接删除数据法以及传统的均值插补法,此算法在一定程 度上消除数据中隐藏的偏向,弥补了回答层与无回答层之间的差异,从而得出更加准 确的结论。 关键词:微观计量;缺失数据;e m 算法;缺失数据机制;农民收入与消费 西南交通大学硕士研究生学位论文第f i 页 a b s t r a c t m i c r oe c o n o m e t r i c si sa l li n t e r d i s c i p l i n a r ys u b j e c tb e t w e e ne c o n o m i c sa n ds t a t i s t i c s ;i ti s t h ee c o n o m i ct h e o r ya n ds t a t i s t i c a lm e t h o dw h i c hr e s e a r c ho nm i c r o d a t am a i n l ya b o u t e c o n o m i ci n f o r m a t i o no fi n d i v i d u a l sf a m i l i e sa n dc o m p a n i e s i nr e c e n ty e a r s ,d o m e s t i c m i c r oe c o n o m e t r i c sf o c u s e so nc o n s t r u c t i o n , e v a l u a t i o na n dt e s t i n go fm o d e l s h o w e v d a t a t h ef o u n d a t i o no fm o d e l i n g ,i sh a r d l yi n v o l v e di nt h i ss u b je c t t h e o r y , m a t h e m a t i c s , a n dd a t aa r e t h et h r e em o s ti m p o r t a n tf a c t o r st ot h es u c c e s so fe c o n o m i cm o d e l i n g 。纬乃e t h e r ae c o n o m i cm o d e li sv a l i dd i r e c t l yr e l i e so ns a m p l i n g ,e s p e c i a l l yr e l i e so nt h eq u a l i t yo f s a m p l ed a t a m i s s i n gd a t ai s ak e yf a c t o rt ot h eq u a l i t yo fs a m p l i n g i nt h es o c i a l i n v e s t i g a t i o n so fi n d i v i d u a l s ,o r g a n i z a t i o n s ,a n dg o v e r n m e n t s ,m i s s i n gd a t ai sac o m m o n p r o b l e m 恤1 et h e r ea r e1 0 r so fr e s e a r c h e so nm i c r oe c o n o m e t r i c s t h em i s s i n gd a t ad o e sn o t g e te n o u g ha t t e n t i o n t h e r e f o r e ,t h et h e s i sb e g i n sw i t ht h e d a t ad e f i c i e n c y , d i s c u s s e st h er e a s o na n d m e c h a n i s mo fd a t ad e f i c i e n c y ,a n dd i s c o u r s e st h ei m p a c to ft h ed a t ad e f i c i e n c yo nm i c r o e c o n o m e t r i c c o n c e r n i n gs u r v e y s ,w h e t h e rt h e r ei sd i f f e r e n c eo fc h a r a c t e r i s t i cb e t w e e n r e s p o n s ea n dn o n r e s p o n s ew i l li n f l u e n c es a m p l i n gd i f f e r e n t l y i ft h ed a t ad e f i c i e n c yi s t o t a l l yr a n d o m t h e no n l yt h ep r e c i s i o nw i l lb er e d u c e dw h i l ed e v i a t i o nw i l ln o tb ec a u s e d h o w e v e r i ft h ed e f i c i e n c yi nc a u s e do np u r p o s eo rt h ed e f i c i e n c yf o c u s e so nc e r t a i ng r o u p , t h e r ew i l lb eo b v i o u su n r a n d o md i f f e r e n c eb e t w e e nt h er e s p o n s ea n dn o n r e s p o n s e ,s o ,t h e y w i l ln o ts h a r et l l es a m eq u a n t i t a t i v ed i s t r i b u t i o nc h a r a c t e r i s t i c a st h er e s u l t , t h es a m p l ew i t l l c o m p l e t ed a t ac a nn o tr e p r e s e n tt h ec h a r a c t e r i s t i co fe n t i r eg r o u p a tt h i st i m e ,t h ed e f i c i e n c y o fd a t aw i l ln o to n l yi n c r e a s et h ev a r i a n c eo fe s t i m a t o r , b u ta l s ot h ee r r o ro fe s t i m a t e m sp a p e ri sa b o u th o wt oc o m p e n s a t et 1 1 ed a t ad e f i c i e n c y si n f l u e n c eo nm i c r o e c o n o m e t r i c sm o d e l s t h i sm e t h o di st of i l lt h em i s s i n gd a t ab yo b s e r v i n gt h ed i s t r i b u t i o no f d a t a t h er e s u l to fe s t i m a t i o ni sa c c u r a t ea n de 伍c i e n t i nt h ec a s eo ff a m e r s r e v e n u ea n d c o n s u m p t i o n ,t h i sp a p e l ;c o m p a r e st h er e s u l to fr e g r e s s i o nw i t he x p e c t a t i o nm a x i m i z a t i o nt o t 1 1 a tw i t h o u te x p e c t a t i o nm a x i m i z a t i o n e i t h e ri nl i n e a rr e g r e s s i o nm o d e lo rb i n a r ys e l e c t i v e m o d e l ,t h er e s u l to fr e g r e s s i o ni sm u c hb e t t e rt h a nt h a to fl i s t w i s ed e l e t i o na n dm e a n i m p u t a t i o n 。t oac e r t a i nc o n t e n t ,t h em e t h o dc a ne l i m i n a t et h ed e v i a t i o nh i d d e nb yd a t aa n d r e p r e s e n tt h ed i f f e r e n c eo fa 1 1l e v e l si nt h er e s u l t s t l m s t h i sm e t h o dw i l lp r o d u c em o r e a c c u r a t ec o n c l u s i o n s k e yw o r d :m i c r oe c o n o m e t r i c s ;m i s s i n gd a t a ;e x p e c t a t i o nm a x i m i z a t i o n ;m i s s i n gd a t a m e c h a n i s m ;f a r m e r si n c o m ea n dc o n s u m p t i o n 西南交通大学 学位论文版权使用授权书 本学位论文作者完全了解学校有关保留、使用学位论文的规定,同意学校保留并 向国家有关部门或机构送交论文的复印件和电子版,允许论文被查阅和借阅。本人授 权西南交通大学可以将本论文的全部或部分内容编入有关数据库进行检索,可以采用 影印、缩印或扫描等复印手段保存和汇编本学位论文。 本学位论文属于 1 保密口,在年解密后适用本授权书; 2 不保密0 使用本授权书。 ( 请在以上方框内打“寸) 将娜躲加砖毒 日期:刎6 f 夕、 r 盯1 , 魏7 氰 名 签 咖 辎 洲 储 文 期 论 日 位学 西南交通大学硕士学位论文主要工作( 贡献) 声明 本人在学位论文中所做的主要工作或贡献如下: 1 通过对微观计量经济学的数据结构的阐述与分析,揭示出了缺失数据最易发生 在哪类微观数据上。 2 在研读相关文献资料的基础上,以线性模型为例,总结了缺失数据给样本代表 性以及模型参数估计带来的影响,并进一步阐述了由于样本容量变小给模型回 归带来的其他影响。 3 通过走访调查获得数据,以农民收入与消费为例,采用e m 算法进行数据插补, 通过比较插补前后模型回归的效果,用实例反映了缺失数据给微观计量带来的 影响。 本人郑重声明:所呈交的学位论文,是在导师指导下独立进行研究工作所得的成 果。除文中已经注明引用的内容外,本论文不包含任何其他个人或集体已经发表或撰 写过的研究成果。对本文的研究做出贡献的个人和集体,均已在文中作了明确说明。 本人完全了解违反上述声明所引起的一切法律责任将由本人承担。 学位论文作者签名: 旒斫 j 嗍帅6 j 西南交通大学硕士研究生学位论文第1 页 第1 章绪论 本章主要描述了研究的背景与内容,国内外现状分析以及技术路线。 1 1 问题的提出与研究意义 微观计量经济学是介于经济学和统计学之间的边缘科学,它是研究微观数据 即大量个人、家庭或企业的经济信息的经济理论和统计方法。微观数据可以是某一时 点的截面数据,也可以是相同观测对象的系列时间序列。 2 0 世纪后半叶经济学发展的一个明显趋势就是加强对数量分析方法的应用,计量 经济学的重要性也得到了日益提高。微观计量经济学近些年得到了显著的发展,不少 经济理论的提出,为研究人员研究微观个体的经济行为提供了有效的实证分析方法,也 为其他重要社会问题的研究开拓了新的空剐。可以这样说,现代经济科学的发展越来 越明显地向定量分析发展。 目前,国内微观经济学的研究集中在模型估计检验理论与相关应用上,而对这些 模型的基础数据重视不够。经济理论、数学方法和数据是计量经济学模型成功的 三大要素,样本信息的质量直接关系到计量模型经济模型成功与否 2 】。其中,缺失数据 是影响样本质量的一个关键因素,在个人、团体或政府的社会调查中,常常面临着缺 失数据的问题,然而,虽然微观计量经济学已出现了大量的相关理论与方法,但对于 缺失数据对模型建立、估计和检验带来的问题,还没有引起研究者的足够重视。 基于上述原因,本论文从缺失数据( 无回答) 的角度,以农民收入与消费为例, 对微观计量经济学进行研究。 通过研究,总结出缺失数据对微观计量带来的不利影响,反映了在微观计量模型 回归中重视缺失数据的重要性。通过数据插补前后的回归效果比较,用实例揭示出缺 失数据对计量模型的影响,反映出了缺失数据在计量回归中的不可忽视性,应当运用 插补技术对其进行弥补,以便于回归所得的模型更能准确地描述所研究的经济现象。 1 2 国内外研究现状分析 现对缺失数据的研究从国内外两个角度进行述评。 1 2 1 国外研究现状 国外对调查中的缺失数据现象( 无回答问题) 这一问题很早就开始了研究,b o w l e y 在1 9 1 5 年就提出了这个问题,缺失数据的问题在国外经历了宣传期( 1 9 1 5 2 0 世纪4 0 西南交通大学硕士研究生学位论文第2 页 年代) ,专题研究期( 2 0 世纪4 0 年代中后期2 0 世纪7 0 年代末期) ,而现在正处于 迅速发展期( 2 0 世纪8 0 年代初至今) 。在迅速发展期,出现了一批对无回答方法理 论进行系统总结的专著,并且以r u b i n 提出的多重插补法为标志,涌现出众多关于无 回答多重插补的文献。此外,大量的先进统计方法在缺失数据研究领域的应用,带动 了这领域的蓬勃发展,使其成为抽样理论界的热点问题之一。 而国外关于缺失数据的前沿研究,可以分为以下三个方面。 ( 1 ) 已有方法的改进和扩展 对缺失数据的假设现在的考虑范围则得到了推广,比如从可忽略的缺失数据转移 到不可忽略的缺失数据。f o r e s t e r 和s m i t h ( 1 9 9 8 ) 提出了对不可忽略缺失数据的模型 推断法。g h o s h d a s t i d a r 和m a d h u m i t a ( 1 9 9 9 ) 扩展了多重替代法,提出了m e m i 法 ( m u l t i p l ee d i t m u l t i p l ei m p u t a t i o n ) ,此方法既能反映无回答,也能计量其误差【3 1 。 r o b i n s 、r o t n i t z k y 和z h a o ( 1 9 9 4 ) 提出了以估计缺失概率为基础的加权法。h e e r i n g a 和 s t e v e ng e o r g e ( 2 0 0 0 ) 探讨了e m 算法和g i b b ss a m p l e r 算法的应用,并对其特性研究和 方法进行了比较【4 1 。s t i n e b r i n k n e r ( 1 9 9 9 ) 同样也面临着缺失数据的问题,研究认为直接 删除数据给所要研究的问题留下过少的数据,并且发展出了基于两层拟似然的估计方 法,这种方法可以估计出缺失数据的联合分布。另外,s c h a f e r ( 1 9 9 7 ) 关于不可忽略的数 据,提供了一些相关的资料。 此外,关于辅助信息的应用也是讨论的焦点和前沿。t h o m s e n 和a n nm a r t ik l e i v e h o l m o y ( 1 9 9 8 ) 根据挪威统计局的经验,提出利用管理档案系统的信息可以提高调查数 据的质量【3 】。l u n d s t r o m 与s a r n d a l ( 2 0 0 1 ) 讨论了辅助信息的重要性,以及辅助信息的选 择标准。b e t h l e h e m ( 2 0 0 2 ) 归纳了基于辅助信息对缺失值进行加权调整的方法【4 】。此 外,r u b i n ( 1 9 9 1 ) 使用了贝叶斯逻辑斯蒂回归对普查样本的缺失值进行多重替代【5 】。 ( 2 ) 方法的比较研究 r o d e r i c k 和l i t t l e 等( 1 9 8 6 ) 利用美国普查局c p s 的收入数据进行了热卡插补和回 归插补的效果比较研究。m i c h a e l 、l u c yw e s l e y ( 1 9 9 9 ) 幂w j 用q o l 调查数据,比较了在不 同的无回答条件下的各种插补方法。r l e g m i n y o u n g e r 等( 1 9 9 8 ) 在分析大学生入学成 绩和入学后成绩的关系时对总均值插补法,分层插补法、热卡法和回归插补法进行了 比较研究【3 】。以数据为最终目的多层数值插补与以估计效率为最终目的多层数据插补是 有差异的,虽然后者可能涉及到更为复杂的经济模型,但是这两类过程都是可建模的。 b r o w n s t o n e 和v a l e t t a ( 1 9 9 6 ) ,s t i n e b r i n k n e r ( 1 9 9 9 ) ,k e n n i c k e l l ( 1 9 9 8 ) ,和d a v e y 、s h a n a h a l l 和s c h a f e r ( 2 0 0 1 ) 都给出相关的例子【引。 ( 3 ) 应用研究 伴随着无回答相关理论的发展,缺失数据的调整方法的应用领域得到了不断地扩 展,呈现着朝气蓬勃的发展态势。z a n u r o 、e l a i n cl o u i s e ( 1 9 9 8 ) 提出基于跟踪访问、管 西南交通大学硕士研究生学位论文第3 页 理记录和配对替代的模型,将替代法推广应用到了单位无回答。w a i l g n r o b i n s j m ( 1 9 9 8 ) 将多重替代法应用到了大样本调查【3 】。g r a h a m 与s c h a f e r ( 1 9 9 7 ) 将多重 插补法的应用范围扩大至小样本。l a n d r u m 和b e c k e t ( 2 0 0 1 ) 探讨了多重插补在不完全纵 向数据中的实现【4 】。 此外,也有许多学者在方差估计上对缺失数据进行研究。s c h e u r e n ( 1 9 8 3 ) 、d e v i l l e 和s a r n d a l ( 19 9 4 ) s t 寸l l t 都进行过研究【4 1 。 1 2 2 国内研究现状 在缺失数据的研究上,国内主要集中在三个方面。 ( 1 ) 关于缺失数据对统计量的影响 郑李玲( 2 0 0 9 ) 在响应变量满足随机缺失机制下,利用完全记录单元方法分别给 出不含附加信息和含附加信息时条件分位数的估计,并在给定的正则条件下证明估计 的渐近正态性【n 。朱五英( 2 0 0 8 ) 讨论了具有部分缺失数据两个几何分布总体的参数估 计,证明了估计的强相合性和渐近正态性,为几何分布总体的统计推断问题提供了一 种解决的方法【8 】。赵志文( 2 0 0 9 ) 利用极大似然估计方法,研究定时截尾下具有部分缺 失数据的两个指数总体中的参数估计问题,以及两指数总体参数相等的假设检验问题, 证明了估计的强相合性以及渐近正态性,给出了检验两总体参数相等的检验统计量及 检验统计量的极限分布【9 】;并研究了具有部分缺失数据的两个对数正态分布总体中的参 数估计问题以及两总体参数相等的假设检验问题。证明了估计的强相合性以及渐近正 态性,给出了检验两总体参数相等的检验统计量以及检验统计量的极限分布( 2 0 0 8 ) 【1 0 】。 ( 2 ) 缺失数据下模型参数的估计 刘妍( 2 0 0 9 ) 在响应变量有缺失值的情形下,利用二阶段估计方法得到半参数回 归模参数p 和非参数甙) 的估计,并给出估计渐近正态性的充分条件【1 1 1 。田霆( 2 0 0 9 ) 在寿命分布为双参数指数分布时,给出了定数截尾寿命试验数据缺失场合下参数的 b a y e s 估计,还给出了b a y e s 估计的一种近似计算方法。通过大量的m o n t e c a r l o 数值 模拟试验,表明这种方法是可行的【l2 1 。罗双华( 2 0 0 8 ) 在缺失响应变量的不完全数据 下,对半参数回归模型进行研究,利用局部线性回归拟合方法建立缺失数据下半参数 回归模型参数分量p 和非参数分量g 的局部线性估计。在适当的条件下,得到其估计 量的最优弱收敛速度【l3 1 。田萍( 2 0 0 8 ) 详细讨论在数据有缺失时的a r m a ( 1 ,1 ) 模型 参数的估计方法【l4 i 。 ( 3 ) 数据插补方法的研究 高扬( 2 0 0 9 ) 将时间序列分析方法用于1 9 8 9 年至2 0 0 0 年中国的外国人入境旅游 人数的数据处理,并对1 9 9 1 全年数据的缺失,采用了回归法和潜周期法对1 9 9 1 的数 据进行了补充【l5 1 。苏毅娟( 2 0 0 9 ) 针对代价敏感决策树方法没有同时考虑填充顺序和 西南交通大学硕士研究生学位论文第4 页 填充代价的问题,提出一种有序填充缺失数据的算法,综合考虑经济因素和建立填充 器所需的有效信息。实验结果表明其预测准确率和分类准确率高于现有算法【16 1 。刘宝 慧( 2 0 0 9 ) 利用无回答所提供的信息采用最d x s - 乘估计给出了缺失数据情形下的目标 变量的种回归插补及其方差估计【1 7 】。曾莉( 2 0 0 9 ) 模拟研究比较了两种m c m c 方法 参数估计的精确性,并进行了实证研究f 18 1 。庞新生( 2 0 0 9 ) 介绍分层随机抽样条件下 多重插补法处理缺失数据的基本思想,分析分层随机抽样建立多重插补的常用方法, 并通过实例加以说明【1 9 】。 而国内关于缺失数据对回归模型影响的研究较少。蒲冰( 2 0 0 9 ) 文章通过考虑基 于q 函数的保形法曲率并借助于g i b b s 抽样和m h 算法,就能够有效地对带有不可忽 略缺失数据的非线性结构方程模型实施局部影响分析【2 0 1 。程英( 2 0 0 5 ) 用方差比和广 义方差比作为影响度量,从估计效率角度研究数据的剔除对加权回归模型的影响【2 1 1 。 小结:从数据缺失的研究上看,国外关于调查样本中数据缺失( 无回答) 的基本 理论框架已经形成,目前的研究大都是方法的改进或比较研究以及实际的应用上,而 国内更集中于应用,关于理论方面的研究比较匮乏。缺失数据对于微观计量的影响研 究,数量较少。 1 3 课题研究的目标 本论文从缺失数据的角度,对缺失数据对微观计量的影响进行研究,论述了缺失 数据对模型估计的影响,并通过合适的修正方法来改进模型估计。 1 4 研究的内容 由于微观计量经济学的特点,其模型的建立与估计都基于微观数据上。本文从简 单抽样数据出发,进行缺失数据对微观计量的影响研究。抽样调查中的误差包括抽样 误差与非抽样误差,抽样误差是本就不可避免的,只能加以控制。而非抽样不是由于 抽样的随机性带来的,可以产生于抽样调查的各个阶段,造成数据的失真,从而影响 微观计量模型的估计。本论文论述了缺失数据对模型的估计造成的影响,并用e m 算 法对数据进行合适的修正。再以农民收入和消费为例,在简单随机抽样的基础上,对 其抽样进行评估和数据修正,并比较数据修正前后,模型回归的差异。 1 5 本课题采取的方法和工具 ( 1 ) 应用s p s s 中的e m 插补,对缺失数据进行了修正。 ( 2 ) 采取走访调查的方式,运用微观计量的方法和e v i e w s ,建立相关的农民收 西南交通大学硕士研究生学位论文第5 页 入、消费模型。 1 6 技术路线 本文研究的技术路线见图1 1 所示。 研读相关文献资料 上 分析缺失数据对样本 代表性的影响 图1 1 本文研究的技术路线图 西南交通大学硕士研究生学位论文第6 页 第2 章微观计量经济学的数据结构 微观计量经济学始于2 0 世纪6 0 年代的经济发达国家,是介于经济学和统计学之 间的边缘科学。在过去的三十年里,微观计量经济学得以迅速发展,这主要取决于数 据库的建立与计算机技术的进步。计算机的日益普及带来的是丰富的数据。大量的微 观数据为计量经济学的研究奠定了坚实的基础。另方面,计算机技术的进步使得其 运算速度不断提高,这为微观计量经济学的研究提供了一个高效的平台,使得在实证 分析应用微观计量模型成为可能【2 2 1 。 2 0 0 0 年诺贝尔经济学奖授予了两位美国经济学家h e c k m a n 教授和m c f a d d e n 教授, 以表彰他们对微观计量经济学所做出的杰出贡献【2 3 1 。赫克曼使得一种研究成为可能: 即在考虑到研究人员可能并不了解其研究对象的情况下,对数据样本进行研究。而麦 克法登的方法,则是把个人选择因素虑在内【2 4 】。赫克曼与麦克法登所研究的方法奠定 了微观计量经济学坚实的基础,发展了在经济学及其他社会科学领域内的理论和方法, 这些方法和理论被经济学家或者社会科学家广泛的应用到了个体行为和家庭行为的统 计以及分析上,特别是对重要社会问题的研究,起到了积极的促进作用【2 52 6 1 。 微观计量经济学的研究对象是微观数据,是研究大量个人、家庭或企业的经济信 息的经济理论和统计方法。微观数据可以是某一时点的截面数据,也可以是系列时间 序列数据1 2 7 i 。 显然的,微观计量模型的建立需要可靠而客观的数据作为支撑,但是随着微观计 量在实际研究中越来越多的运用,由于数据的原因对微观计量带来的影响日益凸显。 本文研究缺失数据对微观计量的影响,所涉及到的是针对个人、家庭或企业的数据。 在此前提下,有必要对微观计量的数据结构作一番了解,并总结出缺失数据的现象最 易发生哪类微观数据上。 按照数据获得的方式,大体上可将微观计量所使用的数据分为调查数据、社会实 验数据和自然实验数据三类。 2 1 调查数据 调查数据的来源以家庭、公司以及政府报告数据为主,其中也包含人口调查数据, 其大量的样本都收集于交易双方、卖家或者( 实际或者潜在) 的消费者数据。互联网 同样也是数据的来源之一。 研究人员通过所研究问题的相关总体收集到调查数据。这些数据是随机的,其特 征未受到任何的控制。取得调查数据的方法常采用简单随机抽样和分层抽样,前者需 西南交通大学硕士研究生学位论文第7 页 要花费大量的成本来获得对总体具有代表性的样本,而后者在成本上更为有效,因为, 对代表了相关特性的子总体进行抽样,它减少了地理上的分离度,并且使得集中在某 一子总体上采样更为可能【6 】。但问题在于,分层抽样会减少个体间的差异,这种差异对 于更好的精度是必不可少的。 调查数据的类型包含横截面数据和面板数据。 横截面数据是在某个f 时刻,通过调查样本集s ,来获得关于特征w 的观察。虽 然在某些时刻调查所有家庭显得不符实际,但横截面数据仍然是对总体子集每个元素 特征的速写,如果总体稳定,关于参数口的的推论不因t 的变化而改变,可应用这些子 集对总体做出结论。但是如果过去和现在有很强的联系,那么也需要纵向数据来定义 研究者所感兴趣的关系。但是如果数据的历史是不可获得的,那么这种联系是不可能 建模的这就是横截面数据的限制之一。 重复横截面数据是从相互独立的样本集s 的序列中获得,其中s 服从分布 f ( w ,p ) ,t = l ,l 因为样本的设计并不试图保留样本中的同一单位,所以关于 同一样本行为的动态联系就被丢失了。如果总体是稳定的,那么获得重复横截面数据 的过程类似于从一个固定不变的总体中更换着样本。如果总体是非平稳的,横截面数 据则涉及到总体在时间中是如何改变的。在这样的情况下,就要做出关于基本的固定 超参数的结论。 面板数据是在t = o 时刻,选择样本s ,并且在后续的时期里( f = j r ) ,从中收 集调查数据这可以通过访问目标并且在同一时间收集到过去以及现在的数据或者 追踪调查目标得到。这个过程会产生一个数据向量 w 1 ,坼) ,这些数据用于对总 体或个体的特殊样本的行为做出推论。 对于有时间相关性的结果,横截面数据或重复横截面的数据一般不适用,其适用 于固定不变的联系。相比而言,面板数据,特别是足够长的时间跨度的数据,对于静 态或动态联系的建模都是适用的。 不管是截面数据还是面板数据,由于采取的都是随机调查的方式,因而都面临着 样本代表性的问题即能根据抽样设计,从总体的正常代表中合理的收集数据,尽 可能地反映总体的结构。而其中,由于面板数据自身的特点,这种代表性问题显得更 加突出。实际上,面板数据集面临着数据磨损的问题【2 8 1 ,原因在于“样本疲劳” 被调查者不能持续提供对问题的回答。这造成了以下2 个问题:首先是面板变得不平 衡。再次,面临着被保留下的家庭不具有经典性或代表性的问题,这使得样本也失去 对总体的代表意义。当可获得的样本数据是来自于总体的非随机数据,其结论也会在 不同的程度上具有偏离性。“样本疲劳 产生的原因在于:跨越了时间,对于个体样本 的保留变得越来越困难,或者因为其他原因“丢失”,比如说住所的变化,人员死亡等 等。 西南交通大学硕士研究生学位论文第8 页 2 2 社会实验数据 社会实验的兴起是缘于公共政策问题。 对政策进行反应,而这种政策从未实施过, 研究人员往往需要了解政策的受众会如何 因此没有相关的观察数据存在。社会实验 的思想就是招募一批志愿者,他们中的一些被随机分配到实验组或者对照组。实验组 接受所要评估的政策,而对照组则维持政策现状,因此实验组与对照组之间反馈结果 的不同能够评估政策的效果。 虽然在农业和生物科学中,随机实验方法已被应用了很长一段时间,但是在经济 以及社会科学中它仍是一个新的方法,但是社会实验在根本上是不同于生物或者农业 实验的,因为其参与者和实验控制的管理者都是可活动的,并且倾向于预知个人的偏 好选择,而不是被动执行着标准化的方案【2 9 】。对于那些从未有过观察数据的政策,社 会实验在研究政策的效果上具有相当的吸引力。在社会科学中,类似于实验数据的数 据要么来自于社会实验,要么来自于“实验室 数据【3 0 ! 。 社会实验数据与调查数据有很大的不同,因为从理论上而言,社会实验的实验环 境是可控制的。它能够改变一个感兴趣的因变量,而同时控制其他因素不变。相比而 言,调查数据在一个不可操控的环境下,许多模糊不清的因素都会干扰研究人员所感 兴趣的因果关系。此外,在调查研究中,常混淆外生和内生因素,而一个良好的社会 实验能够很好的区别这些可操控的因素( 变量) 的角色。 社会实验数据同时也允许政策变量与参数比在调查数据中具有更大的变化。在许 多情况下,社会实验或许会尝试一个从未实施过的政策,所以调查数据在政策可能的 影响上就无法发挥它的作用了【3 1 1 。 b u r t l e s s ( 1 9 9 5 ) 描述了社会实验的优点f 6 】。 首先,随机实验的特性消除了项目参与者观察与未观察特性间的联系。 其次,社会实验使政策变量的外生化变得可能了,并且其随机性也使得估计分析 更为简单了。 社会实验也具有其缺陷。 首先来说,社会实验的成本非常的昂贵,如果成本的因素阻碍了个大型实验, 那么实验的效用会受到质疑。并且成本的限制使得其时间的跨度小于调查数据中的时 间跨度。 其次,社会实验还面临着随机实验的随机性减损的问题,比如样本选择问题【3 2 1 、 霍桑效应的问题、数据磨损问题等等。 除此之外,由于社会实验管理的问题存在了形式主义的问题,因而也有可能产生 偏离随机化偏离( r a n d o m i z a t i o nb i a s ) 和替代偏离( s u b s t i t u t i o nb i a s ) 【3 3 1 。另外, 还有一个问题就是从实验中推断出来的结果是否能普遍到应用到总体中去。 西南交通大学硕士研究生学位论文第9 页 曼曼曼曼曼皇曼曼! 曼曼曼皇曼曼曼! 曼曼曼舅曼曼曼曼! 曼曼i i 一 i ;i 一i _一; ;- - i 一一i m i 鼍曼曼曼! 皇曼! ! ! 曼曼 总而言之,社会实验一般而言能产生出比调查数据更易于分析的数据。要达到这 样的效果要依赖于可靠的实验设计。个不可靠的实验设计往往会提高自身的统计复 杂性,这影响着结论的准确性。 2 3 自然实验数据 当总体中的一个子集的变量发生了外生性的变化,那自然实验就产生了这种 外生性的变化可能是政策的改变。理想状态下,这变化的原因是可知的。此时,一个 研究者可以从自然实验中获得可用的数据了。 这种自然实验相当的具有吸引力,因为这些实验可以用较少的成本产生实验组和 对照组,并且这些实验本身就处在一个真实的环境中。一个自然实验是否能产生一个 可靠的结论在于假设的自然干扰是否是外生的,在于它的影响是否可以大到足够测量 以及实验组和对照组本身是否合适。 然而,基于自然实验的调查有很多潜在的限制。因此任何一个自然实验的重要性, 只有在通过对相关理论,事实和情境的仔细考究之后才能得出。 在任何研究中,都会有些被忽略的变量在政策变化到产生影响这段时间同样发生 了变化。比如样本中个人的年纪、健康状况以及他们现在或者与预期的经济环境同样 也会变化。自然实验的结论是否能推广到总体的其他成员上将要依赖于因非随机抽样 发生的偏离、政策改变与其环境的相互作用,以及会导致影响从一个状况转换到另一 个状况的历史因素。 使用自然实验数据的主要好处是研究者所感兴趣的政策变量可能会被妥当地看做 外生变量。然而使用自然实验的数据时,对照组的选择是决定结论是否可靠的一个关 键性因素。同时,也当看到,几个影响社会实验的问题,比如选择性问题以及样本磨 损问题,同样也在自然实验中存在。另外只有当总体中的一个子集的某些变量发生改 变时,才在自然实验的框架下对问题进行分析,因此这个实验可能仅仅支持总体中的 一部分而已【6 i 。 2 4 小结 在此,将三类数据做一个比较。 西南交通大学硕士研究生学位论文第10 页 表2 1 三类数据的比较 由上表,社会实验数据是在人为控制的实验环境下获得,并且被调查者都是志愿 参加,因此本文所研究的缺失数据不易在此类数据中产生。此外,由于社会实验数据 还面临着成本问题,因此国内这方面的数据较少。 而调查数据与自然实验数据都是在真实的自然环境下产生的,两者的区别在于后 者要在子总体发生特定的外生性变化下产生,因而其产生的几率要小于前者。由于两 类数据的被调查对象都非志愿参加,因此都存在缺失数据的问题,进而产生样本代表 性问题。但对于自然实验数据,其还面临着其他更为重要的问题。由此可见,两者相 比而言,缺失数据问题更易发生在调查数据中。 此外,在国内,微观计量经济学的研究主要是建立在调查数据之上。 因此,在下面的研究中,研究对象仅限于调查数据的范畴中。 西南交通大学硕士研究生学位论文第11 页 - - i i , i i i i | 鼍曼皇曼曼鼍曼曼曼曼曼曼曼曼曼! 曼鼍曼曼曼鼍皇曼皇曼曼! ! 曼曼! 蔓曼曼曼曼曼皇曼 第3 章缺失数据 在本章,介绍了缺失数据的相关概念,特别是缺失数据机制。笔者根据所查阅到 的资料,总结了缺失数据对样本代表性和参数估计的影响,然后从容量变小的角度阐 述了其带来的其他影响。研究认为,当缺失机制为m c a r 时,可以剔除含有缺失数据 的样本,否则,若剔除含有缺失数据的样本,会影响样本的代表性,进而对计量回归 带来不利的影响。 3 1 相关概念 首先,介绍缺失数据的定义以及产生原因,然后进一步地阐述无回答的确定论与 随机论,最后再详细地介绍缺失数据机制。 3 1 1 定义 缺失数据是指未能取得所要搜集资料的一种现象。关于缺失数据的概念有不同的 术语来表达。大多数研究者,如s a x 3 4 1 ,都使用传统的表述词“无回答 ( n o n r e s p o n s e ) , 另一些学者,如k o o p m a n t 3 5 1 ,则称之为“缺失数据”( m i s s i n gd a t a ) ,这是古典统计学 中更为一般的叫法。另外还有学者称之为“不完全数据 【3 6 】( i n c o m p l e t ed a t a ) 和“无 访问”( n o n i n t e r v i e w ) 【3 7 】。本文中主要以“缺失数据”这一术语为主,个别情况下使 用“无问答 这一术语。 缺失数据主要包括如下几种情况:个体无回答和项目无回答以及抽样框的覆盖不 全。个体无回答也称全无回答,是指被调查者由于主观或客观的原因未接受调查,因 而造成整个问卷的空白;项目无回答也称部分无回答,是指调查者接受了调查,但是 未能回答部分项目,从而造成调查内容不完整。抽样框的覆盖不全是指抽样在设计阶 段目标人群未覆盖完全,因而造成本应访问的人员类型未包含在最终确定的受访人群 类型内。 关于调查中无回答程度的测定方法有很多,通常是采用比率形式反应无回答率。 无回答的测定具有如下几个作用: ( 1 ) 测定作用。用于衡量调查中测定无回答的程度。 ( 2 ) 对调查的操作进行监督,根据无回答反馈回来的情况,对调查计划进行修改, 也便于今后相关调查计划的制定f 3 8 】。 ( 3 ) 用于调查员工作质量的考察。 首先定义个体无回答的测定,由于个体无回答的测定有许多不同的背景和用途, 西南交通大学硕士研究生学位论文第12 页 因此对于无回答进行测定的相关术语和相应的定义也有所不同。l e s s l e r t 3 8 】从回答率、 完成率和拒绝率这三个方面对无回答的测定方法做了一次总结。但单就一个方面而言, 其面临的测评方式也多种多样,这在于人们对于回答率的测定有各自的理解。在回答 率的计算中,不同的看法集中在分母“样本中合格单位数上 。而在完成率和拒绝率的 计算中,也存在着分歧。 项目无回答的测定同样采用比率的方法,通常是对将含有项目缺失的样本数除以 合格单位数,它可以反映该有缺失数据的项目在调查过程中取得可用信息的困难程度。 同时,也应当注意,无回答的测评仅告诉了无回答的程度,但它并不表示无回答 率越大,给统计估计所带来的影响越大。它仅仅意味着潜在威胁,这种影响的大小实 际上与回答层与无回答层的差异有关。实际上,如果回答层与无回答层的差异很小, 与差异较大的回答层和无回答层相比较,即便前者的无回答率高于后者,其对统计推 断的影响也要小于后者。 在本文中,取回答率衡量调查中个体无回答程度,样本中的合格单位包括访问完 成、符合条件的受访者不在家、临时外出、拒绝回答和其他符合受访条件的单位。并 用上述的项目无回答率对项目无回答程度进行衡量。 3 1 2 造成缺失数据的原因 因为调查是调查者与被调查者互动的过程,因而造成数据缺失的原因是双方面的, 既有调查者的原因,也有被调查者的原因。影响调查者的原因是多方面的,比如责任 心不强,怕吃苦,激励机制的不完善或者本身得到的培训就不够等,这些都会造成数 据的缺失。而在调查者足够努力的情况下,仍有无回答现象的发生,那么原因就要归 结于被调查者身上了。 下面,在调查者足够努力的情况下,总结无回答的主要原因【3 83 9 1 。 1 被调查者的不合格 由于抽样框设计的问题或者确定具体的调查对象时,将不应调查的人员纳入到了 调查范围内,比如对于未成年人调查婚姻问题,这会造成调查的无法回应。 2 未寻找到被调查者 它包含如下几种情况: ( 1 ) 遗漏了应该调查的对象。 ( 2 ) 由于地址的原因造成了问卷无法达到调查者。 ( 3 ) 由于调查者自身的原因使得调查内容未达到调查者。这种情况下,调查者地 址清楚,但调查内容未能与被调查者接触、取得联系。比如被调查者出外打工或者

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论