第十一章-调查中的非抽样误差讲解.ppt_第1页
第十一章-调查中的非抽样误差讲解.ppt_第2页
第十一章-调查中的非抽样误差讲解.ppt_第3页
第十一章-调查中的非抽样误差讲解.ppt_第4页
第十一章-调查中的非抽样误差讲解.ppt_第5页
已阅读5页,还剩47页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

1、第十一章 调查中的非抽样误差,1、误差的来源及特点 2、抽样框误差 3、无回答误差 4、计量误差,数据的准确性与可靠性是抽样调查的生命力之所在。 换言之,一次抽样调查是够成功的关键是选取的样本能否很好地代表总体,样本和总体之间的差异有多大。 如果不考虑样本的代表性和误差,很可能会得出错误的结论。 如美国选举前的调查。,为什么要研究误差?,美国选举案例,谁会在1936选举中获胜 ?Alf London还是 F.D.R.(罗斯福)? Literary Digest (文摘)送出一千万份问卷(返回二百四十万份)后,预测London 会赢。 而Gallop(盖洛普)只问了5000人说 Roosevel

2、t (罗斯福)会赢。 最后罗斯福和盖洛普都赢了。文摘倒闭了。,样本数据误差的来源,抽样误差的特点,在抽样调查中,抽样误差是不可避免的,但是可以估算出抽样误差的大小; 增大样本量可以减少抽样误差; 选择更适合的抽样方法可有效减小抽样误差,如分层抽样、多阶段抽样等; 利用辅助变量改进估计方法也可提高估计的精度,如比估计和回归估计。 预先可知。,返回,非抽样误差不随样本量增大而减小 造成估计量有偏,且难以从样本中估计出来,(知道存在,但无法估计出误差的大小); 有些非抽样误差难以识别和测定,(不知道是不是存在非抽样误差);如班级人数 成因复杂,有社会的、经济的、心里的等多方面的因素,处理方法复杂,且

3、较困难。,非抽样误差的特点,非抽样误差的产生,1、调查及抽样设计阶段 问卷设计:词汇、问题能导致多种理解 抽样框不完善 2、数据采集阶段 无回答:没有填写 信息不真实:没有填对 3、数据处理与分析阶段 审核、整理、录入时出错 估计方法不当:抽样方法必须和估计方法一致。,在抽样调查的各个阶段都有可能出现非抽样误差,NEXT,问卷设计阶段可能出现的问题,您是否认为使用电脑数字技术制作的广告更具有吸引力? 人们认为长虹牌彩电质量不错,你觉得怎么样? 您觉得产品的包装不好看吗?,返回,抽样框,抽样框不完善,返回,目标总体,抽样框,抽样框,抽样框误差及其控制,一、抽样框误差的产生 抽样框是有关总体全部单

4、元的名录或地图等的框架,是抽取样本单元的依据。理想的抽样框(也称抽样总体)应该同所研究现象的总体(也即目标总体)一致,但在实践中,抽样总体与目标总体常常不一致,由此产生的误差就是抽样框误差。,考察抽样框误差的成因,大致有以下几个方面:,(1)丢失目标总体单元。在此情形下,抽样框没有能够覆盖全部目标总体单元,也就是使部分目标总体单元没有包括在抽样框中,因而也就没有机会被选入样本。由于存在丢失单元,使得总体总和的估计偏低,总体均值的估计也可能会出现偏差。丢失单元是一种威胁性较大的抽样框误差,具有较强的隐蔽性,不易被发现。,(2)包含非目标总体单元。 有时,抽样框中也可能包含了一些不属于研究对象总体

5、即非目标总体的单元,由此容易导致总体总和的估计偏高。但这种类型的抽样框误差一般要比丢失单元的威胁性小。因为在调查中,非目标总体单元往往更容易被发现,并予以剔除。,(3)复合联接。 实践中常可能会遇到这种情况:抽样框中的单元与目标总体单元不完全为一一对应,而是一对多或多对一,即存在复合联接。在这种情形下,目标总体中各个单元的入样概率可能会受到相应的影响,从而导致非抽样误差的扩大。但是,有时候采用经过精心设计的有复合联接的抽样框可以提高稀有元素被抽中的概率。 比如:一个门牌号内有几户人家,或一个家庭有几处住房。,(4)不正确的辅助信息。 一般将不包含辅助信息的抽样框称之为简单抽样框,而将包含辅助信

6、息的抽样框称为复杂抽样框。复杂抽样框中的辅助信息可以用于分层抽样、不等概率抽样,以及使用比估计和回归估计等。如果辅助资料不完全或不正确,则不但不能提高抽样估计的效率,反而会降低估计的准确性。,(5)抽样框陈旧。 有时由于构成抽样框的抽样单元资料“老化”,抽样框所提供的信息与现实情况差距较大,也会导致抽样框误差。并且这类误差也可能进一步引起前面四类抽样框误差中的一种或几种同时发生。 比如,以2000年的人口普查资料作为抽样框。,二、抽样框误差的确定,(一)丢失目标总体单元时的影响 前已指出,丢失目标总体单元是抽样框误差中威胁最为严重的一种。现设目标总体是由N1个抽样总体单元及另外N0个没有包含在

7、抽样框中的单元(即丢失单元)组成,即N=N1+N0,则总体总和应为:,(一)丢失目标总体单元时的影响,其中Y1为抽样总体总和,Y0为丢失单元总和,Yi为第i单元的观测值。现从抽样框的N1个单元中随机抽取n1个单元组成样本,则 是Y1的无偏估计。当估计Y时,结果就会出现偏差,偏差为- Y0。 如果以r表示丢失单元与抽样框中单元的均值之比,又以W0表示丢失单元占全部目标总体单元的比重。,(一)丢失目标总体单元时的影响,则估计Y的相对偏倚为: 则均值的相对偏倚为: 由此可见,相对便宜取决于r和W0两个因素。 当r=1是,均值估计量是无偏的。,总体总和估计偏倚,总体均值估计偏倚,(二)包含非目标总单元

8、时的影响,如果以M0表示抽样框中所含非目标总体单元数,MT表示抽样框中所含目标总体单元数,则抽样框所含全部单元数M=MT+M0,在抽样框中不存在丢失单元,也没有复合联接时MT=N,则抽样总体总和可表示为,(二)包含非目标总单元时的影响,其中,Y0是非目标总体单元观测值之和,Y是目标总体总量,Yi为第i单元的观测值。现从抽样框的M个单元中随机抽取m个单元组成样本,则 为YF的无偏估计。当用来估计Y时,就会产生偏差,这表明被高估了。,(二)包含非目标总单元时的影响,如果以u表示非目标总体单元与目标总体单元均值之比,Q0表示非目标总体单元占抽样总体单元的比重,即 则总和估计量YF的相对偏差可表示为

9、当估计总体均值时,估计的偏差为 此时的相对偏差为,(二)包含非目标总单元时的影响,在实际调查中,如果将那些被选入样本的非目标总体单元剔除,而以样本中剩余的属于目标总体单元的资料进行估计,由于减少了样本容量则会使估计的误差增大。令:,(二)包含非目标总单元时的影响,则总体总和估计为 此时有 其中 同完善的抽样框(即Q00 )相比,包含非目标总体单元抽样框使得估计误差增大,三、抽样框误差的补救,根据前面的分析可以看出,当抽样框不完善时常会给抽样估计产生程度不同的影响,但在实际中取得一个好的抽样框又可能十分困难,我们常常不得不面对各种有缺陷的抽样框。但这并不等于说我们就只能使用这种不完善的抽样框,事

10、实上可以有多种办法用来对抽样框误差进行调整和补救。,(一)丢失单元抽样框的补救,基本思路大致有三种类型:一利用资料对抽样框进行调整或对估计量进行调整;二利用规则进行现场处理;三使用多个抽样框进行抽样。具体方法有: (1)对丢失单元实行连接。当在调查过程中能够查明丢失单元时,在调查前可以确定某种规则,将丢失单元同抽样总体中的单元联接起来,以便将查明的丢失单元纳入到不完善的抽样框中,并赋于其与抽样总体相同的抽选概率。,(一)丢失单元抽样框的补救,(2)采用辅助抽样框。即将查明的丢失单元单独编制成一个辅助抽样框,并同原抽样框一起使用。 (3)利用有关资料进行推算。通过分析丢失单元的特征,尤其将丢失单

11、元同抽样总体单元进行比较,结合其它一些资料,则可以大致对丢失单元的统计特征性作出一个估计或判断,并以其对实际调查的结果进行调整的基础上作出估计,这样也可以减弱丢失单元造成影响。,(一)丢失单元抽样框的补救,(4)用复查结果调整。也就是采用核查和质量检查的方式,查明丢失单元的影响程度,并做为对原调查结果调整的依据。这种方法在我国的农产量调查中得到应用,在那里,抽样是依据上报面积进行,而在推算过程中是以核实面积调整上报面积(具体是用核实系数),又以丈量面积调整核实面积。,(二)其它类型不完善抽样框的补救,对于包含非目标总体单元的抽样框的补救,可以利用有关信息来进行调整,也可以通过对抽样框进行质量检

12、查的方法以查明和剔除非目标总体单元。不准确的辅助信息常常是同抽样框资料的老化有关的。因此,在构造完善的抽样框时,必须注意选择最新的资料,同时要加强对抽样框的维护,以保证抽样框的质量。,(二)其它类型不完善抽样框的补救,对于抽样框中的复合联接问题,需要具体进行区分:对属于一对多联接(即一个抽样总体单元对应多个目标总体单元的联接)的情形,当这种现象比较多时,可以将其作为一种整群抽样,按整群抽样的方法处理;而对属于多对一联接(即多个抽样总体单元对应一个目标总标单元的联接)的情形,一是可以针对产生这种复合联接的原因重新定义联接规则,以使每个目标单元与抽样总体单元唯一联接。,(二)其它类型不完善抽样框的

13、补救,如以职工名单为抽样框抽选职工家庭时,规定必须是家庭中年龄最大的职工方可入选样本,这样即使一个家庭有几个职工,但与只有一个职工的家庭被抽中的概率是相同的。二是利用有复合联接的调查数据,对目标总体进行估计,(具体方法可查阅有关文献,如J.T.莱斯勒等人的著作)。,(二)其它类型不完善抽样框的补救,使用多个抽样框 多个抽样框可能会产生重叠,对估计有影响,方法就是剔除重叠部分。,第三节 无回答误差,无回答误差比较普遍,对估计的影响也较大。根据产生条件不同,无回答可分为: 1、根据内容区分: 单元无回答:调查单元没有参与或拒绝接受调查。 项目无回答:某些问题没有回答,如敏感性、隐私性的问题。,无回

14、答误差,2、按性质分: 有意无回答: 有意无回答对数据质量的影响很大,回答者与无回答者之间往往存在系统性差异,不仅减少了有效样本量,增大了估计量方差,而且导致估计偏倚。 无意无回答: 一般认为是随机的,但若产生于某个具有同样特征的群体时,也会造成估计的偏倚。(如旅游开支),产生原因,1、查找阶段: 找不到被调查者 2、接触阶段: 找到但没有接受调查 3、采访阶段: 部分问题没有回答,无回答影响,对无回答进行研究时,可以把总体分为两层:第一层由入样能得到其计量值的所有单元组成,简称回答层;第二层由无法测得计量值的单元组成,简称无回答层。设N。N1,N2分别为总体单元数,回答层单元数和无回答层单元

15、数,R1,R0分别为总体回答率和无回答率:,无回答影响,则总体均值: 从总体中抽取容量为n的简单随机样本,n1来自回答层,n0来自无回答层。可知回答单元样本均值 是总体回答层均值的无偏估计。 用 作为总体均值 的估计时,其偏倚为:,无回答影响,由此可得总体总量的偏倚和相对偏倚。 可以看出,导致无回答偏倚的原因主要来自两个方面: 回答层与无回答层之间的数量差异; 无回答率 启示: 如 ,这时相当于样本量的减少; 如 ,必须降低无回答率或加以调整。,降低无回答的措施,解决问题最好的方法是不让它发生。 1、问卷设计 2、激发被调查者的参与意识 3、确定准确的调查方位 4、消除疑虑 5、调查员的挑选

16、6、调查员培训 7、过程监控 8、奖励措施 9、再次调查(改变方法) 10、替换被调查者(按一定规则),无回答数据的处理,(一)再抽样调整 指在第一次无回答单元中随机抽取一个子样本进行深入调查,作为无回答层的估计。 估计量见教材p261页 对无回答层单元进行再抽样,可以得到无偏估计量,但是以增大估计量方差为代价的。,无回答数据的处理,(二)加权调整 通过对调查中所获得的回答数据使用加权因子,来减小由于无回答造成的估计偏倚。,无回答数据的处理,(三)相关推估法 主要用于项目无回答 用已知信息估算未知信息的方法,无回答数据的处理,(四)插补调整 插补可以达到两个调整目的: 减小估计量偏倚 力图构造一个完整的数据集 实际中用的比较多的是均值插补: 将样本分成若干组 计算各分组均值替代缺失值 弱点: 1、歪曲了样本单元的分布;2、对方差的低估,第四节 计量误差,成因:设计误差、被调查者误差、调查者误差、其他误差。 (一)设计误差 用词不当 问题顺序 抽样过程设计(严格随机) (二)被调查者误差 无意识误差和有意识误差,第四节 计量误差,(三)调查者误差 记录错误 诱导 (四)其他误差 测量工具 编码 录入,计量误差模型,模型说明 如果存在计量偏倚,估计量有偏,且偏倚无法计算; 偏倚不影响方差估计;

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论