版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
1、中国劳动力动态(CLDS)“劳动力数据”权数计算说明梁中山大会科学中心二一三年四月本说明系中山大会科学中心“中国劳动力动态(CLDS)”的版本。说明文件。本说明文件会随着时间不断有所更新,提醒读者注意是否本文的梁 技术建议:,中山大,2013,中国劳动力追踪计算说明,中国劳动力追踪系列会科学中心。联络方式:中山大会科学中心目录介绍一、村居问卷的权数(一)、村居的抽样设计权数(二)、执行调整权数二、家庭问卷的权数(一)、抽样设计权数(二)、执行调整权数(三)、事后分层调整权数(四)、家庭户的各类的效果对比:三、劳动力问卷的权数(一)、抽样设计权数(二)、执行调整权数(三)、事后分层调整权数(四)
2、、劳动力的各类的效果对比:四、变量列表五、使用的注意事项六、使用 SA进行分析的说明介绍这份带有备忘录性质的文件劳动力动态(以下简称“CLDS”)”国际的技术的,该方法所的,是劳动力动态下获得的成果。“中国劳动力动态”国际委员会成员如下:()基于的建议,中国劳动力动态(CLDS)被设计成一个轮换跟。CLDS作为一个轮换踪 告主,其权数包含基线权数和追踪权数。本报方法。明其基线数据的CLDS基线抽样框(东部的抽样设计是一个三阶段不等概率的整群抽样设计,包含7个大省群、中部大省群、西部大省群、东部小省群、中部小省群、西部小省群、补充样本)组成的7个子总体(样小省本、东部大省样本、中部大省样本、西部
3、小省样本、大省样本、东部补充样本)。样本、中部小省样本、西部CLDS一共进行了3个层次的,即村居层次、家庭层次和劳动力层次。所以提供这3个层次的数据库。每个数据库包含多个变量,为了得到目标变量的无偏或近似无偏估计量,并对数据进行更准确的定量分析,CLDS的权数进行了计算,并向使用者提供对社区、家庭和劳动力的每个回答抽样设计权数、调整权数、事后调整权数三种类型的权数。为了帮助读者使用这些权数,分析的说明。介绍了在SA下使用这些权数进行一、村居问卷的权数(一)、村居的抽样设计权数抽样设计权数即样本单元入样概率的倒数。CLDS 的村居抽样是按 2 个阶段进行的,所以该类权数计算的过程中需要考虑 2
4、个阶段的权数,即在每个抽样框中抽取样本区县的权数、在每个样本区县中抽取样本村居的权数。1、第一阶段的设计权数第一阶段的抽样设计概率是每个抽样框中每个样本区县的入样概率,即:Nsjpcj;其中, N 是第s个抽样框的总数, N 是第s个抽样框中第j个sjssj/样本区县的数, Js 是第s个抽样框的样本区县的总个数。下标s表示抽样框,s=1,2,7;下标 j 表示区县,j=1,2, n j , n j 表示第i个抽样框中抽中的区县样本数。第一阶段的设计权数是第一阶段的设计概率的倒数。2、第二阶段的抽样权数第二阶段的抽样设计概率是每个样本县区中每个样本村居的入样概率,即:Nsjkpcj;其中, N
5、 是第s个抽样框第k个区县的总数, N是第s个sjksksjksk /s抽样框中第j个样本区县中的第k个村居的总数, Ks 是第s个抽样框的第j个样本区县的村居总数。下标k表示村居,k=1,2, nk , nk 表示第k抽中的区县中的村居样本总数。针对补充样本的调整。为了可以更精确的分析大城市样本,采用了补充样本的设计(supplemental sle design),即对于被抽中的大城市,其入样概率在36%以上的虚拟区,增加了一倍的村居样本。最终有6个大城市有过度抽样(oversle)。 因此需要建立一个新的权数,将补充样本与样本(core sle)在一起。的补充样本,是在第二阶段抽取,因此
6、,需要在这个阶段考虑新权数。使用了OMuircheartaigh and Pedlow (2002) 以及Wes(2006)混合方法补充样本的增加,不应该增加该城市在样本中的比例。换(pooled approach)。句话说,新的该城市补充样本与样本的权数之和,也应该等于该城市的规模。因此,假定分析某个变量 ,假设0 1,两个样本放在一起的值为: c (1 ) s其中, c 代表样本的值, s 代表补充样本的值。因为样本和补充样本是独立的,因此作为权数, 的最优解为:nc / dc nc / dc ns / dsns / ds1 nc / dc ns / ds其中, nc 和ns 为样本与补充
7、样本的样本量, dc 和ds 为样本与补充样本的设计效应。因为设计中,样本与补充样本的样本量相等,样本与补充样本的设计效应也相等,因此, 0.5 。所以,在加抽补充样本的大城市中,需要进行的调整是,补充样本与样本的设计入样概率为原来的一半。第二阶段的设计权数是第二阶段的设计概率的倒数。3、抽样设计权数抽样设计概率是上述 2 个各阶段抽样设计概率的乘积。 Nsj Nsjkpcj N Ndes/ J/ Ks s ssk抽样设计权数就是抽样设计概率的倒数。(二)、执行调整权数无回答村居,是指在被抽中的县区中,没有获得任何一份有效的家庭问卷。这种情况一共发生了15次,其中2个分布在无回答调整概率为:补
8、充样本中。N cj sjpcjsjN cj jkN cj sj 和 N cj jk 分布代表第s个抽样框中第j个样本区县中实际村居数量和设计村居数量。村居的执行调整概率是抽样设计概率乘以无回答调整概率: N cj sj NsjNsjkp cj runN / JN/ Kcjss sks Njk村居的执行调整权数是村居的执行调整概率的倒数。二、家庭问卷的权数(一)、抽样设计权数CLDS 抽样是按 3 个阶段进行抽取家庭的,所以权数计算的过程中需要考虑 3 个阶段的权数,即在每个抽样框中抽取样本区县的权数、在每个样本区县中抽取样本村居的权数、在每个样本村居的家户抽样框中抽取样本家户的权数。1、第一阶
9、段的设计权数第一阶段的抽样设计概率是每个抽样框中每个样本区县的入样概率,即:N hsjph;其中, Nhs 是第s个抽样框的总户数, N sj 是第s个抽样框中第jhsjhs /s个样本区县的总户数, Js 是第s个抽样框的样本区县的总个数。下标s表示抽样框,s=1,2,7;下标 j 表示区县,j=1,2, n j , n j 表示第i个抽样框中抽中的区县样本数。第一阶段的设计权数是第一阶段的设计概率的倒数。2、第二阶段的抽样权数第二阶段的抽样设计概率是每个样本县区中每个样本村居的入样概率,即:N hsjkhhhp;其中, Nsk 是第s个抽样框第k个区县的总户数, N sjk 是第s个sjk
10、hsk /s抽样框中第j个样本区县中的第k个村居的总户数, Ks 是第s个抽样框的第j个样本区县的村居总数。下标k表示村居,k=1,2, nk , nk 表示第k抽中的区县中的村居样本总数。针对补充样本的调整。为了可以更精确的分析大城市样本,采用了补充样本的设计(supplemental sle design),即对于被抽中的大城市,其入样概率在36%以上的虚拟区,增加了一倍的村居样本。最终有6个大城市有过度抽样(oversle)。 因此需要建立一个新的权数,将补充样本与样本(core sle)在一起。的补充样本,是在第二阶段抽取,因此,需要在这个阶段考虑新权数。补充样本的增加,不应该增加该城
11、市在样本中的比例。换句话说,新的该城市补充样本与样本的权数之和,也应该等于该城市的规模。因此,假定分析某个变量 ,假设0 1,两个样本放在一起的值为: c (1 ) s其中, c 代表样本的值, s 代表补充样本的值。因为样本和补充样本是独立的,因此作为权数, 的最优解为:nc / dc nc / dc ns / dsns / ds1 nc / dc ns / ds其中, nc 和ns 为样本与补充样本的样本量, dc 和ds 为样本与补充样本的设计效应。因为设计中,样本与补充样本的样本量相等,样本与补充样本的设计效应也相等,因此, 0.5 。所以,在加抽补充样本的大城市中,需要进行的调整是,
12、补充样本与样本的设计入样概率为原来的一半。第二阶段的设计权数是第二阶段的设计概率的倒数。3、第三阶段的抽样设计权数第三阶段的抽样设计概率是每个样本村居中抽取家庭户的概率,即:N hs /(JK )h ss 其中, Nhpsjk 是第s个抽样框中第j个样本区县中的第k个村居的sjkhN hsjk户数; N hs 是第s个抽样框的总户数;总计划Js 表示第s个抽样框的样本区县数; Ks 表示第s个抽样框中第j个区县抽取的村居数量,这样, Js Ks 即是第s个抽样框所要抽取的总村居样本数。在研究设计中, N hsjk 设计为35户。第三阶段的设计权数是第三阶段的设计概率的倒数。4、抽样设计权数抽样
13、设计概率是上述各阶段抽样设计概率的乘积。 N hsjk N hs /(JK ) N hsjp h ss desN hs / JN hsk / KN hsjks s 家庭的抽样设计权数就是抽样设计概率的倒数。(二)、执行调整权数0、村居无回答调整无回答村居,是指在被抽中的县区中,没有获得任何一份有效的家庭问卷。这种情况一共发生了15次,其中2个分布在补充样本中。无回答调整概率为:N cj sjpcjsjN cj jkN cj sj 和 N cj jk 分布代表第s个抽样框中第j个样本区县中实际村居数量和设计村居数量。1、样本的户膨胀调整知道,在实际抽样中,会存在入户成功率小于1的情况,因此,在抽
14、取家庭的时候,采取膨胀样本,且样本无替换的方法。例如计划抽取35户,实际抽取50户(假定成功率平均为70%,这样35/0.7=50),这样,膨胀系数为1.43。因此,劳动力在膨胀样本后的入样概率,即: Ns /(Js Ks ) .index,其中index为第k个村居的膨胀系数,其计算方phsjkhisjksjkN hsjk .H法为实际接触户数除以原来设计的35户: indexsjk contact_f/35 。2、无回答调整CLDS获得的数据经过事后与2010年第六次普查资料在性別、户规模、教育等的分布进行比较,发现不仅各区县的成功率有同,甚至同一区县的不同户规模、性別、分组的成功率也尽相
15、同,因此能假設无回答(non-response)的现象是完全随即的( missing compley at random, MCAR),在此情況之下,如按成功率进行调整, 則能代表原抽样总体。无回答调整权数主要是针对CLDS实际中的各个阶段(区县、村居、家户、)的各种类型(无法联系、拒访等)的单元无回答进行的进一步调整。从方便操作的角度出发,假定同一村居的回答具有相似性,以此为前提,采用了简单的以村居为组的无回答调整方法。家户无回答系数,需要同时考虑村居层次的无回答调整系数和家户层次的无回答调整系数,是这两者的乘积。其中村居层次的无回答调整系数见村居权数说明部分。家户层次的无回答调整系数如下:
16、h n non _ sjk和nhph;其中nh分别表示家庭成员问卷的第s个抽non _ sjkhnon _ sjknon _ sjknhnon _ sjk样框的第j个样本区县第k个样本村居中的总接触家户数和总完成家户数。3、户的户的执行调整权数执行概率,是户的抽样设计概率乘以户的的执行调整概率: nhnon _ sjk N h /(J K ) N cj sj N hN hsjsjksphrunss N cj indexnhnon _ sjkhhN hsjkN/ JN/ Ks s jk ssksjk户的执行调整权数是户的执行调整概率的倒数。(三)、事后分层调整权数样本的结构与总体符,strati
17、fication weights)1、多变量反复需要采取的补救措施有事后分层法(Raking)2。方法(t1事后分层法是同时对几个同的变量的联合分布进。该方法先将同变量组合的总体分成不同的子总体(由于每个子总体具有一样的特征,例如城市的 1519 岁的男性子群、农村的 2025 岁的女性子群,统计上当做均质的层,因此称为事后分层),再算出每一层内的权数,进而一次就直接将几个目标变量进过关,并使得后的目标变量与总体在这些变量上的分布完全一致。因此事后分层方法因其计算方成为最常被采取的方法。但是这个方法要求必须可以得到总体在所选取变量上的联合分布的情况;而实际上经常做不到。因此,这就提出了多变量反
18、复法。2多变量反复法则是一次对一个变量进,目标是要让若干个变量得到一致的分布,则须先后依照顺序对这些变量进,断重复对这些变量进至所有变量同时与总体分布一致为止,在反复庭民族分两类、,当第一次过序中,如的变量有户中规模分 8 类、家将户中规模的分布与总体比分布一致后,第二次将家庭民族二分类调整与总体比分布一致时,户中规模的各分类的比又可能与总体比符,所以多变量反复法就是要通过多次迭代(iterative proportional事后分层方法要求必须具有进行的多个变量的联合分布;而多变量反复法则在仅仅拥有进行的多个变量的各自分布的情况下即可执行。使用了中国 2010 年普查资料中给出的家庭有关变量
19、的分布数据。但是非常遗憾,该资料仅仅有这些变量(家庭规模、家庭民族、家庭结构、家庭世代结构)与地区变量的联合分布,没有家庭规模、家庭民族、家庭结构、家庭世代结构之间的联合分布,因此不适合使用事后分层方法。所以采用多变量反复法进行事后。在可以进行多变量反复的事后变量中,家庭规模、家庭结构、家庭世代结构之间具有很强的相关,如家庭规模为 1,则家庭世代结构也只能是一代人,这使得他们之间的联合分布中,会出现很多为 0 的各自,且无法合并(例如家庭规模为 1,在家庭世代结构为 2 代、3 代、4 代的格子总均为 0 观测个案);因此经过考虑,仅保留家庭规模,而舍弃家庭世代结构变量。以下是进行调整的相关家
20、庭变量分布:的样本不包括海南和,但2010 年普查资料中的资料是汇总,数据显示,海南和的家庭规模仅占全部资料的 0.7%,具体见下表:fitting algorithm),最终达到将若干需要方法由 Deming and Stephan (1940)提出,序 ipfweight 来完成。的变量同时调整与总体比分布一致为止。该使用 Michael Bergmann 给出的 SA 分析程去除海南和的全国家庭总户数海南家庭户占全国比例海南家庭户数家庭户总数无60岁及以上老年人的户有6064岁老年人的户有65岁及以上老年人的户普查数据0.694130.086840.21903单一民族户二个或以上民族户普
21、查数据0.972580.02742城市乡镇农村普查数据0.320100.195380.48452一人户二人户三人户四人户五人户六人或以上户普查数据0.145290.243690.268650.175650.100350.06639因此,即使海南和在这些变量上的分布与有巨大的差异,对每个变量的影响会非常小。因此直接使用资料。法获得的事后数3。多变量反复经过多变量反复法在计算时,是以户的执行调整权数为起点。直接给出户的事后调整权数。(四)、家庭户的各类的效果对比:下面列出以上不同下的关键变量上的分布:规模,分为6类,从1人户到5人户,以及6人以上户;家庭设计权数修订权数事后权数0.35490.35
22、920.32010.15560.16780.19540.489540.47300.4845无设计权数修订权数事后权数0.95680.95340.95340.97260.04320.04660.04660.02743使用 Michael Bergmann 给出的 SA 命令 ipfweight 来完成多变量迭代权数后的分布,与总体分布的差异在 0.001%以内。(IPF-Algorithm adjustment weights),样本无60岁及以上老年人的户有6064岁老年人的户有65岁及以上老年人的户普查数据0.694130.086840.21903单一民族户二个或以上民族户普查数据0.972
23、580.02742城市乡镇农村普查数据0.320100.195380.48452无0.41750.15760.4249一人户二人户三人户四人户五人户六人或以上户普查数据0.145290.243690.268650.175650.100350.06639无0.11970.29570.27570.16810.09110.0497设计权数0.11850.30820.27250.16750.08850.0447修订权数0.12070.29910.26740.17150.09120.0501事后权数0.14530.24370.26860.17560.10030.066440193419639893220
24、930019870.0074688520.74060.73210.73660.69410.08570.08660.08610.08680.17380.18130.17730.2190无设计权数修订权数事后权数多变量反复迭代法是在无需要的多变量的联合分布下的事后方法。六普数据中有城乡和家庭规模这两个变量的联合分布,因此,给出结果多变量反复迭代法获得的事后个方法有所比较:组别在这 2 个变量上的联合分布,以便数据使用者对这 2无回答权数调整比例0.04632450.11368310.115420.04984790.02511940.00885160.0187690.04740430.0407829
25、0.03015080.01903040.01163410.05559130.1380040.11115520.09153250.04704350.0296556事后分层调整权数比例 0.05072230.08431570.10459850.04577380.02452920.01016040.02610110.04418640.04757290.03582680.02446180.01723110.06846370.1151830.11647320.09404590.0513570.03899722010比例抽样设计权数比例家庭规模样本比例城乡城市城市城市城市城市城市乡镇乡镇乡镇乡镇乡镇乡镇农
26、村农村农村农村农村农村1234561234561234560.05746970.08905590.10613620.03881870.02000210.00862180.02754140.04769380.05426710.03491470.01881020.01214870.06027710.10694120.10824430.10191340.06153380.04560980.05597440.13352810.13635510.05588010.02676220.00904640.01743310.04428950.03788160.02845830.017810.01168490.0
27、4626840.11788540.10148890.08377310.04655110.02892950.04301610.11662490.11887540.04602170.02286130.00748460.01786710.04541410.03800540.02703110.01773260.00958460.05765210.14612090.11563330.09444860.04794890.0276771三、劳动力问卷的权数(一)、抽样设计权数抽样设计权数即样本单元入样概率的倒数。由于 CLDS 抽样是按 3 个阶段进行的,所以该类权数计算的过程中需要考虑 3 个阶段的权数,
28、即在每个抽样框中抽取样本区县的权数、在每个样本区县中抽取样本村居的权数、在每个样本村居的家户抽样框中抽取样本家户的权数;最后在家庭中抽取所有劳动力范围内的。1、第一阶段的设计权数第一阶段的抽样设计概率是每个抽样框中每个样本区县的入样概率,即:Nsjp ;其中, N 是第s个抽样框的总数, N 是第s个抽样框中第j个sjssj/ss样本区县的数, Js 是第s个抽样框的样本区县的总个数。下标s表示抽样框,s=1,2,7;下标 j 表示区县,j=1,2, n j , n j 表示第i个抽样框中抽中的区县样本数。第一阶段的设计权数是第一阶段的设计概率的倒数。2、第二阶段的抽样权数第二阶段的抽样设计概
29、率是每个样本县区中每个样本村居的入样概率,即:Nsjkp;其中, N 是第s个抽样框第k个区县的总数, N是第s个抽sjksksjk/sks样框中第j个样本区县中的第k个村居的总数, Ks 是第s个抽样框的第j个样本区县的村居总数。下标k表示村居,k=1,2, nk , nk 表示第k抽中的区县中的村居样本总数。针对补充样本的调整。为了可以更精确的分析大城市样本,采用了补充样本的设计(supplemental sle design),即对于被抽中的大城市,其入样概率在36%以上的虚拟区,增加了一倍的村居样本。最终有6个大城市有过度抽样(oversle)。 因此需要建立一个新的权数,将补充样本与
30、样本(core sle)在一起。的补充样本,是在第二阶段抽取,因此,需要在这个阶段考虑新权数。补充样本的增加,不应该增加该城市在样本中的比例。换句话说,新的该城市补充样本与样本的权数之和,也应该等于该城市的规模。因此,假定分析某个变量 ,假设0 1,两个样本放在一起的值为: c (1 ) s其中, c 代表样本的值, s 代表补充样本的值。因为样本和补充样本是独立的,因此作为权数, 的最优解为:nc / dc nc / dc ns / dsns / ds1 nc / dc ns / ds其中, nc 和ns 为样本的设计效应。因为样本与补充样本的样本量, dc 和ds 为样本与补充设计中,样本
31、与补充样本的样本量相等,样本与补充样本的设计效应也相等,因此, 0.5 。所以,在加抽补充样本的大城市中,一半。需要进行的调整是,补充样本与样本的设计入样概率为原来的第二阶段的设计权数是第二阶段的设计概率的倒数。3、第三阶段的抽样设计权数第三阶段的抽样设计概率是每个样本村居中抽取劳动力的入样概率,即: Ns /(Js Ks ) 其中, N hsjk 是第s个抽样框中第j个样本区县中的第k个村居的总psjkhN hsjk .H接触户数;H为平均户内劳动力数; Ns 是第s个抽样框的总数; Js 表示第s个抽样框的样本区县数; Ks 表示第s个抽样框中第j个区县抽取的村居数量,这样, Js Ks
32、即是第s个抽样框所要抽取的总村居样本数;理论上,在没有无回答h家庭户的情况下, Nsjk 等于 N sjk .H 。户,城市中,每户有2.07个劳动力在研究设计中,每个村居计划抽取35,农村中每户有2.17劳动力。第三阶段的设计权数是第三阶段的设计概率的倒数。4、抽样设计权数抽样设计概率是上述各阶段抽样设计概率的乘积。 Ns /(Js Ks ) NsjNsjkpdes N N / J/ KN hsjk .Hss sks 抽样设计权数就是抽样设计概率的倒数。(二)、执行调整权数0、村居无回答调整无回答村居,是指在被抽中的县区中,没有获得任何一份有效的家庭问卷。这种情况一共发生了15次,其中2个分
33、布在补充样本中。无回答调整概率为:N cj sjpcjsjN cj jkN cj sj 和 N cj jk 分布代表第s个抽样框中第j个样本区县中实际村居数量和设计村居数量。1、样本的户膨胀调整知道,在实际抽样中,会存在入户成功率小于1的情况,因此,在抽取家庭的时候,采取膨胀样本,且样本无替换的方法。例如计划抽取35户,实际抽取50户(假定成功率平均为70%,这样35/0.7=50),这样,膨胀系数为1.43。因此,劳动力在膨胀样本后的入样概率,即: Ns /(Js Ks ) .index,其中index为第k个村居的膨胀系数,其计算方phsjkhisjksjkN hsjk .H法为实际接触户
34、数除以原来设计的35户: indexsjk contact_f/35 。3、无回答调整 CLDS获得的数据经过事后与2010年第六次普查资料在性別、户规模、教育等的分布进行比较,发现不仅各区县的成功率有同,甚至同一区县的不同户规模、性別、分组的成功率也尽相同,因此能假設无回答(non-response)的现象是完全随即的( missing compley at random, MCAR),在此情況之下,如按调整, 則能代表原抽样总体。成功率进行3.1、家户层次的无回答调整家户层次的无回答调整主要是针对CLDS实际中的各个阶段(区县、村居、家户、)的各种类型(无法联系、拒访等)的单元无回答进行的
35、进一步调整。从方便操作的角度出发,假定同一村居的回答具有相似性,以此为前提,采用了简单的以村居为组的无回答调整方法。家户无回答系数,需要同时考虑村居层次的无回答调整系数和家户层次的无回答调整系数,是这两者的乘积。其中村居层次的无回答调整系数见村居权数说明部分。家户层次的无回答调整系数如下:h nnon _ sjk和nhph;其中nh分别表示家庭成员问卷的第s个抽non _ sjkhnon _ sjknon _ sjknhnon _ sjk样框的第j个样本区县第k个样本村居中的总接触家户数和总完成家户数。3.2、劳动力劳动力层次的无回答调整的回答概率,采用倾向性匹配的办法。考虑到不同省份的城乡具
36、有社会信任、文化上的一致性,导致成功率的差异较大(总体上家庭内的劳动力成功率为74.02%,其中分城市区、县级市、县分别为:67.96%;78.14%和77.17%),为了排除这个部分造成的偏误,使用多层次logistic模型来所有家庭户内的劳动力的回答概率。家庭问卷中的全部家庭成员中的劳动力作为第一层次;被对象所属的省份的城乡类型作为第二层次;合格的家庭成员是否回答了劳动力问卷作为因变量。基于多层次logistic模型来每个劳动力的回答倾向性,并将其分为200组(平均每组包含110个劳动力),这时可以假定他们均具有相似的背景和回答概率,其回答概率计算为: nnon _ pg和np;其中n分别
37、表示第g个倾向性分组中的完成non _ p _ gnon _ pgnon _ pgnnon _ pg回答的劳动力总数和应该成劳动力总数;g=1,2,3,200。变量 i.countytype gender marryage edu poli health hukou fin_N old youth zhu内容地区类型变量类型分类分类分类分类连续分类连续分类连续分类分类分类状况最高学历是否党员健康状况户口家庭数是否有老人 是否有儿童 房屋所有情况模型结果为:Mixed-effects logistic regresNumber of obs=22303Group variable: procNu
38、mber of groups=59Obs per group: min =175avg =378.0max =1672egration pos =7Wald chi2(12)=1073.32Log likelihood = -12335.115Prob chi2=0.0000nomiss |Coef.Std. Err.zP|z|95% Conf.erval-+- gender |.2722582.03173228.580.000.2100642.3344522marry |.1171664.03128953.740.000.0558401.1784927age |.0729752.007442
39、19.810.000.0583891.0875614age2 | -.0007177.0000914-7.850.000-.0008969-.0005384edu | -.0096335.008828-1.090.275-.026936.007669poli | -.0444863.0580827-0.770.444-.1583263.0693537health | -.0368472.017869-2.060.039-.0718697-.0018247hukou |.3673215.04535218.100.000.278433.45621fin_N | -.2505741.0128557-
40、19.490.000-.2757707-.2253774old | -.1738993.0389113-4.470.000-.2501641-.0976346youth |.3197597.03769978.480.000.2458697.3936498zhu|.0350126.04163540.840.400-.0465913.1166166_cons | -.7553909.1819084-4.150.000-1.111925-.3988571Random-effects Parameters |EstimateStd. Err.95% Conf.erval proc: Identity|
41、sd(_cons) |.6915138.0684129.5696259.8394831回答组与未回答组的倾向性得分分布如下图,分析显示,完成的劳动力和没有完成的劳动力是不同的群体,存在着选择性。因此,使用倾向性匹配的方法进行,可以较好的处理选择效应带来的偏误。在数据库中给出的调整整权数是上述抽样设计权数与样本膨胀系数、无回答调整系数与的乘积。4、劳动力劳动力的的执行调整权数执行概率,是劳动力的抽样设计概率乘以劳动力的的执行调整概率: Ncjnh n NN Ns /(JsKs) sjnon_ sjk non_ pg sj sjkpindex non sjk run N N/ K Ncjhn n/
42、 JNh.Hs s jk non_ pg sjksjkssk劳动力的执行调整权数是劳动力的执行调整概率的倒数。density: Predicted mean012340.2.4.6.81Predicted meandensity: Predicted meandensity: Predicted mean(三)、事后分层调整权数家庭数据的抽样设计权数是三个阶段的权数的乘积。在计算过程中,利用国家第六次普查数据中的家庭户数据和过程中的地图法中的住宅地图资料、住户门牌资料和家庭资料所得到的地址结果和家户结果,对第三个阶段家户层次的权数进行了回答率修正。基于同样的方法,考虑到不同利用国家第六次普查数
43、据中的劳动力统计数据计算了劳动力数据的抽样设计权数。一方面由于在抽样设计工作中某些重要指标在抽样之前不可能获得,另一方面由于样本成功率因为不同特征不同,所以最终的样本在这些重要指标上的分布情况与总体相比会呈现一定程度的不一致。由于CLDS的抽样总体为已知(即1564岁的劳动力),故应该采用事后分层方法进行。事后分层,是将获得的数据资料按照已知总体的分布结构,给与每一个被个案一个值,使得处理后的资料在变量上的分布与总体一致。主要在城乡、教育等变量上对数据进行事后分层调整,通过对数据进行事后分层调整,使样本辅助变量与总体的辅助变量相一致,从而减小抽样误差,提高估计精度。家庭问卷数据库按照家庭户规模
44、和城乡变量进行事后分层调整。其中,的划分标准分为1人家庭、2人家庭、10人以家庭户规模按照国家上家庭;城乡分为城市、镇和农村,所以共有3*10=30个组别。个人问卷数据库主要使用城乡、和教育变量进行事后分层调整。分为1619,2024、2529,其中,城乡分为城市、镇和农村分为男和女3034、3539,4044、4549,5055、5559,6064等组别;教育分为无教育、小学、初中、高中、大专、本科和等组别。对于问卷中的教育和的极少量缺失,采用平均值进行插补。考虑到某些组别的个案数过少(例如农村在1619岁读的组),采用合并的方法,将全部420个组别(3*2*7*10)归并为274个组别。N
45、nNnwi其中, wi :总体第i组的总数ni :第i组n :全部成功的个案总数成功的个案总数Ni :总体中第i组的个案总数N :总体的总数计算权重使用的数据国第六次普查数据国家根据 2010 年 11 月 1 日零点完成的中的中国 2010 年普查资料(上中下)中的资料。 prun的事后调整概率: pp_/ wi因此,劳动力得到劳动力t的事后调整权数是劳动力的事后调整概率的倒数。(四)、劳动力的各类的效果对比:组别事后分层调整权数比例1.56%1.49%2.44%2.35%1.93%1.89%1.83%1.76%2.06%1.94%1.97%1.84%1.70%1.56%1.25%1.19%
46、1.13%1.13%0.77%0.78%1.22%1.12%1.20%1.17%抽样设计权数比例无回答权数调整比例2010全国比例样本比例城乡城市城市城市城市城市城市城市城市城市城市城市城市城市城市城市城市城市城市城市城市乡镇乡镇乡镇乡镇1619161920242024252925293034303435393539404440444549454950555055555955596064606416191619202420241.56%1.49%2.44%2.35%1.93%1.89%1.83%1.76%2.06%1.94%1.97%1.84%1.70%1.56%1.25%1.19%1.13%
47、1.13%0.77%0.78%1.22%1.12%1.20%1.17%1.14%0.87%1.44%1.57%1.74%2.01%1.67%1.86%1.70%2.10%1.99%2.41%1.67%2.47%1.59%1.85%1.66%2.04%1.43%1.64%0.73%0.55%0.74%0.86%1.33%0.89%1.57%1.77%2.03%2.10%1.70%1.76%1.63%1.93%2.02%2.39%1.63%2.37%1.58%1.68%1.64%1.74%1.32%1.53%0.71%0.51%0.86%0.91%0.98%0.72%1.12%1.34%1.54%
48、1.75%1.37%1.58%1.44%1.82%1.73%2.18%1.47%2.25%1.37%1.61%1.44%1.71%1.18%1.46%0.68%0.50%0.69%0.80%女性女性女性女性女性女性女性女性女性女性女性女性乡镇乡镇乡镇乡镇乡镇乡镇乡镇乡镇乡镇乡镇乡镇乡镇乡镇乡镇乡镇乡镇农村农村农村农村农村农村农村农村农村农村农村农村农村农村农村农村农村农村农村农村2529252930343034353935394044404445494549505550555559555960646064161916192024202425292529303430343539353940444
49、044454945495055505555595559606460640.99%1.00%1.04%1.02%1.30%1.25%1.34%1.28%1.09%1.05%0.77%0.73%0.77%0.75%0.55%0.53%2.45%2.22%2.82%2.86%2.20%2.16%2.12%2.02%2.72%2.62%3.10%3.04%2.62%2.61%2.04%1.95%2.25%2.17%1.69%1.60%0.63%0.70%0.57%0.74%0.67%0.80%0.98%1.28%1.16%1.34%0.86%0.98%1.02%1.12%0.94%0.81%1.66%
50、1.71%1.46%1.66%1.21%1.52%1.39%1.70%1.81%2.21%2.91%3.45%3.14%3.29%2.07%2.52%2.65%2.91%2.60%2.33%0.60%0.66%0.55%0.70%0.67%0.75%0.99%1.26%1.14%1.21%0.84%0.85%0.96%1.04%0.94%0.75%1.87%1.80%1.91%1.95%1.40%1.69%1.56%1.81%1.98%2.29%3.26%3.42%3.39%3.57%2.33%2.57%2.92%3.21%3.01%2.54%0.54%0.64%0.53%0.71%0.65%
51、0.78%1.02%1.38%1.20%1.35%0.88%0.97%1.04%1.16%1.00%0.84%1.68%1.75%1.49%1.67%1.18%1.58%1.44%1.80%1.94%2.42%3.27%3.72%3.49%3.89%2.34%2.83%3.03%3.50%3.08%2.75%0.99%1.00%1.04%1.02%1.30%1.25%1.34%1.28%1.09%1.05%0.77%0.73%0.77%0.75%0.55%0.53%2.45%2.22%2.82%2.86%2.20%2.16%2.12%2.02%2.72%2.62%3.10%3.04%2.62%
52、2.61%2.04%1.95%2.25%2.17%1.69%1.60%女性女性女性女性女性女性女性女性女性女性女性女性女性女性女性女性女性女性城乡教育2010比例样本比例抽样设计权数比例无回答权数调整比例事后分层调整权数比例城市无教育0.07%0.46%0.48%0.43%0.07%城市无教育女性0.19%1.44%1.29%1.29%0.19%城市小学1.17%1.46%1.33%1.28%1.17%城市小学女性1.59%2.71%2.43%2.42%1.59%城市初中6.48%5.55%5.51%4.80%6.48%城市初中女性6.08%5.97%5.85%5.42%6.08%城市高中4.
53、69%4.93%5.20%4.13%4.69%城市高中女性4.30%5.03%4.73%4.09%4.30%城市大专2.30%1.69%1.81%1.42%2.30%城市大专女性2.19%1.81%1.92%1.61%2.19%城市本科1.83%1.83%2.01%1.49%1.83%城市本科女性1.50%1.75%1.80%1.47%1.50%城市0.10%0.10%0.13%0.09%0.10%城市女性0.09%0.12%0.14%0.11%0.09%乡镇无教育0.08%0.42%0.44%0.49%0.08%乡镇无教育女性0.25%1.37%1.37%1.54%0.25%乡镇小学1.41
54、%1.88%1.94%1.96%1.41%乡镇小学女性2.03%2.78%2.62%2.85%2.03%乡镇初中5.09%3.73%3.67%3.75%5.09%乡镇初中女性4.66%3.14%2.98%3.13%4.66%乡镇高中3.12%1.89%1.85%1.71%3.12%乡镇高中女性2.40%1.40%1.18%1.18%2.40%乡镇大专0.36%0.18%0.19%0.15%0.36%乡镇大专女性0.38%0.30%0.28%0.27%0.38%乡镇本科0.19%0.18%0.18%0.15%0.19%乡镇本科女性0.18%0.20%0.20%0.16%0.18%农村无教育0.4
55、9%2.51%2.70%2.84%0.49%农村无教育女性1.31%6.93%7.28%8.04%1.31%农村小学6.20%5.82%6.27%6.46%6.20%农村小学女性8.27%6.87%6.88%7.49%8.27%农村初中13.79%8.57%9.67%9.31%13.79%农村初中女性11.35%6.76%7.28%7.41%11.35%农村高中3.06%3.48%4.34%3.85%3.06%农村高中女性1.91%2.31%2.84%2.53%1.91%农村大专0.36%0.31%0.36%0.28%0.36%农村大专女性0.31%0.22%0.31%0.25%0.31%农村
56、本科0.11%0.21%0.29%0.21%0.11%农村本科女性0.09%0.19%0.26%0.19%0.09%四、变量列表给出的每个权数都可以单独使用,研究者可以根据自己的研究需要选择合适的权数进行研究。在资料量,分别为:时,每个个案均有 3 个权数,以及其他关键变使用的关键变量表变量名描述家庭数据ncode初级抽样(PSU)scode次级抽样()rot样本轮次strata分层的层变量wfd设计权数nncode层中包含的初级抽样数量fpc_f有限总体校正wfr无回答调整权数tstrata_f事后分层的类别数wfp事后权数(多变量迭代法)劳动力数据ncode初级抽样(PSU)scode次级
57、抽样()rot样本轮次strata分层的层变量fpc_p有限总体校正wpd设计权数nncode层中包含的初级抽样数量wpr无回答调整权数tstrata_f事后分层的类别数wpp事后权数(事后分层法)五、使用的注意事项1、当研究者希望进行总体描述,或者进行不同类别的交叉分析以便推论总体的状况时,应该使用估计值。提供的值来进行分析和,这样的结果才是无偏的2、本资料提供的值没有经过标准化处理,值之和等于劳动力总数(而非样本总数)。3、如果研究者希望分析使用标准化的系数(即权数加总之和等于样本数),可自行完成。的但是在分析中如使用子样本,往往会出现子样本数小于样本总数,而相关统计并不会自动将值者需要将
58、值重新标准化后再进行分析。因此,本数据的使用中,建议研究者使用复杂抽样设计的分析专业。4、对复杂抽样设计的分析专业很多,在运算复杂抽样设计的数据时,会自动修订度、调整后的标准误等用于计算公式之中。为了能够做到这些,必须先将抽样中重要的变量:层、初级抽样单元和样本权数实现定义和说明。在第六部分,给出使用 SA,进行的说明。六、使用 SA进行分析的说明第一步,对复杂抽样设计的数据的设定说明在进行复杂资料的抽样分析时,SA 抽样的模块为“svy”。在一开始要先设定抽样相关的抽样设计变量,以后的分析中只要在分析命令前加上“svy:”,告知 SA 以复杂抽样设计的分析方法处理即可。命令形式为: svys
59、et pweight=varname, strata (varname)psu (varname)在 pweight 后面放入样本的权数变量名称;在strata 后放入分层的变量名称;在 psu 后面放入初级抽样(PSU)的变量名称即可。如想了解变量设定是否正确,可在SA中使用“svydes”来显示描述内容。例:svyset pweight=wpp, strata (strata ) psu (ncode) svydes也可对单一或多个变量进行说明:svydes genderpweight: wppVCE: linearizedSurvey: Describing stage 1 sling
60、unitspweight: wppVCE: linearized Single unit: missingStrata 1: strataSU 1: ncodeFPC 1: #Obs per Unit Stratum#Units#Obsmeanmax1.92372162807116175.43013.03564182715101150.82185101907108190.7276610150341150.32236871460741167.9356以上是一般情况。具体到的数据,有2个权数可供使用,一个是调查调整权数,另外一个是事后调整权数。1、使用调整权数本研究是多阶段抽样。因此,需明最重要的
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 车间员工绩效考核辅导时机
- 液化气考试试题及答案
- 史记讲读考试题及答案
- 公路重要委托协议
- 高一化学下学期期中试题汉语班无答案
- 服装定制化服务合同
- 碧波实验小学三年级信息科技期末测试卷
- 银行运营与票据业务合规考核试题
- 云计算排他性维修合同
- 《高二服装表演暑假系统复习课件》
- 2024年汕头市龙湖区教育局招考聘用机关聘用人员高频500题难、易错点模拟试题附带答案详解
- HG+20231-2014化学工业建设项目试车规范
- 中医外科学笔记
- SY-T 5037-2023 普通流体输送管道用埋弧焊钢管
- Smart-manager-中文说明书改
- 模拟卷成人高考模拟试卷
- 高一入学分班考试-数学试题含答案
- 激光模切机问题及解决办法
- 苏教版数学六年级上册全册教案学案(学前预习单)
- 内科护理学学习指导(完整)Word版
- 冰水机操作指导书
评论
0/150
提交评论