版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
1、4.1整群抽样,1。聚类抽样的定义和特征。整群抽样的定义整群抽样是一种将整体分成若干组,然后以组为抽样单位,从整体中随机选择一些组,并调查所选组中所有基本单位的抽样技术。2.整群抽样的优点(1)简化了抽样框架的编制(2)调查实施方便,节约了成本(3)整群抽样的缺点:抽样误差大。(2)聚类的划分,聚类抽样中的聚类大致可以分为两类:一类是根据行政或区域形成的群体,如学校、企业和街道,对其采用聚类调查,便于调查和节约成本。另一组是由调查人员人为确定的。例如,如果将一个大的区域分成几个较小的组,则有必要考虑如何划分这些组,以便在相同的调查成本下使调查误差最小化。聚类划分的一般原则为了提高准确性,我们应
2、该努力使同一聚类中的单元之间的差异尽可能大,以避免重复同一聚类中的单元所提供的信息。这个原则正好与分层抽样中的分层原则相反。从这个角度来看,整群抽样和分层抽样是针对不同的总体结构提出的两种不同的抽样方法。群体规模大,估计精度差,但成本低;组的大小很小,并且可以提高估计精度,但是成本增加。在实践中,确定一个群体的规模涉及到许多因素,如群体的具体结构、精度、成本、组织和管理的调查与实施等。群体规模有两种情况:一是整体上每个群体的规模相等;另一个是人口中每个群体的规模不相等。4。附有编号的说明:第七组中第七个单位的指数值:第七组中第七个单位的观察值:psu数:n个样本组数:第七组中的单位数(ssu)
3、:总人口数:总人口数:总人口数:总人口数:总人口数:总人口数,总人口数,总人口数,总人口数,组平均人口数:组平均样本数总体中的个体均值:总体方差:样本方差:组间样本方差:总体中的第i个聚类内方差:样本中的第i个聚类内方差:具有相同聚类大小的聚类抽样中的聚类内方差:具有相同聚类大小的聚类抽样中的聚类内方差:4.2等概率整数对于聚类抽样,抽样聚类中的所有次要单位都被抽样。 让我们考虑最简单的情况:每个组中包含的单位数m是相等的,这被称为相等的组大小。(在实际问题中,只要群体大小相近,也可以视为相等)。在聚类大小相等的情况下,聚类抽样一般采用简单的随机抽样方法来提取聚类,并且总体均值的估计非常简单。
4、1.群体规模相等时的估计。1.如果均值估计量及其方差是随机抽样的,并且组的大小等于m,那么总体均值的估计是:定理4.1是无偏估计,也就是说,结果是明显的,因为组是通过简单的随机方法提取的,所以样本组均值是总体均值的无偏估计。因此,证明了定理4.2的方差为33,360。让我们看一个聚类抽样的例子。例4.11在对一所中学学生零花钱的调查中,以宿舍为一组进行了整群抽样,每个宿舍有6名学生。使用简单的随机抽样从所有n=315个宿舍中选择n=8个宿舍。下表显示了上周所有48名学生的零花钱和相关计算数据。试着估计一下这个学校学生平均每周的零花钱,并给出其95%的置信区间。48名学生在8个宿舍的每周零花钱支
5、出,解:据我们所知,估计量的方差的估计值计算如下:所以95%置信区间为98.171.964.34,即89.66元和106.68元。2.聚类抽样效率分析,在聚类抽样中,因为估计量的方差主要取决于聚类之间的可变性。因此,如果聚类抽样较大,聚类抽样的准确性将会丧失。让我们用方差分析表来讨论这个问题。聚类抽样的总体方差分析表当聚类大小相等时,我们比较了聚类抽样和简单随机抽样的效率,假设从总体中直接抽取一个样本大小为nm的简单随机样本,样本均值的方差为:但如果将总体平均分成n个样本大小为m的聚类,则定义为聚类内相关系数。 其描述了同一组中成对的单个单元之间的相关程度,其表达式为:根据组合和平均值的计算,
6、可以表示为:实际上,上述可以用聚类内相关系数来近似,从而可以计算出等聚类抽样的设计效果:表明聚类抽样的方差约为简单随机抽样方差的倍,聚类抽样的估计效果与聚类内相关系数密切相关。 如果聚类中所有单元的值相等,则聚类内方差和数量方差是简单随机抽样的估计方差的倍。因此,为了提高聚类采样的效率,有必要通过聚类和差异来实现。对于自然形成的组,不能通过调整组中的单位来控制该值。这时,如果你想减少采样误差,你只能增加样本量。此外,聚类内相关系数也可以用聚类内方差和聚类间方差来表示,聚类内方差和聚类间方差可以通过样本统计来估计。例4.2估计例4.1中的簇内相关系数和宿舍设计效果。解决方案:样本的聚类间方差由例
7、4.1计算,聚类内方差为:由相关系数和设计效果的估计公式2.741表示。在本次调查中,为了达到同样的效果,整群随机抽样的样本量大约是简单随机抽样的2.74倍。此时,简单随机抽样的样本量为33,360。1.等概率抽样,简单估计,此时,不考虑不相等的聚类大小的影响,抽样方法与前一个聚类大小相等时相同,估计方法也相同,即采用简单随机抽样。总体均值的估计如下:(2)方差的估计如下:(2)等概率抽样和加权估计。其基本思想是以群体规模为权重,乘以每个群体,取样本中n个群体的群体总和的平均值。估算公式为:如果总体组的平均规模未知,则样本组的方差、单个单元的总数和总体的总价值可用作:其无偏估计为:这对于均值估
8、计是:与简单估计相比,加权估计方法考虑了总体规模,因此估计量是无偏估计、3等概率抽样和比率估计。比率估计形式的人口平均数为33,360。与第三章的比率估计不同的是,这里的辅助变量是有偏差的。当样本组数n较大时,不是,而是组的大小。从比率估计的性质来看,偏差很小,可以忽略不计。总值y的比率估计为:样本估计为:4。例与法的比较例4.3一个县有33个乡,726个村,某一年某一作物的总种植面积为30525亩。通过等概率抽样随机选择了10个乡镇来调查这种作物的产量(调查数据如下表所示)。需要使用无偏估计量和比率估计量来估计该县的总产量,并计算估计量的标准差。,10个乡镇的调查数据,(1)无偏估计(等概率
9、抽样,简单估计),计算每个村的平均产量如下:因此,=966.19,评价:虽然这种方法的估计过程并不复杂,但它是有偏估计。(2)无偏估计(等概率抽样,加权估计),评估:相反,它是增加的。该方法适用于聚类抽样,两者差别不大。(3)以聚类大小为辅助变量的比率估计。比率估计的评价引入了聚类大小作为辅助变量,其估计方差取决于聚类均值的差异。差值比应该是稳定的,所以比值估计比前两种方法有更好的估计效果。(4)以种植面积为辅助变量的比率估计。据了解,该作物在全县的总种植面积为x=30,525亩,以种植面积为辅助变量的估算结果为33,360亩。与以往的方法相比,33,360的估计误差最小,估计效果最好。原因是
10、乡镇农作物产量不仅与乡镇规模有关,还与乡镇的种植面积有关。补充总体比例的估计,即等群体规模的估计。也就是说,组中具有特定特征的单元的数量由p118的(6.1)表示。是总体比例p的无偏估计,总体比例p是样本中第ith组中具有某一特征的单元数量的比例;m是每组的单位数。无偏估计为:2。聚类大小不等的估计。如果聚类大小不等,仍采用简单随机抽样提取聚类,则总体比例的估计为:根据比例估计的性质,估计公式为:例6.5一个居住区有415个居住群体,通过聚类抽样随机选取。95%的置信水平用于估计该社区妇女比例的置信区间,并通过简单随机抽样方法进行比较。总比例估计例,25个居民群体的人数和女性人口的人数,解是:
11、这是不同组大小的比例估计。总比例估计为:由于总数未知,用样本代替,所以置信区间为:如果采用简单的随机抽样方法,假设调查结果与上表相同,即妇女人数为72人,抽样比例f也假设相同,则从社区中选取151人。则估计量的估计方差为:因此可以计算出设计效果,这表明在分项调查中,整群抽样的估计效果明显优于简单随机抽样。4.3等概率两阶段抽样,1。多阶段抽样虽然上述聚类抽样有许多优点,但聚类中的单位通常是相似的(聚类中的相关系数大于零)。特别是当群体规模较大时,人们自然会认为没有必要调查群体中的所有单位,而只需对群体中的单位进行再抽样,并对抽取的单位进行调查,这就是所谓的两阶段抽样。同样,也可以有三阶段采样、
12、四阶段采样等。统称为多级采样。(1)多阶段抽样保留了整群抽样的优点,如样本集中、调查方便、节约成本。同时,避免了小单位过度调查造成的浪费。(2)多级取样不需要编制所有小单元的样品盒。提取一次单元时,只需要编制一次单元的采样框架,然后为提取的一次单元编制二次单元的采样框架,依此类推。抽样方法和推断原则在多阶段抽样时,每个阶段的抽样可以相同也可以不同。它通常与分层抽样、整群抽样和系统抽样结合使用。在多级取样中,取样是逐步进行的。因此,当讨论估计量的均值和方差时,需要分阶段进行,这需要以下特性。对于两阶段抽样,有,当主要单位固定时,计算二阶抽样的均值和方差;求一阶样本的均值和方差。参见教科书p148
13、的证明。上述特性可以扩展到多级采样。例如,对于三阶段抽样,有三阶段和等概率两阶段抽样的符号描述。一级单位拥有的一级单位和二级单位数量:n,m一级和二级抽样的样本量:n,m第一级单位的第二级单位的观测值:第一级单位的第二级单位的观测值。第一阶段和第二阶段的抽样比例为:第一个主要单位基于次要单位的平均值:次要单位的平均值:主要单位之间的差异:以及主要单位内部的差异:如果记得的话,它可以从表达式中得知,有,也就是,平均值。同样,4。一次单元大小相等的二阶抽样,在第一阶段,通过简单随机抽样对n个一次单元进行抽样,在第二阶段,通过简单随机抽样从被抽样的一次单元中包括的m个二次单元,即最终被调查的单元,对
14、m个二次单元进行抽样。例如,一个新开发的社区有15个相同公寓类型的单元,居民一个接一个地搬进新房子,每个单元住12户。为了调查家庭装修情况,计划从180户中选择20户进行调查。下表:表格中的红色字母表示选定的房间号。这里有15个一级单位(房地产),每个一级单位有12个二级单位(家庭)。首先,将基本单元从1到15进行编号,从15个基本单元中随机选取5个单元,分别为1、6、9、12和13;然后,在选定的主要单元中,进行第二次抽样,即,从5个选定的建筑物中随机选择4个住户。这是一个两阶段取样,主要单位大小相同。等规模两阶段抽样的估计量及其性质(1)总体均值的估计定理4.5对于等基本单位规模的第二阶段
15、抽样,如果两个阶段都是简单随机抽样,并且第二阶段抽样是对每个基本单位独立进行的,那么总体均值的无偏估计量是:总体均值估计量的方差是:总体均值估计量的无偏估计量是:其中,例4.4要调查4月份的100家企业的指数,首先, 从100家企业中抽取一个包含5家样本企业的简单车载样本,调查人员从5家企业中随机抽取3天作为调查日,并要求样本企业只填写这3天的流水账。 调查结果如下。根据这些数据,需要计算不超过100家企业的该指标总量,并给出估计的95%置信区间。把企业理解为初级单位,并且每天看着次级单位。调查月有30天(即有30个二级单位)。首先,从主单元中提取n=5的简单随机样本,然后从每个样本的次单元中
16、独立提取m=3的简单随机样本。根据问题的含义,n=100,m=30,n=5,m=3,计算样本主要单位的均值和方差,95%的置信区间为:16088。初级单位大小不同的二阶抽样一般来说,初级单位的大小是不相等的。如果根据基本单元的尺寸分层后,层内基本单元的尺寸仍有较大差异,则应采用本节介绍的方法处理二阶抽样问题。当主要单位的大小不同时,一般采用不等抽样。,1。符号描述、总体中主要单元的数量和按一阶抽样的样本大小:n,n、第i个主要单元中次要单元的数量:第i个主要单元中次要单元的观测值:样本中第i个主要单元中次要单元的观测值:一阶和二阶抽样比:第i阶主要单元指数和: 第一级单位根据第二级单位的平均值:第一级单位之间的方差:第一级单位的第二级单位之间的方差:对第一级单位进行简单随机抽样。 如果二阶抽样的每一级都采用简单随机抽样,并且每个一级单位中二级单位的抽样相互独立,则总和的估计可以采用简单估计或比值估计。简单估计量简单地将总体的总和估计为:这可以证明这个估计量是无偏的,它的方差是:无偏估计量是:其中,3。由于主要单元的大小不同,比率估计器经常导致主要单元的观测值的巨大差异,这使得估计器方差的第一项非常大,因此估计器方差变得非常大。此时,主单元的大小可被视为辅助变量,比率估计器可用于估计总和。总
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 江苏省南通市海安市2027届高三上学期期初测试政治试卷
- 高中生物 第五章 第一节 生物进化理论教学设计 苏教版必修2
- 消毒供应中心考试题及答案
- 高三学生错题本规范使用管理实施方案
- 医院2024年门诊护理工作计划
- 湘教版七年级地理上第二章 第四节 海陆变迁教学设计
- 分级护理制度考试试题(含答案)
- 残疾人培训机构管理制度
- 身份识别查对制度及答案
- 语文二年级下册15古诗二首教学设计
- 过敏性休克的麻醉处理要点
- 古诗中的饮食文化课件
- 维保居间合同协议
- 培训机构周例会
- 音乐照护健康评估-老年康体指导 初 级 -1729733444183
- 粉尘危险品仓储运输协议
- “企业工商登记及年报自主公示”系统操作手册
- 《信息安全技术 政府联网计算机终端安全基本要求》
- 高考作文标准方格纸-A4-可直接打印
- 石墨烯行业分析报告
- 部编版《道德与法治》一年级上册教案(全册)
评论
0/150
提交评论