免费预览已结束,剩余15页可下载查看
下载本文档
版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
第四章 抽样推断 科学的抽样法是统计研究中的一种重要方法,是统计学的核心内容之一,在社会经济领域中有着极其重要的作用。抽样法由两个基本环节构成,一是抽样调查,二是抽样推断。抽样调查是获得统计数据的重要渠道,是抽样推断的基础;抽样推断则利用抽样调查的抽样数据,采用概率理论对总体的参数作出推断和估计,是抽样调查的继续,也是抽样方法的关键环节;初步了解小样本的抽样估计方法。本章的目的与要求 通过本章学习,要求学生在充分理解随机性与概率分布等有关抽样理论的基础上,理解掌握抽样推断的有关基本概念,尤其应该充分理解掌握抽样分布的理论;掌握各种条件下抽样平均误差、抽样极限误差的计算,以及概率与概率度的应用;熟练掌握对总体指标进行区间估计的理论和方法;明确影响样本容量大小的各种因素,并掌握求解的方法。本章主要内容(计划学时6 ) 一、抽样推断的意义与基本概念 1、抽样推断的意义 2、抽样推断的特点与作用 3、抽样推断的有关基本概念 二、抽样误差 1、抽样误差的影响因素 2、抽样平均误差 3、抽样极限误差 三、抽样估计 1、优良估计的三个标准 2、区间估计方法 四、确定样本容量的方法学习重点 一、抽样推断的有关基本概念,抽样分布的理论; 二、抽样平均误差、抽样极限误差、概率度以及概率的确定; 三、确定优良估计量,进行区间估计; 四、样本容量的确定。学习难点 一、随机性与概率分布等理论问题的理解; 二、所有可能构成的样本数目,样本指标的分布(即抽样分布问题); 三、利用极限误差与平均误差确定可能出现的概率; 四、小样本抽样估计中自由度的理解。第一节 统计推断的意义与基本概念 一、抽样推断的意义 抽样推断:在抽样调查的基础上,根据样本的数据,对所研究的总体现象作出具有一定可靠程度的估计和判断,以达到对现象总体的认识。 抽样法: 1、抽样调查(取得随机数据) 2、抽样推断(推断总体指标) 抽样估计的步骤 二、抽样推断的特点 1、随机原则 2、从数量上推算总体 3、运用概率理论进行估计 4、所产生的误差可以计算、可以控制。 三、抽样推断的作用 1、不必要或不可能进行全面调查时,可采用抽样推断方法; 2、应用抽样法可以对全面调查结果加以补充或修正; 3、对于产品质量的检查和控制; 4、可以对提出的某种假设进行检验。 四、抽样推断的基本概念 (一)全及总体和抽样总体 1、全及总体(简称总体,亦称母体):所要研究和推算的总体,其单位数用“N”表示 (1)有限总体和无限总体 (2)属性总体和变量总体 2、抽样总体(简称样本,亦称子样):随机地从母体中抽出的部分单位所组成的小总体,其单位数用“n”表示 例如: 从企业生产的50 000只电子元件中,随机抽取了200只进行质量检验。 总体(母体):50 000只电子元件构成的整体,N50 000 只 样本(子样):200只电子元件构成的小总体,n200 只 (这只是50 000只电子元件中抽出的一个样本,试想:从这50000只电子元件中可以构造多少个这样的样本 ) 属性总体和变量总体 (二)样本空间和样本容量 1、样本空间:所有可能形成的样本数目,用“M”表示 (1)重复抽样条件下的样本空间 重复抽样:每次从总体单位数N中抽取一个单位,观察登记后,随即放回再参加下一次抽选。 特点: 总体单位数始终保持N个; n 次抽样,就是 n次独立的试验; 所产生的误差较不重复抽样的大。 可能组成的样本数目(即样本空间 M): MN n 例41.1 某生产班组有A、B、C、D 4个工人,从中随机抽取2人(即:N4 ,n2),观察其工资收入 工 人ABCD工资收入(百元)5678 按重复抽样条件下的所有可能样本数目如下: AA AB AC AD BA BB BC BD CA CB CC CD DA DB DC DD (MN n 4 2 16) 例41.2 一个质地均匀的六面体骰子,其六面的点数分别为1、2、3、4、5、6。问连续掷两次的样本空间。 1、1 1、2 1、3 1、4 1、5 1、6 2、1 2、2 2、3 2、4 2、5 2、6 3、1 3、2 3、3 3、4 3、5 3、6 4、1 4、2 4、3 4、4 4、5 4、6 5、1 5、2 5、3 5、4 5、5 5、6 6、1 6、2 6、3 6、4 6、5 6、6 MN n 6 2 36 (2)不重复抽样条件下的样本空间 不重复抽样:每次从总体单位数N中抽取一个单位,观察登记后不再将这个单位放回。 特点: 每抽一次,总体就少一个单位(N1),直至抽完n个,总体单位剩 N n 个; n 次抽样,不是 n次独立的试验; 所产生的误差较重复抽样的小。 可能组成的样本数目(即样本空间 M): 考虑顺序(排列问题): MN ( N1 )( N2 )!(Nn1) 例41.3 某班拟从其40名同学中随机抽取5名担任不同的职务,问有几种抽法。 (这个例子中,抽 5名同学是为了安排不同职务,所以顺序是很重要的,不同顺序就构成不同样本) M = N( N1 )( N2 ) ( N n + 1 ) = 4039383736 = 78960960(种) 不考虑顺序(组合问题): 例41.3 某班拟从其40名同学中随机抽取 5名检查其统计作业完成情况,问有几种抽法。 (这个例子中,抽 5名同学是为了检查统计作业,所以顺序是不重要的) 658 008(种) 由于总体通常都很大(N很大),所以无论什么情况,样本空间M 都是一个很大的数字。(对于每个样本来说,被抽中的概率都是1/M ) 2、样本容量:即样本单位数,用“n”表示;通常认为n30 为大样本,n30 为小样本。 (三)全及指标与抽样指标 1、全及指标(总体指标参数) 反映全及总体数量特征的指标(客观存在的、唯一的、未知的); (1)全及平均数 (关于变量总体的指标) 反映全及总体一般水平的指标 (2)全及成数 P (关于属性总体的指标) 全及总体具有某属性的单位在全部单位中的比重 (3)全及方差 2(标准差) 关于变量总体的方差 x2 关于属性总体的方差 p2 2、抽样指标(样本指标估计量) 反映抽样总体数量特征的指标(随机变量); (1)抽样平均数 (关于变量总体的指标) 反映了抽样总体的一般水平 (2)抽样成数 p (关于属性总体的指标) 反映抽样总体具有某属性的单位在全部单位中的比重 (3)抽样方差 S2(标准差S ) 关于变量总体的方差Sx2 关于属性总体的方差Sp2 Sp2 = p ( 1- p ) 例41.4 某生产班组有A、B、C、D 4个工人,从中随机抽取2人(即:N4 ,n2),观察其工资收入 工 人ABCD工资收入(百元)5678 全及平均数 6.5(百元) 抽样平均数 AA(5.0) AB(5.5) AC(6.0) AD(6.5) BA(5.5) BB(6.0) BC(6.5) BD(7.0) CA(6.0) CB(6.5) CC(7.0) CD(7.5) DA(6.5) DB(7.0) DC(7.5) DD(8.0) 以上抽样平均数的分布为:抽样指标()5.05.56.06.57.07.58.0合计频 数123432116频率 ()6.2512.518.7525.018.7512.56.25100 可见,虽然对于每个样本来说被抽中的概率是一样的,但是,对于样本指标而言,每个样本指标被抽中的概率就不一样了,越接近全及指标周围的越容易被抽中。 (四)正态分布再生定理与中心极限定理 1、正态分布再生定理 任意有限个独立正态变量之和仍服从正态分布,这就是正态分布的再生定理。 如果所研究总体本身就服从正态分布(且已知分布的方差),那么从中抽出的样本,无论其容量大小,样本平均数的分布也服从正态分布。 若: x 则: 由于 所以 证明: E()= E() = E(x1 + x2 + + xn) = E(x1)+ E(x2)+ + E(xn) 1、重复抽样条件下,由于x1 、x2 xn 是相互独立的,而且都是从总体的各单位数值X1 、X2 XN中抽取,其被抽中的概率P相等,均为。所以 E(x1)= E(x2)= = E(xn) = = 所以 E()= E(x1)+ E(x2)+ + E(xn) = (n) = 2、不重复抽样条件下,由于x1 、x2 xn 是不独立的。当抽到Xi(i =1、2 N )时,再抽Xj(i j , j =1、2 N ),Xi不再出现。 抽第一个数值为X1、X2 XN时,每一个数值出现的概率为Pi =。则 E(x1)= = 当抽到第二个数值为X1、X2 XN的时候,则每一个数值出现的概率仍为Pi =。则 E(x2)= = 当抽到的第三个数值为X1、X2 XN的时候,则每一个数值出现的概率仍为Pi =。则 E(x3)= = 同理,当抽到的第n个数值为X1、X2 XN的时候,则每一个数值出现的概率仍为Pi =。则 E(xn)= = 即:E(x1)= E(x2)= = E(xn)= E()= E(x1)+ E(x2)+ + E(xn) = (n)= 2、中心极限定理 如果所研究总体本身不是正态的,甚至不知道其分布,只要总体客观上存在着有限的平均数和标准差,那么从中抽出的样本,其指标的分布随着样本容量n的增大而趋近于正态。 一般认为,样本单位数不少于30是大样本,这时,抽样平均数的分布就趋近于正态分布。 即: (以上两定理同样适合抽样成数) (四)统计量与抽样分布 1、统计量 统计量就是“不含任何未知参数”的来自样本的函数。 可见,上述的样本平均数、样本成数以及样本方差等都是统计量。 2、抽样分布(例41.4中的抽样平均数的分布就是抽样分布) 统计量的分布就叫抽样分布。有样本平均数的分布、样本成数的分布。 概括上述两定理,一般地说,只要样本容量不小于30,样本平均数、样本成数的分布基本上都是正态的。 第二节 抽样误差 一、统计误差 (一)登记性误差:由于记录、抄录或计算等错误所产生的误差。属主观误差,是可以消除和克服的误差。 (二)代表性误差 1、系统误差:因调查问题不明确、抽样框设计不当或使用了没校正正确的测量器具而造成的误差。 2、随机误差 :即抽样误差。由于随机抽样的样本数值要代表总体数值而产生的误差,是不可避免的抽样误差。 二、抽样误差:样本指标与全及指标的离差。即 与 三、影响抽样误差大小的因素 1、被研究总体的标志变异程度( ) 大(变异大),误差大;反之误差小。与抽样误差成正比 2、抽样单位数(样本容量 n ) n 大(容量大),误差小;反之误差大。与抽样误差成反比 3、抽样方法(重复或不重复) 4、抽样组织形式 四、抽样平均误差 所有可能样本指标与全及指标所产生的误差的平均数,用(变量总体)与(属性总体)表示。 抽样平均误差就是所有可能的样本指标与全及指标误差的平均数。 与 由于式中子项始终为0 ,所以采用平方的办法消除负号,避免正负抵消,得理论公式如下: 理论公式: 与 可见,抽样平均误差就是关于抽样指标的标准差。 抽样平均误差是度量抽样指标离散程度的重要指标。 (一)重复抽样条件下的抽样平均误差 1、关于变量总体的抽样平均误差(即关于抽样平均数的抽样平均误差) 计算公式 式中为抽样指标的标准差(即抽样平均数的抽样平均误差),x为全及总体变量的标准差。 证明: = Var () = Var () = Var ( x1 + x2 + + xn ) = Var ( x1 ) + Var ( x2 ) + + Var ( xn ) 由于x1 、x2 xn 是相互独立的,而且都是从总体的各单位数值X1 、X2 XN中抽取,所以变量xi是同分布的,因而有 Var ( x1 ) = Var ( x2 ) = = Var ( xn ) = = n = 实际运用时x2通常是未知的,可用样本的 Sx2代替,也可用试验的或以往的方差代替。 2、关于属性总体的抽样平均误差(即关于抽样成数的抽样平均误差) 计算公式 式中为抽样指标的标准差(即抽样成数的抽样平均误差),p2P(1P)为反映全及总体属性差异的方差。 p 通常是未知的,可用样本的Sp代替,也可用试验的或以往的方差代替;如果这些资料都缺乏,成数的方差还可以使用 0.50.5 。 (二)不重复抽样条件下的抽样平均误差 1、关于变量总体的抽样平均误差(即关于抽样平均数的抽样平均误差) 计算公式 证明 = E - E()2 = E(-)2 = E(-)2 = E (x1 -)+(x2 -)+ +(xn -)2 = E 2 = (4 -1) 从N个单位中随机抽取n个单位组成一个样本,共有M =种组合,也就是共有M个样本,样本单位数的比例为。所以,xi 在一个样本中出现的概率为,在所有M个样本中,每一个xi 共出现M次。 所以,(4 -1)式中 E= = = = n 在不重复抽样条件下,当xi第一个被抽中后,第二个抽中xj的概率则为,所以,xi与xj同时出现在同一个样本中的概率应为,共有M个样本,xi与xj同时出现在所有样本中的次数为M次。 所以,(4 -1)式中 E= = = = = = 0 = 所以,由(4 -1)式得 = = n = (1 - ) = 由于N通常都很大,式中分母的N减 1与不减 1,分式的比值相差不大,即,当总体的N很大时,所以不重复抽样的抽样平均误差可近似地用以下公式计算: 2、关于属性总体的抽样平均误差(即关于抽样成数的抽样平均误差) 计算公式 由于N通常都很大,式中分母的N减 1与不减 1,分式的比值相差不大,即 ,所以上式可写为: 在不重复抽样中,是样本单位数占总体单位数的比重,总是小于1,故不重复抽样平均误差总是小于重复抽样平均误差。当 N很大而n相对不大时,的值仍趋近于 1 。所以,用重复抽样与用不重复抽样公式计算的结果相差甚微。因此,在实际抽样中,为减小误差可采用不重复抽样的方法抽取样本,而计算误差时,则可采用重复抽样的公式计算。 抽样平均误差的计算举例:例42.1 从50000只电子元件中随机抽取100只检验结果如下:耐用时数(千小时)组中值x元件数fx f x = 9.4( x)2( x)2 f7 以下 7 8 8 9 9 1010 1111 以上6.57.58.59.510.511.5 2 8 28 32 20 10 13 60 238 304 210 115 2.9 1.9 0.9 0.1 1.1 2.1 8.41 3.61 0.81 0.01 1.21 4.41 16.82 28.88 22.68 0.32 24.20 44.10合 计 100940 137.00 (设8000小时以下为不合格品) 要求计算:(1)抽样平均数的抽样平均误差 (2)抽样成数的抽样平均误差变量总体: 属性总体: 9.4(千小时) 0.9 1.170(千小时) 0.3 抽样平均误差(重复抽样条件下) 0.117(千小时) 3 抽样平均误差(不重复抽样条件下) 0.1169(千小时) 3 五、抽样极限误差 抽样估计时,根据目的要求以及所研究对象的变异程度,确定一个可接受的、允许的误差范围,叫抽样极限误差,也叫抽样允许误差。抽样极限误差用“”表示 (一)关于抽样平均数的抽样极限误差 (在这个范围内,用标准差为尺度衡量其标准,即此范围相当于几个标准差) 式中 Z 服从标准正态分布,称其为概率度 Z N( 0,1 ) 有了一定的概率度 Z ,就能从正态分布表中查出相应的概率 F(Z) 常用的概率度与概率的对应数值概 率 度1.001.501.641.962.003.00概 率 F (z)0.68270.86640.90000.95000.95450.9973 例42.2 设某银行的个人储蓄服从平均数为20 000元,标准差为8 000元的正态分布。如果银行从中随机抽取100个帐户,其样本平均数落在19 000元至20 500元之间的概率是多少? 已知: 20 000元 x8 000元 n100 解: (元) 对于 19000元 (则查表得 F(1.25)0.7887) 对于 20500元 (则查表得 F(0.625)0.4680) 样本平均数落在19000至20500元之间的可能性为 0.6284 (二)关于抽样成数的抽样极限误差 用标准差衡量得: 即 P 第三节 抽样估计 由于总体指标叫参数,所以抽样估计也叫参数估计。参数估计有点估计和区间估计两种。 进行参数估计时,总是希望估计是合理的、优良的。作为优良的估计量应具备的标准是: 一、优良估计的三个标准 (一)无偏性 所谓无偏性,就是以抽样指标估计总体指标时,要求所有可能形成的抽样指标值的平均数要等于被估计的总体指标值本身。 即: 与 (二)一致性 所谓无偏性,就是随着样本容量 n 的无限增大,抽样指标和未知的总体指标的绝对离差就无限的缩小。换句话说,就是随着样本容量的逐渐扩大,抽样指标就逐渐地靠近总体指标。即 P | | = 1 P | p P | = 1 以上公式为无限总体的情况,如果是有限总体,则 n 趋于N 。 (三)有效性(方差越小越有效) 如果有多个样本指标可作为总体参数的估计 量,那么,方差越小的越有效。即方差较小的那个估计量的估计效果较好。 样本平均数的方差为 总体变量的方差为 显然,用样本平均数作为估计量要比用总体变量X作为估计量的效果更好。因为样本平均数的方差较总体变量的方差小。 二、抽样估计方法 (一)点估计 直接用样本指标值作为总体指标的估计值 。 即: 与 p = P 总体参数的点估计, 其优点是简便易行,原理直观。但不足之处也很明显, 就是这种估计没有表明估计误差( 抽样估计不可能没有误差),更没有指出误差在一定范围内的概率保证程度有多大,即估计的可靠性有多大。 (二)区间估计 1、区间估计的基本要素 (1)样本估计值 抽样平均数:(关于变量总体的指标) 抽样成数: p(关于属性总体的指标) (2)抽样极限误差 关于抽样平均数的 x 关于抽样成数的 p (3)估计的置信度 Z 或 F(Z) 2、区间估计方法 (1)给出一定估计区间(即)的估计步骤 (关于变量总体) 第一步:计算抽样指标(样本估计量) 第二步:计算抽样平均误差 (重复抽样) (不重复抽样) 第三步:计算估计区间的上下限 下限: 上限: 即: 第四步:回答落在此区间的可能程度(即计算置信度) 从而查得 F(Z) 例43.1 从50000只电子元件中随机抽取100只检验结果如下:耐用时数(千小时)组中值x元件数fx f x = 9.4( x)2( x)2 f7 以下 7 8 8 9 9 1010 1111 以上6.57.58.59.510.511.5 2 8 28 32 20 10 13 60 238 304 210 115 2.9 1.9 0.9 0.1 1.1 2.1 8.41 3.61 0.81 0.01 1.21 4.41 16.82 28.88 22.68 0.32 24.20 44.10合 计 100940 137.00 (设8000小时以下为不合格品) 第一步:计算抽样指标 9.4(千小时) 1.170(千小时) 第二步:计算抽样平均误差(若不重复抽样就按不重复方法计算) 0.117(千小时) 第三步:计算估计区间的上下限(已知 x150小时) 下限:94001509250(小时) 上限:94001509550(小时) 即: 9250(小时) 9550(小时) 第四步:回答落在此区间的可能程度(即计算置信度) 1.28 (查表得 F(1.28)0.7995 ) 说明这批电子元件的平均寿命大概有80%的可能9250小时至9550小时范围之内。即,平均寿命落在此区间内的概率大约有80。 (关于属性总体) 第一步:计算抽样指标(样本估计量) 第二步:计算抽样平均误差 (重复抽样) (不重复抽样) 第三步:计算估计区间的上下限 下限: 上限: 即: P 第四步:回答落在此区间的可能程度(即计算置信度) 从而查得 F(Z) 仍就例43.1 第一步:计算抽样指标 0.9 0.3 第二步:计算抽样平均误差(若不重复抽样就按不重复方法计算) 3 第三步:计算估计区间的上下限(已知 p6 ) 下限:90%6%84% 上限:90%6%96% 即: P 84% P 96% 第四步:回答落在此区间的可能程度(即计算置信度) 2 (查表得 F(2)0.9545 ) 说明这批电子元件的合格率在84至96范围内的可能程度达到95.45。 (2)给出一定概率要求(即F(Z))的估计步骤 (关于属性总体) 第一步:计算抽样指标(样本估计量) 第二步:计算抽样平均误差 (重复抽样) (不重复抽样) 第三步:计算极限误差(因为Z已给出) 第四步:计算估计区间的上下限 下限: 上限: 即: 这就是能达到一定把握程度的估计区间。 (关于属性总体) 第一步:计算抽样指标(样本估计量) 第二步:计算抽样平均误差 (重复抽样) (不重复抽样) 第三步:计算极限误差(因为Z已给出) 第四步:计算估计区间的上下限 下限: 上限: 即: P 这就是能达到一定把握程度的估计区间。 3、小样本的抽样估计 如果在方差未知的正态母体中抽取样本容量小于30的小样本,则估计时就不能再利用标准正态Z值,而应另寻途径,构造另一种统计量 t 。 其中 , 式中为x2的无偏估计;n1 为自由度。 t 服从自由度为 n1的 t 分布。 需要指出的是,如果样本方差 Sx2是按正常公式计算的,即 则统计量t应为 样本方差 Sx2,如果不是为了作为总体方差x2的无偏估计量,则应该按正常公式计算。 (三)总量指标的区间估计 1、关于变量总体的总量指标 总量指标 2、关于
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- GB/T 7643-2026紫胶
- 2026圣基茨和尼维斯群岛建筑建材制造业市场发展分析及投资评估
- 2026中国显示面板行业市场供需分析及投资评估规划发展研究报告
- 2026叶黄素酯国际市场开拓与贸易壁垒应对策略
- 2026中国智能运动护具数据安全保护与隐私合规管理报告
- 2026中国涡流泵在水处理领域技术应用与项目案例研究
- 2026人工智能退休金规划系统设计及效果检测与行业推广研究报告
- 2026中国玻璃微纤维过滤材料在洁净室建设中的不可替代性报告
- 2026桥梁建筑行业设计施工市场竞争资质审核成本控制提升规划
- 2026汽车行业技术创新发展趋势分析及投资布局与发展规划报告
- 2026年广州市海珠区教育系统引进教育管理急需人才6人考前冲刺密卷及参考答案详解【满分必刷】
- 电子设备手工装接工岗中实操水平考核试卷含答案
- 群体塔吊安全管理培训
- GB/T 47655-2026电力电子装备和系统的构网性能要求及试验方法
- -医疗器械gcp考试题库及答案解析
- 2026-2030中国夹心糖果产业运行态势与营销策略分析研究报告
- 【新教材】统编版(2024)一年级上册语文第二单元集体备课教案
- 绿城建筑工程工艺工法标准-机电安装篇
- 2026年电信考试题及答案
- 初一语文词性练习
- 废杂铝采购管理制度
评论
0/150
提交评论