数据分析基础-基于Excel和SPSS(下篇共上下2篇)_第1页
数据分析基础-基于Excel和SPSS(下篇共上下2篇)_第2页
数据分析基础-基于Excel和SPSS(下篇共上下2篇)_第3页
数据分析基础-基于Excel和SPSS(下篇共上下2篇)_第4页
数据分析基础-基于Excel和SPSS(下篇共上下2篇)_第5页
已阅读5页,还剩407页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

数据分析基础讲课人:——基于Excel和SPSS所有教学资源,我们给;所有复杂操作,我们做;图书附赠,永久免费,只为老师用书更方便课件教案微课扫码题库建课互评考试平台

学习工具相关与回归是处理变量之间关系的统计方法。从所处理的变量多少来看,如果研究的是两个变量之间的关系,称为简单相关与简单回归分析;如果研究的是两个以上变量之间的关系,称为多元相关与多元回归分析。从变量之间的关系形态上看,有线性相关与线性回归分析以及非线性相关与非线性回归分析。本项目主要讨论线性相关与线性回归的基本原理与方法。项目六XIANGMULIU相关与回归分析学习目标12知识目标了解相关分析的概念、内容和多元线性回归分析的基本思想。掌握相关关系测定和一元线性回归分析的方法。能力目标能够计算相关系数和配合回归方程。能够测定客观现象间是否具有相关关系。1模块6.1相关分析3模块6.3多元线性回归分析目录Contents2模块6.2一元线性回归分析4模块6.4复相关系数和偏相关系数导入案例父代与子代的关系正如高尔顿进一步发现的那样,平均来说,非常矮小的父辈倾向于有偏高的子代,而非常高大的父辈则倾向于有偏矮的子代;在第一次考试中成绩最差的那些学生在第二次考试中倾向于有更好的成绩(比较接近所有学生的平均成绩),而第一次考试中成绩最好的那些学生在第二次考试中则倾向于有较差的成绩(比较接近所有学生的平均成绩);同样,平均来说,第一年利润最低的公司第二年不会最差,而第一年利润最高的公司第二年则不会是最好的。(资料来源:/s/blog_50b6a20601008got.html)模块一1相关分析经济现象之间客观上存在着各种各样的有机联系,一种经济现象的发展变化必然受到与之相联系的其他经济现象发展变化的影响与制约。这种依存关系可以分为函数关系和相关关系两大类。函数关系与相关关系6.1.1函数关系反映现象之间存在着严格的依存关系,在这种关系中,对于某一变量的每一个数值,都有另一个变量的确定值与之相对应,并且这种关系可以用一个数学表达式反映出来。例如,圆的面积与半径之间的关系可用S=πR2表达,这就是一种函数关系。1.函数关系相关关系反映现象之间确实存在的,而关系数值不固定的相互依存关系。理解相关关系,要把握以下两个要点。2.相关关系01相关关系是变量之间确实存在数量上的相互依存关系两个变量之间,一个变量发生数量上的变化,另一个变量也会相应地发生数量上的变化。例如,身体高的人一般体重也要重一点;劳动生产率提高相应地会使成本降低、利润增加等。在具有相互依存关系的两个变量中,作为根据的变量叫作自变量,发生对应变化的变量叫作因变量。自变量一般用x表示,因变量用y表示。02变量之间数量依存关系的具体关系值不是固定的。在相关关系中,对于某项标志的每一个数值,可以有另外标志的若干个数值与之相适应,在这些数值之间表现出一定的波动性,但又总是围绕着它们的平均数并遵循一定的规律而变化。例如每亩耕地的施肥量与亩产量之间存在着一定的依存关系。在一般条件下,施肥量适当增加,亩产量便相应地提高,但亩产量增长与施肥量增长的数值之间并不存在严格的依存关系,因为对每亩耕地的产量来说,除了施肥量多少这一因素外,还受到种子、土壤、降雨量等其他因素的影响,这就造成即使在施肥量相同的条件下,其亩产量也并不完全相等。尽管如此,施肥量和亩产量之间仍然存在着一定的规律性,即在一定范围内,随施肥量的增加,亩产量便相应地有所提高。函数关系与相关关系之间并不存在严格的界限。由于有观察或测量误差等原因,函数关系在实际中往往通过相关关系表现出来;在研究相关关系时,又常常要使用函数关系的形式来表现,以便找到相关关系的一般数量表现形式。相关关系的种类6.1.2现象之间的相互关系是很复杂的,它们以不同的方向和程度相互作用着,并表现出不同的类型和形态。按相关关系涉及的因素多少分类,相关关系可分为单相关和复相关。1.单相关和复相关单相关复相关单相关是指两个因素之间的相关关系,即研究时只涉及1个自变量和1个因变量;复相关是指3个或3个以上因素的相关关系,即研究涉及2个或2个以上的自变量和因变量。按相关关系的表现形态分类,相关关系可分为直线相关和曲线相关。相关关系是一种数量上不严格的相互依存关系。如果这种关系近似地表现为一条直线,则称为直线相关;如果这种关系近似地表现为一条曲线,则称为曲线相关。曲线相关也有不同的种类,如抛物线、指数曲线、双曲线等。2.直线相关和曲线相关按直线相关变化的方向分类,相关关系可分为正相关和负相关。3.正相关和负相关正相关负相关正相关是指自变量x的数值增加,因变量y的数值也相应地增加。例如,施肥量增加,亩产量也增加。负相关是指自变量数值增加,因变量数值相应减少;或者自变量数值减少,因变量数值相应增加。例如,产量越高,生产成本越低;商品价格降低,商品销售量增加。按相关的程度分类,相关关系可分为完全相关、不完全相关和无相关。4.完全相关、不完全相关和无相关完全相关无相关

无相关是指两种现象的数量各自独立,互不影响。例如,企业生产成本与工人年龄之间一般是无相关的。不相关不完全相关是指两个现象之间的关系介于完全相关与无相关之间。通常,相关分析主要是不完全相关分析。以上相关关系的种类可以用下图表示。(a)(b)(c)(d)(e)(f)相关关系的种类(a)完全正相关

(b)不完全正相关

(c)无相关

(d)完全负相关

(e)不完全负相关

(f)曲线相关制作相关表和相关图,可以对现象之间存在的相关关系的方向、形式和密切程度进行直观、大致的判断。相关表和相关图6.1.3研究现象之间的依存关系,首先要通过实际调查获得一系列成对的数据,作为相关分析的原始资料。将某一变量按其数值的大小顺序排列,然后再将与其相关的另一变量的对应值平行排列,便可得到简单的相关表。1.相关表【例6-1】有8个企业生产某种产品,其月产量和生产费用资料如下表所示。请根据下表列出简单相关表。8个企业的月产量和生产费用资料【解】

将月产量按从小到大的顺序排列,可编制如下表所示的相关表。产品月产量和生产费用相关表从上表中可以看出,产品月产量和生产费用之间的关系虽然不十分严格,但有直线相关的趋势,而且大致可以看出关系比较密切。相关图又称散点图或散布图,是以直角坐标系的横轴代表变量x,纵轴代表变量y,将两变量相对应的成对数据用坐标点的形式描绘出来,用于反映两变量之间相关关系的图形。由28页中表的资料绘制出的相关图,如30页图所示。2.相关图8个企业月产量和生产费用的相关图从左图中可以看出,8个企业的月产量和生产费用之间有依存关系,各个点虽不完全在一条直线上,但有形成一直线的趋向。相关系数6.1.4

1.相关系数的定义总体相关系数是反映两变量之间线性相关程度的一种特征值,表现为一个常数。其计算公式为:

(6-1)式中,Cov⁡(x , y)是变量x和y的协方差,Var⁡(x)和Var⁡(y)分别为变量x和y的方差。样本相关系数是根据样本观测值计算的。抽取的样本不同,其具体的数值也会有所差异。样本相关系数的计算公式为:

(6-2)式中,和分别是x和y的样本平均数。样本相关系数r具有以下特点:2.相关系数的特点

具体计算样本相关系数时,通常采用以下公式:

(6-3)上式是由式(6-2)推导而来的。3.相关系数的计算【例6-2】请根据28页中的表的数据计算月产量和生产费用的样本相关系数。【解】计算x2、y2、xy的值,如下表所示。相关系数计算表将40页表中的相关数据代入式(6-3),可得

样本相关系数为0.9697,说明8个企业产品月产量与生产费用之间有高度的线性正相关关系。在实际的客观现象分析研究中,相关系数一般都是利用样本数据计算的,因而带有一定的随机性。样本容量越小,其可信程度就越差,因此也需要进行检验。4.相关系数的检验相关系数的显著性检验问题可分为两类:一是对总体相关系数是否等于0进行检验二是对总体相关系数是否等于某一个给定的不为0的数值进行检验。

(1)计算相关系数r的t值,计算公式如下:

(6-4)

【例6-3】根据例6-2计算的相关系数,检验8个企业产品月产量与生产费用之间的相关系数是否显著(设定显著水平α=0.05)。【解】①提出假设:H_0:ρ=0;H_1:ρ≠0②计算检验的统计量:

模块二2一元线性回归分析相关分析和回归分析是研究现象之间相关关系的两种基本方法,二者有着密切的联系。它们不仅具有共同的研究对象,而且在具体运用时,常常需要互相补充。相关分析与回归分析的关系6.2.1在相关分析中,相关系数能确定两个变量之间的相关方向和相关的密切程度;而回归分析就是对具有相关关系的两个或两个以上变量之间数量变化的一般关系进行测定,选择一个合适的数学模型,以便对因变量进行估计或预测。相关分析需要依靠回归分析表明现象数量相关的具体形式;而回归分析需要依靠相关分析来表明现象数量变化的相关程度,只有变量之间存在着高度相关时,进行回归分析寻求其相关的具体形式才有意义。因此,在一些统计学的相关书籍中,回归分析和相关分析也合并称为相关关系分析或广义的相关分析。但是,相关分析和回归分析在研究目的和具体的研究方法上有着明确区别,具体表现在:其一,在相关分析中,只是研究变量之间的相关方向和相关的密切程度,无须确定自变量和因变量;而在回归分析中,必须事先确定自变量和因变量,而且只能从自变量去推测因变量,而不能从因变量去推测自变量。其二,相关分析不能指出变量之间相互关系的具体形式,也无法从一个变量的变化推测另一个变量的变化情况;而回归分析能确定地指出变量之间相互关系的具体形式,它可以根据回归模型从已知量估计和预测未知量。其三,相关分析所涉及的变量一般都是随机变量;而回归分析中因变量是随机的,自变量则作为研究的非随机变量。在应用相关分析和回归分析研究客观现象时,一定要注意把定性分析和定量分析结合起来,在定性分析基础上开展相关和回归的定量分析。回归模型6.2.2在回归分析中,最简单的模型是只有一个因变量和一个自变量的线性回归模型,即一元线性回归模型。从一个总体来看,反映两个变量依存关系的线性回归模型可表示为:

(6-5)1.总体回归函数

例如

例如

所以我们只能说,平均来看消费支出与可支配收入的关系能够用直线反映,如果用数学形式表示,则有:

(6-6)式(6-6)表明,在x的值给定的条件下,y的期望值是x的严密的线性函数。式(6-6)所反映的直线被称为总体回归直线。y的实际观测值并不一定位于该直线上,只是散布在该直线的周围。我们把各实际观测点与总体回归线垂直方向的间隔称为随机误差项(见右图),即总体回归线与随机误差项(6-6)在反映y的实际观测值与给定的x值的线性关系中,引进随机误差项,就得到总体回归函数式(6-5)。

2.误差项的标准假定

满足以上标准假定的一元线性模型称为标准的一元线性回归模型。提示模块二一元线性回归分析上述标准假定是用最小平方法拟合方程和对总体进行推断所必需的前提条件。但在社会经济现象中,由于各种原因,上述标准假定不一定会完全得到满足。

3.样本回归函数

知识库

模块二一元线性回归分析知识库模块二一元线性回归分析

因此,样本回归函数是对总体回归函数的近似反映。回归分析的主要任务就是要采用适当的方法,充分利用样本所提供的信息,使得样本回归函数尽可能地接近于真实的总体回归函数。模型参数的估计6.2.2

1.回归参数的点估计

2.总体方差的估计

3.回归参数的区间估计

回归模型的检验6.2.4回归模型中的参数估计出来之后,还必须对其进行检验。如果通过检验发现模型有缺陷,则必须回到模型的设定阶段或参数估计阶段,重新选择因变量和自变量及其函数形式,或者对数据进行加工整理之后再次估计参数。1.回归模型检验的种类

在对实际的社会经济现象进行回归分析时,常常会遇到经济意义检验不能通过的情况。造成这一结果的主要原因是:社会经济统计数据无法像自然科学中的实验数据那样通过有控制的实验去取得,因而所观测的样本不具有足够的代表性,或者不能满足标准线性回归分析所要求的假定条件。一级检验又称统计学检验,是指利用统计学中的抽样理论来检验样本回归方程的可靠性,具体又可分为拟合优度评价和显著性检验。一级检验是对所有现象进行回归分析时都必须通过的检验。二级检验又称经济计量学检验,是指对标准线性回归模型的假定条件能否得到满足进行检验,具体包括序列相关检验、异方差性检验、多重共线性检验等。本项目只讨论一级检验。回归直线在一定程度上描述了变量之间的数量关系,根据这一方程,可根据自变量的取值来估计因变量的取值。但估计或预测的精度如何将取决于回归直线对观测数据的拟合优度。如果各观测值数据的散点都落在这条回归直线上,那么这条直线就是对数据的完全拟合,此时用来估计是没有误差的。2.回归方程的拟合优度评价各观测值数据越是紧密地聚集在直线周围,说明直线对观测数据的拟合程度越好,反之则越差。我们把样本观测值聚集在样本回归线周围的紧密程度称为回归直线对数据的拟合优度。01判定系数的定义判定系数建立在对总离差平方和进行分解的基础之上,如下图所示。

离差分解图

式(6-25)中,SST是总离差平方和;SSR是由回归直线可以解释的那一部分离差平方和,称为回归平方和,它反映自变量x的变化对因变量y取值变化的影响,或者说是由于x与y之间的线性关系引起的y的取值变化,也称为可解释的平方和;SSE是用回归直线无法解释的离差平方和,称为残差平方和,它反映除x以外的其他因素对y取值的影响,也称为不可解释的平方和或剩余平方和。

判定系数是对回归模型拟合程度的综合度量。判定系数越大,模型拟合程度越高;判定系数越小,则模型对样本的拟合程度越差。02判定系数的特性

括号内的部分正是单相关系数。

回归分析的一个重要目的是根据所建立的回归方程,用自变量x来估计或预测因变量y的取值。当我们建立了回归方程后,还不能马上进行估计或预测,因为回归方程是根据样本数据拟合得出的,它是否真实反映了变量之间的关系,则需要通过检验后才能证实。检验包括两方面的内容:一是对各回归系数的显著性检验,二是对整个回归方程的显著性检验。3.显著性检验01回归系数的显著性检验

①t检验。

②P—值检验

02回归方程的显著性检验

为了检验两个变量之间的线性关系是否显著,我们需要构造用于检验的一个统计量。该统计量的构造是以回归平方和(SSR)与残差平方和(SSE)为基础的。由离差平方和的分解公式可知,回归模型的总离差平方和(SST)等于回归平方和(SSR)与残差平方和(SSE)之和。回归模型总体函数的线性关系是否显著,其实质就是判断回归平方和与残差平方和之比值的大小问题。由于回归平方和与残差平方和的数值会随着样本容量和自变量个数的不同而变化,因此不宜直接比较。

检验的具体步骤如下:①提出假设。

②计算检验统计量F。

③作出判断。

03进行显著性检验应注意的问题

如果所拟合的样本回归方程经过检验被认为具有经济意义,同时被证明有较高的拟合程度,就可以利用其来进行预测,即根据自变量x的取值估计因变量y的取值。回归模型预测6.2.5

1.点预测

2.预测误差01模型本身中的误差因素所造成的误差由于总体回归函数并未将所有影响y的因素都纳入模型,同时其具体的函数形式也只是实际变量之间数量联系的近似反映,因此必然存在误差。这一误差可以用总体随机误差项的方差来评价。02回归系数的估计值与其真值不一致所造成的误差。样本回归系数是根据样本估计的,它与总体回归系数之间总是有一定的误差。这一误差可用回归系数的最小二乘估计量的方差来评价。03自变量x的设定值与其实际值的偏离所造成的误差

04未来时期总体回归系数发生变化所造成的误差在研究客观经济现象的总体回归方程中,总体回归系数是一定时期内经济结构的数量特征,随着社会经济运行机制和经济结构的变化,它也会有所变动。这时,如果仍沿用根据样本期数据拟合的样本回归方程进行预测,也会造成误差。需要注意的是,在以上造成预测误差的原因中,(3)和(4)两项不属于回归方程本身的问题,而且也难以事先予以估计和控制。

3.区间预测

对于每一个给定的x值,计算相应的y的置信区间,并将连接各点的曲线描绘在平面图上,就可得到回归预测置信区间,如右图所示。回归预测置信区间

模块三3多元线性回归分析客观现象之间的联系是复杂的,许多现象的变动常常涉及多个变量的数量关系,这就是多元相关,也称复相关。例如,消费水平除了受本期收入水平的影响外,还会受物价水平、收入水平、心理预期和以往消费习惯的影响;一个工业企业利润额的大小除了与总产值多少有关外,还与成本、价格等有关。在许多场合,需要就一个因变量与多个自变量的联系来进行考察,才能获得比较满意的结果,这就需要进行多元线性回归分析。

回归模型6.3.1

与一元线性回归分析类似,为了进行多元线性回归分析,也需要提出一些必要的假定。多元线性回归分析的标准假定除了包括关于随机误差项的假定外,还要追加一条假定,即回归模型所包含的自变量之间不能具有较强的线性关系,同时样本容量必须大于所要估计的回归系数的个数,即n>k。参数估计6.3.2多元线性回归模型中回归系数的估计也采用最小二乘法。设:(6-39)

检验和预测6.3.31.拟合优度的评价01判定系数

在一元线性回归模型中,所有模型包含的变量个数都相同,如果所使用的样本容量也一样,判定系数便可以直接作为评价拟合优度的尺度。然而在多元线性回归模型中,各回归模型所含的变量的个数未必相同,以R2的大小作为衡量拟合优度的尺度是不合适的。

提示模块三多元线性回归分析对于不包含常数项的回归方程,不可用式(6-43)来求判定系数。02

2.显著性检验多元线性回归模型的显著性检验同样包括两方面的内容,即回归系数的显著性检验和回归方程的显著性检验。01回归系数的显著性检验多元回归中进行这一检验的目的主要是为了检验与各回归系数对应的自变量对因变量的影响是否显著,以便对自变量的取舍做出正确的判断。一般来说,当发现某个自变量的影响不显著时,应将其从模型中删除,这样才能做到以尽可能少的自变量达到尽可能高的拟合优度。

02回归方程的显著性检验对于多元回归模型,除了要对单个回归系数进行显著性检验外,还要对整个回归模型进行显著性检验,即检验因变量与多个自变量的线性关系是否显著。多元线性回归方程的显著性检验也采用F检验,其原理和基本步骤与一元回归模型中的F检验基本相同。

3.多元线性回归预测

模块四4复相关系数和偏相关系数

复相关系数6.4.1而在多元分析的情况下,以上定义的复相关系数的平方实际上就是多元线性回归方程的判定系数。实际计算复相关系数时,一般不直接根据其定义式,而是先计算判定系数,然后再求判定系数的平方根。应当指出,在多个变量的情况下,y与其他多个变量之间既可能有正相关又可能有负相关,所以复相关系数也就只取正值。因此,复相关系数只是反映一个变量y与其他多个变量x1,x2,…,xk之间线性相关程度的指标,而不能反映其相互之间线性相关的方向。复相关系数的取值区间为0≤R≤1。复相关系数为1,表明y与x1,x2,…,xk之间存在严密的线性关系;复相关系数为0,则表明y与x1,x2,…,xk之间不存在任何线性相关关系。一般情况下,复相关系数的取值在0~1之间,表明变量之间存在一定程度的线性相关关系。偏相关系数是指在对其他变量的影响进行控制的条件下,衡量多个变量中某两个变量之间的线性相关程度和相关方向的指标。偏相关系数6.4.2偏相关系数在计算单相关系数时,只需要掌握两个变量的观测数据,并不考虑其他变量对这两个变量可能产生的影响。而在计算偏相关系数时,需要掌握多个变量的数据,一方面考虑多个变量相互之间可能产生的影响,一方面又采用一定的方法控制其他变量,专门考察两个特定变量的净相关关系。1.偏相关系数与单相关系数的区别在多变量相关的情况下,由于变量之间存在错综复杂的关系,因此偏相关系数与单相关系数在数值上存在着差异。单相关系数受其他因素的影响,反映的往往是表面的非本质的联系,而偏相关系数则较能说明现象之间的真实联系。例如一种商品的需求既受收入水平的影响又受其价格的影响。根据经济学理论,在一定的收入水平下,该商品的价格越高,商品的需求量就越小。也就是说,需求与价格之间应当是负相关。但是在现实经济生活中,由于收入和价格常常都有不断提高的趋势,如果不考虑收入对需求的影响,仅仅利用需求和价格的时间序列数据去计算单相关系数,就有可能得出价格越高、需求越大的错误结论。

2.偏相关系数的定义公式

例如

以上偏相关系数的定义可以推广到k个变量的情形。在进行实际的客观现象的定量分析时,人们所关心的通常是某一个因变量y与多个自变量之间的偏相关程度。

0102030405新建班级新建作业成绩统计布置作业学生扫码做小提示:生成的班级二维码,放在下一页ppt中即可。放入二维码后,记得取消“隐藏幻灯片”哦~扫码布置本课作业↑↑↑扫码布置作业wenjingketang扫码填写问卷定制更实用的教学资源对课件有修改、优化建议平台使用遇到问题想免费使用平台、免费建课扫码加小旌好友为您提供专属服务哦PPT模板下载:/moban/行业PPT模板:/hangye/节日PPT模板:/jieri/PPT素材下载:/sucai/PPT背景图片:/beijing/PPT图表下载:/tubiao/优秀PPT下载:/xiazai/PPT教程:/powerpoint/Word教程:/word/Excel教程:/excel/资料下载:/ziliao/PPT课件下载:/kejian/范文下载:/fanwen/试卷下载:/shiti/教案下载:/jiaoan/PPT论坛:

THANKS数据分析基础讲课人:——基于Excel和SPSS所有教学资源,我们给;所有复杂操作,我们做;图书附赠,永久免费,只为老师用书更方便课件教案微课扫码题库建课互评考试平台

学习工具在统计调查中,为了要取得某一社会经济现象总体的综合特征,有时只对总体的一部分单位进行调查,再根据从总体中抽取的样本估计总体分布中包含的未知参数,即可推断总体。项目七XIANGMUQI抽样推断与参数估计学习目标12知识目标理解抽样和抽样分布的基本概念。掌握抽样推断中各种指标的计算方法。掌握总体均值、总体比例和总体方差的区间估计方法。能力目标能够根据样本数据对总体数据进行估算和推断。1模块7.1抽样调查概述3模块7.3抽样分布目录Contents2模块7.2抽样的基本概念4模块7.4参数估计5模块7.5各种抽样设计下的参数估计导入案例2015年全国1%人口抽样调查湖南综合试点工作启动2015年8月18日上午,2015年全国1%人口抽样调查湖南综合试点工作在湘潭县启动。并对易俗河镇吴家巷、富豪阁和上马等3个村(社区)进行现场入户登记。启动仪式结束后,相关与会人员还来到易俗河镇吴家巷社区,现场观摩1%人口抽样调查入户登记工作。未来几年是我国实现全面建成小康社会的关键时期。导入案例据县统计局负责人介绍,在2015年开展人口调查,对于掌握国情、制定经济社会发展政策、推动全面建成小康社会具有十分重要的意义,调查获取的人口基础信息将在国家发展的过程中,在经济转型、社会变动的过程中发挥重要的决策参考作用。2015年全国1%人口抽样调查时点为2015年11月1日零时。此次湘潭县试点调查分3个调查小区进行,每个调查小区划分为4个调查片区,每个调查片区调查20户,共计调查约240户,750人左右。导入案例导入案例调查对象为抽中调查小区的全部人口,不包括港澳台居民和外国人。调查内容包括住户的基本情况和个人的性别、年龄、民族、受教育程度、迁移流动、就业、社会保障、婚姻、生育、死亡、住房情况等指标。调查主要采用由住户通过互联网自主填报与调查员手持电子终端(PDA)入户登记相结合的方式。(资料来源:/c/2015/08/19/3770239.htm)模块一1抽样调查概述在社会经济统计工作中,有时不可能进行全面调查,有时全面调查的成本很高;因此,在统计实践工作中,就像全国1%人口抽样调查一样,我们经常采用抽样调查。政府和其他机构常常利用抽样调查来了解总体各个部分的情况,并制订相应的经济发展规划,公司或企业常将抽样调查的结果作为公司树立形象的参考依据。抽样调查的概念可以有广义和狭义的两种理解。按照广义的理解,凡是抽取一部分单位进行观察,并根据观察结果来推断全体的都是抽样调查,其中又可分为非随机抽样和随机抽样两种。抽样调查的概念7.1.1非随机抽样就是由调查者根据自己的认识和判断,选取若干个有代表性的单位,根据这些单位进行观察的结果来推断全体,如民意测验等。随机抽样则是根据大数定律的要求,在抽取调查单位时,应保证总体中各个单位都有同样的机会被抽中。一般所讲的抽样调查,大多数是指这种随机抽样,即狭义的抽样调查。所以,严格意义上的抽样调查就是:按照随机原则从总体中抽取一部分单位进行观察,并运用数理统计的原理,以被抽取的那部分单位的数量特征为代表,对总体做出数量上的推断分析。抽样调查的特点7.1.2抽样调查具有以下几个特点:1只抽取总体中的一部分单位进行调查。这是抽样调查和全面调查的主要区别,全面调查要调查总体中所有的单位。2用一部分单位的指标数值去推断总体的指标数值。这是抽样调查和重点调查的主要区别,重点调查是选择总体中被研究标志在标志总量中占有绝大多数比重的那些单位进行调查,其作用是掌握总体的主要情况,并不在于推算总体的综合数量特征。3抽选部分单位时要遵循随机原则。其他非全面调查,如典型调查和重点调查等,一般是要根据统计调查任务的要求,有意识地选取若干个调查单位进行调查。3抽样调查不同,从总体中抽取部分单位时,必须非常客观,毫无偏见,也就是严格按照随机原则抽取调查单位,不受调查人员任何主观意图的影响,否则可能会使得选中的那部分单位的标志值偏高或偏低,从而失去对总体数量特征的代表性。4抽样调查会产生抽样误差,抽样误差可以计算,并且可以加以控制。在非全面调查方式中,典型调查固然也有可能用它所取得的部分单位的数量特征去推算全体的数量特征。4但这种推算的误差范围和保证程度是无法事先计算并加以控制的。而抽样调查则是在于对一部分单位的统计调查,在实际观察标志值的基础上,去推断总体的综合数量特征。例如

抽样调查的适用范围7.1.3抽样调查适用的范围是广泛的,从原则上讲,为取得大量社会经济现象的数量方面的统计资料,在许多场合,都可以运用抽样调查方法取得;在某些特殊场合,甚至还必须应用抽样调查的方法取得。01有些事物在测量或试验时有破坏性,不可能进行全面调查。例如,灯泡耐用时间试验,电视机抗震能力试验,罐头食品的卫生检查,人体白细胞数量的化验等,都是有破坏性的,不可能进行全面调查,只能使用抽样调查。02有些总体从理论上讲可以进行全面调查,但实际上办不到。例如,了解某森林区有多少棵树,职工家庭生活状况如何等。从理论上讲,这些都是有限总体,可以进行全面调查,但实际上办不到,也不必要。对这类情况的了解一般采取抽样调查方法。03和全面调查相比较,抽样调查能节省人力、费用和时间,而且比较灵活。抽样调查的调查单位比全面调查少得多,因而既能节约人力、费用和时间,又能比较快地得到调查的结果,这对许多工作都是很有利的。例如农作物产量全面调查的统计数字要等收割完毕以后一段时间才能得到,而抽样调查的统计数字在收获的同时就可以得到,一般能提早两个月左右得到,这对于安排农产品的收购、储存和运输等都是很有利的。由于调查单位少,有时可以增加调查内容。因此,有的国家在人口普查的同时也进行人口抽样调查,一般项目通过普查取得资料,另一些项目则通过抽样调查取得资料。这样既可以节省调查费用和时间,又丰富了调查内容。04在有些情况下,抽样调查的结果比全面调查要准确。全面调查只有登记误差而没有代表性误差,而抽样调查则两种误差全有。因此,人们往往认为抽样调查不如全面调查准确。这种看法忽略了两种误差的大小。全面调查的调查单位多,涉及面广,参加调查汇总的人员也多,水平不齐,因而发生登记误差的可能性就大。04抽样调查的调查单位少,参加调查汇总的人员也少,可以进行严格的培训,因而发生登记误差的可能性就少。在这种情况下,抽样调查的结果会比全面调查的结果更为准确。例如,有些国家在人口和农业调查中,根据调查项目的精确要求不同,分别进行普查和抽样调查,由这两种调查所得的资料不但便于核对差错,而且可以满足不同的需要。05抽样调查方法可以用于工业生产过程中的质量控制。抽样调查不但广泛用于生产结果的核算和估计,而且也有效地应用于对成批或大量连续生产的工业产品在生产过程中进行质量控制,检查生产过程是否正常,及时提供有关信息,便于采取措施,预防废品的发生。05通过抽样推断,对未知总体的假设进行检验,来判断这种假设的真伪。例如,新教学法的采用,新工艺、新技术的改革,新医疗方法的使用等是否收到明显效果,须对未知的或不完全知道的总体做出一些假设,然后利用抽样调查的方法,根据实验材料对所做的假设进行检验,作出判断。抽样调查是必不可少的一种调查方法,但是,抽样调查也有它的弱点。05例如,它只能提供说明整个总体情况的统计资料,而不能提供说明各级状况的详细的统计资料,这就难以满足各级领导和管理部门的要求。抽样调查也很难提供各种详细分类的统计资料。05因此,抽样调查和全面调查是不能互相代替的。它们在认识上的作用是相辅相成的。随着抽样理论的发展,抽样技术的进步,抽样方法的完善和统计队伍业务水平的提高,抽样调查方法将在社会经济生活中得到更加广泛的运用。模块二2抽样的基本概念抽样的基本概念主要包括总体、样本、参数、统计量、重复抽样、不重复抽样、样本量和样本可能数目等,下面分别进行介绍。函数关系与相关关系7.2.1总体是指所要认识对象的全体,总体是由具有某种共同性质的许多单位组成的,因此,总体也就是具有同一性质的许多单位的集合体。例如,我们要研究某城市职工的生活水平,则该城市全部职工即构成总体。我们要研究某乡粮食亩产水平,则该乡的全部粮食播种面积即是总体。1.总体构成变量总体的各个单位可以用一定的数量标志加以计量,例如,研究居民的收入水平,每户居民的收入就是它的数量标志,反映各户的数量特征。总体按其各单位标志性质不同,可以分为数量总体和品质总体两类。但并非所有标志都是可以计量的,有的标志只能用一定的文字加以描述。例如,要研究织布厂1000台织布机的完好情况,这时只能用“完好”和“不完好”等文字作为品质标志来描述各台设备的属性特征,这种用文字描写属性特征的总体称为属性总体。区分变量总体和属性总体是很重要的,由于总体不同,认识这一总体的方法也就不同。通常总体的单位数用大写的英文字母N来表示。作为总体,单位数N即使有限,但总是很大,大到几千、几万、几十万,甚至几百万,如人口总体、棉花纤维总体、粮食产量总体等。对无限总体的认识只能采用抽样的方法,而对于有限总体的认识,理论上虽可以应用全面调查来收集资料,但实际上往往由于不可能或不经济而借助抽样的方法以求得对有限总体的认识。样本是从总体中随机抽取出来,代表总体部分单位的集合体。样本的单位数通常用小写英文字母n表示。对于总体单位数N来说,n是个很小的数,它可以是N的几十分之一,几百分之一、几千分之一或几万分之一。2.样本一般说来,样本单位数达到或超过30个称为大样本,30个以下称为小样本。社会经济现象的抽样调查多取大样本,自然实验观察则多取小样本。以很小的样本来推断很大的总体,这是抽样调查的一个特点。如果说总体是唯一确定的,那么,抽样样本就完全不是这样,一个总体可能抽取很多个样本,全部样本的可能数目和每一样本的容量有关,它也和随机抽样的方法有关。不同的样本容量和取样方法,样本的可能数目也有很大的差别,抽样本身是一种手段,目的在于对总体判断,因此,样本容量要多大,要怎样取样,样本的数目可能有多少,它们的分布又怎样,这些都是关系到对总体判断的准确程度,都需要认真研究。参数和统计量7.2.2参数是指根据总体各个单位的标志值或标志特征计算的、反映总体某种属性的综合指标,也称总体参数。由于总体是唯一确定的,根据总体计算的参数也是唯一确定的。1.参数不同性质的总体,需要计算不同的参数。对于变量总体,由于各单位的标志可以用数量来表示,所以可以计算总体平均数。

(7-1)

2.统计量

重复抽样和不重复抽样7.2.3重复抽样的方法:从总体N个单位中随机抽取容量为n的样本,每次从总体中抽取一个,把它看作一次试验,连续进行n次试验构成抽样样本。每次抽出一个单位把结果登记下来又放回,重新参加下一次的抽选。1.重复抽样因此,重复抽样的样本是由n次相互独立的连续试验所组成的。每次试验是在完全相同的条件下进行的。每个单位中选或不中选机会在每次都完全一样。不重复抽样的方法:从总体N个单位中要抽取容量为n的样本,每次从总体中抽取一个,连续进行n次抽选,构成抽样样本。与重复抽样不同的是,每次抽选一个单位就不再放回参加下一次抽选。2.不重复抽样因此,不重复抽样有以下这些特点:(1)样本由n次连续抽选的结果组成,实质上等于一次同时从总体中抽n个组成抽样样本。(2)连续n次抽选的结果不是相互独立的,第一次抽选的结果影响下一次抽样,每抽一次总体的单位数就少一个,因此,每个单位的中选或不中选机会在各次是不同的。样本量和样本可能数目7.2.4

1.样本量样本可能数目是按照不同的抽样方式和方法从总体中可能抽取的样本个数,也称样本可能个数。在抽样设计中,样本可能数目的多少与抽样方式(重复抽样与不重复抽样)、取样要求(考虑顺序与不考虑顺序)相关。2.样本可能数目模块三3抽样分布近代统计学曾把抽样分布、参数估计和假设检验列为统计推断的三个中心内容。抽样分布是进一步学习参数估计、假设检验以及方差分析等内容的基础,因此,掌握其理论与方法十分重要。抽样分布的内容较多本节重点介绍抽样分布的概念和一个总体参数的抽样分布问题。抽样分布的概念7.3.1抽样分布是指样本统计量的概率分布。由于样本统计量是由n个随机变量构成的样本的函数,因此,抽样分布属于随机变量函数的分布。例如

经过整理,将样本均值的全部可能取值及其出现的概率依次排列,就得到样本均值的概率分布,即样本均值的抽样分布。同理可得到样本比例的抽样分布、样本方差的抽样分布等。为了更好地掌握抽样分布的原理,首先须了解三种不同性质的分布,即总体分布、样本分布和抽样分布,并掌握三者之间的区别与联系。总体分布是指总体中各元素的观测值所形成的相对频数分布。假如可对总体中所有观测值做一次全面普查,则可通过直方图观测该总体的分布状况。但在现实中,总体的分布往往是不知道的,通常是根据经验大致了解总体的分布类型,或者假定它服从某种分布,然后再用样本分布推断总体分布。1.总体分布先假定某种小包装茶叶的重量服从正态分布,然后在全部小包装茶叶中按随机原则抽取部分来测定,最后用部分小包装茶叶的样本分布推断总体分布。例如样本分布是指从总体中抽取一个容量为n的样本,由这n个观测值形成的相对频数分布。由于样本是从总体中抽取的,其中包含着总体的一些信息和特征,因此样本分布也称经验分布。2.样本分布一般地,当样本量较大或逐渐增大时,样本的分布也逐渐接近于总体的分布;但当样本量较小或受随机因素影响时,样本的分布也可能与总体的分布不一致,甚至会有较大差异。值得注意的是,样本分布是指一个样本中各观测值的分布,它与抽样分布是不同的。抽样分布是指样本统计量的概率分布。理论上说,其就是指从容量为N的总体中抽取容量为n的样本时,所有样本可能数目的统计量取值所形成的相对频数分布。因为现实中不可能将所有的样本都抽出来,所以统计量的抽样分布实际上只是一种理论分布。通常情况下,总体参数根据样本统计量来推断。3.抽样分布用样本均值去推断总体均值,用样本比例去推断总体比例,用样本标准差去推断总体标准差等,那么进行这种推断的理论依据就是统计量的抽样分布。可以说,抽样分布是研究样本分布与总体分布之间关系的桥梁。例如样本均值的抽样分布7.3.2总体参数的抽样分布,是指在一个总体中全部样本统计量的所有可能取值形成的相对频数分布。构造一个总体参数的抽样分布的步骤为:(1)从一个容量为的有限总体中随机抽取容量为n的所有可能样本。(2)算出每个样本的统计量数值。(3)将这些来自不同样本的不同统计量观测值加以分组排列,把对应每个观测值的相对出现的频数排成另一列,则形成样本统计量的所有可能取值的相对频数分布表。(4)对频数分布数据进行数字特征分析。在一个总体的参数估计中,人们所关心的参数及用于推断这些参数的统计量主要是总体的均值、比例和方差等。下面将以简单随机抽样为例,讨论其抽样分布。样本均值的抽样分布按抽样方式的不同可以分为重复抽样和不重复抽样两种。1.重复抽样情况01总体方案已知时。

【例7-1】

设某公司有5名员工,他们在单位的时薪分别为6,8,10,12,14元。现用简单随机重复抽样方式从5名员工中抽出2人,试列出样本均值的抽样分布,分析样本均值的数值特征;并回答样本均值小于8的频数,样本均值大于12的频数及样本均值在8~12的频数各是多少?

考虑顺序的重复抽样样本分布表考虑顺序的重复抽样样本分布及计算表总体X的分布图样本的抽样分布图

总体X的分布及计算表首先,从以上总体分布和样本均值抽样分布的计算可知时薪的总体分布均值为10元,虽然每个样本均值与总体均值有差异,但样本均值的数学期望等于总体均值;其次,总体分布的方差为8,抽样分布的方差等于总体方差的1/n;最后,总体的分布为均匀分布,但样本均值的抽样分布在形态上却是对称的正态分布。

02总体方案未知时。

2.不重复抽样情况

比例,是指总体(或样本)中具有某种属性的单位占全部单位的比重,如某产品的合格率、市场占有率等。同理,样本比例的抽样分布按抽样方式的不同,也可以分为重复抽样和不重复抽样情况下的样本比例的抽样分布。样本比例的抽样分布7.3.3

1.重复抽样情况

2.不重复抽样情况样本方差的抽样分布是指在按一定的抽样方式选取容量为n的样本时,由样本方差的所有可能取值形成的相对频数分布。样本方差的抽样分布式样本方差推断总体方差的理论基础。样本方差的抽样分布7.3.4

1.样本方差是总体方差的无偏估计量

2.分布(卡方分布)

模块四4参数估计参数估计是指用样本统计量估计总体参数的方法。参数估计是统计推断的重要内容之一,它是在抽样及抽样分布的基础上,根据样本统计量来推断所关心的总体参数,如用样本均值估计总体均值、用样本比例估计总体比例、用样本方差估计总体方差等。参数估计的内容较多,本节重点介绍总体参数的估计问题。参数估计的基本原理7.4.1

1.估计量与估计值估计值是指用来估计总体参数时计算出来的估计量的具体数值。如要估计某城市300万名职工的月平均工资,从中随机抽取300名职工进行调查,根据样本计算出月平均工资为3000元,该城市职工总体平均工资不知道用样本均值3000元估计总体均值,这个3000元就是估计值。点估计是指用样本统计量的某个取值直接估计总体的估计值。点估计具有方法简单、结果直接明了的优点;但点估计值无法给出估计的置信度(或可靠性),且样本是随机的,抽出一个具体样本得到的点估计值很可能不同于总体真值。2.点估计与区间估计区间估计是指用样本统计量给出总体参数估计的区间范围。区间估计是在点估计的基础上,给出了总体参数估计的置信度,弥补了点估计的不足,但也带来了精确度的矛盾。在区间估计中,由样本统计量所构造的总体参数的估计区间称为置信区间,其中区间的最小值称为置信下限,最大值称为置信上限。,由于统计学家在某种程度上确信这个区间会包含真正的总体参数,所以给它取名为置信区间。原因是,如果抽取了许多不同的样本,比如说抽取100个样本,根据每一个样本构造一个置信区间,这样,由100个样本构造的总体参数的100个置信区间中,有95%的区间包含了总体参数的真值,而5%则没包含,则95%这个值称为置信水平。一般地,如果将构造置信区间的步骤重复多次,置信区间中包含总体参数真值的次数所占的比例称为置信水平,也称为置信度或置信系数。抽样调查的目的是用样本统计量来推断总体参数,对于同一个样本,用不同的方法来推断,可能得到不同的估计量,究竟哪一个更好呢?这就涉及估计量的优良标准问题。衡量估计量优劣的标准通常有以下三点。3.评估估计量的标准01无偏性

图7-3无偏和有偏估计量(a)无偏估计量

(b)有偏估计量

02有效性一个无偏的估计量并不意味着它就非常接近被估计的参数,它与总体参数的离散程度还应比较小。有效性是指对同一总体参数的两个无偏估计量,有更小标准差的估计量更有效。

两个无偏估计量的抽样分布03一致性

因此可以说,大样本量给出的估计量更接近总体均值μ。从这个意义上说,样本均值是总体均值的一个一致估计量。对于一致性,可以用右图直观地说明它的意义。两个不同样本量的样本统计量的抽样分布在对总体均值进行区间估计时,需要考虑总体是否为正态分布、总体方差是否已知、用于构造估计量的样本是大样本还是小样本等几种情况。总体均值的区间估计7.4.2

1.正态总体、方差已知,或非正态总体、大样本

【例7-4】

某市药品加工厂从长期生产实践中了解到,加工500克某袋药品重量X是一个随机变量,服从方差为5的正态分布。为对加工的袋装药品质量进行监测,该厂质检部门经常要进行抽检,以分析每袋药品重量是否符合要求。现从某天加工的一批袋装药品中随机抽取28袋,测得其重量如下表所示。28袋药品的重量

2.正态总体、方差未知、小样本【例7-5】

已知某种轴承的寿命服从正态分布,现从一批轴承中随机抽取16个,测得其使用寿命(单位:小时)如下:1510145014801460152014801490146014801510153014701500152015101470试建立该批轴承平均使用寿命的95%的置信区间。

以下对总体均值的区间做一个总结,如下表所示。不同情况下总体均值的区间估计

总体比例的区间估计7.4.3

总体方差的区间估计7.4.4

样本量的确定7.4.5必要的样本量是指满足一定精度要求和费用要求必须抽取的样本单位个数。在具体组织实施抽样调查前,首先应该确定一个适当的样本量,即抽取多少样本单位数。因为样本量的多少不仅关系到抽样精度的高低,而且关系到抽样调查所花费的人力物力的多少。1.必要的样本量

7-297-30

7-317-32从必要的抽样单位数公式可以看出,必要的样本量受5种因素的影响:2.影响必要样本量的因素01受总体单位之间变异程度的影响及方差的影响。02受极限抽样误差的影响。03受概率保证程度的影响。04受抽样方法的影响。05受抽样组织方式的影响。模块五5各种抽样设计下的参数估计在抽样调查中,由于调查对象的特点及工作条件的不同,因此调查组织形式呈现出多样性的特点。常用的抽样调查组织形式有:简单随机抽样、类型抽样、等距抽样、整群抽样和多级抽样等。简单随机抽样7.5.1简单随机抽样又称纯随机抽样,它是根据随机原则直接从总体中抽取样本单位的一种抽样方法。从理论上讲,简单随机抽样最符合抽样的随机原则,是抽样调查中最基本也是最单纯的组织形式。简单随机抽样在抽取样本单位时,主要有以下几种抽选方法。1.简单随机抽样的概念及抽选方法01直接抽选法就是直接从调查对象中随机抽选。02抽签法先给总体的每个单位编上序号,将号码写在纸片上,掺和均匀后从中随机抽选,直到抽够预先规定的样本单位数为止。03随机数字表法先将总体的全部单位加以编号,根据编号的位数确定使用随机数字表的栏数,然后从任意一栏、任意一行的数字开始,可以向任何方向摘录属于编号范围内的数字,即为样本单位。如果是不重复抽样,碰到重复的数字时就删掉,直到抽够预定的样本单位数为止。简单随机抽样主要适用于总体单位数较少、范围较狭窄的情况。简单随机抽样在实践中具有较大的局限性,当总体很大、范围很广时不宜使用。例如,在进行全国职工家庭收支抽样调查时,要对全国职工家庭进行编号,这实际上是很难办到的。抽样误差是指按随机原则抽样时,在没有登记误差和系统性误差的条件下,单纯由于不同的随机样本统计量估计总体参数而产生的误差。虽然抽样误差是抽样调查固有的、无法避免的误差,但可以运用大数定理的数学公式加以精确计算,并通过抽样设计程序加以控制,所以这种误差也称为可控制误差。抽样误差有以下几种表现形式。2.抽样误差01抽样实际误差

02抽样平均误差抽样平均误差反映了所有抽样结果所得的样本统计量与总体参数的平均离差,是指样本统计量的标准差,其计算公式有理论与实际两种。

样本可能数目既与抽样的方式和取样要求有关,也与总体、样本的大小有关。由抽样分布理论证明,在抽样调查中,根据取样方式的不同,可分为重复抽样和不重复抽样;根据对样本的要求不同,可分为考虑顺序抽样和不考虑顺序抽样。将上述两种抽样方式和取样要求结合起来考虑,形成相互交叉的四种情况:考虑顺序的不重复抽样,考虑顺序的重复抽样,不考虑顺序的不重复抽样,不考虑顺序的重复抽样。上述四种情况所组成的样本可能数目是不同的。

受总体单位之间变异程度的影响。总体标准差数值大,抽样平均误差也大;反之,抽样平均误差就小。抽样平均误差与总体标准差的大小成正比例关系。受样本量大小的影响。样本量越大,抽样平均误差就越小;反之,抽样平均误差就越大。抽样平均误差与样本量成反比例关系。从上述抽样平均误差的实际公式可以看出,抽样平均误差的大小主要受以下几个因素的影响。受抽样方式不同的影响。不重复抽样小于重复抽样的抽样平均误差。受抽样组织形式不同的影响。不同抽样组织所抽取的样本,其计算抽样平均误差的方法不同,故抽样平均误杀的计算结果也不相同。

03抽样极限误差

由此可见,抽样极限误差反映了抽样估计的精确度。一般来说,抽样极限误差越小,抽样估计的精确度越高;反之,抽样估计的精确度就越低。3.总体均值的参数估计01总体总值、总体均值和总体方差。

02样本总值、样本均值和样本方差。

03总体总值、总体均值和总体方差的参数估计。

(7-48)(7-49)

【例7-9】

某外贸公司出口5万包小包装糖果,与外商签订的合同规定每包糖果的平均重量不能低于150克,采用简单随机不重复方式抽取2‰进行检验,检验结果如下表所示。糖果重量的计算表根据上述资料,在95.45%的概率保证程度下:①

试估计该批糖果的平均重量;②

试推断该批糖果是否符合合同规定的要求;③

试推断该批糖果总重量区间范围;④

试推断抽样估计精确度。

4.总体比例的参数估计01总体比例和总体方差。

根据前文所述,比例参数和统计量可以定义为:02样本比例和样本方差。

03样本比例和样本方差。

(7-59)(7-60)

5.样本量的确定

(7-63)(7-64)

(7-65)(7-66)

类型抽样7.5.2类型抽样是指对总体各单位先按主要标志加以分类,然后再从各类中按随机原则抽选一定单位构成样本的抽样组织形式。1.类型抽样概述

类型抽样通过对总体各单位分类后,可以使总体单位标志值比较接近的单位归为一类,使各类的分布比较均匀,在样本量一定的条件下,可以缩小抽样平均误差,提高抽样调查的效率。类型抽样在各类中抽取样本可以看成是总的样本数在各类中的分配。在类型抽样中,总体均值(或比例)与总体总值的参数估计的步骤与简单随机抽样大致相同,由于类型抽样是先分类再从各类中抽选样本量,故其样本均值(或比例)是各类均值(或比例)的加权算术平均数,方差是各类方差的加权算术平均数。2.总体均值(或比例)与总体总值的参数估计【例7-12】

某县有产粮耕地6500公顷,按平原、丘陵和山区面积等比例共抽819m2进行实割实测,计算结果如下表所示。计算结果

3.样本量的确定及分配01平均法平均法是一种简单平分法,其在样本量给定的条件下,仅考虑类型抽样的分类组数,将总样本量平均分配到各层中,然后各层平均分摊样本量。02比例法比例法主要以各类型中总体単位数的多少进行分配,其在样本量给定的条件下,按比例分配各层中的样本量,以保证类型抽样平均数(或比例)是总体平均数(或比例)的无偏估计。03适度法适度法兼顾了各层内单位数和差异情况,其在样本量给定的条件下,合理安排各层样本量,使抽样误差达到最小。04最优法最优法可进一步考虑调查费用问题,其在样本量和调查费用给定的条件下,使抽样误差达到最小;或在样本量和抽样误差给定的条件下,使调查费用最省。

将计算出的平均每平方米产量、抽样平均误差和总费用填入194页表中。④最优法。

计算结果分析194页中的表,可以看出最优法平均单位产量较准、误差最小、总费用最低,比例法平均单位产量最准、误差最小、总费用也较低。这两种方法比平均法和适度法优异,所示是实际工作中常用的两种方法。等距抽样7.5.3等距抽样又称机械抽样、系统抽样,它是将总体全部单位按某一标志排列,然后按固定顺序和间隔来抽选样本单位的抽样组织形式。等距抽样总体单位的排列顺序可以是无关标志,也可以是有关标志。

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论