版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
《应用统计学》
第6章抽样分布与参数估计
第6章
《应用统计学》抽样分布与参数估计
6.1抽样理由和抽样方法
6.2抽样误差
6.3抽样分布
6.4参数估计
6.5样本容量的确定
第6章抽样分布与参数估计
《应用统计学》本章教学目的
n在本章中你将学到:
n区分不同的抽样方法
n抽样分布的概念
n计算样本平均数和样本比例相关的概率
n中心极限定理的重要性
n理解点估计与置信区间估计
n计算均值和比例的置信区间
n根据所要得到的置信区间确定样本容量。
第6章抽样分布与参数估计
《应用统计学》本章重点和难点
n区分不同的抽样方法
n理解抽样分布的概念
n理解中心极限定理的重要性
n计算均值和比例的置信区间
第6章6.1抽样理由和抽样方法
《应用统计学》
6.1.1抽样理由
6.1.2抽样方法
第6章6.1抽样理由和抽样方法
《应用统计学》6.1.1抽样理由
n选择样本比总体(人口普查)中的每一项要节省时间。
n选择样本比总体中的每一项要节省费用。
n分析样本要比分析整个总体容易且更加实际。
第6章6.1抽样理由和抽样方法
《应用统计学》6.1.2抽样方法
n抽样过程从抽样框开始
n抽样框是对组成总体的一系列条目的列举。
n抽样框是类似总体清单,目录或者地图的数据源。
n如果抽样框里没有包括总体的某些部分,不准确或者
有偏的结果就可能产生。
n使用不同的抽样框得到数据会得出不同的结论。
第6章6.1抽样理由和抽样方法
《应用统计学》样本类型
样本
非概率样本概率样本
简单
判断样本便利样本分层样本
随机样本
系统样本群样本
第6章6.1抽样理由和抽样方法
《应用统计学》样本类型:非概率样本
n在非概率样本中,选中的条目不根据他们发生的概率。
n在便利抽样中,条目的选择简单,便宜,且方便抽样。
n在判断样本中,我们得到预先选好的专家就主题发表的
意见。
第6章6.1抽样理由和抽样方法
《应用统计学》样本类型:概率样本
在概率样本中,样本中条目的选择基于已知的概率。
概率样本
简单
系统样本分层样本群样本
随机样本
第6章6.1抽样理由和抽样方法
《应用统计学》概率样本:简单随机样本
n架构里的每一个条目都有同等的机会被选中。
nn代表样本容量,N代表抽样框的大小,对抽样框中的每
个条目进行编号为1到N。
n抽样可以放回(选择了某一个条目之后再把它放回架构里,
它再次被选中的概率仍然相同)或者不放回(选择的某
一个条目,不能放回架构中)。
n简单随机样本适用于总体较小,且同质性比较高的情况。
n样本通过随机数表或随机数产生器取得。
第6章6.1抽样理由和抽样方法
《应用统计学》使用随机数表选择简单随机样本
随机数表(部分)
有850条目的总体抽样架构
492808892435779002838116307275
条目名条目号
111000234012860746979664489439
BevR.001
098932399720048494208887208401
UlanX.002
..简单随机样本前5个条目
..
..Item#492
..Item#808
JoannP.849
PaulF.850Item#892--不存在所以忽略
Item#435
Item#779
Item#002
第6章6.1抽样理由和抽样方法
《应用统计学》概率样本:系统样本
n取决于样本容量:n
n抽样框中N个个体分成含k个个体的组:k=N/n
n从第一组随机选择一个个体
n接下来,每数到第k个数都依次选取
n简单易行,但可能带来周期性问题,导致抽样偏差
N=40第一组
n=4
k=10
第6章6.1抽样理由和抽样方法
《应用统计学》概率样本:分层样本
n根据一些常见的特征,把总体分成两个或两个以上的亚
群体,即层(strata)。
n在每个层中根据层容量相应选择简单随机样本。
n分层选择的样本然后加以合并。
n当抽样总体是选民时,根据种族或社会经济层次分层是
常用的技术。
总体分成
4个层
第6章6.1抽样理由和抽样方法
《应用统计学》例选取分层样本
某公司要从800名全职雇员中选取32名全职雇员作为样本,
估计一项公司赞助的牙科保健计划方面的费用。在全职雇
员中,25%是经理,75%是非经理。如何选择分层的样本使
样本能代表经理雇员和非经理雇员正确的比例?假定回复
率为80%。总体800
解:共需发送
32/0.8=40份调查问卷。经理200非经理600
抽取抽取
40*25%=1040*75%=30
第6章6.1抽样理由和抽样方法
《应用统计学》概率样本:聚类样本
n总体分为若干个“聚类”或者“群”,每个聚类或群代表
整个总体。
n随机选择聚类样本或群样本
n使用选中的聚类里的所有项目或者从聚类里面选取基于概率
的样本。
n聚类样本的通常应用是选举,其中选择特定选区并抽样。
总体分成16个
聚类样本。
随机选择聚类样本抽样
第6章6.1抽样理由和抽样方法
《应用统计学》概率样本:比较抽样方法
n简单随机样本和系统样本
n使用简单
n可能不能很好的代表总体的潜在特性
n分层样本
n确保代表的个体覆盖整个总体
n聚类样本
n成本效率更高
n有效性较低(需要更大的样本以取得同等程度的精确性)
第6章6.2抽样误差
《应用统计学》
n样本统计量和对应的总体参数之间的差异,称之为抽样
误差。
n抽样误差的产生是由于抽样的非全面性和随机性所引起
的,是偶然性误差。
n非抽样误差
n抽样框误差
n系统性误差
n测量误差
n登记误差
第6章6.3抽样分布
《应用统计学》
n抽样分布就是选出所有可能的样本情况下结果的分布
n两类统计量的抽样分布:样本均值和样本比例。
n例如,假设想知道某学院学生的平均成绩,随机选择
50个学生。如果得到很多不同的50个学生的样本,将
计算每个样本不同平均数。我们可以计算对于任意给
定的50个学生的样本,我们对所有潜在的平均成绩感
兴趣。
第6章6.3抽样分布
《应用统计学》6.3.1样本均值的抽样分布
均值的抽样分布是指在给定样本容量的情况下所有可能
的样本均值的分布。
第6章6.3抽样分布
《应用统计学》1.样本均值的均值例子
n假设总体…
n总体容量N=4
CD
n随机样本变量,X,AB
是个体的年龄
nX的观测值:24,28,
32,36(岁)
第6章6.3抽样分布
《应用统计学》
总体均值
总体的均值等于总体的所有数值之和除以总体容量N。
n
Xi
i1
N
总体的标准差
n
()2
Xi
i1
N
第6章6.3抽样分布
《应用统计学》样本均值的均值——例子(续)
总体分布的概括度量:
XP(x)
μi
N.3
24283236
30.2
4.1
20
(Xiμ)24283236x
σ4.472
NABCD
均匀分布
第6章6.3抽样分布
《应用统计学》样本均值的均值——例子(续)
现在考虑容量n=2的所有可能的样本
16个样本
第一个第二个观测值
观测值平均数
24283236
第一个
2424,2424,2824,3224,36第二个观测值
2828,2428,2828,3228,36观测24283236
3232,2432,2832,3232,36值
3636,2436,2836,3236,362424262830
2826283032
3228303234
16个可能的样本
3630323436
(有放回的抽样)
第6章6.3抽样分布
《应用统计学》样本均值的均值——例子(续)
所有样本平均数的抽样分布
16个样本平均数
样本平均数的分布
第一个第二个观测值
P(X)
观测值24283236.3
2424262830
2826283032.2
3228303234
.1
3630323436
0_
24262830323436
X
(不再是均匀分布)
第6章6.3抽样分布
《应用统计学》样本均值的均值——例子(续)
该抽样分布的概括度量:
X24262636
μi30
XN16
2
(Xiμ)
σX
XN
(24-30)2(26-30)2(36-30)2
3.16
16
第6章
6.3抽样分布
《应用统计学》样本均值的均值——例子
算术平均数是无偏的,因为所有可能的样本均值(给定
样本容量n)的平均值等于总体的均值。
E(X)
第6章6.3抽样分布
《应用统计学》2.样本均值的标准误差
总体样本平均数分布
N=4n=2
μ30σ4.472μX30σX3.16
_
P(X)P(X)
.3.3
.2.2
.1.1
00_
X24262830323436
24283236X
ABCD
第6章
6.3抽样分布
《应用统计学》
n同样总体相同容量的不同的样本导致不同的样本平均数
n样本与样本之间平均数的变动用均值的标准误差来度
量:(这假设是有放回的抽样或者无限总体无放回的抽样)
n均值的标准误差是所有可能的样本均值的标准差。
σ
σ
Xn
n注意平均数的标准差随着样本容量增加而减少
第6章6.3抽样分布
《应用统计学》3、正态分布总体的抽样分布
总体服从正态分布,平均数μ且标准差σ,抽样分布
X也服从正态分布。
σ
σ
μμX
X且n
第6章6.3抽样分布
《应用统计学》平均数抽样分布的Z值
抽样分布的Z值:
(Xμ)(Xμ)
ZX
σ
σX
n
其中:=样本平均数
μ=总体平均数
σ=总体标准差
n=样本容量
第6章6.3抽样分布
《应用统计学》抽样分布特征
总体正态分布
μxμ
μ
抽样分布也正态分布
(有同样的平均数)
μx
第6章6.3抽样分布
《应用统计学》抽样分布特征
(续)
随着n增加,
较大的样本
σx减少容量
较小的样本
容量
μ
第6章6.3抽样分布
《应用统计学》例子:麦片包装问题
假设每盒麦片的重量服从正态分布,均值为368克,标准
差为15克。如果从同一天包装的几万盒麦片中随机抽取25
盒作为样本,则该样本均值低于365克的可能性有多大?
解:
15
X~N(368,)
25
365368
P(X365)P(Z)P(Z1)0.1587.
3
即所有容量为25的样本的均值有15.87%的概率低于365克。
第6章6.3抽样分布
《应用统计学》例子:麦片包装问题
假设每盒麦片的重量服从正态分布,均值为368克,标准
差为15克。如果从同一天包装的几万盒麦片中随机抽取
100盒作为样本,则该样本均值低于365克的可能性有多大?
解:
15
X~N(368,)
100
365368
P(X365)P(Z)P(Z2)0.0228
1.5
即所有容量为100的样本的均值有2.28%的概率低于365克。
第6章6.3抽样分布
《应用统计学》6.3.2中心极限定理
n我们可以使用中心极限定理:
n即使总体非正态分布,总体的样本平均数将近似正
态分布只要样本容量足够的大.
抽样分布的特征:
σ
σx
μxμ且n
第6章6.3抽样分布
《应用统计学》6.3.2中心极限定理
随着样本容不管总体的分布
量变得足够n↑如何,抽样分布
的大…趋近于正态分布
第6章6.3抽样分布
《应用统计学》
(续)
总体分布
抽样分布特征:
集中趋势
μxμμ
抽样分布
变异程度(随着n的增加服从正态分布)
σ较大的样
σx
n较小的本容量
样本容量
μx
第6章6.3抽样分布
《应用统计学》多大是足够的大?
对于大多数分布,n>30将导致抽样分布近乎正态分
布
对于完全对称分布,n>15一般足够导致抽样分布近乎
正态分布
对正态分布的总体,平均数的抽样分布总是服从正态分布
第6章6.3抽样分布
《应用统计学》例子
n假设总体的平均数μ=8且标准差σ=3.假设选
中容量n=36随机样本。
n样本平均数介于7.8和8.2之间的概率是多少?
第6章6.3抽样分布
《应用统计学》
例子(续)
n结论:
n即使总体非正态分布,中心极限定理可以应用(n>
30)
n…因此抽样分布近乎正态分布
n…且平均数X8
n…且标准差σ3
σ0.5
xn36
第6章6.3抽样分布
《应用统计学》例子
(续)
结论(续):
7.8-8X-μ8.2-8
P(7.8X8.2)P
3σ3
36n36
P(-0.4Z0.4)0.3108
总体分布抽样分布标准正态分布.1554
??+.1554
???
??
???
??样本标准化
μ8X7.88.2-0.40.4Z
μ8
Xμz0
第6章6.3抽样分布
《应用统计学》6.3.3比例的抽样分布
nπ=有着某种特性的总体的比例
n样本比例(p)提供π的估计:
X样本中有着感兴趣特性条目数量
p
n样本容量
n0≤p≤1
n当n比较大时,p近乎正态分布
n(假设是有放回的抽样或者无限总体无放回的抽样)
第6章6.3抽样分布
《应用统计学》p的抽样分布
近乎正态分布分布,如果:
抽样分布
n5P(ps)
.3
且.2
.1
0
n(1)5p
0.2.4.681
其中
且π(1π)
μpπσ
pn
(其中π=总体比例)
第6章6.3抽样分布
《应用统计学》比例的Z值
使用公式将p标准化为Z值:
pp
Z
σp(1)
n
第6章6.3抽样分布
《应用统计学》例子
n如果支持A主张的投票者的真正比例是π=0.4,容量
200的样本导致样本比例介于0.40与0.45之间的概率是
多少?
n也就是说:
ifπ=0.4且n=200,
P(0.40≤p≤0.45)是多少?
第6章6.3抽样分布
《应用统计学》例子(续)
ifπ=0.4且n=200,
P(0.40≤p≤0.45)是多少?
计算:(1)0.4(10.4)
σ0.03464
pn200
转换成标准正态分布:
0.400.400.450.40
P(0.40p0.45)PZ
0.034640.03464
P(0Z1.44)
第6章6.3抽样分布
《应用统计学》例子(续)
ifπ=0.4且n=200,
P(0.40≤p≤0.45)是多少?
使用标准正态分布表:P(0≤Z≤1.44)=0.4251
抽样分布标准正态分布
0.4251
标准化
0.400.45p01.44Z
第6章6.4参数估计
《应用统计学》
6.4.1点估计
使用单个样本的统计量来估计总体参数的方法。
第6章6.4参数估计
《应用统计学》6.4.2置信区间估计
n置信区间估计:是在样本点左右构造的一段区间,从
而可以知道总体参数落在特定区间内的概率。
n对于未知参数,找到两个数值1和2,12
n使参数位于区间(1,2)的概率为1,即
P(12)1
n式中,区间表示总体参数的区间估计或置信区
(1,2)
间。
第6章6.4参数估计
《应用统计学》点估计和置信区间估计
n点估计是单个数
n值置信区间提供了估计变动的额外信息
置信区间下界置信区间上界
点估计
置信区间宽度
第6章6.4参数估计
《应用统计学》6.4.3总体均值的置信区间估计(已知时)
n区间给出了观测值的一个范围:
n考虑样本统计量随着样本的不同而变化
n基于一个样本的观测值
n给出接近未知总体参数的信息
n以置信度表示
n例如95%的置信度,99%的置信度
n不能为100%的置信度
第6章6.4参数估计
《应用统计学》置信度(1-)
n置信度:置信区间包含未知总体参数的百分比(低于
100%)
n假设置信度=95%,也可写成(1-)=0.95,(故=
0.05)
n为分布中置信区间外的两个尾部的比例。
n一般的相关解释:
n构造的所有置信区间95%包含未知的真实参数
n特别的,区间可以包含也可以不包含真实参数
第6章6.4参数估计
《应用统计学》μ的置信区间(σ已知)
n假设
n总体标准差σ已知
n总体是正态分布
n如果总体非正态,则使用大样本
n置信区间估计:σ
XZ
/2n
其中
Zα/2是标准正态分布曲线上上限临界值以上的比例
为/2对应的数值;
第6章6.4参数估计
《应用统计学》寻找临界值,Zα/2
考虑置信度是95%的置信区间:
Z/21.96
10.95,所以0.05
αα
0.0250.025
22
Z:Zα/2=-1.960Zα/2=1.96
置信下限点估计置信上限
X:临界值临界值
第6章6.4参数估计
《应用统计学》常用置信度
通常使用的置信度是90%,95%,和99%
置信系数
置信度Zα/2值
1
80%0.801.28
90%0.901.645
95%0.951.96
98%0.982.33
99%0.992.58
99.8%0.9983.08
99.9%0.9993.27
第6章6.4参数估计
《应用统计学》置信区间和置信度
均值的样本分布
/2
1/2
X
区间从μxμ
σx1
XZ/2(1-)x100%
nx2
扩展到区间包含μ;
()x100%不包
σ含
XZ
/2n
置信区间
第6章6.4参数估计
《应用统计学》【例6-1】
一个文具商店想要估计库存中贺卡的平均销售额。随机选
择100张贺卡,均值为3.65元,标准差为0.4元。假设服
从正态分布,计算该店库存中所有贺卡的均值的95%置信
区间估计。
解:95%的置信度对应的临界值Z21.96
0.4
xZ23.65(1.96)3.650.0784
n100
3.5716≤≤3.7284
即库存中所有贺卡的平均销售额的95%置信区间估计为
3.5716~3.7284元。
第6章6.4参数估计
《应用统计学》6.4.3总体均值的置信区间估计(未知时)
n如果总体标准差σ是未知的,我们可以用样本标准差
S来替代。
n这种做法是非常不确定的,因为S随着样本的变化而变
化。
n所以我们用t分布来代替正态分布。
第6章6.4参数估计
《应用统计学》1.学生t分布
n如果随机变量X服从正态分布,那么下面的统计量服从
自由度为n-1的t分布:
X
t
S
n
n其中S为样本标准差。
第6章6.4参数估计
《应用统计学》2.t分布的特性
注意:tZn增加
标准正态
(t有df=∞)
t(df=13)
t-分布是钟形的对称
的,但其尾部比正
态的“胖”t(df=5)
0t
第6章6.4参数估计
《应用统计学》t分布的特性(续)
nt是一个分布集
ntα/2的值依赖于自由度(d.f.)
n观察值在样本均值计算后是自由变化的
d.f.=n-1
第6章6.4参数估计
《应用统计学》3.自由度(df)的概念
思想:观察值在样本均值计算后是自由变化的
例子:假设3个数字的均值是8.0
令X=7
1如果这三个数的均值是8.0,
令X2=8
那么X3一定是9
X3是多少?
(即,X3不是自由变化的)
这里,n=3,所以自由度=n–1=3–1=2
(对于一个给定的均值,2个值可以是任意的数字,但
是第三个数是不能自由变化的)
第6章6.4参数估计
《应用统计学》4.置信区间的表达式(σ未知)
当σ未知时,均值的(1-)100%置信区间估计为:
S
Xt
/2n
(其中tα/2是具有n-1自由度和α/2的累积面积的t分
布的临界值)
第6章6.4参数估计
《应用统计学》t分布表
上部的尾部面积
令:n=3
df.25.10.05df=n-1=2
=0.10
11.0003.0786.314/2=0.05
20.8171.8862.920
30.7651.6382.353/2=0.05
表的主体包含t值
,但没有概率02.920t
第6章6.4参数估计
《应用统计学》【例6-2】
某医院想估计其急诊室服务的病人的平均等候时间。随机抽取33
名急诊室病人进行调查,经计算样本均值为222分钟,样本标准差
为76分钟。在95%的置信水平下估计平均等候时间的置信区间。
解:由题意知,x222S76n33
95%的置信度,自由度为32时,对应的t分布的临界值
为,应用公式(6-13)可得:
t22.037
S76
xt2=2222.037=22226.97
n33
即195.03≤≤248.97
第6章6.4参数估计
《应用统计学》6.4.4比例的置信区间估计
n总体比例(π)的区间估计可以通过对样本比例(p)
的不确定性增加一个限制来计算。
第6章6.4参数估计
《应用统计学》
n置信区间上下界通过以下公式来计算
p(1p)
pZ
/2n
n其中
nZα/2是所要求的置信度的标准正态值
nP是样本比例
nn是样本容量
n注意:一定要np>5和n(1-p)>5
第6章6.4参数估计
《应用统计学》【例6-3】
某网站对1120名全职妈妈进行了调查,其中280位表明她们对工
作-生活的平衡并不满意。计算全职妈妈中对工作-生活的平衡并
不满意的总体比例的90%置信区间估计。
解:置信区间估计可以计算如下:
X280
p0.25
n1120
90%的置信度对应的关键值Z21.64,5则有
p(1p)0.250.75
pZ0.25(1.645)
2n1120
0.25(1.645)(0.0129)
=0.250.0212
即0.2288≤≤0.2712
第6章6.5样本容量的确定
《应用统计学》
样本容量的
确定
均值比例
第6章6.5样本容量的确定
《应用统计学》6.5.1估计总体均值时样本容量的确定
n样本容量需要达到置信度(1-)要求下的误差界限
(ME)
n此误差界限也称为抽样误差
n总体参数估计时的不精确量
n点估计生成置信区间时增加减少的量
第6章6.5样本容量的确定
《应用统计学》
样本容量
的确定
均值
抽样误差
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 2026事业单位工勤技能-内蒙古-内蒙古机械冷加工四级(中级工)历年参考题库含答案详解
- 2026事业单位工勤技能-云南-云南堤灌维护工三级(高级工)历年参考题库含答案详解
- 2026事业单位工勤技能-上海-上海公路养护工二级(技师)历年参考题库含答案详解
- 2026中级审计师资格考试(审计相关基础知识)历年参考题库含答案详解
- 2026年甘肃中医药大学附属医院(第二期)高层次人才引进笔试备考试题及答案详解
- 2026中国龙江森林工业集团有限公司事业单位公开招聘工作人员132人笔试备考试题及答案详解
- DB32/T 4928-2024温室气体 二氧化碳和甲烷观测规范 光腔衰荡光谱法
- 2026上海华东师范大学智能交互学院研究生工作秘书招聘1人考试备考题库及答案详解
- 2026年云南外事服务中心有限公司工作人员招聘(3人)笔试模拟试题及答案详解
- 2026年鄂州市市直机关公开遴选公务员17人笔试备考试题及答案详解
- 蔚来汽车买车合同协议
- 护理伦理学人卫版
- 欧泰科-吊挂软件使用教程
- 主题班会关于运动会主题班会
- 粤教版小学科学三年级上册教学计划
- 污水处理站员工培训实施方案
- YDT 4864-2024通信用光纤预制棒的测量方法
- 智慧公路交通讲座-日本的智能交通与智慧公路
- 2024年05月广东广州美术学院招考聘用协议年薪制工作人员4人笔试笔试历年典型考题及考点研判与答案解析
- 湖南高速铁路职业技术学院单招职业技能测试参考试题库(含答案)
- 小学-舞蹈校本课程教材
评论
0/150
提交评论