第六章 参数估计(课件)- 《统计学(第二版) 》同步教学(人民大学版)_第1页
第六章 参数估计(课件)- 《统计学(第二版) 》同步教学(人民大学版)_第2页
第六章 参数估计(课件)- 《统计学(第二版) 》同步教学(人民大学版)_第3页
第六章 参数估计(课件)- 《统计学(第二版) 》同步教学(人民大学版)_第4页
第六章 参数估计(课件)- 《统计学(第二版) 》同步教学(人民大学版)_第5页
已阅读5页,还剩64页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

§1抽样分布

§2点估计

§3区间估计

§4一个总体参数的区间估计

§5两个总体参数的区间估计

§6样本量

§1.1抽样的基本概念

§1.2样本均值的抽样分布

§1.3中心极限定理

在抽样问题中,我们把研究对象的全体称为总体(population),总体

的数量特征就是总体参数(Populationparameter)。

为了解总体的情况,我们从总体中随机抽取的个个体称为样本(sample

),样本的数量特征就是统计量(statistics),它与总体参数相对应。统

计量是关于样本数据的函数,它不依赖任何未知参数,利用调查数据,就能

直接计算得到统计量的值。

设X1,X2,,Xn是从总体中抽取的容量n为的一个样本,根据样本构造一个

函数,该函数便是一个统计量,也称为样本统计量。

TX1,X2,,Xn

当调查得到样本数据的值时,代入T,计算出

x1,x2,,xnTX1,X2,,Xn

的数值,就得到了一个具体的统计量值。在这里,大写的X1,X2,,Xn

表示变量,小写的表示变量的具体取值,相应的,TX,X,,X

x1,x2,,xn12n

表示统计量,而Tx1,x2,,xn则表示统计量的一个具体结果。

设是从总体中抽取得到一个样本,则:

X1,X2,,Xn

1n

样本均值为XXi

ni1

n

样本方差为212

SXiX

n1i1

样本均值和方差是最常见的统计量。

2

设总体X服从正态分布N,,X1,X2,,Xn为n个互相独立且与总体同

1n

2

分布的随机变量,则样本均值XXi服从期望为,方差为/n的

ni1

正态分布。记作:X~N,2/n

上面的结果表明,样本均值的期望与总体均值相同,而方差则变为原来

的1/n,这说明用样本均值去估计总体均值,平均来说没有偏差(因为

期望相等),当样本量n增加时,样本均值的方差变小,即用样本均值X

估计总体均值会更加精确。

2

设总体X的分布未知,但已知均值为,方差为,抽取得到一个容量为

的样本,当足够大(我们通常要求)时,则样本均值1n

nnn30XXi

ni1

近似服从期望为,方差为2/n的正态分布。

中心极限定理告诉我们:不管总体服从什么样的分布,只要样本量足够大,

样本均值都近似服从正态分布。

参数估计的方法分为:

点估计

区间估计

点估计:直接以样本统计量的某个取值作为总体参数的估计值

区间估计:给出一个区间,说起来留有余地,不像点估计那么绝对

§2.1点估计

§2.2点估计优劣的评价标准

点估计(pointestimation)就是直接以样本统计量的某个取值作

为总体参数的估计值。

在统计中经常使用的点估计量有:用样本均值x直接估计总体均值

n

2

(xix)

,用样本比例p直接估计总体比例,用样本方差s2i直

n1

接估计总体方差2等。

【例6.1】已知某种灯泡的寿命X~N(,2),其中和2都是

未知的。现随机抽取,10只灯泡,测得寿命(单位:小时)

分别为1502,1453,1567,1510,1500,1468,1582,1534,

1450,1504,试估计和2。

解:

因为是全部灯泡的平均寿命,x为样本平均寿命,根

据点估计的思想,用x估计,用s2估计2。由于

1n

xxi1507

ni1

n

2

(xix)

s2i11970.222

n1

所以,和2的估计值分别为1507小时和1970.222小时。

评价估计量好坏的标准:

无偏性

有效性

一致性

1.无偏性定义

如果ˆ的期望等于未知参数,即Eˆ对一切可能的成立,

则称ˆ为的无偏估计。

【例6.2】设为从一均值为的总体中抽取的样本,

x1,x2,,xn

请验证的如下估计量的无偏性:

XXXXXXXX

ˆX,ˆ12,ˆ12n1n,ˆ2X,ˆ12

1122344153

解:

由于,容易验证Eˆ,。因而,

E(Xi)ii1,2,3

ˆ1,ˆ2,ˆ3都是的无偏估计。

12

然而,Eˆ42EX12,EˆEXX,

53123

因而它们都不是的无偏估计。

2.有效性定义

设ˆ和ˆ均为参数的无偏估计,如果有

12

ˆˆ

Var1Var2

则称ˆ比ˆ有效。

12

当ˆ是所有无偏估计中方差最小的那个时,称ˆ为最小方差无偏估

计。

3.一致性定义

设ˆ是的一个估计量,若ˆ依概率收敛于,即对任意的0,

limP|ˆ|1

n

则称ˆ是的一致估计。

同时满足上述三条标准的估计量称为一致最小方差无偏估计量。

定义设为总体的一个未知参数,x1,x2,,xn是来自该总体的一个样

本,对给定的,确定两个统计量ˆ和ˆ,若有ˆˆ

(01)LUPLU1

ˆˆˆ

成立,则L,U称为的置信度为1的置信区间。其中,L称为置信下

ˆ

限,U称为置信上限。

为显著性水平,一般取较小的值,如0.05,0.01等。

ˆˆ

区间长度UL则表示估计的范围,即估计的精度,区间长度

越短越好。但置信度和区间长度是相互矛盾的。

实际中,我们总是在保证置信度的前提下,尽可能地提高精

度。

§4.1正态分布总体

§4.2非正态分布总体

§4.3比例的估计

1.正态总体,2已知

当总体服从正态分布且2已知时,样本均值x的抽样分布均为正态

分布,对x进行标准化以后的随机变量将服从标准正态分布,即有

x

z~N(0,1)

n

从而,总体均值在置信度1下的置信区间为:

xZ12,xZ12

nn

【例6.3】从某超市的货架上随机地抽得9包0.5千克装的白

糖,实测其重量分别为(单位:千克):

0.497,0.506,0.518,0.524,0.488,0.510,0.510,0.515,0.512,

从长期的实践中知道,该品牌的白糖重量服从正态分布N(,2)

22

已知0.01,求的95%置信区间。

解:经计算,x0.5089,对于显著性水平0.05,查标准正

态分布表,可得Z0.9751.96,于是,的95%置信区间为

0.010.01

0.50891.96,0.50891.960.5024,0.5154

99

2.正态总体,2未知

方差未知,且为小样本时,虽然同样可以用样本方差

s2代替2来构建总体均值的置信区间,但此时,样本均

值经标准化以后的随机变量服从自由度为n1的t分布,

即:

x

t~t(n1)

sn

根据t分布建立的总体均值在置信度1下的置信区间为:

ss

xt12(n1),xt12(n1)

nn

t(n1)

其中,12为自由度为n1时,t分布中左侧面积为12

时的值。

【例6.4】例6.3中,若2未知,求的95%的置信区间。

解:已知n9,x0.5089,直接计算可得s20.1184103

对于显著性水平0.05,查自由度为8的t分布表,可得

t0.975(8)2.306。从而,的95%置信区间为:

0.11841030.1184103

0.50892.306,0.50892.3060.5005,0.5173

88

当总体是非正态分布总体时,在数学上可以证明,当样本n

足够大时,无论总体是否服从正态分布,样本均值x的抽样

分布均为正态分布,其数学期望为总体均值,方差为2n

,其中2为总体方差。对x进行标准化以后的随机变量将服

从标准正态分布,即有:

x

z~N(0,1)

n

从而,总体均值在置信度1下的置信区间为:

xZ12,xZ12

nn

其中,Z12是标准正态分布左侧面积为12时的Z值。

如果总体的方差未知,则式中的可用样本标准差s代替

,此时总体均值的置信区间变为:

ss

xZ12,xZ12

nn

【例6.5】从某校随机地抽取100名男学生,测得平均身高为

170厘米,标准差为7.5厘米,试求该校男学生平均身高95%

的置信区间。

解:

由于为大样本,且总体方差未知,又

n=100,x=170,s=7.5,1-=0.95,

查表得=1.96,

Z12

s

有xZ12=170±1.96=170±1.47

n

因此,该校男学生平均身高的95%的置信区间为68.5~171.5

厘米之间。

大样本情形(np5,n(1p)5时),比例p的抽样分布可用

正态分布近似。

(1)

p的数学期望为E(p),p的方差为Var(p)。

n

样本比例经标准化后的随机变量服从标准正态分布,即:

p

z~N(0,1)

(1)

n

从而,总体比例在置信度1下的置信区间为:

(1)(1)

pZ12,pZ12

nn

值未知的解决办法:

用样本比例p来代替,总体比例的置信区间可表示为:

p(1p)p(1p)

pZ12,pZ12

nn

较为保守的方法:当=1=0.5时,(1)达到最大值。所以

用0.5作为的估计值求出的将是最宽的置信区间:

0.250.25

pZ12,pZ12

nn

当0.3≤p≤0.7时,由这两种方法得到的结果很接近。

【例6.6】从某社区抽取一个由200个家庭组成的样本,发现

其中有36%的家庭拥有电脑。试问,在99%的置信度下,该

社区拥有电脑的家庭所占比例的置信区间是多少?

解:若采用第一种方法,得到的置信区间为:

pZ12p(1p)/n,pZ12p(1p)/n

=O.36±2.58(0.36)(0.64)

200

=O.36±O.09

=[0.27,0.45]

若采用第二种方法,则得到置信区间:

pZ120.25/n,pZ120.25/n

=036±2.58(0.5)(0.5)

200

=O.36±O.09

=[0.27,0.45]

因此,该社区拥有电脑的家庭所占比例的置信区间是[27%,

45%]。

§5.1独立样本

§5.2匹配样本

§5.3比例之差的估计

独立样本指的是两个样本从两个总体中独立抽取,一个样本

中的元素与另一个样本中的元素相互独立。

假设有两个总体,它们均值分别为1和2,方差分别

22

为1和2,现分别从这两个总体中独立地抽取大小为n1

和n2的两个样本。

在大样本情形下,无论两个总体是否服从正态分布,

两个样本均值之差的抽样分布均服从期望为1-2,方差

22

为12的正态分布,即有:

n1n2

22

12

x1x2~Nu1u2,

n1n2

对x1x2进行标准化,则有

xxuu

Z1212~N0,1

22

12

n1n2

22

当两个总体的方差为1、2已知时,由P|Z|z121,可

构造1置信度下的u1u2的置信区间为

2222

1212

x1x2z12,x1x2z12

n1n2n1n2

22

当两个总体的方差1、2未知时,可以用两个样本方差来代

替。置信区间为:

2222

s1s2s1s2

x1x2z12,x1x2z12

n1n2n1n2

匹配样本指的是一个样本中的数据与另一个样本中的数据相

对应。

大样本条件下,使用匹配样本进行估计时,两个总体均值之

差的置信度下的置信区间为

ud121

dd

dz12,dz12

nn

其中,d表示两个匹配样本数据的差值,d表示各差值的均值,

d表示各差值的标准差。

若d未知,可用样本数据sd来代替。而如果是小样本,若两

个总体配对的观察值之差服从正态分布,则ud12的1

置信区间为

sdsd

dt12,dt12

nn

【例6.7】某机构对随机抽取的10名小学生采用A、B两套试

卷测智力,结果如表6.1所示,试建立这两套试卷平均得分

之差的95%置信区间。

解:将每位学生A套试卷的得分与B套试卷得分相差,得到差

值d列。

nn

又1d1d2

ddi4.1sddid4.41

n1

ndi1di1

查分布表可知,得到这两套试卷平均得分之

tt0.975(9)2.262

差的95%置信区间为:

4.414.41

4.12.262,4.12.2624.13.15,4.13.15[0.95,7.25]

1010

两个样本比例之差p1p2的抽样分布服从正态分布,将p1p2进

行标准化,则有

pp

Z1212~N(0,1)

(1)(1)

1122

n1n2

通常1和2是未知的,可以用样本比例p1和p2来代替。

两个总体比例之差12在1置信度下的置信区间可构建为

p1(1p1)p2(1p2)

p1p2z12

n1n2

【例6.8】H公司委托一家市场调查公司对旗下产品进行调查

,以对该公司产品在两个地区的市场占有率进行比较。调查

公司从这两个地区分别随机调查了1000人,其中使用过H公

司产品的被调查者所占的比例分别为30%和22%,试求这两个

地区H公司产品市场占有率之差的95%置信区间。

解:,=30%,=22%,

n1n21000p1p2

故=70%,=78%,

1p11p2

查表可得,==1.96。

z12z0.975

代入算式,得:

30%70%22%78%

30%22%1.96

10001000

8%1.961.95%

8%3.83%

4.17%,11.83%

从而,两个地区产品市场占有率之差的95%置信区间为

4.17%,11.83%

§6.1确定样本量的一般问题

§6.2一般问题的具体化

在1置信度下,总体均值的置信区间为xZ12,其区

n

间长度为2Z12。置信区间长度的一半称为允许误差,表

n

示在一定的置信度下,用样本均值去估计总体均值时所允许

的最大绝对误差,用符号表示。允许误差、可靠性系数

Z12、总体标准差和样本量之间存在着如下关系:

Z12

n

从而有

Z22

n12

2

影响样本量的因素主要有:

1.可靠性系数

•所需要的样本量与可靠性系数成正比关系

2.总体方差

•所需要的样本量与总体方差也成正比关系

3.允许误差

•所需要的样本量与允许误差成反比关系

§6.2.1估计总体均值

1.单个总体情形

Z22

n12

2

•若总体方差未知,则可采用经验值代替。

【例6.9】设某市家庭的月均收入服从正态分布,标准差为

l000元,现要对该市家庭的月平均收入进行估计,若置信度

为95%,允许的估计误差在100元以内,样本量应定为多少

解:

由题意,=1000元,=100元,=1-0.95=0.05,

查表得Z0.975=1.96,

代入算式,得

22

Z22

12

n=1.961000=384.16385385(人)

21002

2.两个总体情形

•对于给定的允许误差和置信度,估计两个总体均值之差所需的样

本量为:

222

Z(12)

nn12

122

22

其中,n1和n2为从两个总体中抽取的样本量,1和2为两个总体

的方差。

【例6.10】假定两个总体的标准差分别为,,

112215

若要求误差范围不超过5,相应的置信度为95%。假定n1n2

估计两个总体均值之差

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论