数据、模型与决策课件:第三章 数据总体和样本统计量的分布规律_第1页
数据、模型与决策课件:第三章 数据总体和样本统计量的分布规律_第2页
数据、模型与决策课件:第三章 数据总体和样本统计量的分布规律_第3页
数据、模型与决策课件:第三章 数据总体和样本统计量的分布规律_第4页
数据、模型与决策课件:第三章 数据总体和样本统计量的分布规律_第5页
已阅读5页,还剩95页未读, 继续免费阅读

付费下载

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

1、第三章数据总体和样本统计量的分布规律授课目的:了解数据总体和样本统计量的分布规律要求:1.掌握不同的概率分布模型 2.学会利用样本估计总体本章要点基本概念不同类型的概率分布样本参数的抽样分布规律参数估计本章要点联系图第三章要点概率分布一般规律期望值方差常用的概率分布离散型0-1分布二项分布超几何分布连续型正态分布标准正态分布样本统计量的抽样分布样本平均数的抽样分布正态分布再生定理中心极限定理t分布样本比率的抽样分布由样本估计总体点估计&区间估计第一节 概率分布一般规律概率概率随机变量取值落入某个范围是一随机事件,而描述随机事件出现可能性大小的数值,即为概率。概率以X表示一随机变量,xi表示该随

2、机变量的各种可能发生的事件(i = 1,2,k),P(X=xi)表示事件X的某一结果xi出现的概率。作为随机变量的X,可以是定标变量,也可以是定名变量或定秩变量,它们也可以按离散型和连续型进行区分(参见第一章第一节第三小节)。连续型随机变量的概率是该变量取值落入特定区间的可能性大小,连续型随机变量取单一值无意义,其概率等于零。概率分布概率分布随机变量取值xi与其相应概率P(X=xi)的对应关系。概率分布从相当大的有限总体乃至无限总体中抽取的若干个体的观察值,其出现的相对频数的理论值,就是该随机事件的概率。在这种情况下,随机变量频数分布的理论模型,就是该变量的概率分布模型。与经验数据的频数分布一

3、样,概率分布也有分布表和分布图的表述方式,但是由于它是理论分布模型,还有数学函数式的表述方式。概率分布(续)离散型随机变量的概率分布连续型随机变量的概率分布性质 0 P(X = xi) 1 =1单值概率的形式P(X = xi) 或者累计概率的形式P(Xxi)性质 f(x)0 由于连续型随机变量取值可以充满一个或一个以上区间,甚至整个实数域,所以只能列出其累计概率分布表概率分布参数:期望值离散型随机变量概率分布连续型随机变量概率分布设连续型随机变量X的取值区域为a,b E(X)= (aXb) 由于随机变量表示的是出现不同的可能结果,所以它的均值一般称为期望值。概率分布参数:方差离散型随机变量概率

4、分布连续型随机变量概率分布设连续型随机变量X的取值区域为a,b随机变量的方差就是变量与期望值差距平方和的期望值,记为V(X)或2,即例3-1某企业在30天里每日接到的定单数目如下:.例题数据例3-1.xls301440425363455425302051423313例3-1观察此数据,最小值是0,最大值是5,适宜作单值式分组。汇总结果见表3.2。表3.2 某企业每日定单数目频数分布定单数(件)天数(天)041324374656合计30例3-1 将该企业30天定单分布的频数改算成相对频数,再从相对频数转化成概率。在此基础上计算该企业定单的期望值和方差,列于表3.3。表3.3表3.3 某企业每日定

5、单数目频数分布(件)(天)040.130.008.21781.0957130.100.103.48440.3484240.130.270.75110.1001370.230.700.01780.0041460.200.801.28440.2569560.201.004.55110.9102合计301.002.872.7156第二节 从双值分布到二项分布和超几何分布0-1分布二项分布超几何分布0-1分布0-1分布又称双值分布或贝努里分布,指定名变量仅取“是”与“非”两个数值时的概率分布。以NA表示总体中“是”的数目,总体的“是”比率则为以 表示样本中“是”的数目,样本的“是”比率则为0-1分布0

6、-1分布的列表形式如下:变量值x概率P(X=x)101-合计1.00例3-210名手机持有者中有4名持的是山寨机。 以6个白球和4个红球分别代表6个非山寨机持有者和4个山寨机持有者。将球放入暗箱,再随机摸出。在游戏开始前,摸到红球的概率是0.4。此时状态系0-1分布,“是红球”和“不是红球”的概率分别为0.4和0.6。例3-2(续)从这10人中进行随机抽样,研究手机持有情况相当于从暗箱中随机摸球。每次摸出球后,无论是红球与否,都将球放回暗箱。这样使得每次摸到红球的概率都保持为0.4。连摸3次,摸到红球的个数设为变量X,X分别为0,1,2,3。则X的出现机会服从二项分布。二项分布二项分布(bin

7、omial distribution)是对服从 0-1分布的总体进行有返回抽样情况下“是”数目的概率分布。二项分布的参数是0-1分布的“是”比率和实验次数n。二项分布(续)X出现的概率可以用下式计算: (x = 0,1,2,n) 式中n和为参数,它们决定二项分布的具体形态;X为变量。 二项分布(续)二项分布的单值概率记为 ,另以 表示二项分布的累计概率。二项分布是最重要,也是最常用的离散型概率分布之一。使用EXCEL的BINOMDIST函数可以查找n和任意组合下二项分布的累计概率值及单值概率值。例3-3某空调厂家驻店代表侧重关心顾客购买本公司产品的概率。若任何一名购买空调的顾客都有30%的可能

8、性购买本公司空调,那么前来购买空调的5名顾客购买本公司品牌空调台数及其概率可以查二项分布累计概率表得到,填入表3.5。表3.5表3.55人购买本公司产品的概率分布二项分布(续)二项分布“是”次数X的期望值和方差分别是: E(X)=n V(X)=n(1-)二项分布(续)二项分布的期望值的涵义是,尽管二项变量的各种取值不等,但是进行大量的实验,二项变量的取值趋向稳定在n水平上。二项分布方差则刻画二项变量各种取值的离散程度。例如上述空调购买数量一例,其期望值是50.3=1.5,方差是50.3(10.3)=1.05,标准差是=1.02。二项分布(续) 二项分布:由“是”数目转化为“是”比率如果所关注的

9、不是n次实验中“是”的绝对次数,而是相对次数“是”比率p=X/n,则模型表述为: (x = 0,1,2,n) 二项分布(续) 二项分布比率p的期望值和方差分别是:超几何分布超几何分布(hyper-geometric distribution)是对服从0-1分布的总体进行无返回抽样情况下“是”数目的概率分布。在例3-2中,如果每次摸出球后不再放回暗箱,那么每次摸球前红球被摸到的概率就不再恒为0.4,具体是多少,当受前次摸球结果的影响。超几何分布(续)超几何分布的“是”数目的概率按下式计算:式中,N代表总体总量; n代表样本容量(实验次数); k代表总体中“是”个体数目; X代表样本中“是”个体数

10、目。超几何分布(续)超几何分布“是”次数X的期望值和方差分别是:超几何分布(续)式中k/N即是抽样开始时“是”比率。将公式3.22和3.23与公式3.16和3.17对照,发现超几何分布与二项分布的期望值完全一致,而前者的方差相当于后者方差乘以 ,它体现无返回抽样对“是”概率分布的 离散带来的影响。 称为有限校正因子。超几何分布(续)如果所关注的不是n次实验中“是”的绝对次数,而是相对次数“是”比率p=X/n,则模型表示为:超几何分布(续)超几何分布比率p的期望值和方差分别是:第三节从正态分布到标准正态分布正态分布模型及特征标准正态分布正态分布(normal distribution)是最重要的

11、连续型概率分布,是从样本数据特征推断总体数据特征方法论的认识基础。许多自然现象数据和工程数据的分布态势都呈现中央对称、峰度适当的特征,即个体数值围绕其平均数呈左右对称分布,并且与平均数距离越近出现频数越大,与平均数距离越远出现频数越少。这些数据分布的理论模型就是正态分布。正态分布模型及特征正态分布模型是:式中,X是正态变量;和分别是该正态分布的期望值和标准差;和e都是数学常数。正态分布模型及特征正态分布曲线的特征是:以期望值为对称轴左右对称。曲线下面积集中在中央部分,向两侧逐渐减少,过拐点后面积减少的速率变小,曲线两尾向两端无限延伸。正态分布曲线中央两侧面积减少的速率的快慢,或者说正态分布变量

12、的离散程度,由方差和标准差决定。正态分布模型及特征形象地说,正态分布曲线有如一口悬在地平面上方的大钟,因此可称之为钟型曲线;期望值决定钟的横向悬挂点坐标;标准差描绘钟形体的高矮胖瘦。正态分布模型及特征用N(,2)表示期望值为,标准差为的正态分布。正态变量X落入a,b区间的概率,相当于公式3.27所表达的函数在a,b两点间的定积分。正态分布模型及特征图3.1 正态曲线下的曲边梯形标准正态分布标准正态分布(standard normal distribution)是具有不同具体参数值的正态分布的归一形式。在应用中需要将各个参数不同的特定正态分布归一化,具体转换途径就是以为标准尺度去测度X变量值与的

13、差幅,即按如下公式将X值标准化:标准正态分布这相当于将原正态分布曲线的对称轴由移至0,将X在原轴上的位置用Z标出。于是各个特定的正态分布N(,2)就转换成统一的标准正态分布N(0,12),其模型是:式中Z称为标准正态单位,Z值落入一区间的概率,由区间割定的标准正态曲线下曲边梯形面积确定。标准正态分布无论原来的参数如何不同,X取值区间端点如何差异,只要Z值相同,它们的概率就相等图3.2 正态分布变量的标准化及其概率标准正态分布使用EXCEL的标准正态函数NORMSDIST可以很方便地计算出标准正态曲线下任意两Z值围定的曲边梯形面积,即两点间概率。该函数自无穷小开始累积,给出自变量Z1值,即可得到

14、P(-ZZ1)。例3-4超市出售的一种调料总体重量服从正态分布,平均重量是160克,标准差是2克。问随机抽取一包,其重量在下列区间的概率各是多少:小于155克;在160克与161克之间;在158克与162克之间;大于166克。第四节 样本平均数和比率的分布规律样本统计量抽样分布的概念平均数的抽样分布比率的抽样分布样本统计量抽样分布的概念刻画样本数据分布特征的量数均称为样本统计量,简称统计量(statistic);凡刻画总体数据分布特征的量数均称为总体参数,简称参数(parameter)。表3.6统计量和参数的对应量数统计量参数平均数方差标准差比率样本统计量与总体参数对表中公式说明如下: 统计量

15、一律用拉丁字母表示,参数一律用希腊字母表示。 样本容量用n表示,总体总量用N表示。 计算方差和标准差的公式,总体的分母是N,样本的是(n-1)。因为只有这样,统计量才是相应参数的无偏估计量。样本统计量抽样分布掌握样本统计量的分布规律,对于经济管理研究中以样本统计量推断相应的总体参数,有重要的意义。在统计学中,一个统计量的概率分布称为它的抽样分布(sampling distribution)。因而可以有平均数的抽样分布,标准差的抽样分布和比率的抽样分布,等等。平均数的抽样分布有两个定理对平均数的抽样分布的形态做了规定。根据正态分布再生定理,从正态总体中抽样,其平均数的抽样分布服从 。根据中心极限

16、定理,从任意 分布形态的总体中抽样,只要样本容量足够大,其平均数的抽样分布逼近 。平均数的抽样分布从正态总体中抽样,或者以30以上的样本容量从任意总体中抽样,样本平均数是随机变量,它服从正态分布,其期望值和方差及标准差分别由下式决定:平均数的抽样分布另外,自有限总体抽样,若样本容量大于总体总量的1/20,方差及标准差需要进行有限校正,即:平均数的抽样分布样本平均数是对总体平均数进行统计推断中的统计量,它的标准化公式是:例3-4续接续例3-4,调料总体重量服从以160克为期望值,2克为标准差的正态分布。如果自一个总量很大的总体中随机抽取一个20包的样本,其平均重量在161克以上的概率有多大?比率

17、的抽样分布比率抽样分布本来服从二项分布,该分布的期望值和方差分别由公式3.19和3.20确定。但是在大样本情况下,可以使用正态分布作近似运算。这两个公式也进一步写成:比率的抽样分布自一个参数为的无限总体中随机抽样,其样本比率p在任意两数值之间的概率,就可以使用正态分布来计算。首先把p值标准化为z值,公式是:比率抽样分布的应用首先,应用中比率问题,往往面对的是有限总体,采用大样本。若n和n (1-)都大于5,p的抽样分布就可以按正态分布来逼近。其次,只要N超过或相当于n的20倍,即 ,有限校正因子接近于1,无须对公式3.36进行有限校正。否则,需将其乘以有限校正因子 。例3-5设某市1200万人

18、口中支持汽车限号行驶规定的比率是55%。如果从其中随机抽取300人,样本中支持汽车限号行驶规定的比率超过65%的概率是多少?不足50%的概率又是多少?第五节参数估计点估计和区间估计总体平均数区间估计原理总体平均数的区间估计(大样本)总体平均数的区间估计(小样本)比率的区间估计总体总量的推断必要样本容量的确定点估计和区间估计用样本统计量的单一数值作为总体参数的估计值称为点估计(point estimation)。以点估计值为基础,以一定的可靠程度给出一个可能包含总体参数真值的区间范围,称为区间估计(interval estimation)。点估计和区间估计点估计虽有简便易行的好处,但局限性在于无

19、法了解估计的可靠程度。区间估计弥补了点估计的不足。区间估计以点估计量为中心构造了总体参数可能出现的一个范围,同时说明了这一估计结果包容总体参数的概率大小,即估计的可靠程度,我们称这种概率为置信系数(confidence coefficient)或置信水平(confidence level)。例3-61998年郑州市某销售纯净水的公司欲知道郑州市居民消费桶装纯净水的市场容量,抽取了800个居民家庭户,调查得知:这个由800户组成的样本中有66户在过去的三个月里使用了纯净水,比率为8.3%;而这66户过去三个月每户月平均用水量是3.26桶。我们可以用样本比率8.3%作为郑州市全体居民家庭户中使用纯

20、净水的户数比率的估计值,还可以用样本平均数3.26桶作为全市居民家庭户三个月每户月平均用水量的估计值,这就是点估计。例3-6(续)在本例中,以8.3%1.9%这个区间对郑州市全体居民家庭户中使用纯净水的户数比率进行估计,就是区间估计。即是说,按保守的观点郑州市全体居民家庭户中使用纯净水的户数比率估计为6.4%,按乐观的观点郑州市全体居民家庭户中使用纯净水的户数比率估计为10.2%。这样的估计方法对于公司的市场营销策略的制定,较只以参考8.3%这个单一比率更为稳妥。同样,还可以用3.260.71(桶)这个区间对郑州市全体居民家庭户中使用纯净水户均数量进行估计。总体平均数区间估计原理根据本章第三节

21、第四小节关于样本平均数抽样分布规律的阐述,以 表示在一次随机抽样中 落入距期望值 左、右距离相等的两数值之间的概率,则有:总体平均数区间估计原理式中 表示标准正态曲线下左右两尾各截掉 的Z 值, 为样本抽样分布的标准差,简称抽样标准误。此式可转写成: 这体现了对总体平均数进行区间估计的原理。总体平均数区间估计原理这种从点估计值和抽样标准误出发,按给定的概率值建立起来的估计总体参数的区间,称为置信区间(confidence interval)。这个给定的概率值 即置信水平。由此总体参数的置信区间可以表示为:总体平均数区间估计原理使用EXCEL的NORMSINV函数可以直接查取标准正态曲线下截掉左

22、尾/2的Z值,也可以换算出截掉右尾/2的Z值。使用EXCEL的CONFIDENCE函数可以直接计算总体平均数区间估计原理置信区间的两端数值称为置信限(confidential limits),具体分为置信下限(lower limit)和置信上限(upper limit)。的置信下限和置信上限分别用LCL()和UCL()表示,有:LCL()=UCL()=总体平均数区间估计原理置信区间的宽度是2 。由公式3.37知:置信水平越大,置信区间就越宽。而过宽的置信区间则在一定程度上降低了估计的准确程度。因而,在样本容量一定的前提下,我们需要在估计的可靠程度和准确程度之间掌握平衡,指定一个较为合适的置信系

23、数。总体平均数的区间估计(大样本)总体方差已知的大样本区间估计 当总体方差已知时,可以直接使用公式3.38和3.39,所求置信区间为:例3-7为估计一批袋装绵白糖的平均重量,随机抽取了50袋,测得样本平均数为502克。根据以往经验知总体标准差为15克,假设每袋白糖的重量服从正态分布。试构造这批白糖平均重量的置信区间(置信系数为95%)。总体平均数的区间估计(大样本) 总体方差未知的大样本区间估计 当总体方差 未知时,如果抽取大样本,总体方差 可由样本方差 代替,这时总体参数在置信系数为 时的置信区间为:例3-8为了解某高校学生生活费用支出情况,从该校学生中随机抽取了100名学生进行调查,得到这

24、100名学生月平均生活费用支出为630元,标准差为80元,试构造该高校学生生活费用支出95%的置信区间。总体平均数的区间估计(小样本)由小样本引出t分布 对于小样本,若其总体服从正态分布但方差未知,则样本平均数经过标准化后服从自由度为(n-1) 的 分布,即总体平均数的区间估计(小样本) t分布也是一种对称分布,它比正态分布平坦和分散。 分布的分布特征依赖于自由度 。随着自由度的增大, 分布越来越趋近于正态分布。总体平均数的区间估计(小样本)图3.6 标准正态曲线和t分布曲线使用EXCEL的TINV函数,可以直接查取自由度为(n-1)的t曲线下截掉双尾面积之和为的两侧正负t值的绝对值。总体平均

25、数的区间估计(小样本)关于小样本 分布应用,需要明确三点:总体服从正态分布小样本总体标准差未知,以样本标准差代之总体平均数的区间估计(小样本)其应用前提之一是总体服从正态分布。这只是理论上的规定,在经济管理实际问题中,只要总体偏斜状况不甚,仍然可以适用本模型。其应用前提之二是小样本,通常掌握在n30。如果n大于30,根据前面所说“随着自由度的增大, 分布越来越趋近于正态分布”的性质,就视该模型为标准正态分布。总体平均数的区间估计(小样本)其应用前提之三是总体标准差未知,以样本标准差代之。若其总体服从正态分布且方差已知,则其样本平均数经过标准化后依然服从正态分布,在置信系数为(1-) 时,置信区

26、间仍然由公式3.37决定。通常所说的“小样本”问题并不包括这种情况。总体平均数的区间估计(小样本)总体方差未知的小样本的区间估计 根据t 分布,可得在置信系数为 时总体平均数的置信区间: 式中 为自由度为 时, t分布中右侧面积为 时的 t值。例3-9从一批手机中抽取了10部,测得平均待机时间为130小时,标准差为9.42小时,假设手机的平均待机时间为正态分布,试构造该批手机待机时间95%的置信区间。比率的区间估计若 ,在置信系数(1-)下的总体比率的置信区间为:例3-10在一项新家电产品的市场调查中,随机抽选400位顾客为样本,询问他们是否喜欢此产品,其中72.1%的顾客表示喜欢该产品,试在

27、95%置信水平下,估计该产品在顾客中的受欢迎率。总体总量的推断经济管理研究中往往要在用样本统计量推断总体参数基础上,进一步对总体总量进行推算,方法是用估计值(总体平均数或总体比率)乘以总体总量(总体单位数目)。总体总量的推断所关注的总体定标变量值置信区间公式是:以上公式适用于总体方差已知情况,其他情况可以参照公式3.40和3.41变通处理。总体总量的推断所关注的总体中“是”数目置信区间公式是:例3-11对某地区一商品知悉率进行抽样调查,其置信区间是25.6%28.4%。已知该地区人口有2000万,按同样的置信水平估计,该地区知悉所关注商品的总人数最少和最多各是多少?必要样本容量的确定估计总体平

28、均数所需的样本容量在以上讨论中我们假设总体标准差是已知的。实际上,对一个尚不知其平均数为几何的总体,我们也很难给出其标准差的确切值。此时就要采取一些变通办法。必要样本容量的确定较近的历史数据类似的另一总体极差小型调查(pilot survey)必要样本容量的确定在确信时间演进对所研究事物的总体离散状况基本没有影响的情况下,可以使用距离当时较近的历史数据的 ;借用与所研究事物离散状况类似的另一总体的 ;(3)如果能够测知所研究总体的极差,可以用极差的 作为 ;先做一次小型调查(pilot survey),求出样本标准差用其替代总体标准差。上述变通方法,一般可以单独使用,为慎重起见也可以结合使用。必要样本容量的确定公式3.45适用于从无限总体中返回简单随机抽样的情况,若从有限总体抽样无返回简

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论