数理统计有关基础知识课案_第1页
数理统计有关基础知识课案_第2页
数理统计有关基础知识课案_第3页
数理统计有关基础知识课案_第4页
数理统计有关基础知识课案_第5页
已阅读5页,还剩20页未读 继续免费阅读

付费下载

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

1、第 4 章 数理统计的基础知识数理统计与概率论是两个有密切联系的学科 , 它们都以随机现 象的统计规律为研究对象 . 但在研究问题的方法上有很大区别:概率论 已知随机变量服从某分布 , 寻求分布的性质、 数字 特征、及其应用 ;数理统计 通过对实验数据的统计分析 , 寻找所服从的分 布和数字特征 , 从而推断整体的规律性 . 数理统计的核心问题 由样本推断总体从本章开始,我们将讨论另一主题:数理统计。数理统计是研究统计工作的一般原理和方法的科学, 它主要阐述 搜集、整理、分析统计数据,并据以对研究对象进行统计推断的理论 和方法,是统计学的核心和基础。本章将介绍数理统计的基本概念:总体、样本、统

2、计量与抽样分 布。由于大量随机现象必然呈现出它的规律性, 因而从理论上讲, 只 要对随机现象进行足够多次观察, 被研究的随机现象的规律性一定能 清楚地呈现出来。 但客观上只允许我们对随机现象进行次数不多的 观察试验,也就是说 , 我们获得的只是局部观察资料。数理统计就是在概率论的基础上研究怎样以有效的方式收集、 整 理和分析可获的有限的 , 带有随机性的数据资料 , 对所考察问题的 统计性规律尽可能地作出精确而可靠的推断或预测, 为采取一定的决 策和行动提供依据和建议 .4.1 总体与样本一、总体与总体分布1. 总体:具有一定的共同属性的研究对象全体。总体中每个对象 或成员称为个体。研究某批灯

3、泡的质量, 该批灯泡寿命的全体就是总体; 考察国产 轿车的质量, 所有国产轿车每公里耗油量的全体就是总体; 某高校学 习“高等数学 ”的全体一年级学生。个体与总体的关系, 即集合中元素与集合之间的关系。 统计学中 关心的不是每个个体的所有具体特性, 而是它的某一项或某几项数量 指标。某高校一年级学生 “高等数学 ”的期末考试成绩。对于选定的数量指标 X (可以是向量)而言,每个个体所取的 值是不同的,这一数量指标 X 就是一个随机变量(或向量) ;X 的概 率分布就完全描述了总体中我们所关心的这一数量指标的分布情况。 数量指标 X 的分布就称为总体的分布。定义4.1统计学中称随机变量(或向量)

4、X为总体,并把随机变量(或向量)X的分布称为 总体分布.说明1. 表示总体的X既可以是随机变量,也可以是随机向量.2. 有时个体的特性本身不是直接由数量指 标来描述的 .例如 服装厂生产的各式服装,玩具厂生产的儿童玩具,检验部 门通常将产品分成若干等级。3总体分布就是设定的表示总体的随机变量X的分布.总体的分布一般来说是未知的,统计学的主要任务正是要对总体 的未知分布进行推断。二样本与样本分布定义4.2称(Xi,X2,Xn)为总体X的简单随机样本,若Xi,X2, ,Xn是独立同 分布的随机变量,且与总体X同分布,样本中所含分量的个数n称为该样本的容量.以下假定所考虑的样本均为简单随机样本,并简

5、称为样本样本的双重理解在未观察具体的抽样结果时,样本(Xl,X2,Xn)视为随机向量.观察 具体的抽样结果后,样本便可理解为所得的一组具体的观察值(xx2,,xn),称为样本值.全体样本值组成的集合称为样本空间设总体X的分布函数为F(x),则样本(XX2,Xn)的分布函数为nF(xn x2,,xn)3U F(xi).称之为样本分布.iT若总体X为离散型随机变量,概率分布为p(x)二PX二x, x取遍X所有 可能值,则样本的概率分布为nP(Xi, X2,Xn)二 PXi 二 Xi,X2 m ,Xn = Xn八 P(X)1例41称总体X为正态总体,如它服从正态分布.正态总体是统计应用 中最常见的总

6、体.现设总体X服从正态分布NC;),则气样本密度 由下式 给出:f (Xi,nX2/,Xn) -Jl.liM1f 1胳苛 eXPQ-)2f(Xi)1 1 n珂一 2二)neXP0 l 化,)2.例4.2称总体X为伯努利总体,如它服从以p(0 ”: p”:1)为参数的伯努利 分布.即PX =1 = p, PX =0=1- p.其样本(XX2, ,Xn)的概率分布为: PXi 订公2 乜,Xn 二 inH pWP)其中ik(1 * n)取1或0,而色1也+ +in,它恰等于样本中取值为 1的分量之总数.例4.3设总体X服从参数为,的泊松分布,(X1,X2r ,Xn)为其样本, 则样本的概率分布为:

7、nPXi =h,X2 “2,,Xn 7 T PX 5 k 二.Snill! in!其中ik(1乞1 n)取非负整数,而sn=i1+i2+ +i总体、样本、样本值的关系n.-r事实上,我们抽样后得到的资料都是具体的、确定的值比如我 们从某班大学生中抽取10人测量身高,得到10个数.它们是样本 取到的值而不是样本.我们只能观察到随机变量取的值而见不到随 机变量.总体(理论分布)?样本值样本/统计是从手中已有的资料一样本值,去推断总体的情况总 体分布F(x)的性质? ? ?()样本是联系二者的桥梁、复杂总体分布决定了样本取值的概率规律,也就是样本取到样本值 的规律,因而可以由样本值去推断总体.分散匚

8、是总体的代表,含有总体的信息三统计推断问题简述借助于总体X的一个样本(Xi,X2,Xn),对总体X的未知分布进行 推断,我们把这 类问题统称为统计推断问题.为利用样本对未知的总体分布进行推断,我们需要借助样本构造 样本的适当的函数,正是利用这些函数所反映的总体分布的信息来对 总体分布所属的类型,或总体分布中所含的未知参数作出统计推断 4.2 统计量一、统计量的定义定义4.3设(Xi,X2,Xn)为总体X的一个样本,称此样本的任一 不含 总体分布未知参数的函数为该样 本的统计量.例4.4 设总体X服从正态分布,EX =5,DX -; 2,二2未知.(XX?, ,Xn)为 总体X的一个样本,令Sn

9、 =X! X2Xn,X二 S1 .n则&与X均为样本(XX2, ,XJ的统计量.但若令u二n(X -5),1则U不是该样本的统计量,因 U的表示式中含有总体分布中的位置参数二.二、常用的统计量设(X!,X2, ,Xn)为总体X的一个样本.1. 样本均值称样本的算术平均值为样本均值,记为X,即1X = (XX2Xn).n2. 样本方差样本方差是用来描述样本中诸分量与样本均值的均方差异的,它有 两种定义方式。直观的:1 n S2 二、(Xi -X)2.n iv并称S;为样本的未修正样本方差.统计学中更常用另一种定义,即2 n 21 n2S2=S行一-(X-X)2.n - 1 n - 1 y并称S2

10、为样本的修正样本方差.以后简称修正样本方差为样本方差3. 样本标准差样本标准差S定义为样本方差的算术平 方根,即4.样本原点距1 n记AkX :, k 1n i丄并称Ak为样 本的k阶原点距一阶原点矩即为样本均值5.样本中心距记Bk(Xi - X), k_1n i丄并称Bk为样本的k阶中心距.二阶中心矩即为未修正样本方差上述五种统计量可统称为样本的矩统计量,简称为样本矩他们 皆可表为样本的显式函数。6顺序统计量设(X1, X2,Xn)为总体X的一个样本将样本中的诸分量按由小 到大的次序排列成X岂X(2)乞乞X(n),则称(X,X(2),,X(n)为样本的一组 顺序统计量,称X(i)为样本的第i

11、个 顺序统计量.特别地,称 X(i)= min(Xi,X2,,Xn)与X(i)= max(Xi, X?,,Xn) 分别为样本极小值与样本极大值,并称X(n)- X为样本的极差.三、枢轴量设(XX2,,Xn)为总体X的一个样本,需推断总体分布中某一未知 参数亠构造一个样本函数U(XX2,Xn户),服从一个已知分布.仅含一个未知参数,但其分布却已知的样本函数成为枢轴量。例45设总体X : NLfO),其中匚2已知,未知,(X!,X2,,Xn)为总体X的一个样本,令-04.3常用的统计分布统计的目的就是借助从总体 X中随机抽取的样本(Xi,,Xn),构 造相应的统计量(枢轴量),通过研究它们的分布来

12、对未知的总体分 布进行推断.因此,本节将要补充统计学中经常用到的分布:2分布、F分布与t分布。一、分位数在统计推断中,经常用到统计分布的一类数字特征-分位数,在讲常用的统计分布之前,我们先给出分位数的一般概念和性质, 这对 于以后查阅常用统计分布表和解决第五章的有关参数的区间估计和 假设检验的问题都是非常有用的.1、上侧分位数定义定义4 .4 设随机变量 X的分布函数为F(x),对给定的实 数: (0 :- F: ?,(4.6)即 1 -F(F:)或 F(F) =1 :(4.7)则称F.为随机变量X的分布的水平:的上侧分位数.或直接称为 分布函数F(x)的水平的上侧分位数.2、上侧分位数的性质

13、(1) 若F(x)是严格单调递增的,则F:.二F_1(V : );(4.8) 若 X f(x),贝yf (x)dx;Fa若X - N(0,1),记水平的上侧分位数为u ,贝S1_ : o(u ),即:(u )叮-:;(4.9) PX 空 F-,(4.10)PF. X 存- : .(4.11)1 2 2对于像标准正态分布那样的对称分布(密度函数为偶函数),统 计学中还用到双侧分位数。3、双侧分位数定义定义4.5设X是对称分布的连续型随机变量,分布函数为F(x),对于给定的实数:(0一: 1),如果正实数T满足 P X T. = : , (4.12) 即F(TJ-FC).(4.13)则称T为随机变

14、量X的分布的水平:的双侧分位数,也简称位分位数, 或直接称为分布函数F(x)的水平的分位数.4、双侧分位数的性质由X分布的对称性容易知道以下关系式成立:(1)a、f(tj-2,或aPX T-F(T-(4.14)T = F(4.15)FF11 -?(4.16)5、上侧分位数和双侧分位数的例题例4.6设X : N(0,1),求水平:=0.05的上侧分位数和双侧分位数解:由于 P X uo.o5 = 0.05,所以 o(Uo.o5)= 1-0.05= 0.95,查表可得U0.05 = *1.645.而水平0.05的双侧分位数为u0.025,它满足 o(uo.o25) = 1-0.025= 0.975

15、,查表得 U0.025 = 1.96.一 7.、2分布1、2分布的定义(4.18)定义4.6如果随机变量X的密度函数为1 n丄f(x)二x2 e2 2飞)其中-(a) 一 xaedx (a 0)是】函数,称X服从 n个自由度的2分布,记作X2(n).对定义4.6的几点说明】(1)=三;-(a)二(a-1)!(当a是正整数时)2n12n -1 2n-31-()(二)(当n2 时)2 2 2 2(2) 2(2)是,1的指数分布.(3) 2(n)(n 一 3)的密度函数为单峰曲线,从原点开始递增,在x = n - 2处取得最大值,然后递减,渐进于x轴,关于x = n - 2不对称.(4) 2(1)的

16、密度函数在x=0处取无穷大,以y轴为垂直渐进线2、2分布的典型模式命题4.1设X1,X2/ , Xn是n个相互独立的随机变量,且Xi - N(0,1), i =1,2/ ,n,则X 二 X 池X;服从 2(n)分布.3、2分布关于自由度的可加性命题4.2 (1若X 2 z2(m), W乳2(n),且X与Y相互独立,则X Y、2(m n).(2) 若 X、2(n),则 EX 二 n, DX 二 2n.证明设X1,X2/ ,Xm.n独立、服从标准正态分布(1)由于X2(m),根据定义4.6与命题4.1, X与X; 比 X;同分布,丫与X;1 X;厂X; n同分步,再由X与丫独立知,X Y与X; X

17、|X;.n同分布,所以X 丫 2(m n).(2)设 Xi, X2 , Xn 相互独立且均服从标准正态分布,由X 2(n)知X与X; x2X2同分布,nnn于是EX 二 E X2 二 EX:DXj 二 n.ii =1V此外,由于EXj4 =3(见习题四(B)的第四题),便知DXj2 = EXi4(EXi2)2 =3 1 = 2.再因X1,X2,Xn相互独立,即得nnDX 二 D xj 八 DXj 二 2n.Vid上述命题 中第一个结论实际上说明2分布同正态分布一样具有可加性.4、2分布的计算由于2分布是常用的统计分布,但又难于利用其密度函数2(x, n)进行直接计算,通常也为其制定了统计用表.

18、附表3中对自由度n 45的2分布给出了水平的上侧分位数 2(n)之值.当X 2(n)时,由(4.6)与(4.10)两式可以得到PX 2(n)二 PX ;二(n)因为2(x;n)不是对称函数,故对2分布而言,不存在双侧分位数, 但在以后统计推断中,将用到等式P(X :二(n)_ X 2.(n),2 2或 P n) X 2(n) =1I 22例如,设X : 2(10)取水平:-0.05查表可知PX 3.940F PX 18.3070.05, P3.247辽 X 20.483 0.95. 当自由度n充分大(如n 43时,2分布可近似地看作正态分布于是由 正态分布的分位数可近似地求得2分布的分位数三、

19、F分布1、F分布的定义定义4.7如果随机变量X的密度函数为1 / m - (m n) (1 X)2 nm1m 書f (x; m, n)( )( x)2B(m n、n n B(2,2)1其中 B(p,q) = Joxp,(1 x)2dx服从第一自由度为(4.20)(p 0,q 0)是B(贝塔)函数,称Xm,第二自由度为n的F分布,记作X -F(m,n).对定义4.7的说明F分布的密度函数曲线也为单峰曲线,当第一自由度 m3时, 曲线在只=匹:旦处达最大值.显见x* : 1,即图形的峰值恒在m n + 2小于1处取到.此外,不难看出,当两个自由度 m与n都变得越来越 大时,x*接近1,从而函数曲线

20、就在非常接近1的地方达到最高点. 图4.5给出了若干F分布的密度函数曲线.2、F分布的典型模式命题4.3设X :2(m), Y :2(n),且X与Y相互独立,记Z X m _ nXYn mY则Z的密度函数为(4.20),因此Z - F(m, n).由命题4.3不难看出,若 X F(m,n),则X v F(n,m).3、F分布的计算P(X F (m,n) 一 X F (m,n)八1-2 2或 PF . (m, n) X F. (m,n) 1-1-22例子:(1)对于较小的:,可以直接由附表4查出 F分布的上侧分位数.设X F (5,10),查表4知PX 3.33 = 0.05, PX 4.24

21、= 0.025.又设丫 - F(10,5),查表4知PY 4.74 = 0.05, PY 6.62 = 0.025.(2) 当接近于1时,可以利用下式求出所需的上侧分位数1F. (m,n).件21)F“(n,m)F0.95 (m, n)=1Fo.o5(n,m)F0.975(m, n)=1F0.025(n, m)这样,当X - F(5,10)时,查表可知PX = 0.05, P X 乞 4.24 = 0.95.4.746.62四、t分布1、t分布的定义定义4.8如果随机变量X的密度函数为(4.23)1 1x2t(x;n)=厂n (1 )B(1,门)厶n2 2记作X t(n).称X服从自由度为n的

22、t分布,对定义4.8的说明(1) t分布的密度函数曲线也为单峰曲线,但关于y轴对称,在x二0处取到最大值.x轴为其水平渐近线.图4.6给出了自由度 n =1,5,10,:时t分布的密度函数曲线.(2)当自由度n很大时,t分布也接近于标准正态分布,这是因为2n 11 2xlim(1) 2 = e 2 .xn二时的t分布的密度函数曲线,即为标准正态分布的密度函数 曲线,但比标准正态分布的尾部有更大的概率.2、t分布的典型模式命题4.4设X : N(0,,), Y2(n),且X与Y相互独立,记T丄n则T的密度函数为(4.23),因此T t(n).由命题4.4不难看出,若X F(1,n),贝U X -

23、t(n).3、t分布的计算附表5对于一些充分小的值给出了 t分布的水平:的上侧分位数 t (n)之值.由于t分布具有对称的密度函数,当:接近1时,可按下式 求出相应的上侧分位数:t/n(n).(4.24)因此,如X : t(n),由(4.6),(4.10)与上式得:PX t(n)二 PX :t (n).再由于t分布具有对称的密度函数,具有双侧 分位数,由(4.12)与(4.15)知 P X t一 (n)./2例如,设X : t(8),取水平 0.05,查表可知t (8) =1.860,t- (8) =2.306,故有/ 2PX 1.860 = PX : 1.860 = P X 2.306 =

24、0.05.此外,由于自由度n充分大时,t分布近似于标准正态分布,故有 t:.(n) u.,其中u .为标准正态分布的上侧分位数. 4.4 抽样分布总体的分布是未知的,或是部分未知的.对总体的分布进行的统 计推断称为非参数统计推断;对总体未知的重要数字特征(如总体数 学期望、总体方差)或总体分布中所含的未知参数进行统计推断.这类问题称为参数统计推断.在参数统计推断问题中,经常需要利用总 体的样本构造出合适的统计量(或枢轴量),并使其服从或渐近服从 已知的确定分布。统计学中泛称统计量(或枢轴量)的分布为抽样分布.讨论抽样分布的途径有两个:一是精确地求出抽样分布,并称相应地统计推断 为小样本统计推断

25、;另一种方式是让样本容量趋于无穷, 并求出抽样 分布地极限分布;然后,在样本容量充分大时,可利用该极限分布作 为抽样分布地近似分布,再对未知参数进行统计推断,因此称相应的 统计推断为大样本统计推断.本节重点讲述正态总体的抽样分布。一、正态总体的抽样分布上节讲述的三种常用的统计分布(2分布、F分布和t分布)为讨论正态总体的抽样分布作了必要的准备 .不过,在一般地讨论正态分布的抽 样分布以前,我们还需要正态总体抽样分布的一个基础性定理,那就是涉 及正态总体样本均值与样本方差的抽 样分布的定理.定理4.1设总体X N(T2), (XXi,Xn)是其容量为n的一个样本,X与S2分别为此样本的样本均值与

26、样本方 差,则有(1)X N();nn_1_22,八2 S(n-1);CTX与S2相互独立.证明 结论(1)可以由一个重要性质(一组相互独立服从正态分布的随机变量的非零线性组合仍然服从正态分布)得到.讨论(2)与(3)的严格证明需要用到关于多重积分的变量替换公式, 此外还要利用正交矩阵的一些性质,数学推导的技巧性很强,故 此处省略,有兴趣的同学可以参考附录42有了上述关于正态总体的样本均值与样本方差的抽样分布的基础性定理,再结合上一节中的常用统计分布, 就可以容易地构造单正态总体与双正态总体中样本的一些统计量 (枢轴量)并使之服从确定的已知分布。二2)的样本,1、单正态总体的抽样分布定理4.

27、2设(XX2, ,Xn)为正态总体X - N(XX与S2分别为该样本的样本均值与样本方 差,则X-卩(“U 二十N(0,1);(2) n J S22(n-1);aX- 4t(n-1).(3)T 二n证明 结论(1)是定理4.1(1)的直接推论.结论(2)已经由定理4.1的(2)给出,再因为(1)( 2)且由定理4.1知U与S2相互独立,故由本定理的结论CT与命题4.4知T、t(n-1).2、双正态总体的抽样分布在统计学的应用中,有时要比较两个正态总体的参数,下述定理 为比较两个正态总体的参数提供了合适的统计量(或枢轴量)。定理4.3设X、N(r, + )与Y、;)是两个相互独立的正 态总体.又设(X1,X2/ ,Xn)为总体X的容量为n1的样本,X与S2分 别为该样本的样本均值与样

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论