版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
1、概率统计复习第一节随机事件与概率一、随机事件及其运算1、随机试验与随机事件2、随机事件之间的关系及其运算事件的包含与相等,事件的和(并),事件的积(交),事件的差,互不相容事件,对立事件二、古典概型及概率1、古典概型及概率 三、加法公式与乘法公式1. 概率的加法公式: 2. 概率的乘法公式 条件概率: 乘法公式: 全概率公式: 贝叶斯公式:四、事件的独立性 事件的独立性: 贝努利概型(独立试验概型):例题选讲:例1甲,乙,丙三人各射一次靶,记“甲中靶” “乙中靶” “丙中靶” 则可用上述三个事件的运算来分别表示下列各事件: (1) “甲未中靶”: (2) “甲中靶而乙未中靶”: (3) “三人
2、中只有丙未中靶”: (4) “三人中恰好有一人中靶”: (5)“ 三人中至少有一人中靶”: (6)“三人中至少有一人未中靶”: 或(7)“三人中恰有兩人中靶”: (8)“三人中至少兩人中靶”: (9)“三人均未中靶”: (10)“三人中至多一人中靶”: (11)“三人中至多兩人中靶”: 或例2 , 求 (1) ; (2) ; (3) ; (4) .解(1)因为 且与是不相容的, 故有于是(2) (3) (4) 例3一个袋子中装有10个大小相同的球, 其中3个黑球, 7个白球, 求(1) 从袋子中任取一球, 这个球是黑球的概率;(2) 从袋子中任取两球, 刚好一个白球一个黑球的概率以及两个球全是
3、黑球的概率.解(1)10个球中任取一个, 共有种. 从而根据古典概率计算, 事件:“取到的球为黑球”的概率为(2)10球中任取两球的取法有种, 其中刚好一个白球, 一个黑球的取法有种取法, 两个球均是黑球的取法有种, 记为事件“刚好取到一个白球一个黑球”, 为事件“两个球均为黑球”, 则例4一个袋中装有10个球,其中3个黑球,7个白球,每次从中随意取出一球,取后放回.(1)如果共取10次,求10次中能取到黑球的概率及10次中恰好取到3次黑球的概率.(2)如果未取到黑球就一直去下去,直到取到黑球为止,求恰好要取3次的概率及至少取3次的概率.解记为事件 “第次取到的是黑球”, 则(1) 记为事件
4、“10次中能取到黑球”, 为事件 “10次中恰好取到次黑球” 则有(2) 记为“恰好要取 3 次”,为“至少要取 3 次”,则 例5袋中装有10个球, 其中3个黑球、7个白球,从中先后随意各取一球(不放回),求第二次取到的是黑球的概率.解这一概率, 我们前面在古典概型中已计算过, 这里我们用一种新的方法来计算. 将事件 “第二次取到的是黑球” 根据第一次取球的情况分解成两个互不相容的部分, 分别计算其概率, 再求和. 记为事件 “第一、二次取到的是黑球”, 则有由题设易知于是例6一袋中有10个球, 其中3个黑球, 7个白球, 从中先后随意各取一球 (不放回),假设已知二次取到的球为黑球, 求
5、“第一次取到的也是黑球” 的概率.解设 “第一次取到的是黑球” 这一事件为 “第二次取到的是黑球”这一事件为则问题归结为求条件概率 根据贝叶斯公式, 有据题涉及例7的结果易知从而 例7设某批产品中, 甲, 乙, 丙三厂生产的产品分别占45%, 35%, 20%, 各厂的产品的次品率分别为4%, 2%, 5%, 现从中任取一件,(1) 求取到的是次品的概率;(2) 经检验发现取到的产品为次品, 求该产品是甲厂生产的概率.解记事件“该产品是次品”, 事件“该产品为乙厂生产的”, 事件“该产品为丙厂生产的”, 事件“该产品是次品”. 由题设, 知(1)由全概率公式得(2)由贝叶斯公式(或条件概率定义
6、), 得 第二节随机变量及分布一、离散型随机变量及其分布1离散型随机变量的概率分布:2. 几个常用的离散型概率分布 二点分布(“01”分布)如果随机应量的分布列为表5310pq其中,则称服从以为参数的二点分布,记作B(1、p)。二项分布若离散型随机变量的分布列为(5-16)则称服从参数为n,p的二项分布)(n次独立试验概型),记作B(n,p)泊松分布如果离散型随机变量的发布为(5-17)则称服从以为参数的泊松分布,记作P()当如果趋一个常数,则有即当很大时可用泊松分布来近似计算服从二项分布的的概率,其误差不大。3. 离散型随机变量的分布函数定义5.8 设是一个随机变量,称函数 ()(5-18)
7、为随机变量的分布函数,记作或。利用概率的性质可以证明,分布函数具有以下性质:1 是一个非减的函数。 即若 ,则; 2 ,在任意一点处都右连续,即。另外,还有如下公式 若离散型随机变量的分布列为表56根据定义5.8它的分布函数为简写为这里的和式是对于小于的一切对应的概率和。三、连续型随机变量及其分布1. 概率密度函数定义5.9 设为连续型随机变量,如果存在非负函数,使在任一区间,内取值的概率都有(5-19)就叫做的概率密度函数(简称为密度函数)。记为。概率密度函数需满足以下条件: 即密度函数是非负的; 显然,对于连续随机变量,但时有故 2. 连续型随机变量的分布函数根据定义5.9对于连续型随机变
8、量,其分布函数为,则且但在处连续时。3几个常见的连续型随机变量的分布函数1均匀分布如果连续型随机变量的概率密度函数为称服从区间上的均匀分布,记为均匀分布的分布函数(5-21)2正态分布如果连续型随机变量的密度函数为(5-22)其中为任意实数,则称服从以,为参数的正态分布,记作。图5-13由图513可见,曲线具有下列特点: 曲线位于轴的上方,且以轴为水平渐近线。 曲线关于参数对称 当时,达到最大值 曲线与轴转成的面积为1。 曲线在处有拐点,拐点坐标为,参数决定正态曲线所在的位置,如图5-14所示。图5-14 图5-15参数决定正态曲线的扁平,小图像狭高,大图像扁平,如图5-15所示。正态分布函数
9、服从正态分布的随机变量的分布函数为(5-23)当,时,则称随机变量服从标准正态分布,记为,其密度函数和分布函数分别为 见图5-16图5-16 图5-17由标准正态分布的密度函数可知曲线关于轴对称且对称区间概率相等。即:如图5-17所示定理 设则标准正态分布表的使用:(1)表中给出了时的数值, 当时, 利用正态分布的对称性, 易见有(2) 若则(3)若, 则 故的分布函数例题选讲:例1 设随机变量X具有概率密度解(1) 由 得解得于是的概率密度为(2) 的分布函数为(3) 或例2某元件的寿命服从指数分布, 已知其参数,求3个这样的元件使用1000小时, 至少已有一个损坏的概率.解由题设知, 的分
10、布函数为由此得到各元件的寿命是否超过1000小时是独立的, 用表示三个元件中使用1000小时损坏的元件数, 则所求概率为例3 设某项竞赛成绩(65, 100),若按参赛人数的10%发奖,问获奖分数线应定为多少?解设获奖分数线为 则求使成立的即 查表得 解得 故分数线可定为78分.例4 某人进行射击, 设每次射击的命中率为0.02, 独立射击400次, 试求至少击中两次的概率.解将一次射击看成是一次试验. 设击中的次数为, 则的分布律为 于是所求概率为例5设, 求的概率密度.解设的分布函数为 则于是的密度函数注意到时,即时,且故例6设随机变量的分布函数为求的概率分布.解由于是一个阶梯型函数, 故
11、知是一个离散型随机变量, 的跳跃点分别为1, 2, 3, 对应的跳跃度分别为 9/19, 6/19, 4/19, 如图.故X的概率分布为第三节 多维随机变量及其分布一、 二维随机变量定义1 设随机试验的样本空间为, 为样本点,而是定义在上的两个随机变量, 称为定义在上的二维随机变量或二维随机向量. 二、 二维随机变量的分布函数定义2 设是二维随机变量, 对任意实数, 二元函数称为二维随机变量的分布函数或称为随机变量和的联合分布函数.三、 二维离散型随机变量及其概率分布定义3 若二维随机变量只取有限个或可数个值, 则称为二维离散型随机变量. 若二维离散型随机变量所有可能的取值为 则称为二维离散型
12、随机变量的概率分布(分布律), 或的联合概率分布(分布律).四、二维连续型随机变量及其概率密度定义 设为二维随机变量,为其分布函数, 若存在一个非负可积的二元函数, 使对任意实数, 有则称为二维连续型随机变量, 并称为的概率密度(密度函数), 或的联合概率密度(联合密度函数).概率密度函数的性质: (3) 设是平面上的区域,点落入内的概率为五、 随机变量的独立性定义1 设随机变量的联合分布函数为, 边缘分布函数为, 若对任意实数,有即 则称随机变量和相互独立.定理1 对离散型随机变量, 其独立性的定义等价于:若对的所有可能取值 有即 则称和相互独立.定理2 对二维连续型随机变量, 其独立性的定
13、义等价于:若对任意的, 有几乎处处成立, 则称相互独立.例题选讲:例1设的概率密度是求 (1) 的值; (2) 两个边缘密度.解(1) 由确定 (2) 即 例2 设随机变量X与Y相互独立, 下表列出了二维随机变量联合分布律及关于X和关于Y的边缘分布律中的部分数值, 试将其余数值填入表中的空白处. Y X 1/81/81/61解由于 考虑到与相互独立, 有所以同理, 可以导出其它数值, 最后将所求数值填入表中. Y X 1/241/81/121/41/83/81/43/41/61/21/31例3设随机变量的概率密度为(1) 求与的边缘密度, 并判断与是否相互独立;(2 求概率.解(1) 当时,当
14、时,所以类似可得由于当时, , 故与不相互独立.(2)第四节随机变量的数字特征一、随机变量的数学期望及其性质1. 离散型随机变量的数学期望定义5.10 设离散型随机变量的分布列为下表59:表5-9则称 为的数学期望(或均值)记为2连续型随机变量的数学期望定义5.11 如果连续型随机变量的概率密度函数为,则称 称为的数学期望。3数学期望的性质随机变量的数学期望有下列性质: 常数的数学期望等于该常数,即(5-26) 常数与随机变量乘积的数学期望等于该常数与随机变量数学期望的积,即(5-27) 两个随机变量和的数学期望等于它们的数学期望的和,即(5-28) 两个相互独立的随机变量乘积的数学期望等于它
15、们的数学期望的乘积,即(5-29)二、随机变量的方差及性质定义5.12 设 是一个随机变量,称为的方差。称为随机变量的标准差或均方差,记作,即如果是离散型随机变量且分布列为,则(5-30)果是连续型随机变量,且概率密度函数为,则(5-31)由定义可见,方差是随机变量所取之值与的距离平方的平均值。因此,方差小说明随机变量所取的值比较集中,方差大说明随机变量所取之值比较分散。随机变量的方差具有以下性质 常数的方差等于零(5-32) 常数与随机变量乘积的方差等于该常数的平方与随机变量方差的乘积,即(5-33) 两个相互独立的随机变量之和的方差等于这两个随机变量方差的和,即(5-34)(证明略)方差的
16、常用公式(5-35)为了使用方便,我们把常用的随机变量的概率分布及其数字特征列表如下:名 称概 率 分 布参 数 范 围均值方差两点分布二项分布泊松分布均匀分布指数分布 正态分布标准正态分布01三、协方差与相关系数1、 协方差的定义定义 设为二维随机向量,若存在, 则称其为随机变量和的协方差, 记为,即 利用数学期望的性质, 易将协方差的计算化简.特别地, 当与独立时, 有 2、相关系数的定义与性质定义 设为二维随机变量,称为随机变量和的相关系数.有时也记为. 特别地,当时,称与不相关.例题选讲: 例1 已知离散型随机向量的概率分布为 Y X 0200.10.2010.30.050.120.1
17、500.1求.解容易求得的概率分布为的概率分布为于是有计算得于是例2设连续型随机变量的密度函数为 求和.解由的密度函数可求得其边缘密度函数分别为: 于是从而又所以故例3 设随机变量服从几何分布, 概率函数其中, 求.解设故第五节 统计推断一、基本概念1总体、样本与统计量在数理统计中把研究对象的全体称为总体(或母体),而组成总体的每一个元素称为个体。由总体中随机抽取的个体组成的集合称为一个样本,样本中所含个体的数目称为样本容量。要求样本具有: 必须是随机抽样,而且每一个个体被抽到的机会均等; 每次抽取的样本是相互独立的,并具有相同的概率分布。满足以上两条的样本称为简单随机样本。为较好的推断(估计
18、)总体的某特性,对随机抽取的样本要进行“加工”和“提炼”,把我们所关心的信息集中起来,针对不同问题构造出不含未知参数的样本的某种函数。这种函数在统计中称为统计量,显然也是随机变量。常用统计量:样本均值(5-36)样本修正方差 (5-37)样本标准差(5-38)样本均值的分布设,是的样本,则 或 2常用统计分布(1)分布定义1 设是取自总体的样本, 则称统计量 (1)服从自由度为n的分布,记为这里, 自由度是指(1)式右端所包含的独立变量的个数.定义2设,对给定的实数 称满足条件的点为分布的水平的上侧分位数. 简称为上侧分位数.(2)t分布定义3 设,且X与Y相互独立,则称服从自由度为n的t分布
19、, 记为.定义4设,对给定的实数 称满足条件的点为分布的水平的上侧分位数. 由密度函数的对称性,可得 (3)F分布定义5 设且X与Y相互独立, 则称服从自由度为的F分布, 记为定义6设,对给定的实数称满足条件的点为分布的水平的上侧分位数.F分布的一个重要性质:此式常常用来求F分布表中没有列出的某些上侧分位数.3. 抽样分布单正态总体的抽样分布设总体X的均值,方差为,是取自X的一个样本,与分别为该样本的样本均值与样本方差, 则有 而 故有下列定理:定理1 设总体 是取自X的一个样本, 与分别为该样本的样本均值与样本方差, 则有(1) ;(2) 定理2 设总体 是取自X的一个样本, 与分别为该样本
20、的样本均值与样本方差, 则有 (1) = (2) 与相互独立. 定理3 设总体是取自X的一个样本, 与分别为该样本的样本均值与样本方差, 则有(1) (2) 二、参数估计参数估计就是用样本的统计量估计总体参数,我们称它为估计量,其具体值称为估计值。参数估计通常分为点估计和区间估计两种1. 评价估计量的优良性准则因为样本的统计量是随机变量,所以估计量也是是随机变量。对于不同的样本它会得到不同的估计量,那么怎样评判哪一个估计量更好呢?标准通常采用以下三个准则: 无偏性 若估计量的数学期望等于未知参数的真值,即,则称是的无偏估计。 有效性 若与都是的无偏估计量,而的方差小于的方差,即,则称较是的有效
21、估计量。2. 点估计从总体中抽取一个样本,用这组样本观测值来估计总体参数的值,这种估计方法称为参数的点估计(也称定值估计)。用点估计法来估计总体的参数方法简单,但由于样本的随机性,估计值会因样本的不同而不同,甚至会有很大的差异。(1)矩估计法用相应的样本矩去估计总体矩的方法就称为矩估计法. 用矩估计法确定的估计量称为矩估计量. 相应的估计值称为据估计值. 矩估计量与矩估计值统称为矩估计.求矩估计的方法:设总体的分布函数中含有k个未知参数, 则(1) 求总体的前k阶矩,一般都是这k个未知参数的函数, 记为 (*)(2) 从(*)中解得 (3) 再用的估计量分别代替上式中的,即可得的矩估计量:(2
22、)极大似然估计法定义 若对任意给定的样本值, 存在,使 则称为的极大似然估计值.称相应的统计量为极大似然估计量. 它们统称为的极大似然估计(MLE).求最大似然估计的一般方法求未知参数的最大似然估计问题, 归结为求似然函数的最大值点的问题. 当似然函数关于未知参数可微时, 可利用微分学中求最大值的方法求之. 其主要步骤:(1) 写出似然函数;(2) 令或, 求出驻点;注: 因函数是L的单调增加函数,且函数与函数有相同的极值点,故常转化为求函数的最大值点较方便.(3) 判断并求出最大值点, 在最大值点的表达式中, 用样本值代入就得参数的最大似然估计值.注:(i) 当似然函数关于未知参数不可微时,
23、只能按最大似然估计法的基本思想求出最大值点。(ii) 上述方法易推广至多个未知参数的情形.例题选讲:例1设总体X的概率密度为其中是未知参数,是取自X的样本, 求参数的矩估计.解数学期望是一阶原点矩其样本矩为 而 即为的矩估计.例2设总体X服从指数分布, 其概率密度函数其中, 是未知参数. 是来自总体X的样本观察值, 求参数的最大似然估计值.解似然函数显然的最大值点一定是的最大值点, 对其取对数由, 可得参数的最大似然估计值3. 区间估计设是总体分布中的未知参数,是取自总体的样本,构造两个统计量和,使得包含未知参数区间的概率为,即(5-41)这样的估计方法称为区间估计。区间叫置信区间,及分别叫置
24、信区间的上下限,如图5-22所示。叫置信系数,也叫置信概率或置信度,而是事先给定的一个小正数,它是指参数估计不准确的概率,通常取值0.01,0.05,0.10等。(5-9)式的意义是反复抽样多次(每次样本容量都相等),每组样本观测值确定一个区间,在这样多的区间中,包含真值的约占,不包含真值的仅占左右。图5-22区间估计较点估计的优点:既反映了估计结果的精确度又表明了这个估计结果的可靠程度。 正态总体均值区间估计 已知方差,求均值的置信区间。设总体,为的一个随机样本,可选用变量求参数的置信区间。由正态分布表可知,对给定的,存在一个临界值,使即 或 这时参数的置信区间为,(5-42)例如时,查正态
25、分布表可得于是有上式表明包含在区间,内的概率为0.95。例5 从生产的一批灯管中,抽了十支进行寿命试验,得数据如下(单位:小时):1300 1210 1050 1260 10401200 1120 1120 1080 1130 估计灯管的平均使用寿命; 灯管寿命服从正态分布,试求平均寿命的置信区间。解 由于已知,求的置信区间,可使用变量,查正态分布表可得而, 根据(5-10)式可得所求的灯管平均使用寿命均值的置信区间(1149.05, 1152.95),置信度为95%. 未知,求均值的置信区间。由于未知,在变量中既含有待估参数外,还含有未知参数,因此不能用变量,但是的良好估计量,故可用代替中的
26、,这就是前面所讲的变量,因此在未知时,估计参数的置信区间可选用变量。对给定的置信度,存在一个临界值使即由分布表,对给定的及自由度出临界值,解出的置信区间,得于是参数的置信度为的置信区间,(5-43)其中例6一家保险公司想要估计在过去的一年里投保人的平均理赔额。随机地选取了36个投保人作为一个随机样本,观测样本均值是元,观测样本标准离差是元。试求以99%的置信度估计去年一年里投保人平均理赔额。解 由题知: , , 置信水平为99%,则,自由度为,查分布表求临界值 代入(7-11)式得,=所以去年一年里投保人平均理赔额为置信度为99%的置信区间为.第六节 单正态总体的假设检验一、总体均值的假设检验
27、 当检验关于总体均值(数学期望)的假设时,该总体中的另一个参数,即方差是否已知,会影响到对于检验统计量的选择,故下面分两种情形进行讨论.1方差已知情形 设总体,其中总体方差已知,是取自总体X的一个样本, 为样本均值.1)检验假设.其中为已知常数.由第五章第三节知, 当为真时,故选取作为检验统计量, 记其观察值为u. 相应的检验法称为u检验法.因为是的无偏估计量, 当成立时, 不应太大, 当成立时, 有偏大的趋势, 故拒绝域形式为 (待定).对于给定的显著性水平,查标准正态分布表得, 使由此即得拒绝域为.即 根据一次抽样后得到的样本观察值计算出U的观察值u, 若, 则拒绝原假设, 即认为总体均值
28、与有显著差异; 若, 则接受原假设, 即认为总体均值与无显著差异.类似地,对单侧检验有:(i) 右侧检验:检验假设,其中为已知常数. 可得拒绝域为(ii) 左侧检验:检验假设 ,其中为已知常数.可得拒绝域为2方差未知情形设总体,其中总体方差未知,是取自X的一个样本, 与分别为样本均值与样本方差.1)检验假设.其中为已知常数.由第五章第三节知, 当为真时, 故选取T作为检验统计量, 记其观察值为t. 相应的检验法称为t检验法.由于是的无偏估计量, 是的无偏估计量, 当成立时, 不应太大, 当成立时, 有偏大的趋势, 故拒绝域形式为 (待定).对于给定的显著性水平, 查分布表得 使由此即得拒绝域为
29、.即 根据一次抽样后得到的样本观察值计算出T的观察值t, 若 则拒绝原假设, 即认为总体均值与有显著差异; 若则接受原假设, 即认为总体均值与无显著差异.类似地,对单侧检验有:(i) 右侧检验:检验假设,其中为已知常数. 可得拒绝域为(ii) 左侧检验:检验假设, 其中为已知常数. 可得拒绝域为二、总体方差的假设检验设,是取自X的一个样本, 与分别为样本均值与样本方差.1)检验假设 .其中为已知常数.由第五章第三节知, 当为真时,故选取作为检验统计量. 相应的检验法称为检验法.由于是的无偏估计量, 当成立时, 应在附近, 当成立时, 有偏小或偏大的趋势, 故拒绝域形式为或 (待定).对于给定的显著性水平查分布表得使.由此即得拒绝域为或.即 根据一次抽样后得到的样本观察值计算出的观察值, 若, 则拒绝原假设,
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
评论
0/150
提交评论