统计学(中篇共上中下3篇)_第1页
统计学(中篇共上中下3篇)_第2页
统计学(中篇共上中下3篇)_第3页
统计学(中篇共上中下3篇)_第4页
统计学(中篇共上中下3篇)_第5页
已阅读5页,还剩327页未读, 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

统计学推断统计导论Statisticalbasis第五章5第一节

事件与事件的概率第二节

几种重要的随机变量概率分布第三节

抽样分布与中心极限定理第四节

三个重要分布掌握概率、概率相关概念,掌握离散型随机变量的0-1分布、二项分布与连续型随机变量的正态分布;掌握统计量的概念,理解样本均值的抽样分布与中心极限定理;掌握在正态分布基础上推导的三个重要分布(χ2分布、t分布、F分布)的特征及应用范围。能够利用Excel计算正态分布、χ2分布、t分布、F分布等的概率与分位数;能够运用样本均值的抽样分布与中心极限定理计算样本抽样分布的均值与标准差。

学习目标学习目标结合案例,理解中国社会发展走向强大的必然性。融合中国传统文化,充分理解正态分布中蕴含的多层次意义。

素养目标思维导图思维导图背景启题

一个国家、一个民族走什么道路、选择哪一种社会制度和体制模式去发展自己,并不是由哪一些人、哪一个政治团体依其主观意愿决定的,而是主要取决于这个国家、这个民族的生产力发展水平、经济基础、阶级阶层构成,以及历史文化特征、社会综合背景、内外联系交流等。也就是说,一个国家、一个民族走什么道路,具有客观性、必然性。

中国走中国特色社会主义道路的历史必然性,由一系列历史必然构成,是一系列历史必然叠加的必然。在1840年西方列强的炮声彻底击碎清朝的安宁和“天朝上国”的美梦后,中国向何处去、中国走什么道路、中国怎样救亡自强,就成为中国人不得不面对的现实课题和严峻考验。由此肇始,一代又一代仁人志士抛头颅洒热血、奔走呼号,中国人开始了“寻路”的艰难历程。

背景启题

从统计学的角度来说,在同一组条件下,每次可能出现也可能不出现的事件称为随机事件,一定会出现的事件称为必然事件。每一个阶段都有可能出现重要事件推动历史的齿轮向前转动。虎门销烟被认为是第一次鸦片战争的导火索,在第一次工业革命和中国封建社会长期延续的条件下,虎门销烟可能发生也可能不发生,而落后的封建社会不可避免地卷入西方国家主导的世界经济体系和全球文明中是当时历史发展的必然。同样,在中国近现代发展的各个重要阶段,导火索事件是有可能出现也有可能不出现的,具有一定的偶然性,也就是随机事件,而每一阶段中国的发展方向却是在当时条件下的必然事件。这样几个阶段依次衔接,构成一个带有客观指向的基本进程,清晰地昭示出蕴藏于“寻路人”不懈努力背后的“历史必然”,明确地告诉人们中国特色社会主义道路多么来之不易。

正如习近平总书记所说,中国特色社会主义,承载着几代中国共产党人的理想和探索,寄托着无数仁人志士的夙愿和期盼,凝聚着亿万人民的奋斗和牺牲,是近代以来中国社会发展的必然选择,是发展中国、稳定中国的必由之路。

请思考:

从统计学的角度来说,生活中有哪些能体现偶然性与必然性的事件呢?【讨论主题】

结合“历史发展的偶然性与必然性”,分析随机事件与必然事件的辩证关系,以及概率在现实决策中的作用。【讨论方向】1.生活中哪些“偶然事件”背后蕴含“必然规律”,可通过概率量化?2.企业新产品上市前的市场预测,如何用概率分布评估成功概率?3.主观概率在个人职业选择、投资决策中如何合理运用,避免主观偏差?【要求】每组结合1个实际案例,说明概率思维对决策的帮助。小组讨论事件与事件的概率Statisticalbasis第一节1第一节事件与事件的概率一、事件的基本概念(1)随机事件(偶然事件)。在一定的条件下,可能发生也可能不发生的事件称为随机事件。(2)必然事件。每次试验都一定会出现的事件称为必然事件。例如,每天早晨太阳都是从东方升起,这就是一个必然事件。(3)不可能事件。每次试验都一定不会出现的事件称为不可能事件。例如,在掷骰子活动中,掷得点数大于6就是一个不可能事件。通常,随机事件用大写字母(如A、B、C等)表示,必然事件用符号Ω表示,不可能事件用符号Φ表示。二、概率的古典定义、统计定义与主观概率第一节事件与事件的概率

概率是对随机事件发生的可能性大小的一种度量,一般用一个介于0~1的实数表示事件发生的可能性大小。若事件A发生的可能性大小为P(A),则称P(A)为事件A的概率。可从以下几个方面来理解概率的定义。(一)概率的古典定义

古典概型(传统概率)是指一个随机试验包含的基本事件是有限的,且每个基本事件发生的可能性均相等,这种条件下的概率模型称为古典概型,由法国数学家拉普拉斯(Laplace)提出。投掷一个质地均匀、形状规范的硬币,正面和反面出现的概率是一样的,都是1/2。很多人会问,为什么正面和反面出现的概率是一样的?显然,硬币是质地均匀、形状规范的,哪一面都不会比另一面有更多的出现机会,正面和反面出现的概率是一样的,这称为古典概型的对称性。体育比赛经常用到这个规律来决定谁开球,谁先选场地。为了解释这个现象,历史上有很多学者对这个问题进行过验证,依据结果可以看出,随着投掷次数的不断增加,正面出现的频率越来越接近50%,我们有理由相信随着次数的继续增加,正面和反面出现的频率将固定在1/2处,即正面和反面出现的概率都为1/2。1.古典概型的例子——掷硬币第一节事件与事件的概率(1)试验只有有限个基本事件。(2)试验的每个基本事件出现的可能性是相同的。在古典概型的例子中,试验结果只有正面和反面,所以正面和反面出现的概率均为2的倒数,即1/2。2.古典试验的条件第一节事件与事件的概率3.古典概率的计算公式在古典概型中,事件A发生概率的计算公式如下。P(A)=m/n式中,n表示该试验中所有可能出现的基本事件的总数目;m表示事件A包含的基本事件个数。这种定义概率的方法称为古典概率。第一节事件与事件的概率(二)概率的统计定义及公理化定义

在相同条件下重复做n次试验,其中事件A发生的次数为m(m≤n)。如果随着n逐渐增大,比值m/n逐渐稳定在某一数值p附近,则称p为事件A在该条件下发生的概率,公式如下。P(A)=p

这种定义概率的方法称为概率的统计定义。尽管统计定义很直观,且适用于实际试验(如掷硬币、抽卡等),但缺点是需要做大量重复试验,费时费力,既不严格,也不利于推广。1.概率的统计定义为了克服统计定义的局限性,根据频率的性质及概率的统计定义,可以给出概率的公理化定义。该定义不仅可以包括特殊情况,还具有更广泛的一般性。设E是一个随机试验,Ω是基本事件空间,对于任意事件A⊂Ω,定义一个实数集函数P(A),若它满足下面三条公理,则称P(A)为事件A的概率。(1)非负性。0≤P(A)≤1(2)规范性。P(Ω)=1(3)可列可加性。若事件A1,A2,…,An两两互不相容,则2.概率的公理化定义第一节事件与事件的概率第一节事件与事件的概率(三)主观概率

根据个人的主观知识判定的目标事件发生的可能性大小称为主观概率。主观概率是人们根据自己对事物发生可能性的判断给出的一种值,并不会存在一个公认的值。当然,其应满足各种概率规则。

主观概率是一种心理评价,判断中具有明显的主观色彩。不同人对同一事件发生的概率的判断是不同的,而谁的判断更接近客观事实,主要取决于其经验知识,专业人士也经常用主观概率帮助他人进行决策。

将新证据融合到主观概率中,计算出“较为客观”的主观概率,构成了概率论中很重要的一个学派——贝叶斯学派。主观概率在人工智能、管理等领域有许多应用。

概率的实际应用场景1.古典概率彩票中奖概率计算、扑克牌游戏中的胜率分析,核心是“等可能基本事件”的判定;2.统计概率保险公司测算保费,通过大量历史数据统计事故发生频率,确定概率;3.主观概率投资分析师根据行业趋势、政策导向,判定某行业股票上涨的主观概率,辅助投资决策。知识链接以贝叶斯定理分析《黔之驴》

贝叶斯(Bayes)定理计算出来的概率是由主观判断到客观实际的一个认识过程,随着样本信息的增加,初始确定的主观概率的不合理性逐渐减弱,而由实际概率代之。以柳宗元的《黔之驴》作为分析实例。设强者为A1,弱者为A2,进攻记作B1,不进攻记作B2。动物界的生存法则:弱肉强食。一般情况下,强者进攻的概率和不进攻的概率如下。当弱者遇到饥饿或威胁状况时也会拼死一搏,其进攻和不进攻的概率如下。知识拓展概率分布表如表5-1所示。……详情阅读书中P108页……

贝叶斯定理是一种强大而灵活的概率工具,在许多领域都有广泛应用。无论是在医学诊断、信息安全、影院选择,还是在天气预报等领域中,甚至在非常火热的ChatGPT中也运用了贝叶斯定理。贝叶斯定理可以帮助我们根据已有的先验知识和新的观测数据进行概率估计和决策推断。尽管贝叶斯定理简单易懂,却能赋予我们强大的推理能力,帮助我们更科学、更准确地处理复杂的问题。(节选)知识拓展1.古典概率的核心前提是(

)A.基本事件有限且等可能 B.需大量重复试验

C.基于主观判断 D.满足公理化公理2.某投资者根据行业经验判断某股票上涨概率为60%,这种概率属于(

)A.古典概率 B.统计概率

C.主观概率 D.公理化概率答案:1.A2.C随堂测试几种重要的随机变量概率分布Statisticalbasis第二节2第二节

几种重要的随机变量概率分布首先,考虑这个试验:抛硬币,正反面出现的概率都是1/2。其概率分布情况如表5-2所示。再引入一个函数X(ω),它可以将样本点映射到数轴上。对于这个试验,可以定义X(正)=0,X(反)=1,就会得到表5-3。将不采用数量标识的表示方法转换为采用数量标识的表示方法,就完成了随机事件的数量化,如表5-4所示。第二节

几种重要的随机变量概率分布无论随机事件是否与数量直接相关,都可以对其进行数量化,便于用数学分析的方法研究随机现象。这种随机现象数量化的表现就是随机变量。对于样本空间Ω中的每个样本点ω,如果总有一个实数X(ω)与其对应,则称实值函数X=X(ω)为随机变量,常用大写字母X、Y、Z等表示。按照随机变量可能取得的值,随机变量可分为两种基本类型:离散型随机变量、连续型随机变量。离散型随机变量是指在一定区间内的取值为有限个或可数无穷多个。连续型随机变量是指在一定区间内变量的取值为无限个,或数值无法一一列举。分布函数是用来刻画随机变量概率分布的有效工具。设X是一个随机变量,对任意实数x,称函数F(X)=P(X≤x)为随机变量X的分布函数,记作X~F(x),读作“X服从F(x)”。第二节

几种重要的随机变量概率分布一、常用的离散分布对于离散型随机变量X,由于其所有可能的取值可以一一列举出来,因此,其所有可能的取值为x1,x2,…,xn,X取xi的概率P(X=xi)=pi(i=1,2,…,n)称为离散型随机变量X的概率分布,记为X~{pi}。离散型随机变量的概率分布也可以用表格形式来表示,表5-4就表示了抛硬币的随机变量的概率分布,这种表示方法被称为分布列。在实际问题中,常常会遇到许多不同类型的离散型随机变量,下面介绍几种常用的离散分布。(一)0-1分布第二节

几种重要的随机变量概率分布1.0-1分布的定义若离散型随机变量X的概率分布为则称随机变量X服从参数为p的0-1分布,记作X~B(1,p)。0-1分布也称为两点分布或伯努利分布。例如,假设我国乒乓球队获得金牌的概率(p)为0.8,定义随机变量X如下。X=1,表示获得金牌X=0,表示没有获得金牌则某次奥运会乒乓球男队的比赛就是X服从参数为0.8的0-1分布,记作X~B(1,0.8),其分布列如表5-5所示。第二节

几种重要的随机变量概率分布2.0-1分布的数学期望与方差0-1分布的数学期望与方差的计算公式如下。课堂讨论根据表5-5提供的数据,计算中国乒乓球男队获得金牌概率分布的数学期望与方差。(二)二项分布第二节

几种重要的随机变量概率分布1.二项分布的定义与性质二项分布描述的是重复n次的伯努利试验。每次试验需满足以下条件。(1)只有两种可能的结果,两种结果发生与否相互对立。(2)每次试验相互独立,与其他各次试验结果无关,即事件A发生或事件A发生。(3)事件发生与否的概率在每一次独立试验中都保持不变,记为p(0<p<1)。如果将这种只有两种结果的试验在相同条件下独立重复进行n次,有这一系列特点的试验就构成了一个新的试验,称为n重伯努利试验。二项分布的概率质量函数如下。显然,二项分布的概率质量函数正好对应二项式定理中(p+q)n展开式中的第k项(从k=0开始计数,令q=1-p),其计算公式如下。由于这是一个概率分布,其所有可能取值的概率之和为1,即因此,随机变量X服从参数为n、p的二项分布,记作X~B(n,p)。第二节

几种重要的随机变量概率分布第二节

几种重要的随机变量概率分布2.二项分布的特性知识拓展IQC中二项分布的应用

1.零件合格率验证

在制造业中,零件供应商与工厂通常会约定合格率,并通过进货检验进行抽检验证。假设约定的合格率为97%,每批零件随机抽取10件,当检出1件零件不合格时,能否判定整批零件合格率未达97%?知识拓展

2.抽样方案设计

那么在抽检时,抽样规模应该如何确定,在《计数抽样检验程序

第1部分:按接收质量限(AQL)检索的逐批检验抽样计划》(GB/T2828.1—2012)中有明确的规定,在这里介绍其中一种最简单的应用原理。

(1)国标方案。如果与供应商约定的合格率是99%,即接收质量限为0.01,本次产品的总数量是1000只,只做一般性的检验,查国标可得抽样量为80,判定规则是:抽到2个及以下不合格品就可以接收这批产品;抽到3个及以上不合格品则拒绝接收。

(2)但在实务中,受限于人力、物力,可能无法抽取80个产品样品用于检验,结合供应商的以往表现和历史数据,设计了两种抽样方案。

方案一:只抽取20个产品,不合格品为0则接收,大于0则退回。

方案二:抽取50个产品,不合格品不超过1则接收,大于1则退回。知识拓展(1)实际的合格率低于约定合格率,仍被接收的风险属于使用者风险。如果约定合格率为99%,但实际的合格率只有98%,按照这两种抽样方案及国标方案,使用者风险(实际合格率不达但仍被接收)如下。这就是抽样检验带来的风险。(2)实际的合格率高于约定合格率,仍存在拒收的风险,通常这一类风险叫作生产者风险。我们也可以分别计算一下。……详情阅读书中P112页……虽然生产者风险并不大,确定抽样方案不是靠拍脑袋来决定的,需要对抽样方案进行比较深入的研究,找到最恰当的抽样方案。另外,关于抽样问题要具体问题具体分析,如果供应商质量控制能力很强,可以放宽检验甚至免检。(三)泊松分布第二节

几种重要的随机变量概率分布1.泊松分布的定义与条件若随机变量X的概率分布为则称随机变量X服从参数为λ的泊松分布,记作X~P(λ)。考查一个变量是否服从泊松分布,需要满足以下条件。(1)X是在一个区间内发生特定事件的次数,可以取值为0,1,2,…。(2)一个事件的发生不影响其他事件的发生,即事件独立发生。(3)事件的发生率是相同的,不能有些区间内发生率高一些而另一些区间低一些。(4)两个事件不能在同一个时刻发生。(5)一个区间内一个事件发生的概率与区间的大小成比例。第二节

几种重要的随机变量概率分布2.泊松分布与二项分布的关系泊松分布常用于近似计算二项分布(当n很大且p很小时)。在没有计算机时,二项分布的计算是非常麻烦的,而用泊松分布来近似计算可以降低大量的计算量。设λ=np,则B(n,p)≈P(λ)(n≥100,np≤10)表5-6列示了在n=100,p=0.02时,泊松分布与二项分布计算结果的对比,可以看出两者的差异很小。第二节

几种重要的随机变量概率分布3.泊松分布的特性服从泊松分布的随机变量,其数学期望与方差相等,计算公式如下。知识拓展邂逅,正态曲线的首次发现这个故事与概率论的发展密切相关,主角是棣莫弗(deMoivre)和拉普拉斯。拉普拉斯是一个大科学家,被称为法国的牛顿。拉普拉斯对棣莫弗十分欣赏,遇到学生向他请教概率方面的问题时,他就说:“这样的问题应该去找棣莫弗,他对这些问题的研究比我深入得多。”……详情阅读书中P113~114页……尽管棣莫弗首先在数学上揭示了正态分布的存在,但这一分布并未因此被命名为“棣莫弗分布”。正态分布的命名与高斯的工作紧密相关。高斯在研究误差理论时,特别是在最小二乘法的发展中,广泛使用了正态分布,并对其性质进行了深入分析。高斯的工作使得正态分布在统计学和误差分析中占据了核心地位,因此,正态分布最终被冠以“高斯分布”的名称。(一)正态分布的定义与特点在连续型随机变量中,最重要的一种随机变量是正态随机变量,其对应的概率分布称为正态分布,也称常态分布或高斯分布。由于其概率密度函数呈钟形,故常被称为钟形曲线。在自然界和人类社会中,许多随机变量的概率分布近似服从正态分布。例如,2023年某省普通高校招生(文史类)考试成绩分布情况如图5-1所示。第二节

几种重要的随机变量概率分布二、常用的连续分布:正态分布1.正态分布的定义正态分布是连续型随机变量中最重要的概率分布之一,有着十分广泛的应用。若随机变量X的概率密度函数为则称X服从参数为μ和σ2的正态分布,记作X~N(μ,σ2)。式中,μ是随机变量X的均值;σ是随机变量X的标准差。第二节

几种重要的随机变量概率分布课堂讨论你还能说出哪些属性或现象量化后可能服从正态分布?

分布类型的实操选择1.0-1分布适用于“非此即彼”的二元结果,如产品合格/不合格、考试通过/未通过;2.二项分布多次独立重复的伯努利试验,如连续10次投篮的命中次数、批量产品的不合格品数;3.正态分布自然与社会现象的常见分布,如学生成绩、人体身高、企业销售额,核心是“中间多、两头少”。知识链接图5-2是正态分布的概率密度曲线,“瘦高”曲线是X1~N(1,0.52)的概率密度曲线,“矮胖”曲线是X2~N(0.5,1.32)的概率密度曲线。第二节

几种重要的随机变量概率分布2.正态分布的特点第二节

几种重要的随机变量概率分布

对于正态分布的概率密度函数,计算公式如下。当均值μ=0且标准差σ=1时,该分布称为标准正态分布,记作N(0,1)。标准正态分布的概率密度函数和累积分布函数如下。第二节

几种重要的随机变量概率分布1.标准正态分布的定义与数学表达式(二)标准正态分布标准正态分布的概率密度曲线如图5-3所示。第二节

几种重要的随机变量概率分布2.标准正态分布的性质与应用式中,Z为标准分数,是个相对值,用于刻画某一具体数值与总体平均值之间的相对位置。标准分数的值可为正、可为负,也可为0。当标准分数等于0时,表明该具体数值等同于总体平均值;当标准分数小于0时,意味着该具体数值低于总体平均值;当标准分数大于0时,则显示该具体数值高于总体平均值。标准分数的绝对值大小反映了具体数值与总体平均值之间距离的远近,其值越大,表明距离越远,在数据分布中出现的概率相对越小。标准分数精确地描述了具体数值在总体中的相对位置,为我们提供了衡量数据偏离平均程度的重要工具,是统计学中用于数据标准化处理的关键概念。标准分数不仅刻画了具体数值与平均值的相对距离,还蕴含着深刻的概率意义。第二节

几种重要的随机变量概率分布对于任意正态随机变量X~N(μ,σ2),可通过如下线性变换(称为Z变换)将其转化为标准正态分布Z~N(0,1),标准分数Z的计算公式如下。标准分数之所以被称为“标准”,正是因为它与概率的精确对应关系,每一个标准分数都对应着正态分布中的特定位置,并唯一对应着一个固定的概率,这一性质在统计推断和数据分析中发挥着至关重要的作用。对于任意正态分布,只要已知其平均值和标准差,即可通过计算得到各个具体数值的标准分数Z,从而利用标准正态分布表来解决概率计算问题。基于图5-1的数据,2023年某省普通高校招生(文史类)考试的平均成绩为421分,标准差为83分,如果一个考生的考试成绩是421分,则其对应的标准分数应该是0。比这位同学分数更高的考生,标准分数应该大于0;比这位同学分数更低的考生,标准分数应该小于0。标准分数能够描述任一考生取得的成绩在全体考生中所处的位置。当然如果我们知道当年的理科类考试成绩,也可以在标准化后计算出标准分数,通过比较标准分数的大小来判断一个文史类考生和一个理工类考生谁在同类型考生中成绩排名更靠前。第二节

几种重要的随机变量概率分布【例5-1】

设X~N(5,32),请计算:第二节

几种重要的随机变量概率分布课堂讨论根据2023年某省普通高校招生(文史类)考试成绩可知其标准差为83分,文史类一本高考录取分数线为484分,那么文史类考生能达到一本录取分数线的概率有多大?(1)P(X≤10)。(2)P(2<X<10)。在计算这道题时,可以首先完成标准化,然后根据标准值查表得到概率。还可以使用Excel直接计算:在单元格中输入“=NORM.DIST(10,5,3,TRUE)”,计算P(X≤10);在单元格中输入“=NORM.DIST(10,5,3,TRUE)-NORM.DIST(2,5,3,TRUE)”,计算P(2<X<10)。1.当n很大且p很小时,二项分布可近似用哪种分布计算?(

)A.0-1分布 B.泊松分布

C.正态分布 D.t分布2.服从泊松分布的随机变量,其数学期望与方差的关系是(

)A.期望大于方差 B.期望小于方差

C.期望等于方差 D.无固定关系答案:1.B2.C随堂测试知识拓展“正态分布”世界观:万有不齐天地事,大道之行是中庸

用正态分布远观宇宙万象,中观万事万物,近观各色人等,我们能看到三大趋势:一是万有不齐,二是静态趋中,三是动态平衡。

第一,万有不齐。启功先生有副对联:“万有不齐天地事,一无可寄古今情。”

第二,静态趋中。正态分布世界观的第二个核心内容是“大道之行是中庸”。无论观察哪个属性的分布,都可以看到多数人平平,聚集在平均值周围,远远高于平均值的人很少,远远低于平均值的人也很少。动态来看,越靠近普通平凡,人数越多;离平均值越远,人数越少;趋向杰出不凡,人数越来越少;趋向低差末流,人数也越来越少。“物以稀为贵”,是片面真理,巨人固然稀少,侏儒同样稀少。两头小中间大,万有不齐,主流平平,是自然的分布,正常的分布,就是术语所说的正态分布。知识拓展

第三,动态平衡。正态分布具有峰值,即平均值的个案数量最多;平均值是一个中心点,偏离平均值,一端滑向低于平均,另一端滑向高于平均,坡度或陡或缓,但永远不平。不平,就无法站稳,只能在动态中求稳。这是从个体角度而言的。从总体来看,同样呈现动态平衡的特征。例如,中国人口的年龄分布原本呈正态分布,但近年来的“老龄化”现象正是这种正态分布的形状发生改变的表现。

强调正态分布是世界观,这里有三层意思。世界本来如是,不以人的意志为转移,如是观之就是实事求是;正态分布是诸多世界观的一种,是精微、科学、通达的一种;科学研究不能停留在常识水平——正态分布是数学家直觉到的概念,先悟出来,然后推理出来。正态分布既有接近常识的一面,也有超越常识的一面。常识能帮我们应对日常生活,但不能助我们深入准确地认识世界。超越常识,意味着把正态分布变成自己的思维方式。抽样分布与中心极限定理Statisticalbasis第三节3一、抽样分布(一)统计量的概念第三节

抽样分布与中心极限定理统计量又称样本统计量,在统计学中具有极其重要的地位,是统计推断的基础。推断统计的重要任务之一是通过从总体中抽取样本构造恰当的统计量,经由样本性质去推断关于总体的性质。统计量通常是指由随机变量完全确定的函数。设X1,X2,…,Xn是从总体X中抽取的容量为n的样本,若函数T(X1,X2,…,Xn)不依赖任何未知参数,则称函数T是一个统计量。将样本的一组具体观测值x1,x2,…,xn代入T,能够计算出一个具体的统计量的值。综上可知,统计量是样本的一个函数,不同的推断问题要求构造不同的统计量。需要注意的是,依赖于总体分布的未知参数的函数不属于统计量,如数学期望E(X)和方差D(X)。第三节

抽样分布与中心极限定理统计量是样本的函数,具有抽象的数学性质,而统计量的值是将样本的具体观测值代入统计量函数后得到的具体数值。在实际使用中,这两个术语有时会混用。例如,从某总体中随机抽取一个容量为5的样本,观测值分别为2、4、6、8、10,样本均值的计算公式如下。常用的样本统计量有样本均值、样本比例和样本方差。其中,样本均值反映出总体X的数学期望信息,其计算公式如下。样本方差是样本中各个值与样本平均值的差的平方和除以样本量减去1的值,反映出总体X的方差的信息。样本方差的计算公式如下。从总体中以一定的样本量多次抽取具有代表性的样本,求样本统计量(如均值或方差)形成的分布称为抽样分布。抽样分布反映样本统计量的分布特征,可以由此估计总体参数,推断总体分布。深入理解抽样分布,要弄清楚以下两个问题:(1)样本抽样分布是对谁的分布?样本抽样是样本统计量的抽样分布。(2)为什么样本统计量可以被当作一个随机变量来看待?这是因为不同样本计算得到的样本统计量的值不同。样本统计量是随机变量,是比较反直觉的。因为样本统计量是依赖样本计算出来的,从总体中可以采用同样的随机抽样方法抽取无穷个样本量作为一定的样本,针对特定的样本统计量,每抽取一组样本都可以计算出一个确定的统计量,而且这些样本统计量都或多或少地存在差异,由此样本统计量会随着抽样的不同而产生随机变动。第三节

抽样分布与中心极限定理(二)抽样分布的概念样本均值的抽样分布被广泛应用。从总体中抽取一定样本量的样本,每一个样本都可以计算出一个均值,这些所有可能的样本均值形成的分布就是样本均值的分布。但现实中,不可能将所有的样本都抽出来。因此,通常所说的样本均值的概率分布实际上是一种理论分布,统计学家需要证明其服从某种分布。第三节

抽样分布与中心极限定理(三)样本均值的抽样分布【例5-2】

某咨询公司为了研究企业研发投入对创新产出的影响,随机抽取了40家不同行业的企业作为样本,搜集了这些企业2024年的研发投入金额(单位:万元)和对应的专利数量。假设样本数据中,企业研发投入金额的标准差为500万元,专利数量的标准差为12件。请分别计算企业研发投入金额和对应专利数量均值的标准误差。第三节

抽样分布与中心极限定理课堂讨论在此次企业研发数据调研中,除了样本容量和标准差,还有哪些因素可能影响样本标准误差?二、中心极限定理

第三节

抽样分布与中心极限定理(一)中心极限定理的定义

抽样分布的核心应用1.样本均值抽样分布企业市场调研时,通过抽取样本计算均值,推断总体均值,标准误差越小,推断越精准。2.中心极限定理的实践意义无论总体分布如何,大样本(n≥30)的样本均值近似正态分布,为抽样推断提供理论支撑,如民意调查中通过少量样本推断全国民意。知识链接中心极限定理的重要意义在于,它允许我们即使在原始数据不服从正态分布的情况下,也可以在一定条件下使用正态分布的性质来进行统计分析。但当n为小样本时(通常为n<30),样本均值的分布不服从正态分布。样本均值的分布与总体分布及样本量的关系如图5-4所示。第三节

抽样分布与中心极限定理(二)中心极限定理的重要意义如果总体分布接近正态或对称分布,较小的样本量也可能使样本均值的分布接近正态;但若总体分布严重偏态或存在极端值,则需要更大的样本量。从三种分布形状的总体中,分别对n=2,n=4,n=30三种样本量,绘制出各分布样本均值的抽样分布图,如图5-5所示。第三节

抽样分布与中心极限定理(三)不同总体分布的模拟验证1.抽样分布是指(

)的分布A.样本统计量 B.总体参数

C.样本观测值 D.总体观测值2.若总体分布为严重右偏分布,要使样本均值抽样分布近似正态,所需样本量通常(

)A.小于30 B.等于30C.大于30 D.无明确要求答案:1.A2.C随堂测试知识拓展从三个层次理解正态分布

在统计学中,正态分布有着非常重要的地位,结合正态分布、抽样分布与中心极限定理的相关知识,正态分布的应用对象可分为以下三个层次。

1.个体的某个属性

当正态分布用于描述个体的某个属性(如人的身高、体重、智商或样本均值)时,正态分布的形状(高度与坡度)由该属性的均值和标准差决定。根据均值和标准差,可以计算个体属性的标准值。标准值是一个相对值,表示某个具体的值与均值之间的距离。知识拓展

2.抽样误差

正态分布常用于描述样本均值与总体均值之间的差异,即抽样误差。其分布形状由抽样误差的平均值(理论上为0)和标准误差决定。根据标准误差,单次抽样误差可转化为标准分数,用于衡量样本均值偏离总体均值的程度。标准分数可能为0(表示样本均值等于总体均值),也可能为正值或负值,分别表示偏高或偏低。标准分数的绝对值越大,表示该偏离出现的概率越小。

3.概率的指标值

当正态分布用于描述概率的指标值(个体属性的标准值和抽样误差的标准值)时,其均值为0,标准差为1。标准值直接对应一个特定的概率。正态分布图以最高点(均值)为界,左侧一半,右侧一半,即高于平均值和低于平均值的样本量各占50%。事件与事件的概率Statisticalbasis第四节4在以特定概率分布对某一现象进行建模时,长期观察的结果往往具有较强的规律性,有助于我们清晰地把握其整体趋势。然而,当实际结果与预期存在差异怎么办?偏差是正常的小幅度波动,还是建模错误?此时,可以利用χ2分布来分析结果,排除可疑结果。χ2是英文“chi-square”的记号,其中“chi”是希腊字母χ的发音,“square”表示平方,因此χ2就是指χ的平方值。χ2统计量用于衡量观察值与期望值之间的差异,其计算公式如下。式中,O是观察频数;E是期望频数。该公式的含义是:对每一类事件,求出观察频数和与期望频数的差的平方,再除以期望频数,最后将所有结果相加。χ2越小,说明观察值与期望值越接近,偏差越小。第四节

三个重要分布一、χ2分布(一)使用χ2分布的原因(二)由标准正态分布构造χ2分布第四节

三个重要分布若n个相互独立的随机变量X1,X2,…,Xn均服从标准正态分布,即Xi~N(0,1)(也称独立同分布于标准正态分布),则称随机变量服从自由度为n的χ2分布,记作χ2~χ2(n)。自由度不同对应的χ2分布不同,正如正态分布中均值或方差不同就会得到不同的正态分布一样。1.χ2分布的定义(1)期望与方差。计算公式如下。(2)可加性。若有k个相互独立的χ2分布随机变量,且自由度为各自自由度之和,则计算公式如下。2.χ2分布的性质第四节

三个重要分布随着自由度增加,χ2分布的形态逐渐由偏斜变得对称,并逐步接近正态分布。(1)图5-6展示了在不同自由度(df=1,2,4,6,11)下χ2分布的理论概率密度曲线的变化趋势,反映出χ2分布逐渐变得平滑和对称。3.χ2分布的自由度与分布形态关系第四节

三个重要分布(2)图5-7展示了在不同自由度(df=1,6,11)下χ2分布的样本直方图与相应正态分布概率密度曲线的对比。可以看出,随着自由度增加,χ2分布的形态越来越接近正态分布。第四节

三个重要分布(3)图5-8进一步扩展到更大的自由度(df=1,6,11,100,500,1000),展示了χ2分布的样本直方图与相应正态分布概率密度曲线的对比。可以看出,当自由度趋近于无穷大时,χ2分布的形态趋于标准正态分布。第四节

三个重要分布二、t分布第四节

三个重要分布(一)t分布的概念t分布全称为学生t分布,由英国的化学家、数学家、统计学家威廉·戈塞特在20世纪发现。威廉·戈塞特当时在都柏林的一家酿酒厂工作,在进行大量实验的过程中,他怀疑存在一个不同于正态分布的未知分布。经过研究,威廉·戈塞特发现了t分布,因为酿酒厂不允许职工发表研究成果,他只好以笔名“Student”(学生)发布,这便是Student的由来。而至于为什么是t分布,这是因为该分布的命名者——另一位统计学家费舍尔使用了字母t来代表服从该分布的随机变量。设随机变量X~N(0,1),Y~χ2(n),且X与Y独立,则称随机变量第四节

三个重要分布服从自由度为n的t分布,记作t~t(n)。自由度n=1的分布称为柯西分布。t分布的分布特征主要包括以下几个方面。t分布是一簇曲线,其形状与自由度有关,当自由度越小时,t值越分散。(3)t分布以t=0为对称轴,概率密度曲线是对称图形。(2)分布是连续分布。(1)第四节

三个重要分布(二)t分布与标准正态分布t分布的自由度越大,则该t分布的曲线就越接近标准正态分布。当n≥30时,t分布与标准正态分布的差异就非常小。df=3,10的t分布与标准正态分布概率密度曲线的对比如图5-9所示。第四节

三个重要分布总的来说,t分布与标准正态分布既在许多方面相似,也存在一些差异。因此,在实际应用中应根据数据的特点和假设检验的需要选择合适的概率分布。表5-7列示了t分布与标准正态分布的联系与区别。三、F分布第四节

三个重要分布(一)F分布的概念F分布是1924年英国统计学家费舍尔(Fisher)提出,并以其姓氏的第一个字母命名的。F分布有着广泛的应用,如在方差分析、回归方程的显著性检验中都有着重要的地位。设X、Y为两个独立的随机变量,X~χ2(n),Y~χ2(m),则随机变量服从第一自由度为n,第二自由度为m的F分布,记作F~F(n,m)。F分布由两个自由度确定,是一组分布。第四节

三个重要分布(二)F分布的性质(1)F分布是一种非对称的右偏分布。(2)F分布有两个自由度,两个自由度的位置不能互换。当n≠m时,交换n和m会得出不同的F分布。如果有Z~F(n,m),则有1/Z~F(m,n),即交换第一自由度和第二自由度的顺序后,两个F分布互为倒数。(3)F分布是一个以自由度为参数的分布族,不同的自由度决定了F分布的形状。对于给定的第一自由度(n=10)且m取不同值时,F(n,m)呈现不同的形状,我们看到的曲线是右偏的,且m越小,偏度就越严重,如图5-10所示。(4)F分布和t分布有密切的关系。如果T~t(n),则T2~F(1,n)。第四节

三个重要分布图5-10。

推断统计在社会科学中的应用

某民意调查机构预测选举结果时,抽取1000名选民作为样本,发现支持候选人A的比例为52%。利用二项分布计算抽样误差,结合中心极限定理,推断总体支持率的置信区间。最终预测结果与实际选举结果偏差小于2%,验证了推断统计的有效性。

推断统计的核心是“用样本推断总体”,通过概率分布、抽样分布和中心极限定理,将随机现象转化为可量化、可推断的科学结论。三大重要分布则为不同场景(大/小样本、方差比较等)提供了精准的推断工具。知识链接知识拓展使用Excel计算χ2分布、t分布、F分布的概率与分位数

在Excel中可通过内置函数快速计算χ2分布、t分布、F分布的概率与分位数。以下为详细操作指南(以t分布为例)。(1)打开Excel软件,选择“公式”选项卡,单击“插入函数”选项,如图5-11所示。知识拓展(2)打开“插入函数”对话框,其中“T.INV.2T”用于计算特定t值下双尾t分布的分位数;“T.DIST.2T”用于计算特定t值下双尾t分布的概率;“T.DIST”用于计算特定t值下单尾t分布的概率,如图5-12所示。知识拓展(3)单击“T.INV.2T”,打开“函数参数”对话框,如图5-13所示。需要计算t分布值:在Probability后面的文本框中输入特定t值对应的概率,在Deg_freedom后面的文本框中输入自由度。知识拓展(4)单击“T.DIST.2T”,打开“函数参数”对话框,如图5-14所示。需要计算t分布的概率:在X后面的文本框中输入t分布的值,在Deg_freedom后面的文本框中输入自由度。知识拓展按Enter键后在光标所在的单元格生成结果。相应地,若计算χ2分布的左尾概率,则应在“插入函数”对话框中选择“CHISQ.DIST”;若计算右尾概率,则应选择“CHISQ.DIST.RT”。输入χ2统计量与自由度后可得到相应的概率。“CHISQ.INV”和“CHISQ.INV.RT”可以得出具有给定概率的左尾/右尾的χ2分布值,但是需要在文本框中输入对应的概率和自由度。同样地,“F.DIST”用于计算左尾F概率分布,“F.DIST.RT”用于计算右尾F概率分布,“F.INV”用于计算左尾F分布的分位数,“F.INV.RT”用于计算右尾F分布的分位数。需要注意的是,F分布有两个自由度,需要在Deg_freedom1与Deg_freedom2中准确填写,不可以交换。问题思考1.在均值为50,标准差为8的总体中,随机抽取容量为64的样本,求样本均值的抽样分布的均值和标准误差。2.某大学的一家快餐店记录了过去5年的每日营业额,每日营业额的均值为2500元,标准差为400元。由于某些节日的营业额偏高,因此每日营业额的分布是右偏的。假设从这5年中随机抽取100天,求平均营业额的抽样分布及均值与标准误差。实战演练《庄子·齐物论》提出的“万物齐一”思想认为,一切事物归根到底都是相同的。查阅资料,从正态分布蕴含的世界观出发,尝试论述庄子“万物齐一”与孟子“物之不齐,物之情也”的辩证统一。谢谢统计学参数估计Statisticalbasis第六章6第一节

参数估计的基本原理第二节

一个总体参数的区间估计第三节

两个总体参数的区间估计掌握区间估计的原理,理解评价估计量的标准;掌握一个总体参数与两个总体参数区间估计的方法。能够在不同的条件下计算一个总体参数或两个总体参数的置信区间,并在Excel中实现对一个总体参数或两个总体参数的区间估计。

学习目标学习目标利用偶然性与必然性理解统计结论的不确定性与区间估计的思想,以及在研究社会经济问题时充分考虑影响因素的复杂性,在偶然中寻找必然。

素养目标思维导图背景启题17世纪,揭示自然界现象间和现象过程的因果性联系的牛顿力学定律提出以后,人们认为它是决定性规律。因为按照这一定律,在一个二体孤立系统中,物体之间的联系是一种确定的联系,并且对一个物体来说,只要知道它在某一时刻的特定状态(如时间、初速度),就可以推演出它随着时间的变化经历的一系列状态,即未来任何时刻的状态,如速度、位置、动量等。反之,如果知道它现在的状态,也可以推出它的初始状态。未来包含在过去之中,过去可以预见未来。这种由前一事物的存在或运动状态,可以必然推出后一事物的存在或运动状态的联系是决定论的。它是以必然性为基础的。拉普拉斯说:假如有一个精灵在已知的时刻了解到每个原子的位置和运动,它就能预言出世界的全部未来。显然,在这里偶然性被排斥了。

背景启题

随着人们对自然现象研究的深入,研究客体对象的不断扩大,人们进而发现事物间的联系绝非像决定论指出的那样简单。事物间的联系或事物的过程,除必然性联系之外,还有一种随机性联系,即在一定条件下,事物间的联系或过程具有多种可能的结果,究竟发生哪一种结果,事先并不能预言,是偶然性的。对于这种现象本质的揭示和量的描述,便产生了统计规律和概率论,并在自然科学中引进了概率的概念。布朗运动、气体定律和热力学定律、放射性衰变律等,都是统计规律。特别是微观粒子运动的量子力学,也是统计规律。这些统计规律的提出和概率论的广泛应用,不仅使自然科学发生了革命性的变革,而且对哲学上的必然性与偶然性、决定论、因果性等概念产生了深刻影响。背景启题

统计规律是对大量偶然性现象进行统计平均得出的完全确定的规律,即它揭示的是一个整体系统的特性。这种特性实质上就是大量个体偶然性中包含的整体必然性。它是以偶然性为基础的,是偶然性转化成为必然性的结果。在这一点上,它确实证明了唯物辩证法的观点:偶然的东西是必然的,没有脱离必然性的偶然性,凡是看起来偶然性在起作用的地方,偶然性本身始终服从于内部隐藏着的必然性。

请思考:

在研究社会经济问题时,应如何充分考虑其中的影响因素,才能在偶然中寻找必然,得出统计的结论?【讨论主题】

结合“偶然性与必然性”的辩证关系,分析参数估计中如何通过样本的“偶然结果”推断总体的“必然规律”,以及置信水平选择对决策的影响。【讨论方向】1.为什么区间估计需要设定置信水平?90%、95%、99%置信水平分别适用于什么场景?2.样本量大小对置信区间宽度有何影响,背后的逻辑是什么?3.企业市场调研中,如何平衡样本成本与估计精度,选择合适的样本量和置信水平?【要求】每组结合一个实际场景,说明参数估计的实操思路。小组讨论参数估计的基本原理Statisticalbasis第一节1第一节参数估计的基本原理

第一节参数估计的基本原理一、估计量的评价标准(一)无偏性

【小提示】在政府统计中,GDP增长率、居民收入等核心指标的估计,必须保证估计量无偏,否则会误导政策制定。第一节参数估计的基本原理(一)无偏性抽样分布的无偏性如图6-1所示。居家社区医养结合服务对老年人医疗费用的影响我国老龄化程度在持续快速加深,2002年到2021年,65岁及以上的老年人口数量从9377万人增至20056万人,老年抚养比由10.4%上涨至20.8%。老年人口数量增加意味着更多的医疗服务需求和医疗资源消耗。医养结合服务被称为整合照料,是全球应对人口老龄化的一种共识性策略,其战略重要性在我国的发展规划中不断凸显。2022年,《国务院关于印发“十四五”国家老龄事业发展和养老服务体系规划的通知》提出,实施“医养结合能力提升专项行动”,以深入推进医养结合发展。医养结合对老年人医疗服务利用存在两种效应:一是消费效应,即通过“医”和“养”的整合,提高就医的便捷性和连续性,促进老年人医疗服务的利用水平,从而提高老年人医疗资源消耗,减少医疗费用支出;二是健康效应,即老年人通过利用医疗服务,健康得以改善,最终会降低医疗服务利用水平,抑制医疗资源消耗和医疗费用支出。素质课堂

衡量医养结合服务对老年人医疗费用的影响是非常必要且重要的。通常,研究者会通过比较医养结合实施前后的平均医疗费用来评估政策效应。然而,这种做法可能会因样本选择偏差而导致错误结论,原因在于样本中存在医疗费用为零的情况。医疗费用为零可能由多种因素导致:一是老年人健康状况良好,无须医疗服务;二是医疗服务价格过高或就医便利性不足,导致部分老年人在患病后放弃就医;三是上述两种因素共同作用的结果。因此,在医疗费用为零的数据中,一部分反映真实的健康需求,另一部分是老年人自我选择的结果。如果直接估计而不考虑修正自我选择导致的偏差,就有可能得出有偏差的估计结果。素质课堂第一节参数估计的基本原理

同一个参数可能有多个无偏估计量。我们可以想象一个场景:普通人与气象局都能够估计天气温度,假设经过多次估计后两者的平均偏差都为0,但在某一次的估计中,气象局的预测更接近真实值。也就是说,在评价无偏估计量时,还需要考虑参数估计的有效性。有效性是指对于同一总体参数的多个无偏估计量,标准差更小的估计量更有效。如图6-2所示。(二)有效性【小提示】比较两种抽样方法的优劣时,若均为无偏估计,选择标准差更小的方法,如分层抽样vs简单随机抽样,前者对总体的估计更有效。第一节参数估计的基本原理(三)一致性

二、点估计与区间估计第一节参数估计的基本原理

点估计是指用样本统计量的某个观测值直接推断总体参数。例如,随机抽取1000名小学生,计算其平均身高为145厘米。如果直接用145厘米代表全体小学生的平均身高,那么这种方法就是点估计。常用的点估计方法包括矩估计和极大似然估计。

但是,点估计无法量化误差。总体参数是一个固定值,而样本统计量是随机变量。用随机变量估计固定值时,误差是不可避免的。由于仅用一个样本值估计总体参数存在较大风险,且风险的大小未知。因此,点估计通常用于定性研究或对总体参数精度要求不高的场景。在需要对精确总体参数进行决策时,点估计的应用较为有限。(一)点估计(二)区间估计第一节参数估计的基本原理1.区间估计的定义

区间估计是在推断总体参数时,根据统计量的抽样分布特征,估计出总体参数的一个区间,而不是一个数值,并给出该区间包含总体参数的概率保证。如果用区间估计推断小学生平均身高,结果可表述为:根据样本数据,估计小学生的平均身高在140~150厘米,置信程度为95%,如图6-4所示。第一节参数估计的基本原理2.置信区间的提出与发展1934年,美籍波兰统计学家奈曼(Neyman)首次系统提出了区间估计方法,并定义了其准确性度量。以下是相关概念。

(1)置信区间。置信区间是指由样本统计量构造的总体参数的估计区间,反映参数真实值以一定概率落在样本结果附近的范围,其核心是提供参数估计的可信程度,即前面所述的“概率保证”。

(2)置信水平。置信水平也称置信度、可靠度,是指在通过样本估计总体参数时,由于样本的随机性,结论存在不确定性。置信水平(通常表示为1-α)表示区间估计的可靠性,即正确覆盖总体参数的概率。

第一节参数估计的基本原理

(3)显著性水平。显著性水平是指估计总体参数时可能犯错的概率,即参数真实值未落在置信区间内的概率,用α表示。

(4)置信界限。置信界限是对单侧区间的界限及双侧区间的置信上限、置信下限的统称。例如,采用奈曼的方法,计算得到某地区成年男子平均身高的95%的置信区间是(1.65,1.71)(单位:米)。其中,置信水平为95%,显著性水平为5%,1.65米和1.71米分别为置信下限和置信上限。第一节参数估计的基本原理3.理解置信区间

置信区间广泛应用于统计分析,其概念可以用图6-5来表示。

置信区间以区间形式量化了参数估计的不确定性。置信区间基于样本统计量构建,区间范围直观反映了对总体参数估计的精度———区间越窄,说明估计越精确;区间越宽,则不确定性越大。需要明确的是,总体参数的真值是固定但未知的常数,而置信区间由于样本的随机性,其位置会随样本的变化而不同。第一节参数估计的基本原理置信水平(如95%)本质上是一个概率度量,表示在重复抽样中,构造出的置信区间中约有95%能包含总体参数真值。换言之,置信区间好比为“捕捉”总体参数而撒下的网,虽然每次撒网的位置不同,但长期来看,大约有95%的网能覆盖目标参数。总结来说,可从两个方面理解置信区间。一是其概率属性,即在重复抽样中,约有95%的置信区间能够覆盖总体参数真值;也可理解为当前区间有95%的把握覆盖真值。二是要避免误解为“总体参数真值有95%的概率落在该区间内”,因为真值是固定常数,不具有概率意义。置信区间的随机性来自样本,而非真值本身。因此,应区分“区间包含真值的概率”与“真值落在区间内的概率”,避免混淆。第一节参数估计的基本原理课堂讨论如图6-6所示,你能找到哪一个区间不包括总体参数真值吗?第一节参数估计的基本原理4.常用置信水平与临界值比较常用的置信水平的z值(zα/2)如表6-1所示。第一节参数估计的基本原理

第一节参数估计的基本原理

资本-技能互补理论下养老保险费用率最优区间估计的机制分析中国社会保险缴费率(包括养老保险缴费率)不仅高于大多发展中国家,甚至高于一些发达国家,事实上已对企业造成较大的负担。2019年4月,中国政府出台《降低社会保险费率综合方案》,明确规定各地企业养老保险缴费率高于16%的,可降至16%。至此,降低企业养老保险缴率成为中国政府启动新一轮减税降费措施、切实减轻企业负担的重要手段之一。……详情阅读书中P135~136……当企业养老保险缴费率处于最优区间(既不过低也不过高)时,养老保险既能够实现对员工的有效激励,又不会因缴费过高而挤占企业研发资金。此时,研发投入与高技能员工之间形成显著的互补效应,二者协同作用可显著提升企业全要素生产率。因此,只有企业养老保险缴费率处于最优区间,方可通过双重传导机制(激励高技能员工+增加研发投入)实现资本—技能互补,最大化提升全要素生产率。素质课堂一个总体参数的区间估计Statisticalbasis第二节2第二节

一个总体参数的区间估计一、总体均值的区间估计在对总体均值进行区间估计时,根据样本均值的抽样分布和中心极限定理可知,样本均值是总体均值的无偏估计。在确定了这个无偏的点估计量之后,需要在点估计量上加减一个误差范围构建一个区间估计。确定误差范围需要区分三种情况:一是总体是否为正态分布;二是总体方差是否已知;三是用于构造统计量的样本是大样本(n≥30),还是小样本(n<30)。(一)对于正态总体第二节

一个总体参数的区间估计1.总体方差已知

第二节

一个总体参数的区间估计2.总体方差未知如果总体方差未知,则需要区分大样本和小样本的情况。(1)对于大样本(n≥30)来说,即使总体方差未知,也可以用样本方差进行近似估计。根据中心极限定理,样本均值的抽样分布近似服从正态分布,故可构造标准化统计量。因此,在1-α的置信水平下,总体均值的置信区间公式如下。第二节

一个总体参数的区间估计(2)对于小样本(n<30)来说,在总体方差未知的条件下,不能使用标准正态分布进行估计,此时应采用t分布来估计总体均值,其对应的统计量公式如下。式中,s为样本标准差;(n-1)为t分布的自由度。因此,在1-α的置信水平下,总体均值的置信区间公式如下。(二)对于非正态总体第二节

一个总体参数的区间估计1.大样本根据中心极限定理,如果是大样本(n≥30),样本均值的抽样分布可近似为正态分布,参考上文可得出以下结论。(1)总体方差已知时,总体均值的置信区间公式如下。(2)总体方差未知时,可用样本标准差代替总体标准差,此时总体均值的置信区间公式如下。第二节

一个总体参数的区间估计2.小样本如果是小样本(n<30),则比较复杂,这种情况需要借助切比雪夫不等式来进行粗略估计。【例6-3】

设总体X~N(μ,σ2)(其中σ为已知参数),{X1,X2,…,Xn}为来自总体X的简单随机样本。问:在1-α的置信水平下,总体均值的双侧置信区间的长度与总体标准差σ的关系如何?由题意可知,总体方差已知,在1-α的置信水平下总体均值的置信区间公式如下。故置信区间的长度为显然,总体标准差σ越大,置信区间就越长。第二节

一个总体参数的区间估计【例6-4】

在某学校的一次考试中,已知全体学生的成绩服从正态分布,总体方差为100。从中抽取25名学生,其平均成绩为80,方差为64。以95%的置信水平估计该学校全体学生成绩均值的置信区间。

第二节

一个总体参数的区间估计【例6-5】

某高校对所有大一学生进行英语水平摸底测试,测试之后从中随机抽取9名考生,其成绩分别为70、68、74、85、91、83、62、50、65。请在90%的置信水平下对所有大一学生的英语测试成绩均值进行置信区间的估计。[(已知t0.05(8)=2.306]

第二节

一个总体参数的区间估计在这里我们只讨论大样本,总体比例用π表示,样本比例用p表示,一般要求np≥5或n(1-p)≥5。在大样本条件下,可以对总体比例进行区间估计。由样本比例的抽样分布可知,当样本量足够大时,样本比例近似服从正态分布。由于故可以构造标准化统计量计算公式如下。二、总体比例的区间估计第二节

一个总体参数的区间估计在1-α的置信水平下,总体比例的置信区间公式如下。然而在实际情况中,总体比例是未知的,所以需要用样本比例代替总体比例。此时,总体比例的置信区间公式如下。第二节

一个总体参数的区间估计【例6-6】

某公司要估计职工中女性所占比例,随机抽取了100名职工,其中有65名为女职工。试以95%的置信水平估计该公司职工中女性比例的置信区间。

第二节

一个总体参数的区间估计这里我们只讨论正态总体(或大样本条件下近似服从正态分布的总体)方差的置信区间估计问题。根据统计理论,样本方差的抽样分布服从自由度为n-1的χ2分布,即由于χ2分布是不对称的,因此总体方差的1-α的置信区间(见图6-7)不能简单地表示为样本方差加减某个对称误差项,而应基于χ2分布的分位点构造。在1-α的置信水平下,根据χ2分布的性质可得三、总体方差的区间估计第二节

一个总体参数的区间估计由此,总体方差的置信区间公式如下。式中,分子里的n-1是样本量减1;分母里的n-1为χ2分布的自由度。第二节

一个总体参数的区间估计【例6-7】

已知某测验的分数服从为正态分布,现有一个样本量为16的样本,其样本方差为5。试估计总体方差在95%置信水平下的置信区间。由于样本方差服从自由度为n-1的χ2分布,因此该总体方差的置信区间公式如下。查χ2分布表,在显著性水平α=0.05,自由度n-1=15时,将数据代入置信区间公式得因此,在95%的置信水平下,该总体方差的置信区间为2.73~11.98,或表示为(2.73,11.98)。1.正态总体方差的区间估计所使用的分布是(

)A.Z分布 B.t分布

C.χ²

分布 D.F分布2.某超市估计顾客平均消费额,已知消费额服从正态分布,总体方差未知,抽取20名顾客(n=20),应使用(

)构造置信区间A.Z分布 B.t分布

C.χ²

分布 D.F分布答案:1.C2.B随堂测试两个总体参数的区间估计Statisticalbasis第三节3第三节

两个总体参数的区间估计

一、两个总体均值之差的区间估计(一)独立样本:总体均值之差的区间估计1.总体方差已知,且为大样本第三节

两个总体参数的区间估计

如果两个总体的方差σ21和σ22未知且为大样本(n1≥30,n2≥30)时,可以用样本方差代替。因此,在1-α的置信水平下,两个总体均值之差的置信区间公式如下。2.总体方差未知,且为大样本第三节

两个总体参数的区间估计如果两个总体都服从正态分布,样本较小,且两个总体方差未知但相等时,可将两个样本的方差合并为合并方差,即构造的统计量服从自由度为n1+n2-2的t分布,即因此,在1-α的置信水平下,两个总体均值之差的置信区间公式如下。3.两个总体方差未知但相等,且为小样本第三节

两个总体参数的区间估计4.两个总体方差未知但不相等,且为小样本第三节

两个总体参数的区间估计

(二)匹配样本:总体差值均值的区间估计1.大样本第三节

两个总体参数的区间估计当样本量较大时,在1-α的置信水平下,总体差值均值的置信区间公式如下。2.小样本在小样本条件下且差值服从正态分布时,总体差值均值的置信区间公式如下。第三节

两个总体参数的区间估计【例6-8】

为

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论