统计学数据分布特征的描述.ppt_第1页
统计学数据分布特征的描述.ppt_第2页
统计学数据分布特征的描述.ppt_第3页
统计学数据分布特征的描述.ppt_第4页
统计学数据分布特征的描述.ppt_第5页
已阅读5页,还剩40页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

1、第1页,第三章是对数据分布特征的描述。通过调查获得的数据,经过整理后显示出来,已经能够反映出被研究对象的一些状态和特征,但认知水平相对肤浅,反映的准确性不够。因此,我们应该用各种有代表性的定量特征值来准确地描述这些数据。第2页,单变量横截面数据的特征描述主要包括四个方面:集中度、离差度、偏度和峰度。各种有代表性的定量特征值,什么是代表性值,代表性有多大,代表性是否可靠,集中趋势的测量,离散趋势,分布特征,平均指数,变异指数,偏度峰度指数,基本公式,简单公式,加权公式,算术平均,调和平均,几何平均,中位数,第三章描述数据分布特征,第3页,第1节,统计变量集中趋势的测量,第2节,统计变量离差度的测

2、量,第3节, 变量分布的偏斜度和峰度,第4节,通过电子表格计算对统计指标的描述,第4页,第1节,统计变量集中趋势的测量1。 用于确定浓度趋势的指标及其功能,两个数字平均值,三种模式和中间值,第5页。1.指标及其确定集中趋势的功能,具有较大和较小集中趋势的观测值出现频率较低,且大部分观测值密集分布在中心附近,因此所有数据都表现出聚集或接近中心的趋势。衡量集中趋势的指标有两种:数值平均是根据所有数据计算的代表值,主要包括算术平均、调和平均和几何平均;位置代表值是根据数据的位置直接观察到的或根据与特定位置相关的一些数据确定的代表值,主要包括模式和中间值。第6页,测量集中趋势指数的功能,1反映集中趋势

3、和一般水平的变量分布。如果用平均工资来理解员工工资分配的中心,它将反映员工工资的总体水平。它可以用来比较同一现象在不同空间或阶段的发展水平。不受整体大小的影响;在一定程度上,偶然因素的影响是相互抵消的。3可以用来分析现象之间的相互依存关系。例如,研究工人的教育水平和收入之间的关系。4平均指数也是统计推断中的一个重要统计量,是统计推断的基础。第7页,2,数字平均,(1)算术平均(average)一组数据的总和除以该组数据中的项目数的结果;最常用的数字平均值。1简单算术平均值直接对每一项数据求和,然后除以项目数。通常用于计算未分组数据的算术平均值。计算公式:第8页,2。数字平均值,2。加权算术平均

4、计算公式:加权为了反映变量值的不同影响,给每个变量值赋予不同的权重。第9页,第二部分。数值平均值,2加权算术平均值计算加权算术平均值的公式:权重(fi,也称为权重)权重是指在计算总体平均值或综合水平的过程中,在加权每个数据时起作用的变量。它可以用绝对数字或比重(如频率)来表示。事实上,比重可以直接显示称量重量的本质。第10页,第二部分。数值平均,2加权算术平均权重性质:权重为了反映变量值的不同影响,给每个变量值赋予不同的权重。表1,表2,表3,大变量值组权重,小变量值组权重,那么平均值是小的。第11,3页通过组距离序列计算算术平均值每个组的变量值由组中值表示。假设每组中的数据均匀分布或对称分布

5、。计算结果是近似值。,2。数字平均值,第12,4页计算相对数字的算术平均值。由于每个相对数的比较基础不同,采用简单算术平均通常是不合理的,需要进行加权。权重的选择必须符合相对数本身的计算公式。权重通常是相对数字的分母指数。算术平均值的主要数学性质(1)算术平均值和变量值的数量的乘积等于每个变量值的和(2)每个变量值和算术平均值之间的偏差之和等于零(3)每个变量值和算术平均值之间的偏差之和最小、2、数值平均值,第14页,2、数值平均值,(2)调和平均值,表1,表2,在商业统计中使用的调和平均值通常是加权算术平均值的变形。对于分组数据,当每组的标记总数m已知而每组的单位总数f未知时,采用加权调和平

6、均。对于未分组的数据,或者当每个组具有相同的次数时,采用简单的算术平均。第15,2页。数字平均值,2。调和平均数调和平均数也称为倒数平均数。每个变量值的倒数(1/xi)是算术平均值的倒数。计算公式如下:对于未分组的数据,采用简单调和平均。对于分组数据,当每组的标记总数m已知,而每组的单位总数f未知时,采用加权调和平均。第16页,第二部分。数字平均【例】一个企业的产品加工应该经过五个连续的过程。本月,该企业每道工序的合格率分别为88、85、90、92和96,所以试着找出这五道工序的平均合格率。在这个例子中,每个过程的合格率都具有环比率的性质,企业产品的总合格率等于每个过程的合格率的连续乘积。因此

7、,平均合格率应为:(3)几何平均值,第17页,(3)几何平均值,n倍于n个可变几何平均值的乘积的平方根。简单几何平均的加权几何平均适用于变量值之间存在连续乘积关系的情况。它主要用于计算现象的平均发展速度;它也适用于平均一些具有环对环特性的比率。数字平均,第18页,数字平均摘要:数字平均,简单公式,加权公式,算术平均,调和平均,几何平均,算术和之间的关系,倒数和,连续乘积,从未分组的数据计算,从分组的数据计算,变量值之间的关系和数字平均的计算。例如,在表3-2中,年龄值是Mo25。模式代表了最常见和最普遍的情况,它是现象集中趋势的量度。它可以用来衡量定性变量的集中趋势;销量最大的产品颜色为“白色

8、”,莫为“白色”。可以测量定量变量的集中趋势。从分布曲线的角度来看,模式是对应于可变分布曲线最高点的变量值。第20页,要确定组距离系列中的模式,请先找到模式。在等距序列中,组是次数最多的组;在距离序列中,组应该是具有最高频率密度的组。根据组与相邻组之间的程度差异。其近似公式为:下限公式:上限公式:第21页。在第二部分,统计变量离散度的度量,有两类指标来度量集中趋势:数值平均主要包括算术平均、调和平均和几何平均;位置代表值主要包括模式和中间值。衡量偏离趋势的指标也有两种:数值平均的代表性主要包括极差、平均差、方差和标准差以及离散系数;位置代表值的代表性主要包括四分位数偏差和不同人群的比例。,第2

9、2页,第二节是统计变量离差度的测量,即指标及其测量离差度的函数,两个范围,四分位数偏差和平均差,三个方差和标准偏差,四个离差系数和五个不同的比值,第23页,即指标及其测量离差度的函数,1。解释数据的离散程度,反映变量的稳定性和均衡性。数据之间的差异越大,变量的稳定性或均衡性就越差。2.衡量平均值的代表性。分散程度越大,平均值的代表性越小。3.统计推断的重要依据是判断统计推断前提是否有效以及衡量推断效果的重要标准。第24页,第2页。极差、四分位偏差和平均差,(1)极差是一组数据的最大值(xmax)和最小值(xmin)之间的差,通常用R表示.对于整体数据,范围是可变变化的范围或幅度,也称为最高范围

10、组的上限-整个距离系列中最低范围组的下限。优缺点:计算简单,意义直观,容易理解。它没有考虑数据的中间分布,不能完全解释所有数据的差异程度。第25页,第2页。极端差异,四分位数偏差和平均差异,2。四分位数偏差中第三个四分位数(Q3)和第一个四分位数(Q1)之间的差异通常用Qd表示。计算公式是:实质上是去掉两端四分之一数据后的极端差值,表示中间数据占总数据的一半的离差程度。四分位数偏差越大,数据分散的程度就越大。优缺点:在一定程度上是对极值范围的改进,避免了极值的干扰。然而,它对数据差异的反映仍然不够。四分位数离差是一种序列统计,适用于有序数据和定量数据。尤其是当使用中位数来衡量数据集中的趋势时。

11、第26页,第二部分。极端差异、四分位偏差和平均差异。平均偏差(Average Distance)每个数据与其平均值之间的偏差的绝对值的算术平均值,它反映了每个数据与其平均值之间的平均差异,通常表示为d。计算公式为:优点和缺点:平均差异是明确的,可以充分反映数据的分散程度。然而,取偏差的绝对值求平均值在数学处理上不方便,在数学性质上也不是最佳的。分组数据:未分组数据:第27页,第三部分。方差和标准差。(1)方差的概念和计算方差是每个数据与其平均值之间的偏差的平方的算术平均值。总体方差(2)的计算公式为:样本方差的分母(通常用S2表示)应为(n -1)。分组数据:未分组数据:第28页,iii。方差

12、和标准差,标准差:方差的算术平方根。人口标准差一般用。计算公式为:样品的标准偏差应为(n-1)。标准差比方差更容易理解。在社会经济现象的统计分析中,标准差比方差使用得更广泛,方差通常被用作衡量数据和平均值之间差异的标准度量。分组数据:未分组数据:第29页,计算平均差异和方差,标准差,第30页,iii,方差和标准差。(2)方差的主要数学性质常数的方差等于零。a是常数,那么变量的线性函数的方差等于变量的系数的平方乘以变量的方差。如果A和B是常数,y=bx,那么群体的方差等于群体间方差和每个群体平均方差之和。组间方差,各组的平均方差,第31页,第三节。方差和标准差,三。标准化值(Z值)标准化值或标准

13、分数也称为Z值。来自具有不同均值和标准差的个体的数据不能直接比较。有必要将它们转换成相同规格和比例的数据,然后进行比较。事实上,规范化的值是转换张在第一次和第二次考试中的分数分别是92分和80分,那么与全班相比,他哪一次考试考得更好呢?解决方法:因为两次考试的平均值和标准差不同,所以不适合每个学生直接比较两次考试。与标准值相比,第二次考试的结果更好。第33、3页。方差和标准差,4。对称钟形分布中的规则3关于钟形分布的近似或经验规则:变量值超出-3,3的范围是极其罕见的。因此,落在区间-3,3之外的数据通常被称为异常数据或异常值。第34、4页。离散系数,所有以前的变异指标都有度量单位,它们的数值

14、不仅取决于数据的离散程度,还取决于数据本身的水平和度量单位。当比较不同变量(或不同数据组)的离差时,只有当它们的平均水平和测量单位相同时,才能用上述变异指数进行分析;否则,应使用分散系数来比较它们的分散程度。例如,哪个变量更不同:体重还是身高?例如,哪一个在体重上的差异更大:父亲还是婴儿?父亲:平均体重=70公斤,标准差=5公斤,婴儿:5公斤,1公斤,第35页,第4页。离差系数,是极端差、四分位数偏差、平均差或标准差等变异指标与算术平均值的比值,以相对数的形式表示变异程度。通过将范围与算术平均值进行比较来获得范围系数,并且通过将平均差值与算术平均值进行比较来获得平均差值系数。最常用的离差系数是

15、根据标准差计算的,称为标准差系数:离差系数大表示数据离差程度大,其平均值的代表性差;反之亦然。第36页,v .异类比,是指非主导值的次数之和占总次数的比例,主要用来衡量以模式为分布中心的一组数据的集中程度,即衡量代表一组数据总体水平的模式的代表性。该值越小,数据集中程度越高,模式的表示越多。第37页,第3节变量分布的偏斜度和峰度,一个矩(动态差),两个偏斜度,三个峰度),第38页,一阶矩(动态差),矩(动态差),一系列表征数据分布的指标。变量值和数值A之间的偏差的第k次幂的平均值称为变量X相对于A的第k次矩,即第39页,第k次原点矩(当a=0时)是数据的第k次幂的平均值,即算术平均值;二阶原点矩是平方平均。k阶中心矩(当a=平均值时)是偏离k次方的平均值。当k=1时,称为一阶中心矩,它总是等于0,即m1=0;当k=2时,称为二阶中心矩,即方差,即m2=2。第40页,第2页。偏斜度,指数据分布的不对称或偏斜程度。使用对称分布作为区分偏态分布的标准,它可以分为左偏态(负偏态)和右偏态(正偏态),左偏态分布(负偏态),右偏态分布(正偏态),第41页,以及偏态测量方法(1)

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论