第4章 统计数据分布特征的测定_第1页
第4章 统计数据分布特征的测定_第2页
第4章 统计数据分布特征的测定_第3页
第4章 统计数据分布特征的测定_第4页
第4章 统计数据分布特征的测定_第5页
已阅读5页,还剩65页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

第四章统计数据分布特征的测定统计数据总体分布特征测定包括:1、数据分布集中趋势的测定2、数据分布离散程度的测定3、数据分布偏度与峰度的测定§4.1统计数据分布集中趋势的测定集中趋势(centraltendency)是指一组数据向某一中心值靠拢的程度,它反映了一组数据中心点的位置所在。数据分布集中趋势的测定就是寻找数据水平的代表值或中心值,在统计学中,这种有代表性的数值又通俗的被称为平均数。§4.1统计数据分布集中趋势的测定本节将针对不同类型的变量,介绍两种类型的平均数,分别是数值平均数和位置平均数,包括算术平均数、调和平均数、几何平均数及众数、中位数、四分位数等六个指标。这两类平均数的涵义不同、计算方法不同、应用场合也不同。§4.1统计数据分布集中趋势的测定§4.1.1算术平均数

§4.1统计数据分布集中趋势的测定§4.1.1算术平均数1、简单算术平均数

----根据未经分组整理的数据计算的平均数§4.1统计数据分布集中趋势的测定§4.1.1算术平均数2、加权算术平均数

----根据经过分组整理后的数据计算的平均数,要以各组变量值的次数(频数或频率)为权数,进行加权计算

§4.1统计数据分布集中趋势的测定上述公式更清晰地表达了加权算术平均数受各组变量值与各组权数比重大小的影响§4.1统计数据分布集中趋势的测定§4.1.1算术平均数3、算术平均数的数学性质(1)总体单位数与其算术平均数的乘积等于总体标志总量(2)各变量值与其算术平均数的离差之和等于零(3)各变量值与其算术平均数的离差平方和为最小§4.1统计数据分布集中趋势的测定§4.1.1算术平均数4、算术平均数的特点及应用算术平均数是根据所有变量值综合计算出来的,属于数值平均数有时为了提高算术平均数的代表性,通常先从数据中删除极大值和极小值,根据剩余的数据计算算术平均数,这样得到的平均数叫切尾平均数,又称为截尾平均数§4.1统计数据分布集中趋势的测定§4.1.2调和平均数调和平均数(harmonicamean)是算术平均数的另一种形式,是一组数据中各个变量值倒数的算术平均数的倒数,因而又称为倒数平均数。§4.1统计数据分布集中趋势的测定§4.1.2调和平均数1、简单调和平均数2、加权调和平均数

§4.1统计数据分布集中趋势的测定§4.1.2调和平均数3、由相对数或平均数求平均数对相对数或平均数求平均数时,应注意以下几点:第一,明确相对数或平均数的分子,分母指标是什么,即相对数或平均数由哪两个指标对比形成的;第二,已知相对数或平均数的分子、分母指标时,用分子指标总数除以分母指标的总即为相对数或平均数的平均数;第三,已知相对数或平均数的分子指标时,以分子指标为权数,采用加权调和平均法计算其平均数;已知相对数或平均数的分母指标时,以分母指标为权数,采用加权算术平均法计算其平均数;第四,加权平均所采用的权数必须是相对数或平均数本身的分子或分母指标。§4.1统计数据分布集中趋势的测定§4.1.3几何平均数几何平均数(Geometricalmean)是一组数据中个变量值连乘积的次方根。几何平均数是一种具有特殊用途的平均指标。1、简单几何平均数§4.1统计数据分布集中趋势的测定§4.1.3几何平均数2、加权几何平均数§4.1统计数据分布集中趋势的测定§4.1.4.众数众数(mode)是数列中次数最多的那个变量值,用Mo表示。众数不仅用于反映数值型变量的集中趋势,还可用于反映定性变量的集中趋势。(1)单项式数列或品质数列确定众数时,只需找出次数最多的变量值即为众数值。§4.1统计数据分布集中趋势的测定§4.1.4.众数(2)组距式数列确定众数时,众数的数值与其相邻组的次数分布有一定的关系,这种关系如下图(a)fmfm+1Moxffm-1fmfm+1Moxf(b)fm-1fmfm+1Moxf(c)fm-1§4.1统计数据分布集中趋势的测定§4.1.4.众数上限公式:

上限公式:§4.1统计数据分布集中趋势的测定§4.1.4.众数2、众数的特点从众数的计算公式可以看出,众数是根据众数组及相邻组的次数分布来确定数据中心点仿置的,因此,众数是一个位置代表值,它不受数据中极端值的影响。从变量值次数分布的角度看,众数是具有明显集中趋势点的数值,它是一组数据分布的最高峰点所对应的数值。如果数据分布没有明显集中趋势,则众数不存在;如果数据较多,数据分布呈现出两个高峰点,则就有两个众数。§4.1统计数据分布集中趋势的测定§4.1.5中位数中位数(Median)是把一组数据排序后,处于中间位置上的那个变量值,用Me表示。中位数适合于数值型变量和顺序变量集中趋势的确定,但不适用于分类变量。§4.1统计数据分布集中趋势的测定§4.1.5中位数1、中位数的确定(1)未分组资料未分组的数据确定中位数时,先要对数据按大小顺序加以排列;再确定中位数所处位置;然后再根据中位数位置确定中位数数值。§4.1统计数据分布集中趋势的测定§4.1.5中位数(2)已分组资料分组数据确定中位数时,分以下几个步骤进行:第一,确定中位数位置;第二,根据向上累计次数判断中位数所在组;向上累计次数是将变量值从小到大排序后,各组次数依次递加的累计第三,由公式确定中位数的数值;§4.1统计数据分布集中趋势的测定§4.1.5中位数下限公式为:

上限公式为:§4.1统计数据分布集中趋势的测定§4.1.5中位数2、中位数的应用中位数是将一组数据排序后一分为二,中间位置上的变量值即为中位数。可见,中位数是以中间位置上的变量值为集中趋势的代表,其不受极端值的影响。当数据较多而有极端出现时,此时中位数的代表性优于算术平均数。在实际经济统计中,人口年龄特征值通常以年龄中位数为代表值来加以描述。§4.1统计数据分布集中趋势的测定§4.1.6四分位数四分位数是指一组数据排序后,处于第一个分割点即25%位置和第三个分割点即75%位置上的变量值。通常第一个分割点上的数值叫下四分位数,用Q1表示,第三个分割点上的数值叫上四分位数,用Q3表示。四分位数的确定类似中位数,先确定位置,再确定分位数值。§4.1统计数据分布集中趋势的测定§4.1.6四分位数1、对于未分组的资料,四分位数的位置分别为:下四分位数的位置为:上四分位数的位置为:两个分割点位置上的数值即为四分位数的数值§4.1统计数据分布集中趋势的测定§4.1.6四分位数若(n+1)恰好为4的倍数,则Q1、Q3直接为其位置上的变量值若(n+1)不是4的倍数,则Q1、Q3可加权平均算出,也可简单平均计算。§4.1统计数据分布集中趋势的测定§4.1.6四分位数2、对于已分组资料,四分位数的位置分别为:与,通过累计次数可以判断四分位数所在组,四分位数的数值按公式计算为:§4.1统计数据分布集中趋势的测定§4.1.6四分位数下限公式为:§4.1统计数据分布集中趋势的测定§4.1.6四分位数上限公式为:

§4.1统计数据分布集中趋势的测定§4.1.7各种平均数的比较1、数值平均数与位置平均数的比较第一,数值平均数是根据一组数据的全部数值综合计算而得出,概括了反映了所有变量值的平均水平,位量平均数则是以一组数据中全部数值的某些特殊位置上的个别数值为总体的代表性数值。第二,数值平均数受一组数据中某些极端值的影响明显,位置平均数则几乎不受极端值变量值的影响。第三,数值平均数适合于数值型变量,对变量值的量化尺度要求高;位置平均数不仅适合于量化程度高的数值型变量,也适合于量化程度较低的定性变量,其中众数适合于各种类型的变量,包括顺序型变量和分类型变量,分位数更适合于顺序型变量。这表明位置平均数的用途更为广泛。§4.1统计数据分布集中趋势的测定§4.1.7各种平均数的比较2、众数、中位数与算术平均数的比较如果次数分布是对称的,众数、中位数、算术平均数三者必然相等

如果次数分布向左偏时,说明数据中存在最小值,必然会拉动算术平均数向极小值一方靠,此时如果次数分布是右偏时,说明数据中存在最大值,必然会拉动算术平均数向极大值一方靠,此时§4.1统计数据分布集中趋势的测定§4.1.7各种平均数的比较§4.2统计数据分布离散程度的测定§4.2.1异众比率异众比率(VariationRatio)是指非众数组的频数占总频率的比率,用vr表示。异众比率的计算公式为:§4.2统计数据分布离散程度的测定§4.2.2四分位差四分位差(quartiledeviation)是上四分位数与下四分位数之差,也称为内距或四分位间距(inter-quartilerange),用表示四分位差的计算公式为:§4.2统计数据分布离散程度的测定§4.2.3极差极差(range)是一组数据的最大值与最小值之差,也称为全距,用R表示。极差的计算公式为:

§4.2统计数据分布离散程度的测定§4.2.4平均差平均差(meandeviation)是一组数据中各变量值与其算术平均数离差绝对值的平均数,也称为平均绝对离差(meanabsolutedeviation)用表示平均差的计算公式为:§4.2统计数据分布离散程度的测定§4.2.5方差与均方差方差(Variance)是一组数据中各变量值与其算术平均数离差平方的平均数。方差的平方根是均方差,又称为标准差。1、总体方差与均方差设为总体方差,为总体均方差对于未分组资料,方差与均方差按简单平均法计算,公式为:§4.2统计数据分布离散程度的测定§4.2.5方差与均方差对于已分组数据,方差与均方差则采用加权平均法计算,公式为:§4.2统计数据分布离散程度的测定2、样本方差与均方差设为样本方差,S为样本均方差,对于未分组资料,方差与均方差按简单平均法计算,方式为:§4.2统计数据分布离散程度的测定2、样本方差与均方差对于分组资料,方差,均方差采用加权平均法计算,公式为:§4.2统计数据分布离散程度的测定经验表明,当一组数据呈现对称分布时,将有68%的变量值位于之内;95%的变量值位于之内,99%的变量值位于之内而对于任意分布的一组数据,至少有75%的变量值位于之内;89%的变量值位于之内;94%的变量值位于之内§4.2统计数据分布离散程度的测定§4.2.6离散系数离散系数(coefficientofvariation)是反映一组数据相对变动程度或离散程度的指标,是平均差或均方差与其算术平均数的比值离散系数用V表示,则:§4.2统计数据分布离散程度的测定§4.2.6离散系数平均差系数

均方差系数§4.2统计数据分布离散程度的测定§4.2.6离散系数离散系数的应用条件:对于平均水平不同的同类数据,对于计量单位不同的不同类别的数据,平均差和均方差都难于比较它们的离散程度。为了消除变量值平均水平高低和计量单位不同对离散程度的影响,需要计算离散系数。§4.2统计数据分布离散程度的测定§4.3统计数据分布偏度与峰度的测定相对于集中趋势和离散程度而言,偏度和峰度主要不是从各单位变量值水平的角度考察分布的代表值或变异度,而是从整个分布图形的形状来考虑问题的,因而,它们所刻画的是数据分布的形态特征。§4.2统计数据分布离散程度的测定§4.3统计数据分布偏度与峰度的测定§4.3.1偏度偏度(skewness)是指一组数据分布的不对称程度,从不对称的方向看,包括左偏和右偏。在算术平均数与中位数、众数的比较中,我们可以大致地判断出数据分布是对称的,还是左偏或右偏,但是要判断数据分布的不对称程度,就要计算偏度系数(coefficientofskewness)指标了§4.2统计数据分布离散程度的测定§4.3统计数据分布偏度与峰度的测定§4.3.1偏度1、皮尔逊偏度系数算术平均数与众数的离差除以均方差的比值,称为皮尔逊偏度系数,用公式表示为§4.2统计数据分布离散程度的测定§4.3统计数据分布偏度与峰度的测定§4.3.1偏度1、皮尔逊偏度系数皮尔逊偏度系数的数值在-3~3的范围内。若算术平均数大于众数,为正,表示右偏或正偏分布;若算术平均数小于众数,为负,表示左偏或负偏分布。的绝对值越接近于3,表示数

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论