第四章 数据的描述2(课件)- 《统计学(第二版) 》同步教学(人民大学版)_第1页
第四章 数据的描述2(课件)- 《统计学(第二版) 》同步教学(人民大学版)_第2页
第四章 数据的描述2(课件)- 《统计学(第二版) 》同步教学(人民大学版)_第3页
第四章 数据的描述2(课件)- 《统计学(第二版) 》同步教学(人民大学版)_第4页
第四章 数据的描述2(课件)- 《统计学(第二版) 》同步教学(人民大学版)_第5页
已阅读5页,还剩58页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

§1集中趋势的度量

§2离散趋势的度量

§3偏态与峰度的度量

§4数据的标准化处理

集中趋势

是指一组数据向某中心值靠拢的倾向,是描述数据分布的一个重要

特征。

集中趋势的测度

实际是对一组数据的一般水平代表值或中心值的测度。

§1.1均值

§1.2中位数

§1.3众数

§1.4几何平均数

§1.5均值、中位数、众数的比较

均值(Mean)

又称平均数,是一组数据大小相互抵消的结果,可以看作是数据集

的重心。

是最主要的集中趋势测度统计量。

适用于定量变量的取值,一般用符号x表示。

1.未加权的算术平均数

未经分组整理的原始数据,其算术平均(arithmeticmean)的计算

就是直接将一组数据的各个数值相加除以数值个数,称为简单算术平均

数。

设一组样本数据为、、、,则算术平均数的计算公式为:

x1x2xn

n

xi

xxx

x12ni1

nn

【例4.1】根据表中给出的某高校统计学院20名同学的统计学期末成绩,

计算其平均成绩。

表4-130名被访者的月收入水平分组数据单位:分

1234567891011121314151617181920

学539491727653100821008894665751639283976455

•解:根据表中的数据,使用公式有

n

xi

xxx1531

x12ni176.55

nn20

•所以20名学生的统计学期末的平均成绩是76.55分。

2.加权的算术平均数

根据分组整理的数据计算的算术平均数,要以各组变量值出现的次

数或频数为权数计算加权算术平均数。

假设样本数据被分成组,样本数据各组变量的代表值用m1、m2、…

、mk表示,各组变量值出现的频数用f1、f2、…、fk,则加权算术平均数

的计算公式为:k

mifi

m1f1m2f2mkfki1

xk

f1f2fk

fi

i1

如果是单变量分组,上式中的代表值就是各组的分组变量值;

如果是组距分组,上式中的代表值就是各组的组中值。

加权算术平均数其数值的大小,不仅受各组变量值大小的影响,而且受

各组变量值出现的频数即权数大小的影响。

k

xf

iikf

i1i

xkxik

i1

fifi

i1i1

算术平均数的数学性质:

性质1各变量值与其算术平均数的离差之和等于零,即:

nk

或(xx)f0

(xix)0ii

i1i1

性质2各变量值与其算术平均数的离差平方和最小,即:

nk

2

最小值或2最小值

(xix)(xix)fi

i1i1

【例4.2】根据表中给出的某项调查中30名被访者的月收入水平分组数据

,计算其平均收入水平:

表4-230名被访者的月收入水平分组数据

收入水平分组(元)组中值被访者人数(人)

xifixifi

1000-2000150034500

2000-30002500717500

3000-400035001345500

4000-50004500522500

5000-60005500211000

合计——30101000

解:

5

xifi

101000

xi13366.67(元)

530

fi

i1

所以30名被访者的平均月收入水平是3366.67元。

均值的特点:

均值一般用于寻找定量数据的中心代表值,并不适用于定性数据。

均值的优点在于它对变量的每一个取值都加以利用。

均值的缺点在于其统计量的稳健性较差,即容易受到极端值的干扰。

中位数(median)

是将变量取值按大小顺序排列后,处于中间位置的那个变量值。适用于

定量变量,以及定性变量中的顺序变量取值的集中趋势测度。不适用于定性

变量中的分类变量取值。一般用Me表示。

1.中位数的确定

变量的取值数据规模较小时,将数据按大小排列。

当数据个数N为奇数时,处在N1位置上的变量取值大小即为改

2

组数据的中位数;

NN

当数据个数N为偶数时,处在和1位置上两个变量取值的简

22

单算术平均数即为中位数。

当为奇数时

XN1N

2

M

e

1当为偶数时

XNXNN

1

222

当变量的取值数据规模较大时,将数据按单变量分组或组距分组

,得到频数分布。对频数分布做向上累计或向下累计:

当f为偶数时,第f个变量值所在的组为中位数所在的组。

2

当f为奇数时,第f1个变量值所在的组为中位数所在的组。

2

如果是单变量分组,可以该组标志值作为中位数。

如果是组距分组,则采用如下公式近似计算得到计算公式

下限公式:f上限公式:f

SS

2m12m1

MeLiMeUi

fmfm

【例4.3】给出的某项调查中30名被访者的月收入水平分组数据,得到累

积频数分布表,计算其中位数。

f

解:15

2

对应的收入水平是,3000-4000元,因此该组就是中位数所在组,有

L3000U4000Sm13710Sm1257

fm13i1000

f

S

2m11510(元)

MeLi300010003384.6

fm13

f

S

2m1157

MeUi400010003384.6(元)

fm13

因此,30名被访者的月收入水平的中位数是3384.6元。

2.根据统计图来寻找中位数

假定数据在中位数所在组呈均匀分布,我们就可以利用直方图确

定中位数。

频20

数(

18

人)

16

14

12

10

8

6

4

2

0

90100110120130140150160170180190200

有效问卷数分组

图4-1100名调查员的有效问卷数分布直方图

例如图4-1所示,全部100名调查员的中位数说对应的位置应当是

50.5。通过图中观察在140-150组之前的累积频数是42,只需要在140-

150之间找到第8.5位置上所对应的数。

由于假设140-150间这18个数是均匀分布的,而这段区间的长时10,

8.5

因此区间上第8.5位置上的数应当是14010144.7。即中位数是

18

144.7。这一结果与实际情况有一些偏差,因为我们假定数据在140-150

这个区间是均匀的,而实际并非如此。

中位数的特点:

中位数很好的代表了一组数据的中间位置。

当直方图显示数据时一个有偏分布时,中位数具有较好的稳健性

,对极端值并不敏感。

中位数并没有利用数据的所有信息,其对原始数据信息的代表性

不如均值。

3.四分位数

四分位数是指一组数据按大小排序后处于25%和75%位置上的值

,也称四分位点。

通常所说的四分位数是指处在25%位置上的数值(下四分位数)

和处在75%位置上的数值(上四分位数)。令四分位数为,上四分位

数为,其计算公式是

QLXn1QUX3(n1)

44

当四分位数的位置不是整数时,按比例计算四分位数两侧的差值。

【例4.4】在某城镇随机抽取9个家庭,调查得到每个家庭的人均月收入

数据(单位:元)分别是2450,1950,1820,1860,2060,1900,2280

,2040,2700。要求计算这九个家庭人均月收入水平的四分位数。

解:将数据由小到大按顺序排列:1820,1860,1900,1950,2040,

2060,2280,2450,2700。

根据公式QLXn1X2.5,QUX3(n1)X7.5。由于2.5处于顺序为2和3的

44

两个数中间,因此按比例分摊两端的差值,即

QLX2.51860(19001860)*0.51880(元)。

同理,QUX7.52280(24502280)*0.52365(元)。

众数(mode)

是指一组数据中出现次数最多的变量值,主要用于测度分类数据的

集中趋势。

一组数据分布的最高峰点所对应的变量值即为众数。具有不唯一性

,用M0表示。

1.定性变量的众数确定

根据分类变量和顺序变量的不同取值得到频数分布,确定众数时

,只需找出频数出现最多所对应的变量取值即为众数。

例:

通过观察频数分布表,可以直观看到受教育水平为高中的频数最大

。因此对于3000名被调查者受教育水平来说,众数就是高中学历。

2.定量变量的众数确定

对于离散型变量的取值,计算众数时,只需找出出现次数最多的变

量取值即为众数。

【例4.5】根据表中35名调查员的有效问卷频数分布资料,确定众数。

解:根据表中所示,问卷数为145份所对应的人数是4人,高于其他

所有问卷数对应的人数。因此35名调查员有效问卷的众数是145份。

对于连续性变量的取值,首先根据组距分组得到频数分布。对于等

距分组,对应频数最大的组为众数所在组;对于不等距分组,对应频数

密度最大的组为众数组。

设众数组的频数为fm,众数前一组的频数为f1,众数后一组的频数

为f1。

假定数据在众数组均匀分布,众数与其相邻两组的频数分布有如下

关系:

下限公式:fmf1

MoLi

(fmf1)(fmf1)

上限公式:fmf1

MoUi

(fmf1)(fmf1)

30

【例4.6】根据例4.3,确定表中30名被访问者月收入水平的众数。

解:首先确定众数组是3000-40000元组,因此

L3000U4000fm17fm15fm13i1000

fmf1137

MoLi300010003428.6

(fmf1)(fmf1)(137)(135)

fmf1135

MoUi400010003428.6

(fmf1)(fmf1)(137)(135)

因此,30名被访者的月收入水平的众数是3428.6元。

众数的特点:

众数根据众数组及相邻组的频率分布信息来确定数据中心点位置的。

众数是一个位置代表值,它不受数据中极端值的影响。

对原数据信息的代表性也不如均值。

只有在数据量较多时才有意义。

几何平均数

几何平均数(geometricmean)也称几何均值,通常用来计算平均

比率和平均速度。计算公式为:

n

nn

MGx1x2xnxi

i1

几何平均数也可看作是算术平均数的一种变形

n

logX

1i

logM(logXlogXlogX)i1

Gn12nn

【例4.7】某股票投资者长期持有一只股票,2005-2008年每年的收益率

分别是5.6%,7.2%,28.5%,-15.6%。计算该股票投资者4年内的平均收

益率。

解:根据股票四年的平均收益率可得到其四年的相对价格分别是105.6%

,107.2%,128.5%,84.4%。计算四年平均相对价格

n

4

n

MGxi105.6%107.2%128.5%84.4%105.26%

i1

四年的平均收益率是105.26%-1=5.26%。

从分布的角度看:均值是一组数据全部数值的平均数。中位数是处

于一组数据中间位置上的数值。众数始终是一组数据分布的最高峰值。

对于具有单峰分布的大多数数据而言,均值、中位数、众数存在以

下关系:(1)当变量取值的频数分布对称时,则均值与众数、中位数三

者完全相等,即

xMeMo

xMeMo

正态分布

(2)当变量取值的频数分布呈现右偏时,说明数据存在最大值,必然拉

动均值向极大值一方靠,而众数和中位数由于不受极端值的影响,因此

,三者之间的关系为xMeMo

M0Mex

右偏分布

(3)当变量取值的频数分布呈现左偏时,说明数据存在最小值,必然拉

动均值向极小值一方靠,而众数和中位数由于不受极端值的影响,因此

,三者之间的关系为xMeMo。

xMeM0

左偏分布

当频数分布呈对称分布或近似对称分布时,以均值、中位数或众数

来描述数据的集中趋势都比较理想;

当频数分布呈偏态时,极端值会对均值产生较大影响,而对众数、

中位数没有影响,此时,用众数、中位数来描述集中趋势比较好。

根据经验,频数分布无论是左偏还是右偏,众数与中位数的距离约

为算术平均数与中位数的距离的两倍,即:

MeMoxMe

Mox3(xMe)3Me2x

§2.1异众比率

§2.2极差和四分位差

§2.3平均差、方差和标准差

§2.4离散系数

异众比率(variationratio)

是指一组数据中非众数(组)的频数占总频数的比例。既适用于定

性数据,也适用于定量数据,但主要用于测度分类数据的离散趋势。用

V表示。计算公式是:

r

fifmfm

Vr1

fifi

异众比率的作用是衡量众数对一组数据的代表性程度的指标。异众

比率越大,说明非众数组的频数占总频数的比重就越大,众数的代表性

就越差;反之,异众比率越小,众数的代表性就越好。

1.极差

级差(range)是一组数据的最大值与最小值之差,也称全距。级差

主要用于测度顺序数据和定量数据的离散趋势。用R表示。级差是最容易

计算的离散趋势的测度统计量。但它容易受极端值的影响。

计算公式是:

Rmax(xi)min(xi)

【例4.8】根据表4.5中35名调查员的有效问卷数分组表计算极差。

Rmax(xi)min(xi)14813117

2.四分位差

四分位数是指一组数据按大小排序后处于25%和75%位置上的值,

也称四分位点。通常所说的四分位数是指:

•处在25%位置上的数值(下四分位数)

•处在75%位置上的数值(上四分位数)。

记下四分位数为QL,上四分位数为QU

其计算公式是

QLXn1QUX3(n1)

44

当四分位数的位置不是整数时,按比例分摊四分位数两侧的差值。

内距或四分间距(inter-quartilerange):

四分位差是上四分位数与下四分位数之差,用Qd表示

计算公式为:

QdQUQL

克服了级差容易受数据中两端极值的影响这一缺陷。

在例4-4中,四分位差是2365-1880=485(元)

1.平均差

平均差(meandeviation)是一组数据与其均值离差绝对值的平均

数。用Md表示。据掌握资料的不同,有两种计算方法。

对于未分组数据,采用简单平均法,其计算公式是:

n

xix

Mi1

dn

对于分组数据,采用加权平均法,其计算公式是:

k

xixfi

i1

Mdk

fi

i1

【例4.9】根据表中给出的某项调查中30名被访者的月收入水平分组数据

,计算其平均差。

解:

k

xxf

ii22333.3

Mi1777.78(元)

dk30

fi

i1

平均差能够准确地、全面地反映一组数值的离散趋势。平均差用绝

对值进行运算,不适宜于代数形式处理,在实际应用上受到很大的限制

2.方差和标准差

方差(variance)是一组数据与其均值离差平方的算术平均数。标准

差(standarddeviation)是方差的平方根。方差、标准差是实际中应用

最广泛的离散趋势度量值。设总体的方差为2,标准差为。

对于未分组数据,方差和标准差的计算公式分别是:

NN

(XX)22

i(XiX)

2i1i1

NN

对于分组数据,方差和标准差的计算公式分别是:

K

2K

(XX)F2

ii(XiX)Fi

2i1i1

KK

F

Fii

i1i1

总体的方差和标准差在对各个离差平方平均时是除以数据个数或总

频数。样本的方差和标准差在对各个离差平方平均时是用样本数据个数

或总频数减1(称为自由度)去除总离差平方和。设样本的方差为s2,

标准差为s。

对于未分组的数据,方差和标准差的计算公式为:

nn

(xx)22

i(xix)

2i1

ssi1

n1n1

对于分组数据,方差和标准差的计算公式为:

kk

22

(xix)fi(xix)fi

2i1i1

sksk

fi1fi1

i1i1

【例4.10】根据表中给出的某项调查中30名被访者的月收入水平分组数

据,计算其方差和标准差。

解:

k

方差(xx)2f

ii27700007

s2i1955172.65

k301

fi1

i1

标准差

s955172.65977.33(元)

离散系数(coefficientofvariation)

是一组数据的标准差与其均值之比,又称变异系数。用Vs表示。主

要用于比较不同样本数据的离散程度。

s

计算公式是:V

sx

【例4.11】甲乙两地的个人收入调查中,甲地的人均月收入是6520元,

标准差是1640元;乙地的人均月收入是5800元,标准差是1300元。比较

甲乙两地人均月收入的差异程度。

解:

s甲1640

由x甲6520得到s甲1640Vs甲0.254

x甲6520

s乙1300

由x乙6520得到s乙1640Vs乙0.224

x乙5800

由于Vs甲Vs乙,因此甲地的人均月收入差异程度大于乙地。

§3.1矩

§3.2偏态

§3.3峰度

变量X的样本观测值与a之差k次方的平均数称为变量X关于a的k

n

阶矩。其公式表示是:k

(xia)fi

i1

n

fi

i1

当a0时,上式称为k阶原点矩,用字母M表示。当ax时,上式

称为k阶中心矩,用字母m表示。

nn

(xx)2f

xifiii

一阶原点矩是i1即均值,二阶中心矩是i1

M1nm2n

fifi

i1i1

偏态(skewness)是对数据分布对称性的侧度。

偏态系数用SK表示。偏态系数采用矩进行计算。

n

3

(xix)fi

计算公式是:m3i1

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论