第2章 数据的描述(课件)-《统计学》同步教学(高等教育版)_第1页
第2章 数据的描述(课件)-《统计学》同步教学(高等教育版)_第2页
第2章 数据的描述(课件)-《统计学》同步教学(高等教育版)_第3页
第2章 数据的描述(课件)-《统计学》同步教学(高等教育版)_第4页
第2章 数据的描述(课件)-《统计学》同步教学(高等教育版)_第5页
已阅读5页,还剩140页未读, 继续免费阅读

付费下载

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

统计学

2026-9-212-1

第2章数据的描述

F2.1数据的计量与分类

F2.2数据的收集

F2.3数据的整理

F2.4集中趋势的度量

F2.5离散程度的度量

F2.6分布偏态与峰度

F2.7统计表

2026-9-212-2

【引例2.0】统计数据

F2009年7月9日随机抽查了某大学50名任课教师的年龄,原

始数据(周岁)如下:

33394527243530445247454240

46684847463960464751295947

29504329353029343345644644

6730272944533155414347

F这一大堆数据可能使你眼花缭乱,也许你并不能够一下

就记住所有数据。

F假如我们感兴趣的是教师年龄的分布,那么,你认为对上

述数据应该怎样分组才能显示教师年龄的分布特征?教师

年龄的集中趋势如何?离散程度怎样?分布的偏态及峰度

又应该如何测定呢?

2026-9-212-3

2.1数据的计量与分类

F数据的计量尺度

F数据的类型

2026-9-212-4

数据的计量尺度

F按照对现象计量程度的不同,可以将数据

计量尺度分为四种,即:定类尺度、定序

尺度、定距尺度、定比尺度。

F定类尺度(nominalscale)也称类别尺度或

列名尺度,它是把事物按属性或类别分组。

其计量的结果只是表现为某种类别,而对

各类间的其它差别却无法测度。

F例如:人口按性别分为男、女两组。

2026-9-212-5

定序尺度

F定序尺度(ordinalscale)也叫顺序尺度,

它是对事物之间等级差或顺序差别的测

度,具有定类尺度的所有性能。

F例如:学生的考试成绩分为优、良、中、

及格、不及格五组。

2026-9-212-6

定距尺度

F定距尺度(intervalscale)(也叫间隔尺

度),是对事物间的类别或次序间的

间距的测度,其计量结果表现为数值。

F例如:三名学生考试成绩分别为60分、

80分、90分。

2026-9-212-7

定比尺度

F定比尺度(ratioscale)(也叫比率尺度),

它与定距尺度属于同一层次,其计量结

果也表现为数值。

F例如:3个工人的月收入分别为2000元、

3000元、4000元。

2026-9-212-8

数据的类型

F四种尺度计量结果,形成三种数据:

分类数据、顺序数据和数值型数据。

F分类数据(categoricaldata)——是定类

尺度对现象计量的结果。

例如人口按性别分类,则“男”、

“女”即为分类数据。

2026-9-212-9

顺序数据

F顺序数据(rankdata)——是定序尺度对现

象计量的结果。

例如:人口按受教育程度分为“小学”、

“初中”、“高中”、“大学及以上”

组,则这里的“小学”、“初中”、

“高中”、“大学及以上”即为顺序数

据。

F分类数据和顺序数据合称为定性数据。

2026-9-212-10

数值型数据

F数值型数据(metricdata)——是定距尺

度和定比尺度对现象计量结果。

例如学生的考试成绩70分、工人的月

收入2000元均为数值型数据。

F数值型数据通常称为定量数据。

2026-9-212-11

问题讨论

F前面例子中涉及的“性别”、“经济类

型”、“受教育水平”、“考试成绩”、

“月收入”能看作数据吗?

F如果它们不能看作数据,那么应该怎样

正确理解这些概念?

2026-9-212-12

2.2数据的收集

F2.2.1数据的间接来源

F2.2.2数据的直接来源

2026-9-212-13

2.2.1数据的间接来源

F间接来源的数据我们称之为第二手数据。

F可从各种公开出版物(如统计年鉴

等)、报纸、杂志、图书、网络、新

闻媒体等获取。

2026-9-212-14

2.2.2数据的直接来源

F直接来源的数据我们称为第一手数据,

主要依赖统计调查得到。

2026-9-212-15

统计调查的分类

F统计调查按调查对象所包括的范围不同,

分为全面调查与非全面调查。

F统计调查按登记事物的连续性不同,分为

经常性调查和一次性调查。

F统计调查还可按组织方式不同分为统计报

表和专门调查(专门包括普查、抽样调查、

重点调查、典型调查)

2026-9-212-16

常用的统计调查方式

F统计报表(statisticalreportforms)是按照

国家有关法规的规定,自上而下地统一

布置,自下而上地逐级提供基本统计数

据的一种调查方式。

F统计报表目前是一种搜集数据的重要方

式,但已不是主要方式。

2026-9-212-17

普查

F普查(census):是为特定目的而专门组织

的一次性全面调查。普查所搜集的是那

种经常的、定期的统计报表所不能提供

的更为详细的资料,主要是表明现象在

某一时点上的情况,时间性要求很强。

2026-9-212-18

普查的特点

F(1)需要规定统一的标准时间(资料所属

时间),以避免调查数据的重复或遗漏;

F(2)通常是一次性或周期性的;

F(3)普查的数据一般较为准确,规范化程

度较高;

F(4)普查适用的对象比较狭窄,只能调查

一些最基本、最一般及特定的现象。

2026-9-212-19

抽样调查

F抽样调查(samplingsurvey):是从研究对

象的总体中随机抽取一部分个体作为样

本进行调查,并根据调查结果来推断总

体数量特征的一种非全面调查方法。

F抽样调查的特点:经济性好、实效性

强、适应面广、准确性高。

2026-9-212-20

2.3数据的整理

F2.3.1分类数据和顺序数据的整理

F2.3.2数值型数据的整理

2026-9-212-21

2.3.1分类数据和顺序数据的整理

F对分类数据和顺序数据,我们可以计算

出每一类别出现的频数或频率,通过频

数分布表和图形来展示。

2026-9-212-22

1.用频数分布表展示分类数据

和顺序数据

F用表格的形式将分类数据或顺序数据各分组

极其相应的频(次)数全部罗列出来,就是

频数分布表(或次数分布表)。

F分布在各组的单位数称为频数(frequency),

也叫次数,各组次数与总次数之比称为频率,

也叫比重(例)(proportion)。一组资料中,

各组频率之和等于100%(或1)。

2026-9-212-23

【例2.1】

——频数分布表的编制

F(数据文件为example2.1)

对某高校经济系30名教师性别及职称登

记结果,如表2.1所示,试用SPSS分别

编制教师性别及职称的频数分布表。

2026-9-212-24

【例2.1】

——频数分布表的编制

原始数据:

表2.1某高校30名教师性别及职称情况统计表

序号性别职称序号性别职称序号性别职称

1男讲师11男教授21男副教授

2女助教12女副教授22女副教授

3女副教授13女副教授23男讲师

4女副教授14男讲师24女助教

5男助教15男讲师25男副教授

6男教授16男副教授26男讲师

7女教授17女讲师27女教授

8男讲师18男助教28男讲师

9女副教授19女副教授29男副教授

10男教授20女副教授30女教授

2026-9-212-25

【例2.1】

——频数分布表的编制

F解:首先将教师性别用代码0、1表示;

将教师职称用代码2、3、4、5表示,然

后在数据文件的VaribleView窗口

Values栏定义变量值标签:

0表示女性,1表示男性;2表示助教,3

表示讲师,4表示副教授,5表示教授。

2026-9-212-26

【例2.1】

——频数分布表的编制

FSPSS操作步骤:

File→open→Data→example2.1→Ana

lyze→DescriptiveStatistics→Frequen

cies→将“性别”选入Variable框→OK。

输出结果如表2.2及表2.3所示:

表2.2某高校30名教师性别分组频数分布表

Cumulative

FrequencyPercentValidPercentPercent

Valid0女46.7

1446.746.7

1男100.0

1653.353.3

Total30100.0100.0

2026-9-212-27

【例2.1】

——频数分布表的编制

表2.3某高校30名教师职称分组频数分布表

Cumulative

FrequencyPercentValidPercentPercent

Valid2助教413.313.313.3

3讲师826.726.740.0

4副教授1240.040.080.0

5教授620.020.0100.0

Total30100.0100.0

F表2.2及表2.3中,Frequency为频数,

Percent为各组频数占总数的百分比,Valid

Percent为各组频数占总数的有效百分比,

CumulativePercent为各组频数占总数的累积

百分比。

2026-9-212-28

2.用图形展示分类数据

和顺序数据

F适合分类数据和顺序数据的图形有条形图、

饼图等。

F条形图:是用条形高度来表示数据多少的

图形。

F饼图:又称圆图,它是以整个圆代表总体,

按总体各部分占总体比重的大小将圆面积

分割成若干扇形,从而用圆内扇形面积来

直观反映各部分在总体中的比例。

2026-9-212-29

【例2.2】

——条形图的绘制

F(数据文件为example2.2)根据表2.3资

料,用SPSS绘制条形图。

F解:SPSS操作步骤:

File→open→Data→example2.2→Grap

hs→Bar→选中Simple,选中

Summariesforgroupsofcases→单击

Define→选中OtherSummary

function→将“人数”选入Variable(纵

轴),将“职称分类”选入Category

Axis(横轴)→OK。输出结果如图2.1所

2026示-9-21:2-30

【例2.2】

——条形图的绘制

F输出结果:

图2.130名教师职称分布条形图

14

12

10

8

n

a

e6

M

数

4

人

2

副教授讲师教授助教

职称分类

2026-9-212-31

【例2.3】

——饼图的绘制

F(数据文件为example2.2)根据表2.3资料,

用SPSS绘制饼图。

F解:SPSS操作步骤:

File→open→Data→example2.2→Graph

s→Pie→选中Valuesofindividual

cases→单击Define→将“人数”选入

SlicesRepresent栏,将“职称分类”选

入Variable栏→OK。输出结果如图2.2所示:

2026-9-212-32

【例2.3】

——饼图的绘制

F输出结果:

图2.230名教师职称分布饼图

助教

教授

讲师

副教授

2026-9-212-33

2.3.2数值型数据的整理

F用频数分布表(变量数列)展示数值型数据

F用图示展示数值型数据

F频数分布的类型

2026-9-212-34

1.用频数分布表(变量数列)展示

数值型数据

F将数值型数据进行统计分组,就可以形成

频数分布表(变量数列)。

F制作频数分布表时可用单变量值分组,也

可用组距分组。

F单变量值分组通常适用于离散变量,且变

量值变动幅度不大时;组距分组通常适用

于变量值较多、且变动范围较大的离散型

或连续型变量。

2026-9-212-35

【例2.4】

——单变量值分组

F某班学生按年龄(周岁)分组的结果如表

2.4所示:

表2.4某班学生按年龄(周岁)分组情况表

按年龄分组(周岁)学生人数(人)比重(%)

18310.00

19620.00

201240.00

21723.33

2226.67

合计30100.00

2026-9-212-36

组距分组中的几个基本概念

F组限:每个组两端的数值。分为上限和

下限。

F组距:一个组的上限与下限两端的距

离。

F全距:所有变量值中最大值与最小值

之差。

F组中值:每个组的上限与下限的中点

值。

2026-9-212-37

组距分组的步骤

F第一,确定组数。

可以按斯特格斯的经验公式确定组数K:

lgNlgN

K1113.322lgN(N为数据的个数)

lg20.30103

F第二,确定各组的组距。

实际中先确定组数或先确定组距均可:

全距全距

组距,或组数

组数组距

F第三,整理成频数分布表。

2026-9-212-38

【例2.5】

——组距分组

F2009年7月9日随机抽查了某大学50名任

课教师的年龄,原始数据(周岁)如下:

33394527243530445247

45424046684847463960

46475129594729504329

35302934334564464467

30272944533155414347

试对数据进行组距分组。

2026-9-212-39

【例2.5】

——组距分组

F解:

F此处采用先确定组距的方式。根据本例的

数据水平及全距大小,组距拟定为10。

F对原始数据分组,整理成频数分布表如表

2.5所示:

2026-9-212-40

【例2.5】

——组距分组

F分组结果:

表2.550名教师年龄分组频数分布表

按年龄分组(周人数(人)比重(%)

岁)

20~30816

30~401122

40~502142

50~60612

60~7048

合计50100

2026-9-212-41

【例2.5】

——组距分组

F本例还可采用间断式组距形式分组,如

表2.6所示:

表2.650名教师年龄分组频数分布表

按年龄分组(周人数(人)比重(%)

岁)

20~29816

30~391122

40~492142

50~59612

60~6948

合计50100

2026-9-212-42

【例2.5】

——组距分组

F本例还可采用开口组形式分组,如表2.7所

示:

表2.750名教师年龄分组频数分布表

按年龄分组(周人数(人)比重(%)

岁)

30以下816

30~401122

40~502142

50~60612

60以上48

合计50100

2026-9-212-43

累计次数与累计频率

F有时为了研究次数分布的状况,需要计算

累计次数或累计频率,方法有两种:

F向上累计(积),也称较小制累计(积)

或以下累计(积),即把各组次数或频率

由变量值小的组向变量值大的组顺序逐组

累计(积),截至各组的累计(积)次数

或累计(积)频率表示小于该组变量值上

限的次数或频率合计有多少。

2026-9-212-44

累计次数与累计频率

F向下累计(积),也称较大制累计(积)

或以上累计(积),即把各组次数或频率

由变量值大的组向变量值小的组顺序逐组

累计(积),截至各组的累计(积)次数

或累计(积)频率表示大于该组变量值下

限的次数或频率合计有多少。

2026-9-212-45

累计次数与累计频率

F如对表2.5计算累计次数或累计频率,可得

累计频数(频率)分布表如表2.8所示:

表2.850名教师年龄分组累计频数(频率)分布表

按年龄频数频率(%)向上累计向下累计

分组(人)频数频率(%)频数频率(%)

(周岁)(人)(人)

20~3081681650100

30~40112219384284

40~50214240803162

50~6061246921020

60~70485010048

合计50100————

2026-9-212-46

【例2.6】

——SPSS制作频数分布表

F(数据文件为example2.3)

2007年我国各地区农村居民家庭人均

纯收入资料如表2.9所示,试用SPSS

制作频数分布表。

2026-9-212-47

【例2.6】

——SPSS制作频数分布表

F原始数据:

表2.92007年我国各地区农村居民家庭人均纯收入

地区人均纯收入(元)地区人均纯收入(元)

北京9439.63湖北3997.48

天津7010.06湖南3904.20

河北4293.43广东5624.04

山西3665.66广西3224.05

内蒙古3953.10海南3791.37

辽宁4773.43重庆3509.29

吉林4191.34四川3546.69

黑龙江4132.29贵州2373.99

上海10144.62云南2634.09

江苏6561.01西藏2788.20

浙江8265.15陕西2644.69

安徽3556.27甘肃2328.92

福建5467.08青海2683.78

江西4044.70宁夏3180.84

山东4985.34新疆3182.97

河南3851.60——

2026-9-212-48

【例2.6】

——SPSS制作频数分布表

F解:

F首先将农村居民家庭人均纯收入用代码1、

2、3、4、5表示,然后在数据文件的

VaribleView窗口Values栏定义变量值标

签。

F操作步骤:

File→open→Data→example2.3→Analyz

e→DescriptiveStatistics→Frequencies

→将“人均纯收入”选入Variable框→OK。

输出结果如表2.10所示:

2026-9-212-49

【例2.6】

——SPSS制作频数分布表

F输出结果:

表2.102007年我国各地区农村居民家庭人均纯收入的频数分布表

FrequencValidCumulative

yPercentPercentPercent

Valid3000元以下(含19.4

618.819.4

3000)

3000元-4000元58.1

1237.538.7

(含4000元)

4000元-5000元77.4

618.819.4

(含5000元)

5000元-6000元83.9

26.36.5

(含6000元)

6000元以上100.0

515.616.1

Total3196.9100.0

Total32100.0

2026-9-212-50

2.用图形展示数值型数据

F适合数值型数据的图形有:

直方图(histogram)

箱线图(boxplots)

线图(linecharts)

茎叶图(stem-and-leafdisplay)

…………

2026-9-212-51

直方图

F直方图(histogram)是用矩形的宽度和高

度来表示频数分布的图形。若是等距数

列,一般用横坐标表示数据分组,而纵

坐标表示次数或频数;若是不等距数列,

则应按频数密度绘制直方图。

2026-9-212-52

【例2.7】

——直方图

F沿用【例2.5】教师年龄原始数据,用

SPSS绘制的直方图如下:

图2.3某大学50名教师年龄直方图

20

10

Std.Dev=10.80

Mean=42.3

0N=50.00

25.030.035.040.045.050.055.060.065.070.0

教师年龄

2026-9-212-53

箱线图

F箱线图(boxplots)是用一组数据的五个特

征值即最大值、最小值、中位数、上四

分位数、下四分位数来表示频数分布状

况的图形,它由一个箱子和两条线段组

成。每个箱子的中间横线是数据的中位

数。

F根据不同资料,可绘制简单箱线图或多

批箱线图。

2026-9-212-54

【例2.8】

——简单箱线图

F沿用【例2.5】教师年龄原始数据,用

SPSS绘制的简单箱线图如下:

图2.550位教师年龄箱线图

80

70

15

60

50

40

30

20

N=50

教师年龄

2026-9-212-55

【例2.9】

——多批箱线图

F现有某大学9名大一新生英语、语文、数

学的考试成绩如表2.11所示,试绘制多批

箱线图,比较9名学生的各科成绩。

表2.119名大一新生英语、语文、数学考试成绩

考试成绩(分)

学生编号英语语文数学

1705667

2658054

3893398

4346978

5668570

6788780

7806269

8935085

9567875

合计———

2026-9-212-56

解:用SPSS16.0绘制的多批箱线图如图

2.6所示:

F图2.69名学生各科成绩的箱线图

120

100

3

80

60

40

4

20

N=999

英语数学语文

2026-9-212-57

线图

F线图(linecharts)是用线条的延伸和波动

来表明现象变动情况的图形,它主要用

于表示现象在不同时间上的变化趋势。

2026-9-212-58

【例2.10】

——线图

F1998~2008年我国农村居民人均纯收入及

城镇居民人均可支配收入资料如表2.12所

示,试用SPSS绘制线图。

表2.121998~2008年我国农村居民人均纯收入及城镇居民人均可支配收入

时间(年)农村居民人均纯收入(元)城镇居民人均可支配收入(元)

199821605425

199922105854

200022536280

200123666860

200224767703

200326228472

200429369422

2005325510493

2006358711759

2007414013786

2008476115781

2026-9-21合计2-59

解:用SPSS16.0绘制的线图如图

2.7所示:

F图2.71998~2008年我国农村居民人均纯收入及城镇居民人均可支配收入线图

18000

16000

14000

12000

)10000

元

(8000

入

收

6000

4000

2000农村居民

0城镇居民

19981999200020012002200320042005200620072008

年份

2026-9-212-60

茎叶图

F茎叶图(stem-and-leafdisplay)又称“枝叶

图”,它是将数组中变化不大的高位数

作为一个主干(茎),将变化大的低位

数作为分枝(叶),列在主干的后面,

来表示频数分布的。

F茎叶图与直方图相类似,但又与直方图

不同。茎叶图保留了原始资料的信息,

而直方图则无原始资料的信息。

2026-9-212-61

【例2.11】

——茎叶图

F根据【例2.5】某大学50名教师年龄原始数

据绘制的茎叶图如图2.8所示:

图2.8某大学50名教师年龄茎叶图

树叶数据个数

树茎

2477999998

30001334559911

401233444555666677777821

50123596

604784

2026-9-212-62

如果茎叶图显得过于拥挤,还可以把它扩展,将每

个数茎分成两段,尾数0~4的在数茎后以“*”表示;

尾数5~9的在数茎后以“·”表示。如将图2.8扩展后,

便形成如图2.9所示的扩展的茎叶图:

F图2.9某大学50名教师年龄扩展的茎叶图

树茎树叶数据个数

2*41

2·77999997

3*00013347

3·55994

4*012334448

4·555666677777813

5*01234

5·592

6*042

6·782

2026-9-212-63

若用SPSS16.0绘制茎叶图,则如图2.10所示:

图2.10某大学50名教师年龄的茎叶图

教师年龄Stem-and-LeafPlot

FrequencyStem&Leaf

1.002.4

7.002.7799999

7.003.0001334

4.003.5599

8.004.01233444

13.004.5556666777778

4.005.0123

2.005.59

2.006.04

1.006.7

1.00Extremes(>=68)

Stemwidth:10

Eachleaf:1case(s)

2026-9-212-64

3.频数分布的类型

F常见的频数分布类型主要有钟形分布、J形

分布和U形分布,如图2.11所示:

图2.11几种常见的频数分布

(a)正态分布(b)右偏分布(c)左偏分布

(d)正J形分布(e)反J形分布(f)U形分布

2026-9-212-65

钟形分布

F钟形分布的特点是靠近中间的变量值分布

的次数多,靠近两端的变量值分布的次数

少,即“两头小、中间大”。

F钟形分布又分正态分布、右偏分布和左偏

分布,如图2.12所示:

图2.12钟形分布

(a)正态分布(b)右偏分布(c)左偏分布

2026-9-212-66

J形分布及U形分布

FJ形分布其分布图象像英文字母“J”字,包

括正J形分布和反J形分布两种类型。

FU形分布的特点是靠近中间的变量值分布的

次数少,靠近两端的变量值分布的次数多,

即“两头大、中间小”。

图2.13J形分布与U形分布

(d)正J形分布(e)反J形分布(f)U形分布

2026-9-212-67

2.4集中趋势的度量

F2.4.1均值

F2.4.2几何平均数

F2.4.3调和平均数

F2.4.4众数

F2.4.5中位数

F2.4.6四分位数

F2.4.7众数、中位数和均值的比较

2026-9-212-68

2.4.1均值

F均值(mean)是全部数据的算术平均,

也称算术平均数。

F均值在统计分析中具有重要的地位,是

集中趋势的最主要测度值。

F根据掌握的资料不同,均值有简单均值

与加权均值两种计算形式。

2026-9-212-69

简单均值

F适用于未分组数据。

F计算公式:n

xi

xxx

x12ni1

nn

式中:

—变量值

xi(i1,2,n)

n—变量值的个数

—求和符号

x—均值

2026-9-212-70

【例2.12】

——简单均值

F沿用【例2.5】中某大学50名任课教师年龄

的原始数据(周岁):

333945272435304452474542404668

484746396046475129594729504329

353029343345644644673027294453

3155414347

则教师的平均年龄为:

xxx3339454347

x12n

n50

2114

4

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论