版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
统计学
2026-9-212-1
第2章数据的描述
F2.1数据的计量与分类
F2.2数据的收集
F2.3数据的整理
F2.4集中趋势的度量
F2.5离散程度的度量
F2.6分布偏态与峰度
F2.7统计表
2026-9-212-2
【引例2.0】统计数据
F2009年7月9日随机抽查了某大学50名任课教师的年龄,原
始数据(周岁)如下:
33394527243530445247454240
46684847463960464751295947
29504329353029343345644644
6730272944533155414347
F这一大堆数据可能使你眼花缭乱,也许你并不能够一下
就记住所有数据。
F假如我们感兴趣的是教师年龄的分布,那么,你认为对上
述数据应该怎样分组才能显示教师年龄的分布特征?教师
年龄的集中趋势如何?离散程度怎样?分布的偏态及峰度
又应该如何测定呢?
2026-9-212-3
2.1数据的计量与分类
F数据的计量尺度
F数据的类型
2026-9-212-4
数据的计量尺度
F按照对现象计量程度的不同,可以将数据
计量尺度分为四种,即:定类尺度、定序
尺度、定距尺度、定比尺度。
F定类尺度(nominalscale)也称类别尺度或
列名尺度,它是把事物按属性或类别分组。
其计量的结果只是表现为某种类别,而对
各类间的其它差别却无法测度。
F例如:人口按性别分为男、女两组。
2026-9-212-5
定序尺度
F定序尺度(ordinalscale)也叫顺序尺度,
它是对事物之间等级差或顺序差别的测
度,具有定类尺度的所有性能。
F例如:学生的考试成绩分为优、良、中、
及格、不及格五组。
2026-9-212-6
定距尺度
F定距尺度(intervalscale)(也叫间隔尺
度),是对事物间的类别或次序间的
间距的测度,其计量结果表现为数值。
F例如:三名学生考试成绩分别为60分、
80分、90分。
2026-9-212-7
定比尺度
F定比尺度(ratioscale)(也叫比率尺度),
它与定距尺度属于同一层次,其计量结
果也表现为数值。
F例如:3个工人的月收入分别为2000元、
3000元、4000元。
2026-9-212-8
数据的类型
F四种尺度计量结果,形成三种数据:
分类数据、顺序数据和数值型数据。
F分类数据(categoricaldata)——是定类
尺度对现象计量的结果。
例如人口按性别分类,则“男”、
“女”即为分类数据。
2026-9-212-9
顺序数据
F顺序数据(rankdata)——是定序尺度对现
象计量的结果。
例如:人口按受教育程度分为“小学”、
“初中”、“高中”、“大学及以上”
组,则这里的“小学”、“初中”、
“高中”、“大学及以上”即为顺序数
据。
F分类数据和顺序数据合称为定性数据。
2026-9-212-10
数值型数据
F数值型数据(metricdata)——是定距尺
度和定比尺度对现象计量结果。
例如学生的考试成绩70分、工人的月
收入2000元均为数值型数据。
F数值型数据通常称为定量数据。
2026-9-212-11
问题讨论
F前面例子中涉及的“性别”、“经济类
型”、“受教育水平”、“考试成绩”、
“月收入”能看作数据吗?
F如果它们不能看作数据,那么应该怎样
正确理解这些概念?
2026-9-212-12
2.2数据的收集
F2.2.1数据的间接来源
F2.2.2数据的直接来源
2026-9-212-13
2.2.1数据的间接来源
F间接来源的数据我们称之为第二手数据。
F可从各种公开出版物(如统计年鉴
等)、报纸、杂志、图书、网络、新
闻媒体等获取。
2026-9-212-14
2.2.2数据的直接来源
F直接来源的数据我们称为第一手数据,
主要依赖统计调查得到。
2026-9-212-15
统计调查的分类
F统计调查按调查对象所包括的范围不同,
分为全面调查与非全面调查。
F统计调查按登记事物的连续性不同,分为
经常性调查和一次性调查。
F统计调查还可按组织方式不同分为统计报
表和专门调查(专门包括普查、抽样调查、
重点调查、典型调查)
2026-9-212-16
常用的统计调查方式
F统计报表(statisticalreportforms)是按照
国家有关法规的规定,自上而下地统一
布置,自下而上地逐级提供基本统计数
据的一种调查方式。
F统计报表目前是一种搜集数据的重要方
式,但已不是主要方式。
2026-9-212-17
普查
F普查(census):是为特定目的而专门组织
的一次性全面调查。普查所搜集的是那
种经常的、定期的统计报表所不能提供
的更为详细的资料,主要是表明现象在
某一时点上的情况,时间性要求很强。
2026-9-212-18
普查的特点
F(1)需要规定统一的标准时间(资料所属
时间),以避免调查数据的重复或遗漏;
F(2)通常是一次性或周期性的;
F(3)普查的数据一般较为准确,规范化程
度较高;
F(4)普查适用的对象比较狭窄,只能调查
一些最基本、最一般及特定的现象。
2026-9-212-19
抽样调查
F抽样调查(samplingsurvey):是从研究对
象的总体中随机抽取一部分个体作为样
本进行调查,并根据调查结果来推断总
体数量特征的一种非全面调查方法。
F抽样调查的特点:经济性好、实效性
强、适应面广、准确性高。
2026-9-212-20
2.3数据的整理
F2.3.1分类数据和顺序数据的整理
F2.3.2数值型数据的整理
2026-9-212-21
2.3.1分类数据和顺序数据的整理
F对分类数据和顺序数据,我们可以计算
出每一类别出现的频数或频率,通过频
数分布表和图形来展示。
2026-9-212-22
1.用频数分布表展示分类数据
和顺序数据
F用表格的形式将分类数据或顺序数据各分组
极其相应的频(次)数全部罗列出来,就是
频数分布表(或次数分布表)。
F分布在各组的单位数称为频数(frequency),
也叫次数,各组次数与总次数之比称为频率,
也叫比重(例)(proportion)。一组资料中,
各组频率之和等于100%(或1)。
2026-9-212-23
【例2.1】
——频数分布表的编制
F(数据文件为example2.1)
对某高校经济系30名教师性别及职称登
记结果,如表2.1所示,试用SPSS分别
编制教师性别及职称的频数分布表。
2026-9-212-24
【例2.1】
——频数分布表的编制
原始数据:
表2.1某高校30名教师性别及职称情况统计表
序号性别职称序号性别职称序号性别职称
1男讲师11男教授21男副教授
2女助教12女副教授22女副教授
3女副教授13女副教授23男讲师
4女副教授14男讲师24女助教
5男助教15男讲师25男副教授
6男教授16男副教授26男讲师
7女教授17女讲师27女教授
8男讲师18男助教28男讲师
9女副教授19女副教授29男副教授
10男教授20女副教授30女教授
2026-9-212-25
【例2.1】
——频数分布表的编制
F解:首先将教师性别用代码0、1表示;
将教师职称用代码2、3、4、5表示,然
后在数据文件的VaribleView窗口
Values栏定义变量值标签:
0表示女性,1表示男性;2表示助教,3
表示讲师,4表示副教授,5表示教授。
2026-9-212-26
【例2.1】
——频数分布表的编制
FSPSS操作步骤:
File→open→Data→example2.1→Ana
lyze→DescriptiveStatistics→Frequen
cies→将“性别”选入Variable框→OK。
输出结果如表2.2及表2.3所示:
表2.2某高校30名教师性别分组频数分布表
Cumulative
FrequencyPercentValidPercentPercent
Valid0女46.7
1446.746.7
1男100.0
1653.353.3
Total30100.0100.0
2026-9-212-27
【例2.1】
——频数分布表的编制
表2.3某高校30名教师职称分组频数分布表
Cumulative
FrequencyPercentValidPercentPercent
Valid2助教413.313.313.3
3讲师826.726.740.0
4副教授1240.040.080.0
5教授620.020.0100.0
Total30100.0100.0
F表2.2及表2.3中,Frequency为频数,
Percent为各组频数占总数的百分比,Valid
Percent为各组频数占总数的有效百分比,
CumulativePercent为各组频数占总数的累积
百分比。
2026-9-212-28
2.用图形展示分类数据
和顺序数据
F适合分类数据和顺序数据的图形有条形图、
饼图等。
F条形图:是用条形高度来表示数据多少的
图形。
F饼图:又称圆图,它是以整个圆代表总体,
按总体各部分占总体比重的大小将圆面积
分割成若干扇形,从而用圆内扇形面积来
直观反映各部分在总体中的比例。
2026-9-212-29
【例2.2】
——条形图的绘制
F(数据文件为example2.2)根据表2.3资
料,用SPSS绘制条形图。
F解:SPSS操作步骤:
File→open→Data→example2.2→Grap
hs→Bar→选中Simple,选中
Summariesforgroupsofcases→单击
Define→选中OtherSummary
function→将“人数”选入Variable(纵
轴),将“职称分类”选入Category
Axis(横轴)→OK。输出结果如图2.1所
2026示-9-21:2-30
【例2.2】
——条形图的绘制
F输出结果:
图2.130名教师职称分布条形图
14
12
10
8
n
a
e6
M
数
4
人
2
副教授讲师教授助教
职称分类
2026-9-212-31
【例2.3】
——饼图的绘制
F(数据文件为example2.2)根据表2.3资料,
用SPSS绘制饼图。
F解:SPSS操作步骤:
File→open→Data→example2.2→Graph
s→Pie→选中Valuesofindividual
cases→单击Define→将“人数”选入
SlicesRepresent栏,将“职称分类”选
入Variable栏→OK。输出结果如图2.2所示:
2026-9-212-32
【例2.3】
——饼图的绘制
F输出结果:
图2.230名教师职称分布饼图
助教
教授
讲师
副教授
2026-9-212-33
2.3.2数值型数据的整理
F用频数分布表(变量数列)展示数值型数据
F用图示展示数值型数据
F频数分布的类型
2026-9-212-34
1.用频数分布表(变量数列)展示
数值型数据
F将数值型数据进行统计分组,就可以形成
频数分布表(变量数列)。
F制作频数分布表时可用单变量值分组,也
可用组距分组。
F单变量值分组通常适用于离散变量,且变
量值变动幅度不大时;组距分组通常适用
于变量值较多、且变动范围较大的离散型
或连续型变量。
2026-9-212-35
【例2.4】
——单变量值分组
F某班学生按年龄(周岁)分组的结果如表
2.4所示:
表2.4某班学生按年龄(周岁)分组情况表
按年龄分组(周岁)学生人数(人)比重(%)
18310.00
19620.00
201240.00
21723.33
2226.67
合计30100.00
2026-9-212-36
组距分组中的几个基本概念
F组限:每个组两端的数值。分为上限和
下限。
F组距:一个组的上限与下限两端的距
离。
F全距:所有变量值中最大值与最小值
之差。
F组中值:每个组的上限与下限的中点
值。
2026-9-212-37
组距分组的步骤
F第一,确定组数。
可以按斯特格斯的经验公式确定组数K:
lgNlgN
K1113.322lgN(N为数据的个数)
lg20.30103
F第二,确定各组的组距。
实际中先确定组数或先确定组距均可:
全距全距
组距,或组数
组数组距
F第三,整理成频数分布表。
2026-9-212-38
【例2.5】
——组距分组
F2009年7月9日随机抽查了某大学50名任
课教师的年龄,原始数据(周岁)如下:
33394527243530445247
45424046684847463960
46475129594729504329
35302934334564464467
30272944533155414347
试对数据进行组距分组。
2026-9-212-39
【例2.5】
——组距分组
F解:
F此处采用先确定组距的方式。根据本例的
数据水平及全距大小,组距拟定为10。
F对原始数据分组,整理成频数分布表如表
2.5所示:
2026-9-212-40
【例2.5】
——组距分组
F分组结果:
表2.550名教师年龄分组频数分布表
按年龄分组(周人数(人)比重(%)
岁)
20~30816
30~401122
40~502142
50~60612
60~7048
合计50100
2026-9-212-41
【例2.5】
——组距分组
F本例还可采用间断式组距形式分组,如
表2.6所示:
表2.650名教师年龄分组频数分布表
按年龄分组(周人数(人)比重(%)
岁)
20~29816
30~391122
40~492142
50~59612
60~6948
合计50100
2026-9-212-42
【例2.5】
——组距分组
F本例还可采用开口组形式分组,如表2.7所
示:
表2.750名教师年龄分组频数分布表
按年龄分组(周人数(人)比重(%)
岁)
30以下816
30~401122
40~502142
50~60612
60以上48
合计50100
2026-9-212-43
累计次数与累计频率
F有时为了研究次数分布的状况,需要计算
累计次数或累计频率,方法有两种:
F向上累计(积),也称较小制累计(积)
或以下累计(积),即把各组次数或频率
由变量值小的组向变量值大的组顺序逐组
累计(积),截至各组的累计(积)次数
或累计(积)频率表示小于该组变量值上
限的次数或频率合计有多少。
2026-9-212-44
累计次数与累计频率
F向下累计(积),也称较大制累计(积)
或以上累计(积),即把各组次数或频率
由变量值大的组向变量值小的组顺序逐组
累计(积),截至各组的累计(积)次数
或累计(积)频率表示大于该组变量值下
限的次数或频率合计有多少。
2026-9-212-45
累计次数与累计频率
F如对表2.5计算累计次数或累计频率,可得
累计频数(频率)分布表如表2.8所示:
表2.850名教师年龄分组累计频数(频率)分布表
按年龄频数频率(%)向上累计向下累计
分组(人)频数频率(%)频数频率(%)
(周岁)(人)(人)
20~3081681650100
30~40112219384284
40~50214240803162
50~6061246921020
60~70485010048
合计50100————
2026-9-212-46
【例2.6】
——SPSS制作频数分布表
F(数据文件为example2.3)
2007年我国各地区农村居民家庭人均
纯收入资料如表2.9所示,试用SPSS
制作频数分布表。
2026-9-212-47
【例2.6】
——SPSS制作频数分布表
F原始数据:
表2.92007年我国各地区农村居民家庭人均纯收入
地区人均纯收入(元)地区人均纯收入(元)
北京9439.63湖北3997.48
天津7010.06湖南3904.20
河北4293.43广东5624.04
山西3665.66广西3224.05
内蒙古3953.10海南3791.37
辽宁4773.43重庆3509.29
吉林4191.34四川3546.69
黑龙江4132.29贵州2373.99
上海10144.62云南2634.09
江苏6561.01西藏2788.20
浙江8265.15陕西2644.69
安徽3556.27甘肃2328.92
福建5467.08青海2683.78
江西4044.70宁夏3180.84
山东4985.34新疆3182.97
河南3851.60——
2026-9-212-48
【例2.6】
——SPSS制作频数分布表
F解:
F首先将农村居民家庭人均纯收入用代码1、
2、3、4、5表示,然后在数据文件的
VaribleView窗口Values栏定义变量值标
签。
F操作步骤:
File→open→Data→example2.3→Analyz
e→DescriptiveStatistics→Frequencies
→将“人均纯收入”选入Variable框→OK。
输出结果如表2.10所示:
2026-9-212-49
【例2.6】
——SPSS制作频数分布表
F输出结果:
表2.102007年我国各地区农村居民家庭人均纯收入的频数分布表
FrequencValidCumulative
yPercentPercentPercent
Valid3000元以下(含19.4
618.819.4
3000)
3000元-4000元58.1
1237.538.7
(含4000元)
4000元-5000元77.4
618.819.4
(含5000元)
5000元-6000元83.9
26.36.5
(含6000元)
6000元以上100.0
515.616.1
Total3196.9100.0
Total32100.0
2026-9-212-50
2.用图形展示数值型数据
F适合数值型数据的图形有:
直方图(histogram)
箱线图(boxplots)
线图(linecharts)
茎叶图(stem-and-leafdisplay)
…………
2026-9-212-51
直方图
F直方图(histogram)是用矩形的宽度和高
度来表示频数分布的图形。若是等距数
列,一般用横坐标表示数据分组,而纵
坐标表示次数或频数;若是不等距数列,
则应按频数密度绘制直方图。
2026-9-212-52
【例2.7】
——直方图
F沿用【例2.5】教师年龄原始数据,用
SPSS绘制的直方图如下:
图2.3某大学50名教师年龄直方图
20
10
Std.Dev=10.80
Mean=42.3
0N=50.00
25.030.035.040.045.050.055.060.065.070.0
教师年龄
2026-9-212-53
箱线图
F箱线图(boxplots)是用一组数据的五个特
征值即最大值、最小值、中位数、上四
分位数、下四分位数来表示频数分布状
况的图形,它由一个箱子和两条线段组
成。每个箱子的中间横线是数据的中位
数。
F根据不同资料,可绘制简单箱线图或多
批箱线图。
2026-9-212-54
【例2.8】
——简单箱线图
F沿用【例2.5】教师年龄原始数据,用
SPSS绘制的简单箱线图如下:
图2.550位教师年龄箱线图
80
70
15
60
50
40
30
20
N=50
教师年龄
2026-9-212-55
【例2.9】
——多批箱线图
F现有某大学9名大一新生英语、语文、数
学的考试成绩如表2.11所示,试绘制多批
箱线图,比较9名学生的各科成绩。
表2.119名大一新生英语、语文、数学考试成绩
考试成绩(分)
学生编号英语语文数学
1705667
2658054
3893398
4346978
5668570
6788780
7806269
8935085
9567875
合计———
2026-9-212-56
解:用SPSS16.0绘制的多批箱线图如图
2.6所示:
F图2.69名学生各科成绩的箱线图
120
100
3
80
60
40
4
20
N=999
英语数学语文
2026-9-212-57
线图
F线图(linecharts)是用线条的延伸和波动
来表明现象变动情况的图形,它主要用
于表示现象在不同时间上的变化趋势。
2026-9-212-58
【例2.10】
——线图
F1998~2008年我国农村居民人均纯收入及
城镇居民人均可支配收入资料如表2.12所
示,试用SPSS绘制线图。
表2.121998~2008年我国农村居民人均纯收入及城镇居民人均可支配收入
时间(年)农村居民人均纯收入(元)城镇居民人均可支配收入(元)
199821605425
199922105854
200022536280
200123666860
200224767703
200326228472
200429369422
2005325510493
2006358711759
2007414013786
2008476115781
2026-9-21合计2-59
解:用SPSS16.0绘制的线图如图
2.7所示:
F图2.71998~2008年我国农村居民人均纯收入及城镇居民人均可支配收入线图
18000
16000
14000
12000
)10000
元
(8000
入
收
6000
4000
2000农村居民
0城镇居民
19981999200020012002200320042005200620072008
年份
2026-9-212-60
茎叶图
F茎叶图(stem-and-leafdisplay)又称“枝叶
图”,它是将数组中变化不大的高位数
作为一个主干(茎),将变化大的低位
数作为分枝(叶),列在主干的后面,
来表示频数分布的。
F茎叶图与直方图相类似,但又与直方图
不同。茎叶图保留了原始资料的信息,
而直方图则无原始资料的信息。
2026-9-212-61
【例2.11】
——茎叶图
F根据【例2.5】某大学50名教师年龄原始数
据绘制的茎叶图如图2.8所示:
图2.8某大学50名教师年龄茎叶图
树叶数据个数
树茎
2477999998
30001334559911
401233444555666677777821
50123596
604784
2026-9-212-62
如果茎叶图显得过于拥挤,还可以把它扩展,将每
个数茎分成两段,尾数0~4的在数茎后以“*”表示;
尾数5~9的在数茎后以“·”表示。如将图2.8扩展后,
便形成如图2.9所示的扩展的茎叶图:
F图2.9某大学50名教师年龄扩展的茎叶图
树茎树叶数据个数
2*41
2·77999997
3*00013347
3·55994
4*012334448
4·555666677777813
5*01234
5·592
6*042
6·782
2026-9-212-63
若用SPSS16.0绘制茎叶图,则如图2.10所示:
图2.10某大学50名教师年龄的茎叶图
教师年龄Stem-and-LeafPlot
FrequencyStem&Leaf
1.002.4
7.002.7799999
7.003.0001334
4.003.5599
8.004.01233444
13.004.5556666777778
4.005.0123
2.005.59
2.006.04
1.006.7
1.00Extremes(>=68)
Stemwidth:10
Eachleaf:1case(s)
2026-9-212-64
3.频数分布的类型
F常见的频数分布类型主要有钟形分布、J形
分布和U形分布,如图2.11所示:
图2.11几种常见的频数分布
(a)正态分布(b)右偏分布(c)左偏分布
(d)正J形分布(e)反J形分布(f)U形分布
2026-9-212-65
钟形分布
F钟形分布的特点是靠近中间的变量值分布
的次数多,靠近两端的变量值分布的次数
少,即“两头小、中间大”。
F钟形分布又分正态分布、右偏分布和左偏
分布,如图2.12所示:
图2.12钟形分布
(a)正态分布(b)右偏分布(c)左偏分布
2026-9-212-66
J形分布及U形分布
FJ形分布其分布图象像英文字母“J”字,包
括正J形分布和反J形分布两种类型。
FU形分布的特点是靠近中间的变量值分布的
次数少,靠近两端的变量值分布的次数多,
即“两头大、中间小”。
图2.13J形分布与U形分布
(d)正J形分布(e)反J形分布(f)U形分布
2026-9-212-67
2.4集中趋势的度量
F2.4.1均值
F2.4.2几何平均数
F2.4.3调和平均数
F2.4.4众数
F2.4.5中位数
F2.4.6四分位数
F2.4.7众数、中位数和均值的比较
2026-9-212-68
2.4.1均值
F均值(mean)是全部数据的算术平均,
也称算术平均数。
F均值在统计分析中具有重要的地位,是
集中趋势的最主要测度值。
F根据掌握的资料不同,均值有简单均值
与加权均值两种计算形式。
2026-9-212-69
简单均值
F适用于未分组数据。
F计算公式:n
xi
xxx
x12ni1
nn
式中:
—变量值
xi(i1,2,n)
n—变量值的个数
—求和符号
x—均值
2026-9-212-70
【例2.12】
——简单均值
F沿用【例2.5】中某大学50名任课教师年龄
的原始数据(周岁):
333945272435304452474542404668
484746396046475129594729504329
353029343345644644673027294453
3155414347
则教师的平均年龄为:
xxx3339454347
x12n
n50
2114
4
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 2026年国开电大计算机网络安全技术作业课堂知识点测验答案
- 人工智能+知识产权保护机制创新研究报告
- 白酒制造业行业分析报告
- 铸造行业产能限值分析报告
- 落实新战略演讲稿高中
- 2026年秋招:陕西汽车试题及答案
- 2026年湖北谷城审计局招聘考试练习试卷(含答案)
- 2026年山西医保局消防安全管理员招聘考试练习试卷(含答案)
- 2026年安徽滁州交通局招聘考试练习试卷(含答案)
- 2026年江苏应急管理局审计专员招聘考试练习试卷(含答案)
- 成人健康体检项目指引(2025年版)
- 检修维护部危险源辨识与风险管控培训
- 铝合金门窗安装施工工艺
- 小学三年级写字教案
- (正式版)T∕CSES 208-2025 珍稀濒危鱼类水质基准推导技术指南(试行)
- 2026年外国法制史考试押题卷及完整答案详解【必刷】
- 12《祝福》课件 统编版高一语文必修下册
- 中风康复期中医护理常规
- 客房卫生处罚制度
- 细胞培养虚拟仿真实验教学的应用
- 上海健康医学院《大学英语》2023-2024学年第一学期期末试卷
评论
0/150
提交评论