第三章 统计数据整理与显示_第1页
第三章 统计数据整理与显示_第2页
第三章 统计数据整理与显示_第3页
第三章 统计数据整理与显示_第4页
第三章 统计数据整理与显示_第5页
已阅读5页,还剩55页未读, 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

第三章统计数据整理与显示学习目标理解数据整理的意义及一般步骤深刻理解统计分组在数据整理中所起的重要作用掌握次数分布表的编制方法了解统计表的设计要求了解统计图的种类及适用场合

第一节统计数据整理

的意义及步骤

一、统计数据整理的意义

统计数据整理即统计整理,就是根据统计研究的任务,对搜集得到的原始数据进行审核、分组、汇总,使之条理化,系统化,变成能反映各组及总体特征的综合数据的工作过程。对已整理过的资料(包括历史资料)进行再加工也属于统计整理。统计整理的意义表现在以下三个方面:统计整理是我们对客观事物从感性认识上升到理性认识的连接点。通过调查取得的资料只是我们对事物的一种感性认识,只是事物的表象。统计整理是进行统计分析的前提。数据整理在整个统计研究中占有重要地位。二、统计数据整理的步骤

统计数据整理是将搜集到的原始数据条理化、系统化,使之符合统计分析与推断的要求。通过整理可以大大简化数据,更有效地显示和提供所包含的统计信息。根据统计研究的目的和内容,统计整理一般分为以下几个步骤:1.拟定整理方案2.数据预处理3.统计分组或分类4.统计汇总5.编制统计表、绘制统计图1.拟定整理方案整理方案是数据整理工作的指导性文件,体现了整理工作的具体规划和要求,主要内容是确定数据预处理方法、分组或分类汇总的方式方法、人员及工作进程安排等。在实际工作中,整理方案就是一系列汇总表式的总称,包括一套综合汇总表、填表说明、统一的分类标准或目录等。整理方案的正确性和合理性是保证数据整理工作有计划并顺利进行的基础,方案设计应力求科学、周密。

2.数据预处理数据预处理是在数据分组或分类之前所做的必要处理,包括数据的审核和筛选。数据的审核数据的筛选3.统计分组或分类

统计分组或分类是数据整理的关键环节,也是一切统计研究的基础,在统计研究中占有重要地位。有关统计分组或分类的详细内容在下一节再做详细论述。4.统计汇总

在统计分组基础上,将所有数据分别归纳到各组中去,计算各组单位数和总体单位数,计算出各组指标和总体指标的数值,使反映总体单位的资料转化为反映总体综合数量特征的过程称为统计汇总或数据汇总。

数据汇总技术主要有手工汇总和计算机汇总两种。手工汇总是借助算盘和小型计算器等手工操作方式进行的汇总。

5.编制统计表、绘制统计图数据分组和汇总后,将汇总得到的各项资料编制成各种统计表,再将表中的数据绘制成不同形状的统计图。统计表和统计图是数据整理结果的基本表现形式,可以更加直观、简明地反映客观现象数量方面的具体表现和有关联系,便于进一步的数据分析。第二节统计分组或分类

一、统计分组的概念

根据统计研究目的和现象的内在特点,将现象总体按照某一(或某些)标志划分为性质不同的组成部分,称为统计分组或分类。通过分组,将现象总体区分为性质不同的几个部分,使性质不同的单位分开,性质相同的单位合在一个组内,这样有助于从数量方面揭示总体内部各部分的关系,更深入地研究总体的特征和规律性。

二、统计分组的作用

统计分组的作用主要表现在以下几个方面:1、划分社会经济类型。统计分组是确定社会经济现象各种类型的基础,例如将国民经济按三个产业划分,将工业企业按所有制的不同划分、按轻重工业划分,居民按城镇、农村划分,从而说明不同的经济类型的特点。一般来说,社会经济类型的分组多采用品质标志来划分。

2.研究总体内部的结构通过统计分组可以反映总体内部各部分之间的差别和相互关系,表明总体的内部结构同时在各组的基础上计算各组所占总体的比重,从总体的构成上认识总体各部分的作用,并对总体作出正确的评价。3、分析现象之间的依存关系社会经济现象之间存在着相互制约、相互联系的关系,通过统计分组可以根据现象间的影响因素和结果因素的对应更好地揭示现象之间的这种依存关系。

三、统计分组的方法

1.正确选择分组标志分组标志的选择是统计分组的关键。分组标志,即将同质总体区分为不同组的标准或依据。分组标志一旦选定,就必然突出了总体在该标志下的性质差别,其他的差别看不见了。分组标志选择不当,不但无法显示现象的根本特征,甚至会混淆事物的性质,歪曲社会经济的真实情况。

2.按品质标志或按数量标志分组

统计分组根据分组标志的性质不同可分为按品质标志分组和按数量标志分组。按品质标志分组即定性数据的分组;按数量标志分组即定量数据的分组。

按品质标志分组

按品质标志分组就是用反映事物的属性、性质的标志分组,它可以将总体单位划分为若干性质不同的类型。例按职工性别、民族、文化程度的分类。品质标志分组一般较简单,分组标志一旦确定,组数、组名、组与组之间的界限也就随之确定。有些复杂的品质标志分组可根据统一规定的划分标准和分类目录进行。

按数量标志分组

按数量标志分组的目的并不是单纯确定各组在数量上的差别,而是要通过数量上的差别来区分各组的性质,反映总体本质的特征。因此,在按数量标志进行分组时,应当根据研究目的,首先确定总体在已选定的数量标志的特征下有多少种性质不同的组成部分,然后再研究确定各组成部分的数量界限,使分组的数量界限能够区分现象性质上的差别。数量标志分组方法从以下几个方面来说明:

单项式分组和组距式分组等距分组和不等距分组组限重叠和组限不重叠

1)单项式分组和组距式分组

对于离散型变量,如果变量值的变动幅度小,变化又很均匀,就可以一个变量值对应一组,称单项式分组。如居民家庭按儿童数或人口数分组、纺织工人按看管机器台数分组等均可采用单项式分组。离散型变量如果变量值的变动幅度很大,变量值的个数很多,这时若采用单项式分组,很可能出现组数过多,各组又没有几个单位的情况,不能很好地反映总体各单位在各组的分布状况,从而失去分组的意义。比如,按职工人数对工业企业进行分组,由于各企业职工人数差别很大,采用单项式分组就很不现实,这就需要采用组距式分组。对于连续型变量,由于其变量值是连续不断的,不能一一列举,故不能采用单项式分组,只能采用组距式分组。把全部变量值依次划分为几个区间,各个变量值则按其大小确定所归并的区间,区间的距离称为组距,这样的分组称为组距式分组。在组距式分组中,被分成的各个组不是一个具体的数值,而是一个数值区间。用于表示各组数量界限的变量值称为组限,其中组内的最小值为该组的下限,最大值为该组的上线。进行组距式分组,组距和组数的确定是很重要的。确定组距和组数时,应以能够显示数据分布特征和规律为目的,还应考虑到组内的同质性。如果组距过大,组数过少,分组虽然简单,但可能将性质不同的单位分在同一组内,数据分布特征的真实性将受到影响。如果组距过小,组数过多,则数据的分布又过于分散,不便于了解数据分布的集中趋势。总之,分组时应根据统计研究目的和数据本身的特点,确定适当的组距与组数。2)等距分组和不等距分组组距式分组有等距分组和不等距分组之分。各组的组距都相等的分组,称为等距分组。各组组距不都相等的分组,称为不等距分组,也叫异距分组。如果变量值变动比较均匀,则可以采用等距分组;如果变量值变动很不均匀,变动幅度较大,则需要采用不等距分组。比如,对人口总体按年龄分组,可根据人口成长的生理特点分成0—6岁(婴幼儿组)、7—17岁(少儿组)、18—59岁(中青年组)、60岁以上(老年组)等四组。具体分组时采用那一种组距,要根据总体性质和研究目的而定。一般情况下尽量采用等距分组,以便于比较分析数据的频数分布特征。3)组限重叠和组限不重叠的分组划分组距式分组的分组界限是统计分组的又一关键问题。采用组距式分组时,各组组限的划分应遵循“不重不漏”的原则。“不重”,是指一项数据只能分在其中的某一组,不能在其他组中重复出现;“不漏”,是指组别必须穷尽,即所分的全部组别要包含所有数据,不能遗漏任何一项。为解决“不重”问题,对于离散型变量,可以采用相邻组限间断(不重叠)的办法。比如,企业按工人人数分组可表示为:199人以下、200—499人、500—999人、1000—1999人、2000人以上等。而对于连续型变量,则必须采用相邻组限重叠的方法,通常根据“上组限不在本组内”的规定解决不重的问题,即在分组时,采用某一组的上限同时也是下一组的下限这样的重叠组限,刚好等于某一组上限的变量值不计算在本组内,而计算在下一组内。。比如,学生按考试成绩分组,分为:60分以下、60—70分、70—80分、80—90分、90分以上五组,70分这个变量值既是60—70分这一组的上限也是70—80分这一组的下限,在分组时,70分不计算在60—70分这一组内,而是把它归到70—80分这一组。为便于计算分析,对于离散型变量也可以采用相邻两组组限重叠的方法,一般遵循“上组限不在本组内”的规定解决“不重”问题在组距式分组中,如果数值中有极大值或极小值存在,为避免出现空白组或个别极端值被漏掉,第一组和最后一组可以采用“xx以下”及“xx以上”这样的开口组。组距式分组掩盖了组内数据分布的状况,为反映各组数据的一般水平,通常用组中值作为该组数据的一个代表值。每组上下限之间的中点数值称为组中值,即组中值=(上限+下限)/2.开口组的组中值一般是参考相邻组的组距计算,公式为:缺下限的开口组的组中值=上限-相邻组组距/2缺上限的开口组的组中值=下限+相邻组组距/2使用组中值代表数据的一般水平时,通常假定各组数据在本组内呈均匀分布,若不满足假定条件,用组中值作为一组数据的代表值就会有一定的误差。综上所述,离散型变量根据实际情况既可采用单项式分组,也可采用组距式分组,组限既可重叠,也可不重叠;连续型变量只能采用组距式分组,并且组限必须重叠。3.简单分组和复合分组

根据数据分析的需要,可以对调查数据进行简单分组或复合分组。所谓简单分组,是指对总体只按一个标志进行的分组。比如,人口总体只按性别分组,学生总体只按考试成绩分组等。所谓复合分组,是指对研究总体按两个或两个以上标志进行的多层次分组,比如,职工总体先按技术级别分组,在此基础上再按性别分组,形成如下复合分组:职工初级中级高级女性男性女性女性男性男性4统计分组体系1).平行分组体系

平行分组体系就是对同一总体同时选择两个或两个以上的标志分别进行简单分组,然后并列在一起就形成了平行分组体系。2).复合分组体系

复合分组体系就是将总体按两个或两个以上的标志结合起来进行层叠分组,形成复合分组体系。第三节次数分布

一、次数分布的概念次数分布是指将总体中的所有单位按某个标志分组后,所形成的总体单位数在各组之间的分布。分布在各组的总体单位数叫做次数或频数。各组次数与总次数之比叫做比重、比率或频率。次数分布是统计分组的必然结果。是反映统计总体中所有单位在各组间的分布状态和分布特征的一个数列,因此也可以称为次数分布数列、频数分布数列,简称分布数列,或分配数列。例如,人口按性别分组后形成的人口数在各组分布情况的数列;学生按年龄分组后形成的学生人数在各组分布情况的数列等,都是次数分布数列。次数分布数列主要由各组名称(或各组变量值)与各组单位数(次数或频数)两部分构成。有时也可把比重(频率)列入分布数列中。(比重也叫频率,是各组频数与总频数之比,它的数值永远大于0而小于100%)分布数列的形式很简单,但它是统计整理的重要表现形式,在统计研究中具有重要的意义。分布数列直观地表明了总体单位的分布特征和结构状况,在此基础上还可进一步研究其构成、平均水平及其变动规律,它是进行统计分析的一种重要手段。根据分组标志的性质不同,分布数列可分为品质分布数列和变量分布数列。按品质标志分组形成的分布数列叫品质分布数列,简称品质数列;按数量标志分组形成的数列叫变量分布数列,简称变量数列。

二、变量数列的种类

变量数量有单项式变量数列和组距式变量数列两种。数值型变量按单项式进行分组后,计算各组的单位数,形成的数列叫单项式数列。数值型变量按组距式分组后,计算各组的单位数,形成的数列称为组距式数列。因为组距有等距和不等距之分,因此分布数列也有等距数列和异距数列之分。三、变量数列的编制变量数列的编制一般采用如下几个步骤:1.将原始资料按其数值大小重新排列2.确定全距3.确定组距和组数4.确定组限5.编制变量数列

四、次数分布的主要类型

各种不同性质的现象有着各自特殊的次数分布。我们在编制分布数列时就要考虑该现象本身的特点,尽量与现象的分布特征一致。概括起来,社会经济现象主要有钟型、U型和J型三种分布类型。1.钟型分布(正态分布)钟型分布的特征是“两头小,中间大”,即靠近中间的变量值分布的次数多,靠近两边的变量值分布的次数少,其曲线图宛如一口钟,如下图所示。(a)正态分布(b)偏态分布正偏(右偏)负偏(左偏)如图(a)所示,其分布特征是以标志变量中心为对称轴,左右两侧对称,两侧变量值分布的次数随着与中间变量值距离的增大而渐次减少。在统计学中,称这种分布为对称分布。而图(b)为非对称分布,它们各有不同方向的偏态,即左偏态分布和右偏态分布。客观实际中,许多社会现象统计总体的分布都趋于对称分布中的正态分布。正态分布是描述统计中的一种主要分布,它在社会经济统计分析中具有重要的意义。2.U型分布U型分布的形状与钟型分布相反,靠近中间的变量值分布次数少,靠近两端的变量值分布次数多,形成“两头大,中间小”的U型分布。如人口死亡率分布,人口总体中,幼儿和老人死亡率高,而中青年死亡率低。3.J型分布J型分布有两种类型,一种是次数随着变量的增大而增多,如投资按利润率大小分布。另一种呈反U型分布,即次数随着变量增大而减少,如随着产品产量的增加,产品单位成本下降。如下图(d)(c)J形分布正J形反J形(d)U形分布第四节统计资料的显示:

统计表和统计图一、统计表的定义和结构统计调查所得来的原始资料,经过整理,得到说明社会现象及其发展过程的数据,将这些数据按一定的顺序排列在表格上,就形成了统计表。广义的统计表包括统计工作各个阶段中所用的一切表格。狭义的统计表专指分析表和容纳各种统计资料的表格,也就是通常所说的统计表,它清楚地、有条理地显示统计资料,直观地反映统计分布特征,是统计分析的一种重要工具。统计表的结构,可以从表式和内容两个方面来认识。1.从表式上看,统计表是由纵横交叉的线条组成的一种表格,表格包括总标题、横行标题、纵栏标题和指标数值四个部分。总标题是统计表的名称,它扼要地说明表的基本内容,并指明时间和范围。它置于统计表格的正上方。横行标题是横行的名称,一般放在表格的左方;纵栏标题是纵行的名称,一般放在表格的上方。横行标题和纵行标题共同说明填入表格中的统计数字所指的内容。指标数值是列在横行和纵栏的交叉处,即表格中的数字就是指标数值,用来说明总体及其组成部分的数量特征,它是填写在统计表格的核心部分2.从内容上来看,统计表是由主词栏和宾词栏两个部分组成。主词栏是统计表所要说明的总体及其组成部分,一般都列在表的左半部分;宾词栏是统计表用来说明总体数量特征的各个统计指标及其数值,一般都列在统计表的右半部分。此外,统计表还有补充资料、注解、资料来源、填表单位、填表人等附加内容。二、统计表的设计

统计表的设计要求是:科学、实用、简练、美观。具体来说,设计统计表时要注意以下几点:第一,统计表的表头。第二,统计表的结构。第三,统计表的表式。第四,

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

最新文档

评论

0/150

提交评论