度量分布偏斜的程度课件_第1页
度量分布偏斜的程度课件_第2页
度量分布偏斜的程度课件_第3页
度量分布偏斜的程度课件_第4页
度量分布偏斜的程度课件_第5页
已阅读5页,还剩103页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

第七章数据的描述统计度量分布偏斜的程度课件目录第一节集中趋势的度量第二节离散趋势的度量第三节偏斜度与峰度的度量第四节SPSS在描述统计中的运用目录集中趋势(centraltendency)是指一组数据向某中心值靠拢的倾向,集中趋势的测度实际上就是对数据一般水平代表值或中心值的测度。不同类型的数据用不同的集中趋势测度值,选用哪一个测度值来反映数据的集中趋势,要根据所掌握的数据的类型来确定。集中趋势的特征数,是代表一组数据典型水平或集中趋势的统计量。常用的集中趋势的特征数包括算术平均数、加权平均数、几何平均数、中位数、众数等。3第一节集中趋势的度量3第一节集中趋势的度量一、算数平均数算术平均数(arithmeticmean)简称为均数(mean)。样本均数通常用

表示,总体均数用希腊字母μ表示。算术平均数是集中趋势的最主要测度值。适用于对称分布,特别是正态或近似正态分布的计量资料。根据所掌握数据形式的不同,算术平均数有简单算术平均数和加权算术平均数。4第一节集中趋势的度量一、算数平均数4第一节集中趋势的度量(1)简单算术平均数(simplearithmeticmean)。未经分组整理的原始数据,其算术平均数的计算就是直接将一组数据的各个数值相加除以数值个数。计算公式为:(2)加权算术平均数(weightedarithmeticmean)。根据分组整理的数据计算的算术平均数,就要以各组变量值出现的次数或频数为权数计算加权的算术平均数。计算公式为:5第一节集中趋势的度量5第一节集中趋势的度量二、几何平均数几何平均数(geometricmean),是指社会经济现象的同质总体在时间上变动速度的平均数,也即统计总体在一段时期内的平均发展速度。几何平均数通常用于计算指数、百分比和增长速度的平均数。根据掌握的数据资料不同,几何平均数可分为简单几何平均数和加权几何平均数两种。6第一节集中趋势的度量二、几何平均数6第一节集中趋势的度量(1)简单几何平均数。根据未经分组资料计算平均数。计算公式为:(2)加权几何平均数。当掌握的数据资料为分组资料,且各个变量值出现的次数不相同时,应用加权方法计算几何平均数。计算公式为:7第一节集中趋势的度量7第一节集中趋势的度量三、中位数中位数(median)是一组按大小顺序排列的观察值中位居中间的数值,通常用

表示。它常用于描述偏态分布资料的集中趋势。中位数是一个位置代表值,因此它不受极端变量值的影响,特别是当分布末端无确定数据不能求算术平均数和几何平均数时,可以用中位数来表示数据分布的集中趋势。8第一节集中趋势的度量三、中位数8第一节集中趋势的度量对于已分组的数据来说,中位数的计算公式为:其中,是到中位数组前面一组为止的向上累计频数,

则是到中位数组后面一组为止的向下累计频数;

为中位数组的频数;i为中位数组的组距。9第一节集中趋势的度量9第一节集中趋势的度量四、众数众数(mode)是指一组数据中出现次数最多的变量值,用

表示。从变量分布的角度看,众数是具有明显集中趋势点的数值,一组数据分布的最高峰点所对应的变量值即为众数。当然,如果数据的分布没有明显的集中趋势或最高峰点,众数也可以不存在;如果有多个高峰点,也就有多个众数。在统计实践中,当一组数据出现不同质的情况,或分布中出现极端数据时,用众数来描述数据的集中趋势较为合适。10第一节集中趋势的度量四、众数10第一节集中趋势的度量设众数组的频数为

,众数前一组的频数为

,众数后一组的频数为

。当众数相邻两组的频数相等时,即

=,众数组的组中值即为众数;当众数组的前一组的频数多于众数组后一组的频数时,即

,则众数会向其前一组靠,众数小于其组中值;当众数组后一组的频数多于众数组前一组的频数时,即

,则众数会向其后一组靠,众数大于其组中值。基于这种思路,借助于几何图形而导出的分组数据众数的计算公式为:其中,

L表示众数所在组的下限;U表示众数所在组的上限。上述下限和上限公式是假定数据分布具有明显的集中趋势,且众数组的频数在该组内是均匀分布的,若这些假定不成立,则众数的代表性就会很差。11第一节集中趋势的度量11第一节集中趋势的度量五、调和平均数调和平均数(reciprocalmean)也称倒数平均数,它是对变量(x)的倒数求平均,然后再取倒数而得到的平均数。根据掌握的统计资料不同,调和平均数可以分为简单调和平均数和加权调和平均数。12第一节集中趋势的度量五、调和平均数12第一节集中趋势的度量(1)简单调和平均数:(2)加权调和平均数:13第一节集中趋势的度量13第一节集中趋势的度量六、集中趋势度量的例题分析【例7-1】2010年中国南方某城镇3200户家庭的平均每一劳动力年收入的频数分布情况如表7-1所示,请计算其算术平均数、中位数和众数。14第一节集中趋势的度量年收入分组/元组中值X/元频数f累积频数8000-1700017000-2600026000-3500035000-4400044000-5300053000-62000125002150030500395004850057500700100080040020010070017002500290031003200总计3200六、集中趋势度量的例题分析14第一节集中趋势的度量年收入分解:(1)算术平均数(2)中位数(3)众数15第一节集中趋势的度量解:15第一节集中趋势的度量【例7-2】1950年我国总人口为5.5亿,1985年达到了10.5亿,共计增长了1.9倍(表7-2)。(1)测算1950~1985年,我国平均每5年的人口增长速度;(2)测算1950~1975年,我国平均每5年的人口增长速度;(3)如果1975~1985年期间不实行计划生育政策,请测算1985年我国的人口总数。16第一节集中趋势的度量年度人口数/万人环比增长速度1950195519601965197019751980198555196614656620772538829929242098705104532-1.1141.0771.0961.1441.1141.0681.05916第一节集中趋势的度量年度人口数/万人环比增长速度195

解:(1)MG=1.114•1.077•1.096•1.144•1.144•1.068•1.059)1/7≈1.096,即1950~1985年,我国平均每5年的人口增长速度为9.6%;

(2)MG=(1.114•1.077•1.096•1.144•1.144)1/5≈1.1096,即1950~1975年,我国平均每5年的人口增长速度10.9%;

(3)P=92420•(1.109)2=113590(万人),即1985年我国的人口总数达到11.359亿。17第一节集中趋势的度量解:17第一节集中趋势的度量【例7-3】东方信托投资公司某笔投资的年收益率是按复利计算的,该笔投资的年收益情况如表7-3所示,请测算该笔投资25年的平均年收益率。18第一节集中趋势的度量年收益率/%环比增长率/%年数/F3481015103104108110115148102总计-2518第一节集中趋势的度量年收益率/%环比增长率/%年数/F解:用几何平均数求该笔投资的年收益率

XG=[(103%)1•(104%)4•(108%)8•(110%)10•(115%)2]1/25=(7.6504)1/25=108.48%则该笔投资的年平均收益率为8.48%。19第一节集中趋势的度量19第一节集中趋势的度量

【例7-4】某汽车公司某年1~12月份生产的平均成本和总成本如表7-4所示。请测算:(1)该公司汽车的月平均生产量;(2)该公司某年汽车的平均生产成本。20第一节集中趋势的度量月份平均成本(万元)生产总成本(亿元)12345678910111241.841.442.741.241.643.742.541.641.142.541.641.31421.218632433.914422329.62053.93697.51414.42219.425502329.61858.5总计2561320第一节集中趋势的度量月份平均成本(万元)生产总成本(亿解:(1)每个月的生产总成本除以平均成本,就可以得到该公司汽车的月平均生产量,分别为:34,45,57,35,56,47,87,34,54,60,56,45。(2)通过计算加权调和平均数,就可以得到该公司汽车的平均生产成本:即该公司汽车的平均生产成本约为42万元。21第一节集中趋势的度量21第一节集中趋势的度量公共管理研究或调查所得到的数据,大都具有随机变量的性质。而对这些随机变量的描述,仅有集中趋势的度量是不够的。集中量数只描述数据的集中趋势和典型情况,还不能说明一组数据的全貌。对于数据变异性即离散趋势进行度量的一组统计量,称作差异量数,这些差异量数有标准差或方差、全距、平均差、四分差及各种百分差等等。如果一组数据是产品质量检查的结果,那么数据的变异情况说明生产是否稳定;如果数据是测量的结果,那么变异的情况说明测量方法是否正确、仪器是否精密;如果数据是学生的成绩,那么变异的情况说明成绩是否整齐(而不是高低)。22第二节离散趋势的度量22第二节离散趋势的度量一、极差极差又称全距(range),是指总体中最大标志值与最小标志值之差。用极差反映总体分布的离散程度,十分简便。其计算公式为:其中,

分别为数据中的极大值和极小值。23第二节离散趋势的度量一、极差23第二节离散趋势的度量三、平均差平均差(meanabsolutedeviation,M.D.)是离差(样本值与均值之差)的绝对值的平均数,即:对于已分组的频数分布(组数为k)平均差反映全部标本数据平均的误差,比极差和四分位差更能全面反映总体的数据变动情况,它的缺点是绝对值不适于作进一步的数学分析。24第二节离散趋势的度量三、平均差24第二节离散趋势的度量三、方差与标准差方差(variance)也称变异数、均方,常用符号

表示;作为总体参数时,常用符号

表示。它是每个数据与该组数据平均数之差平方后的均值,即离均差平方后的平均数。标准差(standarddeviation)即方差的平方根,常用S或SD表示。若用

表示,则是指总体的标准差。25第二节离散趋势的度量三、方差与标准差25第二节离散趋势的度量(1)总体方差(未分组的数据)(已分组的数据)(2)样本方差(未分组的数据)(已分组的数据)(3)总体标准差(未分组的数据)(已分组的数据)(4)样本标准差(未分组的数据)(已分组的数据)26第二节离散趋势的度量26第二节离散趋势的度量

方差与标准差是表示一组数据离散程度的最好、最常用的指标。其值大,说明离散程度大;其值小,说明数据比较集中。它基本具备一个良好的差异量数应具备的条件:①反应灵敏;②由一定的计算公式严密确定;③容易计算;④适合代数运算;⑤受抽样变动的影响小;⑥简单明了,这一点与其他差异量数比较稍有不足,但其意义还是较明白的。除上述之外,方差还具有可加性特点,它是对一组数据中造成各种变异的总和的测量,能利用其可加性分解并确定出属于不同来源的变异性(如组间、组内等)并可进一步说明每种变异对总结果的影响。27第二节离散趋势的度量27第二节离散趋势的度量五、变差系数变差系数又称变异系数、相对标准差等,通常用符号CV表示,其计算公式为:其中,S为某样本的标准差;

为该样本的平均数。变异系数是一个无量纲的量。变差系数适于用在比较有不同算术平均数或有不同量纲的两组数据的情况。28第二节离散趋势的度量五、变差系数28第二节离散趋势的度量六、离散趋势度量的实例

【例7-5】2012年某大学公共管理学院MPA报考人数为311人,缺考2人,其余309人的英语考试成绩如表7-5所示,请计算相关的表征离散趋势的特征数。29第二节离散趋势的度量六、离散趋势度量的实例29第二节离散趋势的度量302012年某大学公共管理

学院MPA报考人员

英语成绩83.0082.0078.0063.0067.0077.0062.0065.0076.0067.0068.0073.0073.0074.0065.0075.0063.0076.0060.0065.0065.0068.0064.0073.0059.0060.0064.0070.0048.0067.0055.0061.0061.0062.0075.0077.0061.0067.0049.0062.0068.0072.0052.0063.0073.0059.0062.0066.0073.0054.0060.0062.0065.0069.0042.0050.0072.0079.0055.0055.0056.0057.0067.0073.0050.0052.0055.0057.0060.0044.0061.0062.0065.0045.0053.0060.0068.0054.0073.0055.0045.0054.0062.0041.0041.0056.0058.0061.0064.0054.0065.0075.0075.0046.0051.0051.0053.0075.0048.0049.0050.0053.0056.0059.0061.0036.0044.0047.0052.0058.0058.0040.0044.0047.0050.0056.0065.0057.0048.0051.0053.0053.0059.0060.0060.0035.0042.0045.0046.0054.0066.0034.0046.0038.0040.0047.0068.0042.0054.0043.0046.0054.0056.0081.0035.0036.0038.0056.0057.0061.0049.0037.0038.0044.0037.0040.0045.0045.0057.0057.0037.0038.0041.0045.0047.0049.0060.0066.0041.0042.0051.0038.0043.0046.0053.0063.0063.0030.0045.0049.0056.0034.0043.0054.0045.0046.0046.0049.0057.0042.0044.0041.0043.0045.0021.0040.0037.0036.0040.0045.0058.0030.0034.0035.0044.0060.0025.0053.0039.0043.0047.0048.0049.0011.0034.0036.0045.0048.0050.0026.0034.0042.0043.0033.0034.0020.0034.0044.0028.0042.0045.0049.0036.0039.0049.0037.0038.0043.0027.0033.0041.0041.0021.0033.0070.0033.0052.0025.0027.0036.0039.0046.0027.0030.0035.0033.0034.0020.0024.0026.0027.0031.0027.0035.0048.0031.0034.0038.0029.0022.0037.0024.0025.0031.0048.0039.0033.0029.0031.0034.0030.0032.0034.0016.0019.0030.0036.0030.0028.0024.0026.0032.0023.0034.0031.0019.0023.0024.0017.0010.0016.0028.0014.0024.0021.0014.0015.0048.0015.00302012年某大学公共管理

学院MPA报考人员

英语成绩8解:(1)极差:R=最大值-最小值=83-10=73(2)四分位差:

(3)方差和标准差。

31第二节离散趋势的度量解:31第二节离散趋势的度量(4)变差系数。32第二节离散趋势的度量32第二节离散趋势的度量集中趋势和离散趋势是数据分布的两个重要特征,但要全面了解数据分布的特点,还需要知道数据分布的形状是否对称、偏斜的程度以及分布的扁平程度等。偏斜度和峰度就是对这些分布特征的描述。偏斜度是对数据分布的偏移方向和程度所作的进一步描述;峰度是用来对数据分布的扁平程度所做的描述。对于偏斜程度的描述用偏斜度系数;扁平程度的描述用峰度系数。33第三节偏斜度与峰度的度量33第三节偏斜度与峰度的度量一、动差法动差又称矩,原是物理学上用以表示力与力臂对重心关系的术语,这个关系和统计学中变量与权数对平均数的关系在性质上很类似,所以统计学也用动差来说明频数分布的性质。一般地说,取变量的

值为中点,所有变量值与

之差的K次方的平均数称为变量X关于

的K阶动差。用公式表示为:34第三节偏斜度与峰度的度量一、动差法34第三节偏斜度与峰度的度量当

时,即变量以原点为中心,上式称为K阶原点动差,用大写英文字母M表示。一阶原点动差:

,即算术平均数;二阶原点动差:

,即平方平均数;三阶原点动差:

,等等。当

时,即变量以算术平均数为中心,上式称为K阶中心动差,用小写英文字母m表示。一阶中心动差:

;二阶中心动差:

;三阶中心动差:

;等等。35第三节偏斜度与峰度的度量35第三节偏斜度与峰度的度量二、偏斜度偏斜度是对统计数据分布偏斜方向及程度的度量。统计数据的频数分布有的是对称的,有的是不对称的,即呈现偏态。在偏态的分布中,又有两种不同的形态,即左偏态和右偏态。度量分布偏斜的程度,可计算偏斜度。采用动差法计算偏斜度系数是用变量的三阶中心动差

进行对比,计算公式为:当分布对称时,变量的三阶中心动差

由于离差三次方后正负相互抵消而取得0值,则

;当分布不对称时,正负离差不能抵消,就形成正的或负的三阶中心动差

。当

为正值时,表示正偏离差值比负偏离差值要大,可以判断为正偏态或右偏态;反之,当

为负值时,表示负偏离差值比正偏离差值要大,可以判断为负偏态或左偏态。

越大,表示偏斜的程度就越大。由于三阶中心动差

含有计量单位,为消除计量单位的影响,就用

去除

,使其转化为相对数。同样的,

的绝对值越大,表示偏斜的程度就越大。36第三节偏斜度与峰度的度量二、偏斜度36第三节偏斜度与峰度的度量三、峰度峰度是用来衡量统计数据分布的集中程度或分布曲线的尖峭程度的指标。计算公式为:当峰度

时,表示分布的形状比正态分布更尖更高,这意味着分布比正态分布更集中在平均数周围,这样的分布称为尖峰分布;

时,分布为正态分布;

时,表示分布比正态分布更扁平,意味着分布比正态分布更分散,这样的分布称为扁平分布。37第三节偏斜度与峰度的度量三、峰度37第三节偏斜度与峰度的度量一、SPSS简介社会科学统计软件包(statisticalpackageforthesocialscience,SPSS)是世界上著名的统计分析软件之一。它由美国斯坦福大学的三位研究生于1968年研制,同年成立了SPSS公司,并于1975年在芝加哥组建了SPSS总部。20世纪80年代以前,SPSS统计软件主要应用于企事业单位。1984年,SPSS总部首先推出了世界上第一个统计分析软件微机版本SPSS/PC+,开创了SPSS微机系列产品的开发方向,极大地扩充了它的应用范围,并使其能很快地应用于自然科学、技术科学、社会科学的各个领域。随着SPSS产品服务领域的扩大和服务深度的增加,SPSS公司已于2000年正式将英文全称更改为StatisticalProductandServiceSolutions,意为“统计产品与服务解决方案”,标志着SPSS的战略方向正在做出重大调整。38第四节SPSS在描述统计中的应用一、SPSS简介38第四节SPSS在描述统计中的应用

SPSS的基本功能包括数据管理、统计分析、图表分析、输出管理等。SPSS统计分析过程包括描述性统计、均值比较、一般线性模型、相关分析、回归分析、对数线性模型、聚类分析、数据简化、生存分析、时间序列分析、多重响应等几大类,每类中又分好几个统计过程,比如回归分析中又分线性回归分析、曲线估计、Logistic回归、Probit回归、加权估计、两阶段最小二乘法、非线性回归等多个统计过程,而且每个过程中又允许用户选择不同的方法及参数。39第四节SPSS在描述统计中的应用39第四节SPSS在描述统计中的应用二、SPSS的基本操作(一)启动SPSS单击Windows的[开始]按钮,在[所有程序]菜单项[IBMSPSSStatistics]中找到[IBMSPSSStatistics20]并单击(图7-3)。40第四节SPSS在描述统计中的应用二、SPSS的基本操作40第四节SPSS在描述统计中的应用(二)打开SPSS的主窗口。SPSS启动成功后,打开SPSS的主窗口[DataView]。SPSS的主窗口名为IBMSPSSStatisticsDataEditor(数据编辑窗口),如图7-4所示。41第四节SPSS在描述统计中的应用41第四节SPSS在描述统计中的应用在SPSS的主窗口的菜单栏中,共有12个选项:(1)File:文件管理菜单,有关文件的调入、存储、显示和打印等;(2)Edit:编辑菜单,有关文本内容的选择、拷贝、剪贴、寻找和替换等;(3)View:视图菜单,运用“视图”菜单可显示或隐藏状态行、工具栏、网络线、值标签和改变字体等;(4)Data:数据管理菜单,有关数据变量定义、数据格式选定、观察对象的选择、排序、加权、数据文件的转换、连接、汇总等;(5)Transform:数据转换处理菜单,有关数值的计算、重新赋值、缺失值替代等;(6)Analyze:统计菜单,有关一系列统计方法的应用;(7)DirectMarketing:直销菜单,有关了解顾客、改进行销活动等;(8)Graphs:作图菜单,有关统计图的制作;(9)Utilities:用户选项菜单,有关命令解释、字体选择、文件信息、定义输出标题、窗口设计等;(10)Window:窗口管理菜单,有关窗口的排列、选择、显示等;(11)Add-ons:附加程序菜单,有关输出管理系统控制、数据文件注释、定义和使用变量集、运行脚本、定制对话框等;(12)Help:求助菜单,有关帮助文件的调用、查询、显示等。42第四节SPSS在描述统计中的应用42第四节SPSS在描述统计中的应用(三)定义变量

打开[VariableView]进入变量定义窗口,对变量进行定义。变量定义包括11个方面的内容,分别为:[Name],[Type],[Width],[Decimals],[Label],[Values],[Missing],[Columns],[Align],[Measure],[Role],如图7-5所示。43第四节SPSS在描述统计中的应用43第四节SPSS在描述统计中的应用(1)[Name]:定义变量名。要求定义变量名,不能超过8个字符(中文和英文均可以),但不能与SPSS软件运算符相同的一些字符串,如all,and,by,not,or,to,with,eq,ge,gt,le,lt,ne;“(”,“)”,“/”,“?”等符号。(2)[Type]:定义变量类型。SPSS的主要变量类型有:Numeric(标准数值型)、Comma(带逗点的数值型)、Dot(逗点作小数点的数值型)、ScientificNotation(科学记数法)、Date(日期型)、Dollar(带美元符号的数值型)、CustomCurrency(自定义型)、String(字符型)、RestrictedNumeric(Integerwithleadingzeros)(受限数值,值限于非负整数的变量,在显示值时,填充先导0以达到最大变量宽度)。(3)[Width]:设置变量长度。设置数值变量的长度,当变量为日期型时无效。(4)[Decimals]:设置变量小数点位数。设置数值变量的小数点位数,当变量为日期型时无效。(5)[Label]:设置变量标签。变量标签是对变量名的进一步描述,变量只能由不超过8个字符组成,8个字符经常不足以表示变量的含义。而变量标签可长达120个字符,变量标签对大小写敏感,显示时与输入值完全一样,需要时可用变量标签对变量名的含义加以解释。(6)[Values]:设置变量值标签。变量值标签是对变量值进一步说明,主要针对名义(nominal)变量和等级(ordinal)变量。单击[Values]相应单元,在如图7-7所示的对话框中进行设置。44第四节SPSS在描述统计中的应用44第四节SPSS在描述统计中的应用(7)[Missing]:缺失值的定义方式。SPSS有两类缺失值:系统缺失值和用户缺失值。在数据长方形中任何空的数字单元都被认为系统缺失值,用点号(·)表示。SPSS可以指定那些由于特殊原因造成的信息缺失值,然后将它们标为用户缺失值,统计过程识别这种标识,带有缺失值的观测被特别处理。默认值为[None]。单击[Values]相应单元中的按钮,可改变缺失值定义方式。(8)[Column]:设置变量的显示宽度。设置在屏幕上变量的显示宽度,默认为8位,也可以根据需求自己设置。(9)[Align]:设置变量显示的对齐方式。选择变量值显示时的对齐方式:[Left](左对齐),[Right](右对齐),[Center](居中对齐)。(10)[Measure]:设置变量的测量尺度。按测量精度的要求,SPSS将测量变量分为三大类分类变量[Nominal]、顺序变量[Ordinal]、等距变量和等比变量[Scale]。等距变量和等比变量经常不加以区别。如果变量为定距变量或定比变量,则在[Measure]相应单元的下拉列表中选择[Scale];如果变量为定序变量,则选择[Ordinal];如果变量为定类变量,则选择[Nominal]。(11)[Role]:设置变量的角色。分配变量的角色:[Input](变量用作输入)、[Target](变量用作输出或目标)、[Both](变量同时用作输入和输出)、[None](变量没有角色分配)、[Partition](分区,用于将数据划分为单独的训练、检验和验证样本)、[Split](拆分,包括以便与IBMSPSSModeler相互兼容,具有此角色的变量不会在IBMSPSSStatistics中用作拆分文件变量)。45第四节SPSS在描述统计中的应用45第四节SPSS在描述统计中的应用(四)数据的输入与编辑定义了变量后就可以输入数据了。由于各种原因,已经输入的数据往往会有错误,这就需要进行编辑。用Windows的基本操作方式可实现对数据的编辑。46第四节SPSS在描述统计中的应用46第四节SPSS在描述统计中的应用三、SPSS在描述统计中的应用实例

运用SPSS对例7-5中的2012年某大学公共管理学院309位MPA考生的英语成绩进行初步的统计分析。

运用SPSS进行数据的初步统计分析的基本程序如下:(1)在SPSS中录入原始数据,建立SPSS数据文件;(2)在主菜单中选择[Analyze]=>[DescriptiveStatistics]=>[Frequencies],如图7-9所示。47第四节SPSS在描述统计中的应用三、SPSS在描述统计中的应用实例47第四节SPSS在描述

(3)打开[Frequencies]对话框,把分析变量(X)输入右框,如图7-10所示。48第四节SPSS在描述统计中的应用48第四节SPSS在描述统计中的应用

(4)打开[Statistics]对话框,做如图7-11所示的选择,并单击[Continue]。49第四节SPSS在描述统计中的应用49第四节SPSS在描述统计中的应用(5)打开[Charts]对话框,作如图7-12所示的选择,并单击[Continue]。50第四节SPSS在描述统计中的应用50第四节SPSS在描述统计中的应用

(6)单击[Ok],输出结果。51第四节SPSS在描述统计中的应用

Valid309Missing0Mean47.39Std.Error

of

Mean0.891Median47.00ModeStd.Deviation15.663Variance245.342Skewness-0.017Std.Error

of

Skewness0.139Kurtosis-0.610Std.Error

of

Kurtosis0.276Range73Minimum10Maximum83Sum14643Percentiles1027.002034.002536.003038.004043.005047.006052.007057.007560.008062.009068.00a.Multiple

modes

exist.The

smallest

value

is

shown表7-7基本统计表51第四节SPSS在描述统计中的应用Valid309带曲线的正态分布图52第四节SPSS在描述统计中的应用52第四节SPSS在描述统计中的应用复习思考题1.举例说明什么是集中趋势。2.集中趋势有哪些统计特征数,对它们的优点和缺点进行比较分析。3.举例说明什么是离散趋势。4.离散趋势有哪些统计特征数,对它们的优点和缺点进行比较分析。5.简要说明偏斜度的概念。6.简要说明峰度的概念。7.结合某个研究课题,运用SPSS进行描述性统计分析。53复习思考题53

谢谢!54谢谢!54第七章数据的描述统计度量分布偏斜的程度课件目录第一节集中趋势的度量第二节离散趋势的度量第三节偏斜度与峰度的度量第四节SPSS在描述统计中的运用目录集中趋势(centraltendency)是指一组数据向某中心值靠拢的倾向,集中趋势的测度实际上就是对数据一般水平代表值或中心值的测度。不同类型的数据用不同的集中趋势测度值,选用哪一个测度值来反映数据的集中趋势,要根据所掌握的数据的类型来确定。集中趋势的特征数,是代表一组数据典型水平或集中趋势的统计量。常用的集中趋势的特征数包括算术平均数、加权平均数、几何平均数、中位数、众数等。57第一节集中趋势的度量3第一节集中趋势的度量一、算数平均数算术平均数(arithmeticmean)简称为均数(mean)。样本均数通常用

表示,总体均数用希腊字母μ表示。算术平均数是集中趋势的最主要测度值。适用于对称分布,特别是正态或近似正态分布的计量资料。根据所掌握数据形式的不同,算术平均数有简单算术平均数和加权算术平均数。58第一节集中趋势的度量一、算数平均数4第一节集中趋势的度量(1)简单算术平均数(simplearithmeticmean)。未经分组整理的原始数据,其算术平均数的计算就是直接将一组数据的各个数值相加除以数值个数。计算公式为:(2)加权算术平均数(weightedarithmeticmean)。根据分组整理的数据计算的算术平均数,就要以各组变量值出现的次数或频数为权数计算加权的算术平均数。计算公式为:59第一节集中趋势的度量5第一节集中趋势的度量二、几何平均数几何平均数(geometricmean),是指社会经济现象的同质总体在时间上变动速度的平均数,也即统计总体在一段时期内的平均发展速度。几何平均数通常用于计算指数、百分比和增长速度的平均数。根据掌握的数据资料不同,几何平均数可分为简单几何平均数和加权几何平均数两种。60第一节集中趋势的度量二、几何平均数6第一节集中趋势的度量(1)简单几何平均数。根据未经分组资料计算平均数。计算公式为:(2)加权几何平均数。当掌握的数据资料为分组资料,且各个变量值出现的次数不相同时,应用加权方法计算几何平均数。计算公式为:61第一节集中趋势的度量7第一节集中趋势的度量三、中位数中位数(median)是一组按大小顺序排列的观察值中位居中间的数值,通常用

表示。它常用于描述偏态分布资料的集中趋势。中位数是一个位置代表值,因此它不受极端变量值的影响,特别是当分布末端无确定数据不能求算术平均数和几何平均数时,可以用中位数来表示数据分布的集中趋势。62第一节集中趋势的度量三、中位数8第一节集中趋势的度量对于已分组的数据来说,中位数的计算公式为:其中,是到中位数组前面一组为止的向上累计频数,

则是到中位数组后面一组为止的向下累计频数;

为中位数组的频数;i为中位数组的组距。63第一节集中趋势的度量9第一节集中趋势的度量四、众数众数(mode)是指一组数据中出现次数最多的变量值,用

表示。从变量分布的角度看,众数是具有明显集中趋势点的数值,一组数据分布的最高峰点所对应的变量值即为众数。当然,如果数据的分布没有明显的集中趋势或最高峰点,众数也可以不存在;如果有多个高峰点,也就有多个众数。在统计实践中,当一组数据出现不同质的情况,或分布中出现极端数据时,用众数来描述数据的集中趋势较为合适。64第一节集中趋势的度量四、众数10第一节集中趋势的度量设众数组的频数为

,众数前一组的频数为

,众数后一组的频数为

。当众数相邻两组的频数相等时,即

=,众数组的组中值即为众数;当众数组的前一组的频数多于众数组后一组的频数时,即

,则众数会向其前一组靠,众数小于其组中值;当众数组后一组的频数多于众数组前一组的频数时,即

,则众数会向其后一组靠,众数大于其组中值。基于这种思路,借助于几何图形而导出的分组数据众数的计算公式为:其中,

L表示众数所在组的下限;U表示众数所在组的上限。上述下限和上限公式是假定数据分布具有明显的集中趋势,且众数组的频数在该组内是均匀分布的,若这些假定不成立,则众数的代表性就会很差。65第一节集中趋势的度量11第一节集中趋势的度量五、调和平均数调和平均数(reciprocalmean)也称倒数平均数,它是对变量(x)的倒数求平均,然后再取倒数而得到的平均数。根据掌握的统计资料不同,调和平均数可以分为简单调和平均数和加权调和平均数。66第一节集中趋势的度量五、调和平均数12第一节集中趋势的度量(1)简单调和平均数:(2)加权调和平均数:67第一节集中趋势的度量13第一节集中趋势的度量六、集中趋势度量的例题分析【例7-1】2010年中国南方某城镇3200户家庭的平均每一劳动力年收入的频数分布情况如表7-1所示,请计算其算术平均数、中位数和众数。68第一节集中趋势的度量年收入分组/元组中值X/元频数f累积频数8000-1700017000-2600026000-3500035000-4400044000-5300053000-62000125002150030500395004850057500700100080040020010070017002500290031003200总计3200六、集中趋势度量的例题分析14第一节集中趋势的度量年收入分解:(1)算术平均数(2)中位数(3)众数69第一节集中趋势的度量解:15第一节集中趋势的度量【例7-2】1950年我国总人口为5.5亿,1985年达到了10.5亿,共计增长了1.9倍(表7-2)。(1)测算1950~1985年,我国平均每5年的人口增长速度;(2)测算1950~1975年,我国平均每5年的人口增长速度;(3)如果1975~1985年期间不实行计划生育政策,请测算1985年我国的人口总数。70第一节集中趋势的度量年度人口数/万人环比增长速度1950195519601965197019751980198555196614656620772538829929242098705104532-1.1141.0771.0961.1441.1141.0681.05916第一节集中趋势的度量年度人口数/万人环比增长速度195

解:(1)MG=1.114•1.077•1.096•1.144•1.144•1.068•1.059)1/7≈1.096,即1950~1985年,我国平均每5年的人口增长速度为9.6%;

(2)MG=(1.114•1.077•1.096•1.144•1.144)1/5≈1.1096,即1950~1975年,我国平均每5年的人口增长速度10.9%;

(3)P=92420•(1.109)2=113590(万人),即1985年我国的人口总数达到11.359亿。71第一节集中趋势的度量解:17第一节集中趋势的度量【例7-3】东方信托投资公司某笔投资的年收益率是按复利计算的,该笔投资的年收益情况如表7-3所示,请测算该笔投资25年的平均年收益率。72第一节集中趋势的度量年收益率/%环比增长率/%年数/F3481015103104108110115148102总计-2518第一节集中趋势的度量年收益率/%环比增长率/%年数/F解:用几何平均数求该笔投资的年收益率

XG=[(103%)1•(104%)4•(108%)8•(110%)10•(115%)2]1/25=(7.6504)1/25=108.48%则该笔投资的年平均收益率为8.48%。73第一节集中趋势的度量19第一节集中趋势的度量

【例7-4】某汽车公司某年1~12月份生产的平均成本和总成本如表7-4所示。请测算:(1)该公司汽车的月平均生产量;(2)该公司某年汽车的平均生产成本。74第一节集中趋势的度量月份平均成本(万元)生产总成本(亿元)12345678910111241.841.442.741.241.643.742.541.641.142.541.641.31421.218632433.914422329.62053.93697.51414.42219.425502329.61858.5总计2561320第一节集中趋势的度量月份平均成本(万元)生产总成本(亿解:(1)每个月的生产总成本除以平均成本,就可以得到该公司汽车的月平均生产量,分别为:34,45,57,35,56,47,87,34,54,60,56,45。(2)通过计算加权调和平均数,就可以得到该公司汽车的平均生产成本:即该公司汽车的平均生产成本约为42万元。75第一节集中趋势的度量21第一节集中趋势的度量公共管理研究或调查所得到的数据,大都具有随机变量的性质。而对这些随机变量的描述,仅有集中趋势的度量是不够的。集中量数只描述数据的集中趋势和典型情况,还不能说明一组数据的全貌。对于数据变异性即离散趋势进行度量的一组统计量,称作差异量数,这些差异量数有标准差或方差、全距、平均差、四分差及各种百分差等等。如果一组数据是产品质量检查的结果,那么数据的变异情况说明生产是否稳定;如果数据是测量的结果,那么变异的情况说明测量方法是否正确、仪器是否精密;如果数据是学生的成绩,那么变异的情况说明成绩是否整齐(而不是高低)。76第二节离散趋势的度量22第二节离散趋势的度量一、极差极差又称全距(range),是指总体中最大标志值与最小标志值之差。用极差反映总体分布的离散程度,十分简便。其计算公式为:其中,

分别为数据中的极大值和极小值。77第二节离散趋势的度量一、极差23第二节离散趋势的度量三、平均差平均差(meanabsolutedeviation,M.D.)是离差(样本值与均值之差)的绝对值的平均数,即:对于已分组的频数分布(组数为k)平均差反映全部标本数据平均的误差,比极差和四分位差更能全面反映总体的数据变动情况,它的缺点是绝对值不适于作进一步的数学分析。78第二节离散趋势的度量三、平均差24第二节离散趋势的度量三、方差与标准差方差(variance)也称变异数、均方,常用符号

表示;作为总体参数时,常用符号

表示。它是每个数据与该组数据平均数之差平方后的均值,即离均差平方后的平均数。标准差(standarddeviation)即方差的平方根,常用S或SD表示。若用

表示,则是指总体的标准差。79第二节离散趋势的度量三、方差与标准差25第二节离散趋势的度量(1)总体方差(未分组的数据)(已分组的数据)(2)样本方差(未分组的数据)(已分组的数据)(3)总体标准差(未分组的数据)(已分组的数据)(4)样本标准差(未分组的数据)(已分组的数据)80第二节离散趋势的度量26第二节离散趋势的度量

方差与标准差是表示一组数据离散程度的最好、最常用的指标。其值大,说明离散程度大;其值小,说明数据比较集中。它基本具备一个良好的差异量数应具备的条件:①反应灵敏;②由一定的计算公式严密确定;③容易计算;④适合代数运算;⑤受抽样变动的影响小;⑥简单明了,这一点与其他差异量数比较稍有不足,但其意义还是较明白的。除上述之外,方差还具有可加性特点,它是对一组数据中造成各种变异的总和的测量,能利用其可加性分解并确定出属于不同来源的变异性(如组间、组内等)并可进一步说明每种变异对总结果的影响。81第二节离散趋势的度量27第二节离散趋势的度量五、变差系数变差系数又称变异系数、相对标准差等,通常用符号CV表示,其计算公式为:其中,S为某样本的标准差;

为该样本的平均数。变异系数是一个无量纲的量。变差系数适于用在比较有不同算术平均数或有不同量纲的两组数据的情况。82第二节离散趋势的度量五、变差系数28第二节离散趋势的度量六、离散趋势度量的实例

【例7-5】2012年某大学公共管理学院MPA报考人数为311人,缺考2人,其余309人的英语考试成绩如表7-5所示,请计算相关的表征离散趋势的特征数。83第二节离散趋势的度量六、离散趋势度量的实例29第二节离散趋势的度量842012年某大学公共管理

学院MPA报考人员

英语成绩83.0082.0078.0063.0067.0077.0062.0065.0076.0067.0068.0073.0073.0074.0065.0075.0063.0076.0060.0065.0065.0068.0064.0073.0059.0060.0064.0070.0048.0067.0055.0061.0061.0062.0075.0077.0061.0067.0049.0062.0068.0072.0052.0063.0073.0059.0062.0066.0073.0054.0060.0062.0065.0069.0042.0050.0072.0079.0055.0055.0056.0057.0067.0073.0050.0052.0055.0057.0060.0044.0061.0062.0065.0045.0053.0060.0068.0054.0073.0055.0045.0054.0062.0041.0041.0056.0058.0061.0064.0054.0065.0075.0075.0046.0051.0051.0053.0075.0048.0049.0050.0053.0056.0059.0061.0036.0044.0047.0052.0058.0058.0040.0044.0047.0050.0056.0065.0057.0048.0051.0053.0053.0059.0060.0060.0035.0042.0045.0046.0054.0066.0034.0046.0038.0040.0047.0068.0042.0054.0043.0046.0054.0056.0081.0035.0036.0038.0056.0057.0061.0049.0037.0038.0044.0037.0040.0045.0045.0057.0057.0037.0038.0041.0045.0047.0049.0060.0066.0041.0042.0051.0038.0043.0046.0053.0063.0063.0030.0045.0049.0056.0034.0043.0054.0045.0046.0046.0049.0057.0042.0044.0041.0043.0045.0021.0040.0037.0036.0040.0045.0058.0030.0034.0035.0044.0060.0025.0053.0039.0043.0047.0048.0049.0011.0034.0036.0045.0048.0050.0026.0034.0042.0043.0033.0034.0020.0034.0044.0028.0042.0045.0049.0036.0039.0049.0037.0038.0043.0027.0033.0041.0041.0021.0033.0070.0033.0052.0025.0027.0036.0039.0046.0027.0030.0035.0033.0034.0020.0024.0026.0027.0031.0027.0035.0048.0031.0034.0038.0029.0022.0037.0024.0025.0031.0048.0039.0033.0029.0031.0034.0030.0032.0034.0016.0019.0030.0036.0030.0028.0024.0026.0032.0023.0034.0031.0019.0023.0024.0017.0010.0016.0028.0014.0024.0021.0014.0015.0048.0015.00302012年某大学公共管理

学院MPA报考人员

英语成绩8解:(1)极差:R=最大值-最小值=83-10=73(2)四分位差:

(3)方差和标准差。

85第二节离散趋势的度量解:31第二节离散趋势的度量(4)变差系数。86第二节离散趋势的度量32第二节离散趋势的度量集中趋势和离散趋势是数据分布的两个重要特征,但要全面了解数据分布的特点,还需要知道数据分布的形状是否对称、偏斜的程度以及分布的扁平程度等。偏斜度和峰度就是对这些分布特征的描述。偏斜度是对数据分布的偏移方向和程度所作的进一步描述;峰度是用来对数据分布的扁平程度所做的描述。对于偏斜程度的描述用偏斜度系数;扁平程度的描述用峰度系数。87第三节偏斜度与峰度的度量33第三节偏斜度与峰度的度量一、动差法动差又称矩,原是物理学上用以表示力与力臂对重心关系的术语,这个关系和统计学中变量与权数对平均数的关系在性质上很类似,所以统计学也用动差来说明频数分布的性质。一般地说,取变量的

值为中点,所有变量值与

之差的K次方的平均数称为变量X关于

的K阶动差。用公式表示为:88第三节偏斜度与峰度的度量一、动差法34第三节偏斜度与峰度的度量当

时,即变量以原点为中心,上式称为K阶原点动差,用大写英文字母M表示。一阶原点动差:

,即算术平均数;二阶原点动差:

,即平方平均数;三阶原点动差:

,等等。当

时,即变量以算术平均数为中心,上式称为K阶中心动差,用小写英文字母m表示。一阶中心动差:

;二阶中心动差:

;三阶中心动差:

;等等。89第三节偏斜度与峰度的度量35第三节偏斜度与峰度的度量二、偏斜度偏斜度是对统计数据分布偏斜方向及程度的度量。统计数据的频数分布有的是对称的,有的是不对称的,即呈现偏态。在偏态的分布中,又有两种不同的形态,即左偏态和右偏态。度量分布偏斜的程度,可计算偏斜度。采用动差法计算偏斜度系数是用变量的三阶中心动差

进行对比,计算公式为:当分布对称时,变量的三阶中心动差

由于离差三次方后正负相互抵消而取得0值,则

;当分布不对称时,正负离差不能抵消,就形成正的或负的三阶中心动差

。当

为正值时,表示正偏离差值比负偏离差值要大,可以判断为正偏态或右偏态;反之,当

为负值时,表示负偏离差值比正偏离差值要大,可以判断为负偏态或左偏态。

越大,表示偏斜的程度就越大。由于三阶中心动差

含有计量单位,为消除计量单位的影响,就用

去除

,使其转化为相对数。同样的,

的绝对值越大,表示偏斜的程度就越大。90第三节偏斜度与峰度的度量二、偏斜度36第三节偏斜度与峰度的度量三、峰度峰度是用来衡量统计数据分布的集中程度或分布曲线的尖峭程度的指标。计算公式为:当峰度

时,表示分布的形状比正态分布更尖更高,这意味着分布比正态分布更集中在平均数周围,这样的分布称为尖峰分布;

时,分布为正态分布;

时,表示分布比正态分布更扁平,意味着分布比正态分布更分散,这样的分布称为扁平分布。91第三节偏斜度与峰度的度量三、峰度37第三节偏斜度与峰度的度量一、SPSS简介社会科学统计软件包(statisticalpackageforthesocialscience,SPSS)是世界上著名的统计分析软件之一。它由美国斯坦福大学的三位研究生于1968年研制,同年成立了SPSS公司,并于1975年在芝加哥组建了SPSS总部。20世纪80年代以前,SPSS统计软件主要应用于企事业单位。1984年,SPSS总部首先推出了世界上第一个统计分析软件微机版本SPSS/PC+,开创了SPSS微机系列产品的开发方向,极大地扩充了它的应用范围,并使其能很快地应用于自然科学、技术科学、社会科学的各个领域。随着SPSS产品服务领域的扩大和服务深度的增加,SPSS公司已于2000年正式将英文全称更改为StatisticalProductandServiceSolutions,意为“统计产品与服务解决方案”,标志着SPSS的战略方向正在做出重大调整。92第四节SPSS在描述统计中的应用一、SPSS简介38第四节SPSS在描述统计中的应用

SPSS的基本功能包括数据管理、统计分析、图表分析、输出管理等。SPSS统计分析过程包括描述性统计、均值比较、一般线性模型、相关分析、回归分析、对数线性模型、聚类分析、数据简化、生存分析、时间序列分析、多重响应等几大类,每类中又分好几个统计过程,比如回归分析中又分线性回归分析、曲线估计、Logistic回归、Probit回归、加权估计、两阶段最小二乘法、非线性回归等多个统计过程,而且每个过程中又允许用户选择不同的方法及参数。93第四节SPSS在描述统计中的应用39第四节SPSS在描述统计中的应用二、SPSS的基本操作(一)启动SPSS单击Windows的[开始]按钮,在[所有程序]菜单项[IBMSPSSStatistics]中找到[IBMSPSSStatistics20]并单击(图7-3)。94第四节SPSS在描述统计中的应用二、SPSS的基本操作40第四节SPSS在描述统计中的应用(二)打开SPSS的主窗口。SPSS启动成功后,打开SPSS的主窗口[DataView]。SPSS的主窗口名为IBMSPSSStatisticsDataEditor(数据编辑窗口),如图7-4所示。95第四节SPSS在描述统计中的应用41第四节SPSS在描述统计中的应用在SPSS的主窗口的菜单栏中,共有12个选项:(1)File:文件管理菜单,有关文件的调入、存储、显示和打印等;(2)Edit:编辑菜单,有关文本内容的选择、拷贝、剪贴、寻找和替换等;(3)View:视图菜单,运用“视图”菜单可显示或隐藏状态行、工具栏、网络线、值标签和改变字体等;(4)Data:数据管理菜单,有关数据变量定义、数据格式选定、观察对象的选择、排序、加权、数据文件的转换、连接、汇总等;(5)Transform:数据转换处理菜单,有关数值的计算、重新赋值、缺失值替代等;(6)Analyze:统计菜单,有关一系列统计方法的应用;(7)DirectMarketing:直销菜单,有关了解顾客、改进行销活动等;(8)Graphs:作图菜单,有关统计图的制作;(9)Utilities:用户选项菜单,有关命令解释、字体选择、文件信息、定义输出标题、窗口设计等;(10)Window:窗口管理菜单,有关窗口的排列、选择、显示等;(11)Add-ons:附加程序菜单,有关输出管理系统控制、数据文件注释、定义和使用变量集、运行脚本、定制对话框等;(12)Help:求助菜单,有关帮助文件的调用、查询、显示等。96第四节SPSS在描述统计中的应用42第四节SPSS在描述统计中的应用(三)定义变量

打开[VariableView]进入变量定义窗口,对变量进行定义。变量定义包括11个方面的内容,分别为:[Name],[Type],[Width],[Decimals],[Label],[Values],[Missing],[Columns],[Align],[Measure],[Role],如图7-5所示。97第四节SPSS在描述统计中的应用43第四节SPSS在描述统计中的应用(1)[Name]:定义变量名。要求定义变量名,不能超过8个字符(中文和英文均可以),但不能与SPSS软件运算符相同的一些字符串,如all,and,by,not,or,to,with,eq,ge,gt,le,lt,ne;“(”,“)”,“/”,“?”等符号。(2)[Type]:定义变量类型。SPSS的主要变量类型有:Numeric(标准数值型)、Comma(带逗点的数值型)、Dot(逗点作小数点的数值型)、ScientificNo

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论