第22节-教育统计的特征量_第1页
第22节-教育统计的特征量_第2页
第22节-教育统计的特征量_第3页
第22节-教育统计的特征量_第4页
第22节-教育统计的特征量_第5页
已阅读5页,还剩48页未读, 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

第二节教育统计的特征量对杂乱无章的数据资料经过初步整理后,可以用统计表和统计图直观表现出数据的全貌。这种对统计资料粗略的、直观的概括是很有用的。但要进一步进行分析研究,只靠图表是不够的,还必须通过数据求得一些特征量,以此来解释统计资料的集中趋势、离散程度和相关程度等各项特点。其中描述统计资料的集中趋势的特征量是集中量;描述统计资料的离散程度的特征量是差异量;描述统计资料的相关程度的特征量是相关量。

一、集中量集中量是代表一组数据典型水平或集中趋势的量。它描述数据分布的规律性,也能反映频数分布中大量数据向某一点集中的情况。常用的集中量有平均数、中位数和众数。(一)平均数平均数是使用比较广泛,也较为简单易懂的一种集中量,它能反映一组数据资料的某种水平。1.算术平均数(1)算术平均数的概念算术平均数是所有观察值的总和除以总频数所得之商,简称平均数,用表示。设变量X1,X2,X3,…,Xn代表各次观察的结果,以N为观察的次数。则可简化为

(2)算数平均数的计算方法①原始数据法②频数分布表法在这里,X1,X2,…,Xk表示第1组到第k组的组中值;

f1,f2,….,fk表示第1组到第k组的频数;

2.加权平均数(1)加权平均数的概念加权平均数是不同比重数据(或平均数)的平均数,用表示如下:在这里,表示加权平均数;W表示各观察值的权数;X表示具有不同比重的观察值。

(2)加权平均数的计算方法①原始数据法:已知原始观察值,又知各原始数据的权数,则用原始数据法按定义式计算。例如:某生平时数学成绩为80分,期中考试成绩为90分,期末考试成绩为95分。按学校规定学期成绩中平时占20%,期中占30%,期末占50%。问该生学期总评成绩应为多少分?

②频数分布表法已知各组的平均数和各组的频数,则可用频数分布表法。公式为:在这里,表示各组的平均数;N表示各组的频数。例如,某年级各班的一次数学考试成绩如下表,求全年级的总平均分。

3.几何平均数

(1)几何平均数的概念几何平均数是N个数据连乘的N次方根。用

表示。用公式表示如下:若数据较多或较大时,可用取对数的方法来求几何平均数,即故几何平均数的对数实际上是各数据的对数算术平均数。(2)几何平均数的计算方法几何平均数适用于计算具有递增(或递减)性数据的集中量,计算方法直接用以上定义公式便可求出。

例如,近几年某地区职业学校在校学生人数如下表。求(1)这4年在校学生的平均数;(2)年平均增长率。(1)显然,这是一组具有递增性的数据,故其平均数宜用几何平均数,不宜用算术平均数。按公式可得:故这4年在校学生平均数为1196人。(2)本例中为求年平均增长率,需先求出以前一数据为基础的逐年增长的比值,即800÷500=1.6,1600÷800=2,3200÷1600=2,然后用公式可求出这些比值的平均数:由于还包含着以第1年的数据作为基数(即1),因而在求年平均增长率时,要减去1,即1.86-1=0.86=86%。故年平均增长率为86%。

4.调和平均数(1)调和平均数的概念调和平均数是一组数据倒数的算术平均数的倒数,也称倒数平均数.用表示.用公式表示如下:(2)调和平均数的计算方法调和平均数适用于求平均速率一类的问题.计算方法直接用以上定义公式便可解出.例如,设甲、乙、丙3个学生的解题速度如下:甲生每小时8题、乙生每小时7题、丙生每小时10题.求3人平均解题速度。由于此例是求平均速度问题,故宜用求调和平均数的方法.根据公式有:

验证:由于解1道题甲生所需时间为h=0.125h,乙生所需时间为h=0.143h,丙生所需时间为h=0.1h,则他们各解1道题(即共解3道题)所需时间为0.368h。由于所求的倒数平均数即为他们的平均解题速度,故在0.368h里他们共解题数为0.368×8.15=3(题),可见与事实相符。

算术平均数在几何或物理上表示一组数据的中心或重心位置,它可用于各组数据之间集中水平的比较;加权平均数用于求不同比重数据(或平均数)的平均数;几何平均数适用于计算具有递增(或递减)性数据的集中量;调和平均数适用于求平均速率一类的问题。

(二)中位数1.中位数的概念

中位数是位于以一定顺序排列的一组数据中央位置的数值,在这一数值上下各分布着一半频数。中位数常用Md表示。中位数也是一个常用的表示集中趋势的指标,对于分布大致对称的数据,中位数与算术平均数十分接近。而当数据分布过于偏时,用中位数表示的集中趋势比算术平均数更为合理。

2.中位数的计算方法(1)原始数据法将一组原始数据依大小顺序排列后,若总频数为奇数,就以位于中央的数据作为中位数;若总频数为偶数,则以最中间的两个数据的算术平均数作为中位数。例如,有以下7个数据,从小到大排列为:5,7,9,13,15,16,19因为数据个数为奇数,则位于中间的数值13即为中位数:Md=13又如,下面有8个数据,从小到大排列为:3,5,7,9,13,15,16,19因为数据个数为偶数,则取位于中间位置的两个数9与13求算术平均数(9+13)/2=11即为中位数:Md=11

(2)频数分布表法若一组原始数据已经变成了频数分布表,可用内插法,通过频数分布表计算中位数。计算时,可以在频数分布表上由数值小向数值大的方向计算;也可以由数值大向数值小的方向计算,公式如下:由小向大的计算公式:Lmd

表示中位数所在组的下限;N表示总数;n1

表示小于中位数所在组下限的频数总和;i表示频数分布表上的组距;fmd

表示中位数所在组的频数。

以表2.7数据为例,说明由数值小向数值大计算中位数的步骤。

由大向小的计算公式为:在这里,Umd

表示中位数所在组的上限;n2表示大于中位数所在组上限的频数总和。当由小向大计算中位数时,如果小于某一组下限的累积频数正好等于总频数的一半,那么该组的下限就是中位数;当由大向小计算时,如果大于某一组上限的累积频数正好等于总频数的一半,那么该组的上限就是中位数。

(三)众数1.众数的概念在一数列中出现频数最多的一个数值称为众数,常用Mo表示。如果所有数据项都不相同,就没有众数。在频数分配表上,频数最多的一组的组中值就是众数。在曲线图上,曲线的最高点所对应的横轴上的数值,就是众数。2.众数的计算方法(1)观察法若数据已归类而组距为一个单位时,则次数出现最多的数据即为众数;若组距为一个单位以上,则以次数最多一组的组中值为众数;当相邻两组频数都是最多时,则分组点为众数。

(2)公式法a.金氏插补法当频数分布呈偏态,即众数所在组以上各组频数总和与以下各组频数总和相差较多时,可以采用金氏公式计算众数,以进行比率调整,其公式为:L表示众数所在组的下限;fa表示大于众数所在组上限那个相邻组的频数;fb表示小于众数所在组下限那个相邻组的频数;i表示组距。

b.皮尔逊公式法公式为算术平均数、中位数与众数三者的关系:当频数分配不甚偏斜时,众数与中位数距离较远于平均数与中位数的距离,即“众数与中位数之间的距离”和“平均数与中位数之间的距离”之比为2:1皮尔逊公式法适用于当频数分布呈正态或接近正态时求众数。

平均数有优于中位数和众数的特点:第一,平均数是根据全体数据参与计算得来的,可以作为一组数据的代表值;第二,简明易懂;第三,可由无次序的数据直接求出;第四,计算公式可用作代数运算;第五,较稳定可靠,受抽样影响不很大;第六,已知平均数与频数可求出总数。平均数也有不足之处:第一,受极端数据的影响较大;第二,如有某几个数据不知道就无法求出。中位数不受极端数据的影响,尤其是在一个方向上出现较多的极端数值时,使用中位数作为集中的代表性较好。但由于中位数只利用了相对位置的信息,所以一般情况下它的集中代表性不如平均数。众数仅利用了数据出现频数最多的信息,因而在一般情况下其代表性不如平均数和中位数,但在单峰的偏态分布中,众数的集中代表性较好。由于平均数(尤其是算术平均数)有较多的优点,且在推断统计中也常常用到,所以我们的统计报告中一般都要选用平均数。

二、差异量(一)全距全距是一组数据中最大值与最小值之差,又称极差,用R表示。用频数分布表求全距的方法是:最大一组与最小一组组中值之差,或者是最大一组上限与最小一组下限之差。全距意义简明,计算方法简单。但它只能反映数据组的两极端值的离差程度,不能反映中间数据的分布情况。所以,全距不是测量数据分布的良好尺度,它具有很大的局限性,只有与其他差异量结合起来使用,才能比较全面地反映出数据分布的情况。(二)平均差平均差是每个数据与该组数据的集中量(如算术平均数、中位数)之差的绝对值的算术平均数。一般用符号AD表示,其公式为在这里,N为数据个数;为平均数;Md

为中位数。

对频数分布表求平均差,可用以下公式在这里,f为各组频数;X0为各组组中值;其余符号同上。平均差是以各数据离开算术平均数或中位数的总的趋势来表示一组数据的离散程度的。它的意义明确,计算容易,且考虑到了全部离差,受两极端数值影响小。但计算要用绝对值,不便于代数运算,因而在教育统计中用得不多。

(三)标准差

1.标准差的概念一组数据离差平方的算术平均数,我们称之为方差。标准差是指方差的平方根。方差用表示,标准差用表示。其定义公式为:在这里,X-

表示离差;N表示总频数。标准差的值越大,表明这组数据的差异程度越大;标准差的值越小,表明这组数据越整齐,分布范围越小。标准差具有反应灵敏、计算简单等优点,所以与其它差异量相比,标准差应用最为广泛。当描述一组数据的离散程度,集中量用算术平均数表示时,差异量要用标准差表示。

2.标准差的计算方法

(1)原始数据法将定义公式加以整理,可变成不必求离差,直接用原始数据计算标准差的公式。其公式为:在这里,X表示原始数据;N表示总频数。(2)频数分布表法当原始数据已经归入频数分布表,而且原始数据又不在手边,这时可以用组中值近似计算。其计算公式为:在这里,X表示各组组中值;f表示各组频数。

3.标准差的组合在实际统计工作中,我们有时已知若干组数据的标准差,要计算全体数据的总标准差,这就是所谓标准差的组合问题。设K组数据的有关资料分别为:并且,N=N1+N2+N3+…+Nk那么,根据方差的可加性可得到、所有N个数据的总标准差的计算公式为:

标准差是比较完善的一种极为重要的差异量。它比全距和平均差都具有优越性。虽然全距的优点是意义明确,计算简单,但由于全距是由一组数据的最大值与最小值决定,因而不能反映分布内部的情况,它不是一种可靠的差异量,用途很少。而平均差虽然意义明确,但在计算时采用了绝对值,不适合代数方法的运算,因而用处不大,在差异量中,无疑标准差是最科学、最完善的一个差异量。这是因为它具有以下特点:(1)标准差反映全部数值的差异情况;(2)标准差适合于代数方法运算;(3)标准差受抽样变动的影响较小。但标准差也有一些缺点,比如说,标准差计算较为复杂,结果易受两极端数值的影响。尽管如此,在各种差异量中,使用最多的仍是标准差,而且往往是把平均数同标准差结合起来使用。标准差与平均数配合使用时,通常表示为

(四)三种差异量的数值关系当总频数相当大,且频数分布呈正态时,全距、平均差、标准差的数值存在如下关系:全距大致等于6个标准差的距离;全距大致等于7.5个平均差的距离。用公式可表示为:

R≈6σ≈7.5AD;

AD=0.7979σ;

σ=1.2533AD算术平均数上、下各一个平均差之间包括57.51%的总频数。算术平均数上、下各一个标准差之间包括68.26%的总频数。因此,三种差异量的数值之间存在一定的关系。已知某种差异量可以粗略求得其他差异量。

(五)差异系数

1.差异系数的概念全距、平均差、标准差都是带有原观察值同一单位的差异量,这种差异量称为绝对差异量。这种绝对差异量对单位不同或单位相同但两个平均数相差较大的数据,都无法比较差异的大小因而其使用范围受到一定限制。当我们要比较单位不同或者单位相同但平均数悬殊较大的几组数据的差异度时,必须用相对差异量进行比较。相对差异量又称差异系数。所谓差异系数是指标准差与算术平均数的百分比,差异系数用CV表示,它没有单位。用公式表示为:差异系数是相对于平均数的离散比率值。差异系数反映了分布中全体数据相对于自身平均数的离散程度。另外,用CV作为衡量学校教学是否面向全体学生,分析学生成绩两极分化情况的指标也较理想。

2.差异系数的用途差异系数的用途主要体现在两个方面:第一可以比较单位不同的数据资料的差异程度;

(六)偏态系数

1.算术平均数、中位数、众数与频数分布

2.偏态系数的求法偏态系数也是一种相对差异量。前面,我们已经初步接触到偏态,但只知分布是否为正偏态或负偏态,而未知其所以然。如果知道偏态系数的计算方法,就可以知道它为何是正偏态,为何是负偏态。求偏态系数的方法有两种:(1)利用算术平均数与众数(或中位数)的距离求偏态系数,其公式为:

(2)利用α3求偏态系数,其公式为:在这里,α

3

表示偏态系数;X表示原始数据;表示平均数;σ表示标准差。若用频数分布表计算偏态系数,其公式为:在这里,α3

表示偏态系数;X表示原始数据;表示平均数;σ表示标准差。在这里,X表示各组组中值;f表示各组频数;其余量意义同上。这里分子为各项离差的立方和的算术平均数,分母为标准差的立方。当α3=0时,表明频数分布呈对称形;当α3>0表明频数分布呈正偏态;当α3<0表明频数分布呈负偏态。当总频数N>200时,所计算出的偏态系数才比较可靠。

三、相关量(一)相关系数的概念某一事物的变化,总是与其他事物的变化相互联系,相互影响的。这种联系,从数量关系来揭示它,可以分为两种类型。一种是函数关系,另一种是相关关系,函数关系是一种严格确定的关系,它反映了事物之间所存在的的严格的依存关系,其特征是现象与现象之间的关系是一一对应的,它通常可以用一个数学表达式准确地表达出来,它反映了必然现象的规律性,函数关系属于传统数学研究的范畴。

相关关系是两组变量之间的非确定性的关系,它反映了变量之间不十分严格但却依然存在着的依存关系,相关关系反映了偶然现象的规律性,它是一种大概如此而绝非如此的关系。相关关系属于统计研究的范畴。例如:学习成绩与智商的关系,学校条件与办学水平的关系等等都属于相关关系的范畴。如果两个变量的变化方向一致,即一个变量变大时,另一个变量值也随之变大;一个变量变小时,另一个变量也随之变小,这种关系我们称之为正相关。如果两个变量之间的变化方向相反,即一个变量变大时,另一个变量值随之变小;一个变量变小时,另一个变量数值随之变大,这两个变量之间的关系我们称之为负相关。两个变量之间变化方向无一定规律,我们称之为零相关。

相关关系我们一般用相关系数(r)表示。它的范围为–1<r<1,由r的正、负号以及绝对值的大小,可以表明两个变量之间的变化方向和密切程度。但相关系数只能描述两个变量之间的变化方向和密切程度,并不能揭示二者之间的内在本质联系,如果要分析其内在本质联系,必须借助于这两个变量相关的专业知识。相关系数的计算方法很多,常见的有积差相关、等级相关、点二列相关、二列相关以及Φ相关等。

(二)积差相关系数1.积差相关系数的概念和条件当两个变量都是正态连续变量,而且两者之间呈线性关系,表示这两个变量之间的相关称为积差相关。积差相关系数的定义公式为:在这里,σX表示X变量的样本标准差;σY表示Y变量的样本标准差。积差相关的使用条件是:(1)两个变量都是连续性数据;(2)两个变量的总体呈正态分布,或接近正态分布,至少是单峰对称的分布;(3)必须是成对的数据,每对数据之间是相互独立的,而且变量对数N>30.(4)两个变量之间呈线性关系。

2.积差相关的计算方法(1)原始数据法由定义式可得:(2)用

,σX,σY和∑XY计算的方法:

(三)等级相关系数1.等级相关的概念和适用范围等级相关是指以等级次序排列或以等级次序表示的变量之间的相关。斯皮尔曼等级相关斯皮尔曼等级相关应用范围较广,是因为当两个变量值以等级次序排列或以等级次序表示时,两个相应总体并不一定呈正态分布,样本容量也不一定大于30,这两种情况都可以用该等级相关来求。2.斯皮尔曼等级相关的计算方法在这里,rR表示等级相关系数;D表示两个变量每对数据等级之差;N表示样本容量。

以上所计算出的相关系数必须检验其显著性,才能评价其相关程度。检验的简单方法是直接根据自由度df=N-2和所确定的检验形式(单侧或双侧),查积差相关系数界值表,寻找r的临界值[表中P(1)表示单侧临界值,P(2)表示双侧临界值],然后将样本r值直接与临界值相比较。如上面两个例子,根据df=N-2=10-2=8,查积差相关系数界值表,r的双侧临界值为r(8)0.01=0.765,由于第一例r=0.78>0.765=r(8)0.01,P<0.01,于是在0.01显著性水平上说明学生初一的数学分数与初二的数学分数存在着正相关。进一步说明了数学成绩的稳定性。第二例r=0.84>0.765=r(8)0.01,则P<0.01,于是也在0.01显著性水平上说明数学分数和物理分数存在着正相关。

(四)点二列相关1.点二列相关的概念和适用范围在两个变量中,其中一个变量是来自正态总体的连续变量,另一个变量为二分变量(例如对与错、男与女、合格与不合格、色盲与非色盲等),这时,表示这两个变量之间的相关,称为点二列相关。点二列相关应用范围只能限制在一个变量是来自正态总体的连续性变量,另一个是真正的二分变量,或者这个变量虽然并非真正的二分变量,而是双峰分布的变量的情况。2.点二列相关系数的计算方法

计算点二列相关系数的计算公式为:用另一种形式表示为:

在这里,rpb表示点二列相关系数;

p表示二分变量中某一类别频数的比率;

q表示二分变量中另一类别频数的比率;表示与二分变量中p类别相对应的连续变量的平均数;表示与二分变量中q类别相对应的连续变量的平均数;表示连续变量的标准差;表示连续变量的平均数。例,在某班中随机抽取15名学生的数学考试成绩如下。问考试成绩与学生性别是否有关?由以上成绩可求得σt=12.19求得的点二列相关系数可以通过查积差相关系数显著性临界值表进行显著性检验。本例df=15-2=13,查得r(13)0.05=0.514.因rpb<r(13)0.05,故rpb无显著相关的意义,即男女生的数学成绩与性别并没有明显

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论