刘丽芳 教育统计学课件描述统计_第1页
刘丽芳 教育统计学课件描述统计_第2页
刘丽芳 教育统计学课件描述统计_第3页
刘丽芳 教育统计学课件描述统计_第4页
刘丽芳 教育统计学课件描述统计_第5页
已阅读5页,还剩209页未读, 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

教育统计学本学期主要内容第一章绪论第二章数据的初步整理第三章集中量第四章差异量第五章相关关系第六章抽样分布及总体平均数的推断第七章平均数差异的显著性检验第十章χ²检验第十一章相关分析主要内容:1.1统计学的发展史简介1.2教育统计学的主要内容1.3统计学中的基本概念1.4学习教育统计学的方法第一章绪论1.1.1统计学的起源第一阶段称之为“城邦政情”

阶段STATISTICS(统计学)一词源于法语STATUS(状态)自中世纪以来逐渐演变为含有政治意味的STATE(国家)。因此,统计学包含有对国家状态作调查研究的意义。概率论的起源与发展。概率论的发展最早源于赌博

1654年:德.梅勒,帕斯卡,费马(法国)惠更斯(C.Huygens)著《论赌博中的计算》

1.1统计学的发展史简介第二阶段称之为“政治算数”

阶段十七世纪,政治算术统计学在英国兴起。1690年英国威廉·配弟出版(政治算数)一书作为这个阶段的起始标志.K.Pearson(1857~1936),

在前人的基础上发展出许多描述统计方法:频数分布、频数分布函数、标准差、相关等。第三阶段称之为“统计分析科学”

阶段W.S.Gorsset(戈赛特)(Student)开始研究t分布R.A.Fisher(费希尔)统计推断学的创立F分布1.1.2统计学的应用

当今信息时代,无论社会政治、军事、经济,还是生物医学、教育心理、工农业生产等各行各业都有大量的数据,需要我们进行分析,从中挖掘出有用的证据、消除虚假的信息,发现事物内部的规律性。

案例1‘非典’中的统计问题北京血液中心高XX主任介绍:香港医务人员用已康复者血浆治疗20例非典病人无一例死亡,而其对照组20例中,有3人死亡。这表明用康复病人血浆治疗非典病人是有效的。

---摘自<北京日报>2003.5.28用康复病人血浆治疗非典病人真有效吗?应用统计分析进行卡方(χ²)检验,很快得出结论:P=0.2308>0.05.经过统计分析,认为两组差别无统计意义。现在实事也不支持原研究者的用康复病人血浆治疗非典病人结论。案例2离婚案件

1949年,西方某国家曾有过一个真实的故事。丈夫到法院要求离婚,唯一的理由是他去海外服兵役50个星期后,回家发现妻子在家分娩。法官怎么样判案?

这桩诉讼案的统计学问题是如何判定正常最长妊娠期的时间。正常妊娠期的统计分布图正常妊娠期超过48周的频率几乎为零。大部分人会觉得丈夫蒙受了不白之冤,如果当时法官仅通过正常妊娠期分布,会判丈夫胜诉。此时,妻子可能蒙冤,虽然其蒙冤的可能性很小。法官判决法官根据医学界的证词,认定怀孕50周,尽管不大可能,但仍可能是科学事实,因此判丈夫败诉。

在这桩诉讼案中,统计学依据和其它法庭证据一样,只能为法官判案提供参考,不能成为唯一的判决依据。

2000年,法国政府已将统计学列入二十一世纪影响法国社会发展的十个重大领域之一。2001年,中国国家教育部为推进基础教育改革而推出新课程标准,将统计学纳入新的小学数学课程。要求小学生要“经历运用数据描述信息、作出推理的过程,发展统计观念”。

1.2.1统计学与教育统计学1.统计学统计学是研究统计原理和方法的科学。具体:是研究如何搜集、整理、分析反映事物总体的数字资料,并以此为依据,对总体特征进行推断的原理和方法。

2.教育统计学

教育统计学是运用数理统计的原理和方法研究教育问题的一门应用科学。主要任务:研究如何搜集、整理、分析由教育调查和教育实验等途径所获得的数字资料,并以此为依据,进行科学推断,从而揭示蕴含在教育现象中的客观规律。1.2教育统计学的主要内容

教育调查研究流程提出问题——确定调查内容——确定调查范围——进行调查——收集、整理、分析数据资料——得出结论。教育科学实验研究流程教育科学实验:提出问题——界定——确定研究范围——假说——实验——收集、整理、分析数据资料——得出结论。教育统计学的研究内容(1)提供各种统计方法的应用条件。(2)对统计计算的结果进行解释。1.描述统计

对已获得的数据进行整理、概括,显现其分布特征的统计方法,称为描述统计。常用的描述统计方法:集中量、差异量、标准分数、相关量。

2.推断统计

根据样本所提供的信息,运用概率的理论进行分析、论证。在一定可靠程度上对总体分布特征进行估计、推测。这种统计方法成为推断统计。3.实验设计

实验者为了揭示实验中自变量与因变量的关系,在实验前所制订的实验计划称为实验设计。

1.2.2教育统计学的基本内容

资料收集描述统计推断统计概率论经常性资料调查数据实验数据历史资料测验数据统计图表集中量差异量相关量

Z检验T检验χ²检验相关分析1.2.3教育统计学的结构

1.3教育统计中几个基本概念。

1.随机现象:它具有以下三个特征:①一次实验有多种可能的结果,其所有可能的结果是已知的;②试验之前不能预料哪一种结果会出现;③在相同的条件下可以重复实验。2.随机事件:随机现象的每一种结果叫做一个随机事件。3.随机变量:我们把能表示随现象各种结果的变量称为随机变量。所研究的具有某些相同性质的全部单位或事件的整体。总体无限总体:含无限多个单位。范围有限总体:含有限个单位。样本:亦可称为抽样总体,是从总体中抽取部分单位所组成的整体,用以分析总体。样本中包含个体的数目成为样本的容量,用n表示

二总体和样本三统计量和参数

参数:总体上的各种数字特征是参数总体平均值µ总体标准差σ统计量:样本上的数字特征是统计量样本平均值样本标准差σx随机抽样是根据随机原则来抽取样本单位

.简单随机抽样方法:在抽样框中的每个单位都具有相同的被抽中的机会,每个容量相同的样本被抽中的机会也是相同的。

亦称为纯随机抽样抽取样本的方法:有放回抽样和无放回抽样。

适合:总体内部差异不是很大,规模也不大的情况。四抽样方法机械抽样方法:抽样框中的N个单位被分成k个系统,k等于抽样框的容量N除以所需的样本容量n,在抽样框中前面的k个个体或单位中随机抽出第一个样本单位,然后,可在其后的每隔k个单位抽取样本中其余的部分。亦可称为等距抽样············例如:从我校11级3000名新生中随机抽取300人了解其英语学习水平。分层抽样亦可称为类型抽样

方法:将总体全部单位分类,形成若干个类型组,后从各类型中分别抽取样本单位,合成样本。总体N样本n······例如,对某校800个学生的品德情况进行了解,拟取40个学生作为样本。800个学生学科成绩优(160人):良(320人):中(240人):差(80人):然后从各部分随机抽样。整群抽样方法:首先把总体中的N个单位划分成为若干个群,并要求每个群对整个总体都具有代表性,然后对群进行简单随机抽样,并对抽中群内的所有单位进行调查研究。

总体群数R=16样本群数r=4样本容量ABCDEFGHIJKLMNOPLHPD适用范围:比简单随机抽样的方法能节约更多的成本,特别当总体的分布地域非常辽阔时。思想观念+学习方法

1.4学习教育统计学的方法

1)思想观念教育统计学不神秘,不可怕,不难学好。教育统计学既很有用,也很有趣。中学教师专业成长过程中必须开展教学研究(论文)2)学习方法

2)重视典型案例的系统学习重点掌握:基本概念、各种方法使用条件、范围3)重视理论与课后练习相结合第二章数据的初步整理§2—1数据的来源及种类§2—2统计表§2—3统计图§2—1数据的来源及种类

一数据的来源1.

经常性资料2.

专题性资料(1)教育调查:现情调查、回顾调查和跟踪调查(2)教育实验:单组实验、等组实验二数据的种类1.按数据的来源分:点计数据和测量数据.2.按随机变量的取值分:间断型随机变量和连续型随机变量.2.2.1表的基本结构标题表号标目(横标目、纵标目)线条(三栏一竖)数字(表的主要内容)表注§2—2统计表1.简单表只列出观察对象的名称、地点、时序或统计指标名称的统计表为简单表。表2.2某年级各班学生人数班别一班二班三班四班五班人数42365045173表2.3某校高三学生各年高考录取人数年份199819992000总和高考录取人数1441231253922.2.2统计表的种类

2.分组表只按一个标志分组的统计表成为分组表。

表2.5上海市区幼儿20米跑步用时年龄组3岁4岁5岁6岁平均秒数(

)7.717.166.045.533.复合表按两个或两个以上标志分组的统计表为复合表。表2.6本市市区、郊区4岁和6岁幼儿守恒能力测定成绩统计表nS4岁市区16763.3719.17郊区9166.1518.236岁市区16791.4719.53郊区9197.7516.572.3.3.1概念1.频数某一个随机事件在n次试验中出现的次数称为这个随机事件的频数。2.频数分布将各种随机事件在n次试验中出现的次数分布,称为频数分布。3.频数分布表频数分布用表格形式表达出来,这种表格叫频数分布表。2.3.3频数分布表列法

例2.1师大附小二年级80个学生的身高如下表,并用该数据做频数分布表。表2.9师大附小二年级80个学生的身高1351341291331311311311341251281351271271331301321321291241321221241271311371321331341241281351331311231151321341381241321281361271201251311361271241291291321381251311201211441281331281271301201211221271211251301401211261301221281271251271312.3.3.2连续变量频数分布表的编制

1.求全距

全部数据的最大值与最小值之差例:R=最大值—最小值=144—115=29(cm)2.决定组数与组距

组数(k):分组的个数(一般10~15为宜),具体根据样本大小来确定组数,组数的确定要与组距同时考虑。例题中决定组数为10。上例:i=3.决定组限每组的最低值为下限,最高值为上限,列出各组组限时,最低一组应包括最小的一个数据,最高一组应包括最大的一个数据。4.登记频数并计算用划“正”字法。将数据列入相应的组距内,在归组时如遇有的数据正好等于某组的组限时,可将它归入数据较大的一组。5.计算频数

全部数据登记完后,把各组次数写在频数分布表内,用“f”表示。表2.10二年级80个学生身高的频数身高(1)组中值(2)频数(3)115-118-121-124-127-130-133-136-139-142-116.5119.5122.5125.5128.5131.5134.5137.5140.5143.513810201912421总和801.区分几个概念组中值频数(绝对频数)(f)相对频数(比率)(rf)累积(绝对)频数(cf)累积相对频数(Relcf)2.3.3.3制作累积频数和累积百分比分布表

表2.10二年级80个学生身高的频数、累积频数、累积百分比表身高组中值频数相对频数累积频数累积百分比115-118-121-124-127-130-133-136-139-142-116.5119.5122.5125.5128.5131.5134.5137.5140.5143.513810201912421.0125.3750.1000.1250.2500.2375.1500.0500.0250.01251412224261737779801.255.0015.0027.5052.5076.2591.2596.2598.75100总和802.累积频数和累积百分比分布表

2.3.1表示间断变量的统计图1.直条图是利用条形的长短比较各种统计指标的大小。绘制手续简便、表现形式明确、图形效果良好。纵排——柱形图横排——带形图§2—3统计图

图2.1大学生和高中生对化学课程的不满意率(2001年)绘制直条图注意点:图形的尺度必须以零点为起点,同时尺度上的任何单位必须用相等距离表示。条形的长短表示数量的多少。各条形的宽度必须相等,各条形之间的间隔应一致,一般为条形宽度的一半至一倍比较合适。各条形的排列应有一定的顺序。直条的顶端和下端不要注写数字。在复合条形图和条形结构图中应采用不同的线纹或颜色加以区别并加制图说明。

2.圆形图圆形图的定义是一种经常用来说明总体结构的图形。一个圆形代表一个完整的总体,圆形内的各个扇形相当于总体的各个组成部分.

绘制步骤求各组成部分所占百分比.求组成部分的中心角度数.以圆的下半径(或上半径)为基线,按被比事物特定顺序,根据各部分的角度数,以顺时针方向,用量角器将图形分成几个扇形.用不同线条或不同颜色将各扇形加以区别,并在各扇形内用简要文字及百分比加以注明.例2.2将下表11的资料制成图2表2.11某区幼儿园家长文化程度统计表文化程度百分比圆心角初中以下初中高中、中专大专以上40.2%40.8%15.9%3.1%144.72°146.88°57.24°11.16°图2.2:某区幼儿园家长文化程度统计图1.线形图定义表示两个变量之间的函数关系。一种事物随另一种事物变化的情况;某种事物随时间推移的发展趋势等。绘制方法先画一条直角坐标系,横轴表示时间或自变量,纵轴表示频数或因变量。描点:用直线连接相邻两点。(按时间顺序连成线条即成)2.3.2表示连续变量的统计图

表2.12建国以来某地区幼儿园人数统计表年份人数(万)解放前495153552.03.54.04.56.0图2.3:建国以来,某地区幼儿园人数发展统计图1.线形图注意点:绘折线,不画光滑曲线图中相比较的线一般不超过五条,图中不用文字或数字表示。常用的频数分布图有:直方图多边图累积多边图2.频数分布图表2.13二年级80个学生身高的频数、累积频数、累积百分比身高组中值频数累积频数累积百分比115-118-121-124-127-130-133-136-139-142-116.5119.5122.5125.5128.5131.5134.5137.5140.5143.5138102019124211412224261737779801.255.0015.0027.5052.5076.2591.2596.2598.75100总和80直方图

用面积表示频数分布,用各组上下限的矩形面

积表示各组的频数.

作横轴:把上表第(1)列的上、下限或第(2)列的组中值分置于横轴上.表上共有10个组,而作图时,须在横轴的两端至少各空出一个组距的位置.作纵轴:在纵轴上表明尺度及其单位,以指示频数.在纵轴上定出各组频数高度,并在各组频数高度处划一横线与各组上、下限的两条纵线相交,形成一个矩形。由于横轴上各组距之间是连续的,故各矩形之间不能留空隙。甚至每个矩形的内侧垂线也可以不画.图2.5:二年级80个学生身高的频数分布直方图特点:以纵轴上的高度表示频数的多少。绘制:以各组的中点为横坐标,以各组的频数为纵坐标描点并用直线连接,即成。图形的两端应该引至外侧一组的中点与基线相接。图2.6:二年级80个学生身高的频数分布多边图多边图图2.7:二年级80个学生身高的频数分布多边图累积频数多边图的绘制:※作横轴将学生身高各组的上、下限分置于横轴上。※作纵轴在纵轴上标明尺度与单位,以指示累积频数。※描点以各组上限为横坐标,各组累积频数为纵坐标描点,用弧线连接每相邻的两点,即成累积频数多变图,图形左端应引至第一组的下限与基线相接。累积频数和累积百分比多边图

表2.14二年级80个学生身高的频数、累积频数、累积百分比表例图2.8:二年级80个学生身高的累积频数和累积百分比分布图身高组中值频数累积频数累积百分比115-118-121-124-127-130-133-136-139-142-116.5119.5122.5125.5128.5131.5134.5137.5140.5143.5138102019124211412224261737779801.255.0015.0027.5052.5076.2591.2596.2598.75100总和80因为累积频数和累积百分比图形都成“S”形,所以统称为“S”型曲线。S型曲线特殊应用是:假如给出横轴上一个分值,我们可以找出其百分位置.成绩组中值甲组乙组20-22.53125-27.511430-32.562035-37.5101940-42.5182145-47.5212150-52.5291455-57.5281360-62.540565-67.531470-72.532275-77.519080-82.514085-87.510090-92.540总计266134练习:把下列甲乙两组学生化学成绩的分布制在同一直角坐标上,以资比较3.1算术平均数3.2中位数3.3众数第三章集中量

集中量是代表一组数据典型水平或集中趋势的量。集中量的作用:利用集中量数可以对各个总体(或各个样本)进行比较。集中量的种类:平均数()中位数(Md);众数(Mo)

集中量的概念及作用

1、概念算术平均数通常称平均数,统计上简称均值或均数,是最重要的集中量数,常用代表总体平均数,代表样本平均数。2.公式:(算术平均数=)其中:=总和

X=各观察值

N=观察值的个数3.1.1算术平均数概念3.1算术平均数1.原始数据计算法例:某幼儿园大班幼儿10名,在某次计算练习中成绩分别为9,6,8,9,7,6,8,9,7,7。试计算这些幼儿的计算练习的平均成绩。3.1.2算术平均数计算解:公式:其中:

表示各组组中值与频数乘积之和 表示频数总和(=N)2.频数分布表计算法(组中值计算法)

例:表3.148个学生数学分数算术平均数组中值计算算术平均数是最好的集中量数,因为它具备一个良好的集中量所应具备的条件。(1)优点:○反应灵敏:一组数据中任何一个数值发生或大或小的变化,所计算出来的算术平均数也会随之变大变小。○严密确定:由同一组数据计算出来的平均数是同一个值。○计算简便:只需四则运算。○受抽样变动的影响较小。○是计算方差、标准差、相关系数以及推断统计的基础。(2)缺点:○易受两极端数值的影响(只要一个极低值,就会下降,反之则上升)。○一组数据中某个数值模糊或不确切,就无法计算其。3.1.2算术平均数的应用及其特点中位数是位于依一定大小顺序排列的一组数据中央位置的数值,大于及小于这一数值各有一半数据分布。中位数普遍用符号Md表示,在中位数前后所包含数据的次数各为50%,即50%的分数在它上面,50%的分数在它下面。3.2.1中位数概念3.2

中位数(Md)1.原始数据计算方法将原始数据依大小顺序排列后,如总频数是奇数,就以位于中央的数据作为Md.例:有以下7个数据,依次从小到大排列:3、5、7、8、9、11、14因为数据个数为奇数,则位于中间的数值8就是中位数即:Md=83.2.2中位数计算方法2.频数分布表计算法如总频数为偶数,则以最中间的的两个数据的算术平均数为中位数例:有以下8个数据,依次从小到大排列

6,9,10,11,12,14,13,17Md=计算公式:Md=Lmd+(n1)(由小向大计算)

在这里Lmd表示中位数所在组的下限N表示总频数n1表示小于中位数所在组下限的频数总和i表示频数分布表上的组距fmd表示中位数所在组的频数○计算步骤:求确定中位数所在组由上往下(或由下往上)累积频数,直至略大于为止,该组就是中位数所在组。确定由中位数所在组取多少个频数,就能使由上往下(或下往上的积累频数等于,即求n1,n1为小于中位数所在组下限的频数总和)本例中

n1=-23=1计算中位数所在组所取频数的距离即求(n1)fmd是中位数所在组的频数i=组距本例:()×=0.71将以上求得的结果与中位数所在组的下限相加便是中位数Md=L+(n1)×(由上往下数的频数)=80+(-23)×=80.71另:Md=U-(-n2)×(由下往上数的频数)U表示中位数所在组的上限

n2表示大于中位数所在组上限的频数总和本例Md=85-()×=85-=80.71注意:○由上往下计算Md时,当小于某一组下限的累积频数正好等于总频数的一半,那么,该组的下限是中位数。○由下往上计算Md时,大于某一组上限的累积频数正好等于那么,该组的上限就是中位数。○中位数是百分位数中的特例。在同一数据中按次序位于某一百分位置的数值,百分位数一般用(Pp)表示。例:第70百分位数,记作(P70),就是在依次从小到大排列的一组数据中小于

这个数值的有70%个频数,大于这个数值有30%个频数的那个数值.中位数(Md)就是第50百分位数,小于它有50%个频数,大于它也有50%个频数,它是百分位数中的特例.3.2.3.1百分位数概念3.2.3

百分位数(Pp)

在频数分布表上可以用内插法计算某个百分位数,其计算公式为:Pp=Lp+(p*N-n)在这里:

Pp表示百分位数

p表示与百分位数相对应的比数

N表示总频数

Lp表示百分位数所在组的下限

n表示小于百分位数所在组下限的频数总和

fp表示百分位数所在组的频数。

i表示组距。3.2.3.2百分位数的计算方法表17:48个学生数学分数百分位数计算表3.3.1众数的概念是集中量的一种指标,用Mo表示,它有理论众数和粗略众数两种。理论众数:是指与频数分布曲线最高点相对应的横坐的一点.粗略众数:是指一组数据中频数出现最多的那个数。3.3.众数(Mo)1、用观察法直接寻找粗略众数在一组原始数据中,频数出现最多的那个数值就是众数。○在一组原始数据2、4、3、6、4、5、4其中频数出现最多的数值是4,4就是这组数据的众数。○在频数分布表中,频数最多一组的组中值就是粗略众数3.3.2众数的计算方法2、用公式求理论众数的近似值公式:

Mo3Md-2

返回3.4加权平均数:在有些测量中所得数据,其单位权重并不相等.这时若要计算平均数,就不能用算术平均数,而应使用加权平均数,其计算公式如下:公式中为权数.所谓权数,是指各变量在构成总体中的相对重要性.例:某课题组在8个省区进行一项调查,各省区的取样人数和平均分数见下表,求该项调查的总平均数。代码人数平均分数162798226860340082467096541180631465761096850088合计38006653.5几何平均数几何平均数,记做Mg,计算的基本公式下:其中N为数据个数,Xi为数据值◆直接应用有一研究者想研究介于S与T二感觉之间的物理刺激是多少,他随机选10名被试,让其调节一下可变的物理刺激,使产生的感觉恰介于S与T间,然后测量所调节刺激的物理量。10名被试的结果为:5.7,6.2,6.7,6.9,7.5,8.0,7.6,10.0,15.6,18.0问这10个被试二感觉之间的那个感觉的物理刺激量的平均值是多少?应用几何平均数的变式计算属于这种情况有:一组数据彼此间变异较大几乎是按一定的比例变化。如教育经费的逐年增加数,学习,阅读的进步数,以及学生人数的增长数等◆学习方面的进步率

在一项有关阅读能力的试验中得到这样的结果.阅读的遍数与每遍理解的程度依次是:第一遍为40%,第二遍为52%,第三遍为65%,第四遍为75%,第五遍为86%,第六遍为97%,在该实验研究中被试阅读能力的平均进步率是多少?阅读能力的平均增加比率又是多少?某校连续四年的毕业人数为:980,1100,1200,1300人,问毕业生平均增长率是多少?若该校毕业生一直按此增长率变化,问再过五年后的毕业人数是多少?学生或人口增加率的估计◆教育经费增加率某校1950年的教育经费是10万元,1982年的教育经费是121万元,问该校教育经费年增长率是多少?若一直按此比例增加,请问1990年该校的教育经费是多少?◆3.6调和平均数调和平均数的计算:在计算中先将各个数据取倒数平均,然后再取倒数平均数,故又称倒数平均数.计算公式是:

调和平均的应用在一个学习实验中,请六名被试分别完成相同的10道作业题.这六名被试花费的时间依次是0.8小时,1.0小时,1.2小时,1.5小时,2.5小时,5.0小时.计算这6名被试平均完成这10道作业题的速度.第四章差异量4.1差异量的概念4.2全距R4.3方差和标准差4.4差异系数1、概念表示一组数据变异程度或离散程度的量称为差异量。现有A、B、C三组测验成绩如下:A组:8、8、9、10、11、12、12(=10)B组:5、6、8、10、12、14、15(=10)C组:1、2、5、10、15、18、19(=10)4.1差异量的概念

差异量越大,表示数据分布的范围越广,越不整齐.差异量越小,表示数据分布越集中,变动范围越小.常用的差异量指标有全距、方差、标准差、差异系数等.2、特点3、种类1.概念:一组数据中最大值与最小值之差,又称极差.用符号R表示.2.计算:(1)原始数据求全距(R)=最大值-最小值例:两组学生某科测验分数分别为:甲组:54、63、72、74、82、88、99、乙组:67、71、73、76、79、82、84、4.2全距

3.频数分布表求全距:最大一组与最小一组组中值之差(或)最大一组与最小一组下限之差。表:小学两年级80个学生身高的全距计算表身高(1)组中值(2)频数(3)累积频数(4)计算全距(5)115-118-121-124-127-130-133-136-139-142-116.5119.5122.5125.5128.5131.5134.5137.5140.5143.513810201912421141222426173777980R=143.5-116.5=27或者R=142-115=27总和804.全距的优缺点:优点:概念清楚,意义明确,计算简便。缺点:易受两个极端的数值影响。4.3.1 方差:方差是指离差平方的算术平均数。样本方差用

表示。

表示总体方差4.3.2计算公式=在这里:X-表示离差〔即每个数据与平均数的差数〕

表示离差平方和

N表示总频数4.3方差和标准差4.3.3 标准差标准差就是离差平方和平均后的方根。样本标准差用σx表示,总体标准差用σ表示4.3.4计算公式原始数据计算法:

实例:在某幼儿园大班中,随机抽取21名幼儿,分成甲、乙、丙三组,每组7人,进行看图讲述比赛,他们的成绩分别为:甲组:9、9、10、11、12、13、13乙组:6、7、9、11、13、15、16丙组:2、3、6、11、16、19、20试求三组幼儿看图讲述成绩的标准差三组幼儿成绩的标准差。甲组:σx==1.6

乙组:σx

=3.6

丙组:σx

=7.0

解:三组幼儿成绩的平均数:

=11;=11;=11

离散程度(S)说明甲组111.6集中(小)数据都集中在附近代表性好乙组113.6(居中)一般丙组117.0最分散(大)各数据分布广代表性较差2.频数分布表计算法(用于数据较多的分组资料)

公式:

其中:x表示各组组中值f表示各组频数

N表示总人数

48个学生数学分数方差、标准差的组中值计算表57.5分组(1)组中值X(2)频数f(3)fx(4)=(2)×(3)

(5)=(2)×(4)利用公式计算方差、标准差

50-52.5252.5×2

×2

=12.2555-57.5057.5×0

×060-62.5262.5×2

×265-67.5367.5×3

×370-72.5872.5×8

×875-77.5777.5×777.5×780-82.5782.5×7

×785-87.5787.5×7

×790-92.5592.5×5

×595-97.5697.5×6

×6总和483840.00314400f52.5=15062.567.572.582.587.592.597.5(1)优点:反映灵敏:随任何一个数据的变化而变化计算简单:适合代数计算严密确定:一组数据的方差以及标准差有确定的值(2)缺点:不太容易理解;易受两极端数值的影响;有个别数值糊涂不清时,无法计算.4.3.5方差和标准差的应用及其优缺点例1.根据调查,得知1000名16岁男生身高平均为168.88公分。其标准差为6.52,体重平均为48.79公斤,其标准差为6.25,试比较身高与体重哪个差异大。例2.调查所得,8岁儿童身高平均为120.27公分。标准差为5,16岁儿童身高平均为168.88公分,标准差为6.52。试比较他们的身高的差异大小。

4.4差异系数(CV)

1.差异系数(VC)的概念差异系数是一种相对差异量数,它是凭借着算术平均数来表示两个或两个以上标准差的相对差异。2.计算公式CV=×100%差异系数又称为相对标准差,在算术平均数不为零的情况下:CV越大,表明离散程度越大(数据的分布愈分散)CV越小,表明离散程度越小(数据的分布愈集中)在这里:CV表示差异系数表示标准差表示算术平均数3.

用途(1) 比较不同单位(现象)的(变异)差异程度CV=×100%=0.0386×100%=3.86%CV×100%=12.81%可见:体重的差异大于身高。(2)比较不同水平的同类现象(单位)的差异程度CVCV可见:8岁组身高差异量虽比16岁组小,但从差异系数来看,8岁组比16岁组大些。课堂练习:甲组小学生参加算术测验,平均分数为20.50,标准差为5.24;乙组小学生参加同样的测验,其平均分数为34.80,标准差是9.62,试比较CV。(3)可判断特殊差异情况根据经验,在教育统计学中,衡量学生德、智、体各方面发展情况的资料,一般差异系数(CV)值常在5%~35%间。若〉35%,可怀疑所求得的平均数是否计算有误,若〈5%,可怀疑为S是否计算有误.当然也有特殊情况,例如3—6岁幼儿单腿立持续时间的差异系数。无论国内外,都在64%以上,甚至越过100%4.注意事项:(1) 测试尺度上的单位必须是等距的。若不等距,则CV的运用无效。(2) 测试尺度的起点必须是绝对零点。

4.5标准分数标准分数又称基分数或Z分数,是以标准差为一个原始分数在团体中所处位置的相对位置量数.离平均数有多远,即表示原始分数在平均数以上或以下几个标准差的位置,从而明确该分数在团体中的相对地位的量数,计算公式为:

标准分数的性质1.Z分数无实际单位,是以平均数为参照点,以标准差为单位的一个相对量.2.一组原始分数转换得到的Z分数可正可负.3.一组原始数据中,各个Z分数的标准差为1.4.若原始分布呈正态分布,则转换得到的所有Z分数是均值为0,标准差为1的标准正态分布.标准分数的优点1.可比性.2.可加性.3.明确性.4.稳定性.标准分数的应用Z分数不仅能表明原始分数在分布中的地位,而且能在不同分布的原始分数之间进行比较,同时,还能用代数方法处理,因此,它被教育统计学家称为多学科表示量数,有着广泛的用途.1.用于比较几个分属性质不同的观测值在各自数据分布中相对位置的高低.2.计算不同质的观测值的总和或平均值,以表示在团体中的相对位置例:A,B两个学生在三种考试中的分数见下表,比较二人分数是否有差别.考试170870902554575134254540

例2:下表是高等学校入学考试中两名考生甲与乙的分数,试问据考试成绩应该优先录取哪名考生?数据表考试科目原始成绩全体考生Z分数甲乙平均分标准差甲乙语文858970101.51.9政治70626551-0.6外语6872698-0.1250.375数学53405060.5-1.67理化7287758-0.3751.5总和3483502.51.505

第五章相关关系5.1相关、相关关系与散点图5.2积差关系5.3等级关系5.4质与量关系5.5品质相关5.1相关、相关关系与散点图统计学中所讲的相关是指具有相关关系的不同现象之间的关系程度,前提是事物之间的这种联系又不能直接做出因果关系的解释.相关有以下三种:1.两列变量变动方向相同.我们称之为正相关.如身高与体重.2.两列变量变动方向相反.我们称之为正相关.如初学打字,练习时间越长,错误越少.3.两列变量没有关系,即零相关.如身高与学业成就、相貌与人的行为等现象之间的关系,都属于零相关即不相关.相关关系的图表判断法例:我们给出5名学生四种测验的分数:学生测验分数ABCD115536410221452651003135166104412506710351149681015.2积差相关积差相关是英国统计学家皮尔逊于20世纪初提出的一种计算相关的方法,因而被称为皮尔逊积差相关,简称为皮尔逊积差相关.它是一种较为普遍的计算相关系数的方法,也是揭示两个变量线性相关方向和程度最常用和最基本的方法.一般来说,用于计算积差相关系数的数据资料需满足以下条件:

①要求成对的数据;②两列变量各自总体的分布都是正态;③两个相关的变量是连续变量,即数据都是观测变量;④两列变量间的关系应是直线性的.计算积差相关系数的基本公式一.运用标准差与离均差的计算公式二.运用标准分数计算相关系数的公式三.原始观测值计算公式

现在我们介绍一个例题,分别用三种不同的公式.例:下表是10名中学生身高与体重的测量结果.问身高与体重的关系如何?数据表被试编号XYXY117050289002500850021734529929220257785316047256002209752041554424025193668205173502992925008650618853353442809996471785031684250089008183493348924018967918052324002704936010165452722520257425总和172548529852523609838915.3等级相关在心理与教育领域的研究中,有时收集到的数据不是等距或等比的测量数据,而是具有等级顺序的测量数据.并且有时总体分布不是正态,不满足求积差相关的要求.于是为了解决两列或两列以上的变量的相关,就要用等级相关.我们主要介绍两种等级相关:①斯皮尔曼等级相关;②肯德尔等级相关;斯皮尔曼等级相关一适用资料积差相关是对两个变量之间相关强度的标准测量指标,斯皮尔曼等级相关则是对皮尔逊相关系数的延伸.他是英国心理学家、统计学家斯皮尔曼根据积差相关的概念推导出来的,因而有人认为斯皮尔曼等级相关是积差相关的一种特殊形式.因为它对数据总体分布不作要求,这是其优点所在,另外,当N<30时,计算比较简单,等级相关的缺点是能用积差相关计算的资料改成等级相关计算精确度要差一些.二计算公式1.等级差数法(N<30)2.等级序数法

斯皮尔曼等级相关的应用例1:现有10人的视,听两种感觉道的反应时(单位:毫秒),数据见下表.问视,听反应时是否具有一致性?(X为听反应时,Y为视反应时)被试XYD117217975243521401622200431521535141654187189880064513918116-52566195220910-119072122101091190816418267-114291491784400161014617033009总和5555483613.有相同等级时计算等级相关的方法

例:下表示10名学生的数学和语文考试成绩,问数学与语文成绩是否相关?(X代表语文成绩,Y代表数学成绩)被试XYD159474.56-1.52.2523540101000359424.58-3.512.254575563.52.56.255504975246716311007625533.5-0.50.258474288009434298111068572200N=10肯德尔等级相关肯德尔等级相关方法有很多种.这里我们主要介绍适合多列等级变量资料的方法.1.肯德尔W系数

①适用资料

肯德尔W系数,又称肯德尔和谐系数,是表示多列等级变量相关程度的一种方法,适用于两列以上的等级变量.肯德尔和谐系数常用符号W表示.

计算此系数,原始数据的获得一般采用等级评定法,即让K个被试对N件事物进行等级评定,因此最小的等级序数为1,最大的为N,这类K列等级变量资料综合起来求相关,就用肯德尔W系数.②基本公式及计算W值介于0与1之间,若K个评价者意见完全一致,则W=1;若他们的意见有一定的联系,又不完全一致,则0<W<1;若其意见完全不一致,则W=0.

例:有10人对红、橙、黄、绿、青、蓝、紫七种颜色按其喜好程度进行等级评价.其中,最喜欢的等级为1,最不喜欢的等级为7,结果见下表.问这10人对颜色的爱好是否具有一致性?N=7评价者K=1012345678910红3523443243331089橙6676757766633969黄5457664454502500绿111222211215225青4344335635401600蓝223111132117289紫7765576577623844总和28013516解:从W值来看,这10个人对颜色的喜好具有较高的一致性,亦即他们所喜爱的颜色比较一致,喜好的顺序可由的大小给出大致情况,其大者等级序数大,诗人对七种颜色有最喜欢到最不喜欢的顺序是:绿、蓝、红、青、黄、紫、橙.③有相同等级出现时W的计算在进行等级评定时,常会遇到两个或两个以上的等级相同,如果遇到这种情况应该采用下面的修正公式:

例:五位评分者对七篇作文进行评价,评价等级为1-5,评价结果见下表,问评分者之间对标准的掌握是否一致?N=7评价者K=512345A453.55421.5462.25B111.5216.542.25C2.521.52210.0100D6554525.0625E2.533.52314.0196F5576629.0841G7767734.01156合计1403422.5解:第六章抽样分布及总体平均数的推断6.1抽样分布6.2总体平均数的估计6.3假设检验的基本原理6.4总体平均数的显著性检验上海市初中一年级末数学水平的调查研究,在该研究中假定上海市共有初中一年级学生为150000人(N人),如果对上海所有初中一年级学生进行统一的标准化的数学成绩测验,其测验的平均成绩为80分(μ),测验的标准差为9分(σ

)。实例16.1抽样分布

6.1.1研究实例

实例2某一调查研究者甲为了节省调查研究的成本,现从上海市初中一年级学生中随机抽取500人(n人)进行统一的标准化的数学成就测验,试图通过这500人的测验结果来推断全上海初中一年级学生的数学水平,其测验的平均成绩为82分(),测验的标准差为8分(σx

)。1、分析上述实例区分总体和样本区分参数与统计量及不同的表达方式总体参数样本统计量容量Nn平均数

μ标准差σσx如果我们用上海初一年级150000个学生的成绩做图,则构成一个总体分布图:概率密度或百分比成绩如果我们只用其中抽取的500个学生的成绩做图,则构成一个样本分布图:概率密度或百分比成绩2、抽样分析假定该研究者第一次抽取500人做完调查研究后,又重新从上海初中一年级学生中(150000人)抽取500人(n2)进行调查研究,其平均数为:标准差为:σx2(抽取学生的过程中,前面抽到的学生在后面抽取中也可能抽到,但不重复测验)。如果上述过程不断重复操作,则可以得到更多的样本平均数和标准差,如下表:抽样次数样本容量样本平均数样本标准差1500σx12500σx23500σx3…………i500σxi…………k500σxk…………∝500σx∝如果我们用k(k趋近于无穷大)个样本平均数做频数分布图,则构成一个由样本平均数组成的抽样分布(平均数抽样分布)图:概率密度或百分比抽样的平均成绩由这些抽样的平均数构成的平均数由这些抽样平均数组成分布的标准差称为平均数的标准误用来表示。标准误

:某种统计量的标准差称为该统计量的标准误。抽样分布是某一种统计量的概率分布3、正态总体中,平均数的抽样分布呈正态1、2、4、偏态总体中,当抽样容量较大时,平均数的抽样分布也呈正态6.1.2平均数抽样分布的几个定理

平均数为:标准差为:离差统计量是以标准差为单位来度量某一个个案值与平均数间的差异。Z分数就是一种离差统计量6.1.3样本平均数与总体平均数离差统计量的形态

当总体标准差已知时,平均数的离差统计量的计算:当总体标准差未知时,平均数的离差统计量的计算:首先根据样本标准差(σx)来估计总体标准差(σ),其估计值用S来表示。因此,平均数的标准差为:离差统计量的表达形式为:例:某校二年级学生的英语平均成绩为78,从中随机抽取50人,其平均成绩为82,标准差为12()。试估计该校二年级学生英语成绩的标准差,并计算50人平均成绩的离差统计量。戈赛特(英国数学家1876-1937)戈塞特早先在牛津温切斯特及新(New)学院学习数学和化学,后来到都伯林市一家酿酒公司担任酿造化学技师,从事统计和实验工作,1906—1907年间,在伦敦大学学院生物实验室做研究,也有机会和皮尔逊共同研讨,此后他们经常通信.1905年,戈塞特利用酒厂里大量的小样本数据写了第一篇论文《误差法则在酿酒过程中的应用》1908年,戈塞特以“学生(Student)”为笔名在《生物计量学》杂志发表了论文《平均数的规律误差》.t分布及其特点自由度:df表示表6.1中央面积为0.95时不同自由度t的临界值自由度2462030∞t值±4.30±2.78±2.45±2.09±2.04±1.96某一个正态总体,其平均数为130,标准差为10。(1)从总体中抽取25人,计算其平均成绩,该平均成绩在128到132间的概率有多大;(2)从总体中抽取25人,计算其平均成绩,该平均成绩以总体平均数为中心,95%概率下的分布范围。若总体平均数未知,从总体中抽取25人,计算其平均成绩为129,按一定概率要求估计总体参数μ的变化范围。————区间估计例2:例3某小学10岁儿童身高的标准差为6.25厘米,现从该校随机抽出27名10岁儿童,其平均身高为134.2厘米,试估计该校10岁儿童身高的95%和99%置信区间.在总体标准差未知,总体呈正态分布,n无论大小,(或总体不呈正态分布,n>30)样本平均数与总体平均数的离差统计量呈t分布;t值μ3、总体标准差(σ)未知条件下的区间估计

区间估计原理例1从某小学三年级学生中随机抽取12名学生,其其阅读能力平均分数为29.917,s=4.100.试估计该校三年级学生总体平均成绩95%和99%的置信区间。例2

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论