社会调查教程(第八版) 知识点、关键概念、课后习题 第14章 统计分析_第1页
社会调查教程(第八版) 知识点、关键概念、课后习题 第14章 统计分析_第2页
社会调查教程(第八版) 知识点、关键概念、课后习题 第14章 统计分析_第3页
社会调查教程(第八版) 知识点、关键概念、课后习题 第14章 统计分析_第4页
社会调查教程(第八版) 知识点、关键概念、课后习题 第14章 统计分析_第5页
已阅读5页,还剩13页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

第十四章统计分析

一、知识框架

二、知识点与关键词解释

序号知识点页码教材章节

1统计分析的目的P24814.1.1

2统计分析的层次P24914.1.3

3描述统计的内容P25014.2.1

4推断统计的形式P25114.2.3

5常用的集中量数与离散量数P25414.3.1

6单变量统计推断P26014.3.3

7双变量统计分析的内容P26114.4.1

8双变量统计分析的方法P26214.4.2

9多变量统计分析的方法P27114.5

1.统计分析

统计分析就是运用统计学原理和方法处理调查所获得的数据资料•,简化和描

述数据资料、揭示变量之间的统计关系,并进而推断总体的一整套程序和方法。

2.描述统计

描述统计,就是运用数字,如频数、百分比、平均值,以及图、表等形式汇

总所收集来的数据信息。

3.推断统计

推断统计,是运用概率分布知识,通过样本统计量预测总体参数的分析方法。

4.抽样分布

所谓抽样分布,是指在一个总体中重复抽取许多大小一样样本的统计量而形

成的分布。

5.集中量数分析

所谓集中量数分析,是指用一个具体的统计量反映一组数据向该统计量集中

趋势的统计方法,它所表示的是一组数据集中的程度或水平。集中量数有平均数、

中位数、众数、四分位数、百分位数以及倒数平均数、几何平均数等。其中,常

用的集中量数是平均数、中位数和众数。

6.离散量数

所谓离散量数,就是表示一组数据变异程度或分散程度的量数。离散量数越

大,表示数据分布范围越广,越不集中,越不整齐;反之,离散量数越小,表示

数据分布范围越集中,变动程度越小。离散量数有多种,如方差和标准差、全距、

四分位差、异众比率、离散系数、偏态系数等。其中,常用的是方差与标准差、

全距、异众比率和偏度系数。

7.相关关系

变量间的相关关系,是指当一个变量X发生变化时,另一个变量Y也随之

发生变化,反之,当Y发生变化时,X也发生变化。人们通常把两个变量之间

的相关关系表示为X--Y。必须指出,存在相关关系的两个变量,只强调它们

之间存在着相互影响的关系,而不清楚也不在乎它们变化的先后,因而也无所谓

前因后果的问题。

8.因果关系

两变量间的因果关系,是指一变量的变化可以确定为另一变量变化的原因的

关系。在自然科学中,确定现象之间的因果关系比较容易。在社会研究中,要确

定两个变量之间的因果关系则比较困难。

三、课后习题详解

1.如何认识统计分析在社会研究中的作用?

答案:社会调查往往要涉及大量的变量并包括众多的个案,而且这些变量间

的关系又往往是错综复杂的,这就使每项调查所要处理与分析的数字信量十分庞

大,处理和理解这么多信息资料是极其困难的,必须设法将其提炼压缩,找出其

内在的特征。统计分析就是帮助人们提高控制和处理数据的能力,透过这些宠杂

的数字和复杂的关系去把握其内在规律性的一种有力的工具。统计分析的作用主

要有:

(1)可对资料进行简化和描述。统计分析的作用之一就是从精简的数字来

综合大量的事实,对研究变量自身特征作出清晰的描述,这也就是所谓的描述性

统计。

(2)可通过样本资料推论总体。在社会研究中,大量调查是抽样调查,抽

样调查所关注的不是样本本身的性质,而是样本所在的更大总体的特性。因此,

如何由样本资料概推到总体,就成为抽样调查必须解决的一个问题,统计学很好

地解决了这一问题,它可以通过参数估计和统计检验等手段将样本资料推论到总

体并能指出这种推论的误差和做出这种推论把握有多大,这就是所谓推断性统

计,它是建立在概率论基础上的。推论性统计使抽样调查科学化,它与描述性统

计和抽样调查一起成为一整套定量分析方法。从而大大扩展了社会调查的范围和

提高了科会调查的效率•并使社会研究得以深入进行c

(3)可对变量之间的关系进行描述和深入的分析。变量之间的关系是社会

研究最主要的内容之一,统计分析为深入描述和分析变量间关系,进而为达到理

论解释提供了十分有力的手段。

解析:本题主要考察对统计分析研究目的的理解。在统计分析是一种基于系

统的模式或模型的理解方法,它按照一定的程序收集、整理和分析研究数据,发

现数据背后所隐含的社会意义。同时,还提供了检验理论假设的方法,使人们对

研究对象建立起一个客观、系统和全面的认识和合理推论.

2.某城市2015年有大学生106.95万人,从中抽取2000人进行烟瘾调查,在调查问卷

中提问:“在过去一周中,你每天至少吸一包烟的天数有多少?"

⑴在以上叙述中,什么是总体,什么是样本?

答:总体时2015年某城市的106.95万大学生;样本是接受调查的2000名大学生

(2)经统计分析发现,回答0天的学生占89%,它是一个参数还是一个统计量?为什么?

答:它是•个样本统计量.总体参数可以通过对总体进行普查和研究计算得到,用于描述总

体的特征或规律,样本统计展则是基于样本数据计算得出的指标,可以通过统计推断估计总

体参数。

3.假如你获得了一份人口普查的总体数据,你会如何进行统计分析?解释为什么你只需

要进行描述分析,而不需要进行推断统计。

答:普查是指时总体所有对象进行数据收集。数据分析分为描述统计和推断统计。描述统计

研究的是数据收集、处理、汇总、图表描述、概括与分析等方法,而推断统计是研究如何利

用样本数据来推断总体特征的方法。普查意味着我们已经收集到了研究对象的总体数据,因

此不需要通过样本来推断总体参数。

4.2010年中国综合社会调查(ChineseGeneralSocialSurvey,CGSS)显示了我国城乡男性体

重状况(见表14-6),根据统计分析结果进行说明。

表14-62010年我国城乡男性体重状况单位:kg

样本量平均数中位数标准差最小值最大值

农业户口285762.676010.7435123

非农户口252368.936911.2336.5115

答:如表所示,农业户口男性体重的均值为62.67公斤,明显低于非农户口男性体重均值

(68.93公斤),前者中位数为60公斤,也低于后者的69公斤。从离散趋势看,农业户口

男性极差为88公斤,而丰农户口男性极差为78.5公斤,说明农业户口男性存在两极分化,

但从标准差看,非农户口男性的差异(标准差为11.23)要大些。

5.2010年中国综合社会调查(CGSS)问道:"您上一周是否为了取得收入而从事一小时以上的

劳动?”在11764个被访者中,有6751人回答"是",请证明回答"是"的总体比例95%

的置信区间为。56,0.58]。

答:已知:置信区间二点估计土误差边际,误差边际:标准误的倍数,即等于Z*标准误

点估计:6751/11764=0.0.57386943

0

标准误:=0.0.00455932

0.57386943-1.96*0.00455932=0.56493316

0.57386943+1.96*0.00455932=0.5828057

所以回答“是”的总体比例95%的置信区间为[0.56,0.58]。

6.以下假设是虚无假设还是备择假设?说明这些假设的参数符号和参数值。

(I)在大学中,谈恋爱的学生比例为0.37。

答:虚无(原)假设,HO:u=0.37Ha:ur0.37。

(2)目前所有在校大学生的饮酒比例小于10年前的0.31。

答:备择假设,HO:u=0.31Ha:u<0.31。

(3)某大学在校男生的平均身高大于172cm。

答:备择假设,HO:ii=172Ha:u>172。

7.2010年中国综合社会调查(CGSS)调查了男性的吸烟和饮酒状况,结果见表14-7。

表14-72010年我国成年男性吸烟、饮酒状况单位:人

饮酒

合计

否是

否387381768

吸烟

是2908061096

合计67711871864

根据上表结果,对吸烟和饮酒两变量之间的关系进行X检验。

答:假定随机大样本,每个单元格至少5个观测值,总的样本量大于40。

假设:H0:吸烟和饮酒在统计.上独立;Ha:吸烟和饮酒在统计上相依。

计算卡方值:

X2=(387-(768*677/1864))A2/(768*677/1864)+(381-(768*1187/1864))A2/(768*1187

/1864)+(290-(677*1096/1864))A2/(677*1096/1864i+(806-(1187*1096/1864))A2/(l

187*1096/1864)=111.81284

计算p值为0.000

结论,p(0.000)<a(0.05),拒绝原假设,说明吸烟与饮酒在统计上相依。

8.一项关于居民幸福感的调查数据的分析结果显示,幸福感(不太幸福、一般、比较幸

福)和收入(低于平均数、平均数、高于平均数)之间的Gamma系数为0.45,请解释。

Gamma系数为0.45,说明幸福感和收入之间有接近中等程度的正关联。

9.据某年度一项涉及63个国家的预期寿命研究表明,预期寿命团与人均国民生产总值

(X)的预测方程为匕55+5.6X。其中预期寿命的范围为54岁(海地)和79岁(加拿大),人均国

民生产总值的取值范围为0.037万美元(塔吉克斯坦)至4万美元(瑞士)。

(1)解释V的截距和斜率。

答:截距是人均GDP等于0时Y的值,即55;斜率是自变量人均国民生产总值每增加一

个单位时预期寿命的变化,即人均国民生产总值每增加1万美元,预期寿命增加5.6岁。

⑵若海地人均国民生产总值为0.043美元,加拿大3.5美元,求两国的预期寿命预测值。

答:海地预期寿命为55.02岁,加拿大为74.6岁。

(3)相关系数为0.72,请解释。

答:相关系数为0.72,意味着预期寿命与人均国民生产总值存在中度相关的线性关系,但

这并不意味着预期寿命与人均国民生产总值一定有囚果关系。

10.简述因果关系的三个条件。对每一个条件,描述两个变量之间因为违背这些条件而

没有因果关系的情况。

答:变量之间有相关关系,两个变量有一定的时间顺序,原因在前,结果在后,还要排除其

他变量的影响。小学生的身高与数学分数有相关性,身高高的小学生,数学分数高的可能性

大,同时身高在时间上是先于数学学习的,也不受数学学习的影响,但显然小学生身高与数

学分数之间是虚假相关,因为真正影响数学分数的重要因素是智力,身高和智力的发育与年

龄密切相关。因此,如果控制智力水平的话,身高的学习效应就很可能消失了。

四.考研真题与典型题详解

(-)简答题

1.在定距变量的统计分析中,怎样认识相关分析与回归分析的关系?

答:两个定距变量的统计分析,是传统统计分析的主要内容,因而也是相

对成熟的统计分析方法。它包括相关分析方法和回归分析方法。相关分析与回归

分析,是两种既有密切联系、又有本质区别的统计分析方法。

首先,相关分析与回归分析都以两个定距变量的线性关系为基础,分析与解

释两个变量之间的相关或相互影响作用力的大小。

其次,相关分析是回归分析的前提和基础。一般地说,只有当两个变量之间

存在着比较高的相关关系,回归分析才有价值,而且相关程度越高回归预测效果

越好。因此,在定距一定距变量分析过程中,通常是先进行相关分析,然后再选

择其中那些有比较强的相关关系的变量进行回归分析。

但是,相关分析与回归分析又是两种不同分析方法,它们的区别是:

其一,相关分析是对两个变量双向依存关系的分析,通常不确定谁是自变量

谁是因变量;回归分析是对两个变量单向关系的分析,即对自变量影响因变量的

分析,必须明确谁是自变量、谁是因变量,而且对于自变量每一个给定的数值,

通过回归方程求得的因变量的估计值不只是一个确定的数值,而是许多可能数值

的平均数,因而可以计算估计值的误差。

其二,从分析层次上讲,相关分析是一种描述和解释既存事实的研究方法,

而回归分析则是一种道过对已有事实的分析进一步推断和预测未来可能发生什

么的研究方法。因此,与相关分析相比较,回归分析是一种更高层次、更为深刻

的统计分析方法。

解析:本题主要考察两变量之间统计分析方法中的主要内容,即相关分析方

法和回归分析方法。在作答时首先对于二者各自的定义要有一个清晰的理解,其

次在叙述二者之间的关系时,既要指出两种分析方法的内在联系,它们之间是相

互影响、相互作用的关系;也要区分两种方法之间的不同之处,主要的区别是在

分析路径和分析层次方面。

知识点:相关分析与回归分析的内涵及二者之间的联系与区别。

2•试述置信区间的基本概念,如何用置信区间进行参数估计?

答:置信区间是指进行区间估计时,在某一概率水平下总体参数所处的数值

区间。区间的上、下限(端点)称为临界值,所确定的概率水平称为置信水平或

置信度,以概率1-a表示,a称为显著性水平,表示该区间估计的不可靠性程度,

即估计参数位于该区间时可能犯错误的概率。显然,1-a则表示估计参数落入置

信区间的可靠性程度或把握度。

所谓参数估计,就是运用样本统计量对总体参数进行推断或估计的统计过程

与统计方法,在实际研究工作中通常选择区间估计法。区间估计的理论基础是抽

样分布,核心问题是把样本统计量与总体参数之间的关系转换成抽样分布来处

理。区间估计的一般程序是:①确定置信水平,区间估计是与这种估计的可信度

(置信水平)的要求是分不开的,要求估计的越可信,即置信水平越高高则估计

的区间也越大。②计算标准误差,根据样本分布特点和样本不同统计值,分别采

用不同的方法确定标准误差。③根据样本统计值和标准误差确定置信区间。

解析:本题主要考察对于区间估计这种参数估计方法的把握程度。在回答时,

首先要对参数估计的类型以及置信区间的基本概念有一个总体说明,其次在说明

如何用置信区间去进行参数估计时,需要对于区间估计方法有一个简要介绍,再

完整阐释区间估计方法的一般程序以及不同的置信区间所代表的实际意义。

知识点:相关分析与回归分析的内涵及二者之间的联系与区别。

3.简述回归方程最重要的统计功能

答:回归方程是根据样本资料,通过回归分析所得到的反映一个变量(因变

量)对另一个或一组变量(自变量)的回归关系的数学表达式,建立回归方程通

常采用的方法称为最小二乘方法,其最简化的形式如:y=a+bx,其中,y为因变

量,x为自变量,a为常数项,b为系数。线性回归分析,实质上就是要在变量X

和变量Y之间建立一个线性回归方程,从而用X去预测Y。回归方程最重要的

功能就是能够通过正确的拟合达到预报和控制的功能。下面结合一个虚拟的回归

方程了解这两个功能。

比如教育的经济回报现象在不同社会条件下都得以证实。假定经过随机抽样

取得某地区有关“受教育年限”(单位:年)与“当前实际收入”(单位:元)的样

本,得到回归方程如下:

y=1000+300x

其中,y为“当前实际收入”,x为样本的“受教育年限:该方程表面,受教

育年限每增加一个单位,当前实际收入就会有300个单位的增长。换句话说,样

本的受教育程度提高一年,当前实际收入就会预期有300元的增长。

从预报的功能看,该回归方程表明,y将随着x的增高或降低相应有b个单

位的变化。在本例中,样本手教育年限降低一年,当前熨际收入会有300个单位

的减少;降低二年,则会有60()个单位的减少。回归方程可以依据自变量的单位

变化,预测因变量的相应变化。

从控制的功能看,该回归方程表明,人为地提高受教育的年限,将预期得到

收入的普遍提高。这种人为地提高某一因素水平,从而促进经济社会进步的原理,

普遍应用在公共政策领域。

解析:本题主要考察对于回归方程的建立过程以及回归分析方法的功能的理

解。在作答时耍注意对丁•回归方程公式的实际意义的准确把握,首先要对回归方

程的构成做一个总体阐释,根据回归方程的内在意义去理解回归分析方法所具有

的社会学意义,并进一步理解回归方程所具有的统计学功能。最后可以适当结合

相应案例更加具体地去说明实际功能。

知识点:回归分析方法的内涵以及回归方程的统计功能。

(二)论述题与计算题

1.根据下表的统计数据能否得出群众参与体育活动和教育水平有直接关

系的结论?是否有与教育水平有关的其他更直接的因素影响群众参与体育活

动?试申述你的理由和检验方法(用文字表述)?

群众参与体育活动和教育水平的交互表

文化程度(人数)%(同类人群中参与体育活动者比

率)

研究生360.5

大学30336.6

中专75430.0

初中48218.4

小学26512.4

文盲1014.6

答:(1)根据该表的统计数据,不能得出群众参与体育活动和教育水平有直

接关系的结论;该表内容提供了两个变量,作为有待解释的因变量,即:“人数”

与“%(同类人群中参与体育活动者比率)

对于“人数”这个变量来说,由于没有交代取得样本的抽样方法,因此,仅仅

凭该列的数据值就进入统计检验过程,是不严谨的。与此同时,仅从该列数据值,

看“文化程度”与“人数”,并没有明显的直接关系。

对于“%(同类人群中参与体育活动者比率)”这个变量来说,直观上看,从

文盲到大学的学历递增,参与体育活动的比率也在相应地递增。只有研究生学历

的样本是个例外。但,由于“%(同类人群中参与体育活动者比率)“变量,在格

式上属于相对频次,即比例值,因此不适用进行卡方检验等基于频数分布的统计

检验过程。

与此同时,该变量也不是“人数”变量所占该类人群的比率值,因此不能通过

该比率值计算“同类人群中参与体育活动者''与"同类人群中未参与体育活动者''

的具体频数。

(2)可能会有与教育水平有关的其他更直接的因素影响群众参与体育活动,

比如:个体工作类型。个体受教育的水平在一定程度上决定了个体工作或劳动的

类型,而劳动类型也意味着不同的闲暇时间安排的模式,从而形成不同的参与体

育运动的模式。

(3)如果能够基于严谨的抽样设计,准确记录每个学历类型参加与不参加

体育活动的频数,采用卡方检验等过程是可以得出更加确定的结论。

解析:本题主要考察双变量关系分析和测量方法的应用。在解答时,首先要

辨别出两个变量的测量层次;其次,要根据已有材料判定两个变量之间的关系类

型,直观上看,从文盲到大学的学历递增,参与体育活动的比率也在相应地递增,

因此,可以初步估计二者之间具有相关关系;最后要通过对应的相关测量方法计

算出两个变量之间的相关强度和方向,并用对应的假设检验方法去验证二者是否

具有显著性相关关系。

知识点:两变量的测量层次、相关测量方法以及假设检验方法。

2.怎样确定两种社会现象之间存在因果关系,请举例说明。

答:两变量之间的因果关系,是指一变量的变化可以确定为另一变量变化原

因的关系。在自然科学中,确定现象之间的因果关系比较容易。

在社会研究中,要确定两个变量之间的因果关系必须同时满足三个条件:

其一,两变量之间必须存在相关关系。两变量之间存在相关关系是两变量之

间存在因果关系的必要条件,但不是充分条件。这就是说,如果两变量之间存在

相关关系,则两变量之间可能是因果关系,也可能不是因果关系;如果两变量之

间没有相关关系,则决不可能存在因果关系。反过来说,如果两变量之间存在着

因果关系,则必定存在着相关关系。

其二,必须确定自变量变化在前,因变量变化在后,即先有原因,后有结果。

也就是说,两变量之间的因果关系是一种单向影响关系,只能是原因导致结果,

自变量的变化导致因变量的变化,而不能反过来说因变量的变化引起自变量的变

化。两变量的因果关系通常表示为X-Y。

其三,必须确定变量X与Y之间的关系,不是由于第三个变量的存在而呈

现出的一种虚假关系。

在研究中,要使两个变量完全满足上述三项条件,是一件很不容易的事情,

因而在社会研究中很难完全确定两种现象之间的因果关系。尽管如此,在统计分

析中,仍然可以对社会现象之间的因果关系进行粗略的分析工比如,在研究玫治

体制对丁民主的稳定性的影响时。首先,变量政治体制是个国家最重耍的攻治

元素,根据已有的历史经验可知,一个国家的政治体制涉及领导人选举机制、法

律制定与执行等面,这些都与国家民主稳定程度有着显著的相关关系;其次,政

治体制的不同会导致国家内部各个不同权力集团之间的组织方式、监督方式不

同,从而使得不同群体的利益满足情况不一样。也就是说,自变量政治体制的变

化会导致社会内部联系程度及利益获得情况的变化,从而导致因变量民主稳定性

的变化。

解析:本题主要考察两个变量之间关系的类型分析以及对于因果关系的确定

准则。在解答时,首先要确定两个变量之间是否具有一方影响另一方的关系,即

一个变量发生变化时,另一个变量也随之发生变化;其次,对于具有相关关系的

两个变量需要进一步确定二者之间是相互影响还是单项影响的关系,只有当二者

是单向影响的关系时,是由于自变量的变化导致了因变量的变化。最后,要确定

这种因果关系是真实的,两个变量间的关系不是由于第三方变量所导致的虚假因

果关系。

知识点:双变量统计分析内容、社会研究中两种现象之间因果关系的确定

3.一个骰子有六个面,重复掷骰子180次之后,得到如下的分布:

骰面123456

频次395120222622

有没有统计学证据,说明这个骰子被人做了手脚?(置信水平。二005)

参考;卡方表

置信水平0.100.050.0250.01().001

自12.7063.8415.0246.63510.828

度24.6055.9917.3789.21013.816

36.2517.8159.34811.34516.266

47.7799.48811.14313.27718.467

59.23611.07012.83315.08620.515

610.64512.59214.44916.81222.458

712.01714.06716.01318.47524.322

813.36215.50717.53520.09026.125

914.68416.91919.02321.66627.877

1015.98718.30720.48323.20929.588

答:,应用行率孥野过程。如果骰子正常的话,那么骰子的6个面出现的期望频数

为适遇的分》一。对本题来说,为30次。

2(3眄理幅鸣物互侬三30)2(22-30)2(26-30)2(22-30)。

所:联与鼓面数第不相1互独近+—

303030

MOO+64+16+64

-----------------------p25.5c

30

自由度:4==5

Z

临界值:O.O5(#=5)=1L070

2

可知,X=25.52>Z^)5=11.07

故,有95%的把握拒绝零假设,接受备选假设,即频次与骰面数值不是独立事

件,是有关的关系。如果骰子是正常的,则骰子1-6个数字出现的频次是均匀的,

其与数值相互独立。所以这个骰子被人做了手脚。

解析:本题主要考察双变量统计分析方法和检验方法的掌握程度。在解答时,

首先要明确两个变量的测量层次。为了验证骰子的准确性,就要考察转到骰子各

个面的概率是否均匀,转化成统计问题,即扔到每一面的频数与骰面数值之间有

没有显著性相关关系;其次由于是基于频数分布的数据,因此使用卡方检验的检

验方法:进行计算之后得出Xz值并与临界值比较,从而确定是否接受原假设。

知识点:双变量统计分析和假设检验方法

4.怎样理解变量方差的本质含义的不确定性。

方差是一种重要的离散量数,它的计算方法是,把一姐数据中每个数据与该

组算术平均数相减,将其差进行平方然后相加,再除以数据的个数。方差的计算

公式为:

N

按照这个公式理解方差时,通常会简单地把方差理解成是相对对于均值的波动,

如果是对更复杂的随机变量,如二维的随机变量,则最好使用不确定性概念。假

设一个神枪手和一个参加军训的大学生一块打靶,显然大学生打靶时相对于靶心

(均值)的弹着点(方差)的不确定性更大。不确定性比相对于均值的波动更能

反映方差这个概念的本质特征。在考虑定性变量的方差时,应使用不确定性而不

是用相对于均值的波动来理解其方差。

与此同时,在社会科学的研究中,更应该根据情况使用不确定性,来表现社

会现象演变的不确定性。"波动''与"不确定性”相比,是一个反映"规律性''的概念,

即观测到的变化更多地表现在一个可以控制和预知的区间内。而社会科学的研

究,则更关注社会现象变化的多种可能性,亦即不确定性。在这个意义上去理解

方差,是独具社会科学的内涵的。

解析:本题主要考察对于方差本质的理解。在解答时首先要指出方差作为一

种重要的离散量数所具有的含义,以及具体的计算方法和公式;其次,要针对计

算公式进一步说明方差所代表的本质内涵,并可以通过举例的方式阐释方差含义

在具体操作中的应用。最后,要将这一统计概念在社会科学领域所具有的特殊性,

即由于社会现象的不确定性导致了方差实际运用中的不确定性.

知识点:离散量数分析方法与离散量数方差的含义

5.方差分析的适用对象,及其假设和检验的基本过程。

方差分析适用于定类一定距变量的研究,所谓方差分析就其内容而言,是分析

或检验总体间的均值是否有所不同,而不是方差是否有所不同。

方差分析对总体必须满足一下假定:(1)等方差性,这一假定要求总体中自变

量的每一个取值对应因变量的分布多具有相同的方差;(2)总体正态分布或因变

量的分布为正态分布,即要求每一个自变量所对应的应变量的分布呈正太分布;

(3)变异的可加性,方差分析所依据的一个基本原理就是变异的可加性。确切

地说,应该是变异的可分解性,总变异可以分解成几个不同来源的部分,这几个

部分变异的来源在意义上必须明确,而且彼此要相互独立。

方差分析大致有4个基本过程:

(1)求平方和

SSw=SSt-SSb

(2)确定自由度

由于K是实验处理数,因此,组间自由度dfb=k-l;组内自由度dfw=k(n1)

总自由度dft=nk-1

(3)求均方

组间均方MSb=SSb/df;组内均方MSw=SSw/dfw

(4)进行F检验

解析;本题主耍考察对于双变量分析方法的掌握情况。在解答时,首先要指出

方差分析的含义以及其对应的两个变量的测量层次;其次,要明确方差分析方法

的具体内容,包括方差分析的基本步骤和对应的假设检验方法,进行方差分析采

用的主要检验方法是F检验,并用eta平方系数来测量两变量的相关强度。

知识点:双变量分析的具体方法以及方差分析的具体内容

五、扩展阅读

(-)统计故事:点估计与飞镖游戏

飞镖游戏起源于英国,是一项风靡全球,集趣味性、竞技性于一体的休对运

动项目,既可用于比赛,又可作为工作、学习之余的消遣。从统计学的角度看,

飞镖游戏暗含了点估计的统计推断思维逻辑,可以用来直观说明点估计的原理。

简单起见,假定4位选手(A、B、C、D)参加飞镖比赛。前3位选手的比赛成绩

如图1所示,第4位选手的比赛结果单独列出,如图2所示。其中,小点表示各

位选手投掷飞镖的结果,飞镖盘中心的白点表示靶心。

那么这些密密麻麻的小点和点估计又是怎么扯上关系呢?实际上,只要是估

计,总要有一个估计目标,通俗地讲,估计就是猜测,总有一个可能被猜中的“正

确”答案。若以总体均值作为目标,该目标或“正确”答案就在图1、图2飞镖

盘中的靶心的位置。各位选手的每一次投掷(其结果就表现为小点),可以看成

是估计或猜测的一次尝试,统计学人称为估计量(其结果称为估计值)。猜测总

有准或不准的问题.我们还需要游戏评委对比赛结果作进一步地解说.

在飞镖游戏中,我们不能只看一次投掷结果,更重要的是透过多次投掷结果

去分析评判一位选手的竞技素质。要反映一位选手的竞技素质,至少可以从两个

方面着眼:①眼神好坏:是否能盯准靶心;②投掷技术稳定性:手发抖的程度。

游戏评委按照这两个标准,对4位选手竞技素质作了评判:选手A的投掷结果紧

密围绕靶心,可以断定其眼神好使,手不抖。选手B的投掷结果密集在飞镖盘的

左下角,说明该选手手虽不抖,但严重斜视,你不能说该选手技术不稳定,但由

于眼神问题,不能很好描准靶心。选手C投掷结果非常密集,却略微偏离靶心.说

明该选手技术相当稳定,遗憾的是略带散光。至于选手D,和飞镖靶有仇似的,

将整个飞镖盘打成了麻子。他眼神没有问题,能够盯准靶心,但手却抖动厉害。

这样来看,A为专业选手,而B、C、D由于各种原因,只能是业余水平了。

统计学中一个估计的好坏,实际上也是这个评判逻辑。

首先,单次的估计值不足以决定一个估计的好坏。拿上面的飞镖比赛来讲,

再稳定的选手也有踩西瓜皮的时候,比如选手A也可能阴错阳差投出脱靶的飞镖

来,虽然这种可能性并不大。而选手B也可能投出正中靶心的结果,那是他歪打

正着。

其次,估计的好坏,正如一个选手的竞技素质。投掷技术稳定性,即手的发

抖程度,对应估计量的方差。而眼神好坏,即是否能盯准靶心,对应估计量的偏

差。所有眼神好使选手的投掷(这里为A和D),在统计上,对应无偏估计.若

在眼神好使的选手里面论英雄,则手不抖者胜,显然选手A毫无争议摘得桂冠,

这在统计上对应为有效估计。至于选手B和C,由于眼神问题,在这样的标准下,

连排名的资格都没有。

如此一来,选手C必然会喊冤,他觉得自己的投掷结果离靶心很近,不能单

以眼神定成败。游戏评委考虑到专业选手并不多见,在业余选手中也需要定个标

准来决定名次。因此,将眼神好坏和投掷技术稳定性综合起来考虑,给出的结果

是选手C强于Do这在统计上便对应于著名的均方误差准则及其分解问题了。

——黄恒君;《游戏中的统计推断逻辑:点估计》

来源:《无处不在的统计(三)》(中国统计出版社)

(二)定量资料的整理与统计分析

由资料收集阶段得到的原始资料通常是粗糙的、杂乱的,虽然代表着事物的

某种特征,具有社会实在性,但它们本身并不能深刻揭示事物和现象的本质,只

有对一其进行去伪存真、由此及彼,由表及里的制作,才能把握其内部的规律性,

反映出事物的木质。分析便是资料加工的一种方法,它包括两个内容:第一,资

料的整理,即对收集到的资料的真实性、准确性、合格性、完整性等进行审查,

并通过编辑、分类、分组,汇总等使其条理化、系统化;第二,分析本身,它是

资料处理的核心部分,它通过对资料所包含的被研究事物的各个部分、各个阶段

和属性的考察,对木质与非木质、偶然与必然因素的区分,把握事物的木质特征、

属性、功能、结构与规律性,进而对所研究的作已正确的解释与结论。因此,资

料分析不仅决定着收集到的资料是否有价值,而且能够很好地检验研究它当初提

出的一些假设,或者适当地回答所要研究的问题,它还能够以令人信服和可以理

解的形式描述研究成果。通过分析,研究者可以将认识从具体提高到抽象,从个

别提高到一般,并可以此为基础提出对策性建议或进行决策。

应当指出的是,一个成功的分析,除必须遵循一定的程序及熟练掌握和灵活

运用各种分析方法与技术外,还必须善于运用分析的策略和逻辑,而它们依赖于

分析者的“分析的想象力”,象敏锐的洞察力一样,分析的想象力也是每一个从

事社会研究的人必须具备的基本素质。因为一个成功的分析不仅是一种技术,而

且是“i种艺术、一种灵感、i种神机,也是一种洞见“,它需要研究者反夏锤

炼,细心培养,一长期积累。在某种意义上说,分析的水平决定着一个研究的水

平,而分析水平的高低则依赖于分析者的理论素养,对分析方法与分析技术的学

握以及分析的想象力。

王汉生:《定量资料的整理与统计分析》,《青年研究》,1993(07).

六、教学案例

案例1:高尔顿与回归方程的起源

“回归”是由英国著名生物学家兼统计学家高尔顿(FrancisGalton,

1822-1911,著名生物学家达尔文的表弟)在研究人类遗传问题时提出来的,为

了研究父代与子代身高的关系,高尔顿搜集了1078对父亲及其儿子的身高数据。

1855年,高尔顿发表《遗传的身高向平均数方向的回归》一文,他和他的学生

皮尔逊通过观察1078对夫妇的身高数据,以每对夫妇的平均身高作为自变量,

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

最新文档

评论

0/150

提交评论