《医学(卫生)统计学》学习指南_第1页
《医学(卫生)统计学》学习指南_第2页
《医学(卫生)统计学》学习指南_第3页
《医学(卫生)统计学》学习指南_第4页
《医学(卫生)统计学》学习指南_第5页
已阅读5页,还剩45页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

1、学习指导目录第一讲 绪论第二讲 数据特征与统计描述第三讲 参数估计第四讲 假设检验的基本概念第五讲 卡方检验第六讲 t检验第七讲 多个样本均数比较的方差分析第八讲 线性回归分析第九讲 多元线性回归分析第十讲 基于秩次的统计方法第十一讲 综合评价第一讲 绪论教学要求了解:医学统计学的发展史。熟悉:统计学习的目标与方法。掌握:统计学基本概念:总体与样本、同质与变异、变量的类型、参数与统计量。重点难点统计医学与医学 统计学、医学统计学的概念第二节 统计工作的基本步骤一、设计1.专业设计:选题、建立假说、确定 研究对象和技术方法等个性2.统计设计:围绕专业设计确定统计 设类型、样本大小、分组方法、统计

2、分析指标及统计分析方法。二、收集资料(一)资料来源第一手资料 经常性:统计报表(死亡登记、疫情 报告等),工作记录(病历、化验); 一时性:专题调查、实验或临床试验。第二手资料:已公布的资料,如数据银行、全国、全省卫生统计资料。 (二)资料要求 完整、准确、及时三、整理资料整理资料即原始数据的条理化、系统化的过程。质分组:按事物的属性或性质分组分类变量;量分组:按数据的大小数值变量四、分析资料1.统计描述:用统计指标、统计图表对资料的数量特征及分布规律进行测定和描述。 2.统计推断:用样本信息推断总体特征:参数估计,假设检验。第三节 统计资料的类型有三种类型的资料:计量资料,计数资料,等级资料

3、 基本概念:变量及变量值,研究者对每个观察单位的某项特征进行观察和测量,这种特征称为变量,变量的测得值叫变量值(也叫观察值),称为资料。按变量值的性质可将资料分为定量资料和定性资料。一、计量资料定义:通过度量衡的方法,测量每一个观察单位的某项研究指标的量的大小,得到的一系列数据资料。特点:有度量衡单位多为连续性资料。二、计数资料定义:将全体观测单位按照某种性质或特征分组,然后再分别清点各组观察单位的个数。特点:没有度量衡单位 三、等级资料定义:介于计量资料和计数资料之间的一种资料,通过半定量方法测量得到。特点:每一个观察单位没有确切值各组之间有性质上的差别或程度上的不同。 第四节 统计学中的几

4、个基本概念一、总体与样本总体(population)是根据研究目的确定的同质研究对象的全体。按研究对象来源又有目标总体和研究总体。样本(sample)是指从研究总体中抽取的一部分有代表性的个体。抽样研究的目的是用样本推断总体。二、同质与变异同质(homogeneity)是指同一总体中个体的性质、影响条件或背景相同或非常相近。变异(variation)是指同质的个体之间存在的差异。统计学的任务是在变异的背景上描述同一总体的同质性,揭示不同总体的异质性。三、变量的类型变量分类变量(categorical variable)变量分类变量(categorical variable)有序变量(ordin

5、al variable)定量变量(quantitative variable)定量变量可分为离散型变量(discrete variable)和连续型变量(continuous variable)。变量类型可以转化:定量有序分类二值。注意转化方向只能由信息量多向信息量少。 四、参数与统计量参数(parameter)是指反映总体特征的统计指标。由样本观察资料计算出来的反映样本特征的量称为样本统计量(statistic)。统计是依据样本统计量及其来推断总体参数。五、误差统计上所说的误差泛指测量值与真值之差,样本指标与总体指标之差。主要有以下二种:系统误差和随机误差(随机测量误差,抽样误差)。(1)系

6、统误差:指数据搜集和测量过程中由于仪器不准确、标准不规范等原因,造成观察结果呈倾向性的偏大或偏小,这种误差称为系统误差。 特点:具有累加性。(2).随机误差:由于一些非人为的偶然因素使得结果或大或小,是不确定、不可预知的。 特点:随测量次数增加而减小。六、概率确定性现象:在一定条件下,一定会发生或一定不会发生的现象。其表现结果为两种事件:肯定发生某种结果的叫必然事件;肯定不发生某种结果的叫不可能事件。随机现象:在同样条件下可能会出现两种或多种结果,究竟会发生哪种结果,事先不能确定。其表现结果称为随机事件。 随机事件的特征:随机性;规律性:每次发生的可能性的大小是确定的。概率:描述随机事件发生的

7、可能性大小的数值,用大写的P 表示;取值0,1。第二讲 数据特征与统计描述教学要求了解:了解定量资料的频数分布表的编制方法和分布规律;了解描述分布形态的偏度系数与峰度系数的计算和意义。熟悉:熟悉利用统计图表描述定量资料的基本方法;熟悉制作统计图表的基本要求和规则;熟悉百分位数的计算方法。掌握:掌握描述定量资料集中趋势的算术均数、几何均数、中位数的计算方法和适用条件;掌握描述定量资料离散趋势的极差、四分位数间距、方差、标准差和变异系数的计算方法和适用条件;掌握常用统计图表的制作方法。重点难点第一节 频数分布表与频数分布图一、频数分布表基本概念。用途:揭示数据分布特征,描述分布趋势,发现极端值。二

8、、频数分布图第二节 计量资料的常用统计指标一、描述集中趋势的统计指标基本概念:由于同质性,所有实测值趋向同一数值的趋势称为集中趋势。在应用中,有一些统计量常称为统计指标。 算术均数 意义:算术均数简称均数,常用符号表示样本均数,表示总体均数。均数是描述一组数据集中趋势或平均水平的最常用统计指标。 计算:1.直接法(基于原数据) 其中, 为观察值。 2. 加权法(基于频数表) 其中, 为组段的频数,为组段的中值。=(组段上限+组段下限)/2。 适用条件:适用于对称分布资料,尤其正态或近似正态分布资料。 几何均数 意义:几何均数以符号G表示,常用来反映一组含多个数量级的数据的集中位置。 计算:1.

9、直接法(基于原数据) 或 其中, 为观察值。 2. 加权法(基于频数表) 适用条件:适用于观察值变化范围跨越多个数量级的资料,尤其对数正态分布资料。 中位数 意义:中位数常用符号M表示,是反映一组数据集中趋势的位置指标,在全部实测值中有一半数值比它小,有一半数值比它大。百分位数常用符号表示,是排序后的全部实测值的某百等份分割值,即在全部实测值中有x%个数值比它小,有1x%个数值比它大。中位数就是一个特定的百分位数,即M=P50。 计算:中位数为全部实测值排序后的中间数值或中间两个数值的算术均数。直接法(基于原数据)将n例数据按升序排列,其第i个数据用表示。n为奇数时, n为偶数时, 2. 内插

10、法(基于频数表)其中,L为欲求的所在组段的下限,i为该组段的组距,为该组段的频数,n为总频数,为该组段之前的累计频数。 其中,L为欲求的中位数所在组段的下限,i为该组段的组距,为该组段的频数,n为总频数,为该组段之前的累计频数。 适用条件:资料不限,但最常用于非对称分布的资料。二、描述离散趋势的统计指标基本概念:离散趋势或变异程度是指观察值之间参差不齐的程度。 极差 意义:极差又称全距,常用符号R表示。极差反映一组数据的变异范围。用极差反映数据的变异程度常常比较粗略和不稳定。 计算: R = 最大值最小值 适用条件:资料不限。 四分位数间距 意义:P75和P25分别称为上、下四分位数。四分位数

11、间距Q是全部观察值中居中的一半数值散布的范围。用四分位数间距反映数据的变异程度比极差稳定。 计算: Q= P75P25 其中,P75和P25的求法参见前述百分位数求法。 适用条件:资料不限。 方差和标准差 意义:总体观测值的离均差平方和的算术均数称为总体方差,用2表示。总体方差的平方根称为总体标准差,用表示。二者都反映总体中观测值之间的离散趋势或变异程度,数值越小,表明变异程度越小;反之亦然。实际抽样研究中,常用样本方差S2和样本标准差S作为2和的近似值。标准差的量纲与原变量一致,故实际应用中常使用标准差。 计算: 总体方差 样本方差 总体标准差 样本标准差 其中,n1称为自由度。 适用条件:

12、适用于对称分布资料,尤其正态或近似正态分布资料。 变异系数 意义:变异系数常用符号CV表示。它是标准差与算术均数之比,是一个不带量纲的相对数。 计算: 适用条件:适用于量纲不同的变量间,或均数差别较大的变量间变异程度的比较。第三节 计数资料的常用统计指标一、常用的相对数指标相对数是两个有联系的指标之比,相对数指标大致有三种类型:频率(frequence)、强度(intensity)和相对比(relative ratio)。(一)频率型指标意义: 通常近似地反映某一事件出现的机会大小, 如发病概率、死亡概率等。计算公式: 频率型指标无量纲,在01范围内取值;K是比例基数,通常取为100%,也可取

13、为1000、1万/1万和10万/10万等,根据习惯用法来决定。常用指标:频率型指标是最常见的。具体指标参见教材。(二)强度型指标意义:强度型指标通常是指一段时间内的平均概率。强度是单位时段内某现象发生的频率。如人时发病率的分子是新发生的事件数,分母是人时数(观察人数乘以时间)的总和。要注意这类指标并不是一般的速率,而是单位时间内的频率。从统计学考虑,其本质实为频率强度或概率强度的近似值。计算公式: 常用指标:强度型指标多用于大人群、长时间随访的资料。可计算发病率、死亡率、出生率等。(三)相对比型指标意义:相对比型指标是指任何两个相关联的变量A与B之比。它表示相对于B的一个(或十个、百个、千个等

14、)单位,A有多少个单位。A和B可以是绝对数、相对数和平均数,A和B的量纲可以不同,也可相同,但A和B互不包含。计算公式: 常用指标:人口学中的男女性别比,反映卫生资源的指标如每千人口的医生数、每千人口的病床数、每医生的门诊工作量以及分析动态数列的指标等都是相对比。 二、应用相对数应注意的事项1. 防止概念混淆 对于表现为相对数的统计指标, 读者必须认真思考其定义, 辨别其性质, 切不可顾名思义。2. 计算相对数时分母应有足够数量 确保研究结果的稳定性。3.正确地合并估计频率(或强度)型指标 分别合计各组的分子和分母后再计算合计的指标,不可将分组的频率或强度取平均数作为合并的频率或速率。4. 相

15、对数间的比较要具备可比性 主要应注意观察的对象是否同质,研究的方法(如检测手段、抽样方法)是否相同,观察的时间是否一致等;在被比较的总体之间与研究指标有关的其它因素是否一致或接近。5. 对相对数的统计推断 从样本估计值推断总体的相对数也应当考虑抽样误差,需要进行参数估计和假设检验。 第四节 统计图表一、统计表基本概念:将统计数值或统计指标用表格的形式列出称为统计表。列表原则:重点突出、简单明了、主谓分明、层次清楚。统计表的结构:标题、标目、线条、数字。二、统计图基本概念:将统计数值或统计指标用图形的方式表达称为统计图。统计图的结构:标题、图域、标目、尺度、图例。常用统计图:直条图 用等宽直条的

16、长度来表达参与比较的指标的大小。百分条图 用直条的长度或面积表达事物各组成部分在全体中的比重。圆图 用同一圆形中的扇形面积表达事物各组成部分在全体中的比重。线图 用线段的升降表达某事物的量随另一事物的量变化的趋势,或某事物的量随时间变化的过程。半对数线图 纵轴用对数尺度的线图。适用于表达事物之间相对变化速度的比较。直方图 用于表示连续性定量变量的频数分布。7.散点图:描述两指标的相关关系。第三讲 参数估计教学要求了解:了解抽样分布及t分布的特征,了解查表法估计总体概率的置信区间。熟悉:理解抽样误差的概念;熟悉标准误的意义及其应用。掌握:会计算均数及频率的标准误;掌握总体均数95和99置信区间的

17、计算及适用条件;掌握正态近似法计算总体概率的95%和99置信区间及适用条件;阐述标准差与均数标准误的区别。重点难点 第一节 抽样分布与抽样误差 一、均数的抽样误差基本概念:在同一总体中反复多次随机抽取样本含量相同的若干样本,由于个体差异与偶然性的影响,样本统计量之间以及样本统计量与总体参数之间的差异,称为抽样误差。这种由抽样造成的均数之间的差异称为均数的抽样误差,频率之间以及频率与概率之间的差异称为频率的抽样误差。特点:从正态分布N(,2)总体中抽样,样本均数仍服从正态分布;从非正态分布总体抽样,只要样本量足够大(n 50),样本均数的分布也近似于正态分布。在抽样研究中,抽样误差是不可避免的。

18、用来表示抽样误差大小的指标称为标准误。二、均数标准误意义:均数标准误用符号表示,也称样本均数的标准差。它反映了样本均数之间、样本均数与总体均数之间的离散程度,也反映了样本均数抽样误差的大小。计算:可按公式 计算。在实际应用中,总体标准差 常常未知,需要用样本标准差s来估计。此时,均数标准误的估计值为 。 由此式可见,若增加样本含量n可以减小样本均数的抽样误差。主要应用:估计总体均数的置信区间;均数的假设检验。在指标的意义、计算及结果解释方面注意与标准差区别,不能将两者混淆。三、频率的标准误意义:频率的标准误用符号p表示,它反映了样本频率与样本频率之间、样本频率与总体概率之间的离散程度,也反映了

19、样本频率抽样误差的大小。 计算:可按公式 p = 计算。在实际应用中,总体概率 常常未知,需要用样本频率p作为总体概率 的估计值 ,因此频率的标准误的估计值为 。由此式可见,增加样本含量n可以减小样本频率的抽样误差。第二节 t分布t值的分布与自由度n 有关(实际是样本含量n不同)。t 分布的图形不是一条曲线,而是一簇曲线。 =(标准正态分布)=5=1012345-1-2-3-4-5f(t)0.10.20.3图5-3 不同自由度下的t分布图t 分布的图形有如下特征:单峰分布,以0为中心,左右对称,类似于标准正态分布。 自由度n 越小,则越大,t值越分散,曲线的峰部越矮,尾部越高; 随着自由度n

20、逐渐增大,t分布逐渐逼近标准正态分布;当n 趋于 时,t分布就完全成为标准正态分布,故标准正态分布是t分布的特例统计学家将t分布曲线下的尾部面积(即概率P)与横轴t值间的关系编制了不同自由度 n 下的t界值表(附表2)。 t界值表:横标目为自由度n ,纵标目为概率P。 t临界值:表中数字表示当 n 和P 确定时,对应的值。 单侧概率 (one-tailed probability):用ta,表示 双侧概率 (two-tailed probability):用ta/2,表示第三节 总体均数及总体概率的估计一、总体均数的估计参数估计是指用样本指标(统计量)估计总体指标(参数)。参数估计有点估计和区

21、间估计两种。点估计直接用随机样本的样本均数作为总体均数 的估计值或用样本频率p作为总体概率 的估计值的方法称为点估计。这是一种没有考虑抽样误差的简单估计方法。区间估计用已知样本统计量和标准误确定总体参数所在范围的方法称为区间估计。所估计的总体参数的范围通常称为参数的置信区间(confidence interval , CI),这一估计可相信的程度称为置信度或置信水平(如95%或99%)。若标准差不变,置信度由95%提高到99%,置信区间便由窄变宽,估计的精度下降。 (三)可信区间的计算1.正态分布总体均数的置信区间总体均数置信区间的基本公式是 t/2, 。样本量较大时,可以是 Z/2或Z/2(

22、若总体标准差已知)。 实际工作中,估计总体均数置信区间时,要注意与参考值范围区别,见卫生统计学教材表5-4中内容。二、总体概率的估计 根据样本含量n和样本频率p的大小,可以采用查表法和正态近似法。重点掌握正态近似法。 正态近似法:当n足够大,且样本频率p和(1p)均不太小时,如np与n(1p) 均大于5,p的抽样分布接近正态分布,此时总体概率的置信区间为 (p Z/2Sp ,p + Z/2Sp ),缩写为p Z/2Sp 第四讲 假设检验的基本概念教学要求了解:了解常用的正态性检验的方法;区间估计与假设检验之间的关系。熟悉:假设检验的概念与原理;假设检验的基本步骤;假设检验功效的意义及计算;假设

23、检验的两类错误之间的区别与联系。掌握:掌握常用的t检验、二项分布资料的Z检验以及Poisson分布资料的Z检验的分析与计算过程,包括每种检验方法的适用条件和不同类型;学会综合考虑研究目的、设计类型、变量类型、样本含量等要素选择合适的假设检验方法的技巧。重点难点第一节 检验假设与P值假设检验的思维逻辑基本推断原理:小概率事件在一次随机试验中不(大)可能发生。特点:从研究总体中抽取大小合适的随机样本,应用假设检验理论和方法,依据样本提供的有限信息对总体做推断。第二节 假设检验的基本步骤基本概念:检验水准是假设检验预先规定的一个“较小”的概率值,应用中常取0.05或0.01等数值,是人为的判断标准。

24、统计量是随机样本的函数;由样本计算出统计量的具体数值,据以决策。如果总体状况和H0一致,统计量获得现有数值以及更不利于H0的数值的可能性(概率)就是P值。假设检验的基本步骤:选择检验方法,建立检验假设并确定检验水准计算检验统计量确定P值做出推断结论第三节 大样本均数的假设检验一、单样本均数的u检验二、两样本均数的u检验第四节 大样本率的假设检验一、单样本率的u检验二、两样本率的u检验第五节 假设检验的功效与两类错误一、假设检验的两类错误 附表 推断结论和两类错误的概率实际情况检验结果 拒绝H0 不拒绝H0H0真第类错误 ()结论正确(1-)H0 不真结论正确 (1-)第类错误()当样本容量n一

25、定时,越小越大;越大越小;要想同时降低与,唯一的方法是增大样本容量。二、假设检验的功效基本概念:1-称为假设检验的功效,其意义是,当所研究的总体与H0确有差别时,按检验水平能够发现它(拒绝H0)的概率。一组样本资料t检验的功效计算: 其中,n为样本容量,为欲发现的最小差异或容许误差,为总体标准差,为假设检验的临界值(取单侧)。然后根据反查标准正态分布表, 标准正态分布的密度曲线下,左侧的面积就是功效1-。两组独立样本资料t检验的功效计算:其中,、分别为两个样本的样本量,其余符号含义同上。二项分布两组独立样本资料Z检验的功效计算:其中,1、2分别为两个被推断的总体概率,其余符号含义同上。第五讲

26、检验 教学要求了解:2分布是一种连续型随机变量的概率分布,其分布的形状依赖于自由度的大小;用“需处理数”( NNT) 作为指标比较两种药物的临床治疗效果;了解似然比 2统计量。熟悉:四格表的确切概率计算法和配对设计下多分类资料的McNemar 检验。掌握:单个频数分布的拟合优度检验;完全随机设计下两组频数分布的2检验;多组频数分布的2检验;以及配对设计下两组频数分布的2检验。 重点难点第一节 2 2表 检验一、2分布基本概念:2分布是一种连续型随机变量的概率分布,其分布的形状依赖于自由度的大小。如果Z服从标准正态分布,那么Z2服从自由度为1的分布。二、拟合优度检验拟合优度检验:拟合优度检验是根

27、据样本的频率分布检验其总体分布是否等于某给定的理论分布。2检验的基本公式:大样本时检验统计量 近似地服从2分布,自由度为=k1(计算Ti时利用样本资料估计的参数个数)其中,Ai和Ti分别为实际观察频数和成立时的理论频数,k为频数分布的类别总数。该公式为2检验的基本公式。22列联表, 又称四格表。完全随机设计下两组频数分布的四格表处理属性合计阳性阴性1(固定值)2(固定值)合计检验目的:根据两组独立样本的频率和检验两个二项分布的概率和是否不同。检验统计量:可直接使用2检验基本公式也可使用等价的专用公式或校正公式。专用公式校正公式自由度为1。配对设计的2检验二分类情形22列联表特点:这类问题的原始

28、数据可以表示为下表所示的四格表形式。这里的“两份样本” 互不独立,样本量都是,是固定的,而行合计与列合计却是事先不确定的。 两个变量阳性率比较的一般形式和符号变量变量2合计阳性阴性阳性阴性合计(固定值)检验目的:通过样本资料来推断两方法的阳性概率有无差别。检验统计量:计算公式为 =1 若, 需对公式进行校正, 校正公式为多分类的情形RR列联表特点:配对设计下多分类资料的RR列联表的形式是: 配对设计下多分类资料的RR列联表变量变量2合计1212R合计(固定值)检验目的: 了解变量和变量2的总体概率分布是否不同检验统计量:自由度为。第三节 R C表的2检验RC列联表:R组独立样本的频数分布,其数

29、据以下表形式表示。这样的数据形式称为RC列联表。完全随机设计下多组频数分布的RC表处理属性(水平)合计12C1(固定值)2(固定值)R(固定值)检验统计量:计算公式为 自由度 =(R-1)(C-1)注意:比较多组独立样本的2检验, 拒绝H0只能说各组总体概率不全相同,并不是多组概率彼此之间均不相同。若要明确哪两组间不同,还需进一步作多组间的两两比较。等级资料总体平均效应的比较一般不能用2检验, 因为两个总体概率分布不同不等于平均效应不同。第四节2检验要注意的问题一、关于2检验的条件注意理论频数 T不能太小。一般要求各格的理论频数均应大于1,且T5的格子数不宜多于格子总数的1/5。二、根据不同的

30、设计采用不同的分析方法完全随机设计下各频数分布是互相独立的,而配对设计下各频数分布却不是互相独立的。设计方法不同,资料的性质不同,分析的方法也不同二、 关于似然比 2统计量作2检验,也可以计算似然比 2统计量,似然比 2统计量记作,计算公式为 式中表示对所有格子求和。其自由度的确定方法和临界值与Pearson 2统计量一致。第六讲 t检验教学要求了解:t检验的基本概念;各种设计t检验的基本步骤。熟悉:t检验的基本步骤。掌握:t检验的基本步骤。重点难点第一节 单样本均数的t检验t检验条件当样本含量较小时,理论上要求样本为来自正态分布总体的随机样本;当两小样本均数比较时,要求两总体方差相等(方差齐

31、性,即)。在实际工作中,若上述条件略有偏离,仍可进行t检验分析。t检验依据的检验统计量是服从t分布的t值。对于总体标准差未知的小样本数据(n60),单样本均数的假设检验采用t检验,计算公式为 , 其中,0为已知的总体均数(一般为理论值、标准值或经过大量观察所得的稳定值等)。第二节 配对样本均数的t检验基本概念:配对设计是研究者为了控制可能存在的主要非处理因素而采用的一种试验设计方法。医学研究中常见的配对样本:配成对子的两个个体分别给予两种不同的处理(如把同窝、同性别和体重相近的动物配成一对;把同性别、同病情和年龄相近的病人配成一对等);同一个体同时分别接受两种不同处理(如同一动物的左右两侧神经

32、、同一份标本分成两部分);同一个体自身前后的比较(如高血压患者治疗前后的舒张压比较、肝炎患者治疗前后的转氨酶比较等)。 检验统计量: , 其中,为差值的均数,为差值的样本标准差, n是对子数。第三节 两独立样本均数的t检验 两样本所属总体方差相等 检验统计量:,其中,是合并方差。 两样本所属总体方差不等(t检验) 检验统计量:,其中,和分别为两组样本均数的标准误。第四节 两独立样本方差的齐性检验 检验统计量: , 1=n1-1,2=n2-1 其中,与是被比较的两个样本方差。第五节 两独立样本方差不齐时均数比较的t检验当两样本方差不齐时,就不能用上述检验方法来进行两样本均数差别的比较,此时可以使

33、用校正t检验- t检验来代替。第六节 变量代换变量代换也称为变量变换,是将原始数据作某种函数转换,如转换为对数值。它的目的是:使各组数据达到方差齐性。使资料转换为正态分布,以满足检验和方差分析(见第十一章)的应用条件。直线化,用于曲线拟合第七讲 多个样本均数比较的方差分析教学要求了解:方差齐性检验和变量变换。熟悉:方差分析的前提条件;多个样本均数的两两比较。掌握:方差分析的基本思想;各种设计方案(完全随机设计、随机区组设计、析因设计、重复测量设计等)变异和自由度的分解方法。重点难点第一节 方差分析的基本思想和应用条件 一、方差分析的基本思想方差分析的基本思想就是把全部观察值间的变异 总变异按设

34、计和需要分解成两个或多个组成部分,总自由度也分解成相应的几个部分,再作分析。分解的每一部分代表不同的含义,其中至少有一部分代表各均数间的变异情况,另一部分代表误差。全部试验数据大小不同,这种变异称为总变异,该变异既包括了随机误差(含个体差异和测量误差),也包括了处理效应的作用。各处理组样本均数各不相同,与总均数也不相同,这种变异称为组间变异(variation between groups),它反映了处理的影响,同时也包括了随机误差(含个体差异和测量误差)。各处理组内部观察值大小不同,这种变异称为组内变异(variation within groups),组内变异仅反映随机误差(含个体差异和测

35、量误差)。二、方差分析的应用条件各组样本是相互独立的随机样本且来自正态总体。各组总体方差相等,即方差齐性(homoscedasticity)。第二节 完全随机设计资料方差分析完全随机设计资料的方差分析用于成组设计多个样本均数的比较,属单向(因素)方差分析(one-way ANOVA),它将数据按一个方向(即同一处理的不同水平或不同处理)进行分组整理。方差分析的基本步骤同其它假设检验,也分为三步。建立检验假设,确定检验水准H0:多个总体均数全相等;H1:多个总体均数不全相等,即至少有两个总体均数不等。=0.05计算检验统计量确定P值,作出推断结论以求F值时分子的自由度1=组间、分母的自由度2=组

36、内查F界值表得P值,P和比较得出推断结论。随机区组设计资料的方差分析一、离均差平方和与自由度的分解随机区组设计资料的变异除了总变异、处理的变异和随机误差外,还存在区组的变异。区组变异是指每一区组的样本均数各不相同,与总均数也不相同。它既反映了区组因素不同的影响,也包括了随机误差(含个体差异和测量误差)。二、随机区组设计资料方差分析的基本步骤(1)建立检验假设,确定检验水准对于处理组,H0:多个总体均数全相等,即各处理效果相同H1:多个总体均数不全相等,即各处理效果不全相同对于区组,H0:多个总体均数全相等H1:多个总体均数不全相等均取=0.05(2)计算检验统计量 (3)确定P值,作出推断结论

37、分别以求F值时分子的自由度处理和区组、分母的自由度误差查F界值表得处理效应的P值和区组效应的P值,P和比较得出推断结论。第三节 多个样本均数的两两比较若经ANOVA分析得到处理因素的P0.05,按0.05水准,拒绝H0,接受H1时,说明多个总体均数不全相等。但不能得到各处理组总体均数全部不等,还是其中有某两个总体均数不等的结论。若要说明多个总体均数中哪些总体均数不等需进一步作两两比较。两两比较的方法很多,常用的是多重比较,可分为以下两种情形:(1)在研究设计阶段未预先考虑或预料到,经假设检验得出多个总体均数全不等的提示后,才决定多个均数的两两事后比较,常用于探索性研究,往往涉及到每两个均数的比

38、较。可采用SNK法、Bonfferoni t检验、idk t检验等等;(2)在设计阶段就根据研究目的或专业知识而计划好的某些均数间的两两比较,常用于事先有明确假设的证实性研究,如多个处理组与对照组的比较。可采用Dunnett-t检验、LSD-t检验等,也可用Bonfferoni t检验、idk t检验。一、SNK法SNK法也称NK法,属多重极差检验(multiple range test),其检验统计量为q,故又称q检验。二、Dunnett法Dunnett法其检验统计量为t,故又称Dunnett t检验。它适用于k1个实验组与对照组均数的比较。三、Bonfferoni法又称Bonfferoni

39、 t检验,该法是对检验水准进行调整,使多次比较后犯第一类错误的累积概率保持不变或至少不超过原有水准的方法,该法的思想适用于所有的两两比较。第四节 重复测量资料的方差分析重复测量资料是同一受试对象的同一观察指标在不同时间点上进行多次测量所得的资料。重复测量资料和随机区组设计资料的区别主要有二:(1)重复测量资料中同一受试对象(看成区组)的数据高度相关。(2)重复测量资料中的处理因素在受试对象间为随机分配,但受试对象内各时间点却不能随机分配;随机区组设计资料中每个区组内的受试对象彼此独立,处理只在区组内随机分配,同一区组内的受试对象接受的处理各不相同。一、离均差平方和与自由度的分解两因素重复测量资

40、料的总变异包括两部分,一部分为横向分组的受试对象间的变异,另一部分为纵向分组的受试对象内的变异。即 (9-4)二、重复测量资料方差分析的前提条件进行重复测量资料的方差分析,除需满足一般方差分析的条件外(详后),还需特别满足协方差阵的球形性或复合对称性。若球形对称性质不能满足,则方差分析的F值有偏,因为它增大了第一类错误的概率。球对称性通常采用Mauchly检验来判断。若按规定检验水准=0.10,拒绝H0,接受H1,则从理论上讲应对受试对象内所有变异的自由度进行校正,用校正后的自由度查F界值表获得P值,再做出推论。如果球对称性不满足时,也可采用多变量方差分析的方法。第八讲 简单回归分析教学要求了

41、解:总体回归线的95%置信带与个体预测值Y的区间估计;可线性化的非线性回归的基本步骤。熟悉:总体回归系数的统计推断;残差与残差分析。掌握:回归分析的基本思想与方法;回归的基本概念;回归系数检验的意义与方法;相关与回归分析的区别与联系。重点难点第一节 两相关变量的散点图 一、直线回归的概念 目的:研究应变量Y对自变量X的数量依存关系。特点:统计关系。 X值和Y的均数的关系,不同于一般数学上的X 和Y的函数关系。第二节 回归方程 一、直线回归方程的一般表达式为 二、回归模型的前提假设:线性(linear)、独立(independent)、正态(normal)与等方差(equal variance)

42、。三、最小二乘原则:求解回归方程中参数估计量a和b值所遵循的策略:使回归残差平方和达到最小;在最小二乘原则下所获得回归参数的估计量称为最小二乘估计。 第三节 回归系数的假设检验 建立样本直线回归方程,只是完成了统计分析中两变量关系的统计描述,研究者还须回答它所来自的总体的直线回归关系是否确实存在,即是否对总体有 ?1回归系数的方差分析 2. t 检验第四节 回归系数与预测值的区间估计一、总体回归线的区间估计1. 总体均数的区间估计给定X=xp时,Y的总体均数的点估计为 其标准误为Y的总体均数的(1-)置信区间为 总体回归线的置信带 同时考虑X的所有可能取值时,总体均数的点估计为回归直线,其(1

43、-)置信区间为一个弧形区带,称为回归直线的置信带(confidence band )。二、个体值的预测带1. 个体预测值Y的区间估计总体中,当Xp为某一固定值时,个体Y值是在一定范围内波动的,其分布的标准差按下式估计:个体Y值的预测区间 (prediction interval)为 2. 个体值的预测带同时考虑X的所有可能取值时,个体预测值的点估计仍然是回归直线,其(1-)置信区间为一个弧形区带,称为个体值的预测带(prediction band )。第五节 回归方程的应用 一、线性回归的主要用途 1研究因素间的依存关系 自变量和应变量之间是否存在线性关系,即研究一个或多个自变量对应变量的作用

44、,或者应变量依赖自变量变化而变化的规律。 2估计与预测 可用易测定的一组给定的自变量的观测值来推算较难测定的Y值 。 3统计控制 是利用回归方程进行逆估计,即应变量Y给出一个确定的值或在一定范围内波动时,通过控制自变量的取值来实现 。二、线性回归应用的注意事项 1在进行直线回归分析之前,应绘制散点图。 2作回归分析时,要注意两变量间是否存在实际意义。 3两变量间存在直线关系时,不一定表明彼此之间就存在因果关系。第九讲 多元线性回归分析教学要求了解多元共线性的概念及其对回归分析结果的影响。熟悉多元相关与回归分析的基本原理与方法。掌握多元相关与回归分析结果的解释;相关、回归、简单相关、偏相关与复相

45、关,简单回归、偏回归与全回归等概念。重点难点 多元线性回归一、多元线性回归模型1、变量(Y)关于k个自变量()的多重线性回归的数学模型为:。实质是将每个Y的观测值用该模型在最小残差平方和的原则下进行分解。2、标准回归系数为将各个变量按变换后,再进行多重回归计算所得的回归系数。因为通过标准化过程消除了各个变量的计量单位不同对回归系数的影响,所以各个标准回归系数的大小能直接反映该自变量对Y变量的回归效应的大小。3、多重回归分析的前提条件完全与简单线性回归相同:线性、独立、正态和等方差,即LINE。二、多元线性回归方程的建立三、回归方程的假设检验1、整体回归效应的假设检验(方差分析)的原假设为H0:

46、 ;其过程是通过对Y的总变异进行分解,用回归均方与残差均方的比值构造F检验统计量,然后根据相应的F分布决定是否拒绝原假设。2、偏回归系数的t检验的的原假设为H0: i=0,即第i个总体偏回归系数为零;其过程是用第i个偏回归系数的估计bi与该偏回归系数的标准误之比值构造t统计量:然后根据相应的t分布决定是否拒绝原假设。几个基本概念:复相关系数的平方称为确定系数(coefficient of determination)或决定系数,记为R 2,用以反映线性回归模型能在多大程度上解释反应变量Y的变异性。其定义为其取值范围为。若确定系数R 2的值接近于1,指示样本数据很好地拟合了所选用的线性回归模型。

47、R 2直接反映回归方程中所有自变量解释反应变量Y总变异的百分比。同时,R 2也可以解释为回归方程使反应变量Y的总变异减少的百分比。复相关系数(multiple correlation coefficient) R, 定义为确定系数的平方根,即调整的R 2(adjusted R-Square):当回归方程中包含有很多自变量,即使其中有一些自变量对解释反应变量变异的贡献极小,随着回归方程的自变量的增加,R 2值表现为只增不减。调整的R 2克服了这一缺点。调整的R 2记为,定义为 偏相关系数(partial correlation coefficient):扣除其他变量的影响后,变量Y与X的相关的有

48、无、方向与强弱程度,称为Y与X的偏相关系数。偏回归系数( partial regression coefficient ):当方程中其他自变量保持常量时,自变量Xi变化一个计量单位,反应变量Y的平均值变化的单位数量。简单相关系数的假设检验与简单回归系数的假设检验等价;多重回归的整体回归效应的假设检验与总体确定系数R 2=0的假设检验等价;偏相关系数的假设检验与偏回归系数的假设检验等价。第二节 自变量选择方法一、 自变量筛选的标准与原则1、自变量筛选的目的是确保回归方程包含所有对反应变量有较大影响的自变量,而把与反应变量关系不大或可有可无的自变量排除在方程之外,以提高回归参数的估计和预测的精度。

49、2、残差平方和()缩小与确定系数()增大的自变量筛选原则是等价的;残差均方()缩小与调整确定系数()增大的自变量筛选的标准与原则也是等价的。二、 变量筛选的常用方法自变量筛选的方法很多,有前向选择、后向选择、逐步选择等。但以逐步选择(stepwise selection)的方法应用较多。在逐步选择过程中,把经F检验有意义的变量引入方程后,又对已在方程中的自变量进行一次关于剔除的F检验,保留有统计学意义的变量,而剔除无统计学意义的变量。反复进行引入、剔除过程,直到既没有变量被引入,也没有变量被剔除为止。 第三节 多元线性回归的应用与注意事项一、非同质资料的合并问题:在用回归分析解释实际专业问题时

50、,应考虑是否存在混杂变量干扰回归结果,即在该混杂变量的不同水平上的回归系数具有不同的特征;不要将这种非同质的资料合并拟合回归模型,应分组拟合回归模型。二、多重共线性(multi-co-linearity)问题:多重共线性是指自变量之间非独立或线性相关,即回归模型中的一个自变量近似为其它自变量的线性组合。多重共线性的存在将导致对回归参数的最小二乘估计的性质变坏。表现为:回归参数估计值的标准误差偏大,因此回归参数估计值变得十分不稳定,甚至符号改变;当样本数据有略微改变或在模型中增加或删除某个自变量时,将使其它自变量的回归参数估计值发生较大变化,从而使回归参数估计值失去意义。在实际应用多重线性回归过

51、程中不难发现,自变量之间相互独立或线性无关的情况是很少见的,多重共线性现象难以避免,问题在于其多重共线性的强弱程度。许多统计学家认为,如果多重共线性在程度上较弱时,线性回归仍然不失为解决实际问题的有效工具。但当多重共线性较强时,将会导致一系列错误的结论。三、自变量间交互作用的回归模型生物医学研究的问题常常涉及到自变量间乘积项对反应变量作用的情况,统计学为处理此类问题提供了方法,即拟合有交互作用项的回归模型。第十讲 基于秩次的统计方法教学要求了解:了解不同设计类型的秩和检验和相应t检验的功效有何不同。熟悉:理解非参数统计的概念;熟悉不同设计类型的秩和检验方法。掌握:掌握不同设计类型的秩和检验的实

52、施方法及其应用条件。 重点难点秩和检验方法适合于:(1)资料的总体分布类型未知;(2)资料分布类型已知,但不符合正态分布;(3)某些变量可能无法精确测量如等级资料。 第一节 两独立样本差别的秩和检验对于定量数据,如果两独立样本分别来自方差相等的正态总体的假定成立,就可以用t检验比较两样本均数与的差别是否有统计学意义;如果此假定不成立或不能确定是否成立,就不能应用t检验,而应采用非参数统计分析方法秩和检验来分析两样本是否来自同一总体。一般文献上使用的方法是Mann_Whitney的U检验法并给出U统计量。两种方法是独立提出的,检验结果完全等价的;前者用T统计量,而后者用U统计量,U统计量有明确含

53、义,为了避免与T统计量混淆,不再给出U统计量的定义。 第二节 配对设计资料的秩和检验适用条件:1.配对设计;2.如果差数严重偏离正态分布,但差数的总体分布对称第三节 完全随机设计多组差别的秩和检验适用条件:1.完全随机设计的多组均数比较 ;2. 试验观测结果严重偏离正态分布 3.组间方差不齐,4.观测结果是有序的 基本思想:如果各组均来自同一总体,则各组的平均秩和近似相等 第四节 多组差别秩和检验的注意事项优点:要求满足的条件宽松,分析结果比较稳健。缺点:当数据满足参数统计分析的要求的时候,仍选择使用的话会损失数据的信息。 Wilcoxon(Mann-Whitney)法和Kruskal-Wallis法本质上是相同的,即检验各组的平均秩是否相等。如果经检验得各组的平均秩不相等,则可以推论数据的分布不同,进一步可推论各分布间分布位置发生了平移;反之,即使各组平均秩相等,也不能说明数据的分布相同Wilcoxon(Mann-Whitney)法和Kruskal-Wallis检验统计量的同秩校正公式计算比较复杂,可以借助第十一章完全随机设计资料方差分析中离差平方和分解的思想计算检验统计量,计算出的检验统计量与用校正公式计算的相等。 第五节 Spearman 秩相关适用条件:求两变量的相关系数,当X、Y并不服从二元正态分布,对数据做秩变换后再计算直线相关

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论