5-《医学统计学》总复习_第1页
5-《医学统计学》总复习_第2页
5-《医学统计学》总复习_第3页
5-《医学统计学》总复习_第4页
5-《医学统计学》总复习_第5页
已阅读5页,还剩163页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

《医学统计学》复习暨南大学基础医学院医学统计学教研室林汉生《医学统计学》教学的指导思想强调重点:基本概念和常用统计方法注意难点:理解和应用中经常出错的地方突出应用:统计设计、方法选择、数据处理、结果表达第一篇基本统计方法第一章绪论第二章计量资料的统计描述第三章总体均数的估计与假设检验第四章方差分析第五章计数资料的统计描述第六章二项分布与Poisson分布第七章

2检验第八章秩和检验第九章回归与相关第十章统计表与统计图第一章绪论《医学统计学》的定义统计学的几个基本概念医学统计工作的基本步骤分析资料包括的内容1.医学统计学》的定义运用统计学的原理和方法,研究医学科研中有关数据的收集、整理和分析的应用科学。医学统计学是处理医学资料中的同质性和变异性的科学。

2.统计学的几个基本概念观察单位同质和变异总体与样本抽样研究、随机抽样、样本含量变量、变量值、数据或资料资料类型参数与统计量误差随机现象、随机事件、随机变量频率与概率(1)观察单位

observedunit,individual,case

统计研究中的基本单位,如1个人、1头动物;1个器官、1个细胞(2)同质和变异

Homogeneity&Variation同质:是指观察单位间,影响被研究指标的主要的可控制的因素达到相同或基本相同。例如研究儿童身高时,要求年代、地区、民族、年龄、性别等影响身高较大且易于控制的因素相同,而不易控制的遗传和营养等影响因素可以忽略。如2010年

广州市

汉族7岁

男孩

身高变异:在同质基础上的个体差异。

(3)总体与样本

populationandsample总体:根据研究目的确定的同质个体某种变量值的全体。广州2015年7岁正常男童的身高测量值

样本:从总体中抽出的有代表性的部分。

(4)抽样研究、随机抽样、样本含量抽样研究(samplingresearch):从总体中随机抽取样本,用样本信息推断总体特征。随机抽样(randomsampling):总体中的每个个体都有相同的可能性被抽取到样本中。样本含量(samplesize):样本中所包含的观察单位数。

(5)变量、变量值、数据或资料变量(Variable):观察对象的特征或指标,如身高。变量值(Valueofvariable):变量的测量值,如某大学男生身高的测量值为170cm。资料(Data):变量的测量值构成数据或资料,如某校100名大学男生的身高测量值。

(6)资料类型计量资料计数资料等级资料计量资料

scalevariable

numericalvariable

quantitativedata变量值表现为数值大小,一般有度量衡单位。如身高(cm)、脉搏(次/分)。根据变量值是否连续,分为:连续型:如身高离散型:如脉搏计数资料

nominalvariable

unorderedcategoricalvariable

qualitativedata变量值表现为互不相容的类别,类别间无程度和顺序差别,也称无序分类资料。如:二分类:如性别男、女多分类:如血型A、B、AB、O等级资料

ordinalvariable

orderedcategoricalvariable

rankeddata变量值表现为互不相容的类别,类别间有程度和顺序差别,也称有序分类资料。如:化验结果(-、±、+、++、+++)疼痛(无,轻、中、重、剧烈)疗效(治愈、显效、好转、无效)变量的转化与编码由计量资料转化为计数和等级资料:如脉搏数正常(60次/分~100次/分)

异常(<60次/分或>100次/分)缓脉(<60次/分)

正常(60次/分~100次/分)

速脉(100次/分)计数或等级资料的数字编码性别:男=1,女=2;

或男=0,女=1;

或男=1,女=0疗效:无效=0、好转=1、显效=2.治愈=3(7)总体参数与统计量

parameterandstatistic总体参数:总体的统计指标,如,统计量:样本的统计指标,如(8)误差(error)

误差:是指观测值与实际值之间的差别。系统误差:误差值恒定不变或按一定规律变化,即多次测量中大小和方向不变的误差,如来自不标准的仪器、不同实验者个人感觉或操作上的差异。系统误差的产生原因往往可知,必须控制或消除。随机测量误差:多次测量中大小和方向不确定的误差,由各种偶然因素引起。该类误差不可避免,但需要控制在一定范围内。抽样误差:由抽样引起的样本统计量与总体参数间的差异。抽样误差产生的原因为:个体之间存在变异,抽样时只能抽取总体中一部分作为样本。该类误差不可避免。非系统误差:在实验过程中由研究者偶然失误造成的误差,如抄错数字,写错单位。该类误差必须消除。

(9)随机现象、随机事件、随机变量随机现象:在相同条件下重复观察同一现象,可能出现多个不同结果,但事先无法确定出现哪一个结果,这类现象称为随机现象。随机事件:随机现象的每一个可能结果。随机变量:表示随机现象观察结果的变量。

例:10例肾移植患者术后3个月内5例出现

急性排斥反应(0:无;1:有)(10)频率与概率

relativefrequencyandprobability频率:设在相同条件下,独立地重复n次试验,随机事件A出现f次,则称f/n为随机事件A出现的频率。如10例肾移植患者术后3个月内5例出现急性排斥反应,排斥反应发生率为50%(5/10)。当n逐渐增大时,频数f/n始终在一个常数左右作微小摆动,则称该常数为随机事件A的概率。概率:描述随机事件发生可能大小的一个量度。数值介于0与1之间,用P表示。将P≤0.05称为小概率事件,表示在一次实验或观察中该事件发生的可能性很小,可视为很可能不发生。

3.医学统计工作的基本步骤设计:指统计设计(如何确定总体?如何抽样?样本含量?如何分组?如何控制误差,等)收集资料:资料来源(报表、工作记录、专题研究)整理资料:关键是检查、核对原始数据分析资料:统计描述和统计推断4.分析资料包括的内容统计描述:只对现有数据的特征进行描述,不涉及到由样本信息推断总体特征。计算统计指标:如均数与标准差;率与构成比绘制统计图表统计推断:涉及到由样本信息推断总体特征。区间估计:由样本统计指标(统计量)推断总体相应指标(总体参数)假设检验:由观察到的样本间差别推断相应总体间是否可能存在差异

第二章计量资料的统计描述频数分布频数分布的类型频数分布表的用途平均数的种类和适用情况离散程度的指标和适用情况正态分布的概念正态分布的两个参数正态曲线下面积的分布规律标准正态分布医学参考值范围参考值范围的确定1.频数分布表和频数分布图如果计量资料观察例数较多,可对数据作适当分组,制作频数表或直方图,表达数据的分布规律。

某地140名正常男子红细胞数的频数分布表红细胞数(1012/l)频数频率(%)3.80~21.44.00~64.34.20~117.94.40~2517.94.60~3222.94.80~2719.35.00~1712.15.20~139.35.40~42.95.60~21.45.80~10.72.频数分布的类型对称分布:以频数最多组段为中心,左右大体对称偏态分布右偏态分布或正偏态分布:频数向右侧拖尾左偏态分布或负偏态分布:频数向左侧拖尾3.平均数的种类和适用情况

描述一组计量数据的平均水平均数(mean):对称分布,特别是正态分布。中位数(median):各种分布类型的计量数据,尤其是偏态分布资料和一端或两端无确切数值的资料。几何均数(geometricmean):反映一组呈倍数关系的观察值的平均水平,如抗体滴度。

4.离散程度的指标和适用情况

描述一组计量数据的离散程度(偏离中心位置的程度)标准差:适用于正态分布资料,常与均数结合使用。四分位数间距:适用于偏态分布资料,常与中位数结合使用。M(P25,P75)变异系数:常用于比较度量衡单位不同的多组资料的变异度均数相差悬殊的多组资料的变异度极差:适用于任何分布的计量资料。(Min,Max)5.正态分布的概念正态分布

频数分布是中间(靠近均数)频数多,两边频数少,两边频数少,且左右对称。正态曲线呈钟型:两头低中间高,左右对称6.正态分布的两个参数位置参数:m形态参数:s。s越小,曲线越陡峭;反之,s越大,曲线越平坦。

7.正态曲线下面积的分布规律(

-1.96

,

+1.96

)的面积占总面积的95.00%(

-2.58

,

+2.58

)的面积占总面积的99.00%8.标准正态分布正态分布是一个分布族,对应于不同的参数m和s会产生不同位置不同形状的正态分布。为了方便使用,令这样可将所有不同均数和标准差的资料都转换为均数为0,标准差为1的分布,即标准正态分布。

9.医学参考值范围指正常人的解剖、生理、生化、免疫及组织代谢产物的含量等各种数据的波动范围。计算方法有正态分布法和百分位数法。11.参考值范围的确定方法:正态近似法,百分位数法95%参考值(正常值)范围

正态近似法

百分位数法双侧

±1.96sP2.5~P97.5单侧下限-1.64s>P5单侧上限+1.64s<P95例1(双侧参考值范围)由例2-1资料估计正常成年女子血清总胆固醇的参考值范围。已知均数为4.03mmol/L,标准差为0.659mmol/L。下限:4.03–1.96×0.659=2.47(mmol/L)上限:4.03+1.96×0.659=5.32(mmol/L)故正常成年女子血清总胆固醇的95%参考值范围为(2.47,5.32)mmol/L。

例2(单侧上限参考值范围)例2-17测得某年某地名正常人的尿汞值如表2-8,试制定正常人尿汞值的参考值范围。该地正常人的尿汞值的95%医学参考值范围为0~43.6(g/L)。例3(单侧下限参考值范围)某地调查110名健康成年男性的第一秒肺通气量的均数为4.2(L),标准差为0.7(L)。请据此估计该地成年男子第一秒肺通气量的95%参考值范围。下限为:4.2-1.64×0.7=3.05(L)该地成年男性的第一秒肺通气量95%参考值范围为:不低于3.05(L)。

第三章总体均数的估计与假设检验均数的抽样误差与标准误样本均数的抽样分布t分

念t界值表的使用总体均数95%可信区间的涵义均数的可信区间与参考值范围的区别均数的标准差与标准误的区别假设检验的基本原理假设检验的基本步骤统计推断结论P值的含义单样本t检验配对样本t检验两独立样本t检验假设检验中两类错误P与的区别和联系检验效能(1–

)影响检验效能的4个因素可信区间在统计推断上提供的信息1.均数的抽样误差与标准误抽样误差(samplingerror):由个体变异产生,抽样造成的样本统计量与总体参数的差异,或同一总体的若干样本统计量间的差异。标准误(standarderror):样本均数的标准差,也称均数的标准误,说明均数抽样误差的大小。

2.样本均数的抽样分布从正态总体中随机抽样,样本均数服从正态分布。从偏态总体中随机抽样,当n足够大时,样本均数也服从正态分布。

3.t

分布的概念Z服从标准正态分布;如果用样本标准差估计总体标准差,则不再服从标准正态分布,而命名为t分布

t分布与标准正态分布的联系:

逐渐增大时,t分布逐渐趋近标准正态分布。

4.t界值表的使用t界值:一侧尾部面积为单侧概率;两侧尾部面积之和称为双侧概率。当=9时,查t界值表得t0.05,9=1.833(单侧)t0.05/2,9=2.262(双侧)附表2t分布界值表自由度概率P

单侧:0.050.0250.010.005双侧:0.100.050.020.0116.31412.70631.82163.65722.924.3036.9659.92591.8332.2622.8213.250301.6972.0422.4572.7501001.6601.9842.3642.626

1.6451.9602.3262.5765.总体均数95%可信区间的涵义某地12岁男孩身高均数的95%可信区间为(138.3,141.0)cm。从理论上说,做100次抽样,可计算得100个可信区间,平均有95个可信区间包括了总体均数,只有5个可信区间不包括总体均数。实际工作中,只根据1次抽样的结果计算1个可信区间,该区间包含总体均数的概率为95%。

6.可信区间与参考值范围的区别区别总体均数可信区间参考值范围含义按预先给定的概率95%,确定包含未知总体均数的可能范围。95%“正常人”的解剖、生理、生化某项指标的波动范围。计算公式用途总体均数的区间估计判定正常和异常的参考标准7.标准差与标准误的区别区别标准差标准误含义反映一组观察值的离散程度。标准差越小,说明离散程度越小,均数代表性越好;样本例数越大,标准差越趋于稳定。反映均数抽样误差的大小。标准误越小,说明样本均数与总体均数越接近;样本例数越大,标准误越小。计算公式8.t检验的用途、适用条件和种类用途:单样本、配对、两样本均数的比较适用条件样本取自正态分布两样本t检验要求两总体方差相等(如方差不齐可选用近似t检验,即t′检验)种类两样本t检验配对样本t检验单样本t检验9.假设检验的基本原理例3-7为研究阿卡波糖胶囊的降血糖效果,某医院用40名II型糖尿病病人进行随机对照试验。病人被随机等分到对照组(拜唐苹胶囊)和试验组(阿卡波糖胶囊),分别测得试验开始前和8周时的空腹血糖,算得空腹血糖下降值,对照组和试验组的血糖下降均数分别为2.6和2.0(mmol/L)。能否认为该拜唐苹胶囊与阿卡波糖胶囊对空腹血糖的降糖效果不同?

两样本均数不等,可能由两种原因所致H0:

1=

2,两总体均数相等,观察到的差别仅由抽样误差所致。H1:

0,观察到的差别由两总体均数不等所致。

在无效假设H0成立的情况下,观察到的差别仅由抽样误差所致。如果由抽样误差所致的可能性(P值)很小,小于0.05,则拒绝H0,接受H1。

10.假设检验的基本步骤建立检验假设,确定检验水准选定检验方法,计算统计量确定P值,作出推断结论11.统计推断结论当P≤时,拒绝H0,接受H1,认为(样本间观察到的)差异有统计学意义;可认为……(总体间)不同或不等。当P

时,不拒绝H0,认为差异无统计学意义。还不能认为……不同或不等。差异的统计学意义和实际意义(或临床意义):如某新药确实能比常规药物平均降低血压多2mmHg,但2mmHg的差别并没有临床意义。

12.P值的含义?P值是当H0成立时,从规定的总体中,随机抽得等于或比检验统计量(如t值)更极端情况的概率。这些极端情况通常随机出现在分布的任何一端。简单地说,P值是任何观察到的差别由机会造成的可能性。

13.配对样本t检验配对设计:两个同质受试对象分别接受两种不同的处理同一受试对象分别接受两种不同的处理同一受试对象处理前后14.两样本t

检验分别从两个研究总体中随机抽取样本,然后比较两组的平均效应;随机抽取实验对象,将其随机分成两组,分别接受两种不同处理,然后比较两组的平均效应。

15.假设检验中两类错误I型错误():拒绝实际上成立的H0的概率II型错误():不拒绝实际上不成立的H0的概率。

检验效能(powerofatest,1–

):拒绝实际上不成立的H0的概率。两总体确有差异,按规定检验水准能发现该差异的能力。

16.P与的区别和联系?区别:P值是拒绝无效假设时,实际犯I型错误的概率;是预先规定的允许犯I型错误的最大概率。联系:当拒绝H0时,P与

都与I型错误有关。

17.假设检验应注意的问题研究设计:组间应均衡。应用条件:如t检验的应用条件为:当样本含量较小时(n<60)样本随机取自正态总体,两小样本均数比较时还要求两样本所对应的两总体方差相等。正

解“显

性”的含义:并不指差异的大小,只反应总体参数间是否有差异。作结

化:写出具体的P值。

18.假设检验与可信区间的区别假设检验:用于推断两总体均数是否不等可信区间:可提示差别有无实际的专业意义第四章多个样本均数的方差分析方差分析用途、种类和应用条件完全随机设计随机区组设计完全随机设计的方差分析随机区组设计的方差分析多个样本均数间的两两比较为什么不能用t检验进行多重比较?1.方差分析用途、种类和应用条件用途:三个及以上样本均数的比较种类完全随机设计的方差分析随机区组设计的方差分析应用条件各样本相互独立各样本来自的总体呈正态分布各样本来自的总体方差相等2.完全随机设计

Completelyrandomdesign将受试对象随机分配到各个处理组或对照组中。当受试对象的同质性较好时。附表15随机数字表(P723)8856532759333572674777345545700818273890097295842949413106704238064518648473316512968817316519690283607586906824641935518594572416920984387622002769852981947810386443599398098438762200276985298194781053440942720041867979684722002035553151514076662684579999903736632208583740136897021779180512595257022207904703281411307995178206533151109646920688077756115081693576224292961183448034683548773342409060……………………………………………………例:设有同性别、体重在一定范围内的健康家兔18只,试完全随机分为3组。

动物编号:按体重从小到大编号。随机数字:从随机数字表的任一行任一列开始,如第10行第1列开始,依次读取2位数作为一个随机数录入于编号下。序号:将随机数从小到大排序后得排序序号,如随机数相同则按先后顺序编号。预先规定:序号1~6者为A组,7~12为B组,13-18者为C组。

18只家兔等分为3组完全随机设计分组结果动物号123456789随机数357622429296118344排序序号51328171811610分组结果ACABCCACB动物号101112131415161718随机数803468354877334240排序序号1541261114397分组结果CABABCABB18只家兔等分为3组完全随机设计分组结果分组动物编号A组137111316B组4912141718C组25681015

3.随机区组设计

Randomizedblockdesign是将受试对象按一定条件(重要的非处理因素)组成区组,每个区组有3个及以上受试对象,再将每一区组的各受试者随机分配到各处理组中去。每个区组中的例数等于处理组的个数。

例:比较A、B.C三种方法治疗乙型脑炎的疗效,将受试者入院时间作为区组因素,即入院时间相邻的3位患者作为一个区组,试分配处理。受试对象30名。

将30个受试对象分成10个区组,即l-3号为第1区组,4-6号为第2区组,余类推。查随机数字表,依次抄录随机数,将随机数按区组排序,序号即为受试者应分入的处理组。

分配结果受试者编号区组号随机数序号受试者编号区组随机数序号112231668832119217609131161186122427821978535203120738162933217532737832284028323223802193151248953104583259352114572269261124481279773135613281046214536229103711551813010613变异用离均差平方和(sumofsquareddeviations,SS)表示:总变异=组间变异+组内变异表6.1糖尿病患者、IGT异常及正常人的载脂蛋白测定结果糖尿病IGT正常人85.7096.00144.00105.20124.50117.00………111.0099.00159.00106.50120.00115.00均数105.45(11)102.39(9)122.80(10)4.完全随机设计的方差分析4.完全随机设计的方差分析用途:检验3组及以上总体均数是否相等。

安慰剂组新药2.4g组新药4.8g组新药7.2g组合计3.532.422.860.894.593.362.281.06…………4.164.021.972.102.592.311.683.17ni30303030120(n)3.432.722.701.972.70()表4-34个处理组低密度脂蛋白测量值(mmol/L)变异用离均差平方和(sumofsquareddeviations,SS)表示:总变异=组间变异+组内变异全部实验结果存在三种不同的变异总变异:全部实验数据大小不等。组间变异:各处理组的样本均数大小不等组内变异:各处理组内部观察值大小不等

将变异用均方(Meansquare),即方差表示:组间均方(MS组间)、组内均方(MS组内)F=MS组间/MS组内若H0成立(H0:m1=m2=

=mk),则组间变异与组内变异仅由随机误差引起,F值接近1。若H0不成立

,组间变异由处理因素和随机误差共同引起,F值明显大于1。

5.随机区组设计的方差分析先将全部实验单位按一定特征分为若干个区组(block),然后按区组随机分配每个实验单位接受处理因素某一水平的处理。

不同药物作用后小白鼠肉瘤重量(g)不同药物作用后小白鼠肉瘤重量(g)不同药物作用后小白鼠肉瘤重量(g)不同药物作用后小白鼠肉瘤重量(g)不同药物作用后小白鼠肉瘤重量(g)不同药物作用后小白鼠肉瘤重量(g)不同药物作用后小白鼠肉瘤重量(g)不同药物作用后小白鼠肉瘤重量(g)不同药物作用后小白鼠肉瘤重量(g)不同药物作用后小白鼠肉瘤重量(g)不同药物作用后小白鼠肉瘤重量(g)不同药物作用后小白鼠肉瘤重量(g)不同药物作用后小白鼠肉瘤重量(g)不同药物作用后小白鼠肉瘤重量(g)不同药物作用后小白鼠肉瘤重量(g)不同药物作用后小白鼠肉瘤重量(g)不同药物作用后小白鼠肉瘤重量(g)不同药物作用后小白鼠肉瘤重量(g)不同药物作用后小白鼠肉瘤重量(g)不同药物作用后小白鼠肉瘤重量(g)不同药物作用后小白鼠肉瘤重量(g)不同药物作用后小白鼠肉瘤重量(g)不同药物作用后小白鼠肉瘤重量(g)不同药物作用后小白鼠肉瘤重量(g)不同药物作用后小白鼠肉瘤重量(g)不同药物作用后小白鼠肉瘤重量(g)不同药物作用后小白鼠肉瘤重量(g)不同药物作用后小白鼠肉瘤重量(g)不同药物作用后小白鼠肉瘤重量(g)不同药物作用后小白鼠肉瘤重量(g)不同药物作用后小白鼠肉瘤重量(g)不同药物作用后小白鼠肉瘤重量(g)不同药物作用后小白鼠肉瘤重量(g)不同药物作用后小白鼠肉瘤重量(g)不同药物作用后小白鼠肉瘤重量(g)不同药物作用后小白鼠肉瘤重量(g)SS总=SS处理+SS区组+SS误差F处理=MS处理/MS误差F区组=MS区组/MS误差6.多个样本均数间的两两比较多个样本均数每两个均数间的两两比较常用的统计方法是:SNK(组数多少均可)Bonferroni(组数少,4组以内),Tukey(组数多,5组以上),Tamhane’sT2(方差不齐,结论较保守)。多个实验组与一个对照组均数间的两两比较常用的统计方法是Dunnett-t。

MultipleComparisons第五章计数资料的统计描述相对数的概念常用相对数的种类率构成比相对比应用相对数的注意事项率的标准化1.

相对数的概念绝对数:实际发生的数,反映事物的实际水平,是

统计分析的基础。缺点是不具有可比性。相对数:是两个有关联的数值之比,说明事物的相对关系和相对大小。使需要相比较的数值处于同一起点上,便于比较。

两种药物治疗脑血管疾病的疗效组别有效例数治疗例数有效率(%)

甲药455090.0

乙药9013069.22.

常用相对数的种类率:说明某现象发生的频率构成比:表示事物的内部构成相对比:说明两指标间的比例关系3.率(rate)定义:说明某现象发生的频率或强度。是两个绝对数之比,分子是分母的一部分,与观察时间的长短有关系。公式:

比例基数:%、‰、1/10万比例基数的选择:习惯用法;保留1~2位整数

发病率:一般用于急性病调查例:某村2000年急性甲肝流行,1000人中有50人发病,则:

甲肝发病率=50/1000×100%=5%4.构成比(proportion)定义:表示事物内部某一部分的个体数与各部分个体数的总和之比。分子是分母的一部分,与观察时间的长短无关系。

公式:

某一组成部分的观察单位数

构成比=×100%

同一事物各部分的观察单位总数

构成比的两个特点同一事物的k个构成比之和为100%各构成部分之间相互影响某部分自身数值的变化其它部分数值的变化

患病率:被习惯说成“率”,但实际上是比。一般用于慢性病调查。例:2014年某工厂职工体检,1000名受检者中患高血压的有100人,则:

高血压患病率=100/1000×100%=10%5.相对比

(ratio)定义:两个有关指标之比,说明两指标间的比例关系。常用倍数或百分数表示。两个指标的量纲可以相同,也可以不同,但互不包含。

公式:

甲指标

相对比=(或×100%)

乙指标计算相对比的两个指标可以是绝对数、相对数、平均数。

举例:性别比:男性人口数:女性人口数(量纲相同)2010年中国总人口性别比为105.2:1002012年中国出生人口性别比为117.7:100某城区与郊区肺癌死亡率之比(量纲相同):

城区为19.39/10万,郊区为9.99/10万,则19.39/9.99=1.94或9.99/19.39×100%=55.52%医院的门诊人次与床位数之比(量纲不相同):

三级甲等医院一般应达到4~6:1变异系数=标准差/均数体重指数=体重(kg)/身高(m)26.应用相对数的注意事项不要把构成比与率相混淆计算相对数应有足够数量要注意资料的可比性。除了要对比的因素外,其他条件应基本相同,如年龄、性别构成是否均衡。对比不同时期资料应注意客观条件是否相同,如疾病报告制度完善、就诊机会增加、诊断技术提高,也会引起发病率"升高”。对样本率或构成比的比较,应作假设检验表5-2已婚育龄妇女不同情况下放环失败率的比较放环情况放环人数失败人数失败人数比失败率(%)人工流产后

255

78

61.9

30.6月经后

87

39

31.0

44.8哺乳期

17

9

7.1

52.9合计

359

126

100.0

35.17.率的标准化

甲、乙两种疗法治疗某病的治愈率比较病型甲疗法乙疗法病人数治愈数治愈率(%)病人数治愈数治愈率(%)普通型30018060.0100

6565.0重型100

3535.030012541.7合计40021553.840019047.5直接法计算标准化治愈率标准组病人甲疗法乙疗法病型标准治疗例数标准人口构成原治愈率(%)分配治愈率(%)原治愈率(%)分配治愈率(%)

(1)=甲法+乙法(2)(3)(4)=(2)(3)(5)(6)=(2)(5)普通型4000.560.030.065.032.5重型4000.535.517.541.720.9合计8001.053.847.5(p')47.553.4(p')甲、乙两法的合计病型例数作为标准人口,即普通型300+100=400

重型100+300=400样本率的比较有必要计算标准化率吗?

标准化率一般用于比较两个构成不同的总体率率的标准误、总体率的区间估计

(第六章

二项分布与Poisson分布的内容)

1.二项分布的概念在医学领域的许多试验或观察中,其结果只有相互对立的一种情况之一。如阳性或阴性,生存或死亡。这时若从阳性率为的总体中随机抽取大小为n的样本,当每次试验的"阳性”概率保持不变时,出现"阳性”次数X=0,1,2,…,n的概率分布即呈二项分布。

2.二项分布的适用条件各次实验独立,即一次实验出现什么样的结果与前面已出现的结果无关。每次实验结果,出现两种互斥的结果之一(A或非A)。每次实验的条件不变,即A发生的概率不变。已知发生某一结果(如阳性)的概率为,其对立结果的概率则为1-

是从大量观察中获得的比较稳定的数值。

3.率的标准误样本率的标准差也称为率的标准误若总体率不知,用样本率作为总体率的估计值,则率的标准误的估计值:例:率的抽样误差的计算某镇按人口的1/20随机抽取329人,作血清登革热血凝抑制抗体反应检验,结果29人阳性。求此阳性率的抽样误差。已知:n=329,p=29/329=0.08814.总体率的区间估计(正态近似法)条件:n较大(如>50),np与n(1-p)均≥5,样本率分布近似正态。公式:p±u

Sp,p样本率,Sp率的标准误。例

求人群血清登革热血凝抑制抗体阳性率的95%可信区间(已知n=329,p=0.0881,Sp=0.0156)。np=329×0.0881=28.98p±u

Sp=(0.0881-1.96×0.0156,0.0881+1.96×0.0156)=(0.0575,0.1187)该镇人群登格热血凝抑制抗体阳性率的95%可信区间为5.75%~11.87%。

第七章

2检验

Chi-squaretest

2检验的主要用途行×列表

2检验时的注意事项多个样本率比较的

2分割法1.2检验的主要用途

(chi-squareTest)推断两个或两个以上的总体率(或构成比)之间有无差别,两个分类变量之间有无关联。

(1)两个样本率比较例7-1某院欲比较异梨醇口服液(试验组)和氢氯噻嗪+地塞米松(对照组)降低颅内压的疗效。将200例颅内压增高症患者随机分为两组。问两组降低颅内压的总体有效率有无差别?

表7-1两组降低颅内压有效率的比较组别有效无效合计有效率(%)试验组99510495.20对照组75219678.18合计1742620087.00四格表

2检验的条件与SPSS结果基本公式:专用公式:

应用条件:n≥40,T≥5。SPSS输出结果选择:Pearson’sChi-Square。

校正公式:

应用条件:n≥40,1≤T<5。SPSS输出结果选择:ContinuityCorrection。如n<40,或T<1,选用确切概率法。SPSS输出结果选择:Fisher’sExactTest。

(2)配对四格表资料的2检验例7-3某实验室分别用乳胶凝集法和免疫荧光法对58名可疑系统红斑狼疮患者血清中抗核抗体进行测定,结果见表7-3。问两种方法的检测结果有无差别?表7-3两种方法的检测结果

免疫荧光法乳胶凝集法合计+-+11(a)12(b)23-2(c)33(d)35合计134558免疫:23/58=0.397乳胶:13/58=0.224(3)多个样本率比较例7-6某医师研究物理疗法、药物治疗和外用膏药三种疗法治疗周围性面神经麻痹的疗效。问三种疗法的有效率有无差别?(3个样本)表7-6三种疗法有效率的比较

疗法有效无效合计有效率(%)物理疗法组199720696.60药物治疗组1641818290.11外用膏药组1182614481.94合计4815153290.41(4)样本构成比的比较例7-7某医师在研究血管紧张素I转化酶(ACE)基因I/D多态与Ⅱ型糖尿病肾病(DN)的关系时,将249例Ⅱ型糖尿病患者按有无糖尿病肾病分为两组,资料见表7-9。问两组Ⅱ型糖尿病患者的ACE基因型(无序分类)分布有无差别(两个样本)?表7-9DN组与无DN组Ⅱ型糖尿病患者ACE基因型分布的比较

组别DDIDII合计DN组42(37.8)48(43.3)21(18.9)111无DN组30(21.7)72(52.2)36(26.1)138合计72(28.9)120(48.2)57(22.9)249(5)双向无序分类资料的关联性检验例7-8测得某地5801人的ABO血型和MN血型结果如表7-10,问两种血型系统之间是否有关联?(1个样本)表7-10某地5801人的血型ABO血型MN血型MNMN合计A4314909021823B3884108001598AB4955879502032合计137179323482.行×列表

2检验时的注意事项当有1/5及以上格子的理论频数1≤T<5,或有格子T<1时,应该与相邻组合并,但要合理;删除相应的行或列;增加样本例数;选用Fisher’sExactTest。适合:双向无序分类资料;对于单向有序分类资料,要求有序变量为分组变量。单向有序行列表,当等级数大于3时,用秩和检验分析更适宜;双向有序分类资料可选用等级相关。结论为拒绝H0,不能说明任两个总体之间皆有差别。进一步的两两比较,可用多个样本率比较的2分割法。

正常人和铅作业工人尿棕色素检查结果"单向有序行列表”,但分组变量无序,适合用"秩和检验”200例棉屑沉着可疑患者的诊断结果第一人检查第二人检查合计正常I期II期正常78

5

083I期

6561375II期

0103242合计847145200“双向有序行列表”,行和列的指标相同,两种方法或两个检查者同时对同一批样品的测定结果,宜用一致性检验(Kappa检验)。

一致性检验(Kappa检验)Kappa值=0.737,P=0.000

可认为两次检查结果存在一致性"双向有序行列表”,行和列的指标不相同,分析两有序分类变量之间是否存在相关关系,宜用等级相关分析。

表7-13年龄与冠状动脉硬化的关系年龄(岁)(X)冠状动脉硬化等级(y)—++++++合计20~7022429830~2724936340~162313759≥50920151458合计1228941262783.多个样本率比较的

2分割法当多个样本率比较的行×列表检验,推断结论为拒绝H0接受H1时,只能

认为各总体率之间总的来说有差别,但不能说明任两个总体率之间有差别。若要对两个总体率之间做出有无差别的推断,需进一步分析。分析方法:多个样本率比较的2分割法。

第八章秩转换的非参数检验秩和检验的适用情况秩和检验的常用种类2.秩和检验的适用情况等级资料明显的偏态分布个别数据偏离过大3.秩和检验的常用种类配对样本比较的符号秩和检验两个独立样本比较的秩和检验完全随机设计多个样本比较的Kruskal-WallisH检验多个相关样本比较的FriedmanM

检验第九章双变量回归与相关双变量回归与相关的用途线性回归的基本概念线性回归方程的形式线性回归方程的应用线性回归方程的假设检验线性相关的基本概念相关系数的意义线性相关系数的假设检验进行线性相关分析的注意事项线性相关与回归的区别线线回归与相关的联系线性回归或相关应用的注意事项等级相关1.双变量回归与相关的用途

研究两个数值变量间的数量关系回归分析:两个数值变量的线性依存关系相关分析:两个数值变量的直线相关关系2.线性回归的基本概念当一个变量X改变时,另一个变量Y也相应改变:称X为自变量(independentvariable)称Y为应变量(dependentvariable)当这两个变量之间存在直线关系时,可以用一个直线方程Y=a+bX表示Y与X的线性关系。

3.线性回归方程的形式a为常数项(constant),是直线的截距;b为回归系数(regressioncoefficient),是直线的斜率。它的统计学意义是:X每增(减)一个单位,Y平均改变b个单位。

为给定X时Y的估计值

4.线性回归方程的应用确定两变量间是否存在依存关系,利用回归方程描述X和Y之间的数量关系利用回归方程对Y进行估计:由易测变量估计难测变量,如由体重估计体表面积。

5.线性回归方程的假设检验

即使X、Y的总体回归系数β为零,但由于抽样误差,其样本回归系数b也不一定为零,因此需作β是否为零的假设检验。只有β

0,所拟合的样本直线回归方程才有意义。

6.线性相关的基本概念如不要求由X估计Y,而关心的是两个变量间是否确有线性相关关系,如有线性相关关系,那么相关的方向和程度如何?资料要求:X、Y均服从正态分布线性相关系数示意图7.相关系数的意义用r表示。描述两个变量直线相关的方向和紧密程度。r的取值范围:-1≤r≤1。r>0为正相关r<0为负相关|r|愈接近1,说明两变量关系愈密切。总体相关系数用ρ表示8.线性相关系数的假设检验即使X、Y的总体相关系数ρ为零,但由于抽样误差,其样本相关系数r也不一定为零,因此需作ρ是否为零的假设检验。

例如:r=0.621,n=6,P=0.10根据r进行总体相关系数

是否为0的假设检验。

9.线性相关与回归的区别资料要求:回归要求应变量Y服从正态分布,自变量X可以选定,也可以服从正态分布;相关要求两个变量都服从正态分布。两个变量之间的关系:线性相关表示两个变量之间的相互关系是双向的回归则反映两个变量之间的依存关系,是单向的。b和r意义:b表示X每增(减)一个单位,Y平均改变b个单位r说明具有直线关系的两个变量间相关关系的密切程度与相关方向。

10.线性回归与相关的联系b和r的正负号一致,假设检验等价(tr=tb)相关回归可以互相解释

决定系数(Coefficientofdetermination):自变量X可以解释应变量Y变异性的百分比。R2=r2=SS回/SS总

如r=0.40,n=38,P=0.01;r2=0.402=0.16,说明自变量X可以解释应变量Y变异性的16%。

12.线性回归或相关分析应用的注意事项作回归或相关分析要有实际意义应先绘制散点图分析两个数值变量相关的密切程度和方向,用线性相关分析,要求X和Y服从双变量正态分布;分析两个数值变量的依存关系,可以用精确测量的自变量X去估计应变量Y,用线性相关分析。对样本回归系数或相关系数应进行假设检验直线回归方程的实用范围一般以自变量的取值范围为限,应避免外延。回归关系不一定是因果关系13.等级相关

rankcorrelation,

其中Spearmancorrelation最常用应用条件:X和Y都为随机变量,但不服从双变量正态分布(如相对数、等级变量)。

第十章统计表与统计图统计表的结构统计表的种类编制统计表的基本要求统计表的绘制常用统计图的用途及绘制要点最常用的几种统计图

1.统计表的结构标题:表号(1或1-1)、内容、表格上方(居中)标目:

横标目:对研究对象分组的变量,位于表的左侧,向右说明各行数字涵义。

纵标目:统计指标,位于表的右侧,向下说明各列数字涵义。

线条:至少3条线,顶线和底线较粗,无竖线和斜线。数字:同指标小数位对齐,缺数据用“…”,无数据用“-”表示。备注:如有必要,在表格下方说明。

表1两种软膏治疗颜面单纯疱疹患者的疗效比较组别例数治愈数治愈率(%)治愈天数()喷昔洛韦软膏1079386.95.7±1.3阿昔洛韦软膏997777.86.4±1.22.统计表的种类简单表:研究对象仅按1个变量分组(分类变量的不同类别,如研究对象只按性别分组;或连续变量的不同水平,如研究对象只按年龄组分组)

组合表:研究对象按2个及以上变量分组,如研究对象按病型和疗法分组。一般把其中主要的或分项较多的变量作为横标目,其余变量安排在纵标目。

表4甲、乙两种疗法治疗某病的治愈率比较病型甲疗法乙疗法病人数治愈数治愈率(%)病人数治愈数治愈率(%)普通型30018060.01006565.0重型1003535.030012541.7合计40021553.840019047.53.常用统计图的用途及绘制要点条图(barchart):比较不同类别某统计指标的数值大小线图(linechart):描述某统计量随另一数值变量的变化趋势。直方图(histogram):显示频数分布误差条图(errorbar):显示95%CI箱图(boxplot):显示离群值构成图:圆图(piechart):显示构成比散点图(scatterplot):回归、相关时用4.最常用的几种统计图图12007年中国城乡居民主要疾病死亡率(1/10万)第二篇高级统计方法第十一章多因素试验资料的方差分析

析因设计的方差分析第十二章重复测量设计资料的方差分析第十五章多元线性回归第十六章logistic回归分析第十九章生存分析第十一章析因设计的方差分析欲观察甲、乙两药治疗高血脂的疗效,以及甲乙两药疗效有无交互作用,研究者将甲药和乙药均定为“不用”和“用”两个水平,有4种试验组合(4种处理,每种处理都使用一般疗法):(1)A药和B药均不用(2)A药(3)B药(4)A药+B药接受四种不同疗法患者血清胆固醇下降值(mg/dl)A药和B药均不用A药B药A药+B药9202146111228526101739792347162214401718381214224651512338.2512.3820.2543.132×2析因设计的方差分析可以安排2个处理因素,每个处理因素分为2个水平,总共有4种组合。每个测量值来自不同个体,彼此独立。分析两个处理因素的主效应和交互作用。如:A.B两药合用有协同降血脂作用

(F=24.08,P<0.001)。

第十二章重复测量设计的方差分析

“球对称”假设成立(P=0.178),可选择SphericityAssumed法处理在受试者间随机分配同一受试者的多次测量结果可能高度相关

不同麻醉诱导时相间的收缩压均数存在差别(F=106.56,P<0.001);不同诱导方法患者收缩压均数的差别随时相改变(F=19.10,P<0.001),其中A组不同诱导时相的收缩压较为稳定(见图)。

不同麻醉诱导方法患者收缩压均数的差异有统计学意义(F=5.78,P=0.017)。

第十五章多元线性回归

:应变量的估计值X1,X2,…,Xk为k个自变量b0:常数项b1,b2,…,bk为偏回归系数(partialregressioncoefficient)的估计值,它表示在其它自变量保持不变的情况下,Xj增加或减少一个单位时,Y的平均改变量。

例题:27名糖尿病人的血糖及

有关变量的测定结果序号i总胆固醇甘油三酯胰岛素糖化血红血糖(mmol/L)X1(mmol/L)X2(U/ml)X3蛋白(%)X4(mmol/L)Y15.681.904.538.211.223.791.647.326.98.836.023.566.9510.812.3……………2511.5410.891.2010.520.0265.840.928.616.413.3273.841.206.459.610.4SPSS筛选变量的方法向前引入法:回归方程由一个自变量开始,每次引入一个对因变量作用最大,且具有统计学意义的自变量,直到不能引入为止。向后剔除法:先建立一个包含全部自变量的回归方程,然后每次剔除一个对因变量作用最小且无统计学意义的自变量,直到不能剔除为止。逐步筛选法:取两种方法的优点,在向前引入每一个新变量之后,都要重新对前面已选入的自变量进行检查,以评价其有无继续保留在方程中的价值Enter(

强迫引入法,默认选择项):定义的全部自变量均被引入方程

检验水准由于多元线性回归方程多用于因素筛选,因此不必对检验水准规定得很严格,可以选择几个水平如0.05.0.10甚至0.15,以分析不同检验水准下的自变量与应变量之间的依存关系。

多元线性回归对资料的要求应变量Y为连续变量,自变量Xi相互独立,可以是任意资料类型。残差近似正态分布。对无序多项分类的自变量,不能用1,2,3等进行有序量化,必须采用k-1个哑变量赋值。如治疗原发性高血压有西医、中西医结合及中医三种不同的疗法,可以用两个哑变量X1.X2表示:西医(X1);中西医结合(X2)

;中医(参照)X1X2

西医:10

中西医结合01

中医:00SPSS结果解释小结:用多元线性回归的逐步回归法筛选血糖的影响因素,引入和剔除变量的检验水准分别为0.10和0.15。结果显示:糖化血红蛋白和甘油三酯对血糖有升高作用,而胰岛素对血糖有降低作用。决定系数R2=0.598,即血糖变异的60%可由糖化血红蛋白、甘油三酯和胰岛素的变化来解释。标准化回归系数显示糖化血红蛋白对血糖的影响的最大。

第十六章logistic回归分析logistic回归是研究二分类观察结果与影响因素之间关系的一种多变量方法。对资料的基本要求:Y取值:0,1;X1,X2,X3,…,Xm的取值:计数、等级和计量资料。无序多分类必须转换成哑变量。回归系数βj的流行病学意义:假定其它因素水平相同时,自变量Xj的暴露剂量每改变一个单位,所引起的比值比的自然对数改变量。OR值(oddsratio,优势比):度量影响因素X与二分类观察结果Y的关联。

SPSS结果解释表1肾细胞癌转移的多因素logistic回归分析影响因素ORP95%CI肾细胞血管内皮生长因子11.170.0441.07~116.44肾癌细胞核组织学分级8.140.0540.97~68.62注:肾细胞血管内皮生长因子分3个等级,肾癌细胞核组织学分4个等级

多因素logistic回归结果:用似然比前进法筛选影响肾细胞癌转移的独立因素并估计OR值,检验水准=0.05。肾细胞血管内皮生长因子表达等级(OR=11.17;95%CI:1.07,116.45)和肾癌细胞核组织学分级(OR=8.14;95%CI:0.97,68.62)是肾细胞癌转移的独立危险因素。

第十九章生存分析两组儿童横纹肌肉瘤治疗后复发时间

(月数,“+”表示未复发)两组儿童横纹肌肉瘤治疗后复发时间

(月数,“+”表示未复发)两组儿童横纹肌肉瘤治疗后复发时间

(月数,“+”表示未复发)两组儿童横纹肌肉瘤治疗后复发时间

(月数,“+”表示未复发)两组儿童横纹肌肉瘤治疗后复发时间

(月数,“+”表示未复发)两组儿童横纹肌肉瘤治疗后复发时间

(月数,“+”表示未复发)两组儿童横纹肌肉瘤治疗后复发时间

(月数,“+”表示未复发)两组儿童横纹肌肉瘤治疗后复发时间

(月数,“+”表示未复发)两组儿童横纹肌肉瘤治疗后复发时间

(月数,“+”表示未复发)两组儿童横纹肌肉瘤治疗后复发时间

(月数,“+”表示未复发)两组儿童横纹肌肉瘤治疗后复发时间

(月数,“+”表示未复发)两组儿童横纹肌肉瘤治疗后复发时间

(月数,“+”表示未复发)两组儿童横纹肌肉瘤治疗后复发时间

(月数,“+”表示未复发)两组儿童横纹肌肉瘤治疗后复发时间

(月数,“+”表示未复发)两组儿童横纹肌肉瘤治疗后复发时间

(月数,“+”表示未复发)两组儿童横纹肌肉瘤治疗后复发时间

(月数,“+”表示未复发)两组儿童横纹肌肉瘤治疗后复发时间

(月数,“+”表示未复发)两组儿童横纹肌肉瘤治疗后复发时间

(月数,“+”表示未复发)两组儿童横纹肌肉瘤治疗后复发时间

(月数,“+”表示未复发)两组儿童横纹肌肉瘤治疗后复发时间

(月数,“+”表示未复发)两组儿童横纹肌肉瘤治疗后复发时间

(月数,“+”表示未复发)两组儿童横纹肌肉瘤治疗后复发时间

(月数,“+”表示未复发)两组儿童横纹肌肉瘤治疗后复发时间

(月数,“+”表示未复发)两组儿童横纹肌肉瘤治疗后复发时间

(月数,“+”表示未复发)两组儿童横纹肌肉瘤治疗后复发时间

(月数,“+”表示未复发)两组儿童横纹肌肉瘤治疗后复发时间

(月数,“+”表示未复发)两组儿童横纹肌肉瘤治疗后复发时间

(月数,“+”表示未复发)两组儿童横纹肌肉瘤治疗后复发时间

(月数,“+”表示未复发)两组儿童横纹肌肉瘤治疗后复发时间

(月数,“+”表示未复发)两组儿童横纹肌肉瘤治疗后复发时间

(月数,“+”表示未复发)两组儿童横纹肌肉瘤治疗后复发时间

(月数,“+”表示未复发)两组儿童横纹肌肉瘤治疗后复发时间

(月数,“+”表示未复发)两组儿童横纹肌肉瘤治疗后复发时间

(月数,“+”表示未复发)两组儿童横纹肌肉

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论