版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
中医药统计学与软件应用笔记重点绪论统计学家C.R.劳先生在《统计与真理——怎样运用偶然性》中指出:在终极的分析中,一切知识都是历史;在抽象的意义下,一切科学都是数学;在理性的基础上,所有的判断都是统计学。一、统计学的概念、发展简史及主要内容1.统计学:是以概率论和数理统计为基础,对研究对象的数据进行搜集、整理和分析,揭示事物总体特征和规律的方法论科学。2.中医统计学:是以概率论和数理统计的原理和方法为基础,以中医理论与实践为主体,通过对数据的搜集、整理和分析,达到探讨中医理论与方法内在规律的目的。3.统计学的发展趋势:①依赖数学。②与计算机技术结合。③与实质性学科、统计软件、现代信息相结合,所发挥的功效日益增强。④从描述事物现状、反映事物规律,向抽样推断、预测未来变化方向发展。4.统计学的主要内容⑴研究设计:专业设计、统计学设计⑶统计描述:统计指标、统计图表
⑵统计学的基本概念、原理和思维方法⑷统计推断:参数估计、假设检验二、统计工作的基本步骤和特点1.统计工作的基本步骤(1)统计学设计(2)搜集资料:①常规保存的记录;②现场调查记录;③实验/试验记录;④医学文献/网络信息。3)整理资料:①检查;②审核;③计算机检查;④分组。4)分析资料2.统计学认识现象的特点1)数量性:(2)群体性:(3)具体性:(4)概率性:三、统计学中常用的概念1.总体(population):是根据研究目的确定的同质观察单位的集合。例①河北省③河北省
18岁男性的身高和体重分布 ②某性红地18岁身高在 170-175cm男性的体重分布
2005年健康成年男细胞数⑴有限总体:指总体限定于特定的空间、时间范围内有限个观察单位。⑵无限总体:指没有空间和时间范围限制的总体 。2.样本(sample):从总体中随机抽取的有代表性的一部分观察单位的集合。样本的可靠性:指总体确定后,样本中的每一个观察单位确属预先规定的同质总体。样本的代表性:即样本能够充分反映总体的真实情况。3.随机(random):即在抽样、分组、安排试验顺序时,让总体中每个受试者或观察单位都有同等的机会被抽中、 被分配或被安排,而不受研究者的主观意愿驱使。不能将随机理解为随便。4.事件(event):指事物发生某种情况或在调查、观察和实验中获得的某种结果。⑴确定性事件是可预言在一定条件下必然发生的事件,发生的概率为1。0~1⑵随机事件:指一定条件下可能发生也可能不发生的不确定性事件,发生的概率介于之间。⑶模糊事件:事物本身的含义不确定的现象。5.频率(frequency):对于随机事件A,在相同的条件下进行了n次实验,事件A发生的次数为m,比值m/n为频率,记为fn(A);概率(probability):描述某随机事件A发生的可能性大小,统计符号为P,0≤P≤1,记为P(A)。当n→∝时,频率fn(A)→概率P(A)。P≤0.05或P≤0.01小概率事件:表示某事件发生的可能性很小,在医学研究中,习惯上把的事件称为小概率事件。6.变异(variation):总体中各个体之间的差异性。同质是相对的,研究对象只是在某一方面是性质相同的, 同类的观察对象之间往往也存在着变异。 变异是绝对的、客观存在的。7.误差(error):指测量值与真值之差。⑴过失误差:也叫粗差。观测者粗心大意造成的误差。⑵系统误差:由于仪器未校准、试剂未标定、观测标准未统一等固定原因造成的误差。⑶测量误差:由事先难于预料的实验或观察条件的随机波动造成的误差。⑷抽样误差:由抽样引起的样本指标(统计量)与总体指标(参数)的差别。8.统计量(statistical):是反映样本特征的统计指标。统计符号为小写的英文字母。 如样本均数 x、样本标准差 s、样本率 p等。9.参数(parameter):是描述总体特征的统计指标。统计符号为小写的希腊字母。 如总体均数μ、总体标准差σ、总体率π等。10.统计资料的类型根据研究目的,对研究对象的某些特征进行观测,将这些观测指标或项目称为变量的具体数值 (变量值)构成了统计数据或 统计资料。
变量。统计资料分为两类:⑴ 值变量(numericalvariable):亦称定量资料。是指对每个观察单位用计量方法测得某项数值大小所获得的资料。特点为其变量值大多有度量衡单位,其具体取值通常是正实数 (零、正整数和小数 )。如身高1.75m、体重68kg、血压9.6kPa、血糖6.8mmol/L。⑵分类变量(categorical variable):又称定性资料。指对每个观察单位按某一方面的特征、性质或等级分组计数而得到的资料。特点是变量值表现为互不相容的属性或类别,无度量衡单位。分类变量又可分为两类:① 序分类变量:又称为名义资料。具体取值通常是具有某种属性或特征的个数。特点是可在非数字中取值,各类之间具有性质上的差异。可分为二分变量和多分变量。二分变量是按互不相容的属性分成两类的资料。多分变量是按某种属性或特征分成两类以上的资料。② 序分类变量:亦称等级资料或半定量资料。具体取值也是具有某种属性或特征的个数,但不同取值之间有半定量的关系。特点是其各类别间有等级、 程度或量的差异,即可按数量的相对大小或程度的高低排出顺序。四、学习中医统计学的目的1.顺应中医药学的发展趋势。 2.强化中医科研的计划性和科学性。3.拓宽研究思路。 4.学会正确地运用统计方法和合理地解释统计结果。五、学习中医统计学的注意事项1.理解和领会基本概念和原理,切忌死记硬背。 2.不追究公式的来源和推导,但要掌握其应用条件。3.重视分析问题和解决问题能力的培养。 4.学会使用统计软件。数值变量资料的统计描述统计描述—— 概念:即利用原始数据,选择适宜的统计指标及统计图表,简明准确地探察数据的分布类型和数量特征的基本统计方法。目的:是根据样本中所包含的信息,客观、正确地推论出其总体规律。第一节 频数分布频数:相同观察值或观察结果出现的次数。分布:指随着随机变量取值的变化,其相应的概率变化的规律性。频数分布:观察值(变量值)按大小分组,各个组段内观察值个数 (频数)的分布,是了解数据分布形态特征与规律的基础。一、频数分布的特征1.集中趋势:指一组变量值的集中倾向或中心位置。2.离散趋势:即一组变量值的离散倾向。二、频数分布的类型1.对称分布:指集中位置居中、左右两侧的频数分布基本对称的频数分布。
2.非对称分布: 亦称偏态分布,是集中位置偏倚、两侧频数的分布不对分为正态分布和非正态分布两
称的频 数分布,可分为正种类型。
偏态和负偏态分布。三、频数分布表 /图的作用1.直观地揭示数据的分布类型和特征。2.便于发现资料中某些远离群体的特大或特小的可疑值。3.描述频数分布的集中趋势与离散趋势。4.便于进一步计算统计指标。四、频数表概念:频数分布表的简称。指观察值或某些类别及其相应的频数按一定顺序排列的表格。例题:随机抽取某地120例正常人,测得血清铜的含量(μmol/L)如下表,试编制频数表。13.8412.5313.7014.8917.5313.1918.8214.7317.4413.9914.1012.2912.6114.7814.5914.7118.6219.0410.9513.8110.5313.5611.4813.0716.8817.0417.9812.6711.039.2315.0414.0915.9011.4814.6413.6414.3915.7413.9911.3117.6116.2613.5311.6813.2511.8814.2115.2115.2913.7014.4511.2319.8413.1115.1511.70频数表的编制方法:1.找极值:Xmax=19.84,Xmin=9.232.求全距:R=Xmax-Xmin,R=19.84-9.23=10.613.定组数:K=8~15。4.求组距:i=R/(K–1)(i为组距,k为组段数,R为全距)i=10.61/(11-1)=1.061≈15.确定各组段的上下限:6.归纳计数:某地120名正常成年人血清铜含量频数表组段频数f频率P(%)fCPC(%)9.00~32.532.510.00~43.375.811.00~1210.01915.812.00~1310.83226.613.00~1714.24940.814.00~2218.37159.115.00~1815.08974.116.00~1310.810284.917.00~119.211394.118.00~54.211898.319.00~21.7120100.0合计120100.0五、频数图概念:亦称直方图,是以直方的宽度代表组距,以直方的面积大小表示频数的多少、以直方面积在总面积中的比例表示频率大小的图形。等距分组——以横轴表示变量,以纵轴表示频数。不等距分组——以横轴表示变量,但纵轴是频数除以组距。第二节 数值变量资料集中趋势的描述集中趋势:是度量变量值集中位置和平均水平的数量指标,其代表值为平均数。平均数:是描述一组观测值平均水平的指标, 是对同质基础上的样本或总体一般特征的表达指标。算术平均数、几何平均数、中位数、众数一、算术平均数1.定义:算术平均数简称均数。是一组观察值的和与观察值个数之商。是数量上的平均。用于说明一组观测值的趋中位置或平均水平。 表示样本均数, 表示总体均数。2.适用条件:正态或近似正态分布的资料。如生理指标。3.计算方法:⑴直接法:有 n个观察值,分别为 X1,X2,,, Xn,式中Σ是求和的符号 。例题:10名12岁男孩身高(cm)分别为125.5,126.0,127.0,128.5,147.0,131.0,132.0,141.5,122.5,140.0。求平均数。⑵加权法:用于观察值中相同数据较多或频数表资料。=1737.00/120=14.48(μmol/L)二、几何均数1.定义:n个数值连乘积的n次方根。是比例或倍数上的平均。统计符号G。2.应用条件:等比数列资料。如抗体滴度。3.计算方法:例题:
6份血清抗体滴度为
1:2,1:4,1:8,1:8,1:16,1:32,求平均数。平均滴度为
1:8。三、中位数1.定义:将一组观察值按由小到大的顺序排列, 位次居中的数值即中位数。 是位次上的平均。统计符号M。2.应用条件:不拘分布、分布类型不明或一端无界的资料。 如潜伏期、治愈时间和发病年龄。3.计算方法:n为奇数时
n为偶数时式中 、 及 均为下标,表示有序数列中观察值的位次。例题:某医院用大黄粉治疗胃热血瘀型血证病人 9例,其大便转阴天数分别为3、4、5、7、10,求其中位数。本例n=9,M=X5=3(天)。
1、1、2、2、如果本例 n=10,第10个数值为 16天,则 M=(3+4)/2=3.5(天)。⑵ 数表法用于观察值例数较多或频数表资料。L为M所在组段的下限; i为该组段的组距;f m为该组段的f; n为总例数;ΣfL为小于L的各组段的fC。例题:905例男性银屑病病人的发病年龄年龄频数f累计频数fC累计频率pC(%)<1054545.9710~252306(ΣfL)33.8120~346(fM)65272.0430~12878086.1940~8486495.4750~2989398.6760~589899.23≥707905(n)100.00M=20+(10/346)(905/2-306)=24.23(岁)第三节 数值变量资料的离散趋势描述离散趋势:亦称变异性,是描述一组同质观察值的变异程度大小的指标。 不但反映研究指标数值的稳定性和均匀性,而且反映集中性指标的代表性。极差、四分位数间距、方差、标准差、变异系数。变异指标示意 (两个学生五门成绩分布学生 科 目
)
变异指标1 2 3
4
5
R
S2
S
CVA
78 79
80 81
82 80
4
2.5 1.58
1.98B 60 70 80 90 100 80 40 250 15.81 19.76A、B两个学生五门课程成绩的均数都是 80,但各科成绩分布情况却不相同。A较集中,变异较小;B较分散,变异较大。一、全距(R)概念:亦称极差,是一组观察值中最小值与最大值之差,反映个体差异的范围。R=xmax-xmin优点:1.意义明确、计算简便。 2.稳定性较差。3.受n大小的影响。4.可应用于任何分布。二、百分位数和四分位间距1.百分位数:是把一组观察值从小到大排列,分为 100等份,与x%位次所对的数值即为第百分之x位数。以P x表示。一个Px将全部观察值分为两部分, 理论上有x%的观察值比它小, 有(100-x)%的观察值比它大。是一种位置指标。 M 即P50。2.四分位数间距: 是上四分位数 QU(P75)与下四分位数 QL(P25)之差,符号为 QR。是中间50%观察值的极差。QR=QU-QL=P75-P25用途:⑴常用来描述偏态分布资料分布以及分布的一端或两端无确切数值资料的离散程度。⑶ 表示参考值范围 百分位数的另一个重要用途是表示偏态分布资料的参考值范围。例题:905例男性银屑病病人的发病年龄(同前)计算方法:P25= 10+(10/252)×(905×0.25-54)=16.84(岁)P75=30+(10/128)×(905×0.75-652)=32.09(岁)QR=P75-P25= 32.09-16.84=15.25(岁)三、方差概念:方差即离均差平方和的均值。总体方差的符号为 σ2,样本方差符号为s 2。优点:由于s2利用了每个观察值的信息,反映一批数据变异程度的稳定性和精确性好。缺点:但在运算时需将各个离均差平方,使原度量单位变成平方单位,不便于进行比较。应用条件:要求资料服从正态或近似正态分布。四、标准差概念:方差的平方根。 除了具有方差的优点外,还克服了度量单位被平方的不足, 运用较方便。总体标准差的符号为 σ,样本标准差的符号为s;英文缩写为 SD。例题:学生:n=5,ΣX=78+79+80+81+82=400;ΣX2=782+792+802+812+822=32010学生:n=5,ΣX==400;ΣX2==33000用途:⑴表示正态或近似正态分布的离散程度。 ⑵描述数值变量的频数分布特征 ( ±s)。⑶制定医学参考值范围。⑷与均数结合计算变异系数。⑸与样本含量结合计算标准误。五、变异系数概念:一组观察值的标准差与均数的百分比。是相对离散量,无单位。统计符号 CV用途:⑴比较度量单位不同或均数相差悬殊时几组样本资料的离散性。⑵比较实验指标的稳定性及测定方法的精密度。例题:(1)某单位测得28例成年脾虚病人的红细胞数为3.10土0.86×1012/L;血红蛋白值为87.2土33.3g/L,试比较该两项指标的变异程度。CVRBC=(0.86/3.10)×100%=27.74%;CVHb=(33.3/87.2)×100%=38.19%可认为Hb的变异程度比RBC大。2)某单位测得大鼠的血清谷丙转氨酶(ALT)为29.4土1.4,家兔的ALT为52.8土1.5,试比较两种实验动物ALT指标的实验稳定性。CV大鼠=(1.4/29.4)×100%=4.76%;CV家兔=(1.5/52.8)×100%=2.84%可认为家兔ALT的实验稳定性较好,应优先考虑以家兔为实验对象进行 ALT的有关研究。由该例可知,CV对于改进实验方法, 选择最佳实验对象、 指标等,都具有一定的实际意义。变异指标:1.极差较粗,适用于任何分布;2.标准差与均数单位相同,最常用,适用于正态及近似正态分布的统计描述;3.集中指标和离散指标分别反映资料的特征,常配套使用:正态分布:算术平均数标准差偏态分布:中位数四分位数间距等比资料:G正态分布及其应用第一节
正态分布某地120例正常人血清铜含量的直方图。设想观察人数逐渐增多组、距不断细分,作直方图。将各直方顶端的中点连接,形成一条光滑的曲线,该曲线即频数曲线或频率曲线,近似于数学上的正态分布曲线。一、正态分布:又称Gauss分布或常态分布,是一种最重要的连续型分布。正态分布曲线:是高峰位于中央,两侧逐渐下降,左右对称,永远不与横轴相交的曲线。二、正态分布的密度函数(–∞<x<∞)f(x)为与x对应的正态曲线的纵坐标高度; μ为总体均数;σ为总体标准差;π为圆周率,即3.14159;e为自然对数的底,即 2.71828。三、正态分布的特征1.在X轴上方,均数所在处最高。2.集中性、对称性和均匀变动性。3.正态分布有两个参数 μ和σ。四、标准正态分布x落在某个区间内的概率显得由于不同的正态分布有不同的μ和σ,用公式计算的随机变量非常麻烦。为寻求一个通用的方法,进行标准正态变换(即u变换):u=(x-μ)/σ。此变换实质上是作了一个坐标轴的平移和尺度变换,使原来的正态分布变换为μ=0、σ=1的标准正态分布 (亦称u分布),记为N(0,1)。五、标准正态分布的密度函数(–∞<u<∞)式中(u)为标准正态分布的密度函数,即纵坐标高度。六、正态曲线下面积分布的规律:七、正态分布的应用1.统计分析方法的基础: 很多抽样分布,如卡方分布、t分布都是建立在正态分布的基础上。2.质量控制:为了控制检测误差,常以 ±2s作为上下警戒线;3.估计医学参考值范围。 4.进行参数估计和假设检验。
±3s作为上下控制。第二节正态分布的应用一、 可根据正态分布的规律估计观察值的频数分布范围。例题 已知某地 120名正常人血浆铜含量 (μmol/L)的均数=14.48、s=120名正常人血浆铜含量在 14.20~15.60(μmol/L)范围内的人数。1.计算u值 当μ和σ未知时,u=(x- )/s。x1=14.20,u1=(14.20-14.48)/2.27=-0.12x2=15.60,u2=(15.60-14.48)/2.27=0.49
2.27,估计该地2.查表
-0.12左侧的面积就是 0.12右侧的面积。当u=0.12时,在表的左侧找到 0.1,在表的上方找到Ф(-0.12)=1-0.5478=0.4522,即标准正态变量 u值小于当u=0.49时,Ф(0.49)=0.6879,即u值小于0.49
0.02,二者相交处为0.5478,-0.12的概率为0.4522;的概率为0.6879。3.确定概率u值在-0.12~0.49范围内的面积为:Ф(0.49)-Ф(-0.12)=0.6879-0.4522=0.2357,即血浆铜含量在14.20~15.60(μmol/L)范围内的概率为23.57%。4.估计区间内人数120名正常人血清铜含量在 14.20~15.60(μmol/L)范围的人数为 120×23.57%=28人二、制定医学参考值范围1、医学参考值的意义○1医学参考值:是指包括绝大多数正常人的解剖、生理、生化、免疫、组织或排泄物中成分的测量值。○2医学参考值范围虑到变异的影响, 提高参考值作为判定正常或异常的可靠性所确定的绝大多数正常人医学参考值的波动范围。○3使用“参考值范围” 的目的:个体—临床上划分正常人与异常人的参考。人群—制订不同性别、年龄儿童某项发育指标的等级标准,用来评价儿童的发育水平等。2、制定参考值范围的步骤○1选定健康人作为调查对象。○ 2控制测量误差。○3.确定样本含量。○4根据实际意义分组。○5.决定取单侧还是双侧界限。 ○6选定适当的百分界限。 常用95%、80 %、90%、99%等。○7制定医学参考值范围。3、制定参考值范围的常用方法○1正态分布法 适用于正态或近似正态分布的资料。 表达式为 ,α为正态曲线下单侧或双侧尾部的面积, uα为α相应的标准正态离差。双侧95%的界限值为:单侧95%的上限值为:单侧95%的下限值为:例题:某地调查正常成年男子 144人的红细胞数,得均数5.38(1012/L),标准差0.44(1012/L),试估计该地成年男子红细胞数的 95%参考值范围。因红细胞数过多或过少均为异常,用双侧界值。下限: -1.96s=5.38-1.96×0.44=4.52上限: +1.96s=5.38+1.96×0.44=6.24该地成年男子红细胞数的 95%参考值范围( 4.52—6.24)1012/L。○2百分位数法: 是利用两个百分位数作为双侧参考值范围的上、下限,或者用一个百分位数作为参考值的上限或下限。适用于非正态分布或分布未知的资料。1)双侧95%参考值范围: P2.5~P97.5 2)单侧95%参考值范围上限值: P953)单侧95%参考值范围下限值: P5总体均数的估计参数估计:是通过样本信息估计其总体相应指标的数值及数值范围的统计分析方法, 即用统计量估计总体参数的方法,是统计推断的一个重要方面。第一节 抽样分布与抽样误差◆医学科研的常用方法是 抽样研究。◆由于个体差异的存在, 测算的样本指标值很难恰好等于总体指标值。 这种由个体差异和抽样造成的样本与总体、样本与样本相应统计指标之间的差异即 抽样误差。一、样本均数的抽样分布与标准误1.样本均数的抽样分布 :指某种统计量的频数分布。 用样本统计量作为该样本的代表值 ,这些个样本代表值的大小就形成了一个抽样分布。2.抽样分布的特点:(1)各统计量间存在差异,统计量不一定等于参数。2)统计量的变异范围比原变量的变异范围大大缩小。3)随着n增加,样本均数的变异程度减小。4)如果原始变量服从正态分布,则统计量也服从正态分布。如果原始变量不服从正态分布,若n较大,则统计量服从正态分布;若n较小,则统计量为非正态分布。3.抽样误差: 是因抽样产生的样本与样本、样本与总体相应统计指标之间的差异。◆由于存在个体差异,且样本又未包含总体的全部信息,因此抽样误差是无法避免的。◆抽样误差的大小主要取决于样本含量的多少和研究指标的变异程度。4.标准误:◆表示样本指标值在抽样分布中的变异情况。◆SE越小,说明抽样误差越小, 用统计量来估计参数时的可靠程度越大; 反之,SE越大,说明抽样误差越大,用统计量来估计参数时越不可靠。均数的标准误:◆ 样本均数的标准差也称均数的标准误。◆反映样本均数间的离散程度,反映样本均数与相应总体均数间的差异,说明均数抽样误差的大小。估计标准误:◆由于σ往往未知,常以S替代,算得的标准误称估计标准误。 其统计符号。◆由于标准误与抽样误差成正比,与样本均数的代表性成反比,故在实际工作中可将标准误作为描述统计指标可靠性的依据。5.标准差与标准误的比较标准差均属标准误意义描述个体观察值之间的离散性(变异程描述同一总体中随机抽出样本含量相度)同的多个样本均数间的离散性公式与n的关系随着n的增大逐渐趋于稳定随着n的增大逐渐减小,与n的平方根成反比。用途表示观察值得变异大小;结合样本均数描述表示样本均数抽样误差的大小;描述样本均正态分布的特征;在正态分布时做参考值范数的可靠性;结合样本均数估计总体均数的围的估计;计算变异系数和均数的标准误CI;进行均数间差别的假设检验例题:已知某样本资料的s=2.27(μmol/L),n=120,求其标准误。代入公式得:二、t分布及其应用1.t分布:若对正态分布总体多次重复抽取若干样本含量相同的样本,样本均数围绕总体均数μ呈现正态分布。若将所有样本均数按公式进行数学变换,可得u围绕0的标准正态分布。由于总体标准差未知,只能求出标准误的估计值,变换公式求 t值,可得到若干 t值。将这些 t值绘成直方图,若样本无限多,可绘成一条光滑的曲线—— t分布曲线,此时所得的t值围绕0呈现的就是 t分布。2.t分布的特征:(1)是一簇单峰分布曲线,以 0为中心,左右对称。(2)其形态变化与自由度 ν的大小有关—— ν越小,则t值越分散,t分布曲线越低平, t分布的峰部越矮而尾部翘得越高; ν越大,t分布越逼近正态分布。(3)t分布的单侧概率和双侧概率在t界值表中,横标目为自由度 ν,纵标目为概率 (P或α)。一侧尾部面积称为单侧概率或单尾概率 ;两侧尾部面积之和称为双侧概率或双尾概率。表中数字表示当 ν和α确定时,对应的 t的界值,其中与单尾概率相对应的 t界值用 表示,与双尾概率相对应的 t界值用表示。查t界值表注意:由于t分布是以 0为中心的对称分布,故附表 2只列出正值,查表时,不管t值正负,均可用其绝对值︱ t︱查表得概率P值。○1相同自由度时,︱ t︱值增大,概率P减小;○2在相同︱ t︱值时,双尾概率P是单尾概率P的两倍。如双尾 =单尾 =1.8123.t分布的用途: 总体均数的区间估计; t检验。第二节 总体均数的估计是根据样本分布的特点,由样本均数推测总体均数的大小及其范围。总体均数估计的方法有点估计和区间估计两种。一、总体均数的点估计点估计 概念:用样本确定的统计量的值来直接估计总体参数的数值。方法:以样本统计量及其标准误作为被估计参数的点估计值,一般是以统计量加减标准误的方式给出参数的点估计值。优点:方法简单。 缺点:未考虑抽样误差的影响。二、区间估计—— 根据抽样分布原理, 按预先给定的概率水准, 给出被估计参数可能的数值范围。统计学称这一范围为被估计参数的可信区间 (CI)。称预先给定的概率水准为可信度或可信系数,符号为 1-α,常取95%或99%。称按95%或99%水准确定的 CI为95%CI或99%CI。1.大样本资料均数的可信区间样本例数n足够大 (n≥100)时,可按正态分布原理,用以下公式估计总体均数 μ的CI。95%CI=
99%CI=例题:测得某地 296例成年男性发锌的均数为
200.0ppm,标准差为
21.8ppm。试估计该地成年男性发锌总体均数的 95%CI。本例n=
296,
=200,s=21.8,
=
=1.27。95%CI=200.0±1.96×1.27=(197.51,202.49)该地成年男性发锌总体均数的 95%CI为197.51~202.4ppm。2.小样本资料均数的可信区间当n较小(n<100)时,一般按
t分布原理,用以下公式估计总体均数
μ的
CI。95%CI=式中t0.05/2,ν与t0.01/2,ν为
t0.05
与
99%CI=t0.01的双侧界值。例题:测得某地 12例肾虚失钠型哮喘病人甲皱微循环管袢长度的均数为 208.33μm,标准差为67.07μm。试估计该地肾虚失钠型哮喘病人甲皱微循环管袢长度总体均数的 95%CI。本例n=
12,
=208.33,s=67.07,= =19.36ν=n-1=12-1=11。查t界值表得t0.05/2,11=2.201,按公式求得:95%CI=208.33±2.201×19.36=(165.72,250.94)该地肾虚失钠型哮喘病人甲皱微循环管袢长度总体均数的 95%CI为165.72~250.94μm3.可信区间的要素(1)准确度:是CI包含总体参数的概率大小, 用可信度的大小 1-α表示。可信度越接近 1,可信程度越高,准确度越高。如可信度 99%比95%可信程度高。(2)精密度:是对总体参数的估计范围或长度的度量,反映在 CI即长度愈小愈精密。每一次估计间的差异越小, CI愈小,即CI的长度越小,其估计的精密度越高。4.可信区间的特点1)当n确定后,CI范围的大小与可信度1-α的高低呈正比,与估计结果的精密度呈反比。2)当可信度1-α确定后,n的大小与CI范围的大小呈反比;与估计结果的精密度呈正比。因为增加样本例数会减小标准误,使CI的范围缩小。CI的范围越小,真实值靠近点估计值的可能性越大,靠近CI边缘的可能性越小,估计的精确度也随之提高,其统计效力就越大。5.可信区间与可信限的关系CI为某一整体内的一个分段,是以上、下可信限为界的开区间 (不包含界值在内 )。CUCL是CI的上下两个界值。如95%CI为(165.6,251.0)μm。165.6μm是CI的下限(L),251.0μm为CI的上限(U)。6.CI与参考值范围的比较1)可信区间:是参数的估计范围,需用标准误(SE)计算,表示总体指标的可能范围。2)参考值范围:表示大多数正常人的解剖、生理、生化某项指标的波动范围,需用标准差计算,用于判断观察对象的某项指标正常与否。假设检验一、假设检验的概念与分类(统计概念:亦称显著性检验,是利用样本信息,根据一定的概率水准,推断样本指标)与总体指标(参数)、不同样本指标间的差别有无意义的统计分析方法。(一)参数检验和非参数检验1.参数检验概念:依赖总体分布的具体形式的统计方法, 简称参数法。常用的参数法有 χ2检验、t检验、F检验等。使用条件是抽样总体的分布已知。优点:能充分利用样本信息; 检验效率较高。 缺点:应用条件限制较多。2.非参数检验 概念:一类不依赖总体分布的具体形式的统计方法。如 Ridit分析、秩和检验、符号检验、中位数检验、序贯试验、等级相关分析等。优点:①对总体的分布形式不要求;②可用于不能精确测量的资料;③易于理解和掌握;④计算简便。缺点:不能充分利用资料所提供的信息,使检验效率降低。(二)单因素分析与多因素分析1.单因素分析——亦称一元分析,是在主要的非处理因素相同的条件下,不管影响结果的处理因素(如病人年龄、病情、辩证分型、病理类型、药物剂型、用药途径、疗程等)有多少,每次仅分析一个处理因素与效应之间关系的统计方法。2.多因素分析—— 亦称多变量分析或多元分析, 是研究多因素和多指标之间的关系以及具有这些因素的个体之间关系的一种统计分析方法。二、 假设检验的基本思想先假设差别由抽样造成,即总体间本无差异,在此假设成立的前提下做抽样研究,如果该次抽样属小概率事件,则样本信息不支持原假设的成立,拒绝它。三、假设检验的基本步骤例题:根据大量调查,已知健康成年男子的脉搏均数为 72次/分。某医生在某医院随机调查30名脾虚男子,求得脉搏均数为74.2次/分,标准差为7.5次/分。脾虚病人的脉搏是正态分布,问脾虚男子的脉搏均数与一般成年男子的脉搏均数是否相等?分析:把一般成年男子的脉搏均数看作一个总体均数,脾虚男子的脉搏均数为样本均数。0=72,n=30,X=74.2,s=7.5。0≠的原因:①抽样误差所致。②脾虚致两个均数间有本质性差异。1.建立假设、确定检验水准⑴无效假设:记为H0,即样本均数所代表的总体均数μ与已知的总体均数μ0相等。样本均数与μ0的差异是由抽样误差引起,无统计学意义。⑵备择假设:记为H1,即样本均数所代表的总体均数μ与μ0不相等,样本均数与μ0的差异是本质性差异,有统计学意义。假设检验有双侧检验和单侧检验H0:μ=μ0,H1:μ≠μ0若目的是推断两总体均数是否不等,应选用双侧检验。若从专业知识已知不会出现μ<μ0(或μ>μ0)的情况,则选用单侧检验。H0:μ=μ0,H1:μ<μ0(或μ>μ0)确定检验水准检验水准亦称显著性水准,符号为α,是事先规定的对假设成立有否作出判断的根据。α常取0.05或0.01。2.选择检验方法、计算统计量根据:①研究目的,②资料的类型和分布,③设计方案,④统计方法的应用条件,⑤样本含量大小等;选择适宜的统计方法并计算出相应的统计量。3.确定P值、做出推论获得等于及大于(和/或假设检验中的P值是指在由无效假设所规定的总体作随机抽样,等于及小于)现有统计量的概率。即各样本统计量的差异来自抽样误差的概率,它是判断H0成立与否的依据。确定P值的方法主要有两种⑴查表法根据检验水准、样本自由度直接查相应的界值表求出P值。⑵计算法用特定的公式直接求出P值。推论:若P>α,就没有理由怀疑H0的真实性,则结论为不拒绝H0,做出不否定此样本是来自于该总体的结论,也即差别无显著性意义;若P≤α,则拒绝 H0,接受H1,也就是说这些统计量来自不同的总体,其差别不能由抽样误差来解释,下结论为差别有显著性意义。t检验以t分布为理论基础, 对一个或两个样本的数值变量资料进行假设检验常用的方法, 属于参数检验。第二节 单样本 t检验概念: 亦称样本均数与总体均数比较的 t检验。用于从正态总体中获得含量为 n的样本,算得均数和标准差,判断其总体均数 μ是否与某个已知总体均数 μ0相同。已知总体均数一般为标准值、理论值或经大量观察得到的较稳定的指标值。一、适用条件: 1.对正态分布的数值变量资料,需用t检验。2.对于非正态分布的资料, 若经过变量变换使成正态分布, 可按t检验处理;否则,用非参数检验的方法。二、正态性检验的方法检验假设H0为总体分布是正态分布,当P>α时,不拒绝H0,认为样本所来自的总体服从正态分布;而P≤α时,拒绝H0,认为样本所来自的总体不服从正态分布。1.W检验 Shapiro-Wilk检验是基于次序统计量对它们期望值的回归而构成的。所用检验统计量为W,又称为W检验。在样本量3≤n≤50时使用。2.D检验 Kolmogorov-Smirnov检验的统计量为 D,所以也称 D检验,在样本量 50≤n≤1000时使用。三、计算公式, ,ν=n-1式中 为样本均数,μ为总体均数,n为样本含量,s为样本标准差, ν为自由度。四、检验步骤1.建立假设、确定检验水准 H0:μ=μ0,H1:μ≠μ0 ,α=0.052.选择检验方法、计算统计量3.确定P值、做出推论=30-1=29,查t值表,t0.05/2,29=2.045,t=1.607<t0.05/2,29,P>0.05。按α=0.05水准,不拒绝 H0,根据现有样本信息,不能认为脾虚男子脉搏数与健康人不同第三节 配对设计资料均数的 t检验配对设计——将观察单位按照某些特征(如性别、年龄、病情等可疑混杂因素)配成条件相同或相似的对子,每对中的两个观察单位随机分配到两个组,给予不同的处理,观察指标的变化。①同一观察单位实验 (或治疗)前后的比较;② 同一样品用两种方法检验结果的比较;③配对的两个观察单位分别接受两种处理后的数据比较。配对t检验配对t检验——又称成对t检验, 是将对子差数 d看做变量,先假设两种处理的效应相同,1—μ2=0,无显著性,推断两种处理因素的效果有无差别或某处理因素有无作用。由于此种设计使影响结果的非被试因素相似或相同,因而提高了研究效率。一、适用条件: 1.设计类型是配对设计。 2.数值变量的对子差值是正态分布。二、计算公式ν=n-1,式中d为各个对子数值的差数, 为差数的平均数 , 为差数的标准差,为差数的标准误,n为对子数。三、检验步骤例题:对10名患者分别用湿式热消化-双硫腙法和硝酸-高锰酸钾冷消化法测定尿铅,问两法测得结果有无差别。用两种方法测定尿铅结果(μmol/L)患者号冷消化法热消化法差值dd212.412.80-0.390.1521212.0711.240.830.688932.903.04-0.140.019641.641.83-0.190.036152.751.880.870.756961.061.45-0.390.152173.233.43-0.200.0480.770.92-0.150.022593.673.81-0.140.0196104.494.010.480.2304合计0.582.1181.建立假设、确定检验水准H0:μ=μ0,H1:μ≠μ0,α=0.05计算统计量t值先计算差值 d及d2(如表),得 ∑d=0.58, ∑d2=2.1182计算差值的标准误3.确定P值、做出推论ν=n-1=10-1=9,查t界值表,得双侧 t0.05/2,9=2.262,本例 t<t0.05/2,9,P>0.05。按α=0.05水准,不拒绝 H0,不能认为两法测定尿铅结果有差别。第四节独立样本 t检验与t′检验独立样本资料——是在两个总体里分别随机抽样,或将同一总体里抽取的观察对象随机分为两组,采取不同的处理得到的资料。独立样本t检验——亦称两样本t检验或成组t检验。与t′检验均适用于完全随机化设计两独立样本的比较,目的是推断两独立样本均数所代表的未知总体均数μ1与μ2是否有差别。一、独立样本的方差齐性检验方差齐性——两个样本均数的假设检验,除了要求样本资料来自正态分布或近似正态分布,还要求两个样本的总体方差相等。(一)应用条件:两个样本均来自正态分布的总体。(二)计算公式:统计量F为较大的方差与较小的方差的比值。F=s12/s22,ν1=n1-1,ν2=n2-1(三)检验步骤20例例题:某医师要观察自拟中药方“降脂胶囊”对高血脂症的疗效,将诊断为高血脂的病人随机分为两组,一组用上述中药治疗,另一组用西药治疗,3个月后测量血清胆固醇含量(mmol/L如下,已知两组血清胆固醇含量均服从正态分布,试比较两药降低胆固醇的效果有无差别。1.建立检验假设、确定检验水准H0:两总体方差相等H1:两总体方差不相等α=0.10(α较大以减少 II类错误)2.选择检验方法、计算统计量2 2中药组S=0.580;西药组S=0.4662 2F=s1/s2=0.580/0.466=1.2453.确定P值、做出推论ν1=n1-1=10-1=9,ν2=n2-1=10-1=9,查F界值表(方差齐性检验用),得F0.05(9,9)=4.03,F<F0.05(9,9),P>0.05。在=0.05水准下不拒绝 H0,认为中药组与西药组的血清胆固醇总体方差齐。二、独立样本 t检验(一)应用条件: 1.样本个体测量值相互独立,即
独立性。2.两个样本所代表的总体均数服从正态分布,即3.总体方差相等,即 方差齐性。
正态性。(二)计算公式先求出合并方差
,再求出两均数之差的标准误,最后算出统计量
t值。(三)检验步骤1.建立假设、确定检验水准H0:μ1=μ2 H1:μ1≠μ2α=0.052.选择检验方法、计算统计量本例n1=10, =5.247,s1=0.762;n2=10, =5.537,s2=0.683 =0.5243.确定P值、做出推论ν=10+10-2=18,查t界值表 ,得t0.05,18=2.101,t<t0.05,18,P>0.05。按α=0.05水准,不拒绝H 0。两药降低胆固醇效果的差别无统计学意义。三、t′检验成组样本均数的比较,若方差不齐,可以采取 3种方式处理:①经过数据变换使方差齐,然后进行 t检验;②采用近似 t检验——t′检验;③基于秩次的非参数检验方法。例题:由X光片上测得两组病人肺门横径右侧距 R1值(cm),结果如下,请先检验两组的总体方差是否相等,然后进行假设检验。肺癌病人 矽肺0期病人(一)方差齐性检验1.建立假设、确定检验水准。H0:两总体方差相等 H1:两总体方差不相等α=0.102.计算统计量 F值2222=10.27F=s1(较大)/s2(较小)=1.79/0.563.确定P值,作出统计推论F界值表,ν1=n1—1=9,ν2=n2—1=49,F0.1(9,50)=2.07。今F=10.217>F0.1(9,50),故P<0.1。按α=0.10水准,拒绝H0,接受H1,可认为两总体方差不齐。(二)t′检验的公式ν1
=n1-1
ν2
=n2-1(三)t′检验的步骤1.建立假设、确定检验水准。H0:两总体R1值相等
H1:两总体
R1值不相等α=
0.052.计算统计量查t值表得:t0.05/2,9=2.262 t0.05/2,49=2.0093.确定P值,作出统计推论t′=3.272>t′0.05=2.257,P按α=0.05水准,拒绝H0,接受
<0.05。H1,可认为两组病人的
R1值不等。假设检验的两类错误和注意事项Ⅰ型错误——指拒绝了实际上成立的 H0,即“弃真”的错误。H0成立的前提下,由于抽样误差,得到的t>t0.05(ν),按α=0.05水准拒绝H0,则犯了Ⅰ型错误。确定以tα为临界值时,犯Ⅰ型错误的概率就是α。Ⅱ型错误——指接受了实际上不成立的H0,即“存伪”的错误。在实际上H1成立的前提下,由于抽样的偶然性得到了较小的t值,若t<t0.05(ν),则按α=0.05的水准接受H0,这就犯了Ⅱ型错误,Ⅱ型错误的概率用β表示。四、应用假设检验的注意事项1.事先进行严密的研究设计。2.预先确定单侧检验与双侧检验。3.灵活确定α水准。4.选择正确的统计方法。5.正确理解推断结论的意义。6.结论的描述应完整,不能绝对化。 7.结合专业知识做出推论。方差分析方差分析——又称 F检验 或变异数分析。是在不增加第一类错误概率的情况下,用于检验多组样本均数差异有无显著性的统计分析方法。方差分析的应用:完全随机设计资料的单因素 F检验;随机区组设计资料的两因素 F检验;析因设计、拉丁方设计、嵌套设计、裂区设计、交叉设计资料的多因素方差分析;单因素重复测量、 双因素重复测量资料的 F检验;ANOVA与回归分析相结合的协方差分析。第一节F检验概述一、因素与水平因素——也称为处理因素。即对试验指标有影响的名义分类变量,在研究中加以考虑(控制)的试验条件。水平——也称“处理组”。是每个因素的不同状态,也就是质量上的或数量上的差别。因素是一个抽象的概念,而水平则是一个较为具体的概念。二、对多样本均数重复进行t检验的风险性当有多个均数比较时,例如有k组均数,采用多重t检验,会导致犯I类错误的机率增大。若要进行k个均数间差异的比较,将会使用m=k(k-1)/2次t检验。假定其检验的显著性概率水平为α’,则其实际上所执行的显著性概率水平为α=1-(1-α’)m例题:4个均数(k=4),完成所有4个均数间差异的显著性检验要进行m=(4)(4-1)/2=6次t检验。若在α’=0.05的显著性水平上进行检验,其实际上犯I类错误的概率α不是0.05,而是α=1-(1-0.05)6=0.2649。三、F检验的应用条件:1.各样本是相互独立的随机样本。2.各样本所来自的总体均服从正态分布。3.各样本所来自的总体方差相等,即方差齐。此外,样本均数比较的F检验方法与实验设计类型密切相关。四、F检验的基本思想——分析变异,即将所有测量值间的总变异按照其变异的来源分解为多个部分,通过比较不同来源的变异推断各处理组间的差异有无统计学意义。实质上是关于观测值变异原因的数量分析。例题:将40只接种肿瘤的小白鼠随机分为4组,给予不同剂量的三菱莪术注射液,半月后称量瘤重,其数据见下表。表中1组为接种后不加任何处理,2、3、4组分别为接种后注射0.5ml、1.0ml和1.5ml三菱莪术液。试比较各组瘤重间有无差别?三菱莪术液抑癌实验的小鼠瘤重(g)实验号1组2组3组4组13.63.00.43.324.52.31.71.295.02.62.11.2104.51.32.52.1Σxi46.62524.618.7114.9(Σx)2226.3270.373.1447.032Σxi416.79(Σx)ni1010101040(N)4.662.502.461.872.87()Si1.010.931.181.161.总变异——将4组综合起来看,40只小鼠的瘤重有差异,称为总变异,用总的离均差平方和表示。2.组间变异从表中可见,4组小鼠瘤重的均数有差别,称为 组间变异,用离均差平方和 (SS组间)表示。造成组间变异的原因是: ①处理差异:即药物及其不同剂量对瘤重有影响造成了各组均数不同。 ②个体差异:即小鼠的个体因素造成各组均数不同。式中i表示组别。3.组内变异从各组内部看,同一种处理的 10只小鼠的瘤重仍有差异,称为 组内变异,用组内离均差平方和(SS组内)表示。造成组内变异的原因只是个体因素。三种变异的关系:4.均方(MS)——由于离均差平方和并不能真正体现变异度,还应考虑其自由度,故可用 SS与自由度之比值,即均方 (MS)表示组间变异和组内变异。5.F值——检验均数是否存在处理差异时,可用 MS组间与MS组内比值—F值判断。如无处理差异存在,造成组间变异和组内变异的原因均为个体差异,则理论上 F=1。由于两者的计算途径不同, F值实际上不一定等于 1,但不应过大。如果 F值过大,大于F值的理论分布界值,即可认为存在处理差异。F检验的基本思想: 把全部观察值之间的总变异,根据不同的设计分解成两个或多个部分,例如完全随机设计分解成组间和组内两部分, 随机区组设计分解成处理组间、区组间和误差 (相当于组内)三部分,求出反映各部分变异的指标 MS及F值,然后根据 F值与理论界值比较,在 α水准上作出相应的统计学判断。第二节 完全随机设计资料的 F检验(单因素方差分析)完全随机设计 ——将全体观察对象按随机化方法分配到两组或多组中, 每个观察单位接受每种处理的机会均等。本设计是一种单因素两水平或多水平的设计类型。因素可视为分组因素,水平可视为组数。单因素方差的计算公式变异 离均差平方和 SS 自由度df 均方MS FN-1K-1N-k1.建立假设检验 2.计算统计量3.确定P值及统计推断F=12.99>F0.05(3,36)=2.86,P<0.05在α=0.05水平上拒绝H0,接受H1。可以认为4个剂量组小鼠的瘤重不同或不全相同。例题:三种不同给药方式测得食管癌患者肿物处放射性活度比较静脉点滴PYM食管肿物处注入PYM食管肿物处注入PYM-CH合计0.191.345.360.211.044.980.661.055.080.441.044.780.371.275.450.581.144.880.340.935.100.241.294.980.271.464.880.291.495.010.551.124.850.181.524.95N12121236∑X4.3214.4960.3079.11∑X21.847817.9433303.4516323.24271.建立假设检验2.计算统计量3.查表及统计推断F=2064.2786>F0.05(2,33)=3.285,P<0.05在α=0.05水平上拒绝 H0,接受H1。可认为不同给药方式患者肿物处放射性活度不同。第三节 随机区组设计资料的 F检验(两因素方差分析)随机区组设计 ——在医学科研中较为常见, 是通过分层将全部受试对象按某种或某些特征分为若干个区组,每个区组内研究对象的特征尽可能相近,每个区组内的观察对象与处理因素的水平数相等,分别使每个区组内的观察对象随机地接受处理因素某一水平的处理。随机区组设计包括:1)对同一观察单位进行多次观察,同一观察单位的多次数据就成为一个配伍组。2)同一样本给予不同处理的比较。3)将条件相近的多个观察单位配成一组(配伍组),然后将每一配伍组的对象随机地分配到各处理组中。随机区组设计是双因素多水平的设计,它除了推断k个样本所代表的总体均数1,2,3,,是否相等外,还要推断b个区组所代表的总体均数是否相等。由于从总变异中分离出配伍组变异,考虑了个体变异对处理的影响,使误差更能反映随机误差的大小,提高了研究效率。变异来源νMSSSF总N-1处理间k-1配伍间b-1误差ν总-ν处-ν配例题:将36只雌性大白鼠按月龄相同、体重接近分为12个配伍组。并将每组三只大白鼠随机分到三个不同雌激素剂量组,经一段时间注射后的子宫质量如下表。问(1)接受不同剂量注射的大白鼠子宫质量是否相同?(2)不同配伍组间的大白鼠子宫质量是否相同?区组剂量(mg/100g)合计0.20.40.81831001092922647811125336979149297454781382705879512831065985154298770701172578649611727795911012329210651111283041158841492911262106114282合计7941092153734231.建立假设、确定检验水准2.计算统计量ν误差=ν总-ν处-ν配=35-2-11=223.确定P值、统计推断F处理=53.48>F(2,22)=3.44,P<0.05,在α=0.05水平上拒绝H0,接受H1,可以认为注射不同剂量雌激素后大鼠子宫质量不同或不全相同。(2)F配伍=0.49<F(11,22)=2.26,P>0.05,在α=0.05水平上不拒绝鼠子宫质量不同。
H0,尚不能认为不同区组的大第四节 多个样本均数间的多重比较F检验结果若为拒绝H0,接受H1,则可认为所比较的各组总体均数不等或不全相等,但不能认为每两个总体均数之间都不相等。如需进一步了解哪两个总体均数不等,哪两个总体均数相等,可进一步作多个样本均数间的两两比较,又称多重比较。多重比较分为两种情况:一种是每两组之间均需比较;另一种是多个实验组与一个对照组比较,实验组间无须比较。多组均数间的两两比较的方法较多,本节介绍每两组之间均需比较的方法--q检验,又称SNK法。Q检验的计算公式分子为比较的两个均数的差,MS组内为F检验中的组内均方,如为随机区组设计资料,则用MS误差。nA与nB为比较的两个样本的观察例数。例题:1.建立假设、确定检验水准H0:μA=μBH1:μA≠μBα=0.052.将样本均数从大到小重新排列组次1234均数4.662.502.461.87组别12343.计算q值分母(两均数之差标准误)本例ni相等,故可先求出。前已求得MS组内=1.157,代入公式求q值分母,得=0.344.列出计算表列出对比组(A与B),求出两均数之差、组数(a)及q值,并将q界值和p值一并列表。在确定临界值时,将被比较的两个均数在 k个均数间的跨距作为一个参数记为 a(组数)。确定不同跨距情况下均数间差异比较的临界值。q检验中用所要的临界值不是惟一值, 而是多个值,在整体原假设基础上对 I型错误α实施了控制。结果:经q检验显示,3个药物组与对照组的瘤重均数比较,P< 0.05,差别均有显著性; 3个药物组之间的瘤重比较,P> 0.05,差别无显著性。药物有抑制肿瘤生长的作用; 而3个剂量组之间瘤重均数差别则无显著性。第五节重复测量资料的F检验重复测量资料——同一受试对象的同一观察指标在不同时间点上进行多次测量所得的资料,常用来分析该观察指标在不同时间点上的变化特点。(或部位)越由于同一受试对象不同时间的数据间往往有一定的相关关系,而且时间间隔接近,相关关系越密切。因此重复测量资料的F检验与随机区组设计的F检验不同。例题:为了对比某种药物的胶囊型(k=1)和片剂型(k=2)在体内的代谢速度,将16名受试对象随机等分成两组,每组8人。一组给予胶囊,另一组给予片剂,分别在服药后1、2、4、6及8h测定血中的药物浓度。重复测量资料和随机区组设计资料的区别:⑴重复测量资料中同一受试对象 (看成区组)的数据高度相关,无论哪位受试对象服用片剂或是胶囊,其服药后 1h、2h、4h、6h和8h的血药浓度均和前面时间点的血药浓度相关。⑵重复测量资料中的处理因素在受试对象间为随机分配, 但受试对象内的各时间点往往是固定的,不能随机分配;随机区组设计资料中每个区组内的受试对象彼此独立, 处理只在区组内随机分配,同一区组内的受试对象接受的处理各不相同。一、离均差平方和与自由度的分解两因素重复测量资料 (1)横向分组的受试对象间的变异。分为处理因素 K(在此为剂型的变的总变异包括: 异和个体间误差的变异两部分(2)纵向分组的受试对象内的变异。分为时间因素 I的变异、处理K和时间I的交互作用(KI)以及个体内误差的变异三部分。
)计算公式:SS总=SS受试对象间+SS受试对象内 =(SS处理+SS个体间误差)+(SS时间+SS处理与时间交互+SS个体内误差)ν总=ν受试对象间+ν受试对象内=(ν处理+ν个体间)+(ν时间+ν处理与时间交互+ν个体内)1.建立检验假设、确定检验水准处理因素KH0:不同剂型(片剂和胶囊)的血药浓度相同H1:不同剂型(片剂和胶囊)的血药浓度不同α=0.05。时间因素 IH0:服药后不同时间血药浓度的总体均数全相等H1:服药后不同时间血药浓度的总体均数不全相α=0.05。交互作用KIH0:药物剂型 K和时间I无交互效应H1:药物剂型 K和时间I有交互效应α=0.05。2.选择检验方法、计算统计量3.确定P值、做出推论以求F值时的分子自由度νl、分母自由度ν2查附表5的F界值表得相应P值,或直接由计算机所给P值做出推断结论。本例按0.05水准,药物剂型 K,剂型K与时间I的交互效应 KI均不拒绝 H0,无统计学意义,还不能认为药物不同剂型的血药浓度不同,也还不能认为剂型K与时间I间有交互效应。而时间因素I拒绝H0,接受H1,差异有显著的统计学意义,可认为服用药物后不同时间(1h、2h、4h、6h和8h)的血药浓度不同或不全相同。分类变量资料的统计描述分类变量资料—— 是按研究对象的性质、 类别或等级分组,清点各组观察单位的数目得到的资料。绝对数——又称总量指标。 是指某现象实际发生的绝对水平, 表示被描述对象的规模。 是制定工作计划、总结工作和进行科学研究时不可缺少的基本数据。 如某病的病人数、治愈人数、死亡人数等。相对数——表示两个有联系的指标之比。 从数量上反映两个相互关联现象之间的对比关系或联系强度,有助于分析和阐明研究现象的规律性。 示事物出现的程度; 将绝对数指标转换成基数相同的相对数指标 (如每千人发病人数、每百例患者病死人数等 ),便于相互比较。第一节 相对数的种类常用的相对数有:率、构成比、相对比一、率(rate)概念:也称强度相对数,是指某种现象在一定条件下,实际发生的观察单位数与可能发生该现象的总观察单位数之比。用以说明某种现象发生的频率、强度和普遍程度。计算公式:医学上常用的率: 发病率、患病率、感染率、死亡率、病死率、治愈率、有效率、生存率等。1.发病率——表示在一定期间内一定人群中发生某病新病例的频率。1)发病时间:出现客观指标或确诊的日期。2)分子为病例数。3)时间单位一般为一年。4)分母是指可能发生该病的人群,但实际工作中常以平均人口数代之。2.患病率—— 也叫现患率。指某特定时间内现有某病病例数与同期人口数之比。按观察时间的不同分为时点患病率和期间患病率,以前者常用。1)期间患病率等于某期间开始时的患病率加上该期间的发病率。2)在人口相对稳定时,某病的发病率升高,则患病率也升高;病程延长,患病率也升高;疾病恢复快或死亡快,则患病率降低。3)患病率常用于表示病程较长的慢性病的发生或流行情况。如糖尿病、肺结核等。例题:某医院03年在某城区随机调查60岁以上老年人858例,发现高血压病人282例。该城区60岁以上老年人高血压患病率为:(282/858)×100%=32.87%3.死亡率——表示在一定期间(一般为一年)的一定人群中,死亡的频率。1)分子为死亡总数算出的率叫粗死亡率;分子为因某病死亡的总数算出的率称某病死亡率。2)常以年为时间单位,分母可用年中人口数或年初与年终人口数的平均值。3)用于衡量某一时期一个地区人群的死亡危险性大小。动态观察可反映某地不同时期人群健康状况和卫生保健水平。4.病死率——表示一定时期内(通常为一年) ,患某病的全部病人中因该病而死亡的频率。受疾病严重程度、早期诊断水平和医院治疗水平的影响。1)反映疾病的严重程度和医疗水平。2)多用于急性传染病。5.生存率——指在患某病的人或接受某种治疗的病人中, 随访满n年(通常为1、3、5年)仍存活的病人数所占的比例 。(1)反映疾病的严重程度。(2)常用于评价肿瘤,心血管病等慢性病的远程疗效。二、构成比(constituentratio)概念:也叫构成指标,是指事物内部某一组成部分的观察单位数与该事物各组成部分的观察单位总和之比。用以说明某一事物内部各组成部分所占的比重或分布;也可以比较个以上相同性质的事物各自比重的变化情况。计算公式:构成比=特点:1.各组成部分的构成比之和为100%。2.某一部分比重增大,则其它部分相应减少。例题:133例崩漏患者中医辩证分型情况某中医院2002年与2003年各科病床构成比证型例数百分比(%)科别2002年2003年肾虚型4130.83病床数(%)病床数(%)肝虚型129.02内科10033.3320050.00肝郁型3123.31外科10033.3310025.00血虚型4936.84传染科10033.3410025.00合计133100.00合计300100.00400100.00三、相对比(relativeratio)概念:也称比例相对数。是指两个有联系的指标之比。说明两指标的比例关系,以倍数或百分数表示。计算公式:相对比=A/B(或×100%)A、B可以相同,也可以不同,可以是绝式中A、B分别表示两个总量指标。对数、相对数,也可以是平均数。例题:某市1990年12岁以下儿童乙肝病毒携带率为2.72%,2000年乙肝病毒携带率为0.52%,计算相对比。相对比=2.72%/0.52%=5.23或相对比=(0.52%/2.72%)×100%=19.12%提示该市1990年12岁以下儿童乙肝病毒携带率为2000年的5.23倍,或2000年12岁以下儿童乙肝病毒携带率为1990年的19.12%。第二节 应用相对数的注意事项1.正确区分率和构成比:构成比是对已有的观察结果分类。率则是在未知观察结果的情况下先确定观察对象的范围,再将观察对象按某种性质或特征分组,统计各组的阳性数,然后计算出各组的频率。例:某年某地白内障患者患病情况年龄人数病例比(%)率(%)40~5606815.1812.1450~44112928.7929.2560~29613530.1345.6170~1499721.6565.1080~22194.2586.36合计1468448100.0030.52例题:在进行某遗传病的研究中,一研究人员发现,在该病患者中,90%是第一个孩子,由此可见该病的遗传与出生顺序有关,更容易遗传给第一个孩子。这个结论是否正确,为什么?2.计算相对数时分母不能太小10例,会使相一般地说,样本含量较大,计算的相对数可靠性也较高。当观察例数<对数波动较大,最好用绝对数表示。在进行动物实验时,由于通过周密设计可以严格控制实验条件,每组用10只动物得出的结果也能计算相对数。3.正确计算合计率对分组资料计算合计率(或称平均率)时,不能简单地由各组率相加或平均求得,而应用合计的实际数字进行计算。P1=x1/n1,P2=x2/n2,P3=x3/n3。P=(x1+x2+x3)/(n1+n2+n3)(正确)。P=(P1+P2+P3)/3 (错误)例题:用某疗法治疗肝炎,甲医院治疗 150例,治愈 30例,治愈率为 20%;乙医院治疗100例,治愈 30例,治愈率为 30%。两个医院合计治愈率应该是 [(30+30)/(150+100)]×100%=24%。若计算为 20%+30%=50%或(20%+30%)/2=25%,则是错的。4.注意资料的可比性在比较相对数时,除了要对比的因素(如不同的药物)外,其余的影响因素应尽可能相同或相近。如研究方法相同、研究对象同质、观察时间相等;若分组遵循随机的原则;不同地区比较时,民族、年龄、性别构成相等,周围环境、风俗习惯和经济条件一致或相近;对比不同时期资料应注意诊断标准一致、医疗条件相同。若要比较的两组以上资料内部构成不同,需要采用率的标准化法。5.样本率(或构成比)的比较应进行差别的假设检验由于抽样误差的存在,不能仅凭样本率(或构成比)数字表面相差大小下结论,应进行差别的显著性检验。第三节 率的标准化率的标准化——采用统一标准计算各率的标准化率, 使各率具有可比性, 目的是在比较总率时消除混杂因素 (即内部构成不同 )的影响。1.选取标准选择具有代表性的、较稳定的数量较大的资料为标准。如全世界、全国或本地区范围较大人群作为标准最好。实践中常用标化组的合计作为标准。2.根据现有数据计算标准化率结果:西医疗法组标化治愈率:P=(109/320) ×100%=34.1%中西医结合疗法组标化治愈率:P=(121/320) ×100%=37.8%标化后,显示西医疗法的治愈率比中西医结合疗法低。第七章总体率的估计一、率的标准误——即样本率的标准差,它不但反映样本率间的离散程度,也反映样本率与相应总体率间的差异,因而说明了率的抽样误差大小。其统计符号为: 式中π为总体阳性率 (总体中某现象的发生率 ),1-π为总体阴性率,n为样本例数。估计标准误—— 实际工作中, π往往未知,常以p代替,得出的标准误称估计标准误。式中p为样本阳性率,1-p为样本阴性率,n为样本例数。例题:1.用某方药治疗慢性肝炎160例,有效率为86.25%,求其标准误。本例n=160,p=0.8625,1-p=1-0.8625=0.1375,2.某市随机调查了50岁以上的中老年妇女776人,其中患有骨质疏松者322人,患病率为41.5%,试估计该样本频率的抽样误差。本例n=776,p=0.415,1-p=1-0.415=0.585,二、总体率的估计点估
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 工业燃料碳足迹项目可行性研究报告
- 病理切片实验课程设计
- 基于多源数据城市交通拥堵仿真模拟课程设计
- 容器逃逸检测防御措施课程设计
- 电机PID参数整定方法课程设计
- 图像边缘检测程序设计案例课程设计
- C语言迷宫智能求解方案课程设计
- 人教部编版(五四制)二年级下册课文517要是你在野外迷了路教学设计
- 报警装置课程设计
- 人教版(新课标)七年级下册第二课早期文明区域第2课时教学设计
- 2026学年人教版新教材小学数学六年级上册教学计划(含进度表)
- 2026海南广播电视总台直属事业单位招聘8人备考题库附参考答案详解【培优A卷】
- 西方经济学(第二版)完整整套课件(马工程)
- 生鲜布局和陈列
- 高三数学复习备考总结与反思
- GB/T 29162-2012煤矸石分类
- 经济法全套课件-
- 马工程西方经济学(第二版)教学课件-8
- 北师大版小学数学三年级上册《小熊购物(一)》同步练习含答案
- DB11-T968-2021预制混凝土构件质量检验标准
- 国际金融课件(完整版)
评论
0/150
提交评论