第二章计量资料统计描述_第1页
第二章计量资料统计描述_第2页
第二章计量资料统计描述_第3页
第二章计量资料统计描述_第4页
第二章计量资料统计描述_第5页
已阅读5页,还剩81页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

第二章计量资料的统计描述

DescriptionsofMeasurementData

第二章计量资料的统计描述

DescriptionsofMeasurementData1内容频数分布(Frequencydistribution)集中趋势的描述(Descriptionofcentraltendency)离散趋势的描述(Measuresofdispersion)正态分布(Normaldistribution)医学参考值范围的制定(Rangeofreferencevalue)2第一节频数分布

例2-1某医院用随机抽样方法检查了138名成年女子的红细胞数(×1012/L),其测量结果如下,试编制频数分布表。一、频数分布表(frequencytable)34

频数表的编制步骤1.求极差(range)极差也称全距,即最大值和最小值之差,记作R。本例:R=5.46-3.07=2.39(×1012/L)。2.确定组距(i)

组段数通常取组10-15组本例组距i=2.39/12=0.199≈0.20(×1012/L)5

3.确定组段上下限组下限(L):每个组段的起点组上限(U):每个组段的终点组段3.07~3.27~3.47~3.67~…5.27~5.4764.分组段(L≤X<U)划记并统计频数,制作频数表。频数表:由各组段及其频数所构成的统计表。7人流次数人数累计频数累计频率(%)(1)(2)(3)(4)040240235.80133073265843118108296.35427110998.75511112099.73631123100.00合计1123——表2-2某医院1123名产后出血孕妇人流次数分布离散型定量变量频数表8二、频数分布图图2-1138名正常成年女性红细胞数的频数分布9三、频数表和频数分布图用途1.描述频数分布的类型

(1)对称分布

若各组段的频数以频数最多组段为中心左右两侧大体对称,就认为该资料是对称分布。10

1)右偏态分布(skewedtotherightdistribution)也称正偏态分布(positiveskewnessdistribution):频数最多组段右侧的组段数多于左侧的组段数,频数向右侧拖尾。

血清转氨酶(mmol/L)051015202513.519.525.531.537.543.5图2-2115名正常成年女子血清转氨酶的频数分布人

数(2)偏态分布11

2)左偏态分布(skewedtotheleftdistribution)也称负偏态分布(negativeskewnessdistribution):频数最多组段左侧的组段数多于右侧的组段数,频数向左侧拖尾.

白(μg/L)05101520252.512.522.532.542.552.5图2-3101名

布人

数122.描述频数分布的特征①变异的范围在3.07~5.46(×1012/L)②有明显的统计分布规律,数据主要集中在3.47~4.87(×1012/L)之间,尤以组段的人数4.07~4.27(×1012/L)最多,且上下组段数的频数分布基本对称。13

3.便于发现一些特大或特小的可疑值4.便于进一步做统计分析和处理

计算频率、均数及标准差等。14第二节

集中趋势的描述

统计上使用平均数(average)这一指标体系来描述一组变量值的集中位置或平均水平。常用的平均数有:算术均数(mean)几何均数(geometricmean)中位数(median)15一、算术均数算术均数,简称均数(mean)

用于反映一组呈对称分布的变量值在数量上的平均水平或者说是集中位置的特征值。16均数的计算方法1.直接计算法

式中X1,X2,…,Xn为所有变量值;n为样本含量,∑(希腊字母,读作sigma)为求和的符号。17例2-2用直接法计算例2-1某医院随机抽查的138名正常成年女子的红细胞的均数。Solution:直接法计算均数举例18

2.频数表法

此处f起到了“权”(weight)作用,即f越大,其对应的组段对均数的影响也越大。19例2-3利用表2-1计算某医院随机抽查的138名正常成年女子的红细胞的均数。频数表法计算均数举例Solution:20均数的应用适用于对称分布,特别是正态分布资料。21二、几何均数几何均数(geometricmean)

用于反映一组经对数转换后呈对称分布的变量值在数量上的平均水平。22几何均数的计算方法1.直接计算法

式中X1,X2,…,Xn为所有变量值;n为样本含量,∑(希腊字母,读作sigma)为求和的符号。23例2-4某地5例微丝蚴血症患者治疗7年后用间接荧光抗体试验测得其抗体滴度倒数分别为10,20,40,40,160,求几何均数。Solution:直接法计算几何均数举例即5份血清抗体效价的平均滴度为1:34.8。24

2.频数表法

此处f同样起到了“权”(weight)作用,即f越大,其对应的组段对均数的影响也越大。25例2-569例类风湿关节炎(RA)患者血清EBV-VCA-lgG抗体滴度的分布见表2-5第(1)、(2)栏,求其平均抗体滴度。频数表法计算均数举例26频数表法计算均数举例Solution:即69例风湿关节炎(RA)患者血清EBV-VCA-lgG抗体滴度的平均抗体滴度为1:150.6。27几何均数的应用适用于成等比级数的资料,特别是对数正态分布资料。28三、中位数与百分位数(一)中位数(median)中位数是将变量值从小到大排列,位置居于中间的那个变量值。例:1,3,7,5,>100

中位数为多少?29中位数计算公式n为偶数时:

n为偶数时:30例2-67名病人患某病的潜伏期分别为2,3,4,5,6,9,16天,求其中位数。中位数计算举例Solution:本例n=7,为奇数,得例2-78名患者食物中毒的潜伏期分别为1,2,2,3,5,8,15,24小时,求其中位数。Solution:本例n=8,为偶数,得31例2-8试计算表2-2某医院1123名产后出血孕妇人工流产次数的中位数。人流次数人数累计频数累计频率(%)(1)(2)(3)(4)040240235.80133073265843118108296.35427110998.75511112099.73631123100.00合计1123——中位数计算举例Solution:本例n=1123,为奇数,得表2-2某医院1123名产后出血孕妇人流次数分布32中位数的应用适用于各种分布类型的资料,特别是偏态分布资料和开囗资料(一端或两端无确切数值的资料)。

33(二)百分位数(percentile)百分位数(percentile)是一种位置指标,用Px来表示。一个百分位数Px将全部变量值分为两部分,在Px处若无相同的变量值,则在不包含Px的全部变量值中有X%的变量值比它小,(100-X)%变量值比它大。中位数(M)是第50百分位数P50。百分位数的重要用途是确定医学参考值范围。34百分位数的计算方法将n个变量值从小到大排列,设(n+1)x%=j+g,j为整数,g为小数部分.计算公式为:1.直接计算法这一算法与前面中位数的计算公式一致,而且也是SPSS软件的计算方法,也是SAS软件的计算方法之一。35例2-9对某医院细菌性痢疾治愈者的住院天数统计,119名患者的住院天数从小到大的排列如下,试求第5百分位数和第99百分位数。直接法计算百分位数举例患者:123456789…116117118119住院天数:112223445…3940404236直接法计算百分位数举例Solution:1)本例n=119,(119+1)×5%=6,j=6,g=0,得2)本例n=119,(119+1)×99%=118.8,j=118,g=0.8,得P5的意义是该医院有5%的细菌性痢疾治愈者的住院天数少于3天;P99的意义是绝大多数(99%)细菌性痢疾治愈者的住院天数少于41.6天。372.频数表法

百分位数的计算方法对于连续变量的频数表资料,其计算公式为:式中LX、iX和fX分别为第X百分位数所在组段的下限、组距和频数;∑fL为小于LX各组段的累计频数;n为总例数。当X%=50%=1/2时,百分位数的计算公式即为中位数的计算公式:382.频数表法

百分位数的计算方法对于离散变量的频数表资料,第X百分位数即为PX所在变量值处的变量值,如对表2-2资料有P95=3;如果每个组有几个变量值,则必须根据原始数据用直接法求PX。39例2-10某地118名链球菌咽喉炎患者的潜伏期频数表见表2-6第(1)、(2)栏,求中位数及第25、第75百分位数。频数表法计算百分位数举例40

Solution:频数表法计算百分位数举例41例2-11三组同龄男孩的身高(cm)分布第三节离散趋势的描述甲组:9095100105110100cmX=甲乙组:9698100102104100cmX=乙丙组:9699100101104100cmX=丙描述数据变异大小的常用统计指标极差四分位数间距方差与标准差变异系数42例2-11三组同龄男孩身高的极差一、极差(range)极差,用R表示,即一组变量值最大值与最小值之差。

R甲=110-90=20(cm)R乙=104-96=8(cm)R丙=104-96=8(cm)43极差的应用极差计算简单,因而比较广泛地应用于描述数据的变异程度;但极差不能全面描述数据的变异,且稳定性较差,易受样本量大小的影响。44二、四分位数间距(quartile)

四分位数间距,用QR表示,即一组变量值中间的50%数据的最大值与最小值之差。QU=P75,称为上四分位数,也称为第3四分位数;QL=P25,称为下四分位数,也称为第1四分位数;45

四分位数间距可以看成居中的一半变量值的极差!46例2-12续例2-10。已知P25=39.2,P75=67.7,计算118名链球菌咽喉炎患者潜伏期的四分位数间距。四分位数计算举例Solution:QR=P75-P25=67.7-39.2=28.5(天)47四分位数的应用四分位数常用于描述偏态分布资料的变异程度,常与中位数一起应用于描述偏态分布资料的分布特征;与极差对比,四分位数较稳定,受样本量大小的影响较小。48三、方差与标准差(一)方差(variance)

也称均方差(meansquaredeviation),反映一组数据的平均离散水平。总体方差用

2表示,样本方差用S2表示,其计算公式为:样本方差中分母用n-1代替n是为了使S2能成为

2的无偏估计量!49三、方差与标准差(二)标准差(standarddeviation)

即方差的正平方根,其单位与原变量值的计量单位相同。总体方差用

表示,样本方差用S表示,其计算公式为:频数表资料样本方差S的计算公式为:50例2-13续例2-10,计算三组资料的标准差。样本标准差计算举例Solution:甲组:同理得:乙组:s=3.2cm,丙组:s=2.9cm。由于丙组的标准差最小,故认为其均数的代表性较其他组要好!51例2-14计算表2-1某医院随机抽查的138名正常成年女子的红细胞数的标准差。样本标准差计算举例Solution:注意:均数和标准差的计算用频数表法会有归组误差,以直接法计算结果为准!(1)直接计算法:(2)频数表法:52四、变异系数变异系数(coefficientofvariation)

,记为CV,多用于观察指标单位不同时或均数相差较大时变异程度的比较。如身高与体重的变异程度的比较;儿童身高与成人身高变异程度的比较。53变异系数的应用举例之一:计量单位不同某地7岁男孩身高的均数为123.10cm,标准差为4.71;体重均数为22.59kg,标准差为2.26kg,比较其变异度?Solution:身高:体重:

该地7岁男孩体重的变异大于身高的变异。54变异系数的应用举例之二:均数相差较大表2-7某地区不同年龄男子身高(cm)的变异程度

该地30~35岁组成人身高的变异小于3~3.5岁组儿童身高的变异!年龄组(岁)人数均数标准差CV(%)3~3.510096.13.13.230~35100170.25.00.355第四节

正态分布

正态分布首先由德国数学家和天文学家德.莫阿弗尔(A.de

Moivre)1733年提出。德国数学家Gauss发现稍晚,但他迅速将之应用于天文学研究,使正态分布广为人知,故正态分布又称为Gauss分布(Gaussdistribution)。56对正态分布曲线的认识——样本频率密度直方图

设想当增加样本含量,原始数据的频数分布图的观察人数逐渐增加且组段不断分细时,样本频率密度直方图中的直条就不断变窄,其顶端则逐渐接近于一条光滑的曲线(如图2-4)。若曲线形态呈钟形,两头低、中间高,左右对称,近似于数学上的正态分布。在处理资料时,我们就把它看成是正态分布。57样本频率密度直方图逐渐接近正态分布曲线的过程图2-4直方图逐渐接近正态分布示意图58一、正态分布的概念和特征1.正态分布曲线的数学函数表达式如果随机变量X的分布服从概率密度函数则称X服从正态分布,记作X~N(

,

2),

为X的总体均数,

2为总体方差。592.正态分布的特征(1)在直角坐标上方呈钟型曲线,两端与X轴永不相交,且以X=

为对称轴,左右完全对称。

(2)在X=

处,f(X)取最大值,其值为;X越远离

,f(X)值越小。(3)正态分布有两个参数,即位置参数

和形态参数

。若固定

,改变

值,曲线沿着X轴平行移动,其形状不变(见图2-5)。若固定

越小,曲线越陡峭;反之,

越大,曲线越平坦(见图2-6)60图2-5正态分布位置变换示意图

61图2-6正态分布形态变换示意图62(4)正态曲线下的面积分布有一定的规律。

X≤x这一侧的面积,即-∞至x区间曲线下与横轴围成的面积求解可通过积分来实,即

F(x)被称为随机变量X的分布函数,为X≤x

这一随机事件发生的概率,即F(x)=P(X≤x)。63正态曲线下的面积分布有一定的规律(图2-7)①

X轴与正态曲线所夹面积恒等于1或100%;②区间

±

的面积为68.27%;③区间

±1.96

的面积为95.00%;④区间

±2.58

的面积为99.00%;64图2-7正态曲线的面积分布示意图65正态分布是一个分布族,对应于不同的参数

会产生不同位置、不同形状的正态分布。二、标准正态分布X~N(

,

2)U~N(0,12)

X0UXU转变66标准正态分布的定义

均数为0,方差为1的正态分布称为标准正态分布(standardnormaldistribution),标准正态分布变量常用U或Z表示,即U~N(0,12)。1.标准正态分布曲线的数学函数表达式(概率密度函数)2.标准正态分布曲线的分布函数U~N(0,12)0Uu

(u)

(u)67正态分布与标准正态分布分布函数(曲线下面积)的对应关系U~N(0,12)0Uu

(u)X~N(

,

2)

XxF(x)F(x)=P(X≤x)F(x)=

(u)

(u)值可以通过查找附表1求解,且

(u)=1-

(-u)。u68利用标准正态分布分布函数计算普通正态分布对应的随机事件的概率例2-15对例2-1、例2-2和例2-14已计算某医院随机抽查的138名正常成年女性的红细胞均数=4.23(×1012/L),标准差s=0.45(×1012/L)。试估计正常成年女性的红细胞数:①在4.00(×1012/L)以下者占正常成年女性总人数的百分比;②4.00~5.00(×1012/L)之间者占正常成年女性总人数的百分比;③在5.00(×1012/L)以上者占正常成年女性总人数的百分比。69利用标准正态分布分布函数计算普通正态分布对应的随机事件的概率Solution:本例可认为红细胞数(X)所似服从正态分布N(

,

2),且因为是大样本,可由代替

,s代替

。①②③70利用标准正态分布分布函数计算普通正态分布对应的随机事件的概率②③本例:查附表1,得:(-0.51)=0.3050,(-1.71)=0.0436,(1.71)=1-(-1.71)=1-0.0436=0.9564。①因此:71

估计频数分布;三、正态分布的应用统计方法的理论基础;应用于质量控制。制定医学参考值范围;72第五节

医学参考值范围的制定一、基本概念医学参考值(referencevalue)是指包括绝大多数正常人的人体形态、机能和代谢产物等各种生理及生化指标常数,也称正常值。由于存在个体差异,生物医学数据并非常数而是在一定范围内波动,故采用医学参考值范围(medicalreferencerange)作为判定正常和异常的参考标准。73制定医学参考值范围应遵循的原则从“正常人”总体中随机抽样;大样本;判定是否要“分层”确定医学参考值范围;依据专业知识确定单侧或双侧范围;依控制漏诊或误诊率要求确定合适的百分数范围;依资料类型确定医学参考值范围计算方法。74

医学参考值范围采用单侧界值还是双侧界值的问题,这通常依据医学专业知识而定。

单侧或双侧医学参考值范围的确定双侧医学参考值范围实例

血清总胆固醇无论过低或过高均属异常白细胞数无论过低或过高均属异常单侧医学参考值范围实例血清转氨酶仅过高异常肺活量仅过低异常75

医学参考值百分数范围的确定医学参考值百分数范围有90%、95%、99%等,范围的选择常结合“正常人”和“病人”某指标的分布,根据控制假阴性率(漏诊率)还是假阳性率(误诊率)来判定。若重点是控制漏诊率,可适当缩小百分数范围;相反,若主要是控制误诊率,则可适当扩大百分数范围。最常用的百分数范围是95%。图2-8正常人和病人数据分布重叠76

医学参考值范围计算方法的确定计算医学参考值范围的常用方法有:正态分布法和百分位数法。资料服从或近似服从正态分布时采用正态分布法资料为非正态分布如偏态分布时采用百分位数法,采用此法需要相对更大的样本量。77医学参考值范围计算方法的确定1.正态分布法双

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论