2数值变量资料的统计描述_第1页
2数值变量资料的统计描述_第2页
2数值变量资料的统计描述_第3页
2数值变量资料的统计描述_第4页
2数值变量资料的统计描述_第5页
已阅读5页,还剩67页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

1、利用数值变量资料的统订分析、窦东梅河南高等院校护理学院公共卫生教室、统订分析、统订描述、统订推定、数值变量资料的统订描述、统订描述:统订图、统订表、统订指标等描述样本资料的特征。数值变量资料的统一描述、一次数分布二集中倾向的描述三离散倾向的描述四正态概率分布、一次数分布表及其用途数值变量资料的描述时,样本量越大,则需要整理原资料,列举次数分布表,通过度数表表示资料的分布类型。 例2-1某医院用随机抽样法检测138名成年女性的红细胞球数,其检测结果如下,试制了次数分布表。 3.964.234.42.595.124.024.32.724.764.164.614.774.204.36.074.894

2、.974.64.64.04.55.25.63.415.525.03.014 564.264.664.284.24.24.24.24.024.33.764.813.17.964.274.274.61.263.964.23.764.014.293.673.394.274.614 31.83.593.973.964.495.114.204.364.543.724.974.763.214.04.564.254.924.43.43.24.024.32.34.684 74.264.035.464.16.64.16.76,(1)求出极差(range ) :即最大值和最小值之差,也称为全距离。 R5.46 3

3、.07=2.39(1012/L) (2)确定组数、组距:根据研究目的和样品含量n确定组数,通常分为1015组。 组距离=极差/组数,为方便起见,组距离为极差的十分之一,稍加调整。 2.39/12=0.1990.20(1012/L) (3)列出组段。 第一个群组区段的下限必须略小于最小值,而最后一个群组区段的上限必须包含最大值。 (4)标记计数:用标记法将全部数据汇总为各段,得到各段的频数。度数表的编制顺序、Nf、138名成年女性的血红细胞数(1012/L )次数分布、二、次数分布表的用途1、公告资料的次数分布类型2记述次数分布的特征3,容易发现一些特大或特别小的可疑值4,1、公告资料的次数分布

4、类型对称分布:各段的度数最多偏置分布:频率最多的组段(集中位置)偏向一侧,表示次数分布不对称。 正偏置状态:集中位置向数值小的一侧(左侧)偏移。 负偏置状态:集中位置向数值大的一侧(右侧)偏移。 (1)对称分布,如果各段的度数在中心位置的左右两侧大致对称,则认为该资料是对称分布,正常成年女性血清转阿美娜酶(mmol/L )含量分布115名,(2)偏压分布1 )右偏压分布(正偏压分布):右侧的定径套,表101名健康人的血清肌红蛋白含量分布,表102名左偏分布(负偏分布),左侧的分组段数比右侧的分组段数多,度数在左侧留尾。 根据上表数据的次数分布特征,数据变异(离散)的范围是5784 (回/分)数

5、据定径套(平均)的段是6873 (回/分),特别是段的人数是71 (回/分)的上下段的次数分布大致对称。、3几个特大或特别小的可疑值、二集中倾向的记述容易找到,统一地使用平均(average )这个指标体系来记述一组变量值的集中位置或平均级别。 一般的平均为:算术平均数(平均)对数平均值中位数(median )和百分比、算术平均数、算术平均数:简称1、修正算法、(1)直接修正算法公式:例如4、4、6、6、8、8、10的平均数? 例2-1某医院采用随机抽样法检测了138名成年女性的红细胞球数,其检测结果如下,试制了次数分布表。 3.964.234.42.595.124.024.324.724.7

6、64.164.614.774.204.36.074.894.974.64.64.04.55.25.63.415.525.03.01 2.564.264.664.284.24.24.24.24.02.33.764.813.17.964.274.274.61.263.964.23.764.014.293.673.394.274.611 31.83.593.973.964.495.114.204.364.543.724.974.763.214.04.564.254.924.43.43.23.024.32.64.684 4.264.035.464.16.64.16.76、(2)加权法(利用度数表)、公

7、式:k :度数表的组级数、成年女性138名的血红细胞数(1012/L )次数分布、2、应用、平均数适用于对称分布,尤其适用于正态概率分布资料。 的双曲馀弦值。 “几何体平均数”(geometric mean )可用于反映经对数变换的对称分布或关正态概率分布帧中变量值数量的平均级别。 几何平均数、几何平均数:变量对数值的算术平均数的反对数。 其他对数(自然对数等)的变换得到相同的几何平均,例如8份血清的抗体价分别为133605、1336010、1336020、1:40、1:80、1:160、1:160,平均抗体价为: 1:57 公式:例69例类风湿关节炎(RA )患者血清EBV-VCA-lgG抗

8、体滴度分布如表2-4第(1)、(2)所示,2,应用:遵循适用于等比数列的资料,尤其是对数正态分布资料。 另外,中位数(median,m )是指,一组观察值从小到大排列后位于中间的数。 也就是说,总数的一半数比它低,一半数比它高。 m的适用范围:理论上用于各种分布的定量资料。 实际使用:偏差分布数据分布种类不明确的资料。 11个大鼠的生存天数: 4、10、7、50、3、15、2、9、13、60、60的平均生存天数? 1,m的订正方法:小样本: n为奇数时n为双位数时,例9名初中生甲型肝炎的潜伏期分别为12、13、14、14、15、15、15、17、19日,求出其中的位数。 可以通过百分比法校正大

9、样本度数表资料:百分比(percentile,Px):表示一系列观察值以升序排列,并且示出了位于100等分线x%位置处的数量。 其中,中位数M=P50,定量,百分比图,百分比,度数表资料的中位数,下限值l,上限值u,i fm,中位数m,例21度数表的中位数的修正计算,Nf,中位数71 3x(130 x50Y)/26 71.69, 表2-2某地630名正常女性血清甘油三酯含量,2应用,1,各种分布类型的数据2,特别是大样本偏压分布数据,或一端或两端没有正确值的数据。 小结1 .能够使用度数表、图像直方图、统一修正指标这样的技术,有效地整理、整理、表现修正量资料的信息。 2 .平均数是描述一系列观

10、察值的集中位置或平均水平的统一校正指标,并且经常是算术平均数、几何平均数和中位数。 其中平均数的应用最广泛,几何平均数用于血清学和微生物学,而中位数主要用于偏差较大的数据分布资料。 3 .百分比可用于描述数据的观察值序列所在的百分比位置的级别。 中位数是其中的特例之一。、设置甲、乙、丙3名医生,分别对相同的血液样本5份进行血红细胞修正数(万/mm3 ),甲得到560、540、500、460、440,乙得到520、510、500,三离散倾向的记述由甲医生进行的5个观察值间的差异(离散程度合) 描述离散倾向特征数的常用定量资料的离散倾向的指标极为恶劣,是四分位间隔、方差、标准差、离散系数。 极差,

11、极差,用r表示,是变量值定径套的最大值和最小值的差。 例2-1数据有,虽然简单,但只利用两端点的值,稳定性差。 由2、四分位间距、四分位间距和q表示的: Q=下四分位:上四分位:3,方差(variance )的距离在每一观察值处接近于其平均值之间的差,即平均差平方和的方差接近于平均差平方的平均值观察值,是小的方差,并且观察值的偏差小的数据。 各观测值远离平均数时,方差变大,各观测值的偏差变大,表示数据分布分散。 “方差”(variance )也称为“均方差”(mean square deviation ),反映一系列数据的平均离散级别。 总体方差样本方差、方差平方和SS、自由度:表示随机变量可

12、以为“自由”的值的个数,例如,具有1、4个数据的样本受平均数量为5的条件限制,在自由确定了4、2、5个数据之后,第4个数据为9、=3,=方差的自由度这表示在选择平均数时n个观察值可自由取值的个数。 由于方差的测量单位是原始测量单位的平方,因此为了实际上容易使用,将方差分解为标准离差、标准离差(standard deviation/SD )、标准离差的用途1、反映个体观察值的离散程度程度的大小2、结合平均值记述正态概率分布特征3,并修正其他5, 变异系数cv 1,语义标准离差与平均数的比以百分率表示2,补正算3,用途比较度量衡单位不同资料的变异度比较平均数差资料的变异度,变异系数的应用,(1)比

13、较度量衡单位不同资料的变异如某20岁男性100人,身高平均数166.06cm,标准离差其体重平均数为53.72 kg,标准差为2.96 kg。 比较身高和体重哪个变异度大,由于测定单位不同,不能直接比较标准差,应该比较其变异系数。 现在身高的离散系数:体重的离散系数:由此可知,当地20岁男性的体重变动度比身高变动度大。 (2)比较平均数差较大的多组资料的变异度由以下表资料可知,小盆友身高的标准差会随着年龄的增加而增大。 但是,由于年龄不同,小盆友身高的平均数量有很大差异,在比较身高的变异度时,不能只看到标准差的大小。 从变异系数分析可知,6岁以下的小盆友随着年龄的增长,身高变异程度逐渐减少。正

14、态概率分布及其应用、观察上述资料作成的图像直方图,一、正态概率分布的概念正规曲线:峰在中央,两侧逐渐下降完全对称,曲线两端不与横轴交叉的钟型曲线。 该曲线的函数式f(x )被称为正态概率分布密度函数,标准差相同,平均数不同的4条正规曲线,平均数相同,标准差不同的4条正规曲线,二,正规概率密度曲线的特征(1)集中性:正规曲线是横轴上的平均数,最高的(2)曲线的下面积决定(3)横轴上的曲线的位置,并增大决定曲线的形状,一定时间越大数据越分散,曲线越矮越集中,曲线越瘦越高。 平均数为标准离差的正态概率分布习惯性地用n (,2 )表示。 (4)在正规曲线上的面积分布有一定的规则。 另外,正规曲线中横轴上的一定区间的面积在总面积中所占的百分率,用于反映该区间的例数在总例数中所占的百分率(频度分布)。 或变量值在该区间下降的概率(概率分布)。 一定区间的面积可以通过对密度曲线函数进行积分来求出,将F(X )称为正态分布曲线的分布函数。 表示正态分布

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论