版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
绪论
第一节统计学与医学统计学方法
统计学是收集、分析、解释与呈现数据资料的一门科学。Statistics:“asciencedealingwiththecollection,analysis,interpretationandpresentationofmassesofnumericaldata”
----Webster国际大辞典收集数据:实验设计、调查设计(8,9)分析数据:统计学描述(2)、统计学推断(3~7;10)解释数据:根据专业等解释统计结果(穿插各个章节)呈现结果:向杂志社、上级部门发表结果(12)统计工作的基本步骤1.统计设计:包括调查、实验设计。2.收集资料:取得准确可靠的原始资料3.整理资料:对资料进行清理、改错,数量化4.分析资料:统计描述、统计推断医学统计学用统计学原理和方法研究医学问题第二节数据类型1.计量资料2.计数资料3.等级资料4.三类资料间关系住院号年龄身高体重住院天数职业文化程度分娩方式妊娠结局20256552716571.55无中学顺产足月20256532216074.05无小学助产足月20258302515868.06管理员大学顺产足月20225432316169.05无中学剖宫产足月20224662515962.011商业中学剖宫产足月20245352715768.02无小学顺产早产20258342015866.04无中学助产早产20194642415870.53无中学助产足月20257832915457.07干部中学剖宫产足月观察单位observations个体individuals变量variablesQuantitativedata计量资料Qualitativedata计数资料Units;elements1.计量资料
用仪器、工具等测量(measure)方法获得的数据,即为计量资料measurmentdata。也叫定量数据Quantitativedata特点:有计量单位,如患者的身高(cm)、体重(kg)、血压(mmHg)、脉搏(次/分)、红细胞计数(1012/L)2.计数资料
按某种属性分类,然后清点每类的数据,称计数资料(countdata)或enumerationdata。也叫定性数据Qualitativedata
特点:无固有计量单位,如肤色(黑、白)、血型(ABO)、职业(工农兵)、性别(男女)3.等级资料Rankdata
半定性或半定量的观察结果。有大小顺序,所以也叫有序分类资料(ordinalcategorydata)。
①癌症分期:早、中、晚。
②药物疗效:治愈、好转、无效、死亡。
③尿蛋白:
,,,++,+++及以上实例数据1实例数据24.三类资料间关系
例:一组20
40岁成年人的血压以12kPa为界分为正常与异常两组,统计每组例数
<8低血压
8
正常血压
12
轻度高血压
15
中度高血压
17
重度高血压计量资料等级资料计数资料第三节统计学基本概念
1.随机变量及其分类2.同质与变异3.总体与样本4.参数与统计量5.误差6.概率1.随机变量(randomvariable)
简称变量(variable),统计上习惯用大写拉丁字母表示,如X、Y、Z、…
。
变量值习惯用小写拉丁字母表示,如性别x1=1(男)、x2=1
(男)、x3=0
(女)
、…。编号(ID)性别(X)体重(kg)(Y)疗效(Z)张11660李21781王30572…………
随机变量的分类
离散型变量(discretevariable),相当于计数资料
连续性变量(continuousvariable),相当于计量资料有序变量(ordinalvariable),相当于等级资料2.同质与变异homogeneityandvariation
同质:指事物的性质、影响条件或背景相同或非常相近。变异:指同质的个体之间的差异。
同质与变异的例子例1调查2003年西安市7岁男童的身高和体重同质:2003年、西安市、7岁男童变异:身高和体重各不相同例2研究某降压药的疗效同质:高血压患者、用某药治疗变异:疗效各不相同表1-1120名正常成年男子红细胞计数值(1012/L)
5.125.134.584.314.094.414.334.584.245.454.324.844.915.145.254.894.794.905.094.645.145.464.664.204.213.735.175.795.464.494.855.284.784.324.945.214.685.094.684.915.135.263.844.174.563.526.004.054.924.874.284.465.035.695.254.565.534.584.864.974.704.284.375.334.784.755.395.274.896.184.135.224.444.134.434.025.865.125.363.864.685.485.314.534.834.113.294.184.134.063.424.684.525.193.705.514.644.924.934.903.925.044.704.543.954.404.313.774.164.585.353.715.274.525.214.374.804.753.865.69最大值=6.18,最小值=3.29,极差=2.89算术均数=4.72,标准差=0.57
3.总体与样本populationandsample总体:根据研究目的确定的同质研究对象的全体(集合)。分有限总体与无限总体样本:从总体中随机抽取的部分观察单位
随机抽样randomsampling为了保证样本的可靠性和代表性,需要采用随机的抽样方法(在总体中每个个体具有相同的机会被抽到)。4.参数与统计量
parameterandstatistic参数:总体的统计指标,如总体均数、标准差,采用希腊字母分别记为μ、σ。固定的常数
总体样本抽取部分观察单位
统计量
参数
推断inference统计量:样本的统计指标,如样本均数、标准差,采用拉丁字母分别记为。参数附近波动的随机变量。5.误差
error误差:实际观察值与客观真实值之差(1)系统误差(2)随机误差(1)系统误差
systematicerror
在实际观测过程中,由受试对象、研究者、仪器设备、研究方法、非实验因素影响等原因造成的有一定倾向性或规律性的误差。流行病学称之为偏倚(bias)。特点:观察值有系统性、方向性、周期性的偏离真值。可以通过严格的实验设计和技术措施消除。(2)随机误差randomerror
排除上述误差后尚存的误差,受多种无法控制的因素的影响。特点:大小方向不一的随机变化。随机测量误差(randommeasurementerror)——提高操作者熟练程度可以减少这种误差
随机抽样误差(random
samplingerror):由抽样造成的样本统计量和总体参数间的差异。——不可避免,但有一定的分布规律,可估计。6.概率probability
确定性现象:在一定条件下,一定会发生或一定不会发生的现象。其表现结果为两种事件:肯定发生某种结果的叫必然事件;肯定不发生某种结果的叫不可能事件。
随机现象:在同样条件下可能会出现两种或多种结果,究竟会发生哪种结果,事先不能确定。其表现结果称为随机事件。随机事件的特征:①随机性;②规律性:每次发生的可能性的大小是确定的。概率:随机事件发生的可能性大小,用大写的P表示;取值[0,1]。必然事件P=1不可能事件P=0随机事件0<P<1
P≤0.05(5%)或P≤0.01(1%)称为小概率事件(习惯),统计学上认为不大可能发生。小概率事件
样本的实际发生率称为频率。设在相同条件下,独立重复进行n次试验,事件A出现f次,则事件A出现的频率为f/n。频率与概率间的关系:样本频率总是围绕概率上下波动样本含量n越大,波动幅度越小,频率越接近概率。频率frequency第四节统计学发展及有关问题
20世纪20年代,英国统计学家R.A.Fisher爵士(1890-1962)创立了实验设计方法和统计分析技术,奠定现代生物统计的基础。1948年,英国发表了评价链霉素治疗肺结核疗效的随机对照的临床试验报告,第一次采用生物统计方法进行临床干预试验。1948年,郭祖超教授(1912~1999)编著的《医学与生物统计方法》,是我国第一部医学统计方法的教科书。1.实例
遗传学家F.Galton爵士(1822-1911)对上千家庭父亲身高和儿子身高的观察发现遗传的“回归”现象1960年英国医生Doll,Hill等发现吸烟与肺癌有关2.医学论文中的统计学问题60年代到80年代,国外医学杂志调查结果:有统计错误的论文20%~72%。1996年对4586篇论文统计(中华医学会系列杂志占6.9%),数据分析方法误用达55.7%。3.伪造统计数据违反科学道德1976年NewScience杂志关于科研舞弊行为的调查(1)74%的调查表反映有不正当修改数据的情况(2)17%拼凑实验结果(3)7%凭空捏造数据(4)2%故意曲解结果FancystatisticalmethodscannotrescuegarbagedataFancystatisticalmethodscanhelpyougaininsightintoyourdata,overandabovewhatseemsobviousonitsfaceYoushouldalwaysworryaboutwhetherthesampledresultsarerepresentativeofthepopulation,andwhetheryoursampleallowsyoutomakeinferencesaboutthepopulation.AWarning!第一节计量资料的统计描述频数表与频数分布平均指标(算术均数、几何均数、中位数、众数)变异指标(极差、百分位数与四分位间距、方差、标准差、变异系数)一、频数表与频数分布
(frequencytableandfrequencydistribution)
表2-1160名正常成年女子的血清甘油三酯(mmol/L)
编号血清甘油三脂编号血清甘油三脂10.51……20.521531.6530.591541.6640.611551.6750.611561.6760.621571.6970.631581.780.641591.71……1601.771.频数表的编制步骤(1)求极差(range):即最大值与最小值之差,又称为全距。本例极差:R=1.77-0.51=1.26(mmol/L)(2)决定组数、组段和组距:根据研究目的和样本含量n确定。组距=极差/组数,通常分10-15个组,为方便计,组距参考极差的十分之一,再略加调整。本例i=R/10=1.26/10=0.126≈0.1。(3)列出组段:第一组段的下限略小于最小值,最后一个组段上限必须包含最大值,其它组段上限值忽略。(4)划记计数:用划记法将所有数据归纳到各组段,得到各组段的频数。
组段(1)
划记(2)
频数,f(3)
组中值,X(4)fX(5)=(3)×(4)0.5~
30.551.650.6~正90.655.850.7~正正120.759.000.8~正正130.8511.050.9~正正正170.9516.151.0~正正正181.0518.901.1~正正正正201.1523.001.2~正正正181.2522.501.3~正正正171.3522.951.4~正正131.4518.851.5~正91.5512.401.6~正81.6514.851.7~1.8
合计
31.755.25160182.302.频数表的分布特征①集中趋势(centraltendency):变量值集中位置。本例在组段“1.1~”。——平均水平指标②离散趋势(tendencyofdispersion):变量值围绕集中位置的分布情况。本例0.9~1.4,共有90人,占56%;离“中心”位置越远,频数越小;且围绕“中心”左右对称。——变异水平指标
3.正态分布与偏态分布1.表2-2频数表——正态分布normaldistribution(图2-1)
2.表2-3频数表——右偏态(skewedtotheright),也称正偏态(positiveskewed)(图2-2)
3.表2-4频数表——左偏态(skewedtotheleft),也称负偏态(negativeskewed)(图2-3)正态分布:中间高、两边低、左右对称正偏态分布:长尾向右延伸负偏态分布:长尾向左延伸a.尖峭峰
b.正态峰
c.平阔峰
二、平均指标总称为平均数(average)反映了资料的集中趋势(centraltendency
)。常用的有:
1.算术均数(arithmeticmean),简称均数(mean)
2.几何均数(geometricmean)
3.中位数
(median)
4.众数(mode)1.均数(mean)Σ为求和符号,读成sigma适用条件:资料呈正态或近似正态。
组段(1)
划记(2)
频数,f(3)
组中值,X(4)fX(5)=(3)×(4)0.5~
30.551.650.6~正90.655.850.7~正正120.759.000.8~正正130.8511.050.9~正正正170.9516.151.0~正正正181.0518.901.1~正正正正201.1523.001.2~正正正181.2522.501.3~正正正171.3522.951.4~正正131.4518.851.5~正91.5513.951.6~正81.6513.201.7~1.8
合计
31.755.25160182.30均数=182.3/160=1.142.几何均数(geometricmean)几何均数:变量对数值的算术均数的反对数。
几何均数的适用条件与实例适用条件:呈倍数关系的等比资料或对数正态分布(正偏态)资料;如抗体滴度资料
血清的抗体效价滴度的倒数分别为:10、100、1000、10000、100000,求几何均数。此例的算术均数为22222,显然不能代表滴度的平均水平。同一资料,几何均数<均数频数表资料的几何均数抗体滴度⑴
人数,f⑵
滴度倒数,X⑶lgX⑷
f·lgX⑸1:2.5
1:101:401:1601:640
合计141822126722.510.040.0160.0640.00.39791.00001.60212.20412.80625.570618.000035.246226.449216.8372102.10323.中位数(median)
中位数是将一批数据从小至大排列后位次居中的数据值,符号为Md,反映一批观察值在位次上的平均水平。
适用条件:适合各种类型的资料。尤其适合于①大样本偏态分布的资料;
②资料有不确定数值;③资料分布不明等。
中位数计算公式与实例
先将观察值按从小到大顺序排列,再按以下公式计算:特点:仅仅利用了中间的1~2个数据频数表资料的中位数下限值L上限值Ui;fm中位数Md
组段(1)
划记(2)
频数,f(3)
累计频数Sf(4)累计百分率0.5~
331.9(0~1.9)0.6~正9127.5(1.9~7.5)0.7~正正122415.0(7.5~15.0)0.8~正正133723.1(15.2~23.1)0.9~正正正175433.8(23.1~33.8)1.0~正正正187245.0(33.8~45.0)1.1~正正正正209257.5(45.0~57.5)1.2~正正正1811068.8(57.5~68.8)1.3~正正正1712779.4(68.8~79.4)1.4~正正1314087.5(79.4~87.5)1.5~正914993.1(87.5~93.1)1.6~正815798.1(93.1~98.1)1.7~1.8
合计
3160100.0(98.1~100)160中位数=1.1+0.1x[(160x50%-72)/20]=1.144.众数(mode)
出现次数(或频数)最多的观察值;在频数分布图中对应于高峰所在位置的观察值。适用于大样本;较粗糙。均数、中位数、众数三者关系正态分布时:均数=中位数=众数正偏态分布时:均数>中位数>众数负偏态分布时:均数<中位数<众数三、变异(variation)指标
反映数据的离散度(Dispersion
)。即个体观察值的变异程度。常用的指标有:
1.极差(Range)
(全距)
2.百分位数与四分位数间距
PercentileandQuartilerange
3.方差
Variance
4.标准差StandardDeviation
5.变异系数
CoefficientofVariation
三、变异(variation)指标盘编号甲乙丙14404804902460490495350050050045405105055560520510合计250025002500均数500500500
例:设甲、乙、丙三人,采每人的耳垂血,然后红细胞计数,每人数5个计数盘,得结果如下(万/mm3)甲乙丙1.极差(Range)(全距)优点:简便缺点:1.只利用了两个极端值
2.n大,R也会大
3.不稳定12040202.百分位数与四分位数间距
Percentileandquartilerange百分位数:数据从小到大排列;在百分尺度下,所占百分比对应的值。记为Px。四分位间距:QR=P75-P25四分位半间距quartiledeviation:QD=QR/2P100(max)P75P50(中位数)P25P0(min)Px频数表资料的百分位数下限值L上限值Ui;fm百分位数Px
组段(1)
划记(2)
频数,f(3)
累计频数Sf(4)累计百分率0.5~
331.9(0~1.9)0.6~正9127.5(1.9~7.5)0.7~正正122415.0(7.5~15.0)0.8~正正133723.1(15.2~23.1)0.9~正正正175433.8(23.1~33.8)1.0~正正正187245.0(33.8~45.0)1.1~正正正正209257.5(45.0~57.5)1.2~正正正1811068.8(57.5~68.8)1.3~正正正1712779.4(68.8~79.4)1.4~正正1314087.5(79.4~87.5)1.5~正914993.1(87.5~93.1)1.6~正815798.1(93.1~98.1)1.7~1.8
合计
3160100.0(98.1~100)160P25=0.9+0.1x[(160x25%-37)/17]=0.92P75=1.3+0.1x[(160x75%-110)/17]=1.36QR=1.36-0.92=0.44;QD=0.22百分位数的应用确定医学参考值范围(referencerange):如95%参考值范围=P97.5-P2.5;表示有95%正常个体的测量值在此范围。中位数Md与四分位半间距QD一起使用,描述偏态分布资料的特征3.方差
方差(variance)也称均方差(meansquaredeviation),样本观察值的离均差平方和的均值。表示一组数据的平均离散情况。样本方差为什么要除以(n-1)
与自由度(degreesoffreedom)有关。自由度是数学名词,在统计学中,n个数据如不受任何条件的限制,则n个数据可取任意值,称为有n个自由度。若受到k个条件的限制,就只有(n-k)个自由度了。计算标准差时,n个变量值本身有n个自由度。但受到样本均数的限制,任何一个“离均差”均可以用另外的(n-1)个“离均差”表示,所以只有(n-1)个独立的“离均差”。因此只有(n-1)个自由度。
离均差和Σ(X-m)=04.标准差
标准差(standarddeviation)即方差的正平方根;其单位与原变量X的单位相同。标准差的计算盘编号甲乙丙甲2乙2丙214404804901936002304002401002460490495211600240100245025350050050025000025000025000045405105052916002601002550255560520510313600270400260100合计250025002500126040012510001250250标准差50.9915.817.91
组段(1)
频数,f(3)
组中值,X(4)fX(5)=(3)×(4)fX2(5)=(3)×(4)20.5~30.551.650.910.6~90.655.853.800.7~120.759.006.750.8~130.8511.059.390.9~170.9516.1515.341.0~181.0518.9019.851.1~201.1523.0026.451.2~181.2522.5028.131.3~171.3522.9530.981.4~131.4518.8527.331.5~91.5513.9521.621.6~81.6513.2021.781.7~1.8
合计31.755.259.19160182.30221.52方差=(221.52-182.302/160)/(160-1)=0.0869标准差=0.295.变异系数变异系数(coefficientofvariation,CV)适用条件:①观察指标单位不同,如身高、体重②同单位资料,但均数相差悬殊均数
标准差变异系数青年男子身高170cm6cm3.5%体重60kg7kg11.7%第三节计数资料的统计描述一、计数资料的数据整理二、常用相对数指标三、应用注意事项一、计数资料的数据整理
计数资料:按某种属性分类,然后清点每类的数据(以下是:孕妇分娩资料)住院号年龄职业文化程度分娩方式妊娠结局202565527无中学顺产足月202565322无小学助产足月202583025管理人员大学顺产足月202567724知识分子中学顺产早产202564730管理人员大学顺产足月202584832无小学剖宫产足月201991527无中学顺产死产202586129无大学剖宫产足月202460125农民中学顺产足月200038626无小学顺产足月按年龄(2岁一组)与职业整理年龄工人管理人员农民商业服务无知识分子总计182000305209261018045222871024701115024503428521534436126504325451337036628343510347857248301114112239171143214231424360344253122283621145114383110218400020002合计2071411022085372061401二、常用相对数(relativenumber)指标率(rate):说明某现象或某事物发生的频率或强度。率=(实际发生数/可能发生总数)×比例基数
比例基数:100%、1000‰、10000/万、100000(1/10万)等
如:发病率、死亡率、发生率、阳性率、患病率等构成比(proportion):说明某一事物内部,各组成部分所占的比重。也叫百分比。
构成比=(某部分观察单位数/各组成部分观察单位总数)×100%
如:教研室16人中高级职称有4人,占20%。相对比(relativeratio):是A、B两个有关指标之比,说明A是B的若干倍或百分之几,通常用倍数或分数表示。如:男:女、医生:护士、教师:学生率与构成比率构成比概念发生的频率或强度各组成部分所占的比重强调点随机发生事件各部分的构成资料获得较难容易特点不一定合计为100%率与构成比的例子
年龄组⑴
受检人数⑵白内障例数⑶
患者年龄构成比(%)⑷患病率(%)⑸=(3)/(2)40~50~60~70~≥80合计5604412961492268129135971915.1828.7930.1321.654.2412.1429.2545.6165.1086.361468448100.0030.52三、应用注意事项1、不能以构成比代替率。2、计算相对数的分母不宜过小。小则直接叙述。3、进行率的对比分析时,应注意资料可比性。如比较疗效时,比较组间应病情轻重相同,性别影响,应按性别分组后再作比较。4、正确求平均率。例:若P1=x1/n1
P2=x2/n2P3=x3/n3
P=(x1+x2+x3)/n1+n2+n3)(正确)
P=(P1+P2+P3)/3(错误)第四节统计表与统计图
统计表(statisticaltable)——数据代替文字描述,便于统计结果的精确、简洁的表达和对比分析
统计图(statisticalchart)——用图形代替数据,获得直观、形象的效果一、统计表1.统计表的结构
2.统计表的种类
3.不良统计表的修改举例1.统计表的结构统计表由以下几个部分组成:①标题、②标目、③线条、④数字、⑤备注表2-9某省某工厂1994、1998年四项检测指标异常检出率检测指标1994年1998年受检人数异常人数检出率(%)
受检人数异常人数检出率(%)
血压心率
TTT
GPT
5195195195195544362010.160.486.943.85582582582582383923166.526.703.952.75
:TTT(麝香草酚浊度试验),
:GPT(谷丙转氨酶)。
(丁建生等.中国卫生统计1999;16(3):166)
统计表的结构××.××┋┋×.××××.××纵标目总标目(单位)××.××××××××合计┋┋┋┋┋┋┋┋×.××××××┋××.××××××××横标目纵标目纵标目纵标目总标目横标目的总标目备注:表号标题(包括何时、何地、何事)2.统计表的种类
根据分组标目的复杂程度,统计表可大致分为简单表和复合表。
简单表(simpletable):只按一个特征或标志分组。如表2-8。
复合表(combinativetable):按两个或两个以上特征或标志结合起来分组。如表2-9。
3.不良统计表的修改举例一、统计图
统计图(statisticalchart或statisticalgraph)是用点、线、面等几何图形,直观形象地表达、描述数据或结果。
1.统计图的结构
2.
统计图的种类与绘制注意事项1.统计图的结构表2-172000年三大城市四苗接种率(%)地区接种率(%)卡介苗脊灰炎苗百白破苗麻疹疫苗甲99.7299.2099.2499.12乙93.5098.2098.7098.20丙99.5093.9098.7098.20统计图由以下几个部分组成:①标题、②标目、③点线条面、④刻度、⑤图例图2-172000年三大城市四苗接种率(%)Excel绘制的图形两组资料均数的比较第一节均数的抽样误差第二节t分布与可信区间第三节t检验第四节假设检验的步骤及其有关概念总体样本抽取部分观察单位
统计量
参数
统计推断统计推断statisticalinference如:样本均数样本标准差S
样本率P如:总体均数总体标准差总体率内容:参数估计(estimationofparameters)
包括:点估计与区间估计2.假设检验(testofhypothesis)总体样本抽取部分观察单位
统计量
参数
统计推断第一节均数的抽样误差如:样本均数样本标准差S
样本率P如:总体均数总体标准差总体率
抽样误差(samplingerror):由于个体差异导致的样本统计量与总体参数间的差别。一、抽样试验
从正态分布总体N(5.00,0.502)中,每次随机抽取样本含量n=5,并计算其均数与标准差;重复抽取1000次,获得1000份样本;计算1000份样本的均数与标准差,并对1000份样本的均数作直方图。按上述方法再做样本含量n=10、样本含量n=30的抽样实验;比较计算结果。抽样试验(n=5)抽样试验(n=10)抽样试验(n=30)1000份样本抽样计算结果总体的均数总体标准差s均数的均数均数标准差n=55.000.504.990.22120.2236n=105.000.505.000.15800.1581n=305.000.505.000.09200.09133个抽样实验结果图示抽样实验小结
均数的均数围绕总体均数上下波动。
均数的标准差即标准误与总体标准差相差一个常数的倍数,即
样本均数的标准误(StandardError)=样本标准差/
从正态总体N(m,s2)中抽取样本,获得均数的分布仍近似呈正态分布N(m,s2/n)
。二、中心极限定理centrallimittheorem①即使从非正态总体中抽取样本,所得均数分布仍近似呈正态。②随着样本量的增大,样本均数的变异范围也逐渐变窄。第二节t分布与可信区间一、t分布(tdistribution)二、总体均数的估计
1.总体均数的点估计(pointestimation)与区间估计
2.总体均数的可信区间(confidenceinterval,CI)
3.总体均数差的可信区间
4.大样本总体均数的可信区间三、可信区间的解释一、t分布随机变量XN(m,s2)标准正态分布N(0,12)u变换均数标准正态分布N(0,12)Studentt分布自由度:n-1t分布的概率密度函数式中为伽玛函数;圆周率(Excel函数为PI())为自由度(degreeoffreedom),是t分布的唯一参数;t为随机变量。以t为横轴,f(t)为纵轴,可绘制t分布曲线。t分布曲线
t分布有如下性质:①单峰分布,曲线在t=0处最高,并以t=0为中心左右对称②与正态分布相比,曲线最高处较矮,两尾部翘得高(见绿线)③随自由度增大,曲线逐渐接近正态分布;分布的极限为标准正态分布。t分布曲线下面积(附表2)双侧t0.05/2,9=2.262
=单侧t0.025,9单侧t0.05,9=1.833双侧t0.01/2,9=3.250
=单侧t0.005,9单侧t0.01,9=2.821双侧t0.05/2,∞=1.96
=单侧t0.025,∞单侧t0.05,∞=1.64二、总体均数的估计
1.总体均数的点估计(pointestimation)与区间估计参数的估计点估计:由样本统计量直接估计总体参数区间估计:在一定可信度(Confidencelevel)下,同时考虑抽样误差可信度与可信区间
区间的可信度(如95%或99%)是重复抽样(如1000次)时,样本(如n=5)区间包含总体参数(m)的百分数。常用100(1-α)%或(1-α)表示,α值一般取0.05或0.01。可信度实验
2.总体均数的可信区间
3.两总体均数差的可信区间
4.大样本总体均数的可信区间(1)
4.大样本总体均数的可信区间(2)
三、可信区间的解释
95%可信区间:从总体中作随机抽样,作100次抽样,每个样本可算得一个可信区间,得100个可信区间,平均有95个可信区间包括μ(估计正确),只有5个可信区间不包括μ(估计错误)。
95%可信区间99%可信区间公式区间范围窄宽估计错误的概率大(0.05)小(0.01)第三节t检验(ttest)t检验,亦称studentt检验(Student’sttest),主要用于样本含量较小(例如n<30),总体标准差σ未知的正态分布资料。
一、样本均数与总体均数的比较二、配对资料的比较三、两样本均数的比较四、大样本均数比较的u检验五、正态性检验与两方差齐性检验一、样本均数与总体均数的比较
推断样本所代表的未知总体均数µ与已知总体均数µ0有无差别。已知总体均数µ0一般为理论值、标准值或经大量观察所得的稳定值。统计量t的计算公式:实例附表2t界值表可信区间方法解答例3-7根据专业知识确定单、双侧检验二、配对资料的比较
两种情况:1.随机配对设计(randomizedpaireddesign)是将受试对象按某些混杂因素(如性别、年龄、窝别等)配成对子,每对中的两个个体随机分配给两种处理(如处理组与对照组);2.或者同一受试对象作两次不同的处理(自身对照)。
优点:配对设计减少了个体差异。
特点:资料成对,每对数据不可拆分。表3-3两法测定12份尿铅含量的结果样品号尿铅含量(μmol.L-1)简便法常规法差值(d)12.412.80-0.390.152122.903.04-0.140.019632.751.880.870.756943.233.43-0.200.040053.673.81-0.140.019664.494.000.490.240175.164.440.720.518485.455.410.040.001692.061.240.820.6724101.641.83-0.190.0361111.061.45-0.390.1521120.770.92-0.150.0225合计----1.342.6314表3-3两法测定12份尿铅含量的结果三、两样本均数的比较
完全随机设计(completelyrandomdesign):把受试对象完全随机分为两组,分别给予不同处理,然后比较独立的两组样本均数。各组对象数不必严格相同。
目的:比较两总体均数是否相同。
条件:假定资料来自正态总体,σ12=σ22计算公式:其中,均数差的标准误
实例四、大样本均数比较的u检验
两样本均数比较时当每组样本量大于30(或50)时,可采用u检验;但只是近似方法。优点:简单,u界值与自由度无关,
u0.05=1.96,u0.01=2.58五、正态性检验与两方差齐性检验1.正态性检验(normalitytest):
统计指标:偏度系数、峰度系数;W值、D值等
统计图:P-P图、Q-Q图、直方图、茎叶图、箱图等2.方差齐性检验2.方差齐性检验Y=log(X+a)Y=Y=Y=
方差齐性检验方差不齐Satterthwaitet检验第四节假设检验的步骤及有关概念总体间差异:1.个体差异,抽样误差所致;
2.总体间固有差异判断差别属于哪一种情况的统计学检验,就是假设检验(testofhypothesis)。
t检验是最常用的一种假设检验之一。小概率思想:P<0.05(或P<0.01)是小概率事件。在一次试验中基本上不会发生。P≤α(0.05)样本差别有统计学意义;P>α(0.05)样本差别无统计学意义1、建立假设与确定检验水准(α)
H0:μ1=μ2无效假设(nullhypothesis)
H1:μ1≠μ2备择假设(alternativehypothesis)检验水准(levelofatest):α=0.05(双侧)2、选定方法和计算统计量:根据统计推断目的、设计、资料组数、样本含量、等选择方法。如两组小样本比较用t检验、大样本比较u检验、方差齐性检验用F检验。3、确定P值,作出判断
P≤α(0.05)样本差别有统计学意义;
P>α(0.05)样本差别无统计学意义
假设检验的步骤
Ⅰ型错误和Ⅱ型错误
由样本推断的结果
真实结果
拒绝H0不拒绝H0
H0成立Ⅰ型错误a
推断正确(1-a
)
H0不成立推断正确(1-b)Ⅱ型错误b
(1-b)即把握度(powerofatest):两总体确有差别,被检出有差别的能力(1-a)即可信度(confidencelevel):重复抽样时,样本区间包含总体参数(m)的百分数
对于一般的假设检验,
a定为0.05(或0.01),b的大小取决于H1。通常情况下,比较总体间有无差异并不知道,即H1不明确,b值的大小无法确定,也就是说,对于一般的假设检验,我们并不知道犯Ⅱ型错误的概率b有多大。通常情况下Ⅱ型错误未知ab减少(增加)I型错误,将会增加(减少)II型错误增大n
同时降低a与ba与b间的关系多组资料均数的比较第一节方差分析的基本思想及应用条件第二节完全随机设计资料的方差分析第三节随机单位组设计资料的方差分析第四节均数间的多重比较第五节析因设计资料的方差分析第六节Bartlett齐性检验第七节Excel实现方差分析(实例演示)
将所研究的对象分为多个处理组,施加不同的干预,施加的干预称为处理因素(factor),处理因素至少有两个水平(level)。用这类资料的样本信息来推断各处理组间多个总体均数是否存在差别,常采用的统计分析方法为方差分析(analysisofvariance,ANOVA)。由英国统计学家R.A.Fisher首创,为纪念Fisher,以F命名,故方差分析又称F检验
(Ftest)。第一节方差分析的基本思想及应用条件i为组的编号,A,B,C
j为组内为个体编号,1,2,…,10i为组的编号,1,2,3
j为组内为个体编号,1,2,…,10总变异(Totalvariation):全部测量值Xij与总均数间的差别
组间变异(betweengroupvariation)各组的均数与总均数间的差异组内变异(withingroupvariation)每组的10个原始数据与该组均数的差异
试验数据有三个不同的变异下面先用离均差平方和(sumofsquaresofdeviationsfrommean,SS)表示变异的大小
1.总变异SS总反映了所有测量值之间总的变异程度,
SS总=各测量值Xij与总均数差值的平方和SS组间反映了各组均数间的变异程度组间变异=①随机误差+②处理因素效应
2.组间变异mi
mj
在同一处理组内,虽然每个受试对象接受的处理相同,但测量值仍各不相同,这种变异称为组内变异。SS组内仅仅反映了随机误差的影响。也称SS误差3.组内变异m
i三种“变异”之间的关系One-FactorANOVA
PartitionsofTotalVariationVariationDuetoTreatmentSSBVariationDuetoRandomSamplingSSWTotalVariationSSTCommonlyreferredtoas:SumofSquaresWithin,orSumofSquaresError,orWithinGroupsVariationCommonlyreferredtoas:SumofSquaresAmong,orSumofSquaresBetween,orSumofSquaresModel,orAmongGroupsVariation=+均方(meansquare,MS)均方之比=FvalueF分布F分布概率密度函数:F分布曲线F界值表附表4F界值表(方差分析用,单侧界值)上行:P=0.05下行:P=0.01分母自由度υ2分子的自由度,υ1123456
1161200216225230234
405249995403562557645859
218.5119.0019.1619.2519.3019.33
98.4999.0099.1799.2599.3099.33
254.243.392.992.762.602.49
7.775.574.684.183.853.63
方差分析的基本思想
首先将总变异分解为组间变异和误差(组内)变异,然后比较两者的均方,即计算F值,若F值大于某个临界值,表示处理组间的效应不同,若F值接近甚至小于某个临界值,表示处理组间效应相同(差异仅仅由随机原因所致)。对于不同设计的方差分析,其思想都一样,即均将处理间平均变异与误差平均变异比较。不同之处在于变异分解的项目因设计不同而异。方差分析的应用条件各样本是相互独立的随机样本;各样本来自正态总体;各处理组总体方差相等,即方差齐性或齐同(homogeneityofvariance)。
上述条件与两均数比较的t检验的应用条件相同。当组数为2时,方差分析与两均数比较的t检验是等价的,对同一资料,有第二节 完全随机设计的方差分析
完全随机设计(completelyrandomdesign)
也叫单因素方差分析(one-wayANOVA)。将受试对象随机地分配到各个处理组的设计。随机分组方法:
1.编号,确定分组方案(如较少10个随机数为A,中间10个数为B,较大10个随机数为C)
2.产生随机数字(附表15,或电脑),排序
3.按方案分组编号12345678910…2930随机数12.13.918.327.126.728.81.412.826.05.024.429.78.4分组BACCCCABCACCA二、方差分析的步骤
m1=m2
=m3H0:m1=m2=m3=...=mk
m1
=m2
m3H1:notallthemi
areequal
m1
m2
m3(二)计算F值(方差分析表)
计算F值(方差分析表)
(三)下结论
第三节 随机单位组设计的方差分析
随机单位组设计(randomizedblockdesign)
:又称随机区组设计、配伍组设计,也叫双因素方差分析(two--wayANOVA)。是配对设计的扩展。具体做法:将受试对象按性质(如性别、年龄、病情等)(这些性质是非处理因素,可能影响试验结果)相同或相近者组成b个单位组(配伍组),每个单位组中有k个受试对象,分别随机地分配到k个处理组。这样,各个处理组不仅样本含量相同,生物学特点也较均衡。比完全随机设计更容易察觉处理间的差别。表4-4注射不同剂量雌激素后的大白鼠子宫重量(g)
一、随机单位组设计
随机分组方法(每个单位组内随机):1.将同种类同窝大白鼠为一个单位组,并编号;2.给同窝中3只大白鼠编号;规定随机数小者分到甲组,中等分到乙组,大者分到丙组;3.给每个大白鼠一个随机数;4.按规定分组表4个单位组大白鼠按随机单位组组设计分组单位组号1234小白鼠123456789101112随机数683526009953936128527005序号321132321231
分配结果丙乙甲甲丙乙丙乙甲乙丙甲二、方差分析的步骤
m1=m2
=m3H0:m1=m2=m3=...=mk
m1
=m2
m3H1:notallthemi
areequal
m1
m2
m3
与完全随机设计的方差分析基本相同,主要区别在于:F值计算的方差分析表(ANOVAtable)不同。变异来源从组内变异中分解出单位组变异与误差变异。(二)计算F值(方差分析表)
计算F值(方差分析表)
(三)下结论
t检验与F检验的关系
当处理组数为2时,对于相同的资料,如果同时采用t检验与F检验,则有:随机单位组设计ANOVA的处理组F值与配对设计的t值;完全随机设计ANOVA的F值与两样本均数比较的t值间均有:完全随机设计ANOVA与随机单位组设计ANOVA
随机单位组设计ANOVA将完全随机设计ANOVA的组内变异分解为单位组间变异与误差变异,即:第四节均数间的多重比较
当方差分析的结果拒绝H0,接受H1
时,只说明k个总体均数不全相等。若想进一步了解哪些两个总体均数不等,需进行多个样本均数间的两两比较或称多重比较(multiplecomparison)。也叫posthoc检验
若用上一章的两样本均数比较的t检验进行多重比较,将会加大犯Ⅰ类错误(把本无差别的两个总体均数判为有差别)的概率。例如,有4个样本均数,两两组合数为,若用t检验做6次比较,且每次比较的检验水准选为,则每次比较不犯Ⅰ类错误的概率为(1-0.05),6次均不犯Ⅰ类错误的概率为.这时,总的检验水准变为为什么一般t检验作多重比较
是错误的?
一、SNK-q检验(多个均数间全面比较)二、LSD-t检验(有专业意义的均数间比较)三、Dunnett检验(多个实验组与对照组比较)还有TUKEY
、DUNCAN、
SCHEFFE、
WALLER
、BON等比较方法“多重比较”的几种方法
SNK(Student-Newman-Keuls)检验,亦称q检验一、SNK-q检验
最小显著差异(Leastsignificantdifference)t检验
二、LSD-t检验
三、Dunnett检验
第六节Bartlett方差齐性检验
第一节率的抽样误差与可信区间第二节率的统计学推断一、样本率与总体率比较的u检验二、两个样本率比较的u检验第三节卡方检验一、卡方检验的基本思想二、四格表专用公式三、连续性校正公式四、配对四格表资料的χ2检验五、行×列(R×C)表资料的χ2检验计数资料的统计学推断第一节率的抽样误差与可信区间
一、率的抽样误差与标准误二、总体率的可信区间一、率的抽样误差与标准误
样本率(p)和总体率(π)的差异称为率的抽样误差(samplingerrorofrate),用率的标准误(standarderrorofrate)度量。如果总体率π未知,用样本率p估计标准误的计算二、总体率的可信区间
总体率的可信区间(confidenceintervalofrate):根据样本率推算总体率可能所在的范围
第二节率的统计学推断
一、样本率与总体率比较u检验二、两个样本率的比较u检验一、样本率与总体率比较的u检验u检验的条件:np
和n(1-p)均大于5时二、两个独立样本率比较的u检验表5-1两种疗法的心血管病病死率比较疗法死亡生存
合计病死率(%)盐酸苯乙双胍26(X1)178204(n1)12.75(p1)安慰剂2(X2)6264(n2)3.13(p2)合计2824026810.45(pc)u检验的条件:n1p1
和n1(1-p1)与n2p2
和n2(1-p2)均>5小结1.样本率也有抽样误差,率的抽样误差的大小用σp或Sp来衡量。
2.率的分布服从二项分布。当n足够大,π和1-π均不太小,有nπ≥5和n(1-π)≥5时,近似正态分布。
3.总体率的可信区间是用样本率估计总体率的可能范围。当p分布近似正态分布时,可用正态近似法估计率的可信区间。
4.根据正态近似原理,可进行样本率与总体率以及两样本率比较的u检验。率的u检验能解决以下问题吗?
率的反应为生与死、阳性与阴性、发生与不发生等二分类变量,如果二分类变量为非正反关系(如治疗A、治疗B);反应为多分类,如何进行假设检验?率的u检验要求:n足够大,且nπ≥5和n(1-π)≥5。如果条件不满足,如何进行假设检验?
第三节卡方检验
χ2检验(Chi-squaretest)是现代统计学的创始人之一,英国人K.Pearson(1857-1936)于1900年提出的一种具有广泛用途的统计方法,可用于两个或多个率间的比较,计数资料的关联度分析,拟合优度检验等等。本章仅限于介绍两个和多个率或构成比比较的χ2检验。一、卡方检验的基本思想(1)疗法死亡生存
合计病死率(%)盐酸苯乙双胍26(a)178(b)204(a+b)12.75(p1)安慰剂2(c)62(d)64(c+d)3.13(p2)合计28(a+c.)240(b+d.)268(a+b+c+d=n)10.45(pc)表5-1
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 养殖企业五一活动方案策划(3篇)
- 设备监理师《设备监理投资》模拟试卷(完整版)
- 2026年陕西(中考)数学考试真题及参考答案
- 2026年山西省晋城市重点学校初一入学数学分班考试试题及答案
- 2026年四川中考数学考试试题(含答案)
- 2026年内蒙古公务员(行测)真题及参考答案
- 2026年黑龙江中小学教师招聘考试真题解析含答案
- 2026年山东小升初(数学)历年真题及答案
- 2026年西藏高考(英语)历年真题及答案
- 2026年黑龙江高考化学(真题)试卷附答案
- GB 47834-2026晶体硅光伏组件和逆变器能效限定值及能效等级
- 工程常见质量问题监理实施细则
- 2026年本溪市明山区事业编单位人员招聘考试备考试题及答案详解
- 2026年广西公需科目全套1卷《人工智能国家战略与政策通识》
- 2026年云南省中考语文试卷(含答案及解析)
- 2026年山东省医疗卫生事业单位招聘护士笔试试卷
- (2026年)内蒙古赤峰市公务员遴选考试题及答案
- 2026年PID控制器的原理与应用实例
- 教育强国建设三年行动计划(2025-2027年)
- 20S515 钢筋混凝土及砖砌排水检查井
- 预防住院患者跌倒集束化护理措施和核查
评论
0/150
提交评论