版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
1、教学提要(一)医用统计学基本概念1、变异:宇宙中的事物,千差万别,各不相同。即使是性质相同的事物,就同一观察指标来看,各观察指标(亦称个体)之间,也各有差异,称为变异。同质观察单位之间的个体变异,是生物的重要特征,是偶然性的表现。2、变量:由于生物的变异特性,使得观察单位某种指标的数值互相不等,所以个体值称为变量值或观察值。3、总体:即根据研究目的确定的同质的研究对象的全体。更确切地说,是性质相同的所有观察单位的某种变量值的集合。4、样本:即从总体中抽取一部分作为观察单位进行观察,这部分观察单位称为样本。为了使样本对总体有较好的代表性,抽样必须遵循随机化的原则,即总体中每一观察单位均有相同的机
2、会被抽取到样本中去。5、计量资料(数值变量资料):对每个观察单位用定量方法测定某项指标量的大小,所得的资料称为计量资料,一般有度量衡等单位。6、计数资料(分类变量资料):将观察单位按某种属性或类别分组,所得各组的观察单位数,称为计数资料。可分为二项式或多项式分类变量。7、等级资料:将观察单位按某种属性的不同程度分组,所得各组的观察单位数,称为等级资料。这类资料与计数资料不同的是:属性的分组有程度的差别,各组按大小顺序排列;与计量资料不同的是:每个观察单位未确切定量,因而称为半定量资料。8、抽样误差:由于总体中各观察单位间存在个体差异,抽样研究中抽取的样本,只包含总体的一部分,因而样本指标不一定
3、等于相应的总体指标,这种样本统计量与总体参数间的差别称为抽样误差。(二)统计工作的基本步骤1 、设计:这是关键的一步。要求科学、周密、简明。2 、搜集资料:要求完整、准确、及时。医学统计资料的来源主要有三个方面:(1)统计报表;(2)日常医疗工作的原始记录和报告卡片;(3)专题调查3 、整理资料:核查资料;按性质或数量分组,拟定整理表。4 、分析资料:包括指标的计算、统计图表的绘制,用统计方法如参数估计、假设检验等对资料作统计分析。(三)计量资料的分析1、平均数:用以描述同质计量资料频数分布的集中趋势,反映一组变量值的平均水平,是一组变量值的代表值。(1)算术均数:简称均数。用于描述对称分布(
4、特别是呈正态分布)的变量值的平均水平。直接法:x=x/n加权法:x=x/=x/n要点:频数表的制作(2)几何均数:用G表示。用于描述变量值呈等比数列,或呈对数正态分布或近似对数正态分布资料。直接法:G=X1X2x3xn,Glg-1(Igx/n)加权法:G=lg-1(lgx/)(3)中位数和百分位数:中位数是一组从小到大顺序排列的变量值,位于中间位置的数值,亦称为位置平均数,代号为M多用于描述偏态分布资料,或分布不明资料,或一端或两端无确定数值的开口资料的集中趋势。百分位数代号为R,是一种位置指标。小样本资料中位数计算方法:当n为奇数时M=X(n+1/2)当n为偶数时M=X(n/2)+X(n/2
5、+1)大样本资料中位数和百分位数计算方法:B=L+I(nx%-L)2、变异指标(1)全距:R亦称极差。即一组变量值中最大值与最小值之差。(2)标准差:是最常用来衡量变量值间离散程度的变异指标。总体标准差代号,样本标准差代号s°运用:”用来描述正态分布资料的变异程度。当资料呈正态或近似正态资料时往往将均数与标准差同时写出:XS,表示均数的代表性。(3)变异系数:又称离散系数。代号为CMCV=运用:比较均数相差悬殊的几组资料的变异程度;比较度量衡单位不同的几组资料的变异程度。3、正态分布及其应用(1)正态分布:是医学和生物学中最常见的总体频数分布,以均数为中心,对称,两侧逐渐下降两端永远
6、不与横轴相交。正态分布用N(,2)表示,为了应用方便,常对变量X作u=(X-)/变换,使=0,=1,则正态分布转换为标准正态分布(或呈U分布),用N(0,1)表示。特征:均数处最高;以均数为中心,左右对称;有两个参数:和;态曲线下的面积分布有一定规律:变量值围正态曲线下面积(变量值出现的概率)(2)正态分布的应用:常用于估计频数分布情况;制定正常值围。1.068.27%1.9695.00%2.5899.00%正常值:指正常人的各种生理常数。当资料呈正态分布时,最常用X1.96S估at95%E常值围,其含义是指绝大多数正常的变量值都在这个围,绝大多数是包括正常的80%90%95喷口99%,最常用
7、95%4、均数的抽样误差和标准误(1)标准误的概念即样本均数的标准差,是说明均数抽样误差大小的指标。标准误愈小,表示抽样误差愈小,样本统计量对总体参数的估计愈可靠。(2)标准误的计算x=/n(总体标准误)sx=s/n(样本标准误)(3)标准误的应用表示样本均数的散布情形;估计总体均数白可信区间;进行假设检验5、t分布和总体均数的估计(1) t分布的概念对正态变量X采用u=(X-)/x变换,将N,x2)变换为标准正态分布,即U分布,而实际中x往往用Sx来估计,这时对正态变量X采用的不是U变换而是t变换,即t=(X-)/sx其结果也不是U分布而是t分布。(2) t分布的特征与标准正态分布相比有以下
8、特征:a.二者都是单峰分布,以0为中心,左右对称;b.t分布的峰部较矮而尾部翘得较高,说明远侧的t值的个数相对较多,即尾部面积(概率P)较大。自由度越小这种情况越明显,逐渐增大时,t分布逐渐逼近标准正态分布;当=时,t分布就完全成为标准正态分布了。t界值t界值表,横标目为自由度,纵标目为概率P,表中数字表示自由度为,P为(检验水准)时,t的界值,常记为t,。理论上单侧:Rt-t,尸,或Rtt,)=双侧:Rt-t,)+Rtt,)=;P(-t,<t<t,尸1-(4)总体均数的估计包括点值估计和区间估计。a.区间估计的涵义:意思是从总体中作随机抽样,每个样本可以算得一个可信区间,如95%
9、T信区间,意味着做100个可信区间,平均有95个可信区间包括总体均数(估计正确),只有5个可信区间不包括总体均数(估计错误)。b.区间估计的方法:X-t,Sx<<X+t,Sx;已知X-U,x<<X+U,x;未知但n足够大X - U ,Sx <6、假设检验概念所谓假设检验,就是根据研究目的,对样本所属总体特征提出一个假设,然后用适当方法根据样本提供的信息,推断该假设应当拒绝或不拒绝,以使研究者了解在假设的条件下,差异由抽样误差引起的可能性大小,便于比较分析。(2) 一般步骤a.建立假设:小无效假设。即假设样本指标与总体指标,或样本与样本指标是相等的,它们的差别是由抽
10、样误差引起的。H:备择假设。是与H相对立的假设。b.确定检验水准:亦称显著性水准,代号为,是一个接受或拒绝H)的概率标准。常取=0.05或=0.01c.选定检验方法和计算统计量:t检验,U检3,2检验等。d.确定P值:P值是指在由H所规定的总体中作随机抽样,获得等于及大于(或等于及小于)现有统计量的概率。e.做出统计推断:当P时,统计推断结论为按所取检验水准拒绝H,接受H,差别有显著性意义。(3)计量资料的假设检验a.样本均数与总体均数的比较:H0:=0t=(X-)/sx=n-1b.配对资料的t检验:即差值均数与总体均数0比较的t检验。配对资料:对同对的两个受试对象分别给予两种处理;对同一受试
11、对象分别给予两种处理;同一受试对象处理前后的比较。H0:d=0t=d/sdC.两样本均数的t检验:H0:1=2t=(X-X2)/sx1-x2=n1+n2-2d.两大样本均数的U检验:H0:1=2U=(X-X2)/Sxi2+Sx22e.多个样本比较F分析:F=MS组间/MS组(4) t、F检验的应用条件:a.要求资料呈正态分步;b.要求总体方差相等c.独立样本(5) U检验的应用条件:样本例数较大或总体标准差已知(6)第一类错误与第二类错误第一类错误:拒绝实际上是成立的出概率为。第二类错误:不拒绝实际上是不成立的H0,概率为,1-称为检验效能或把握度。(7)假设检验时应注意的问题a. 要有严密的
12、抽木研究设计;b. 选用的假设检验方法应符合其应用条件;c. 正确理解差别有无显著性的条件意义;d. 结论不能绝对化;e.报告结论时注意应列出检验统计量值,注明采用的是单侧或双侧检验,写出P值确切围。(四)计数资料的分析1、常用相对数:分析计数资料的指标。(1)率:表示某种现象发生的频度或强度。率=某现象实际发生例数/可能发生该现象的总例数比例基数(习惯上以计算的率保留1-2位整数)e. )构成比:说明事物部各组成部分所占的比重或分布。构成比=某一组成部分的观察单位数/同一事物各组成部分的观察单位总数100%(3)相对比:两个有关指标之比,用以表示两个指标之间的对比关系。2、应用相对数时应注意
13、的问题(1)计算相对数的分母不宜太小;(2)分析时不能以构成比代替率;(3)对观察单位数不等的几个率,不能直接相加就其平均率;(4)资料的对比应注意可比性:a.观察对象同质;b.部构成相同。(5)对样本率(或构成比)的比较应遵循随机抽样,要作假设检验。3、标准化法(1)概念:即采用一个共同的部构成标准,使两个样本或多个样本的不同部构成调整为共同的部构成标准,以消除因部构成不同对样本率的影响。标准化后的率叫标准化率。(2)计算方法:直接法、间接法。(3)注意事项:a.选定标准不同,算得的标准化率也不同,因此不能代表实际水平;b. 各组间若出现明显交叉,不宜用标准化法;c. 两样本标化率的比较应作
14、假设检验。4、常用相对数指标(1)出生率次年活产数/同年平均人口数1000%(2)死亡率次年死亡总数/同年平均人口数1000%(3)发病率次人群某时期新病例数/某人群同期平均人口数K(4)某病患病率=观察时点某病例数/同时点检查人数K(5)某病感染率=受检者感染某病原体人数/受检人数K(6)治愈率=治愈病人数/接受治疗人数100%(7)某病病死率=某期间因某病死亡人数/同期该病患者100%(8)生存率二n年末存活的病例数/随访满n年的病例数100%5、率的抽样误差和率的标准误(1)概念:由抽样造成的样本率与总体率的差别叫率的抽样误差。衡量率的抽样误差大小,衡量样本率的稳定性的指标,即率的标准误
15、。(2)率的标准误的计算p=(1-)/nSp=P(1-P)/n(3)总体率的区间估计a.查表法:n较小,特别是p接近0或1时b.正态近似法:n足够大,样本率p和(1-p)均不太小,如np与n(1-p)均大于5时(p-uSp,p+uSp)6、计数资料的假设检验-U检验条件:n足够大,样本率p和(1-p)均不太小,如np与n(1-p)均大于5时,样本率的分布呈正态分布。(2)样本率与总体率的比较H0:=0u=p-/p(3)两样本率比较的u检验H0:1=0u=p1-p2/SP1-P27、计数资料的假设检验-2检验用途常用于检验两个样本率(或构成比)之间的差异显著性,也可用于检验多个样本率之间的差异显
16、著性,还可用于检验配对计数资料的差异显著性。(2)基本思想2=(A-T)2/TT=nmJn2反映了实际频数与理论频数的吻合程度。2的大小取决于A-T的差值,还取决于自由度。=(行数-1)(列数-1)(3)四格表资料的2检验(两样本率比较)统计量的计算可用专用公式或基本公式a. 基本条件:n>40,T>1b. 校正条件:n>40,5>T>1(4)行列表的2检验(多个样本率或构成比的比较)a. 2值的计算:2=n(A2/nRnC-1)b. 注意事项:2检验要求理论频数不宜太小,一般认为不宜有1/5以上格子理论数小于5,或有一个理论数小于1,处理办法有:增大一般含量,最
17、好;删去理论频数太小的行或列合并性质相近的行或列。等级资料宜用秩和检验。当结论为拒绝检验假设,只能认为各总体率(或总体构成比)之间总的来说有差别,但不能说明它们彼此之间都有差别。(5)配对计数资料的2检验a. H0:b=cb. 2=(b-c)2/b+cc. b+c<40,需校正,2=(b-c-1)2/b+cd. =1(五)统计表与统计图1、统计表(1)基本结构与要求:由标题、标目、线条、数字等组成a. 标题:要求中心容突出,必要时注明资料的时间、地点。b. 标目:横标目:在表的左侧,是表的主语位置。纵标目:在表的上方,是表的谓语位置。c. 线条:分顶线、底线、纵标目下面与合计上面的横线,
18、斜线、竖线省略。d. 数字:一律用阿拉伯数字。e. 备注:列于表的下面,对表中标有()的数字加以描述。(2)种类a. 简单表:被研究的事物只按一个特征或指标分组。b. 复合表:被研究的事物按两个或两个以上相关联的特征或指标分组。2、统计图(1)基本要求:a.依据资料的性质选择适当的图形;b. 要有标题,扼要说明资料的容,必要时注明时间、地点;c. 以纵轴和横轴为坐标的图形,横轴尺度自左而右,纵轴尺度自下而上,数量一律由小到大,并需等距标明。纵横坐标长度的比例一般为57。d. 比较不同事物时,用不同的线条或颜色表示,要附图例说明。3、常用统计图(1)直条图:用相同宽度条形的长短.来表示资料数值大
19、小比例关系,适用于按TIe质分组,各个独立的、无连续关系的统计图。(2)百分条图:适用于表达构成比的资料。(3)线图:用线条的上升和下降来表示某事物(或某现象)因时间或条件而变化的趋势。适用于连续性的变量资料。(4)直方图:用于表示连续变量的频数分布。常以横轴表示被观察现象,纵轴表示频数或频率,以各矩形(宽度为组距)的面积代表各组段的频数。(六)调查设计1、调查方法(1)普查(全面调查):将组成总体的所有观察单位全部加一调查。(2)抽样调查:从总体中随机抽取一定数量的观察单位组成样本,然后用样本信息来推断总体特征。(3)典型调查(案例调查):即在对事物作全面分析的基础上,有目的地选定典型的人、
20、典型的单位进行调查。2、调查项目和调查表(1) 分析项目:直接用于计算调处指标,以及分析时排除混杂因素影响所必须得分容。(2) 备查项目:便于核查、补填和更正而设置的,通常不直接用于分析。(3) 调查表的格式:分为一览表和单一表。(4) 随机抽样的方法:a.单纯随机抽样;b. 系统抽样;c. 整群抽样;d. 分层抽样;根据抽样误差的大小,分层抽样<系统抽样<单纯随机抽样<整群抽样第十章线性相关与回归(LinearCorrelation&Regression)线性相关与回归第一节线性相关第二节线性回归第三节线性相关与回归的区别和联系第三节等级相关线性相关(linearc
21、orrelation)一、线性相关的基本概念二、线性相关系数三、相关系数的显著性检验四、进行线性相关分析的注意事项一、线性相关的基本概念为直观地判断两个变量之间的关系,可在直角坐标系中把每对(Xi,Yi)值所代表的点绘出来,形成散点图。若一个变量X由小到大(或由大到小),另一变量Y亦相应地由小到大或由大到小,则两个变量的散点图呈直线趋势,我们称这种现象为共变,也就是这两个变量之间有“相关关系”。男青年身高与前臂长散点呈直线趋势,即男青年身材高,前臂亦长,说明身高与前臂长之间存在线性相关关系我们把这种关系称为直线相关。线性相关用于双变量正态资料。它的性质可由散点图直观地说明。散点图中点的分布即线
22、性相关的性质和相关之间的密切程度,可分为以下几种情况:1.正相关 2.负相关 3. 无相关l>r>00>r>- 1j=- 1(1)正相关(2)完全正相关(3)负相关r=0心。,这0(4)完全负相关(5)无相关伤)无相关(7)无相关(8)非线性相关L XYL XX - LYY(XX)(YY)rxy(XiX)2(YiY)2线性相关系数在分析两个变量X与Y之间关系时,常常要了解X与Y之间有无相关关系,相关是否密切,是呈正相关还是负相关。相关系数就是说明具有直线关系的两个变量间相关密切程度和相关方向的统计量。皮尔森(Pearson)相关系数的计算公式为:相关系数r没有测量单位,
23、其数值为-K<+1相关系数的计算方法计算时分别可用下面公式带入相关系数r的计算公式中例10.1从男青年总体中随机抽取11名男青年组成样本,分别测量每个男青年的身高和前臂长,身高和前臂长均以cm为单位,测量结果如下表所示,试计算身高与前臂长之间的相关系数。编号身高(cm)前臂长(X)(Y)cm)XYX2Y2117047799028900220921734272662992917643160447040256001936415541635524025168151734781312992922096188509400353442500717847836631684220981834684183
24、3489211691804988203240024011016543709527225184911166443174285612116合计18915008618532608122810相关系数的显著性检验与前面讲的其它统计量一样,根据样本资料计算出来的相关系数同样存在抽样误差。即假设在一个X与Y无关总体中作随机抽样,由于抽样误差的影响,所得的样本相关系数也常常不等于零。因此要判断两个变量X与Y是否真的存在相关关系,仍需根据作总体相关系数p是否为零的假设检验。常用的检验方法有两种:1. 按自由度直接查附表11的界值表,得到P值。2. 用假设检验法,计算统计量进行线性相关分析的注意事项1 .线性相
25、关表示两个变量之间的相互关系是双向的,分析两个变量之间到底有无相关关系可首先绘制散点图,散点图呈现出直线趋势时,再作分析。2 .相关系数的计算只适用于两个变量都服从正态分布的情形,如果资料不服从正态分布,应先通过变量变换,使之正态化,再根据变换值计算相关系数。3 .依据公式计算出的相关系数仅是样本相关系数,它是总体相关系数的一个估计值,与总体相关系数之间存在着抽样误差,要判断两个事物之间有无相关及相关的密切程度,必须作假设检验。4 .相关分析是用相关系数来描述两个变量间相互关系的密切程度和方向,而两个事物之间的关系既可能是依存因果关系,也可能仅是相互伴随的数量关系。决不可因为两事物间的相关系数
26、有统计学意义,就认为两者之间存在着因果关系,要证明两事物间确实存在因果关系,必须凭借专业知识加以阐明。相关是分析两个正态变量X与丫之间的互相关系。在相关分析中,分不清X与丫何者为自变量,何者为因变量。现在假设两个变量X、Y中,当一个变量X改变时,另一个变量Y也相应地改变,当这样的两个变量之间存在着直线关系时,不仅可以用相关系数r表示变量Y与X线性关系的密切程度,也可以用一个直线方程来表示丫与X的线性关系。根据大量实测数据,寻找出其规律性,寻求一个直线方程来描述两个变量间依存变化的近似的线性数量关系,即线性回归关系,这样得出的直线方程叫做线性回归方程。进行线性回归分析的注意事项1 .只有将两个在
27、有联系的变量放在一起进行回归分析才是有意义的。2 .作回归分析时,如果两个有在联系的变量之间存在的是一种依存因果的关系,那么应该以“因”的变量为X,以“果”的变量为Y。如果变量之间并无因果关系,则应以易于测定、较为稳定或变异较小者为X。3 .在回归分析中,因变量是随机变量,自变量既可以是随机变量(II型回归模型,两个变量应该都服从正态分布),也可以是给定的量(I型回归模型,这时,与每个X取值相对应的变量Y必须服从正态分布),如果数据不符合要求,在进行回归分析前,必须先进行变量的变换。4 .回归方程建立后必须作假设检验,只有经假设检验拒绝了无效假设,回归方程才有意义。5 .使用回归方程计算估计值
28、时,不可把估计的围扩大到建立方程时的自变量的取值围之外。第三节线性相关和回归的区别与联系1 .相关系数的计算只适用于两个变量都服从正态分布的情形,而在回归分析中,因变量是随机变量,自变量既可以是随机变量(II型回归模型,两个变量都应该服从正态分布),也可以是给定的量(I型回归模型,这时,与每个X取值相对应的变量Y必须服从正态分布)。2 .线性相关表示两个变量之间的相互关系是双向的,回归则反映两个变量之间的依存关系,是单向的。3 .如果对同一资料进行相关与回归分析,则得到的相关系数r与回归方程中的b正负号是相同的。4 .在相关分析中,求出r后要进行假设检验,同样,在回归分析中,对b也要进行假设检
29、验。实际上,通过数学推导,对同一样本可以得出r与b互化的公式,同一样本的这两种假设检验也是等价的。因此,由于r的假设检验可以直接查表,较为简单,所以可以用其代替对b的假设检验。第四节等级相关如果观测值是等级资料,则可以用等级相关来表达两事物之间的关系。等级相关是分析X、Y两变量等级间是否相关的一种非参数方法。常用的等级相关方法是Spearman等级相关。与线性相关系数r一样,等级相关系数rs的数值亦在-1与+1之间,数值为正表示正相关,数值为负表示负相关。思考题与参考答案数值变量资料的统计描述统计表与图思考题1描述单变量资料的统计描述指标分哪两类,分别包括哪些指标?2试述平均数、标准差、变异系
30、数的含意与用途。3什么是医学参考值?如何制定95%的参考值围?4绘制统计表及统计图的原则与要什么?5常见的统计图有哪几种?它们的适用条件是什么?数值变量资料的统计推断思考题1标准差和标准误有何区别和联系。2t检验和u检验的公式有哪些类型,在应用上有哪些异同?3在统计推断过程中,如何区别单侧检验和双侧检验。4可信区间和参考值围有何不同?5假设检验和总体均数区间估计有何不同?6什么是一类错误与二类错误,有何关系?7方差分析的基本思想是什么?8描述t检验与F检验的适用条件。分类变量资料的统计描述与统计推断思考题1常用的相对数指标有哪些?它们在计算和意义上有哪些不同?2率的标准化的意义和基本思想是什么
31、?3试述率的标准误的意义和用途。224试述2检验的用途和各种2检验的适用条件。5. 列举RXC表2检验的注意事项。6. 为什么不能以构成比代替率?请联系实际加以说明。7. 应用相对数时应注意哪些问题?数值变量资料的统计描述统计表与图思考题1、描述单变量资料的统计描述指标分哪两类,分别包括哪些指标?答:单变量资料的统计描述指标分:(1)集中趋势指标:包括算术平均数(简称均数)、几何均数、中位数与百分位数、众数、调和均数;(2)离散趋势指标:包括全距、四分位数间距、方差、标准差、变异系数。2、试述平均数、标准差、变异系数的含意与用途。答:1、平均数(1)含意:平均数是一类用于描述数值变量资料集中趋
32、势(或平均水平)的指标,包括算术平均数(适用条件是资料呈正态分布或近似正态分布或对称分布)、几何平均数(适用于观察值非对称分布、其差距较大时,倍数关系或近似倍数关系)、中位数(适用于偏态分布、开口、分布不确定)、众数、调和均数。(2)用途:描述数值变量资料集中趋势,进行事物之间的分析比较。2、标准差(1)含意:指将方差开平方,取平方根的正值。反映资料的离散程度。(2)用途:反映一组观察值的离散程度,标准差小,离散程度小,均数的代表性好;用于计算变异系数;计算标准误;结合均值与正态分布的规律估计医学参考值的围。3、变异系数(1)含意:是将标准差转化为算术均数的倍数,以百分数的形式表示。(2)用途
33、:用于比较度量单位不同或均数相差悬殊的两组(或多组)资料的变异程度。3、什么是医学参考值?如何制定95%的参考值围?答:医学参考值是指绝大多数正常人的各种生理、生化数据,组织或排泄物中各种成分的含量围。制定95%的参考围:从正常人总体中抽样;控制测量误差;判定是否需要分组确定参考围;决定取单侧还是双侧;选定合适的百分界限;对资料的分布进行正态性检验;根据资料的分布类型选定适当的方法进行参考围的估计。4、绘制统计表及统计图的原则与要什么?答:绘制统计表的原则:(1)重点突出,简单明了;(2)主谓分明,层次清楚;(3)数据准确,便于分析。基本要求:(1)标题:简明扼要说明表的中心容,必要时注明研究
34、事物现象发生的时间、地点等。标题一般写在表的正上方。(2)标目:横标目和纵标目。横标目列在表的左侧,表明被研究事物的主要特征;纵标目列在表的右上端,说明横标目容的各项统计指标。标目的排列应有一定的次序。(3)线条:一般包括顶线、纵标目下线、合计上线、底线。(4)数字:表数字一律用阿拉伯数字,同一指标的小数位数保留、单位、精度一致,上下位次对齐,表不留空格。数据暂缺或未记录可用“”,数据不可能得到用“一”,数据为“0”时则填0。(5)备注:一般不列入表,必要时可用“*”,解释在表的下面。绘制统计图的原则:用几何图形的位置、大小、长短、面积等特征来表现数据信息,将数据形象化。与统计表相比,更直观。
35、但只是粗略表达,只能做统计表的补充。基本要求:(1)标题:概括图的容,应简明确切,一般置于图域的下方。一篇文献中有多幅统计图时,标题前应表注序号。(2)图域:长宽比例一般为7:5或5:7。(3)标目:一般在纵轴左侧和横轴下方(4)刻度:常用算术尺度和对数尺度,刻度值一般标注与纵轴外侧和横轴上侧。(5)图例:图例一般放在横标目下方,若空间较多可放在图域中。5、常见的统计图有哪几种?它们的适用条件是什么?答:常用统计图有:按图示形式有条图、直方图、百分条图、圆图、散点图、线图、统计地图以及在探索性分析时用的茎叶图、残差图、箱式图,判别分析的类别分布图,聚类分析的谱系图等。使用条件:(1)条图:适于
36、彼此相互独立的现象间相同指标的比较。(2)圆图:用于表示全体各部分的构成情况,百分比的情况。(3)线图:适用于连续性变量或某一现象随另一现象变迁的情况。(4)半对数线图:用语表示事物现象发展变化的速度(相对比),常用语两个或多个事物现象在发展速度上的对比。(5)直方图:适用于某连续性资料的分布。(6)散点图:适用于双变量统计分析。(7)统计地图:用与显示不同地域事物数量的分布情况。数值变量资料的统计推断思考题1、标准差和标准误有何区别和联系。答:区别:标准差是表示个体之间的变异度,其值越大,说明变异程度越大。标准差同时是表示观察值与样本均值之间的离散程度,标准差越大,说明离散程度越大,从而也说
37、明均数反映平均水平代表性欠佳。标准误即样本均数的标准差。表示样本均数之间的变异度以及样本均数与总体均数之间的离散度。标准误越大,均数的抽样误差就越大,说明样本均数与总体均数的差异越大。联系:即当样本例数n一定时,标准误与标准差呈正比;当标准差一定时,标准误与样本含量n的平方根成反比。2、t检验和u检验的公式有哪些类型,在应用上有哪些异同?答:t检验和u检验的公式类型如下:样本均数与总体均数的比较:已知总体均数一般为理论值、标准值或经大量观察所得的稳定值。样本与总体均数比较的目的是推断样本所代表的未知的总体均数科与科0是否相同。用统计量t的计算公式:|X o|t|X0|Sxt值公式:配对资料的比
38、较:用检验统计量两个样本均数的比较:两个大样本均数的比较:当两个样本量较大(均50)时,自由度足够大,可用 u检验。公式为:XiX2XiX2u1,22SXiX2S1S2nin2两个小样本均数的比较:推断科1是否等于科2,作与比较的t检验,公式为:5少/鼻(叫-1)&、(%;1电:4='勺-14%-1JI)+rtj-2在应用上白异同:t检验和科检验通常用于两均数的比较。科检验用于已知总体标准差情况下的样本均数与总体均数比较与大样本资料的两均数比较,要求资料服从对称或正态分布;t检验常用于木¥本例数n较小、总体标准差未知时样本与总体均数的比较,配对设计资料的比较与两个样本
39、均数的比较。两样本均数比较时还要求所对应总体方差齐同,资料服从正态分布。3、在统计推断过程中,如何区别单侧检验和双侧检验。答:应事先根据专业知识和问题的要求,在实验设计时做出规定,而不能在计算出检验统计量后才确定。对同一份资料,单侧检验比双侧检验更易得到差别有显著性的结论。因此,在报告讨论时,应列出检验方法、检验统计量的值、检验水准和P值的确切围,还要著名采用的是单侧检验还是双侧检验,然后结合专业做出结论。4、可信区间和参考值围有何不同?答:可信区间反映区间包含总体均数的概率大小,即1“大小,越趋近1越好;反映区间的长度,长度越小越好,即1a一定,n越大精度越高。参考值围是正常人指标测定值的波
40、动围,参考值围在诊断方面可用于划分正常或异常。5、假设检验和总体均数区间估计有何不同?答:总体均数区间估计是从总体中做随机抽样,每个样本可以算得一个可信区间,如95函信区间,意味着做100个可信区间,平均有95个可信区间包括总体均数(估计正确),只有5个可信区间不包括总体均数(估计错误)。假设检验,就是根据研究目的,对样本所属总体特征提出一个假设,然后用适当的方法根据样本提供的信息,推断假设应当拒绝或不拒绝,使研究者了解在假设的条件下,差异由抽样误差引起的可能性大小。6、什么是一类错误与而二类错误,有何关系?答:一类错误是统计学中将拒绝了实际正确的无效假设H。,即“弃真”,放弃本来成立的Ho所
41、犯的错误,概率a表示,常取a=0.05。二类错误是将接受了实际上错误的无效假设H。,概率用3表示,在统计学中将1-3称为检验效能,即“取伪”接受本来不成立的H。所犯的错。关系:一类误差认为规定,二类误差大小随一类误差增大而减小;增大样本量,可以同时减小两类误差。客观实际拒绝H0不拒绝H0H0成立第一类错误(“)判断正确(1-a)H0不成立判断正确(1-3)第一类错误(3)7、方差分析的基本思想是什么?答:将总变异分解成两个或多个变异,其中有一个是由随机误差引起的,而其他变异是由各自因素引起的。然后,比较各因素变异与误差引起的变异,评价由某种因素引起的变异是否具有统计学意义。总变异二组变异+组间
42、变异总变异:随机测量误差+个体变异+处理因素作用组变异:随机测量误差+个体之间变异组间变异:随机测量误差+个体之间变异+处理因素作用F=组间变异均方/组变异均方8、描述t检验与F检验的使用条件。答:t检验的使用条件:常用于样本例数n较小、总体标准差未知是样本与总体的比较,配对设计资料的比较和两个样本均数的比较。要求所对应的总体方差齐同,资料服从正态分布。F检验的使用条件:各样本来自正态分布的总体,且为相互独立的随机样本,各个样本所来自的总体相等。分类变量资料的统计描述与统计推断1、常用的相对数指标有哪些?它们的意义和计算上有和不同?(1)比例(构成比)意义:用以说明事物部各组成部分所占的比重或
43、分布情况。计算:构成比二事物部某一组成部分的观察单位数/事物各组成部分观察单位总数(或X100%)(2)率意义:用以说明某现象发生的频率或强度。计算:一定时间某现象发生率=一定时间某现象实际发生的观察单位数/该时间段开始时的观察单位总数(3)比意义:两个有联系的指标之比。计算:比=甲指标计数/乙指标计数(或x100%)3、试述率的标准误的意义和用途。意义:由于抽样而引起的样本率与总体率之间或样本率之间的差异称为率的抽样误差,其大小用率的标准误来表示。用途:率的标准误反映抽样误差的大小,标准误越小,说明率的抽样误差越小,用样本推论总体时,可信程度越高。4、试述c2检验的用途和c2检验各种适用条件
44、。c2检验的应用:1)两个或两个以上样本率之间差异有无显著性;2)两个或两个以上样本构成比之间差异有无显著性;3)两分类变量间有无相关关系;4)频数分布的拟合优度检验;5)实际频数与理论频数的吻合程度检验。c2检验的应用条件:1)n>=40,T>=5卡方检验2) n>=40,1<T<5校正卡方检验3) n<40,或T<1确切概率法5、列举R*C表c2检验的注意事项。(1)对行列表资料进行c2检验,要求不能有1/5以上的格子理论数小于5,或者不能有一个格子理论数小于1,否则将导致分析偏性。出现这些情况时可采取以下措施:1)增加观察例数;2)合并相邻行或列
45、的实际数;3)删去太过小的行或列;4)精确概率检验法或似然比检验法。(2)如假设检验的结果是拒绝无效假设,只能认为各总体率或构成比之间总的来说有差别,但并不是说它们彼此之间都有差别。6、为什么不能以构成比代替率?请联系实际加以说明。构成比是比例指标,它用来说明事物部各组成部分所占的比重或分布,分子仅是分母中同一事物现象的一部分,是概率的估计值。率则与时间有关,它具有速率的概念,也具有概率估计值的意义,是与时间有关的比例。但在实际工作中,计算率时起始点暴露人数很难得到,有时常以时点人数代替,如婴儿死亡率、时点发病率等,实质上也是比例指标。7、应用相对数时应注意哪些问题?计算相对数的分母不宜过小分
46、析时不能以构成比代替率正确计算平均率相互比较时应注意可比性。所要比较的研究对象同质,所比较资料的部构成要相同,同一地区不同时期资料的对比,应注意客观条件有无变化。样本率或构成比的比较应遵循随机抽样,要进行假设检验综合练习题(一)名词解释:概率总体样本变异抽样误差随机抽样随机化原则标准差数值变量计数资料分类变量等级资料正态分布t分布U分布率的标准化相对数假设检验标准误直线回归直线相关(二)填空:1、统计工作的基本步骤包括、,其中关键的是。2、统计分析包括和。3、误差可分为、和,其中丕可避免,但可用抽样设计来控制。4、四种基本抽样方法的抽样误差大小顺序为°>>。5、频数分布可
47、分为和。6、和可全面描述正态分布的频数特征。7、若频数分布明显呈偏态分布,各观察值之间呈倍数关系,宜用反映其平均增减倍数。8、比较度量衡单位不同的各组资料的变异度,宜用指标。9、对于两组正态分布资料,且均数相近,度量单位相同,大,的代表性较差。10、正态分布的特征有:;。11、正常值指。制定正常值围的方法根据指标的_而判断,可有法和。12、标准误是的标准差,与标准差的关系可用公式表示。13、对于相同的值,越大,t,值,当=,t,=O14、统计推断包括两个重要方面:和。15、假设检验的目的是推断。16、假设检验结果具有显著性意义,是根据而判定的,结论具有性。17、两样本均数比较的t检验,要求;(
48、2)。18、两个或两个以上样本均数的比较,可用。应用日要求:(1)(2)(3) 。19、假设检验时根据检验结果作判断,可能发生两种错误,第一类错误的概率为,第二类错误的概率为,同时减少两类错误的唯一方法是。20、构成比有两个特点:(1),(2)。21、率的标准化的目的是,常用的计算方法有和。22、率的标准误Sp=,是描述的统计指标。23、 2检验的基本思想是比较和的吻合程度,其基本公式是。24、 2的大小由和两方面因素决定。25、四格表2检验的基本数据是两对和两对。26、四格表2检验的基本条件是,当日t需用校正公式。27、配对计数资料2检验的无效假设是,2检验的公式是。28、统计表由、和构成。
49、编制统计表的总的原则是、。29、绘制统计表要求线条不宜过多,除有线和线以及线以外,其余如竖线、斜线均不宜有。30、统计图除圆图外,长宽比例一般以为宜,标题的位置是。31、频数分布的两个重要特征是和。32 .总体标准差的含义是。33 .1-a是指。34 .三个样本率比较得到X2>X20.05,v,可认为。35 .计数资料统计描述的主要指标有等。236 .行X列表X检验应注意,否则,则应增大样本量,c37 .两率比较U检验应用条件是。38 .率的标准误可应用于。39 .几何均数是将原始变量值作'变换,可使其成为分布,再按类似于算术均数计算公式作计算。40 .今已知甲、乙两地肝癌死亡率
50、相等,但甲地老年人比重较大,若要比较两地肝癌死亡率情况,需求O41 .方差分析的基本思想是。42 .方差分析的应用条件是。43 .调查设计一般包括设计和设计,二者是紧密结合的。44 .调查可分为和,后者又以和最为常用。45 .调查项目包括和,前者直接用于,后者是为了。46 .调查项目的答案有两种设计:和。47 .资料的设计分组有两种方法,它们是和。48 .实验设计的三个基本要素是、。49 .单纯随机抽样,估计总体均数所需样本数n时,需要实现确定、c50 .调查中系统误差的来源有、。51 .调查研究又称,其特点、。52 .概率是描述随机事件发生可能性的大小,用表示。随机事件发生概率在和之间。53
51、 .某市159名15岁女生体重均数X=46.8Kg,标准差S=5.5Kg,估计本市15岁女生体重正常值应在。54 .标准差的大小受的影响,标准误的大小受的影响。(三)是非题:卫生统计学研究的主要容是社区医疗。随机事件发生的概率小于0.05或0.01时,可认为在一次抽样中它不太可能发生。变异系数越大表示标准差越大。正态分布的特点有算术均数等于中位数。在假设检验中,本应是双侧检验的问题而误用了单侧检验水准,当拒绝H时,则增大了第二类错误。率是说明某现象发生强度的指标。配对设计四格表资料比较两个率有无差别的无效假设是b=c.四格表资料的自由度为1。随着样本含量的逐渐加大,标准误与标准差则逐渐变小。1
52、0.只研究某一种药物预防、治疗某疾病时,可以不设置对照组。如果有少数几个数据比大部分数据大几百倍,这组资料就不宜计算算术均数。标准误越大,说明样本均数的抽样误差越大。两组计量资料的假设检验是否采用t检验,主要取决于样本含量。两个大样本(一般n>30例)均数的比较可用样本均数与总体均数差异的显著性检验。构成比可说明某种事物发生的可能性大小。x2值反映了实际数与理论数之吻合程度,如果假设成立,则A与T之差一般不会很大,因而P值也不会很大。两样本比较得P<0.05,此时一定可认为两总体率不同。2行3列X2检验,理论数不可小于5。行X列表x2检验,若1/5格子以上1<T<5或任
53、一格子T<1,则应进行合理合并。只研究某一种药物预防、治疗某疾病时,可以不设置对照组。比较5所中学的近视患病率可绘制直条图。t检验可以代替方差分析。方差分析总变异可分为组间变异和组变异。调查项目是设计统计调查方案时应考虑的首要因素。()普查和抽样调查的目的不同,前者为了了解总体,后者为了了解局部。()蒙牛公司推出一种新的液态奶,让本公司职员对这种奶品尝并做出评价,这属于分层抽样。(四)单项选择题1、抽样误差是指A.不同样本指标之间的差别B.样本指标与总体指标之间由于抽样产生的差别C.样本中每个体之间的差别D.由于抽样产生的观察值之间的差别E.测量误差与过失误差的总称2、为了由样本推断总体
54、,样本应该是A.总体中任意的一部分B.总体中的典型部分C.总体中有意义的部分D.总体中有价值的部分E.总体中有代表性的部分3、随机样本的特点有A.能消除系统误差B.能消除测量误差C.能缩小抽样误差D.能消除样本偏差E.以上都不是4、搞好统计工作,达到预期目标,最重要的是A.原始资料要多B.原始资料要正确C.分析资料要先进D.整理资料要详细E.统计计算精度要高5、计数资料、计量资料和等级资料的关系是A.计量资料兼有计数资料和等级资料的一些性质B.计数资料兼有计量资料和等级资料的一些性质C.等级资料兼有计量资料和计数资料的一些性质D.计数资料有计量资料的一些性质E.以上都不是变换后,有6、如果X服
55、从总体均数为,总体标准差为的正态分布,则作u=(x-)/A.u符合正态分布,且均数不变B.u符合正态分布,且标准差不变C. u符合正态分布,且均数与标准差都不变D. u符合正态分布,且均数与标准差都改变E.u不符合正态分布7、某人群的某个生理指标或生化指标的正常值围一般指A.该指标在所有人中的波动围B.该指标在所有正常人中的波动围C.该指标在绝大部分正常人中的波动围D.该指标在少部分正常人中的波动围E.该指标在一个人不同时间的波动围8、总体标准差描述的是A.所有个体值对总体均数的离散程度B.某样本均数对总体均数的离散程度C.所有样本均数对总体均数的离散程度D.某些样本均数对总体均数的离散程度E.所有某个含量相同的样本均数对总体均数的离散
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 2026年情绪管理能力评估试卷
- 2026年计算机网络应用实操测试题库
- 2026年系统架构设计师专业水平考试要求试题
- 注塑厂巡检常见试题及详细答案
- 商务接待相关试题及参考答案
- 互联网时代下的品牌传播策略探讨真题
- 浙江省义乌市2027届九上化学期末复习检测模拟试题含解析
- 2026年古代文献版本研究评估试卷及答案
- 宁波市安全监理模拟考试试题及答案
- 2026事业单位工勤技能-山东-山东防疫员五级(初级工)历年参考题库含答案详解3套试卷
- 2026江西农商联合银行金融科技人才招聘30人笔试参考题库及答案详解
- 2026年福建厦门市统计局招聘非在编辅助岗位人员1人笔试参考题库及答案详解
- 2026年机械产品检验工专项题库(附答案与解释)
- 成都市龙泉中学高一入学数学分班考试真题含答案
- 2026年河南省中考数学试卷真题及答案解析
- 2026年中考开放性测试题及答案
- 中国博物馆数字技术应用及案例研究2025年度报告
- 2026年高考数学终极冲刺:培优专题04 解析几何 6大重难题型(大题专练)(原卷版及全解全析)
- 食品生产企业飞行检查要点培训
- 娱乐经营许可证延续许可申请书
- 2026年高等职业教育知识考前冲刺模拟题库含答案详解(新)
评论
0/150
提交评论