版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
1、学习资料收集于网络,仅供参考第一章 绪论1、统计学 ,是关于数据收集、整理、分析、表达和说明的普遍原理和方法;2、讨论对象 :具有不确定性结果的事物;3、统计学作用 :能够透过偶然现象来探测其规律性,使讨论结论具有科学性;4、统计分析要点 :正确选用统计分析方法,结合专业学问作出科学的结论;5、医学统计学基本内容:统计设计、数据整理、统计描述、统计推断;6、医学统计学中的基本概念 1 同质与变异 同质,指依据讨论目的所确定的观看单位其性质应大致相同;变异,指总体内的个体间存在的、确定的差异;统计学通过对变异的讨论来探究事物;2 变量与数据类型 变量 ,是反映试验或观看对象生理、生化、解剖等特点
2、的指标;变量的观测值,称为 数据 分为三种类型:定量数据 ,也称 计量资料 ,指对每个观看单位某个变量用 测量 或其他定量 方法精确获得的定量结果;(如身高、体重、血压、温度等)定 性 数据 ,也称 计数资料 ,指将观看单位按某种属性分组 计数 的定性观看结果;包括二分类、无序多分类;(进一步分为二分类和多分类,如性别分为男和女,血型分为 A、B、O、A B 等),指将观看单位按某种属性的不同程度或次序分成 有序数据 ,也称 半定量数据或等级资料 等级 后分组计数的观看结果,具有半定量性质;统计方法的选用与数据类型有亲密的关系;(3)总体与样本总体,指依据讨论目的确定的全部 值;同质 观看单位
3、的全体,包括全部定义范畴内的个体变量样本,是从讨论总体中随机抽取部分有代表性的观看单位,对变量进行观测得到的数据;抽样,是从讨论总体中随机抽取部分有代表性的观看单位;参数,指描述 总体特点 的指标;统计量,指描述 样本特点 的指标;(4)误差 误差,指观测值与真实值、统计量与参数之间的差别;可分为三种:系统误差,也称统计偏倚,是某种必定因素所致,不是偶然机遇造成的,误 差的大小通常恒定,具有明确的方向性;随机测量误差,是偶然机遇所致, 误差没有固定的大小和方向;抽样误差,是抽样引起的统计量与参数间的差异;抽样误差主要来源于个体的变异;统计学主要讨论抽样误差;(5)概率 概率,是描述某大事发生可
4、能性大小的量度;必定大事,大事确定发生,概率 PU1;随机大事,大事可能发生,可能不发生,概率介于 0PA 1 不行能大事,大事确定不发生,概率 P 0;学习资料小概率大事,大事发生的可能性很小,概率 PA 0.05、或 PA 0.01;学习资料收集于网络,仅供参考医学科研中,PA0.05作为事物差别有统计意义,PA 0.01 作为事物差别有高度统计意义;其次章 定量数据的统计描述 定量数据的统计描述方法:频数表、直方图、统计指标;(1)频数分布 频数分布的目的:明白数据的分布范畴、集中位置以及分布外形等特点,以便依据资料分 布情形挑选合适的统计方法;频数分布的用途:作为陈述资料的形式;便于观
5、看数据的分布类型;便于发觉数据中特大或特小的可疑值;当样本量大时,可用各组段的频率作为概率的估量值;运算全距( range,R): 是一组数据的最大值与最小值之差;RMax-Min 确定组数与组距样本量在 100 例左右,组数挑选815 之间,一般取10 组左右;组距 全距 /组数 确定组限 第一组段必需包括最小值,最终一组段必需包括最大值;最终一组段包括最大值,且一般情形下应包含该组段上限,其余各组段区间左闭右开;运算各组段频数(frequency): 即运算各组段内观看值的个数;运算各组段频率(percent): 即运算各组段频数与总观看值个数之比,用百分数表示;运算累计频数(cumula
6、tive frequency)和累计频率(cumulative percent):累计频数 是由上至下将频数累加;(2)直方图累计频率 是由上至下将频率累加;直方图, 是以垂直条段代表频数分布的一种图形;(3)频数分布表的用途1、作为称述资料的形式,可以代替原始资料,便于进一步分析;2、便于观看数据的分布类型;资料分布类型分为:对称分布和偏态分布;在统计分析经常需要依据资料的分布形式挑选相应的统计分析方法,因此对数据分布形式 的判定特别重要;3、便于发觉资料中某些远离群体的特大或特小值;4、当样本含量比较大时,可用各组段的频率作为概率的估量值;集中趋势的统计指标 平均数, 是描述一组观看值集中
7、位置或平均水平的统计指标,常作为一组数据的代表值用 于分析和进行组间的比较;常用的有算术均数、几何均数、中位数、百分位数等;算术均数, 等于一个变量全部观看值的和除以观看值个数;总体均数用希腊字母 表示,样本均数用符号 拔 表示;算术均数 适用于 对称分布的资料,如分布匀称的小样本数据或近似正态分布的大样本数据;算术均数易受极端值的影响,并且受极大值的影响大于受微小值的影响;几何均数几何均数( geometric mean,G), 等于一个变量全部n 个观看值的乘积的n 次方根;几何均数适用于取对数后近似呈对称分布的资料,特殊是右偏态分布数据;医学讨论中常学习资料学习资料收集于网络,仅供参考用
8、于比例数据;【注】运算几何均数的观看值不能小于或等于0,由于无法求对数;中位数中位数( median,M), 是在按大小次序排列的变量的全部观看值中,位于正中间的一个 或两个数值;当数据呈偏态分布、或频数分布两端无确定数值,均宜采纳中位数描述集中趋势;中位数的确定取决于它在数据序列中的位置,因此对极端值不敏锐;百分位数 百分位数( percentile), 是一个位置指标,它将一组变量值排列后划分为如干相等部分的分割点数值;用Px 表示, X 用百分数表示;X %,其右侧( 表示在依据升序排列的数据中,其左侧( Px )的观看值个数在整个样本中所占百分比为Px )的观看值个数在整个样本中所占百
9、分比为100X % ;百分位数不论资料分布类型均可运算,在实际工作中常用于确定医学参考值范畴;在假设 检验中用作拒绝或不拒绝检验假设的界值;百分位数并非由全部观看值综合运算得来,因此,它不如均数和标准差精确;然而中间部 分的百分位数因不受资料中个别极端数据的影响,具有较好的稳固性;小 结指 标意 义适用场合均 数个体的平均值对称分布,特殊是正态分布资料;几何均数平均倍数取对数后对称分布;中位数位次居中的观看值非对称分布;半定量资料;末端无准确数值;分布不明;变异程度的统计指标 变异指标,又称离散指标,用以描述一组计量资料各观看值之间参差不齐的程度;变异指标越大,观看值之间差异愈大,说明变异程度
10、越大;反之亦然;常用的有极差、四分位数间距、方差、标准差和变异系数;极 差 极差( range,R),等于一个变量全部观看值中最大值与最小值之间的差值;R Max Min 缺点:没有利用观看值的全部信息,不能反映其它数据的离散度;各样本含量大小悬殊时,不宜比较其极差;极差的抽样误差也较大,所以不够稳固;极差仅适用于对未知分布的小样本资料作粗略的分析;四分位数间距四分位数, 是统计学对特殊的三个百分位数P25% 、 P50% 和 P75%的统称四分位数间距(quartile range ,Q), 等于第三四分位数与第一四分位数之间的差值;Q P75% P25% 学习资料学习资料收集于网络,仅供参
11、考缺点:没有利用观看值的全部信息,不能反映其它数据的离散度;四分位数间距仅用来描述大样本偏态资料的变异情形;方 差 方差( variance), 是描述一个变量的全部观看值与总体均数的平均离散程度的指标;总体方差用 2表示,样本方差用S2 表示;标准差标准差( standard deviation,S ),是描述一个变量的全部观看值与均数的平均离散程度的指标;总体标准差用 表示,样本标准差用S 表示;标准差 方差或标准差属同类变异指标,它们多用来描述匀称分布或近似正态分布的资料,大、小 样本均可,其中以标准差的应用最广,通常与均数结合使用;比如在很多医学讨论报告中 常用 X 拔S 的形式表达资
12、料;变异系数变异系数( coefficient of variation,CV ),是一个度量相对离散程度的指标;CV 是无量纲的指标,可以用来比较几个量纲不同的指标变量之间的离散程度的差异,或 比较量纲相同但均数相差悬殊的变量之间的离散程度的差异;小 结指 标意 义适用场合极 差观看值的取值范畴不拘分布形式,概略分析;四分位数居中半数观看值的极差非对称分布;半定量资料;间距观看值距离均数的平均程度末端无准确数值;分布不明;标准差对称分布,特殊是正态分布资料;(方差)变异系数变异程度大小的对比不同量纲的变量间比较;量纲相同但数量级相差悬殊的变 量间比较;第三章 正态分布与医学参考值范畴 正态分
13、布, 是一种连续型随机变量常见而重要的分布;正态曲线 ,是一条高峰位于中心,两侧逐步下降并完全对称,曲线两端永久不与横轴相交 的钟型曲线;假如随机变量X 的分布听从概率密度函数和概率分布函数称连续型随机变量X 听从正态分布,记为 XN , 2 为圆周率,e 为自然对数的底值, 为总体标准差, 为总体均数;正态分布的特点学习资料学习资料收集于网络,仅供参考1、正态分布是单峰分布,以 X = 为中心,左右完全对称,正态曲线以 X 轴为渐近线,两端与 X 轴不相交;2、正态曲线在 X = 处有最大值,其值为f =1/ 2 ;X 越远离 ,fX 值越小,在 X= 处有拐点,出现钟形;3、正态分布完全由
14、参数 和 打算; 是位置参数,打算正态曲线在 X 轴上的位置;在 肯定时, 增大,曲线沿横轴向右移动; 较小,曲线沿横轴向左移动; 是外形参数,打算正态曲线的分布外形; 越大,曲线的外形越“ 矮胖 ” ,表示数据分布越分散; 越小,曲线的外形越“瘦高 ”,表示数据分布越集中;正态曲线下面积分布规律1、听从正态分布的随机变量在某一区间上的曲线下面积与其在同一区间上取值的概率相等;2、曲线下的总面积为1或100%,以为中心左右两侧面积各占50%,越靠近 处曲线下面积越大,两边逐步削减;3、全部的正态曲线,在 左右的任意个标准差范畴内面积相同;一些特殊情形,在 范畴内的面积约为 68.27%,在 1
15、.96 范畴内的面积约为 95.00%,在 2.58 范畴内的面积约为 99.00%;标准正态分布对任意一个听从 N , 2 分布的随机变量 X ,经 Z=X- / 变换都可以转为 =0、 =1的标准正态分布,也称随机变量的标准化变换;标准正态分布的应用实际应用中,经 z 变换可把求解任意一个正态分布曲线下面积的问题,转化成标准正态分布曲线下相应面积的问题;正态分布的应用1、制定医学参考值范畴2、质量掌握3、正态分布是很多统计方法的理论基础医学参考值范畴医学参考值范畴,指正常人的解剖、生理、生化、免疫及组织代谢产物的含量等各种数据的波动范畴;医学参考值范畴,习惯上是包含 95%的参照总体的范畴
16、;制订的留意事项a、抽取足够例数的同质“ 正常人 ” 样本“正常人 ”的定义,样本量(n120),随机化;b、确定具有实际意义的统一测量标准指标的测量方法等要有规定,掌握测量误差;c、依据指标的性质确定是否要分组依据实际情形、专业学问;d、依据指标含义打算单、双侧范畴单侧下限,过低反常;单侧上限,过高反常;双侧,过高、过低均反常;e、挑选适当的百分范畴绝大多数人,一般 80%、90%、95%、99%;削减误诊,取较大范畴;削减漏诊,取较小范畴;f、估量参考值范畴学习资料学习资料收集于网络,仅供参考依据资料分布类型:正态分布法、百分位数法;第四章 定性数据的统计描述 相对数 ,是两个有关的确定数
17、之比,也可以是两个统计指标之比;运算相对数的意义 主要是把基数化作相等,便于相互比较;相对数 主要用于 定性资料的统计描述;常用的指标有频率、构成比、相对比;频 率 频率 (rate),表示在肯定范畴内某现象的发生数与可能发生的总数之比,说明某现象显现 的频率或概率;总体率 用 来表示, 样本率 用 P 来表示;需要留意的是,率在更多情形下是一个具有时间概念的指标,即用于说明在一段时间内某 现象发生的强度或频率;构成比 构成比, 表示某事物内部各组成部分在整体中所占的比重;构成比之和应为 100,某一构成部分的增减会影响其他构成部分相应的削减或增加;而 某一部分率的变化并不影响其他部分率的变化
18、,且其平均率不能简洁地将各率相加后平均 求得;相对比 相对比 ,是 A、B 两个有关联指标之比,用以描述两者的对比水平;相对危急度( relative risk ,RR), 用于流行病学中队列讨论资料;比数比( odds ratio,OR ),用于流行病学中病例对比讨论资料;小 结指 标运算公式适用场合频率n/N估量总体中某一结局发生的概率或可能性构成比n1/N,n2/N, ,nk/N估量总体中全部可能结局所占的比例或比重相对比A/B估量两个指标的相对大小构成比表示某事物内部各部分所占的比例或比重,频率是说明某现象发生的频率或概率;构成比的分子中的个体肯定是分母中的一部分,而相对比就不肯定;构
19、成比是同一类事物 的数值之比,相对比可以是任意两个数值之比;相对数的使用留意 a、区分构成比和频率频率,强度相对数;构成比,结构相对数;b、使用相对数时分母不宜过小“ 3例中死亡例 ” ;如分母太小,用确定数表示,如 c、留意相对数的可比性讨论对象要同质,方法要相同,观看时期要一样等;d、考虑存在抽样误差对总体进行推断应作统计学检验;率的标准化 标准化率, 是为了在比较两个不同人群的患病率、发病率、死亡率等资料时,排除内部构 成(如年龄、性别、工龄、病程长短等)不同而不能直接比较所产生的影响;标准化率仅用于相互比较,不代表实际水平;当标准构成不同时,标准化率一般也不相同学习资料学习资料收集于网
20、络,仅供参考;标准构成的选取从外部取一个公认的标准构成比,如全国范畴或全省范畴的数据、国际间比较时取世界 通用标准;将几个组的观看例数合并,运算出合并的构成比,以其作为标准构成比;取某一个组的构成比为标准构成比;医学中常用相对数指标 表示某年某地每千人中的死亡人数;反映当地居民总体死亡水平 死亡率,又称粗死亡率,;对不同地区的死亡率进行比较时,应留意不同地区人口年龄或性别构成的影响;如年龄或 性别构成存在差异,需先将死亡率标化后再进行比较;年龄别死亡率,表示某年某地某年龄组每千人口中的死亡数;10 万人中因某种疾病死亡的人数;反映各类病伤死亡对居 死因别死亡率,表示某年某地每 民生命的危害程度
21、;死亡 因构成,也称相对死亡比,比;反映各种死因的相对重要性;表示全部死亡人数中,死于某死因者占总死亡数的百分疾病统计指标发病率, 表示在肯定期间内,肯定人群中某病新发生的病例显现的频率;反映疾病对人群 健康影响和描述疾病分布状态的一项测量指标;患病率,也称现患率,表示某一时点某人群中患某病的频率;反映病程较长的慢性病的发 生或流行情形;病死率, 表示某期间内,某病患者中因某病死亡的频率;反映该疾病的严峻程度和医疗水 平;治愈率, 表示接受治疗的病人中治愈的频率;第五章 统计表与统计图 统计表, 把反映某事物的数量特点以及相互关系的统计数字用表格的形式归纳起来;特点:防止冗长的文字表达、削减篇
22、幅;便于表达事物间的内在联系和区分;便于分析、比较并易于发觉和订正错误;编制原就a、重点突出,简洁明白一张表表达一个中心内容或主题;b、主谓分明,层次清晰定语在标题内,主语作为横标目,谓语作为纵标目;c、数据表达规范、文字和线条从简 结 构a、标题位于统计表的最上部,应包括表的编号;b、标目纵标目标示相应一列(或数列)的内容;横标目标示相应行的内容;c、线条学习资料学习资料收集于网络,仅供参考不宜太多,一般为三线表;不答应使用竖线与斜线;d、数字一律使用阿拉伯数字;同一指标的小数位数应一样,位次要对齐;数值为零时应写“0” ,缺省用“ ” 表示,不存在或不需要用“ ” 表示;e、备注不是统计表
23、的必需项目,需要时才用;位于统计表的最下部,表格之外,用“*” 号标出;统计图统计图,是指用几何图形(点、线段、直条等)显示统计指标的大小、对比关系或变化趋势;特点:与统计表相比,统计图更加直观,更便于比较和分析;但它不能准确地显示数字大小,因 此常与统计表一并使用;常用的统计图有:条图、圆图、百分条图、线图、直方图等;制作原就a、依据资料性质、分析目的选用适当的统计图 b、一个图表达一个中心内容或主题;c、图形应精确、美观;结 构a、标题位于统计图的下方,应包括图的编号;b、图域一般用直角坐标系第一象限的位置表示图域;c、标目纵标目和横标目,表示纵轴和横轴数字刻度;一般有度量衡单位;d、图例
24、对图中不同颜色或图案代表的指标进行注释;图例放在横标目与标题之间,或放在图域中;e、刻度刻度数值从小到大,纵轴由下向上,横轴由左向右;描述定量数据的统计图 直方图, 用于表示连续变量频数分布情形;线图 ,适用于描述一个变量随另一个变量变化的趋势;半对数线图, 用来比较事物之间相对的变化速度;箱 图,适用于比较多组资料的集中趋势和离散趋势;一般选用五个描述统计量(Min 、P25、M 、P75、Max )来绘制;误差条图, 适用于比较多组资料的均值和可信区间;散点图, 用点的密集程度和变化趋势来表示两指标之间的直线或曲线关系;条图 ,适用于各组资料之间指标的比较;圆图, 描述一组构成比资料;学习
25、资料学习资料收集于网络,仅供参考百分条图, 描述多组构成比资料小 结图形主要目的说明条图比较各组之间的统计指标一个坐标轴为组名称,另一个坐标轴为频率;圆图的差别多个指标变量可放在一个图中描述变量的构成比没有坐标轴;用图例区分各部分百分条图比较多个指标变量的构成一个坐标轴为各变量名称,另一个坐标轴刻度线图比为 0100% ;用图例区分各部分描述一个变量随另一个变两个变量的观看值必需一一对应;横轴为自变半 对 数 线量变化的趋势量,纵轴为因变量同上因变量的变异较大时使用;其他同上图箱图比较一个变量在多个组上一个坐标轴为组名称,另一个坐标轴为该变量散点图的分布的取值描述两个指标变量之间的两个变量的观
26、看值可以不一一对应;横轴为自直线相关关系变量,纵轴为因变量第六章参数估量抽样误差 :由个体差异和抽样造成的样本统计量与总体参数的差异;包括:样本统计量与总体参数间的差异,样本统计量间的差异;具有如下特点:1、各样本均数未必等于总体均数;2、 各样本均数间存在差异;3、样本均数的分布环围着总体均数出现中间多、两边少、左右基本对称,近似听从正态分布;4、样本均数的变异范畴较之原变量的变异范畴小;5、随着样本含量的增大,样本均数的变异范畴逐步缩小;均数的标准误 标准误 (standard error ,SE),指样本统计量的标准差;均数的标准误 (standard error of mean,SEM
27、 ),指样本均数的标准误;它反映样本均数间的离散程度,反映样本均数与相 应总体均数间的差异,说明白均数抽样误差的大小;在 n 肯定的情形下,标准误与标准差呈正比,说明当总体中各观测值变异较小时,抽到的X拔与可能相差较小,X拔用估量 的牢靠程度高;反之,当总体中各观测值变异较大时,牢靠程度较低;标准误与样本含量的平方根呈反比,说明在同一总体中随机抽样,率的抽样误差n 越大,标准误越小;率的标准误 (standard error of rate,SER),指样本率的标准误;它反映样本率间的离散程度,反映样本率与相应总体率学习资料学习资料收集于网络,仅供参考间的差异,说明白率抽样误差的大小;总体率标
28、准误用 p 表示,样本率标准误用Sp 表示;总体均数的估量概 述点估量 (point estimation ),是用样本统计量直接作为其总体参数的估量值;区间估量 (interval estimation ),是按预先给定的概率 1- 所确定的包含未知总体参数的一个范畴;点估量: 优点:表达简洁 缺点:未考虑抽样误差,无法评判参数估量的精确程度可信区间在区间估量中,预先给定的概率1- ,称为 可信度 ( confidence level ),常取95% 或99% ;通过可信度,运算得到的区间范畴,称为 可信区间 ( confidence interval ,CI );可信区间由两个数值界定的可
29、信限(confidence limit ,CL )构成,较小的数值为下限(lower limit ,L ) ,较大的数值为上限(upper limit , U ),一般表示为 LU ;可信度为 95% 可信区间的涵义:如重复 100次样本含量相同的抽样,每个样本均按同一方法构建 95%可信区间,就理论上平均有95个可信区间包含了总体均数,只有5个可信区间未包含;可信区间估量的优劣:精确性,反映可信度 1-的大小,其值越接近 1越好;精确性,用可信区间的宽度 CU CL衡量,宽度越小越好;t 分布t 分布: 主要用于总体均数的区间估量和 t 检验等; 为自由度 (degree of freedo
30、m,df ),指能够自由取值的变量个数;t 分布的特点: 1、t 分布图是一簇曲线,曲线的外形变化与自由度有关;学习资料学习资料收集于网络,仅供参考2、随 的增大,曲线越来越接近标准正态分布曲线;3、当 时, t 分布的极限分布就是标准正态分布;4、t分布的密度曲线下面积有肯定的规律性;在 t 界值表中,横标目为自由度,纵标目为尾部概率;一侧尾部面积称为单侧概率();one-tailed probability ),两侧尾部面积之和称为双侧概率(two-tailed probability 从t界值表中看出:在相同自由度时,小 结 t 值越大,概率 P越小;区分总体均数的可信区间参考值范畴点含
31、义按预先给定的概率确定的“ 正常人 ” 的解剖,生理,未知参数 的可能范畴;总体均数的波动范畴生化等某项指标的波动范 围;个体值的波动范畴运算 未知:正态分布:z /2S 公式双侧) 已知或 未知但 n60:偏态分布: Px P100-x 学习资料n越大, CI越小; n,双侧)样本n越大,参考值范畴越稳学习资料收集于网络,仅供参考两总体均数差值的区间估量在实际工作中,经常需要估量两总体均数之差信区间; 1 2的大小,需估量两总体均数差值的可总体率的区间估量 小样本率的区间估量:在样本例数较小,且样本率接近1或0时,利用二项分布可估量其总体率的1- 可信区间;当n50,样本例数 n和阳性例数
32、Xn/2时,直接查表得到95%和99%可信区间;当阳性例数 X n/2时,用 nX查表,获得总体阴性率可信区间,再用 1减去总体阴性率可信区间,既为总体阳性率可信区间;大样本率的区间估量在样本例数较大,且p 和 1p 均不太小,如np 与 n1p均大于 5 时,样本率p 的抽样分布近似正态分布,可按正态分布近似法求总体率的1- 可信区间;两总体率差值的区间估量设两样本率分别为 p1和p2,当 n1与 n2均较大,且 p1 ,1 p1及p2 ,1p2均不太小,如 n1 p1 、 n11 p1 、 n2 p2 、 n21 p2均大于 5时,可采纳正态近似法对两总体率差值进行可信区间估量;第七章 假
33、设检验假设检验 (hypothesis testing )也称显著性检验(significance 学习资料学习资料收集于网络,仅供参考test ),是用来判定样本与样本,样本与总体的差异是由抽样误差引起仍是本质差别造成的统计推断方法;假设检验的基本思想反证法思想:先提出假设,再用适当的统计方法确定假设成立的可能性大小,如可能性小,就认为假设不成立;小概率大事 :是指在一次试验中基本上不大会发生的大事;假设检验的基本步骤a、建立假设无效假设( null hypothesis ),记为 H0,指需要检验的假设,即 1= 2;b、确定检验水准检验水准(level of a test )也称为显著性
34、水准(significance level ),是预先规定的判定小概率大事的概率尺度,记为 ;实际中一般取 =0.05 或 =0.01 ;c、挑选检验方法,运算统计量依据资料类型、讨论设计方案和统计推断的目的,挑选适当的检验方法和运算公式;如: t 检验、 u 检验、 F 检验、 2检验;c、确定 P 值,作出统计推断结论P 值( probability value),指由 H0 所规定的总体做重复随机抽样,获得等于及大于当前检验统计量的概率;确定 P 值的方法:依据检验统计量的自由度、检验水准,查检验统计量对应的界值表,通过检验界值,得到与检验统计量相对应的 P 值范畴;如: u0.05/2
35、=1.96对应的 P 值为 0.05;d、确定 P 值,作出统计推断结论假设检验规定:假如一次试验结果学习资料学习资料收集于网络,仅供参考.P,拒绝 H0 ,结论为 “ 差别有统计学意义”;.P,不拒绝 H0 ,结论为 “ 差别没有统计学意义” ;P 值的习惯表述:P 0.05称 “不显著 ”(not significant );P 0.05 称“ 显著 ” ( significant );P 0.01 称“ 特别显著 ” (highly significant );假设检验中两类错误假设检验是利用小概率反证法思想,从问题的对立面 H0 动身间接判定要解决的问题 H1是否成立,然后在假定 H0
36、成立的条件下运算检验统计量,最终依据 P值判定结果,此推断结论具有概率性,因而无论拒绝仍是不拒绝 H0,都可能犯错误;检验效能 ( power of test ),指当两总体确有差别,按 水准,假设检验能发觉其差别的才能;记为 1- ;愈小, 愈大;愈大, 愈小;如要同时减小型错误和型错误,唯独方法是增加样本量;第七章单样本t 检验( one sample t-test),适用于样本均X拔与已知均数 0 的比较,目的是检验样本均数0所代表的未知总体均数 是否与已知总体均数 0 有差别;已知总体均数 0一般指理论值、标准值或经过大量观看所得到的稳固值;配对样本均数 t 检验( paired t-
37、test),适用于配对设计的计量资料两相关样本均数的比较,目的是检验两相关样本均数所代表的未知总体均数是否有差别;配对设计( paired design),是将受试对象按某些重要特点相近的原就配成对子,每对中的学习资料学习资料收集于网络,仅供参考两个个体随机地赐予两种处理;配对设计处理安排方式:.将同一受试对象处理前后的结果进行比较;.同一受试对象随机安排接受不同处理;.同一标本的两个部位测试同一指标;.两个同质受试对象分别接受两种处理;两独立样本均数 t 检验( two independent samples t-test),适用于完全随机设计两独立样 本均数的比较,目的是检验两独立样本均数
38、所代表的未知总体均数是否有差别;完全随机设计(completely random design):从某讨论总体随机抽取肯定数量的讨论对 象,将其随机安排到两组,接受不同的处理后,测量某指标后进行组间比较;两独立样本均数t 检验要求两样本所代表的总体方差相等,即方差齐性留意事项:a、假设检验结论正确的前提作假设检验用的样本资料,必需能代表相应的总体,各对比组具有良好的组间均衡 性;b、检验方法的选用及其适用条件依据分析目的、讨论设计、资料类型、样本量大小等选用适当的检验方法;c、双侧检验与单侧检验的挑选依据讨论目的和专业学问予以挑选,一般选用双侧检验;d、假设检验的结论不能确定化列出概率的准确数
39、值或给出范畴,注明采纳单侧检验仍是双侧检验;e、正确懂得P 值的统计意义第八章方差分析方差分析,能用于两个或两个以上样本均数的比较,仍可分析两个或多个讨论因素的交互 作用以及线性回来方程的假设检验等;基本思想是:分析变异,也就是分解变异,即将数据总的变异分解为处理因素引起的变异 和随机误差引起的变异,通过对两者进行比较作出处理因素有无作用的统计推断;应用条件 .各组样本是相互独立的随机样本 .各组样本都来自正态总体;.各组总体方差相等,即方差齐性;完全随机设计的方差分析 完全随机设计,是按一个处理因素随机分组,统计分析处理因素各个水平组间均数差别有 无统计学意义;a、 变异的分解 b、 自由度
40、分解 c、 估量方差(均方)d、 F 统计量的运算 e、 F 分布及确定 P 值 随机区组设计的方差分析 随机区组设计(randomized block design),是先按对试验结果有影响的非讨论因素将受 试对象配成如干个区组,再分别将各区组内的受试对象随机安排处处理水平不同的各个 组;学习资料学习资料收集于网络,仅供参考多个样本均数的两两比较经方差分析,如各组的均数差别无统计学意义,就不需要作进一步的统计处理,但是当方差分析结果为 P 时,只说明各组总体均数不相同或不全相同,不能说明各组总体均数间有差别;假如要分析哪两组间均数有差别,需进行多组均数间的多重比较;多个样本均数两两比较方法挑
41、选策略第九章 卡方检验方差齐性检验的作用:Bartlett 检验法主要适用于正态分布资料的方差齐性检验问题;卡方检验常用于 推断两个总体率(或构成比)之间有无差别; 2 值反映了实际频数与理论频数的吻合程度;如假设成立,实际频数与理论频数的差值较小, 2值也较小;如假设不成立,实际频数与理论频数的差值较大, 2值也较大;配对四格表资料的卡方检验计数资料的配对设计常用于两种检验方法、培育方法、诊断方法的比较;特点是对样本中各观看单位分别用两种方法处理,然后观看两种处理方法的某两分类变量的计数结果R C 列联表资料的卡方检验用于多个样本率的比较、两个或多个构成比的比较;基本数据为:多个样本率比较时
42、,有 R 行 2 列;两个样本构成比比较时,有 2 行 C 列;多个样本构成比比较时,有 R 行 C 列;采纳 Bonferroni 法进行多个样本率的两两比较,步骤如下:对需要比较的行列表资料进行 2分割,变成多个四格表;对每个四格表进行 2检验;采纳( = / 比较次数 )运算调整的水准,其中 为事先确定的水准;以 调整作为检验检验水准,作出结论;R C 列表表 2检验留意事项:如有 1/5 以上的格子显现1T5 ,就 增大样本含量,以达到增大理论频数的目的; 结合专业,删去理论频数太小的格子对应的行或列; 结合专业,将理论频数太小的行或列与性质相近的行或列合并;学习资料学习资料收集于网络
43、,仅供参考 用双向无序 R C表资料的 Fisher准确概率法;b、多个样本率比较,如统计推断为拒绝 H0 ,接受 H1 ,只能认为各总体率或构成比之 间总的来说有差别;如要进一步明白哪两者之间有差别,可用卡方分割法,或者调整检验 水准;c、对于单向有序的 R C 表资料,在比较各处理组的效应有无差别时,应当用秩和检验;第十章 非参数秩和检验 参数检验,是基于随机样原来自某已知分布的总体,推断两个或两个以上总体参数是否相 同的方法;常用的方法有:t 检验、方差分析;特点主要有:对总体参数进行估量或检验是主要目的;要求总体分布已知;统计量有明确的理论依据;有严格的使用条件,要求总体分布符合正态分布、总体方差齐性、数据间相互独立;非参数检验( nonparametric test),是在不考虑总体参数和分布类型的情形下,对总体的 参数和分布位置进行检验的方法;常用的方法有:秩和检验、符号检验;特点主要有:适用范畴广,可应用于总体分布类型未知的计量资料、偏态分布的资料、等级资料、不 满意参数检验条件的资料等;受限条件少,更适合一般情形;具有较好的稳健性;方法简便,易于懂得和把握;秩和检验( rank sum test),是基于秩次的假设检验方法,属非参数检验范畴;秩次( rank ),是将数
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- UC矩阵试题与答案分享
- 汽修初级专项试题及答案
- 腹腔镜手术术前的护理和术后的观察要点
- 教育咨询基础试题与答案梳理
- 大学逻辑期末试题及答案分享
- OOS培训检验试题及答案分析
- PLC原理及应用测验试题及答案
- 护理人员技能提升培训成果
- DN600顶管及牵引管工程施工方案
- 2026病毒性肝炎诊治试题及答案
- 2026浙江金华市自然资源和规划局婺城分局招聘编外人员1人考试备考试题及答案详解
- 2026年高处作业企业员工安全培训考试题及答案
- 2026中国银行消防安全专项社会招聘备考题库含答案详解【培优】
- 化工园区公共管廊钢结构工程竣工验收报告
- 固态聚合物锂离子电池项目可行性研究报告
- 2026年贵州省、市两级机关公开遴选公务员考试(公共科目)综合能力测试题及答案
- 倍智tas人才测评系统题库及答案
- 2026年医院抗菌药物临床应用管理试题
- 2026年一级建造师(港口与航道工程)模拟考试题及答案
- 抗日战争胜利纪念日
- 2024年黎明职业大学辅导员考试笔试真题汇编附答案
评论
0/150
提交评论