版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
1、统计学以理解为主,没有名解第一章 绪论(概念、区别变量类型和参数统计量)1.抽样从研究总体中抽取一部分有代表性的个体。2.同质同一总体的个体具有共性(大同小异)。变异同一总体中不同个体间存在的差异。定量变量离散型变量:只可取整数值(月份)连续型变量:可取实数轴上任何数值(血压)3.变量类型(区别)定性变量分类变量(名义变量):如二分类变量(性别-男女)、多分类变量(职业)有序变量(等级变量):如药物疗效-无效/一般/好转变量的转化只能”高级”到”低级”:定量有序分类二值4.参数描述总体分布数量特征的统计指标值(总体统计指标值)。其大小是客观存在的,但往往是未知的,需要通过样本资料来估计。统计量
2、由观察资料(样本资料)计算出来的量(样本统计指标值)。是对总体参数的估计。抽样误差由抽样而造成的样本统计指标(统计量)与总体统计指标(参数)之差。统计学关心的常常是总体参数的大小,其依据却是统计量及其性质。研究设计收集资料5.统计工作的基本步骤整理资料定量资料统计描述平均数统计描述定性资料统计描述相对数分析资料 参数估计统计推断(由样本信息对相应总体的特征进行推断)假设检验第2章 定量变量的统计描述1. 频率分布表(图)的用途:描述变量的分布类型:对称,非对称(偏锋)揭示变量的分布特征:集中趋势、离散趋势集中趋势与离散趋势同时存在,是随机变量分布的两个重要特征,通过描述变量的平均水平(集中趋势
3、)和变异程度(离散趋势)可较全面地揭示数据分布的特征(1)集中趋势的描述- 平均数是分析定量资料的基本指标。用于描述一组同质观察值(变量值)的集中位置,反映一组观察值的平均水平或集中趋势。应用分类算术平均数(均数)几何均数中位数适用范围适用于对称分布资料,尤其是正态分布或近似正态分布资料。1.原始观察值分布不对称,但经对数转换后呈对称分布(正态分布)的变量。2.当变量值之间呈倍数关系(等比数列)。3.频率图呈正偏锋分布,均数变量平均水平的代表性较差1.当一组变量值呈偏态(峰)分布;2.资料的分布类型不清楚时;3.数据大部分比较集中,少部分偏向一侧;4.资料的一端或两端无界限(2)离散趋势的描述
4、-变异指标:极差、四分位数间距、标准差、变异系数。其中以标准差最常用。特点:四分位数间距常与中位数结合来描述变量的平均水平和变异程度。四分位数间距的适用范围即中位数适用范围。标准差常与均数结合起来,从平均水平和变异程度两方面描述变量的分布特征。标准差适用范围即均数适用范围。2. 描述分布形态的统计指标:偏度系数、峰度系数正态分布时,偏度系数与峰度系数均为0.3. 统计表的结构:表号及标题、标目、线条(三线表:顶线、底线、纵标目分割线)、数字。第3章 定性变量的统计描述1. 定性资料常用相对数作为统计描述指标。常用的相对数有:频率、强度、相对比。应用相对数的注意事项:1、防止概念混淆; 2、计算
5、相对数时分母应有足够数量;3、正确计算合计率;4、样本相对数的统计推断;5. 注意资料的可比性;6、频率型指标的解释要紧扣总体与属性(总体不同、属性不同);2. 应用粗率标准化法的注意事项:标准化法的应用范围很广;标准化后的标准化率,已经不再反映当时当地的实际水平,它只表示相互比较的资料间的相对水平。选择不同的”标准”,算出的标准化率也会不同,比较的结果也未必相同。两样本标准化率是样本值。存在抽样误差。比较两样本的标准化率,当样本含量较小时,还应作假设检验。3. 动态数列按时间顺序将一系列统计指标(可以是绝对数,相对数或平均数)排列起来,用以观察和比较该事物在时间上的变化和发展趋势。l 常用的
6、动态数列分析指标有:绝对增长量、发展速度与增长速度、平均发展速度与平均增长速度。l 动态数列的分析不仅可以总结过去,而且可以进行预测,即根据平均发展速度公式计算几年后达到的指标。第4章 常用概率分布1. 二项分布l 概念:观察结果是以两分类变量来表示的,如果每个观察对象阳性结果的发生概率均为,阴性结果的发生概率均为(1);而且各个观察对象的结果是相互独立的,重复观察n次,发生阳性结果的次数X的概率分布为二项分布,记作B(n,)。l 特点:结果只有两种可能;事件的概率不变;每次事件相互独立。l 当n相当大(n100),只要不太靠近0或1,特别是当n和n(1)都大于5时,二项分布近似正态分布。2.
7、 正态分布(1) 形状:一条高峰位于中央,两侧逐渐下降并完全对称,曲线两端永远不与横轴相交的钟型曲线。(2) 参数:位置参数即总体均数,描述正态分布的集中位置。变异度参数(形状参数)为总体标准差,描述正态分布的离散程度。(3) z变换与标准正态分布l 任意一个服从正态分布N(,2)的随机变量,均可以作标准化变换(也称z变换)。l 变换后的z值仍服从正态分布,且总体均数0,总体标准差1。此正态分布称为标准正态分布,用N(0,1)表示。(4)正态曲线下面积分布规律:l 1.96范围内的面积占曲线下总面积的95.00(该范围内的频数占总观察单位数的95%)。l 2.58范围内的面积占曲线下总面积的9
8、9.00(该范围内的频数占总频数的99%)。标准正态分布中(-1.96,1.96)=95%;(-2.58,2.58)=99%(5) 医学参考值范围指特定的“正常”人群(排除了对所研究指标有影响的疾病和有关因素的特定人群)的解剖、生理、生化指标及组织代谢产物含量等数据中大多数个体的取值所在的范围。l 确定医学参考值的方法:百分位数法:可用于任何分布类型的资料,较适合偏态分布;正态分布法:适用于正态分布。第5章 参数估计基础 1.参数估计根据样本统计量估计总体参数的过程。定量资料的参数估计:均数的抽样误差、均数的标准误、t分布、总体均数的可信区间定性资料的参数估计:率的抽样误差、率的标准误、二项分
9、布、总体率的可信区间2.抽样误差由抽样而造成的样本统计量与总体参数、样本统计量之间的差异。3.正态分布总体样本均数抽样分布的特点:各样本均数未必等于总体均数。各样本均数间存在差异。样本均数围绕总体均数,中间多、两边少,左右基本对称,呈近似正态分布;事实上,如果原总体呈正态分布,样本均数围绕总体均数亦呈正态分布。样本均数的变异范围较原变量的变异范围小。随着n增加,样本均数的变异程度减小。4.当样本量n较小时,样本均数的分布并非正态分布,而样本量足够大时(例如,n50),样本均数的分布近似于正态分布。5.均数的标准误样本均数的标准差。可用于反映均数的抽样误差大小。l 均数的标准误可衡量样本均数(估
10、计总体均数)的可靠性。l 二项分布中,频率的标准误=均数的标准误。6. t分布(1)t分布与标准正态分布(z分布)比较相似:t分布和z分布都是以0为中心,中间高,两边低,左右对称的光滑曲线;不同:t分布是一簇单峰分布曲线。比z分布的离散度更大,其性状与自由度有关,越小,t值分布越分散。(即t分布离散度大,z分布离散度小)联系:随着自由度的增大,t分布越来越接近z分布,当自由度为无穷大时,t分布即为z分布。t分布不是正态分布,但标准正态分布(z分布)为特殊的t分布(2)统计学关心的是t分布曲线下的尾部面积(即概率P)与横轴t值的关系。自由度相同时,|t|值越大,t分布的尾部概率越小;t临界值相同
11、时,双侧尾部概率为单侧尾部概率的两倍。(3)t分布的用途:总体均数的区间估计;两均数差别的假设检验t检验。7. 总体均数及总体概率的估计(1) 参数估计:用样本指标(统计量)估计总体指标(参数)。包括点估计和区间估计。点估计难以反映参数估计值对其真值的代表性,多不用。区间估计用已知样本统计量和标准误,按一定的概率估计可能包含总体参数在内的一个范围。而这个范围称为总体参数的置信区间。l 1称为置信度,值一般取0.05或0.01,故最常用总体参数的95%或99%置信区间。l 估计总体均数的置信区间方法:t分布法(当未知且n较小,小样本)正态近似法(当已知,或未知但n足够大,大样本)8.标准差和标准
12、误比较标准差(S)标准差(Sx)相似反映观察值的离散程度反映样本均数的离散程度不同意义表示观察值的变异程度,衡量均数的代表性表示样本均数抽样误差的大小,衡量样本均数的可靠性应用制定医学参考值范围估计总体均数可信区间第6章 假设检验基础1.假设检验判断样本统计量与总体参数之间的差别(或两个或两个以上样本统计量之间的差别)是否由于抽样误差所致的方法。2.区别参数估计和假设检验参数估计假设检验同由样本推总体异已知样本统计量的值推总体统计量的范围假设已知样本统计量的比较,推总体样本统计量比较结果是否相同。3. 假设检验的基本步骤:(1)建立假设零假设(原假设或检验假设) :假设差别是由抽样误差引起(差
13、别无统计学意义)备择假设(对立假设) :假设差别是由处理因素所致(差别有统计学意义)(2) 确定检验水准一般取= 0.05(3)选择检验方法,计算检验统计量 选择检验方法的依据:研究目的、研究设计的类型、资料特点(变量种类、样本大小)等(4) 确定P值P值的定义:在零假设成立的条件下,出现统计量目前值及更不利于零假设数值的概率。(5) 作出推论(结果推断)定量资料假设检验4. (小样本资料两均数比较)t检验的应用条件:(1)随机独立样本(2)样本来自正态分布总体(3)两样本均数比较的t检验要求两样本所来自的总体方差相等,(即方差齐性)单样本资料的t检验配对设计定量资料的t检验两独立样本资料的t
14、检验(两样本来自正态分布总体)目的推断样本来自的总体均数与已知的某一总体均数0(常为理论值或标准值)有无差别。着眼于配对设计(异体配对和自身配对)每一对中两个观察值之差,这些差值构成一组资料,用t检验推断差值的总体均数是否为”0”。判断两独立样本资料的总体均数是否相等。分两种情况(样本量大可不检方差齐性):总体方差相等(方差齐性)总体方差不等检验方差齐性,用两独立样本资料的方差齐性检验(F检验)。5. 二项分布资料的z检验(大样本)近似正态分布,应用条件:n足够大,不太靠近0和1;或n和n(1-)均大于5。6. 假设检验的功效(1)假设检验的两类错误第类错误:拒绝了实际上成立的H0。第类错误的
15、概率大小用表示。第类错误:不拒绝实际上不成立的H0。第类错误的概率用表示。当样本例数n确定时,愈小,愈大;反之,愈大,愈小。要同时减少及,唯一的方法是增加样本例数。(2) 假设检验的功效又称为检验效能或把握度,用符号1-表示。意义是:当所研究的总体与H0确有差别时,按规定检验水准能够发现该差异(拒绝H0)的能力(概率)。影响因素:总体参数的差异、个体差异(标准差)、样本量、检验水准应用假设检验需要注意的问题:a.事先进行严密的统计学设计:1、样本是从同质总体中随机抽取的一部分2、应注意样本含量是否合理3、假设检验的先决条件是比较组间资料是可比的(组间非处理因素均衡)4、单侧检验和双侧检验的选择
16、b.应用假设检验方法必须符合其适用条件c.权衡两类错误的危害来确定的大小d.正确理解假设检验的结论1、 有无差别是相对的2、 正确理解P值的意义3、 结合专业知识作出推断结论第7章 方差分析基础1. 方差分析通过对数据变异的分解来判断不同样本所代表的总体均数是否相同,用于比较两个或两个以上均数的差别。(当用于两两比较时,同一资料所得结果与t检验等价,即t2=F)(1)基本思想:把全部数据的总离均差平方和(SS总)分解为若干部分,其总自由度(v总)也作相应的分解。每一部分表示一定意义,其中至少有一个部分表示各组均数间的变异情况,另一部分表示误差。l 总变异,组间变异(同时反映处理因素和随机误差)
17、,组内变异(只反映随机误差)l SS离均差平方和;MS均方(即方差)l F值为MS组间与MS组内之比。如果处理因素不起作用,MS组间与MS组内之比应近于或等于1;如果试验因素确有作用,则MS组间与MS组内之比应明显大于1。(2)两种计算方法:l 完全随机设计资料方差分析(单一因素方差分析)也适用3种t检验l 随机区组设计资料的方差分析(双因素方差分析)适用于除配对设计t检验外的另外两种t检验通常是将受试对象按性质(非实验因素)相同或相近者组成b个区组(配伍组),每个区组中的k个受试对象分别随机分配到k个处理组中去,构成bk个格子。l 随机区组设计与完全随机设计相比,因利用区组控制了可能的混杂因
18、素,并在进行方差分析时将区组的变异从原组的变异中分解出来。(3) 多个样本均数两两比较l SNK法(q检验):区组中每两组之间比较l Dunnett法:多个实验组与一个对照组均数的比较l Bonferroni法:调整值,确定每次比较的检验水准=/m。使多次比较后犯第一类错误的累计概率较少,适用于所有两两比较。(4) 方差分析的前提条件各样本是相互独立的随机样本样本来自正态分布总体各样本的总体方差相等,即方差齐性(即方差分析前须检验方差齐性)(5) 数据变换(对于符合方差分析假定条件的资料,可用方法有:1.数据变换;2.非参数统计分析;3采用近似检验)对数变换:(1)对数正态分布资料;(2)标准
19、差与均数成比例,或变异系数接近甚至等于某一常数的资料。平方根变换:适用于方差与均数成比例的资料,如服从Poisson分布的资料。平方根反正弦变换:适用于二项分布(百分比)的数据资料。定性资料假设检验第八章 1.可用于:(1)检验两个或多个频率(率或构成比)间的差异;(2)判断两种属性或现象间是否存在关联性;(3)了解实际分布与某种理论分布是否吻合;(4)判断两个数列间是否存在差异等。2.独立样本22列联表资料的 2检验:l 条件:n40,T5(四个格子的理论数均大于5)组别属性合计Y1Y2甲a(T11)b(T12)n1=a+b乙c(T21)d(T22)n2=c+d合计m1=a+cm2=b+dn
20、=a+b+c+dl 四格表:l 公式:3.22列联表资料 2检验校正公式:l 条件:n40,任一格理论数:1T5。l 公式:(校正后2值变小)4. Fisher确切概率法:n40或T1,不能用2方检验,须用Fisher确切概率法直接计算概率。5. 四格表资料的卡方检验注意事项:校正公式仅用于四格表资料;不满足2检验条件时(n40或T1)用Fisher确切概率法直接计算概率;组间比较注意可比性。6. 多个独立样本RC列联表资料的2检验l 条件:T5的格子不超过总格子数的1/5,且T1l RC列联表卡方检验的注意事项:(1)在RC列联表表资料中,当有1/5以上格子的理论数小于5或有任一格子内理论数
21、小于1时,处理的方法有:增大观察例数再做研究将T5或T1所在的行或列与性质相同的相邻行或列合并,删除T5或T1所在的行或列改用RC表的Fisher确切概率法(2) 注意对比组之间的可比性(3) RC表资料卡方检验结果,当P0.05,按=0.05的水准,认为被比较的几个率之间总的来说有差别,但不能据此作出任何两组间均有差别的结论。究竟哪两组间有差别,还需作两两比较。(4) 如果行或列的变量是有序的(单向有序),比较两组(或几组)总的程度有无不同,宜用秩和检验。卡方检验比较的是几组构成比(频率分布)有无不同。7. 2检验用于拟合优度检验:根据样本的频率分布检验其总体分布是否等于某给定的理论分布(泊
22、松分布、二项分布、正态分布等)第9章 基于秩次的非参数检验参数检验以特定的总体分布为前提,对未知的总体参数做推断的假设检验方法。非参数检验不以特定的总体分布为前提,也不针对决定总体分布的参数做推断的假设检验方法,又称任意分布检验。1.秩和检验应用条件:l 总体分布类型未知,或资料分布类型已知,但不符合正态分布的资料。l 某些可能无法精确测量,只能以严重程度、优劣等级、次序先后等表示的等级资料。l 个别数据偏大或数据的某一端或两端为不确定值的资料。l 各总体方差不齐的资料。但符合参数检验应用条件的定量资料,如果选用秩和检验进行统计分析,可能会降低检验功效。2. 平均秩次:当差值绝对值相等时,若符
23、号相同,可顺次编秩也可求平均秩次,若符号不同,求平均秩次并记原来符号。3. 秩和检验的方法:(1) 配对设计资料的符号秩和检验:混合编秩次,分别求秩和。(2) 两组独立样本比较的秩和检验:混合编秩次,分组求秩和。两组连续型变量资料的秩和检验两组有序分类变量资料的秩和检验(1)和(2)均可查表,或样本量较大可用正态近似法z检验,但相同秩次(相持现象)超过25%,则要校正。(3) 多组独立样本比较的秩和检验:混合编秩次,分组求秩和。多组连续变量资料的秩和检验多组有序变量资料的秩和检验(3)求统计量H,若超出H界值表则查2界值表。4. 随机区组设计资料的秩和检验:按区组编秩次,按区组求秩和。(M检验
24、)5. 多个样本间的多重比较第10章 两变量关联性分析(两定量变量间的线性关系)1. 线性相关系数简称相关系数,是定量描述两个随机变量间线性关系密切程度和相关方向的统计指标。(总体相关系数,样本相关系数r)l 相关系数无单位,其值变动于-1与+1之间。l 当0,称X和Y线性相关,简称相关;=0,零相关或X和Y无线性相关。l 0,正相关;0,负相关。l |=1,完全相关(函数关系);|愈接近1,表示两变量间关系愈密切;|愈接近0,表示两变量间关系愈不密切 。2. 常用线性相关系数假设检验方法有两种:(1)直接查相关系数临界值表(2)采用回归系数t检验假设检验目的在于定性地回答两变量之间是否存在线
25、性相关,P值越小并不表示相关性越强。3.线性相关分析应用中应注意的问题;(1)在作直线相关分析前,应先绘散点图,当散点图有线性趋势时,才进行相关分析。(2)线性相关分析要求两个变量都是随机变量,且呈二元正态分布,当两变量均明显不呈正态分布时,最好采用数据变换或采用秩相关(等级相关)分析。(3)相关关系不一定是因果关系,需从专业角度分析(4)出现离群值时慎用相关(5)注意假相关:分层资料盲目合并易出假象。4.秩相关:适用于不服从正态分布、总体分布未知以及原始数据用等级表示的资料。常用Spearman秩相关系数rs(又称等级相关系数)描述两个变量间关联的程度与方向。第十一章 简单线性回归1.线性相
26、关与线性回归比较线性相关线性回归同线性相关与回归分析研究两个(定量)变量间的线性关系。异分析研究两个变量间线性关系的强度和方向分析研究两个连续型变量之间线性依存关系以及建立一个线性回归方程来定量地表达两变量间的线性关系。可用于估计、预测。2. 回归分析研究一个变量如何随另一些变量变化的常用方法。线性回归分析研究两个定量变量X与Y之间线性依存关系,并建立一个线性回归方程来定量地表达两变量间依存变化的数量关系的统计分析方法。3. 回归系数为直线的斜率,它表示X每变动一个单位时,Y变动的单位数。(即相关系数)4. 线性回归模型的适用条件LINE(1)(L)-线性(linear):X与Y呈直线关系(2
27、)(I)-独立(independent):每个个体观察值之间相互独立(3)(N)-正态(normal):任意给定X值,对应的随机变量Y都服从正态分布(4)(E)等方差(equal variance):不同的X值所对应的随机变量Y的方差相等5. 遵循最小二乘法则:保证各实测点距回归直线的纵向距离的平方和为最小。即估计误差平方和 最小。残差(剩余值)实测值y与回归线上的估计值 的纵向距离 6. 总体回归系数的统计推断:t检验:检验总体回归系数是否不为0F检验:检验回归方程是否成立(即检验回归系数是否不全为0)当仅一个自变量时: t2=F7. 决定系数回归平方和与总离均差平方和之比,记为R2。通过决
28、定系数大小反映回归的实际效果。当X与Y都是正态随机变量时,相关系数的平方在数值上就等于决定系数 。8. 线性回归的应用:(1) 统计预测:Y的总体均数的置信区间;给定X=Xp时,Yp的总体均数的点估计为 。计算出对应于所有X值的Y总体均数的置信区间,以相应X为横坐标,Y为纵坐标,将置信区间的上下限分别连起来形成两条弧线间的区域,称为回归直线的置信带。(1-)置信带的意义:在满足线性回归的假设条件下,可以认为真实的回归直线落在两条弧形曲线所形成的区带内,其置信度为1-。个体Y值的预测区间。给定X=Xp时,对应的个体Y值存在一个波动范围。计算出对应于所有X值的Y的预测范围,以相应的X横坐标,Y为纵坐标,将预测区间的上下限分别连起来形成的两条弧形线间的区域,称为Y值的预测带。内:Y的总体均数的置信区间 外:个体Y值的预测区间第12章 多重线性回归与相关1.多重线性回归与多重相关是研究一个连续型变量和其他多个变量间线性关系的统计学分析方法。2.j 自变量Xj对Y的偏回归系数,表示当方程中其它自变量保持不变时,Xj
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 物业企业财务管理制度
- 母猪泌乳期猪苗同步护理手册
- 快递员服务规范与操作手册
- 汽车保险业务流程与理赔服务手册
- 《高速公路隧道爆破作业安全手册》
- 尿不湿生产跨境出口合规手册
- 工程施工现场围挡设置及管理手册
- 突发事件综合应急管理工作手册
- 城乡公共停车场管理手册
- 动物园游客投诉处理工作手册 (标准版)
- 口服抗栓药物消化道损伤防治共识2026
- 2026年gcp考试及答案
- 国家癌症中心2025年癌症统计报告
- 养老院出入院管理制度
- 郴州亚光高纯银电解项目环境影响报告书
- 《JBT 7052-2024六氟化硫高压电气设备用橡胶密封件技术规范》专题研究报告
- 体重管理门诊工作制度
- 2026年低碳技术与城市可持续发展
- 平台防腐施工方案(3篇)
- 科研团队介绍
- 无人机通信技术
评论
0/150
提交评论