版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
多变量数据的统计描述与统计推断
在医学研究中,尤其在临床试验中,每个观察对象记录的观察结果通常有多个反应变量(responsiblevariable)。例如,血压记录有收缩压、舒张压、脉压等;血脂记录有胆固醇脂、甘油三酯、磷脂、未脂化脂肪酸等;心功能、肺功能、微循环的检测记录项目则可多达十几个乃至几十个,这种有多个反应变量的数据称为多变量数据(multivariatedata)。在数据处理时,如果只有一个反应变量但有多个解释变量,有时也称为多变量数据。要注意多变量数据与多因素试验的区别:多因素试验指的是有多个干预因素(分组因素)的试验,尽管析因设计方差分析和正交设计方差分析可以分析多个试验因素的作用,但试验结果只有一个反应变量,仍然是单变量方差分析。本章的所有统计描述与统计推断都是建立在单变量分析的基础之上,如单变量均数、单变量方差、单变量t检验、单变量方差分析等,只是在描述和表达时采用了适合多变量的向量和矩阵的表示方法。第一节描述统计量一、均数向量与离差矩阵
1.均数向量设有n个观察对象,每个观察对象记录了m个反应变量,
X’i=(xilxi2
•••xim),i=1,2,•••,nm个反应变量的样本均数构成均数向量,记为
2.离差矩阵任意两个反应变量Xj,Xk离均差积和ljk构成一个m×m矩阵,称为离差矩阵,记为
其中,ljj是第j个反应变量的离均差平方和,ljk是第j个反应变量与第k个反应变量的离均差积和,并且有ljk=lkj。离差矩阵L不仅是多变量数据统计描述的重要统计量,更是多变量数据统计分析最重要的中间结果。下面介绍的协方差矩阵和相关矩阵的计算都依赖离差矩阵L,第以后的多元分析,如多元回归、判别分析、聚类分析等也要用到L矩阵。
二、协方差矩阵任意两个反应变量Xj,XK的样本方差Sjk构成一个m×m矩阵,称为样本方差—协方差矩阵,简称样本矩阵,记为
三、相关矩阵任意两个反应变量Xj,XK的样本相关系数rjk构成一个m×m样本相关矩阵(correlationmatrix),记为
例14-1在一项健康调查中,随机抽取某单位15名正常成年男性测量血脂,记录甘油三酯(mmol/L)、总胆固醇(mmol/L)和高密度脂蛋白胆固醇(mmol/L),结果见表14-1。试对这三个反应变量进行多变量描述。
以上三个多元描述统计量,描述三个测量指标的平均水平,S描述这三个指标的变异程度,R描述这三个指标的相关性。由R可知,甘油三酯与总胆固醇的相关系数为0.456(p=0.088),甘油三酯与高密度脂蛋白胆固醇的相关系为0.284(P=0.305),总胆固醇与高密度脂蛋白胆固醇的相关系数为0.623(p=0.013)。
四、多元正态分布
在单变量统计描述和推断中,通常假定数据服从正态分布。同理,在多变量统计描述和推断中,通常假定数据服从多元正态分布。设μ为m个反应变量的总体均数向量,σjk为第j个反应变量与第k
个反应变量的总体协方差,σjk(j,k=1,2,•••,m)构成m×m的总体协方差矩阵Σ。m维正态分布的密度函数为
第二节组间差别比较
一、单组资料对于单变量资料,假定样本观察值X服从正态分布N(µ,σ2),样本均数服从正态分N(µ,σ2/n),可采作t检验(H0:μ=μ0)
已知当m=1时,在H0:μ=μ0成立条件下,检验统计量t2=F。当m>1时,在H0:μ=μ0成立条件下,HotellingT2与F有如下关系
因此,根据一个样本均数向量检验其总体均数向量是否为μ0
,可采用公式(14-10)定义的F值作为检验统计量。在H0:μ=μ0成立条件下该统计量服从F分布,当n较大时,近似地服从自由度为m的χ2分布。
例14-2随机抽取某单位5名怀疑有冠心病的成年男性,测量其甘油三酯(mmol/L)、总胆固醇(mmol/L)和高密度脂蛋白胆固醇(mmol/L)含量。根据例14-1已知,该单位正常成年男性的甘油三酯、总胆固醇和高密度脂蛋白胆固醇均数分别为1.02mmo1/L、2.73mmol/mmol/L和2.04mmol/L。问该单位怀疑冠心病成年男性的血脂与正常成年男性有无差别?
表14-2中列出了怀疑冠心病成年男性的血脂三个指标与正常成年男性血脂均数的差异,如果其总体均数向量不等于,则可认为怀疑冠心病成年男性的血脂与正常成年男性有差别。
查F界值表,F0.05(3,2)=19.16,F0.01(3,2)=99.17,0.01<p<0.05,拒绝H0,接受H1,可认为怀疑冠心病成年男性的血脂与正常成年男性有差别。由样本均数向量=(0.776,0.780,-0.574)可知(经单变量统计检验),可认为该单位怀疑冠心病成年男性甘油三酯和总胆固醇高于正常成年男性,高密度脂蛋白胆固醇低于正常成年男性。二、两组比较
例14-3某妇幼保健院将孕妇随机分两组,一组接受孕期保健教育,另一组作为对照。表14-3是同一日出生的13名顺产婴儿的体重和身长,问孕期保健教育对婴儿生长发育有无促进作用?表14-3中用两个指标反映婴儿的生长发育状况,通过孕期保健教育组和对照组婴儿样本均数向量和的比较,推论两组总体均数向量μ1和μ2是否相等,进而得出孕期保健教育对婴儿体格发育有无影响的结论。查F值表,F0.05(2,10)=4.10,F0.01(2,10)=7.56,0.01<P<0.05,拒绝H0,接受H1,可以认为孕期保健教育组出生婴儿的生长以育优于对照组,即孕妇孕期的保健教育对婴儿生长发育有促进作用。
三、多组比较
1.多变量方差分析单变量多个均数假设检验,假定g(≥2)组样本观察值分别来自正态总体N(μ1,σ2),N(μ2,σ2),…,N(μ
g,σ2
),根据样本均数推论H0:μ1
=μ2=•••μ
g是否成立,采用多个均数比较的方差分析的方法(见第一讲)。同理,当有多个反应变量时,是通过g个均数向量推论H0:μ1
=μ2=•••μ
g是否成立,相应的假设检验方法采用多变量方差分析。
多变量方差分析与单变量方差分析原理完全相同,即将实验结果的总离差平方和SS总分解为SS组间和SS组内两部分,只不过多变量方差分析的SS总、SS组间、SS组内用矩阵表示。设分别表示第i组的例数、均数向量和协方差矩阵,表示全体总均数向量,g个均数向量差别比较的多变量方差分析见表14-4,其中H组间相当于单变量方差分析中的SS组间,E组内相当于SS组内。
例14-4将患慢性胃炎的儿童随机分为3组,其中I组、II组为治疗组,另一组作为对照组,试比较治疗药物对T细胞免疫功能(外周血T3,T4,T8细胞百分比)的影响。表14-5是其中部分儿童的T细胞免疫功能的测量结果,试按表14-4计算H组间,E组内。将以上计算结果按表14-4的形式汇总,得表14-6。
2.*统计量与F值*统计量是Wilks于1932年提出的一种广义方差比,也称WilksLambda统计量。
其中,分子、分母都是行列式。当*很小时,说明组间差H异大于随机效应E,应怀疑零假设H0:μ1
=μ2=•••μ
g是否正确。表14-6中的H和E通过*值可转变为F值(见表14-7),实现多变量的方差分析。
由表14-7可知,对两组均数向量作假设检验时,除HotellingT2外,还可用多变量方差分析。正如单变量两组均数假设检验既可用t检验也可用方差分析一样。多变量方差分析的计算十分繁琐,但用SPSS或SAS软件计算则非常简单,而且可以分析多因素设计时均数向量间的差别。在SPSS或SAS输出结果中,各种情况下的*以及本节介绍的单组、两组和多组比较的HotellingT2统计量,都可自动转换为我们熟悉的F值。
例14-5根据表14-6计算结果,比较3组慢性胃炎儿童T细胞免疫功能有无差别。按公式(14-16)计算检验统计量
四、多变量分析与单变量分析
多变量分析是对m个反应变量进行一次假设检验(HotellingT2检验或MANOVA),对组间差别作出推断。在大多数情况下,多变量假设检验结论与对m个反应变量进行m次单变量假设检验(t检验或ANOVA)的结论是一致的,即多变量假设检验拒绝H0,m次单变量假设检验至少有一次拒绝H0,SPSS、SAS等统计软件也是先给出多变量假设检验结果,再给出单变量假设检验结果,作为多变量分析的补充。
但理论上单变量假设检验不能代替多变量假设检验,主要理由:①m次单变量假设检验增加假阳性错误的概率,设每次单变量假设检验的检验水准定为a,做完m次检验I类错误的概率增加为am=1-(1-a)m。②单变量假设检验只说明某一变量在数轴分布上的组间差别,不能反映多个变量在平面或空间上的差别,两者的意义不同,各自说明各自的问题,不能相互代替。如表14-8的两组数据,分别对两组新生儿出生时的体重与身长做单变量t检验:体重t=1.62,p=0.13,身长t=0.04,p=0.97,都不能拒绝H0。但双变量的HotellingT2检验:T2=9.87,F=4.58,P=0.03,拒绝H0:μ1=μ2,两组在平面分布上差别如图14-1所示。第三节重复测量资料的多变量分析
前面已经介绍了重复测量资料的单变量ANOVA分析方法。如果不考虑重复测量数据是否满足“球对称”假设,可将每个观察对象的m次重复测量结果看作一个向量,直接采用多变量的HotellingT2检验。例14-610名肥胖患者在医生指导下服用药物减肥,按统一标准记录服药前和服药后1~4周的体重,见表14-9,试分析减肥效果。
1.建立检验假设如果减肥药物无效,各时间点体重的总体均数相等,即μ1=μ2=μ3=μ4=μ5。所以有H0:Cμ=0,H1:Cμ≠
0,其中3.分析服药后1~4周的体重降低的变化趋势本例可将10名患者组内变异SS组内(自由度为υ=4)分解为多项式的1次项(liner)、2次项(quadratic)、3次项(cubic)、4次项(order4),描述体重随时间变化的曲线趋势。SPSS10.0的输出结果为:
只有1次项有意义(P<0.01),说明服药后患者体重降低是线性变化趋势,见图14-2.
例14-6是对10名肥胖患者各自体重变化(组内变异)的分析。如果设立对照组,比较药物疗效要在患者间进行,即分析处理组和对照组的体重差异和变化趋势(组间变异),分析方法同组内变异。第四节轮廓分析
轮廓分析是比较两组或多组多变量均数向量的轮廓是否相等。如将表12-20中A,B,C三组不同麻醉诱导时相的平均收缩压作图,A,B,C三组均数的折线称为轮廓(profile),见图14-3。轮廓分析(profileanalysis)是两个或多个均数向量比较的一个特例。m个变量可以是同一个处理的m次重复测量结果(图14-3),也可以是m次处理的观察结果(图14-4),但m次处理的观察结果必须属于同一类型的指标且计量单位相同。本节介绍两组多变量均数比较的轮廓分析。
例14-7分别对50名硕士生和30名博士生进行健康状况抽样调查。调查问卷设计了如下七个问题:①对自己健康状况的满意程度(X1);②是否需要调养身体(X2);③身体有不适或不舒服的感觉(X3);④有生病的感觉(X4);⑤有紧张情绪和压力感(X5);⑥晚间休息感到不能很快入睡(X6);⑦吃饭有时觉得胃口不好(X7)。每个问题的回答从好到差按4个等级记分(分别赋值1、2、3、4),调查结果见表14-10,7个问题的平均得分的轮廓图见图14-4,问每个问题硕士生和博士生的回答结果是否相同?
2.相合检验检验两个总体的轮廓否为重合轮廓(coincidentprofile)。如果两个总体的轮廓相互平行,Σμ1i=Σμ2i(i=1,2,…,m)相等时两个总体的轮廓重合。因此,检验假设H0:Σμ1i=Σμ2i,H1:Σμ1i
≠
Σμ2i
,检验方法用单变量t检验
3.水平轮廓检验检验两个总体的轮廓是否为水平直线轮廓(levelprofile)。在两个总体的轮廓重合的假定下,两组多变量数据视为一个总体,合并后的总体均μˊ=(μ1,μ2,μ3,μ4,μ5,μ6,μ7),并且有μ1-μ2=μ1-μ3=μ1-μ4=μ1-μ5=μ1-μ6
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 2026福建泉州惠安嘉惠中学自聘教师招聘1人(三)笔试备考题库及答案解析
- 2026年通化县教师招聘笔试模拟试题及答案解析
- 2026年祁县教师招聘考试参考题库及答案解析
- 2026年祁东县教师招聘笔试备考题库及答案解析
- 2026广东惠州仲恺高新区招聘区应急救援大队(森林消防大队)队员16人考试模拟试题及答案解析
- 2026年洪洞县教师招聘考试备考试题及答案解析
- 2026天津海泰市政绿化有限公司招聘专业技术人员3人考试备考题库及答案解析
- 2026武汉同济航天城医院第十批劳务派遣人员招聘考试参考题库及答案解析
- 2026-福建烟草公司消防安全管理员招聘考试参考题库-含答案
- 2026福建三明市宁化县安乐镇公开招聘2名公益性岗位人员考试备考题库及答案解析
- 广东深圳市龙岗区实验学校2026-2027学年度第一学期 七年级9月阶段性反馈英语试卷(含答案)
- 工程挂靠协议书
- 无产权车位使用权转让协议书2026年模板
- 关于新生儿科输液泵故障的应急预案演练脚本
- 吉兰-巴雷综合征合并吞咽困难管理专家共识(2026版)
- 探索HIV-1感染者Vpr基因多态性及其临床关联:从分子特征到医学启示
- 网吧卫生管理制度及流程
- 卫浴装修公司合作协议7篇
- 韦氏-儿童智力测验量表
- 内科诊所规章制度
- 《千字文》硬笔楷书字帖
评论
0/150
提交评论