版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
第1章绪论应用多元统计分析
-
1-第1章绪论第2章多元正态抽样分布第3章多元正态总体的假设检验第4章判别分析第5章聚类分析第6章主成分分析第7章因子分析第8章对应分析第9章典型相关分析
多元统计分析是研究多个随机变量之间相互依赖关系及内在统计规律的一门统计学科,其内容既包括一元统计理论方法的推广,也包括多个随机变量特有的一些理论和方法,后者有大量的实际应用背景。
在实际问题中,涉及到的随机变量往往有多个,且这些变量之间又存在一定的联系。例如,一个国家的经济状况需要用多个指标来刻画。人的体能需要用年龄、体重、肺活量等多项指标来反映。
1.1多元统计分析概述
例1.1考察学生的学习情况时,需要了解学生在几个主要科目的学习成绩,等等。表1.1给出20名中学生5门主课期末考试成绩。我们希望根据表1.1提供的数据对这20名学生的学习情况进行评价。多元统计分析概述
如果用一元统计方法,需要对各门课程成绩分别分析。这样处理,由于忽视了课程之间可能存在的相关性,因此会丢失许多信息,分析的结果不能客观全面地反映学生的真实学习情况。
如果采用多元分析方法,可以同时对多门课程的成绩进行综合分析,给出比较客观和全面的分析结果。多元统计分析概述
多元统计分析的内容和方法主要有以下几个方面。1.多元统计理论基础
包括多维随机向量,特别是多维正态随机向量,以及由此定义的各种统计量的分布及其性质,多元统计分布理论。
2.多元统计推断
包括多元正态总体的参数估计和假设检验问题,特别是均值向量和协方差阵的估计和假设检验等问题。
3.变量之间的相互关系
(1)多元回归分析:分析变量之间的因果关系,建立一个变量或几个变量与另一些变量的定量关系式,并用于预测或控制。(2)典型相关分析:分析两组变量之间的相关关系。多元统计分析概述
4.分类与判别问题
(1)判别分析:根据观测到的样品数据(训练样本),按相似程度大小对所考察的样品或变量进行分类(归类),常称其为“有监督的分类问题”。(2)聚类分析:对观测到的数据,按相似程度大小对样品或变量进行分类。常称其为“无监督的分类问题”。5.简化数据结构(降维问题)
将高维数据降为低维数据,使数据结构得到有效简化,并在此基础上分析变量之间或样品之间的复杂关系。这类问题的统计方法包括主成分分析、因子分析以及对应分析,等等。多元统计分析概述
多元统计分析起源于20世纪初,1928年Wishart发表的一篇论文《多元正态总体样本协方差阵的精确分布》被公认为是多元统计的开端。之后Fisher、Hotelling、Roy和许宝騄等著名统计学家的开创性工作,使多元统计分析在理论上得到了迅速发展,并在许多领域得到实际应用。但是,由于使用多元统计方法解决实际问题时需要的计算量很大,使其发展受到一定限制。多元统计分析概述
到了20世纪中后期,随着电子计算机的出现和发展,使得多元统计分析方法在自然科学和社会科学的许多领域得到广泛的应用,并由此带来其理论的进一步发展。另一方面,不断提出一些新理论、方法和技术,又促使其应用范围进一步扩大。21世纪初,随着现代信息技术的高速发展和广泛应用,人类进入了大数据时代。多元统计分析概述
海量数据和超高维数据的大量涌现,对统计理论、方法和技术的发展提出新的挑战。近年来,我国学者在多元统计分析的理论研究和应用方面取得了显著成绩,有不少研究工作已达到国际领先水平,并形成许多高水平的科研团队,活跃在各个领域。多元统计分析概述
1.2多元数据的直观表示
多元数据可以通过图形直观表示,以便对所研究的数据的直观了解。另一方面,对具体问题的多元分析结果或过程也可以通过图形来展示,以便人们对分析结果或计算过程有直观的理解。本章主要介绍多元数据的几个常用直观表示方法,对于多元分析的结果或过程的直观表示方法,将在本书后面几章介绍的各种多元分析方法中介绍。内容与要求内容:
包括轮廓图、散布矩阵图、均值条形图、箱线图、星相图、脸谱图、调和曲线图等图形。要求:
要求学生了解多元数据的直观表示方法及多变量图形的一些特点,并掌握一些复杂的多元数据的图示技术。多元数据的直观表示多元数据的直观表示说明与举例
说明:
图形有助于对所研究数据的直观了解,如果能把一些多元数据直接绘图显示,便可从图形一目了然看出多元变量之间的关系。
例1.2
为了研究全国31个省、市、自治区2018年城镇居民生活消费的分布规律,根据调查资料做区域消费类型划分。多元数据的直观表示
指标:食品x1:人均食品支出(元/人)衣着x2:人均衣着商品支出(元/人)居住x3:人均居住支出(元/人)生活x4:人均家庭设备用品及服务支出(元/人)交通x5:人均交通和通讯支出(元/人)教育x6:人均娱乐教育文化服务支出(元/人)医疗x7:人均医疗保健支出(元/人)其他x8:人均杂项商品和服务支出(元/人)地区x1x2x3x4x5x6x7x8北京8064.92175.514110.32371.94767.43999.43274.51078.6天津8647.51990.06406.31818.44280.93186.62676.9896.3河北4271.31257.44050.41138.72355.41734.51540.5373.8山西3688.21261.03228.5855.61845.21940.01635.1356.4内蒙古5324.31751.23680.01204.63074.32245.41847.5537.9辽宁5727.81628.14169.51259.42968.22708.02257.1680.2吉林4417.41397.03294.8899.42479.72193.42012.0506.7黑龙江4573.21405.43176.3866.42196.62030.32235.3490.4上海10728.22036.814208.52095.54881.25049.43070.21281.5江苏6529.81541.06731.21493.33522.82582.62016.4590.4浙江8198.31813.57721.21652.44302.03031.32059.4692.6安徽5414.71137.43941.91041.22082.11810.41224.0392.8福建7572.91212.16130.01223.12923.32194.01234.8505.8江西4809.01074.13795.21047.71872.11813.01000.0381.0山东5030.91391.83928.51394.32834.32174.41627.6398.1河南3959.81172.83512.01054.41838.01769.11541.5321.0湖北5491.31316.24310.61253.22584.12187.51907.9487.0湖南5260.01215.53976.11190.22322.92786.21705.5351.5广东8480.81135.36643.31440.83423.92750.91520.8658.2广西4545.7616.73268.5898.22150.11798.91364.6291.9海南6552.2655.93744.0826.61919.02185.51236.1409.2重庆6220.81454.53498.81338.92545.02087.81660.0442.8四川5937.91173.83368.01182.22398.81599.71568.6434.5贵州3792.9934.72760.7878.12408.01660.01083.5280.1云南3983.4789.13081.1859.92212.81772.71267.7283.2西藏4330.51285.22102.6622.31847.7609.3460.1262.6陕西4292.51141.13388.21200.82005.82008.81749.4373.2甘肃4253.31111.53095.0896.91640.71710.31573.9342.4青海4671.61350.62990.0932.02671.41655.61842.0444.0宁夏4234.11388.23014.31067.12724.42139.51727.1420.4新疆4691.61456.02894.31082.82274.41762.51592.6434.9
数据输入:数据R语言读取X=read.table('biao1.2.txt',header=T)
直观分析:图示法
pairs(X)###画散布矩阵图从该图可以看出,食品支出与生活用品及服务支出、教育及文化娱乐支出之间存在显著线性相关关系,而教育及文化娱乐支出又与居住支出、其他支出之间存在显著线性相关关系,等等。多元数据的直观表示
均值条图
多元数据的直观表示
样品(行)的均值条图#按行做均值条形图barplot(apply(X,1,mean))
均值条图
多元数据的直观表示
指标(列)的均值条图#按行做均值条形图barplot(apply(X,2,mean))
箱线图
多元数据的直观表示
箱线图
用途:Tukey提出的箱线图由箱子和其上引出的两个尾组成,这种图用来表示在一定时间内一个班成绩的变化、物体位置的变化、原材料的变化、产品标准的变化等。
特征:箱线图可以比较清晰地表示数据的分布特征,它由4部分组成。
R语言函数:boxplot(X,...)
箱尾图
多元数据的直观表示boxplot(X)#按列做垂直箱线图boxplot(X,horizontal=T)#水平箱线图从该图可以看出,食品消费支出远高于其它指标的支出。
星相图
多元数据的直观表示
星相图
用途:它将每个变量的各个观察单位的数值表示为一个图形,n个观察单位就有n个图,每个图的每个角表示每个变量。
特征:星相图是雷达图的多元表示形式。
R语言函数:stars(X,draw.segments=FALSE,key.loc=NULL,...)星相图
多元数据的直观表示#简单星相图stars(X)
星相图
多元数据的直观表示#带图例度彩色星相图stars(X,key.loc=c(17,7),draw.segments=T)
#加载aplpack包library(aplpack)#按每行7个做脸谱图faces(X,ncol.plot=7)脸谱图:运用样本各变量值构造脸的各部位,通过分析脸部位大小或形状来分析各样本数据特征
脸谱图
多元数据的直观表示#加载mvstats包library(mvstats)plot.andrews(X)调和曲线图:使用高维空间中的一个样本对应于二维平面上的一条曲线的方法分析数据特征
调和曲线图
多元数据的直观表示####也可以直接从镜像站加载andrews包绘制调和曲线图library(andrews)andrews(X,type=3,clr=5,ymax=3)调和曲线图:使用高维空间中的一个样本对应于二维平面上的一条曲线的方法分析数据特征
调和曲线图
多元数据的直观表示
第2章多元正态抽样分布应用多元统计分析
-
25-
在多元统计分析中,多元正态分布占有相当重要的地位。这是因为,许多实际问题涉及到的随机向量服从正态分布或近似服从正态分布;当样本量很大时,许多统计量的极限分布往往和正态分布有关。此外,对多元正态分布,理论与实践都比较成熟,已有一整套行之有效的统计推断方法。
基于这些理由,我们在介绍多元统计分析的种种具体方法之前,首先介绍多元正态分布的定义、性质及多元正态分布中参数的估计问题。第2章多元正态抽样分布
多元统计分析讨论的是多变量总体。以p个随机变量作为分量构成的向量称为p维随机向量。如果我们同时对p个变量作一次观测,得到观测值,它是一个样品。如果我们观察n次得到n个样品品,而n个样品就构成一个样本。
2.1随机向量
常把n个样品排成一个n×p矩阵,称为样本数据矩阵(或样本资料阵),记为
2.1随机向量
在多元统计分析理论中涉及到的向量一般都是随机向量,或是由多个随机向量构成的随机矩阵。均值向量和协方差阵
设是一个随机向量。称向量为随机向量X的均值向量。称矩阵为随机向量X的协方差矩阵,其中。
2.1随机向量均值向量和协方差阵
设是另一个随机向量。称矩阵为随机向量X与Y的协方差矩阵,其中
2.1随机向量均值向量和协方差阵
若为X的协方差阵,则称为X的相关阵,其中若记,则有
或
2.1随机向量均值向量和协方差阵的性质性质1.
设X和Y是适当维数的随机向量,A和B是适当阶数的常数矩阵,则有
2.1随机向量均值向量和协方差阵的性质性质2.
若X
与Y
相互独立,则;反之则不一定成立。性质3.
随机向量X的协方差阵是对称非负定矩阵。性质4.,其中L为非负定矩阵,称为的平方根矩阵,记为,即。
证明由于,利用实对称非负定矩阵的对角化原理,存在正交矩阵,使得
2.1随机向量均值向量和协方差阵的性质
2.1随机向量其中这里为的特征值,为的与对应的单位正交特征向量。均值向量和协方差阵的性质性质5.,其中A为列满秩矩阵,若则A为非退化矩阵。
定理2.1
设,则其中表示矩阵B
的迹。
2.1随机向量多元正态分布的定义和性质
定义2.1.设为随机向量,其中相互独立,同服从标准正态分布。设为p维常数向量,A为常数矩阵,则称向量所服从的分布为p维正态分布,并称X为p维正态随机向量,记为,或简记为,其中。
性质1.设,B为常数矩阵,d为s维常数向量。令,则性质1说明,正态随机向量的任意线性组合仍然服从正态分布。
2.2多元正态分布多元正态分布的定义和性质
推论2.1.设将分块为则。此推论说明,多元正态分布的边缘分布仍为正态分布。但反之不一定成立(例如见例2.1)。
2.2多元正态分布多元正态分布的定义和性质
例2.2.设其中求的分布,这里
2.2多元正态分布多元正态分布的定义和性质
性质2.若,则。此性质给出多元正态分布中参数的明确统计意义。
性质3.
设相互独立,且为任意常数。则
2.2多元正态分布多元正态分布的定义和性质
性质4.设则
性质5.
设则X的密度函数为其中是p维向量。
2.2多元正态分布条件分布和独立性
设将分块为由推论2.1可知
定理2.2.设则与独立,当且仅当。
2.2多元正态分布多元正态分布的定义和性质
定理2.3.设分块为则给定时,的条件分布为其中
2.2多元正态分布多元正态分布的定义和性质
推论2.4.在定理2.3条件下有(1)与相互独立;(2)与相互独立;(3)其中
2.2多元正态分布多元正态分布的定义和性质
例2.4.设其中试求已知时的条件分布。
2.2多元正态分布样本均值向量和样本协方差阵
设为来自总体的一个随机样本,且。记样本数据矩阵为下面我们引入样本均值向量、样本离差阵、样本协方差阵和样本相关阵。
2.3多元抽样分布样本均值向量和样本协方差阵
样本均值向量为其中为的样本均值。
2.3多元抽样分布样本均值向量和样本协方差阵
样本离差阵为其中
2.3多元抽样分布样本均值向量和样本协方差阵
样本协方差阵为其中称为变量的样本方差,称其算术平方根为变量的样本标准差。
2.3多元抽样分布样本均值向量和样本协方差阵
样本相关阵为其中
2.3多元抽样分布样本均值向量和样本协方差阵
定理2.4.设和A分别为来自总体的样本均值向量和样本离差阵,则
(1)
(2)A可表示为其中独立同服从分布;(3)和A相互独立。
2.3多元抽样分布极大似然估计及其性质
设为来自正态分布的一个随机样本,且。本节我们讨论参数和的极大似然估计。为此我们把样本的联合密度函数视为和的函数,并称其为似然函数,即
2.4极大似然估计
2.4极大似然估计极大似然估计及其性质由于我们有
2.4极大似然估计极大似然估计及其性质
令
2.4极大似然估计极大似然估计及其性质得到和的极大似然估计为其中
因为故是的无偏估计。
2.4极大似然估计极大似然估计及其性质
又由定理2.4可得因此的极大似然估计不是的无偏估计,而才是的无偏估计。常称为样本均值,S为样本协方差阵。
2.4极大似然估计
第3章多元正态总体的假设检验应用多元统计分析
-
57-
在一元正态总体中,关于参数的假设检验涉及到一个总体和多个总体情况,推广到多元正态总体,关于参数的假设检验问题也涉及一个总体和多个总体情况。本章我们只讨论关于均值向量的假设检验问题。
在多元统计中,用于检验的抽样分布有维希特(Wishart)分布、霍特林(Hotelling)分布和威尔克斯(Wilks)分布,它们都是由来自多元正态总体的样本构成的统计量。在第2章中,我们已经讨论了维希特分布的定义和性质,本章我们讨论后两个统计量的分布。第3章多元正态总体的假设检验霍特林分布在一元统计中,若,且相互独立,则或等价地下面把的分布推广到多元正态总体。
定义3.1设,,其中,且与相互独立。则称统计量为统计量,其分布称为自由度为n的霍特林分布,记为
3.1
几个重要统计量的分布
分布的性质
性质1设是来自正态总体的随机样本,和A分别是样本均值向量和样本离差阵,则
性质2分布与F分布的关系为:若则
3.1
几个重要统计量的分布
分布的性质
性质3
设是来自正态总体的随机样本,和A分别是样本均值向量和样本离差阵,记则
性质4分布只与n,p有关,而与无关。
3.1
几个重要统计量的分布威尔克斯分布
定义3.2设,称协方差阵的行列式为的广义方差。若是来自总体的随机样本,A为样本离差阵,则称或为样本广义方差。
定义3.3
设,这里,且与独立,则称广义方差比为统计量,其分布称为威尔克斯分布,记为。当p=1时,分布正是一元统计中参数为的贝塔分布,即。
3.1几个重要统计量的分布
分布的性质
性质1
当时,若,则
性质2
当时,若,则
3.1
几个重要统计量的分布性质3
当p=1时,性质4
当p=2时,
性质5若,则当时有下列极限分布其中。
3.1几个重要统计量的分布
下面是分布的两个有用性质。
性质6若,则存在,且之间相互独立,使得
性质7若则
3.1几个重要统计量的分布单总体均值向量的假设检验设总体为,为来自该总体的随机样本。欲检验下列假设:其中为已知常数向量。
1.当已知时均值向量的假设检验此时
3.2单总体均值向量的统计推断于是有若检验统计量取为则当原假设成立时,。按照传统的检验方法,对于给定的显著性水平,由分布分位数表查得,使得,则拒绝域为。若由样本观测值计算的值为,则当时拒绝,否则接受。
3.2单总体均值向量的统计推断2.当未知时均值向量的假设检验对于一元统计,上述假设的检验统计量为其中,当成立时。与上述统计量等价的一个检验统计量为推广到多元情况,对于正态总体,考虑统计量当成立时,由定义3.1及分布的性质1可知
3.2单总体均值向量的统计推断再利用与F分布的关系,检验统计量取为当成立时,若取显著性水平为,则拒绝域为,其中是自由度为的F分布上侧分位数。
例3.1人的出汗多少与人体内钠和钾的含量有一定的关系。今测量了20名健康女性的出汗量()、钠的含量()和钾的含量(),数据见表3.1。试检验假设(取):
3.2单总体均值向量的统计推断
表3.1成年女性的出汗量及其体内钠和钾的含量数据
3.2单总体均值向量的统计推断序号x1x2x3序号x1x2x313.748.59.3113.936.912.724.765.18.0124.558.812.333.847.210.9133.527.89.843.253.212.0144.540.28.453.155.59.7151.513.510.164.636.17.9168.556.47.172.424.814.0174.571.68.287.233.17.6186.552.810.996.747.48.5194.144.111.2105.454.111.3205.540.99.4
解
记随机向量,并假定。检验统计量为其中。由表3.1中的样本观察值计算得到及进一步计算可得
3.2单总体均值向量的统计推断
对于给定的显著性水平,由F分布的分位数表查得。由于,故接受原假设。由上述F值,根据检验统计量的分布,可利用统计软件计算出检验的p值为该p值大于0.05,因此应接受原假设。
置信域
在一元统计中,讨论均值的假设检验问题本质上等价于求均值的置信区间。作为一元统计中置信区间的推广,下面简单讨论单个多元正态总体均值向量的置信域。
3.2单总体均值向量的统计推断设是来自总体的随机样本,和A分别为样本均值向量和样本离差阵,则由分布的性质1可知有其中为样本协方差阵,并且由分布与F分布的关系可知有因此,对于给定的置信度,查F分布的分位数,满足则均值向量的置信度为的置信域为
3.2单总体均值向量的统计推断该置信域是中心位于的一个椭球,称为置信椭球。两总体均值向量的假设检验协方差阵相等时均值向量的假设检验
设是来自总体的随机样本,是来自总体的随机样本,且两个总体相互独立,方差阵未知。要检验假设检验统计量为
3.3
多总体均值向量的统计推断这里和分别是由来自两个总体的样本组成的样本离差阵。
由分布定义3.1可知,当上面的原假设成立时有利用分布与F分布的关系,检验统计量可取为
3.3
多总体均值向量的统计推断
例3.3
对某地区农村2周岁婴儿的身高(x1)、胸围(x2)和上半臂围(x3)进行测量(单位:cm),样本数据如表3.2所示,其中序号1至6为6名男婴的测量数据,7至15号为9名女婴的测量数据。试检验男女婴儿之间身体特征是否有显著差异。表3.2某地区农村2周岁婴儿的体格测量数据
3.3
多总体均值向量的统计推断编号x1x2x3编号x1x2x317860.616.597860.315.027658.112.5107557.413.039263.214.5117959.514.048159.014.0127858.114.558160.815.5137558.012.568459.514.0146455.511.078058.414.0158059.212.587559.215.0
解
比较男女婴儿之间身体特征是否有显著差异问题,就是两总体均值向量是否相等的假设检验问题。记男婴的三个身体指标为总体X,并设。记女婴的三个身体指标为总体Y,并设。来自两个总体的样本容量为。欲检验的假设为检验统计量为其中,由样本观测值计算得
3.3
多总体均值向量的统计推断进一步计算可得取显著性水平为,查F分布表得。因,故不能拒绝原假设,即认为两个总体均值向量无显著差异。事实上,由检验统计量的观测值,可以算出此检验的p值为由于该p值比较大,因此应接受原假设。
3.3
多总体均值向量的统计推断多元方差分析
设有k个总体,从第i个总体抽取容量为的样本。欲检验下列假设不全相等。类似于一元情况,令其中这里。再令则
3.3
多总体均值向量的统计推断其中
采用似然比方法可以得到检验统计量由于且之间相互独立,由维希特分布的可加性得又在成立条件下,可以证明
3.3
多总体均值向量的统计推断且A与B相互独立,于是根据分布的定义可知有对于给定的显著性水平,拒绝域为,其中是分布的分位数,满足。分布的分位数表可以从一些文献中找到,但在许多情况下,分布的分位数可以通过分布与F分布的关系,并通过F分布的分位数表而得到。
3.3
多总体均值向量的统计推断
第4章判别分析应用多元统计分析
-
82-判别分析是用于判断样品所属类型的一种统计方法。判别分析方法处理的问题看起来与聚类分析方法有些类似,似乎都是要将观察值进行分类,但是它们的使用前提是不同的。判别分析是根据某些指标的已有数据(或称为训练样本)对所研究的对象建立判别函数,并进行分类的一种多变量分析方法,也称之为“有监督的分类方法”。进行判别归类时,由假设前提、判别依据及处理手法的不同可采用不同的判别方法。如距离判别、贝叶斯(Bayes)判别、费希尔(Fisher)判别等。第4章判别分析概念和方法判别分析概念判别分析方法
是在已知的分类之下,对新的样品,利用某判别准则,来判定其属于哪个类。
判别分析(DiscriminatAnalysis)是多元分析中用于判别样品所属类型的一种统计分析方法。第4章判别分析主要内容判别分析的目的和意义几种判别分析方法和性质
包括:距离判别法、Bayes判别法、Fisher判别法R语言程序中有关判别分析的算法第4章判别分析
所谓判别问题,就是将欧几里德空间划分为k个互不相交的区域,即。当时,就判断x属于总体。特别是,当k=2时,就是两总体的判别问题。
距离判别是最简单、最直观的一种判别方法,也是最常用的一种判别方法,该方法适用于连续型随机变量的判别,对变量的概率分布没有要求。
4.1距离判别
定义4.1
设是从均值向量为,协方差阵为的总体G中抽取的两个样品,则与之间的马氏距离定义为样品与总体G之间的马氏距离为4.1距离判别两总体的距离判别
设总体和的均值向量分别为和,协方差阵分别为和,x是一个新样品,现在要判断x来自哪一个总体。可计算x到两个总体的马氏距离的平方和,并按照下列判别准则进行判别:当两个总体的方差相等,即时,该判别准则可以进行简化。
4.1距离判别
1.当时的线性判别
此时其中是两个总体均值的平均值。令
其中,则。4.1距离判别因此判别准则可简化为:其中称为判别函数,由于它是的线性函数,故又称它为线性判别函数。4.1距离判别
在实际中,总体的均值向量和协方差阵一般都是未知的,此时可用样本均值向量和样本协方差阵来代替。设是来自总体的样品,是来自总体的样品,则样品均值向量和样品离差阵为的由两个总体样品构成的无偏估计为4.1距离判别
2.当时的非线性判别
此时判别函数为与之差,即由于这个是x的二次函数,故又称它为二次判别函数或非线性判别函数。相应的判别准则为4.1距离判别
与前面讨论的情况相同,在实际中总体均值向量和协方差阵往往未知,需要用样本均值向量和样本协方差阵来代替,这里分别是和的无偏估计。4.1距离判别例4.1
在研究砂基液化问题中,选了7个因子。今从液化和未液化的地层中分别抽取12个和23个样品,数据列在表4.1中,其中1类表示已液化类,2类表示未液化类。试按照距离判别准则对原35个样本进行分类(即回代),并分析误判情况。4.1距离判别表4.1砂基液化原始分类数据编号类别G116.6391.06.060.1220216.6391.06.0120.1220316.1471.06.060.0812416.1471.06.0120.0812518.4322.07.5190.3575617.261.07.0280.3030718.41133.56.0180.1575817.5521.06.0120.1640917.5523.57.560.16401018.31130.07.5350.121801117.81721.03.5140.21451217.81721.53.0150.21451328.4321.05.040.35751428.4322.09.0100.35751528.4322.54.0100.35751626.3114.57.530.20151727.084.54.590.25301827.086.07.540.25301927.081.56.010.25302028.31611.54.040.08702128.31610.52.510.08702227.263.54.0120.30302327.261.03.030.30302427.261.06.050.30302525.562.53.070.18182628.41133.54.560.1575#############首先对表4.1中数据建立文本文件biao4.1.txtlibrary(MASS)###加载程序包li4.1=read.table("biao4.1.txt",head=TRUE)###读入数据##################################################线性判别ld1<-lda(G~.,data=li4.1);ld1###方差相同条件下的线性判别y1<-predict(ld1,data=li4.1)###对原始数据进行预测,即回代newG1=y1$class###预测原始数据所属类别cbind(li4.1$G,y1$x,newG1)###显示判别结果##################################################非线性判别qd1<-qda(G~.,data=li4.1);qd1###方差不同条件下的二次判别y2<-predict(qd1,data=li4.1)###对原始数据进行预测,即回代newG2=y2$class###预测原始数据所属类别cbind(li4.1$G,newG2)###显示判别结果4.1距离判别
解:利用R程序进行运算。线性判别结果4.1距离判别Groupmeans:
x1x2x3x4x5x6x717.35833373.666671.4583336.0000015.2500000.171666749.5000027.68695769.608702.0434785.239136.3478260.215652270.34783Coefficientsoflineardiscriminants:X1X2X3X4X5X6X7-0.24564980.00125460.2132494-0.1895015-0.19451528.91250000.0195838cbind(li4.1$G,y1$x,newG1)###显示结果序号GLD1newG序号GLD1newG11-0.978064511921.3184485221-2.145155712020.2547354231-1.358373812120.9092838241-2.525465012220.3782688251-0.901731012321.7852837261-3.835602212420.8277489271-1.783971012520.4401957281-1.601754812620.8344636291-0.185792422720.44543322101-4.30786241282-0.43466362111-0.89663631292-1.10794621121-0.889776113022.059148021322.276501323122.592271321420.564653723221.165660621521.618785623321.662713821620.721250023420.659485321720.686327123520.341864021821.41027272
非线性判别结果4.1距离判别Groupmeans:
x1x2x3x4x5x6x717.35833373.666671.4583336.0000015.2500000.171666749.5000027.68695769.608702.0434785.239136.3478260.215652270.34783
cbind(li4.1$G,newG2)###显示结果序号GnewG序号GnewG序号GnewG序号GnewG11110111922282221111112022292231112112122302241113222222312251114222322322261115222422332271116222522342281117222622352291118222722
线性判别函数:本例中。经计算得线性判别函数为
,其系数向量为
4.1距离判别判别结果:
(1)在方差相同条件下的线性判别结果:将训练样本回代判别,结果有2个样本点判错,分别是第9号和第29号样本。即在方差相同条件下,误判率为2/35=5.7%。
(2)在方差不同条件下的非线性判别结果:将训练样本回代判别,结果全部正确,即此误判率为零。4.1距离判别
多总体的距离判别
设有k个总体,它们的均值分别为协方差阵分别为,x到的马氏距离的平方为判别准则为:判定,若在实际中和往往未知,此时可用相应的估计来代替。4.1距离判别
例4.2
某地市场上销售的电视机有多种品牌,该地某商场随机抽取了20种牌子的电视机进行调查,发现其中有5种畅销、8种平销、7种滞销。按电视机的质量评分Q、功能评分C、销售价格P(单位:百元)收集数据,列在表4.2中,其销售状态G中元素1表示畅销,元素2表示平销,元素3为滞销。试根据该资料进行判别。假设有一新厂商来推销其产品,产品质量评分为8.0,功能评分为7.5,销售价格为65(百元),问该厂家产品销售前景如何?4.1距离判别4.1距离判别
表4.2某地电视机销售数据编号类别GQCP118.34.029219.57.068318.05.039417.47.050518.86.555629.07.558727.06.075829.28.082928.07.0671027.69.0901127.28.5861226.47.0531327.35.0481436.02.0201536.44.0391636.85.0481735.23.0291835.83.5321935.54.0342036.04.536#############首先对表4.2中数据建立文本文件biao4.2.txtlibrary(MASS)###加载程序包li4.2=read.table("biao4.2.txt",head=TRUE)###读入数据ld2<-lda(G~.,data=li4.2);ld2###方差相同条件下的线性判别y1<-predict(ld2,data=li4.2)###对原始数据进行预测,即回代newG1=y1$class###预测原始数据所属类别cbind(li4.2$G,y1$x,newG1)###显示判别结果z1<-predict(ld2,data.frame(Q=8,C=7,P=65));z1###对新数据进行预测qd2<-qda(G~.,data=li4.2);qd2###方差不同条件下的二次判别y2<-predict(qd2,data=li4.2)###对原始数据进行预测,即回代newG2=y2$class###预测原始数据所属类别cbind(li4.2$G,newG2)###显示判别结果z2<-predict(qd2,data.frame(Q=8,C=7,P=65));z2##对新数据进行预测4.1距离判别
解:利用R程序进行运算。线性判别结果4.1距离判别cbind(li4.2$G,y1$x,newG1)###显示结果No.GLD1LD2newG111-0.14099842.582951755121-2.39183560.825366275131-0.37044521.641514840141-0.97148350.548448277151-1.71348911.246681993162-2.45935981.3615711741720.3789617-2.200431689282-2.5581070-0.467096091292-1.1900285-0.4129720272102-1.7638874-2.3823023242112-1.1869165-2.4855749402122-0.1123680-0.59888392221320.33991320.23286339731432.84565610.93672257331531.55923460.02566821631630.7457802-0.20916815931733.0062824-0.35898953431832.25117080.00885206731932.2108260-0.33120676832031.52109390.0359848853各组均值及非线性判别结果4.1距离判别Groupmeans:
QCP18.4000005.90000048.20027.7125007.25000069.87535.9571433.71428634.000
cbind(li4.2$G,newG2)###显示结果No.1234567891011121314151617181920G11111222222223333333newG11111222222233333333判别结果:
(1)在方差相同条件下的线性判别结果:将训练样本回代判别,结果有2个样本点判错,分别是第6号和第13号样本。即在方差相同条件下,误判率为2/20=10%。对新厂家产品销售前景预测结果为Q=2,即平销。
(2)在总体方差不同条件下的非线性判别结果:将训练样本回代判别,结果有1个样本点判错,即第13号样本。因此在方差不同条件下,误判率为1/20=5%。对新厂家产品销售前景预测结果为Q=2,即平销。4.1距离判别
距离判别只利用总体的特征信息,即均值向量和协方差阵,不涉及总体的分布类型。该判别方法有两个缺点:一是该方法与总体出现的机会大小(先验概率)无关;二是该方法没有考虑错判造成的损失。贝叶斯判别正是为解决这两个问题而提出的一种判别方法。贝叶斯统计方法总是假定对所研究的对象已有一些认识,常用先验概率分布来描述这种认识。当抽取一个样本后,再利用样本信息来修正已有的认识,得到后验概率分布。各种统计推断都是基于后验分布而进行。将贝叶斯统计思想用于判别分析就得到贝叶斯判别方法。4.2贝叶斯判别距离判别的缺点:贝页斯判别准则:一是判别方法与各总体出现的概率无关;二是判别方法与错判后造成的损失无关。以个体归属于某类的概率(或判别值)最大,或错判总平均损失最小为标准。4.2贝叶斯判别
贝页斯判别准则一、概率判别(不考虑误判损失)假设k个类的先验概率为各类的密度函数分别为x来自第j类的后验概率为(贝页斯公式)4.2贝叶斯判别判别准则为
贝页斯判别准则二、损失判别(考虑误判损失)
x错判为来自第j个类的平均损失:这里是样品实际来自第i个类但被错判为属于第j个类的损失。
4.2贝叶斯判别损失判别准则为:
贝页斯判别准则对于两总体情况损失判别准则可简化为:这里
4.2贝叶斯判别
例4.3
设总体和的概率密度函数分别为和,又假设误判损失为,根据以往经验给出的先验概率为。根据贝叶斯判别准则(4.5)得到的划分为若一个新样品的密度函数值为,则因此判断属于总体。4.2贝叶斯判别
例4.4
设有三个总体,欲判断某样品属于哪个总体。已知属于各个总体的判别概率为:由于最大,故在不考虑误判损失情况下应判断。4.2贝叶斯判别
例4.5
在例4.4中,假定误判的损失矩阵为现在采用平均损失最小规则进行判别。各个总体的判别函数值为:4.2贝叶斯判别由于最小,故在考虑误判损失情况下应判断。
4.2贝叶斯判别这个判别结果与例4.4不同。
利用R软件进行贝叶斯判别与距离判别方法类似,只需加上先验概率。在进行贝叶斯判别时,可假定各类方差阵相同,即采用线性判别方法,或假定各类方差阵不同,即采用非线性判别方法。
例4.6
应用贝叶斯判别方法分析例4.2中的数据。
解
取先验概率为各类比例,即设4.2贝叶斯判别li4.6=read.table("biao4.2.txt",head=TRUE)###读入数据library(MASS)###加载程序包ld3<-lda(G~.,prior=c(5,8,7)/20,data=li4.6);ld3###方差相同条件下的Bayes判别y3<-predict(ld3,data=li4.6)###对原始数据进行预测,即回代newG3<-y3$class###预测原始数据所属类别cbind(li4.6$G,y3$x,newG3)###显示结果table(li4.6$G,y3$class)###混淆矩阵z3<-predict(ld3,data.frame(Q=8,C=7,P=65));z3###对新数据进行预测qd3<-qda(G~.,prior=c(5,8,7)/20,data=li4.6);qd3###方差不同条件下的二次判别y4<-predict(qd3,data=li4.6)###对原始数据进行预测,即回代newG4<-y4$class###预测原始数据所属类别cbind(li4.6$G,newG4)###显示结果table(li4.6$G,y4$class)###混淆矩阵z4<-predict(qd3,data.frame(Q=8,C=7,P=65));z4###对新数据进行预测4.2贝叶斯判别利用R程序进行运算。线性判别结果Groupmeans:cbind(li4.1$G,y1$x,newG1)###显示结果QCP18.4000005.90000048.20027.7125007.25000069.87535.9571433.71428634.000No.GLD1LD2newG111-0.14099842.582951755121-2.39183560.825366275131-0.37044521.641514840141-0.97148350.548448277151-1.71348911.246681993162-2.45935981.3615711741720.3789617-2.200431689282-2.5581070-0.467096091292-1.1900285-0.4129720272102-1.7638874-2.3823023242112-1.1869165-2.4855749402122-0.1123680-0.59888392221320.33991320.23286339731432.84565610.93672257331531.55923460.02566821631630.7457802-0.20916815931733.0062824-0.35898953431832.25117080.00885206731932.2108260-0.33120676832031.52109390.0359848853table(li4.6$G,y3$class)###混淆矩阵
1231500216130074.2贝叶斯判别非线性判别结果Groupmeans:cbind(li4.1$G,newG2)###显示结果QCP18.4000005.90000048.20027.7125007.25000069.87535.9571433.71428634.000No.1234567891011121314151617181920G11111222222223333333newG11111222222233333333table(li4.6$G,y4$class)###混淆矩阵
1231500207130074.2贝叶斯判别判别结果:
(1)在总体方差相同条件下的判别结果:将训练样本回代,判别结果有2个点判错,分别是第6号和第13号样本。即在方差相同条件下,误判率为2/20=10%。对新厂家产品销售前景预测结果为Q=2,即平销。
(2)在总体方差不同条件下的判别结果:将训练样本回代,判别结果有1个点判错,即第13号样本。因此在方差不同条件下,误判率为1/20=5%。对新厂家产品销售前景预测结果为Q=2,即平销。4.2贝叶斯判别费希尔判别的基本思想:费希尔(Fisher)判别的基本思想是投影,或降维。对于来自不同总体(类)的高维数据,选择若干个好的投影方向将它们投影为低维数据,使得这些来自不同类的低维数据之间有比较清晰的界限。对于新样品对应的高维数据点,也将其以同样方向投影为一个低维数据点,然后再利用一般的距离判别方法判断其属于哪一类。而衡量类与类之间是否分开的方法借助于一元方差分析的思想。4.3费希尔斯判别费希尔判别的基本思想:
需要指出的是,在大数据时代,随着计算能力和信息技术的快速发展和广泛应用,人们需要处理大量的金融、生物、互联网和物联网等海量数据,这些数据往往是高维的,因此需要采用费希尔判别方法并借助现代统计软件技术进行判别分析和数据处理。利用R软件进行费希尔判别与距离判别方法相同,实际上lda函数和qda函数的算法程序采用了费希尔判别的降维过程。4.3费希尔斯判别
例4.7
费希尔于1936年发表的鸢(yuan)尾花(iris)数据被广泛地作为判别分析的例子。该数据集是R软件的自带数据(iris)。数据中包含150个样品的三种鸢尾花:刚毛鸢尾花、变色鸢尾花和弗吉尼亚鸢尾花。现在从各类中各抽取一个容量为50的样品,测量其花萼长()、花萼宽()、花瓣长()、花瓣宽(),单位为mm。试对该数据进行判别分析。
解
本题中,。4.3费希尔斯判别X=iris[,1:4]G=gl(3,50)attach(X)library(MASS)###Fisher线性判别ld=lda(G~Sepal.Length+Sepal.Width+Petal.Length+Petal.Width);ldplot(ld)###绘制图4.2Z1=predict(ld)newG1=Z1$classcbind(G,Z1$x,newG1)###显示结果(判别结果与真实类型对照)(tab1=table(G,newG1))###混淆矩阵sum(diag(prop.table(tab1)))###判对率4.3费希尔斯判别利用R程序进行运算。###Fisher非线性判别qd=qda(G~Sepal.Length+Sepal.Width+Petal.Length+Petal.Width);qdZ2=predict(qd)newG2=Z2$classcbind(G,newG2)###显示结果(判别结果与真实类型对照)(tab2=table(G,newG2))###混淆矩阵sum(diag(prop.table(tab2)))###判对率4.3费希尔斯判别利用R程序进行运算。4.3费希尔斯判别费希尔线性判别结果:Groupmeans:
Sepal.LengthSepal.WidthPetal.LengthPetal.Width15.0063.4281.4620.24625.9362.7704.2601.32636.5882.9745.5522.026Coefficientsoflineardiscriminants:
LD1LD2Sepal.Length0.82937760.02410215Sepal.Width1.53447312.16452123Petal.Length-2.2012117-0.93192121Petal.Width-2.81046032.83918785(tab1=table(G,newG1))###混淆矩阵
NewG1
123G15000
20482
30149
sum(diag(prop.table(tab1)))###判对率[1]0.98由上述计算结果得4.3费希尔斯判别中心化的费希尔判别函数为
我们首先采用费希尔线性判别方法,在各类方差阵相同条件下对判别函数的观察数据采用距离判别法。我们可以将样品中150个4维向量的判别函数得分画成散点图4.2。图中LD1和LD2分别指和。从图4.2可以看出,分离的效果不错,特别是将第一类与其它两类清晰地分离。正如我们所预期的那样,三个类的分离很大程度上展现在坐标轴上。对于某个新品,将其坐标代入上述判别函数,即可得到一个点,将其也画在上面的散点图上,即可直观地判断出它属于哪一类。4.3费希尔斯判别4.3费希尔斯判别
利用两个判别函数计算得到的三个类的均值为即三个类的判别函数值的中心点分别为,和。我们可以计算150个4维向量的费希尔判别函数值与上述三个类的中心点的欧氏距离,并根据距离最小的规则回判它们属于哪一类。结果表明,150个点中有147个判断正确,只有3个判错,误判率为,效果不错。
其次采用费希尔非线性判别方法,即在各类方差阵不相同条件下对判别函数的观察数据采用距离判别法。回判结果与采用费希尔线性判别方法得到的结果相同,即误判率也是。4.3费希尔斯判别1.判别分析方法是按已知所属类的训练样本确定判别函数,制定判别规则,然后
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 2026总监厂长面试题目及答案
- 2027届高考语文散文阅读一轮复习(四):分析线索作用题“3步走”
- 苏教版小学一年级语文下册低段写字习惯培养教案
- 2026年《护士条例》培训试题(含答案)
- 2026年「熔化焊接与热切割」考试题及答案
- 商场员工安全知识培训
- 设备安全管理培训
- 文案策划部主管年度工作述职报告
- 健康素养促进管理
- 食品加工企业安全检查制度
- 城市环卫租赁管理办法
- 2024年芜湖市直属学校选调教师真题
- HY/T 0460.1-2024海岸带生态系统现状调查与评估技术导则第1部分:总则
- 2025-2030中国电容式液位变送器行业市场现状供需分析及投资评估规划分析研究报告
- 酒驾查处流程
- QGW1799.1-2013《电力安全工作规程变电部分》-无附录
- DB51∕T 2428-2017 高速公路施工标准化技术指南
- 2024年湖南省张家界桑植县卫健局招聘271人历年(高频重点复习提升训练)共500题附带答案详解
- 篮球场维护管理合同范本
- 《山东省建设工程消防设计审查验收技术指南(建筑、结构)》
- 九年级物理学霸赛考卷01(解析版)(考查范围人教版九年级13-14章)2023-2024学年九年级全一册物理培优专题训练(人教版)
评论
0/150
提交评论