什么是主成分分析_第1页
什么是主成分分析_第2页
什么是主成分分析_第3页
什么是主成分分析_第4页
什么是主成分分析_第5页
已阅读5页,还剩10页未读, 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

主成分分析(principalcomponentanalysis,PCA)如果一组数据含有N个观测样品样本,每个样品样本需要检测的变量指标有K个,如何综合比较各个观测样品样本的性质优劣或特点?这种情况下,任何选择其中单个变量指标对样品本进行分析的方法都会失之偏颇,无法反映样品样本综合特征和特点。这就需要多变量数据统计分析。多变量数据统计分析中一个重要方法是主成份分析。主成分分析就是将上述含有N个观测样品样本、K个变量指标的数据矩阵转看成一个含有K维空间的数学模型,N个观测样品样本分布在这个模型中。从数据分析的本质目的看,数据分析目标总是了解样品样本之间的差异性或者相似性,为最终的决策提供参考。因此,对一个矩阵数据来说,在K维空间中,总存在某一个维度的方向,能够最好、最大程度地描述样品的差异性或相似性(图1)。基于偏最小二乘法原理,可以计算得到这个轴线。在此基础上,可以在垂直于第一条轴线的位置找出第二个最重要的轴线方向,独立描述样品第二显著的差异性或相似性;依此类推到n个轴线。如果有三条轴线,就是三维立体坐标轴。形象地说,上述每个轴线方向代表的数据含义,就是一个主成份。X、Y、Z轴就是第1、2、3主成份。由于人类很难想像超过三维的空间,因此,为了便于直观观测,通常取2个或者3个主成份对应图进行观察。图(1)PCA得到的是一个在最小二乘意义上拟合数据集的数学模型。即,主成分上所有观测值的坐标投影方差最大。从理论上看,主成分分析是一种通过正交变换,将一组包含可能互相相关变量的观测值组成的数据,转换为一组数值上线性不相关变量的数据处理过程。这些转换后的变量,称为主成分(principalcomponent,PC)。主成分的数目因此低于或等于原有数据集中观测值的变量数目。PCA最早的发明人为KarlPearson,他于1901年发表的论文中以主轴定理(principalaxistheorem)衍生结论的形式提出了PCA的雏形,但其独立发展与命名是由HaroldHotelling于1930年前后左右完成。PCA可通过对数据的协方差/相关系数矩阵的特征分解,或对数据矩阵进行奇异值分解完成。设一个由N个观测值(行),K个变量(列)的数据矩阵X,如图(2)。观测值可以是分析样品,化合物或不同反应条件,持续流程的时间点,批量工程的批次,生物个体等等,而变量则是表征观测值属性的数值,可以是光谱(NIR,NMR等),色谱(HPLC,GC等)乃至以及其他传感器的测量值。图(2)PCA数据集示意图主成分分析的数学模型如下:上述N×K维矩阵写作向量集为因此对N个观测值求平均向量,为观测值向量集的协方差矩阵为:求出协方差矩阵的特征向量ui和对应的特征值λi,并有:选择大于λd的λi对应特征向量构成主成分,主成分构成的变换矩阵为:PCA分析的几何解释如图(?)。N个观测值(黄点)分布在K个变量方向构成的K维空间中。利用最小二乘法原理找到一条直线使所有样品距离该直线的总残差最小,而投影在此数轴方向的方差最大,那么该直线方向也就体现了样品间最大差异,为一个主成分;沿着与前一个直线垂直方向,找到第二个主成分,以此类推。PCA的最重要作用是建立低维平面或空间(通常2-5维),以此概览整个数据集,并从中揭示出数据集中观测值的分组、趋势以及离群值。这一概览同时可以发现观测值与变量,以及变量间的关系。统计上,PCA的过程是在K维的空间中,寻找在最小二乘意义上可以整体估计整个数据集的线、平面或超平面。这样的线、平面或超平面是对整个数据集的最小二乘近似,在这样的线或平面上,变量(即观测值的坐标)达到可能的最大总方差。PCA是试探性数据分析(exploratorydataanalysis,EDA)的有力工具,也可以用于预测模型;作为基于特征向量进行的最简单的多变量分析方法,可用于揭示数据的内在结构,最大程度好地解释数据的差异。对于一个原本只能用高维坐标系描述的数据集(每个变量对应1个维度),PCA可用一个低维度的坐标系进行描述(每个主成分对应1个维度),并且通过降维的转换令数据本征性的变化凸显出来。参考文献Pearson,K.(1901)."OnLinesandPlanesofClosestFittoSystemsofPointsinSpace"(PDF).PhilosophicalMagazine.2(11):559–572.Hotelling,H.(1933).Analysisofacomplexofstatisticalvariablesintoprincipalcomponents.JournalofEducationalPsychology,24,417–441,and498–520.Hotelling,H.(1936).Relationsbetweentwosetsofvariates.Biometrika,28,321–77

多变量分析(Multi-VariateAnalysis,MVA)在管理科学、社会科学与自然科学的许多领域中,往往需要对许多事物、许多系统参数及流程属性中的各种变量进行计量和分析研究。在这些过程中收集到的数据,往往同时存在复数的变量,并来源于复数的样本或时间点,可称之为多元变量(Multi-Variate)。通过多变量数据,对研究对象的本质的深入洞悉与解读,除了需要所研究系统涉及的科学技术背景知识,也需要相应的分析手段。针对同时存在复数变量的多变量数据的这些分析方法统称为多变量分析。明智地选择观测值(Observations)以及变量(Variables),并准确计量而得到的多变量数据,比单变量(Univariate)数据包含更多的信息。一般认为,多变量分析起源于医学和心理学,Anderson于1958年的著作AnIntroductiontoMultivariateAnalysis是这一理论于现代建立并完善的起点。限于当时的计算技术,多变量分析的应用和发展均受到限制。近年随着计算机技术的发展,多变量分析发展速度趋快。目前,多变量分析技术包括但不限于以下类型:1回归分析(multiplelinearregression,MLR)2判别分析(lineardiscriminationanalysis,LDA)3典型相关分析(canonicalcorrelation,CC)4因子分析(factoranalysis,FA)5主成分分析(principalcomponentanalysis,PCA)参考文献1ErikssonL,ByrneT,JohanssonE,etal.Multi-andmegavariatedataanalysisbasicprinciplesandapplications[M].UmetricsAcademy,2013.2T.W.Anderson,AnIntroductiontoMultivariateStatisticalAnalysis,Wiley,NewYork,1958.

主成分得分与得分图(PrincipleComponentScoreandScorePlot)主成分得分(PrincipalComponentScore)是PCA分析结果中的一个重要参数,简称得分(Score),是PCA分析中观测值的重要表征。如图(编号将根据最后图片数量和位置确定),以黄点表示的N个观测值分布在以红点为原点的K维空间中。X1-X3为K个变量中前三个变量的方向,PC1和PC2为两个主成分方向。对N个观测值中的第i个,做其垂直于第j主成分方向的投影,即以该主成分方向为坐标方向,得到观测值i在主成分j上的坐标值,称为i在第j主成分上的得分。每个观测值在每个主成分上都可能有不同的得分。以得分值作图即为得分图。如图()所示,为各观测值在主成分PC1和PC2的得分图。观测值i在主成分j的得分反映了其在该主成分上的变异程度,如i和i’在主成分j上拥有相近得分值,证明观测值i,i’在主成分j的特征上较为相近。这样的关系通过得分图上观测值的分布较容易得出。图()观测值在PC1和PC2上的投影即为得分图()PCA得分图一例参考文献阿基业.代谢组学数据处理方法——主成分分析[J].中国临床药理学与治疗学,2010,15(5):481-489.

主成分载荷与载荷图(PrincipleComponentLoadingandLoadingPlot)几何学上,主成分载荷用于表征主成分模型(线、平面或超平面)在K位变量空间的方向。如图(),以黄点表示的N个观测值分布在以红点为原点的K维空间中。X1-X3为K个变量中前三个变量的方向,PC1和PC2为两个主成分方向。对PC1,其方向与原始变量X1-X3方向的关系,可以用PC1分别与变量X1-X3的夹角α1-α3余弦值来表征。这些数值体现了变量X1-X3对PC1的贡献,称为载荷。图()主成分方向与变量方向夹角的余弦称为载荷每个变量对每个主成分都有各自的载荷。通过所有的载荷唯一确定模型在K维变量空间的方向与位置。以各主成分上各变量的载荷作图即为载荷图。如图()例,为某主成分分析中PC1和PC2所有变量的载荷图。结合载荷图和得分图,可以分析观测值分布与变量的关系,各个变量对观测值的影响程度,以及变量之间的相关性。在位于同一象限且距离更近的变量,在各观测值间有相对一致的变化趋势,存在正相关;而原点对称的两个变量趋于负相关。在载荷图上距离原点距离近的变量对模型贡献较小,也意味着其对观测值的变化贡献较小,反之亦然。图()主成分载荷图一例

变量的缩放与平均值中心化(ScalingandMean-centering)主成分分析是一种寻求最大总方差投影的方法,因此,有较大方差的变量在主成分分析模型中的表达比方差较小的变量更显著。在实际分析中,观测值的各变量常常具有不同的数量级。数量级大的变量相比之下方差数量级也较大。在这种情况下,数量级小的变量其变化不能在模型里充分表达。解决上述问题的方法,是对各变量进行标准化,使各变量的数值范围按一定标准规整一致。这种对变量规整化的处理称为缩放(Scaling)。图()为缩放的几何解释。N个包含K个变量的观测值,以分布在K维空间的点表示。而缩放的目的,则是按照一定标准,将各观测值在各坐标轴上的范围进行规整。常用的一个缩放标准是令各变量等方差,这样的缩放方式称为等方差缩放(UnitVarianceScaling,UV-Scaling)。等方差缩放的代数方法是计算每一个检测变量的标准偏差(standarddeviation,Sk),然后对此变量乘以1/Sk进行缩放。经过如此缩放后,每个变量均具有相同的方差。图()变量缩放的几何解释计算每个变量的平均值,用变量中的数据减去该平均值使数据均匀分布在0点附近,这个过程称作平均值中心化(mean-centering)。这一过程可提高主成分分析模型的解释能力。

基于偏最小二乘法的内在结构投影分析(PartialLeastSquareProjectionstoLatentStructures,PLS)偏最小二乘法是一种将观测值的两个数据矩阵,如X和Y,通过线性多变量模型关联的方法。它尤其在X和Y中存在大量噪音、多重共线性甚至缺失变量时十分有效。PLS分析中,观测值可以是化合物、分析样品、连续流程的时间点、生物个体等等。X变量矩阵又称为因子(factors)或预测因素(predictors),可以是色谱、质谱或其他传感器的读数。Y变量矩阵称为响应(responses),反映观测值的性质,如收率、纯度、质量等。在偏最小二乘法分析中,X和Y都被投影到新的空间中,并以X空间的多维方向来解释Y空间方差最大的多维方向,是在这两个空间对协方差结构建模的隐变量方法。图()PLS的基本思想偏最小二乘的简化数学模型如下:X=TPT+EY=UQT+E其中X是N×K的预测因子矩阵,Y是N×M的响应矩阵;T和U是N×L的矩阵,分别为X的投影和Y的投影矩阵;P和Q分别是M×L和P×L的正交载荷矩阵;矩阵E和F是残差,假设是独立同分布的随机正态变量。对X和Y分解来最大化T和U之间的协方差。对PLS的几何解释见图()。N个观测值的K个预测变量(即X矩阵)和M个响应变量(即Y矩阵)分别表示为K维空间和M维空间中的点。通过偏最小二乘法分析,目的是最大程度解释观测值,并判断进而描述观测值集合的预测变量与响应变量的联系。第一个PLS成分,是X空间和Y空间各一条直线,X,Y在这条直线上的投影为向量T,U。两条直线需满足:1最大解释观测值,包括X,Y;2T和U能达到最大的关联程度,如图()所示。在垂直于第一个PLS的条件下,以此类推求第二个PLS成分,如图()所示。图()PLS的几何解释图()以U与T的关联解释Y与X的关联1975年,瑞典统计学家HermanWold在对复杂链矩阵建模,即路径模型的研究中,发明了简单高效地对上述模型中一些参数进行估算的算法——非线性迭代偏最小二乘法(NonlinearIterativePartialLeastSquares,NIPALS)。1980年左右,其子SvanteWold与HaraldMartens完善了这一算法,使它可以应用于通常回归较难进行的复杂数据集之间。SvanteWold等人认为偏最小二乘法应该命名为内在结构投影(ProjectionstoLatentStuctures),但这一命名至今未被大多数领域接受。偏最小二乘法最早用于社会科学领域,经过多年发展,现已为计量化学、生物信息学、神经科学等领域接受并广泛应用。加参考文献

正交内在结构投影分析(orthogonalprojectionstolatentstructures,OPLS)2002年,JohanTrygg和SvanteWold在偏最小二乘法的算法基础上,建立了一种新的多变量分析方法,称为正交内在结构投影。与偏最小二乘法的区别是,预测矩阵X中,与响应矩阵Y无关联的变化会被除去。从数学角度,即除去X中正交于Y的系统变异。PLS算法的目的是最大解释观测值并最大关联预测变量与相应变量,其目标函数是最大化X与Y的协方差。通俗的说,PLS算法将观测值中预测变量X的变异——以方差的平方和表示——分成了可解释的系统变化R2X和残差E。对X/Y关联的解释乃至可视化是PLS算法的一大优点。但当模型复杂性上升的时候,通过模型参数对X/Y关联的解释难度将会上升。OPLS算法相比PLS算法,除残差部分E之外,进一步地将观测值中的预测变量X的系统变异分解为两个部分,与Y变异相关的,可预测Y变异的部分R2Xpred;与Y变异不相关,即与Y变异正交的部分R2Xorth。在与PLS有相同的模型拟合和预测能力的基础上,OPLS通过预测成分(predictiveOPLScomponent)和正交成分(orthogonalOPLScomponent)的区分,使模型有了更好的可解释性。图OPLS的简化数学模型如下:X=TpPpT+ToPoT+EY=TpQpT+F其中X是N×K的预测因子矩阵,Y是N×M的响应矩阵;Tp和T

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论