多元统计分析-(4)ppt课件_第1页
多元统计分析-(4)ppt课件_第2页
多元统计分析-(4)ppt课件_第3页
多元统计分析-(4)ppt课件_第4页
多元统计分析-(4)ppt课件_第5页
已阅读5页,还剩85页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

1、R语言与数据分析培训,1,第4讲 多元统计分析,2,多元数据,3,多元数据基本方法,聚类(cluster),排序 (ordination),4,5,Doubs鱼类数据集,该数据集包括3个矩阵,第一个矩阵是27种鱼类在每个样方的多度,第二个矩阵包括11个与河流的水文、地形和水体化学属性相关的环境变量,第三个矩阵是样方的地理坐标(笛卡尔坐标系,X和Y)。,法国和瑞士边境的Jura山脉的Doubs河,6,聚类分析,7,层次法(hierarchical)和非层次法(non-hierarchical),8,距离(distance)(相异性)矩阵。例如欧氏距离、Jaccard相似系数,排序的对象-距离矩阵

2、,9,基于连接的层次聚类,平均聚合聚类,10,11,12,13,14,Ward最小方差聚类,15,16,非层次聚类,非层次聚类(non-hierarchical clustering)是对一组对象进行简单分组的方法,也可以表述为:在p维空间内有n个对象(点),将n个对象分为k组(或称为聚类簇),分组的依据是尽量使组内的对象之间比组间对象之间的相似度更高。此时用户需要自己决定分组的数量k。非层次聚类的算法首先需要有个初始的结构,即首先将所有对象任意分为k组,然后在初始结构的基础上进行不断替换迭代,以达到最优化的分组结果。初始结构的设定可以依据某种理论,但大多数情况下是随机分配。通常是设定不同的初

3、始结构,然后通过大量的迭代以找到最佳的解决方案。,17,18,19,20,物种,环境因子,多元回归树(MRT),空间,时间,21,MRT,22,23,24,25,26,27,28,29,30,排序(Ordination),非约束排序 (Unconstrained Ordination) 典范排序 (Canonical Ordination),31,Petr,Ter Braak,32,33,34,35,2个种的排序图,3个种的排序图,4个种的排序图?,40个种排序图?,Why ordination?,36,Why ordination?,37,排序的目标: 1.降低维数,减少坐标轴的数目 ; 2

4、. 由降低维数引起的信息损失尽量少,即发生最小的畸变,也就是让新的坐标系前几轴排序轴包含大量的生态信息 。,38,排序类别 非约束排序 Unconstrained Ordination PCA (Principal components analysis) CA (Correspondence analysis) (DCA) PCoA (Principal Coordinate Analysis) NMDS(Nonmetric Multidimensional Scaling) 非度量多维尺度分析 约束排序(典范排序) constrained Ordination RDA (Redundanc

5、e analysis) CCA (Canonical correspondence analysis) LDA (linear discriminant analysis ) (CCorA), canonical correlation analysis; (CoIA) co-inertia analysis, (MFA)multiple factor analysis (对称),非对称,特征根方法,39,非约束排序 (Unconstrained Ordination),主成分分析(principal component analysis,PCA):基于特征向量的主要排序方法。分析对象是原始的

6、定量数据。排序图展示样方之间的欧氏距离。 对应分析(correspondence analysis,CA):分析对象必须是频度或类频度、同量纲的非负数据。排序图展示行(对象)或列(变量)之间的卡方距离。在生态学研究中主要用于分析物种数据。 主坐标分析(principal coordinate analysis,PCoA):分析对象为距离矩阵(大部分为Q模式),而非原始的样方-变量矩阵表格。因此,可以灵活选择关联测度。 非度量多维尺度分析(nonmetric multidimensional scaling,NMDS):与前面三种排序方法不同,NMDS不是基于特征向量提取的排序方法。NMDS尝试

7、在预先设定数量的排序轴去排序对象,目标是保持这些对象排位关系(ordering relationships)不变。,40,PCA,协方差,41,42,43,44,45,46,47,48,CA,49,50,51,52,53,PCoA(Principal Coordinate Analysis),欧氏距离,卡方距离,任何距离,54,55,NMDS(非度量多维尺度分析)nonmetric multidimensional scaling,如果排序的目的不是在于最大程度保留对象之间实际的距离,只是反映对象之间顺序关系,这个时候非度量多维尺度分析可能是一种解决方案。与PCoA一样,NMDS可以基于任何类

8、型距离矩阵对对象(样方)进行排序。与PCoA不同的是,NMDS不再基于距离矩阵数值,而是根据排位顺序进行计算。这对于距离缺失的数据的确有优势,只要想办法确定对象之间的位置关系,便可以进行NMDS分析。NMDS不再是特征根排序技术,也不再以排序轴承载更多的变差为目的。因此NMDS排序图可以任意旋转、中心化和倒置。NMDS的计算过程如下:(此处描述非常简略,详情请参考Legendre和Legendre,1998,第445页及之后的内容)。p136,56,NMDS,在这里dij 是样方点在排序空间中的距离,而 是原始的距离矩阵的相异性系数。f()函数是非度量单调转化函数。用这种方法,以非度量方式定义

9、对应的过程是,也就是排序依赖于相异系数的大小顺序,并不依赖准确的相异性系数值。这种在排序空间对排序对象进行重新排列的目的在于最小化stress. 这个算法必然是一个迭代的过程,它的收敛性依赖初始的结构。当然,做到全局的最小化stress往往是不能达到,因此,多尝试几次初始结构是值得的。很多常用和专业化统计软件包带有计算NMDS的程序。,57,58,59,RDA (Redundance analysis) CCA (Canonical correspondence analysis) LDA (linear discriminant analysis ) (CCorA), canonical c

10、orrelation analysis (CoIA) co-inertia analysis, (MFA)multiple factor analysis,非对称,第6章 典范排序(canonical ordination),对称,物种,环境因子,60,典范排序(canonical ordination),RDA,PCA,Total variation,61,RDA,62,RDA,63,RDA,64,65,66,67,68,计算校正R2,这里,n是对象的数量(样点数量),m是解释变量的数量(或更准确说,是模型的自由度)。只有模型自由度(m)不要比观测值的数量(n)大(保证n-m-10),公式是有效的。,69,70,71,置换检验的原理,72,73,74,75,76,偏RDA,77,78,解释变量的筛选,这里R2j是变量Xj作为响应变量,与其他变量进行多元回归的决定系数。如果Xj依赖别的变量越强,R2j越大,

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论