版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
ClusterAnalysis聚类分析•
聚类分析概况•
系统聚类法•
快速聚类法•
其它聚类方法•聚类方法的选择•聚类分析注意事项•实例分析一、聚类分析概况1、概念•聚类分析(clusteranalysis),是研究"物以类聚"的一种统计方法,研究样本与指标之间存在不同程度的相似性.根据一批样本的多个观测指标,具体找出能够度量样本或指标之间相似程度的统计量,以这些统计量为划分类型的依据,将相似程度比较高的样本(指标)聚合为一类,把另外一些彼此相似程度较大的样品(指标)又聚合为另外一类,即关系密切的聚合到一个小的分类单位,关系疏远的聚合到一个大的分类单位,直到把所有的样品(指标)都聚合完毕。•聚类分析与判别分析有所不同.判别分析根据已知其类别的样品,总结出类别的判断法则,用以判断未知类别的新样品的归类;而聚类分析是在事物分类面貌尚不清楚,甚至连总共分几类也不确定的情况下讨论事物的分类问题,所以聚类分析没有作为分类依据的"历史资料",只能根据事物本身的特性进行分类分类•按聚类对象分.1)Q型聚类分析:又称样品聚类,是指将多个样品归类的方法,其目的是找出样品间的共性.2)R型聚类分析:又称指标聚类,是指将多个指标归类的方法,其目的是将指标降维从
而选择有代表性的指标。•按聚类方法分.1)系统聚类法:从各样品自成一类到全部样品归为一类,适合对小样本的样品之间聚类以及对变量聚类2)快速聚类法:寻找中心点形成几类,适合对大样本的样品之间聚类.3)模糊聚类法:采用模糊数学思想进行聚类,适合对大样本的快速聚类.4)有序样品聚类法:对有序样品进行聚类5)两步聚类法:一种探索性的聚类方法,可以处理大样本的数据及同时处理连续和离散型变量.6)决策树聚类法:是解决实际应用中分类问题的数据挖掘方法常用的聚类统计量类•距离:用来衡量样本个体之间属性相似程度的统计量1)绝对值距离2)切比雪夫距离3)欧氏距离4)绝对值的幂测度距离5)明考斯基距离•相似系数:用来衡量指标变量之间属性相似程度的统计量R型聚类常用简单相关系数的绝对值定义变量间的相似系数,绝对值越大表明两变量间相似程度越高Speaman相关系数常用的聚类统计量类•关联测度:用来度量分类变量的研究对象的相似性1)简单匹配系数:适用于二分类变量,最简单的关联测度是两个案例在所有聚类变量上回答相同情况出现的频率,称为简单匹配系数2)雅可比系数:仅适用于二分类变量,把两个答案都回答"否"的部分从上述简单匹配
系数的公式中去掉,也就是d格子常用的聚类统计量类3)果瓦系数:可用于定义名义变量、有序变量和间距测度变量二、系统聚类法2、系统聚类法•基本思想是:开始时各个样品(或变量)独自视为一类,即各类只含一个样品(或变量),计算类间相似系数矩阵,其中的元素是样品(或变量)间的相似系数,相似系数矩阵是对称矩阵.将相似系数最大(距离最小或相关系数最大)的两类合并成新类,计算新类与其余类间相似系数;重复第二步,直至全部样品(或变量)被并为一类.•当类内含有两个或两个以上样品或变量时,由于类间的距离有不同的定义方法,导致有多种方法(methods)可选,在SPSS中主要有:(1)类间平均链锁法(between-groupslinkage):合并两类的结果使所有的两两项对之间的平均距离最小,相对的两个成员分别属于不同的类别。(2)类内平均链锁法(within-groupslinkage):该法是使当两类合并为一类后,合并后的类中的所有项之间的平均距离最小,两类之间的距离是合并后的类中所有可能的项对之间的距离平方(3)最近邻居法(nearestneighbor):该方法首先合并最近或最相似的两项,用两类间最近点间的距离最小值定义为样品和之间的距离(4)最远邻居法(furthestneighbor):用两类之间最远点的距离代表两类之间的距离.(5)重心法(centroidclustering):定义类间的距离等于两类的重心之间的距离,这里的
重心指的是类内所有样本的均值坐标.用和分别表示p、q两类的均值向量(重心),其分量是各个指标类内均数
三、快速聚类法3、快速聚类法•系统聚类法计算样本量很大的样品聚类时,工作量极大,做出的树状图也十分复杂,不便于分析。因此当样本量很大时,可以利用快速聚类法。•快速聚类法是1967年麦克奎因(Macqueen)提出的一种聚类方法,此方法又称为K-均数聚类法(k-means-clustering),K为事先要给定的类别个数。•快速聚类的原理是:首先确定几个有代表性的样品,称之为凝聚点,作为各类的核心,然后将其他样品逐一归类,归类的同时按某种规则修改各类核心直至分类合理为止,快速聚类法可以一开始即对元素分组,或从一个构成各类核心的"种子"集合开始,选择好的初始构型,一种方法是从所有项目中随机选择"种子"或者随机把元素分成若千个初始类.3、快速聚类法该方法原理简单,分类快速,一般经过几轮归类就收敛了,即使样品很多也能迅速得到分类结果.此法的缺点是要事先知道分类数目,在某些具体问题中分类数目根据专业知识是可以事先确定的,而在有的问题中分类数目则难以确定,其过程由下列三步组成:第一步,把样品粗略分成K个初始类.第二步,进行修改,逐个分派样品到其最近均值的类中去,重新计算接受新样品的类和失去样品的类的均值.第三步,重复第2步,直到各类元素进出稳定.想检验聚类稳定性,可以用一个新的最初分类重新检验整个聚类算法,如果最终分类与原来一样,不必再重新计算;否则要重新考虑聚类算法四、其它聚类方法4、其它聚类方法•模糊聚类法(fuzzyclusteringmethod):是在模糊集理论基础上产生的一种聚类分析方法,其实质是根据研究对象本身的属性而构造模糊矩阵,在此基础上根据一定的隶属度确定其分类关系,模糊聚类分析的基本过程:1)原始数据变换,变换方法有标准化变换、对数变换等;2)计算样本或变量间的相似系数,建立模糊相似矩阵;3)利用模糊运算对相似矩阵进行一系列的合成改造,生成模糊等价矩阵;4)最后根据不同的截取水平λ对模糊等价矩阵进行截取分类;5)进行聚类.4、其它聚类方法•有序样品聚类法(orderedsampleclustermethod):又称为最优分割法(theoptimalpartitionmethod),是1958由Fisher提出的一种分类方法,一般的聚类方法是用于独立样品的,因此分类是彼此平等的。但在有些实际问题中,要求样品分裂时次序不能打乱,例如,要了解儿童的生长发育规律,将其发育分为几个阶段,统计男孩从出生到11岁每年平均增长的重量,儿童每年平均增长的重量的数据对应的位置(即样品的次序)在分类时不能打乱.如果用
表示n个有序样品,则每一类必须是这样形式:,其中,,且
,即同一类样品必须是相互邻接的,这种分类问题称为有序样品聚类法。最优分割法是对有序样品进行聚类分割的一种简单方法,其基本思想是将n个有序样品分割为L段.设Xkj表示第k段第j个样品的指标,表示第k段指标的平均值,nk表示该段样品数,表示全部n个样品的总平均值,则样品分为L段时,其指标的总的离差平方和T可以分解为段内离差平方和W与段间离差平方和B两部分.即当一个样品给定后,T是一个常量,当W最小时,B也就达到最大,这种使段内离差平方和最小的分割法就是最优分割法,因此,认为使W值最小的分法是合理的分类法。•两步聚类法(twostepclustering):随着人工智能发展起来的智能聚类方法中的一种探索性聚类方法,其前提条件是各个变量互相独立,服从多元正态分布(对于连续型变量)或联合多分类正态分布(对于同时具有连续型和分类变量时),用于解决海量数据或具有复杂类别结构的聚类分析问题,其基本原理是根据信息量准则给出最佳聚类方案,其基本过程可以分为两步.第一步,预聚类,对记录进行初始的归类,用户自定义最大的类别数,通过构建和修改特征树(CTtree)完成.第二步,正式聚类.对第一步完成的初步聚类进行再聚类并确定最终的聚类方案,系统根据一定的统计标准确定聚类的类别数目.以后,可以通过传统的聚类方法进行聚类•决策树聚类法(dicisiontreeclstering):决策树(desiontree)是自下而上形成的,每个决策或事件都可能引出两个或多个事件,导致不同的结果,把这种决策分支画成图形很像
一棵树的枝干,故称决策树。决策树聚类法是一种基于逻辑的方法,通过
一组输入-输出样本构建决策树,决策树包含属性已被检验的节点,一个节点的输出分枝和该节点的
所有可能的检验结果相对应.由一组输入的属性
值向量和相应的类,用基于归纳学习算法得出分类.其目标是:构建一个分类模型,又叫分类器,可以根据有效的属性输入值预测一些所给样本的类,是在样本其他属性已知的情况下预测另外一个属性(样本的类)的模型(分类的结果)。对于树中的非叶节点,可以沿着分枝继续分区样本,每一个节点得到其相应的样本子集.生成决策树的主要算法是Quilan的ID3算法,C4.5算法是其改进版,该算法的基本思路是:1)从树的根节点处所有训练样本开始,选一个属性来划分这些样本,对属性每一个值产生一个分枝,分枝属性值的相应样本子集被移到新生成的子节点上;2)这个算法递归地应用于每个子节点,直到一个节点上的所有样本都分区到某个类中;3)到达决策树的叶节点的每条路径表示一个分类规则五、聚类方法的选择5、聚类方法的选择聚类方法的选择是由目的和资料特征决定的,在进行聚类分析之前先要判断该资料是要进行样品聚类还是指标聚类,若是指标聚类,直接选择系统聚类法;若是有序样品直接选择有序样品聚类法;若是需要快速聚类的无序样品并服从正态分布则选择两步聚类法;若是需要快速聚类的无序样品并且不服从正态分布则选择快速聚类法;若是需要快速聚类的无序样品需要模糊聚类则选择模糊聚类法;若是需要快速聚类的无序样品不符合模糊聚类,看其是否基于逻辑,是则选择逻辑聚类,不是则选择系统聚类。聚类分析流程图二、聚类分析注意事项5、聚类方法的选择•分类数的确定:聚类分析的目的是要对研究对象进行分类,因此如何选择分类数成为各种聚类方法中的重要问题之一确定分类数的问题是聚类分析中迄今为止尚未完全解决的问题之一,主要的障碍是对类的结构和内容很难给出一个统一的定义.虽然分类数难以确定,但是可以从一些现象来决定,如各类观测值不要太多或太少,类与类间的分野应尽量清楚,即类与类间的重心距离必须很大,黛米尔曼曾经提出了根据树状结构图来分类的准则:准则1:任何类都必须在临近各类中是突出的,即各类重心之间的距离必须大.准则2:各类所包含的元素都不要过分地多.准则3:分类的数目应该符合使用的目的.准则4:若采用几种不同的聚类方法处理,则在各自的聚类图上应发现相同的类。聚类分析时最好不要有某个类的观测值很多或某个群的观测值特别少的现象,聚类数最好是二类、三类或者四类,因为当超过五类时,就很难对每个聚类加以解释,也很难对其特征命名了.5、聚类方法的选择•聚类的命名:对聚类结果进行解释是希望对各个聚类特征进行准确的描述,给每个类取一个合适的名称,这一步可以借助与各种描述性统计量进行分析.通常做法是计算各个类在各聚类变量上的均值,对均值进行比较分析,还可以使用聚类变量之外的其他变量帮助描述各个类的特征,解释各个类别的原因•聚类结果验证:若采用不同的方法进行聚类分析,且得到了很接近的结果,或选用不同的初始聚类中心,重复用迭代聚类法进行聚类,得到完全相同的聚类结果,则表示聚类结果
是可信的、合适的.在决定聚类方法与聚类数上,结果是否合适才是最重要的,检验与统计指标并不是绝对的参考量,研究人员针对研究决定"目标"的专业判断和解释才是非常重要的.六、实例分析6、实例分析测得32名成年男性的血生化和血常规指标11项(表10.2),分别是血红蛋白、红细胞、白细胞、血小板、总胆红素、直接胆红素、谷丙转氨酶、谷草转氨酶、碱性磷酸酶
尿素氮、肌酐,对这11项血常规和血生化指标进行聚类分析【分析】这是一个小样本的连续变量资料,对这类数据进行分析,可以采用系统聚类分析,既对变量进行聚类,又可对样品进行聚类,这里主要展示变量聚类情形.【操作】在SPSS主菜单中,激活Statisics菜单选Classiy中的HierarchicalCuster命令
项,弹出HierarchicalClusterAnalysis对话框,在对话框左侧的变量列表中点需分析的多个
变量,使之进入Variables框;在Cluster处选择聚类类型(Cases,样品聚类;Vaniables,变量聚
类)为变量聚类,点Methods钮弹出一个符合框,在Clustermethod框中可以用下拉式菜单
选择聚类方法[本例选择类间平均链锁法(Between-groupslinkage)],在Measure框中可以用
下拉式菜单选择聚类统计量(这里选相关系数Pearsoncorrlarion),点Continue返回.若要选择统计量则点Statisics后进行选择并点Contine返回,最后点0K钮即可。【结果及解释】这里Mehod选用常用的类间平均链锁法(betweengrupsike,聚类统计量选择Pearsoncorelation,对11个变量聚类的主要结果如下:以上结果,ClusterCombined合并聚类步骤,Coefficients表示聚合系数,第2列和第3列表示每次聚合的类.开始时每个变量自成一类,共11类,此后逐步减少直到全部聚为
一类,注意总共有10类(11-1=10);第三阶段(Stage=3)时,第5类(代表变量5与6聚合成的新类)与第10类(变量10)聚合为1类.前3步聚类过程如下,后面步骤以此类推.第1步:第5和第6两个变量合并.第2步:第2、8两个变量合并.第3步:第5类、第10变量合并以上为纵向(垂直)冰柱图(verticalicicle).冰柱图(icicleplot)是表示聚类结果的另
外一种常见形式,包括两种,一种是纵向(垂直)冰柱图,另一种是横向冰柱图(horizontalicicle).纵向冰柱图中,水平方向表示案例(本题表示变量),纵向表示类数,横向冰柱图
相反,水平方向表示类数,纵向表示案例,上面的图给出了系统聚类的纵向冰柱图,如果
按照设定的类数,在类数的行上,从左到右可以找到各类所包含的变量,比如我们希望分3类,最左边的类数应该选择3,每个样品右边都有一列X,如果某个样品右边的X个数少
于3,那么它和前面多于3个X的样品聚为一类,如此下去直到找到全部三类为止.例
如,X5右边的列只有两个X,那么它就与前面X6、X10、X11聚为一类,而X4右边只有一
个X,那么它就和X11聚为一类,后面的变量聚为一类,下面列举出分为3类时的结果:聚为1类:(X1,X2,X3
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 函函函函函请示函函复(4篇范文)
- 技术更新与升级协调会议通知(3篇)
- 关于召开销售与市场策略讨论会议的通知(4篇)
- 电商物流仓储优化与配送效率提升方案
- 预防为主守护身心健康一年级主题班会课件
- 养成良好学习习惯提高学习效率小学主题班会课件
- 制造业现场精益生产操作规范方案
- 关于客户订单更改事宜确认函(6篇)
- 关于招聘面试安排商洽函8篇范本
- 环境监测与分析方法及其在环境治理中的应用
- DB11-T 638-2023 房屋修缮工程工程量计算标准
- T-DGGC 011-2023 盾构机操作工技能鉴定规范
- 2026国考行测言语理解真题(地市)及完整答案1套
- DB52∕T 1401.23-2020 山地旅游 第23部分:漂流服务规范
- 《医疗机构工作人员廉洁从业九项准则》党课学习
- 学生安全管理知识培训课件
- 有线电视客服部应急预案
- 主任护师晋级工作总结
- 完形填空(含答案解析)-2025年新九年级(八升九)英语暑假专项提升
- 2025年苏科版七年级数学八年级开学摸底测试卷(一)含答案
- 中国外卖行业趋势报告2025
评论
0/150
提交评论