版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
方法原理按照个体(记录)的特征将它们分类,使同一类别内的个体具有尽可能高的同质性,而类别之间则具有尽可能高的异质性。为了得到比较合理的分类,首先要采用适当的指标来定量地描述研究对象之间的联系的紧密程度。直观的理解为按空间距离的远近来划分类别方法原理假定研究对象均用所谓的“点”来表示。在聚类分析中,一般的规则是将“距离”较小的点归为同一类,将“距离”较大的点归为不同的类。常见的是对个体分类,也可以对变量分类此时一般使用相似系数作为“距离”测量指标方法原理例:根据年龄将人群分成适当的类,从右图可见,人群被分为两类是比较合适的。方法原理在右图中可以看到五个样品应当可能被分为两组或者三组,C/D组x和y的取值均偏低,而另三个所在组x和y的取值均偏高分为两类或三类都是可接受的从图中可以直观的理解“距离”的含义方法原理当用于聚类的变量逐渐增多时,分析思路完全相同,只是这样简单、清晰的图示展现类别情况变得逐渐不大可能多维空间中的观察可能的解决方法放弃图示化观察,改用复杂的统计指标缩减维度,使得可以在低维度空间进行呈现特点聚类分析前所有个体所属的类别是未知的,类别个数一般也是未知的,分析的依据就是原始数据,可能事先没有任何有关类别的信息可参考。严格说来聚类分析并不是纯粹的统计技术,它不像其它多元分析法那样,需要从样本去推断总体。一般都涉及不到有关统计量的分布,也不需要进行显著性检验。聚类分析更像是一种建立假设的方法,而对相关假设的检验还需要借助其它统计方法。聚类分析与SPSS软件TwoStepCluster过程特点:处理对象:分类变量和连续变量自动决定最佳分类数快速处理大数据集前提假设:变量间彼此独立分类变量服从多项分布,连续变量服从正态分布模型稳健TwoStepCluster过程步骤:建立ClusterFeatures(CF)Tree确定最佳聚类数分析实例:某汽车制造商为了了解整个汽车市场的形势,希望根据汽车的基本属性和价钱对其进行分类,以有效地提高竞争力。数据:car_sales.savcategoricalvariable:Vehicletypecontinuousvariables:Priceinthousands~Fuelefficiency价位低、车型小、省油在该类中,所有变量均对分类有意义按变量对分类的贡献大小排序Fuelefficiency唯一大于均值K-meansCluster过程k-均值聚类(k-meanscluster,也叫快速聚类,quickcluster)要求你先说好要分多少类。假定你说分3类,这个方法还进一步要求你事先确定3个点为“聚类种子”(SPSS软件自动为你选种子);也就是说,把这3个点作为三类中每一类的基石。然后,根据和这三个点的距离远近,把所有点分成三类。再把这三类的中心(均值)作为新的基石或种子(原来“种子”就没用了),再重新按照距离分类。如此叠代下去,直到达到停止叠代的要求(比如,各类最后变化不大了,或者叠代次数太多了)。显然,前面的聚类种子的选择并不必太认真,它们很可能最后还会分到同一类中呢。K-meansCluster过程属于非系统聚类法的一种方法原理选择(或人为指定)某些记录作为凝聚点按就近原则将其余记录向凝聚点凝集计算出各个初始分类的中心位置(均值)用计算出的中心位置重新进行聚类如此反复循环,直到凝聚点位置收敛为止K-meansCluster过程方法特点要求已知类别数可人为指定初始位置节省运算时间样本量大于100时有必要考虑只能使用连续性变量K-meansCluster过程分析实例一个电信服务提供商希望基于客户使用的服务种类对客户进行细分。如果客户能够按照使用的服务种类进行细分,提供商就可以针对客户的偏好,向其提供不同的服务内容,吸引客户使用更多的服务。关于客户服务使用情况的标准变量包含在数据〈电信客户.sav〉中,请使用快速聚类法对客户进行聚类。zlnlong~zlnwire、zmultlin~zebill注意类别数、分类结果的实际应用。大客户:购买很多服务中等客户:主要使用“calling”服务小客户:使用很少的服务,或者不购买任何服务惨了,近一半的客户属于价值非常小的客户。能不能从这群人中找到一些相对来说价值比较大的客户呢?发现一类具有潜在价值的客户:购买网络服务寻找到25%的潜在客户!练习在SPSS自带数据文件plastic.sav中根据tear_res、gloss、opacity三个变量的取值将20个样本分为三类方差分析表,剔除无用变量均数描述和均数图,考察变量在各组间的均值变化情况按姿势蝶泳、仰泳、蛙泳、自由泳四类对游泳运动员进行分类。数据〈swim.sav〉HierarchicalCluster过程属于系统聚类法的一种其聚类过程可以用树形结构(treelikestructure)来描绘的方法方法原理先将所有n个变量/观测看成不同的n类然后将性质最接近(距离最近)的两类合并为一类再从这n-1类中找到最接近的两类加以合并依此类推,直到所有的变量/观测被合为一类使用者再根据具体的问题和聚类结果来决定应当分为几类HierarchicalCluster过程特点一旦记录/变量被划定类别,其分类结果就不会再进行更改可以对变量或记录进行聚类变量可以为连续或分类变量提供的距离测量方法非常丰富运算速度较慢HierarchicalCluster过程分析实例:数据car_sales.sav,对售价在10万以上的汽车进行分类。type=0,sales>100HierarchicalCluster过程分析实例:电信服务提供商希望了解客户对于各种服务的使用情况,如果能够对服务进行分类,他们就可以将服务进行打包,推出更有吸引力的服务。服务的使用情况包含在数据〈电信.sav〉中,请使用系统聚类法来研究不同类型的服务之间的关系。对变量进行聚类Tollfreeservice~Wirelessservice、Multiplelines~Electronicbilling冰柱图的解读需要注意的问题距离测量方法使用默认值即可变量选择无关变量有时会引起严重的错分应当只引入在不同类间有显著差别的变量尽量只使用相同类型的变量进行分析使用连续变量,将分类变量用于结果解释新的聚类方法可以同时使用这些变量需要注意的问题共线性问题对记录聚类结果有较大的影响相当于某个变量在聚类中的权重大于其它变量最好先进行预处理变量的标准化变量量纲/变异程度相差非常大时需要进行数理统计算法上要求一律标准化标准化后会削弱有用变量的作用需要注意的问题异常值影响较大还没有比较好的解决办法尽力避免分类数从实用角度讲,2~8类比较合适专业意义一定要结合专业知识进行分析需要注意的问题其他方面聚类分析主要应用于探索性的研究,其分析的结果可以提供多个可能的解,选择最终的解需要研究者的主观判断和后续的分析聚类分析的解完全依赖于研究者所选择的聚类变量,增加或删除一些变量对最终的解都可能产生实质性的影响不管实际数据中是否真正存在不同的类别,利用聚类分析都能得到分成若干类别的解总结内容\方法Two
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 2026青年成长经济社会发展新时代怎样培养担当民族复兴大任的时代新人报告方案设计规划
- 2026中国涡流泵进出口贸易与国际化战略研究报告
- 2026中国现代农业装备智能化转型与市场前景研究报告
- 2026中国水泥设备行业市场应用现状与发展趋势深度研究报告
- 2026中国云计算数据中心建设布局与绿色节能发展策略
- 2026瑞士钟表制造业危机应对经验工艺创新与留学青年支持政策研究报告
- 2026中国心血管支架产业专利格局与临床应用报告
- 2026人工智能伦理体系构建与行业自律机制设计
- 2026煤化工行业气化炉燃烧效率提升技术改造及碳排放交易市场价格波动影响分析
- 2026中国食品添加剂市场竞争分析发展现状评估投资规划研究报告
- 血管炎患者的护理
- 架线跨越果林施工方案
- 16G362钢筋混凝土结构预埋件(详细书签)图集
- 价值型销售(技能篇)
- T-CECS120-2021套接紧定式钢导管施工及验收规程
- 医学实验风险评估报告
- MR355.臂丛神经规范化扫描方案
- 中式烹调工艺与实训(第三版) 课件全套 (刘致良) 第1-13章 绪论、烹饪文化- 成本控制
- 蒋争:英语词汇的奥秘(词根词缀)
- 山西兰花科技创业股份有限公司大阳煤矿分公司煤炭资源开发利用、地质环境保护与土地复垦方案
- 中国越剧唱腔知到章节答案智慧树2023年浙江艺术职业学院
评论
0/150
提交评论