SPSS操作方法:聚类分析报告_第1页
SPSS操作方法:聚类分析报告_第2页
SPSS操作方法:聚类分析报告_第3页
SPSS操作方法:聚类分析报告_第4页
SPSS操作方法:聚类分析报告_第5页
已阅读5页,还剩5页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

./实验指导之一聚类分析的SPSS操作方法系统聚类法实验例城镇居民消费水平通常用下表中的八项指标来描述。八项指标间存在一定的线性相关。为研究城镇居民的消费结构,需将相关性强的指标归并到一起,这实际上就是对指标聚类。实验数据表20XX30个省。市,自治区城镇居民月平均消费数据x1人均粮食支出<元/人>x5人均衣着商品支出<元/人>x2人均副食支出<元/人>x6人均日用品支出<元/人>x3人均烟、酒、茶支出<元/人>x7人均燃料支出<元/人>x4人均其他副食支出<元/人>x8人均非商品支出<元/人>x1x2x3x4x5x6x7x8北京7.7848.448.0020.5122.1215.731.1516.61天津10.8544.687.3214.5117.1312.081.2611.57河北9.0928.127.409.6217.2611.122.4912.65山西8.3523.537.518.6217.4210.001.0411.219.2523.756.619.1917.7710.481.7210.51辽宁7.9039.778.4912.9419.2711.052.0413.29吉林8.1930.504.729.7816.287.602.5210.327.7329.205.429.4319.298.492.5210.00上海8.2864.348.0022.2220.0615.520.7222.89江7.2145.797.6610.3616.5612.862.2511.69浙江7.6850.3711.3513.3019.2514.592.7514.87安徽8.1437.759.618.4913.159.761.2811.28福建10.6052.417.709.9812.5311.702.3114.69江西6.2535.024.726.2810.037.151.9310.39山东8.8233.707.5910.9818.8214.731.7810.10河南9.4227.938.208.1416.179.421.559.76湖北8.6736.057.317.7516.6711.682.3812.88湖南6.7738.696.018.8214.7911.441.7413.23广东12.4776.395.5211.2414.5222.005.4625.50广西7.2752.653.849.1613.0315.261.9814.57海南13.4555.855.507.459.559.522.2116.30四川7.1840.917.328.9417.6012.751.1414.80贵州7.6735.718.048.3115.137.761.4113.25云南9.9837.697.018.9416.1511.080.8311.67西藏7.9439.6520.9720.8222.5212.411.757.90陕西9.4128.205.7710.8016.3611.561.5312.17甘肃9.1627.989.019.3215.999.101.8211.35青海10.0628.6410.5210.0516.188.391.9610.81宁夏8.7028.127.2110.5319.4513.301.6611.96新疆6.9329.854.549.4916.6210.651.8813.61系统聚类法的SPSS操作:1.从数据编辑窗口点击Analyze→Classify→HierachicalCluster,〔见图1图1系统聚类法打开层次聚类法对话如图2。图2系统聚类法对话框选择需要进行聚类分析的变量进入Variable框后,在Cluster栏中选择聚类类型,SPSS有两种层次聚类方法:Cases对样品聚类〔Q型;系统默认,Variable对指标变量聚类<R型,本例选择。在Display栏中选择默认的输出项。2.点击Statistics按钮,打开对话框如图3.图3Statistics对话框Agglomerationschedule输出凝聚状态表〔聚类进度表;本例选择。Ploximitymatrix输出个体间的距离矩阵,本例选择。ClusterMembership栏中显示每个观测量被分派到的类。None不输出。本例选择。Simplesolution指定分类数,并输出样本所属类,单一解。Rengeofsolution指定输出从m到n类的各样本所属类。多个解。选好后返回主对话框。3.单击Method按钮,打开对话框如图4-1.ClusterMethod:选择聚类方法:SPSS中提供7种聚类方法,分别是:类间平均,类平均,最短距离,最长距离,重心法,中值法,最小平方和法。本例选择类间平均。Measure栏:对距离的测度方法选择SPSS中提供了三种类型:Interval等间距度量的变量〔连续型,Counts计数型变量〔离散型和Binary二值变量。Interval等间隔测度的变量方法包括:Euclideandistance欧氏距离;SquaredEuclideandistance欧氏平方距离;Cosine夹角余弦〔R型聚类;PearsonCorrelation皮尔逊相关系数距离〔R型聚类,本例选择此项。Chebychev契比雪夫距离;block距离;Minkowski明氏距离;Customized用户自定义距离--即变量绝对值的第p次幂之和的第r次根。p与r由用户指定。图4-1Method对话框TransformValues栏,选择消除数量级差的方法〔见图4-2,依次是:None不作处理〔系统默认;本例选择此项。Zscores标准化处理;Range-1to1各变量值除全距;Range0to1各变量值减最小值后除全距;Maximummagnitudeof1各变量值除最大值;Meanof1各变量值除以均值;Standarddeviationof1各变量值除以标准差。图4-2Method对话框4.单击Plots按钮,打开对话框如图5.图5Plots对话框Dendrogram表示输出树形图,本例选择此项。Icicle表示输出冰柱图。其中,Allclusters表示输出聚类分析每个阶段的冰柱图;本例选择此项。Specifiedrangeofcluster表示只输出某个阶段的冰柱图,输入从第几步开始到第几步结束,中间间隔几步。Orientationk栏中指定如何显示冰挂图:Vertical纵向显示,本例选择此项。Horizontal横向显示。图6SaveNewVariables对话框5.单击Save按钮,打开SaveNewVariables对话框,如图6所示。选择是否将聚类的结果以变量形式保存在数据文件中。变量名为:clun_m,其中n表示类数,m表示第m次分析。ClusterMembership栏None不输出Simplesolution指定分类数,并输出样本所属类。单一变量。Rengeofsolution指定输出从m到n类的各样本所属类。多个变量。当选择结束后,在主对话框中点击OK,可得下面的输出表和图。ProximityMatrix两两变量间距离矩阵〔相关系数矩阵CaseMatrixFileInput人均粮食支出〔元/人人均副食支出<元/人>人均烟、酒、茶支出<元/人>人均其他副食支出<元/人>人均衣着商品支出<元/人>人均日用品支出<元/人>人均燃料支出<元/人>人均非商品支出<元/人>人均粮食支出〔元/人.000.334-.055-.061-.289.197.349.319人均副食支出<元/人>.334.000-.023.399-.156.716.414.835人均烟、酒、茶支出<元/人>-.055-.023.000.533.497.033-.139-.258人均其他副食支出<元/人>-.061.399.533.000.698.478-.171.313人均衣着商品支出<元/人>-.289-.156.497.698.000.284-.208-.081人均日用品支出<元/人>.197.716.033.478.284.000.408.710人均燃料支出<元/人>.349.414-.139-.171-.208.408.000.399人均非商品支出<元/人>.319.835-.258.313-.081.710.399.000AverageLinkage<BetweenGroups>类间平均AgglomerationSchedule凝聚状态进度表;StageClusterCombinedCoefficientsStageClusterFirstAppearsNextStageCluster1Cluster2Cluster1Cluster2128.835002226.713105345.698004434.515037527.407206612.299057713.004640凝聚状态进度表:第一列<Stage>表示聚类的进度顺序;第二、三列<Clustercombine>表示每一步将哪两类合并;第四列<Cofficients>表示被合并的两类之间的距离;第五、六列<StageClusterFirstAppares>表示被合并的两类上一次合并分别是在哪一步形成的。0表示被合并的类为单个样品。最后一列<NextStage>表示每一步形成的新类将在哪一步参与下一次合并。VerticalIcicle冰柱图NumberofclustersCase人均衣着商品支出<元/人>人均其他副食支出<元/人>人均烟、酒、茶支出<元/人>人均燃料支出<元/人>人均日用品支出<元/人>人均非商品支出<元/人>人均副食支出<元/人>人均粮食支出〔元/人1XXXXXXXXXXXXXXX2XXXXXXXXXXXXXX3XXXXXXXXXXXXX4XXXXXXXXXXXX5XXXXXXXXXXX6XXXXXXXXXX7XXXXXXXXXDendrogram表示输出树形图〔谱分析图******HIERARCHICALCLUSTERANALYSIS******DendrogramusingAverageLinkage<BetweenGroups类间平均>RescaledDistanceClusterCombineCASE0510152025LabelNum++++++X22X88X66X77X11X44X55X33二:K-聚类法的具体操作以例10.4为例,说明快速聚类法的操作过程。1.在数据窗口单击Analyze→Classify→K-MeanCluster打开对话框〔见图7图7K-MeansClusterAnalysis对话框将变量选入Variables栏;将标识变量选入LabelCases栏〔可省略将分类数输入Numberof框〔系统默认为2,本例中选择4.Method栏聚类方法栏Iterateandclassify〔按K-means算法叠代分类〔系统默认。Classifyonly仅按初始类别中心点分类〔不叠代。Centers类中心数据的输入与输出〔可省略Readinitialfrom使用指定数据文件中的数据作为初始类中心〔文件格式参考Writefinalas文件格式选择Writefinalas把聚类结果中的各类中心数据保存到指定的文件。本例中选择系统默认项。2.单击Iterate按钮,打开Iterate对话框如图8所示:MaximumIterations限定K-Means算法的迭代次数,系统默认值10ConvergenceCriterion-指定限定收敛标准,系统默认值为0。Userunningmeans限定在每个观测量被分配到一类后即刻计算新的类中心,不选此项表示只有当全部样本的类分配完后再计算类中心,可以节省运算时间,所以一般情况下不选择此项。本例中选择默认项。图8Iterate对话框3.单出Save按钮,打开Save对话框见图9.ClusterMember在原数据文件中保存分类结果〔本例选择。Distancefromclustercenter在原数据文件中保存各观测量距所属类中心间的欧氏距离。图9Save对话框4.单击Options按钮,打开Options对话框见图10。Statistics栏Initialclustercenters输出初始类中心。ANOVAtable输出方差分析表Clusterinformationforeachcase每个观测量的分类信息<分类结果和该观测量距所属类中心的距离等图10Options对话框MissingValues栏Excludecaseslistwise将出现在Variables变量表中变量带有缺失值得观测量从分析中剔除〔系统默认Excludecasespairwise只有当一个观测量的全部聚类变量值均缺失时才将其从分析中剔除,否则根据所有其他非缺失变量值把它分配到最近的一类中去。全部选择完成后得到输出结果。InitialClusterCenters初始类中心Cluster1234x1人均粮食支出〔元/人21.3023.6825.5619.07x2人均副食支出〔元/人124.89173.30171.6573.18x3人均烟、酒、饮料支出〔元/人35.4317.4322.3018.01x4人均其他副食支出〔元/人73.9843.5940.5329.38x5人均衣着支出〔元/人93.0153.6657.1364.51x6人均日用杂品支出〔元/人20.5816.8612.608.91x7人均水电燃料支出〔元/人43.9765.0254.0338.14x8人均其他非商品支出〔元/人433.73385.94225.08155.45IterationHistorya迭代过程表IterationChangeinClusterCenters1234129.250.00038.95025.3212.000.0008.4152.4043.000.000.000.000a.Convergenceachievedduetonoorsmallchangeinclustercenters.Themaximumabsolutecoordinatechangeforanycenteris.000.Thecurrentiterationis3.Theminimumdistancebetweeninitialcentersis88.803.ClusterMembership〔聚类结果CaseNumber地区ClusterDistance1北京129.2502天津357.2953河北413.0144山西430.5285434.5116辽宁437.3507吉林420.5208421.3969上海129.12810江314.37111浙江130.02312安徽435.51913福建345.00514江西432.83415山东433.83916河南425.20617湖北413.68918湖南336.63719广东2.00020广西445.45321海南467.00422重庆319.28923四川424.56724贵州427.32625云南426.22826西藏361.06627陕西428.34828甘肃420.17529青海417.87430宁夏422.44831新疆418.804聚类结果中的第四列显示的是各样本与其所属类的中心之间的距离。上述结果可通过"save"按钮设置,保存至原始数据文件中。FinalClusterCenters类中心Cluster1234x1人均粮食支出〔元/人20.8023.6822.2919.72x2人均副食支出〔元/人145.27173.30131.3891.46x3人均烟、酒、饮料支出〔元/人39.8617.4331.6420.63x4人均其他副食支出〔元/人64.9543.5944.1933.93x5人均衣着支出〔元/人89.7053.6665.4859.43x6人均日用杂品支出〔元/人16.3216.8613.069.96x7人均水电燃料支出〔元/人49.4465.0242.4838.91x8人均其他非商品支出〔元/人417.01385.94234.53171.13ANOVA方差分析表ClusterErrorFSig.MeanSquaredfMeanSquaredfx1人均粮食支出〔元/人14.17035.710272.482.082x2人均副食支出〔元/人5809.6463474.0872712.254.000x3人均烟、酒、饮料支出

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论