基于系统聚类的k-means聚类分析在人体体型分类中的应用_第1页
基于系统聚类的k-means聚类分析在人体体型分类中的应用_第2页
基于系统聚类的k-means聚类分析在人体体型分类中的应用_第3页
基于系统聚类的k-means聚类分析在人体体型分类中的应用_第4页
基于系统聚类的k-means聚类分析在人体体型分类中的应用_第5页
全文预览已结束

付费下载

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

基于系统聚类的k-means聚类分析在人体体型分类中的应用

随着人们生活水平的提高,人们的体重发生了显著变化。由于年龄、个体、地区和种族的不同,以及服装个性化的需要,服装生产和加工对人体体型的分类有了越来越详细的要求。许多专家和科学家在分类方法、分类变量和分类数字方面进行了探讨。在文献中,中国北方的年轻女性的人体数据通过聚类分析将人体分为三种类型:薄、正常和胖,并使用距离法分析了体重的比例。在文献中,我们发现了四个具有代表人体的体表角度,即斜角、胸凸角、体侧角和脊柱凸角。采用k-mean聚类分析将人体分为四种类型。文献使用heat-torr脂肪体法对865名土家族儿童的体重进行了评价。结果表明,除了标准水平的胸腰椎差异外,还有人体特征点、生态单元、综合变量和特征指数。通过对1995年至2014年文献中的数据库电子资源进行调查,发现k-mean聚类分析是人类规模分析中最常见的分类方法。应用现状如下。(1)分类变量为人体特征部位数据或这些部位的派生变量;(2)分类数的确定主要有2种:一是根据经验或参照国内外服装号型标准中的分类数,二是根据多次聚类结果进行对比后选定最佳分类数目.同时,文献检索发现K-means聚类分析在人体体型分析的应用中存在以下问题:(1)K-means聚类只能对连续变量进行分类,大量使用该方法的文献几乎没有提及K-means聚类分析对数据的分布要求;(2)人体体型分类相关研究极少提到确定K-means聚类分析分类数的科学合理依据;(3)K-means聚类受到聚类中心和分类数的影响,达到聚类收敛所需的迭代次数各不相同,查阅到的文献中只有少数几篇提到,因此迭代次数的选择与聚类收敛的关系有待探索.针对以上总结,本文将从以下几个方面对K-means在人体体型分析中的应用进行探索:(1)K-means聚类只能应用于连续型变量,先对已有的变量进行分布检验,确定可行性;(2)寻找确定分类数的方法;(3)探索K-means聚类中迭代次数和迭代收敛的关系,确定使用SPSS做聚类分析时的最大迭代次数,确保聚类收敛.1k-mean聚集类分析数据的准备1.1人体差异检验样本容量是指样本中所包含的单位个数.样本容量过大,会造成人力、物力和财力的浪费;样本容量过小,会增大抽样误差,影响样本可靠程度,因此,样本容量的确定是抽样方案中的基础问题.服装号型标准GB/T1335—2008规定了成年人体各部位尺寸的标准差和最大容许误差,如表1所示.根据样本容量计算式其中,n为样本容量,t为置信度5%和自由度为∞下的概率度,为1.96,Δ为样本的容许误差,δ为总体标准差,代表离散程度.以成年人体各部位为考核对象的样本容量计算结果如表1所示.由表1可知,以腰围为基础的样本容量最大,故本实验中测量的人数不得少于173人.本文以219名18~25岁青年女性的人体数据作为检验样本,采用统计软件SPSS(StatisticalPackagefortheSocialSciences)作为数据分析工具,参考我国服装号型标准GB/T1335—2008,以胸腰差作为体型分类判别变量,对数据进行K-means聚类分析.1.2性检验—正态分布检验一般情况下人体的胸腰差符合正态分布.K-means聚类分析只能对连续型变量进行分类,在数理统计中许多统计量不论原分布是何种形式,只要样本容量n充分大,它都近似于正态分布,正态分布是连续型分布的一种.因此,聚类分析之前需要检验胸腰差变量是否符合正态分布.本文选用分布检验中的χ2检验法.首先给出假设:H0:ξue01bN(μ,σ2),将总体划分为k个不相交的区间,样本落在第i个区间的频数即观察频数为νi,当k足够大时统计量由表3数据求得χ2=11.476.α=0.05,k=8,r=2时查表得到渐进显著性为0.119,大于显著性水平0.05,接受原假设,则可以认为该群体青年女子的胸腰差服从N(15.66,2.94072)的正态分布,符合K-means聚类分析和系统聚类分析的前提要求.1.3按胸腰差分类根据国家服装号型标准对成年女子体型划分依据(如表4所示)可知,国家标准的体型划分趋于均匀,便于实际应用.检验样本按胸腰差分类的结果如表5所示.由表5可知,与国家服装号型标准相比,检验样本的胸围、腰围、臀围、腰围高、身高均值略小,但两者非常接近,说明该地区青年女子体型具有代表性.2确定最佳分类数的方法K-means聚类分析必须先给定分类数,分类数K决定最终的聚类结果,K的选定需要经过多次试验确定最佳值.现有的人体体型分类文献中分类数的选择多为根据经验或参照国内外相关标准确定,或对多次聚类结果进行对比后选定最佳值.选择合适的方法确定最佳分类数是非常重要的.通过查阅2001—2014年数据挖掘的相关文献,发现确定最佳分类数常用的方法:(1)根据数据点的分布情况,凭经验直观判断;(2)根据适当的阈值,即按照系统聚类步骤分类后,使用临界相似性尺度分割谱系图得到分类;(3)根据统计量如伪F统计量、伪T2统计量、混合F统计量等;(4)提出有效性指标如Silhouette指标和各种距离评价函数.上述方法各有优劣,其中,距离评价函数是基于同类之间的相似度最大而差异度最小,类与类之间的相似度最小而差异度最大的准则.距离评价函数与人体体型分类要求吻合,因此,将其引入人体体型分类中具有可行性.距离评价函数需要确定分类数范围[Kmin,Kmax],通过编程语言计算得到相关参数,最终判断最优分类数.为了简化计算,降低计算难度,本文在距离评价函数F(S,K)的基础上提出了一种新的确定分类数的方法,即基于系统聚类分析的距离评价函数优化法.该方法采用系统聚类分析的树状图判断可能较优的分类数,再通过距离评价函数优化法确定分类数.2.1不同树状的分类结果图1所示系统聚类分析树状图显示聚类过程和不同类时个案所属的分类结果,观察树状图发现,以胸腰差为分类依据,样本可以划分为2,3,4,5,6,7类,仅仅需要验证6种分类数时的分类结果,工作量大大减少.2.2距离评价函数样本数据集合为S={x1,x2,...,xn},K为分类数,令I={S,K}为聚类空间.(1)类间距离Dout为所有聚类中心(类内样本均值)到全域中心(全体样本均值)的距离之和,计算式如式(2)所示.其中:珚x为全体样本均值,xi为类Ci中的所有样本均值.(2)类内距离Din为每个类内对象到该类中心距离的总和,计算式如式(3)所示.其中:p为任一类内的空间对象.(3)由文献可知,当Dout+Din最小时,K值接近最优,定义距离评价函数为运用距离评价函数检验聚类的有效性时,确定了距离代价最小的原则,即距离评价函数达到最小值时,空间聚类结果最优,K=min{F(S,K)},由系统聚类分析树状图确定K=2,3,4,5,6,7,不同的K值对应的评价参数如表6所示.由表6可知,分类数为7时距离评价函数达到最小值,可判断7为最优分类数;分类数为4的距离评价函数值小于分类数为3和5的情况,说明分类数为4要优于3和5,所以当分类数限定为3~5时,应优先将其分为4类.基于系统聚类的距离函数评价法减少了运算量和运算的复杂程度,提高了效率,并且通过219名青年女性的人体数据验证了该方法的可行性和有效性.需要注意的是,此处的分类数仅代表本次219个样本的计算结果,受样本量和分布区域的影响,不同样本的最佳分类数需要根据实际情况确定.3k-mens聚类分析的迭代收敛K-means聚类分析通过计算每个观测量到各个聚类中心的欧氏距离,按就近原则将观测量归入一类,再计算归类后各类的中心位置,并将该中心位置作为新的聚类中心.如此反复,直到迭代停止.只有迭代收敛才能确定样本最终属于哪一类,因此,迭代必须收敛是K-means聚类分析中十分重要却容易被忽视的问题.已知K-means聚类分析的迭代收敛条件为maxΔ{zN}<minz{i-zj}×θ,其中,maxΔz{N}为迭代到第N次时,聚类中心的最大改变量;为初始中心间的最小距离;θ为聚类比例系数.SPSS17.0系统默认的K-means聚类分析的最大迭代次数为10次,因不能确定10次是否满足聚类分析的迭代收敛,这里通过对两组不同的数据进行聚类分析,探索K-means聚类分析收敛的迭代次数,分类数为4.选取总体样本219名青年女性人体数据为数据1,已经证明符合正态分布;从219个样本量中随机抽取100名青年女性人体数据为数据2,数理统计中重复抽样的每一个样本都具有总体特征,即与总体有相同分布.数据1和数据2用于K-means聚类收敛迭代次数的探索.3.1k-me现行聚类分析数据1的不同体型聚类中心随迭代次数增加的变化趋势如表7所示.由表7可知,经过K-means聚类分析之后,第1类体型的最终聚类中心位于Y体型中,第2类体型的最终聚类中心位于A体型中,第3类体型的最终聚类中心位于B体型,第4类体型的最终聚类中心位于C体型中.由此可见,K-means聚类分析与国标体型划分是相当接近的.表7显示,初始中心间的最小距离为3.7cm(14.3-10.6=3.7),取聚类比例系数θ=0.02,初始聚类中心之间最小距离的θ倍为0.074cm(0.02×3.7=0.074).数据1的K-means聚类分析的迭代历史记录如表8所示.由表8可知,迭代次数为7,聚类中心之间的最大改变量为0,小于0.074,聚类中心之间的最大改变量小于初始聚类中心之间最小距离的θ倍时,聚类分析收敛,从而停止迭代,由此可知,本文对数据1的K-means聚类分析的最小迭代次数为7次.3.2k-me党组织聚类分析数据2的不同体型聚类中心随迭代次数增加的变化趋势如表9所示.由表9可知,4种体型的最终聚类中心分别位于Y,A,B,C4类体型中.表9显示数据2初始中心间的最小距离为2.3cm(10.6-8.3=2.3),取聚类比例系数θ=0.02,初始聚类中心之间最小距离的θ倍为0.046cm(0.02×2.3=0.046).数据2的K-means聚类分析的迭代历史记录如表10所示.由表10可知,迭代次数为17时,聚类中心的最大改变量小于初始聚类中心之间最小距离的θ倍,迭代收敛.由此可知,本文对数据2的K-means聚类分析的最小迭代次数为17次,所以迭代次数不能小于17.由以上两组数据的K-means聚类分析可以看出,因数据的离散程度和范围不同,不同数据聚类分析所需要迭代的次数也有所不同.SPSS软件默认的迭代次数比较小,所以K-means聚类分析时要注意迭代次数的选定,确定迭代是否已经收敛,如不收敛,则需要设定更大的迭代次数直到聚类收敛.4k-me现行聚类分析方法k-me-pb本文以现行的国家服装号型标准规定的体型分类依据———胸腰差为分类变量,对K-Means聚类分析在人体体型分类中的应用进行了研究,分析了样本量的确定,应用统计学的χ2检验法验证了本次样本的人体胸腰差数据符合正态分布,确定该样本符合K-means聚类分析的前提要求.然后,采用基于系统聚类的距离评价函数法,确定本次样本的最优分类数为7,当分类数的范围限定为3~5类时,则最优分类数

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论