课件-聚类分析_第1页
课件-聚类分析_第2页
课件-聚类分析_第3页
课件-聚类分析_第4页
课件-聚类分析_第5页
已阅读5页,还剩129页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

聚类分析(Cluster

ysis)问题的引出经济、社会、人口研究中,存在着大量分类研究、构造分类模式的问题经济研究中,根据经济发展水平把各个国家分成发达国家、中等发达国家、发展中国家;为了研究不同地区城镇居民生活中的收入及消费状况,往往需要划分为不同的类型去研究市场

中按照消费者的特征对消费者分类,按照产品特征对产品分类,从而进行市场分层、建立目标市场为多种动物群体——昆虫、哺乳动物和爬行动物的区分建立生物分类学……分类需要解决的问题样品特征如何描述?需要选取能够描述不同样品特征的变量,依据这些不同变量将样本划为不同的类别分类的依据是什么依据描述样品之间相同性质的“相似性”指标前言聚类分析是用多元统计理论进行分类的法聚类的原则是“组(类)内同质,组(类)间差异”本讲所介绍的是系统聚类法、动态聚类(K-均值聚类)和有序样品聚类法聚类分析的概念聚类分析是通过被分类的对象的各种指标进行分类的,而指标按其测量的尺度可以有以下三种:间隔尺度:指标用连续的实值变量表示,如长度、重量、时间;有序尺度:用该指标度量时无数量表示,只表示次序,如产品质量的等级;名义尺度:该指标只代表某些分类或属性,不代表大小和次序,如

。数据表指标样品1

2

p12...n……x1px2px11

x12x21

x22…xn1

xn2…xnp聚类分析的分类在实际问题中,收集n个样品,对每一个样品测量p个指标:Q型聚类根据p个指标值对n个样品进行分类如,根据多项经济指标(指标)对不同的地区(样品)进行分类R型聚类根据n个样品对p个指标进行分类根据不同地区的样本数据对多个经济指标进行分类两者没有本质区别,实践中人们更感

的通常是Q型聚类本讲主要内容系统聚类K-均值聚类有序样品聚类系统聚类法系统聚类基本思路和步骤样品间距离类间距离系统聚类的应用系统聚类的思想产品质量分类从21个工厂各抽一件同类产品,每件产品测量两个质量指标,记为x1与x2,现要求将各厂的产品按质量情况进行分类将每个工厂产品的两个指标看成平面上的一个点,并在坐标平面上将21个点画出来。基本思想:逐步将距离近的类合并在一起2-6-6X1根据产品质量分类2-6-6X1dij

12-6-6X1dij

22-6-6X1dij

2系统聚类法的基本思路基本思想:逐步将距离近的类合并在一起。先将所有n个样品看成不同的n类,然后将性质最接近(距离最近)的两类合并为一类;再从这n-1类中找到最接近的两类加以合并,依次类推,直到所有的样品被合为一类。系统聚类法的具体步骤先将n个样品各自看成一类,即有n个类,(此时的类间距离为样品间距离),选择距离最小的合并成一个新类;定义新类与新类之间的距离,然后再将距离最小的合并;每合并一次,至少减少一类;直到所有的样品都并成一类为止。距离的度量样品间距离类间距离:此距离由样品间距离推导得出。样品间距离以dij表示第i个样品与第j个样品之间的距离,作为p中两点距离,要满足:dij≥0,对一切i,jdij=0,当第i个样品与第j个样品p个指标都相同dij=

dji

,对一切i,jdij≤dik+dkj,对一切i,j,k样品间距离最常用的形式绝对值距离欧氏距离闵氏距离切

距离马氏距离绝对值距离(Block

distance)pk

1

x

jkdij

(1)

xik欧氏距离(Euclidean

distance))2pijikjkk

1

xd

(2)

(

xxik表示第

个i

样品的第

个k指标值闵氏距离(Minkowski

distance)p

x

jk

k

1dij

(q)

xik切距离(Chebychev

distance)ijikjkd

()

max

x1k

p

x马氏距离(Mahalanobis

distance)ijd

2

(M

)

(

X

X

)

'

S

1

(

X

X

)ij

i

j类间距离→系统聚类法最短距离法(Nearest

Neighbor)最长距离法(

Furthest

Neighbor

)中间距离法(Median

Clustering)重心法(Centroid

Clustering)类平均法组间联结法(Between-groups

linkage)组内联结法(Within-groups

linkage)离差平方和法(Ward's

Method)应用广泛的是类平均法和离差平方和法一、最短距离法在最短距离法中两类间的距离定义为:Dpq

iGp

,

jGq最短距离示意图GqGpA**CB*

*DDpq样品间分类-最短距离法设抽取六个样品,每个样品只测一个指标,它们分别是1,2,5,7,9,10。试用最短距离法对它们进行分类。聚类步骤-1:规定样品间的距离,计算距离矩阵D0

,其中Gpq={dpq}(1)样品间距离采用绝对值距离,建立D0G1

G2

G3

G4

G5G2G3G4G5G68

5

3

1聚类步骤-2:选择D0

中最小元素,设为Dpq,将Gp与Gq合并成一个新类,记为Gr,则Gr={

Gp

,Gq

}(2)

D0中最小元素为1G1

G2

G3

G4

G5G2G3G4G5G68

5

3

1由D0中最小元素为1:G1

与G2合并成一个新类,记为G7,G5

与G6合并成一个新类,记为G8D1G7G3G4G33G452G8742聚类步骤-3:Drk

dijiGr

,

jGk计算新类与其它类之间的距离(最短距离):

minij

ijd

iGp

,

jGkminiGq

,

jGk

min

min

d

,qkpk

min

D

,

D

得到D1(3)得到D1D0

G1

G2

G3

G4

G5D

G7

G3

G4G2G3G4G5G6GGG88

75

43

21聚类步骤-4:由D1中最小元素为2:G3,G4与G8合并成一个新类,记为G9,计算新类与其它类之间的距离,得到D2(4)得到D2G79G

3D1D

G73G

G4G4G3

2

35

2G8

7

4

2聚类步骤-5:G7与G9合并成一个新类,记为G10聚类图G7G8G9G10最短距离法的缺陷

聚合的趋势:因为类与类之间的距离为所有距离中的最短者,两类合并以后,它与其他类间的距离缩小了,这样容易形成一个较大的类,大部分样品被分在一个类中。聚类效果不好,实际中不提倡使用。二、最长距离法在最长距离法中两类间的距离定义为:Dpq

iG

p

,

jGq最长距离示意图DpqGqGpA*B**D*C样品间分类-最长距离法设抽取5个样品,每个样品只测一个指标,它们分别是1,2,3.5,7,9。试用最长距离法对它们进行分类。聚类步骤:规定样品间的距离(此处用绝对值距离),计算距离矩阵D0

,其中Gpq={dpq}D(0)G1

={x1} G2

={x2}G3

={x3}G4

={x4}G5

={x5}G1G2G3G4G5012.56801.55703.55.5020D(1)G6

={x1,

x2}

G3G4

G5G6G3G4G502.56803.55.5020D(2)G6

={x1,

x2}G7

={x4,

x5}G3G6G7G3082

.505.50D(3)G7={x4,x5}G8={x1,x2

,x3}G70G88001234567812.582G7G8G6x1x2x3

x4x5最长距离法的缺陷

克服了最短距离法

聚合的趋势,两类合并后与其它类的距离是两个类中的距离最大者,加大了合并后的类与其他类之间的距离。三、中间距离法在中间距离法中两类间的距离定义为:2

2

4rkpk

qkpqD2

1

D2

1

D2

1

D2注:在某一步时,将Gp和Gq合并为Gr中间距离示意图DqkDpkDrkDpqGrGpGqGkβ=-1/4时,Drk为三角形的中线p

qMD

pq

d

M四、重心法设Gp和Gq的重心(该类样品的均值)分别为Mp和Mq,则定义两类间距离为:一个类的重心常用该类样品的均值来代表设某一步将类Gp与类Gq合并为类Gr

,且各有np、nq、nr(=np+nq)个样品,重心分别用

x

p、xq、xr

表示。则r

p

p

q

qrnx

1

(n

x

n

x

)重心法距离递推公式krkp

kqpqr

rr

rD2nnn

n

np

D2

nq

D2

np

nq

D2某一类Gk的重心为

xk

,则它与新类Gr的距离可表示为:D

2

(

x

x

)(

xkr

k

r

k

xr

)重心法的特点归类步骤与前面三种方法基本一样,所不同的是每合并一次类,就要重新计算新类的重心及各类与新类的距离较少受到特殊点的影响,有较好的代表性未充分利用各样品的信息聚类过程中,不能保证合并的类之间的距离呈单调增加的趋势,也即本次合并的两类之间的距离可能小于上一次合并的两类之间的距离,这一点限制了它的应用。krkp

kqrrD2nn

np

D2

nq

D2pqijp

qD2

d

2n

niGp

jGq

1

五、类平均法两类元素两两之间的平均平方距离来定义两类间的距离平方:类平均法中两类间的距离的递推公式为:六、离差平方和法离差平方和法的统计思想如果类分得合理,则同类样品间的离差平方和应当较小,而类间离差平方和应当较大n

ji

1

x

j

)

'(

xij

x

j

)S

j

(

xijg全部样品类内离差平方和为S

S

jj

1假定有n个样品,共分g类:Gj中nj个样品的离差平方和为Ward提出了一个找局部最优解的方法其过程与系统聚类法类似聚类步骤:先将n个样品各自看成一类,此时S1

=

S2

=

=

Sn=

0

,

S=0

,然后逐步合并,每合并一次离差平方和就要增加,并类的原则是选择使S增加量最小的两类合并离差平方和法中两类间的距离的递推公式为:krkp

kqpqrkrkrknkD2D2

np

nk

D2

nq

nk

D2n

nn

nn

n样品间分类-离差平方和法设抽取5个样品,每个样品只测一个指标,它们分别是1,2,3.5,7,9。试用离差平方和法对它们进行分类。D2(0)G1

G2

G3

G4

G5G1

={x1}

0G2

={x2}

0.5

0G3

={x3}

3.125

1.125G4

={x4}G5

={x5}01812.56.12503224.515.12520D2(1)G6G3G4G5G6={x1,x2}0G3

={x3}2.6670G4

={x4}20.1676.1250G5

={x5}37.515.12520D2(2)G6G3G7G6

={x1,x2}

0G3

={x3}

2.667

0G7

={x4,x5}

42.25

13.50D2(3)G7

G8G7

={x4,

x5}0G8

={x1,

x2

,

x3}40.83

00

0.5

12

2.6

340.83x1x2

x3

x4x5

0.5G6G82G740.832.667Lance

&

Williams系统聚类中六种方法的递推公式的

表达krkqD

2

D

2

D

2

D

2

D

2

D

2p

kp

q

kq

pq

kp六种方法参数值p

q1212120

120

12

14

0

p

q

00

00nk

n

rnk

npnk

n

r121212n

p

n

r

n

q

n

rn

p

n

r

n

q

n

rnk

nqn

kn

k

n

r最短距离最长距离中间距离重心法类平均法离差平方和系统聚类法的实际应用在实际问题中,收集n个样品,对每一个样品测量p个指标:可以根据p个指标值对n个样品进行分类也可以根据n个样品对p个指标进行分类数据表指标样品1

2

p12...n……x1px2px11

x12x21

x22…xn1

xn2…xnp样品分类衡量两个样品之间的接近程度的方法:将每个样品看成p

中的一个点,在p维空间中定义两点的距离,距离近的点归为一类。指标分类衡量两个指标之间的接近程度的方法:可定义指标间的相似系数;相似系数越接近1或-1的两个指标就越相似,可以归为一类。相似系数以cij表示第i个指标与第j个指标之间的相似系数,要满足:|cij|≤1

,对一切i,jcij=+1,当且仅当

xi=αxjcij=

cji,对一切i,j指标的相似系数与指标间的距离的关系d

2

1

c2ij

ij最常用的相似系数22nijn

nxxc

(1)

k

1

xki

xkj

ki

kjk

1

k

1n

nikink

12(x

x

)2kj

jk

1(x

x

)

xi

)

(xkj

x

j

)(xkicij(2)

k

1

夹角余弦相关系数夹角余弦与相关系数示意图0xixj(

xi,

x

j

)[例]根据我国31个省市2006年的6项主要经济指标数据,采用系统聚类法进行分类,并对结果进行分析系统聚类的应用(实例分析)31个地区的6项经济指标用SPSS进行系统聚类第1步 选择[

yze]下拉菜单,并选择[Classify-HierarchicalCluster],进入主

框第2步

将用于聚类的所有变量选入[Variable(s)];把区分样本的

(本例为“地区”)选入[Label

Cases

by];若对样本进行聚类,在[Cluster]下选择[Cases](本例选择对样本聚类),若对变量进行聚类,在[Cluster]下选择[Variables]第3步

点入[Statistics]选中[Agglomeration

schedule],点击[Continue]回到主

框第4步 点入[Plots]选中[Dendrogram],点击[Continue]回到主框用SPSS进行系统聚类第5步 点入[Method],在[ClusterMethod]中选择类间距离的定义方法(本例选择Ward’smethod);在[Measure]下选择点间距离的定义方法(本例使用Squared

Euclideandistance);在[TransformValues]的[Standardize]框中选择否对原始数据进行标准化处理(本例选择了[Zscores])。点击[Continue]回到主

框第6步 点入[Save],在[ClusterMembership]下选择在原始数据中保留分类结果,其中[Singlesolution]表示指定要分成类时各样本所属的类,[Rangeofsolution]表示指定要分成最少类、最多类时各样本所属的类(SPSS会将分类的结果以变量形式保存到原数据窗口中),点击[Continue]

→[OK]用SPSS进行层次聚类SPSS的输出结果(实例分析)层次聚类过程的步骤号SPSS的输出结果(实例分析)系统聚类过程的步骤号第1列是聚类的步骤号。第2列和第3列给出了每一步被合并的对象(这里是地区)首先把31个地区各自作为一类(共有31类)。第1步是把距离最近的两个地区21(海南)和地区30(

)合并成一类。在后面的步骤中,对于包含多个样本的新类别,实际上是用类中的一个样本来代表该类别,比如,第2步被合并的是21和地区29(青海),这里的“21”实际上是指在第1步中被合并的类别,只是用“21”表示21(海南)所在的类别SPSS的输出结果(实例分析)系统聚类过程的步骤号第4列给出每一步被合并的两个类之间的聚类系数(即距离)。距离按从小到大排列,越早合并的类距离越近。0.013是地区21(海南)和地区30(

)之间的距离,而0.040是先被合并的第一小类与地区29(青海)之间的距离第5列和第6列表示本步聚类中参与聚类的是原始的样本还是已经合并的小类,0表示本步聚类的是原始的样本,第一次出现在聚类过程中,其他数字则表示第几步聚类生成的小类参与了本步聚类。第7列给出了在每一步中合并形成的新类别下一次将在第几步中与其他类别合并。例如,在第2步中,参与聚类的是第1步形成的小类(21号样本所在的

类)和地区29(青海),第5列的“1”表示21号类是在第1步中形成的小

类,而“0”表示地区29(青海)是第一次出现在本步聚类中的原始样本,第7列中的“10”表示这一类将在第10步中与其他类别合并,其余类推Cluster

Membership系统聚类的树状图分成两类分成四类最大距离作为相对距离25,其余的距离都换算成与之相比的相对距离大小系统聚类的应用(分类汇总)类别地区地区个数第一类3第二类,

,河北,辽宁, ,福建,

,湖南,8第三类山西,内

,吉林,黑龙江,江西,广西,海南,重庆, ,云南,

,,16第四类陕西, ,青海,江苏,浙 东,4框【Compare

Means】【One-Way

ANVOA】主第二步

将用于描述的所有变量选入【Dependentlist】,把地区所属的类别号变量选入【Factor】第三步

点击【Options】并选择所需要的统计量,选中【Descriptive】主

【OK】

使用SPSS中的Means过程(计算分类统计量注)意使用Means过程时可直接在聚类分析的数据中进行,数据表中应包括SPSS

以变量名CLU5_1

、CLU4_1

CLU3_1、CLU2_1等保存的结果,然后按下列步骤操作第一步选择【yze】下拉菜单,并选择使用SPSS的Means过程系统聚类的应用(类别检验)各类别所属地区的描述统计量系统聚类的应用(类别检验)不同类别6项经济指标的方差分析表方差分析K-均值聚类K-均值聚类的基本过程K-均值聚类的应用系统聚类与K-均值聚类的比较系统聚类特点事先不需要确定要分多少类聚类过程一层层进行,最后得出所有可能的类别结果,研究者根据具体情况确定最后需要的类别。该方法可以绘制出树状聚类图,方便使用者直观选择类别缺点计算量较大,对大批量数据的聚类效率不高当每个观测值被归属在某一类中,纵使后来发现不恰当,也不会被重新归属K-均值聚类在每次聚类过程中,皆可重新考虑每个观测值最适当的类,且可以重新移动,不会像层次聚类那样将某些观测值固定在不适当的分类中。计算量小,效率高:不受样品数增加的影响,适合于大样本的聚类也称快速聚类(quick

cluster)将样品(而不是变量)

k

个类的集合K-均值聚类(过程图示)第1步:确定要分的类别数目K需要研究者自己确定在实际应用中,往往需要研究者根据实际问题反复尝试,得到不同的分类并进行比较,得出最后要分的类别数量第2步:确定K个类别的初始聚类中心要求在用于聚类的全部样本中,选择K个样本作为K个类别的初始聚类中心与确定类别数目一样,原始聚类中心的确定也需要研究者根据实际问题和经验来综合考虑使用SPSS进行聚类时,也可以由系统自动指定初始聚类中心K-均值聚类(步骤)第3步:根据确定的K个初始聚类中心,依次计算每个样本到K个聚类中心的欧氏距离,并根据距离最近的原则将所有的样本分到事先确定的K个类别中。第4步:根据所分成的K个类别,计算出各类别中每个变量的均值,并以均值点作为新的K个类别中心。根据新的中心位置,重新计算每个样本到新中心的距离,并重新进行分类。K-均值聚类(步骤)K-均值聚类(步骤)第5步:重复第4步,直到满足终止聚类条件为止迭代次数达到研究者事先指定的最大迭代次数(SPSS隐含的迭代次数是10次)新确定的聚类中心点与上一次迭代形成的中心点的最大偏移量小于指定的量(SPSS隐含的是0.02)K-均值聚类法是根据事先确定的K个类别反复迭代直到把每个样本分到指定的类别中。类别数目的确定具有一定的性,究竟分多少类合适,需要研究者对研究问题的了解程度、相关知识和经验。聚类数k

的确定准则各类所包含的元素不要过分地多分类的数目应符合使用的目的先用系统聚类初步确定分类数采用几种不同的系统聚类方法处理,则在各自的聚类图上发现相同的聚类数或借助树状图确定合理的k系统聚类中每次合并的类与类之间的距离可以作为确定类数的一个辅助工具。聚类过程中,聚合系数呈增加趋势,聚合系数小,表示合并的两类的相似程度大,两个差异很大的类合并在一起,会使聚合系数增大;或者根据聚合系数随聚类数变化的曲线图确定合适的k。2425262728293031041311聚合系数随聚类数变化的曲线图01

3类数

[例]根据我国31个省市 2006年的6项主要经济指标数据,采用K-均值聚类法进行分类,并对结果进行分析K-均值聚类的应用(实例分析)31个地区的6项经济指标

数据检查若原始变量取值差异较大,应先将原始数据进行标准化,避免变量值差异过大对分类结果的影响可以先观察6项经济指标的有关描述统计量K-均值聚类的应用(实例分析)K-均值聚类的应用(实例分析)

数据标准化(SPSS)【

yze】【Descriptive

Statistics】【Descriptives】主

框将需要标准化的变量选入【Variable(s)】【Save

standardized

values

as

variables】【OK】31个地区的6项经济指标的标准化SPSS中K-Means

聚类主要选项含义Iterate:Iterate

andclassify不断迭代与更新聚类中心位置(当聚类中心未知时)Save:cluster

membership可输出聚类后每一事件所属类别

Distance

from

cluster

center

可输出各样品与其聚类中心的欧氏距离Options:ANOVA可显示每个聚类变量的单变量的F

检验的方差分析表K-均值聚类的应用(实例分析)分成4类的初始聚类中心

该表列出每一类别的初始聚类中心,本例的这些中心是由SPSS自动生成

的,它实际上就是数据集中的某一条记录。聚类中心的选择原则是中心点

距离其他点尽可能远。例如,第一类的聚类中心中的人均GDP标准化后的

值是3.17960,这实际上就是

的人均GDP标准化后的值。第二类聚类中心中的人均GDP标准化后的值是1.83293,则是

的标准化人均GDP,等等K-均值聚类的应用(实例分析)

从表中可以看出每次迭代过程中类别中心的变化,随着迭代次数的增加,类别中心点的变化越来越小。本例只4次就已经收敛了分成4类的初始聚类中心K-均值聚类的应用(实例分析)

表中的数据表示各个类别在各变量上的平均值。如,第一类的2.88521表示被分到第一类的地区(

和 )标准化后的人均GDP平均值分成4类的初始聚类中心K-均值聚类的应用(实例分析)分类后各个变量在类别之间的方差分析表

利用方差分析表可以判断所分的类别是否合理。从表中可以看出,分类后各变量在不同类别之间的差异都是显著的(P值均接近0)K-均值聚类的应用(实例分析)分成4类时每一类的地区数量

由该表可以看出,第一类包括2个地区,第二类包括11个地区,第三类包括4个地区,第四类包括14个地区K-均值聚类的应用(实例分析)分成4类时每个地区所属的类别K-均值聚类的应用(分类汇总)类别地区地区个数第一类,2第二类11,内,吉林,海南,重庆,贵州,,,青海,,第三类江苏,浙 东,4第四类14河北,山西,辽宁,黑龙江,,福建,江西,,,湖南,广西,,云南,陕西无论哪种方法,最终要分成多少类别,并不是完全由方法本身来决定,研究者应结合具体问题而定聚类分析是一种探索性的数据分析方法。相同的数据采用不同的分类方法,也会的得到不同的分类结果。分类的结果没有对错之分,只是分类标准不同而已使用聚类方法时,首先要明确分类的目的,再考虑选择哪些变量(或数据)参与分类,最后才需要考虑方法的选择。至于分类结果是否合理,该如何解释,

取决于研究者对所研究问题的了解程度、相关的背景知识和经验聚类分析的注意事项参与分类的各变量的取值不应有数量级上的过大差异,否则会对分类结果产生较大影响。这时需要对变量进行标准化处理(SPSS提供的层次聚类法中在聚类时可以选择对变量做标准化处理,而K-均值聚类法则需要单独做标准化处理,然后再进行聚类)各变量间不应有较强的相关关系。若两个强相关的变量同时参与聚类分析,在测度距离时,就加大了它们的贡献,而其他变量则相对被削弱有序样品聚类法有序样品聚类法—最优分割法按一定的要求排成序的样品,称为有序样品;如,从

到2009年,我国的国内生产总值可以划分为几个阶段。阶段的划分必须以年份为依据,即按照时间顺序将国内生产总值接近的年份划分到一个段内如,研究儿童生长发育规律,可以根据一些反映生长发育特征的指标,将儿童生长发育分为几个不同阶段在分类时,要求样品的次序不能打乱,因而这种分类也称为分割法。最优分割的涵义有

种可能最优分割:使各段内样品间的差异最小,各段间样品的差异最大的一种“棍子”的插法将n个有序样品分成k类,共有n-1个间隔,相当于在n-1个间隔上插上k

-1根“棍子”,故

n

1

k

1

Fisher算法介绍基本思想:开始时,将所有的样品分为一类,然后分为两类、三类等,直到分成n类。每次分类要求分类所产生的离差平方和增加量达到最小。几个概念均值类Gij是由{xi,xi+1,…,xj},i<j,组成,则该类均值定义为:jlijxx

j

i

1

l

i1直径类Gij的直径定义为:jD(i,

j)

(xl

xij

)

'(xl

xij

)l

i它实际上是j-i+1个样品的离差平方和。n

个样品分成k

类的分法21

1i

1

i

1iP(n,

k

)

:

x

,

x

,...,

x

,,3221

,...,

xi

1

xi

,

xi

xi

,

xi

,...,

xi

1

,k

k

1

k

1n个样品分成

k类的分法(简写)P(n,

k

)

:

i1

,

i1

1,...,

i2

1

,

1

,

i2

,

i2

1,...,

i3

ik

,

ik

1,...,

ik

1

1

,其中分点为1

i1<i2<...<ik

<ik

1

1

n目标函数kn个样品分成k类的目标函数:e

P(n,

k

)

D(ij

,

i

j

1

1)j

1最优分割的思想:当n与k固定时,目标函数越小表示各类的离差平方和越小,这时分类是合理的。2

j

n最小目标函数递推公式e

P(n,

2)

min

D(1,

j

1)

D(

j,

n)

k

jne

P(n,

k

)

min

e

P(

j

1,

k

1)

D(

j,

n)

要将n

个样品分成k

类的最优分割,应建立在将j

1

个样品分成

k

1类的最优分割基础上j

k,

k

1, ,

n求最优分割的步骤1、计算各种分类的直径D(i,j);2、计算最小目标函数e〔P(i,k)〕,将计算所得目标函数列成矩阵;3、根据最优目标函数矩阵逐步将n个样品分成k类。儿童体重问题1234567891011增重9.31.81.91.71.51.31.42.01.92.32.1ageweight求最优分割的步骤求直径矩阵D(i,j)(1)直径矩阵D(i,j)可以利用EXCEL的函数:DEVSQ(偏差平方和)直径矩阵D(i,j)=D(j,i)ji12345678910228.1337.0.005442.2.020.020545.9.088.080.020649.1.232.200.080.020751.1.280.232.088.020.005851.5.417.393.308.290.287.180951.9.469.454.393.388.370.207.0051052.0.802.800.774.773.708.420.087.0801152.2.909.909.895.889.793.452.088.080.020计算最小目标函数e〔P(i,k)〕2

j

i将i个样品,(i=3,4,…,n),分成k类(k=2)的最优分割的目标函数e

P(i,

2)

min

D(1,

j

1)

D(

j,

i)

3个样品分两类的最小目标函数e

P(3

min

D(1,

j

1)

2

j

3

min

D(1,1)

2

j3

min

0

0.005,28.1

0

0.005

(2)4个样品分两类的最小目标函数e

P(4,2)

min

D(1,

j

1)

D(

j,4)

2

j

4

min

D(1,1)

D(2,4),

D(1,2)

D(3,4),2

j

4D(1,3)

D(4,4)

min

0

0.02,28.1

0.02,37.0

0

0.02

(2)e

P(5,2)

min

D(1,

j

1)

D(

j,5)

2

j

55个样品分两类的最小目标函数

min

D(1,1)

D(2,5),

D(1,2)

D(3,5),2

j

5D(1,3)

D(4,5),

D(1,4)

D(5,5)

min

0

0.088,28.1

0.08,37.0

0.02,42.2

0

0.088

(2)计算最小目标函数e〔P(i,k)〕3

j

i将i个样品,(i=4,5,…,n),分成k类(k=3)的最优分割的目标函数e

P(i,

3)

min

e

P(

j

1,

2)

D(

j,

i)

4个样品分三类的最小目标函数e

P(4

min

e

P(

j

1,2)3

j

4

D(3,4

min

e

P(2,2)

min

0

0.0

0.005

(4)5个样品分三类的最小目标函数e

P(5,3)

min3

j

5

min

e

P(2,2)

D(3,5),

e

P(3,2)

D(4,5)e

P(4,2)

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论