数据挖掘试验教案4_第1页
数据挖掘试验教案4_第2页
数据挖掘试验教案4_第3页
数据挖掘试验教案4_第4页
数据挖掘试验教案4_第5页
免费预览已结束,剩余3页可下载查看

付费下载

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

1、实验六:用K均值(K-means)算法实现聚类分析一、实验目的1、通过本次试验了解K均值算法实现聚类分析的原理;2、锻炼学生对K均值算法实现聚类分析操作水平;3、通过模拟和讨论,确保学生深刻体会K均值在整个聚类分析的重要性。二、实验内容本实验的主要内容是通过对wake软件系统的实验,了解K均值算法实现聚类分析的原理以及具体的实验步骤。三、实验设备(一)实验设备1、计算机控制系统,包括计算机、wake软件等(二)软件环境1、服务器采用Java操作系统;2、操作软件:wake软件四、实验内容和步骤用“Explorer”打开刚才得到的“bank.arff”,并切换到“Cluster"。点“

2、ChoosS按钮选择“SimpleKMeans",这是WEKA中实现K均值的算法。点击旁边的文本框,修改“numClusters”为6,说明我们希望把这600条实例聚成6类,即K=6。下面的“seed参数是要设置一个随机种子,依此产生一个随机数,用来得到K均值算法中第一次给出的K个簇中心的位置。我们不妨暂时让它就为10。如下图所示:NuritjerorluerationsioKithiezclusterauonofaquarsd巳工亡口二号11"ED4-"41££53522332:Mi3sirgvaluesql口匕allyreplacFi二h加

3、尸刁口,mnd产CluaterceE.trQida;ClU5tPT#AtrirueFull1吗匕oL(03JE(7617门1471(iffi<117iage42.39337,12994水31L1m丸use助廉1947.661MEHFEMALErEMU£"EMm:FEEALEFEMALEHALCe且ginuINWTRjCTTYunreR_ciT¥R7RALINNER_CITYmwwrmrEftj:iTT7OWKincoM27524,031223377.760427772痛瓯*3>«24047.3S4S26354.ft3Ml.9的Zzarzied

4、YESHOYESYESl£E3YE3nceh.ldzea0a2100A上car况KONOnoNOYES悭yusrESYES5J0ZESNOcurreeil:actYISsfES¥ESYE£ZEEYESYZSlEjortacaeNCNONOKNO正5敢NCHQ即ITS皿ciusLeredinLances077(13*)1 7fi(131)2 77(13,)3 147(翡助4 106(181)结果解释:首先我们注意到结果中有这么一行:Withinclustersumofsquarederrors:1604.7416693522332这是评价聚类好坏的标准,数值越小说明

5、同一簇实例之间的距离越小。也许你得到的数值会不一样;实际上如果把"seed'参数改一下,得到的这个数值就可能会不一样。我们应该多尝试几个seed,并采纳这个数值最小的那个结果。接下来“Clustercentroids:"之后列出了各个簇中心的位置。对于数值型的属性,簇中心就是它的均值(Mean);分类型的就是它的众数(Mode),也就是说这个属性上取值为众数值的实例最多。对于数值型的属性,还给出了它在各个簇里的标准差(StdDevs)。最后的“ClusteredInstances是各个簇中实例的数目及百分比。为了观察可视化的聚类结果,我们在左下方“Resultlis

6、t”列出的结果上右击,点“Visualizeclusterassignments,如下图所示:弹出的窗口给出了各实例的散点图(操作说明详见第七章)。最上方的两个框是选择横坐标和纵坐标,第二行的“color”是散点图着色的依据,默认是根据不同的簇“Cluster”给实例标上不同的颜色,如下图所示:五、实验报告实验结束后,学生对模拟操作进行总结,编写出实验报告。实验报告包括如下内容:1、实验题目2、实验的目的和要求;3、实验仪器4、实验步骤5、实验结论K均值算法6、本次实验取得的主要收获和体会,结合所学的理论知识谈谈应用的好处以及还有哪些应用前景。实验七:基于密度的方法-DBSCAN方法实现聚类一

7、、实验目的1、通过本次试验了解基于密度的方法-DBSCAN方法实现聚类的基本原理;2、锻炼学生对基于密度的方法-DBSCAN方法实现聚类的操作水平;3、通过模拟和讨论,确保学生深刻体会基于密度的方法-DBSCAN方法在整个聚类过程中的重要性。二、实验内容本实验的主要内容是通过对wake软件系统的实验,了解基于密度的方法-DBSCAN方法实现聚类分析的原理以及具体的实验步骤。三、实验设备(一)实验设备1、计算机控制系统,包括计算机、wake软件等(二)软件环境1、服务器采用Java操作系统;2、操作软件:wake软件四、实验内容和步骤用“Explorer”打开“bank.arff”,并切换到“C

8、luster"。点“Choosg'按钮选择“DBSCAN",这是WEKA中实现DBSCAN的算法。点击旁边的文本框,修改参数epsilon和minpoints,epsilon表示epsilon领域的半径(搜索半径),minpoints表示epsilon领域最少包含点数。database_Iypeweka.clustsrargsforOFIICSAndDBSean.Databates.SequentialDa.taba.sedate_distaxLcelypeteka.clustrers.£crOPIICSAxidDEScazi.DattObjects.Ex

9、iclidiaxiDttaObjetle:pEilan。闾minPints6Open.Save.«OKCazic-el点击运行CLustezedDataCbjscts:5*?*Jcf国二七£珏丫七已日;vEpjilon:0.9;jninfointj:6Index:weka.clustrers.forOPTICSAndDBScan.r.DL9Eance-Efpe!weka.c1ugxerera.fcrOETICStndJNumberofgeneratedclasters:34EL4paedtime:S910(3曲1010(对116(2打126(2%)1312(31)1.410(3%)1524(71)168(2%)1711(31)1311(3%)19S(21)20e(2犯21s(2%)227(2号)23g(3*)24is(51)2s7(鸿)26(21)2711(3%)287(21)297(2%)306(力)3111(3%)3210(3%)336(2打Unclusteredinstances:229表示在此设定下,有229条数据被认为是噪声,其余的分成了33类注意:minpoints越小,epsilon越大,噪点越少,minpoints越小,类另U越多,epsilon越大,类别越少。思考:在数据项的属性中既有数值型,又有字

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论