版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
第9章
K均值聚类1学习目标了解K-Means聚类的基本原理掌握利用Scikit-learn库进行K均值聚类基本方法122目录页39.1基本原理9.2应用实例K均值聚类9.1基本原理聚类是指以“同类样本相似度高而异类样本相似度低”为基本准则将样本自动分成若干个类别的过程,属于无监督学习(即无类别标记)。如图9-1所示,相似度较高或在特征空间距离较近的样本通常聚集成簇,因而,通过判别样本之间的相似度可将其分成指定数量的类别。类内样本相似性越大、类间样本相似性越低,则聚类效果越好。4图9-1聚类示例
9.1.1基本概念
5
9.1.1基本概念K均值聚类的基本步骤如下:步骤1:随机选择K个样本作为初始聚类中心。步骤2:计算每个样本到K个聚类中心的距离,选择距离其最近的聚类中心所属类别作为当前样本的类别直至所有样本点分类完毕。步骤3:根据K个类别中的样本计算相应均值并作为新的聚类中心。步骤4:重复步骤3~4直至每类的聚类中心或样本不再变化。6
9.1.1基本概念以“将5个样本分为两类”为例进一步描述K均值聚类的过程。①随机选择2个样本作为聚类中心。如图(a)所示。②将距离聚类中心最近的样本分至相应的类别。如图(b)所示。③计算每类样本的均值以作为新的聚类中心并更新每类的样本。如图(c)所示。④重复步骤3时发现无样本,因而聚类结束。如图(d)所示。7
(a)选取聚类中心(b)划分类别(c)计算均值(d)重复计算均值直至无样本更新9.1.2评价标准(1)类内样本聚合度样本到距离其最近的聚类中心之间的距离之和,其值越小,表明类内样本越聚集,因而分类效果越好。在Scikit-learn库中,此指标可通过K均值聚类对象的inertia_属性获取。89.1.2评价标准
99.1.2评价标准
109.1.3扩展类型(1)DBSCAN聚类DBSCAN(Density-BasedSpatialClusteringofApplicationswithNoise)是一种基于密度的聚类算法。其思想是将簇定义为密度相连的点的最大集合,能够将具有足够高密度的区域划分为簇,并可在噪声的空间数据库中发现任意形状的聚类。119.1.3扩展类型DBSCAN算法描述:输入:数据集,邻域半径Eps,邻域中数据对象数目阈值MinPts。输出:密度联通簇。①从数据库中抽出一个未处理的点;②如果对于参数Eps和MinPts,抽出的点是核心点,则找出所有从该点密度相连的对象,形成一个簇;③若抽出的点是边缘点(非核心对象),寻找另一个点;④重复步骤②和③,直到所有的点都被处理。129.1.3扩展类型(2)层次聚类层次聚类(HierarchicalClustering)是一种基于原型的聚类算法,通过某种相似性测度计算节点之间的相似性,并按相似度由高到低排序,逐步重新连接各个节点。139.1.3扩展类型层次聚类算法描述:①移除网络中的所有边,得到有n个孤立节点。②计算网络中每对节点的相似度。③根据相似度从强到弱连接相应节点对,形成树状图。④根据实际需求横切树状图,获得社区结构。149.1.3扩展类型(3)Mini-BatchK-均值Mini-BatchK-均值使用了MiniBatch(分批处理)的方法对数据点之间的距离进行计算,是K-均值的修改版本,计算过程中使用小批量数据样本而不必使用所有的数据样本对群集质心进行更新,提高了大数据集的更新速度,并且可能对统计噪声更健壮。Mini-BatchK-均值算法描述如下。①从数据集中随机抽取一些数据形成小批量,把它们分配给最近的质心。②更新质心。159.2应用实例利用Scikit-learn库中K均值聚类模块引入方法如下:fromsklearn.clusterimportKMeans函数原型如下:KMeans(n_clusters=8,init='k-means++',n_init=10,max_iter=300,tol=0.0001,precompute_distances='auto',verbose=0,random_state=None,copy_x=True,n_jobs=1,algorithm='auto')169.2.1参数分析均值聚类算法重要的参数为K值,本例利用部法则确定最优K值并不同度量标准对模型的性能进行分析。(1)问题描述利用K均值聚类算法对make_blobs数据行聚类,具体要求如下:①利用肘部法则确定最优K值。②采用三种聚类度量标准比较最优K值与非最优K值时的聚类效果。③绘制最优K值时聚类效果。(2)编程实现见9.2.1参数分析.py17
8.2.1参数分析(3)结果分析聚合度(K=3):276.0896109598088轮廓系数(K=3):0.5242733767166292Calinski-Harabasz值(K=3):1140.3741744702536聚合度(K=4):155.4680451324735轮廓系数(K=4):0.5805348965200624Calinski-Harabasz值(K=4):1475.656378279951218
8.2.1参数分析(3)结果分析19(a)最优K值确定(b)聚类结果可视化9.2.2文本聚类文本聚类是指在不需要预先指定类别的情况下将相似的文本归为同一类别,可以从海量的文本数据中提取有价值的信息,在信息检索、新闻推荐等自然语言处理领域中具有重要的应用价值。(1)问题描述已知句子集合,利用K均值聚类算法对句子进行聚类,具体要求如下:①统计不同的单词及出现的次数(生成词频矩阵)。②根据词频矩阵转换为TF-IDF值构成的样本。③利用主成分分析算法对样本进行降维处理。④对样本进行聚类并输出相应的聚类结果。(2)编程实现见9.2.2文本聚类.py20
9.2.2文本聚类(3)结果分析样本基本信息:(14,50)样本基本信息(PCA):(14,13)聚类结果:[21222210111212]第1类:Ipromise.第2类:Whatareyougoingtodo?Youlookbeautifultonight.Howgreatyouare!Igotsickandtiredofhotels.IamsorryItooksolongtoreply.Whenareyoufree?21第3类:Gotit!Anidleyouth,aneedyage.Hehasalargeincome.Howbluetheskyis!Whatisontheschedulefortoday?Ihopeeverythingisallright.Whatareyouinthemoodfor?
9.2.2文本聚类(3)结果分析根据实验结果可知,所有句子共包含50个不同的单词,因而通过词频统计与TF-IDF值处理后生成14行50列的样本集。在此基础上,通过主成分分析后生成14行13列的样本集并以此构建句子分类模型以实现句子的分类。整体上而言,由于K均值聚类算法的精度受K值的影响较大,不同的K值将导致不同的聚类结果;此外,对于文本分类问题,仅利用词频特征进行求解,通常并不易获得较高的精度,在精度要求较高的场合中往往需要进一步融合文本语义、词语相关性等特征。229.2.3睡眠障碍预测随着人们生活节奏的加快及生活压力的增加,不规则的睡眠时长、体重偏胖、心率不稳定、运动量较少等因素往往易导致睡眠障碍病症。利用相关数据预测睡眠障碍病症发生的可能性有助于人们提前做好防患,提高健康水平与生活质量。(1)问题描述已知影响睡眠障碍(Y:SleepDisorder)的相关因素包括睡眠时长(F1:SleepDuration)、BMI类别(F2:BMICategory)、心率(F3:HeartRate)与每天行走步数(F4:DailySteps),利用如表9-2所示数据构建睡眠障碍预测模型以对人们是否存在睡眠障碍进行预测(Y取值None、SleepApnea与Insomnia分别表示高、中与低三种类别的适应度),具体要求如下:①分析不同特征与睡眠障碍之间的关系。②对不同特征之间的相关性进行可视化与分析。③确定最优聚类数并构建睡眠障碍分类模型。④测试原特征与主成分分析生成的新特征相应的睡眠障碍分类模型的精度。23
9.2.3睡眠障碍预测(2)编程实现见9.2.3睡眠障碍预测.py(3)结果分析预测精度:0.575预测精度(PCA):0.5524
9.2.3睡眠障碍预测(3)结果分析25(a)心率与睡眠障碍之间的关系(b)每日运动量与睡眠障碍之间的关系(c)BMI与睡眠障碍之间的关系
(d)特征相关性
(e)利用肘部法则确定最优K值
9.2.4图像颜色聚类图像颜色聚类旨在将图像中像素对应的颜色划分为指定的类别,进而可以较少的颜色信息表达图像主体内容;在效果上,同一类别的颜色可能对应图像中多个图像区域。图像颜色聚类与计算机视觉领域中的图像过分割较为相似,但后者同时考虑到图像中像素的颜色与位置信息,最终将图像中具有相近颜色与位置特征的像素划分为一个超像素或图像区域,不同超像素或图像区域具有不同的颜色与位置特征。26
9.2.4图像颜色聚类(1)问题描述对指定图像中像素的颜色进行聚类,具体要求如下:①将图像中全部像素的颜色划分为8类并生成新图像,比较新图像与原图像之间的差异。②随机从图像中抽取指定数量像素的颜色并划分为8类,然后生成新图像以比较其与原图像之间的差异。③比较以下两种图像聚类方法所用时间的差异。(2)编程实现见9.2.4图像颜色聚类.py279.2.4图像颜色聚类(3)结果分析Time(all_samples):0.99s.Time(subset_samples):0.54s.28(a)原始图像
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 2025年劳动用工合规理论知识测试题(含答案)
- 湿法水刺非织造布制作工安全实操能力考核试卷含答案
- 2026年防静电手套行业创新模式与竞争力分析报告
- 机场场道维护员安全生产意识考核试卷含答案
- 砂石骨料生产工常识水平考核试卷含答案
- 货装值班员岗中生产安全考核试卷含答案
- 电工合金金属粉末处理工安全技能测试知识考核试卷含答案
- 手风琴校音工岗位创新实践考核试卷含答案
- 2027届浙江省宁波七中学教育集团九年级化学第一学期期中学业水平测试试题含解析
- 浆纱机操作工工作意识评优考核试卷含答案
- 2026年秋季开学小学防震减灾开学第一课
- 2026年继电保护专业岗位考核题库(附答案)
- (2026 秋季版)新人教 PEP 六年级上册英语单元词汇表(含音标 + 默写练习 + 参考答案)
- 消毒供应室追溯系统
- 乡镇消防安全知识培训课件
- 中建钢结构工程质量通病防治图册2020版
- 人体生理功能PPT(高职护理)完整全套教学课件
- 04SG519-2 多高层建筑钢结构节点连接
- GB/T 22344-2008包装用聚酯捆扎带
- 幼儿园中班课件:《调皮的风》
- 吹灰器教学讲解课件-
评论
0/150
提交评论