北京大学统计学课件第八章-聚类分析_第1页
北京大学统计学课件第八章-聚类分析_第2页
北京大学统计学课件第八章-聚类分析_第3页
北京大学统计学课件第八章-聚类分析_第4页
北京大学统计学课件第八章-聚类分析_第5页
已阅读5页,还剩25页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

ClusterAnalysis第八章聚类分析北京大学统计学经典课程Contents本章教学目录聚类分析——从距离度量到算法实现的完整知识脉络01聚类分析导论与应用场景02数学基础:距离与相似系数03系统聚类法(层次聚类)04动态聚类法(K-Means算法)05密度聚类与前沿应用CHAPTER01聚类分析导论探索数据内在结构的无监督学习艺术聚类分析什么是聚类分析?聚类分析(ClusterAnalysis)是一种无监督的模式识别方法,旨在将数据样本划分为不同的组别(簇),使得同一组内的样本具有高度的相似性,而不同组间的样本具有显著的差异性。核心目标发现数据中的潜在结构和模式,将复杂的高维数据集简化为易于理解的类别,帮助研究者理解数据特征与关系。高维简化与分类的区别分类是有监督学习,已知类别标签;聚类是无监督学习,类别标签未知,完全由数据驱动生成。无监督基本原则类内差异最小化,类间差异最大化。追求簇内样本紧密聚集,同时不同簇之间保持足够的距离。最小·最大METHODOLOGY聚类分析的标准流程科学的聚类分析并非简单的算法调用,而是包含从指标构建到结果验证的严密逻辑链条。01选择变量根据研究目的,挑选能够准确描述事物对象特征的指标(变量),这是决定聚类成败的前提。VARIABLESELECTION02构建矩阵建立样品数据资料矩阵,将n个样本的m个指标转化为数学模型进行后续处理。DATAMATRIX03数据标准化消除量纲影响,保证各变量在分析中处于同等地位(如Z-score标准化)。STANDARDIZATION04确定度量选择计算对象间"距离"或"相似程度"的统计量(如欧氏距离、相关系数)。DISTANCEMETRIC05选择算法根据数据特性选择适当的聚类方法(系统聚类、K-Means等)并输出结果。ALGORITHMCLUSTERINGTAXONOMY聚类的两大分类体系根据聚类对象的不同,统计学将其划分为Q型聚类(样品聚类)和R型聚类(变量聚类),两者在度量指标和应用场景上各有侧重。Q型聚类样品聚类📍对象对n个观测样本进行分类,每个样本代表一个待归组的个体单元。例如消费者、城市、产品等实体对象。📐度量使用距离系数(Distance)衡量样本间差异,距离越近说明样本越相似。常用欧氏距离、曼哈顿距离等。💡案例将全国31个省市按土地利用情况分类,或按消费习惯对人群分群,发现潜在的市场细分结构。R型聚类变量聚类📍对象对m个变量(指标)进行分类,将高相关性的指标归为同组。目标是识别冗余变量、简化数据结构。📐度量使用相似系数(Similarity),如相关系数,系数越大说明变量相关性越强。常用皮尔逊相关系数。💡案例将几十项经济指标归类为几个核心因子,用于后续降维分析,消除多重共线性问题。CASESTUDIES经典应用案例分析聚类分析跨越商业、政府与学术界,为精准决策提供数据支撑。📊MARKETINGChrysler客户细分背景:定位雅皮士阶层目标客户,推出新产品Viper。通过聚类算法整合人口统计、消费行为与生活方式数据,构建精准客户画像体系。结果:成功划分出"年轻创业型"、"中产稳健型"、"保守低调型"三类消费者心理特征,指导产品定位与营销策略制定。3类画像🏛️GOVERNANCE土地利用"卫片执法"背景:国土资源部利用卫星遥感图片叠加对比,覆盖全国31个省市。通过图像聚类技术自动识别土地利用类型变化。结果:根据土地利用特征自动分类,一目了然识别乱占耕地与违建区域,为国土规划与执法决策提供实时数据支持。31省市覆盖Chapter02数学基础距离、相似系数与数据标准化Chapter08·ClusterAnalysis数据资料矩阵的标准化处理消除量纲影响是聚类分析的前提。通过标准化变换,使各指标均值为0、标准差为1,确保所有变量在多维空间中具有同等权重。01量纲的干扰:当变量单位不同(如身高cm与体重kg)或数量级差异巨大时,直接计算距离会导致大数值变量主导聚类结果。02Z-score标准化:最常用的处理方法,公式为x'=(x−μ)/σ。变换后数据服从标准正态分布,保留了原始数据的相对结构。03极差归一化:将数据映射到[0,1]区间,公式为x'=(x−min)/(max−min),适用于对边界有严格要求的场景。统计学正态分布曲线·标准化变换使数据服从标准正态分布DISTANCEMETRICS距离度量:闵氏与欧氏距离距离越小,样本关联性越大。闵氏距离是p维欧氏空间中最通用的距离定义,而欧氏距离是其最常见特例。闵氏距离(Minkowski)dij=[Σ|xik−xjk|q]1/q。当q=1时为绝对值距离,q=2时为欧氏距离,是参数化距离族的统一表达。q参数欧氏距离(Euclidean)dij=√[Σ(xik−xjk)²]。符合人类对空间距离的直观感知,计算简单,是应用最广泛的距离度量。q=2局限性两种距离都将各维度视为独立,未考虑变量间相关性。若变量高度相关,会导致某些特征权重被重复计算,影响聚类效果。维度独立DistanceMetrics距离度量:马氏距离(Mahalanobis)马氏距离通过引入协方差矩阵,有效排除了变量间相关性的干扰,并具备尺度不变性,是更严谨的统计学距离。定义DM(x,y)=√[(x−y)TΣ−1(x−y)]其中Σ为样本总体的协方差矩阵协方差矩阵识别分布形态考虑数据的分布形状(协方差),能够识别出在椭圆分布下真正远离中心的异常点。椭圆分布尺度不变性不受量纲影响,自动进行了标准化处理,适用于不同单位的多维数据比较。量纲无关局限性要求协方差矩阵Σ可逆,且假设样本来自同一总体,矩阵不稳定时计算可能失效。Σ可逆ClusterAnalysis·Ch.08相似系数:Pearson相关系数相似系数用于度量变量间的亲疏程度,绝对值越接近1说明性质越接近,是R型聚类的核心统计量。定义衡量两个变量之间线性相关程度的统计量,取值范围[-1,1]。[-1,1]判定准则|r|越接近1,说明两个变量关系越密切,越应归为一类;|r|越接近0,说明越不相关。|r|→1几何意义实际上是数据做标准化处理后的夹角余弦,反映了两个变量向量在多维空间中的方向一致性。cosθCosineSimilarity相似系数:夹角余弦将变量视为n维空间中的向量,通过计算向量夹角的余弦值来衡量相似度,不受向量长度(绝对数值)的影响。核心公式cos(θ)=(X·Y)/(||X||×||Y||)即两向量内积除以模长之积,衡量向量间的夹角关系。cos(θ)核心特点只关注向量的方向(变化趋势),忽略向量的模长(绝对大小),使相似度度量不受数据量级差异的干扰。方向不变性典型应用广泛应用于文本相似度计算(如TF-IDF向量)和推荐系统中,能够有效处理高维稀疏矩阵。TF-IDFChapter03系统聚类法层次结构与树状图(Dendrogram)解析HierarchicalClustering系统聚类法(HierarchicalClustering)系统聚类是一种自下而上(Agglomerative)的聚合过程,通过逐步合并距离最近的类,构建出完整的层次分类结构。01初始化将n个样本各自看作一个独立的类,此时共有n个类。02合并计算任意两个类之间的距离,将距离最小的一对类合并为一个新类。03迭代重新计算新类与剩余类之间的距离,重复合并步骤,每次减少一个类。04终止直到所有样本最终合并为一个大类,并绘制聚类谱系图(Dendrogram)。聚类谱系图·Dendrogramx₁x₂x₃x₄x₅高低距离自下而上逐步合并,纵轴表示类间距离CLUSTERINGANALYSIS类间距离的连接方式如何定义"类与类"之间的距离是系统聚类的核心。不同的连接准则会直接导致截然不同的聚类拓扑结构。最短/最长距离法SingleLinkage取两类中最近样本点的距离。易产生"链状"效应,适合非球形簇。CompleteLinkage取两类中最远样本点的距离。倾向于生成紧凑、直径较小的球形簇。基于极值点的距离度量Ward法(离差平方和)原理每次合并使得合并后类内离差平方和(方差)增加最小。特点统计学理论最严密,倾向于生成大小均匀的簇,对异常值相对不敏感,是实际应用的首选。方差最小化原则HIERARCHICALCLUSTERING聚类谱系图(Dendrogram)树状图是系统聚类的可视化结晶,不仅展示了分类结果,更记录了整个聚类的历史过程和类间亲疏关系。层次聚类树状图的绘制场景01结构解析:横轴代表样本点,纵轴代表合并时的距离(不相似度)。节点的高度反映了两个簇合并时的代价。02截断阈值:通过在纵轴特定高度画一条水平截断线,与树状图垂直线的交点数量即为最终的聚类数量。03优势:无需预先指定K值(簇的数量),研究者可以根据业务逻辑和树状图的结构灵活决定分类粒度。04局限:计算复杂度高,通常为O(n³)或O(n²logn),不适合处理超大规模数据集(如n>10000)。CHAPTER04动态聚类法K-Means算法的原理、优化与K值选择Algorithm·ClusteringK-Means算法核心流程K-Means是一种基于划分的迭代算法,通过不断调整质心位置,最小化簇内样本到质心的距离平方和(SSE)。01初始化从n个样本中随机选择k个对象作为初始的聚类中心(Centroids)。02分配计算每个样本到各个质心的欧氏距离,将其分配给距离最近的质心所代表的簇。03更新重新计算每个簇内所有样本的均值,将该均值点作为新的质心。04迭代重复Step2和Step3,直到质心位置不再发生显著变化(收敛)或达到最大迭代次数。CLUSTERINGANALYSISK-Means算法的优劣势分析作为工业界应用最广泛的算法,K-Means在效率与鲁棒性之间做出了取舍,理解其边界是正确应用的关键。核心优势原理简单,易于实现和解释,是数据挖掘的基线算法。收敛速度快,时间复杂度接近线性O(n·k·t),适合处理大规模数据集。聚类效果在簇呈凸球形分布且方差相近时表现优异。关键局限K值敏感:需要预先指定簇的数量,错误的K值会导致无意义的结果。初始化陷阱:对初始质心选择敏感,易陷入局部最优解(常用K-Means++优化)。形状限制:基于距离的划分假设簇是球形的,难以处理流形或非凸形状的簇。CLUSTERINGANALYSIS·CHAPTER08K值选择:手肘法(ElbowMethod)手肘法通过观察误差平方和(SSE)随K值变化的拐点,提供了一种直观且基于数据驱动的最佳K值确定策略。01指标定义:SSE(SumofSquaredErrors)是所有样本到其所属簇质心的距离平方和,代表聚类的紧凑程度。02趋势分析:随着K增大,SSE单调递减。K小于真实簇数时下降幅度大;K超过真实簇数时下降趋于平缓。03拐点识别:选择SSE下降速率发生突变("手肘"形状)的K值作为最佳聚类数,平衡模型复杂度与精度。SSE随K值变化趋势模拟K=3处出现明显拐点,SSE下降趋缓ValidationMethodK值验证:轮廓系数(SilhouetteCoefficient)轮廓系数结合了内聚度(a)和分离度(b),是评估聚类效果内部一致性的无监督量化指标。公式定义s=(b−a)/max(a,b)。其中a是样本到簇内其他点的平均距离,b是到最近其他簇的平均距离。a·b取值解读s∈[−1,1]。s接近1表示聚类紧凑且分离良好;s接近0表示在边界上;s<0表示可能分配错误。[−1,1]应用策略计算不同K值下的平均轮廓系数,选择使平均轮廓系数最大的K,通常比手肘法更客观。最优KCHAPTER05密度聚类与前沿DBSCAN算法与生物信息学应用探索CLUSTERING·CHAPTER08DBSCAN算法核心原理DBSCAN(Density-BasedSpatialClusteringofApplicationswithNoise)通过定义邻域半径和最小样本数,能够发现任意形状的簇并有效识别噪声。核心参数Eps定义邻域半径,MinPts指定成为核心点所需的最小样本数,两者共同决定密度判定标准。Eps·MinPts点的分类核心点邻域内点数≥MinPts;边界点处于核心点邻域内但自身非核心;噪声点既非核心也非边界。三类样本点扩张机制从任意核心点出发,通过密度可达关系不断合并密度相连的样本,最终形成完整的簇。密度可达AlgorithmComparison三大聚类算法横向对比没有万能的算法,只有最适合数据特性的选择。常用聚类算法特性对比算法名称簇形状假设需指定K值抗噪能力大数据性能K-Means球形/凸集是弱极高系统聚类无特定假设否中低DBSCAN任意形状否极强中等DBSCAN在处理复杂形状和噪声数据时具备独特优势BIOINFORMATICS前沿应用:生物信息学与基因表达聚类分析是高通量测序时代解析生命密码的核心工具,能够从海量且充满噪声的基因序列数据中提取结构信息。DNA双螺旋结构·基因科学研究意象01SAGE数据分析:基因表达序列分析技术(SAGE)可快速分析数以千计的转录本,聚类算法用于发现隐含的转录模式。SAGE02蛋白质家族分类:通过序列相似性聚类,将未知功能的蛋白质序列归入已知家族,从而预测其生物学功能。序列相似性03算法挑战:生物数据通常具有高维度、小样本、高噪声的特点,需要结合统计特性(如Poisson分布)的定制化聚类算法。Poisson分布APPLICATION前沿应用:计算机视觉图像分割将图像的像素或区域作为样本进行聚类,是实现图像分割、目标检测和场景理解的基础步骤。

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

最新文档

评论

0/150

提交评论