北京大学统计学课件第八章-聚类分析_第1页
北京大学统计学课件第八章-聚类分析_第2页
北京大学统计学课件第八章-聚类分析_第3页
北京大学统计学课件第八章-聚类分析_第4页
北京大学统计学课件第八章-聚类分析_第5页
已阅读5页,还剩29页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

第八章聚类分析(1)北京大学统计学经典课件·多元统计分析Contents本章目录聚类分析的核心方法、评估指标与应用场景,涵盖从基础概念到前沿算法的完整知识体系。01聚类分析概述02K均值聚类03层次聚类04DBSCAN聚类05基于密度的聚类方法06聚类分析的评估指标与应用07总结与展望CHAPTER01聚类分析概述从定义、分类到应用场景,建立聚类分析的完整认知框架CLUSTERANALYSIS什么是聚类分析聚类分析是一种无监督学习方法,通过对数据对象之间的相似性进行计算,将它们自动分成若干内部相似、彼此差异明显的群体(cluster),其本质是让数据自己"长出类别",而非人为预设标签。01无监督学习范式不需要预先标记的训练数据,算法自动从数据的分布特征中发现隐藏的分组结构和内在规律,适用于探索性数据分析场景。02核心目标——"物以类聚"同一聚类内的数据点尽可能相似(组内同质性),不同聚类间的数据点尽可能不同(组间异质性),形成清晰可辨的数据分组。03与分类分析的本质区别分类是"已知类别标签,学习判别规则"的监督学习;聚类是"未知类别结构,探索自然分组"的无监督发现过程。04数学本质在多维空间中寻找数据点的自然聚集区域,通过欧氏距离、余弦相似度等度量来量化"相似"与"不同"的程度。DistanceMetrics聚类分析的基本原理聚类分析的数学基础建立在距离度量与相似性度量之上,不同度量方式对聚类结果产生显著影响。Euclidean欧氏距离多维空间中两点的直线距离,最常用的距离度量,适用于连续型数值数据,但对量纲敏感需先标准化。L2NormManhattan曼哈顿距离各维度差的绝对值之和,在高维空间中比欧氏距离更稳健,适用于网格状空间或稀疏数据。L1NormMinkowski闵可夫斯基距离欧氏与曼哈顿距离的泛化形式,通过参数p控制计算方式:p=1为曼哈顿,p=2为欧氏距离。LpNormCosine余弦相似度衡量两个向量方向的一致性而非绝对距离,广泛用于文本挖掘和高维稀疏数据场景。VectorAngleClassification聚类分析的主要分类聚类分析算法按核心思想可分为四大类:基于距离、基于层次、基于密度和基于网格。每类方法在算法复杂度、适用数据形态和聚类形状假设上存在本质差异,选择时需结合数据特征和分析目标。基于距离的聚类以数据点之间的距离为核心划分标准,代表算法为K均值(K-Means)和K中心点(K-Medoids)原理简单、计算效率高;通常只能发现球形簇,对异常值敏感K-Means基于层次的聚类逐层合并(凝聚法)或逐层分裂(分裂法)形成树状结构,代表算法有BIRCH、CURE无需预设类别数、可生成层次化聚类树;计算复杂度较高,合并后不可撤回BIRCH基于密度的聚类以局部密度为判据,能发现任意形状聚类并识别噪声,代表算法为DBSCAN、OPTICS对异常值鲁棒、可发现非球形簇;对密度参数敏感,不适合密度差异大的数据集DBSCAN基于网格的聚类将数据空间划分为有限网格单元,基于网格密度进行聚类,代表算法有STING、CLIQUE处理速度快、对数据顺序不敏感;聚类精度受网格粒度影响,难以处理高维稀疏数据STINGAPPLICATIONDOMAINS聚类分析的应用领域聚类分析作为无监督学习的核心工具,已渗透到市场营销、生物医学、社会科学、环境科学等众多领域。其价值在于将复杂数据集简化为可理解的类别结构,为精细化决策提供数据支撑。商业与市场商业与市场根据消费属性与行为特征将客户划分为不同群体,实现精准营销和个性化推荐识别不同产品的销售模式聚类,优化库存管理和定价策略精准营销生物医学生物医学对基因表达数据进行聚类,发现功能相关的基因群组,推动精准医疗发展根据患者症状和检测指标聚类,辅助识别疾病亚型和个性化治疗方案精准医疗社会与环境社会与环境识别人口分布特征和社区结构,为公共政策制定提供数据依据对气候和生态指标聚类,揭示环境变化的区域模式和演化趋势公共决策CHAPTER02K均值聚类最经典的划分式聚类算法:原理、流程、优化与局限K-MeansClusteringK均值聚类的基本原理K均值聚类是一种基于质心的划分式聚类算法,通过迭代优化最小化组内平方和(WCSS),将n个数据点划分到K个簇中,使每个数据点到其所属簇中心的距离之和最小,从而实现紧凑且分离的聚类结构。核心假设数据可以被K个球形簇良好描述,每个簇由其质心(均值向量)代表,簇内数据围绕质心呈近似球形分布。球形簇目标函数最小化所有样本到其所属簇质心的距离平方和WCSS=ΣΣ||xᵢ−μₖ||²,其中μₖ为第k簇的质心。WCSS迭代优化策略在"分配样本到最近质心"和"重新计算各簇质心"两个步骤之间交替进行,每轮迭代都使目标函数单调递减。交替收敛收敛保证由于WCSS有下界(≥0)且每轮单调递减,算法必然在有限步内收敛,但可能收敛到局部最优而非全局最优。局部最优K-MeansAlgorithmK均值算法的完整流程K均值算法通过"初始化→分配→更新→判定"四步循环实现迭代优化。虽然流程简洁,但初始质心选择、距离计算方式和收敛条件设定都会显著影响最终的聚类质量和算法效率。01初始化质心随机选择K个观测值作为初始聚类中心,或使用K-Means++等启发式方法选取分散的初始点以降低局部最优风险K-Means++02样本分配计算每个数据点到K个质心的距离(通常为欧氏距离),将每个点分配给距离最近的质心所对应的簇欧氏距离03更新质心对每个簇内所有数据点在各维度上求均值,得到新的质心位置,作为下一轮迭代的聚类中心维度均值04收敛判定比较新旧质心位置差异,若所有质心变化量小于预设阈值或达到最大迭代次数则终止,否则返回Step2继续阈值终止CHAPTER08·CLUSTERINGANALYSISK值选择:肘部法则与轮廓系数K值的合理选择直接决定聚类质量。肘部法则通过WCSS曲线的拐点直观判断最优K值,轮廓系数法则从组内紧密度和组间分离度两个维度量化评估聚类效果,两者结合使用可提高K值选择的可靠性。01肘部法则(ElbowMethod):依次计算K=1,2,...,n时的WCSS并绘制曲线,曲线出现明显拐点处即为推荐K值,拐点后WCSS下降趋缓说明继续增加K的边际收益递减。02轮廓系数(SilhouetteCoefficient):对每个样本计算其与同簇其他样本的平均距离a(组内紧密度)和与最近异簇样本的平均距离b(组间分离度),公式为S=(b−a)/max(a,b)。03取值范围[−1,1]:接近1表示样本聚类分配合理、簇间分离清晰;接近0表示样本处于两簇边界;负值表示样本可能被分配到了错误的簇。04实践建议:同时使用两种方法交叉验证,当肘部法则拐点不明显时优先参考轮廓系数,并结合业务背景和数据含义做最终判断。聚类分析·CLUSTERINGK均值聚类的优势与局限K均值以简洁的原理和高效的计算成为应用最广泛的聚类算法,但其对K值先验、初始质心、簇形状假设和异常值的敏感性构成了四大核心局限,这些局限推动了K-Means++、K-Medoids等变体和其他聚类算法的发展。STRENGTHS原理简洁、易于实现算法逻辑清晰,编程实现仅需数十行代码,便于教学与工程落地计算效率高时间复杂度约O(n·K·T·d),大规模数据集仍能快速收敛,适合工业级应用可解释性强每个簇由质心代表,结果直观易懂,便于向非技术人员解释聚类含义LIMITATIONSK值需预先指定缺乏自动确定最优K值的机制,依赖肘部法则或轮廓系数等外部方法辅助判断对初始质心敏感随机初始化可能陷入局部最优,多次运行结果不一致,需K-Means++改进簇形状假设受限隐含球形簇假设,难以发现条形、环形等不规则结构,对非凸数据表现较差CLUSTERING·OPTIMIZATIONK均值聚类的优化策略K-Means++通过概率化的分散式初始化显著降低了局部最优风险,是K均值最重要的改进之一。结合多次随机重启、Mini-batch采样等策略,可在不改变核心算法框架的前提下大幅提升聚类质量和稳定性。01K-Means++初始化首个质心随机选取,后续质心按与最近已有质心的距离平方成正比的概率选取,确保初始质心充分分散,大幅降低局部最优风险。该策略已被scikit-learn等主流库作为默认初始化方法。D²-SAMPLING·概率化分散02多次随机重启策略运行K均值多次(如10–100次),每次使用不同的随机初始质心,取WCSS最小的那次结果作为最终输出。配合早停机制可在保证质量的同时控制计算开销。10–100RESTARTS·最优选择03Mini-batchK-Means每次迭代仅用一小批随机样本更新质心,在保持聚类质量的同时将计算复杂度从O(n)降至O(b),适合百万级以上大规模数据,收敛速度提升3–10倍。O(b)复杂度·大规模适用04K-Medoids变体用实际数据点(而非均值)作为簇中心,对异常值和噪声更鲁棒,适用于非数值型数据或存在离群点的场景。支持任意距离度量,扩展性更强。鲁棒中心点·任意度量CASESTUDY·聚类分析K均值应用案例:社区老年人健康需求分型通过K均值聚类对老年人健康需求进行分型,成功识别出三类差异化群体,使'千人一面'的养老服务模式转向'人群分型+定向匹配',体现了聚类分析在社会服务精细化中的核心价值。社区老年人健康需求K均值聚类结果群体类型核心特征对应服务策略技术适应型年轻、收入中高、愿意尝试智慧设备智慧化主动健康管理包依赖支持型多病、认知较弱、子女远重度照护+线下响应优先混合过渡型轻病、偏保守但有家庭资源引导式数字陪护服务三类群体在年龄、健康状况和技术接受度上呈现显著差异,验证了K均值在社会服务分群研究中的有效性CHAPTER03层次聚类无需预设类别数的树状聚类方法:凝聚法、分裂法与类间距离HIERARCHICALCLUSTERING层次聚类的基本概念层次聚类通过逐步合并或逐步分裂构建数据的树状聚类结构,无需预先指定类别数,研究者可根据需要选择合适的切割层级。AGGLOMERATIVE凝聚层次聚类(自底向上)01初始状态将n个观测值各自视为独立的一类,共n个簇02迭代合并每次计算所有类对之间的距离,将距离最近的两个类合并为一个新类03终止条件重复合并过程,直到所有观测值归为一个大类,或达到预设的类别数DIVISIVE分裂层次聚类(自顶向下)01初始状态所有观测值归为一个大类02迭代分裂每次选择内部差异最大的类进行分裂,将其分成两个差异最大的子类03终止条件重复分裂直到每个观测值自成一类,或满足预设的终止条件Chapter08·HierarchicalClustering类间距离的五种度量方法类间距离的度量方式直接决定层次聚类的行为特征。最短距离法倾向链式聚类,最长距离法倾向紧凑簇,Ward法在最小化方差增量意义上最优。不同度量方法适用于不同的数据分布形态,选择时应结合数据特征和聚类目标。五种常用类间距离度量方法对比方法名称定义特征与适用场景最短距离法两类中最近的两个点之间的距离易产生链状聚类,适合发现长条形簇最长距离法两类中最远的两个点之间的距离倾向产生紧凑球形簇,对异常值敏感类平均法两类所有点对距离的平均值折中方案,对异常值较稳健重心法两类质心(均值向量)之间的距离考虑了类的大小,但可能出现逆合并现象Ward法使合并后组内离差平方和增量最小方差最小化准则,实践中效果通常最佳Ward法和类平均法在实际应用中使用最广泛,选择时需结合数据形态和聚类目标综合考量HIERARCHICALCLUSTERING树状图的解读与聚类决策树状图(Dendrogram)是层次聚类的核心输出,直观展示了数据在不同粒度下的聚类层次。通过在树状图上选择合适的切割高度,研究者可以灵活地获取不同数量的聚类结果,这是层次聚类相比K均值最大的实践优势。01树状图结构解读:横轴为数据点或簇标签,纵轴为合并距离(不相似度),两条分支的合并高度反映两个类之间的差异程度02切割高度选择:在树状图上某一高度画水平线,该线截断的分支数即为聚类数;应选择在距离跳跃最大的区间切割,确保簇间差异显著03与K均值的互补性:可先通过层次聚类的树状图初步判断合理K值,再用K均值在该K值下进行精细聚类,两种方法结合使用效果更佳04实际应用注意:当样本量很大时(如n>10000),凝聚层次聚类的O(n³)复杂度会成为瓶颈,此时应考虑BIRCH等高效变体或改用K均值层次聚类树状图(Dendrogram)——纵轴表示合并距离,横轴为数据点或簇标签CHAPTER04DBSCAN聚类基于密度的空间聚类方法:发现任意形状簇与自动噪声识别CoreConceptsDBSCAN的核心概念与点分类DBSCAN通过Eps(邻域半径)和MinPts(最小点数)两个参数,将数据点分为核心点、边界点和噪声点三类。从核心点出发通过密度可达关系扩展形成聚类簇,能自动发现任意形状的聚类并识别离群噪声点。01·两个关键参数Epsε-邻域半径:定义每个数据点的邻域范围,即以该点为圆心、Eps为半径的圆形区域MinPts最小点数:Eps邻域内需要的最少数据点数,用于判定一个点是否处于足够密集的区域02·三种点类型核心点(CorePoint):Eps邻域内至少包含MinPts个点,代表数据密集区域的核心密度最高的区域中心边界点(BorderPoint):非核心点但位于某核心点的Eps邻域内,属于簇的边缘连接核心与噪声的过渡噪声点(NoisePoint):既非核心点也非边界点,被视为数据中的异常或离群值DBSCAN自动识别的离群点CLUSTERING·DENSITYDBSCAN算法流程与密度可达DBSCAN通过密度可达关系的传递性,从核心点出发逐步扩展形成聚类簇。这种基于密度连通性的扩展机制使算法能够发现任意形状的聚类结构,同时自动将不满足密度条件的孤立点标记为噪声。01密度直达若点p为核心点,点q在p的Eps邻域内,则q从p直接密度可达DirectlyDensity-Reachable02密度可达存在点序列p₁→p₂→…→pₙ使pᵢ₊₁从pᵢ直接密度可达,则pₙ从p₁密度可达,具有传递性Density-Reachable03密度相连存在点o使p和q都从o密度可达,则p、q密度相连;同簇内任意两点均满足此关系Density-Connected04算法终止所有点标记为簇成员或噪声时结束;无需预设聚类数,簇的个数由数据密度结构决定Auto-determineKCLUSTERINGANALYSIS·CH.8DBSCAN参数选择与优缺点分析DBSCAN的性能对Eps和MinPts参数高度敏感。k-距离图法是确定Eps的有效启发式方法,MinPts通常取数据维度+1。虽然DBSCAN在发现任意形状簇和噪声识别方面具有独特优势,但在密度不均匀的数据集和高维空间中表现受限。核心优势无需预设簇数聚类数量由数据的密度结构自动决定,避免了K均值中K值选择的难题,使分析过程更加数据驱动。发现任意形状簇基于密度连通性而非距离最小化,可识别月牙形、环形等非凸聚类结构,突破传统算法的形状限制。自动噪声识别将密度不足区域中的点标记为噪声,天然具备异常检测能力,无需额外的离群点处理步骤。主要局限参数敏感性Eps和MinPts的微小变化可能导致截然不同的聚类结果,参数调优需要结合领域知识与可视化辅助。密度不均匀问题当不同簇的密度差异较大时,单一Eps无法同时适应高密度和低密度区域,可能导致簇的过度合并或分裂。高维空间退化在高维数据中距离度量趋于失效,密度概念变得模糊,聚类质量显著下降,通常需要先进行降维处理。Chapter05基于密度的聚类方法从DBSCAN到OPTICS:密度聚类方法的演进与扩展DENSITY-BASEDCLUSTERINGOPTICS:克服密度不均匀的密度聚类OPTICS通过引入核心距离和可达距离两个概念,将DBSCAN的单一密度阈值扩展为多密度层次分析,允许在不同密度水平上灵活提取聚类结构。01核心距离使一个数据点成为核心点所需的最小邻域半径,反映该点所在区域的局部密度水平。该参数决定了点能否作为簇的种子点,是OPTICS算法识别高密度区域的关键指标。02可达距离数据点到其最近核心点的距离与该核心点的核心距离的较大值,用于衡量点与簇的"归属强度"。较小的可达距离表明点更紧密地属于某个聚类。03可达距离图将所有数据点按OPTICS排序后的可达距离绘制成折线图,波谷对应聚类簇,波峰对应簇间分隔。这种可视化方式直观展现了数据集的层次聚类结构。04与DBSCAN的关系OPTICS本身不直接产生聚类结果,而是生成一个排序结构,后续可在该结构上以不同Eps值提取等价于DBSCAN的聚类。相比DBSCAN,OPTICS仅需一次扫描即可支持多密度分析。DENSITY-BASEDCLUSTERING密度聚类方法对比总结密度聚类方法从DBSCAN发展到OPTICS和HDBSCAN,逐步解决了参数敏感性、密度不均匀和自动化程度等问题。选择时应根据数据的密度分布特征、维度规模和对自动化的需求综合考量。主要密度聚类方法特性对比方法关键参数核心优势主要局限DBSCANEps,MinPts简单高效,自动发现噪声对参数敏感,不适合密度不均数据OPTICSEps(上限),MinPts适应多密度层次,可视化好计算复杂度更高,不直接输出聚类HDBSCANMinPts自动选择最优聚类,无需Eps对极小簇的检测可能不稳定DENCLUE网格宽度,密度阈值基于密度吸引子,处理高维数据较好网格宽度选择影响结果质量从DBSCAN到HDBSCAN的演进体现了密度聚类方法在自动化和鲁棒性方面的持续改进CHAPTER06聚类分析的评估指标与应用从内部指标到外部指标,系统评价聚类质量并深入实践场景InternalValidationMetrics聚类评估的内部指标内部评估指标不需要外部真实标签,仅基于数据本身的几何结构衡量聚类质量。轮廓系数、Davies-Bouldin指数和Calinski-Harabasz指数是三种最常用的内部指标,分别从紧密度-分离度、簇间相似比和方差比三个角度量化聚类效果。轮廓系数综合衡量每个样本的组内紧密度a和组间分离度b,公式S=(b-a)/max(a,b),取值[-1,1],越大越好,适合比较不同K值。Silhouette↑越大越好Davies-Bouldin指数对每对簇计算簇内散度之和与簇间距离的比值并取平均,值越小说明簇内越紧凑且簇间越分离。该指标计算效率高,对凸形簇效果较好。DBI↓越小越好Calinski-Harabasz指数类间离散度矩阵的迹与类内离散度矩阵的迹之比,再按自由度调整,值越大表示聚类效果越好。计算速度快,适合大规模数据集。CH↑越大越好实践建议同时使用多个指标交叉验证,当指标间出现矛盾时应优先参考轮廓系数,并结合数据可视化和业务逻辑做最终判断,避免单一指标的局限性。交叉验证多指标综合评估ExternalEvaluationMetrics聚类评估的外部指标外部评估指标通过比较聚类结果与真实标签的一致性来衡量算法性能,主要用于算法基准测试和方法比较。调整兰德指数(ARI)和归一化互信息(NMI)因修正了随机基准和类别数影响,成为学术研究中最被推荐的外部指标。纯度(Purity)对每个簇找出其包含最多的真实类别,计算该类别样本占簇总样本的比例,所有簇加权平均得到整体纯度。取值范围为[0,1],值越高表示聚类结果与真实标签越吻合。取值范围:[0,1]调整兰德指数(ARI)基于样本对在聚类结果和真实标签中的一致性(同簇/异簇)计算,修正了随机分配的期望值,0表示随机水平。相比纯度更稳健,是学术论文首选指标。取值范围:[-1,1]归一化互信息(NMI)基于信息论,计算聚类结果与真实标签之间的互信息并归一化,值越大说明聚类结果包含的真实类别信息越多。对类别数量变化具有良好鲁棒性。取值范围:[0,1]使用场景主要适用于有标注数据的算法评估和基准测试;实际业务场景中往往缺乏真实标签,需依赖内部指标和业务逻辑综合判断。常用于Kaggle竞赛、学术基准数据集对比。应用场景:BENCHMARKCASESTUDY应用案例:家政服务客户分型研究通过Two-step聚类方法对家政服务客户进行多维度分型,成功识别出三类差异化客户群体。这一分型结果为平台实现精准营销、差异化服务设计和培训体系优化提供了数据驱动的决策依据。家政服务客户Two-step聚类分型结果客户类型核心画像特征差异化服务策略定制型中产家庭注重服务匹配、看重隐性价值、愿付溢价推送高端定制服务线,配备专属客户经理高频刚需型家庭双职工、有老人或婴幼儿,时间紧张注重效率提供标准化快速响应套餐,优先保障服务时效价格敏感型用户服务弹性使用,以临时应急为主,波动大推出灵活计费方案,通过优惠券刺激复购三类客户在服务需求、价格敏感度和使用频率上存在显著差异,验证了聚类分析在商业客户细分中的实用价值CLUSTERING·DECISIONFRAMEWORK聚类算法选择决策指南聚类算法的选择应综合考虑K值先验知识、数据簇形状、数据规模、噪声水平和数据类型等因素。没有一种算法在所有场景下都是最优的,理解每种算法的假设前提和适用边界是正确选择的关键。聚类算法选择决策矩阵决策因素K均值层次聚类DBSCAN是否需预设K值需要不需要不需要簇形状假设球形取决于距离度量任意形状大规模数据适用性优

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论