SPSS 数据分析与应用课件 第5章 聚类分析_第1页
SPSS 数据分析与应用课件 第5章 聚类分析_第2页
SPSS 数据分析与应用课件 第5章 聚类分析_第3页
SPSS 数据分析与应用课件 第5章 聚类分析_第4页
SPSS 数据分析与应用课件 第5章 聚类分析_第5页
已阅读5页,还剩23页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

第5章聚类分析学习目标1.了解聚类分析的概念及算法分类2.理解K-means聚类及系统聚类的基本概念3.掌握SPSS实现K-means聚类和系统聚类并对结果进行解读的方法学习导读与引导案例聚类分析:揭示数据内在分组规律、实现多维数据高效分类的重要工具核心目标:通过相似性度量将复杂数据集划分为具有显著差异的簇群,挖掘数据背后的结构特征。本章包括概述、K-means聚类、系统聚类,并通过移动通信客户数据综合实践。图5-1移动通信客户数据.sav(部分)引导案例移动通信客户数据:工作日上班/下班、周末、国际、总通话时长、平均每次通话时长6项指标。思考①如何将客户定量地分为5个群体?②如何依据聚类结果为每个群体设计个性化营销策略?客户细分是最常见的聚类需求:定量分类+画像命名+分群施策。Part5.1聚类分析概述5.1.1聚类分析的概念把研究对象按一定规则分成若干类,类由数据特征决定而非事先给定聚类分析(clusteranalysis)是研究分类问题的多元统计方法:同一类内对象相似度高,不同类之间差异大。相比依赖经验的定性分类,聚类以数学方法克服主观性与任意性。类非预设类别不是事先给定,而是根据数据特征确定类内相似同类对象“亲疏”程度近、结构相似类间相异不同类之间距离远、差异显著应用广泛客户细分、金融投资分组、生物分类等移动通信案例:按各时段通话时长指标将客户分类,从而更有针对性地服务客户、提供个性化服务。5.1.2聚类算法的分类三个角度理解聚类算法家族划分角度类型含义聚类结果覆盖/非覆盖每个观测点是否至少属于一个类聚类结果分层/非分层是否存在一个类是另一个类的子集聚类结果确定(硬)/模糊一个观测点最多属于一类,还是以隶属度向量归属多类变量类型数值型/分类型/混合型聚类变量的数据类型聚类原理分割/层次/密度/网格分割(K-means)、层次(系统聚类)等本章重点:K-means(覆盖型数值分割聚类)与系统聚类(覆盖型数值分层聚类)。Part5.2K-means聚类5.2.1K-means对“亲疏”程度的测度样本视为p维空间上的点,距离越小越“亲密”距离定义要点欧氏距离p个变量值之差的平方和开平方(最常用)切比雪夫距离p个变量值绝对差的最大值绝对距离p个变量值绝对差的总和闵可夫斯基距离绝对差k次方总和的k次方根,k可指定夹角余弦距离从整体结构相似性角度测度,值越大结构越相似“亲疏”程度也可从相似程度(简单/等级相关系数)角度测度;K-means处理的变量均为数值型变量。5.2.1K-means聚类过程反复迭代:分配→更新中心→直至收敛步骤1指定聚类数目k:兼顾聚类效果与实际需要,过大过小都失去意义步骤2确定k个初始类中心:经验选择法/随机选择法/最小最大法步骤3最近原则聚类:每个观测点分配到距离最近的类中心步骤4重新确定类中心:以各类观测点变量均值作为新中心步骤5判断终止:达最大迭代次数,或中心最大偏移量小于指定值;否则回步骤3图5-2K-means聚类过程5.2.1聚类前应排除的影响因素距离是K-means的基础,两个因素必须提前处理①数量级差异变量量纲差异将主导距离计算。例:贷款金额以“元”为单位时客户距离完全失真,换算为“十万元”后结果改变。对策:聚类前先标准化(Z分数)。②强线性相关若聚类变量间存在较强线性相关、可相互替代,计算距离时这些信息会被重复计入,扭曲聚类结果。对策:剔除冗余变量或先做因子分析降维。观测点对情况1(元)情况2(十万元)(1,2)265000027.51(1,3)416000042.36(2,3)151000021.57表5-2贷款客户欧氏距离矩阵:计量单位改变,距离结论随之改变5.2.2K-means聚类的SPSS实现先标准化,再聚类:分析→分类→K-均值聚类步骤1-2打开“移动通信客户数据.sav”;【描述】中勾选“将标准化值另存为变量(Z)”步骤3【分析】>【分类】>【K-均值聚类】;选入6个标准化变量,聚类数填5步骤4迭代【迭代】中将最大迭代次数改为50步骤5保存勾选【聚类成员】和【与聚类中心的距离】步骤6选项缺失值选择【成列排除个案】步骤7单击【确定】完成K-means聚类菜单路径:【分析(A)】→【分类(F)】→【K-均值聚类】5.2.2SPSS对话框设置标准化、迭代、保存、选项四个关键设置图5-3“描述”对话框(存Z分数)图5-5“迭代”对话框图5-6“保存新变量”对话框图5-7“选项”对话框5.2.2结果解读:最终聚类中心与类别命名5类客户特征分明,据中心值完成业务命名变量(Z分数)类1高端商务类2低端少用类3中端商务类4中端日常类5长聊客户工作日上班3.22-1.162.650.201.93工作日下班-0.65-1.27-1.033.87-0.17周末3.723.11-0.02-0.91-1.21国际通话4.91-1.170.292.770.53总通话时长2.96-1.312.071.471.64平均每次时长-0.520.315.49-0.2313.00个案数443123983180676表5-5最终聚类中心|表5-6每个聚类中的个案数目(有效3395,缺失0)迭代35次收敛,初始中心最小距离7.609;数据视图新增QCL_1(所属类)与QCL_2(与类中心距离)两列。Part5.3系统聚类5.3.1系统聚类的基本概念凝聚式层次聚类:每个观测点自成一类,逐步合并为一个大类凝聚聚类过程①每个观测点自成一类;②测度彼此“亲疏”程度,将最“亲密”的两点聚成小类;③重复合并,直至所有样本聚成一类。n个观测点经n−1步凝聚完成。图5-95个观测点的凝聚聚类过程示例系统聚类又称层次聚类,属于覆盖型数值分层聚类:聚类结果具有层次包含关系,每个样本点唯一属于一个类。随着聚类进行,类内的“亲疏”程度逐渐降低。5.3.1小类间“亲疏”程度的测度方法观测点已聚合后,需要定义“点与类、类与类”的距离方法距离定义重心法观测点与小类重心点之间的距离最近邻元素法观测点与小类中所有观测点距离的最小值组间平均联接法观测点与小类(除自身类)中所有观测点距离的平均值组内平均联接法含自身所在类在内的所有相关距离的平均值离差平方和法(Ward)使小类内离差平方和增加最小的两类先合并SPSS默认:组间联接+平方欧氏距离。5.3.2系统聚类的SPSS实现样本量大时先抽样演示:随机抽取15条数据步骤1-2打开“移动通信客户_样本15.sav”;【描述】中勾选“将标准化值另存为变量(Z)”步骤3【分析】>【分类】>【系统聚类(H)】;选入6个标准化变量,“客户编号”放入个案标注依据步骤4图【图(T)】中勾选【谱系图(D)】步骤5方法【方法(M)】中聚类方法默认【组间联接】步骤6单击【确定】完成系统聚类图5-11“系统聚类分析”对话框图5-12“图”对话框5.3.2结果解读:冰柱图从图的最下端开始读:白色间隙切分类别图5-14冰柱图(聚类进程一)图5-16冰柱图(聚类最后一步)图5-17冰柱图(划分为4类)冰柱图横轴为样本名称,纵轴为可划分的类别数。纵坐标14表示15个样本被划为14类;依次合并直至全部聚为一类。若取纵坐标4,3个白色间隙将样本切分为4类——白色间隙即类别分界。5.3.2结果解读:谱系图(树状图)用一把“尺子”从左向右垂直截断,端点数即类别数图5-18谱系图(组间平均联接法)横着生长最左侧为所有个案(根系类),逐步向右合并为枝干类,最终聚为一类顶部横轴数字是各类别的相对距离,按距离比例重新设定读图方法尺子沿横线垂直90°放置,截断的端点个数即该相对距离下的类别数例:分成2类时样本15(K101260)独自成类;带圈竖线间距可初步判断聚类效果。K-means与系统聚类对比大样本快速分群用K-means,小样本探索层次结构用系统聚类对比项K-means聚类系统聚类聚类原理分割式:迭代分配与更新中心分层式:逐步凝聚合并聚类数需预先指定k无需预先指定,由图确定适用样本量大样本、计算要求低小样本、计算量随n²增长结果呈现最终聚类中心表、个案归属冰柱图、谱系图、聚类进度本章案例3395名客户分为5类抽样15名客户演示层次结构两法互补:实际项目中常先用系统聚类探索类别数,再用K-means完成大样本分群。Part5.4应用案例与结论建议5.4应用案例:移动通信客户聚类分析定量客户细分,支撑个性化服务与精准营销背景介绍客户资源是运营商的核心资源。只有充分细致地认识客户、了解客户间差异,才能提供更好的服务,提高满意度与忠诚度,增强市场竞争力。数据说明(表5-9)3395条客户数据,7个变量:客户编号+6个通话行为指标;数值差距较大,标准化后均值均为0、方差均为1。K-means方案按前期调研将客户分为5个群体:标准化→K-均值聚类(k=5)→最终中心命名→个案归属与距离。系统聚类方案随机抽样15条数据演示:标准化→组间联接法→冰柱图/谱系图→讨论聚为几类合适。5.4.4结论:五类客户画像依据最终聚类中心完成业务命名类1高端商务客户443人总通话时间最长,工作日上班时期通话比例高,国际通话多类2使用较少的低端客户1239人各项通话指标全面偏低,数量最多的基本盘类3中端商务客户831人通话量居中偏高,平均每次通话时长突出类4中端日常客户806人工作日下班时期通话比例高,偏生活化使用类5长聊客户76人数量最少,平均每次通话时长极高(Z≈13)5.4.4建议:分群施策针对五类客户设计差异化营销与服务策略高端商务客户VIP专属服务:国际漫游优惠、专属客户经理、优先网络保障,防流失是首位低端少用客户低成本维系:低门槛套餐、唤醒短信、轻量权益,防止沉默流失中端商务客户升档引导:流量/语音升档包、企业融合套餐,向高端迁移中端日常客户场景化营销:夜间/周末定向流量包、家庭套餐与内容权益长聊客户语音关怀:大语音包、畅聊会员,防范携号转网本章小结一图回顾聚类分析知识框架概念类由数据决定:类内相似、类间相异距离度量欧氏/切比雪夫/绝对/闵氏/夹角余弦;先标准化K-means指定k→初始中心→最近分配→更新中心→迭代收敛系统聚类凝聚合并n−1步;冰柱图+谱系图确定类别数聚类的价值不止于“分类”,更在于命名画像与分群施策——让每一类客户都被看懂、被善待。本章习题(节选)检验对核心概念的掌握单选1聚类分析的目的:对样本进行分类单选3初始类中心指定方法不包括“就近选择法”单选5系统聚类不需要指定聚类数目(D说法不正确)判断1聚类变量之间可以有较强线性相关(×,不应有)判断3K-means采用分层实现聚类(×,采用分割原理)判断5聚类变量值不应有数量级上的差异(√)本章实

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

最新文档

评论

0/150

提交评论