《大数据分析与挖掘》实训教案-1.基于聚类分析(K-means)的快递客户群识别实验指导手册_第1页
《大数据分析与挖掘》实训教案-1.基于聚类分析(K-means)的快递客户群识别实验指导手册_第2页
《大数据分析与挖掘》实训教案-1.基于聚类分析(K-means)的快递客户群识别实验指导手册_第3页
《大数据分析与挖掘》实训教案-1.基于聚类分析(K-means)的快递客户群识别实验指导手册_第4页
《大数据分析与挖掘》实训教案-1.基于聚类分析(K-means)的快递客户群识别实验指导手册_第5页
已阅读5页,还剩12页未读, 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

基于聚类分析(K-Means)的快运客户群识别一、操作环境1.操作系统:windowAll2.软件平台:LogisPMT,python3.4二、业务场景 聚类是将数据集划分为若干相似对象组成的多个组或簇的过程,使得同一组中对象间的相似度最大化,不同组中对象间的相似度最小化。在商业上,聚类分析是细分市场的有效工具,基于消费者行为来区分不同类型的客户群,并刻画不同客户群的特征,以更好地提供个性化服务,提高客户满意度,减少高价值客户的流失。 某国内大型快运企业,服务客户对象主要是国内第三方电商卖家,集快运、快运、仓储服务为一体,主营公路运输业务,覆盖城市多达300多个,细分为同城快运、省内异地快运、省际快运等。该快运企业由于客户关系管理方面失当,所导致业务效率低下,客户投诉率居高不下,营销受阻等一系列问题,尤其是高价值客户的持续流失给企业带来难以估量的损失。希望通过利用聚类分析思想,精准识别特定客户群,提出具体解决方案。

目标:通过对快运客户的历史运单、业务量等数据集,挖掘出对企业产生不同价值的客户群,进而为企业的客户关系差异化服务和营销决策提供支撑。三、数据 快运客户历史交易数据。时间跨度为:2015年7月至2016年1月。每一条记录表征客户在某个月份的业务数据,数据特征包括客户账号—表示快运客户的唯一标识,运单数、业务量、体积、计费重量、收益等数值型业务属性,还包括重货标识、结算方式、是否流失、主要始发站及主要终点站等分类型业务属性。四、操作步骤新建一个工程,如图1所示。图1新建工程1.数据载入 由于本案例涉及数据体量庞大,放置云端便于统一存储管理,用户只需相关组件(节点)即可实现调用。在Data区域中选择Logis云端数据组件,双击打开出现对话框,下拉菜单选择快运企业客户数据选项,如图2所示,数据传输速度受用户当前网速影响。图2获取云端数据原始数据观测及数据清洗在Data区域中选择数据表格组件,并与Logis云端数据组件相连,双击打开,如图3所示:图3原数据观测对话框的左上角数据简要区域展现原始数据的基本信息,包括数据的体量,特征维度以及缺失值比率,有无元变量等信息,对话框的右侧区域展现原始数据的二维列表。原始数据包含41138个实例(记录),18个特征变量,零缺失值,但观测右侧二维数据列表,实际存在少量缺失值(缺失值体量占比极为微小,远未达到对话框显示最小粒度0.1%),为降低缺失值的存在对后期数据建模的影响,对原始数据进行相关清洗工作。在Data区域中选择缺失值处理组件,并与Logis云端数据组件相连,该组件对缺失值的处理包含全局处理以及局部处理两大模块,选择全局处理中的方法选项,算法将对所有的字段实行同一种方法的缺失值处理,选择局部处理中的方法选项,用户可以自定义不同字段的缺失值处理方法。组件中集成的缺失值处理方法包括:1.不作处理;2.按字段所在列平均值/出现频次最高值补全;3.基于简单树方法补全;4.按随机值补全;5移除存在缺失值的实例。本案例中由于缺失值比率极为微小,采用第2种方法进行全部缺失值补全,如图4所示。图4缺失值处理探索性数据分析为了观察该快运企业客户的业务量、运单数以及收益等维度在时间上的变动情况,采用时间序列的手段进行深度探测。原始数据中包含近期合作月份和近期合作日期等两个时间字段,因此为了精准识别某个时间字段,引入时间对象选择组件,该组件位于TimeSeries区域中,将其与缺失值处理组件相连,双击组件打开对话框,在序列特征配置中选择近期合作日期,点击自动应用按钮如图5所示。图5时间对象选择 为了直观展现快运客户在不同时间点上的业务量,运单量及收益等维度上的分布状况,引入序列图组件,该组件位于TimeSeries区域中,将其与时间对象选择组件相连,双击组件打开对话框,点击增加按钮可增加序列图数量,本案例中同时展现业务量、运单数和收益三个维度的分布状况,如图6所示。图6业务量、运单数和收益等三个维度序列图 从以上序列图中可以清晰的发现,该快运企业在收益这个维度上是一个随机的不平稳序列,在局部出现明显的、差异度较大的波峰与波谷,特别在2015年10月18号出现全局最高峰值,达到828922.63元,同时业务量及运单数量也达到全局最高峰值,分别达到10000、200000个单位。有趣的是,业务量及运单数两个维度在其他时间点上多次同时达到了全局最高峰值,但收益差异性却非常大,是什么原因导致快运企业出现这种情况有待更为深入一步探测。 为了从更大的粒度进行观测,比如快运企业月度业务量,月度运单数,月度收益等,引入螺旋图组件,该组件位于TimeSeries区域中,将其与时间对象选择组件相连,双击组件打开对话框,Y轴配置years,径向配置monthsofyear,聚合函数选择sum。三个维度月度分布情况分别如图7,图8,图9所示。图7运单数螺旋图图8业务量螺旋图图8收益螺旋图用户将鼠标光标放置对应区域可观测对应具体数值。 从以上螺旋图可清晰观测,该快运企业在进入2015年7月以上,在三个维度的分布情况皆出现了巨大的增长幅度,2015年4月至6月,月度运单数平均不足300,进入7月份以后,月度运单数量均在2000000以上,月度运单数峰值达到3252251,业务量的峰值达到43417911,月度平均收益上从前三个月份的不足15000升至月度平均收益均超过30000000。这也能从一个侧面上反映该快运企业的业务淡季及旺季分布状况。 客户流失,尤其是高价值客户的流失往往对企业的利润增长造成极大的影响,因此本案例另外一个关注的侧重点是客户流失分布情况。引入列联表组件,该组件位于Prototypes区域,将其与缺失值处理组件相连,双击打开,不妨先关注客户流失在收益站上的分布情况,在出现的对话框行配置中选择收益站,列配置中选择流失情况。由于不同收益站存在流失客户数量上的差异,因此,构造新的特征—客户流失率,并引入特征工程组件,该组件位于Data区域,并与列联表组件相连,双击打开,在出现的对话框中进行变量定义。点击创建按钮,选择连续型字段,并定义字段名称(客户流失率),配置方法为流失/(流失+未流失),并点击发送,如图9所示。(注意:新加的字段要使用英文环境下的括号与符号)图9构造客户流失率特征 引入数据表格组件来观察客户流失率的分布情况,将该组件与特征工程组件相连,双击打开,点击客户流失率字段降序排列,可以观测到客户流失率超过30%的收益站包括:青岛站(87.5%),昆山站(80.3%),滨城站(80%),医药冷链事业站(76.3%),林安站(63.5%),综合物流站(39.7%),郑州站(32%)。图10收益站客户流失率 同理,可进一步观测在创收站维度上客户流失分布情况,客户流失率超过30%的收益站包括:花都站(100%),林安站(88.4%),大山子站(75.9%),汉口北站(73.3%),昆山站(69.4%),广州大客户站(54%)。作为业务管理者,从客户流失率的角度来思考,重点加强站点间的资源整合,降低客户流失率。特征选择及特征工程经过数据清洗及数据后,接下来进行特征选择及特征工程。通过特征选择来减少样本的维度,减少计算的成本,降低时间和空间复杂度,简化训练模型,通过特征工程创建更能刻画原始数据集信息的新特征,使得模型构建精度更为准备。例如,本案例中,体积、计费重量和业务量的相关性很强,建模时可以认为存在冗余性,删除一些相关程度过高的特征简化训练模型。原始数据集中能直接反映快运客户对企业创收能力及业务特点的几个特征维度有运单数、业务量、体积、计费重量和收益等,为了从更为细致的粒度进行观测,构造快运客户单位运单数收益、单位业务量收益、单位体积收益、单位计费重量收益等特征。引入记录选择组件,该组件位于Data区域,并与缺失值处理组件相连,双击打开,点击增加条件,详细配置如图11所示。图11过滤存在零值的相关记录从Data区域中引入特征工程组件,并与记录选择组件相连,构建单位运单数收益、单位业务量收益、单位体积收益、单位计费重量收益等四个新特征变量,详细配置如图12所示。图12特征工程 本案例建模目标为区分不同价值层次客户,包含从客户对企业的创收(即收益)、业务特征双重方面。经过筛选,适用建模特征为:收益、业务量、运单数、单位运单数收益、单位业务量收益、单位体积收益、单位计费重量收益等。在Data区域中引入特征选择组件,并与特征工程组件相连,双击打开,详细配置如图13所示。图13特征选择模型构建本案例采用K-Means聚类算法,K-Means算法是典型的基于欧式距离的聚类算法,采用距离作为相似性的评价指标,即认为两个对象的距离越近,其相似度就越大。该算法认为簇是由距离靠近的对象组成的,因此把得到紧凑且独立的簇作为最终目标。算法过程如下:1)从N个对象随机选取K个对象作为质心;2)对剩余的每个对象测量其到每个质心的距离,并把它归到最近的质心的类;3)重新计算已经得到的各个类的质心;4)迭代2~3步直至新的质心与原质心相等或小于指定阈值,算法结束。K-Means聚类算法能根据较少的已知聚类样本的类别对树进行剪枝确定部分样本的分类;其次,为克服少量样本聚类的不准确性,该算法本身具有优化迭代功能,在已经求得的聚类上再次进行迭代修正剪枝确定部分样本的聚类,优化了初始监督学习样本分类不合理的地方。然而,K-Means算法需要采用初始随机种子点,随机种子点往往太重要,不同的随机种子点会有得到完全不同的结果。因此,引入K-Means++,用来有效的选择初始点。 从Unsupervised区域中引入K-Means聚类组件,配置好参数,并与特征选择组件相连。本案例中假定聚类簇数为4。详细配置如图14所示。图14模型训练待模型训练完毕,为了探测聚类模型的效果(一般而言,我们希望聚类模型组内差异尽可能小,组间差异尽可能大)以及各个类别在不同维度上的分布情况,引入箱线图组件,从Visualize区域中选择boxplot组件,并与K-Means聚类组件相连,双击打开,在Subgroups配置中选择Cluser项,Display配置中选择对比均值,Variable区域中用户可自由切换不同维度进行观测。快运客户在收益、业务量、运单数三个维度上的箱线图分布分别如图15、图16和图17所示。图15快运客户在收益维度上的箱线图分布图16快运客户在业务量维度上的箱线图分布图17快运客户在运单数维度上的箱线图分布 从整体上观测,聚类模型性能大致符合预期。 从以上箱线图中可以观测到,四类快运客户在不同维度上的均值如下表所示。表1客户类别收益业务量运单数单位业务量收益C1180322929821200.8931C2252425582332.1315C32250011000807128424.7115C44699917427834000.2870表2客户类别单位运单数收益单位体积收益单位计费重量收益C143.4241314.65910.6315C215.3756478.23170.9072C3133.39915112.809820.372C448.3212144.14860.2800通过对以上数据整合,获得四类快运客户在不同维度上的排名如下表所示。表3排名收益业务量运单数单位业务量收益1C3C4C3C32C4C3C4C23C1C1C1C14C2C2C2C4表4排名单位运单数收益单位体积收益单位计费重量收益1C3C3C32C4C2C23C1C1C14C2C4C4从聚类以后客户体量来看,C1:2500;C2:38251;C3:97;C4:289。依据上述分析,可以总结如下结论:价值最大的VIP大客户群(C3,占比为0.24%),此类客户给企业带来的收益最大,且在运单数、单位业务量收益、单位运单数收益、单位体积收益、单位计费重量收益等维度上分布都处于最高级别,从客户差异化服务视觉来看,建议设专人一对一跟踪服务的同时,及时了解客户具体需求并及时反馈;必要时可在各网点设立服务专区,让大客户在专区内办理快运手续和进行快运资费结算服务。能够为快运企业带来较高收益的主要客户群(C4,占比为0.70%),此类客户在收益维度上排名第二,均值达到46999元,且在其他维度上均有不俗的表现。消费额一般的潜在客户群(C1,占比为6.08%),此类客户在收益维度上徘徊在18032,具有较大的提升空间,从精准营销的视觉,对于潜在客户,采取积分制,当服务次数达到一定量时,给予价格优惠,加强合作较少流失。且提供多种结算方式,采用季节或预存措施。数量庞大但价值很低的小客户群(C2,占比为92.98%)。 为了观测不同类别客户的流失状况,在箱线图中切换变量至流失情况,如图18所示。图18快运客户流失分布 从上图中可以发现,流失情况最为严重的类别为第3类客户和第2类客户,流失率分别达到了5.15%,4.83%。而C3作为VIP大客户,流失情况如此严重需要管理层深入思考应对策略,高价值客户的流失对企业带来的损失是难以估量的。 此外,用户可以使用分布图可视化的方式来进一步探测聚类结果,分布图组件位于Visualize区域,将其与K-Means聚类组件相连,双击打开,分组配置设置为Cluster,勾选显示相

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论