考试模拟样题-数据分析应用_第1页
考试模拟样题-数据分析应用_第2页
考试模拟样题-数据分析应用_第3页
已阅读5页,还剩3页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

1、1 (50.0 分)移动公司想结合用户通话行为,推荐相应套餐,或者结合用户现有套餐优化 用户套餐,提供个性化套餐,从而对客户进行精准营销,增加客户粘性。为 此,移动公司收集了下列数据,移动公司收集到的数据包含下列字段:变量名称变量标签Customer ID用户编号Peak mi ns工作日上班时间电话时长OffPeak mi ns工作日下班时间电话时长Weeke nd mins周末电话时长In ternatio nal mi ns国际电话时长Total mi ns总通话时长average m ins平均每次通话时长H移动用户细分聚类data-移动用户细分聚类.xlsx请你根据这些客户数据,进行

2、数据的预处理(数据预处理过程中可以根据现 有变量构造新变量进行分析),预处理之后选择合适变量进行分析, 分析算法自 行选择,写出分析思路和过程,通过数据分析对客户进行细分,将客户分为5类。并为移动公司提供客户精准营销的相关建议。(请写出分析的流程并刻画最后细分之后的客户的特点和相应的营销建议)答案解析:根据题意解读本题可以选用聚类方式对客户进行类别划分,此处采用 Kmea ns聚类进行模型假设。1、对数据进行预处理,数据均为数值型,此项不用处理;检验数据可知没有缺失值,故此项不用处理;将数据导入datehoop平台进行异常值处理可以看到虽然异常值较多但考虑 到可能是特殊人群,故此项不做处理。聚

3、类对变量相关性影响较为敏感,因此将 数据通过datehoop平台进行相关性分析结果如下:Peak nnrftorfPeak_mirisWeekendjnimsInleinaliundljr inslotdljninsaveragejmnisPcak_inins10.1210.144811.2 小0 94150.0 S6 ?Off Peak mins0 12110.0247n.44?50.0(1Q.1440fl .02471ai262-0.1066|lnt?rntiiional minsO2&20.l?S21o.7m-DCJ4Tatal nnins0.94150.4250.2 OQftaziii

4、1aveage miris-O.OJ670.00-C.10G6-0.0 J4-0.03G11从相关矩阵可以看出Peak_mins和Total_mins相关性显著。此处利用比值 法构建新的变量peak_mins/total_mins ,因为变量之间取值范围差异较大,因 此进行聚类时需要进行标准化(datehoop平台可以自动标准化,此处不单独处 理)。2、对变量进行聚类,选择变量 peak_mins/total_mins , offpeak_mins , weekend_mins, international_mins, total_mins , average_mins;根据题目要求,聚类个数

5、选择5,聚类结果如下:一一平均轮廊奈数0J485类中心点坐标00.214324479711-01.300938252730.9002961421754-0.65915626203平均轮廓系数为0.2485,虽然轮廓系数并没有接近 1但也是合理的。在 实际聚类过程中并不是每次聚类都会达到较高的轮廓系数,轮廓系数不高说明 类之间区分性不是特别明显,但并不代表类之间没有区分3、针对聚类结果分析每一类客户在 现有变量上的特征,这里选取平均值作 为参考依据,每一类针对每一个变量的类中心点如下:行标整Peak_insOffPeak_a_insWeekend _ insIntern

6、a t jLonal_insaverage_Bins01826.03340,665G.44541 . S72223.121958 192站gg37.12247.B41162 .3012.90270 5053.4120.6427 49144.742.4 S3877.84470 7056.71300 . 371405.253 .314111?.67175 0756.93293.861351.673 . 090类:工作日通话时长、国际通话时长、总通话时长都最长,周末通话时长 也较长,可以定义为高端商务客户;1类:平均每次通话时长最长,其他通话时长处于中等水平,可以定义为长聊客户;2类:所有通话时长都

7、最低,命名为 不常使用客户;3类:下班班时间通话时长最长,总通话时长和上班时间通话时长较长,可 以命名为中端日常客户;4类:周末通话时长最长,上班时间通话时长仅次于高端商务客户,国际通 话时长和总通话时长都较长,可以命名为中端商务客户;4、根据以上客户细分的结果和特征分析,移动产品开发部门有针对性的开 发设计套餐品类,满足不同类型客户的实际需求,增加客户黏性,提高客户满 意度,最终提高客户的生命周期价值。 对于1类长聊客户,移动公司可以推出相应的畅聊套餐或者开设亲情号以 吸引客户的眼光。(3)对于4类中端商务客户可以推出和高端商务客户相似 的套餐,以吸引顾客的目光。(4)对于2类不常使用客户可

8、以开设包月低价套餐,以增加客户使用率和客 户粘性。2 (50.0 分)通过游戏用户相关行为数据预测用户是否会付费某游戏公司,根据收集的2016年上半年的用户行为数据对用户是否会付费 进行预测,根据预测结果对可能付费用户进行精准营销。该公司一共收集了用户的编号,以及用户的注册时间和最后一次登录时间,以及用户退出时的等级还有用户是否付费等数据。user_ idin stall_ datelast_logi n _datelevel_ endo sis_pa yeractive_ daysavg_sessio n_cnt用户 编号游戏安装 时间最后一次登 录游戏时间用户退 出时的 游戏等 级登 录

9、手 机 系 统是否付费活跃天 数每天登录频 次userdin stall_ datelast_logi n _datelevel_ endosis_pa yeractive_ daysavg_sessio n_cnt字符 型日期型 如: 2015/5/4日期型数值型字符型, 取值 为:An dr oid 和 iOS是否付费1代表 付费,0代表 未付 费数值型数值型数据及数据类型解释游戏数据训练集游戏训练数据.xlsx游戏数据测试集游戏测试数据.xlsx游戏预测数据.xlsx请根据原始数据,对数据进行预处理(包括对类别型变量进行数值化处理、 重新构造新的变量),然后根据原始数据,自行选择变量和分

10、析算法进行分析(数 据提供包含训练数据、测试数据、预测数据、其中测试数据的模型检验结果的计 算提供了相应的excel表格,表名为:测试数据结果计算,只需把测试结果拷贝 到第二类数下面,相应的指标即可计算出来),写出分析过程和思路,并且根据 模型进行预测。答案:1、由题意可知本题是分析用户是否会付费这一问题,可以考虑用逻辑回归建立 模型进行预测。本题中level_end、 os、 active_days 、 avg_session_cnt、duration、为自变量,i is_payer 为因变量2、对数据进行预处理,因为登录手机系统OS为字符型数据,故进行数值化编码如下:osos编码An dr

11、oid1iOS2经检验数据可知无缺失值,故此项不用处理; 数据样本均衡,符合建模要求;异常值分析:将所有变量导入 datahoop平台进行异常值分析,由箱型图可知虽 然存在异常数据,但是考虑到可能是分类所致,故此项不做处理。逻辑回归对多种共线性敏感,因此需要进行共线性分析,将所有变量导入 datahoop平台进行相关系数分析,得到相关系数矩阵如下:相关系数矩阵level_e ndos数值 化active_d aysavg_sessi on_ entdurati onis_pay erlevel e nd10.08350.88860.70530.72790.6825os数值化0.083510.0

12、6280.00440.06840.1237active days0.88860.062810.52810.76720.5323avg_sessi on_ ent0.70530.00440.528110.38060.5184durati on0.72790.06840.76720.380610.4497is payer0.68250.12370.53230.51840.44971由矩阵可以看出变量之间虽然具有相关性,但是相关性不强,可以进行逻辑回归分析。3、设定自变量 level_end、os、active_days 、 avg_session_cnt 、duration 分别为Xi, X2,

13、X3,X4,X5,因变量is payer 为y,假设回归方程In 1-p(y)=aix 1+82X2+ax3+a4X4+ax5+b将训练集和测试集的数据分别导入 datahoop平台,选择相应的自变量和因变量,进行逻辑回归分析(迭代次数1000次)模型结果及检验情况如下:Interceptlevel endosactive daysavg sessian cnduratio n162670.12070975-0.00090.117-0.001GAccuracyAUC0,8720.93PrecisionRecallFl-scoreSupport00.86650.8821207410.878903

14、4210.86011818Accuracy和AUC值,准确率和召回率都比较高,模型拟合效果较好,训练误差 不大。回归方程为 ln ?(y) =0.1207x 1+0.5375X2-0.0009X 3+0.117x4-0.0016x 5-3.62671-p( y)将测试结果和原测试集中的实际分类进行对比,得到如下混淆矩阵和计算出相应 的准确率召回率,结果如下:AccuracyQ. 86671TRUE-Precision RecallFl-scorePredict101010. R4380. 343B0, 8S370. sasr0. 843&0. 333710760由混淆矩阵可知Accuracy和

15、准确率召回率都比较大,模型预测效果较好,泛化 误差不大。可以用该模型进行预测。平台答案解析答案解析:提示:根据题目可以选取聚类方法对客户进行细分,这里选取k-means聚类方法进行分析。k-means聚类要求,纳入的聚类变量一般为数值型变量,而且聚类变量 之间不应该有较强的线性相关关系,如果变量间存在较高的线性关系且能够相互 替代,那么计算距离时,这些变量会对距离重复贡献,一定程度上影响到聚类结 果。对数据进行预处理,数据无缺失值,异常值分析显示异常值较多,结合实际 情况认为有可能是特殊人群,所以在此不作处理。通过查看相关系数矩阵看到 peak_mins和total_mins相关性很高,所以只

16、选取其中一个,然后构造一个新 的变量peak_mins/total_mins ,由于新构造的变量取值与其他变量取值范围相 差较大,因此,在聚类分析时,选择标准化处理之后的数据进行聚类( datahoop 可以在分析时默认进行标准化处理);对数据进行聚类分析,选取变量为:peak_mins/total_mins ,offpeak_mins, weekend_mins, international_mins ,total_mins ,average_mins,聚类个数为 5。平均轮廓系数为0.246左右,虽然轮廓系数并没有接近 1,但也是合理的。 在实际聚类过程中并不是每次聚类都会达到较高的轮廓系

17、数, 轮廓系数不高说明 类之间区分性不是特别明显,但并不代表类之间没有区分。根据聚类结果分析每一类客户在现有变量上的特征,这里选取平均值作为参考依据。对类进行特征分析:1类:总通话时间(Total_mins)最长,上班通话通话时间(Peak_mins)最长, 国际通话(International_mins )最长,命名为高端商用客户;0类:下班通话时间(OffPeak_mins)最长,周末通话时间(Weekend_mins) 最长,上班和国际通话时间居中,命名为中端日常客户;2类:上班通话通话时间(Peak_mins)和国际通话(International_mins)仅次于第1类,周末通话时间

18、(Weekend_mins)居中,总通话时间(Total_mins) 较长,命名为中端商用客户;4类:平均每次通话(average_mins )时长最长,命名为长聊客户;3类:各项通话时间均很低,命名不常使用客户。综上,根据以上客户细分的结果和特征分析,移动产品开发部门有针对性的开发设计套餐品类,满足不同类型客户的实际需求。比如:高端用户推荐各项指 标偏高,套餐费用也偏高的套餐;中端用户和中高端用户可以较高端用户偏低一 点进行套餐推荐,常聊用户可以推荐符合常聊特点的套餐,比如通话次数优惠类套餐,低端用户可以推荐资费便宜的套餐。从而增加客户黏性,提高客户满意度, 最终提高客户的生命周期价值。答案解析:分析不同特点的用户是否会

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论