中级分析核心试题及答案呈现_第1页
中级分析核心试题及答案呈现_第2页
中级分析核心试题及答案呈现_第3页
中级分析核心试题及答案呈现_第4页
中级分析核心试题及答案呈现_第5页
已阅读5页,还剩3页未读, 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

中级分析核心试题及答案呈现考试时间:______分钟总分:______分姓名:______选择题(每题2分,共20分)1.某电商平台希望评估“新用户注册后首单满减活动”对用户30日留存率的影响,应优先采用的分析方法是()。A.卡方检验B.独立样本t检验C.A/B测试D.线性回归2.在构建用户画像时,若发现“用户年龄”字段存在缺失值,且缺失比例约为15%,最合适的处理方法是()。A.直接删除缺失值B.用均值填充C.用中位数填充D.根据缺失机制选择填充方法或标记3.假设检验中,若P值=0.03,显著性水平α=0.05,应如何做出统计结论?()A.拒绝原假设B.接受原假设C.无法判断D.需要增加样本量4.在时间序列分析中,若数据存在季节性波动,应优先选择的模型是()。A.线性回归B.ARIMAC.逻辑回归D.卡方检验5.数据可视化中,用于展示分类变量与连续变量关系的最佳图表是()。A.直方图B.散点图C.箱线图D.条形图6.在回归分析中,若自变量之间存在高度相关性,可能导致()。A.模型过拟合B.多重共线性C.异方差性D.自相关7.某公司希望预测客户流失概率,应优先采用的模型是()。A.线性回归B.逻辑回归C.决策树D.K-means聚类8.在A/B测试中,为确保结果可靠,样本量应满足()。A.越大越好B.越小越好C.基于统计功效计算D.随机分配即可9.数据清洗中,处理异常值的方法不包括()。A.删除异常值B.用均值替换C.标记异常值D.忽略异常值10.在假设检验中,Ⅰ类错误是指()。A.原假设成立但拒绝B.原假设不成立但接受C.样本量不足D.显著性水平设置过高简答题(每题7.5分,共30分)1.简述假设检验中的“显著性水平(α)”与“P值”的关系,并说明若P值=0.03,α=0.05,应如何做出统计结论?该结论可能存在的风险是什么?2.对比“线性回归”与“逻辑回归”的适用场景及模型输出结果的差异。3.在数据清洗过程中,处理缺失值的主要方法有哪些?请简述其适用场景。4.业务指标体系构建的基本步骤是什么?请举例说明。案例分析(共50分)案例一:电商用户留存分析背景:某电商平台近3个月用户数据如下:总用户数10万,其中新用户(注册≤30天)3万,老用户(注册>30天)7万;新用户30日留存率40%,老用户月均复购率25%。业务目标:提升新用户30日留存率至50%。数据字段:用户ID、注册时间、近30日登录次数、近30日购买次数、客单价、所属地区、渠道来源(APP/小程序/官网)。要求:1.若数据中存在“登录次数”为负值的异常值,请说明处理步骤及理由。2.分析影响新用户留存率的关键因素(至少3个),并选择合适的方法验证。3.基于分析结果,提出3条可落地的业务建议,并说明预期效果。案例二:零售销售预测背景:某零售连锁企业希望预测未来3个月各门店的销售额,用于库存管理和人员排班。历史数据包含:门店ID、销售额、日期、气温、节假日、促销活动(是/否)、周边竞品数量(个)。要求:1.若销售额数据存在“节假日异常峰值”,如何处理以提升模型预测准确性?2.选择合适的预测模型,并说明选择理由。3.评估模型效果的指标有哪些?若模型预测值与实际值偏差较大,可能的原因是什么?试卷答案选择题:1.C解析:评估活动对留存率的影响需验证因果关系,A/B测试是通过随机分组控制变量、验证因果关系的标准方法;卡方检验用于分析分类变量相关性,t检验用于分析连续变量组间差异,线性回归用于预测,均无法直接验证因果关系。2.D解析:缺失值处理需先判断机制:若随机缺失(MCAR/MAR),可用均值/中位数/模型填充;若非随机缺失(MNAR),需标记缺失特征或删除。直接删除可能损失样本信息,盲目填充可能引入偏差(如“年龄”缺失可能与用户隐私相关,非随机缺失)。3.A解析:P值=0.03<α=0.05,拒绝原假设,认为结果在统计上显著(即“新活动对留存率有影响”)。风险:可能犯Ⅰ类错误(弃真错误),即原假设实际成立(活动无影响),但错误拒绝的概率为5%。4.B解析:ARIMA模型可处理含季节性和趋势的时间序列数据;线性回归不考虑时间序列特性,逻辑回归用于分类问题,卡方检验用于分析分类变量相关性。5.C解析:箱线图能直观展示不同分类组下连续变量的分布差异(如各地区用户的客单价分布);直方图用于单变量分布,散点图用于双连续变量关系,条形图用于分类变量频数统计。6.B解析:自变量高度相关性导致多重共线性,使回归系数不稳定、标准误增大;过拟合与模型复杂度有关,异方差性是残差方差非恒定,自相关是时间序列残差相关性。7.B解析:逻辑回归输出概率值(如流失概率),适合分类问题;线性回归用于连续预测,决策树和聚类也可用于分类,但逻辑回归更直接且可解释性强。8.C解析:样本量需基于统计功效(效应量、显著性水平、功效)计算,确保能检测到真实效应;过大浪费资源,过小无法保证结果可靠性。9.D解析:忽略异常值可能导致模型偏差或结果失真;删除(少量异常)、替换(如用中位数)、标记(作为独立特征)是常用方法,但忽略不可取。10.A解析:Ⅰ类错误是“原假设成立但错误拒绝”(如实际无差异却认为有差异);Ⅱ类错误是“原假设不成立但错误接受”,样本量不足和显著性水平过高均可能增加错误风险。简答题:1.答案:-关系:显著性水平(α)是研究者设定的“拒绝原假设的阈值”(如0.05),表示“原假设成立时错误拒绝的概率上限”;P值是“在原假设成立条件下,当前样本或更极端样本出现的概率”。P值越小,说明原假设越不成立。-结论:P值=0.03<α=0.05,拒绝原假设,认为结果统计显著。-风险:可能犯Ⅰ类错误(弃真错误),即原假设实际成立,但错误拒绝的概率为5%。2.答案:-适用场景:线性回归因变量为连续变量(如销售额、温度),逻辑回归因变量为分类变量(如是否流失、是否购买)。-输出结果:线性回归输出“连续预测值”(如预测销售额1000元),逻辑回归输出“概率值”(如P(流失)=0.3),需通过Sigmoid函数转换。3.答案:-删除:缺失比例高且随机(如>50%),或缺失与目标变量无关,避免引入偏差。-填充:均值/中位数(连续变量,随机缺失);众数(分类变量,随机缺失);模型预测(如用回归模型填充,适用于非随机缺失)。-标记:将缺失作为独立特征(如“是否缺失”),适用于非随机缺失,保留缺失信息。4.答案:-步骤:①明确业务目标(如提升用户留存);②拆解核心指标(如留存率=登录用户数/注册用户数);③设置层级指标(如登录用户数=自然登录+活动引导登录);④确定指标权重和监控周期。-举例:电商GMV拆解为访客数×转化率×客单价,再拆解访客数为自然访客、付费访客等子指标。案例分析:案例一:1.答案:-步骤:①识别(用箱线图/IQR法则定位负值异常);②核查(回溯数据源,确认是否系统错误或录入错误);③处理(修正正确值或标记为“异常”特征)。-理由:负登录次数不符合业务逻辑,直接删除损失样本,盲目填充(如用0)掩盖数据问题,需根据原因针对性处理。2.答案:-关键因素:登录次数、渠道来源、首次客单价。-验证方法:登录次数(逻辑回归,检验系数显著性);渠道来源(卡方检验,分析“渠道”与“留存”的独立性);首次客单价(t检验,比较留存与未留存用户差异)。3.答案:-建议1:针对“近30日登录≤1次”用户,推送个性化Push+优惠券,目标留存率从30%提升至45%。-建议2:优化“低留存渠道”(如自然搜索)的新用户引导,简化注册步骤,目标留存率提升10%。-建议3:针对“首次客单价<50元”用户,推出“第二单立减20元”活动,目标复购率从20%提升至35%。案例二:1.答案:-处理:标记节假日为“特殊事件”,引入“节假日哑变量”(如0/1变量);或对峰值数据平滑处理(如移动平均)。-理由:避免异常峰值干扰模型捕捉趋势和季节性,哑变量可量化节假日影响。2.答案:-模型:SARIMAX(含外部变量)或Prophet(可处理节假日和季节性)。-理由:数据含趋势、季节性和外部变量(气温、促销),需

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论