2025年大数据分析考试试卷及答案_第1页
2025年大数据分析考试试卷及答案_第2页
2025年大数据分析考试试卷及答案_第3页
2025年大数据分析考试试卷及答案_第4页
2025年大数据分析考试试卷及答案_第5页
已阅读5页,还剩11页未读 继续免费阅读

付费下载

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

2025年大数据分析考试试卷及答案一、单项选择题(每题2分,共20分)1.以下哪项不是Hadoop生态中用于处理实时流数据的组件?A.ApacheFlinkB.ApacheStormC.ApacheKafkaD.ApacheHBase答案:D(HBase是列式数据库,用于离线存储;Kafka是消息队列,可结合Flink/Storm处理流数据)2.数据倾斜(DataSkew)最可能导致分布式计算中的哪种问题?A.内存溢出(OOM)B.任务执行时间显著不均衡C.数据一致性丢失D.网络传输延迟增加答案:B(数据倾斜指部分分区数据量远大于其他分区,导致对应任务执行缓慢)3.在机器学习中,若模型在训练集上准确率为95%,测试集上准确率为60%,最可能的原因是?A.欠拟合B.过拟合C.数据量不足D.特征选择不当答案:B(训练集效果远好于测试集,典型过拟合表现)4.以下哪种聚类算法需要预先指定聚类数k?A.DBSCANB.层次聚类(Agglomerative)C.KmeansD.谱聚类(SpectralClustering)答案:C(Kmeans必须指定k值;DBSCAN基于密度参数,层次聚类可动态确定)5.特征选择中,互信息(MutualInformation)用于衡量?A.特征与目标变量的线性相关性B.特征与目标变量的非线性依赖关系C.特征之间的多重共线性D.特征的方差大小答案:B(互信息可捕捉任意函数关系,不限于线性)6.Spark中RDD的persist()方法默认存储级别是?A.MEMORY_ONLYB.MEMORY_AND_DISKC.MEMORY_ONLY_SERD.DISK_ONLY答案:A(默认仅内存存储,不序列化)7.在时间序列分析中,ARIMA(p,d,q)模型中的d表示?A.自回归阶数B.差分次数C.移动平均阶数D.季节周期数答案:B(d是使序列平稳所需的差分次数)8.以下哪种数据清洗方法不适用于处理异常值?A.用均值替换B.用上下四分位数范围(IQR)截断C.直接删除异常值记录D.用K近邻(KNN)算法预测替换答案:A(均值易受异常值影响,替换可能引入偏差;IQR截断、删除或KNN更合理)9.计算两个高维稀疏向量的相似度时,最适合的指标是?A.欧氏距离B.余弦相似度C.曼哈顿距离D.汉明距离答案:B(余弦相似度关注方向而非长度,适合稀疏高维向量)10.以下哪项不属于数据湖(DataLake)的典型特征?A.存储原始格式数据B.支持事务性ACID操作C.多类型数据混合存储(结构化/非结构化)D.支持大数据分析与机器学习答案:B(数据湖通常不强调事务支持,数据仓库或湖仓一体才关注ACID)二、填空题(每空1分,共15分)1.数据清洗的主要步骤包括缺失值处理、异常值检测、重复值删除和数据标准化/归一化。2.混淆矩阵中,真正类率(TPR)的计算公式为TP/(TP+FN),假正类率(FPR)的计算公式为FP/(FP+TN)。3.SparkSQL中用于将DataFrame注册为临时视图的方法是createOrReplaceTempView()。4.分布式计算中,MapReduce的Shuffle阶段主要完成数据分区与排序操作,Spark的Shuffle则通过HashPartition或RangePartition实现数据重分布。5.特征工程中,对类别型特征常用的编码方法有独热编码(OneHotEncoding)、标签编码(LabelEncoding)和目标编码(TargetEncoding)。6.梯度下降算法中,每次使用全部样本计算梯度的是批量梯度下降(BatchGD),每次使用单个样本的是随机梯度下降(SGD),折中的是小批量梯度下降(MinibatchGD)。7.时间序列的四大组成部分是趋势(Trend)、季节波动(Seasonality)、循环波动(Cycle)和随机波动(Irregular)。三、简答题(每题8分,共40分)1.简述数据清洗中处理缺失值的常用方法及其适用场景。答案:(1)删除法:包括删除含缺失值的记录(适用于缺失率低,且记录间独立性强)或删除缺失率过高的特征(如缺失率>70%且无业务意义)。(2)填充法:均值/中位数填充(数值型,数据分布较均匀);众数填充(类别型);插值法(时间序列,如线性插值、拉格朗日插值);模型预测填充(如用KNN、回归模型预测缺失值,适用于缺失值与其他特征强相关)。(3)保留缺失值:将缺失作为独立类别(如类别型特征,缺失本身有业务含义,如“未填写”)。2.对比Kmeans算法与DBSCAN算法的核心差异。答案:(1)聚类依据:Kmeans基于距离(如欧氏距离),寻找类内紧凑、类间分离的簇;DBSCAN基于密度,寻找由高密度区域分隔的低密度区域。(2)簇形状:Kmeans适合凸形、球形簇;DBSCAN可发现任意形状簇(如环形、不规则形)。(3)参数敏感性:Kmeans依赖初始质心选择和k值;DBSCAN依赖邻域半径ε和最小点数minPts,对噪声敏感。(4)噪声处理:Kmeans将所有点分配到簇,无噪声点;DBSCAN可识别噪声点(不属于任何簇)。3.说明随机森林(RandomForest)与梯度提升树(GradientBoostingTree,GBDT)的主要区别。答案:(1)集成方式:随机森林是并行集成(Bagging),各树独立训练;GBDT是串行集成(Boosting),每棵树纠正前序树的错误。(2)偏差方差权衡:随机森林通过降低方差提高性能(多棵树取平均);GBDT通过降低偏差提高性能(逐步拟合残差)。(3)过拟合风险:随机森林对过拟合不敏感(树间独立,样本/特征随机);GBDT易过拟合(串行累加,需控制树深度和学习率)。(4)计算效率:随机森林可并行训练,适合大规模数据;GBDT需串行,训练时间较长。4.对比Hive与SparkSQL在大数据处理中的优缺点。答案:(1)计算引擎:Hive基于MapReduce,适合离线批处理,延迟高;SparkSQL基于内存计算(RDD),支持实时/准实时处理,延迟低。(2)数据存储:Hive数据默认存储在HDFS;SparkSQL可对接HDFS、HBase、JDBC等多数据源。(3)适用场景:Hive适合复杂ETL、离线报表;SparkSQL适合交互式查询、流批一体(如结合StructuredStreaming)。(4)生态集成:Hive与Hadoop生态(如HBase、Pig)集成成熟;SparkSQL与MLlib、GraphX集成更紧密,支持机器学习与图计算。5.简述特征工程中“特征缩放”(FeatureScaling)的目的及常用方法。答案:目的:消除特征间量纲差异,避免模型对大数值特征过度敏感(如梯度下降中更新步长受影响),提升模型训练效率和效果(如KNN、SVM、神经网络等对尺度敏感的算法)。常用方法:(1)归一化(MinMaxScaling):将特征缩放到[0,1],公式:(xmin)/(maxmin),适用于分布未知或需要保留原始范围的场景。(2)标准化(ZScoreNormalization):将特征缩放到均值0、标准差1,公式:(xμ)/σ,适用于特征服从正态分布或模型假设数据正态(如线性回归、SVM)。(3)对数变换:对偏态分布特征取对数,使其更接近正态(如收入、用户行为次数)。四、计算题(每题10分,共20分)1.某数据集包含两个类别(正类、负类),特征A的取值为{1,2,3}。已知样本分布如下:|特征A|正类样本数|负类样本数||||||1|8|2||2|4|6||3|3|7|计算特征A的信息增益(假设总样本中正负类比例为15:15)。(提示:信息熵公式H(S)=p+log2(p+)plog2(p))答案:步骤1:计算原始熵H(S)总样本数N=30,正类p+=15/30=0.5,负类p=0.5H(S)=0.5log2(0.5)0.5log2(0.5)=1bit步骤2:计算特征A各取值的条件熵H(S|A)A=1时,样本数n1=10,p+1=8/10=0.8,p1=0.2H(S|A=1)=0.8log2(0.8)0.2log2(0.2)≈0.7219bitA=2时,样本数n2=10,p+2=4/10=0.4,p2=0.6H(S|A=2)=0.4log2(0.4)0.6log2(0.6)≈0.9709bitA=3时,样本数n3=10,p+3=3/10=0.3,p3=0.7H(S|A=3)=0.3log2(0.3)0.7log2(0.7)≈0.8813bit条件熵H(S|A)=(10/30)0.7219+(10/30)0.9709+(10/30)0.8813≈(0.7219+0.9709+0.8813)/3≈0.8580bit步骤3:信息增益IG(A)=H(S)H(S|A)=10.8580=0.142bit2.某二分类模型的预测结果如下(实际正类100个,实际负类200个):真正例(TP)=70假正例(FP)=30假负例(FN)=30真负例(TN)=170计算准确率(Accuracy)、精确率(Precision)、召回率(Recall)和F1分数。答案:准确率=(TP+TN)/(TP+TN+FP+FN)=(70+170)/(70+170+30+30)=240/300=0.8(80%)精确率=TP/(TP+FP)=70/(70+30)=0.7(70%)召回率=TP/(TP+FN)=70/(70+30)=0.7(70%)F1分数=2(精确率召回率)/(精确率+召回率)=2(0.70.7)/(0.7+0.7)=0.7(70%)五、综合题(25分)某电商平台需分析用户复购行为(复购=1,未复购=0),现有用户行为数据包含以下字段:用户ID、年龄、性别、历史购买金额(元)、近30天登录次数、近30天加购商品数、近30天收藏商品数、近1年退货率(退货订单数/总订单数)、目标变量(复购标志)。请设计分析流程,并回答以下问题:(1)数据预处理阶段需要完成哪些关键步骤?(2)如何选择特征并验证其重要性?(3)若选择逻辑回归模型,需注意哪些问题?(4)模型评估时,除准确率外还需关注哪些指标?为什么?答案:(1)数据预处理关键步骤:①缺失值处理:检查各字段缺失率(如年龄缺失可填充均值/中位数;退货率缺失可能因无订单,可填充0或单独标记)。②异常值检测:用IQR法或Zscore识别历史购买金额、登录次数等的异常值(如购买金额为负数,需修正或删除)。③特征转换:类别型特征(性别):独热编码或标签编码(若类别少用独热)。连续型特征(年龄、购买金额):可分箱(如年龄分1825、2635等区间),提升模型鲁棒性。退货率(01):保留原始值或对数变换(若分布偏态)。④数据标准化:逻辑回归等模型需对连续特征标准化(如Zscore),避免量纲影响。⑤划分训练集/测试集:按7:3或8:2划分,分层抽样(保持复购类分布一致)。(2)特征选择与重要性验证:①特征选择方法:统计方法:计算各特征与目标变量的相关系数(如点二列相关系数,适用于连续特征与二分类目标);卡方检验(类别型特征与目标的独立性)。模型方法:使用随机森林的特征重要性(基于基尼系数减少量);逻辑回归的系数绝对值(系数越大,特征越重要)。正则化:L1正则化(Lasso)可自动筛选特征(系数为0的特征剔除)。②验证重要性:通过交叉验证(如5折CV)比较包含/排除某特征后的模型性能变化(如AUC提升是否显著);或使用SHAP值(模型无关的特征重要性解释)。(3)逻辑回归模型需注意的问题:①多重共线性:检查特征间相关性(如近30天加购数与收藏数可能高度相关),可用VIF(方差膨胀因子)检测,若VIF>5需处理(删

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

最新文档

评论

0/150

提交评论