2025年数据科学与大数据技术专业考试题及答案_第1页
2025年数据科学与大数据技术专业考试题及答案_第2页
2025年数据科学与大数据技术专业考试题及答案_第3页
2025年数据科学与大数据技术专业考试题及答案_第4页
2025年数据科学与大数据技术专业考试题及答案_第5页
已阅读5页,还剩12页未读 继续免费阅读

付费下载

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

2025年数据科学与大数据技术专业考试题及答案一、单项选择题(每题2分,共20分)1.以下关于数据湖(DataLake)与数据仓库(DataWarehouse)的描述中,错误的是()。A.数据湖存储原始数据(RawData),数据仓库存储经过清洗、结构化的数据B.数据湖支持多类型数据(结构化、半结构化、非结构化),数据仓库以结构化数据为主C.数据湖的典型应用场景是实时分析,数据仓库更适合历史报表D.数据湖通常使用对象存储(如S3、HDFS),数据仓库多使用关系型数据库2.在特征工程中,对“用户年龄”字段(取值范围1-120)进行分箱处理时,若采用等频分箱(分5箱),则每个箱内样本数占比约为()。A.10%B.20%C.25%D.30%3.某分布式系统中,主节点故障后,通过Raft协议重新选举领导者时,关键步骤不包括()。A.候选节点发起投票请求(RequestVote)B.所有节点进入跟随者(Follower)状态C.节点根据日志完整性和任期号(Term)投票D.当候选节点获得多数票时成为新领导者4.对于不平衡数据集(正类占比5%),以下评价指标中最不适用的是()。A.准确率(Accuracy)B.F1值C.ROC-AUCD.召回率(Recall)5.以下Hadoop生态组件与功能对应错误的是()。A.HBase——分布式列式存储数据库B.Hive——基于Hadoop的分布式数据仓库工具(提供类SQL查询)C.Flume——分布式日志收集、聚合、传输系统D.ZooKeeper——分布式计算框架(替代MapReduce)6.假设某分类模型的混淆矩阵如下(行:真实类,列:预测类):```[[180,20],[30,70]]```则模型的精确率(Precision)为()。A.70%B.78%C.81.8%D.85%7.在Spark中,以下操作属于宽依赖(WideDependency)的是()。A.map()B.filter()C.groupByKey()D.flatMap()8.关于时间序列预测,以下说法错误的是()。A.ARIMA模型要求序列平稳,而LSTM可以直接处理非平稳序列B.滑动窗口(SlidingWindow)是将时间序列转换为监督学习问题的常用方法C.季节性分解(STL)可分离序列中的趋势项、季节项和残差项D.均方根误差(RMSE)比平均绝对误差(MAE)对异常值更敏感9.在联邦学习(FederatedLearning)中,核心目标是()。A.在不共享原始数据的前提下联合训练模型B.提高模型在跨设备场景下的泛化能力C.减少模型训练的计算资源消耗D.解决数据孤岛问题,同时保护隐私10.某数据集的特征X服从正态分布N(μ=5,σ²=4),则P(X≤7)的值约为()(已知Φ(1)=0.8413,Φ(0.5)=0.6915)。A.0.6915B.0.8413C.0.9772D.0.9332二、填空题(每空2分,共20分)1.数据清洗中处理缺失值的常用方法包括删除记录、插补(如均值/中位数插补)、______(如使用KNN模型预测缺失值)。2.机器学习中,L1正则化(Lasso)的作用是______,L2正则化(Ridge)的作用是______。3.分布式文件系统HDFS的默认块大小是______,其设计目的是减少______开销。4.在决策树中,信息增益的计算基于______,基尼系数(GiniIndex)衡量的是______。5.实时流处理框架Flink的时间类型包括事件时间(EventTime)、摄入时间(IngestionTime)和______。6.假设某文本的词袋模型(BagofWords)表示为向量[3,0,2,5],则该文本的词频-逆文档频率(TF-IDF)中,“逆文档频率(IDF)”反映的是______。三、简答题(每题8分,共32分)1.简述数据清洗的主要步骤,并举例说明每一步的具体操作。2.比较K-means聚类与层次聚类(HierarchicalClustering)的优缺点及适用场景。3.解释Spark中RDD(弹性分布式数据集)的容错机制,并说明其与HadoopMapReduce容错机制的差异。4.什么是过拟合(Overfitting)?列举至少3种防止过拟合的方法,并简要说明其原理。四、计算题(每题10分,共20分)1.某电商平台用户购买行为数据集包含以下特征:年龄(连续型)、性别(男/女)、月收入(连续型)、过去30天购买次数(离散型)、是否复购(目标变量,0/1)。现需构建逻辑回归模型预测用户复购概率。(1)对“性别”字段进行编码,应采用何种方法?并写出编码后的形式(假设原始数据中有“男”“女”两类)。(2)对“年龄”字段进行标准化处理(Z-score标准化),假设年龄均值为35,标准差为10,某用户年龄为45岁,计算其标准化后的值。2.某分类任务中,使用朴素贝叶斯分类器(假设特征条件独立),训练集如下:|特征1(X1)|特征2(X2)|类别(Y)||||--||高|是|正类||高|否|正类||低|是|负类||低|否|负类||高|否|正类||低|是|负类|(1)计算先验概率P(Y=正类)和P(Y=负类)。(2)对于测试样本(X1=高,X2=是),计算P(Y=正类|X1=高,X2=是)和P(Y=负类|X1=高,X2=是),并判断其类别。五、综合题(8分)某银行需构建一个“客户流失预测”的大数据分析系统,要求覆盖数据采集、存储、处理、模型训练及结果应用全流程。请设计该系统的技术方案,需包括以下内容:(1)数据来源与采集方式;(2)大数据存储架构(需说明使用的存储技术及原因);(3)数据处理与特征工程步骤;(4)模型选择与评估指标;(5)结果应用场景(至少2个)。答案及解析一、单项选择题1.C解析:数据湖的典型场景是支持探索性分析、机器学习等,数据仓库更适合历史报表和确定性查询;实时分析通常由流处理系统(如Flink)支持。2.B解析:等频分箱要求每个箱内样本数量相等,分5箱则每箱占比20%。3.B解析:Raft选举中,故障后主节点失效,其他节点可能变为候选者(Candidate)并发起投票,而非所有节点进入跟随者状态。4.A解析:准确率在不平衡数据中会因多数类主导而虚高(如95%样本为负类时,全预测负类准确率95%,但无实际意义)。5.D解析:ZooKeeper是分布式协调服务,用于管理集群状态;分布式计算框架是MapReduce、Spark等。6.C解析:精确率=TP/(TP+FP)=70/(20+70)=70/90≈77.78%(接近选项B,但实际计算应为70/(20+70)=7/9≈77.78%,可能题目选项有误,正确应为约78%,选B)。注:原题混淆矩阵中,第一行是真实负类(假设),第二行是真实正类。若真实正类为第二行,则TP=70(真实正类预测正类),FP=20(真实负类预测正类),精确率=70/(70+20)=70/90≈77.78%,选B。7.C解析:宽依赖涉及shuffle操作(如groupByKey需跨分区聚合),map、filter、flatMap是窄依赖(每个分区只依赖父RDD的少量分区)。8.A解析:LSTM通过门控机制捕捉长期依赖,但仍需对非平稳序列进行差分等预处理(如转换为平稳序列)。9.D解析:联邦学习的核心是在数据不出域的前提下联合训练模型,同时保护隐私,解决数据孤岛问题。10.B解析:X~N(5,4),则Z=(7-5)/2=1,P(X≤7)=Φ(1)=0.8413。二、填空题1.模型插补2.特征选择(稀疏化);防止过拟合(参数平滑)3.128MB;寻址(或元数据操作)4.信息熵的减少量;数据的不纯度(或分类错误概率)5.处理时间(ProcessingTime)6.词的普遍重要性(或词在多少文档中出现过,出现越少IDF越高)三、简答题1.数据清洗主要步骤及示例:(1)缺失值处理:检查各字段缺失率,如用户“收入”字段缺失率5%,可采用中位数插补(因收入可能右偏,均值易受异常值影响);若某条记录90%字段缺失,直接删除。(2)异常值检测:通过箱线图(IQR方法)检测“年龄”字段,如某用户年龄为150岁,标记为异常,可修正为合理值(如根据上下文推断)或删除。(3)重复值处理:使用Pandas的drop_duplicates()函数删除“用户ID”“订单时间”完全相同的重复记录。(4)格式标准化:将“手机号”字段统一为11位数字格式(如删除空格、区号前缀)。(5)不一致值处理:将“省份”字段中的“北京”“北京市”统一为“北京市”。2.K-means与层次聚类对比:-优点:K-means计算效率高(时间复杂度O(nkI),n样本数,k簇数,I迭代次数),适合大规模数据;层次聚类无需预设簇数,可展示簇间层次结构(树状图)。-缺点:K-means需预设k值,对初始中心敏感,不适合非凸形状簇;层次聚类时间复杂度O(n²),难以处理大样本。-适用场景:K-means用于用户分群(如电商用户分层);层次聚类用于小样本的生物学分类(如基因序列聚类)。3.SparkRDD容错机制:RDD通过记录血缘关系(Lineage)实现容错,即保存RDD的生成路径(如父RDD、转换操作),当某分区数据丢失时,通过重算父RDD的对应分区恢复数据。HadoopMapReduce容错机制:通过持久化中间结果(如Map阶段输出写入磁盘)实现容错,任务失败时需重新执行整个Map或Reduce任务。差异:RDD的血缘机制避免了中间结果持久化,减少I/O开销;MapReduce依赖磁盘存储,容错成本更高。4.过拟合:模型在训练集上表现很好,但在新数据(测试集)上表现差,原因是模型过度学习了训练数据中的噪声和细节。防止方法:(1)正则化:在损失函数中添加L1/L2正则项,约束模型复杂度(如L2正则通过惩罚大的参数值,使模型更平滑)。(2)早停(EarlyStopping):在验证集性能不再提升时停止训练,避免模型过拟合训练数据。(3)数据增强:对训练数据进行变换(如图像旋转、加噪声),增加数据多样性,使模型学习更鲁棒的特征。(4)dropout(神经网络):随机失活部分神经元,强制模型学习冗余特征,减少对特定神经元的依赖。四、计算题1.(1)性别为类别型变量(二分类),应采用独热编码(One-HotEncoding)。编码后,“男”表示为[1,0],“女”表示为[0,1](或虚拟变量编码,删除一列避免多重共线性,如只保留“性别=男”,0表示女,1表示男)。(2)Z-score标准化公式:Z=(X-μ)/σ=(45-35)/10=1.0。2.(1)训练集共6条样本,正类3条(第1、2、5行),负类3条(第3、4、6行)。先验概率:P(Y=正类)=3/6=0.5;P(Y=负类)=3/6=0.5。(2)计算条件概率(拉普拉斯平滑,假设无则加1):对于Y=正类:P(X1=高|Y=正类)=(正类中X1=高的样本数+1)/(正类样本数+特征1的可能取值数)=(2+1)/(3+2)=3/5=0.6(特征1可能取值为“高”“低”,共2类);P(X2=是|Y=正类)=(正类中X2=是的样本数+1)/(正类样本数+特征2的可能取值数)=(1+1)/(3+2)=2/5=0.4(特征2可能取值为“是”“否”,共2类)。对于Y=负类:P(X1=高|Y=负类)=(负类中X1=高的样本数+1)/(负类样本数+2)=(0+1)/(3+2)=1/5=0.2;P(X2=是|Y=负类)=(负类中X2=是的样本数+1)/(负类样本数+2)=(2+1)/(3+2)=3/5=0.6(负类中X2=是的样本为第3、6行,共2条)。根据贝叶斯定理:P(Y=正类|X1=高,X2=是)∝P(Y=正类)×P(X1=高|Y=正类)×P(X2=是|Y=正类)=0.5×0.6×0.4=0.12;P(Y=负类|X1=高,X2=是)∝P(Y=负类)×P(X1=高|Y=负类)×P(X2=是|Y=负类)=0.5×0.2×0.6=0.06。归一化后,正类概率=0.12/(0.12+0.06)=2/3≈0.667,负类概率=1/3≈0.333,因此测试样本预测为正类。五、综合题(示例)1.数据来源与采集方式:-来源:银行核心系统(如客户基本信息、账户交易记录)、APP日志(用户登录、页面浏览、操作行为)、外部数据(如央行征信、运营商用户画像)。-采集方式:核心系统数据通过ETL工具(如Sqoop)定时抽取至大数据平台;APP日志通过Flume实时采集并发送至Kafka消息队列;外部数据通过API接口或文件(CSV/Parquet)批量导入。2.存储架构:-原始数据层(ODS):使用HDFS存储原始日志、交易明细(支持海量非结构化/半结构化数据);Kafka作为实时数据缓冲区(保留7天日志,供流处理消费)。-明细数据层(DWD):清洗后的结构化数据存储于HBase(列式存储,支持高频读/写,如用

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

最新文档

评论

0/150

提交评论