版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
2026年高职大数据技术(数据挖掘基础)试题及答案1.单项选择题(每题1分,共20分)1.1在CRISP-DM方法论中,用于将模型结果转化为业务解决方案的阶段是A.数据理解 B.数据准备 C.建模 D.部署答案:D1.2下列距离度量中,对异常值最敏感的是A.曼哈顿距离 B.欧氏距离 C.切比雪夫距离 D.余弦相似度答案:B1.3在Apriori算法中,若最小支持度阈值为3%,则下列哪一项会被直接剪枝A.支持度2.8%的2-项集 B.支持度3.1%的1-项集 C.置信度90%的规则 D.提升度1.2的规则答案:A1.4使用K-Means对包含1000条二维样本的数据集进行聚类,若初始质心落在同一位置,则算法第一次迭代后A.质心保持不变 B.所有样本被分到同一簇 C.目标函数值无穷大 D.算法自动重新初始化答案:B1.5在ID3算法中,信息增益最大的分裂属性对应A.信息熵最大 B.信息熵最小 C.条件熵最小 D.基尼系数最大答案:C1.6下列关于随机森林的说法正确的是A.每棵树使用相同的随机种子 B.每棵树必须剪枝到最大深度 C.特征子集大小通常取√p(p为总特征数) D.投票阶段采用加权平均答案:C1.7在SparkMLlib中,用于将类别特征转换为数值索引的转换器是A.StandardScaler B.Tokenizer C.StringIndexer D.PCA答案:C1.8若某分类模型在测试集上的混淆矩阵为[[90,10],[5,95]],则其宏平均召回率为A.0.90 B.0.925 C.0.95 D.0.975答案:B1.9在PCA降维中,主成分方差贡献率递减的根本原因是A.特征值按降序排列 B.特征向量正交 C.协方差矩阵对称 D.数据中心化答案:A1.10下列评估指标中,对类别不平衡最不敏感的是A.准确率 B.宏平均F1 C.AUC-ROC D.微平均F1答案:C1.11在关联规则挖掘中,已知规则{X,Y}→{Z}的置信度为80%,则A.支持度(X,Y,Z)≥支持度(X,Y) B.支持度(X,Y,Z)=支持度(X,Y)0.8 C.支持度(X,Y,Z)≤支持度(X,Y) D.支持度(X,Y,Z)=支持度(Z)0.8A.支持度(X,Y,Z)≥支持度(X,Y) B.支持度(X,Y,Z)=支持度(X,Y)0.8 C.支持度(X,Y,Z)≤支持度(X,Y) D.支持度(X,Y,Z)=支持度(Z)0.8答案:C1.12使用梯度提升树时,减小学习率的主要作用是A.降低训练时间 B.减少过拟合 C.提高可解释性 D.增加特征重要性答案:B1.13在HDFS中,默认块大小为128MB,若上传一个257MB的文件,则实际占用块数A.2 B.3 C.4 D.5答案:B1.14下列关于L1正则化的描述正确的是A.可产生稀疏解 B.等价于岭回归 C.不可用于神经网络 D.对异常值不敏感答案:A1.15DBSCAN算法中,若MinPts=5,某点核心条件为ε邻域内点数≥5,则边界点A.邻域内点数≥5 B.邻域内点数<5但落在核心点邻域 C.邻域内点数=0 D.无法确定答案:B1.16在Spark中,RDD的懒执行特性是指A.任务立即调度 B.转换操作构建DAG C.缓存自动失效 D.分区数固定答案:B1.17若某时间序列采用移动平均法平滑,窗口宽度为5,则输出序列长度比原始序列A.减少4 B.减少2 C.不变 D.增加4答案:B1.18在文本挖掘中,TF-IDF公式IDF(t)=ln(N/df(t)),当df(t)=N时,IDF值为A.0 B.1 C.e D.ln(N)答案:A1.19下列关于HBase的描述错误的是A.面向列存储 B.强一致性 C.支持SQL全文索引 D.基于HDFS答案:C1.20使用MapReduce实现WordCount时,Reducer输入键类型为A.Text,IntWritable B.Text,Text C.IntWritable,Text D.LongWritable,Text答案:A2.多项选择题(每题2分,共20分;每题至少有两个正确答案,多选少选均不得分)2.1下列属于监督学习算法的有A.C4.5 B.K-Means C.SVM D.Apriori E.LogisticRegression答案:ACE2.2关于集成学习,下列说法正确的有A.Bagging可降低方差 B.Boosting可降低偏差 C.随机森林属于Boosting D.AdaBoost对误分类样本增加权重 E.Stacking使用异构基学习器答案:ABDE2.3下列操作可用于处理缺失值的有A.均值填充 B.前向填充 C.删除含缺失行 D.使用LightGBM内置缺失处理 E.独热编码答案:ABCD2.4在SparkSQL中,下列函数可用于窗口分析的有A.row_number B.lag C.concat_ws D.rank E.percent_rank答案:ABDE2.5下列属于Hadoop生态组件的有A.Hive B.Pig C.Flume D.ZooKeeper E.Kafka答案:ABCD2.6下列关于卷积神经网络的说法正确的有A.池化层可降低参数量 B.卷积核权重共享 C.ReLU常用于激活 D.全连接层一定位于网络末端 E.Dropout可防止过拟合答案:ABCE2.7下列可用于时间序列预测的模型有A.ARIMA B.LSTM C.Prophet D.XGBoost E.DBSCAN答案:ABCD2.8下列属于NoSQL数据库的有A.MongoDB B.Redis C.HBase D.Oracle E.Neo4j答案:ABCE2.9在模型评估中,绘制ROC曲线所需数据有A.真正率 B.假正率 C.精确率 D.阈值 E.AUC值答案:ABD2.10下列关于数据仓库的描述正确的有A.面向主题 B.集成性 C.实时更新 D.非易失性 E.支持OLAP答案:ABDE3.填空题(每空1分,共20分)3.1在朴素贝叶斯中,若某特征值在训练集中未出现,则采用________估计解决零概率问题。答案:拉普拉斯平滑3.2若某决策树使用基尼系数作为划分标准,则节点基尼系数越小,表示________。答案:纯度越高3.3在SQL中,将两个子查询结果按行合并且不去重,应使用________关键字。答案:UNIONALL3.4在Pythonpandas中,将DataFramedf按列col降序排序并取前10行,代码为________。答案:df.sort_values('col',ascending=False).head(10)3.5在协同过滤中,用户-物品评分矩阵规模10000×5000,稀疏度99%,则非零元素约________个。答案:5000003.6在HDFS中,NameNode的作用是________。答案:管理元数据3.7若某卷积层输入28×28×3,使用10个5×5卷积核,步长1,无填充,则输出特征图尺寸为________。答案:24×24×103.8在Kafka中,保证消息顺序的最小单元是________。答案:分区3.9使用XGBoost时,控制基学习器数量的参数为________。答案:n_estimators3.10在R语言中,将向量x转换为因子类型的函数为________。答案:factor()3.11若某数据集特征矩阵X经标准化后均值为0,方差为1,则新特征向量x′的L2范数为________。答案:√n(n为特征数)3.12在MapReduce中,Shuffle阶段将Mapper输出按键________后传递给Reducer。答案:分区、排序、合并3.13在Elasticsearch中,执行全文检索的查询DSL类型为________。答案:match3.14若某FP-Growth算法最小支持度计数为100,则条件模式基的总出现次数至少为________。答案:1003.15在Python中,使用sklearn.metrics计算宏平均F1的函数为________。答案:f1_score(average='macro')3.16在Hive中,将字符串'2026-06-01'转换为日期类型的函数为________。答案:to_date()3.17在PCA中,第k主成分的方差等于协方差矩阵第________大特征值。答案:k3.18在SparkStreaming中,批次间隔设置为2秒,则每________秒生成一个RDD。答案:23.19在数据挖掘中,将连续变量离散化为等频区间的方法称为________分箱。答案:qcut3.20若某神经网络使用Softmax输出,类别数3,输出向量[1,2,3],则第三类的概率为________。(保留两位小数)答案:0.674.简答题(共6题,每题8分,共48分)4.1(封闭型)简述K-Means++初始化步骤,并说明其相对随机初始化的优势。答案:步骤:1)从数据集中随机选取一个样本作为第一个质心;2)计算每个样本到最近已选质心的距离D(x);3)以概率D(x)²/ΣD(x)²选择下一个质心;4)重复2-3直至选出k个质心;5)运行标准K-Means。优势:降低质心初始位置敏感性,减少迭代次数,提高聚类质量,使目标函数值更优且方差更小。4.2(开放型)某电商公司发现推荐系统离线AUC提升3%,但线上转化率下降5%,请分析可能原因并提出解决思路。答案:原因:1)离线特征与线上分布不一致,如特征延迟、缺失;2)训练数据存在未来信息泄漏;3)推荐结果头部集中,导致用户疲劳;4)冷启动商品占比高,模型泛化差;5)线上排序策略未考虑业务约束(库存、价格)。解决:1)建立实时特征监控,差异报警;2)重新划分训练/验证时间窗口,消除泄漏;3)引入多样性重排,MMR或DPP;4)冷启动通道采用内容/协同混合;5)在排序目标中加入库存惩罚项,多目标优化。4.3(封闭型)写出使用MapReduce实现Top-N频繁项集的伪代码,包括Mapper、Reducer及Combiner。答案:Mapper:输入:(transaction_id,itemset)foriteminitemsetemit(item,1)Combiner:局部聚合:对同一item累加计数emit(item,partial_count)Reducer:全局汇总:对同一item累加所有partial_count维护大小为N的小顶堆,保留计数最大的N个itemcleanup时输出(topN_items,count)4.4(开放型)解释梯度消失与梯度爆炸的产生机理,并列举两种以上深度网络中的缓解技术。答案:机理:反向传播时链式求导导致梯度呈指数级缩小或放大,深层网络连乘小于1或大于1的因子。缓解:1)ReLU、LeakyReLU激活,导数恒1区间;2)BatchNorm将输入归一化,稳定分布;3)残差连接提供恒等路径,梯度直接回传;4)梯度裁剪限制最大范数;5)使用LSTM/GRU门控机制,恒定误差轮盘。4.5(封闭型)给定混淆矩阵,计算宏平均Precision、Recall、F1,并写出公式。矩阵:预测0 1实0 80 20实1 10 90答案:Precision0=80/(80+10)=0.8889 Recall0=80/(80+20)=0.8 F10=20.88890.8/(0.8889+0.8)=0.8421Precision0=80/(80+10)=0.8889 Recall0=80/(80+20)=0.8 F10=20.88890.8/(0.8889+0.8)=0.8421Precision1=90/(90+20)=0.8182 Recall1=90/(90+10)=0.9 F11=20.81820.9/(0.8182+0.9)=0.8571Precision1=90/(90+20)=0.8182 Recall1=90/(90+10)=0.9 F11=20.81820.9/(0.8182+0.9)=0.8571宏平均:P=(0.8889+0.8182)/2=0.8536R=(0.8+0.9)/2=0.85F1=(0.8421+0.8571)/2=0.84964.6(开放型)描述数据倾斜在Hive中的常见表现、产生原因及三种以上优化手段。答案:表现:某个Reducer长时间99%,其余结束;任务卡在最后一个reduce;输出文件大小差异大。原因:分组键分布极不均匀,如大卖家订单占总量80%;空值、热点key;join时一侧表存在超大key。优化:1)两阶段聚合:先随机前缀打散,再全局聚合;2)Map-sidejoin:将小表加载至内存,避免reduce;3)倾斜key单独处理:将热点key过滤后union;4)调整hive.groupby.skewindata=true启用负载均衡;5)使用distributeby+sortby强制重新分区并排序,避免数据集中到单一reducer。5.应用题(共4题,共62分)5.1计算题(15分)某超市一个月共10000笔交易,其中购买牛奶2000次,面包1500次,同时购买牛奶和面包800次。1)计算支持度、置信度、提升度;2)写出关联规则“牛奶→面包”的Lift值并解释业务含义;3)若最小支持度阈值1%,最小置信度阈值60%,该规则是否强规则?答案:1)支持度(Milk)=2000/10000=20%支持度(Bread)=1500/10000=15%支持度(Milk∧Bread)=800/10000=8%置信度(Milk→Bread)=800/2000=40%提升度=0.4/0.15=2.672)Lift=2.67>1,表示牛奶与面包正相关,购买牛奶的顾客购买面包的概率是整体平均的2.67倍,可交叉促销。3)支持度8%>1%,置信度40%<60%,非强规则。5.2分析题(16分)给定鸢尾花数据集150条样本,4个特征,要求使用Python完成以下任务并给出关键代码与结果截图(文字描述即可)。1)标准化后划分训练集70%,测试集30%,随机种子42;2)训练SVM(RBF核,C=1,γ=0.1),输出测试准确率;3)绘制PCA二维投影图,不同类别用不同颜色;4)解释γ=0.1对决策边界的影响。答案:代码:fromsklearnimportdatasets,preprocessing,model_selection,svm,decompositionimportmatplotlib.pyplotaspltiris=datasets.load_iris()X,y=iris.data,iris.targetX=preprocessing.StandardScaler().fit_transform(X)Xtr,Xte,ytr,yte=model_selection.train_test_split(X,y,test_size=0.3,random_state=42)clf=svm.SVC(kernel='rbf',C=1,gamma=0.1)clf.fit(Xtr,ytr)print('Accuracy:',clf.score(Xte,yte)) #输出0.98pca=decomposition.PCA(n_components=2)Xpca=pca.fit_transform(X)plt.scatter(Xpca[:,0],Xpca[:,1],c=y,cmap='viridis')plt.title('PCA2DProjection')plt.show()解释:γ=0.1较小,RBF核半径大,决策边界平滑,偏差略增方差略减,适合鸢尾花这种低维线性可分近似数据,避免过拟合。5.3综合题(16分)某市出租车GPS数据量每日500GB,字段:车牌、时间、经度、纬度、载客状态、速度。需构建实时热点路段识别系统。要求:1)给出技术架构图(文字描述);2)说明数据清洗两项以上规则;3)给出路段划分方法;4)说明实时指标计算窗口及输出格式;5)列举一种可视化方案。答案:1)架构:Flume-Kafka-SparkStreaming-Redis-Elasticsearch-Kibana;Flume采集GPS流,Kafka缓存,SparkStreaming消费,Redis存热点缓存,ES存历史,Kibana展示。2)清洗:速度>200km/h或<0剔除;经纬度超出城市边界剔除;时间字段异常格式过滤;重复上传同一车牌同一秒记录去重。3)路段划分:采用GeoHash精度6编码,或调用OSM路网匹配,将轨迹点绑定最近路段ID。4)窗口:滑动窗口5分钟,步长1分钟;指标:路段载客量、空驶率、平均速度;输出:{road_id,window_end,count,occupancy,avg_speed}。5)可视化:Kibana热力图,颜色深浅表示载客量,时间轴播放,支持路段下钻。5.4设计题(15分)设计一个基于Hive+SparkMLlib的
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 暑假攻克易错点|小学数学方程入门高频丢分题型专项复习
- 一册吃透|小学全科思维导图暑假系统梳理课件
- 七年级体育:实心球投掷动作规范学习与探索
- 暑假基础清零计划|高考语文古诗文鉴赏专项课件
- 年产300套高精密多层复合共挤挤出模具设备更新技改项目可行性研究报告模板立项申批备案
- 沙漠骆驼健康知识宣传
- 科幻与AI的融合之道
- 单位复工报审表
- 自考行政管理全真模拟冲刺密卷含完整答案
- 军队文职管理岗全真模拟测评卷含完整答案
- 2026年有限空间试题和答案
- 招标代理及造价咨询服务方案投标文件(技术标)
- 2026年党员党史知识竞赛试题(附答案)
- 2026年安徽省中考英语试题(含答案)
- 2026河北省新高一入学摸底测试全科高频考点与模拟训练
- 医护护理传染科护理与防控
- 成都银都紫藤2025小升初入学分班考试数学考试试题及答案
- 麻醉复苏期患者术后低氧血症的防治措施
- 2026年北京市海淀区初三下学期一模英语试卷及答案
- 诊所岗位职责及工作制度
- GB/T 33855-2026母婴保健服务机构通用要求
评论
0/150
提交评论