版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
2026年数据挖掘期末考题(附答案)1.下列关于数据挖掘核心目标的描述,最准确的是()A.从海量、不完全、有噪声的模糊数据中,提取隐含在其中的、人们事先不知道但又潜在有用的信息和知识的过程B.数据挖掘等同于数据库中的知识发现(KDD)整个流程C.数据挖掘的核心是对结构化数据做统计描述D.数据挖掘就是大模型训练的前置预处理步骤答案:A解析:KDD是包含数据预处理、数据挖掘、结果评估的完整流程,数据挖掘只是KDD的核心步骤之一,B错误;数据挖掘可处理非结构化、半结构化数据,核心目标是发现未知的潜在知识,不是简单的统计描述,C错误;数据挖掘可独立于大模型训练存在,也可应用于大模型结果分析、业务决策等多个场景,D错误。2.针对百万级交易数据集挖掘频繁项集,下列关于Apriori算法和FP-Growth算法的对比,描述错误的是()A.Apriori算法需要多次扫描数据集,IO开销远大于FP-GrowthB.FP-Growth不需要生成候选频繁项集,避免了候选集生成带来的计算开销C.Apriori算法不支持挖掘闭频繁项集,FP-Growth可以直接输出闭频繁项集D.当数据集稀疏度较高时,FP-Growth的FP树占用内存仍然可能远超预期答案:C解析:Apriori算法可以通过对生成的频繁项集做闭性检验,筛选得到闭频繁项集,并非不支持挖掘,C选项描述错误。3.当前大语言模型应用中,常将用户查询转化为词嵌入(Embedding)后做文本聚类,下列关于聚类算法选择的描述,正确的是()A.已知用户查询需要分为10个兴趣类,K-Means算法比DBSCAN更适合B.Embedding向量维度通常在几百到上千维,层次聚类适合处理十万级以上的该类样本C.需要聚类簇形状为任意凸形时,K-Means比谱聚类表现更优D.对噪声点鲁棒性要求高时,GMM高斯混合模型比DBSCAN更适合答案:A解析:已知聚类簇数时,K-Means实现简单、收敛快,适合该场景,A正确;层次聚类时间复杂度为O(n²),十万级样本计算开销无法承受,B错误;K-Means只能处理凸形簇,谱聚类可以处理任意形状簇,C错误;DBSCAN基于密度聚类,对噪声点鲁棒性远优于GMM,GMM对异常点敏感,D错误。4.下列关于分类模型过拟合现象的描述,哪一项是针对数据层面导致过拟合的原因()A.模型训练时采用了L2正则化且系数设置过大B.训练数据集样本量过小,且采样存在偏差,覆盖不到真实数据分布的全部场景C.决策树算法设置了过大的最大深度限制D.训练时提前停止迭代导致模型未收敛答案:B解析:A选项正则化系数过大是欠拟合原因,且属于模型正则化层面;B选项属于数据层面的过拟合原因,符合要求;C选项最大深度过小才会限制模型复杂度,过大的深度会导致过拟合,且属于模型复杂度层面问题,描述不符合题意;D选项提前停止导致欠拟合,不符合要求。5.电商平台检测羊毛党恶意刷单账号,需要识别行为明显偏离绝大多数用户的异常账号,下列方法中不适合用于该场景离群点检测的是()A.基于统计的一元正态分布检验法B.基于密度的LOF局部离群因子算法C.一类SVM算法D.孤立森林算法答案:A解析:用户行为是多维度特征,不是一元分布,一元正态分布检验仅能处理单变量离群点检测,无法适配多维度的用户行为特征,因此不适合该场景。6.现有关联规则R:A→B,已知support(A)=0.5,support(B)=0.3,support(A∪B)=0.2,那该规则的提升度Lift是()A.0.4/3≈0.13B.4/3≈1.33C.0.2D.0.8答案:B解析:提升度Lift(A→B)=confidence(A→B)/support(B)=(support(A∪B)/support(A))/support(B)=(0.2/0.5)/0.3=0.4/0.3=4/3≈1.33,因此选B。7.下列关于主成分分析PCA和线性判别分析LDA的描述,正确的是()A.PCA是无监督降维,LDA是有监督降维B.PCA降维的目标是使同类样本间距最大,不同类样本间距最小C.降维到k维时,PCA需要计算类内散度矩阵和类间散度矩阵D.LDA最多只能将数据降维到n-1维,其中n是样本量答案:A解析:PCA是无监督降维,不需要样本标签,LDA需要样本标签做有监督降维,A正确;PCA的目标是降维后数据方差最大,B选项描述的是错误反转了LDA的目标,错误;PCA计算协方差矩阵,LDA才需要计算类内、类间散度矩阵,C错误;LDA最多降维到k-1维,k是样本类别数,D错误。8.当前联邦学习框架下的跨机构数据挖掘,下列描述错误的是()A.纵向联邦学习适合不同机构拥有相同用户不同特征的场景B.横向联邦学习适合不同机构拥有不同用户相同特征的场景C.联邦学习可以在不交换原始数据的前提下完成联合模型训练,符合数据隐私合规要求D.联邦挖掘得到的模型性能一定低于集中式训练得到的模型答案:D解析:当各方数据分布一致、数据质量较高时,联邦学习得到的模型性能可以接近甚至达到集中式训练的水平,并不是一定更低,D描述错误。9.基于用户的协同过滤推荐算法,在用户冷启动场景下表现最差的原因是()A.新用户没有历史交互行为,无法计算用户相似度B.新用户对推荐结果的点击率过低,无法更新模型C.物品的相似度矩阵没有新物品的信息D.基于模型的协同过滤参数没有更新答案:A解析:基于用户的协同过滤核心是基于用户历史交互计算用户相似度,新用户没有历史交互,无法计算相似度,所以冷启动表现差,A正确;C是物品冷启动的问题,不符合题意。10.针对不平衡数据集的二分类任务,正类为需要识别的少数类(占总样本的2%),负类为多数类,下列评估指标中最适合衡量模型整体泛化性能的是()A.准确率AccuracyB.精确率PrecisionC.召回率RecallD.AUC-PR(精确率-召回率曲线下面积)答案:D解析:准确率会因为多数类占比过高失去参考意义,全猜负类即可得到98%的准确率,无法反映模型对少数正类的识别能力,A错误;精确率仅衡量预测为正类的样本中真实正类的比例,召回率仅衡量真实正类中被识别出来的比例,单一指标无法反映整体性能,B、C错误;AUC-PR对类别不平衡不敏感,能够准确反映模型在少数类上的整体区分能力,因此D正确。1.下列属于无监督数据挖掘任务的是()A.用户消费行为分群B.无标签场景下的恶意交易账号识别C.商品销售价格预测D.文本主题模型LDA训练E.点击通过率预测答案:ABD解析:价格预测和点击通过率预测都是有监督的回归/分类任务,C、E错误;A用户分群是聚类任务,属于无监督,B无标签离群点检测属于无监督挖掘任务,DLDA主题模型是无监督文本挖掘方法,因此ABD正确。2.下列措施中,能够有效缓解分类模型过拟合的是()A.增加训练样本量B.增加模型的复杂度C.加入L1/L2正则化D.决策树剪枝E.集成学习中的Bagging方法答案:ACDE解析:增加模型复杂度会加剧过拟合,让模型更容易学习到训练数据中的噪声,B错误;增加训练样本可以让模型学习到更真实的数据分布,正则化限制模型参数复杂度,剪枝降低决策树的复杂度,Bagging通过集成降低模型方差,都是缓解过拟合的常用方法,ACDE正确。3.下列关于Apriori算法中支持度和置信度的描述,正确的是()A.支持度表示项集在数据集中出现的频率B.置信度表示关联规则中,前提项A出现的条件下结论项B出现的概率C.提升度大于1表示A的出现对B的出现有正向促进作用D.最小支持度阈值设置越高,得到的频繁项集数量越多E.有效的关联规则必须同时满足最小支持度和最小置信度要求答案:ABCE解析:最小支持度阈值越高,只有越高频的项集才能满足要求,因此得到的频繁项集数量越少,D错误,ABCE描述正确。4.下列关于集成学习的描述,正确的是()A.Bagging基于bootstrap采样,基学习器之间相互独立,能够降低模型方差B.Boosting是串行训练基学习器,每一轮调整错分样本权重,能够降低模型偏差C.随机森林是Bagging的扩展,基学习器是决策树,同时引入了特征扰动提升模型泛化能力D.XGBoost和LightGBM都是常用的GBDT实现,LightGBM采用了直方图做差加速,训练速度更快E.大模型时代,集成学习已经被完全淘汰,没有应用场景答案:ABCD解析:集成学习在中小规模结构化数据挖掘任务中仍然是性能最优、成本最低的方案之一,并没有被淘汰,E错误,ABCD描述正确。5.2026年数据挖掘应用中,涉及合规性的要求包括下列哪些()A.用户个人数据挖掘需要获得用户授权,符合GDPR、《个人信息保护法》等法规要求B.挖掘敏感数据时需要采用脱敏、隐私计算等技术降低隐私泄露风险C.算法挖掘结果用于公共决策或商业授信等场景时,不能存在针对特定群体的算法歧视D.训练数据的版权不需要审核,直接用公开爬取的数据训练即可E.输出的挖掘结果如果涉及商业秘密,需要做加密处理答案:ABCE解析:公开爬取的数据仍然需要审核版权,未经授权使用他人享有版权的数据训练模型属于侵权行为,违反著作权法相关规定,D错误,ABCE符合当前数据合规要求,正确。简答题1.简述Apriori算法的核心思想和优缺点。答案:Apriori算法的核心思想基于两个基本性质:①任何频繁项集的所有非空子集都是频繁项集;②任何非频繁项集的所有超集都是非频繁项集。算法流程分为两步迭代:第一步连接步,通过k-1项频繁项集连接生成k项候选集;第二步剪枝步,利用上述Apriori性质剪去所有子集包含非频繁项集的候选集,之后扫描数据集计算候选集的支持度,筛选出满足最小支持度的k项频繁集,重复上述过程直到无法生成更长的频繁项集为止。Apriori算法的优点:原理简单,易于实现,对硬件要求低,适合中小规模数据集的关联规则挖掘。缺点:①算法需要多次扫描整个数据集,当数据集规模很大时IO开销非常大,运行效率低;②算法需要生成大量候选频繁项集,候选集的存储和计算带来额外的开销,当最小支持度阈值较低时,候选集数量会呈指数级增长,严重影响运行效率。2.什么是K-Means聚类算法?简述K-Means算法收敛的依据,以及K-Means算法的主要缺点。答案:K-Means是一种划分式聚类算法,目标是将n个样本划分为k个互斥的簇,使得每个样本到其所属簇中心的平方误差和最小。算法流程为:首先随机选取k个样本作为初始簇中心,之后重复迭代两个步骤:①分配步骤:将每个样本分配到距离最近的簇中心对应的簇;②更新步骤:重新计算每个簇的样本均值作为新的簇中心,直到簇中心不再发生明显变化或者达到最大迭代次数停止。K-Means算法收敛的依据是:算法每一次迭代都会降低簇内平方误差和SSE,而SSE存在下界,不可能无限降低,因此算法一定会收敛。K-Means的主要缺点包括:①需要提前指定聚类簇数k,实际应用中k的最优取值很难提前确定;②对初始簇中心敏感,不同的初始中心可能得到差异很大的聚类结果,算法容易陷入局部最优;③只能发现凸形状的簇,对非凸形状的簇聚类效果差;④对噪声点和离群点非常敏感,少数离群点就会导致簇中心计算出现很大偏差;⑤不适合处理规模特别大的数据集,每次迭代都需要计算所有样本到所有簇中心的距离,计算开销随k增大线性升高。3.简述数据挖掘中维度灾难的含义,以及常用的降维方法。答案:维度灾难是指随着数据维度的升高,模型计算复杂度呈指数级增长,同时高维空间中数据变得极度稀疏,样本之间的距离趋同,导致模型的泛化性能下降的现象。具体来说,高维情况下,样本量相对于维度来说严重不足,容易引发过拟合;高维数据存储和计算需要更多的内存和计算资源,大幅提升了挖掘成本;高维空间中任意两个样本的距离接近,相似度计算失去意义,导致分类、聚类等任务性能大幅下降。常用的降维方法分为线性降维和非线性降维,线性降维包括:主成分分析PCA、线性判别分析LDA、因子分析等;非线性降维包括:t-SNE、Isomap等距映射、局部线性嵌入LLE、核PCA等,当前大语言模型场景下,也常用自监督预训练得到的低维嵌入作为降维结果,兼顾降维效果和语义信息保留。4.为什么协同过滤算法会出现稀疏性问题?简述常见的解决方法。答案:协同过滤算法核心依赖用户-物品交互矩阵计算相似度,交互矩阵通常维度很高,且绝大多数用户只会和极少数物品产生交互,因此交互矩阵绝大多数元素都是空值,矩阵的稀疏度通常在99%以上,这种特性会导致相似度计算不准确,很多用户或物品因为没有足够的交互无法计算相似度,进而导致推荐效果下降,这就是协同过滤的稀疏性问题。常见的解决方法包括:①利用矩阵分解技术对稀疏交互矩阵做填充,得到低维的用户和物品隐向量,基于隐向量计算相似度,缓解稀疏性;②引入用户的属性信息、物品的内容信息,混合内容推荐和协同过滤,补充交互数据不足的问题;③引入因子分解机、深度学习模型,结合侧信息建模,缓解稀疏性;④对交互矩阵做降维处理,提取低维特征,降低稀疏性的影响;⑤当前大模型时代,可以利用大语言模型生成用户和物品的文本嵌入,作为补充特征加入协同过滤模型,进一步缓解冷启动和稀疏性问题。综合应用题1.给定某超市的5次交易记录,交易记录如下:T1:{面包,牛奶,可乐},T2:{面包,尿布,啤酒,鸡蛋},T3:{牛奶,尿布,啤酒,可乐},T4:{面包,牛奶,尿布,啤酒},T5:{面包,牛奶,尿布,可乐},设置最小支持度计数为3(即最小支持度为3/5=0.6),要求用Apriori算法挖掘所有频繁项集,写出详细过程。答案:首先,Apriori算法第一次扫描数据集,得到1项候选集,计算每个项的支持度计数:面包:出现在T1、T2、T4、T5,支持度计数4;牛奶:出现在T1、T3、T4、T5,支持度计数4;可乐:出现在T1、T3、T5,支持度计数3;尿布:出现在T2、T3、T4、T5,支持度计数4;啤酒:出现在T2、T3、T4,支持度计数3;鸡蛋:出现在T2,支持度计数1。筛选出支持度计数≥3的1项频繁集L1:{面包}(4)、{牛奶}(4)、{可乐}(3)、{尿布}(4)、{啤酒}(3)。第二步,连接L1生成2项候选集C2,候选集包括:{面包,牛奶}、{面包,可乐}、{面包,尿布}、{面包,啤酒}、{牛奶,可乐}、{牛奶,尿布}、{牛奶,啤酒}、{可乐,尿布}、{可乐,啤酒}、{尿布,啤酒}。扫描数据集计算每个候选集的支持度计数:{面包,牛奶}:出现在T1、T4、T5,计数3;{面包,可乐}:出现在T1、T5,计数2<3,不满足;{面包,尿布}:出现在T2、T4、T5,计数3;{面包,啤酒}:出现在T2、T4,计数2<3,不满足;{牛奶,可乐}:出现在T1、T3、T5,计数3;{牛奶,尿布}:出现在T3、T4、T5,计数3;{牛奶,啤酒}:出现在T3、T4,计数2<3,不满足;{可乐,尿布}:出现在T3、T5,计数2<3,不满足;{可乐,啤酒}:出现在T3,计数1<3,不满足;{尿布,啤酒}:出现在T2、T3、T4,计数3。筛选得到2项频繁集L2:{面包,牛奶}(3)、{面包,尿布}(3)、{牛奶,可乐}(3)、{牛奶,尿布}(3)、{尿布,啤酒}(3)。第三步,连接L2生成3项候选集C3,连接规则是两个k-1项频繁项集如果前k-2个项相同,就连接生成k项集。L2是2项集,得到所有候选3项集:连接{面包,牛奶}和{面包,尿布},得到{面包,牛奶,尿布};连接{面包,牛奶}和{牛奶,可乐},得到{面包,牛奶,可乐};连接{面包,牛奶}和{牛奶,尿布},得到{面包,牛奶,尿布}(去重);连接{面包,尿布}和{尿布,啤酒},得到{面包,尿布,啤酒};连接{牛奶,可乐}和{牛奶,尿布},得到{牛奶,可乐,尿布};连接{牛奶,尿布}和{尿布,啤酒},得到{牛奶,尿布,啤酒}。接下来做剪枝,检查所有3项候选集的所有2项子集是否都属于L2:{面包,牛奶,尿布}的2项子集:{面包,牛奶}(L2)、{面包,尿布}(L2)、{牛奶,尿布}(L2),全部满足,保留;{面包,牛奶,可乐}的2项子集:{面包,牛奶}(L2)、{面包,可乐}(∉L2)、{牛奶,可乐}(L2),存在子集不属于L2,剪枝;{面包,尿布,啤酒}的2项子集:{面包,尿布}(L2)、{面包,啤酒}(∉L2)、{尿布,啤酒}(L2),存在子集不属于L2,剪枝;{牛奶,可乐,尿布}的2项子集:{牛奶,可乐}(L2)、{牛奶,尿布}(L2)、{可乐,尿布}(∉L2),存在子集不属于L2,剪枝;{牛奶,尿布,啤酒}的2项子集:{牛奶,尿布}(L2)、{牛奶,啤酒}(∉L2)、{尿布,啤酒}(L2),存在子集不属于L2,剪枝。剪枝后C3只剩下一个候选集{面包,牛奶,尿布},扫描数据集计算支持度计数:{面包,牛奶,尿布}出现在T4、T5,计数2<3,不满足最小支持度要求,因此L3为空集,算法停止。最终得到的所有频繁项集为:1项频繁集{面包}、{牛奶}、{可乐}、{尿布}、{啤酒};2项频繁集{面包,牛奶}、{面包,尿布}、{牛奶,可乐}、{牛奶,尿布}、{尿布,啤酒},没有更长的频繁项集。2.某银行要构建一个信用卡逾期风险识别模型,当前积累的标注数据为:10万条历史用户数据,其中逾期用户(正类)3000条,未逾期用户(负类)97000条,数据包含用户的基本属性、历史消费行为、还款行为共120维特征,请你结合数据挖掘的流程,从数据预处理、模型选择、模型评估三个层面说明该任务的整体解决方案。答案:首先,数据预处理层面:第一步,数据清洗,首先处理缺失值,该数据集是用户行为数据,对于缺失率超过70%的特征直接删除,对于缺失率较低的数值型特征,采用中位数填充,类别型特征采用众数填充,或者单独新增一个“未知”类别,避免丢失缺失本身携带的风险信息;处理异常值,基于箱线法识别数值特征中的离群点,对离群点做截断处理或者对数变换,避免极端异常值影响模型训练;第二步,特征工程,首先做特征编码,对类别型特征做独热编码或者目标编码,对于高基数类别特征采用目标编码避免维度爆炸;然后做特征选择,首先去掉方差接近0的恒定特征,去掉皮尔逊相关性大于0.9的冗余特征,之后可以用卡方检验、互信息或者树模型的特征重要性排序,筛选出
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 广东省深圳市盐田高级中学2025-2026学年高一下学期7月期末考试生物试卷(含答案)
- 思维训练老师岗位教学考试试卷及答案
- 寓言与童话整本书阅读综合测评试题及答案
- 《全民阅读促进条例》知识竞赛试题及答案
- 餐具及厨具制作工岗前班组安全考核试卷含答案
- 复合超硬材料制造工安全管理能力考核试卷含答案
- 地层测试工班组管理模拟考核试卷含答案
- 纺粘针刺非织造布制作工基础理论能力考核试卷含答案
- 高压试验工安全生产知识考核试卷含答案
- 2026年生物检测实验室(cnas)安全培训试题及答案
- 学堂在线 工程伦理2.0 章节测试答案
- 网络传播法规(自考14339)复习题库(含答案)
- 测量部安全管理制度
- 广东肇庆市怀集县(2020-2024年)事业单位招聘工作人员笔试真题及入职考生经验(A类综合知识)
- 项目式学习实施心得体会
- 2024年卫生部手术分级目录四级手术部分
- 临床护理教学管理规范
- DB22T 2200-2014 社区脑卒中高危人群筛查与防治规范
- 门店协议合同范例
- 汽油发动机电控燃油喷射系统认识与检修
- 《人体损伤致残程度分级》
评论
0/150
提交评论