2025年大数据挖掘(关联规则挖掘)试题及答案_第1页
2025年大数据挖掘(关联规则挖掘)试题及答案_第2页
2025年大数据挖掘(关联规则挖掘)试题及答案_第3页
2025年大数据挖掘(关联规则挖掘)试题及答案_第4页
2025年大数据挖掘(关联规则挖掘)试题及答案_第5页
已阅读5页,还剩1页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

2025年大数据挖掘(关联规则挖掘)试题及答案

(考试时间:90分钟满分100分)班级______姓名______第I卷(选择题,共30分)答题要求:每题只有一个正确答案,请将正确答案的序号填在括号内。1.以下关于频繁项集的说法,正确的是()A.频繁项集的支持度一定大于最小支持度阈值B.频繁项集的元素个数一定大于1C.频繁项集一定是闭项集D.频繁项集的子集一定是频繁项集2.关联规则挖掘中,提升度的计算公式是()A.支持度(A∪B)/支持度(A)×支持度(B)B.支持度(A∩B)/支持度(A)×支持度(B)C.置信度(A→B)/支持度(A)D.置信度(A→B)/支持度(B)3.以下哪种算法是经典的关联规则挖掘算法()A.K-Means算法B.Apriori算法C.决策树算法D.神经网络算法4.在关联规则挖掘中,最小支持度阈值设置过高,可能会导致()A.发现过多的关联规则B.发现的关联规则过于琐碎C.遗漏重要的关联规则D.计算效率降低5.对于项集{牛奶,面包,尿布},其支持度计数表示()A.同时购买牛奶、面包和尿布的顾客数量B.购买牛奶或面包或尿布的顾客数量C.购买牛奶且购买面包但不购买尿布的顾客数量D.购买牛奶的顾客数量加上购买面包的顾客数量加上购买尿布的顾客数量6.关联规则A→B的置信度表示()A.同时购买A和B的概率B.购买A的顾客中购买B的概率C.购买B的顾客中购买A的概率D.购买A或B的概率第II卷(非选择题,共70分)二、填空题(每题4分,共20分)1.关联规则挖掘的主要步骤包括数据预处理、______、规则生成与评估。2.频繁项集的性质包括反单调性、______和______。3.计算项集{苹果,香蕉}的支持度,需要统计______的数量。4.提升度大于1表示规则A→B是______。5.剪枝步是Apriori算法中的重要步骤,目的是减少______的数量。三、简答题(每题10分,共20分)1.简述Apriori算法的基本原理。2.说明关联规则挖掘中支持度、置信度和提升度的含义及作用。四、材料分析题(每题15分,共30分)材料:某超市记录了顾客的购物清单数据,经过整理得到以下部分数据:顾客1:牛奶,面包,鸡蛋顾客2:面包,尿布,啤酒顾客3:牛奶,尿布,啤酒顾客4:鸡蛋,面包,尿布顾客5:牛奶,鸡蛋,啤酒1.设最小支持度阈值为30%,请找出所有的频繁项集。2.根据频繁项集生成关联规则,并计算其置信度和提升度,分析哪些规则是有价值的。五、综合应用题(20分)假设你负责分析一个电商平台的用户购买数据,目标是挖掘出有价值的关联规则,以帮助优化商品推荐策略。请描述你将采取的步骤,包括数据预处理、关联规则挖掘算法的选择及原因、规则评估指标的确定等。答案:第I卷答案1.A2.A3.B4.C5.A6.B第II卷答案1.频繁项集挖掘2.单调性、向下封闭性3.同时购买苹果和香蕉的顾客4.有意义的规则5.候选频繁项集三、简答题答案1.Apriori算法基于频繁项集的性质,通过逐层搜索的方式生成频繁项集。首先生成候选1项集,扫描数据集计算支持度,筛选出频繁1项集;然后由频繁1项集生成候选2项集,再次扫描数据集计算支持度,得到频繁2项集,以此类推,直到无法生成新的频繁项集。2.支持度表示项集在数据集中出现的频率,反映了项集的普遍程度;置信度表示在购买了前提项集的情况下,购买结论项集的概率,衡量规则的可靠性;提升度表示规则的实际效果与期望效果的比值,大于1表示规则有价值,可用于指导决策。四、材料分析题答案1.项集{牛奶}:支持度为4/5=80%;项集{面包}:支持度为4/5=80%;项集{尿布}:支持度为4/5=80%;项集{啤酒}:支持度为3/5=60%;项集{鸡蛋}:支持度为3/5=60%;项集{牛奶,面包}:支持度为3/5=60%;项集{牛奶,尿布}:支持度为3/5=60%;项集{面包,尿布}:支持度为3/5=60%;项集{尿布,啤酒}:支持度为3/5=60%;项集{牛奶,鸡蛋}:支持度为2/5=40%;项集{面包,鸡蛋}:支持度为2/5=40%;项集{鸡蛋,啤酒}:支持度为2/5=40%;项集{牛奶,面包,尿布}:支持度为3/5=60%;项集{面包,尿布,啤酒}:支持度为3/5=60%。频繁项集有{牛奶}、{面包}、{尿布}、{啤酒}、{鸡蛋}、{牛奶,面包}、{牛奶,尿布}、{面包,尿布}、{尿布,啤酒}、{牛奶,面包,尿布}、{面包,尿布,啤酒}。2.关联规则:牛奶→面包,置信度为3/4=75%,提升度为75%/(80%×80%)≈1.17;牛奶→尿布,置信度为3/4=75%,提升度为75%/(80%×80%)≈1.17;面包→尿布,置信度为3/4=75%,提升度为75%/(80%×80%)≈1.17;尿布→啤酒,置信度为3/4=75%,提升度为75%/(80%×60%)≈1.56。有价值的规则如尿布→啤酒,提升度大于1,说明购买尿布的顾客购买啤酒的可能性比随机情况高,可用于商品推荐。五、综合应用题答案步骤:首先进行数据预处理,包括清洗数据,去除重复记录、缺失值等;对商品名称进行标准化处理。选择Aprio

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论