数据仓库与数据挖掘考试试题附答案_第1页
数据仓库与数据挖掘考试试题附答案_第2页
数据仓库与数据挖掘考试试题附答案_第3页
数据仓库与数据挖掘考试试题附答案_第4页
数据仓库与数据挖掘考试试题附答案_第5页
已阅读5页,还剩9页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

数据仓库与数据挖掘考试试题附答案一、单项选择题(每题2分,共20分)1.数据仓库的核心特性不包括以下哪项?()A.面向主题B.实时更新C.集成性D.时变性2.OLAP(联机分析处理)的典型操作不包括()A.上卷(Roll-up)B.下钻(Drill-down)C.关联(Association)D.切片(Slice)3.以下哪项是数据挖掘的无监督学习任务?()A.分类B.回归C.聚类D.预测4.维度建模中,事实表存储的核心数据是()A.描述性属性B.度量值C.时间戳D.维度键5.ETL过程中,“转换(Transform)”的主要目的是()A.从多个数据源提取原始数据B.清洗、标准化和整合数据C.将数据加载到目标库D.监控数据质量6.关联规则挖掘中,支持度(Support)的计算公式是()A.包含X和Y的事务数/总事务数B.包含X的事务中包含Y的事务数/包含X的事务数C.包含Y的事务中包含X的事务数/包含Y的事务数D.包含X或Y的事务数/总事务数7.决策树算法中,信息增益(InformationGain)用于()A.评估属性的分裂能力B.计算模型的准确率C.确定叶节点的类别D.剪枝操作8.以下哪项不属于数据仓库的分层设计?()A.操作数据存储(ODS)B.数据集市(DataMart)C.原始数据层(RawData)D.数据挖掘层(DM)9.K-means聚类算法的核心步骤是()A.计算样本间的曼哈顿距离B.迭代更新簇中心C.确定最优簇数KD.计算轮廓系数10.离群点检测(OutlierDetection)在数据挖掘中的主要作用是()A.提升模型的泛化能力B.发现数据中的异常模式C.增加数据的多样性D.简化数据维度二、填空题(每空1分,共10分)1.数据仓库的四个基本特征是面向主题、________、非易失性和________。2.OLAP的三种实现方式是________(基于多维数组)、ROLAP(基于关系数据库)和HOLAP(混合模式)。3.数据挖掘的十大经典算法包括C4.5决策树、k-NN、SVM、________(关联规则)和________(聚类)等。4.维度建模中,________模型通过维度表的层级扩展减少冗余,而________模型直接使用单一层级的维度表。5.ETL过程中,转换操作通常包括数据清洗、________、________和数据归约。6.关联规则的两个核心指标是支持度和________,后者用于衡量规则的可靠性。三、简答题(每题6分,共30分)1.简述数据仓库与传统数据库的主要区别。2.ETL过程中可能遇到的关键挑战有哪些?请列举并简要说明。3.维度建模中的星形模型与雪花模型有何差异?各自的适用场景是什么?4.关联规则挖掘的主要步骤包括哪些?请简述每一步的任务。5.分类(Classification)与聚类(Clustering)的本质区别是什么?请从目标、输入数据、方法类型三方面说明。四、应用题(每题10分,共30分)1.某家电零售企业需要构建销售分析数据仓库,现有业务数据包括:销售日期(年/月/日)、门店所在城市(一线/新一线/二线)、产品类别(冰箱/空调/洗衣机)、客户年龄(20-30/30-40/40以上)、销售额(元)、销售数量(台)、利润(元)。(1)请设计该数据仓库的维度模型,列出维度表和事实表的关键字段;(2)绘制星形架构示意图(文字描述即可)。2.某超市的购物篮数据如下(共5条事务):T1:牛奶、面包、鸡蛋T2:牛奶、面包、洗发水T3:面包、鸡蛋、洗发水T4:牛奶、面包T5:牛奶、鸡蛋、洗发水假设最小支持度为40%(2/5),最小置信度为60%。(1)计算规则“牛奶→面包”的支持度和置信度;(2)判断该规则是否为强关联规则,并说明理由。3.某银行客户数据如下表(部分),目标是预测客户是否会申请贷款(类别:是/否)。其中“年龄”分箱为青年(≤30)、中年(31-50)、老年(>50);“收入”分箱为低(≤5000)、中(5001-10000)、高(>10000);“信用评分”分箱为差(≤600)、良(601-700)、优(>700)。客户ID年龄收入信用评分是否贷款1青年低差否2中年中良是3老年高优是4青年中良否5中年高优是6老年低差否7青年高优是8中年中差否(1)计算“年龄”属性的信息增益(假设初始信息熵H(S)=0.954);(2)若仅根据信息增益,判断“年龄”是否为最优分裂属性(需给出计算过程)。五、论述题(每题10分,共20分)1.结合企业实际场景,论述数据仓库如何支持决策分析。要求从数据整合、多维分析、历史对比三个层面展开。2.数据挖掘模型评估需要考虑哪些维度?请结合分类模型和聚类模型,分别说明关键评估指标及意义。参考答案一、单项选择题1.B2.C3.C4.B5.B6.A7.A8.C9.B10.B二、填空题1.集成性;时变性2.MOLAP3.Apriori;k-means4.雪花;星形5.数据转换(或字段计算);数据关联(或维度匹配)6.置信度三、简答题1.主要区别:(1)应用场景:数据库支持OLTP(事务处理),面向日常业务操作;数据仓库支持OLAP(分析处理),面向决策支持。(2)数据特性:数据库存储当前、细节数据,实时更新;数据仓库存储历史、集成数据,批量更新。(3)数据结构:数据库采用规范化设计(避免冗余);数据仓库采用维度建模(支持快速查询)。(4)用户群体:数据库用户为业务操作员;数据仓库用户为管理层、分析师。2.关键挑战:(1)数据异构性:数据源可能来自不同系统(如ERP、CRM),格式、语义不一致,需统一清洗。(2)数据质量问题:存在缺失值、重复值、错误值,需设计清洗规则(如填充、去重、校验)。(3)性能瓶颈:大规模数据抽取和加载可能导致系统延迟,需优化ETL流程(如并行处理、增量更新)。(4)元数据管理:需记录数据来源、转换规则,否则影响后续分析的可追溯性。3.差异与场景:(1)星形模型:事实表直接连接维度表,维度表无层级扩展(如“时间维度”仅包含“日期”字段);优点是查询速度快,适用于业务需求明确、维度层级简单的场景。(2)雪花模型:维度表进一步规范化(如“时间维度”拆分为“年”“季”“月”子表);优点是减少冗余,适用于维度层级复杂、需严格数据一致性的场景。4.主要步骤:(1)数据预处理:清洗、集成购物篮数据,统一事务格式。(2)频繁项集挖掘:通过Apriori等算法,找出支持度≥最小支持度的项集(如频繁2项集)。(3)规则提供:从频繁项集中提取置信度≥最小置信度的规则(如X→Y)。(4)评估与筛选:结合提升度(Lift)等指标,排除冗余或无实际意义的规则。5.本质区别:(1)目标:分类是预测已知类别的标签;聚类是发现数据的内在分组(类别未知)。(2)输入数据:分类需要带标签的训练集;聚类仅需无标签数据。(3)方法类型:分类是监督学习(需训练模型);聚类是无监督学习(无需先验标签)。四、应用题1.(1)维度模型设计:维度表:时间维度:日期ID、年、月、日、季度;地区维度:地区ID、城市等级(一线/新一线/二线);产品维度:产品ID、产品类别(冰箱/空调/洗衣机);客户维度:客户ID、年龄分段(20-30/30-40/40以上)。事实表:销售事实表(日期ID、地区ID、产品ID、客户ID、销售额、销售数量、利润)。(2)星形架构:以销售事实表为中心,通过外键(日期ID、地区ID等)分别连接时间、地区、产品、客户四个维度表,形成星型结构。2.(1)计算支持度和置信度:支持度:包含“牛奶”和“面包”的事务是T1、T2、T4,共3条;支持度=3/5=60%。置信度:包含“牛奶”的事务是T1、T2、T4、T5,共4条;其中包含“面包”的是T1、T2、T4,共3条;置信度=3/4=75%。(2)判断:支持度(60%)≥40%,置信度(75%)≥60%,因此是强关联规则。3.(1)计算信息增益:年龄分为青年、中年、老年三组:青年(客户1、4、7):3条,其中“是”1条(客户7),“否”2条;熵H(青年)=(1/3)log₂(1/3)(2/3)log₂(2/3)≈0.918。中年(客户2、5、8):3条,其中“是”2条(客户2、5),“否”1条;熵H(中年)=(2/3)log₂(2/3)(1/3)log₂(1/3)≈0.918。老年(客户3、6):2条,其中“是”1条(客户3),“否”1条;熵H(老年)=(1/2)log₂(1/2)(1/2)log₂(1/2)=1.0。年龄属性的条件熵H(S|年龄)=(3/8)×0.918+(3/8)×0.918+(2/8)×1.0≈0.933。信息增益Gain(年龄)=H(S)H(S|年龄)=0.9540.933=0.021。(2)判断:需比较其他属性(如收入、信用评分)的信息增益。假设收入的信息增益为0.15,信用评分的信息增益为0.28,则“年龄”的信息增益(0.021)并非最大,因此不是最优分裂属性。五、论述题1.数据仓库支持决策分析的机制:(1)数据整合:通过ETL将分散在ERP、CRM、POS系统中的业务数据清洗、转换,统一存储到数据仓库,解决“数据孤岛”问题。例如,零售企业可整合线上、线下销售数据,形成全局视图。(2)多维分析:基于OLAP技术,支持上卷(按季度汇总月销售额)、下钻(从“华北区”细化到“北京市”)、切片(筛选“2023年Q3”的空调销售数据)等操作,帮助分析师从时间、地区、产品等多维度洞察销售趋势。(3)历史对比:数据仓库存储长期历史数据(如5-10年),支持同比(2023年Q3vs2022年Q3)、环比(2023年Q3vs2023年Q2)分析,识别季节性波动或长期增长模式。例如,通过对比春节前后各品类的销售峰值,优化下一年的库存策略。2.模型评估的多维度考量:(1)分类模型:准确率(Accuracy):正确分类样本数/总样本数,衡量整体正确性;精确率(Precision)与召回率(Recall):分别关注“预测为正的样本中实际为正的比例”和“实际为正的样本中被正确预测的比例”,适用于类别不平衡场景(如欺诈检测);AUC-RO

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

最新文档

评论

0/150

提交评论