2026年数据仓库与数据挖掘题库(含答案)_第1页
2026年数据仓库与数据挖掘题库(含答案)_第2页
2026年数据仓库与数据挖掘题库(含答案)_第3页
2026年数据仓库与数据挖掘题库(含答案)_第4页
2026年数据仓库与数据挖掘题库(含答案)_第5页
已阅读5页,还剩5页未读 继续免费阅读

付费下载

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

2026年数据仓库与数据挖掘题库(含答案)一、单项选择题(每题2分,共20分)1.数据仓库的四个基本特征不包括()A.面向主题B.集成性C.实时性D.时变性答案C2.在数据仓库体系结构中,负责数据抽取、转换、加载的组件通常称为()A.OLAP服务器B.ETL工具C.数据挖掘工具D.报表工具答案B3.下列属于OLAP基本操作的是()A.上卷B.选择C.投影D.连接答案A4.在星型模型中,事实表与维度表之间通过()关联。A.事实表主键与维度表外键B.事实表外键与维度表主键C.事实表外键与维度表外键D.事实表主键与维度表主键答案B5.下列数据挖掘任务中,属于无监督学习的是()A.分类B.回归C.聚类D.决策树答案C6.ID3决策树算法使用的特征选择指标是()A.基尼指数B.信息增益C.信息增益率D.卡方检验答案B7.Apriori算法中,若一个项集是非频繁的,则它的所有超集也一定是非频繁的,该性质称为()A.先验性质B.拉普拉斯平滑C.马尔可夫性质D.贝叶斯定理答案A8.K-means算法中,更新簇中心的常用方法是()A.计算簇内样本的均值B.计算簇内样本的中位数C.随机选择簇内样本D.计算簇内样本的众数答案A9.下列数据预处理操作中,属于数据变换的是()A.处理缺失值B.去除噪声C.数据规范化D.纠正不一致数据答案C10.CRISP-DM模型的第一步是()A.数据准备B.建模C.业务理解D.评估答案C二、多项选择题(每题3分,共15分)1.以下属于数据仓库基本特征的有()A.面向主题B.集成性C.稳定性D.随时间变化答案ABCD解析数据仓库的四大基本特征是面向主题、集成性、稳定性和随时间变化性。2.下列属于数据清洗操作的有()A.处理缺失值B.去除噪声数据C.数据规范化D.纠正不一致数据答案ABD解析数据规范化属于数据变换,不是数据清洗操作。3.下列属于有监督学习算法的是()A.决策树B.朴素贝叶斯C.K-meansD.支持向量机答案ABD解析K-means是无监督聚类算法,决策树、朴素贝叶斯和支持向量机均属于有监督学习。4.下列关于Apriori算法的描述,正确的有()A.频繁项集的所有非空子集必为频繁项集B.非频繁项集的超集必为非频繁项集C.需要多次扫描事务数据库D.使用逐层搜索的迭代方式产生候选集答案ABCD解析A、B是Apriori先验性质的核心内容,C、D是Apriori算法的基本过程。5.维度建模中常见的数据模型包括()A.星型模式B.雪花模式C.星座模式D.网状模式答案ABC解析维度建模的常见模式包括星型模式、雪花模式和星座模式;网状模式属于传统数据库数据模型。三、填空题(每空1分,共15分)1.数据仓库的四大特征是__、、、__。答案面向主题;集成性;稳定性(非易失性);随时间变化性2.ID3算法基于__选择划分属性,C4.5算法基于__选择划分属性。答案信息增益;信息增益率3.关联规则X⇒Y的支持度公式为supp答案σ(X4.K-means算法需要预先指定__,常用的距离度量是__。答案簇个数k;欧氏距离5.ETL是指__、、__三个环节。答案抽取(Extract);转换(Transform);加载(Load)6.OLAP的基本操作包括上卷、下钻、__和__。答案切片(切块);旋转(透视)四、判断题(每题1分,共10分)1.数据仓库中的数据是易失的,会随业务操作实时更新。答案错误2.维度表通常包含描述性的文本属性,事实表通常包含数值型度量。答案正确3.OLTP系统主要用于决策分析,OLAP系统主要用于日常事务处理。答案错误4.关联规则的置信度可以解释为在前件出现的条件下,后件出现的条件概率。答案正确5.ID3算法可以直接处理连续型属性。答案错误6.K-means算法对初始聚类中心不敏感,多次运行结果一定相同。答案错误7.最小-最大规范化属于数据清洗操作。答案错误8.支持向量机是一种基于统计学习理论的监督分类算法。答案正确9.在星型模型中,事实表的主键通常由各维度表的外键组合而成。答案正确10.聚类分析属于无监督学习,训练数据不需要类别标号。答案正确五、简答题(每题5分,共20分)1.简述数据仓库与操作型数据库的主要区别。答案(1)面向主题vs面向应用;(2)数据集成vs数据分散;(3)数据稳定(非易失)vs数据频繁更新;(4)保存历史数据vs保存当前数据;(5)主要用于决策分析vs主要用于日常事务处理。2.简述CRISP-DM数据挖掘过程模型包含的主要阶段。答案业务理解、数据理解、数据准备、建模、评估、部署。3.简述Apriori算法的先验性质及其在剪枝中的应用。答案先验性质是指频繁项集的所有非空子集一定是频繁的;反之,若一个项集是非频繁的,则它的所有超集也一定是非频繁的。在由频繁k-项集连接生成候选(k+14.简述K-means算法的基本步骤。答案(1)选择k个初始聚类中心;(2)计算每个样本到各聚类中心的距离,并将其分配到距离最近的簇;(3)重新计算每个簇的均值,作为新的聚类中心;(4)重复步骤(2)(3),直到聚类中心不再变化或达到最大迭代次数。六、综合题(每题10分,共20分)1.给定如下事务数据库:TID项集1A,B,D2A,B,C,D3B,D4B,C,D5A,C,D设最小支持度min_(1)计算频繁1-项集和频繁2-项集。(2)计算规则A⇒D和答案(1)事务总数N=5,最小支持度计数为5×60%=3。各1-项集支持度计数:A:3,B:4,C:3,D:5,均不小于3,因此频繁1-项集为{(2)规则A⇒sc置信度100%≥80规则D⇒sc置信度80%≥802.下表是某天气与打球的小型训练数据集:天气温度湿度风力打球晴热高弱否晴热高强否阴热高弱是雨温正常弱是雨冷正常强否阴冷正常强是晴温高弱否雨温正常弱是(1)计算根节点的信息熵。(2)分别计算属性“天气”“温度”“湿度”“风力”的信息增益。(3)选择哪个属性作为决策树根节点?答案(1)样本总数N=H(2)属性“天气”:-晴:3个样本,打球全为“否”,熵为0;-阴:2个样本,打球全为“是”,熵为0;-雨:3个样本,打球“是”2个、“否”1个,熵约为0.918。G属性“温度”:-热:3个样本,打球“是”1个、“否”2个,熵约为0.918;-温:3个样本,打球“是”2个、“否”1个,熵约为0.918;-冷:2个样本,打球“是”1个、“否”1个,熵为1。G属性“湿度”:-高:4

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论