数据仓库与数据挖掘-北京理工大学中国大学mooc课后章节答案期末考试题库2023年_第1页
数据仓库与数据挖掘-北京理工大学中国大学mooc课后章节答案期末考试题库2023年_第2页
数据仓库与数据挖掘-北京理工大学中国大学mooc课后章节答案期末考试题库2023年_第3页
数据仓库与数据挖掘-北京理工大学中国大学mooc课后章节答案期末考试题库2023年_第4页
数据仓库与数据挖掘-北京理工大学中国大学mooc课后章节答案期末考试题库2023年_第5页
已阅读5页,还剩20页未读 继续免费阅读

付费下载

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

数据仓库与数据挖掘.北京理工大学中国大学mooc课后章节答案期末

考试题库2023年

1.假设属性income的最大最小值分别是12000元和98000元。利用最大最

小规范化的方法将属性的值映射到0至1的范围内。对属性income的

73600元将被转化为:()

参考答案:

0.716

2.数据的可视化是将数据以各种图表的形式展现在用户的面前,使用户能观察

数据,并在较高的层次上找出数据间可能的关系。

参考答案:

正确

3.数据挖掘和可视化都是知识提取的方式。

参考答案:

正确

4.面向应用场景的可视化交互式数据挖掘方法是以数据挖掘算法和模型为主,

并不针对具体应用场景或数据类型

参考答案:

错误

5.将原始数据进行集成、变换、维度规约、数值规约是以下哪个步骤的任务?

()

参考答案:

数据预处理

6.数据仓库的数据ETL过程中,ETL软件的主要功能包括()

参考答案:

数据抽取一数据加载一数据转换

7.数据挖掘的主要任务是从数据中发现潜在规则,从而能更好的完成描述数据、

预测数据的任务。

参考答案:

正确

8.传统数据仓库包拓数据仓库数据库、数据抽取/转换/加载、元数据、访问工

具、数据集市、和信息发布系统七个部分组成。

参考答案:

数据仓誓管理

9.关联规则挖掘过程是发现满足最小支持度的所有项集代表的规则。

参考答案:

错误

10.假定你现在训练了一个线性SVM并推断出这个模型出现了欠拟合现象。在

下一次训练时,应该采取下列什么措施?()

参考答案:

增加特征

11.下面哪一项关于CART的说法是错误的()

参考答案:

CART输出变量只能是离散型。

12.以下哪种方法不是常用的数据约减方法()

参考答案.

关联规而挖掘

13.假设12个销售价格记录组已经排序如下:5,10,11,13,15,35,50,55,72,92,

204,215使用如下每种方法将它们划分成四个箱。等频(等深)划分时,

15在第几个箱子内?()

参考答案:

第二个

14.下表是一个购物篮,假定支持度阈值为40%,其中()是频繁闭项集。TID

项Iabc2abcd3bce4acde5de

参考答案:

abc_de

15.利用Apriori算法计算频繁项集可以有效降低计算频繁集的时间复杂度。在

以下的购物篮中产生支持度不小于3的候选3-项集,在候选2-项集中需要

剪枝的是()ID购买项1面包、牛奶2面包、尿布、啤酒、鸡蛋3牛奶、

尿布、啤酒、可乐4面包、牛奶、尿布、啤酒5面包、牛奶、尿布、可乐

参考答案:

啤酒、面包.啤酒、牛奶

16.一个数据集的分布的五数概括由最小值、第一个四分位数、、第三个

四分位数、和最大值构成。

参考答案:

中位数

17.以下哪项关于决策树的说法是错误的

参考答案:

决策树算法对于噪声的干扰非常敏感

18.数据仓库的生命周期包括.规划分析阶段_、_设计实施阶段_、三个阶段。

参考答案:

使用维护阶段

19.DBSCAN中密度相连关系满足对称性

参考答案:

正确

20.业内主流的数据仓库方法论主要有两种:Kimball和

参考答案:

Inmon

21.数据仓库的数据模型分为概念模型、逻辑模型、三个层次

参考答案:

物理模型

22.数据转换的常用规则有:字段级转换、、多源数据整合和集合和汇总。

参考答案:

清洁和净化

23.元数据的分类标准有:、应用场合、具体内容和具体用途。

参考答案:

领域相关性

24.在决策树中,随着树中结点数变得太大,即使模型的训练误差还在继续减低,

但是检验误差开始增大,这是出现了模型拟合不足的问题。

参考答案:

错误

25.KNN算法是一种典型的消极学习器。

参考答案:

正确

26.FP表示被错误地划分为负例的个数,即实际为正例但被分类器划分为负例

的实例数;

参考答案:

错误

27.KNN算法不仅可以用于分类,还可以用于回归

参考答案:

正确

28.以下哪些算法是基于规则的分类器()

参考答案:

C4

29.以下两种描述分别对应哪两种对分类算法的评价标准?()(a)警察抓小偷,

描述警察抓的人中有多少个是小偷的标准。(b)描述有多少比例的小偷给警

察抓了的标准。

参考答案:

Precision,Recall

30.数据整理的任务主要有:、数据质量评估与清洗、数据规范化、和数据的

融合与摘取。

参考答案:

数据结而化处理

31.通过聚集多个分类器的预测来提高分类准确率的技术称为()

参考答案:

组合(ensemble)

32.数据集的属性可以划分为一和连续型两种。

参考答案:

离散型

33.假定用于分析的数据包含属性age,age值[以递增序)为:13,15,16,

16,19,20,20,21,22,22,25,25,25,25,30,33,33,35,35,

35,35,36,40,45,46,52,70。则数据第三个四分位数的值为一

参考答案:

35

34.假定你现在训练了一个线性SVM并推断出这个模型出现了欠拟合现象。在

下一次训练时,应该采取下列什么措施?

参考答案:

增加特征

35.下面哪一项关于CART的说法是错误的

参考答案:

CART输出变量只能是离散型

36.检测一元正态分布中的离群点,属于异常检测中的基于()的离群点检测。

参考答案:

统计方法

37.下面购物篮能够提取的3-项集的最大数量是多少()ID购买项1牛奶,啤

酒,尿布2面包,黄油,牛奶3牛奶,尿布,饼干4面包,黄油,饼干5

啤酒,饼干,尿布6牛奶,尿布,面包,黄油7面包,黄油,尿布8啤酒,

尿布9牛奶,尿布,面包,黄油10啤酒,饼干

参考答案:

3

38.假设12个销售价格记录组已经排序如下:5,10,11,13,15,35,50,55,72,92,

204,215使用如下每种方法将它们划分成四个箱。等频(等深)划分时,

15在第几个箱子内?()

参考答案:

第二个

39.假定用于分析的数据包含属性age。数据元组中age的值如下(按递增序):

13,15,16,16,19,20,20,21,22,22,25,25,25,30,33,33,

35,35,36,40,45,46,52,70,问题:使用按箱平均值平滑方法对上

述数据进行平滑,箱的深度为3。第二个箱子值为:()

参考答案:

18.3

40.主成分分析法是一种有参的数据约减方法

参考答案:

正确

41.离散属性总是具有有限个值。

参考答案:

错误

42.特征提取技术并不依赖于特定的领域。

参考答案:

错误

43.可以通过创造新的属性并加入到现有属性集中实现更有效的挖掘

参考答案:

正确

44.通过离散化操作可以将连续属性转化为序数属性

参考答案:

正确

45,设X二{1,2,3}是频繁项集,则可由X产生()个关联规则。

参考答案:

46.数据挖掘任务主要包括描述性和__任务

参考答案:

预测性

47.考虑下面的频繁3■项集的集合:{1,2,3},{1,2,4},{1,2,5},{1,3,

4},{1,3,5},{2,3,4},{2,3,5},{3,4,5}假定数据集中只有5个

项,采用合并策略,由候选产生过程得到4.项集不包含()

参考答案:

1,2,4,5

48.以下哪些算法是分类算法

参考答案:

C4.5

49.以下哪项关于决策树的说法是错误的()

参考答案:

决策树算法对于噪声的干扰非常敏感

50.从数据仓库的角度可以将数据挖掘过程划分为、数据集成、数据选择

与变换、数据挖况及知识评估等阶段。

参考答案:

数据清理##%_YZPRLFH_%##数据清洗

51.判断以下行为是否属于数据挖掘任务:监测患者的心率是否异常

参考答案:

正确

52.图是一种数据结阂,其中的节点至少具有一个相邻元素。

参考答案:

错误

53.传统的统计数据可视化方法主要有两种:报表和统计图形。

参考答案:

正确

54.主成分分析法(PCA)是一种有监督的降维方法。

参考答案:

错误

55.一是使用线性或非线性变换把高维数据投影到低维空间。常用的方法有主

成分分析法、线性判别分析、多维定标等。

参考答案:

降维

56.将时间事件流与地图进行融合,反映信息对象随时间进展与空间位置所发生

的行为变化,可以用来表示。

参考答案:

流式地图

57.判断以下行为是否属于数据挖掘任务:根据顾客的购物记录预测顾客感兴趣

的商品

参考答案:

正确

58.基于K-均值的聚类中可以使用肘线图辅助碓定k值

参考答案:

正确

59.聚类中,当对象。的轮廓系数值接近0时,意味着包含。的簇是紧凑的,

并且。远离其他簇

参考答案:

错误

60.聚类中把小簇划分成更小簇比把大簇划分为小簇的危害更大

参考答案:

正确

61.在基本K均值算法里,当邻近度函数采用()的时候,合适的质心是簇中

各点的中位数。

参考答案:

曼哈顿距离

62.局部异常因子计算中,样本p的第k邻域内点到p的平均可达距离的倒数成

为样本p的一

参考答案:

局部可达密度

63.DBSCAN算法时间复杂性0(_)

参考答案:

64.以下()属于无参数的异常检测方法

参考答案:

直方图

65.关联规则挖掘问题可以划分成两个子问题:发现频繁项目集和生成

参考答案:

关联规则

66.大于或等于min-support的非空子集,称为_。

参考答案:

频繁项目集

67.关于K均值和DBSCAN的比较,以下说法不正确的是()。

参考答案:

K均值丢弃被它识别为噪声的对象,而DBSCAN一般聚类所有对象。

68.()将两个簇的邻近度定义为两个簇合并时导致的平方误差的增量,它是一

种凝聚层次聚类技术。

参考答案:

Ward方法

69.()将两个簇的邻近度定义为不同簇的所有点对的平均逐对邻近度,它是

一种凝聚层次聚类技术。

参考答案:

组平均

70.()是一个观测值,它与其他观测值的差凯如此之大,以至于怀疑它是由

不同的机制产生的。

参考答案:

离群点

71.一个数据集的分布的五数概括由最小值、第一个四分位数、、第三个

四分位数、和最大值构成。

参考答案:

中位数

72.定用于分析的数据包含属性age。age值(以递增序)为:13,15,16,16,

19,20,20,21,22,22,25,25,25,25,30,33,33,35,35,35,

35,36,40,45,46,52,70。则数据的第一个四分位数的值为一,第三

个四分位数的值为35

参考答案:

20

73.考虑值集{12243324556826},其四分位数极差是:

参考答案:

31

74.数据集的属性可以划分为一和连续型两种。

参考答案:

离散型

75.两个向量dl=(L1,2,1,1,1,0,0,0)d2=(1,1,1,0,1,1,1,1,1)的余弦

相似度为()

参考答案:

[0.8,0.83]

76.使用DBSCAN进行异常点检测时,异常点被定义为的数据对象。

参考答案:

不属于任何簇

77.KNN算法是一种典型的学习器

参考答案:

消极

78.当不知道数据所带标签时,可以使用哪种技术促使带同类标签的数据与带其

他标签的数据相分离?

参考答案:

聚类

79.通过聚集多个分类器的预测来提高分类准确率的技术称为()

参考答案:

集成(ensemble)

80.判断以下行为是否属于数据挖掘任务:预测掷骰子的结果

参考答案:

错误

81.从数据仓库的角度可以将数据挖掘过程划分为数据清理、数据集成、数据选

择与变换、数据挖掘及等阶段。

参考答案:

知识评估

82.异常点类型包括全局异常、上下文异常和

参考答案:

群体异常

83.聚类中不属于任何簇的数据对象可以被认为是

参考答案:

异常点##%_YZPRLFH_%##离群点

84.下面购物篮能够提取的3-项集的最大数量是多少()ID购买项1牛奶,啤

酒,尿布2面包,黄油,牛奶3牛奶,尿布,饼干4面包,黄油,饼干5

啤酒,饼干,尿布6牛奶,尿布,面包,黄油7面包,黄油,尿布8啤酒,

尿布9牛奶,尿布,面包,黄油10啤酒,饼干

参考答案:

3

85.Apriori算法的计算复杂度受()影响。

参考答案:

事务平均宽度_事务数一项数(维度)_支持度阀值

86.非频繁模式()

参考答案:

对异常或据项敏感.其支持度小于阈值

87.某超市研究销售纪录数据后发现,买啤酒的人很大概率也会购买尿布,这种

属于数据挖掘的哪类问题?

参考答案:

关联规而发现

88.以下两种描述分别对应哪两种对分类算法的评价标准?(a)警察抓小偷,描

述警察抓的人中有多少个是小偷的标准。(b)描述有多少比例的小偷给警察

抓了的标准。

参考答案:

Precision,Recall

89.将原始数据进行集成、变换、维度规约、数值规约是在以下哪个步骤的任务?

参考答案:

数据预处理

90.考虑值集{12243324556826},其四分位数极差是:

参考答案:

31

91.C4.5算法采用基于一作为选择分裂属性的度量标准。

参考答案:

信息增益率

92.设X={1,2,3}是频繁项集,则可由X产生个关联规则。

参考答案:

6

93.一所大学内的各年纪人数分别为:一年级200人,二年级160人,三年级

130人,四年级110人。则年级属性的众数是:()

参考答案:

一年级

94.假设属性income的最大最小值分别是12000元和98000元。利用最大最

小规范化的方法将属性的值映射到0至1的范围内。对属性income的

73600元将被转化为:0

参考答案:

0.716

95.CART采用Gini指数来度量分裂时的不纯度。—越大,样本集合的不确定

性程度越高。

参考答案:

gini指数##%_YZPRLFH_%##Gini指数##%_YZPRLFH_%##GINI指数

##%_YZPRLFH_%##基尼指数

96.局部异常因子计算中,样本p的第k邻域内点到p的平均可达距离的倒数成

为样本p的

参考答案:

局部可达密度

97.只有非零值才重要的二元属性被称作:()

参考答案:

非对称而二元属性

98.当不知道数据所带标签时,可以使用哪种技术促使带同类标签的数据与带其

他标签的数据相分离?0

参考答案:

聚类

99.通过数据集成可以维护数据源整体上的数据

参考答案:

一致性

100.样本p的局部异常因子值接近1,说明p与其邻域点密度差不多,p可能和

邻域点属于同一簇。

参考答案:

正确

101.样本p的局部异常因子值接近说明P与其邻域点密度差不多,P可能

和邻域点属于同一簇。

参考答案:

1

102.通过离散化操作可以将连续属性转化为—属性

参考答案:

序数

103.下面不属于数据集特征的是:()

参考答案:

连续性

104.判断以下行为是否属于数据挖掘任务:提取声波的频率

参考答案:

错误

105.局部异常因子计算中,将样本的局部密度与其邻居的局部密度进行比较,被

密度明显低于其邻居的样本被认为是异常点。

参考答案:

正确

106.聚类中不属于任何簇的数据对象可以被认为是异常点

参考答案:

正确

107.使用聚类方法可以有效检测出群体异常

参考答案:

错误

108.在异常检测评价中,召回率比精度更重要

参考答案:

正确

109.异常检测前不需要剔除噪声点

参考答案:

错误

110.样本p的局部异常因子接近1意味样本p为异常点的概率较高

参考答案:

错误

111.属性Hair_color={auburn,black,blond,brown,grey,red,white},该属性属

于()类血

参考答案:

标称

112.age(以递增序)为:13,15,16,16,19,20,20,21,22,22,25,

25,25,25,30,33,33,35,35,35,35,36,40,45,46,52,70。

使用z・score规范化将age值35变换到[0.0,1.0]区间,变换后的值为()

参考答案:

0.4

113.一所大学内的各年纪人数分别

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论