版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
1、数据仓库与数据挖掘技术复习资料一、单项选择题数据挖掘技术包括三个主要的部分数据、模型、技术C.数据、建模能力、算法与技术关于基本数据的元数据是指:(D(C )算法、技术、领域知识D.建模能力、算法与技术、领域知识)基本元数据与数据源,数据仓库,数据集市和应用程序等结构相关的信息;基本元数据包括与企业相关的管理方面的数据和信息;基本元数据包括日志文件和简历执行处理的时序调度信息;基本元数据包括关于装载和更新处理,分析处理以及管理方面的信息。关于OLAP和OLTP的说法,下列不正确的是:( A)OLAP事务量大,但事务内容比较简单且重复率高OLAP的最终数据来源与OLTP不一样OLTP面对的是决策
2、人员和高层管理人员OLTP以应用为核心,是应用驱动的将原始数据进行集成、变换、维度规约、数值规约是在以下哪个步骤的任务?频繁模式挖掘B.分类和预测下面哪种不属于数据预处理的方法?变量代换B.离散化在ID3算法中信息增益是指(D信息的溢出程度C.熵增加的程度最大以下哪个算法是基于规则的分类器A. C4.5B. KNN以下哪项关于决策树的说法是错误的(A.B.C.D.C.数据预处理D.数据流挖掘(D )C.聚集D.估计遗漏值)信息的增加效益D.熵减少的程度最大A )(C. Bayes D. ANNC )冗余属性不会对决策树的准确率造成不利的影响子树可能在决策树中重复多次决策树算法对于噪声的干扰非常
3、敏感寻找最佳决策树是NP完全问题假设收入属性的最小与最大分别是10000和90000,现在想把当前值30000映射到区间0,1,若采用最大一最小数据规范方法,计算结果是(A )A. 0.25B. 0.375C.0.125 D. 0.5在抽样方法中,当合适的样本容量很难确定时,可以使用的抽样方法是:(D )A.有放回的简单随机抽样分层抽样无放回的简单随机抽样渐进抽样当不知道数据所带标签时,可以使用哪种技术促使带同类标签的数据与带其他标签的数据相分离?( B)A.分类B.聚类 C.关联分析D.隐马尔可夫链设X=1,2, 3是频繁项集,则可由X产生(C)个关联规则。A.4B.5C.6D.7( C )
4、将两个簇的邻近度定义为不同簇的所有点对的平均逐对邻近度,它 是一种凝聚层次聚类技术。A. MIN (单链)B. MAX (全链)。.组平均 D. Ward方法只有非零值才重要的二元属性被称作:(C )A.计数属性B.离散属性非对称的二元属性D.对称属性在基本K均值算法里,当邻近度函数采用(A )的时候,合适的质心是 簇中各点的中位数。A.曼哈顿距离B.平方欧几里德距离C.余弦距离 D.Bregman散度下面关于数据粒度的描述不正确的是:(C )粒度是指数据仓库小数据单元的详细程度和级别数据越详细,粒度就越小,级别也就越高数据综合度越高,粒度也就越大,级别也就越高粒度的具体划分将直接影响数据仓库
5、中的数据量以及查询质量某超市研究销售纪录数据后发现,买啤酒的人很大概率也会购买尿布,这种 属于数据挖掘的哪类问题?(B )D.自然语言处理D.多维分析D.估计遗漏值A.聚类B.关联规则发现C.分类OLAP技术的核心是:(D )A.在线性B.对用户的快速响应C.互操作性下面哪种不属于数据预处理的方法?( D )A.变量代换B.离散化C.聚集假设12个销售价格记录组已经排序如下:5, 10, 11, 13, 15, 35, 50, 55, 72, 92, 204, 215使用如下每种方法将它们划分成四个箱。等深划分时,15在第 几个箱子内? ( B )A.第一个B.第二个C.第三个D.第四个上题中
6、,等宽划分时(宽度为50), 15又在哪个箱子里? ( A )A.第一个B.第二个C.第三个D.第四个熵是为消除不确定性所需要获得的信息量,投掷均匀正六面体骰子的熵是:(B )A.lbitB.2.6bit C.3.2bitD.3.8bit假设属性income的最大最小值分别是12000元和98000元。利用最大最小规 范化的方法将属性的值映射到0至1的范围内。对属性income的73600元将被转 化为:(D )A.0.821B.1.224C.1.458D.0.716假定用于分析的数据包含属性age。数据元组中age的值如下(按递增序): 13,15,16,16,19,20,20,21,22,
7、22,25,25,25,30,33,33,35,35,36, 40,45, 46, 52, 70,问题:使用按箱平均值平滑方法对上述数据进行平滑, 箱的深度为3。第二个箱子值为:(A )A. 18.3B. 22.6C. 26.8D.27.9给定两个对象,分别用元组(22,1,42,10)和(20,0,36,8)表示,则这两个对象之间的曼哈坦距离为:()A.5B.11C.2.92D.2.24概念分层图是(B )图。A.无向无环B.有向无环C.有向有环D.无向有环假设A为事件“产品合格”,B为“机器工作正常”,现给出以下概率:机器工作正常,生产产品合格的概率为P(AIB)=0.95;机器不正常工作
8、时,生产产品合 格的概率为P(A I B)=0.1;机器正常工作的概率,即P(B)=0.9。已知生产了一个不 合格品,机器不正常工作的概率,即P(BI A)是()。A. 0.90B. 0.333C. 0.667D. 0.05二、填空题数据仓库是面向主题的、( 集成的 )、(具有特性的)、稳定的数据 集合,用以支持经营管理中的决策制定过程。OLAP的基本多维分析操作有(聚类)、切片、切块以及(旋转)等。多维数据集通常采用(星型)或雪花型架构,以(事实)为中心,连 接多个(维表)。空缺值数据的处理方法主要有使用默认值、(属性平均值)、(同类样本平均值) 和预测最可能的值等。平均互信息等于(信息)熵
9、减(条件)熵,表示不确定性的消除。神经网络的学习方式有3种:(监督学习)、(非监督学习)和再励学习(强 化学习)。聚类分析的数据通常可分为区间标度变量、二元变量、(标称变量)、(比例 标度变量)、序数型以及混合类型等。数据立方体是数据的多维建模和表示,由维和事实组成。维就是涉及的(属 性)、而事实是一个具体的(数据)。数据预处理的主要内容(方法)包括(数据清洗)、(数据变换 )、(数 据集成)和数据归约等。关联规则的经典算法包括(Apriori )算法和(FP_Growth )算法,其中(FP_Growth )算法的效率更高。非线性回归的模型有:直接换元法、(间接代换法)和(非线性型)三种。人
10、工神经网络的特点和优势主要表现在具有(自学习)功能、具有(联系存 储)功能和具有高速寻找优化解的能力三个方面。ID3算法只能对描述属性为(离散)型属性的数据集构造决策树。 TOC o 1-5 h z 按照对应的数据类型,Web挖掘可分为内容挖掘、()和()。BP神经网络由(输入)、(输出)以及一或多个隐含结点组成。三、判断题数据挖掘的目标不在于数据采集策略,而在于对于已经存在的数据进行模式的发掘。(对 )模式为对数据集的全局性总结,它对整个测量空间的每一点做出描述;模型则对变量变化空间的一个有限区域做出描述。(错)数据仓库中间层OLAP服务器只能采用关系型OLAP。(错)特征提取技术并不依赖于
11、特定的领域。(错)定量属性可以是整数值或者是连续值。(对)Web数据挖掘是通过数据库仲的一些属性来预测另一个属性,它在验证用户提出的假设过程中提取信息。(错)贝叶斯法是一种在已知后验概率与类条件概率的情况下的模式分类方法,待分 TOC o 1-5 h z 样本的分类结果取决于各类域中样本的全体。(错)给定由两次运行K均值产生的两个不同的簇集,误差的平方和最大的那个应该被视为较优。(错)。如果规则不满足置信度阈值,则形成的规则一定也不满足置信度阈值,其中是X的子集。( 对)分类和回归都可用于预测,分类的输出是离散的类别值,而回归的输出是连续数值。(对)如果一个对象不强属于任何簇,那么该对象是基于
12、聚类的离群点。(对 )K均值是一种产生划分聚类的基于密度的聚类算法,簇的个数由算法自动地确定。(错)数据挖掘的主要任务是从数据中发现潜在的规则,从而能更好的完成描述数据、预测数据等任务。(对 )离散属性总是具有有限个值。(错 )用于分类的离散化方法之间的根本区别在于是否使用类信息。(对)特征提取技术并不依赖于特定的领域。(错)定量属性可以是整数值或者是连续值。(对)Web数据挖掘是通过数据库仲的一些属性来预测另一个属性,它在验证用户提出的假设过程中提取信息。( 错)关联规则挖掘过程是发现满足最小支持度的所有项集代表的规则。(错)利用先验原理可以帮助减少频繁项集产生时需要探查的候选项个数。( 对
13、)具有较高的支持度的项集具有较高的置信度。(错 )聚类(clustering)是这样的过程:它找出描述并区分数据类或概念的模型(或函数),以便能够使用模型预测类标记未知的对象类。(错 )分类和回归都可用于预测,分类的输出是离散的类别值,而回归的输出是连续数值。( 对)四、简答题设某事务项集构成如表1所示,填空完成粗体字部分支持度和置信度的计算, 保留1位小数。表1事务ID项集L2支持度规则置信度T1A,DA,B33.3A=B50T2D,EA,C33.3C=A60T3A,C,EA,D44.4A=D66.7T4A,B,D,EB,D33.3B=D75T5A,B,CC,D33.3C=D60T6A,B,
14、DD,E33.3D=E42.9T7A,C,DT8C,D,ET9B,C,D写出非对称二元变量相异度计算公式(即jaccard系数),并计算表2中各对象间 的相异度。表2-试项目 对象test-1test-2test-3test-4test-5test-6OBJ1YNPNNNOBJ2YNPNPNOBJ3NYNYNN解:Jaccard系数公式可描述为非对称二元相异度二取值不同的同位属性数/(单个元素的属性位数-同取0的位数)。d(i, j) = r +,其中r表示对象i取值为1,对象j取值为0; s表示对 q + r + s象i取0值,对象j取1值,q表示对象i和j同取1值。d(OBJ 1,OBJ2
15、) = 0 +1 = - = 0.332 + 0 +1 3,. c 2 + 24 ,d(OBJ 1,OBJ3) = = 10 + 2 + 2 43 + 25d(OBJ2,OBJ3) = = 10 + 3 + 2 5给定两个对象,分别用元组(22,1,42,10)和(20,0,36,8)表示计算两个对象之间的欧几里德的距离;计算两个对象之间的曼哈坦距离;计算两个对象间的明考斯基距离,q = 3。解:欧几里德距离:d(i,j) = * (20 22)2 + (0 1)2 + (36 42)2 + (8 10)2 = 5 ;曼哈坦距离:d (i, j) = |20 22| +10-1| +136 4
16、2| +18-10 = 11 ;明考斯基距离,q=3。d(i, j)=20 22|3 +10 1|3 +136 42|3 +18 10|3 = 4.327。五、分析题已知某事务数据库如表3所示,请采用FP-Growth算法绘制出FP-tree,要求 画出绘制过程。表3:事务数据库TID项目列表T1I1,I2,I5T2I2,I3T3I2,I4T4I1,I2,I4T5I1,I4,I5T6I2,I3T7I3,I4T8I1,I2,I3,I5T9I1,I2,I3解:排序启1页集支持度计数顶集支持度讦数TID项目列表(iG5(127T112,11,157III5T2皿日03)5I3JS13仃441414T
17、4皿工1网!&3US】3TS皿工七15兴算法的步骤噩1FF-h契耳法的步骤流在WT6蚀,13TT皿wTS皿瓦13,15T9皿口 131FF-tr打算法的步痢罹才图:FP-tree给定表4所示的训练数据,数据样本属性age, income, student和credit_rating 描述。类标号属性buys_computer具有两个不同值(即Yes,No)。给定一个没有 类标号的数据样本 X=(age=30, income=medium, student=yes, credit_rating=” fair” ),使用朴素贝叶斯分类预测这个数据样本的类标号。(10 分)表4数据库训练数据元组RI
18、DageincomestudentCredit_ratingClass:buys_computer1=30highnofairNo240mediumnofairYes540lowyesfairYes640lowyesexcellentNo731-40lowyesexcellentYes8=30mediumnofairNo940mediumyesfairYes1140mediumnoexcellentNo解:(1)每个类的先验概率P(buys_computer=Yes)=9/14P(buys_computer =No)=5/14为计算P(X/Ci), i=1,2,计算下面的条件概率:P(age=30”| buys_computer =Yes)=2/9P(age=30”| buys_computer =No)=3/5P(income=medium| buys_computer =Yes)=4/9P(income=medium| buys_computer =No)=2/5P(student=yes| buys_computer =Yes)=6/9P(student=yes| buys_computer =No)=1/5P(credit_rating=fair”| buys_computer =Yes)=6/9P(credit_rating=fair| buys_computer
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 2026小学四年级英语上册 核心词汇(Unit 1-Unit 3)
- 植树节活动方案集锦15篇
- 防撞护栏施工方案
- 网络拓扑设计与调整实例
- 企业数字资产管理的行业挑战
- 城市交通时空大数据标准(征求意见稿)
- 固定收益策略报告:又见资产荒
- 国企改革之脱胎换骨药剂
- 2026年中等职业学校教师资格考试护理学科测试题及答案
- 2026海洋科普知识赛题参考答案分解
- 2026年广西事业单位招聘考试真题及答案
- 《2026年》知识产权专利工程师高频面试题包含详细解答
- 公司计量监督考核制度
- 2025年铜川职业技术学院单招综合素质考试题库带答案
- 内蒙美食课件
- 兴奋躁动状态的治疗及护理
- 《JBT 13686-2019 光栅编码器 加速寿命试验方法》(2026年)实施指南
- 消防工程计量课件
- 可穿戴设备轻量化设计与人体工学适配建设方案
- 2025年海南省公安厅招聘警务辅助人员笔试试题(含答案)
- 初中安全防性侵课件
评论
0/150
提交评论