《大数据导论》题库及答案 Chap3 题库_第1页
《大数据导论》题库及答案 Chap3 题库_第2页
《大数据导论》题库及答案 Chap3 题库_第3页
《大数据导论》题库及答案 Chap3 题库_第4页
《大数据导论》题库及答案 Chap3 题库_第5页
已阅读5页,还剩4页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

第三章试题一、单项选择题1.下列属于日志收集系统具有的基本特征是()高可用性高可靠性可扩展性以上都是2.以下哪种数据采集方法是针对非结构数据,将其从网页中抽取并以结构化的方式将其存储起来。()系统日志采集网络数据采集数据库采集以上都是3.数据质量的评估标准不包括以下哪一项()完整性一致性及时性针对性4.以下哪一项属于数据质量最为基础的评估标准。()一致性完整性及时性准确性5.在对天津的16个区的经济情况做调查时,发现区域数量一共14个,说明数据质量存在()问题。一致性完整性准确性及时性6.163邮箱用户的号码一般都以163.com结尾,这遵循了数据质量评估标准的哪一项()完整性一致性准确性及时性7.一份数据文件中出现的字符型数据乱码现象,这份数据不具备数据质量评估标准的哪一项()完整性一致性准确性及时性8.以下数据质量评估标准,哪一条主要跟数据的同步和处理过程的效率相关。()完整性一致性准确性及时性9.以下不属于数据质量的影响因素的是()信息因素时间因素流程因素管理因素10.信息因素是影响数据质量的一条重要因素,关于对信息因素的理解,下列说法正确的是()指由于技术处理异常造成的数据质量问题指由于系统流程和操作流程设置不当造成的数据质量问题指由于元数据对数据的描述以及理解错误、数据源规格不统一造成的质量问题指由于人员素质以及管理机制方面造成的数据质量问题11.当在测量一个变量时出现了相对于真实值的偏差或错误,这种数据会影响后续的分析。这种数据属于()。冗余数据残缺数据噪声数据错误数据12.以下不属于处理残缺数据的方法是()。忽略整个元组人工填写缺失值分箱设置允许存在空值规则13.使用分箱法处理噪声数据时,发现每个箱子的区间相等,因此使用的分箱法为()。等深分箱法等高分箱法等宽分箱法用户自定义分箱法14.以下哪种方法可以处理冗余数据()重复过滤回归分箱聚类15.以下哪一种属于数据概化()将“××年××月××日”日期形式转换为“××/××/××/”根据病人得分将健康状况分为“优秀、良好、中等、合格、不合格”等级根据出生日期的属性将其转化为80后、90后、00后等根据半径的属性计算出球的表面积和体积16.一份数据的最小值和最大值分别是6和659899,其中一个值为569,将其使用小数定标法将其标准化,结果为()0.5695.690.05690.00056917.属性“支出”的最小值和最大值分别为15000元和96000元。将属性值56000元进行0-1标准化后可得()0.5600.5660.5060.65818.以下不属于在实现数据集成时需要解决的问题是()模式匹配数据值冲突数据冗余数据残缺19.以下不属性属于标称数据的有()地理位置属性工种属性商品类型属性分数属性20.经过一些列数据处理,在基本保持原始数据完整性的基础上,减少数据规模的是()数据清洗数据融合数据归约数据挖掘21.维归约的目的是()找到最小属性集找到最大属性集解决数据值冲突减少数据冗余22.维归约时为了找到最小属性集采用的逐步向前选择方法,将()作为初始值。一个拥有所有属性的属性集一个空的属性集随机选择部分属性后的属性集以上都可23.我国的手机号码一定是11位数字,满足数据质量中的哪一条标准()完整性一致性准确性及时性24.一个学校中学生的学号是唯一的,某班级共有30个人。在统计全班的学生信息时得到的唯一值总数小于30,则可以断定该数据缺乏()。完整性一致性准确性及时性25.数据获取过程中出现的采集点不正确、取数时点不正确以及接口数据在过程中失真的情况,比如编码转换处理错误以及精度不够,导致指标统计结果不一致、数据无效等降低了数据的质量,这属于()。信息因素技术因素流程因素管理因素26.以下说法正确的是()同样的顾客ID,在A系统中的字段名是Cust_id,在B系统中是Customer_Num,因此在集成时会出现数据冗余A系统中有月营业额属性,B系统中有日营业额属性,A和B集成时不会出现数据冗余地理位置、工种、商品类型属于标称数据对数值数据一般通过检测他们之间的相关系数估计两个属性之间的相关度27.以下说法错误的是()数据规约对后续的分析处理不产生影响,即规约前后的数据的分析结果相同逐步向前选择是指从一个拥有所有属性的属性集开始逐步向后删除是指从一个拥有所有属性的属性集开始数值规约常用的方法有直方图、聚类、抽样、参数回归等二、判断题(正确打√,错误打×)1.数据采集属于大数据生命周期的第一个环节,之后的分析挖掘都建立在数据采集的基础之上。()2.数据采集产品Logstash是一个接收,处理,转发日志的工具。支持系统日志、webserver日志、错误日志、应用日志等各种日志类型。()3.一个班级中及格率为101%,这违背了数据质量的准确性。()4.元数据:又称中介数据、中继数据,为描述数据的数据,主要被用于描述数据属性。()5.当填写残缺值时,如果数据量很大并且缺失值很多,可以采用人工填写法。()6.一份数据存在缺失值,这意味着数据存在错误。()7.平滑处理中按边界值处理数据时,一般使用距离边界值较小的边界值来代替箱子中的所有数据。()8.冗余数据既包括重复的数据,也包括对分析处理的问题无关的数据,通常采用过滤数据的方法来处理冗余数据。()9.数据概化是指用低层次的属性代替高层次或者抽象的数据。()10.根据正方形的边长属性可以计算其周长属性和面积属性,这一过程属于属性构造。()11.标称数据:指具有有穷多个不同值(但可能很多),且值之间无序的属性。如地理位置、工种、商品类型等。()12.对于标称数据,可以通过计算两个属性之间的相关系数来估计这两个属性之间的相关度。()13.对于数值数据,可以通过检测他们之间的相关系数来估计这两个属性之间的相关度。相关系数越大,代表两个属性相关度越高。()14.数据归约也称数据削减,是指在尽可能保持数据原貌的前提下,最大限度地精简数据量。数据归约对后续的分析处理不产生影响。()15.数值归约中使用的抽样,其中的优点是:得到样本的花费正比于样本集的大小,而不是数据集的大小。()16.将一个班中各学生的语文成绩按照0~59、60~69、70~79、80~89、90~100的数值型数据依次转化为不及格、及格、中等、良好、优秀的字符型数据类型。这种由原属性到目标属性之间的映射关系为多对一映射。()17.数据集成是指将不同数据源中的数据,逻辑地(生成一个视图)或物理地(生成一个新的关系表)集成到一个统一的数据集合中。()第三章答案一、单项选择题1.D2.B3.D4.B5.B

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论