版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
第1章大数据概述第1章大数据概述测验1.关于数据生成阶段,哪个顺序是正确的()
答案:【运营与业务系统、感知阶段、用户生成内容运营与业务系统,用户生成内容,感知阶段感知阶段,运营与业务系统,用户生成内容感知阶段,用户生成内容,运营与业务系统】2.据Gartner称,估计有20%的组织数据是()数据,其他多数是()数据.()
答案:【结构化,非结构化非结构,结构化结构化,半结构化非结构,半结构化】3.关于结构化数据,与非结构化数据相比,哪个描述不对?()
答案:【它通常采用行和列的表格形式易于加工它以预定义的格式组织数据需要更多的存储空间】4.关于非结构化数据,与结构化数据相比,哪个描述不对?()
答案:【不能显示在行、列和关系数据库中.它们通常是图像、音频、视频、文字处理文件、电子邮件、电子表格.它们需要更多存储空间,因为它们数量庞大且组织不当.可以轻松地使用传统方式用遗留解决方案管理和保护.】5.以下哪个阶段是大数据的主要原因?()
答案:【运营与业务系统用户生成内容感知阶段社交媒体】6.为什么我们说数据像未加工的原油?以下哪一个不是合理的原因?()
答案:【数据有价值需要被加工才能使用一个数据集可以应用到不同的分析目的可以被出售】7.产生和消费数据的模式已经转变为以下哪种情况()
答案:【少数公司产生数据,其他公司消费数据.我们所有人都在产生数据,同时我们所有人也在消费数据.一些公司在产生数据,一些公司在消费数据.我们中的一些人在产生数据,我们中的一些人在消费数据.】8.关于大数据术语,哪个描述不合适()
答案:【可以分析大数据以获得更好的决策和战略业务举措的见解只是规模大包括结构化和非结构化数据难以管理的数据量】9.在下图中,每个数字的正确术语是什么?()
答案:【数据来源、数据存储、数据采集、数据处理、数据可视化、报表监控数据来源、数据采集、数据存储、数据可视化、数据处理、报表监控数据来源、数据采集、数据存储、数据处理、数据可视化、报表监控数据来源、数据采集、数据存储、数据处理、报表监控、数据可视化】10.当数据量越来越大时,任何单一的传统高性能服务器都无法满足需求,需要更多的服务器.这叫做()扩展
答案:【垂直水平集中式分布式】11.分布式计算的思想是使用()来取得()()
答案:【冗余性,可靠性;可靠性,冗余性;冗余性,性能;可靠性,性能;】12.大数据的两个主要的组件是()和().()
答案:【分布式存储,分布式处理分布式采集,分布式处理分布式采集,分布式存储分布式采集,分布式应用】13.以下哪一个是关于想法、学习、符号、概念、综合、比较、思考、讨论?()
答案:【数据信息智慧知识】14.以下哪一项是关于理解、整合、应用、反思、可操作、积累、原则、模式、决策过程?()
答案:【数据信息智慧知识】15.利用数据的历史技术发展顺序是()1)()可以对历史数据进行报告和人工分析2)()可以分析当前数据以改善业务交易3)()实时分析处理以做出实时决策并改进实时业务响应
答案:【OLAP:在线分析处理;OLTP:在线交易处理;RTAP:实时分析处理;OLTP:在线交易处理;OLAP:在线分析处理;RTAP:实时分析处理;OLAP:在线分析处理;RTAP:实时分析处理;OLTP:在线交易处理;OLTP:在线交易处理;RTAP:实时分析处理;OLAP:在线分析处理;】16.商务智能在规模和速度上都不断发展,下图中1234号方框中的技术分别是什么.()
答案:【1-数据仓库,2-内存关系型数据库管理系统,3-分布式数据存储,4-实时&单一数据视图1-内存关系型数据库管理系统,2-数据仓库,3-分布式数据存储,4-实时&单一数据视图1-数据仓库,2-分布式数据存储,3-内存关系型数据库管理系统,4-实时&单一数据视图1-数据仓库,2-内存关系型数据库管理系统,3-实时&单一数据视图,4-分布式数据存储】17.在大数据通用架构中,从下到上,大数据计算系统的三个基本层是()
答案:【数据处理系统;数据存储系统;数据应用系统;数据存储系统;数据处理系统;数据应用系统;数据采集系统;数据处理系统;数据存储系统;数据存储系统;数据处理系统;数据可视化系统;】18.在大数据通用架构中,数据存储系统分为四个部分,哪一个最能描述数据存储系统的四个部分?()
答案:【数据采集,数据建模,数据存储(分布式文件系统和分布式数据库),统一数据访问接口数据采集,数据预处理,数据存储(分布式文件系统和分布式数据库),统一数据访问接口数据预处理,数据建模,数据存储(分布式文件系统和分布式数据库),统一数据访问接口数据预处理,数据建模,分布式文件系统,分布式数据库】19.在大数据通用架构中,数据处理系统分为三个部分,哪一个最恰当地描述了它们?()
答案:【数据存储,数据处理算法,计算引擎和计算平台数据存储,计算模型,计算引擎和计算平台数据处理算法,计算模型,计算引擎和计算平台数据处理算法,计算引擎,计算平台】20.在大数据通用架构中,UDAI-统一数据访问接口不能解决的问题是.()
答案:【跨平台问题异构问题分布式计算问题数据不一致问题】第2章数据获取第2章数据获取测验1.单选题:下面关于深网搜索接口的描述哪一个是不正确的()
选项:
A、深网有复杂的搜索接口
B、支持对多个属性的查询
C、从数据库中提取内容
D、接口容易找到
答案:【接口容易找到】2.单选题:哪一个完整地描述了深网数据采集方法的内容()
选项:
A、自动查询接口标识并填写表单
B、解析HTML表单或对HTML表单执行语法分析,以自动发现深网数据资源
C、将HTML表单与特定字段关联,实现表单的自动填充
D、域无关检测:基于样本从查询结果中迭代获取查询关键字,以较少的查询获得尽可能多的查询结果
答案:【自动查询接口标识并填写表单】3.单选题:爬虫的任务通常是很繁重的,很难由一个单独的网络爬虫爬取,所以需要分布式网络爬虫。有三张基本的网络爬虫分布式架构,以下哪一种不属于常用的分布式网络爬虫架构。()
选项:
A、Master-slave
B、Peertopeer
C、Mixedstructure
D、Hybrid
答案:【Hybrid】4.单选题:传统搜索引擎由于技术限制无法索引或经过仔细考虑后不愿意索引的那些网页、文件或其他高质量、权威的信息,这些互联网内容属于以下哪一种。()
选项:
A、浅网
B、深网
C、暗网
D、以上都不是
答案:【深网】5.单选题:以下哪一项不是深网信息的特征?()
选项:
A、与信息需求、市场和领域高度相关.
B、互联网上增长最快的新型信息.
C、其中一半以上储存在专题数据库中.
D、可以通过搜索引擎进行搜索.
答案:【可以通过搜索引擎进行搜索.】6.单选题:深网内容包括以下哪些()1由于缺乏定向链接而不被搜索引擎引用的页面2网页上可访问的非网页文件,如图片文件、Pdf及word文件等.3通过填写表单查询后端在线数据库获得的动态页面.4需要注册或其他访问限制的内容。
选项:
A、1234
B、124
C、123
D、234
答案:【1234】7.单选题:以下哪种方法是在数据库中提取自上次提取以来的新的或修改的数据,同时,它通常不会对运行的业务系统产生很大影响.()
选项:
A、增量提取
B、全量提取
C、时间戳提取
D、触发器提取
答案:【增量提取】8.单选题:以下哪种方法是在数据提取时通过数据库自带的日志评估变化了的数据.()
选项:
A、日志比较方法
B、时间戳方法
C、触发器方法
D、全表比较方法
答案:【日志比较方法】9.单选题:以下哪种方法在更新相应的记录数据时添加和修改时间戳字段值。通过比较系统时间和时间戳时间来决定是否进行本次数据提取。()
选项:
A、日志比较方法
B、时间戳方法
C、触发器方法
D、全表比较方法
答案:【时间戳方法】10.单选题:以下哪种方法每次在源数据库表发生变化时在数据表上创建一个触发器,变化了的数据通过相应的触发器被写到临时表中,数据提取线程从临时表中提取数据。()
选项:
A、日志比较方法
B、时间戳方法
C、触发器方法
D、全表比较方法
答案:【触发器方法】11.单选题:根据组织边界,数据资源可分为两类.()
选项:
A、在线数据和离线数据.
B、组织数据和政府数据.
C、内部数据和外部数据.
D、系统数据和IoT物联网数据
答案:【内部数据和外部数据.】12.单选题:当您从互联网上采集数据时,您应该注意一些问题,哪一项不包括在内()
选项:
A、不同网站具有不同的IT水平和结构—没有一个统一的采集方法;
B、不同的网站对网络爬虫有不同的控制策略;
C、数据的权威性和数据的质量要比其他的数据源的数据差
D、我们平均地采集各种形式的数据.
答案:【我们平均地采集各种形式的数据.】13.单选题:最常用的内部数据采集是()
选项:
A、数据仓库
B、ETL(Extract提取,Transform转换,load加载)
C、数据触发器
D、增量数据提取
答案:【ETL(Extract提取,Transform转换,load加载)】14.单选题:()是简单直观的数据提取方式,每次提取整个源数据存储中的所有数据.()
选项:
A、增量提取
B、全量提取
C、时间戳提取
D、触发器提取
答案:【全量提取】15.单选题:网络爬虫的过程以下描述的正确顺序是()a)一个称为种子URL的统一资源地址列表并将其用作爬行的链接的入口。当爬虫程序访问这些种子URL时,它识别出在种子URL上的所有需要的链接并将这些链接添加到待爬取队列.b)把已经下载完的URL放到已爬取URL列表c)提取新的URL,按照既定策略把这些URL放到待爬取URL队列中等待爬取d)从待爬取队列中取出网页的链接,然后读取URL,进行DNS解析,并且把网页放在已经下载的网页库中.e)当爬取队列空了的时候,所有的爬取过程将终止.
选项:
A、abcde
B、adbce
C、acbde
D、adcbe
答案:【adbce】16.单选题:如何处理种子URL中的扇出URL,也就是链接的链接,这涉及到网络爬虫的爬取策略.以下哪一个不是常用的爬虫爬取策略()
选项:
A、深度优先
B、广度优先
C、先进先出
D、部分PageRank策略
答案:【先进先出】17.单选题:在下图中使用广度优先爬取策略,以下哪一个是正确的爬取顺序?()
选项:
A、M1-M2-M5-M8-M6-M3-S7-S4
B、M1-M2-M3--S4-M5-M6-S7-M8
C、M1-M2-M5-M6-M8-M3-S7-S4
D、M1-M2-M5-M6-M3-S7-M8-S4
答案:【M1-M2-M3--S4-M5-M6-S7-M8】18.单选题:以下哪一个爬取策略给每一个网页分配同样的金币。每当一个网页P被下载,P所拥有的金币就平均分配给网页P所包含的链接页面。在队列中的链接按照所拥有的金币的数量从多到少顺序进行爬取()
选项:
A、PageRank
B、OPIC
C、深度优先
D、广度优先
答案:【OPIC】19.单选题:以下哪种数据提取方法中,ETL工具事先创建一个与待提取的数据库表具有相似结构的MD5临时表。临时表记录源表的主键和基于所有字段数据计算的MD5值()
选项:
A、日志比较方法
B、时间戳方法
C、触发器方法
D、全表比较方法
答案:【全表比较方法】20.单选题:下列哪项不是进行数据抽取时的数据转换组件?()
选项:
A、字段映射
B、数据计算
C、数据拆分
D、去重
答案:【去重】21.单选题:以下哪一个不是数据加载的方法?()
选项:
A、用SQL语句进行插入,更新和删除数据
B、数据全量提取
C、批量复制程序
D、通过API应用程序接口进行数据加载
答案:【数据全量提取】22.单选题:以下哪一个不是网络大数据的特征?()
选项:
A、多源异构
B、高噪声
C、交互性
D、结构化
答案:【结构化】第3章数据预处理第3章数据预处理测验1.单选题:关于主成分分析-PCA,以下哪一个描述是错的?()
选项:
A、主成分分析搜索得到最能代表数据的c维正交向量
B、主成分分析是数量Numerosity约简方法。
C、将原始数据投影到更小的空间,实现数据压缩.
D、主成分分析是有损压缩.
答案:【主成分分析是数量Numerosity约简方法。】2.单选题:如何判断两条记录是否重复?()
选项:
A、根据每个属性的相似度和属性的权重,比较两条记录的相关属性值
B、由技术人员手工比较
C、通过数据库支持进行比较
D、以上都不是
答案:【根据每个属性的相似度和属性的权重,比较两条记录的相关属性值】3.单选题:缺失值必须被找出并且通过以下哪些手段进行补充()1)忽略这条记录2)使用默认值3)使用属性平均值4)使用相似样本的平均值5)预测最有可能的值
选项:
A、1234
B、2345
C、12345
D、1345
答案:【12345】4.单选题:以下哪一项不是消除数据噪声的主要方法之一?()
选项:
A、bin/splitbin分箱算法
B、聚类算法
C、回归算法
D、功能算法
答案:【功能算法】5.单选题:当平滑有噪声的数据时,哪一个不是常用的方法?()
选项:
A、用平均值来平滑
B、用随机值来平滑
C、根据边界值来平滑
D、根据中位数来平滑
答案:【用随机值来平滑】6.单选题:命名冲突(对不同的数据对象使用同一个名字或者对同一个数据对象使用不同的名字)属于以下哪个数据质量的范畴()
选项:
A、单一数据源,模型层面
B、单一数据源,实例层
C、多数据源,模型层面
D、多数据源,实例层
答案:【多数据源,模型层面】7.单选题:结构冲突(指用不同的方式表示在不同的数据源中的同一数据对象)属于以下哪个数据质量的范畴()
选项:
A、单一数据源,模型层面
B、单一数据源,实例层
C、多数据源,模型层面
D、多数据源,实例层
答案:【多数据源,模型层面】8.单选题:相同值的不同表达属于以下哪个数据质量的范畴()
选项:
A、单一数据源,模型层面
B、单一数据源,实例层
C、多数据源,模型层面
D、多数据源,实例层
答案:【多数据源,实例层】9.单选题:以下哪项不是主要的数据清理任务之一?()
选项:
A、重复数据清洗
B、缺失值清洗
C、剔除噪声数据
D、当合并不同的表时删除一些冗余属性
答案:【当合并不同的表时删除一些冗余属性】10.单选题:下列哪个选项不是数据分析中数据规模减少的方法?()
选项:
A、PCA主成分分析法
B、数据立方体聚合
C、聚类
D、采样
答案:【PCA主成分分析法】11.单选题:1.以下哪一种是属性子集选择技术的属性子集选择的方法?()1)向前逐步选择属性子集2)向后逐步选择属性子集3)向前选择和向后删除方法相结合4)PCA主成分分析法5)基于统计分析的减少属性6)决策树(decisiontree)归纳
选项:
A、12346
B、12345
C、12356
D、123456
答案:【12356】12.单选题:下图中显示了什么属性子集选择方法?()
选项:
A、向前逐步选择属性子集
B、向后逐步选择属性子集
C、向前选择和向后删除方法相结合
D、决策树(decisiontree)归纳
答案:【向前逐步选择属性子集】13.单选题:下图中显示了什么属性子集选择方法?()
选项:
A、向前逐步选择属性子集
B、向后逐步选择属性子集
C、向前选择和向后删除方法相结合
D、决策树(decisiontree)归纳
答案:【向后逐步选择属性子集】14.单选题:当将多个数据源的数据整合到一个一致的存储中,以下哪项数据预处理任务不能起到保证数据质量的作用()
选项:
A、模式匹配
B、数据冗余处理
C、数据值冲突解决
D、数据计算
答案:【数据计算】15.单选题:为了方便高效的分析,以下哪些是可以采用的数据转换方法()?1)数据平滑2)数据聚合3)数据泛化4)数据规范化5)属性构造
选项:
A、1234
B、2345
C、12345
D、1345
答案:【12345】16.单选题:以下哪一种数据规约的说法是不正确的?()
选项:
A、使用数据规约(减法)技术,帮助从原始庞大的数据集中获得一个压缩的数据集,并使这个压缩的数据集保持原始数据集的完整性
B、对压缩后的数据集进行数据分析效率明显更高,分析结果与使用原始数据集得到的结果基本一致
C、花在数据缩减上的时间可以超过或“抵消”分析减少的数据所节省的时间.
D、数据规约得到的数据比原始数据小很多,但可以产生相同或几乎相同的分析结果.
答案:【花在数据缩减上的时间可以超过或“抵消”分析减少的数据所节省的时间.】17.单选题:以下哪项不是降维的方法?()
选项:
A、小波变换
B、属性子集选择
C、PCA主成分分析法
D、聚类
答案:【聚类】18.单选题:以下哪个不能有助于防止脏数据出现?()
选项:
A、统一多个数据源的属性值编码
B、尽可能清楚地给出属性名和属性值
C、键值尽量使用选项
D、手动填写条目
答案:【手动填写条目】19.单选题:数据预处理的任务不包含以下的哪一项()
选项:
A、数据清洗
B、数据转换
C、数据规约
D、数据定义
答案:【数据定义】20.单选题:属性依赖属于以下哪个数据质量的范畴()
选项:
A、单一数据源,模型层面
B、单一数据源,实例层
C、多数据源,模型层面
D、多数据源,实例层
答案:【单一数据源,模型层面】21.单选题:拼写错误属于以下哪个数据质量的范畴()
选项:
A、单一数据源,模型层面
B、单一数据源,实例层
C、多数据源,模型层面
D、多数据源,实例层
答案:【单一数据源,实例层】22.单选题:冗余和重复记录属于以下哪个数据质量的范畴()
选项:
A、单一数据源,模型层面
B、单一数据源,实例层
C、多数据源,模型层面
D、多数据源,实例层
答案:【单一数据源,实例层】23.单选题:属性值冲突属于以下哪个数据质量的范畴()
选项:
A、单一数据源,模型层面
B、单一数据源,实例层
C、多数据源,模型层面
D、多数据源,实例层
答案:【单一数据源,实例层】24.单选题:数据清洗技术不包含以下的哪一项()
选项:
A、数据转换
B、缺失数据的清洗
C、数据去重
D、在数据集上执行异常检测
答案:【数据转换】25.单选题:数据规约技术不包含以下的哪一项()
选项:
A、高维数据的降维处理
B、减少数据的量
C、随机删除一些数据
D、数据离散化技术
答案:【随机删除一些数据】26.单选题:完整性约束属于以下哪个数据质量范畴()
选项:
A、单一数据源,模型层面
B、单一数据源,实例层
C、多数据源,模型层面
D、多数据源,实例层
答案:【单一数据源,模型层面】27.单选题:唯一性属于以下哪个数据质量的范畴()
选项:
A、单一数据源,模型层面
B、单一数据源,实例层
C、多数据源,模型层面
D、多数据源,实例层
答案:【单一数据源,模型层面】第4章数据存储系统第4章数据存储系统测验1.单选题:以下哪一种NoSQL数据库中,基本思想是通过键来查询数据值,键可以是字符串类型,值可以是任何类型的数据,如整数、字符、数组、列表、集合、JSON、BLOB(二进制大对象)等。它不支持基于数据值的查询。它帮助开发人员存储无模式数据。它们最适合处理购物车里的东西。()
选项:
A、键值数据库
B、列数据库
C、面向文档的数据库
D、图数据库
答案:【键值数据库】2.单选题:文档数据库、键值数据库、列数据库和图数据库的代表数据库平台()
选项:
A、MongoDB,Redis,Cassandra和Neo4j;
B、MongoDB,Cassandra,Redis和Neo4j;
C、Redis,MongoDB,Cassandra和Neo4j;
D、MongoDB,Redis,Neo4j和Cassandra;
答案:【MongoDB,Redis,Cassandra和Neo4j;】3.单选题:在数据存储系统中,哪一部分是在分布式环境中支持跨平台异构数据,并向上层数据处理系统提供数据。()
选项:
A、数据采集和建模
B、分布式文件系统
C、分布式数据库
D、统一数据访问接口
答案:【统一数据访问接口】4.单选题:()等数据库连接编程接口可以支持应用程序对数据库的SQL访问,但不能提供分布式计算环境中事务管理、并发调度、缓冲区管理、异构数据转换和继承等复杂功能。这就引入了()。它是在数据库之上提供数据交换功能的一层软件。当系统扩展需要访问跨平台异构数据库时,操作系统可以是UNIX、Linux或Windows,表单可以是邮件、XML文档、EJB组件、Web服务、图像、音频/视频文件或其他非结构化数据,大数据应用层的技术也多样化和各种标准。()的设计需要与各种标准技术和产品兼容,这就引入了()。()
选项:
A、ODBC和JDBC;数据访问层DAL;统一数据访问接口;统一数据访问接口;
B、ODBC和JDBC;数据访问层DAL;数据访问层DAL;统一数据访问接口;
C、DALdataaccesslayer;ODBC和JDBC;数据访问层DAL;统一数据访问接口;
D、ODBC和JDBC;数据访问层DAL;统一数据访问接口;数据访问层DAL;
答案:【ODBC和JDBC;数据访问层DAL;数据访问层DAL;统一数据访问接口;】5.单选题:下列哪一个不是RDBMS数据库事务模型–ACID的特征?()
选项:
A、可用性
B、隔离
C、一致性
D、持久性
答案:【可用性】6.单选题:以下哪一种NoSQL数据库提供高性能的聚合查询,如SUM,COUNT,AVG,MIN等.()
选项:
A、键值数据库
B、列数据库
C、面向文档的数据库
D、图数据库
答案:【列数据库】7.单选题:以下哪一种NoSQL数据库中,关系直接定义并存储在数据库中,遍历关系是快速的,因为它们已经被捕获到数据库中,不需要计算它们。()
选项:
A、键值数据库
B、列数据库
C、面向文档的数据库
D、图数据库
答案:【图数据库】8.单选题:以下哪一种NoSQL数据库中,记录可以“自描述”所包含数据的类型和内容。包含的数据记录是一系列数据项的集合。每个数据项都有一个名称和一个对应的值。值可以是简单的数据类型,如字符串、数字和日期,也可以是复杂的类型,如有有序的列表和关联对象。()
选项:
A、键值数据库
B、列数据库
C、面向文档的数据库
D、图数据库
答案:【面向文档的数据库】9.单选题:1.以下哪些是统一数据访问接口Unifieddataaccessinterface的功能?()1)事务管理;2)并发调度;3)缓冲区管理;4)数据转换5)统一数据展示,存储和管理;6)数据建模7)访问接口与实现代码分离,底层数据库连接的改变不影响统一的数据访问接口;8)屏蔽数据源差异和数据库操作细节,使应用层专注于数据应用;9)提供统一的访问接口和统一的查询语言;
选项:
A、123456789
B、1345789
C、1235789
D、1235678
答案:【1235789】10.单选题:在HDFS中写数据到DataNodes的正确的顺序是()a)分布式文件系统向NameNode发起一个RPCcall要在文件系统的命名空间中创建一个新的文件,该新文件当前没有数据块与之关联;b)客户端Client通过在分布式文件系统上调用create()方法创建文件;c)DataNode的列表组成一个管道Pipeline,默认的复制级别是3,因此管道Pipeline中有3个节点。DataStreamer将数据包以流的形式发送到管道中的第一个datanode,该datanode存储数据包并将其转发给管道中的第二个datanode。d)NameNode执行各种检查以确保文件不存在,并且客户端有正确的权限创建文件。如果这些检查都通过了,namenode会记录新文件。否则,文件创建失败,客户端会抛出IOException异常.e)分布式文件系统返回一个FSDataOutputStream,让客户端开始向DataNode写入数据。FSDataOutputStream封装了一个DFSOutputStream,用于处理与DataNode和NameNode的通信.f)当客户端写入数据时,DFSOutputStream将其拆分为数据包,并将其写入一个内部队列,称为数据队列。数据队列由DataStreamer使用,DataStreamer负责通过选择一组合适的datanode让namenode分配新数据块来存储数据副本g)类似地,第二个datanode存储数据包并将其转发给管道中的第三个(也是最后一个)datanodeh)DFSOutputStream还维护一个内部队列,用于等待datanode的确认,称为ack队列(ackqueue)。只有在数据包得到管道Pipeline中所有datanode的确认后,它才会从ack队列移除。i)Whentheclienthasfinishedwritingdata,itcallsclose()onthestream.Itflushesalltheremainingpacketstothedatanodepipelineandwaitsforacknowledgmentsbeforecontactingthenamenodetosignalthatthefileiscomplete.当客户端完成数据写入时,它对数据流调用close()函数。它将所有剩余的数据包发送到DataNode管道Pipeline,并在与NameNode联系以表明文件已完成之前等待确认。j)Namenode已经知道文件由哪些块组成,所以它只需要等待块被最小限度地复制就可以返回成功消息
选项:
A、badefcghij
B、abdefcghij
C、badefchgij
D、badefcgihj
答案:【badefcghij】11.单选题:在HDFS中读数据的正确的顺序是()a)分布式文件系统向Namenode发出RPC调用,以确定Datanode中文件以块的形式存储的位置。对于每个数据块,Namenode返回有数据块副本的Datanode的地址(数据块和Datanode的元数据)。Datanode根据邻近程度(取决于网络拓扑信息)进行排序。b)客户端通过调用分布式文件系统上的open()方法打开文件.c)客户端然后对数据流调用read()方法。存储了文件中前几个数据块的Datanode地址的DFSInputStream,然后连接到第一个(最近的)Datanode来获取文件中的第一个数据块d)分布式文件系统返回一个FSDataInputStream(一个支持文件查找的输入流)给客户端,以便从中读取数据。FSDataInputStream又封装了一个DFSInputStream,用于管理datanode和namenode的I/O。e)数据以数据流的形式从Datanode返回客户端(以数据包的形式),客户端在数据流上反复调用read()方法.f)当客户端Client完成数据读取后,它对FSDataInputStream调用close()方法g)当到达数据块的末尾时,DFSInputStream将关闭与Datanode的连接,然后找到下一个数据块的最合适的Datanode。
选项:
A、ABDCEGF
B、BADCEGF
C、BADCEFG
D、BACDEGF
答案:【BADCEGF】12.单选题:以下哪项不是RDBMS的挑战?()
选项:
A、灵活性和易于在分布式环境中扩展
B、按索引快速查询
C、存储非结构化或半结构化数据
D、支持分治策略等上层计算模式
答案:【按索引快速查询】13.单选题:下列对NoSQL数据库的描述哪项是错误的?()
选项:
A、NoSQL是无模式的
B、使用哈希和键空间进行分区
C、NoSQL去掉了代价较大的关系维护,可以很好地扩展
D、NoSQL具有强一致性
答案:【NoSQL具有强一致性】14.单选题:为什么对收集来的数据进行数据建模,以下不正确的是()
选项:
A、数据存储结构设计
B、数据库设计
C、计算模型
D、应用设计
答案:【应用设计】15.单选题:基于需求,我们可以构建业务模型,业务模型包含()和().
选项:
A、概念模型,逻辑模型
B、逻辑模型,物理模型
C、过程模型,数据模型
D、过程模型,逻辑模型
答案:【过程模型,数据模型】16.单选题:关于数据建模设计层次的描述:哪一个匹配是正确的?()1)基于用户的数据功能需求,获取功能和关联关系,以及与业务元素和功能相关的实体类.2)数据实体的更多细节,包括主键,外键,属性,索引,关系,关系,约束甚至是视图和数据表,数据列,取值范围,面向对象的类,XML标签和其他描述形式。3)数据存储实现包括数据分区,数据表空间和数据集成.
选项:
A、1-概念模型设计2-物理模型设计3-逻辑模型设计
B、1-逻辑模型设计2-物理模型设计3-概念模型设计
C、1-概念模型设计2-逻辑模型设计3-物理模型设计
D、1-物理模型设计2-概念模型设计3-逻辑模型设计
答案:【1-概念模型设计2-逻辑模型设计3-物理模型设计】17.单选题:在HDFS中,name节点和data节点有各自的职责,请分别选择Namenodes和Datanodes的职责.Namenodes(),Datanodes()(B)1)实现数据块到数据节点本地文件系统的映射2)管理文件系统命名空间3)存储文件到数据块4)存储文件到数据块到数据节点的映射关系5)调度客户端的文件访问6)存储数据块到本地磁盘7)在内存中存储元数据方便快速访问
选项:
A、1237,456
B、2457,136
C、1245,367
D、2456,137
答案:【2457,136】18.单选题:根据CAP定理,一个分布式系统在进行数据读写操作时,只能满足CAP特性其中的两个,RDBMS可以满足哪两个特性?()
选项:
A、一致性(C)和可用性(A)
B、一致性(C)和分区容忍性(P)
C、可用性(A)和分区容忍性(P)
D、以上都不对
答案:【一致性(C)和可用性(A)】19.单选题:根据CAP定理,分布式系统在运行中的数据读写操作中只能满足CAP三个特性中的两个,MongoDB可以满足哪两个特性()
选项:
A、一致性(C)和可用性(A)
B、一致性(C)和分区容忍性(P)
C、可用性(A)和分区容忍性(P)
D、以上都不对
答案:【一致性(C)和分区容忍性(P)】20.单选题:根据CAP定理,分布式系统在运行中的数据读写操作中只能满足CAP三个特性中的两个,Cassandra可以满足哪两个特性?()
选项:
A、一致性(C)和可用性(A)
B、一致性(C)和分区容忍性(P)
C、可用性(A)和分区容忍性(P)
D、以上都不对
答案:【可用性(A)和分区容忍性(P)】21.单选题:下列哪一个不是NoSQL数据库事务模型-BASE的特征?()
选项:
A、基本可用性
B、最终一致性
C、软状态
D、原子性
答案:【原子性】22.单选题:下列哪项关于NoSQL数据库结构特征的描述是不正确的?()
选项:
A、不需要预定义数据格式;
B、灵活可扩展;
C、应用共享存储架构;
D、异步复制;
答案:【应用共享存储架构;】23.单选题:下列哪项不是关系型数据库的优点?()
选项:
A、基于完美的关系代数理论,具有严格的标准
B、支持交易酸的四个特性ACID
C、易于伸缩
D、利用索引机制可以实现高效的查询
答案:【易于伸缩】24.单选题:以下哪项不是NoSQL数据库的优势?()
选项:
A、能支持超大规模数据存储
B、灵活的数据模型可以很好地支持Web2.0应用
C、水平扩展能力强
D、数学理论基础
答案:【数学理论基础】25.单选题:关系数据库和NoSQL数据库各有优缺点,无法相互替代,()应用场景:电信、银行等领域的关键业务系统需要保证强事务一致性()应用场景:互联网企业、传统企业的非关键业务(如数据分析)。()
选项:
A、NoSQL数据库,关系数据库;
B、关系数据库;NoSQL数据库
C、NoSQL数据库,NoSQL数据库;
D、关系数据库;关系数据库
答案:【关系数据库;NoSQL数据库】26.单选题:数据建模可以包含定义以下的哪些().1)元数据2)数据结构3)属性4)值的范围5)关联关系6)一致性7)时效性
选项:
A、12345
B、1234567
C、134567
D、123567
答案:【1234567】27.单选题:在数据存储系统中,可分为4个部分,从下至上合理的处理顺序是(A)1)数据收集与建模2)统一数据访问接口3)分布式文件系统4)分布式数据库和数据仓库
选项:
A、1342
B、1234
C、1324
D、1423
答案:【1342】28.单选题:在HDFS中,每个存储文件首先被划分为多个长度可以根据数据的大小进行调整的数据块.()
选项:
A、正确
B、错误
答案:【错误】29.单选题:HDFS中的数据是不可修改的.()
选项:
A、正确
B、错误
答案:【正确】30.单选题:数据库提供物理存储结构;()
选项:
A、正确
B、错误
答案:【错误】31.单选题:DFS分布式文件系统提供了数据的逻辑存储结构.()
选项:
A、正确
B、错误
答案:【错误】32.单选题:HDFS支持批量读取、写入和更新操作.()
选项:
A、正确
B、错误
答案:【错误】第5章数据处理系统第5章数据处理系统测验1.单选题:以下哪一个是无共享架构.()
选项:
A、SMP
B、NUMA
C、MPP
D、以上都不是
答案:【MPP】2.单选题:当CPU增加时,哪种方法可以实现近似线性的性能扩展?()
选项:
A、SMP
B、NUMA
C、MPP
D、以上都不能
答案:【MPP】3.单选题:在OLTP,用户访问中心数据库,并且如果采用()系统架构,会更加高效.从()架构的角度,可以在一个物理服务器中集成很多CPU,因此系统有更高的事务处理能力.由于远程访问的延迟时间比本地内存访问时间长,必须减少不同CPU模块之间的交互,显然,()架构更加适合OLTP业务处理的环境.在数据仓库环境中,由于大量的复杂数据处理不可避免的导致大量的数据交互,这将明显降低CPU的利用率,所以()架构是一个比较好的解决方案.()
选项:
A、SMP,NUMA,NUMA,MPP
B、MPP,NUMA,NUMA,SMP
C、SMP,SMP,NUMA,MPP
D、SMP,NUMA,MPP,MPP
答案:【SMP,NUMA,NUMA,MPP】4.单选题:机器学习和深度学习之间的区别,机器学习算法使用()进行模式识别,深度学习使用()建模,两者都可以以有监督或无监督的方式学习.()
选项:
A、统计分析技术,神经网络
B、神经网络,统计分析技术
C、统计分析技术,统计分析技术
D、神经网络,神经网络
答案:【统计分析技术,神经网络】5.单选题:下列哪项不是数据处理系统的一部分?()
选项:
A、计算算法
B、计算模型.
C、计算平台和引擎.
D、数据采集与建模.
答案:【数据采集与建模.】6.单选题:有代表性的批处理计算平台,流处理计算平台。大规模并行处理MPP计算平台,内存计算平台,图并行处理计算平台是()
选项:
A、Hadoop,Greenplum,Storm,Spark,Pregel
B、Hadoop,Storm,Greenplum,Spark,Pregel
C、Hadoop,Storm,Pregel,Spark,Greenplum
D、Hadoop,Spark,Greenplum,Storm,Pregel
答案:【Hadoop,Storm,Greenplum,Spark,Pregel】7.单选题:在下面的内容中,哪一个是共享一切架构.()
选项:
A、SMP
B、NUMA
C、MPP
D、以上都不是
答案:【SMP】8.单选题:用户编写的MapReduce程序通过()提交给()。用户可以通过()提供的一些接口查看作业的运行状态.()
选项:
A、JobTracker,Client,Tasktracker
B、Client,JobTracker,Client
C、JobTracker,Tasktracker,Client
D、Tasktracker,Client,JobTracker
答案:【Client,JobTracker,Client】9.单选题:()负责资源监控和作业调度,()监控所有()和作业的健康状态,如果发现故障,会将相应的任务转移到其他节点。()将跟踪任务执行进度、资源使用情况和其他信息,并通知(),而()将在资源变为空闲时选择使用这些资源的适当任务。()
选项:
A、JobTracker,JobTracker,TaskTrackers,JobTracker,TaskScheduler,TaskScheduler
B、JobTracker,TaskTrackers,JobTracker,JobTracker,TaskScheduler,TaskScheduler
C、JobTracker,JobTracker,JobTracker,TaskTrackers,TaskScheduler,TaskScheduler
D、JobTracker,JobTracker,TaskTrackers,TaskScheduler,JobTracker,TaskScheduler
答案:【JobTracker,JobTracker,TaskTrackers,JobTracker,TaskScheduler,TaskScheduler】10.单选题:()会通过“心跳”周期性地向()报告节点上的资源使用情况和任务的进度,同时接收()发送的命令并执行相应的操作(如启动新任务、终止任务等)。()
选项:
A、JobTracker,TaskTracker,JobTracker
B、TaskTracker,TaskTracker,JobTracker
C、TaskTracker,JobTracker,JobTracker
D、JobTracker,JobTracker,TaskTracker
答案:【TaskTracker,JobTracker,JobTracker】11.单选题:()使用()来划分该节点上的资源数量(CPU、内存等)。任务在获得()后有机会运行,()的作用是在每个()上为任务分配idle()。()
选项:
A、JobTracker,slot,slot,Hadoopscheduler,slots,TaskTracker;
B、TaskTracker,slot,slot,Hadoopscheduler,slots,TaskTracker;
C、TaskTracker,slot,slot,Taskscheduler,slots,TaskTracker;
D、TaskTracker,slot,slot,Hadoopscheduler,task,TaskTracker;
答案:【TaskTracker,slot,slot,Hadoopscheduler,slots,TaskTracker;】12.单选题:分类属于()算法类别.()
选项:
A、监督学习
B、无监督学习
C、半监督学习
D、增强学习
答案:【监督学习】13.单选题:聚类属于()算法类别.()
选项:
A、监督学习
B、无监督学习
C、半监督学习
D、增强学习
答案:【无监督学习】14.单选题:Self-training属于()算法类别.()
选项:
A、监督学习
B、无监督学习
C、半监督学习
D、增强学习
答案:【半监督学习】15.单选题:蒙特卡洛方法MonteCarlo属于()算法类别.()
选项:
A、监督学习
B、无监督学习
C、半监督学习
D、增强学习
答案:【增强学习】16.单选题:1.对流计算特性和需求的正确描述包括(B)1)数据不再是分批到达,而是动态地连续到达2)计算分析需要实时、快速响应和低延迟3)数据量大,不重视数据的存储,但强调对数据的即时处理和分析4)注重整体数据的计算和分析结果,而不注重个别数据5)数据元素到达的顺序和时间无法预测或控制,计算程序必须能够响应6)动态连续数据流的实时分析计算7)得到计算结果后,数据要么导入静态数据库,要么丢弃,即一次性使用
选项:
A、12347
B、1234567
C、124567
D、123567
答案:【1234567】17.单选题:内存数据库HANA可以快速地处理数据,主要因为()
选项:
A、HANA的多核架构
B、HANA部署在高性能服务器上
C、HANA设计了快速索引机制
D、HANA把主要的数据存储在内存中
答案:【HANA把主要的数据存储在内存中】18.单选题:HANA在数据仓库中提升了数据分析的性能,以下哪一个不是性能提升的原因()
选项:
A、HANA消除了不必要的复杂结构和延迟
B、通过简化进行加速
C、由于内存计算的优势,支持HANA把OLTP业务处理,和OLAP数据分析,集成在一个数据库中。
D、用于报告和分析的专用数据仓库需要对事务性数据进行移动、转换和预处理,这带来了巨大的复杂性:有时一个企业可能拥有相同数据的三个不同副本
答案:【用于报告和分析的专用数据仓库需要对事务性数据进行移动、转换和预处理,这带来了巨大的复杂性:有时一个企业可能拥有相同数据的三个不同副本】19.单选题:在图计算中最基本的计算单元是节点,节点包含()
选项:
A、节点属性,外弧outwardarcs及其属性,一个来接受发来的所有消息的逻辑收件箱
B、节点属性,外弧outwardarcs及其属性,外弧所指向的节点ID
C、节点属性,外弧outwardarcs及其属性,外弧所指向的节点ID,一个来接受发来的所有消息的逻辑收件箱
D、外弧outwardarcs及其属性,外弧所指向的节点ID,一个来接受发来的所有消息的逻辑收件箱
答案:【节点属性,外弧outwardarcs及其属性,外弧所指向的节点ID,一个来接受发来的所有消息的逻辑收件箱】20.单选题:下面哪项关于图并行计算架构的描述是不正确的()
选项:
A、整个图被分解为多个“分区”
B、每个分区包含大量的节点
C、分区是一个执行单元并且通常有一个执行线程与之关联
D、一个"worker"机器上运行一个"partitions"
答案:【一个"worker"机器上运行一个"partitions"】21.单选题:在Spark中,()负责将应用的计算任务转换为()。()负责在工作节点上完成计算和数据存储。在每个worker上,()为分配给它的每个数据分区生成任务线程,以完成并行计算。()
选项:
A、Executor,topology,Executor,Driver
B、Driver,Directedacyclicgraph(DAG),Executor,Executor
C、Executor,Directedacyclicgraph(DAG),Executor,Driver
D、Driver,topology,Executor,Executor
答案:【Driver,Directedacyclicgraph(DAG),Executor,Executor】22.单选题:Spark的特征包括以下哪些()1)内存计算2)硬盘中计算3)延迟评估LazyEvaluation4)立即评估ImmediatelyEvaluation5)容错FaultTolerant6)不可修改Immutability7)分区Partitioning8)持久性Persistence9)粗力度操作Coarse-GrainedOperation10)细粒度操作Fine-GrainedOperation
选项:
A、2346789
B、1356789
C、135678,10
D、235678,10
答案:【1356789】23.单选题:Spark的组件可以方便地处理不同类型的计算任务,比如机器学习、流计算、图计算等,这些组件包括()1)SparkCoreAPI2)Resilientdistributeddataset(RDD),3)SparkSQL4)Sparktopology5)SparkStreaming6)MLlib(MachineLearningLibrary)7)GraphX8)Sklearn
选项:
A、12345
B、13456
C、13567
D、13578
答案:【13567】24.单选题:以下哪些属于Spark的优势()1)快速处理2)灵活性3)内存计算4)实时处理5)更好的分析6)容错7)需要额外的持久化存储
选项:
A、123567
B、123456
C、134567
D、234567
答案:【123456】25.单选题:在执行图并行计算时,以下哪些描述了master的作用?()1)协调superstep的顺序执行2)在知道所有worker都完成了上一个superstep之后,向所有worker发出信号,告知新的superstep要开始了3)ping每个worker以了解其处理状态4)定期向所有worker发出“checkpoint”命令,然后worker将其分区保存到持久图存储中
选项:
A、123
B、134
C、124
D、1234
答案:【1234】26.单选题:超步Superstep执行过程是下面哪个顺序()1)向其他节点发送消息,使它们处于活动状态;2)修改节点和弧的属性;3)去掉现在的弧或者创建一个新的弧;4)从收件箱接收消息;5)自我停止直到收到新的信息;
选项:
A、42513
B、12345
C、42135
D、42351
答案:【42513】27.单选题:执行模型基于BSP(BulkSynchronousProcessing)模型。在该模型中,多个处理单元在一系列“superstep”中并行进行。在每个“Superstep”中,处理序列应该是()a)每个处理单元首先接收来自上一个“superstep”发送给它们的所有消息;b)当所有处理单元完成消息传递(即同步点);c)可以将它打算发送给其他处理单元的消息排队;d)排队的消息将被交付给指定的处理单元,但直到下一个“superstep”才能看到;e)操作本地数据;f)可以启动下一个superstep;g)循环重复,直到达到终止条件;
选项:
A、aedcbfg
B、aecdbfg
C、acedbfg
D、adecbfg
答案:【aecdbfg】28.单选题:图并行计算的每个superstep分为两个阶段()
选项:
A、遍历Travers和转换transform
B、遍历Travers和计算compute
C、计算Compute和交互communicate
D、转换Transform和交互communicate
答案:【计算Compute和交互communicate】29.单选题:在执行图并行计算时,下列哪个不是1:n关系?()
选项:
A、Master:worker
B、worker:partition
C、partition:node
D、partition:thread
答案:【partition:thread】30.单选题:大规模并行处理MPP(MassivelyParallelProcessing)通过()的并行来提升性能.()与()合作,()与一个或者多个()合作。()并行处理查询.()在无共享架构下有自己的CPU,硬盘,内存。为持续的数据处理流水线高速进行交互。()
选项:
A、segmenthosts,Master,segmenthost,Segmenthost,segmentinstances,Segmentinstances,Segmenthosts
B、segmentinstance,Master,segmenthost,Segmenthost,segmentinstances,Segmentinstances,Segmenthosts
C、segmentinstance,Master,segmenthost,Segmenthost,segmentinstances,Segmentinstances,Segmentinstances
D、segmenthosts,Master,segmenthost,Segmenthost,segmentinstances,Segmenthosts,Segmenthosts
答案:【segmentinstance,Master,segmenthost,Segmenthost,segmentinstances,Segmentinstances,Segmenthosts】31.单选题:基于内存计算模型的并行处理框架spark可以构建在Hadoop平台上,并使用HDFS文件系统存储数据,但为了支持高效的分布式内存计算,在文件系统之上构建了()()
选项:
A、Datachunk
B、ResilientDistributeddataset(RDD)
C、DataBlock
D、dataset
答案:【ResilientDistributeddataset(RDD)】32.单选题:RDD(ResilientDistributedDataset)只有两种操作()。在()中可以对数据进行filter、join、map、reduce等操作,但不进行计算,只有在()才能进行计算,并生成结果值.()
选项:
A、mapandreduce,map,reduce
B、transformationsandaction,action,transformation
C、transformationsandaction,transformation,action
D、mapandreduce,reduce,map
答案:【transformationsandaction,transformation,action】33.单选题:()返回给驱动程序或者存储在文件中的返回值,是从RDD到result的转换过程,而()是从RDD到RDD的转换过程。只有当()被执行时,RDD才会被计算和生成,这是RDD延迟执行的根源。()
选项:
A、Action,Transformation,Action
B、Transformation,Action,Action
C、Transformation,Transformation,Action
D、Action,Transformation,Transformation
答案:【Action,Transformation,Action】34.单选题:Storm是一个原生的流处理系统,即流数据的处理是基于每条数据进行的,其并行计算是基于有向拓扑图实现的。由数据源-()和处理单元-()组成的拓扑结构。Topology定义了并行计算的(),即从功能和结构的角度设计计算步骤和过程。
选项:
A、Bolt,Spout,物理模型
B、Spout,Bolt,物理模型
C、Bolt,Spout,逻辑模型
D、Spout,Bolt,逻辑模型
答案:【Spout,Bolt,逻辑模型】35.单选题:在Storm中,()通过一组()来管理许多工作节点,每个工作节点运行一个()守护进程,监控本地节点的状态,并在必要时根据()指令启动和关闭该节点的()进程。InStorm,()managesmanyworkernodesthroughagroupof(),Eachworkernoderunsa()daemon,monitorsthestatusofthelocalnode,andstartsandshutsdownthe()processofthenodewhennecessaryaccordingto()instructions.()
选项:
A、Zookeeper,Nimbus,Supervisor,worker,Nimbus
B、Nimbus,Zookeeper,Supervisor,worker,Zookeeper
C、Nimbus,Zookeeper,Supervisor,Nimbus,worker
D、Supervisor,Zookeeper,Supervisor,worker,Nimbus
答案:【Nimbus,Zookeeper,Supervisor,Nimbus,worker】36.单选题:MPP数据库过
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 2026年大连市沙河口区增补选任人民陪审员17人考试备考题库及答案详解
- 2026广东阳江阳春市中小学校选调教师87人(编制)笔试备考试题及答案详解
- 2026届广东湘桥区订单定向医学毕业生选岗考试备考试题及答案详解
- 2026年内蒙古自治区乌兰察布市法检系统书记员招聘考试备考题库及答案详解
- 2026江西抚州市资溪县城乡建设和交通运输局招聘合同制协管人员3人考试备考试题及答案详解
- 成都市第三幼儿园蒲葵分园2026年公开招聘员额教师(7人)考试备考试题及答案详解
- 2026安徽马鞍山市当涂县引进高层次人才2人笔试备考题库及答案详解
- 2026江苏盐城市第四人民医院招聘编外专业技术人员7人考试备考试题及答案详解
- 2026年度自贡市公开选调公务员笔试参考题库及答案详解
- 2026江西吉安市安福县教育卫生事业单位引进高层次人才8人考试模拟试题及答案详解
- 煤矿入井安全操作规程培训
- 饲草产品加工工安全技能测试水平考核试卷含答案
- 甘肃省民航机场集团招聘笔试题库2026
- 《JBT 14962-2025磁悬浮离心式压缩机能效限定值及能效等级》专题研究报告
- 2025年案件管理检察业务竞赛真题及答案
- 2026广岩国际投资有限责任公司招聘14人备考题库及答案详解(各地真题)
- 券商从业人员专属2026新三板考试试题答案
- 钛白粉行业风险分析报告
- NCIC临床实践指南:免疫检查点抑制剂毒性管理指南(2026版)课件
- 氧气充装安全培训
- 2025年广东省常用非金属材料检测技术培训考核考前冲刺备考速记速练500题-含答案
评论
0/150
提交评论