《大数据技术原理和应用操作》试卷A卷及答案_第1页
《大数据技术原理和应用操作》试卷A卷及答案_第2页
免费预览已结束,剩余1页可下载查看

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

1、 5/5大数据技术原理和应用操作试卷A卷及答案 大数据技术原理和应用操作试卷A卷 一、单选题(每题2分,共计20分) 1.下列选项中,用于获取Zookeeper所包含的信息的Shell命令是()。 A、ls B、ls2 C、r D、get 2.MapReduce处理数据的工作流程大致分为()步。 A、两 B、三 C、四 D、五 3.下列选项中,关于HDFS的架构说法正确的是()。 A、HDFS采用的是主备架构 B、HDFS采用的是主从架构 C、HDFS采用的是从备架构 D、以上说法均错误 4.下列选项中,若是哪个节点关闭了,就无法访问Hadoop集群()。 A、namenode B、datan

2、ode C、secondary namenode D、yarn 5.下列选项中,Hadoop2.x版本独有的进程是()。 A、JobTracker B、TaskTracker C、NodeManager D、NameNode 6.下列选项中,存放Hadoop配置文件的目录是()。 A、include B、bin C、libexec D、etc 7.下列选项中,最早提出“大数据”这一概念的是()。 A、贝恩 B、麦肯锡 C、吉拉德 D、杰弗逊 8.HDFS中的Block默认保存()份。 A、3份 B、2份 C、1份 D、不确定 9.下列选项中,主要用于决定整个MapReduce程序性能高低的阶段

3、是()。 A、MapTask B、ReduceTask C、分片、格式化数据源 D、Shuffle 10在配置Linux网络参数时,固定IP地址是将路由协议配置为()。 A、static B、dynamic C、immutable D、variable 二、多选题(每题2分,共计20分) 下列选项中,属于Hadoop优势的有()。 A、扩容能力强 B、可靠性 C、低效率 D、高容错性 下列哪项可以作为集群的管理? A、Puppet B、Pdsh C、Cloudera Manager D、Zookeeper 下列选项中,属于Hadoop版本系列的有()。 A、Hadoop4 B、Hadoop2

4、C、Hadoop1 D、Hadoop3 Hadoop提供的自定义配置时编辑的配置文件中,包含()。 A、core-site.xml B、hdfs-site.xml C、mapred-site.xml D、yarn-site.xml 下列说法中,关于crontab表达式说法正确的是()。 A、通过执行crontab表达式可以执行定时任务 B、crontab表达式是由6个参数决定 C、Crontab表达式是由5个参数决定 D、以上说法均正确 在Zookeeper选举过程中,一共有四种状态,分别是()。 A、竞选状态 B、随从状态 C、观察状态 D、领导者状态 下列选项中,属于Sqoop指令的参数有

5、()。 A、import B、output C、input D、export 下列选项中,关于Hadoop集群说法正确的是()。 A、Hadoop集群包含Worker节点 B、Hadoop集群包含Master节点 C、Hadoop集群包含Slave节点 D、Hadoop集群包含HMaster节点 下列选项中,属于Google提出的处理大数据的技术手段有()。 A、MapReduce B、MySQL C、BigTable D、GFS Hive数据表插入数据时,insert()table ,括号中可使哪些关键字? A、into B、append C、overwrite 三、判断题(对的打“”,错的

6、打“”;每题1分,共10分) 1.由于Hadoop是使用Java语言编写的,因此可以使用Java API操作Hadoop文件系统。( ) 2.大数据提供的是一些描述性的信息,而创新还是需要人类自己实现。( ) 3.带有倒排索引的文件我们称为倒排索引文件,简称倒排文件。( ) 4.Hadoop集群执行完MapReduce程序后,会输出_SUCCESS和part-r-00000结果文件。( ) 5.传统文件系统存储数据时,若文件太大,会导致上传和下载非常耗时。( ) 通过使用虚拟机软件(如VMware Workstation),可以在同一台电脑上构建多个Linux 虚拟机环境。( ) 6.Zook

7、eeper的选举机制,实际上是采用算法FastLeaderElection,投票数大于半数则胜出的机制。( ) 7.在Hadoop的解压目录下的bin目录,存放的是Hadoop的配置文件。( ) 8.Hadoop HA是集群中启动两台或两台以上机器充当NameNode,避免一台NameNode节点发生故障导致整个集群不可用的情况。( ) 9.在安装配置windows平台hadoop,配置后直接运行是没有问题的。( ) 四、填空题(每题2分,共计20分) 1.Flume的核心是把数据从数据源通过数据采集器(Source)收集过来,再将收集的数据通过【】汇集到指定的接收器(Sink)。 2.Sqo

8、op连接器,它用于实现与各种关系型数据库的连接,从而实现数据的【】和导出操作。 3.Hive的安装模式分为【】、本地模式、远程模式三种形式。 4.VMware提供了两种类型的克隆,分别是完整克隆和【】。 5.Hadoop支持在【】系统和Windows系统上进行安装使用。 6.Hadoop的解压目录下【】目录存放的是Hadoop管理脚本,包含HDFS和YARN中各类服务的启动/关闭脚本。 7.一般关于日志文件产生都是根据【】而决定。 8.在部署Sqoop时,需要在sqoop-env.sh配置文件中添加【】环境。 9.当出现【】时,说明Hadoop集群已经被格式化成功。 10.Flume分为两个版

9、本,分别是Flume-og、【】。 六、简答题(每题6分,共计30分) 1.启动Hive方式有哪些? 2.简述大数据在零售行业应用的具体表现。 简述event。 3.简述单点故障的产生。 4.简述如何检查Namenode是否正常运行。 参考答案 单选题(每题2分,共计20分) 1.D 2.D 3.B 4.A 5.C 6.D 7.B 8.A 9.D 10.A 多选题(每题2分,共计20分) 1.A,B,D 2.A,B,D 3.B,C,D 4.A,B,C,D 5.A,B 6.A,B,C,D 7.A,D 8.B,C 9.A,C,D 10.A,C 判断题(每题1分,共计10分) 1.对 2.对 3.对

10、 4.对 5.对 6.对 7.对 8.错 9.对 10.错 填空题(每题2分,共计20分) 1.【缓冲通道(Channel)】 2.【导入】 3.【嵌入模式】 4.【链接克隆】 5.【Linux】 6.【sbin】 7.【业务】 8.【Hadoop】 9.【successfully formatted】 10.【Flume-ng】 简答题(每题6分,共计30分) 1.正确答案:1.bin/hive、 2.bin/hiveserver2 2.正确答案:大数据在零售行业的具体表现有三个,分别是精准定位零售行业市场、支撑行业收益管理以及挖掘零售业新需求。 3.正确答案:它是Flume内部数据传输的基本单元。

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

最新文档

评论

0/150

提交评论