Hadoop 基础综合试题及参考答案(实战版)_第1页
Hadoop 基础综合试题及参考答案(实战版)_第2页
Hadoop 基础综合试题及参考答案(实战版)_第3页
Hadoop 基础综合试题及参考答案(实战版)_第4页
Hadoop 基础综合试题及参考答案(实战版)_第5页
全文预览已结束

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

Hadoop基础综合试题及参考答案(实战版)适用场景:大数据入门考核、企业面试笔试、课程结课考试难易程度:基础+中等,贴合实际生产、无偏题怪题考试时长:90分钟总分:100分一、单项选择题(每题2分,共20分)1.以下不属于Hadoop核心组件的是()A.HDFSB.MapReduceC.SparkD.YARN2.HDFS默认的文件系统副本系数是()A.1B.2C.3D.43.HDFS中负责存储元数据、管理文件目录的节点是()A.DataNodeB.NameNodeC.ResourceManagerD.NodeManager4.YARN集群中,负责全局资源调度、管理所有节点的核心服务是()A.NodeManagerB.ResourceManagerC.ApplicationMasterD.Container5.MapReduce程序中,负责数据分片、排序、分区的阶段是()A.Map阶段B.Reduce阶段C.Shuffle阶段D.输出阶段6.HDFS块的默认大小(Hadoop3.x)是()A.64MB.128MC.256MD.512M7.以下关于DataNode的说法错误的是()A.负责存储实际文件数据块B.定期向NameNode上报心跳C.集群中只能部署一个D.宕机会导致数据副本重构8.MapReduce中Combiner的主要作用是()A.全局排序B.本地预聚合,减少网络传输数据量C.划分数据分区D.管理任务资源9.Hadoop集群中,负责监控单节点资源、启动容器的组件是()A.ResourceManagerB.NodeManagerC.NameNodeD.SecondaryNameNode10.SecondaryNameNode的核心作用是()A.实时备份NameNode数据B.处理客户端读写请求C.定期合并fsimage和edits日志D.存储文件数据块二、填空题(每空2分,共20分)1.Hadoop三大核心组件是________、________、________。2.HDFS的工作机制是________架构,分为主节点和从节点。3.MapReduce程序的核心执行流程分为________、________、________三个核心阶段。4.YARN中________是资源运行的基本单位,所有任务都在其中运行。5.HDFS客户端写入文件采用________机制,保证数据可靠性。6.当DataNode超过________时间未上报心跳,NameNode会判定其宕机。三、简答题(每题8分,共40分)1.简单说明HDFS的优缺点。2.简述MapReduceShuffle阶段的完整执行流程。3.说明NameNode和SecondaryNameNode的区别,SecondaryNameNode为什么不能做主节点高可用?4.简述YARN的工作原理,以及各个组件的职责。5.说说Hadoop副本机制的作用,以及副本的存储策略。四、实操应用题(每题10分,共20分)1.请写出常用的5个HDFSShell命令,并说明其作用。2.简述经典的WordCount单词统计案例的执行逻辑(Map阶段、Reduce阶段分别做什么)。参考答案一、单项选择题答案1.C2.C3.B4.B5.C6.C7.C8.B9.B10.C二、填空题答案1.HDFS、YARN、MapReduce2.主从(Master-Slave)3.Map、Shuffle、Reduce4.Container5.流水线复制6.10分钟(默认超时时间)三、简答题答案1.HDFS的优缺点优点:1)高容错,通过多副本机制避免数据丢失;2)适合超大文件存储,支持PB级海量数据;3)可横向扩展,集群节点可按需扩容;4)成本低,可搭建在普通廉价服务器上;5)高吞吐量,适合批量数据读写场景。缺点:1)不适合低延迟、实时数据访问;2)不适合大量小文件存储,会占用大量NameNode内存;3)不支持随机文件修改,仅支持追加写入。2.MapReduceShuffle阶段执行流程Shuffle是Map端输出到Reduce端输入的核心数据处理过程,流程如下:1)Map任务输出键值对数据,先写入本地环形缓冲区;2)缓冲区满后触发溢写,对数据进行分区、排序,可通过Combiner本地聚合;3)溢写生成多个临时文件,任务结束后合并成一个有序文件;4)Reduce端通过HTTP拉取对应分区的Map输出数据;5)Reduce端对拉取的数据进行归并排序,分组后交给Reduce函数处理。3.NameNode和SecondaryNameNode区别1)NameNode是HDFS主节点,全程管理元数据、处理客户端读写请求、维护文件系统目录,是集群核心,实时工作;2)SecondaryNameNode不是NameNode备用节点,核心工作是定期下载NameNode的fsimage镜像文件和edits编辑日志,合并生成新的镜像文件,减轻NameNode压力;3)无法做主节点高可用的原因:SecondaryNameNode无法实时同步NameNode的最新日志数据,存在数据延迟和丢失风险,集群故障时不能无缝接管服务,仅能做数据恢复辅助。4.YARN工作原理及组件职责YARN是Hadoop的资源调度框架,核心实现资源统一管理和任务调度,主要组件及职责:1)ResourceManager(RM):全局资源管理者,负责接收客户端任务请求、分配集群资源、调度任务,管理所有NodeManager;2)NodeManager(NM):单节点资源管理者,负责监控本机CPU、内存资源,启动和管理Container容器,上报节点状态;3)ApplicationMaster(AM):每个任务的专属管理者,向RM申请资源,和NM协作启动、运行、监控任务;4)Container:资源运行容器,封装CPU、内存等资源,所有任务进程都在Container中运行。工作流程:客户端提交任务-RM接收任务并分配节点资源-启动AM-AM申请Container资源-NM启动容器运行任务-任务执行完毕释放资源。5.Hadoop副本机制作用及存储策略核心作用:解决集群节点故障、磁盘损坏导致的数据丢失问题,保障数据高可用、高容错,同时提升数据读取的负载均衡能力。默认3副本存储策略:1)第一个副本存储在当前写入的本地节点;2)第二个副本存储在同一机架的不同节点;3)第三个副本存储在不同机架的节点。该策略兼顾数据安全性和读写性能,避免单机架故障导致数据全部丢失。四、实操应用题答案1.常用HDFSShell命令及作用1)hdfsdfs-ls路径:查询HDFS指定路径下的文件和目录;2)hdfsdfs-put本地路径HDFS路径:将本地文件上传到HDFS集群;3)hdfsdfs-getHDFS路径本地路径:将HDFS文件下载到本地;4)hdfsdfs-mkdir路径:在HDFS中创建目录;5)hdfsdfs-rm路径:删除HDFS中的指定文件;补充:hdfsdfs-cat路径:查看HDFS文件内容。2.WordCount单词统计执行逻辑Map阶段:读取HDFS中的文本文件,按行切割数据,将每行文本按空格、标点等分隔符拆分为单个单词,输出<单词

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

最新文档

评论

0/150

提交评论