版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
Hadoop经典笔试题及详细答案(企业真实版)一、单项选择题(10题,含详细答案)1、以下不属于Hadoop核心组件的是()A.HDFSB.YARNC.MapReduceD.Redis答案:D解析:Hadoop三大核心组件为HDFS(分布式文件存储)、YARN(资源调度)、MapReduce(分布式计算)。Redis是内存型缓存数据库,和Hadoop生态无核心绑定关系。2、HDFS默认的块大小是()A.64MBB.128MBC.256MBD.512MB答案:B解析:Hadoop2.x及后续稳定版本默认块大小为128MB,1.x版本默认64MB。企业生产环境大多基于2.x/3.x版本,标准答案为128MB。3、HDFS中负责存储元数据的节点是()A.DataNodeB.NameNodeC.ResourceManagerD.NodeManager答案:B解析:NameNode是HDFS主节点,统一管理文件系统的目录结构、文件块映射、副本位置等元数据;DataNode仅负责存储真实的文件数据块。4、YARN中负责整个集群资源统一调度的组件是()A.NodeManagerB.ResourceManagerC.ApplicationMasterD.Container答案:B解析:ResourceManager是YARN集群全局资源调度中心,负责接收任务、分配资源、管理所有节点;NodeManager是单节点资源管理者,仅负责本机资源管控。5、MapReduce任务中,负责对map输出数据进行分区的阶段是()A.MapB.ShuffleC.ReduceD.Commit答案:B解析:Shuffle是MapReduce核心数据整理阶段,包含分区、排序、合并、拉取数据等核心操作,是连接Map和Reduce的关键流程。6、HDFS默认的文件副本数是()A.1B.2C.3D.4答案:C解析:HDFS默认副本系数为3,默认策略为:第一个副本存本地节点,第二个副本存同机架不同节点,第三个副本存不同机架节点,最大程度保证数据可靠性。7、以下哪项不是MapReduce的特点()A.离线批量计算B.高实时性C.容错性好D.易于扩展答案:B解析:MapReduce是典型的离线分布式计算框架,任务启动、调度、Shuffle流程耗时较高,无法满足实时计算场景,高实时性是Spark、Flink等框架的特点。8、HDFS中SecondaryNameNode的主要作用是()A.实时备份元数据B.辅助合并镜像文件和日志文件C.管理数据块存储D.调度集群任务答案:B解析:SecondaryNameNode并非NameNode备用节点,不具备实时容错接管能力,核心作用是定期合并fsimage和edits日志,清理旧日志,减轻NameNode压力。9、MapReduce中,Reduce任务的执行顺序是()A.排序→合并→聚合B.拉取→排序→合并→迭代聚合C.合并→拉取→聚合D.拉取→聚合→排序答案:B解析:Reduce首先通过HTTP拉取所有Map节点的输出数据,对数据进行全局排序、归并合并,最后遍历相同key的数据集完成聚合计算。10、YARN中Container的作用是()A.存储元数据B.封装资源和任务运行环境C.管理集群节点D.分发任务答案:B解析:Container是YARN资源调度的最小单位,封装了CPU、内存等资源,同时为任务提供独立的运行环境,所有任务都运行在Container中。二、多项选择题(5题,含详细答案)1、HDFS架构中,以下属于DataNode工作内容的有()A.存储真实数据块B.定期上报块状态C.响应客户端读写请求D.维护文件目录元数据答案:ABC解析:维护文件目录、块映射等元数据是NameNode的专属工作,DataNode仅负责数据存储、心跳上报、响应读写请求、副本冗余维护。2、MapReduceShuffle阶段包含的操作有()A.分区B.排序C.归并D.拉取数据答案:ABCD解析:完整Shuffle流程包含:Map端分区、快速排序、溢写、归并合并;Reduce端拉取数据、再次排序合并,是整套数据规整流程。3、以下属于Hadoop集群容错机制的有()A.数据副本机制B.任务重试机制C.心跳检测机制D.元数据镜像恢复机制答案:ABCD解析:Hadoop多层容错:HDFS通过副本、fsimage+edits保证数据容错;YARN和MapReduce通过心跳检测节点状态、失败任务自动重试,保证任务容错。4、导致MapReduce任务数据倾斜的常见原因有()A.个别Key数据量远超其他KeyB.分区算法不均匀C.空值、异常值过多D.Reduce任务数量设置过多答案:ABC解析:数据倾斜核心是数据分发不均,大量数据集中在少数Reduce节点。Reduce数量过多只会导致任务碎片化,不会造成数据倾斜。5、YARN核心组件包含()A.ResourceManagerB.NodeManagerC.ApplicationMasterD.Container答案:ABCD解析:四者共同构成YARN调度体系,各司其职完成资源申请、调度、任务运行、节点管理全流程。三、判断题(5题,含详细答案)1、HDFS适合存储大量小文件。()答案:错误解析:HDFS每个文件都会占用一条元数据记录,大量小文件会耗尽NameNode内存,降低集群性能,HDFS更适合存储大文件。2、SecondaryNameNode可以在NameNode故障时直接接管集群。()答案:错误解析:SecondaryNameNode仅定期合并元数据文件,无法实时同步最新日志,NameNode故障后无法直接接管,仅能恢复历史合并后的元数据,新版本Hadoop依靠HA机制实现主备切换。3、MapReduce中Map任务的数量由文件切片数量决定。()答案:正确解析:默认情况下,一个文件切片对应一个Map任务,切片大小默认等于HDFS块大小,可通过参数自定义调整。4、YARN中ApplicationMaster是每个任务独有的。()答案:正确解析:每提交一个应用任务,就会启动一个独立的ApplicationMaster,负责向ResourceManager申请资源、协调本任务的所有Container。5、HDFS写入数据时,支持随机写入、修改文件中间数据。()答案:错误解析:HDFS仅支持文件追加写入,不支持随机修改、覆盖已有数据,该设计是为了适配分布式存储的高可用、高吞吐特性。四、简答题(6道高频真题,详细解析)1、简述HDFS读写文件的完整流程答:写入流程:1.客户端发起文件写入请求,向NameNode申请创建文件,NameNode校验权限和文件状态,返回成功;2.客户端将文件按块切片,向NameNode请求对应的数据节点列表;3.NameNode根据副本策略,返回最优的DataNode节点列表;4.客户端将数据块以流水线方式依次写入第一个节点,第一个节点同步数据到第二个、第三个副本节点;5.单个数据块写入完成后,依次确认应答,继续写入下一个数据块;6.所有数据块写入完成,客户端通知NameNode关闭文件,写入流程结束。读取流程:1.客户端向NameNode请求读取指定文件,NameNode返回文件对应的所有数据块及存储节点位置;2.客户端根据节点就近原则,选择距离最近的DataNode读取数据块;3.依次读取所有数据块,拼接成完整文件;4.读取过程中若节点故障,客户端自动切换到该数据块的副本节点继续读取。2、简述MapReduce的核心执行流程答:1.任务初始化:客户端提交任务,YARN分配资源,启动ApplicationMaster;2.切片与Map阶段:对输入文件切片,启动对应数量的Map任务,读取数据,执行map逻辑输出key-value数据;3.Shuffle阶段:Map端对数据分区、排序、溢写、归并;Reduce端拉取对应分区数据,二次排序合并;4.Reduce阶段:对相同key的数据集执行聚合计算,输出最终结果;5.任务结束:所有任务执行完成,回收资源,任务结束。3、什么是数据倾斜?MapReduce数据倾斜的解决方案有哪些?答:数据倾斜定义:任务执行过程中,绝大部分数据集中在少数Reduce节点,导致部分任务执行极慢,整体任务卡死、超时,其余节点资源闲置的现象。常用解决方案:1.预处理过滤:提前清洗空值、异常值、无效key,从源头减少倾斜数据;2.key加盐打散:对热点key添加随机前缀,将集中的数据分散到多个Reduce节点,完成计算后再聚合结果;3.自定义分区:重写分区算法,对热点key单独分区,避免数据扎堆;4.拆分任务:将倾斜数据和正常数据拆分计算,最后合并结果;5.调整参数:开启本地聚合,减少Shuffle阶段的数据传输量。4、NameNode故障恢复机制是什么?答:NameNode元数据由fsimage(元数据镜像文件)和edits(操作日志文件)组成,故障恢复依靠两套文件完成:1.NameNode正常运行时,所有读写操作实时记录在edits日志中,fsimage仅作为静态镜像;2.SecondaryNameNode定期拉取fsimage和edits日志,合并生成新的完整fsimage,替换旧镜像、清空旧日志;3.当NameNode故障重启时,会加载最新的fsimage镜像,并重放未合并的edits日志,恢复故障前的完整元数据状态,保证集群数据不丢失。高可用集群中,会通过Zookeeper实现主备NameNode自动切换,实现故障秒级恢复。5、简述Hadoop小文件问题的危害及解决方案答:主要危害:1.每个小文件占用一条NameNode元数据,大量小文件会耗尽NameNode内存,导致集群卡顿、宕机;2.小文件会产生大量Map任务,任务启动开销远大于计算开销,大幅降低任务执行效率;3.增加磁盘寻址开销,降低HDFS读写吞吐率。解决方案:1.数据采集阶段合并小文件,批量写入HDFS;2.使用Hive、Spark合并历史小文件,定时归档;3.开启Hadoop小文件合并参数,优化切片逻辑;4.使用SequenceFile、ORC等列式存储格式存储小文件数据。6、YARN资源调度的三种调度器区别是什么?答:1.默认调度器(FIFO):先进先出,按任务提交顺序依次执行,简单高效,适合测试单机集群,不适合多用户多任务生产集群,高优先级任务无法插队。2.容量调度器(CapacityScheduler):Apache默认生产调度器,支持多队列配置,为每个队列分配固定资源配额,保证核心业务资源,支持任务抢占和资源共享,稳定性强。3.公平调度器(FairScheduler):CDH版本默认调度器,不固定配额,动态分配资源,保证所有任务平均占用集群资源,适合多业务公平共享集群的场景。五、综合应用题(1道笔试高频大题)题目:现有一份用户访问日志文件,需要统计每个用户的访问次数,请简述MapReduce实现思路、key-value设计、执行逻辑答题思路:1、数据格式:每行数据为一条用户访问记录,包含用户ID、访问时间、访问地址等信息,核心字段为用户ID。2、Key-Value设计Map阶段:key=用户ID,value=1(单条访问记录计数1)Reduce阶段:key
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 2026年新乡卫滨区(平原镇、开发区)招录乡镇消防救援站消防员12名笔试模拟试题及答案解析
- 2026贵州铜仁市德江县消防救援大队招聘政府专职消防员9人笔试备考题库及答案解析
- 2026年农安县教师招聘笔试备考试题及答案解析
- 2026年义县教师招聘笔试备考试题及答案解析
- 2026年郎溪县教师招聘笔试参考题库及答案解析
- 2026年南靖县教师招聘考试模拟试题及答案解析
- 2026年浦城县教师招聘笔试备考题库及答案解析
- 2026浙商期货有限公司招聘5人考试模拟试题及答案解析
- 2026版培植工程施工合同(示范文本)解读
- 2026年投资与资产管理行业市场运行态势报告及未来五至十年第二曲线与持续增长
- (2026秋新版)人教版五年级数学上册全册教案
- 2026年中国华电集团招聘考试综合知识题库
- 供热典型事故案例分析
- 七年级英语第一次月考卷(全解全析)(仁爱版2024)
- 2025年大学天文学(天体物理基础)试题及答案
- 中药鉴定技术 课件 第一章 中药鉴定技术概要
- 生命统计考试试题及答案
- 2025至2030中国微型线材指南行业项目调研及市场前景预测评估报告
- 雨课堂在线学堂《管理沟通的艺术》作业单元考核答案
- 《陆上风力发电机组钢混塔架施工与质量验收规范》
- 儿童健康体检知识培训课件
评论
0/150
提交评论