版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
Hadoop大数据经典面试题(企业真实版)本次面试题贴合一线互联网、数仓公司真实面试口径,剔除书面化套话,聚焦实操、原理、故障排查、性能调优,适配大数据开发、运维、数仓岗位初/中级面试,无冗余理论,全部为高频必考内容。一、Hadoop基础核心面试题(入门必考)1、简单说下Hadoop的核心组件和各自作用?参考答案:Hadoop核心由三大组件构成,分别是HDFS、YARN、MapReduce。HDFS是分布式文件系统,负责海量数据的分布式存储,解决大数据持久化存储问题;YARN是资源调度框架,负责集群内存、CPU资源的分配、任务调度和资源管理,是整个Hadoop集群的资源管家;MapReduce是分布式计算框架,负责离线批量数据计算,将复杂计算拆分、分布式执行、合并结果,解决海量数据计算效率问题。2、Hadoop1.x、2.x、3.x的核心区别是什么?参考答案:1.x版本架构简陋,存在单点故障,MapReduce既负责计算又负责资源调度,资源利用率极低,不支持高可用;2.x最大的革新是拆分了计算和调度,独立出YARN资源调度框架,实现MR和其他计算框架(Spark、Flink)共享集群资源,同时实现了HDFS、ResourceManager高可用,解决单点故障问题;3.x主要优化是摒弃了冗余的副本机制,采用纠删码技术节省磁盘空间,优化集群负载均衡,提升集群稳定性和资源利用率,同时修复大量bug,支持更高规模的集群节点扩容。3、Hadoop集群的搭建核心步骤有哪些?生产环境需要重点注意什么?参考答案:核心步骤:配置服务器主机名与hosts映射、关闭防火墙和selinux、配置免密登录、安装JDK并配置环境变量、解压Hadoop安装包、配置核心配置文件、分发配置文件、格式化HDFS、启动集群并校验节点状态。生产环境重点注意:禁止root用户启动集群、时间同步必须开启、配置文件权限严格管控、关闭自动休眠、预留磁盘和内存冗余、开启日志持久化,禁止单机多角色部署核心服务。4、Hadoop的优缺点分别是什么?参考答案:优点:高可靠性,数据多副本存储,节点故障不丢失数据;高扩展性,可横向扩容上千节点;低成本,基于普通物理服务器搭建,无需高端硬件;高吞吐,适合海量离线批量数据处理;开源生态完善,兼容各类大数据组件。缺点:延迟高,不适合实时低延迟计算;小文件处理效率极低;不支持频繁随机读写数据;集群运维成本较高。二、HDFS架构与原理高频题(重中之重)1、讲解HDFS的架构组成,NameNode、DataNode、SecondaryNameNode的作用?参考答案:HDFS采用主从架构,一个主节点搭配多个从节点。NameNode是主节点,核心管理HDFS的元数据,包括文件目录结构、文件与块的映射关系、块存储节点位置,不存储真实业务数据,全程基于内存运行;DataNode是从节点,负责真实数据块的存储、读写响应、数据副本维护,定时向NameNode上报心跳和块状态;SecondaryNameNode不是NameNode备用节点,核心作用是辅助NameNode合并fsimage和edits日志,定期备份元数据,减轻NameNode压力,无法实时接管主节点服务。2、HDFS默认块大小是多少?为什么设置这么大?小文件过多有什么危害?参考答案:Hadoop2.x默认块大小128M,3.x默认256M。设置大块的核心原因:减少元数据数量,降低NameNode内存压力;减少磁盘寻道次数,提升大批量数据读写吞吐。小文件过多危害:每个小文件都会生成一条元数据,大量占用NameNode内存,导致集群性能下降、卡顿;任务切片过多,产生大量Map任务,占用YARN资源,任务调度效率极低;磁盘碎片化严重,读写性能变差。3、HDFS的副本机制是什么?默认副本数多少?副本存放策略?参考答案:HDFS默认3副本机制,保证数据高可用。副本存放策略:第一个副本存放在客户端所在节点;第二个副本存放在同机架的不同节点;第三个副本存放在不同机架的节点。该策略既能保证数据安全性,避免机架故障导致数据丢失,又能兼顾数据读写的网络效率。4、NameNode宕机后集群会怎么样?如何恢复?参考答案:普通非HA集群中,NameNode宕机后,整个HDFS集群无法写入新数据,已有的数据无法查询元数据,只读不可写,所有依赖HDFS的任务都会阻塞失败。恢复方式:重启NameNode服务,服务启动后会加载本地fsimage文件,回放edits日志恢复最新元数据,重启完成后集群恢复正常读写。HA集群中,备用NameNode会自动切换为主节点,集群无感知,不影响业务。5、讲解HDFS的读写流程?参考答案:写入流程:客户端发起文件写入请求→NameNode校验权限、路径合法性,返回可用DataNode节点列表→客户端将数据切块,分批写入第一个DataNode,同时通过流水线机制同步副本到其他节点→所有块写入完成后,客户端通知NameNode更新元数据,写入完成。读取流程:客户端请求读取文件→NameNode查询元数据,返回文件块对应的存储节点列表→客户端就近选择节点读取数据,优先本地、同机架节点→数据读取完成,校验数据完整性,异常则读取副本数据。三、YARN资源调度核心面试题1、YARN的核心组件及各自职责?参考答案:ResourceManager:全局资源调度者,负责接收客户端任务、分配集群资源、管理NodeManager、调度任务队列,是YARN的主节点;NodeManager:每个节点的资源管理者,负责单节点的内存、CPU管控,启动、监控、销毁容器,定时上报节点资源状态;ApplicationMaster:每个任务的专属管理者,由ResourceManager分配资源后启动,负责拆分任务、申请资源、监控任务运行、处理任务异常;Container:资源容器,是YARN资源分配的最小单位,封装任务运行所需的内存、CPU、磁盘资源。2、YARN的任务运行完整流程?参考答案:客户端向ResourceManager提交任务请求→RM接收请求,分配资源启动ApplicationMaster→AM向RM申请运行任务所需的Container资源→RM调度空闲节点的NodeManager创建Container→AM在容器中启动Map/Reduce任务→任务运行过程中,NM实时监控任务状态,上报RM→任务执行完成后,释放容器资源,AM注销,任务结束。3、YARN有哪些调度器?各自适用场景?参考答案:三种核心调度器:FIFO调度器,先进先出,单队列执行,适合测试环境,生产环境几乎不用;容量调度器(CapacityScheduler),多队列、多用户,支持队列资源分配、抢占,适合大型集群、多部门共用场景,是Hadoop默认调度器;公平调度器(FairScheduler),动态均衡资源,保证所有任务公平占用资源,适合交互式任务、实时性要求较高的场景。4、YARN任务经常出现资源不足、任务卡顿的原因有哪些?如何解决?参考答案:常见原因:队列资源配置过小、单任务申请资源过大、小任务过多抢占资源、节点资源负载过高、任务数据倾斜、容器内存溢出。解决方式:调整队列资源配额、优化任务资源参数、合并小任务、开启资源抢占机制、优化数据倾斜问题、扩容集群节点、限制单用户任务并发数。四、MapReduce计算框架面试题1、MapReduce的运行流程、阶段划分?参考答案:整体分为5个核心阶段:Input输入阶段,读取HDFS数据,完成数据切片、格式化;Map阶段,并行处理每一片数据,完成数据过滤、转换、分组;Shuffle阶段,对Map输出数据分区、排序、合并、拉取数据,是MR的核心瓶颈阶段;Reduce阶段,对分组数据聚合计算,输出最终结果;Output输出阶段,将结果写入HDFS持久化。2、详细说说Shuffle机制,为什么Shuffle是MR性能瓶颈?参考答案:Shuffle是Map输出到Reduce输入的数据整理过程,分为Map端Shuffle和Reduce端Shuffle。Map端:数据写入环形缓冲区,满溢后本地排序、分区、合并小文件;Reduce端:主动拉取Map节点的输出数据,再次合并排序。瓶颈原因:涉及大量磁盘IO、网络传输、排序合并操作,数据量大时会产生大量临时文件,占用磁盘和网络资源,极易出现数据拥堵、任务超时,是整个MR任务耗时最长的阶段。3、MapReduce的数据倾斜是什么?如何解决?参考答案:数据倾斜是指相同key的数据量远超其他key,导致个别Reduce任务数据量巨大、运行缓慢,整体任务卡死、超时失败。解决方案:预处理过滤无效key、对倾斜key加盐打散、局部聚合先combiner再reduce、拆分倾斜key单独计算、调整分区规则、优化数据清洗逻辑。4、Combiner的作用是什么?什么时候可以使用?参考答案:Combiner是Map端的局部聚合器,核心作用是在数据发送到Reduce之前,提前聚合本地重复key数据,减少网络传输数据量,降低Shuffle压力,提升任务效率。适用场景:聚合运算满足交换律、结合律,如求和、计数、最大值、最小值;不适用场景:平均值、中位数等不支持局部聚合的运算。五、集群故障排查与实操面试题(生产高频)1、HDFS启动失败,常见原因和排查思路?参考答案:常见原因:主机名映射错误、免密登录失效、防火墙/selinux未关闭、磁盘空间不足、日志目录权限不足、多次格式化导致集群ID不一致、时间不同步。排查思路:优先查看服务启动日志、核对配置文件参数、检查节点网络互通、校验磁盘权限和空间、核对集群UUID、同步服务器时间。2、DataNode节点掉线的原因?如何处理?参考答案:常见原因:节点心跳超时、磁盘故障、网络中断、节点资源耗尽、HDFS版本不一致、服务器宕机。处理方式:首先查看掉线节点日志,排查网络和服务器状态;临时故障重启DataNode服务即可恢复;磁盘损坏则下线节点、更换磁盘、重新同步数据;长期异常节点手动下线,避免影响集群均衡。3、YARN任务报OOM内存溢出,如何排查解决?参考答案:排查步骤:查看任务日志定位溢出阶段(Map/Reduce)、分析是否数据倾斜、查看任务处理数据量、核对容器内存配置。解决方式:调大Map/Reduce容器内存参数、开启JVM堆内存优化、优化代码减少内存占用、解决数据倾斜、拆分大任务、增加局部聚合。4、HDFS小文件过多,生产环境如何优化处理?参考答案:优化方案:通过Hive/Spark任务合并小文件、定时脚本批量合并历史小文件、设置文件写入阈值自动合并、调整切片规则减少小文件输出、开启HDFS归档功能、规范业务写入逻辑,避免频繁写入小批量数据。六、性能调优面试题(进阶必考)1、HDFS核心调优参数有哪些?各自作用?参考答案:核心参数:dfs.blocksize调整数据块大小,适配大文件场景;dfs.replication调整副本数,平衡安全和磁盘占用;erval调整心跳间隔,提升节点感知速度;dfs.datanode.max.transfer.threads调整传输线程数,提升读写并发;优化元数据加载参数,提升NameNode响应速度。2、MapReduce任务整体调优思路?参考答案:整体从四个维度调优:数据层面,清洗无效数据、解决数据倾斜、合并小文件;Shuffle层面,调优环形缓冲区大小、开启压缩、优化排序合并参数;资源层面,合理配置Map/Reduce内存、CPU资源,避免资源浪费和溢出;任务层面,合理设置切片大小、启用Combiner局部聚合、复用JVM提升任务启动效率。3、YARN集群资源调优怎么做?参考答案:根据服务器硬件配置,合理设置单节点最大内存、CPU分配上限;划分多业务队列,隔离离线、实时任务;设置队列最小/最大资源配额、任务并发数;开启资源抢占,避免大任务长期占用资源;关闭空闲容器,释放冗余资源;根据任务运行情况动态调整资源参数。七、场景化面试真题(面试官最爱问)1、线上海量日志数据,每天10TB,存在大量小文件,任务运行越来越慢,怎么处理?参考答案:第一步,临时优化,定时执行合并脚本,批量合并历史小文件,释放NameNode内存;第二步,源头优化,调整日志采集写入规则,批量写入文件,避免碎片化;第三步,任务优化,计算任务前增加合并逻辑,启用Combiner聚合,优化Shuffle参数;第四步,长期优化,开启HDFS归档,规范数据分层存储,
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 2025-2026学年初中二英语说课稿
- 2025-2026学年大班音乐说课稿影子
- 2025-2026学年7上春说课稿
- 2025-2026学年七下家乡说课稿
- 2025-2026学年初一人教版下册说课稿
- 2025-2026学年关于作文写作的说课稿
- 配膳员岗前健康知识考核试卷含答案
- 硬质合金精加工工岗前实操综合知识考核试卷含答案
- 2025-2026学年初中秋水庄子说课稿
- 乒乓球制作工岗前专项应用考核试卷含答案
- 2025年中国养老地产行业市场研究报告:CCRC与居家养老
- 2026-2027学年人教版八年级上学期数学第一次月考模拟测试抢分卷(含答案)
- 教师五年专业发展目标达成情况个人总结
- (2026秋新版)苏教版五年级数学上册全册教案
- 2026北京急救中心第三批招聘27人笔试参考题库及答案解析
- 2025年四川省纪委监委遴选笔试题库及答案
- 骨科脊柱退变性疾病保守治疗规范
- 煤矿作业规程培训课件
- 雨课堂学堂云在线《人工智能原理》单元测试考核答案
- 【MOOC】《知识创新与学术规范》(南京大学)期末考试慕课答案
- 金太阳陕西省2028届高一上学期10月月考语文(26-55A)(含答案)
评论
0/150
提交评论