版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
2026年大数据开发工程师招聘笔试专业试卷及答案一、单项选择题(每题2分,共20题,共40分)1.Hadoop3.x中HDFS默认的Block大小是?A.64MBB.256MBC.128MBD.512MB答案C解析Hadoop1.x默认64MB,Hadoop2.x及3.x默认128MB。2.YARN中负责集群资源统一管理和调度的组件是?A.ResourceManagerB.NodeManagerC.ApplicationMasterD.Container答案A解析ResourceManager负责全局资源分配,NodeManager负责单节点资源监控,ApplicationMaster负责单个应用的任务调度。3.Hive中以下哪种操作最能减少查询扫描的数据量?A.SELECT*B.使用分区裁剪C.使用ORDERBYD.使用LIKE模糊查询答案B解析分区裁剪只扫描需要的分区目录,极大减少I/O。4.Kafka中消息在磁盘上的默认保留策略依据是?A.仅根据消息数量B.仅根据消费者数量C.根据日志保留时间或日志大小D.根据主题名称长度答案C解析Kafka通过log.retention.hours和log.retention.bytes控制日志保留。5.Spark中map操作产生的依赖类型是?A.宽依赖B.窄依赖C.Shuffle依赖D.不确定答案B解析map一个父分区只对应一个子分区,属于窄依赖。6.HBase中的存储单元(Cell)由哪几个维度唯一确定?A.行键、列族、列限定符、时间戳B.行键、列族、版本号C.行键、列限定符、时间戳D.行键、列族、值答案A解析HBaseCell由RowKey+ColumnFamily+Qualifier+Timestamp确定。7.MapReduce中Combiner的主要作用是?A.在Map端进行局部聚合,减少网络传输B.在Reduce端进行全局排序C.负责读取HDFS数据D.分配MapReduce作业资源答案A解析Combiner本质是Map端的小Reduce,可降低Shuffle数据量。8.Flink实现端到端Exactly-Once语义通常依赖的机制是?A.重试发送B.Checkpoint+两阶段提交C.增大并行度D.使用广播流答案B解析Flink通过Checkpoint保证状态一致性,结合两阶段提交保证端到端精确一次。9.ZooKeeper集群中基于什么协议实现Leader选举?A.PaxosB.ZABC.RaftD.Gossip答案B解析ZooKeeper使用ZooKeeperAtomicBroadcast(ZAB)协议。10.数据仓库分层中,普遍靠近原始数据层、只做简单清洗不做强聚合的层是?A.ADSB.DWSC.DWDD.ODS答案D解析ODS是操作数据层,保留原始粒度;DWD做清洗和规范化;DWS做轻度汇总;ADS面向应用。11.以下哪种文件格式最适合OLAP查询中的列裁剪?A.TextFileB.SequenceFileC.ParquetD.Avro答案C解析Parquet是列式存储,支持列裁剪、谓词下推,适合OLAP。12.Spark中广播变量(BroadcastVariable)的特点是?A.每个Task复制一份B.每个Executor复制一份C.只读,并在Executor间共享D.可写,用于累加数据答案C解析广播变量是只读共享变量,减少Task间重复数据传输。13.以下哪项是数据倾斜的典型表现?A.所有Task执行时间基本一致B.个别Task执行时间远长于其他TaskC.集群资源利用率低D.输入数据总量非常大答案B解析数据倾斜指部分Key数据量过大,导致个别Task成为瓶颈。14.Hive中用于实现列转行的函数是?A.explodeB.splitC.collect_setD.array_contains答案A解析explode将数组或Map元素拆成多行;collect_set是行转列聚合。15.Kafka消费组中,一个分区最多可以被几个消费者同时消费?A.0个B.1个C.2个D.任意多个答案B解析同一消费者组内,一个分区只能由组内一个消费者消费,保证顺序。16.HDFS写数据时,默认第一个副本通常放置在?A.随机远端机架B.客户端所在节点或同一机架的随机节点C.不同机架的任意节点D.NameNode所在节点答案B解析默认第一个副本写在客户端所在节点;若客户端不在集群,则随机选择同机架节点。17.SparkSQL中DataFrame相比RDD的主要改进是?A.支持分布式计算B.提供Schema信息和Catalyst优化器C.只能处理结构化文本D.不需要序列化答案B解析DataFrame有Schema,并通过Catalyst做SQL优化。18.Lambda架构由哪三层组成?A.批处理层、速度层、服务层B.采集层、计算层、展示层C.存储层、调度层、应用层D.事实层、维度层、指标层答案A解析Lambda架构包含BatchLayer、SpeedLayer、ServingLayer。19.MapReduce的Shuffle过程发生在?A.Map计算之前B.Map输出之后、Reduce输入之前C.Reduce计算之后D.作业初始化阶段答案B解析Shuffle包括Map端分区、排序、溢写和Reduce端拉取、合并。20.Redis中不支持的数据类型是?A.StringB.HashC.ListD.Table答案D解析Redis支持String、Hash、List、Set、ZSet、Stream等,不支持关系表。二、多项选择题(每题3分,共5题,共15分。多选、少选、错选均不得分)1.HDFS高可用(HA)架构中涉及的组件包括?A.ActiveNameNodeB.StandbyNameNodeC.JournalNodeD.ZooKeeper答案ABCD解析HA需要两个NameNode、JournalNode保证元数据同步,ZooKeeper负责自动故障转移。2.Spark作业性能优化的合理措施有?A.使用广播变量替代小表JoinB.合理设置分区数C.避免不必要的ShuffleD.使用Kryo序列化答案ABCD解析均为常见Spark优化手段。3.Kafka的典型特点包括?A.高吞吐量B.持久化消息C.支持发布订阅D.强一致性事务答案ABC解析Kafka高吞吐、持久化、发布订阅;事务支持是较新特性,但“强一致性事务”表述过强,通常选ABC。4.Hive中常用的优化方式包括?A.分区裁剪B.列裁剪C.使用ORC或Parquet格式D.使用SELECT*答案ABC解析SELECT*会扫描所有列,不利于优化。5.Flink支持的状态后端有?A.MemoryStateBackendB.FsStateBackendC.RocksDBStateBackendD.HDFSStateBackend答案ABC解析Flink官方状态后端为MemoryStateBackend、FsStateBackend、RocksDBStateBackend。三、判断题(每题1分,共10题,共10分)1.HDFS中NameNode负责存储元数据,DataNode负责存储实际数据块。答案正确2.Spark中Transformation操作是惰性执行的,只有Action才会触发计算。答案正确3.HBase是典型的行式存储数据库。答案错误解析HBase是按列族存储的分布式列式数据库。4.同一个Kafka分区内的消息是有序的。答案正确5.YARN中NodeManager负责整个集群的资源调度。答案错误解析NodeManager只负责单节点资源管理和容器运行,集群资源调度由ResourceManager完成。6.数据仓库和业务数据库在用途和模型设计上没有区别。答案错误解析数据库面向事务处理,数据仓库面向分析,建模方式不同。7.MapReduce中的输入输出数据都是以键值对形式组织的。答案正确8.Hive中删除内部表时,只删除元数据,HDFS上的数据不会被删除。答案错误解析删除内部表会同时删除元数据和HDFS数据;外部表只删除元数据。9.Flink的DataStreamAPI主要面向批处理场景。答案错误解析DataStreamAPI面向流处理,DataSetAPI面向批处理(新版已统一)。10.Sqoop可以用来在Hadoop与关系型数据库之间进行批量数据传输。答案正确四、简答题(每题5分,共5题,共25分)1.简述HDFS写入数据的基本流程。答案客户端向NameNode请求创建文件;NameNode检查权限与目录结构,返回可用的DataNode列表;客户端将数据按Block依次写入第一个DataNode,第一个DataNode再复制到第二个DataNode,第二个复制到第三个,形成流水线复制;每个Block写完返回确认;全部写完后客户端通知NameNode关闭文件。2.简述Spark中宽依赖和窄依赖的区别及其对容错的影响。答案窄依赖:一个父RDD分区最多被一个子RDD分区使用,如map、filter。宽依赖:一个父RDD分区被多个子RDD分区使用,通常伴随Shuffle,如groupByKey、reduceByKey。窄依赖容错时只需重新计算丢失的父分区;宽依赖容错需要重新计算所有依赖的父分区,代价更高。3.Kafka中如何从生产者、Broker、消费者三个层面保证消息不丢失?答案生产者:使用acks=all,并要求主从都确认;设置合适的重试机制。Broker:合理设置replication.factor,保持至少一个副本,启用min.insync.replicas。消费者:关闭自动提交偏移量,采用手动提交,并且先处理业务再提交偏移量,避免重复消费和丢失。4.解释数据倾斜产生的原因,并给出至少三种解决方案。答案原因:某些Key的数据量远大于其他Key,导致部分Task处理压力过大。常见方案:(1)对倾斜Key加随机前缀或盐值,分散到多个分区;(2)使用两阶段聚合(局部聚合+全局聚合);(3)将小表广播,避免ShuffleJoin;(4)使用Hive的skewjoin或Spark的AEQ优化。5.简述Hive内部表与外部表的区别。答案内部表由Hive管理元数据和HDFS数据,删除表时元数据与数据一并删除;外部表只由Hive管理元数据,删除表时只删除元数据,HDFS数据仍保留。外部表适合已有数据或需要与其他组件共享数据的场景。五、SQL与编程题(每题5分,共2题,共10分)1.已知用户行为日志表user_log,字段为user_id、item_id、action、ts。请写出SQL,查询每个用户最近一次行为的时间及对应的item_id。SELECTuser_id,
item_id,
ts
FROM(
SELECTuser_id,
item_id,
ts,
ROW_NUMBER()OVER(PARTITIONBYuser_idORDERBYtsDESC)ASrn
FROMuser_log
)t
WHERErn=1;解析:使用窗口函数ROW_NUMBER按用户分组、时间倒序编号,取每组第一条即为最近一次行为。2.使用SparkScala编写WordCount程序,统计给定文本中每个单词出现的次数。valtextFile=sc.textFile("hdfs://input/words.txt")
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 2025年山东郓城八里湾小学四年级数学第二学期期末复习检测模拟试题含答案解析
- 2026医疗诊断软件行业市场发展深度剖析及疾病预测技术创新与投资布局研究报告
- 2026锑矿石行业市场发展分析及前景趋势与投融资发展机会研究报告
- 2026中国民宿行业品质化升级与区域集群发展差异化竞争报告
- 2026磁铁行业产能扩张与市场投资机会分析报告
- 2026真空热成型包装行业政策环境变化与合规经营报告
- 2026企业差旅管理解决方案市场供需格局与投资价值评估报告
- 2026磁铁行业安全生产要求对供需影响分析研究报告
- 2026免税购物市场政策环境及消费行为洞察分析报告
- 2026中国智慧城市交通管理系统市场渗透率与投资回报分析报告
- 2026年中级会计实务真题及答案解析
- 2026年秋季开学大学开学第一课(校规校纪)课件
- 2026年开学第一课法治教育课件
- 2026年重庆市从“五方面人员”中选拔乡镇领导班子成员考试试卷(含完整答案解析)
- 2026年广州市中考语文试卷(含答案及解析)
- 2026年秋季开学初中开学第一课(科学启蒙)课件
- GA/T 1999.3-2025道路交通事故车辆速度鉴定方法第3部分:基于视频图像
- (2026年)水利工程监理总结汇报
- 2026年一建管理四色笔记
- 2026贵州农商联合银行第二批社会招聘11人笔试参考题库及答案详解
- 新版2026年秋统编版小学道德与法治四年级上册(全册)教学设计
评论
0/150
提交评论