2026年大数据开发工程师真题及参考答案_第1页
2026年大数据开发工程师真题及参考答案_第2页
2026年大数据开发工程师真题及参考答案_第3页
2026年大数据开发工程师真题及参考答案_第4页
2026年大数据开发工程师真题及参考答案_第5页
已阅读5页,还剩6页未读, 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

2026年大数据开发工程师真题及参考答案一、单项选择题(共15题,每题2分,共30分)1.大数据4V特性中,不包括以下哪一项?A.VolumeB.VelocityC.VarietyD.Visibility答案:D解析:大数据的4V特征通常指Volume、Velocity、Variety、Value,部分定义也包含Veracity。Visibility不属于4V特征。2.Hadoop生态中,用于海量数据分布式存储的组件是:A.HDFSB.MapReduceC.YARND.Hive答案:A3.Hadoop2.x/3.x中,HDFS默认数据块大小通常为:A.64MBB.128MBC.256MBD.512MB答案:B4.MapReduce中,Shuffle阶段的主要功能是:A.数据分片B.分区、排序与数据传输C.数据输出D.任务调度答案:B解析:Shuffle是Map输出到Reduce输入之间的过程,主要完成分区、排序、合并和网络传输,是MapReduce性能关键环节。5.Hive创建分区表时使用的关键字是:A.GROUPBYB.DISTRIBUTEBYC.PARTITIONEDBYD.CLUSTERBY答案:C6.Spark中,用于缓存RDD的方法有:A.cache()B.persist()C.collect()D.A和B均可答案:D解析:cache()和persist()均可缓存RDD。cache()等价于persist(StorageLevel.MEMORY_ONLY),collect()是行动算子,用于触发计算并返回结果。7.Kafka中,消息存储与读写的最小单元是:A.BrokerB.TopicC.PartitionD.ConsumerGroup答案:C8.ZooKeeper在Kafka集群中的主要作用是:A.存储消息数据B.维护集群元数据与控制器选举C.处理消费者请求D.负责消息序列化答案:B9.HBase中,行键RowKey在底层按什么顺序存储?A.随机顺序B.字典序C.插入时间顺序D.哈希值顺序答案:B10.以下哪一项不属于Spark常见运行模式?A.LocalB.StandaloneC.YARND.HDFS答案:D解析:Spark运行模式包括Local、Standalone、YARN、Kubernetes、Mesos等。HDFS是存储系统,不是Spark运行模式。11.Flink实现端到端Exactly-once语义时,核心机制是:A.WAL日志B.Checkpoint与BarrierC.TCP重传D.简单重试队列答案:B12.数据仓库建模中,星型模型与雪花模型的主要区别在于:A.事实表数量不同B.维度表是否进一步规范化C.是否使用主键D.是否支持事实表答案:B13.SQL中窗口函数ROW_NUMBER()的作用是:A.计算累计值B.求可并列排名C.为每一行分配唯一序号D.计算方差答案:C解析:ROW_NUMBER()为窗口内每一行分配唯一序号,不允许并列;RANK()和DENSE_RANK()支持并列排名。14.Hadoop中,负责集群资源调度与任务分配的组件是:A.HDFSB.MapReduceC.YARND.Sqoop答案:C15.以下哪种文件格式属于列式存储格式?A.TextFileB.SequenceFileC.ParquetD.JSON答案:C二、多项选择题(共5题,每题3分,共15分。多选、少选、错选均不得分)1.HDFS主要由以下哪些组件组成?A.NameNodeB.DataNodeC.ResourceManagerD.SecondaryNameNode答案:ABD解析:HDFS核心组件包括NameNode、DataNode、SecondaryNameNode。ResourceManager属于YARN组件。2.Spark相比传统MapReduce的优势包括:A.基于内存计算,迭代处理性能更高B.支持批处理、流处理、机器学习、图计算等多种计算范式C.完全不需要使用磁盘D.提供DAG调度与容错机制答案:ABD解析:Spark并非完全不需要磁盘。当内存不足或发生Shuffle时,数据仍会溢写磁盘,因此C错误。3.关于Kafka中ConsumerGroup的特点,下列说法正确的有:A.一个分区在同一时刻只能由组内一个消费者消费B.一个消费者可以消费多个分区C.消费位置必须由消费者本地文件保存D.同一组内消费者数量大于分区数量时,会有消费者处于空闲状态答案:ABD解析:Kafka中消费偏移量Offset保存于内部主题__consumer_offsets,而不是仅依赖消费者本地文件保存,因此C错误。4.关于数据倾斜,下列说法正确的有:A.某个Key数据量过大,会导致任务执行出现长尾B.可通过加盐、两阶段聚合等方式缓解C.只发生在离线计算中D.可能导致个别Reduce任务执行缓慢答案:ABD解析:数据倾斜在离线计算和实时计算中都可能出现,C错误。常见优化包括加盐、预聚合、改写Join等方式。5.以下属于大数据分布式处理框架的有:A.HadoopMapReduceB.ApacheSparkC.ApacheFlinkD.MySQL答案:ABC三、判断题(共10题,每题1分,共10分)1.HDFS适合低延迟随机读写场景。答案:错误2.MapReduce输入分片通常基于HDFS文件块进行划分。答案:正确3.Hive可以将SQL语句转换为MapReduce或Spark等执行引擎的作业。答案:正确4.Kafka中消息被消费者消费后会被立即删除。答案:错误5.SparkRDD是一个可变的数据集。答案:错误6.HBase基于HDFS存储,支持随机实时读写。答案:正确7.ApacheFlink是典型的微批处理引擎。答案:错误8.ZooKeeper是一个分布式协调服务。答案:正确9.数据仓库主要面向高频事务处理场景。答案:错误10.Parquet格式支持列裁剪,可以提升查询性能。答案:正确四、填空题(共10空,每空2分,共20分)1.Hadoop生态中,用于数据仓库查询的工具是____;用于日志采集、聚合和传输的工具是____。答案:Hive;Flume2.Spark的核心数据结构称为____,其操作分为转换和____两类。答案:RDD(弹性分布式数据集);Action(行动)3.Kafka中,主题的每个分区内部消息偏移量称为____;消费者提交的偏移量存储在Kafka内部主题____中。答案:Offset;__consumer_offsets4.HDFS默认副本数为____;当某个数据块损坏时,系统会通过____机制进行恢复。答案:3;副本冗余5.在HiveSQL中,将小表放入内存进行连接优化的方式称为____;开启Hive连接数据倾斜优化可设置参数____。答案:MapJoin;hive.optimize.skewjoin=true五、简答题(共3题,每题5分,共15分)1.简述HDFS写入数据的基本流程,以默认副本数3为例。答案:(1)客户端向NameNode发送创建文件请求,NameNode检查权限和路径后返回可用的DataNode列表;(2)客户端将数据分块,向第一个DataNode写入数据;(3)第一个DataNode通过Pipeline管道将数据复制到第二个DataNode,第二个DataNode再复制到第三个DataNode;(4)每个数据块写入完成后逐级返回确认信息;(5)客户端通知NameNode完成写入。2.简述Kafka如何从生产者、Broker、消费者三个层面保证消息不丢失。答案:生产者层面设置acks=all并要求足够的ISR副本确认;Broker层面配置多副本机制,保障分区副本可靠存储;消费者层面关闭自动提交,采用手动提交Offset,并在业务处理成功后再提交。3.简述Spark中宽依赖与窄依赖的区别及其对容错的影响。答案:窄依赖指父RDD的每个分区最多被子RDD一个分区使用,支持流水线执行,失败恢复时只需重算对应父分区;宽依赖指父RDD的一个分区可能被多个子RDD分区使用,通常需要Shuffle,失败恢复时可能需要重算多个父分区,开销更大。六、综合应用题(共1题,共10分)1.某电商用户行为明细表user_log包含字段:user_id(用户ID)、item_id(商品ID)、action(行为类型:pv、cart、buy)、ts(时间戳)。请使用HiveSQL统计每个用户的PV数和购买数,并过滤出PV数超过100且购买数大于0的用户,返回用户ID、PV数、购买数。SELECTuser_id,

SUM(CASEWHENaction='pv'THEN1ELSE0END)ASpv_cnt,

SUM(CASEWHENaction='buy'THEN1ELSE0END)ASbuy_cnt

FROMuser_log

GROUPBYuser_id

HAVINGSUM(CASEWHENact

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论