2026年大数据技术考试试卷及答案_第1页
2026年大数据技术考试试卷及答案_第2页
2026年大数据技术考试试卷及答案_第3页
2026年大数据技术考试试卷及答案_第4页
2026年大数据技术考试试卷及答案_第5页
已阅读5页,还剩11页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

2026年大数据技术考试试卷及答案一、单项选择题(每题1分,共20分)1.在HDFS中,默认的Block大小为A.32MB  B.64MB  C.128MB  D.256MB答案:C2.下列哪一项不是Kafka的核心组件A.Producer  B.Consumer  C.Broker  D.NameNode答案:D3.SparkRDD的懒执行特性是指A.任务立即提交到集群  B.转换算子不会立即触发计算C.行动算子不会触发计算  D.缓存立即生效答案:B4.在Flink中,Exactly-Once语义依赖的核心机制是A.异步快照(Checkpoint)  B.窗口合并  C.背压机制  D.增量迭代答案:A5.若Hive表partitionedby(dtstring,hourtinyint),则下列分区路径合法的是A.dt=2026-06-01/hour=24  B.dt=20260601/hour=00C.dt=2026/06/01/hour=1  D.dt=2026-06-01/hour=1答案:D6.HBase中RowKey设计应避免A.散列  B.顺序递增  C.反转  D.加盐答案:B7.使用ScalaAPI读取Parquet文件并生成DataFrame的语句是A.spark.read.json("path")  B.spark.read.parquet("path")C.sqlContext.load("path")  D.spark.textFile("path")答案:B8.在ClickHouse中,最适合做高并发点查的引擎是A.MergeTree  B.SummingMergeTree  C.Log  D.TinyLog答案:A9.下列关于数据湖的说法错误的是A.支持Schema-on-Read  B.通常基于对象存储C.不支持事务  D.可与Flink集成答案:C10.在Elasticsearch中,分片分配的首要约束是A.disk.threshold  B.cluster.routing.allocation.same_shard.hostC.index.number_of_replicas  D.node.data答案:B11.若Spark作业频繁出现“ExecutorLostFailure”,优先应查看A.Driver日志  B.YARNResourceManagerUI  C.ExecutorGC日志  D.SparkHistoryServer答案:C12.关于KafkaConsumerGroup,以下说法正确的是A.同一Group内每个分区可被多个Consumer同时消费B.分区只能被Group内一个Consumer实例消费C.GroupCoordinator运行在ZookeeperD.Rebalance不会导致消费停顿答案:B13.在FlinkSQL中,表示5秒的处理时间窗口写法为A.TUMBLE(rowtime,INTERVAL'5'SECOND)B.TUMBLE(proctime,INTERVAL'5'SECOND)C.HOP(rowtime,INTERVAL'5'SECOND,INTERVAL'1'SECOND)D.SESSION(rowtime,INTERVAL'5'SECOND)答案:B14.使用HiveCLI执行脚本时,指定动态分区模式的参数是A.hive.exec.dynamic.partition=trueB.hive.exec.dynamic.partition.mode=nonstrictC.hive.exec.max.dynamic.partitions.pernodeD.hive.exec.reducers.bytes.per.reducer答案:B15.在SparkMLlib中,用于特征标准化的类是A.StandardScaler  B.MinMaxScaler  C.Normalizer  D.MaxAbsScaler答案:A16.下列存储格式中,支持列式压缩且与Flink原生集成最好的是A.Avro  B.ORC  C.CSV  D.ProtocolBuffer答案:B17.关于数据倾斜,下列缓解措施无效的是A.两阶段聚合  B.增加并行度  C.使用随机前缀  D.提高副本数答案:D18.在YARN容量调度器中,队列资源抢占的默认超时为A.0ms  B.5000ms  C.10000ms  D.15000ms答案:C19.使用Presto查询Hive表时,元数据通过A.HiveMetastore  B.HDFSClient  C.PrestoCoordinator  D.RangerPlugin答案:A20.在DeltaLake中,时间旅行查询依赖的字段是A.versionAsOf  B.timestampAsOf  C.__timestamp  D.A和B答案:D二、多项选择题(每题2分,共20分)21.以下属于FlinkCheckpoint的组成部分A.Barrier  B.SnapshotState  C.WAL  D.Acknowledge答案:ABD22.关于SparkShuffle,下列说法正确的是A.SortShuffleWriter会产生index文件B.BypassMergeShuffleWriter需满足reduce数<200C.UnsafeShuffleWriter需Serializer支持relocationD.ShuffleMapTask输出文件个数等于分区数答案:ABC23.在HBase二级索引方案中,可能带来写放大问题的有A.Coprocessor方案  B.Phoenix索引  C.Elasticsearch外部索引  D.Redis索引答案:AB24.以下哪些操作会触发SparkDAG重新计算A.cache()后首次行动算子  B.checkpoint()后首次行动算子C.对同一RDD再次调用count()  D.修改RDD分区器后调用first()答案:ABD25.关于Kafka幂等Producer,正确的是A.enable.idempotence=true自动将acks设为allB.需要retries>0C.max.in.flight.requests.per.connection≤5D.幂等范围跨会话答案:ABC26.使用HiveonTez时,可提升性能的优化包括A.启用Vectorization  B.使用LLAP  C.开启CBO  D.关闭MapJoin答案:ABC27.下列属于ClickHouseMergeTree家族且支持预聚合的引擎A.AggregatingMergeTree  B.SummingMergeTree  C.ReplacingMergeTree  D.CollapsingMergeTree答案:AB28.在Elasticsearch集群中,导致脑裂的因素有A.网络分区  B.discovery.zen.minimum_master_nodes设置过低C.节点负载高  D.使用单播发现答案:AB29.使用Airflow调度Spark作业时,可实现的特性有A.重试策略  B.SLA告警  C.动态任务生成  D.分布式执行答案:ABC30.关于数据湖仓一体(LakeHouse),下列说法正确的是A.支持ACID事务  B.使用Parquet+Delta格式C.计算存储耦合  D.通过TimeTravel实现版本回退答案:ABD三、填空题(每空1分,共20分)31.HDFSNameNode内存中每个Block占用约________字节元数据,若集群存储1PB,Block大小128MB,副本数3,则NameNode约需________GB内存。答案:150,1.232.SparkSQL中,将DataFrame注册为临时视图的函数是________,删除临时视图的函数是________。答案:createOrReplaceTempView,dropTempView33.KafkaTopic分区副本因子为3,最小ISR为2,则允许宕机的副本数最多为________。答案:134.Flink使用RockDBStateBackend时,Checkpoint文件默认存储在________文件系统,可通过参数________指定路径。答案:分布式,state.checkpoints.dir35.在Hive中,设置本地模式执行的参数是________,设置Reducer数量的参数是________。答案:hive.exec.mode.local.auto,mapreduce.job.reduces36.HBase中,删除标记版本在________阶段被真正清理,该阶段称为________。答案:MajorCompaction,MajorCompaction37.Elasticsearch写入数据时,先写入内存缓冲区________,再刷新到文件系统缓存,默认刷新间隔为________秒。答案:IndexingBuffer,138.ClickHouse中,用于去重合并的引擎为________,用于替换更新的引擎为________。答案:ReplacingMergeTree,ReplacingMergeTree39.Presto查询ORC文件时,提升读取效率的优化参数为________,表示将ORC的________下推到存储层。答案:hive.orc.sarg.cache,谓词40.DeltaLake的MVCC实现依赖________日志,每条记录称为________。答案:Delta,Commit四、简答题(共30分)41.(封闭型,6分)简述Spark广播变量的实现原理,并说明何时需要手动销毁。答案:广播变量通过TorrentBroadcast实现,Driver将对象序列化后切分成4MB块存储于DriverBlockManager,Executor按需拉取;Executor端缓存于本地BlockManager。当任务结束或调用unpersist()时手动销毁,避免DriverOOM。42.(开放型,6分)KafkaRebalance的触发条件有哪些?请给出三种以上并说明其影响。答案:1.Consumer成员变更(加入或离开)导致分区重新分配,引发消费停顿;2.Topic分区数扩容,Coordinator需重新计算分配;3.订阅正则表达式匹配到新Topic,触发Rebalance;4.Consumer处理超时(erval.ms),被判定为宕机。影响:Stop-the-world,增加延迟,可能重复消费。43.(封闭型,6分)Flink的Checkpoint与Savepoint区别是什么?答案:Checkpoint由Flink定时触发,用于故障恢复,可增量,默认保留策略为仅最新;Savepoint由用户手动触发,用于版本升级、迁移,保留所有历史,可跨版本兼容,不支持增量。44.(开放型,6分)列举三种HBaseRowKey散列方法,并比较其优缺点。答案:1.反转:将时间戳反转,避免热点,但失去范围查询;2.加盐:随机前缀分散,写吞吐高,但扫描需全表;3.哈希:取MD5散列,分布均匀,但无法范围查询;4.预分区+十六进制:结合业务,可控性强,需预估数据量。45.(封闭型,6分)说明HiveonTez中Vertex、Edge、Task的关系。答案:Vertex为计算逻辑单元,对应Map/Reduce阶段;Edge描述Vertex间数据流转方式(scatter-gather、one-to-one);Task为Vertex的物理实例,运行在Container中,一个Vertex可并行多个Task。五、应用题(共60分)46.(计算类,15分)某电商公司使用SparkStreaming消费Kafka统计实时GMV,KafkaTopic:order,10分区,每秒约5万条订单,单条JSON0.5KB,每条包含amount:Double。集群配置:10个Executor,每个4核16GB。(1)计算每秒数据量与所需网络带宽;(2)若窗口5秒,触发间隔2秒,估算每个Executor内存中缓存数据大小;(3)给出调优参数避免OOM。答案:(1)50000×0.5KB=25MB/s,约200Mb/s;(2)5秒窗口+2秒间隔,最大缓存2个批次,25MB×2=50MB;(3)spark.streaming.receiver.maxRate=30000;spark.executor.memoryOverhead=2GB;spark.streaming.kafka.maxRatePerPartition=3000;启用backpressure:spark.streaming.backpressure.enabled=true。47.(分析类,15分)用户反馈HBase查询延迟偶发>3秒,给出排查步骤与根因可能性。答案:步骤:1.查看RegionServer日志确认是否发生MajorCompaction或FullGC;2.使用RegionServerUI检查Handler是否耗尽;3.检查RowKey是否热点,使用scan'hbase:meta'定位Region分布;4.检查BlockCache命中率,若<80%则扩容内存或调整LRU策略;5.检查HDFS读延迟,排除磁盘故障。根因:MajorCompaction抢占IO、FullGC停顿、Handler阻塞、RowKey热点、磁盘损坏。48.(综合类,15分)基于Flink1.18实现Exactly-Once端到端,要求:Kafka→Flink→MySQL。给出配置清单、代码片段、幂等InsertSQL示例。答案:配置:env.enableCheckpointing(5000);env.getCheckpointConfig.setCheckpointingMode(CheckpointingMode.EXACTLY_ONCE);env.setStateBackend(newEmbeddedRocksDBStateBackend(true));env.getCheckpointConfig.setCheckpointStorage("hdfs://ns/flink/checkpoints");MySQLSink:DDL:CREATETABLEsink_order(order_idVARCHAR(50)PRIMARYKEY,amountDECIMAL(10,2));Sink:MySink.builder().setOptions(JdbcConnectionOptions.builder().url().username().password().build()).setDmlOptions(JdbcDmlOptions.builder().withTableName("sink_order").withInsertQuery("INSERTINTOsink_order(order_id,amount)VALUES(?,?)ONDUPLICATEKEYUPDATEamount=VALUES(amount)").build()).build();KafkaSource:KafkaSource.builder().setGroupId("flink_gmv").setStartingOffsets(OffsetsInitializer.latest()).setValueOnlyDeserializer(newJSONDeser()).build();49.(设计类,15分)设计Lambda架构离线层与加速层统一方案,要求:(1)使用Iceberg1.4存储,支持ACID;(2)Flink流式写入,Spark离线修正;(3)Presto统一查询;(4)给出表结构、分区策略、合并小文件流程。答案:表结构:CREATETABLEuser_behavior(user_idBIGINT,event_timeTIMESTAMP(6),event_typeSTRING,page_idSTRING,tsASevent_time)PARTITIONEDBY(event_dateSTRING,event_hourINT)STOREDBY'org.apache.iceberg.mr.hive.HiveIcebergStorageHandler'TBLPROPERTIES('format-version'='2','wri

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

最新文档

评论

0/150

提交评论