2026年大数据工程师技能培训试卷(附答案)_第1页
2026年大数据工程师技能培训试卷(附答案)_第2页
2026年大数据工程师技能培训试卷(附答案)_第3页
2026年大数据工程师技能培训试卷(附答案)_第4页
2026年大数据工程师技能培训试卷(附答案)_第5页
已阅读5页,还剩15页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

2026年大数据工程师技能培训试卷(附答案)1.单项选择题(每题1分,共20分)1.1在HDFS中,NameNode的主要职责是A.存储实际数据块B.维护文件系统元数据C.执行Map任务D.执行Reduce任务答案:B1.2下列哪一项不是Kafka的核心组件A.ProducerB.ConsumerC.BrokerD.JobTracker答案:D1.3Spark中RDD的lineage机制主要解决A.数据倾斜B.容错恢复C.广播变量D.内存回收答案:B1.4在Flink的checkpoint机制中,barrier的作用是A.触发窗口计算B.分隔数据流以实现一致性快照C.标记迟到数据D.控制并发度答案:B1.5Hive默认的元数据库是A.MySQLB.PostgreSQLC.DerbyD.Oracle答案:C1.6HBase中RowKey设计的最佳实践不包括A.散列性B.长度尽可能长C.业务可逆性D.避免热点答案:B1.7使用Scala编写Spark程序时,下列哪个操作是窄依赖A.groupByKeyB.distinctC.mapD.sortByKey答案:C1.8在数据仓库分层架构中,DWD层的主要作用是A.原始数据保留B.明细数据清洗C.维度建模D.指标汇总答案:B1.9下列关于数据倾斜的描述正确的是A.只会发生在Reduce阶段B.可通过两阶段聚合缓解C.与分区函数无关D.无法通过加盐解决答案:B1.10在Elasticsearch中,一个索引默认的分片数是A.1B.3C.5D.7答案:C1.11若某表在MySQL中字段类型为datetime,同步到Hive后最合适的类型是A.stringB.bigintC.timestampD.date答案:C1.12使用FlinkSQL时,Rowtime属性必须在A.源表定义时声明B.插入语句中指定C.结果表中声明D.任意时刻均可答案:A1.13在Kafka中,consumergrouprebalance触发的条件不包括A.消费者加入B.消费者退出C.topic分区数变化D.broker宕机答案:D1.14下列算法属于聚类算法的是A.AprioriB.K-meansC.PageRankD.FP-growth答案:B1.15在SparkMLlib中,特征向量列的类型是A.Array[Double]B.VectorUDTC.DenseMatrixD.LabeledPoint答案:B1.16若HDFS副本系数为3,则DataNode宕机1台后A.立即丢失数据B.自动降低副本系数C.自动触发复制保持副本数D.需手工干预答案:C1.17在数据治理中,数据血缘(metadatalineage)的核心价值是A.降低存储成本B.追踪数据来龙去脉C.提高查询速度D.增加数据冗余答案:B1.18下列关于Parquet格式的说法错误的是A.列式存储B.支持谓词下推C.与Avro不可共存D.支持压缩答案:C1.19在Airflow中,task实例状态为skipped的原因是A.上游失败B.被BranchPythonOperator跳过C.重试次数耗尽D.pool资源不足答案:B1.20使用Hadoop3.x的YARN时,默认资源调度器是A.FIFOB.FairSchedulerC.CapacitySchedulerD.DominantResourceCalculator答案:C2.多项选择题(每题2分,共20分,每题至少两个正确答案,多选少选均不得分)2.1下列属于Flink时间语义的有A.ProcessingTimeB.IngestionTimeC.EventTimeD.SystemTime答案:ABC2.2关于Spark的shuffle,以下说法正确的有A.map端写入磁盘B.reduce端拉取map输出C.一定会发生排序D.可通过bypass机制跳过排序答案:ABD2.3在数据质量管理中,常见的数据质量维度包括A.准确性B.完整性C.一致性D.可用性答案:ABCD2.4下列属于Hadoop3.x新特性的有A.ErasureCodingB.YARN联邦C.MapReduce自动并行度D.支持GPU资源调度答案:ABD2.5关于Kafka的exactly-once语义,需要满足A.开启幂等producerB.事务APIC.consumer端去重D.关闭acks答案:ABC2.6以下哪些操作会导致SparkRDD触发宽依赖A.cogroupB.unionC.groupByKeyD.reduceByKey答案:ACD2.7在数据湖架构中,常见的存储层格式有A.DeltaLakeB.IcebergC.HudiD.ORC答案:ABC2.8下列属于NoSQL数据库CAP定理中“可用性”牺牲的场景有A.MongoDB写关注majorityB.HBaseRegionServer宕机C.CassandraQUORUM读写D.Redis哨兵模式主从切换答案:AC2.9关于HiveonSpark与HiveonTez对比,正确的有A.均使用YARN资源B.均支持向量化的orcfilereaderC.均使用MapReduce作为执行引擎D.Tez的DAG模型可减少落盘答案:ABD2.10下列属于数据安全脱敏算法的有A.MD5B.TokenizationC.K-anonymityD.DifferentialPrivacy答案:BCD3.填空题(每空1分,共20分)3.1HDFS默认块大小为________MB,Hadoop3.x可支持最大________GB。答案:128,5123.2Spark的默认并行度参数为________,与________分区数一致。答案:spark.default.parallelism,RDD3.3Kafka中,________参数控制producer批量发送的字节数上限。答案:batch.size3.4Flink的checkpoint超时时间由________参数设定,单位________。答案:checkpoint.timeout,milliseconds3.5在HBase中,________过滤器可实现对RowKey的前缀匹配。答案:PrefixFilter3.6Elasticsearch的写入原理中,数据先写入________段,再经过________段合并。答案:memory,segment3.7Hive的动态分区功能由参数________控制开关,默认________。答案:hive.exec.dynamic.partition,false3.8数据仓库维度建模的四种类型缓慢变化维中,________型直接覆盖旧值。答案:Type13.9在Scala中,________关键字用于定义不可变变量,________定义可变变量。答案:val,var3.10Airflow的DAG文件需放在________目录,调度器通过________间隔扫描。答案:dags,dag_dir_list_interval3.11使用Sqoop导出MySQL时,________参数可指定更新模式为allowinsert。答案:--update-mode3.12在FlinkCEP中,模式序列通过________类描述,超时数据通过________侧输出流获取。答案:Pattern,OutputTag3.13SparkSQL的catalyst优化器核心步骤包括________、________和物理计划生成。答案:Analysis,LogicalOptimization3.14数据治理元数据标准中,________协议提供REST接口用于数据目录交互。答案:ApacheAtlas3.15在Linux中,________命令可查看磁盘I/O实时状态,________命令可查看内存占用。答案:iostat,free4.判断题(每题1分,共10分,正确打“√”,错误打“×”)4.1Spark的RDD一旦缓存,内存不足时必然抛出OOM异常。答案:×4.2HDFS的NameNode高可用通过QJM共享编辑日志实现。答案:√4.3Kafka的topic分区数只能增加不能减少。答案:√4.4Flink的窗口计算必须基于EventTime。答案:×4.5Hive支持事务表,但必须使用ORC格式并开启表属性transactional=true。答案:√4.6HBase的Cell版本号默认使用服务器当前时间戳。答案:√4.7Elasticsearch的mapping字段类型一旦创建可随意修改。答案:×4.8在数据湖方案中,DeltaLake通过事务日志实现ACID。答案:√4.9Airflow的task失败重试次数由retries参数控制,默认值为0。答案:×4.10使用DataX同步数据时,reader插件和writer插件必须一一对应。答案:√5.简答题(共30分)5.1(封闭型,6分)简述Spark的宽窄依赖区别,并给出各自触发shuffle的典型算子。答案:窄依赖指父RDD的每个分区最多被子RDD的一个分区使用,无需shuffle,如map、filter、union;宽依赖指父RDD的一个分区被多个子RDD分区使用,必须shuffle,如groupByKey、reduceByKey、join、distinct。5.2(封闭型,6分)列举Flink实现端到端exactly-once的四大要素。答案:1.可重放的数据源;2.状态一致性快照(checkpoint);3.幂等sink或事务sink;4.两阶段提交协议(2PC)。5.3(开放型,8分)某电商公司订单表每日增量2亿条,需构建实时GMV指标,请给出技术选型和核心架构理由,至少考虑3种以上主流框架。答案:选用Kafka+Flink+Redis+ClickHouse。Kafka承担高吞吐消息队列;Flink负责流式计算,支持事件时间、窗口、CEP;Redis存储秒级结果供大屏查询;ClickHouse存储明细+预聚合,支持OLAP多维分析。对比Storm(低延迟但语义弱)、SparkStreaming(微批延迟高)、Flink(真正的流计算,exactly-once),综合选型Flink。5.4(封闭型,5分)写出HBaseRowKey设计的三原则,并解释热点产生原因。答案:三原则:长度原则(10~100字节)、散列原则(哈希/反转避免顺序)、唯一原则。热点原因:大量连续RowKey落在同一Region,导致写请求集中,RegionServer负载激增。5.5(开放型,5分)说明数据倾斜在HiveSQL中的典型表现及两种以上解决策略。答案:表现:某个reduce任务耗时远超其他,99%进度长时间等待。策略:1.两阶段聚合,对倾斜键加随机前缀;2.增加reduce个数,setmapreduce.job.reducers=1000;3.使用map-sidejoin,将小表加载内存;4.重写SQL,拆分倾斜键单独处理。6.应用题(共50分)6.1计算题(10分)某Spark任务读取HDFS上1TB的ORC文件(压缩率0.25),集群每个executor配置4核8GB,HDFS块大小128MB。假设每个map任务处理一个块,计算理论最小map任务数;若每个executor并行运行2个任务,求最少需要多少executor。答案:未压缩大小=1TB/0.25=4TB=4096GB块数=4096GB/128MB=4096×1024/128=32768块理论最小map任务数=32768每个executor并发2任务,所需executor=32768/2=163846.2分析题(15分)给定Kafkatopic:order,分区30,日均消息3亿条,峰值QPS8万。消费者采用Flink,checkpoint间隔10s,状态大小500MB。分析:(1)若消费者首次上线,如何设置scan.startup.mode保证不丢数据?(2)checkpoint超时频繁报警,列出3条调优思路。(3)如何评估分区数是否合理?给出公式。答案:(1)设置earliest-offset,确保从最早消息消费;同时开启checkpoint与Kafka事务,保证exactly-once。(2)调优:增大checkpoint.timeout(如60s);使用增量checkpoint减少数据量;提高并行度,将状态打散到更多sub-task。(3)分区数评估公式:P≥max(QPS/consumer处理单条耗时,状态大小/可用内存)。若单条处理2ms,单并发5000条/s,则P≥80000/5000=16;当前30满足。6.3综合设计题(25分)背景:某视频平台日均上传原始视频日志500GB,字段含user_id、video_id、watch_duration、event_time、ip、country。需求:1.实时统计每5分钟各视频观看时长;2.离线计算每日用户观看总时长Top100;3.支持按country维度过滤,查询延迟<1s;4.存储成本≤原始大小×1.5。要求:(1)给出整体架构图(文字描述即可);(2)列出各层技术选型、表结构、分区策略;(3)给出实时与离线核心SQL/代码片段;(4)说明如何满足成本与性能指标。答案:(1)架构:日志→Flume→Kafka→Flink→ClickHouse(实时);日志→Flume→HDFS(ODS)→SparkSQL→Hive(DWD)→Hive(DWS)→ClickHouse(离线)。(2)ODS:HDFS按天+小时分区,parquet压缩snappy,大小≈500GB×0.7=350GB。DWD:清洗后字段同上,增加etl_time,按dt分区。DWS:按video_id+country+5min粒度预聚合,字段:video_id,country,window_start,window_end,total_duration,uv。ClickHouse本地表:MergeTree,分区键toYYYYMMDD(window_start),排序键(video_id,country)。(3)实

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论