2026年大数据工程师大数据处理技术检验考试试题及答案解析_第1页
2026年大数据工程师大数据处理技术检验考试试题及答案解析_第2页
2026年大数据工程师大数据处理技术检验考试试题及答案解析_第3页
2026年大数据工程师大数据处理技术检验考试试题及答案解析_第4页
2026年大数据工程师大数据处理技术检验考试试题及答案解析_第5页
已阅读5页,还剩14页未读, 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

2026年大数据工程师大数据处理技术检验考试试题及答案解析一、单项选择题(每题1分,共20分)1.下列关于Hadoop分布式文件系统(HDFS)的短路读取特性,描述正确的是?A.仅适用于NameNode节点的本地读取B.客户端直接与DataNode本地磁盘交互读取数据,跳过DataNode进程的网络传输C.会显著增加DataNode的CPU开销D.仅支持小文件读取场景2.Spark生态中,支持流批一体表语义、可实现增量计算的API是?A.RDDB.DataFrameC.StructuredStreamingD.DStream3.下列关于湖仓一体架构中ApacheIceberg的分区演化特性,说法正确的是?A.修改分区策略后,历史数据必须全部重写才能正常查询B.仅支持新增分区字段,不支持删除分区字段C.查询引擎可通过元数据自动识别新旧分区规则,无需用户手动适配D.分区演化会导致表的元数据失效,需要重新建表4.Flink实现端到端Exactly-Once语义的核心机制不包括下列哪项?A.两阶段提交(2PC)B.检查点(Checkpoint)C.水印(Watermark)D.Source端数据可重放5.数据仓库维度建模中,缓慢变化维(SCD)类型2的典型处理方式是?A.直接覆盖旧值,仅保留最新版本B.新增维度行保留全量历史版本,通过生效时间/版本号区分C.新增单独的历史列存储上一个版本的值D.只保留最近两个版本的维度值6.下列开源ETL工具中,天然支持分布式流批一体数据同步的是?A.DataXB.SqoopC.ApacheSeaTunnelD.Kettle7.SparkSQL中关于广播变量的使用场景,下列说法错误的是?A.适合小表与大表的Join场景B.广播数据会在每个Executor上缓存一份全量副本C.广播表的大小没有限制,可任意使用D.可通过spark.sql.autoBroadcastJoinThreshold配置自动广播阈值8.Flink中水印(Watermark)的核心作用是?A.保证数据的精确一次语义B.处理事件时间乱序,触发窗口计算C.提升状态后端的存储效率D.实现任务的故障恢复9.下列数据质量校验规则中,属于“完整性”约束的是?A.用户表的用户ID字段不得重复B.订单表的订单金额必须大于0C.用户表的手机号字段不能为空D.订单表的下单时间格式必须为yyyy-MM-ddHH:mm:ss10.Hive中下列哪种文件格式的查询性能最高、压缩比最优?A.TextFileB.SequenceFileC.ORCD.Parquet11.下列关于ApacheHudi的MOR(MergeOnRead)表的特点,描述正确的是?A.写入性能差,读取性能好B.写入时直接合并到基础文件,读取时无需额外处理C.适用于写少读多的场景D.写入时将增量数据写入日志文件,读取时动态合并基础文件与日志12.下列选项中,不属于Spark数据倾斜常见诱因的是?A.Join键的分布极不均匀B.数据源的小文件数量过多C.按Key聚合时存在大量热点KeyD.分组字段的取值过于集中13.数据仓库分层架构中,DWD(明细数据层)的主要作用是?A.存储原始业务数据,不做清洗转换B.对原始数据进行清洗、脱敏、维度退化等处理,保留明细粒度C.按照主题域聚合生成宽表或汇总指标D.面向业务应用提供最终数据服务14.Flink中适合超大状态、持久化存储场景的状态后端是?A.MemoryStateBackendB.FsStateBackendC.RocksDBStateBackendD.HashMapStateBackend15.Spark中下列操作产生的依赖,属于宽依赖的是?A.map操作B.filter操作C.非分区键的join操作D.union操作16.下列数据同步方式中,属于增量同步的是?A.每天凌晨全量拉取业务表数据覆盖数仓表B.基于数据库binlog捕获数据变更并同步C.每周导出一次业务表的全量快照D.每次同步时清空目标表再写入全量数据17.下列关于ApacheIceberg快照隔离特性的描述,正确的是?A.写入操作会阻塞读取操作B.同一时刻只能有一个写入操作C.读取操作始终访问提交时的一致快照,不受写入影响D.快照只能保留最近7天的历史版本18.Hive中开启动态分区的核心参数是?A.hive.exec.dynamic.partitionB.hive.optimize.sort.dynamic.partitionC.hive.exec.max.dynamic.partitionsD.hive.exec.parallel19.Flink中下列不属于官方内置窗口类型的是?A.滚动窗口B.滑动窗口C.会话窗口D.聚合窗口20.下列关于数据治理与数据处理关系的描述,错误的是?A.数据质量校验是数据处理流程中的必要环节B.数据治理是数据处理的前提,与数据处理流程完全独立C.元数据管理可为数据处理提供血缘追踪能力D.数据安全脱敏是数据处理中必须遵循的治理要求二、多项选择题(每题2分,共20分。多选、少选、错选均不得分)1.下列属于流批一体大数据处理框架的有?A.ApacheSparkB.ApacheFlinkC.ApacheStormD.ApacheHadoopMapReduce2.湖仓一体架构相较于传统离线数据仓库的核心优势包括?A.支持结构化、半结构化、非结构化多类型数据存储B.采用计算存储分离架构,扩展性更强C.支持事务性写入与快照隔离,保证数据一致性D.仅支持SQL查询接口,使用门槛更低3.下列属于数据质量核心评估维度的有?A.完整性B.一致性C.准确性D.时效性4.Flink实现端到端Exactly-Once语义的必要条件有?A.Source端支持数据可重放B.开启Checkpoint机制C.Sink端支持幂等写入或两阶段提交D.使用RocksDB状态后端5.下列关于Spark中RDD、DataFrame、DataSet的说法,正确的有?A.RDD是强类型的,编译期可检查类型错误B.DataFrame是弱类型的,仅在运行期检查SchemaC.DataSet结合了RDD的强类型和DataFrame的优化引擎优势D.三者均支持Catalyst优化器优化执行计划6.下列关于Hive分桶表的说法,正确的有?A.分桶是将数据按指定字段的Hash值打散到多个文件中B.分桶表适用于数据抽样、Join优化等场景C.分桶的数量必须等于HDFS的块数量D.分桶表可以提升特定查询的性能7.下列属于ETL过程中数据清洗常用操作的有?A.去除重复记录B.补全缺失字段C.格式标准化(如时间、手机号格式统一)D.按照主题域聚合数据8.下列关于ApacheHudi、Iceberg、DeltaLake三种湖仓表格式的共同点,描述正确的有?A.均支持ACID事务B.均支持快照查询和时间旅行(TimeTravel)C.均为Apache顶级项目D.均支持流批一体的读写9.数据仓库维度建模中,常见的标准维度类型包括?A.缓慢变化维B.快速变化维C.退化维D.Junk维(垃圾维)10.SparkStructuredStreaming官方支持的输出模式(OutputMode)有?A.Append模式B.Complete模式C.Update模式D.Overwrite模式三、判断题(每题1分,共10分)1.HDFS中NameNode负责存储数据块的实际内容,DataNode负责管理文件系统的元数据。2.Flink的事件时间(EventTime)是指数据进入Flink处理引擎的时间。3.Spark的窄依赖不会产生Shuffle操作,宽依赖会产生Shuffle。4.数据仓库的ODS层是面向业务应用的最终服务层。5.ApacheIceberg的分区演化需要重写历史数据才能正常查询。6.Hive的动态分区可以根据查询结果自动生成分区,无需手动指定所有分区值。7.Flink的Checkpoint是用户手动触发的全量状态快照,用于数据备份。8.数据倾斜是指分布式计算中部分分区的数据量远大于其他分区,导致任务执行效率低下的现象。9.湖仓一体架构中,数据只能存储在HDFS上,不能存储在对象存储中。10.ETL中的ELT模式是指先加载到目标系统,再在目标系统中进行转换,适合大数据量、计算资源充足的场景。四、简答题(每题10分,共30分)1.简述SparkSQL中BroadcastJoin和SortMergeJoin的工作原理及各自适用场景。2.简述Flink中Checkpoint和Savepoint的区别与联系。3.简述数据仓库维度建模中星型模型和雪花模型的区别及各自优缺点。五、综合分析题(共20分)某电商平台需要搭建实时交易统计大屏,核心需求为:实时统计最近5分钟的各品类交易额,每10秒更新一次结果;同时需要支持按天维度的历史交易额回溯查询。已知业务侧每秒产生约10万条订单数据,订单数据包含字段:orderid(订单ID)、categoryid(品类ID)、amount(交易金额)、create_time(下单时间,毫秒级时间戳),其中大促期间头部3个品类的订单量占总订单量的30%左右。请回答以下问题:(1)请设计该实时统计任务的技术方案,包括计算框架选型、窗口设计、状态管理、结果存储选型,并说明理由。(10分)(2)大促期间任务出现严重的数据倾斜,导致反压严重、延迟升高,请分析原因并给出至少3种可行的优化方案。(10分)答案:(1)技术方案设计:①计算框架选型:选用ApacheFlink。理由:Flink天生支持事件时间处理、低延迟流计算,内置窗口机制与状态管理能力,适配高吞吐、低延迟的实时统计场景。(2分)②窗口设计:采用事件时间的滑动窗口,窗口大小为5分钟,滑动步长为10秒;同时设置30秒的水印延迟,处理数据乱序问题。理由:使用事件时间可避免网络延迟、数据乱序导致的统计误差,滑动窗口满足“每10秒更新最近5分钟结果”的业务需求。(3分)③状态管理:选用RocksDBStateBackend,开启增量Checkpoint,Checkpoint间隔设置为30秒。理由:订单量大、窗口状态数据规模大,RocksDB支持磁盘存储超大状态,增量Checkpoint可降低快照开销,30秒间隔兼顾容错性与性能。(3分)④结果存储选型:实时统计结果写入Redis供大屏查询,同时将明细数据+聚合结果写入ApacheIceberg湖仓表支持历史回溯。理由:Redis支持高并发低延迟的点查,适配大屏实时访问需求;Iceberg支持快照查询与时间旅行,可高效存储全量历史数据,支持按天回溯。(2分)(2)数据倾斜原因与优化方案:①原因:大促期间头部品类为热点Key,订单量占比达30%,相同category_id的数据会被分发到同一个并行子任务处理,导致该子任务的数据量远高于其他子任务,出现数据倾斜与反压。(2分)②优化方案:方案一:两阶段聚合(加盐聚合)。第一阶段对category_id拼接0~9的随机前缀,将热点品类的数据打散到10个并行子任务做局部聚合;第二阶段去掉随机前缀,再做全局聚合,将热点压力分散到多个节点。(3分)方案二:本地预聚合+全局聚合。在Shuffle前先在每个并行实例本地做窗口内的品类预聚合,仅向下游发送每个品类的局部聚合结果,大幅减少Shuffle数据量,降低下游热点子任务的处理压力。(3分)方案三:热点品类拆分处理。识别出TopN热点品类,将其单独拆分为独立的流,再按order_id哈希分桶做并行聚合,非热点品类走普通聚合逻辑,最后合并两类结果输出。(2分)解析:本题考点为实时大数据处理的方案设计与性能优化,需结合业务的高吞吐、热点数据等特点,从框架选型、窗口、状态、存储多维度设计合理方案;数据倾斜优化的核心思路是“打散热点Key、分散处理压力”,需结合Flink流处理的特性设计可落地的方案。参考答案与解析一、单项选择题1.答案:B解析:短路读取适用于客户端与DataNode部署在同一节点的场景,直接读取本地磁盘文件,绕过DataNode进程开销,可降低CPU消耗,对大文件场景优化效果更明显。2.答案:C3.答案:C解析:Iceberg支持隐式分区演化,可新增、删除、调整分区规则,历史数据无需重写,引擎通过元数据自动适配分区逻辑,不会造成元数据失效。4.答案:C解析:水印是处理事件时间乱序、触发窗口计算的机制,与一致性语义无关;Exactly-Once依赖Source可重放、Checkpoint状态一致性、Sink端2PC或幂等写入三类核心机制。5.答案:B6.答案:C解析:SeaTunnel是Apache顶级的分布式数据集成工具,支持流批一体同步;DataX是单进程多线程的批同步工具,Sqoop仅支持Hadoop与关系型数据库的批同步,Kettle是单机ETL工具。7.答案:C8.答案:B9.答案:C解析:A属于唯一性约束,B属于准确性约束,D属于规范性约束。10.答案:C解析:ORC是Hive原生优化的列式存储格式,内置索引、字典编码、多种压缩算法,在Hive场景下的查询性能和压缩比均优于Parquet;Parquet更适合多引擎通用场景。11.答案:D解析:MOR为读时合并模式,写入速度快(仅写日志),读取时需合并基础文件和增量日志,读性能相对较低,适合写多读少的场景。12.答案:B解析:小文件过多会导致任务调度开销大,但属于小文件问题,不是数据倾斜;数据倾斜的核心是部分分区的数据量远高于其他分区,本质是Key分布不均。13.答案:B14.答案:C15.答案:C16.答案:B17.答案:C18.答案:A19.答案:D20.答案:B二、多项选择题1.答案:AB解析:Spark通过StructuredStreaming实现流批统一处理,Flink天生支持流批一体架构;Storm是纯实时流处理框架,MapReduce是纯批处理框架,二者均不具备流批一体能力。2.答案:ABC解析:湖仓一体基于数据湖存储底座,支持多类型数据存储,采用存算分离架构弹性扩展,同时引入数仓的ACID事务能力;D选项错误,湖仓一体支持SQL、Python、机器学习API等多种访问接口。3.答案:ABCD解析:数据质量的通用核心评估维度包括完整性(字段/记录不缺失)、一致性(跨系统/跨表数据逻辑一致)、准确性(数据符合真实业务含义)、时效性(数据及时更新),此外还包括唯一性、规范性等衍生维度。4.答案:ABC解析:端到端Exactly-Once依赖三个核心条件:Source可重放(故障后回退重算)、Checkpoint保证内部状态一致性、Sink支持幂等或2PC保证外部写入一致性;RocksDB仅影响状态存储能力,与一致性语义无直接关联。5.答案:ABC解析:RDD是分布式弹性数据集,强类型、编译期检查,但没有Catalyst优化;DataFrame以Row为单位,携带Schema信息,弱类型、运行期检查,支持Catalyst优化;DataSet是强类型的DataFrame,结合了两者优势,支持Catalyst优化。6.答案:ABD解析:分桶表通过对分桶字段取Hash模分桶数的方式分散数据,可用于数据抽样、分桶Join(避免全量Shuffle),提升查询性能;分桶数量与HDFS块数量无强制关联,可根据业务需求自定义。7.答案:ABC解析:数据清洗是对原始脏数据的治理操作,包括去重、补全缺失值、格式标准化、异常值过滤等;主题域聚合属于数据转换(T)的汇总操作,不属于清洗范畴。8.答案:ABD解析:三种表格式均支持ACID事务、快照隔离、时间旅行、流批一体读写;DeltaLake由Databricks公司主导开源,不属于Apache基金会项目。9.答案:ACD解析:维度建模的常见标准维度类型包括缓慢变化维、退化维、Junk维、角色扮演维、迷你维度等;快速变化维是业务场景中的属性特征,不属于标准维度分类,通常通过拆分事实表或迷你维度的方式处理。10.答案:ABC解析:StructuredStreaming官方支持三种输出模式:Append(仅输出新增结果)、Complete(每次输出全量结果)、Update(仅输出有变更的结果);Overwrite是批处理的输出模式,不属于流处理输出模式。三、判断题1.答案:错误解析:NameNode负责管理文件系统元数据(目录结构、块映射等),DataNode负责存储实际的数据块。2.答案:错误解析:事件时间是数据本身携带的业务发生时间,数据进入引擎的时间为处理时间(ProcessingTime)。3.答案:正确4.答案:错误解析:ODS层是操作数据层,存储原始业务数据;面向应用的最终服务层是ADS(应用数据层)。5.答案:错误6.答案:正确7.答案:错误解析:Checkpoint是Flink自动周期性触发的状态快照(支持增量),用于故障恢复;Savepoint是用户手动触发的全量快照,用于版本升级、任务迁移等场景。8.答案:正确9.答案:错误解析:湖仓一体采用存算分离架构,支持HDFS、S3、OSS等多种存储介质,对象存储是当前主流的存储选择之一。10.答案:正确四、简答题1.答案:①BroadcastJoin(广播连接)工作原理:将小表的全量数据广播到所有Executor节点的内存中,大表的每个分区直接与本地缓存的小表做关联,无需Shuffle阶段。适用场景:小表与大表的关联场景,且小表数据量低于自动广播阈值(默认10MB),性能最优。②SortMergeJoin(排序合并连接)工作原理:两张

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论