2026年大数据技术与应用考试试卷及答案_第1页
2026年大数据技术与应用考试试卷及答案_第2页
2026年大数据技术与应用考试试卷及答案_第3页
2026年大数据技术与应用考试试卷及答案_第4页
2026年大数据技术与应用考试试卷及答案_第5页
已阅读5页,还剩16页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

2026年大数据技术与应用考试试卷及答案一、单项选择题(共20题,每题2分,共40分)1.关于HDFS3.x的特性,以下描述错误的是()A.支持EC(纠删码)存储以降低存储成本B.引入HDFSFederation实现元数据横向扩展C.默认块大小从128MB调整为256MBD.支持QoS(服务质量)控制以优化读写性能2.以下YARN组件中,负责管理单个节点资源并执行任务的是()A.ResourceManagerB.NodeManagerC.ApplicationMasterD.Container3.Spark中,若需要对两个RDD按相同键进行聚合,且希望减少网络传输,应优先使用()A.joinB.cogroupC.reduceByKeyD.groupByKey4.数据倾斜的典型表现不包括()A.任务执行时间差异显著B.个别节点内存溢出C.Shuffle阶段网络流量均匀分布D.部分分区数据量远大于其他分区5.以下Flink时间类型中,基于数据实际产生时间的是()A.EventTimeB.ProcessingTimeC.IngestionTimeD.WatermarkTime6.数据湖(DataLake)与传统数据仓库(DataWarehouse)的核心区别是()A.数据湖仅存储结构化数据,数据仓库支持多类型数据B.数据湖采用“读时模式”,数据仓库采用“写时模式”C.数据湖强调事务性,数据仓库强调分析性D.数据湖不支持SQL查询,数据仓库支持7.隐私计算中,联邦学习(FederatedLearning)的核心目标是()A.在不共享原始数据的前提下联合建模B.对数据进行加密存储C.提升数据清洗效率D.优化分布式计算资源调度8.Kafka中,增加分区数会直接影响()A.消息的有序性(同一分区内)B.消费者组的并行消费能力C.生产者的消息发送延迟D.主题的消息保留时间9.OLAP与OLTP的主要区别是()A.OLAP面向事务处理,OLTP面向分析B.OLAP数据更新频繁,OLTP数据相对静态C.OLAP查询复杂且耗时,OLTP查询简单且实时D.OLAP使用关系型数据库,OLTP使用NoSQL10.数据仓库分层设计中,DWD(数据明细层)的主要作用是()A.存储原始数据,不做任何处理B.对数据进行轻度聚合,满足日常查询C.保留明细数据,完成清洗、去重、关联等操作D.存储高度聚合的统计结果,支持快速分析11.分布式系统中,CAP理论指的是()A.一致性、可用性、分区容错性B.兼容性、可扩展性、性能C.正确性、可恢复性、持久性D.并发控制、访问控制、权限管理12.特征工程中,对类别型特征进行独热编码(One-HotEncoding)的主要目的是()A.减少特征维度B.消除量纲影响C.将离散特征转化为连续特征D.避免模型对类别顺序的错误假设13.MapReduce计算过程中,排序(Sort)阶段发生在()A.Mapper输出后,Reducer输入前B.Mapper输入前C.Reducer输出后D.Shuffle阶段之前14.Elasticsearch中,倒排索引(InvertedIndex)的核心作用是()A.加速文档的全文检索B.优化数据存储压缩率C.支持事务的原子性操作D.实现分布式数据分片15.Kudu相比HBase更适合的场景是()A.实时写入与随机读B.大规模历史数据的批量写入C.高频更新与点查、范围查询D.非结构化数据的存储与检索16.以下数据脱敏方法中,属于不可逆脱敏的是()A.替换(如将“张三”替换为“用户A”)B.加密(如AES加密)C.掩码(如将身份证号后6位隐藏)D.哈希(如MD5哈希)17.机器学习模型训练中,若验证集准确率远低于训练集,可能的原因是()A.模型欠拟合B.模型过拟合C.数据存在缺失值D.学习率过低18.HBase中,RegionServer的主要职责是()A.管理元数据(如hbase:meta表)B.处理客户端的读写请求,管理RegionC.协调Region的分裂与合并D.实现HBase与HDFS的接口19.数据血缘(DataLineage)分析的主要价值是()A.提升数据存储效率B.追踪数据从产生到最终应用的全流程C.优化数据清洗规则D.增强数据加密强度20.图计算中,PageRank算法主要用于()A.社区发现B.节点重要性排序C.最短路径计算D.图的聚类分析二、填空题(共10题,每题2分,共20分)1.HDFS默认块大小在Hadoop3.x中为________MB。2.YARN中负责资源分配与调度的全局组件是________。3.Spark的共享变量包括广播变量(BroadcastVariable)和________。4.Flink1.18版本中,流批一体的核心实现是将批处理视为________的特例。5.Kafka消费者组中,一个分区最多被________个消费者实例消费。6.数据仓库ETL流程的三个阶段是抽取(Extract)、转换(Transform)和________。7.分布式锁的常见实现方式包括基于数据库、Redis和________(选填一种)。8.特征选择的常用方法包括过滤法(Filter)、包裹法(Wrapper)和________。9.HBase的RowKey设计需要遵循散列性、________和长度适当原则。10.隐私计算的典型框架包括联邦学习、安全多方计算(MPC)和________(选填一种)。三、简答题(共5题,每题6分,共30分)1.简述Hadoop3.x相比2.x的主要改进。2.说明SparkRDD的五大特性。3.列举数据倾斜的检测方法及至少三种解决策略。4.解释Flink流批一体的实现原理,并说明其优势。5.对比数据湖与数据仓库在数据类型、模式设计、应用场景上的差异。四、应用题(共2题,每题15分,共30分)1.某电商平台需要实时分析用户行为(如点击、加购、下单),要求处理延迟低于3秒,支持实时报表展示和异常事件告警。请设计技术方案,包括数据采集、流处理、存储和展示组件的选择,并说明各组件的作用及数据流程。2.某企业在使用Spark处理用户订单数据时,发现部分任务运行时间长达2小时(正常任务约10分钟),且日志显示Shuffle阶段网络流量集中在少数节点。请分析可能原因(数据倾斜),并给出具体的诊断步骤和优化方法。五、综合题(共1题,20分)设计一个企业级大数据平台架构,需包含数据采集层、存储层、计算层、分析应用层,并说明各层的核心组件及设计要点(需考虑高并发、低延迟、数据安全、可扩展性等需求)。答案一、单项选择题1.C2.B3.C4.C5.A6.B7.A8.B9.C10.C11.A12.D13.A14.A15.C16.D17.B18.B19.B20.B二、填空题1.128(注:Hadoop3.x默认块大小仍为128MB,EC存储为可选特性)2.ResourceManager3.累加器(Accumulator)4.有界流(BoundedStream)5.16.加载(Load)7.ZooKeeper(或etcd)8.嵌入法(Embedded)9.有序性(或前缀匹配)10.同态加密(或可信执行环境TEE)三、简答题1.Hadoop3.x的改进包括:①引入HDFS纠删码(EC),通过冗余策略降低存储成本(如6+3编码,存储利用率提升50%);②支持YARN的资源隔离增强(如CGroups),提升多租户资源管理能力;③HDFSFederation元数据横向扩展优化,支持更大集群规模;④MapReduce性能优化(如基于容器的任务调度);⑤兼容Java11及以上版本,提升安全性和维护性。2.SparkRDD的五大特性:①不可变的分布式数据集,支持分区(Partition);②依赖关系(Dependency),记录RDD之间的计算血缘;③计算函数(ComputeFunction),用于根据父RDD计算当前RDD;④分区器(Partitioner),控制键值对RDD的分区方式(如HashPartitioner);⑤优先位置(PreferedLocations),数据本地性优化(如HDFS块的位置)。3.数据倾斜检测方法:①任务监控(如SparkUI中查看各任务执行时间,差异超3倍可能倾斜);②Shuffle指标(如Spark的shuffleread/writemetrics,个别分区数据量异常大);③日志分析(查看是否有节点内存溢出或GC频繁)。解决策略:①过滤异常值(如高频Key去噪);②加盐分桶(对倾斜Key添加随机前缀,分散到多个分区);③使用MapSide预聚合(如在Mapper端先局部聚合,减少Shuffle数据量);④调整分区数(增加分区数,分散数据分布);⑤使用广播join替代Shufflejoin(小表广播到各节点)。4.Flink流批一体的实现原理:将批处理视为“有界流”(BoundedStream),统一使用流处理引擎处理。通过Watermark机制处理有界流的时间语义,利用Checkpoint实现容错,同时优化批处理的调度(如批量提交、内存优化)。优势:①统一开发接口(如DataStreamAPI支持批流),降低学习成本;②统一运维(同一套集群管理流批任务);③批处理性能提升(利用流引擎的优化技术,如状态管理、增量计算)。5.数据湖与数据仓库的差异:①数据类型:数据湖支持结构化、半结构化、非结构化数据(如日志、图片);数据仓库主要存储结构化数据(如关系型表)。②模式设计:数据湖采用“读时模式”(Schema-on-Read),写入时不强制模式,读取时解析;数据仓库采用“写时模式”(Schema-on-Write),写入前需定义严格模式。③应用场景:数据湖适用于探索性分析、多源数据融合、机器学习训练;数据仓库适用于确定性报表、OLAP查询、业务指标统计。四、应用题1.技术方案设计:数据采集:使用Flume或KafkaConnect采集用户行为日志(如Nginx日志、APP埋点),实时发送至Kafka消息队列(作用:解耦生产与消费,缓冲高并发流量)。流处理:采用ApacheFlink作为流处理引擎,消费Kafka数据,进行窗口计算(如5秒滚动窗口)、过滤(如排除机器人行为)、聚合(如统计每分钟点击量)。Flink作业需设置Checkpoint(如每30秒)保障容错,使用EventTime+Watermark处理乱序数据(作用:实时计算,延迟<3秒)。存储:实时结果写入HBase(高频点查,如用户实时访问次数)和ClickHouse(列式存储,支持实时OLAP查询);原始日志归档至HDFS或云对象存储(如OSS)。展示:通过Grafana或Superset连接ClickHouse,展示实时报表(如PV/UV、转化率);异常检测(如下单量骤降)通过FlinkCEP(复杂事件处理)触发告警,发送至钉钉/邮件。数据流程:用户行为→采集工具→Kafka→Flink处理→HBase/ClickHouse→可视化/告警。2.数据倾斜诊断与优化:可能原因:订单数据中存在高频Key(如某大促活动的商品ID),导致Shuffle阶段该Key的数据集中到少数Reducer,引发任务延迟。诊断步骤:①查看SparkUI的“Stages”标签,定位耗时Stage(通常为ShuffleWrite/Read阶段)。②进入该Stage的“TaskMetrics”,对比各任务的“ShuffleReadSize”,若个别任务数据量是其他任务的10倍以上,确认倾斜。③分析倾斜Key:在Mapper输出阶段添加日志(如统计Top10Key的出现次数),或使用approxTop函数快速定位高频Key。优化方法:①预聚合:在Map阶段对倾斜Key进行局部聚合(如使用mapPartitions先计算每个分区内的Key计数),减少Shuffle数据量。②加盐分桶:对倾斜Key添加随机前缀(如0-9的随机数),将其分散到10个分区,聚合时先按加盐Key计算,再去前缀合并结果。③调整分区策略:将HashPartitioner改为RangePartitioner(根据Key分布自定义分区边界),或手动设置分区数为原分区数的5-10倍。④广播小表:若倾斜是由于大表与小表join引起,将小表广播至所有节点,避免Shuffle(如使用BroadcastHashJoin)。五、综合题企业级大数据平台架构设计:1.数据采集层:组件:Flume(日志采集)、KafkaConnect(关系型数据库CDC,如Debezium)、边缘计算网关(如EMQX,采集IoT设备数据)。设计要点:支持多源接入(结构化/非结构化),高并发写入(Kafka分区数根据流量调整),数据脱敏(如通过正则替换手机号)。2.存储层:组件:HDFS/对象存储(OSS)(冷数据存储,成本低)、HBase(实时读写,如用户画像)、Kudu(高频更新+范围查询,如订单状态)、DeltaLake(数

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论