2025年大数据技术与应用考核能力测试题及答案_第1页
2025年大数据技术与应用考核能力测试题及答案_第2页
2025年大数据技术与应用考核能力测试题及答案_第3页
2025年大数据技术与应用考核能力测试题及答案_第4页
2025年大数据技术与应用考核能力测试题及答案_第5页
已阅读5页,还剩8页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

2025年大数据技术与应用考核能力测试题及答案一、单项选择题(每题2分,共20分)1.以下哪种技术属于大数据实时处理框架?A.HadoopMapReduceB.SparkRDDC.ApacheFlinkD.Hive答案:C2.在数据湖仓一体(Lakehouse)架构中,核心解决的问题是?A.结构化数据与非结构化数据的统一存储B.批处理与流处理的性能优化C.数据仓库的实时写入限制D.数据湖的分析能力不足与数据仓库的灵活性缺陷答案:D3.联邦学习中“数据不动模型动”的核心目的是?A.降低数据传输成本B.保护数据隐私C.提升模型训练速度D.减少计算资源消耗答案:B4.Spark中RDD的persist()方法默认存储级别是?A.MEMORY_ONLYB.MEMORY_AND_DISKC.DISK_ONLYD.MEMORY_ONLY_SER答案:A5.以下哪项不属于数据清洗的常见操作?A.缺失值填充B.异常值检测C.数据归一化D.重复数据删除答案:C(数据归一化属于数据变换)6.HBase的RowKey设计中,为避免热点问题通常采用的策略是?A.递增时间戳作为前缀B.哈希散列或加盐C.按业务主键直接排序D.长字符串作为主键答案:B7.在Flink的时间窗口中,事件时间(EventTime)的水印(Watermark)用于解决?A.数据乱序问题B.窗口触发延迟C.状态存储溢出D.流数据背压答案:A8.数据血缘分析的主要作用是?A.统计数据使用频率B.追踪数据来源与处理过程C.优化数据存储结构D.评估数据质量等级答案:B9.以下哪种数据库适合存储时序大数据(如IoT传感器数据)?A.MySQLB.CassandraC.InfluxDBD.Redis答案:C10.云原生大数据平台的核心特征是?A.基于单一云服务商构建B.支持容器化部署与弹性扩缩容C.完全依赖本地硬件资源D.仅支持批处理任务答案:B二、多项选择题(每题3分,共15分,少选得1分,错选不得分)1.大数据技术栈中,属于分布式文件系统的有?A.HDFSB.GFS(GoogleFileSystem)C.CephD.HBase答案:ABC2.数据预处理阶段可能包括以下哪些步骤?A.数据抽取(ETL中的Extract)B.特征工程(FeatureEngineering)C.数据脱敏(DataMasking)D.维度建模(DimensionalModeling)答案:ABC(维度建模属于数据仓库设计阶段)3.SparkSQL支持的数据源包括?A.Hive表B.JSON文件C.JDBC数据库D.Kafka流数据答案:ABCD4.隐私计算技术主要包括?A.多方安全计算(MPC)B.联邦学习(FL)C.同态加密(HE)D.数据脱敏(Masking)答案:ABC(数据脱敏属于数据保护手段,非计算技术)5.大数据平台性能优化的常见方法有?A.增加并行度(Parallelism)B.减少数据Shuffle量C.使用列式存储(如Parquet)D.关闭推测执行(SpeculativeExecution)答案:ABC(推测执行用于解决任务延迟,关闭可能降低容错性)三、简答题(每题8分,共40分)1.简述Hadoop生态中HDFS、YARN、MapReduce的分工与协作关系。答案:HDFS负责分布式存储,将大文件分块存储在集群节点;YARN作为资源管理系统,负责集群资源(CPU、内存)的调度与分配;MapReduce是计算框架,将任务分解为Map和Reduce阶段,通过YARN申请资源执行。协作流程:用户提交MapReduce任务→YARN的ResourceManager分配Container资源→NodeManager启动ApplicationMaster→ApplicationMaster向ResourceManager申请任务资源→NodeManager启动Map/Reduce任务进程→任务读取HDFS数据并输出结果到HDFS。2.对比SparkRDD与FlinkDataStream的核心差异。答案:①数据模型:RDD是不可变的分布式数据集,基于批处理;DataStream是持续流动的事件流,基于流处理。②执行方式:Spark通过DAG调度批处理任务,Flink通过时间窗口和水印处理实时流。③状态管理:Flink内置状态后端(如RocksDB)支持长时间窗口的状态存储;Spark需通过Checkpoint或外部存储管理状态。④时间语义:Flink支持事件时间、处理时间、摄入时间,RDD默认基于处理时间。3.说明数据湖(DataLake)与数据仓库(DataWarehouse)的主要区别。答案:①数据类型:数据湖存储原始的、多格式(结构化/半结构化/非结构化)数据;数据仓库存储经过清洗、结构化的业务数据。②存储成本:数据湖使用对象存储(如S3、OSS),成本更低;数据仓库使用结构化存储(如关系型数据库),成本较高。③处理模式:数据湖采用“读时模式”(SchemaonRead),灵活性高;数据仓库采用“写时模式”(SchemaonWrite),需提前定义结构。④应用场景:数据湖支持探索性分析、AI训练;数据仓库支持确定性的OLAP查询。4.解释Flink中水印(Watermark)的提供策略及其在事件时间窗口中的作用。答案:水印是一个时间戳,表示后续不会再有该时间戳之前的数据到达。提供策略包括:①周期性水印(Periodic):按固定间隔提供,适用于数据乱序程度低的场景;②标点水印(Punctuated):基于特定事件(如数据中的标记)触发,适用于乱序严重场景。作用:当水印超过窗口的结束时间时,触发窗口计算,确保在延迟数据到达前完成计算(允许设置延迟时间),平衡实时性与准确性。5.列举三种常见的大数据安全技术,并说明其应用场景。答案:①数据脱敏:对敏感数据(如身份证号、手机号)进行替换、掩码处理,用于开发测试环境数据分发。②访问控制(RBAC):基于角色分配数据访问权限,适用于企业内部多部门数据共享场景。③联邦学习:在不交换原始数据的前提下联合训练模型,适用于跨机构(如银行与电商)的用户画像建模。四、计算题(10分)某电商平台日均产生用户行为日志100TB(压缩后,每记录约500字节),要求存储到HDFS中(块大小128GB,副本数3)。假设集群节点存储容量为16TB/节点(可用空间80%),计算:(1)每日产生的日志记录数;(2)HDFS存储所需的总块数;(3)至少需要多少台存储节点?答案:(1)记录数=100TB/500B=100×10^12B/500B=2×10^11条(200亿条)。(2)HDFS块数=100TB/128GB=100×1024GB/128GB=800块(注意:HDFS按原始大小计算块数,不考虑压缩,若题目明确“压缩后存储”则需调整,但通常HDFS块大小基于原始数据)。(3)总存储量=100TB×3副本=300TB;每节点可用空间=16TB×80%=12.8TB;节点数=300TB/12.8TB≈23.44,向上取整为24台。五、综合应用题(15分)某智慧城市项目需实时分析交通传感器数据(每秒10万条,包含时间戳、传感器ID、车流量、车速、车牌号),要求实现以下功能:(1)实时监测主干道车流量,当连续5分钟平均车流量超过5000辆/分钟时触发预警;(2)每日统计各路段的高峰时段(车流量前20%的时段);(3)对异常车速(超过限速20%)的车辆进行记录,需关联车牌号与车主信息(存储在MySQL数据库)。请设计技术方案,包括:①数据采集与传输技术;②实时处理框架选择及拓扑设计;③存储方案(实时预警、历史统计、异常记录);④关键技术点(如窗口定义、状态管理、外部连接)。答案:①数据采集与传输:传感器通过MQTT协议将数据发送至Kafka消息队列(高吞吐量、持久化),分区数根据吞吐量设置(如10分区,每个分区处理1万条/秒)。②实时处理框架:选择ApacheFlink(支持事件时间窗口、状态管理、SQL集成)。拓扑设计:Source:KafkaConsumer读取原始数据流;处理1(预警):按传感器ID分组,定义滑动窗口(窗口大小5分钟,滑动间隔1分钟),计算平均车流量,输出预警事件;处理2(高峰时段统计):按路段分组,使用EventTime会话窗口(间隔30分钟),聚合每日车流量,通过FlinkTableAPI写入Hive或ClickHouse;处理3(异常车速):过滤车速>限速×1.2的记录,通过异步IO连接MySQL查询车主信息(减少延迟),输出异常记录。③存储方案:实时预警:结果写入Redis(内存存储,低延迟查询)或Kafka(供监控系统消费);历史统计:每日结果写入Hive(支持批处理分析)或ClickHouse(OLAP加速);异常记录:结构化数据写入MySQL(关联车主信息),非结构化日志写入Elasticsearch(支持快速检索)。④关键技术点:

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论