版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
2026年大数据工程师职业资格考试试题及答案一、单项选择题(每题1分,共20分)1.在Hadoop生态系统中,负责将用户程序提交到集群并执行资源管理的组件是?A.HDFSB.MapReduceC.YARND.HBase2.Spark中RDD实现容错的关键机制是?A.数据复制B.Lineage(血缘)C.Checkpoint(检查点)D.数据加密3.下列哪种文件格式最适合用于大数据分析中的列式存储?A.TextFileB.CSVC.ParquetD.Avro4.Kafka中,消费者通过记录哪个参数来实现断点续传?A.topicB.partitionC.offsetD.group5.HBase中最小数据存储单元是?A.行(Row)B.列族(ColumnFamily)C.单元格(Cell)D.表(Table)6.Flume中用于暂存并缓存event的组件是?A.SourceB.ChannelC.SinkD.Agent7.下列哪种数据预处理方法不适用于处理缺失值?A.删除含有缺失值的记录B.使用均值填充C.使用前后相邻值填充D.直接加入随机噪声8.K-means聚类算法属于哪种学习范式?A.监督学习B.非监督学习C.半监督学习D.强化学习9.大数据“4V”特征中的“Variety”是指?A.数据量大B.数据类型多样C.处理速度快D.价值密度低10.在Hive中,一条INSERTOVERWRITE语句执行时,底层默认通过哪个计算引擎完成?A.MapReduceB.SparkC.TezD.Flink11.在ZooKeeper中,用于实现分布式锁最典型的节点类型是?A.持久节点B.临时顺序节点C.持久顺序节点D.临时节点12.Sqoop的主要功能是?A.从日志文件中采集数据B.在关系数据库与Hadoop之间进行数据迁移C.对数据进行实时流处理D.管理Hadoop作业调度13.关于HDFS中的小文件问题,下列哪种说法是正确的?A.HDFS特别适合存储大量小文件B.小文件过多会加重NameNode元数据内存压力C.小文件不影响MapReduce任务性能D.HDFS默认存储小文件时会自动合并14.对于MapReduce作业中的数据倾斜,下列哪种处理方案不合理?A.增加reduce任务数量B.对热点key添加随机前缀,再进行二次聚合C.自定义分区函数,使数据分配更均匀D.将所有数据集中到同一个reduce任务15.MapReduce的Shuffle阶段主要发生在下列哪个过程之间?A.Map输入与Split之间B.Map输出与Reduce输入之间C.Reduce输出与写入HDFS之间D.Driver与ApplicationMaster之间16.下列哪个框架以事件驱动、毫秒级延迟为特点,适合实时流处理?A.FlinkB.HiveC.MapReduceD.Oozie17.数据治理中,描述数据从源系统到目标系统完整流转过程的技术称为?A.数据血缘B.数据脱敏C.数据复制D.数据压缩18.在分布式系统的CAP理论中,P代表什么?A.一致性(Consistency)B.可用性(Availability)C.分区容错性(PartitionTolerance)D.持久性(Persistence)19.在数据仓库星型模型中,中心位置通常存放的是?A.维度表B.事实表C.汇总表D.字典表20.在YARN中,负责与ResourceManager协商资源并监控任务执行的组件是?A.NodeManagerB.ApplicationMasterC.ContainerD.Client二、多项选择题(每题2分,共20分)1.下列属于分布式计算框架的有?A.HadoopMapReduceB.SparkC.FlinkD.Hive2.HDFS保证数据可靠性的机制包括?A.多副本冗余B.数据校验(CheckSum)C.节点间心跳检测D.数据加密传输3.Spark中常用的转换(Transformation)算子包括?A.mapB.filterC.reduceByKeyD.saveAsTextFile4.下列属于NoSQL数据库的有?A.HBaseB.MongoDBC.RedisD.Oracle5.关于数据倾斜问题的解决方案,正确的有?A.增大shuffle并行度B.对热点key加随机前缀并两次聚合C.将热点数据打散到不同分区D.将该key的数据全部过滤掉6.下列属于数据预处理环节的有?A.数据清洗B.数据集成C.数据变换D.数据可视化7.关于Flink的特点,正确的有?A.支持事件时间(EventTime)处理B.支持窗口(Window)计算C.提供精确一次(Exactly-once)语义D.仅支持流式处理,不支持批处理8.数据脱敏的常见方法有?A.替换B.重排C.加密D.删除源数据库中的所有数据9.数据质量评估通常包括的维度有?A.完整性B.准确性C.一致性D.及时性10.关于Hive与HBase的描述,正确的有?A.Hive适合离线批量分析B.HBase适合随机实时读写C.Hive通过SQL进行交互D.HBase的底层文件存储格式固定为HFile三、判断题(每题1分,共10分)1.HDFS适合存储大量小文件。2.Spark中RDD是不可变的,一旦创建就不能被修改。3.HBase中的行键(RowKey)按字典顺序排列。4.Kafka的消费者组中,一个分区可以被同组内多个消费者同时消费。5.在数据仓库ETL中,T表示Transform(转换)。6.1ZB=1024MB。7.MapReduce适合处理迭代式机器学习算法。8.HDFS中的文件支持随机更新和覆盖写。9.数据质量维度中,“完整性”通常指数据是否缺失以及缺失比例。10.在分布式系统中,实现强一致性往往比实现最终一致性更容易获得高可用性。四、简答题(每题5分,共15分)1.简述大数据的四个基本特征(4V)及其典型场景。2.Velocity(处理速度快):如实时风控需要在毫秒级识别欺诈交易。3.Variety(数据类型多样):如社交媒体中既有结构化用户信息,也有半结构化日志、非结构化图片和视频。4.Value(价值密度低):如监控视频中仅少数片段包含有效线索。2.简述SparkStreaming与Flink在实时流处理模型上的主要区别。3.窗口机制:Flink支持丰富的事件时间和会话窗口;SparkStreaming窗口基于批间隔,相对简单。4.语义保证:Flink原生支持精确一次语义,SparkStreaming需要额外配置实现类似保证。3.简述HBaseRowKey设计应遵循哪些原则。4.避免使用单调递增的RowKey(如时间戳),防止写入集中在单个Region。五、计算/应用题(每题10分,共20分)1.某二分类数据集S包含100条样本,其中类别A有60条,类别B有40条。请计算该数据集的经验熵H(H其中p1=60代入计算:$$\begin{aligned}
H(S)&=-0.6\log_20.6-0.4\log_20.4\\
&\approx-0.6\times(-0.737)-0.4\times(-1.322)\\
&\approx0.442+0.529\\
&\approx0.971
\end{aligned}$$所以H(2.某HDFS集群数据块大小为128MB,现需存储一个512MB的文件,副本因子设为3。请计算:(1)该文件被划分成多少块?(2)该文件实际占用集群多少物理存储空间(不考虑校验和等额外开销)?(3)若采用机架感知策略,第一个副本放置在客户端本地节点,第二个副本放置在同一机架的另一节点,第三个副本放置在另一机架的节点,至少需要多少个机架才能存储所有副本?512(2)物理空间占用:4也可等价理解为512×(3)第一个副本和第二个副本位于同一机架的不同节点,第三个副本必须位于另一个机架,因此至少需要2个机架。六、案例分析题(15分)某电商平台需要构建一套大数据分析系统,要求:-实时采集用户点击日志,每5分钟统计一次各商品页面的UV和PV;-离线分析历史订单数据,计算各品类销售额Top10;-将实时统计结果与离线报表结果存储在数据库中,供前端查询展示;-系统需具备故障恢复能力,且能应对突发的数据倾斜。请设计一套合理的技术架构,说明各环节的组件选型及理由,并至少提出三个在实施过程中可能遇到的问题及解决方案。1.数据采集层:使用Flume实时采集Web/App点击日志,写入Kafka消息队列。Flume支持多源接入,Kafka具备高吞吐、削峰填谷和持久化能力。2.实时计算层:采用Flink消费Kafka中的点击流,进行窗口聚合,每5分钟计算PV/UV。Flink支持事件时间、精确一次语义,适合实时流处理。3.离线计算层:使用SparkSQL或Hive定期分析HDFS中的历史订单数据,计算各品类销售额Top10。SparkSQL吞吐量高、易用性好,Hive适合海量数据的ETL和批处理。4.存储层:-原始日志与离线计算结果存入HDFS;-实时统计结果与离线报表结果存入HBase(支持随机读写)或MySQL(结果数据量较小时);-前端高频查询的热点结果可放入Redis缓存。5.资源调度与任务调度:使用YARN管理集群资源,使用Azkaban或Oozie编排离线任务。1.数据倾斜:部分热点商品的key集中,导致单个计算节点压力过大。解决:对热点key添加随机前缀,打散到多个分区,完成第一次聚合后再进行全局聚合;也可提高并行度或自定义分区器。2.数据洪峰导致Kafka消费堆积:大促等活动期间流量突增,Flink消费速度跟不上。解决:增加Kafka分区数和Flink并行度;对算子进行性能优化,合理设置背压机制;必要时提前扩容。3.实时结果与离线结果不一致:实时统计与离线计算因时间窗口、数据延迟等原因产生差异。解决:统一事件时间口径;离线结果以全量数据T+1计算,实时结果允许合理误差;建立对账机制,以离线结果进行校正。4.故障恢复:Flume、Kafka或Flink任务宕机可能造成数据丢失或重复。解决:Kafka设置多副本并配置合理ACK;Flink开启Checkpoint;HDFS副本因子默认3,保证底层数据持久可靠。参考答案与解析一、单项选择题1.答案:C解析:YARN是资源管理器;HDFS负责存储;MapReduce、HBase分别是计算与数据库组件。2.答案:B解析:RDD通过记录转换血缘关系,在分区丢失时可重新计算,从而恢复数据。3.答案:C解析:Parquet是典型的列式存储格式,压缩率和查询效率高;Avro为行式存储。4.答案:C解析:offset记录消费者在分区中的消费位置,可实现失败后从上次位置继续消费。5.答案:C6.答案:B7.答案:D8.答案:B9.答案:B10.答案:A解析:Hive默认执行引擎为MapReduce,也可以通过配置切换为Tez、Spark等。11.答案:B12.答案:B13.答案:B解析:每个小文件都会产生元数据并保存在NameNode内存中,文件过多会导致内存膨胀。14.答案:D15.答案:B16.答案:A17.答案:A18.答案:C19.答案:B20.答案:B二、多项选择题1.答案:ABC解析:Hive是数据仓库工具,本身不是计算框架。2.答案:ABC解析:数据加密属于安全机制,不属于可靠性机制。3.答案:ABC解析:saveAsTextFile是行动算子(Action),不是转换算子。4.答案:ABC解析:Oracle是传统关系型数据库。5.答案:ABC解析:过滤会造成数据丢失,不是合理方案。6.答案:ABC7.答案:ABC解析:Flink支持流批一体,既能流处理也能批处理。8.答案:ABC9.答案:ABCD10.答案:ABCD三、判断题1.答案:错误2.答案:正确3.答案:正确4.答案:错误5.答案:正确6.答案:错误7.答案:错误8.答案:错误9.答案:正确10.答案:错误四、简答题1.答案:1.Volume(数据
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 2026全球杯装茶饮品牌竞争格局与渠道策略研究报告
- 2026饮品行业数字孪生技术在库存管理中的应用研究报告
- 2026年虚拟现实教育创新应用发展报告
- 刨花板热压工岗前技能竞赛考核试卷含答案
- 2026年科技行业人工智能应用创新展望报告
- 二氧化碳回收处理操作工岗前能力评估考核试卷含答案
- 钢琴调律师岗前安全生产能力考核试卷含答案
- 电子电气产品检验员创新意识知识考核试卷含答案
- 普通架子工岗位应急准备考核试卷含答案
- 火工品检测工安全宣传能力考核试卷含答案
- 2026孙吴县供销合作社联合社社有企业面向社会联合公开招聘8人笔试备考试题及答案详解
- 2026基层医务人员医护人员的职业防护课件
- 2026年秋北师大版四年级上册数学全册教案(完整版含教学反思)
- 2026年群众文化专业人员职称考试真题
- 二次函数与一元二次方程 (课件) 2026-2027学年人教版九年级数学上册
- 牙科手机注油机使用方法
- 雨课堂学堂在线学堂云《创新思维与创业实验(东南)》单元测试考核答案
- 2025年国才杯日语笔试真题及答案
- 慢性病管理APP开发
- 函数的单调性 第一课时 课件(共18张) 高一上学期数学人教A版必修第一册
- 压力容器安全知识培训课件
评论
0/150
提交评论