版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
2026年大数据HCIA复习题+参考答案一、单项选择题1.大数据技术中,HDFS默认的块大小是()。A.32MBB.64MBC.128MBD.256MB答案:C2.Hive中,元数据默认存储在()数据库中。A.MySQLB.PostgreSQLC.DerbyD.Oracle答案:C3.SparkRDD的核心特性是()。A.可变、不可分区B.不可变、可分区C.可变、可分区D.不可变、不可分区答案:B4.HBase中,负责管理Region的服务器是()。A.HMasterB.RegionServerC.ZooKeeperD.HQuorumPeer答案:B5.YARN中,负责为应用程序分配资源并监控其运行状态的组件是()。A.ResourceManagerB.NodeManagerC.ApplicationMasterD.Container答案:C6.以下不属于数据清洗主要步骤的是()。A.缺失值处理B.数据标准化C.异常值检测D.数据可视化答案:D7.分布式文件系统的核心目标是()。A.降低存储成本B.提高单节点性能C.实现海量数据的可靠存储与高效访问D.简化数据管理流程答案:C8.Hive的分区(Partition)和分桶(Bucket)中,()是物理分割数据的方式。A.分区B.分桶C.两者都是D.两者都不是答案:A9.Spark中,以下属于Action操作的是()。A.map()B.filter()C.reduce()D.flatMap()答案:C10.HBase的RowKey设计时,为避免热点问题,通常建议()。A.使用递增时间戳作为前缀B.对RowKey进行哈希散列C.保持RowKey长度尽可能长D.按业务含义顺序拼接字段答案:B二、多项选择题1.以下属于Hadoop生态核心组件的有()。A.HDFSB.MapReduceC.YARND.Hive答案:ABCD2.数据清洗的常见方法包括()。A.缺失值填充(如均值、中位数)B.异常值删除或修正(如Z-score检验)C.重复记录去重D.数据格式转换(如日期格式统一)答案:ABCD3.分布式系统的关键特性包括()。A.高可用性(HA)B.可扩展性(Scalability)C.容错性(FaultTolerance)D.强一致性(StrongConsistency)答案:ABC4.Hive支持的存储格式有()。A.TextFileB.ParquetC.ORCD.CSV答案:ABC5.Spark的部署模式包括()。A.StandaloneB.YARNC.MesosD.Kubernetes答案:ABCD三、判断题1.HDFS适合存储大量小文件,因为其元数据管理效率高。()答案:×(HDFS存储小文件会占用过多NameNode内存,降低性能)2.HBase是一种列式存储的NoSQL数据库,支持ACID事务。()答案:×(HBase仅支持单行事务,不支持跨行/跨表事务)3.MapReduce适用于实时数据处理场景(如秒级响应)。()答案:×(MapReduce是离线批处理框架,实时性差)4.Spark的Shuffle操作会将数据从内存写入磁盘,导致较大IO开销。()答案:√5.Hive的分区键可以是多个字段的组合,用于快速定位数据。()答案:√四、简答题1.简述HDFS的写数据流程。答案:HDFS写数据流程主要包括以下步骤:(1)客户端调用FileSystem.create()请求创建文件,NameNode检查权限及文件是否存在,返回允许写入的响应。(2)客户端将文件分块(默认128MB),向NameNode申请第一个块的存储位置(返回若干DataNode列表)。(3)客户端与第一个DataNode建立Pipeline(默认3副本),按顺序将数据块通过Pipeline传输,DataNode接收数据后复制到其他副本节点。(4)每个DataNode确认接收完成后,向客户端返回确认信息,客户端通知NameNode该块写入完成。(5)重复步骤(2)-(4)直到所有块写入完成,最后客户端通知NameNode文件写入结束。2.说明MapReduce的核心执行步骤。答案:MapReduce执行步骤分为以下阶段:(1)输入分片(InputSplit):将输入数据划分为多个Split,每个Split对应一个Map任务。(2)Map阶段:每个Map任务读取对应Split的数据,调用用户定义的map函数,输出<key,value>键值对。(3)Shuffle阶段:分区(Partition):根据key的哈希值将map输出分配到不同分区(对应Reduce任务)。排序(Sort):每个分区内的键值对按key排序。合并(Combine,可选):对相同key的value进行本地聚合,减少网络传输量。(4)Reduce阶段:每个Reduce任务拉取对应分区的数据,调用reduce函数处理,输出最终结果到HDFS。3.对比HBase与Hive的适用场景。答案:HBase与Hive的适用场景对比如下:(1)数据模型:Hive基于表结构,类似关系型数据库,适合结构化数据;HBase是列式存储,适合半结构化/非结构化数据。(2)查询类型:Hive支持复杂SQL查询(如JOIN、聚合),但为离线处理;HBase支持单键查询、范围扫描,实时性高。(3)数据规模:两者均支持海量数据,但HBase更适合高频读/写(如实时日志、用户行为记录);Hive适合离线分析(如报表提供、趋势预测)。(4)事务支持:HBase支持单行事务;Hive仅支持有限的事务(需开启配置)。4.解释SparkRDD的容错机制。答案:SparkRDD通过“血统(Lineage)”机制实现容错,具体如下:(1)RDD是不可变的分布式数据集,每个RDD记录其依赖的父RDD(即提供该RDD的转换操作链)。(2)当某个RDD分区数据丢失时,Spark根据Lineage重新计算该分区(而非复制所有数据),通过重新执行父RDD的转换操作恢复数据。(3)对于计算成本高的RDD,可通过persist()或cache()方法将其持久化到内存/磁盘,减少重复计算开销。5.数据清洗的主要步骤及常见技术。答案:数据清洗的主要步骤包括:(1)数据质量检查:通过统计分析(如缺失率、异常值比例)、规则校验(如日期格式、字段长度)定位问题数据。(2)缺失值处理:技术包括删除缺失记录、均值/中位数填充、插值法(如线性插值)、模型预测填充(如KNN算法)。(3)异常值处理:技术包括Z-score检验(超出3σ视为异常)、IQR法(超出Q3+1.5IQR或Q1-1.5IQR视为异常)、直接删除或修正。(4)重复值处理:通过主键或特征字段去重(如保留第一条/最后一条记录)。(5)格式标准化:统一日期格式(如“2023-01-01”与“2023/1/1”)、数值单位(如“100cm”转为“1m”)等。五、综合题1.某电商企业需分析用户行为数据(包括点击、加购、下单记录),要求:(1)设计基于Hadoop生态的离线处理流程;(2)说明各组件的作用;(3)给出关键步骤的技术细节。答案:(1)离线处理流程设计:原始数据(日志文件)→Flume采集→HDFS存储→Hive数据清洗与结构化→SparkSQL分析→结果存储(HDFS/MySQL)→可视化(如Superset)。(2)各组件作用:Flume:实时采集服务器日志,批量写入HDFS,确保数据可靠传输。HDFS:作为底层存储,保存原始日志及中间结果,支持海量数据存储。Hive:将HDFS上的文本日志映射为结构化表(如user_behavior表,字段包括user_id、event_type、item_id、timestamp),通过HiveQL进行清洗(如过滤无效记录、转换时间格式)和预处理(如按日期分区)。SparkSQL:基于Hive表进行深度分析(如计算各商品的转化率=下单数/点击数、用户行为路径分析),利用Spark的内存计算优势提升效率。MySQL:存储分析结果(如Top10热销商品),供业务系统快速查询。(3)关键步骤技术细节:数据清洗:在Hive中使用UDF(用户自定义函数)处理时间戳(如将“1672531200”转为“2023-01-0100:00:00”);通过WHERE子句过滤event_type为空的记录。分区设计:Hive表按dt(日期)分区(如dt=2023-01-01),查询时仅扫描指定日期分区,提升查询效率。Spark分析:使用窗口函数(windowfunction)计算用户行为序列(如点击→加购→下单的时间间隔);通过groupBy和agg函数统计各商品的点击、加购、下单次数。2.某物联网平台需处理传感器实时数据流(每秒10万条,字段包括设备ID、温度、湿度、时间戳),要求:(1)设计实时处理架构;(2)说明各组件的选型及原因;(3)提出性能优化策略。答案:(1)实时处理架构设计:传感器→Kafka消息队列→Flink实时处理→HBase存储→实时监控平台。(2)组件选型及原因:Kafka:作为消息中间件,支持高吞吐(每秒百万级消息)、持久化存储(通过主题分区),为Flink提供稳定的数据流输入,解耦生产端与处理端。Flink:选择原因包括低延迟(毫秒级)、支持事件时间(EventTime)处理(解决传感器时间戳乱序问题)、精确一次(Exactly-Once)语义(确保数据处理正确性)。HBase:列式存储适合高频写入(传感器数据按设备ID+时间戳作为RowKey),支持快速单键查询(如查询某设备某时间段的温度),满足实时监控的低延迟需求。(3)性能优化策略:Kafka层面:增加分区数(如设置为CPU核心数×2),提升消费者并行度;调整linger.ms(延迟发送)和batch.size(批量大小),平衡吞吐量与延迟。Flink层面:并行度调优:根据Kafka分区数设置Source并行度(1:1对应),避免数据倾斜(如按设备ID分区);状态后端选择:使用RocksDB状态后端(适合大状态场景),配
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 2026渭职单招面试题及答案
- 2026乌航乘务面试题及答案
- 2026下井职工面试题及答案
- 2026项目专员面试题目及答案
- 2026新疆文职面试题目及答案
- 2026年临床执业医师综合考试二试真题及答案
- 2026特种设备安全管理员考试题库及答案
- 网站制作合同书
- 【教学设计】《习作:-即景》
- 【教学设计】《习作:我的观察日记》
- 2025广西卫生职业技术学院招聘临床医学院(附属医院)(筹)工作人员13人考试参考试题及答案解析
- DB65T 3722-2015 土地整治工程建设标准
- 日本食品储藏管理办法
- 培训后续跟踪管理办法
- 临床病例书写试题及答案2025版
- 重症肺炎集束化治疗专题报告
- 纲要与指南试题及答案
- DB32/T 4467-2023南美白对虾小型温棚养殖尾水生态化处理技术规程
- 门窗副框合同协议
- 西北名校教研联盟2025届高三下学期2月联考英语试题(解析版)
- 学校食堂经理员合同协议书版
评论
0/150
提交评论