2026年大数据HCIA习题库及答案_第1页
2026年大数据HCIA习题库及答案_第2页
2026年大数据HCIA习题库及答案_第3页
2026年大数据HCIA习题库及答案_第4页
2026年大数据HCIA习题库及答案_第5页
已阅读5页,还剩16页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

2026年大数据HCIA习题库及答案一、单项选择题1.以下关于Hadoop分布式文件系统(HDFS)的描述中,错误的是?A.HDFS采用主从架构,主节点为NameNode,从节点为DataNodeB.HDFS默认块大小为128MB,可通过配置修改C.HDFS适合存储大量小文件,支持随机读写D.HDFS通过副本机制保证数据可靠性,默认副本数为3答案:C解析:HDFS设计目标是处理大文件,小文件会占用NameNode内存导致元数据管理压力;HDFS是流式数据访问,不支持随机读写,适合一次写入多次读取场景。2.在YARN(YetAnotherResourceNegotiator)架构中,负责管理单个节点上资源并与ResourceManager通信的组件是?A.ApplicationMasterB.NodeManagerC.ContainerD.TimelineServer答案:B解析:NodeManager是YARN的从节点,负责监控本节点资源使用情况,管理Container生命周期,并向ResourceManager汇报状态;ApplicationMaster负责单个应用的资源申请和任务监控。3.以下哪项不是HBase的核心组件?A.RegionServerB.HMasterC.ZookeeperD.NameNode答案:D解析:HBase依赖HDFS存储数据,NameNode是HDFS组件;HBase自身核心组件包括HMaster(管理RegionServer)、RegionServer(处理数据读写)、Zookeeper(维护集群状态)。4.关于SparkRDD(弹性分布式数据集)的特性,以下描述错误的是?A.RDD具有容错性,通过血统(Lineage)机制恢复数据B.RDD支持惰性计算,转换操作(Transformations)不会立即执行C.RDD是不可变的,所有转换操作会提供新的RDDD.RDD默认存储在磁盘中,可通过persist()方法缓存到内存答案:D解析:RDD默认存储在内存中,若内存不足会溢出到磁盘;persist()方法可指定存储级别(如MEMORY_ONLY、MEMORY_AND_DISK)。5.数据清洗过程中,处理“年龄字段出现-5”的问题属于?A.缺失值处理B.异常值处理C.重复值处理D.格式不一致处理答案:B解析:年龄为负数属于逻辑错误的异常值,需通过统计方法(如Z-score、IQR)识别并修正;缺失值指字段为空,重复值指记录重复,格式不一致如“2023/1/1”与“2023-01-01”。6.以下Hive(Hadoop数据仓库工具)的说法中,正确的是?A.HiveQL语法与SQL完全一致,支持所有SQL特性B.Hive元数据默认存储在HDFS中,可通过配置存储到MySQLC.Hive表分为内部表(管理表)和外部表,删除外部表会同时删除HDFS数据D.Hive的执行引擎支持MapReduce、Spark、Tez等答案:D解析:Hive支持多种执行引擎(如MapReduce、Spark、Tez);HiveQL是类SQL语法,不支持所有SQL特性(如事务);元数据默认存储在Derby,生产环境常用MySQL;外部表删除时仅删除元数据,保留HDFS数据。7.在Kafka(分布式消息队列)中,消费者组(ConsumerGroup)的主要作用是?A.提高消息发送速率B.实现消息的广播与负载均衡C.保证消息的顺序性D.存储消息的元数据答案:B解析:同一消费者组内的消费者通过分区分配实现负载均衡(每条消息仅被组内一个消费者消费),不同消费者组间实现广播(每条消息被所有组消费)。8.以下关于分布式计算框架的描述,正确的是?A.MapReduce适合实时数据处理,延迟低于1秒B.SparkStreaming基于微批处理,延迟通常为秒级C.Flink是批处理框架,不支持流处理D.Storm是批处理框架,支持高吞吐数据处理答案:B解析:SparkStreaming将流数据分割为小批次(如1秒),处理延迟秒级;MapReduce适合离线批处理,延迟分钟级;Flink是流批一体框架,支持毫秒级延迟;Storm是实时流处理框架,支持低延迟。9.数据湖(DataLake)与数据仓库(DataWarehouse)的主要区别是?A.数据湖存储结构化数据,数据仓库存储非结构化数据B.数据湖在存储时定义模式(Schema-on-Write),数据仓库在分析时定义模式(Schema-on-Read)C.数据湖存储原始数据,数据仓库存储经过清洗、转换的数据D.数据湖仅支持SQL查询,数据仓库支持多种分析工具答案:C解析:数据湖存储原始的、多格式(结构化/半结构化/非结构化)数据,采用Schema-on-Read(分析时定义模式);数据仓库存储经过ETL的结构化数据,采用Schema-on-Write(存储前定义模式)。10.以下哪项不是HDFS的高容错机制?A.数据副本存储在不同机架B.NameNode元数据通过SecondaryNameNode定期合并编辑日志C.DataNode定期向NameNode发送心跳和块报告D.启用HDFSFederation实现横向扩展答案:D解析:HDFSFederation是横向扩展机制(多个NameNode管理不同命名空间),与容错无关;容错机制包括副本策略、心跳检测、SecondaryNameNode/CheckpointNode/JournalNode的元数据备份。二、多项选择题1.以下属于Hadoop生态系统组件的有?A.HiveB.SparkC.FlinkD.Kafka答案:ABCD解析:Hadoop生态包含存储(HDFS)、计算(MapReduce)、资源管理(YARN)、数据仓库(Hive)、数据库(HBase)、流处理(Storm、Flink)、消息队列(Kafka)等组件。2.关于HBase的RowKey设计原则,正确的有?A.避免RowKey过长,减少存储和查询开销B.采用递增序列作为RowKey,提高写入性能C.分散RowKey的哈希值,避免热点问题D.RowKey需包含时间戳,便于按时间范围查询答案:ACD解析:递增RowKey会导致所有写入集中在最后一个Region,引发热点问题;应通过哈希、反转等方式分散RowKey;RowKey长度建议不超过16字节;包含时间戳可优化时间范围查询。3.SparkRDD的持久化(Persistence)级别包括?A.MEMORY_ONLYB.MEMORY_AND_DISKC.DISK_ONLYD.MEMORY_ONLY_SER答案:ABCD解析:Spark支持多种持久化级别,如仅内存(MEMORY_ONLY)、内存+磁盘(MEMORY_AND_DISK)、仅磁盘(DISK_ONLY)、内存序列化(MEMORY_ONLY_SER)等,可通过StorageLevel类指定。4.数据清洗的常见步骤包括?A.缺失值处理(填充、删除)B.异常值检测(Z-score、IQR)C.重复值去除(记录去重)D.格式标准化(统一日期格式)答案:ABCD解析:数据清洗需处理缺失值、异常值、重复值、格式不一致、逻辑错误等问题,以上均为典型步骤。5.YARN的资源调度器类型包括?A.FIFOSchedulerB.CapacitySchedulerC.FairSchedulerD.SparkScheduler答案:ABC解析:YARN内置三种调度器:FIFO(先进先出)、Capacity(多队列容量控制)、Fair(公平共享);SparkScheduler是Spark自身的任务调度器,与YARN无关。6.以下关于KafkaPartition(分区)的描述,正确的是?A.分区数决定了消费者组中消费者的最大并行度B.增加分区数可提高主题的吞吐量C.分区数据在Broker中按顺序存储,保证同一分区内消息有序D.分区的副本数可超过Broker数量答案:ABC解析:分区副本数不能超过Broker数量(每个副本需存储在不同Broker);分区数决定了消费者组的最大消费者数(一个消费者处理一个分区),增加分区可水平扩展吞吐量,同一分区内消息严格有序。7.以下属于NoSQL数据库特点的有?A.支持ACID事务B.schema灵活,适合非结构化数据C.横向扩展能力强D.采用关系模型存储数据答案:BC解析:NoSQL(NotOnlySQL)强调高扩展、高可用,支持灵活schema(如键值、列族、文档、图模型),通常不支持强事务(除Couchbase等部分产品);关系模型是关系型数据库(如MySQL)的特点。8.大数据处理的典型场景包括?A.实时日志分析(如网站访问日志)B.推荐系统(基于用户行为数据)C.气象数据预测(PB级历史数据)D.企业ERP系统的事务处理答案:ABC解析:ERP系统事务处理(如订单录入)属于OLTP(联机事务处理),适合关系型数据库;大数据处理侧重OLAP(联机分析处理)、实时流处理、海量数据挖掘等场景。三、判断题1.HDFS的NameNode负责存储数据块,DataNode负责管理文件元数据。()答案:×解析:NameNode管理元数据(文件目录、块位置),DataNode存储数据块。2.Spark的行动操作(Actions)会触发任务执行,如count()、collect()。()答案:√解析:转换操作(如map、filter)是惰性的,行动操作(如count、saveAsTextFile)会触发计算并返回结果或输出。3.Hive的分区(Partition)和分桶(Bucket)都是为了提高查询效率,分区适合大范围过滤,分桶适合精确查询。()答案:√解析:分区按字段值将数据存储在不同目录(如日期分区),查询时可跳过无关分区;分桶通过哈希将数据分散到多个文件,适合JOIN或抽样查询。4.Kafka的消息一旦被消费者消费,就会从Broker中删除。()答案:×解析:Kafka通过保留策略(如7天)自动删除过期消息,与是否被消费无关;消费者通过偏移量(Offset)记录已消费位置。5.HBase是列式存储数据库,适合实时读写和随机访问。()答案:√解析:HBase基于列族存储,支持单行快速读写(通过RowKey),适合OLTP场景(如用户行为记录)。四、简答题1.简述HDFS的写数据流程。答案:(1)客户端调用FileSystem.create()请求创建文件,NameNode检查文件是否存在、权限是否允许,返回可写入的DataNode列表(副本策略决定)。(2)客户端将文件分块(默认128MB),通过DFSOutputStream与第一个DataNode建立Pipeline(副本数决定Pipeline长度,如3副本则Pipeline包含3个DataNode)。(3)客户端将数据以Packet(64KB)为单位发送到第一个DataNode,该节点存储后转发到第二个DataNode,依此类推,形成链式复制。(4)每个DataNode确认接收后向客户端发送确认消息,所有副本写入成功后,客户端通知NameNode提交文件(此时文件才可见)。(5)若某DataNode故障,Pipeline重新建立,剩余数据写入新的DataNode,NameNode更新块位置信息。2.说明YARN中ApplicationMaster的主要功能。答案:(1)资源申请:向ResourceManager申请Container资源(CPU、内存),用于运行任务。(2)任务监控:启动并监控任务(如MapReduce的Map/Reduce任务),处理任务失败重试。(3)与NodeManager交互:向NodeManager发送任务启动命令,获取任务运行状态。(4)进度汇报:向ResourceManager汇报应用程序进度和状态(如运行中、完成、失败)。(5)资源释放:应用程序完成后,通知ResourceManager释放所有占用的Container资源。3.比较Hive与HBase的适用场景。答案:Hive是数据仓库工具,基于HDFS存储,通过HiveQL实现类SQL查询,底层调用MapReduce/Spark等计算引擎,适合离线批处理、复杂聚合查询(如统计月销售额),处理结构化数据(需定义Schema)。HBase是NoSQL数据库,基于HDFS存储

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论