2026年大数据与云计算技术能力考试试卷及答案_第1页
2026年大数据与云计算技术能力考试试卷及答案_第2页
2026年大数据与云计算技术能力考试试卷及答案_第3页
2026年大数据与云计算技术能力考试试卷及答案_第4页
2026年大数据与云计算技术能力考试试卷及答案_第5页
已阅读5页,还剩19页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

2026年大数据与云计算技术能力考试试卷及答案第一部分:单项选择题(共20题,每题1.5分,共30分)1.在Hadoop2.x及后续版本的架构中,负责资源管理和调度的核心组件是()。A.JobTrackerB.TaskTrackerC.ResourceManagerD.NameNode2.下列关于虚拟化技术的描述中,错误的是()。A.全虚拟化需要修改客户机操作系统内核B.半虚拟化通过修改客户机操作系统来实现高性能C.硬件辅助虚拟化(如IntelVT-x/AMD-V)可以提升全虚拟化的性能D.容器技术(如Docker)属于操作系统层级的虚拟化,共享宿主机内核3.在SparkRDD的转换操作中,属于窄依赖的是()。A.groupByKeyB.joinC.mapD.coalesce4.Docker容器与虚拟机(VM)相比,最主要的区别在于()。A.容容器拥有独立的操作系统内核B.容器启动速度更快,资源利用率更高C.容器无法实现资源隔离D.容器比虚拟机更安全5.HBase数据库中,数据是按照()进行存储的。A.行键有序存储B.列名有序存储C.时间戳倒序存储D.随机无序存储6.在Kubernetes架构中,负责维护集群状态并执行调度循环的组件是()。A.kubeletB.kube-proxyC.APIServerD.ControllerManager7.下列哪项技术主要解决了大数据处理中的“数据倾斜”问题?()A.数据本地化B.Salting(加盐)C.内存缓存D.索引构建8.OpenStack是开源的云计算管理平台项目,其中负责提供计算服务(即管理虚拟机生命周期)的组件是()。A.NovaB.SwiftC.CinderD.Neutron9.在MapReduce计算模型中,Reduce任务的输入数据通常来自于()。A.HDFS上的原始数据块B.Map任务的输出文件(经过Shuffle和Sort)C.Reduce任务的本地磁盘D.分布式缓存中的文件10.Kafka消息系统中,为了保证消息的持久化和容错性,通常将分区副本分为什么角色?()A.Master和SlaveB.Leader和FollowerC.Primary和SecondaryD.Active和Passive11.SparkSQL在执行SQL查询时,会经过Catalyst优化器进行优化,下列不属于其优化阶段的是()。A.解析B.逻辑优化C.物理计划生成D.数据清洗12.在云计算服务模型中,PaaS(平台即服务)向用户提供的主要能力是()。A.虚拟机、存储和网络等基础设施B.应用程序运行环境、中间件和开发工具C.完整的软件应用D.数据库管理服务13.HDFS文件系统默认的副本策略中,第一个副本通常存放在()。A.随机节点B.与客户端同机架的节点C.不同机架的节点D.远程数据中心节点14.下列关于CAP理论的描述,正确的是()。A.在分布式系统中,一致性、可用性、分区容错性三者可以同时满足B.在分布式系统中,一致性、可用性、分区容错性三者最多只能同时满足两个C.分区容错性在分布式系统中是可以被牺牲的D.CA系统在出现网络分区时依然能正常服务15.FlumeNG架构中,负责汇聚多个Agent数据的组件通常配置为()。A.MemoryChannelB.FileChannelC.AvroSource/AvroSinkD.HDFSSink16.在YARN的资源调度器中,支持多队列资源分配和容量保证的调度器是()。A.FIFOSchedulerB.CapacitySchedulerC.FairSchedulerD.DelayScheduler17.Docker镜像采用分层存储机制,其联合文件系统(UnionFS)的作用是()。A.加速镜像构建B.减少镜像存储空间C.提高容器运行速度D.增强容器安全性18.Redis作为一种高性能的键值对数据库,支持多种数据结构,下列哪种结构适合实现排行榜功能?()A.StringB.HashC.ListD.SortedSet19.在大数据处理流程中,ETL代表()。A.Extract,Transform,LoadB.Extract,Transform,ListenC.ElectronicTransactionLayerD.EnterpriseTransactionLevel20.下列关于微服务架构与单体架构的对比,错误的是()。A.微服务架构每个服务可以独立部署和扩展B.微服务架构通信开销通常比单体架构大C.微服务架构调试和监控比单体架构简单D.微服务架构更适合复杂、快速变化的业务场景第二部分:多项选择题(共10题,每题3分,共30分。多选、少选、错选均不得分)1.下列属于Hadoop生态系统核心组件的有()。A.HDFSB.MapReduceC.YARND.HBaseE.Spark2.Kubernetes中的Pod可以通过以下哪种方式暴露服务?()A.ClusterIPB.NodePortC.LoadBalancerD.IngressE.HostNetwork3.SparkRDD具有以下哪些特性?()A.弹性B.分布式C.只读D.可缓存E.强类型4.Docker容器可以通过以下哪些方式与宿主机进行通信或数据交换?()A.端口映射B.数据卷挂载C.网络桥接D.环境变量传递E.进程间通信(IPC)5.在NoSQL数据库的分类中,属于列族数据库的有()。A.HBaseB.CassandraC.MongoDBD.RedisE.Bigtable6.下列哪些因素会影响HDFS的读写性能?()A.副本数量B.块大小C.机架感知策略D.内存缓冲大小E.网络带宽7.OpenStackCinder组件主要提供的功能包括()。A.块存储服务B.对象存储服务C.卷管理(创建、删除、挂载)D.快照管理E.共享文件系统8.在实时流处理框架Storm中,Spout和Bolt的角色描述正确的有()。A.Spout是数据源,负责从外部系统读取数据B.Bolt是数据处理单元,负责转换和过滤数据C.一个Topology中只能有一个SpoutD.Bolt可以发射新的Tuple到下游E.Spout必须保证消息的可靠性处理9.下列关于数据仓库维度的描述,属于事实表特征的有()。A.包含大量的数据行B.包含描述性的文本属性C.包含数值型的度量值D.记录发生的具体业务事件E.拥有主键10.在云计算安全中,IAM(身份识别与访问管理)主要包含哪些核心概念?()A.用户B.组C.策略D.角色E.许可证第三部分:填空题(共15空,每空2分,共30分)1.HDFS默认的底层存储块大小为________MB,默认的副本系数为________。2.在Linux系统中,Docker守护进程默认监听的UnixSocket路径是________。3.Spark的算子分为Transformation和Action两类,其中________算子会触发Job的提交。4.Kubernetes中________资源对象用于声明式地管理Pod,确保指定数量的Pod副本始终在运行。5.MapReduce的输入数据切片大小默认等于HDFS的________大小。6.在ZooKeeper集群中,节点数量通常建议为________台,以便在发生故障时仍能选举出Leader。7.HBase中,RowKey的设计极其重要,为了利用其有序存储特性,通常建议RowKey具有________性,且长度尽可能短。8.Redis的持久化机制主要有RDB和________两种。9.在Flume配置文件中,Agent主要由Source、________和Sink三个组件串联而成。10.OpenStack________组件负责提供镜像服务,用于发现、注册和获取虚拟机镜像。11.在YARN中,ApplicationMaster负责向________申请资源,并监控任务运行状态。12.为了解决Spark中的数据倾斜问题,可以使用________算子将同一个Key的数据加上随机前缀分发到多个Reducer处理。13.DockerCompose工具使用的默认配置文件名称为________。14.在Elasticsearch中,________是数据存储的最小单位,类似于关系型数据库中的“行”。15.大数据的4V特征指的是Volume、Velocity、________和Value。第四部分:简答题(共5题,每题6分,共30分)1.请简述HDFS的读写流程(以读流程为例)。2.请解释Docker容器技术中的Cgroups和Namespace技术分别解决了什么问题?3.在Spark作业中,“宽依赖”和“窄依赖”的区别是什么?这对Stage的划分有何影响?4.请简述Kubernetes中Service的作用及其工作原理(以ClusterIP为例)。5.请列举至少三种常见的消息中间件,并简要说明它们的应用场景差异。第五部分:应用与分析题(共3题,共30分)1.(计算题,10分)某公司拥有一个HDFS集群,配置如下:集群总共有10个DataNode节点,每个Data节点的磁盘容量为10TB,HDFS的副本系数设置为3。(1)请计算该HDFS集群理论上可用的最大存储容量是多少?(2)如果现在需要存储一个大小为500GB的文件,该文件在HDFS底层会被切分成多少个Block?(假设块大小为128MB,不考虑最后一个块不足128MB的情况)(3)实际上,该文件占用了DataNode上多少GB的物理磁盘空间?2.(分析题,10分)某电商平台需要设计一个实时推荐系统,要求能够根据用户的实时点击行为,在毫秒级更新用户的推荐列表。现有技术栈包括Kafka、Flume、SparkStreaming、Redis、HBase。请根据以上组件设计一个合理的数据处理流水线架构,并说明每个组件在架构中的具体作用。3.某企业使用OpenStack构建私有云,运维人员在部署过程中发现虚拟机实例无法获取IP地址,导致网络不通。已知网络配置采用Neutron组件,且使用了OVS(OpenvSwitch)作为虚拟交换机。(1)请分析可能导致该故障的常见原因(至少列出三点)。(2)描述排查该故障的基本思路。参考答案及解析第一部分:单项选择题1.【答案】C【解析】在Hadoop2.x中,ResourceManager取代了1.x中的JobTracker,负责整个集群的资源管理和调度;NodeManager取代了TaskTracker。NameNode是HDFS的元数据管理节点。2.【答案】A【解析】全虚拟化通过二进制翻译或硬件辅助技术,不需要修改客户机操作系统内核;半虚拟化需要修改客户机操作系统内核以调用特权的Hypercall。3.【答案】C【解析】map操作是窄依赖,每个父分区只被一个子分区使用。groupByKey、join和coalesce(当shuffle为true时)通常涉及数据重组,属于宽依赖。4.【答案】B【解析】Docker容器直接利用宿主机的操作系统内核,不需要启动完整的GuestOS,因此启动速度快、资源占用少。容器拥有独立的文件系统、网络和进程空间,但共享内核。5.【答案】A【解析】HBase是面向列的分布式存储系统,数据在表中是按照RowKey的字典序进行排序存储的。6.【答案】D【解析】ControllerManager负责维护集群状态(如副本数、端点映射等),并执行相应的控制循环。kubelet是节点代理,APIServer是统一入口。7.【答案】B【解析】Salting(加盐)技术通过给Key添加随机前缀,将原本聚集在一个Reducer上的热点数据分散到多个Reducer上,从而解决数据倾斜。8.【答案】A【解析】Nova是OpenStack的计算服务组件;Swift是对象存储;Cinder是块存储;Neutron是网络服务。9.【答案】B【解析】Reduce任务的输入是Map任务输出的中间结果,经过了Shuffle(拷贝)和Sort(排序)阶段。10.【答案】B【解析】Kafka中,每个Partition有多个副本,分为Leader和Follower。Leader处理读写请求,Follower从Leader同步数据。11.【答案】D【解析】Catalyst优化器包含解析、逻辑优化、物理计划生成和代码生成等阶段。数据清洗属于ETL过程,不属于优化器阶段。12.【答案】B【解析】PaaS提供平台环境,包括运行时、中间件和数据库等;IaaS提供基础设施;SaaS提供软件应用。13.【答案】B【解析】HDFS默认副本策略:第一个副本存放在客户端所在的DataNode(如果客户端不在集群内则随机选),第二个副本存放在同机架不同节点,第三个副本存放在不同机架。14.【答案】B【解析】CAP定理指出在分布式系统中,一致性、可用性、分区容错性三者不可兼得,通常由于网络分区不可避免,P是必须的,因此只能在CP和AP之间权衡。15.【答案】C【解析】在FlumeNG中,Agent之间可以通过Avro协议传输数据。汇聚节点通常配置AvroSource来接收多个Agent的AvroSink发送的数据。16.【答案】B【解析】CapacityScheduler支持多队列,每个队列可以分配一定比例的资源,保证最小容量。FairScheduler旨在让所有应用平均分配资源。17.【答案】B【解析】联合文件系统将不同的镜像层挂载到同一个挂载点,通过分层复用,极大地减少了镜像占用的存储空间。18.【答案】D【解析】SortedSet(有序集合)中的每个成员都会关联一个分数,Redis根据分数进行排序,非常适合实现排行榜。19.【答案】A【解析】ETL是Extract(抽取)、Transform(转换)、Load(加载)的缩写,是数据仓库建设的关键环节。20.【答案】C【解析】微服务架构由于服务数量众多且分散,调用链路复杂,因此调试、监控和追踪(如使用SkyWalking)比单体架构要复杂得多。第二部分:多项选择题1.【答案】ABC【解析】Hadoop的核心组件包括HDFS(存储)、MapReduce(计算)、YARN(资源调度)。HBase和Spark属于生态系统的重要组成部分,但通常不被称为“核心”组件(狭义上)。但在广义生态题中,若未严格界定,有时会包含D/E,但在标准考试中,核心通常指ABC。注:此处按最严格的核心定义ABC作答,若为广义生态题,HBase和Spark也是重要组成部分,但MapReduce和YARN/HDFS是基石。2.【答案】ABCDE【解析】Kubernetes暴露服务的方式包括ClusterIP(集群内)、NodePort(节点端口)、LoadBalancer(云厂商负载均衡)、Ingress(HTTP路由)以及直接使用HostNetwork。3.【答案】ABCD【解析】RDD具有弹性(容错)、分布式、只读(不可变)、可缓存等特性。RDD在Scala中是强类型的,但在Python/Java中泛型支持不同,且“强类型”并非其核心特性描述的必备项(相比之下ABCD更为本质)。4.【答案】ABCDE【解析】端口映射、数据卷、网络配置、环境变量以及IPC机制都是容器与宿主机交互的常见方式。5.【答案】ABE【解析】HBase、Cassandra和Bigtable(Google的,HBase的原型)属于列族数据库。MongoDB是文档型,Redis是键值型。6.【答案】ABCDE【解析】副本数量、块大小、机架策略、缓冲区大小以及网络带宽都会直接或间接影响HDFS的读写性能。7.【答案】ACD【解析】Cinder提供块存储服务,包括卷管理和快照。对象存储是Swift,共享文件系统是Manila。8.【答案】ABDE【解析】Spout是源,Bolt是处理单元。一个Topology可以有多个Spout和Bolt。Bolt负责发射Tuple。Spout需要负责消息的可靠性(ack/fail)。9.【答案】ACD【解析】事实表通常包含大量数据、数值型度量值和业务事件的外键。描述性属性通常在维度表中。事实表也有主键(通常是复合键)。10.【答案】ABCD【解析】IAM的核心概念包括用户、组、策略和角色。许可证属于License管理,不属于IAM核心概念。第三部分:填空题1.【答案】128;32.【答案】/var/run/docker.sock3.【答案】Action4.【答案】Deployment5.【答案】Block6.【答案】奇数(或3/5/7等)7.【答案】散列(或唯一/Hash)8.【答案】AOF9.【答案】Channel10.【答案】Glance11.【答案】ResourceManager12.【答案】salting(或加盐)13.【答案】docker-compose.yml14.【答案】Document15.【答案】Variety第四部分:简答题1.【答案】HDFS读流程主要步骤如下:(1)客户端调用DistributedFileSystem.open()方法,打开要读取的文件。(2)RPC调用NameNode,NameNode返回文件的部分或全部Block列表(对于返回哪些Block取决于距离客户端的远近)。(3)客户端根据返回的Block列表,选择距离最近的DataNode建立连接。(4)客户端调用FSDataInputStream.read()方法,通过流式读取数据。(5)当读取完一个Block后,客户端会断开与当前DataNode的连接,并寻找下一个Block的最优DataNode继续读取。(6)读取完毕后,关闭流。2.【答案】(1)Namespace(命名空间):实现了资源隔离。它使得容器看起来拥有独立的文件系统、网络栈、进程ID、用户ID等。通过Namespace,容器内的进程无法感知到宿主机或其他容器的存在。(2)Cgroups(控制组):实现了资源限制和配额管理。它可以限制、记录和隔离进程组使用的物理资源(如CPU、内存、磁盘I/O等)。通过Cgroups,可以防止单个容器耗尽宿主机的所有资源导致系统崩溃。3.【答案】(1)区别:窄依赖:父RDD的一个分区最多被子RDD的一个分区使用(一对一)。例如map,filter。宽依赖:父RDD的一个分区被子RDD的多个分区使用(一对多)。例如groupByKey,reduceByKey。(2)对Stage划分的影响:Spark根据宽依赖划分Stage。窄依赖允许在同一个Stage内进行流水线优化;而遇到宽依赖时,必须进行Stage划分(ShuffleWrite/Read),因为宽依赖涉及数据重组,需要跨节点传输数据,无法在一个Task中完成。4.【答案】(1)作用:Service定义了一组Pod的访问规则,主要用于解决PodIP动态变化的问题(Pod重启后IP会变),提供稳定的访问入口。它支持负载均衡和服务发现。(2)工作原理(ClusterIP):Service创建时,Kubernetes会分配一个虚拟IP(ClusterIP)。kube-proxy在每个节点上运行,通过监听APIServer的变化。kube-proxy通过iptables或IPVS规则,将发往ClusterIP的流量转发到后端具体的PodIP上。如果后端有多个Pod,kube-proxy会实现负载均衡策略轮询转发。5.【答案】(1)Kafka:高吞吐量的分布式发布订阅消息系统,适合大数据日志收集、流式处理等场景。(2)RabbitMQ:基于AMQP协议的消息队列,延迟极低,可靠性高,适合传统的企业级应用、路由复杂的业务场景。(3)RocketMQ:阿里开源的消息中间件,支持事务消息,适合金融交易、电商订单等对一致性要求极高的场景。第五部分:应用与分析题1.【(1)答案】可用存储容量=(节点数*单节点容量)/副本系数(10*10TB)/3≈33.33TB注:实际中还需预留部分空间给NameNode元数据或操作系统,但理论计算通常按此公式。【(2)答案】文件大小500GB=500*1024MB=512000MBBlock数量=512000/128=4000个Block【(3)答案】物理占用空间=文件大小*副本系数=500GB*3=1500GB或者:4000个Block*128MB*3=1536000MB=1500GB2.【答案】数据处理流水线架构如下:1.数据采集层:用户点击行为日志由WebServer生成,通过Flume(作为Agent)实时采集日志。2.消息缓冲层:Flume将采集到的日志作为Producer发送到Kafka集群。Kafka作为消息队列,起到削峰填谷、解耦的作用,暂存海量实时日志。3.实时计算层:SparkStreaming应用程序作为Kafka的Consumer,订阅相关Topic,消费日志数据。4.流处理逻辑:SparkStreaming对接收到的DStream进行

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论