2026年云计算与大数据技术考试试题及答案_第1页
2026年云计算与大数据技术考试试题及答案_第2页
2026年云计算与大数据技术考试试题及答案_第3页
2026年云计算与大数据技术考试试题及答案_第4页
2026年云计算与大数据技术考试试题及答案_第5页
已阅读5页,还剩17页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

2026年云计算与大数据技术考试试题及答案一、单项选择题(每题1分,共20分。每题只有一个正确答案,请将正确选项的字母填入括号内)1.在Hadoop生态中,负责资源管理与任务调度的组件是()。A.HDFS  B.YARN  C.MapReduce  D.Hive答案:B2.下列关于对象存储的描述,正确的是()。A.强一致性保证读写延迟极低B.适合存放大量小文件且支持追加写C.采用扁平命名空间,通过唯一ID访问对象D.必须挂载到本地文件系统才能使用答案:C3.在AWSWell-ArchitectedFramework中,"限制爆炸半径"属于哪一设计原则()。A.可靠性  B.性能效率  C.安全性  D.卓越运营答案:A4.SparkRDD的懒执行特性是指()。A.任务提交后立即分配容器B.转换算子构建DAG,遇到行动算子才触发执行C.每次行动算子都会重新计算全量数据D.缓存策略默认开启答案:B5.某Parquet文件采用SNAPPY压缩,读取时若想提升扫描速度,应优先调整Spark的()参数。A.spark.sql.shuffle.partitionsB.spark.sql.parquet.filterPushdownC.spark.serializerD.spark.default.parallelism答案:B6.在Flink中,用于保证Exactly-Once语义的机制是()。A.Event-Time+WatermarkB.Checkpoint+Two-PhaseCommitC.AsyncI/OD.Savepoint答案:B7.某云厂商提供的Serverless容器服务,其计费粒度通常精确到()。A.小时  B.分钟  C.秒  D.毫秒答案:D8.下列关于数据湖与数据仓库的对比,错误的是()。A.数据湖支持读时模式(Schema-on-Read)B.数据仓库更适合低延迟交互式查询C.数据湖存储原始格式,数据仓库存储经过ETL的模型D.数据湖只能使用对象存储,数据仓库只能使用HDFS答案:D9.在Kafka中,ConsumerGroupRebalance触发的条件不包括()。A.分区数增加  B.消费者加入或退出  C.Topic删除  D.Coordinator宕机答案:C10.使用Terraform管理多云资源时,状态文件远程存储的最佳实践是()。A.本地Git仓库  B.加密后存对象存储并启用状态锁C.邮件发送给管理员  D.每台管理员电脑保留副本答案:B11.在GoogleBigQuery中,如需将外部CSV文件一次性加载为分区表,应使用()。A.bqload--time_partitioning_fieldB.bqmk--external_table_definitionC.bqquery--destination_tableD.bqextract答案:A12.某企业使用K8s运行AI训练任务,需动态申请GPU,应安装()。A.ClusterAutoscaler  B.DevicePluginC.VerticalPodAutoscaler  D.kube-state-metrics答案:B13.在数据治理成熟度模型DAMA-DMBOK中,最高级"优化级"的特征是()。A.已建立数据治理委员会但未量化考核B.数据质量由业务方自发管理C.通过AI自动修复数据缺陷并持续优化D.仅对关键数据做血缘追踪答案:C14.下列关于差分隐私的描述,正确的是()。A.加入噪声后查询结果一定无偏B.隐私预算ε越大,隐私保护强度越高C.同一数据集多次查询需累加隐私预算D.差分隐私无法抵抗成员推理攻击答案:C15.在多云灾备方案中,RPO最优的技术是()。A.每日全量备份到对象存储B.同步复制块存储C.异步复制文件存储D.磁带库离线归档答案:B16.某Lambda函数需要访问私有子网中的RDS,应配置()。A.公网NATGateway+安全组放行/0B.私有NATGateway+安全组放行函数安全组C.VPCEndpointforRDSD.将函数部署到公有子网答案:B17.在ClickHouse中,最适合高并发点查的表引擎是()。A.MergeTree  B.SummingMergeTree  C.Memory  D.Dictionary答案:C18.使用Airflow调度Spark作业时,若任务失败需重试3次、每次间隔5分钟,应在DAG中设置()。A.retries=3,retry_delay=timedelta(minutes=5)B.retry=3,delay=5C.max_retries=3,backoff=5D.retry_policy={'times':3,'wait':300}答案:A19.在零信任架构中,对微服务调用进行身份认证的核心组件是()。A.APIGateway+mTLSB.ServiceMesh+JWTC.IDS+IPSD.VPNGateway答案:B20.某企业采用Snowflake弹性数据仓库,其计算资源扩容速度主要受限于()。A.对象存储I/O  B.元数据服务锁C.虚拟仓库启动时间  D.数据重分布耗时答案:C二、多项选择题(每题2分,共20分。每题有两个或两个以上正确答案,多选、少选、错选均不得分)21.以下属于Serverless计算特征的有()。A.自动扩缩容  B.按请求计费  C.需预留实例  D.事件驱动答案:A、B、D22.在HDFSFederation中,解决单NameNode瓶颈的方法包括()。A.多个NameNode共享同一DataNode存储B.每个NameNode管理独立命名空间C.客户端挂载表统一访问视图D.使用QJM实现HA答案:A、B、C23.下列措施可提升Kafka集群吞吐量的有()。A.增加分区数  B.启用压缩  C.调大batch.size  D.使用SSD磁盘答案:A、B、C、D24.关于SparkSQLAdaptiveQueryExecution(AQE),正确的有()。A.运行时动态合并小分区B.运行时动态调整Join策略C.需要重启集群生效D.可动态优化倾斜Join答案:A、B、D25.在多云成本优化中,属于FinOps"通知"阶段的最佳实践有()。A.为每个团队分配成本标签B.设置预算告警到SlackC.使用RI覆盖率指标D.关闭未使用的负载均衡答案:A、B、C26.以下属于FlinkSQL动态表特征的有()。A.更新记录可撤回B.支持窗口Top-NC.必须声明主键D.结果表可输出到Kafkaupsert答案:A、B、D27.在Kubernetes中,实现Pod跨可用区打散调度可使用的机制有()。A.PodAntiAffinity  B.TopologySpreadConstraintsC.Taints&Tolerations  D.Descheduler答案:A、B28.下列属于数据血缘自动捕获技术的有()。A.SQL解析  B.静态代码扫描  C.运行时Hook  D.日志正则匹配答案:A、B、C、D29.在深度学习中,使用混合精度训练可带来的收益有()。A.减少显存占用  B.提升吞吐  C.无需损失缩放  D.支持TensorCore答案:A、B、D30.以下符合GDPR"数据可携权"要求的有()。A.提供机器可读格式导出B.在30天内响应请求C.收取合理费用D.包含第三方提供的数据答案:A、B三、填空题(每空1分,共20分)31.在HDFS写入管道中,默认副本放置策略为"第一副本在本地节点,第二副本放在________机架,第三副本放在________机架"。答案:不同;第二副本所在32.SparkStandalone模式下,Master默认通过________协议监听8080端口提供WebUI。答案:HTTP33.在AWSS3中,如需实现客户端端到端加密且密钥完全由客户保管,应使用________加密模式。答案:SSE-C34.FlinkCheckpoint的底层实现依赖________算法,用于实现分布式一致性快照。答案:Chandy-Lamport35.在GoogleCloudBigtable中,RowKey设计应避免________热点,常用的散列方式是________。答案:顺序;反转或加盐36.在K8s中,HorizontalPodAutoscaler默认每________秒抓取一次MetricsServer指标。答案:1537.在数据治理中,数据质量维度通常包括准确性、完整性、一致性、________、________。答案:及时性;有效性38.在差分隐私机制中,拉普拉斯噪声的参数b=Δf/ε,其中Δf表示查询的________。答案:敏感度39.在Serverless平台中,冷启动延迟的主要瓶颈是________下载与________初始化。答案:容器镜像;运行时40.在多云网络互联场景,________协议可实现加密通道且支持全链路IPv6。答案:WireGuard四、判断题(每题1分,共10分。正确打"√",错误打"×")41.在Hive中,ORC文件支持谓词下推,因此查询速度一定快于TextFile。()答案:√42.Kafka的Leader副本一定也是PreferredLeader。()答案:×43.SparkStructuredStreaming的Complete模式必须声明水印。()答案:×44.在Raft算法中,日志提交后必然已应用到状态机。()答案:×45.使用Terraform的count参数创建资源时,可通过count.index获取当前索引。()答案:√46.在AWSRDS中,启用Multi-AZ即可实现跨Region灾备。()答案:×47.Snowflake的TimeTravel功能依赖数据文件的MVCC版本链。()答案:√48.在ClickHouse中,使用JOIN时任意列均可作为连接键,无需考虑数据分布。()答案:×49.在零信任网络中,默认拒绝所有通信,必须通过动态策略授权。()答案:√50.混合精度训练时,损失缩放因子过大可能导致梯度溢出。()答案:√五、简答题(共30分)51.(封闭型,6分)简述HDFSNameNode高可用(HA)架构中,Active与Standby如何保持元数据同步,并说明QJM写入流程。答案:1.元数据同步:ActiveNN将编辑日志写入JournalNode集群(至少3节点),StandbyNN实时拉取并回放日志,保持内存元数据一致。2.QJM流程:a.ActiveNN将EditLog分段,通过RPC并发写入所有JournalNode,需获多数派ACK。b.写入成功后,ActiveNN更新内存并返回客户端。c.StandbyNN定期读取已完成段,合并到本地目录,完成checkpoint后上传新镜像到JN。d.发生故障切换时,StandbyNN确保读取最新段后转为Active,保证一致性。52.(开放型,8分)某电商公司每日新增100TB日志,需实时计算GMV并支持近7天交互式查询。请给出基于Flink+ClickHouse的技术方案,说明分层设计、维表关联、容灾策略及成本优化点。答案:1.分层:ODS:Kafka保留3天,分区按小时。DWD:Flink清洗去重,写Kafka压缩主题。DWS:Flink计算小时级GMV,写ClickHouse本地表,按天分区。ADS:ClickHouse物化视图提供分钟级GMV。2.维表:商品维表存储在Redis,Flink异步查询并缓存TTL=5min;大维表采用ClickHouse字典,Flink通过JDBC批量关联。3.容灾:双活集群,FlinkCheckpoint到HDFS+OSS;ClickHouse使用分片+副本,跨可用区部署ZooKeeper。4.成本:冷热分层:7天后数据转存OSS,ClickHouse使用DETACH+ATTACH恢复。按量Flink集群,低峰自动缩容到0。ClickHouse采用ZSTD压缩,磁盘节省40%。53.(封闭型,6分)说明SparkAQE动态分区合并的原理及触发条件。答案:原理:在ShuffleMap阶段完成后,Driver收集各Map输出大小,若连续小分区平均大小<spark.sql.adaptive.advisoryPartitionSizeInBytes,则合并相邻分区,减少Reduce任务数。触发条件:1.spark.sql.adaptive.enabled=true2.使用Shuffle算子(如Aggregate、Join)3.非广播Join且分区数>spark.sql.adaptive.coalescePartitions.minPartitionNum54.(开放型,10分)某金融公司计划将本地Hadoop集群迁移至云端,要求零停机、数据一致、回滚窗口72小时。请给出详细迁移步骤、验证方案及风险应对措施。答案:1.步骤:a.评估:使用CloudEndure采集依赖,生成TCO报告。b.网络:通过VPN+DirectConnect打通,DNS权重1:99。c.双写:启用KafkaMirrorMaker,将本地Kafka同步到云;Hive元数据使用Waggle-Dance联邦。d.增量:DistCp每日增量,结合S3Inventory校验MD5。e.切换:停调度,确认云集群数据零滞后。修改DNSTTL=30s,权重99:1,观察2小时。关闭本地写,保留72小时只读。2.验证:数据:使用GCPDVT全表对比,抽样1%做哈希。作业:运行T+1ETL,对比输出报表行级一致。性能:运行TPC-DS1TB,云集群性能>本地110%。3.风险:网络抖动:启用多链路BGP,设置重传队列。数据倾斜:提前在云侧预分区,使用S3DistCp加--groupBy。回滚:保留本地HDFS快照,DNS一键切回,RTO<15min。六、应用题(共50分)55.(计算类,15分)某Spark作业处理1TBParquet文件(Snappy压缩),文件平均大小128MB,字段含user_id、event_time等。集群配置:Executor4核16GB,并行度200。现发现任务耗时2.5小时,CPU利用率仅45%,且存在大量小任务。请计算并给出调优方案,目标将耗时降至1小时以内,并给出预期性能提升比。答案:1.诊断:文件数≈1TB/128MB=8192个,分区数200,每分区≈41个文件,导致大量小任务。CPU利用率低说明任务启动开销>计算开销。2.调优:a.合并小文件:使用AQE动态合并,设置spark.sql.adaptive.coalescePartitions.initialPartitionNum=800,目标分区大小=256MB,则分区数≈1TB/256MB=4000,Reduce任务数从200降至4000,单任务处理时间增加但启动开销占比下降。b.提高并行度:将spark.sql.shuffle.partitions=4000,Executor数=4000/4=1000,需扩容至1000×4核=4000核,原集群仅200核,需增加20倍资源。c.启用动态资源:spark.dynamicAllocation.enabled=true,minExecutors=200,maxExecutors=1000,峰期自动扩容。3.预期:原任务200任务×45s=2.5h调优后4000任务×20s≈22min,加启动开销≈40min,满足<1h。性能提升比=150min/60min=2.5倍。56.(分析类,15分)某视频App使用Kafka+Flink实时统计每分钟播放量,发现晚高峰20:00-22:00出现消费延迟递增,峰值延迟达5min。给出根因分析步骤、监控指标及优化方案。答案:1.根因分析:a.查看FlinkBackpressure:通过WebUI发现Subtask3背压红色。b.查看KafkaLag:使用__consumer_offsets,发现分区8-11Lag持续增加。c.查看热点Key:发现分区8的Key="热门综艺E"占比70%,导致倾斜。2.监控指标:kafka.consumer.lag.sumflink.task.backpressure.ratioflink.operator.busyTimeMsPerSecondCPU利用率按TaskManager分布3.优化:KeyBy改为user_id+salt,再二次聚合,打散热点。提高并行度:分区8-11扩容至原2倍,Flink并行度=Kafka分区数。资源:TaskManagerCPU从4核升至8核,Heap增至12GB。缓存:使用RocksDBStateBackend,开启增量Checkpoint,降低I/O。结果:延迟

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论