2026年大数据与云计算知识考察试题及答案解析_第1页
2026年大数据与云计算知识考察试题及答案解析_第2页
2026年大数据与云计算知识考察试题及答案解析_第3页
2026年大数据与云计算知识考察试题及答案解析_第4页
2026年大数据与云计算知识考察试题及答案解析_第5页
已阅读5页,还剩17页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

2026年大数据与云计算知识考察试题及答案解析一、单项选择题(每题2分,共20分。每题只有一个正确答案,请将正确选项字母填入括号内)1.在HDFS中,NameNode的主要职责是()。A.存储实际数据块B.管理文件系统元数据C.执行Map任务D.执行Reduce任务【答案】B【解析】NameNode负责维护整个文件系统的目录树、文件到块的映射以及副本策略等元数据,不直接存储数据块。2.某公有云厂商提供的对象存储服务采用“最终一致性”模型,以下操作中最可能出现读取到旧版本对象的场景是()。A.上传新对象后立即下载B.删除对象后立即列举桶C.覆盖写对象后立即下载D.设置对象ACL后立即读取ACL【答案】C【解析】最终一致性下,覆盖写(PUTObjectoverwrite)后,并发读可能命中旧副本;列举桶、ACL元数据为强一致,上传新对象无旧副本。3.在Spark中,以下转换操作会产生宽依赖的是()。A.mapB.filterC.unionD.groupByKey【答案】D【解析】groupByKey需要把相同key的数据shuffle到同一分区,属于宽依赖;其余为窄依赖。4.某云原生应用使用Kubernetes部署,Pod的livenessProbe连续3次探测失败,系统将()。A.重启容器B.重启Pod内所有容器C.将Pod标记为NotReadyD.删除Pod并重新调度【答案】A【解析】livenessProbe失败达到阈值,kubelet会按重启策略重启该容器;readinessProbe失败才标记NotReady。5.在AWSWell-ArchitectedFramework中,将日志集中存储到S3并启用MFADelete,主要体现哪一设计原则()。A.卓越运营B.安全性C.可靠性D.成本优化【答案】B【解析】MFADelete防止日志被误删或恶意删除,属于安全支柱。6.某企业使用Flink实现Exactly-Once语义,以下机制起决定性作用的是()。A.异步checkpointB.幂等sinkC.两阶段提交D.事件时间窗口【答案】C【解析】TwoPhaseCommitSinkFunction利用预提交+checkpoint屏障实现端到端Exactly-Once。7.在数据湖架构中,以下格式最支持模式演进且与计算引擎无关的是()。A.ParquetB.ORCC.AvroD.DeltaLake【答案】D【解析】DeltaLake在Parquet之上提供ACID、版本回退及模式演进,且与Spark、Presto、Flink等多引擎兼容。8.某多云灾备方案采用“备份云”模式,将主云MySQL数据通过binlog实时同步到备云MySQL,RPO≈0。该方案属于()。A.冷备B.温备C.热备D.快照备【答案】C【解析】实时同步,备库随时可接管,RPO≈0,为热备。9.在GoogleBigQuery中,以下SQL语句可正确查询嵌套字段“user.address.city”的是()。A.SELECTuser.address.cityFROMtB.SELECTuser['address']['city']FROMtC.SELECTuser:address:cityFROMtD.SELECTUNNEST(user.address.city)FROMt【答案】A【解析】BigQuery使用点分路径访问嵌套结构,无需UNNEST除非显式拆数组。10.某云函数(Lambda/FunctionCompute)冷启动耗时占比高,以下优化手段效果最显著的是()。A.增大内存B.使用自定义运行时C.启用预置并发D.减少函数压缩包大小【答案】C【解析】预置并发提前初始化执行环境,可基本消除冷启动。二、多项选择题(每题3分,共15分。每题有两个或以上正确答案,多选少选均不得分)11.以下关于HBase的说法正确的有()。A.采用LSM-Tree存储模型B.支持多版本并发控制MVCCC.RegionServer宕机后其region立即不可用D.通过ZooKeeper完成Master选举【答案】A、B、D【解析】RegionServer宕机后,HMaster通过ZooKeeper感知并重新分配region,region短暂不可用但非“立即永久不可用”。12.在Kubernetes中,以下对象可直接用于持久化存储声明的有()。A.emptyDirB.hostPathC.PersistentVolumeClaimD.ConfigMap【答案】B、C【解析】emptyDir生命周期与Pod绑定,非持久;ConfigMap用于配置;hostPath与PVC均可实现持久化。13.以下属于Serverless大数据计算平台的有()。A.AWSAthenaB.GoogleBigQueryC.AzureHDInsightD.AlibabaMaxCompute【答案】A、B、D【解析】HDInsight为托管集群模式,仍需管理节点,非Serverless。14.某Spark作业出现“ExecutorLostFailure”频繁,可能原因包括()。A.堆外内存不足导致YARNkill容器B.动态分配策略过于激进C.使用collect()拉取大量数据到DriverD.序列化框架不兼容【答案】A、B、C【解析】序列化框架不兼容通常报SerializationException,而非ExecutorLost。15.以下关于云计算计费模式描述正确的有()。A.预留实例可跨区域灵活切换B.按需实例按秒计费,最低60秒C.Spot实例价格随供需波动D.SavingsPlan可自动应用于任何家族实例【答案】B、C、D【解析】预留实例绑定区域与可用区,不可跨区切换;SavingsPlan自动抵扣符合条件的使用量。三、填空题(每空2分,共20分)16.在MapReduce中,数据倾斜常发生在________阶段,可通过________采样提前拆分热点key。【答案】Reduce;两阶段聚合(或“二次排序”、“加盐”亦可)17.某云对象存储桶启用________策略,可实现上传对象时自动触发Lambda函数进行病毒扫描。【答案】事件通知(或“EventNotification”)18.在Flink的时间语义中,________时间用于处理乱序事件流,需结合________机制触发窗口计算。【答案】事件;watermark19.某企业使用KafkaMirrorMaker2.0实现跨地域复制,其内部通过________主题保存偏移量,实现________语义。【答案】__mm2_offsets;至少一次(at-least-once)20.在AWSIAM策略中,效力(Effect)字段取值为________时表示显式拒绝,且拒绝规则优先于允许。【答案】Deny21.在Kubernetes的ServiceMesh方案Istio中,________资源用于定义版本间流量比例,实现灰度发布。【答案】VirtualService(或“DestinationRule”配合权重,答VirtualService即可)22.某数据仓库采用星型模式,事实表与维度表通过________键关联,维度表通常采用________策略缓解SCD第二类缓慢变化。【答案】surrogatekey(代理键);拉链表(或“历史表”、“periodversioning”)23.在GoogleCloudSpanner中,________是全局有序的事务时间戳来源,保证外部一致性。【答案】TrueTime24.某云盘采用三副本机制,写入时遵循________协议,即至少________副本写入成功才返回客户端ACK。【答案】Quorum;2(或“多数派”、“n/2+1”)25.在PyTorch分布式训练里,DDP采用________梯度同步算法,通信后端常用________。【答案】Ring-AllReduce;NCCL四、判断题(每题1分,共10分。正确打“√”,错误打“×”)26.HDFS的默认块大小为64MB,不可在线调整。(×)【解析】可通过dfs.blocksize在线调整,对新文件生效。27.SparkSQL的Catalyst优化器支持代价基于优化(CBO)。(√)28.AWSGlacierDeepArchive取回时间最短为12小时。(√)29.Kubernetes的ConfigMap大小上限为1MiB。(√)30.在BigQuery中,CLUSTERBY字段可以减小查询扫描量。(√)31.使用Z-Standard压缩的Parquet文件,Snappy无法解压。(√)32.Flink的checkpoint屏障是广播元素,与数据流复用同一网络通道。(√)33.在Linux下,使用df-h命令可查看inode使用率。(×)【解析】df-i查看inode,df-h查看磁盘空间。34.云函数按调用次数计费,与内存大小无关。(×)【解析】内存影响GB-秒费用。35.在Raft算法中,Leader选举需要获得多数派投票,但日志复制只需成功写入本地即可返回客户端。(×)【解析】日志复制也需多数派确认才提交。五、简答题(共25分)36.(封闭型,6分)简述HDFS写入流程中Packet队列与ACK队列的作用,并说明数据节点故障时的处理步骤。【答案】1.客户端将数据切为64KBPacket,先放入数据队列(dataQueue),同时复制一份到ACK队列(ackQueue)等待确认。2.DataNode管道依次写入并向上游返回ACK。3.若某DataNode故障,客户端从ackQueue移除未确认Packet,关闭管道,通知NameNode标记该节点块无效;剩余健康节点组成新管道,NameNode安排副本重建。4.客户端继续写入,不丢失数据。整个过程对用户透明。37.(开放型,7分)某电商公司使用Lambda架构,批层用Spark每日凌晨处理T+1数据,速度层用Flink实时处理Kafka流。随着业务增长,批层ETL耗时超过24小时,出现“批层追不上”问题。请给出三种以上架构演进方案,并比较优缺点。【答案】方案A:升级为Kappa架构,下线批层,全部走Flink流式,历史数据重放Kafka。优点:统一代码、低延迟;缺点:Kafka保存7年以上成本高,重放耗时长。方案B:引入增量批处理,改用DeltaLake/ApacheHudi,Spark每小时一次增量commit。优点:缩短单次处理量;缺点:小文件增多,需定期compaction。方案C:采用混合调度,将非关键报表降级为T+2,核心报表仍T+1,资源错峰。优点:无需技术改造;缺点:业务体验下降。方案D:将批层迁移到Snowflake/BigQuery等弹性数仓,利用其并发扩展能力将8小时任务压缩到1小时。优点:运维简单;缺点:云费用高,需适配SQL方言。38.(封闭型,6分)写出在Kubernetes中给StatefulSet名为“mysql”的Pod注入时区配置的YAML片段,要求不重建镜像,并确保所有mysql容器使用上海时区。【答案】```yamlapiVersion:v1kind:ConfigMapmetadata:name:tz-configdata:TZ:Asia/ShanghaiapiVersion:apps/v1kind:StatefulSetmetadata:name:mysqlspec:template:spec:containers:name:mysqlenvFrom:configMapRef:name:tz-configvolumeMounts:name:localtimemountPath:/etc/localtimereadOnly:truevolumes:name:localtimehostPath:path:/usr/share/zoneinfo/Asia/Shanghaitype:File```39.(开放型,6分)某金融公司计划将本地Hadoop集群(300节点)迁移至云端,要求RPO<15min、RTO<1h,且需满足等保三级。请列出迁移实施的关键步骤与对应技术手段。【答案】1.网络:通过专线+VPN双链路,启用BGP高可用,满足等保通信安全。2.数据:采用DistCp+增量脚本,每10分钟一次差异同步,RPO<15min;首次全量使用TB级Snowball设备离线传输。3.安全:启用KMS加密,RAM/IAM细粒度授权,云堡垒机+AuditLog投递到OSS保存6个月。4.应用:MapReduce任务不改代码,直接跑EMR;Hive元数据使用RDS高可用版,并开启SSL。5.验证:在云端搭建并行环境,跑回归测试,对比哈希校验。6.切换:DNS权重流量灰度,保留本地集群热备1小时,若异常立即回滚。7.等保测评:提交云上系统基线扫描、渗透测试报告,完成备案。六、计算与分析题(共30分)40.(计算类,10分)某Spark作业处理1TBgzip压缩文本日志(压缩比10:1),每个文件128MB,HDFS块大小256MB,集群共100executor,每个executor4cores16GB。(1)估算输入Split数量,并指出最大并行度。(2)若改用bzip2(可切分),估算新Split数量与并行度。(3)解释为何gzip情况下出现“小任务”现象,并给出两种优化方案。【答案】(1)gzip不可切分,每个128MB文件对应一个InputSplit,共1TB/10/128MB≈781个文件→781Split;最大并行度=executorcore总数=100×4=400,故并行度受限于Split数781。(2)bzip2块大小约900KB,可切分,Split≈1TB/10/900KB≈1.1×10^6Split,远大于400,并行度=400。(3)gzip不可切分导致单个任务处理128MB压缩数据,解压后约1.28GB,任务过大;同时因不可切分,无法利用集群并行度。优化:①上传前解压,改为128MB未压缩文本,Split≈1TB/128MB=7810,并行度提升;②改用lz4或snappy+text可切分格式,或转为Parquet列存,Split由block边界决定,并行度≈1TB/256MB=3900,且支持列裁剪。41.(分析类,10分)某云厂商对象存储标准存储单价0.12元/GB/月,低频0.08元,归档0.033元;流出流量0.5元/GB。某应用每月产生10TB新数据,30天访问一次,90天后访问频率降至10%,之后长期保存7年。请设计生命周期策略,并计算相比全部使用标准存储,5年累计节省费用(折现忽略,结果以万元为单位保留两位小数)。【答案】策略:第0天:标准存储第30天:转为低频第90天:转为归档流量:每月10TB需读出一次,流量费不变,故仅比较存储费。标准存储5年费用:10TB×1024GB×0.12元×60月=737280元分层方案:1.标准30天:10TB×0.12×1月=12288元2.低频60天:10TB×0.08×2月=16384元3.归档剩余59月:10TB×0.033×59≈194610元合计:12288+16384+194610=223282元节省:737280−223282=513998元≈51.40万元42.(综合类,10分)某视频公司使用CDN+对象存储,用户上传视频后需转码为HLS。原方案:上传触发函数计算,函数内拉取整段视频转码,耗时随视频大小线性增长,导致4GB以上文件超时。请重新设计事件驱动架构,要求:1.支持50GB大文件;2.平均转码耗时不超过原1GB文件耗时2倍;3.失败子任务可重试,不重复转码已成功分片;4.成本不高于原方案2倍。请画出架构图(文字描述),说明关键组件与数据流,并估算资源用量。【答案】架构:用户→上传→对象存储→触发事件→消息队列(MQ)→转码调度函数(FC)调度函数调用“分片函数”:使用ffmpeg-ss-t按10MB分段生成m3u8索引,输出N个10MBts列表,写入Redis记录状态pending。对每个ts,发送消息到RocketMQ/SQS,消费者为“转码worker函数”(FCGPU3GB内存,单ts平均3秒)。worker完成上传ts到OSS,写Redis状态=done;若失败,消息重试3次,幂等使用ts文件名+md5。全部ts完成后,聚合函数合并m3u8,写入OSS,回调业务API。资源估算:50GB视频→5000个10MBts;每ts转码3秒,GPU内存3GB,并发100,总耗时≈5000/100×3=150秒<2×原1GB线性耗时(原1GB约120秒)。费用:GPU内存3GB×0.0009元/秒×3秒×5000≈40.5元;原方案1GB费用:10GB×0.0009×120≈1.08元,50GB线性54元。新方案40.5元<2×54元,满足成本。七、综合设计题(共20分)43.某市政府拟建设“城市大脑”实时数据湖,数据源包括:20万路高清摄像头,每路平均码流2Mbps,需实时结构化(车辆、人脸);8万部出租车GPS,每10秒上报;地铁刷卡每秒8万笔;气象、环保等IoT传感器合计100万设备,每30秒上报。要求:1.端到端延迟≤500ms;2.存储7年,可查任意1分钟粒度聚合;3.支持突发事件回溯,即5分钟内完成过去30天任意维度ad-hoc查询;4.符合等保2.0三级,关键数据国密算法加密;5.预算约束:硬件+云资源年费用≤3亿元。请给出总体技术架构(文字描述),包含数据采集、流处理、存储、查询、安全、运维六大子系统,并论证满足延迟、成本、合规三大约束。【答案】采集层:视频流:边缘机房部署200个机柜,每柜10台GPU边缘服务器(含100TOPSINT8),使用RTMP推流到边缘Kafka,同时本地YOLOv5+人脸识别抽帧,结构化后输出JSON,压缩率1/50,原始视频本地循环48小时,异常事件自动上传冷存。其他流:GPS、刷卡、IoT通过MQTToverTLS

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论