2026年数据工程与数据管理考试试题及答案_第1页
2026年数据工程与数据管理考试试题及答案_第2页
2026年数据工程与数据管理考试试题及答案_第3页
2026年数据工程与数据管理考试试题及答案_第4页
2026年数据工程与数据管理考试试题及答案_第5页
已阅读5页,还剩19页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

2026年数据工程与数据管理考试试题及答案一、单项选择题(每题1分,共20分。每题只有一个正确答案,请将正确选项字母填入括号内)1.在数据仓库分层架构中,最接近源业务系统、保留原始细节数据的一层是()A.ODSB.DWDC.DWSD.ADS答案:A2.下列关于HDFS写入流程的描述,正确的是()A.客户端直接向所有DataNode并行写入B.客户端先将数据写入NameNode本地磁盘C.客户端以数据包形式通过流水线依次写入DataNodeD.写入完成后NameNode立即将元数据持久化到edits.new答案:C3.在Kafka2.8之后,若将__transaction_state主题副本因子设置为3,则下列说法正确的是()A.事务协调器可容忍2个副本同时离线B.事务消息顺序性由Leader副本保证,与副本因子无关C.副本因子仅影响消费者读取性能,不影响可用性D.副本因子必须小于等于Broker数,否则创建失败答案:D4.某电商公司使用星型模型建模,事实表orders含外键列customer_key,若需统计“最近30天下单次数大于5的会员数”,最应优先创建的索引是()A.位图索引B.B-Tree复合索引(customer_key,order_date)C.哈希索引D.聚簇索引答案:B5.在Spark3.4中,对DataFramedf执行df.repartition(200,col("user_id")).write.mode("overwrite").parquet(path)后,生成的文件数理论上为()A.200B.200×分区列基数C.200×Executor数D.由parquet.block.size决定答案:A6.某银行使用两阶段提交(2PC)实现分布式事务,若协调者在“pre-commit”阶段崩溃,参与者最可能处于的状态是()A.全部回滚B.全部提交C.阻塞等待D.自动超时回滚答案:C7.在Snowflake弹性数据仓库中,以下操作不会触发Micro-Partition元数据更新的是()A.DELETEB.UPDATEC.SELECTD.INSERT答案:C8.关于PostgreSQL15的WAL归档,下列参数组合可实现“每16MB段文件生成即归档”的是()A.archive_mode=on,archive_timeout=0B.archive_mode=always,wal_segment_size=16MBC.archive_mode=on,archive_command非空D.archive_mode=on,archive_timeout=16MB答案:C9.在数据治理成熟度模型DAMA-DMBOK2中,达到“已管理级(ManagedLevel)”的核心标志是()A.建立数据资产目录B.实施数据质量度量并定期评审C.任命CDOD.通过ISO27001认证答案:B10.某企业采用DataMesh架构,下列原则最能体现“面向领域所有权”的是()A.统一中央数据湖B.领域团队拥有并发布自己的数据产品C.所有数据必须经过企业级ETLD.采用单一事实来源表答案:B11.在Flink1.17中,使用TableAPI进行流式去重时,语法正确的语句是()A.SELECTDISTINCTFROMtableA.SELECTDISTINCTFROMtableB.SELECTFROMtableGROUPBYidB.SELECTFROMtableGROUPBYidC.SELECTid,LAST_VALUE(val)FROMtableGROUPBYidD.SELECTid,valFROMtableWHERErownum=1答案:A12.某云厂商提供对象存储S3-CompatibleAPI,若需保证“读已写”一致性,最应使用的Header是()A.x-amz-server-side-encryptionB.x-amz-storage-classC.x-amz-metadata-directiveD.x-amz-expected-bucket-owner答案:无正确选项(注:S3原生提供“写后读最终一致”,强一致需借助版本号或外部锁,故本题无正确选项,考生须知晓此陷阱)答案:无13.在MySQL8.0中,对InnoDB表执行ALTERTABLE…ALGORITHM=INSTANT,ADDCOLUMNnew_colINT,其限制为()A.只能添加在最后一列B.表必须为空C.不能添加带有DEFAULTCURRENT_TIMESTAMP的列D.不支持压缩表答案:A14.某数据湖采用DeltaLake2.4,若需回溯到历史版本v5,正确命令是()A.spark.read.format("delta").option("versionAsOf",5).load(path)B.spark.read.format("delta").option("timestampAsOf",5).load(path)C.RESTORETABLEdelta.`path`TOVERSION5D.ALTERTABLEdelta.`path`SETTBLPROPERTIES('delta.version'=5)答案:C15.在数据质量维度中,最能反映“同一客户在不同系统生日不一致”问题的维度是()A.准确性B.一致性C.完整性D.及时性答案:B16.某企业使用Airflow2.7,任务t1使用KubernetesPodOperator,若需保证“任务重试时重新拉取最新镜像”,应设置的参数是()A.image_pull_policy='Always'B.restart_policy='Always'C.retries=3D.dagrun_timeout=timedelta(hours=1)答案:A17.在数据血缘分析中,采用“列级血缘”而非“表级血缘”最主要的技术挑战是()A.存储成本指数级上升B.SQL解析需支持嵌套视图、子查询、UDFC.元数据获取需JDBC权限D.图数据库写入性能瓶颈答案:B18.某金融公司使用Debezium采集OracleCDC,若源表含LOB列,下列配置可避免“ORA-22922:nonexistentLOB”的是()A.lob.enabled=trueB.database.history.store.only.monitored.tables.ddl=trueC.snapshot.mode=initialD.decimal.handling.mode=double答案:A19.在数据安全分类分级中,将“客户身份证照片”标记为“CIII”级,依据的国家标准是()A.GB/T35273-2020B.GB/T37918-2019C.JR/T0197-2020D.GB/T22239-2019答案:B20.某云数据仓库采用列存+向量化执行,若查询出现“Columnpruning”失效,最可能的原因是()A.使用了SELECTA.使用了SELECTB.列存文件块大小过小C.未做ANALYZED.未建ZoneMap答案:A二、多项选择题(每题2分,共20分。每题有两个或两个以上正确答案,多选、少选、错选均不得分)21.下列属于CAP定理中“分区容错性”在工程实现中的具体表现有()A.使用Raft共识算法B.采用异步复制C.设置重试退避策略D.启用多可用区部署答案:A、B、D22.在Spark3.4AdaptiveQueryExecution中,以下优化可动态生效的有()A.动态调整Reducer数量B.动态切换Join策略C.动态优化数据倾斜D.动态下推聚合到源端答案:A、B、C23.关于数据湖仓一体(LakeHouse)特征,正确的有()A.支持ACID事务B.存算分离C.仅支持Parquet格式D.支持时间旅行答案:A、B、D24.在数据资产估值中,属于成本法的成本项有()A.存储费用B.算力费用C.数据质量修复费用D.数据带来的增量利润答案:A、B、C25.下列关于GDPR“数据可携权”技术实现的说法,正确的有()A.需提供结构化、常用、机器可读格式B.必须提供CSV,不能提供JSONC.需在30天内完成D.不得影响他人隐私答案:A、C、D26.在构建实时数仓时,FlinkCDC+Kafka+Doris架构中,Kafka承担的作用有()A.解耦B.削峰C.容错D.提供OLAP查询答案:A、B、C27.某企业实施DataFabric,下列技术组件属于“主动元数据”范畴的有()A.基于ML的自动数据分类B.动态数据血缘图C.静态数据字典D.实时质量评分答案:A、B、D28.在Hive3.0中,使用LLAP(LowLatencyAnalyticalProcessing)可获得的优势有()A.缓存列数据于内存B.减少NameNodeRPCC.支持事务UPDATED.支持向量化执行答案:A、C、D29.下列关于Z-order曲线在多维索引中的应用,正确的有()A.可提高范围查询性能B.需对列进行排序键重排C.适用于高维稀疏数据D.可结合DeltaLake的DataSkipping答案:A、B、D30.在数据产品定价策略中,属于“基于价值定价”的有()A.按数据提升客户转化率2%收费B.按API调用次数阶梯计费C.按替代成本折扣20%收费D.按带来的新增营收分成答案:A、D三、填空题(每空2分,共20分)31.在MySQL8.0中,查看InnoDB当前锁等待的视图是________。答案:information_schema.innodb_lock_waits32.在SparkSQL中,将字符串列按“yyyy-MM-dd”解析为Date类型的函数是________。答案:to_date33.数据治理经典框架DAMA-DMBOK将知识领域划分为________个职能领域。答案:1134.在Oracle19c中,对分区表执行ALTERTABLE…TRUNCATEPARTITION…UPDATEINDEXES,若省略UPDATEINDEXES,则全局索引将变为________状态。答案:UNUSABLE35.某云厂商对象存储提供S3API,若需通过Pre-signedURL上传文件,HTTP方法必须设置为________。答案:PUT36.在Flink中,实现Exactly-once端到端语义的核心屏障机制称为________。答案:CheckpointBarrier37.数据质量规则“字段X必须满足正则表达式^1[3-9]\d{9}$”,该规则维度属于________。答案:准确性(或格式准确性)38.在DataVault2.0模型中,链接表(Link)的主键通常由________组成。答案:所连接各Hub的哈希键联合39.某企业使用dbt进行数据转换,模型配置materialized='incremental',若想仅追加新数据而不更新旧数据,应添加________策略。答案:append40.在Pythonpandas中,对DataFramedf按列col1分组并计算col2的加权平均,权重列w,可写为df.groupby('col1').apply(lambdag:________)答案:(g['col2']g['w']).sum()/g['w'].sum()答案:(g['col2']g['w']).sum()/g['w'].sum()四、简答题(共30分)41.(封闭型,6分)简述Lambda架构与Kappa架构的核心差异,并指出Kappa架构在工程落地时的两项主要挑战。答案:(1)Lambda同时维护批、速两层视图,Kappa仅保留流层,通过重放日志生成批视图;(2)Kappa挑战:①海量日志长期存储与重放成本;②重放时资源调度、任务隔离与版本兼容。42.(开放型,8分)某头部电商“618”大促实时GMV看板出现“延迟>5分钟”告警,经排查Kafkatopic写入正常,Flink消费延迟低,但Doris查询延迟高。请给出系统级排查思路(至少四点)并给出可落地的优化方案。答案:排查:①查看DorisBE节点CPU、IO、内存是否瓶颈;②检查Doristablet分布及副本是否倾斜;③确认是否触发Compaction积压;④查看是否存在大查询抢占资源;⑤核对FE元数据缓存命中率;⑥检查是否开启PartitionCache。优化:①开启Doris动态分区,预建分区避免实时创建;②调整compaction策略,增大cumulative_size_based_compaction_lower_bound_mb;③对看板SQL开启物化视图或Rollup预聚合;④BE节点扩容并开启SSD缓存;⑤在Flink侧预聚合分钟级粒度,减少写入TPS;⑥开启QueryCache并设置cache_last_version_interval=30。43.(封闭型,6分)说明Snowflake中“TimeTravel”与“Fail-safe”在保留时长、使用场景、计费规则三方面的区别。答案:TimeTravel:保留1-90天可配置,用户自助查询历史、恢复表,按存储量计费;Fail-safe:保留7天且不可配置,仅Snowflake后台用于灾难恢复,用户不可直接读取,不额外计费。44.(开放型,10分)某金融公司计划将核心MySQL5.7分布式拆分至MySQL8.0分片集群,要求零停机、数据一致性、可回滚。请设计迁移方案,包括技术选型、步骤、校验、回滚策略。答案:技术选型:采用阿里云DTS双向同步+校验工具pt-table-checksum。步骤:①全量同步:DTS创建全量任务,目标分片为8.0集群;②增量同步:开启双向同步,源→目标实时复制;③数据校验:pt-table-checksum在目标端运行,对比checksum;④流量灰度:通过数据库代理DBProxy按用户尾号10%→50%→100%切换读流量;⑤写流量切换:停写源库5s,确认无延迟后切换写流量至8.0;⑥保留反向同步7天,若异常立即切换回源库;⑦回滚:通过DTS反向同步将增量写回5.7,切换DNS指向源库,确保零数据丢失。五、应用题(共60分)45.(计算类,15分)某互联网公司日志数据每日增量1TB,存储周期30天,采用Parquet+ZSTD压缩,压缩比1:5,冷数据占比70%,热数据占比30%。云厂商报价:标准存储0.12元/GB/月,低频0.08元/GB/月,归档0.03元/GB/月。若采用生命周期策略:7天后转低频,15天后转归档,计算30天总存储成本。答案:原始日增量1TB,压缩后200GB。第1-7天:标准存储,200GB×7×0.12/30=5.6元;第8-15天:低频存储,200GB×8×0.08/30≈4.27元;第16-30天:归档存储,200GB×15×0.03/30=3元;单份数据30天成本=5.6+4.27+3=12.87元;30天累计存量呈等差:第n天存量为n×200GB,总存储量=Σn×200GB,n=1…30,总存储量=200GB×30×31/2=93000GB;按分层权重折算:标准层=200GB×(7+6+…+1)=200×28×7=39200GB·天;低频层=200GB×(15+14+…+8)=200×92×8/2=73600GB·天;归档层=93000×15-39200-73600=93000-112800=-19800(修正逻辑:按日存量×当日单价累加);精确计算:每日存量n×200GB,当日费用=当日存量×当日单价;标准期:n=1…7,费用=Σn×200×0.12/30=200×0.12/30×(1+2+…+7)=200×0.004×28=22.4元;低频期:n=8…15,费用=Σn×200×0.08/30=200×0.08/30×(8+…+15)=200×0.08/30×92=49.07元;归档期:n=16…30,费用=Σn×200×0.03/30=200×0.03/30×(16+…+30)=200×0.001×345=69元;总成本=22.4+49.07+69=140.47元。46.(分析类,15分)给定某电商订单表orders(order_id,user_id,amount,order_time,status),需计算“近30天每日首单金额”及“首单用户次日留存率”。请写出FlinkSQL实现,并说明状态存储策略。答案:```sqlCREATETEMPORARYTABLEorders_kafka(order_idSTRING,user_idSTRING,amountDECIMAL(10,2),order_timeTIMESTAMP(3),statusSTRING,WATERMARKFORorder_timeASorder_timeINTERVAL'5'SECOND)WITH(...);CREATETEMPORARYTABLEfirst_order_daily(order_dateSTRING,first_order_amountDECIMAL(10,2),PRIMARYKEY(order_date)NOTENFORCED)WITH('connector'='upsert-kafka',...);每日首单金额INSERTINTOfirst_order_dailySELECTDATE_FORMAT(order_time,'yyyy-MM-dd')ASorder_date,FIRST_VALUE(amount)OVER(PARTITIONBYDATE_FORMAT(order_time,'yyyy-MM-dd')ORDERBYorder_timeROWSBETWEENUNBOUNDEDPRECEDINGANDUNBOUNDEDFOLLOWING)ASfirst_order_amountFROMorders_kafkaWHEREstatus='success';首单用户次日留存CREATEVIEWuser_first_orderASSELECTuser_id,MIN(order_time)ASfirst_timeFROMorders_kafkaWHEREstatus='success'GROUPBYuser_id;CREATEVIEWretentionASSELECTDATE_FORMAT(a.first_time,'yyyy-MM-dd')ASfirst_date,COUNT(DISTINCTa.user_id)ASfirst_cnt,COUNT(DISTINCTb.user_id)ASret_cntFROMuser_first_orderaJOINorders_kafkabONa.user_id=b.user_idANDDATE_FORMAT(b.order_time,'yyyy-MM-dd')=DATE_FORMAT(a.first_time+INTERVAL'1'DAY,'yyyy-MM-dd')GROUPBYDATE_FORMAT(a.first_time,'yyyy-MM-dd');状态存储:使用RocksDB状态后端,开启增量Checkp

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论