2026年专业技术人员公需科目必修课考试试题(含答案)大数据应用_第1页
2026年专业技术人员公需科目必修课考试试题(含答案)大数据应用_第2页
2026年专业技术人员公需科目必修课考试试题(含答案)大数据应用_第3页
2026年专业技术人员公需科目必修课考试试题(含答案)大数据应用_第4页
2026年专业技术人员公需科目必修课考试试题(含答案)大数据应用_第5页
已阅读5页,还剩12页未读 继续免费阅读

付费下载

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

2026年专业技术人员公需科目必修课考试试题(含答案)大数据应用一、单项选择题(每题1分,共20分。每题只有一个正确答案,请将正确选项字母填入括号内)1.在Hadoop生态中,负责集群资源管理与任务调度的核心组件是()。A.HDFS  B.YARN  C.MapReduce  D.Hive答案:B2.下列哪一项最能准确描述“数据湖”概念()。A.仅存储结构化数据的关系型仓库  B.先建模后存储的OLAP系统C.原始格式无限扩展的集中存储池  D.基于内存的流处理框架答案:C3.在Spark中,下列操作属于“行动”(Action)类型的是()。A.map  B.filter  C.reduceByKey  D.collect答案:D4.某电商公司利用用户浏览日志进行实时推荐,其技术架构首选的流处理框架是()。A.Sqoop  B.Flume  C.Flink  D.PIG答案:C5.在数据治理成熟度模型DAMA-DMBOK中,最高等级被称为()。A.初始级  B.管理级  C.优化级  D.已定义级答案:C6.当使用Kafka保证“精确一次”语义时,必须同时开启的两个机制是幂等生产者和()。A.事务管理器  B.消费者组再平衡  C.分区副本  D.日志压缩答案:A7.在数据仓库维度建模中,缓慢变化维类型2采用的技术手段是()。A.覆盖旧值  B.增加新列  C.新增代理键行  D.时间戳分区答案:C8.下列算法中,常用于文本特征降维的是()。A.K-Means  B.PCA  C.Apriori  D.C4.5答案:B9.根据《个人信息保护法》,处理敏感个人信息应当取得个人的()。A.口头同意  B.推定同意  C.单独同意  D.默示同意答案:C10.在Python的pandas库中,用于将分类变量转换为数值型哑变量的函数是()。A.cut  B.qcut  C.get_dummies  D.factorize答案:C11.当HDFS副本系数为3时,写入一个128MB文件,实际占用的集群磁盘空间为()。A.128MB  B.256MB  C.384MB  D.与块大小无关答案:C12.在NoSQL数据库中,Cassandra采用的一致性协议是()。A.Paxos  B.Raft  C.Gossip+HintedHandoff  D.Two-PhaseCommit答案:C13.下列指标中,最能反映二分类模型区分能力的指标是()。A.准确率  B.召回率  C.F1值  D.AUC-ROC答案:D14.在SparkSQL中,用于注册临时视图的API是()。A.cache()  B.createOrReplaceTempView()  C.persist()  D.registerTable()答案:B15.当使用Elasticsearch进行地理距离查询时,应使用的查询类型是()。A.match  B.term  C.geo_distance  D.range答案:C16.在数据资产目录中,用于描述字段业务含义的元数据属于()。A.技术元数据  B.操作元数据  C.业务元数据  D.管理元数据答案:C17.下列关于数据倾斜的说法正确的是()。A.只会发生在reduce阶段  B.无法通过加盐解决C.会导致任务耗时严重不均  D.对内存消耗无影响答案:C18.在机器学习中,用于防止决策树过拟合的剪枝策略是()。A.信息增益  B.Gini系数  C.代价复杂度剪枝  D.随机子空间答案:C19.某省政务云采用“两地三中心”架构,其中“三中心”不包括()。A.生产中心  B.同城双活中心  C.异地灾备中心  D.测试中心答案:D20.在数据可视化中,适合展示两个连续变量相关关系的图形是()。A.饼图  B.箱线图  C.散点图  D.雷达图答案:C二、多项选择题(每题2分,共20分。每题有两个或两个以上正确答案,多选、少选、错选均不得分)21.下列属于大数据“5V”特征的有()。A.Volume  B.Velocity  C.Viscosity  D.Variety  E.Veracity答案:ABDE22.在HDFS写数据流程中,客户端需要与以下哪些节点交互()。A.NameNode  B.SecondaryNameNode  C.DataNode  D.JobTracker  E.客户端本地缓存答案:AC23.以下哪些算法可用于时间序列预测()。A.ARIMA  B.LSTM  C.Prophet  D.DBSCAN  E.XGBoost答案:ABCE24.关于Kafka分区,下列说法正确的有()。A.一个分区只能被一个消费者组内的一个消费者实例消费B.分区数一旦创建不可修改C.增加分区可提高并行度D.分区副本因子可在线调大E.消息在分区内有序答案:ACDE25.下列属于数据质量维度指标的有()。A.准确性  B.一致性  C.及时性  D.可理解性  E.唯一性答案:ABCE26.在Python中进行缺失值处理时,pandas提供的策略包括()。A.dropna  B.fillna  C.interpolate  D.replace  E.merge答案:ABC27.以下属于图数据库典型应用场景的有()。A.社交网络好友推荐  B.金融反欺诈关联分析C.实时日志聚合  D.知识图谱构建  E.商品库存事务处理答案:ABD28.在数据脱敏技术中,可逆加密方法包括()。A.对称加密  B.哈希加盐  C.格式保持加密  D.令牌化  E.掩码答案:ACD29.下列关于联邦学习的描述正确的有()。A.原始数据不出域  B.仅交换模型参数或梯度C.可解决数据孤岛问题  D.无需加密机制E.支持异构特征空间答案:ABCE30.以下属于《数据安全法》规定的数据安全管理制度有()。A.数据分类分级  B.风险评估  C.数据出境安全评估D.重要数据备份  E.数据交易备案答案:ABCD三、填空题(每空1分,共20分)31.在HDFS中,默认块大小为________MB。答案:12832.SparkCore的抽象数据模型称为________。答案:RDD33.在SQL中,用于将行转列的聚合函数搭配关键字是________。答案:PIVOT34.若某表字段age为NULL,MySQL中筛选非NULL值的条件写法是age________NULL。答案:ISNOT35.在Python的sklearn中,标准化缩放的类名是________。答案:StandardScaler36.数据治理组织中的最高决策机构通常称为________委员会。答案:数据治理(或数据管理)37.在Elasticsearch中,默认的分词器是________。答案:StandardAnalyzer38.当Redis用作缓存时,常用的淘汰策略之一是________,即最近最少使用。答案:LRU39.在数据仓库中,事实表通常记录________,维度表记录上下文。答案:业务过程的度量40.用于衡量推荐系统多样性的指标是________,即列表内物品间平均相似度。答案:Intra-listSimilarity(或ILS)41.在Flink中,窗口函数在________窗口上可提前触发计算。答案:会话42.数据血缘追踪时,字段级血缘的最细粒度节点被称为________节点。答案:列(或字段)43.当使用XGBoost时,控制过拟合的参数中,________用于限制树的最大深度。答案:max_depth44.在数据资产估值中,基于收益的评估方法首字母缩写为________。答案:DCF(DiscountedCashFlow)45.在Kafka中,消费者位移默认存储于________系统主题。答案:__consumer_offsets46.根据国标GB/T35273,个人信息分为个人信息与________信息两级。答案:敏感个人47.在数据可视化中,将连续颜色映射到不同数值的映射方式称为________映射。答案:线性(或连续)颜色48.当使用HBase时,对RowKey进行________设计可避免热点。答案:散列(或反转、加盐)49.在机器学习中,F1值是精确率与召回率的________平均。答案:调和50.在数据安全能力成熟度模型中,等级保护2.0将安全区域边界分为________层。答案:三四、判断题(每题1分,共10分。正确打“√”,错误打“×”)51.Hive默认使用Tez作为执行引擎。()答案:×52.在Spark中,窄依赖的子RDD每个分区只依赖父RDD的一个分区。()答案:√53.数据备份等同于数据归档,两者可互换使用。()答案:×54.在深度学习中,Dropout只能在测试阶段生效。()答案:×55.根据CAP理论,分区容错性在分布式系统中必须保证。()答案:√56.在MySQL中,InnoDB支持全文索引。()答案:√57.数据沙箱环境允许分析人员导出原始敏感数据到本地。()答案:×58.在Python中,NumPy数组的切片返回的是视图而非复制。()答案:√59.使用KafkaMirrorMaker可实现跨集群数据复制。()答案:√60.在数据治理中,数据Owner对数据质量负最终责任。()答案:√五、简答题(共30分)61.(封闭型,6分)简述HDFS读数据流程的三个主要阶段。答案:1.客户端向NameNode请求文件元数据,获取文件块位置信息;2.客户端根据距离拓扑选择最近的DataNode建立流式读取,逐个块下载;3.数据传输完成后关闭流,若出现校验错误则向NameNode汇报并重新读取其他副本。62.(开放型,8分)结合实际案例,说明数据倾斜在SparkSQL中的危害及三种以上解决思路。答案:危害:导致部分Task处理数据量远大于平均,作业整体耗时由最慢Task决定,资源利用率低,甚至引发OOM。案例:某运营商日志分析,用户ID字段空值占30%,空值被集中哈希到同一分区。解决思路:1.加盐拆分:对热点Key添加随机前缀,扩展为多个Reduce,再二次聚合去前缀;2.两阶段聚合:局部预聚合+全局聚合,减少Shuffle量;3.广播join:将小表(<10MB)广播到各节点,避免shuffle;4.自定义分区器:将热点Key均匀散列到更多分区;5.过滤隔离:将热点数据单独处理,再与普通数据结果合并。63.(封闭型,6分)列出数据分类分级工作中“重要数据”识别的四项通用原则。答案:1.国家安全与公共利益影响度;2.一旦泄露对经济社会运行的危害程度;3.数据规模与覆盖范围;4.数据敏感度与聚合增值潜力。64.(开放型,10分)说明联邦学习与传统的集中式机器学习在隐私保护、通信成本、模型性能三方面的差异,并给出各自适用场景。答案:隐私保护:联邦学习原始数据不出域,仅交换加密梯度,满足GDPR“数据最小化”;集中式需上传原始数据,泄露风险高。通信成本:联邦学习每轮需上传模型参数,网络开销大,尤其深度模型;集中式一次性上传数据,后续训练在云端,通信一次性。模型性能:联邦学习面临Non-IID、设备异构,准确率通常略低于集中式;集中式数据同分布,易收敛到全局最优。适用场景:联邦学习适用于医疗多中心联合建模、手机输入法词频预测、金融跨机构反洗钱;集中式适用于数据可汇聚、隐私要求低、模型复杂度高且需调参的场景,如大型电商推荐、图像搜索。六、计算与分析题(共30分)65.(计算题,10分)某市交通卡口每日产生车辆通行记录10亿条,每条记录包含车牌号、时间戳、卡口ID、车型,平均每条0.1KB。若采用HDFS三副本存储,计算:(1)每日原始数据量(GB);(2)占用磁盘空间(GB);(3)若保存30天并启用LZO压缩,压缩比5:1,求实际磁盘空间(GB)。答案:(1)10×0.1GB=10GB;(2)10GB×3=30GB;(3)30GB×30天/5=180GB。66.(分析题,10分)给定如下混淆矩阵,计算精确率、召回率、F1值,并判断当业务要求“尽可能少漏掉阳性样本”时,该模型是否可用,说明理由。预测1  0真实1 85 15真实0 20 880答案:TP=85,FP=20,FN=15,TN=880;精确率P=85/(85+20)=0.8095;召回率R=85/(85+15)=0.85;F1=2PR/(P+R)=0.829。业务要求少漏阳性即要求高召回,当前召回85%,若可接受15%漏检则可用;若阳性为癌症筛查等高风险场景,需召回>95%,则不可用,应调低阈值或优化模型。67.(综合题,10分)某省卫健委拟建设“健康医疗大数据平台”,需整合省内200家医院HIS、LIS、PACS数据,数据量3PB,涉及敏感个人信息。请给出技术架构图文字描述(含数据采集、存储、治理、分析、共享五大层),并指出三层以上安全合规措施。答案:技术架构:1.采集层:Flume+Kafka+CDC工具实时抽取,Nifi离线调度,统一HL7/FHIR标准;2.存储层:HDFS冷数据,SSD+HBase热数据,Elasticsearch索引,数据湖

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论