2026年大数据分析技能知识普及试题及答案解析_第1页
2026年大数据分析技能知识普及试题及答案解析_第2页
2026年大数据分析技能知识普及试题及答案解析_第3页
2026年大数据分析技能知识普及试题及答案解析_第4页
2026年大数据分析技能知识普及试题及答案解析_第5页
已阅读5页,还剩18页未读 继续免费阅读

付费下载

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

2026年大数据分析技能知识普及试题及答案解析1.单项选择题(每题1分,共20分)1.1在Hadoop生态中,负责资源管理与任务调度的组件是A.HDFS B.YARN C.MapReduce D.Hive答案:B解析:YARN(YetAnotherResourceNegotiator)是Hadoop2.x引入的资源管理层,负责集群资源分配与作业调度。1.2下列哪一项最能描述Kappa架构与Lambda架构的核心差异A.是否使用HDFS B.是否将批处理层与速度层分离 C.是否使用Kafka D.是否支持SQL查询答案:B解析:Lambda架构同时维护批处理层与速度层,Kappa架构通过统一流处理链路消除批处理层,降低代码冗余。1.3在Spark中,以下操作属于窄依赖的是A.groupByKey B.distinct C.map D.sortByKey答案:C解析:map操作父RDD每个分区只被子RDD一个分区依赖,无需shuffle,属于窄依赖。1.4使用Python的pandas读取一个10GBCSV文件时,最节省内存的做法是A.pd.read_csv('file.csv') B.pd.read_csv('file.csv',dtype=str) C.pd.read_csv('file.csv',chunksize=100000)D.pd.read_csv('file.csv',compression='gzip')答案:C解析:分块读取(chunksize)可逐块处理,避免一次性加载到内存。1.5在Hive中,以下哪种文件格式支持行级索引与谓词下推A.TextFile B.SequenceFile C.ORC D.LZO答案:C解析:ORC(OptimizedRowColumnar)内置轻量级索引,支持谓词下推与压缩。1.6若某电商用户行为表user_action(user_id,item_id,action_type,log_time)数据量每日新增100GB,按log_time做分区,最合理的分区粒度是A.年 B.月 C.日 D.小时答案:C解析:日分区可平衡查询性能与管理成本,避免产生过多小文件。1.7在Flink中,以下哪个窗口分配器会产生“固定个数元素”的窗口A.TumblingEventTimeWindows B.SlidingProcessingTimeWindows C.CountWindow D.SessionWindows答案:C解析:CountWindow按元素数量触发,与事件时间无关。1.8使用K-means聚类时,若样本量n=1000000,维度d=50,k=100,采用SparkMLlib默认实现,最可能遇到的瓶颈是A.网络I/O B.内存占用 C.磁盘顺序读 D.CPU缓存命中率答案:B解析:每轮迭代需存储并广播簇中心,高维大k导致Driver内存压力大。1.9在ClickHouse中,以下列类型最适合存储IPv4地址的是A.String B.UInt32 C.FixedString(16)D.IPv4答案:D解析:ClickHouse原生支持IPv4类型,存储紧凑且支持IP函数。1.10某模型在测试集上AUC=0.81,若将分类阈值从0.5降到0.3,则A.召回率一定上升 B.精确率一定上升 C.F1一定上升 D.真正例率一定下降答案:A解析:阈值降低,更多样本被预测为正,召回率(TPR)单调不减。1.11在PostgreSQL中,对JSONB字段创建GIN索引后,下列查询仍无法使用索引的是A.SELECTFROMtWHEREj->>'name'='Alice'A.SELECTFROMtWHEREj->>'name'='Alice'B.SELECTFROMtWHEREj@>'{"name":"Alice"}'B.SELECTFROMtWHEREj@>'{"name":"Alice"}'C.SELECTFROMtWHEREj?'name'C.SELECTFROMtWHEREj?'name'D.SELECTFROMtWHEREj->'age'>20D.SELECTFROMtWHEREj->'age'>20答案:A解析:->>操作符返回text,GIN索引无法对text等值加速,需改写为@>或?。1.12使用TensorFlow2.x训练深度模型时,以下哪种策略可在多机多卡场景下保持收敛性一致A.MirroredStrategy B.MultiWorkerMirroredStrategy C.TPUStrategy D.CentralStorageStrategy答案:B解析:MultiWorkerMirroredStrategy采用All-Reduce同步梯度,保证各worker参数一致。1.13在AB实验中发现实验组CTR提升2%,p值=0.08,则A.可认为提升显著 B.可认为提升不显著 C.需增加样本量 D.需降低显著性水平α答案:C解析:p>0.05未达显著,但效应存在可能,可通过增加样本量降低第二类错误。1.14使用HBaserowkey设计时,为避免热点,最佳实践是A.使用时间戳作为rowkey前缀 B.使用哈希散列前缀 C.使用自增ID D.使用字典序连续字符串答案:B解析:哈希前缀可将写请求均匀分散到各Region。1.15在数据湖Iceberg中,以下哪项元数据用于实现快照隔离A.manifestlist B.partitionspec C.sortorder D.tableproperty答案:A解析:manifestlist记录各快照对应的文件清单,实现读写隔离。1.16若某特征服从幂律分布,采用下列哪种标准化方法最合理A.Z-score B.Min-Max C.Log变换后Z-score D.RobustScaler答案:C解析:幂律分布重尾,先取对数可缓解异方差,再Z-score可近似正态。1.17在Airflow中,若task_a执行成功后触发task_b与task_c,两者均成功后再执行task_d,应使用的模式是A.chain B.cross_downstream C.one_to_many D.dummy+trigger_rule答案:D解析:设置task_dtrigger_rule='all_success',并用dummy节点聚合b、c。1.18使用Prophet预测节假日效应时,参数holidays_prior_scale越大,则A.节假日效应越平滑 B.节假日效应越灵活 C.趋势变化越剧烈 D.季节项越弱答案:B解析:priorscale越大,节假日回归系数先验方差越大,拟合越灵活。1.19在数据治理中,衡量“同一指标在多个系统取值一致”的维度是A.唯一性 B.完整性 C.一致性 D.及时性答案:C解析:一致性定义即跨系统数值无矛盾。1.20某SQL查询使用窗口函数ROW_NUMBER()OVER(PARTITIONBYuser_idORDERBYlog_timeDESC)后,再WHERErn=1,其等价逻辑是A.每个用户最早一条记录 B.每个用户最新一条记录 C.全局最新一条记录 D.全局最早一条记录答案:B解析:按user_id分区、log_time降序,rn=1即每个用户最新记录。2.多项选择题(每题2分,共20分,多选少选均不得分)2.1下列属于NoSQL数据库CAP理论中“分区容错+可用”组合的典型系统有A.Cassandra B.MongoDB C.HBase D.DynamoDB答案:A、D解析:Cassandra与DynamoDB优先保证AP,HBase优先保证CP。2.2在SparkSQL中,以下写法可触发谓词下推的有A.df.filter(df.age>30).select("name")B.df.select("name").filter(df.age>30)C.df.where("age>30").selectExpr("name")D.df.selectExpr("name").where("age>30")答案:A、C解析:SparkCatalyst优化器支持列式存储下推,filter在select前即可下推。2.3关于XGBoost,下列说法正确的有A.默认使用预排序算法计算分裂点 B.支持自定义目标函数 C.支持类别特征直接输入 D.支持L1、L2正则答案:A、B、D解析:XGBoost需对类别特征做数值编码,不支持直接输入。2.4在Kafka中,以下配置可提高吞吐但可能增大延迟的有A.batch.size B.linger.ms C.acks=1 D.compression.type=none答案:A、B解析:增大batch.size与linger.ms可提高吞吐,但会增大端到端延迟。2.5使用Python进行特征选择时,基于模型系数绝对值的方法有A.LassoCV B.SelectFromModel(LinearSVC(penalty='l1')) C.RFE D.VarianceThreshold答案:A、B解析:L1正则可将不重要特征系数压缩至0,实现嵌入式选择。2.6下列属于FlinkCheckpoint持久化存储的可插拔方案有A.HDFS B.S3 C.RocksDB D.NFS答案:A、B、C、D解析:Flink通过FileSystem抽象支持所有兼容Hadoop的文件系统。2.7在数据仓库缓慢变化维(SCD)中,Type2做法包括A.新增行记录版本 B.增加有效起止时间字段 C.覆盖原值 D.增加当前标识字段答案:A、B、D解析:Type2通过新增行保留历史,不覆盖原值。2.8下列指标可用于评估回归模型稳定性的有A.PSI B.CV(RMSE) C.R² D.MAPE答案:A、B解析:PSI(PopulationStabilityIndex)与CV(变异系数)可衡量分布漂移与波动。2.9在Linux大规模集群运维中,可用来诊断TCP重传过高的工具有A.ss-s B.netstat-s C.sar-nETCP D.tcpdump答案:B、C、D解析:netstat-s与sar-nETCP可查看重传计数,tcpdump可抓包定位。2.10关于数据血缘(DataLineage)自动采集,以下可实现SQL解析开源组件有A.ApacheAtlas B.SQLLineage C.OpenLineage D.Amundsen答案:B、C解析:SQLLineage与OpenLineage专注SQL解析,Atlas与Amundsen需集成其他解析器。3.填空题(每空2分,共20分)3.1在Hive中,将日期字符串'2026-03-09'转换为时间戳(秒)的函数是________。答案:unix_timestamp('2026-03-09','yyyy-MM-dd')解析:unix_timestamp按指定格式解析并返回秒级时间戳。3.2若某决策树采用基尼系数作为划分标准,则节点基尼系数计算公式为________。答案:1−Σ(p_i²)解析:p_i为节点中第i类样本占比。3.3在PythonNumPy中,生成形状(100,100)且服从标准正态分布的随机数组的代码为________。答案:np.random.randn(100,100)解析:randn返回标准正态N(0,1)。3.4在SQL中,计算每月累计成交额的窗口函数表达式为________。答案:SUM(amount)OVER(PARTITIONBYMONTH(order_time)ORDERBYorder_timeROWSUNBOUNDEDPRECEDING)解析:按月份分区、按时间排序,累计求和。3.5在Elasticsearch中,设置分片副本数为2的模板语句为"number_of_replicas":________。答案:2解析:副本数提高可用性与查询吞吐。3.6在Spark中,将RDD转换为DataFrame需导入的隐式转换对象为________。答案:spark.implicits._解析:ScalaAPI需引入隐式转换以支持toDF方法。3.7若某特征列缺失率>95%,且业务含义为“用户未填写”,则最适合的缺失处理方式是________。答案:保留并新增布尔标识特征解析:高缺失且含信息,应保留缺失模式。3.8在Linux中,查看当前系统最大打开文件数限制的命令是________。答案:ulimit-n解析:ulimit-n返回单进程可打开文件描述符上限。3.9在Prophet模型中,设置年度季节模式为加法型的参数为________。答案:seasonality_mode='additive'解析:additive与multiplicative可选。3.10在Kafka2.8版本后,无需依赖Zookeeper的集群模式称为________。答案:KRaft解析:KafkaRaftMetadataMode(KRaft)移除Zookeeper依赖。4.简答题(共30分)4.1(封闭型,6分)简述数据倾斜在SparkSQL中的典型表现、定位手段及三种优化方案。答案:表现:某task处理数据量远大于其他,执行时间长尾,甚至OOM。定位:通过SparkHistoryServer查看Stage详情,发现某task输入记录数或shuffleread量异常;或在代码中加入df.groupBy(spark_partition_id()).count()查看各分区大小。优化:1.加盐打散:对倾斜key添加随机前缀,二次聚合。2.广播join:当小表<10MB时,使用broadcasthint避免shuffle。3.自定义分区:采用repartition(col,n)将热点key分散到更多分区,或采用两阶段聚合(局部聚合+全局聚合)。4.2(开放型,6分)某电商公司“猜你喜欢”场景,离线训练AUC提升显著,但上线后CTR下降,请列举四种可能原因并给出验证思路。答案:1.特征穿越:离线使用未来数据统计特征。验证:对比离线特征生成时间与label时间,检查是否<=label时间。2.数据分布漂移:上线时段用户群体或商品池变化。验证:计算上线前后特征PSI、标签CTR差异。3.线上线下特征不一致:线上服务缺失某特征默认填0。验证:采集线上请求日志,回放特征抽取流程,与离线特征diff。4.模型过拟合高维稀疏ID:离线AUC虚高。验证:采用交叉验证、去掉高维ID特征重新训练,观察AUC变化;或绘制训练集vs验证集AUC曲线。4.3(封闭型,6分)说明ClickHouseMergeTree引擎中partition与primarykey的区别,并给出一种利用partition裁剪提升查询性能的SQL示例。答案:区别:partition决定数据在磁盘上的目录划分,查询时可根据分区字段直接跳过整个目录;primarykey是稀疏索引,用于定位mark区间,粒度更细。示例:ALTERTABLEhitsPARTITIONBYtoYYYYMM(event_time);SELECTcount()FROMhitsWHEREevent_time>='2026-03-01'ANDevent_time<'2026-04-01';解析:通过分区字段event_time裁剪,仅扫描202603分区,减少80%数据读取。4.4(开放型,6分)描述在联邦学习场景下,横向联邦与纵向联邦的数据划分差异,并指出两种对应的加密梯度聚合协议。答案:横向联邦:样本不同、特征重叠(如两家银行各自拥有不同客户群,特征相同)。纵向联邦:样本重叠、特征不同(如银行与电商拥有同一批用户,特征互补)。加密协议:横向:FedAvg(SecureAggregation+SecretSharing),服务器仅看到聚合梯度。纵向:SecureBoost(基于同态加密或差分隐私),各参与方在加密状态下计算梯度和hessian,再聚合。4.5(封闭型,6分)给定一张用户登录表login(user_idINT,login_timeTIMESTAMP),用SQL计算每个用户连续登录的最大天数(允许跨天间隔<=1天)。答案:WITHgrpAS(SELECTuser_id,DATE(login_time)ASlogin_date,DATE_SUB(DATE(login_time),INTERVALROW_NUMBER()OVER(PARTITIONBYuser_idORDERBYDATE(login_time))DAY)ASgrp_flagFROMloginGROUPBYuser_id,DATE(login_time)),streakAS(SELECTuser_id,grp_flag,COUNT()ASstreak_lenSELECTuser_id,grp_flag,COUNT()ASstreak_lenFROMgrpGROUPBYuser_id,grp_flag)SELECTuser_id,MAX(streak_len)ASmax_streakFROMstreakGROUPBYuser_id;解析:grp_flag相同的日期即连续区间,计数后取最大。5.应用题(共60分)5.1计算题(15分)某短视频平台采用Lambda架构,每日新增1亿条观看记录,平均每条200B,冷层存储90天,热层存储7天。(1)估算冷层与热层数据量(GB)。(2)若采用Snappy压缩比0.5,冷层实际磁盘占用多少?(3)若HDFS三副本,冷层实际磁盘占用多少?(4)若采用ErasureCodingRS(6,3)替代三副本,磁盘节省百分比?答案:(1)冷层:1×10^8×200×90=1.8×10^11B≈167.6GB;热层:1×10^8×200×7≈13.0GB。(2)167.6×0.5≈83.8GB。(3)83.8×3≈251.4GB。(4)RS(6,3)冗余度=9/6=1.5,节省=(3−1.5)/3=50%。5.2分析题(15分)给定广告曝光日志表impression(ad_id,user_id,ts,cost),点击日志表click(ad_id,user_id,ts)。任务:计算过去7天每小时的CTR,并找出CTR异常下降Top3的小时。要求:1.给出完整的SparkSQL脚本(含时间过滤、leftjoin、CTR计算、异常判定方法)。2.说明异常判定采用的统计规则及阈值。答案:1.脚本:WITHimpAS(SELECThour(ts)AShr,COUNT()ASimp_cntCOUNT()ASimp_cntFROMimpressionWHEREts>=current_timestamp()INTERVAL7DAYGROUPBYhour(ts)),clkAS(SELECThour(ts)AShr,COUNT()ASclk_cntCOUNT()ASclk_cntFROMclickWHEREts>=current_timestamp()INTERVAL7DAYGROUPBYhour(ts)),ctrAS(SELECTi.hr,clk_cnt/imp_cntASctr,avg(ctr)OVER()ASglobal_avg,stddev(ctr)OVER()ASglobal_stdFROMimpiLEFTJOINclkcONi.hr=c.hr)SELECThr,ctrFROMctrWHEREctr<global_avg2global_stdWHEREctr<global_avg2global_stdORDERBYctrLIMIT3;2.异常规则:采用均值−2σ阈值,若某小时CTR低于该值则判定异常,阈值动态根据7天样本计算。5.3综合题(30分)背景:某城商行拟构建实时反欺诈模型,交易流kafkatopic:transaction,字段如下:trans_id,user_id,card_no,amount,merchant_code,lat,lon,trans_time,label(0=正常,1=欺诈)(训练时才有)。要求:(1)设计一套基于Flink的实时特征工程方案,输出到Kafkatopic:feature,需包含三类特征:a.用户最近30分钟交易次数与金额均值;b.用户最近1小时异地交易次数(距离>100km);c.用户最近5笔

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论