2026大数据分析师考试题目及答案_第1页
2026大数据分析师考试题目及答案_第2页
2026大数据分析师考试题目及答案_第3页
2026大数据分析师考试题目及答案_第4页
2026大数据分析师考试题目及答案_第5页
已阅读5页,还剩13页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

2026大数据分析师考试题目及答案一、单项选择题(每题1分,共20分。每题只有一个正确答案,请将正确选项字母填入括号内)1.在Hadoop生态中,负责资源管理与任务调度的组件是()A.HDFS  B.YARN  C.MapReduce  D.Hive答案:B2.下列关于数据湖描述正确的是()A.仅支持结构化数据  B.强制预定义Schema  C.支持原始格式存储  D.不支持流式写入答案:C3.在SparkSQL中,用于将DataFrame注册为临时视图的函数是()A.cache()  B.createTempView()  C.persist()  D.collect()答案:B4.若某电商订单表包含列order_id、user_id、amount、pay_time,计算“每位用户2025年累计消费额”应使用的SQL子句是()A.GROUPBYuser_id,YEAR(pay_time)  B.GROUPBYuser_id  C.PARTITIONBYuser_id  D.ORDERBYuser_id答案:B5.在Pythonpandas中,对DataFramedf按列col升序并返回前10%行的最佳写法是()A.df.sort_values('col').head(int(len(df)0.1))A.df.sort_values('col').head(int(len(df)0.1))B.df.nlargest(int(len(df)0.1),'col')B.df.nlargest(int(len(df)0.1),'col')C.df.sample(frac=0.1).sort_values('col')D.df['col'].quantile(0.1)答案:A6.下列算法中,属于无监督学习的是()A.XGBoost  B.K-Means  C.LightGBM  D.LogisticRegression答案:B7.在Hive中,将字符串'2026-03-01'转换为日期类型的函数是()A.unix_timestamp  B.from_unixtime  C.to_date  D.castasdate答案:C8.使用Kafka保证消息“恰好一次”语义需同时启用()A.at-least-once+幂等producer+事务B.at-most-once+批量刷盘C.关闭ackD.增大batch.size答案:A9.在ROC曲线中,越靠近左上角的点对应的模型()A.召回率越低  B.精确率越低  C.AUC越小  D.综合性能越好答案:D10.对高维稀疏文本特征进行降维,最常用的是()A.PCA  B.t-SNE  C.TruncatedSVD  D.LDA(线性判别分析)答案:C11.在SQL优化中,EXPLAIN输出中type列显示“index”表示()A.全表扫描  B.全索引扫描  C.范围扫描  D.唯一索引查找答案:B12.下列关于FlinkCheckpoint描述错误的是()A.基于Chandy-Lamport算法  B.可配置Exactly-Once  C.保存点自动删除无法恢复  D.支持增量Checkpoint答案:C13.使用Pythonstatsmodels计算线性回归时,默认使用下列哪种方法估计参数()A.梯度下降  B.普通最小二乘  C.最大似然  D.贝叶斯答案:B14.在PostgreSQL中,建立GiST索引适合的数据类型是()A.int4  B.text  C.jsonb  D.point答案:D15.当特征存在多重共线性时,首选的回归改进方法是()A.向前选择  B.Lasso  C.增加样本  D.提高学习率答案:B16.在Tableau中,将维度字段拖至“颜色”标记卡,默认生成的是()A.热力图  B.饼图  C.散点图  D.条形图答案:B17.使用HBaseRowKey设计时,为避免热点应()A.使用时间戳前缀  B.使用哈希前缀  C.使用递增数字  D.使用短RowKey答案:B18.在Python中,使用multiprocessing模块时,进程间共享最高效的方式是()A.Queue  B.Pipe  C.shared_memory.SharedMemory  D.Manager.list答案:C19.在数据治理成熟度模型DAMA-DMBOK中,最高级是()A.Managed  B.Defined  C.Optimized  D.Initial答案:C20.若某模型在训练集准确率99%,测试集准确率72%,则最恰当的下一步是()A.增加训练轮数  B.收集更多训练数据  C.降低正则化  D.减小学习率答案:B二、多项选择题(每题2分,共20分。每题有两个或两个以上正确答案,多选、少选、错选均不得分)21.下列属于时间序列分解分量的有()A.Trend  B.Seasonal  C.Residual  D.Variance答案:ABC22.在Spark中,会导致Shuffle的操作包括()A.reduceByKey  B.groupByKey  C.map  D.distinct答案:ABD23.关于数据仓库Kimball维度建模,下列说法正确的有()A.星型模型含冗余维度表  B.事实表存储度量  C.维度表主键常为代理键  D.支持缓慢变化维度答案:BCD24.下列Python库可用于深度学习的包括()A.TensorFlow  B.PyTorch  C.Keras  D.Scrapy答案:ABC25.在A/B测试中,为降低第二类错误,可采取()A.增加样本量  B.提高显著性水平α  C.降低β  D.使用双侧检验答案:AC26.关于数据倾斜,正确的缓解策略有()A.两阶段聚合  B.加盐后局部聚合  C.提高并行度  D.使用MapJoin答案:ABCD27.下列属于NoSQL数据库的有()A.MongoDB  B.Redis  C.Neo4j  D.Oracle答案:ABC28.在特征选择中,基于模型系数进行筛选的方法有()A.L1正则  B.递归特征消除  C.方差阈值  D.基于树模型的特征重要性答案:ABD29.下列指标可用于回归模型评估的有()A.MAPE  B.RMSE  C.AUC  D.R²答案:ABD30.在数据安全合规中,GDPR赋予数据主体的权利包括()A.访问权  B.删除权(被遗忘权)  C.可携带权  D.修改权答案:ABCD三、填空题(每空2分,共20分)31.在Hive中,将表table_a按列col分区且分区字段类型为string,创建分区表的DDL语句分区子句应写:__________。答案:PARTITIONEDBY(colstring)32.在Pythonnumpy中,生成形状(3,4)且元素服从标准正态分布的随机数组的代码为:__________。答案:np.random.randn(3,4)33.在SQL中,计算列col滑动3行平均窗口函数表达式为:__________。答案:AVG(col)OVER(ORDERBYidROWSBETWEEN2PRECEDINGANDCURRENTROW)34.在Linux中,将本地文件data.csv上传至HDFS目录/user/hadoop/的命令为:__________。答案:hdfsdfs-putdata.csv/user/hadoop/35.在FlinkTableAPI中,将DataStream注册为表名为log的语句为:__________。答案:tableEnv.createTemporaryView("log",dataStream)36.在Pythonsklearn中,使用StandardScaler对训练集X_train拟合并转换的代码为:__________。答案:StandardScaler().fit_transform(X_train)37.在PostgreSQL中,开启扩展以支持UUID生成的SQL为:__________。答案:CREATEEXTENSIONIFNOTEXISTS"uuid-ossp";38.在Excel365中,使用动态数组函数将区域A1:A10去重的公式为:__________。答案:=UNIQUE(A1:A10)39.在Tableau计算字段中,将字符串字段date_str从'20260301'转为日期型日期的表达式为:__________。答案:DATEPARSE("yyyyMMdd",date_str)40.在PromQL中,计算过去5分钟HTTP请求平均每秒增长率的表达式为:__________。答案:rate(http_requests_total[5m])四、判断题(每题1分,共10分。正确打“√”,错误打“×”)41.在HDFS中,NameNode负责存储实际数据块。  答案:×42.使用PCA降维后,各主成分之间正交。  答案:√43.LightGBM采用直方图算法加速训练。  答案:√44.在Kafka中,partition数一旦创建不可修改。  答案:×45.在Python中,GIL限制了多线程并行计算。  答案:√46.在SQL中,LEFTJOIN结果行数一定大于等于左表行数。  答案:×47.在A/B测试中,p值越小说明实验组效果越显著。  答案:√48.在XGBoost中,设置reg_lambda相当于L2正则。  答案:√49.在数据仓库中,事实表越宽越好,可减少关联。  答案:×50.在ElasticSearch中,mapping一旦创建不可修改。  答案:×五、简答题(共30分)51.(封闭型,6分)简述数据治理中“元数据管理”的核心目标,并列举两类常见元数据。答案:核心目标是通过统一收集、存储、维护数据资产的描述信息,实现数据可发现、可理解、可信任、可追踪。常见两类:技术元数据(表结构、字段类型、存储路径)、业务元数据(业务定义、业务规则、数据责任人)。52.(开放型,8分)某电商公司发现推荐系统离线AUC提升3%,但线上CTR下降1%,请给出至少四条可能原因及对应排查方法。答案:1.数据泄露:离线特征含未来信息,排查方法:检查特征生成时间戳是否晚于样本标签时间。2.样本偏差:离线采样策略与线上分布不一致,排查:对比离线/线上用户画像分布,使用PSM重采样。3.位置偏差未建模:离线未考虑展示位置,线上受位置影响大,排查:引入positionbias特征重新训练。4.冷启动差异:离线数据覆盖老用户多,线上新用户占比高,排查:分新老用户评估AUC/CTR,增加冷启动策略。5.实时特征延迟:线上特征延迟导致分值不准,排查:监控特征延迟P99,增加缓存或流式特征。(答出任意四条即满分)53.(封闭型,6分)写出使用Pythonsklearn构建随机森林回归模型并输出特征重要性的完整代码(含训练、预测、评估RMSE)。答案:```pythonfromsklearn.ensembleimportRandomForestRegressorfromsklearn.metricsimportmean_squared_errorfromsklearn.model_selectionimporttrain_test_splitimportnumpyasnpX,y=load_data()#假设已定义X_train,X_test,y_train,y_test=train_test_split(X,y,test_size=0.2,random_state=42)rf=RandomForestRegressor(n_estimators=300,max_depth=10,random_state=42)rf.fit(X_train,y_train)pred=rf.predict(X_test)rmse=np.sqrt(mean_squared_error(y_test,pred))print("RMSE:",rmse)importances=rf.feature_importances_forf,iinzip(range(X.shape[1]),importances):print(f"feature{f}:{i:.4f}")```54.(开放型,10分)某运营商每日新增500GB信令数据,需构建用户位置轨迹仓库,要求保留18个月,支持秒级查询最近7天、分钟级查询历史,请给出技术选型、分层架构、分区策略、索引方案及压缩格式,并说明理由。答案:技术选型:HDFS+Spark(批)、Kafka+Flink(流)、ClickHouse(OLAP)、Alluxio(加速)。分层:ODS(原始信令,Parquet+ZSTD,按天分区)、DWD(清洗去重,保留cell_id,imsi,time等,按天+小时分区)、DWS(用户级轨迹聚合,窗口10分钟,按天分区)、ADS(最近7天热数据,写入ClickHouse)。分区策略:ODS/DWD使用(dt,hh)二级分区;ClickHouse按toStartOfHour(time)分区+imsi哈希分片。索引:ClickHouse使用跳数索引(minmaxtime)、布隆过滤器(imsi)、cell_id位图索引。压缩:Parquet+ZSTD压缩率50%,ClickHouse默认LZ4兼顾速度与压缩。理由:分层降低重复计算;小时分区平衡文件数与扫描量;ClickHouse列存+索引实现秒级;Alluxio缓存最近7天热分区,减少HDFSIO;ZSTD高压缩节约磁盘。六、应用题(共50分)55.计算题(10分)给定用户消费表user_cost(user_idstring,costdouble,dtstring),计算2025年每用户月累计消费、环比增长率(当月/上月-1),要求输出user_id,month,cost,mom_rate,缺失上月填充0。SQL答案:```sqlWITHtAS(SELECTuser_id,date_format(dt,'yyyy-MM')ASmonth,SUM(cost)AScostFROMuser_costWHEREdtBETWEEN'2025-01-01'AND'2025-12-31'GROUPBYuser_id,date_format(dt,'yyyy-MM')),t_lagAS(SELECTuser_id,month,cost,LAG(cost,1,0)OVER(PARTITIONBYuser_idORDERBYmonth)ASlast_costFROMt)SELECTuser_id,month,cost,CASEWHENlast_cost=0THENNULLELSEcost/last_cost-1ENDASmom_rateFROMt_lag;```56.分析题(15分)某视频平台实验组新增“连播”功能,实验两周后指标如下:实验组样本120万,对照组样本120万;实验组人均播放时长+4.2%,p=0.008;广告曝光量+1.5%,p=0.12;会员转化率+0.8%,p=0.45。问题:(1)判断上述指标是否统计显著,并给出业务结论。(3分)(2)若公司KPI优先级为“会员转化>时长>广告”,请给出后续决策建议并补充需要监控的次要指标。(5分)(3)从实验设计角度,指出可能威胁内部效度的两个因素及改进措施。(7分)答案:(1)仅人均播放时长p<0.05,显著;广告与会员不显著。结论:功能显著提升播放时长,但对广告与会员影响不明确。(2)决策:延长实验4周扩大样本,继续观察会员转化;若会员仍不显著,则小流量灰度至20%并迭代产品(如连播提示加会员优惠)。次要监控:留存、完播率、crash率、客服投诉。(3)威胁:1.选择偏差——实验组用户更活跃,改进:实验前AA检验,确保基线一致;2.网络效应——连播影响好友观看,改进:按地理或用户群簇随机化,使用簇稳健标准误;3.新奇效应——初期好奇,改进:观察指标时序衰减,若四周后效应减半需重新评估。57.综合题(25分)某城域交通卡口每30秒上传一条过车记录,字段:camera_id,plate_no,pass_time,color,speed,road_id,日增量8000万条(≈1.2TB)。需实现:a.实时识别套牌车:同一plate_no在5分钟内出现在两个相距>20km的卡口;b.离线统计:每日各道路平均车速、流量、拥堵指数(速度<30km/h占比);c.支持交警按plate_no查询近一年轨迹,响应<2s。要求:给出完整技术架

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论