版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
大数据分析师招聘笔试题与参考答案(某大型央企)2025年一、基础理论题(共30分)1.选择题(每题2分,共10分)(1)以下哪项不属于Hadoop生态体系的核心组件?A.HDFSB.YARNC.SparkD.HBase(2)数据仓库(DW)与数据库(DB)的本质区别在于?A.数据存储量大小B.是否支持事务处理C.面向分析还是事务D.数据模型设计复杂度(3)在数据质量评估中,“同一指标在不同系统中的计算结果一致”属于以下哪个维度?A.准确性B.一致性C.完整性D.及时性(4)以下哪种技术最适合处理实时流数据?A.HiveB.FlinkC.HBaseD.Presto(5)在机器学习中,若模型在训练集上表现良好但在测试集上效果差,最可能的原因是?A.欠拟合B.过拟合C.数据不平衡D.特征选择不当2.简答题(每题5分,共20分)(1)简述数据湖(DataLake)与数据仓库(DataWarehouse)的核心差异及适用场景。(2)列举至少5个常用的大数据性能优化手段,并说明其适用场景。(3)在数据清洗过程中,处理缺失值的常用方法有哪些?请结合具体业务场景说明选择依据。(4)简述央企数据治理中“数据安全合规”的关键要求,至少列出3项核心措施。二、技术实操题(共40分)1.SQL编程(20分)某央企制造板块有3张业务表:-`production`(生产记录):`prod_id`(产品ID)、`line_id`(产线ID)、`shift`(班次)、`output`(产量)、`defect_num`(不良数)、`prod_date`(生产日期)-`equipment`(设备信息):`eq_id`(设备ID)、`line_id`(所属产线)、`eq_type`(设备类型)、`purchase_date`(采购日期)-`maintenance`(维修记录):`eq_id`(设备ID)、`m_date`(维修日期)、`m_cost`(维修成本)、`m_reason`(维修原因)要求:(1)查询2024年每个产线(`line_id`)的总良率(良率=(总产量-总不良数)/总产量),按良率降序排列(5分)。(2)统计2024年各设备类型(`eq_type`)的“维修成本/设备使用年限”比值(使用年限=2024-采购年份,不足1年按1年计),并筛选出比值前3的设备类型(7分)。(3)分析某关键产线(`line_id='L001'`)2024年各月的不良数波动情况,要求输出月份、月均不良数、与上月相比的环比增长率(8分)。2.Python编程(20分)某央企客户数据文件`customer_data.csv`包含以下字段:`user_id`(用户ID)、`age`(年龄)、`gender`(性别)、`income`(月收入)、`region`(地区)、`purchase_freq`(月购买频次)、`churn`(是否流失,1=是,0=否)。要求:(1)使用Pandas读取数据,完成以下清洗操作:-剔除`age`字段中小于18或大于80的异常值;-将`income`字段的缺失值填充为所在地区(`region`)的收入中位数;-将`gender`字段中的“男/女”统一为“M/F”(5分)。(2)基于清洗后的数据,使用Scikit-learn构建逻辑回归模型预测用户流失(`churn`),要求:-选择`age`、`income`、`purchase_freq`作为特征;-按7:3划分训练集与测试集(随机种子=42);-输出模型的准确率、精确率(查准率)、召回率(查全率)(8分)。(3)使用Matplotlib绘制`purchase_freq`与`churn`的箱线图,直观展示不同购买频次用户的流失差异(7分)。三、业务分析题(共20分)某央企能源板块下属省级公司面临“用户电费欠费率上升”问题(2024年Q3欠费率8.2%,较Q2上升2.1个百分点)。公司数据团队已收集以下数据:-用户基本信息:年龄、性别、用电类型(居民/商业/工业)、所在区域(城市/农村);-用电行为:月均用电量、电费缴纳方式(线上/线下)、历史欠费次数;-外部数据:区域经济指数(反映收入水平)、当月天气(高温/低温天数)。要求:(1)从数据角度,你认为需要优先验证哪些假设来定位欠费率上升的原因?请列出至少3个假设,并说明验证方法(10分)。(2)基于分析结果,提出至少3条可落地的业务优化建议(10分)。四、综合应用题(共10分)某央企计划构建集团级“采购供应链大数据分析平台”,目标是通过分析供应商履约率、采购成本、库存周转等指标,优化采购策略并降低供应链风险。作为数据分析师,需主导该平台的需求调研与分析方案设计。要求:(1)列出需求调研阶段需重点访谈的3类核心用户,并说明访谈的关键问题(4分)。(2)设计平台的核心分析场景(至少3个),并说明每个场景所需的关键指标及数据来源(6分)。---参考答案---一、基础理论题1.选择题答案及解析:(1)C(Spark属于独立计算框架,非Hadoop原生生态);(2)C(数据仓库面向分析,支持复杂查询;数据库面向事务,支持高并发增删改);(3)B(一致性强调跨系统、跨时间的数据统一);(4)B(Flink是专为流数据处理设计的框架);(5)B(过拟合表现为模型对训练数据过度学习,泛化能力差)。2.简答题答案:(1)核心差异:数据湖存储原始、多格式数据(如结构化、非结构化),支持灵活分析;数据仓库存储结构化、清洗后的数据,面向固定业务指标。适用场景:数据湖用于探索性分析、AI训练;数据仓库用于报表、固定KPI监控。(2)优化手段:①分区与分桶(Hive),适用于大表查询;②索引(如HBase的RowKey设计),加速随机访问;③并行计算资源调优(YARN资源分配),提升任务效率;④谓词下推(Presto),减少数据传输量;⑤列存储(Parquet),降低I/O消耗。(3)处理方法:①删除缺失行(当缺失比例<5%且无规律);②均值/中位数填充(数值型,如年龄);③众数填充(分类型,如地区);④模型预测填充(如用其他字段训练回归模型预测缺失值)。示例:用户收入缺失时,若业务关注地区差异,应按地区分组填充中位数,避免全局均值掩盖区域特征。(4)关键要求:①数据分级分类(按敏感程度划分,如用户隐私、经营数据);②访问权限控制(最小权限原则,如生产数据仅限授权分析师);③脱敏处理(如身份证号打码、手机号隐藏中间四位);④跨境数据合规(遵守《数据安全法》,重要数据本地存储)。二、技术实操题1.SQL编程答案:(1)```sqlSELECTline_id,(SUM(output)-SUM(defect_num))100.0/SUM(output)ASyield_rateFROMproductionWHEREprod_dateBETWEEN'2024-01-01'AND'2024-12-31'GROUPBYline_idORDERBYyield_rateDESC;```(2)```sqlWITHequipment_ageAS(SELECTeq_id,eq_type,CASEWHEN(2024-YEAR(purchase_date))=0THEN1ELSE(2024-YEAR(purchase_date))ENDASuse_yearsFROMequipment)SELECTe.eq_type,SUM(m.m_cost)1.0/SUM(e.use_years)AScost_per_yearFROMmaintenancemJOINequipment_ageeONm.eq_id=e.eq_idWHEREm_dateBETWEEN'2024-01-01'AND'2024-12-31'GROUPBYe.eq_typeORDERBYcost_per_yearDESCLIMIT3;```(3)```sqlWITHmonthly_defectAS(SELECTDATE_FORMAT(prod_date,'%Y-%m')ASmonth,SUM(defect_num)AStotal_defectFROMproductionWHEREline_id='L001'ANDprod_dateBETWEEN'2024-01-01'AND'2024-12-31'GROUPBYDATE_FORMAT(prod_date,'%Y-%m'))SELECTmonth,total_defectASmonthly_defect,(total_defect-LAG(total_defect)OVER(ORDERBYmonth))100.0/LAG(total_defect)OVER(ORDERBYmonth)ASmom_growthFROMmonthly_defect;```2.Python编程答案:(1)数据清洗代码:```pythonimportpandasaspd读取数据df=pd.read_csv('customer_data.csv')剔除age异常值df=df[(df['age']>=18)&(df['age']<=80)]按region填充income缺失值df['income']=df.groupby('region')['income'].transform(lambdax:x.fillna(x.median()))统一gender字段df['gender']=df['gender'].map({'男':'M','女':'F'})```(2)模型构建与评估代码:```pythonfromsklearn.model_selectionimporttrain_test_splitfromsklearn.linear_modelimportLogisticRegressionfromsklearn.metricsimportaccuracy_score,precision_score,recall_score特征与标签X=df[['age','income','purchase_freq']]y=df['churn']划分数据集X_train,X_test,y_train,y_test=train_test_split(X,y,test_size=0.3,random_state=42)模型训练model=LogisticRegression()model.fit(X_train,y_train)预测与评估y_pred=model.predict(X_test)print(f"准确率:{accuracy_score(y_test,y_pred):.2f}")print(f"精确率:{precision_score(y_test,y_pred):.2f}")print(f"召回率:{recall_score(y_test,y_pred):.2f}")```(3)箱线图绘制代码:```pythonimportmatplotlib.pyplotaspltplt.figure(figsize=(10,6))df.boxplot(column='purchase_freq',by='churn',showfliers=False)plt.title('PurchaseFrequencybyChurnStatus')plt.xlabel('Churn(0=Retained,1=Churned)')plt.ylabel('MonthlyPurchaseFrequency')plt.show()```三、业务分析题(1)需验证的假设及验证方法:①假设“农村地区用户欠费率上升”:按区域分组计算欠费率,对比Q2与Q3农村/城市的差异,使用卡方检验验证显著性。②假设“线上缴费用户因系统故障导致欠费”:统计Q3线上缴费失败次数,分析失败率与欠费用户的关联(如相关系数)。③假设“高温天气导致工业用户用电量激增,缴费压力大”:按用电类型分组,计算工业用户月均用电量与欠费的相关性,结合高温天数做回归分析。(2)业务优化建
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 2026年11月06日 贵港市港北区测评中心 伊士曼 化工助剂研发 10人
- 江苏连云港市2025-2026学年第一学期期末考试高一化学试题(含答案)
- 贵州省黔南布依族苗族自治州2025-2026学年六年级下学期期末检测科学试卷(有答案)
- 甘肃临洮第三中学2025-2026学年高一上学期1月期末考试化学试题(含答案)
- 2026教师气象灾害预警与应对课件
- 2026高三年级教导主任工作经验分享课件-学困生帮扶的智慧
- 2026新学期小学低年级骨干班主任经验交流课件:家校携手共育未来
- 2026新学期三高人群老人秋冬防病保健专题培训课件
- 2025-2026年陕西省人教版七年级物理第5课力学综合练习题
- 黄色人工膝关节表面置换术护理查房
- 出生医学证明警示教育培训
- 困困困不醒大王原创课件
- (已压缩)(11)义务教育物理课程标准日常修订版(2022年版2025年修订)
- 2025年上海交通大学招聘真题(行政管理岗)
- Q-SY 13034-2024 物料主数据数字化描述规范
- 2025年法考主观题真题答案及解析
- 淝水之战课件
- 校园贷款案例讲解
- 《习作:-让生活更美好》教学课件
- 护士人文修养(第4版)课件 第四章 护士的美学修养
- 多源固废基尾砂胶结充填体损伤特性与劣化机理研究
评论
0/150
提交评论