版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
2026年数据分析能力培训考核试卷及答案1.单选题(每题2分,共20分)1.1在Pythonpandas中,下列代码执行后df.shape的结果是importpandasaspddf=pd.DataFrame({'A':[1,2,3],'B':[4,5,6]})df=df.assign(C=df.A+df.B).drop(columns='A')A.(3,2)B.(3,3)C.(2,3)D.(2,2)答案:A1.2对一组右偏的连续变量做对数变换,主要目的是A.降低维度 B.减小偏度 C.提高峰度 D.增加方差答案:B1.3在SQL中,计算每个用户近7日活跃天数的最佳窗口函数写法是A.COUNT()OVER(PARTITIONBYuser_idORDERBYdtRANGEBETWEEN6PRECEDINGANDCURRENTROW)A.COUNT()OVER(PARTITIONBYuser_idORDERBYdtRANGEBETWEEN6PRECEDINGANDCURRENTROW)B.SUM(1)OVER(PARTITIONBYuser_idORDERBYdtROWS6PRECEDING)C.COUNT(dt)OVER(PARTITIONBYuser_idORDERBYdtROWSBETWEEN6PRECEDINGANDCURRENTROW)D.DENSE_RANK()OVER(PARTITIONBYuser_idORDERBYdtDESC)答案:C1.4使用主成分分析(PCA)时,第一主成分的方差贡献率等于A.第一特征值/特征值总和 B.第一特征向量模长 C.第一特征值/样本量 D.第一特征值/p答案:A1.5在A/B测试中,若检验指标为二分类转化率,样本量足够大,应采用的显著性检验方法是A.独立样本t检验 B.配对t检验 C.卡方检验 D.Mann-WhitneyU检验答案:C1.6XGBoost的目标函数obj=∑l(yi,ŷi)+∑Ω(fk)中Ω(fk)表示A.训练样本权重 B.树复杂度正则项 C.学习率 D.叶子权重之和答案:B1.7在时间序列分解模型Yt=Tt+St+Rt中,St是指A.趋势分量 B.季节分量 C.随机分量 D.周期分量答案:B1.8下列关于过拟合的说法正确的是A.训练误差低且测试误差高 B.训练误差高且测试误差低 C.训练误差与测试误差都高 D.训练误差与测试误差相等答案:A1.9在聚类评估指标中,取值范围在[−1,1]且越接近1越好的是A.SSE B.Silhouette系数 C.Calinski-Harabasz指数 D.Davies-Bouldin指数答案:B1.10在PowerBI中,建立星型模型时,事实表与维度表之间的连接应采用A.一对多,维度表主键→事实表外键 B.多对多 C.一对一 D.事实表主键→维度表外键答案:A2.多选题(每题3分,共15分;每题至少有两个正确答案,多选少选均不得分)2.1下列属于特征缩放方法的有A.Min-Max标准化 B.Z-score标准化 C.对数变换 D.Robust标准化 E.One-Hot编码答案:ABD2.2关于随机森林,下列说法正确的有A.可输出特征重要度 B.对异常值敏感 C.可并行训练 D.必使用深度为1的决策树 E.可处理缺失值答案:ACE2.3在SQL优化中,能够减少全表扫描的手段包括A.在WHERE列上建立索引 B.使用SELECT C.避免对索引列使用函数 D.使用LIMIT1 E.使用JOIN代替子查询A.在WHERE列上建立索引 B.使用SELECT C.避免对索引列使用函数 D.使用LIMIT1 E.使用JOIN代替子查询答案:ACDE2.4下列指标可用于回归模型评估的有A.MAE B.MSE C.AUC D.R² E.F1-score答案:ABD2.5在Python中,关于pandas.merge说法正确的有A.on参数缺失时默认按同名列连接 B.how='outer'保留左右表所有键 C.suffixes可自定义重名列后缀 D.只能连接两个表 E.支持按索引连接答案:ABCE3.填空题(每空2分,共20分)3.1在numpy中,生成形状为(100,5)且服从标准正态分布的随机数组的代码是________。答案:np.random.randn(100,5)3.2若线性回归模型y=β0+β1x的残差平方和SSE=36,总平方和SST=100,则R²=________。答案:0.643.3在SQL里,将字符串日期'2026-03-01'转为日期型的函数是________(MySQL语法)。答案:STR_TO_DATE('2026-03-01','%Y-%m-%d')3.4在Python中,使用seaborn绘制两变量联合分布图并带核密度估计的函数是________。答案:sns.jointplot3.5在sklearn中,使用Pipeline顺序执行标准化和逻辑回归的类是________。答案:Pipeline3.6在时间序列里,若观测序列为月度数据且季节周期为12,则SARIMA(p,d,q)(P,D,Q)s模型中s=________。答案:123.7在Excel中,计算一列数据A1:A100的第90百分位数的函数公式为________。答案:=PERCENTILE.INC(A1:A100,0.9)3.8在Tableau中,将度量转为维度可直接拖入________面板。答案:维度(Dimensions)3.9在Pythonpandas中,将category类型列按指定顺序['低','中','高']排序的方法名是________。答案:cat.reorder_categories3.10在统计学中,当样本量n→∞时,t分布趋近于________分布。答案:标准正态4.判断题(每题1分,共10分;正确打“√”,错误打“×”)4.1在k-means算法中,初始质心的选择对最终聚类结果无影响。 ×4.2当特征之间存在完全多重共线性时,线性回归的OLS估计无法得到唯一解。 √4.3在LightGBM中,leaf-wise的生长策略比level-wise更容易过拟合。 √4.4使用PCA降维后,原始特征的可解释性一定提高。 ×4.5在Excel中,数据透视表不支持将同一字段同时拖入行和列区域。 ×4.6若两变量相关系数为0,则它们一定独立。 ×4.7在Python中,DataFrame的apply方法默认按列轴操作。 √4.8在A/B测试的多重比较问题中,Bonferroni校正会降低Ⅰ类错误率但增加Ⅱ类错误率。 √4.9在SQL中,UNION会自动去重而UNIONALL不会。 √4.10在Prophet模型中,节假日效应通过indicator变量方式加入回归。 √5.简答题(封闭型,每题6分,共18分)5.1简述梯度提升树(GBDT)与随机森林在样本采样与模型集成方式上的两点主要区别。答案:1)样本采样:GBDT每轮使用全量样本训练新树以拟合残差;随机森林对每棵树自助采样(bootstrap)形成不同训练集。2)集成方式:GBDT采用Boosting串行加权累加,每棵树依赖前一轮结果;随机森林采用Bagging并行投票或平均,树之间独立。5.2写出在SQL中计算用户次日留存率的完整查询逻辑,要求给出字段含义。答案:SELECTdt,COUNT(DISTINCTb.user_id)1.0/COUNT(DISTINCTa.user_id)ASretention_2dCOUNT(DISTINCTb.user_id)1.0/COUNT(DISTINCTa.user_id)ASretention_2dFROM(SELECTDISTINCTuser_id,dtFROMlogin_log)aLEFTJOIN(SELECTDISTINCTuser_id,dtFROMlogin_log)bONa.user_id=b.user_idANDb.dt=DATE_ADD(a.dt,INTERVAL1DAY)GROUPBYa.dt;5.3说明L1正则与L2正则在特征选择中的作用差异。答案:L1正则通过几何性质(菱形约束)使部分系数精确压缩至0,实现自动特征选择;L2正则使系数整体缩小但不为0,对共线性稳健但不具备稀疏性。6.简答题(开放型,每题8分,共16分)6.1某电商APP发现近30日DAU连续下降,请给出数据分析思路与可能验证方向。答案:1)明确指标口径:DAU定义、去重规则、上报时机。2)拆分维度:渠道、版本、地域、设备、新老用户、活跃时段。3)时间序列分解:观察季节性与趋势,排除节假日因素。4)用户分层:计算新安装、回流、核心活跃、流失占比变化。5)竞品与外部:应用商店评论、竞品活动、舆论事件、疫情/天气。6)产品侧:核心路径转化率、崩溃率、关键接口耗时、推荐算法变更。7)数据质量:埋点丢失、上报延迟、口径变更。8)建立假设→数据验证→A/B测试或问卷→输出结论与修复方案。6.2请阐述在机器学习项目中“数据泄露”常见场景及预防措施。答案:常见场景:1)用未来信息预测过去,如训练集包含预测时刻之后变量。2)先整体标准化再划分训练测试集,导致统计量泄露。3)特征选择时基于全集计算重要度。4)交叉验证外泄露:用全量数据选模型再CV。5)目标衍生特征与标签高度相关。预防措施:1)严格按时序划分训练/验证/测试。2)管道(Pipeline)内仅对训练集计算变换参数。3)特征工程在每一折CV内独立进行。4)建立时间窗口,确保特征生成仅依赖历史。5)代码审查与单元测试,引入“时间旅行”检测脚本。7.应用题(计算类,共20分)7.1某短视频平台随机抽取10000条视频,记录播放量(x,万次)与点赞量(y,万次),得到:∑xi=12000,∑yi=600,∑xi²=30000,∑yi²=120,∑xiyi=1500。(1)求线性回归方程y=β0+β1x的系数。(6分)(2)计算决定系数R²。(4分)答案:n=10000,x̄=1.2,ȳ=0.06Sxx=∑xi²-nx̄²=30000-10000×1.2²=15600Sxy=∑xiyi-nx̄ȳ=1500-10000×1.2×0.06=780β1=Sxy/Sxx=780/15600=0.05β0=ȳ-β1x̄=0.06-0.05×1.2=0回归方程:ŷ=0.05xSST=∑yi²-nȳ²=120-10000×0.06²=84SSR=β1Sxy=0.05×780=39R²=SSR/SST=39/84≈0.4647.2根据7.1结果,若某视频预测播放量x=10万次,给出点赞量95%置信区间(已知残差标准误差σ̂=0.08)。(4分)答案:ŷ=0.05×10=0.5标准误差SE=σ̂√(1+1/n+(x-x̄)²/Sxx)=0.08√(1+0.0001+(10-1.2)²/15600)≈0.0803t0.975,∞≈1.96,CI:0.5±1.96×0.0803→(0.343,0.657)万次7.3若平台希望点赞率(点赞量/播放量)均值提升10%,通过A/B测试检验,已知对照组点赞率p0=0.06,要求检验效能1-β=0.8,α=0.05,双侧检验,求每组所需最小样本量。(6分)答案:p1=0.06×1.1=0.066,Δ=0.006合并率p̄=(0.06+0.066)/2=0.063Z1-α/2=1.96,Z1-β=0.84n=[(1.96+0.84)²×2×0.063×(1-0.063)]/0.006²≈[7.84×0.118]/0.000036≈25700每组至少25700条视频。8.应用题(分析类,共15分)8.某O2O外卖平台提供“超级会员”月卡,为评估会员上线对非会员用户客单价的影响,采用双重差分法(DID)。数据包含城市、月份、是否会员城市、是否上线后、平均客单价。(1)给出DID模型设定与变量说明。(5分)答案:Yit=α+β1Treati+β2Postt+β3(Treati×Postt)+εitYit:城市i在t月平均客单价Treati:1=会员城市,0=非会员城市Postt:1=上线后月份,0=上线前月份β3为DID估计量,衡量会员上线对非会员客单价净影响。(2)写出检验平行趋势假设的可视化与统计方法。(4分)答案:可视化:绘制Treat组与Control组上线前各月Yit均值趋势图,观察是否重合。统计:在模型中加入Treat×月份虚拟变量,检验上线前交互项联合显著性,F检验p>0.05则支持平行趋势。(3)若β3=−2.3元,p<0.01,给出业务解释与后续建议。(6分)答案:会员上线导致非会员客单价下降2.3元,可能因补贴倾斜、流量转移。建议:1)细分品类,观察下降是否集中在高毛利商品。2)调整会员优惠力度,避免过度挤占非会员预算。3)对非会员推出轻度优惠,提高留存。4)监控长期趋势,评估品牌忠诚度变化。9.综合题(编程+报告,共26分)9.使用Python完成以下任务并给出关键输出与解读。数据:airbnb.csv,字段id、price、bedrooms、neighbourhood、reviews、availability_365、last_review。任务:(1)清洗:去除缺失last_review的行,price>0且≤1000,获得有效样本量。(2分)(2)特征工程:计算每条房源年均评论数=reviews/(2026-last_review年份),生成新字段avg_review。(3分)(3)建模:以price为目标,bedrooms、neighbourhood、availability_365、avg_review为特征,采用随机森林回归,GridSearchCV调参(max_depth,n_estimators),评估指标RMSE。(8分)(4)可视化:绘制特征重要度水平条形图。(3分)(5)报告:写出模型表现、重要度前三特征的业务含义及优化建议。(10分)答案:关键代码:importpandasaspd,numpyasnpfromsklearn.ensembleimportRandomForestRegressorfromsklearn.model_selectionimportGridSearchCV,train_test_splitfromsklearn.metricsimportmean_squared_errorimportmatplotlib.pyplotaspltdf=pd.read_csv('airbnb.csv')df=df.dropna(subset=['last_review'])df=df[(df.price>0)&(df.price<=1000)]print('N=',len(df))#输出:N=45600df['last_year']=pd.to_datetime(df.last_review).dt.yeardf['avg_review']=df.reviews/(2026-df.last_year)X=df[['bedrooms','availability_365','avg_review']]X=pd.concat([X,pd.get_dummies(df.neighbourhood)],axis=1)y=df.priceX_train,X_test,y_train,y_test=train_test_split(X,y,test_siz
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 2025年湖北省襄阳市法检系统书记员招聘笔试试题及答案详解
- 2026云南昆明市第一人民医院住院医师规范化培训招收59人笔试模拟试题及答案详解
- 2025年通辽市科尔沁区法检系统书记员招聘笔试试题及答案详解
- 2025年张家口市下花园区法检系统书记员招聘笔试试题及答案详解
- 2025年涪陵区法检系统书记员招聘笔试试题及答案详解
- 2026重庆交通大学合同工招聘考试参考题库及答案详解
- 2026单招面试题库基础常识及答案
- 叉车停放位置锁定及防溜车管理工作手册
- 高架道路设施巡检工作手册
- 废水处理与固废处置技术手册
- GB/T 47661-2026温室气体产品碳足迹量化方法与要求风力发电
- 2026贵州农商联合银行第二批社会招聘11人笔试参考题库及答案详解
- 2026年新疆银行人员招聘笔试参考题库及答案详解
- 2026年联通考试试题及答案
- 2026年湖北公开遴选公务员考试(综合管理类)综合试题及答案
- 2026年专业技术人员继续教育公需科目人工智能及应用试题及答案
- 江苏徐州市交通控股集团招聘笔试题库2026
- 2025年株洲市荷塘区事业单位招聘笔试试题及答案解析
- 2026春每日一练小纸条数学人教版小升初
- 武汉理工大学新生数学入学测试真题
- 2026年养生食疗教程课件
评论
0/150
提交评论