DS数据科学家面试真题及详细答案(职场实战版)-1_第1页
DS数据科学家面试真题及详细答案(职场实战版)-1_第2页
DS数据科学家面试真题及详细答案(职场实战版)-1_第3页
DS数据科学家面试真题及详细答案(职场实战版)-1_第4页
DS数据科学家面试真题及详细答案(职场实战版)-1_第5页
已阅读5页,还剩2页未读, 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

DS数据科学家面试真题及详细答案(职场实战版)本套面试题适配企业初级、中级数据科学家岗位,筛选互联网、金融、电商高频真题,答案贴合实际工作场景,拒绝理论套话,适配面试口述、笔试作答场景。一、统计学基础(高频必问)1、简述均值、中位数、众数的区别,以及各自适用场景三者都是用来描述数据集中趋势的指标,核心区别是抗干扰能力和适用数据类型不同。均值是所有数据的平均值,利用了全部数据信息,计算简单,但缺点是极易受极端异常值影响。比如统计员工薪资,少数高薪管理层会拉高整体均值,无法反映普通员工真实薪资水平。它只适用于数值型、分布相对均匀的数据。中位数是数据排序后中间位置的数值,完全不受极端值影响,抗干扰性极强。适合偏态分布、存在异常值的数据,比如薪资、房价、用户消费数据这类长尾数据,用中位数能真实反映整体水平。众数是数据中出现频次最高的数值,不唯一,也可能没有。它不依赖数值大小,只看出现频率,既可以用于数值型数据,也可以用于分类数据。比如统计用户最常用的支付方式、商品热销规格,用众数最合适。2、什么是正态分布?工作中哪些数据符合正态分布?正态分布是一种对称的连续概率分布,形态是中间高、两边低的钟形曲线,核心特点是均值、中位数、众数三者重合,数据大多集中在均值附近,向两端逐渐减少。工作中很多自然、稳定的指标都符合正态分布,比如用户单次使用时长、普通用户的页面浏览量、产品常规误差值、用户年龄分布、订单履约时长等。而像销售额、用户充值、广告点击量这类数据,大多是长尾分布,不符合正态分布。3、P值的含义是什么?如何正确理解显著性差异?P值是假设检验的核心指标,通俗来说,就是“原假设成立的前提下,出现当前数据结果或更极端结果的概率”。行业通用标准是以0.05为临界值。当P<0.05,代表结果具有统计学显著性,说明两组数据的差异大概率不是随机波动导致的,是真实存在的差异;当P>0.05,代表无显著差异,观测到的差异大概率是数据随机误差、波动造成的。需要注意的是,P值只代表差异的可信度,不代表差异的大小。哪怕差异幅度很小,样本量足够大时,P值也会显著,所以工作中不能只看P值,还要结合业务幅度判断结果是否有价值。4、方差和标准差的区别与适用场景方差是各数据与均值差值平方的平均值,标准差是方差的平方根,二者都是衡量数据离散程度的指标。方差的单位是原数据的平方,无法和原始数据直观对比,主要用于数据运算、模型计算、方差分析等底层统计计算场景;标准差单位和原始数据一致,可读性更强,工作中主要用来直观判断数据波动大小。比如分析用户活跃度稳定性,用标准差可以直接看出用户数据的波动幅度,判断指标是否稳定;在做特征筛选、统计建模时,会用方差进行数据计算和校验。二、数据分析与业务思维(核心考察)1、拿到一个业务指标下跌,你的分析流程是什么?我会按照「定问题、拆维度、找原因、验结论、给方案」的标准化流程分析,全程结合业务场景,不做纯数据拆解。第一,确认数据真实性。先校验数据口径、统计逻辑、埋点是否异常、是否有数据延迟、统计规则变更,排除数据错误导致的假下跌。第二,明确下跌特征。看是短期突发下跌还是持续下跌,是全时段下跌还是某时段下跌,区分波动和真实业务问题。第三,多维度拆解定位问题。维度包括用户维度(新用户/老用户、不同渠道、不同年龄段)、产品维度(不同功能、页面、模块)、时间维度(日/时段/周度)、地域维度,快速锁定下跌核心区间。第四,归因分析。区分外部原因(行业淡季、竞品活动、政策影响)和内部原因(产品迭代、活动下线、运营策略调整、服务器故障),结合同期数据、历史数据对比验证。第五,落地结论和优化方案。明确核心原因,输出可落地的优化建议,同时跟进后续数据复盘,验证优化效果。2、如何区分指标波动是正常波动还是真实业务问题?日常业务指标都会存在随机波动,不能看到涨跌就判定为业务问题,我主要通过三种方式判断。第一,对比历史数据。看当前指标波动幅度是否在日常波动区间内,结合近7天、近30天的均值、标准差,判断是否超出正常波动范围。第二,做显著性检验。通过假设检验判断当前波动是否为随机误差导致,排除偶然情况。第三,结合业务场景辅助判断。如果波动伴随产品迭代、运营活动、渠道调整,基本可以判定是业务变动导致;如果无任何业务动作,小幅涨跌属于正常波动,大幅异常则需要排查问题。3、什么是辛普森悖论?工作中如何规避?辛普森悖论就是分组统计数据和整体统计数据结论完全相反的现象,核心原因是分组样本权重不均、样本分布不均衡。举个工作常见例子:某产品新老用户整体转化率提升,但拆分新、老用户单独看,两组转化率都在下跌,原因是低转化的新用户占比大幅提升,拉高了整体样本基数,造成整体数据假象。规避方式很简单,做数据分析时,不能只看整体指标,必须结合核心维度拆分看,优先保证样本分层均匀,重点关注高权重、高影响的用户群体,避免被整体平均数据误导决策。4、相关性和因果性的区别?工作中如何避免误判?相关性只是两个指标的变化趋势一致,同涨同跌,仅代表数据层面的关联,不代表互相影响;因果性是一个指标的变化直接导致另一个指标变化,存在明确的逻辑驱动关系。很多数据看似相关,实际无任何因果关系,比如冰淇淋销量和溺水人数同步上涨,只是因为夏季高温这个隐藏变量影响,二者本身无关联。工作中避免误判的核心:不仅凭数据相关性下结论,必须结合业务逻辑、场景、时间先后顺序判断,同时通过对照组、AB实验、拆分维度验证,排除隐藏变量干扰,确认真实因果关系。三、SQL高频面试题(实操必考)1、说说窗口函数的作用,常用窗口函数有哪些?窗口函数是数据分析核心函数,相比于普通聚合函数,它可以在不合并多行数据为一行的前提下,实现分组统计计算,保留原始数据明细,同时输出统计结果,是做排名、分层、同比环比、累计统计的核心工具。常用的分为两类:第一类是排名类,row_number、rank、dense_rank,其中row_number是连续不重复排名,rank是跳跃排名,dense_rank是连续排名;第二类是统计类,sum、avg、max、min结合over实现分组累计、均值计算,还有lag、lead用于取上下行数据,做同比环比分析。2、leftjoin、innerjoin、rightjoin的区别,以及使用场景innerjoin是内连接,只返回两张表中匹配成功的交集数据,匹配失败的数据会直接过滤,适合需要精准匹配、只保留有效关联数据的场景,比如关联用户表和订单表,查询有订单的用户信息。leftjoin是左连接,以左表为基准,保留左表所有数据,右表匹配不到的字段填充null,是工作中最常用的连接方式。适合需要保留全量主数据,关联辅助数据的场景,比如统计所有用户的下单情况,无订单的用户也要保留记录。rightjoin是右连接,以右表为基准,保留右表全量数据,日常工作中使用极少,基本可以用leftjoin替代。3、如何用SQL实现用户连续登录天数统计?核心思路是分组+日期差值分组。首先对每个用户的登录日期去重,然后按用户ID分组,将登录日期减去排序后的行号,得到一个固定日期差值,连续登录的日期差值会完全一致,最后对该差值分组统计,即可算出每个用户的连续登录天数。这是用户行为分析中非常经典的统计场景,常用于用户活跃度分层、留存分析。四、机器学习基础(DS核心)1、区分过拟合和欠拟合,以及对应的解决办法欠拟合是模型复杂度太低,无法学习数据的核心特征,在训练集和测试集上效果都很差,本质是模型学习不足。解决欠拟合:增加模型复杂度,比如浅层模型换成深层模型、增加特征数量、调整模型学习率、减少正则化强度。过拟合是模型复杂度太高,过度学习了训练集的噪声和随机波动,在训练集效果极好,但在测试集、真实业务数据上效果很差,泛化能力弱。解决过拟合:最常用的是增加训练样本数据、加入正则化(L1、L2正则)、提前停止训练、做特征筛选剔除无效噪声特征、使用集成模型降低单模型噪声影响。2、L1和L2正则的区别,各自作用是什么?L1正则是绝对值惩罚,核心作用是特征稀疏化,可以让部分特征权重直接变为0,自动剔除无效特征,相当于自带特征筛选功能,适合特征维度高、冗余特征多的场景,比如用户行为特征、文本特征。L2正则是平方值惩罚,不会让权重变为0,只会压缩所有特征的权重趋近于0,核心作用是抑制模型过拟合,避免单个特征权重过高,让模型参数更平滑、泛化性更强,是日常建模最常用的正则方式。3、分类任务中,精准率、召回率、F1值的区别和适用场景精准率是模型预测为正样本的数据中,真实正样本的比例,核心衡量预测的准确率,适合误判成本高的场景。比如金融风控预测欺诈用户,宁愿漏判也不要误判正常用户为欺诈,此时优先保证精准率。召回率是所有真实正样本中,被模型成功预测出来的比例,核心衡量找全样本的能力,适合漏判成本高的场景。比如疾病检测、违规内容识别,必须尽可能找出所有异常样本,优先保证召回率。F1值是精准率和召回率的调和平均数,用来综合平衡两个指标,避免单一指标虚高,适合需要兼顾准确率和全覆盖的通用业务场景。4、什么是偏差和方差?对应模型什么问题?偏差是模型预测值和真实值的平均误差,反映模型的拟合能力,偏差大对应欠拟合,模型过于简单,无法捕捉数据规律。方差是模型在不同数据集上预测结果的波动程度,反映模型的稳定性,方差大对应过拟合,模型过度贴合训练数据,换一批数据预测结果就大幅波动,泛化能力差。建模的核心就是权衡偏差和方差,找到最优平衡点,让模型既可以拟合数据规律,又具备良好的泛化能力。五、AB实验与业务建模(进阶高频)1、做AB实验的核心流程是什么?第一,明确实验目标和核心指标,确定需要优化的业务指标,区分核心指标、辅助指标、负向指标,避免只看单一指标。第二,实验设计,确定实验组、对照组,保证两组用户分层、样本分布均匀,规避样本偏差,同时计算所需最小样本量,保证实验结果可信。第三,上线实验,保证实验期间无其他业务干预、无版本迭代、无渠道波动,确保变量唯一。第四,数据观测与统计校验,通过假设检验判断指标差异是否显著,同时观测负向指标,避免核心指标提升但其他指标恶化。第五,实验复盘,总结结论,达标则全量上线,不达标则迭代优化方案。2、AB实验样本量不足会有什么问题?如何解决?样本量不足会导致实验结果不显著,真实的业务差异会被数据随机波动掩盖,容易得出错误的实验结论,出现“实验有效但检测不出来”或者“随机波动误判为实验效果”的问题。解决方式:提前通过显著性水平、预期提升幅度、数据标准差计算最小样本量;适当延长实验周期积累样本;合并同质用户群体扩大样本量;降低实验检测阈值(谨慎使用,需结合业务)。3、实验中出现样本不均、流量倾斜如何处理?首先排查流量分配规则、埋点统计逻辑,确认是系统分配问题还是自然波动。如果是轻微不均,可通过事后分层校正、加权校准数据,修正样本偏差;如果是严重流量倾斜,样本分层差异过大,数据不具备可比性,直接作废本次实验,重新分配流量、重启实验,不基于错误样本做结论。六、实操场景面试题(压轴业务题)1、如何搭建用户留存预测模型?核心流程是什么?首先明确建模目标和标签定义,确定预测场景,比如预测用户7日留存、30日留存,定义留存标签:当日是否活跃、是否复访。然后做特征工程,提取用户基础特征(年龄、渠道、注册时间)、行为特征(访问频次、停留时长、功能使用次数、互动行为)、业务特征(是否下单、是否充值、参与活动次数),并对特征做缺失值填充、异常值处理、归一化、离散化。接着划分训练集、测试集、验证集,选择适配模型,留存预测属于二分类任务,常用逻辑回归、随机森林、XGBoost、LightGBM,兼顾效果和可解释性。模型训练后做参数调优、特征筛选,评估精准率、召回率、AUC值,保证模型泛化能力。最后落地业务,用模型预测低留存用户,针对高危流失用户做精准运营、召回策略,同时线上持续监控模型效果,定期迭代更新。2、模型上线后效果衰减的原因和优化方案核心原因是数据分布偏移,线上用户行为、业务场景、市场环境会持续变化,训练模型的历史数据和线上实时数据分布不一致,导致模型适配性下降。其次是特征失效、业务规则迭代、用户群体更新,都会造成模型效果逐步衰减。优化方案:建立模型监控机制,实时监控AUC、准确率、特征分布变化;定期重新采样

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论