DS数据科学基础测试题(含详细答案)_第1页
DS数据科学基础测试题(含详细答案)_第2页
DS数据科学基础测试题(含详细答案)_第3页
DS数据科学基础测试题(含详细答案)_第4页
DS数据科学基础测试题(含详细答案)_第5页
已阅读5页,还剩1页未读, 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

DS数据科学基础测试题(含详细答案)本次测试题适用于数据科学入门考核,涵盖统计学基础、数据处理、数据分析、机器学习基础、业务落地思维等核心内容,题型包含选择题、填空题、简答题、计算题,总分100分,答题时间90分钟。题目贴合实际工作场景,侧重实操与理解,无偏题、怪题。一、单项选择题(共10题,每题3分,共30分)1.下列指标中,最能反映一组数据离散程度的是()A.均值B.中位数C.方差D.众数2.在数据清洗过程中,对于连续型数值的异常值,最常用且稳健的处理方式是()A.直接删除所有异常值B.均值填充C.四分位数截断处理D.随机填充3.相关性分析中,皮尔逊相关系数r=-0.92,说明两个变量的关系是()A.高度正相关B.高度负相关C.微弱负相关D.无相关性4.以下不属于无监督学习算法的是()A.K-MeansB.层次聚类C.逻辑回归D.DBSCAN5.针对分类模型,精准率(Precision)的核心含义是()A.所有正样本中被预测正确的比例B.预测为正的样本中真实为正的比例C.所有样本预测正确的比例D.负样本被预测正确的比例6.数据分析中,用于判断两组数据是否存在显著差异的常用检验方法是()A.正态性检验B.T检验C.卡方检验D.单位根检验7.下列关于缺失值的说法,错误的是()A.缺失值分为随机缺失、非随机缺失、完全随机缺失B.高缺失率的特征可直接删除,减少数据干扰C.分类数据缺失只能用众数填充,无其他处理方式D.部分场景下,缺失本身可作为有效特征8.决策树模型中,用于衡量节点纯度的指标是()A.学习率B.基尼系数C.正则化系数D.梯度值9.时间序列数据中,不属于数据核心组成成分的是()A.趋势成分B.季节成分C.随机扰动成分D.归一化成分10.下列场景中,适合使用回归分析的是()A.将用户分为高、中、低价值群体B.预测未来月度销售额数值C.判断用户是否流失D.识别数据异常样本二、填空题(共5题,每题2分,共10分)1.数据分布不对称、存在极端极值时,________比均值更能代表数据的整体水平。2.机器学习中,模型在训练集表现优异、在测试集表现极差的现象称为________。3.卡方检验主要用于分析________类型数据之间的关联性。4.特征缩放的两种常用方法是归一化和________。5.A/B测试的核心目的是通过________数据对比,验证策略优化的有效性。三、简答题(共4题,每题8分,共32分)1.简述数据分析中,均值、中位数、众数的适用场景区别。2.简述过拟合产生的常见原因,以及对应的解决办法。3.精准率和召回率在业务场景中如何取舍?请举例说明。4.简述K-Means聚类算法的核心步骤,以及算法的优缺点。四、计算题(共2题,每题14分,共28分)1.现有一组用户消费数据:[120,150,90,200,130,150,80,150],请计算该组数据的均值、中位数、众数。2.某二分类模型测试结果:真正例TP=85,假正例FP=15,真负例TN=90,假负例FN=10。请计算模型的精准率、召回率、准确率。参考答案(详细解析)一、单项选择题答案及解析1.答案:C解析:均值、中位数、众数均为描述数据集中趋势的指标,方差、标准差、极差用于反映数据离散、波动程度。2.答案:C解析:直接删除异常值会丢失有效数据,均值填充易受极值干扰,随机填充无数据依据;四分位数(IQR)截断是业界通用的稳健异常值处理方式,可保留合理数据、剔除极端干扰值。3.答案:B解析:皮尔逊相关系数取值范围为[-1,1],绝对值越接近1相关性越强;负数代表负相关,正数代表正相关,-0.92属于高度负相关。4.答案:C解析:逻辑回归是经典的有监督二分类算法,需要标注训练数据;K-Means、层次聚类、DBSCAN均为无监督聚类算法,无需数据标注。5.答案:B解析:精准率=TP/(TP+FP),含义是模型预测为正的所有样本中,真实标签确实为正的样本占比;A选项为召回率定义,C选项为准确率定义。6.答案:B解析:T检验用于两组连续型数据的均值差异显著性检验;卡方检验用于分类数据关联性检验,正态性检验用于判断数据分布类型,单位根检验用于时间序列平稳性检验。7.答案:C解析:分类数据缺失值除众数填充外,还可采用新增缺失类别、模型预测填充、条件填充等方式,并非只有众数填充一种方法。8.答案:B解析:决策树通过基尼系数、信息熵、信息增益衡量节点纯度,数值越小代表节点数据纯度越高,分类效果越好。9.答案:D解析:时间序列核心成分为趋势、季节、随机扰动、周期成分,归一化是数据预处理手段,不属于时间序列固有成分。10.答案:B解析:回归分析用于预测连续型数值,预测销售额属于数值预测;用户分群用聚类、流失判断用分类、异常识别用异常检测算法。二、填空题答案及解析1.中位数解析:中位数不受极端极值影响,偏态分布数据中比均值更具代表性。2.过拟合解析:过拟合指模型过度学习训练集噪声数据,泛化能力差,训练集精度高、测试集精度低。3.分类(离散)解析:卡方检验适配性别、品类、渠道等离散分类变量的关联性、独立性检验。4.标准化解析:归一化将数据缩至[0,1]区间,标准化将数据转化为均值为0、方差为1的标准分布,是两大核心特征缩放方式。5.对照实验解析:A/B测试通过设置实验组和对照组,控制单一变量,对比数据差异验证优化效果。三、简答题详细答案1.均值、中位数、众数适用场景区别①均值:适用于数据分布均匀、无极端极值的正态分布数据,能够充分利用所有数据信息,精准反映整体平均水平,比如正常场景下的用户日均访问时长、商品平均售价。②中位数:适用于数据存在极端极值、分布偏态的场景,不受最大值、最小值干扰,能客观反映中间水平,比如居民收入、用户消费金额(少数高消费用户会拉高均值,中位数更贴合大众水平)。③众数:适用于分类数据或离散数据,用于反映数据中出现频率最高的数值/类别,比如用户最偏好的商品品类、最常用的支付方式。2.过拟合的原因及解决办法常见原因:一是训练样本数量过少,数据量不足以支撑模型学习通用规律;二是模型复杂度过高,远超数据本身的复杂度;三是训练数据存在大量噪声、错误样本;四是训练轮次过多,模型过度拟合训练集细节。解决办法:①增加高质量训练数据,扩充样本量;②降低模型复杂度,简化模型结构;③加入正则化约束(L1、L2正则),抑制参数过拟合;④提前终止训练,避免过度迭代;⑤采用交叉验证,筛选最优模型参数。3.精准率和召回率的业务取舍逻辑精准率侧重「预测正确的样本占比」,追求预测结果尽可能准确,减少误判;召回率侧重「尽可能找出所有正样本」,减少漏判,二者此消彼长。①优先选精准率:适用于误判成本极高的场景。例如金融风控欺诈识别,误将正常用户判定为欺诈(FP),会影响用户体验、造成投诉,因此需要保证预测为欺诈的用户一定是高风险用户,优先提升精准率。②优先选召回率:适用于漏判成本极高的场景。例如用户流失预警、故障检测,漏判流失用户(FN)会导致错失挽回机会,设备故障漏判会造成损失,因此需要尽可能找出所有潜在正样本,优先提升召回率。4.K-Means聚类核心步骤及优缺点核心步骤:①人为设定聚类数量K;②随机选取K个样本作为初始聚类中心;③计算所有样本到各个聚类中心的距离,将样本划分至距离最近的簇;④重新计算每个簇的均值,更新聚类中心;⑤重复迭代三四步骤,直至聚类中心不再变化或达到最大迭代次数,聚类结束。优点:算法逻辑简单、运算速度快、时间复杂度低,适配大规模数据集,聚类效果直观易懂。缺点:需要人工指定K值,K值选择不当会严重影响结果;对初始聚类中心敏感,不同初始值可能得到不同聚类结果;对异常值、噪声数据敏感,仅适用于球状分布的数据,无法适配非球状、不规则分布数据。四、计算题详细答案1.消费数据统计计算原始数据:[120,150,90,200,130,150,80,150]排序后数据:[80,90,120,130,150,150,150,200]①均值:总和÷样本数量=(80+90+120+130+150+150+150+200)÷8=1070÷8=133.75②中位数:样本数为偶数,取中间两个数平均值=(130+150)÷2=140③众数:出现次数最多的数值,150出现3次,为最高频次,众数为1502.模型指标计算已知:TP=85,FP=15,TN=90,FN=10①精准率Precision=TP/(TP+FP)=85/(85+15)=85/100=85%②召回率Recall=TP/(TP+FN)=85/(85+10)=85/95≈89.47%③准确率Accuracy=(TP+TN)/(TP+FP+TN+FN)=(85+90)/(85+15+

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论