2025年统计学期末考试题库:统计与决策数据挖掘试题_第1页
2025年统计学期末考试题库:统计与决策数据挖掘试题_第2页
2025年统计学期末考试题库:统计与决策数据挖掘试题_第3页
2025年统计学期末考试题库:统计与决策数据挖掘试题_第4页
2025年统计学期末考试题库:统计与决策数据挖掘试题_第5页
已阅读5页,还剩2页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

2025年统计学期末考试题库:统计与决策数据挖掘试题考试时间:______分钟总分:______分姓名:______一、选择题(每题2分,共20分。请将正确选项的代表字母填入括号内)1.下列哪个指标最适合衡量对称分布数据的离散程度?()A.极差B.方差C.标准差D.偏度系数2.在假设检验中,第一类错误是指()。A.犯弃真错误,即原假设为真却拒绝原假设B.犯取伪错误,即原假设为假却未能拒绝原假设C.检验统计量计算错误D.样本量不足3.简单线性回归模型中,解释变量(自变量)和因变量之间的关系被假设为()。A.线性相关B.非线性相关C.独立无关D.因果关系确定4.下列哪种方法不属于聚类算法?()A.K-MeansB.KNNC.层次聚类D.Apriori5.用于衡量分类模型预测准确性的指标是()。A.相关系数B.决策树深度C.准确率(Accuracy)D.相关系数的绝对值6.数据挖掘过程中,数据预处理通常发生在哪个阶段?()A.模型评估B.模型选择C.数据探索D.数据准备7.在进行关联规则挖掘时,为了减少搜索空间,通常采用()算法。A.决策树B.AprioriC.K-MeansD.神经网络8.抽样调查中,样本量的确定主要受哪些因素影响?()A.总体方差B.置信水平C.允许误差D.以上都是9.对于分类问题,如果预测结果为某个类别的概率,常用的模型是()。A.线性回归B.逻辑回归C.K-Means聚类D.主成分分析10.下列哪个不是数据挖掘的常见任务类型?()A.聚类分析B.回归分析C.统计预测D.文本生成二、简答题(每题5分,共20分)1.简述假设检验的基本步骤。2.解释什么是相关系数,并说明其取值范围及含义。3.简述K-Means聚类算法的基本思想和工作流程。4.列举并简要说明三种常用的分类模型。三、计算题(每题8分,共24分)1.已知某班级10名学生的身高(cm)和体重(kg)数据如下:身高:170,165,180,175,160,170,185,160,170,180体重:65,55,75,68,52,60,78,50,62,72计算该班级学生的平均身高和平均体重,并计算身高和体重的样本相关系数。2.假设对一个二元分类问题,某个模型的预测结果如下(P为预测为正类,A为实际为正类,N为实际为负类):|预测|实际||:---:|:---:||P|P||P|N||N|P||N|N||P|N|计算该模型的准确率、精确率、召回率和F1分数。3.设有一个数据集包含三个特征X1,X2,X3,通过主成分分析(PCA)得到两个主成分PC1和PC2,它们的方差贡献率分别为85%和10%,且PC1由X1的50%和X2的70%线性组合而成。请解释这两个主成分的含义,并说明数据降维后的主要信息损失是多少。四、应用题(共16分)假设你是一家电商公司的数据分析师,近期公司关注用户购买行为,希望利用历史订单数据对用户进行分群,以便进行更精准的营销。现有以下数据:用户的性别、年龄段(分为18-25,26-35,36-45,45+)、最近一次购买的产品类别(服装、电子、家居、书籍)、购买频率(低、中、高)、平均客单价。请详细说明你将如何利用聚类分析方法对用户进行分群,包括:1.数据预处理步骤(如何处理类别型变量?如何处理不同量纲的数据?)。2.选择合适的聚类算法,并说明理由。3.确定合适的聚类数目(可以提及一种确定聚类数目的方法)。4.对最终得到的各个用户群体进行简要描述和分析,并提出至少两条针对不同群体的营销建议。试卷答案一、选择题1.C2.A3.A4.B5.C6.D7.B8.D9.B10.D二、简答题1.假设检验的基本步骤:a.提出原假设H0和备择假设H1。b.选择合适的检验统计量,并确定其在H0成立时的分布。c.根据显著性水平α确定拒绝域(临界值或P值临界值)。d.收集样本数据,计算检验统计量的观测值。e.根据观测值与拒绝域的关系或计算P值与α的大小关系,做出拒绝或不拒绝H0的决策。2.相关系数是用来衡量两个变量之间线性相关程度的统计量。其取值范围在-1到1之间。当相关系数为1时,表示两个变量之间存在完美的正线性相关关系;当相关系数为-1时,表示两个变量之间存在完美的负线性相关关系;当相关系数为0时,表示两个变量之间不存在线性相关关系。3.K-Means聚类算法的基本思想是将数据集划分为K个簇,使得簇内数据点到簇中心的距离之和最小。工作流程如下:a.随机选择K个数据点作为初始簇中心。b.将每个数据点分配给距离最近的簇中心,形成K个簇。c.计算每个簇的新中心(簇内所有数据点的均值)。d.重复步骤b和c,直到簇中心不再变化或达到最大迭代次数。4.常用的分类模型有:a.逻辑回归:适用于二分类问题,通过sigmoid函数将线性组合的输出转换为概率值。b.决策树:通过树状结构进行决策,对数据进行分类或回归。c.支持向量机(SVM):寻找一个最优的超平面将不同类别的数据点分开。d.K近邻(KNN):根据样本最近的K个邻居的类别来预测新样本的类别。三、计算题1.平均身高=(170+165+180+175+160+170+185+160+170+180)/10=171.5cm平均体重=(65+55+75+68+52+60+78+50+62+72)/10=63.4kg身高和体重的样本相关系数r=[10*(170*65+165*55+...+180*72)-(171.5*63.4)*10]/sqrt{[10*(170^2+...+180^2)-(171.5*171.5)*10]*[10*(65^2+...+72^2)-(63.4*63.4)*10]}r≈0.8952.准确率=(2+1+1)/(2+1+1+1)=4/5=0.8精确率=(2+1)/(2+1)=3/4=0.75召回率=(2+1)/(2+1)=3/4=0.75F1分数=2*(精确率*召回率)/(精确率+召回率)=2*(0.75*0.75)/(0.75+0.75)=0.753.PC1和PC2是数据降维后的两个主成分。PC1由X1的50%和X2的70%线性组合而成,说明PC1主要反映了X1和X2的综合信息。由于PC1的方差贡献率为85%,说明它包含了数据集中大部分的变异信息。PC2的方差贡献率为10%,说明它包含了少量剩余的变异信息。数据降维后的主要信息损失是10%,即丢失了原始数据中由PC2所代表的那部分变异信息。四、应用题1.数据预处理步骤:a.处理类别型变量:将性别、年龄段、产品类别等类别型变量转换为数值型变量,可以使用独热编码(One-HotEncoding)或标签编码(LabelEncoding)。b.处理不同量纲的数据:由于购买频率和平均客单价可能具有不同的量纲,需要进行标准化或归一化处理,例如使用Z-score标准化或Min-Max归一化,使得所有特征具有相似的尺度。2.选择合适的聚类算法:K-Means聚类算法。理由是K-Means算法简单易实现,计算效率高,适用于较大规模的数据集,并且能够较好地处理数值型数据。3.确定合适的聚类数目:可以使用肘部法则(ElbowMethod)来确定聚类数目。肘部法则是通过计算不同K值下K-Means算法的簇内平方和(Within-ClusterSumofSquares,WCSS),绘制K值与WCSS的关系图,选择拐点(肘部)对应的K值作为最终的聚类数目。4.对最终得到的各个用户群体进行简要描述和分析,并提出至少两条针对不同群体的营销建议:a.年轻群体(如18-25岁):购买频率高,但平均客单价可能较低。营销建议

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论