版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
2026cda数据分析师考试真题及答案一、单项选择题(本大题共20小题,每小题2分,共40分。在每小题列出的四个备选项中只有一个是符合题目要求的,请将其代码填在括号内。)1.在数据分析的流程中,数据清洗通常占据分析师大量的时间。以下关于数据清洗的描述中,错误的是()。A.缺失值处理常用的方法包括删除法、均值填充法、插值法等B.异常值检测可以通过箱线图、3σ原则等方法进行C.重复数据对分析结果没有影响,可以直接保留D.数据一致性检查包括数据类型、格式、取值范围的校验2.某电商公司想要分析用户的购买行为,收集了用户的年龄、性别、收入、购买频次、上次购买时间等数据。为了预测用户未来一个月是否会复购,以下变量中属于因变量(目标变量)的是()。A.年龄B.收入C.购买频次D.是否复购3.在Python的Pandas库中,假设df是一个DataFrame,执行`df.groupby('Category')['Sales'].sum()`操作后,返回的结果类型是()。A.DataFrameB.SeriesC.ListD.NumpyArray4.关于假设检验中的P值,下列说法正确的是()。A.P值是原假设成立的概率B.P值越小,拒绝原假设的证据越强C.P值大于显著性水平α时,拒绝原假设D.P值表示备择假设为真的概率5.在SQL语句中,用于过滤分组结果的关键字是()。A.WHEREB.ORDERBYC.GROUPBYD.HAVING6.某数据集包含1000个样本,其中正样本100个,负样本900个。如果模型将所有样本都预测为负样本,则该模型的准确率为()。A.10%B.50%C.90%D.100%7.在衡量回归模型的性能时,以下指标主要用于衡量模型预测值与真实值之间的平均误差大小的是()。A.R-squaredB.RMSE(均方根误差)C.F1-ScoreD.AUC8.下列关于数据中心趋势的描述,不正确的是()。A.均值容易受极端值的影响B.中位数是数据排序后位于中间位置的数,抗干扰性强C.众数是数据中出现次数最多的数值D.对于偏态分布,均值通常能最好地代表数据的典型水平9.在进行A/B测试时,为了确保实验结果的科学性,我们需要保证实验组和对照组除了实验变量外,其他条件保持一致。这主要体现了实验设计的()。A.随机性原则B.对照原则C.独立性原则D.双盲原则10.下列Python代码片段的输出结果是()。```pythonimportnumpyasnparr=np.array([[1,2,3],[4,5,6]])print(arr.shape)```A.(2,3)B.(3,2)C.6D.[1,2,3,4,5,6]11.在数据可视化中,想要展示两个连续型变量之间的线性相关关系,最适合使用的图表是()。A.饼图B.散点图C.柱状图D.热力图12.某连锁超市想要分析不同地区的销售额差异,地区包括“华东”、“华北”、“华南”、“西部”。此时,“地区”变量属于()。A.定类变量B.定序变量C.定距变量D.定比变量13.在逻辑回归模型中,Sigmoid函数的作用是()。A.将线性回归的输出映射到[0,1]区间,表示概率B.增加模型的复杂度以防止欠拟合C.将特征进行标准化处理D.计算特征之间的交互项14.下列关于数据标准化的描述,正确的是()。A.标准化后数据的均值为0,标准差为1B.归一化是将数据转换为均值为0,标准差为1的分布C.只有在数据存在异常值时才需要进行标准化D.标准化处理后的数据范围一定在[0,1]之间15.在SQL中,若要查询表中某列去重后的记录数,应使用()。A.SUM(DISTINCTcolumn_name)B.COUNT(DISTINCTcolumn_name)C.AVG(column_name)D.COUNT(column_name)16.决策树算法中,用于选择最佳分裂特征的指标不包括()。A.信息增益B.信息增益率C.基尼系数D.均方误差17.某在线教育平台发现用户完成课程的比例与学习时长呈正相关。若Pearson相关系数为0.85,这表明()。A.学习时长每增加1小时,完成课程的比例增加85%B.两者之间存在强正相关关系C.学习时长是导致完成课程比例提高的原因D.两者之间的线性关系可以解释85%的变异18.在时间序列分析中,移动平均法主要用于()。A.消除季节性波动B.消除长期趋势C.平滑数据,消除短期随机波动D.进行循环变动分析19.以下关于主成分分析(PCA)的说法,错误的是()。A.PCA是一种降维技术B.PCA通过线性变换将原始数据变换为一组各维度线性无关的表示C.降维后的主成分保留了原始数据的全部方差D.第一主成分反映了数据方差最大的方向20.在使用Python进行数据读取时,read_csv函数中用于指定编码格式的参数是()。A.sepB.headerC.encodingD.index_col二、多项选择题(本大题共10小题,每小题3分,共30分。在每小题列出的五个备选项中至少有两个是符合题目要求的,请将其代码填在括号内。多选、少选、错选均不得分。)1.下列属于常见的数据挖掘任务的有()。A.分类与预测B.聚类分析C.关联规则挖掘D.异常检测E.数据可视化2.在进行特征工程时,处理分类变量的常用方法包括()。A.独热编码B.标签编码C.哑变量编码D.标准化E.离散化3.下列关于K-Means聚类算法的描述,正确的有()。A.K值需要预先指定B.算法对初始质心的选择敏感C.只能处理数值型数据D.最终结果一定收敛到全局最优解E.算法基于距离度量样本相似度4.评估二分类模型性能的常用指标包括()。A.准确率B.精确率C.召回率D.F1-ScoreE.AUC值5.在Pandas中,合并两个DataFrame的方法有()。A.mergeB.joinC.concatD.appendE.combine_first6.下列关于过拟合的说法,正确的有()。A.训练集误差很低,测试集误差很高B.模型过于复杂,捕捉了数据中的噪声C.可以通过增加数据量来缓解过拟合D.可以通过正则化来缓解过拟合E.欠拟合也是过拟合的一种极端表现7.SQL中的连接类型包括()。A.内连接B.左外连接C.右外连接D.全外连接E.交叉连接8.下列属于NumPy数组创建方法的有()。A.np.array()B.np.zeros()C.np.ones()D.np.arange()E.np.random.rand()9.在描述性统计分析中,衡量数据离散程度的指标有()。A.方差B.标准差C.极差D.四分位距E.变异系数10.下列关于RFM模型的描述,正确的有()。A.R代表最近一次消费时间B.F代表消费频率C.M代表消费金额D.RFM模型常用于客户价值分析E.RFM值越高,客户价值一定越低三、填空题(本大题共10小题,每小题2分,共20分。请将答案填在横线上。)1.在统计学中,如果两个事件的发生互不影响,则称这两个事件为__________事件。2.在Python中,使用Matplotlib库绘制折线图时,用于设置x轴标签的函数是__________。3.某班级有50名学生,数学成绩的平均分为80,标准差为10。根据经验法则(68-95-99.7),大约有__________名学生的成绩分布在70分到90分之间。4.在SQL中,__________函数用于计算某列的平均值。5.在决策树中,若节点的所有样本都属于同一类别,则该节点被称为__________节点。6.数据分析中,__________是指由于数据收集、处理或记录过程中的错误导致的不准确或无效的数据。7.在线性回归方程y=+x8.Pandas中,__________属性用于获取DataFrame的行索引对象。9.为了解决类别不平衡问题,除了修改阈值外,还可以采用__________技术,即通过复制少数类样本或生成新样本来平衡数据集。10.在A/B测试中,我们通常将显著性水平α设定为__________,以控制犯第一类错误的概率。四、简答题(本大题共4小题,每小题10分,共40分。)1.简述描述性统计与推断性统计的区别与联系。2.在数据清洗过程中,发现了缺失值,请列举至少三种处理缺失值的方法,并简述其适用场景。3.简述什么是交叉验证,以及为什么要使用交叉验证?4.解释什么是A/B测试,并说明在实验设计时需要注意哪些关键点以保证结果的有效性。五、综合应用题(本大题共3小题,共70分。要求逻辑清晰,计算过程准确,必要时可结合代码或公式说明。)1.(本题25分)某电商平台拥有用户订单数据表`orders`,表结构如下:`order_id`(INT):订单ID`user_id`(INT):用户ID`product_category`(VARCHAR):商品类别`amount`(DECIMAL):订单金额`order_date`(DATETIME):下单时间请完成以下任务:(1)编写SQL语句,查询2025年全年每个商品类别的总销售额和订单数量,并按总销售额降序排列。(8分)(2)编写SQL语句,找出消费金额排名前10的用户ID及其总消费金额。(8分)(3)现在需要分析用户的复购情况。请编写SQL语句,计算在2025年下单次数大于1次的用户数占比(即复购率)。保留两位小数。(9分)2.(本题20分)某手机厂商收集了一批手机的使用时长数据(单位:年),如下所示:[2.1,1.5,3.2,4.5,2.8,1.2,5.1,3.6,2.9,4.2,1.8,2.5,3.1,4.8,2.2]请利用Python或手动计算方式完成以下分析:(1)计算该组数据的均值、中位数和众数(若无众数请注明)。(6分)(2)计算该组数据的方差和标准差。(6分)(3)假设数据服从正态分布,根据计算出的均值和标准差,估计使用时长在2年到4年之间的手机占比概率(提示:可查阅标准正态分布表或使用Python计算)。(8分)3.(本题25分)某银行想要构建一个信用评分卡模型,用于预测客户是否会违约(目标变量:0表示未违约,1表示违约)。现有训练数据集`train_data`,包含特征:`age`(年龄)、`income`(年收入)、`debt_ratio`(负债率)、`num_loans`(贷款笔数)。(1)在建模前,需要对数据进行探索性分析(EDA)。请简述针对该数据集应进行哪些必要的EDA步骤。(8分)(2)使用逻辑回归进行建模。假设模型训练完成后,某个客户的特征为:年龄30岁,年收入10万元,负债率0.5,贷款笔数2笔。模型输出的概率值为0.75。若我们将分类阈值设定为0.5,请判断该客户是否会被预测为违约,并说明理由。(5分)(3)模型评估阶段,混淆矩阵如下所示:预测未违约(0)预测违约(1)实际未违约(0)80050实际违约(1)150200请根据该混淆矩阵计算:准确率、精确率、召回率和F1-Score。(12分)参考答案与详细解析一、单项选择题1.【答案】C【解析】重复数据可能会导致分析结果出现偏差,例如在计算统计量时权重变大,因此通常需要检查并处理重复数据,而非直接保留。A、B、D均为正确的数据清洗操作。2.【答案】D【解析】因变量(目标变量)是模型想要预测或解释的变量。在本题中,目的是预测“是否复购”,因此D是因变量,A、B、C是自变量(特征变量)。3.【答案】B【解析】`df.groupby('Category')`返回的是一个DataFrameGroupBy对象,对其中的'Sales'列进行`sum()`聚合操作后,返回的是一个Series对象,索引是'Category',值是'Sales'的总和。4.【答案】B【解析】P值是指在原假设为真的前提下,出现当前样本或更极端样本的概率。P值越小,说明在原假设下发生当前观测结果的概率越小,因此拒绝原假设的证据越强。A选项错误,P值不是原假设成立的概率;C选项错误,P值大于α时接受原假设;D选项错误,P值不直接表示备择假设为真的概率。5.【答案】D【解析】SQL中,WHERE用于在聚合前过滤行,HAVING用于在聚合后(即GROUPBY后)过滤分组结果。6.【答案】C【解析】准确率=(预测正确的样本数)/(总样本数)。模型将所有样本预测为负样本,其中负样本有900个,全部预测正确;正样本100个,全部预测错误。准确率=900/1000=90%。7.【答案】B【解析】RMSE(均方根误差)是预测值与真实值偏差平方和的均值的平方根,主要用于衡量误差的大小。A是决定系数,衡量拟合优度;C和D是分类指标。8.【答案】D【解析】对于偏态分布,均值容易受极端值影响,此时中位数或众数通常能更好地代表数据的典型水平。D选项描述错误。9.【答案】A【解析】随机性原则确保每个样本被分配到实验组或对照组的概率相等,从而消除混杂变量的影响,使得两组具有可比性。虽然C和D也是实验设计的重要原则,但题目描述的核心在于通过随机分配来平衡其他条件。10.【答案】A【解析】`arr`是一个2行3列的二维数组,`shape`属性返回数组的维度,即(2,3)。11.【答案】B【解析】散点图是展示两个连续型变量之间关系的最直观图表。饼图用于展示比例,柱状图用于比较分类数据,热力图常用于展示矩阵或相关性密度。12.【答案】A【解析】地区(华东、华北等)之间没有顺序关系,只是不同的类别,属于定类变量。如果是“满意度:非常满意、满意、不满意”等,则属于定序变量。13.【答案】A【解析】逻辑回归中,Sigmoid函数g(z)14.【答案】A【解析】标准化(Z-Score)公式为z=15.【答案】B【解析】`COUNT(DISTINCTcolumn_name)`用于计算某列去重后的非空记录数。16.【答案】D【解析】决策树分类算法常用的分裂指标有信息增益(ID3)、信息增益率(C4.5)、基尼系数(CART)。均方误差(MSE)通常用于回归树的分裂指标。17.【答案】B【解析】相关系数0.85表示强正相关。A错误,相关系数不表示斜率大小;C错误,相关性不等于因果性;D错误,解释变异程度看的是决定系数,即=0.7225。18.【答案】C【解析】移动平均法通过取近期一定期内的平均值来平滑数据,消除短期随机波动,从而显示出长期趋势或周期性。19.【答案】C【解析】PCA降维会损失部分信息,保留的是最主要的方差成分,无法保留全部方差(除非保留所有主成分)。20.【答案】C【解析】`encoding`参数用于指定文件编码格式(如'utf-8','gbk')。`sep`指定分隔符,`header`指定表头行,`index_col`指定索引列。二、多项选择题1.【答案】ABCD【解析】数据可视化是展示分析结果的手段,不属于核心的数据挖掘算法任务,尽管它常用于数据挖掘过程中。A、B、C、D均为经典的数据挖掘任务。2.【答案】ABC【解析】独热编码、标签编码、哑变量编码(与独热编码类似)都是处理分类变量的方法。标准化和离散化通常用于数值型变量。3.【答案】ABCE【解析】K-Means需要预设K值(A),对初始中心敏感(B),基于距离(E),且主要处理数值型数据(C)。D错误,K-Means容易陷入局部最优,不一定收敛到全局最优。4.【答案】ABCDE【解析】A、B、C、D、E均是评估二分类模型性能的常用指标。5.【答案】ABC【解析】`merge`和`join`用于基于键合并,`concat`用于沿轴拼接。`append`在较新版本中已被弃用或并入`concat`,但在旧题库中常见,不过严格来说`append`也是合并的一种。但最标准的核心合并方法是merge,join,concat。这里选择ABC最为稳妥,若考虑旧版API特性D也可,但通常考核心方法。注:`append`在Pandas1.4.0后不推荐使用,2.0移除。此处取ABC。6.【答案】ABCD【解析】过拟合表现为训练误差低、测试误差高(A),由模型复杂度过高导致(B)。增加数据(C)和正则化(D)是解决过拟合的常用方法。E错误,欠拟合与过拟合相反。7.【答案】ABCDE【解析】SQL标准连接包括内连接、左外连接、右外连接、全外连接和交叉连接。8.【答案】ABCDE【解析】A、B、C、D、E均为NumPy创建数组的常用方法。9.【答案】ABCDE【解析】方差、标准差、极差、四分位距、变异系数均用于衡量数据的离散程度。10.【答案】ABCD【解析】RFM模型中,R(Recency),F(Frequency),M(Monetary)是三个核心维度,常用于客户价值分析。E错误,通常R值越小(越近),F和M值越大,客户价值越高。三、填空题1.【答案】独立2.【答案】xlabel3.【答案】34(约68%的50人,即34人)4.【答案】AVG5.【答案】纯或叶6.【答案】脏数据7.【答案】回归系数8.【答案】index9.【答案】过采样10.【答案】0.05四、简答题1.【答案】区别:描述性统计:旨在描述和概括数据集的特征,如集中趋势(均值、中位数)、离散程度(方差、标准差)等。它只对收集到的数据进行描述,不进行推断。推断性统计:利用样本数据来推断总体的特征,包括参数估计(点估计、区间估计)和假设检验等。它超越了数据本身,试图得出普遍性的结论。联系:描述性统计是推断性统计的基础。在进行推断之前,通常需要先对数据进行描述性分析,以了解数据的分布特征和基本规律。2.【答案】(1)删除法:直接删除含有缺失值的行或列。适用于缺失比例较小且数据量充足的情况,以免丢失过多信息。(2)均值/中位数/众数填充法:用该列其余数据的均值、中位数或众数填充缺失值。适用于缺失随机发生且数据分布较为均匀的情况。(3)插值法:利用周围数据的值(如线性插值)或通过建立模型预测缺失值。适用于时间序列数据或有明显趋势的数据。(4)哑变量填充:将缺失值作为一个新类别(如“Unknown”)。适用于缺失值本身可能含有信息的情况。3.【答案】交叉验证是一种将数据集分成多个子集,轮流将其中一个子集作为测试集,其余作为训练集进行模型训练和评估的方法(如K折交叉验证)。原因:更充分地利用数据:在数据量有限的情况下,尽可能多地使用数据进行训练。减少评估结果的方差:通过多次取平均,得到比单次划分更稳定、更可靠的模型性能评估。防止过拟合:能够更客观地评估模型在未知数据上的表现。4.【答案】A/B测试是一种将用户随机分成两组(实验组和对照组),给实验组展示新版本(A),对照组展示旧版本(B),然后对比两组的关键指标(如点击率、转化率)以判断新版本是否有效的方法。关键点:样本量:确保样本量足够大,以保证统计功效。随机分组:确保除实验变量外,其他特征在两组间分布一致。辛普森悖论:注意细分数据与整体数据趋势可能相反的情况。显著性检验:使用科学的统计方法判断差异是否显著,而非仅看绝对值差异。实验时长:避免由于周期性波动(如周末效应)导致的偏差,通常需运行完整的周期。五、综合应用题1.【答案】(1)```sqlSELECTproduct_category,SUM(amount)AStotal_sales,COUNT(order_id)ASorder_countFROMordersWHEREYEAR(order_date)=2025GROUPBYproduct_categoryORDERBYtotal_salesDESC;```(2)```sqlSELECTuser_id,SUM(amount)AStotal_spentFROMordersGROUPBYuser_idORDERBYtotal_spentDESCLIMIT10;```(3)```sqlSELECTCONCAT(ROUND(COUNT(CASEWHENorder_cnt>1THEN1END)*100.0/COUNT(*),2),'%')ASrepurchase_rateFROM(SELECTuser_id,COUNT(order_id)ASorder_cntFROMordersWHEREYEAR(order_date)=2025GROUPBYuser_id)ASuser_order_summary;```2.【答案】数据:[2.1,1.5,3.2,4.5,2.8,1.2,5.1,3.6
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 2026南方医科大学珠江医院胸外科招聘科研助手1人考试参考题库及答案详解
- 2026年继电保护专业考试题库及答案
- 询问2026年销售目标达成情况联系函5篇
- 告知取消原定线下会议决定函(7篇)
- 2026年湖北省孝感市医疗系统事业编人员招聘笔试参考试题及答案详解
- 校园安全知识普及:预防校园伤害小学主题班会课件
- 浙江省温州市十校联合体2024-2025学年高一上学期11月期中地理试题(含答案)
- 中医内科学考试题库及答案(一)
- 感恩教师节:感谢您我的老师小学主题班会课件
- 上饶市广信区2026年教育系统“归雁计划”选调教师工作笔试备考试题及答案详解
- 消防工程施工重点、难点分析及对策
- 小区道路施工方案内(3篇)
- 2026年考研管综199真题(试卷+答案)
- 2026年四川省泸州社区工作者考试试题题库(答案+解析)
- 浙江金华十校2025-2026学年高二下学期6月期末质量检测地理试题含答案
- 2026年无锡九年级语文中考二模冲刺卷:作文审题立意与范文素材(区县教研共同体第2套)含参考答案、逐题解析与评分细则
- 2025广东广州市劳动人事争议仲裁委员会招聘兼职仲裁员考试参考题库附答案
- 《云南省城市园林工程施工及质量验收规程》
- GB/T 3883.203-2025手持式、可移式电动工具和园林工具的安全第203部分:手持式砂轮机、盘式抛光机和盘式砂光机的专用要求
- 皮具行业创业计划书范文
- 社区保密工作课件及讲稿
评论
0/150
提交评论