版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
2026年数据分析师职业能力鉴定考试试卷及答案一、单项选择题(本部分共20题,每题1分,共20分。每题只有一个正确选项,请将正确选项填入括号内)1.在关系型数据库SQL查询中,若要查找“成绩表”中分数在60到80之间(包含60和80)的所有记录,下列WHERE子句正确的是()。A.WHEREscore>60ANDscore<80B.WHEREscoreBETWEEN60AND80C.WHEREscoreIN(60,80)D.WHEREscoreLIKE'60,80'2.使用Python的Pandas库进行数据处理时,若DataFrame对象df中存在缺失值,下列哪个方法可以删除包含缺失值的行?()A.df.dropna()B.df.fillna(0)C.df.isnull()D.df.notnull()3.在假设检验中,如果原假设(H0)实际上是成立的,但检验结果却拒绝了原假设,这类错误被称为()。A.第一类错误(TypeIError)B.第二类错误(TypeIIError)C.统计偏差D.抽样误差4.在数据仓库建模中,星型模型与雪花模型的主要区别在于()。A.星型模型包含事实表,雪花模型不包含B.雪花模型对维度表进行了规范化,星型模型维度表通常处于反规范化状态C.星型模型查询性能更差,雪花模型查询性能更好D.雪花模型无法处理大数据量5.下列Python代码片段的输出结果是()。list_a=[1,2,3,4]result=[x*2forxinlist_aifx>2]print(result)A.[2,4,6,8]B.[6,8]C.[3,4]D.[4,6]6.在SQL中,窗口函数`RANK()`与`DENSE_RANK()`的主要区别在于()。A.RANK()是排序,DENSE_RANK()是聚合B.DENSE_RANK()不跳过排名序号,RANK()会跳过(如1,2,2,4vs1,2,2,3)C.RANK()只能用于数值型字段,DENSE_RANK()用于字符型D.两者没有区别,功能完全一致7.某电商dataset中,用户年龄与购买金额之间的皮尔逊相关系数为-0.85,这表明()。A.年龄越大,购买金额越高B.年龄与购买金额没有线性关系C.年龄越大,购买金额越低,且负相关关系很强D.相关系数计算错误,取值范围超出了-1到18.在使用NumPy进行矩阵运算时,若要创建一个3行3列的全零矩阵,应使用()。A.np.zeros((3,3))B.np.empty((3,3))C.np.ones((3,3))D.np.eye(3)9.数据可视化中,若要展示两个连续变量之间的相关性分布趋势,最适合的图表类型是()。A.饼图B.散点图C.柱状图D.雷达图10.某APP昨日活跃用户数为10000,今日活跃用户数为12000,其中两日都活跃的用户数为8000。则次日留存率为()。A.80%B.66.67%C.120%D.20%11.在Python中,使用Matplotlib绘制图表时,若要解决中文显示乱码问题,通常需要配置字体属性,下列哪个参数用于设置字体文件路径?()A.`font.family`B.`font.size`C.`font.sans-serif`D.`axes.unicode_minus`12.SQL语句中,`GROUPBY`子句通常与`______`一起使用,以便对分组后的数据进行筛选。()A.WHEREB.ORDERBYC.HAVINGD.LIMIT13.在机器学习的特征工程中,将数值型特征缩放到[0,1]区间的方法称为()。A.标准化B.归一化C.正则化D.独热编码14.下列关于数据分析师职业素养的描述,不准确的是()。A.需具备良好的业务理解能力,能将数据问题转化为业务问题B.只需要精通编程技术,业务逻辑可以由产品经理补充C.需具备严谨的数据敏感度,能发现数据中的异常值D.需具备良好的沟通表达能力,能将分析结果呈现给非技术人员7.在Python中,下列哪个数据结构是可变的且无序的,不允许重复元素?()A.ListB.TupleC.SetD.Dictionary16.在A/B测试中,为了判断实验组与对照组的差异是否具有统计学意义,我们通常设定显著性水平α为0.05。这意味着()。A.我们有95%的把握拒绝原假设B.原假设为真时,错误拒绝原假设的概率为5%C.实验组效果优于对照组的概率为95%D.样本量不足的概率为5%17.关于数据库索引,下列说法正确的是()。A.索引越多,查询性能一定越好B.索引会降低写入速度,但能提高查询速度C.只有主键可以建立索引D.索引会占用额外的内存空间,但不会占用磁盘空间18.在时间序列分析中,移动平均法的主要作用是()。A.预测数据的长期趋势B.消除数据中的随机波动,平滑序列C.检测数据的季节性波动D.计算数据的方差19.使用Pandas读取Excel文件时,若要指定读取哪个Sheet,应使用的参数是()。A.`header`B.`sheet_name`C.`index_col`D.`encoding`20.某连锁店想要分析“天气情况”对“奶茶销量”的影响,但发现数据中缺失了30%的天气数据。下列处理方式最不恰当的是()。A.删除所有缺失天气数据的行B.使用天气数据的众数进行填充C.使用前后日期的天气数据进行线性插值填充D.忽略该字段,直接分析销量与其他因素的关系(如果天气是核心因素)二、多项选择题(本部分共10题,每题2分,共20分。每题有两个或两个以上正确选项,少选得1分,多选、错选不得分)1.下列属于数据清洗常见步骤的有()。A.缺失值处理B.重复值处理C.异常值检测与处理D.数据标准化E.特征构建2.在Python的数据分析库生态中,下列哪些库可以用于数据可视化?()A.MatplotlibB.SeabornC.PlotlyD.Scikit-learnE.PyTorch3.SQL中的聚合函数包括()。A.SUM()B.COUNT()C.AVG()D.MAX()E.CONCAT()4.评估回归模型性能的常用指标有()。A.均方误差(MSE)B.均方根误差(RMSE)C.平均绝对误差(MAE)D.R平方(R-squared)E.准确率5.下列关于PandasDataFrame的操作,描述正确的有()。A.`df.head(5)`可以查看前5行数据B.`df.describe()`可以计算数值型列的统计摘要C.`df.sort_values(by='col')`可以按照指定列升序排序D.`df.merge(df2,on='key')`类似于SQL的JOIN操作E.DataFrame的索引一旦设定就不能修改6.在进行用户画像分析时,常用的用户维度标签包括()。A.人口属性标签(性别、年龄、地域)B.社会属性标签(职业、收入、教育程度)C.行为偏好标签(购买品类、活跃时段)D.心理属性标签(价值观、兴趣爱好)E.预测类标签(流失概率、复购倾向)7.下列哪些情况会导致数据采集过程中的偏差?()A.幸存者偏差B.选择偏差C.测量工具精度不足D.数据录入错误E.随机抽样8.在Python中,处理字符串的常用方法有()。A.`strip()`(去除首尾空格)B.`split()`(分割字符串)C.`upper()`(转换为大写)D.`join()`(连接序列)E.`mean()`(计算平均值)9.下列属于非关系型数据库特点的有()。A.灵活的数据模型B.最终一致性C.支持复杂的SQL事务D.水平扩展性强E.表格结构固定10.在漏斗分析中,关注的核心指标包括()。A.总转化率B.各步骤转化率C.各步骤流失率D.平均停留时长E.用户跳出率三、填空题(本部分共10题,每题1分,共10分。请将答案填写在横线上)1.在统计学中,描述数据集中趋势的三个常用统计量是平均值、中位数和______。2.Python中,用于导入Pandas库并简写为pd的语句是:`importpandas______pd`。3.在SQL中,若要对查询结果进行去重,应使用关键字______。4.某班级有50名学生,数学成绩的平均分为80,标准差为10。根据切比雪夫定理,至少有______%的学生成绩在60到100之间。5.在A/B测试中,我们将流量随机分为两组,一组保持现状称为对照组,另一组使用新策略称为______。6.Pandas中,若要将DataFrame对象导出为CSV文件,应使用的方法是`df.______('file.csv')`。7.在数据可视化中,用于展示各部分占总体的百分比,且各部分之和为100%的图表是______。8.Python中,`2**3`的计算结果是______。9.在逻辑回归模型中,Sigmoid函数将线性回归的结果映射到______区间,表示概率。10.数据分析的基本流程通常包括:明确需求、数据收集、数据清洗、数据分析与建模、______。四、简答题(本部分共4题,每题5分,共20分)1.请简述在数据分析中,什么是“辛普森悖论”?并举例说明其产生的原因及解决思路。2.请比较说明“长表”和“宽表”在数据存储和分析中的优缺点。3.在电商数据分析中,什么是RFM模型?请解释R、F、M三个维度的具体含义及其在用户分层中的应用价值。4.简述在使用Python进行大规模数据处理时,若遇到内存不足的问题,有哪些常用的优化策略?五、综合应用题(本部分共3题,共50分。请详细阅读题目,按要求作答)1.(SQL应用题,15分)某公司拥有两张数据库表:表`orders(订单表)`,字段包含:`order_id`(订单ID,主键),`user_id`(用户ID),`order_date`(订单日期),`amount`(订单金额)。表`order_items(订单详情表)`,字段包含:`item_id`(详情ID),`order_id`(订单ID,外键),`product_id`(商品ID),`quantity`(购买数量),`price`(单价)。请编写SQL语句完成以下任务:(1)查询2023年10月份每个用户的总订单金额(`total_amount`)和订单总数(`order_count`),并按总金额降序排列。(2)查询所有包含商品ID为'P1001'的订单,显示订单ID、用户ID和该订单的总金额。(3)使用窗口函数,查询每个用户最近一次下单的订单ID及其下单日期。2.(Python数据分析题,20分)假设你是一名在线教育平台的数据分析师,现在手头有一份CSV格式的学员学习记录数据`study_log.csv`。数据包含以下字段:`user_id`:用户ID`course_id`:课程ID`duration`:学习时长(分钟)`device_type`:设备类型('PC','Mobile','Pad')`login_date`:登录日期请使用Python(Pandas库)完成以下分析任务,并写出关键代码步骤:(1)读取数据,并将`login_date`字段转换为日期时间格式。(2)检查数据中是否存在缺失值,若有缺失值,请根据业务逻辑填充或删除,并说明理由。(3)统计不同设备类型(`device_type`)的学习总时长和平均学习时长。(4)找出学习时长最长的前10名用户,输出他们的`user_id`和总学习时长。(5)定义一个函数,根据学习时长将用户分为三个等级:'High'(>100分钟),'Medium'(30-100分钟),'Low'(<30分钟),并在DataFrame中新增一列`level`标记这些等级。3.(商业案例分析题,15分)某外卖平台推出了“会员免配送费”功能,并进行了为期一周的A/B测试。实验组(GroupB):10000名用户,开通会员免配送费功能。对照组(GroupA):10000名用户,保持原有状态(无免配送费)。测试一周后收集到的核心数据如下:GroupA:下单用户数2000人,总订单数5000单,平均每单配送费5元。GroupB:下单用户数2500人,总订单数7000单,平均每单配送费0元(平台补贴)。已知平台每单的平均利润(不含配送费成本)为3元,配送费实际成本为4元。(1)请计算GroupA和GroupB的订单转化率(下单用户数/总曝光用户数)。(2)请计算GroupA和GroupB的人均订单数(总订单数/下单用户数)。(3)从总利润的角度分析,该“会员免配送费”功能在一周内是否带来了正向收益?请列出计算过程。(4)除了短期利润,作为数据分析师,你还建议关注哪些长期指标来评估该功能的最终成败?参考答案一、单项选择题1.B2.A3.A4.B5.B6.B7.C8.A9.B10.B11.C12.C13.B14.B15.C16.B17.B18.B19.B20.D二、多项选择题1.ABCD2.ABC3.ABCD4.ABCD5.ABCD6.ABCDE7.ABCD8.ABCD9.ABD10.ABCE三、填空题1.众数2.as3.DISTINCT4.75(解析:k=2,1-1/2^2=0.75)5.实验组6.to_csv7.饼图8.89.0到110.数据可视化/报告撰写四、简答题1.答:辛普森悖论是指在分组比较中都占优势的一方,在总评中反而处于劣势的一种现象。产生原因:通常是因为样本中存在混杂变量,且不同分组间的样本权重分配不均匀导致的。举例:比如对比两个医院的治愈率。A医院治疗重症治愈率低(如10/100=10%),轻症治愈率高(如80/100=80%);B医院重症治愈率高(如1/10=10%),轻症治愈率低(如8/10=80%)。如果直接看总治愈率,A医院(90/200=45%)低于B医院(9/20=45%),这里数值相等,若样本权重变动则可能出现A在各类都低但总高的情况。关键在于A医院接收了更多难治的重症病人,拉低了总数据。解决思路:采用标准化处理,或者使用分层分析,控制混杂变量(如病情严重程度)后再进行对比,而不是直接汇总数据。2.答:宽表:优点:人类可读性好,便于人工查看,适合做透视表输入,某些分析工具直接处理方便。缺点:字段较多,容易产生稀疏数据,新增维度时需要修改表结构(DDL),灵活性较差。长表:优点:符合数据库范式,结构紧凑,便于存储,新增维度或指标时不需要修改表结构,适合计算机处理和绘图库(如ggplot,seaborn)的输入。缺点:分析时需要进行透视或聚合操作,对人类阅读不够直观。3.答:RFM模型是衡量客户价值和客户创利能力的重要工具和手段。R(Recency)最近一次消费:指的是用户距离上一次购买/消费的时间间隔。R值越小,用户越活跃,越容易再次消费。F(Frequency)消费频率:指的是用户在一段时间内的消费次数。F值越大,用户忠诚度越高。M(Monetary)消费金额:指的是用户在一段时间内的消费总额。M值越大,用户的消费能力越强,对企业的贡献越高。应用价值:通过这三个维度,可以将用户划分为不同的群体,如“重要价值客户”(R高、F高、M高)、“重要挽留客户”(R低、F高、M高)、“一般发展客户”等。针对不同群体,企业可以制定差异化的营销策略,如对高价值客户进行VIP维护,对流失风险高的客户进行优惠券召回等。4.答:分块读取:使用Pandas的`chunksize`参数分批读取大文件,逐块处理并聚合结果,避免一次性加载全部数据。指定数据类型:在读取数据时使用`dtype`参数明确指定列类型(如将int64转为int32或category),减少内存占用。及时释放内存:在处理完中间变量后,使用`del`删除变量,并调用`gc.collect()`强制回收垃圾。使用高效数据结构:对于文本数据,尽量转换为`category`类型;对于稀疏数据,使用稀疏矩阵结构。使用Dask或Modin等库:这些库专门用于处理超出内存限制的大规模数据,支持并行计算和磁盘溢出。五、综合应用题1.答:(1)```sqlSELECTuser_id,SUM(amount)AStotal_amount,COUNT(order_id)ASorder_countFROMordersWHEREorder_dateBETWEEN'2023-10-01'AND'2023-10-31'GROUPBYuser_idORDERBYtotal_amountDESC;```(2)```sqlSELECTo.order_id,o.user_id,o.amountFROMordersoJOINorder_itemsoiONo.order_id=oi.order_idWHEREduct_id='P1001';```(3)```sqlSELECTuser_id,order_id,order_dateFROM(SELECTuser_id,order_id,order_date,ROW_NUMBER()OVER(PARTITIONBYuser_idORDERBYorder_dateDESC)asrnFROMorders)tWHEREt.rn=1;```2.答:```pythonimportpandasaspd#(1)读取数据并转换日期格式df=pd.read_csv('study_log.csv')df['login_date']=pd.to_datetime(df['login_date'])#(2)缺失值处理#假设user_id,course_id,duration为核心字段,若缺失则无意义,删除行#device_type若缺失,可填充为'Unknown'#login_date若缺失,无法分析,删除df.dropna(subset=['user_id','course_id','duration','login_date'],inplace=True)df['device_type'].fillna('Unknown',inplace=True)#(3)统计不同设备类型的总时长和平均时长device_stats=df.groupby('device_type')['duration'].agg(['sum','mean'])print(device_stats)#(4)学习时长最长的前10名用户top_users=df.groupby('user_id')['duration'].sum().sort_values(ascending=False).head(10)print(top_users)#(5)定义函数并新增level列defcategorize_level(x):ifx>100:return'High'elifx>=30:return'Mediu
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 2026中国手术动力装置耗材商业模式创新与利润增长点
- 2026中国水泥立磨轴承磨损机理与表面处理技术突破
- 2026人工智能教育机器人行走训练平台设计儿童编程课程书
- 2026中国新能源汽车电池回收利用市场格局与商业模式创新分析报告
- 2026中国推广行业市场深度调研及发展趋势和投资前景预测研究报告
- 2026孟加拉国成衣制造产业集群与全球供应链重构研究
- (正式版)DB34∕T 4117-2022 《艾草大棚扦插育苗技术规程》
- (正式版)DB11∕T 2249-2024 《园区能效评价指南》
- 共享车位应聘面试题及详细答案
- 2026中国特色广告行业市场需求与投资潜力评估规划分析研究
- 2025年山东省烟台市辅警招聘公安基础知识考试题库及答案
- 拉力试验机安全操作规程及维护手册
- 《装配式公路钢桥墩》
- (正式版)DB23∕T 221-2002 《规模化养蜂技术规程》
- 选煤厂安全规程培训课件
- BSL-1生物安全实验室备案审核表
- 基于STM32的室内花卉自动浇灌系统设计
- 韩语入门考试题库及答案
- 辽宁护士注册管理办法
- 学校保安保洁及宿管服务投标方案(技术方案)
- 中医针灸学(A1题型)历年真题试卷汇编2
评论
0/150
提交评论