版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
2025年大数据分析师初级职称考试试题集一、单项选择题(共20题,每题1分,共20分。每题的备选项中,只有1个最符合题意)1.下列选项中,不属于Gartner提出的大数据经典4V特征的是()A.VolumeB.VelocityC.VeracityD.Variety2.下列数据类型中,属于半结构化数据的是()A.MySQL数据库中的用户订单表B.JSON格式的系统日志数据C.高清监控视频文件D.Excel中的员工薪资统计表3.某销售数据表包含“区域”“订单金额”等字段,要统计华东区域所有订单的总金额,应使用的Excel函数是()A.SUMB.SUMIFC.COUNTIFD.VLOOKUP4.要从user表中查询年龄在20到30岁(含20岁、30岁)的用户姓名,正确的WHERE子句是()A.WHEREage>20ANDage<30B.WHEREageBETWEEN20AND30C.WHERE20<age<30D.WHEREageIN(20,30)5.已知一组数据为:3,5,5,7,10,12,15,该组数据的中位数和众数分别是()A.7和5B.5和7C.7和7D.6和56.下列数据处理方法中,不属于缺失值处理方法的是()A.均值填充B.删除缺失记录C.哑变量转换D.相邻值插补7.要展示某企业近5年营业收入的变化趋势,最适合的图表类型是()A.饼图B.折线图C.散点图D.箱线图8.在Python的pandas库中,用于读取CSV格式数据文件的函数是()A.read_excelB.read_csvC.to_csvD.read_sql9.下列抽样方法中,属于概率抽样的是()A.方便抽样B.判断抽样C.分层抽样D.滚雪球抽样10.根据《中华人民共和国个人信息保护法》,下列不属于敏感个人信息的是()A.生物识别信息B.宗教信仰信息C.工作单位信息D.医疗健康信息11.基于正态分布的3σ异常值识别原则中,通常将偏离均值的标准差倍数超过多少的数据判定为异常值()A.1倍B.2倍C.3倍D.4倍12.下列SQL聚合函数中,用于统计表中记录行数的是()A.SUMB.COUNTC.AVGD.MAX13.将原始数据缩放至[0,1]区间的标准化方法是()A.min-max标准化B.Z-score标准化C.小数定标标准化D.对数转换标准化14.在Excel数据透视表中,用于设置行维度分类字段的区域是()A.值区域B.行区域C.列区域D.筛选器区域15.皮尔逊相关系数的取值范围是()A.[0,1]B.[-1,1]C.[0,+∞)D.(-∞,+∞)16.下列属于分布式文件存储系统的是()A.MySQLB.HDFSC.RedisD.MongoDB17.在Python的numpy库中,用于生成元素全为0的数组的函数是()A.onesB.zerosC.arangeD.array18.下列工作内容中,不属于数据清洗范畴的是()A.去除重复记录B.修正逻辑错误数据C.补充缺失值D.制作可视化报表19.电商平台“客单价”指标的正确计算公式是()A.销售总额/订单总数B.销售总额/活跃用户总数C.订单总数/用户总数D.销售毛利/销售总额20.下列数据处理操作中,属于数据脱敏方法的是()A.数据备份B.数据加密C.手机号中间4位替换为*D.数据压缩二、多项选择题(共10题,每题2分,共20分。每题的备选项中,有2个或2个以上符合题意,至少有1个错项。错选不得分;少选,所选的每个选项得0.5分)1.下列数据类型中,属于非结构化数据的有()A.微信聊天语音B.PDF格式的合同文档C.Redis中的键值缓存数据D.监控摄像头的视频录像E.Oracle数据库的产品信息表2.下列Excel函数中,属于查找与引用类函数的有()A.VLOOKUPB.HLOOKUPC.INDEXD.MATCHE.SUMIFS3.下列SQL关键字中,属于数据查询语言(DQL)范畴的有()A.SELECTB.WHEREC.INSERTD.GROUPBYE.UPDATE4.下列统计指标中,属于描述性统计范畴的有()A.均值B.中位数C.假设检验P值D.标准差E.皮尔逊相关系数5.数据预处理的核心环节包括()A.数据清洗B.数据集成C.数据变换D.数据规约E.数据可视化6.下列图表类型中,适合展示数据构成占比的有()A.饼图B.环形图C.堆叠柱状图D.雷达图E.热力图7.下列Python库中,属于数据分析常用工具库的有()A.pandasB.numpyC.matplotlibD.flaskE.scikit-learn8.下列抽样方法中,属于非概率抽样的有()A.简单随机抽样B.方便抽样C.判断抽样D.整群抽样E.配额抽样9.根据《中华人民共和国数据安全法》,我国数据安全保护等级分为()A.一般数据B.重要数据C.核心数据D.敏感数据E.公开数据10.下列能力要求中,属于初级大数据分析师必备核心能力的有()A.独立完成数据采集与清洗B.使用常用工具开展描述性分析C.独立设计复杂深度学习模型D.制作规范的数据分析报告E.制定企业级数据战略规划三、判断题(共15题,每题1分,共15分。正确的打“√”,错误的打“×”)1.大数据的价值密度与数据量呈正相关,数据量越大,价值密度越高。()2.Excel中VLOOKUP函数的第四个参数为FALSE时,表示执行精确匹配。()3.SQL中ORDERBY子句的默认排序方式为降序(DESC)。()4.中位数不受极端值影响,适合描述偏态分布数据的集中趋势。()5.散点图可直观展示两个连续变量之间的相关关系。()6.pandas库中dropna()函数的作用是填充数据中的缺失值。()7.分层抽样的抽样误差通常小于同等样本量下的简单随机抽样误差。()8.数据标准化的核心目的是消除不同变量的量纲差异,提升数据可比性。()9.饼图适合展示多类别数据的数值大小对比。()10.根据《个人信息保护法》,处理所有个人信息都必须取得自然人的明示同意。()11.Hive是基于Hadoop的数据仓库工具,可将结构化数据文件映射为数据库表并提供SQL查询功能。()12.数据集的标准差越大,说明数据的离散程度越小。()13.Excel数据透视表的值区域仅支持求和一种计算方式。()14.两个变量的皮尔逊相关系数为0,说明两个变量之间不存在任何关联关系。()15.数据脱敏是通过规则对敏感信息进行变形,实现隐私数据保护的技术手段。()四、简答题(共3题,每题7分,共21分。要求观点明确,条理清晰,表述简洁)1.请简述数据清洗的主要内容及对应常用方法。2.请列举至少5种常用数据可视化图表类型,并说明各自的核心适用场景。3.请简述初级大数据分析师应遵守的核心数据伦理规范。五、实操分析题(共2题,第1题10分,第2题14分,共24分。要求写出操作步骤、函数公式或SQL语句,逻辑清晰,表述准确)1.某零售企业2024年10月销售数据存储在Excel工作表“销售表”中,包含字段:订单编号(文本型)、销售日期(日期型)、区域(文本型,可选值:华东/华北/华南/西南)、产品类别(文本型,可选值:食品/日用品/电器)、销售额(数值型,单位:元)、销售人员(文本型)。请按要求完成以下操作,写出对应函数公式或操作步骤:(1)统计华北区域电器类产品的总销售额,要求使用SUMIFS函数实现,写出完整函数公式。(3分)(2)快速提取销售额排名前3的订单编号和销售额,简述可使用的Excel功能及操作步骤。(3分)(3)制作数据透视表,展示各区域不同产品类别的销售额汇总情况,简述操作步骤。(4分)2.某电商平台数据库包含两张核心表,表结构如下:用户表(users):user_id(用户ID,INT,主键)、user_name(用户名,VARCHAR)、age(年龄,INT)、city(所在城市,VARCHAR)、register_time(注册时间,DATETIME)订单表(orders):order_id(订单ID,INT,主键)、user_id(用户ID,INT,外键关联users表user_id)、order_amount(订单金额,DECIMAL(10,2))、order_time(下单时间,DATETIME)、order_status(订单状态,INT,1=待付款,2=已付款,3=已完成,4=已取消)请按要求写出对应的SQL查询语句:(1)查询2024年注册、年龄在25-35岁(含两端)的用户ID、用户名和所在城市。(4分)(2)统计每个城市的已完成订单总金额,结果按总金额从高到低排序,返回城市名称和总金额(总金额列别名设为total_amount)。(5分)(3)查询从未产生过任何订单的用户ID和用户名。(5分)参考答案及解析一、单项选择题1.答案:C解析:Gartner提出的大数据经典4V特征包括Volume(数据量大)、Velocity(处理速度快)、Variety(数据类型多)、Value(价值密度低)。Veracity(真实性)是大数据5V扩展特征,不属于经典4V范畴。2.答案:B解析:半结构化数据具有一定的结构标识但模式不固定,典型代表为JSON、XML、HTML格式数据。A、D属于结构化数据,C属于非结构化数据。3.答案:B解析:SUMIF函数用于单条件求和,可根据“区域”列的“华东”条件对“订单金额”列求和。SUM为无条件求和,COUNTIF为条件计数,VLOOKUP为纵向查找函数。4.答案:B解析:BETWEEN...AND...用于指定闭区间范围,包含两端值,符合题意。A为开区间(不含20和30),C不符合SQL语法规范,IN为枚举匹配,仅匹配20和30两个值。5.答案:A解析:数据已按升序排列,共7个值,中位数为第4位的7;众数为出现次数最多的数值5。6.答案:C解析:哑变量转换是分类变量编码的方法,用于将分类变量转换为可用于模型计算的数值型变量,不属于缺失值处理方法。7.答案:B解析:折线图通过连续折线展示数据随时间或有序类别变化的趋势,适合展示时间序列数据的波动规律。饼图用于展示占比,散点图用于展示相关性,箱线图用于展示数据分布。8.答案:B解析:read_csv是pandas中读取CSV文件的专用函数,read_excel用于读取Excel文件,to_csv用于导出CSV文件,read_sql用于读取数据库查询结果。9.答案:C解析:概率抽样是按照随机原则抽取样本,包括简单随机抽样、分层抽样、整群抽样、系统抽样等。方便抽样、判断抽样、滚雪球抽样均属于非概率抽样。10.答案:C解析:敏感个人信息是指一旦泄露或非法使用,易导致自然人人格尊严受损或人身、财产安全受危害的信息,包括生物识别、宗教信仰、特定身份、医疗健康、金融账户、行踪轨迹等。工作单位属于一般个人信息范畴。11.答案:C解析:3σ原则基于正态分布特征,认为99.73%的数据会落在均值±3倍标准差范围内,超出该范围的数据被判定为异常值。12.答案:B解析:COUNT函数用于统计符合条件的记录行数,SUM用于求和,AVG用于求平均值,MAX用于求最大值。13.答案:A解析:min-max标准化(离差标准化)通过线性变换将原始数据映射到[0,1]区间,公式为(x-min)/(max-min)。Z-score标准化将数据转换为均值为0、标准差为1的分布,取值范围无固定区间。14.答案:B解析:行区域用于放置行维度分类字段,每一行对应一个分类值;列区域用于放置列维度分类字段;值区域用于放置需计算的数值字段;筛选器区域用于设置全局筛选条件。15.答案:B解析:皮尔逊相关系数衡量两个变量的线性相关程度,取值范围为[-1,1],绝对值越接近1表示线性相关性越强,正值为正相关,负值为负相关。16.答案:B解析:HDFS(HadoopDistributedFileSystem)是ApacheHadoop生态的分布式文件存储系统,用于存储海量非结构化/半结构化数据。MySQL是关系型数据库,Redis是内存键值数据库,MongoDB是文档型非关系数据库。17.答案:B解析:zeros函数用于生成指定形状的全0数组,ones用于生成全1数组,arange用于生成等差序列数组,array用于将列表等对象转换为数组。18.答案:D解析:数据清洗是对原始数据中的错误、缺失、重复、异常等问题进行修正处理的过程,制作可视化报表属于数据分析与展示环节,不属于数据清洗范畴。19.答案:A解析:客单价是指平均每笔订单的成交金额,计算公式为销售总额/订单总数。B为用户平均收入(ARPU),C为人均订单数,D为销售毛利率。20.答案:C解析:数据脱敏是对敏感信息进行变形处理,实现隐私保护,手机号中间4位替换为*是典型的掩码脱敏方法。数据备份是数据容灾手段,数据加密是数据安全传输/存储手段,数据压缩是提升存储效率的手段,均不属于脱敏范畴。二、多项选择题1.答案:ABD解析:非结构化数据无固定数据结构,无需预先定义数据模式,典型包括音频、视频、图片、PDF/Word文档等。C属于半结构化数据,E属于结构化数据。2.答案:ABCD解析:VLOOKUP、HLOOKUP、INDEX、MATCH均属于查找与引用类函数,SUMIFS属于数学与三角函数类的多条件求和函数。3.答案:ABD解析:数据查询语言(DQL)核心是SELECT查询语句,WHERE、GROUPBY、ORDERBY等均为SELECT语句的子句,属于DQL范畴。INSERT、UPDATE属于数据操纵语言(DML)范畴。4.答案:ABDE解析:描述性统计用于汇总、描述数据集的基本特征,包括集中趋势、离散程度、相关关系等指标。假设检验P值属于推断统计范畴,用于基于样本推断总体特征。5.答案:ABCD解析:数据预处理是数据分析前的核心准备环节,包括数据清洗、数据集成、数据变换、数据规约四大核心环节。数据可视化属于数据分析与展示环节。6.答案:ABC解析:饼图、环形图用于展示单一维度的整体构成占比;堆叠柱状图可同时展示不同类别下的内部结构占比。雷达图用于多维度指标综合对比,热力图用于展示矩阵数据的数值密度。7.答案:ABCE解析:pandas用于数据处理与分析,numpy用于数值计算,matplotlib用于数据可视化,scikit-learn用于机器学习建模,均为数据分析常用库。flask是PythonWeb开发框架,不属于数据分析工具库。8.答案:BCE解析:非概率抽样不遵循随机原则,由研究者根据主观判断或便捷性抽取样本,包括方便抽样、判断抽样、配额抽样、滚雪球抽样等。简单随机抽样、整群抽样属于概率抽样。9.答案:ABC解析:《数据安全法》明确我国实行数据分类分级保护制度,按数据重要程度及危害程度将数据分为一般数据、重要数据、核心数据三级,核心数据实行最严格的保护制度。10.答案:ABD解析:初级大数据分析师需具备基础数据处理、描述性分析、报告输出能力,复杂模型设计、企业级数据战略规划属于中高级大数据分析师的能力要求。三、判断题1.答案:×解析:大数据价值密度低,数据量与价值密度通常呈负相关,例如海量监控视频中,有效信息可能仅占几秒钟。2.答案:√解析:VLOOKUP函数语法为VLOOKUP(查找值,查找区域,返回列数,匹配类型),第四个参数为FALSE时执行精确匹配,为TRUE时执行近似匹配。3.答案:×解析:SQL中ORDERBY子句默认排序方式为升序(ASC),需降序排列时需指定DESC关键字。4.答案:√解析:中位数是位置代表值,仅与数据排序后的中间位置数值有关,不受极端值影响,因此比均值更适合描述偏态分布数据的集中趋势。5.答案:√解析:散点图以点的位置反映两个连续变量的取值,可直观展示变量间的相关方向和相关程度。6.答案:×解析:dropna()函数的作用是删除包含缺失值的行或列,fillna()函数才是用于填充缺失值。7.答案:√解析:分层抽样将总体按特征划分为若干层,层内差异小、层间差异大,样本代表性更强,因此抽样误差通常小于同等样本量的简单随机抽样。8.答案:√解析:不同变量的量纲、数值范围差异较大时无法直接对比或用于模型计算,数据标准化通过线性变换消除量纲差异,提升数据可比性。9.答案:×解析:饼图适合展示单一维度的构成占比,柱状图更适合展示多类别数据的数值大小对比。10.答案:×解析:《个人信息保护法》规定了处理个人信息的合法情形,除取得个人同意外,为履行法定职责、应对突发公共卫生事件、维护自然人生命财产安全等法定情形下,可无需取得个人同意处理个人信息。11.答案:√解析:Hive是Hadoop生态的分布式数据仓库工具,支持将结构化数据文件映射为表,提供类SQL的HiveQL查询功能,底层基于MapReduce或Spark执行计算。12.答案:×解析:标准差是衡量数据离散程度的核心指标,标准差越大,说明数据的离散程度越大。13.答案:×解析:数据透视表的值区域支持多种计算方式,包括求和、计数、平均值、最大值、最小值、方差等,可根据需求灵活设置。14.答案:×解析:皮尔逊相关系数仅衡量变量间的线性相关程度,系数为0仅说明不存在线性相关关系,可能存在非线性相关关系。15.答案:√解析:数据脱敏通过掩码、替换、加密变形等规则对敏感信息进行处理,在保证数据可用性的前提下实现敏感隐私数据的保护。四、简答题1.参考答案:数据清洗是对原始数据中存在的质量问题进行修正处理的过程,是数据预处理的核心环节,主要内容及方法如下:(1)缺失值处理:①删除法:直接删除缺失占比极低的记录或字段,适用于缺失对样本代表性无明显影响的场景;②填充法:包括均值/中位数/众数填充、固定值填充、相邻值填充、模型预测填充等,适用于缺失占比不高且数据有规律的场景;③保留法:将缺失值作为单独类别处理,适用于分类变量缺失的场景。(2分)(2)重复值处理:通过主键或多字段组合识别重复记录,通常采用直接删除法保留唯一值,保证数据唯一性。(1分)(3)错误值处理:对录入错误、格式错误、逻辑矛盾的数据进行修正,通过格式校验修正日期、数值格式问题,通过业务规则校验修正逻辑矛盾数据。(1分)(4)异常值处理:①识别方法:包括3σ原则、箱线图四分位距法、业务规则判断法、聚类法等;②处理方法:包括删除异常值、修正异常值、单独分析异常值、分位数替换等,需结合业务判断异常值是否为有效数据。(2分)(5)一致性处理:统一数据的格式、编码、度量单位、统计口径等,确保同一指标的表述规范一致。(1分)2.参考答案:常用数据可视化图表类型及适用场景如下:(1)柱状图:适用于不同类别数据的数值对比,如不同区域销售额对比、不同产品销量排名,堆叠柱状图还可展示各分类的内部结构占比。(1分)(2)折线图:适用于展示时间序列数据的变化趋势,如近12个月营收波动、日活用户变化趋势,可同时绘制多条折线对比多组序列的差异。(1分)(3)饼图/环形图:适用于展示单一维度的构成占比,如不同产品营收占比、不同渠道用户占比,类别数量建议控制在6类以内以保证可读性。(1分)(4)散点图:适用于展示两个连续变量的相关关系,如用户浏览时长与消费金额的相关性、广告投放量与转化量的相关性,可通过趋势线强化相关性展示。(1分)(5)箱线图:适用于展示数据的分布特征及异常值,如不同类别用户消费分布对比、不同批次产品质量指标波动,可直观呈现中位数、四分位数、异常值等统计量。(1分)(6)热力图:适用于展示矩阵数据的数值密度,如不同时段不同区域的用户活跃度分布、网页点击热力分布,通过颜色深浅直观反映数值高低。(1分)(答出5种及以上即可得满分,每少1种扣1分,表述不准确酌情扣分)3.参考答案:初级大数据分析师应遵守的核心数据伦理规范包括:(1)合法合规:严格遵守《数据安全法》《个人信息保护法》等法律法规,数据采集、存储、使用、传输等活动需符合法定要求或取得合法授权,不得非法处理个人信息和重要数据。(2分)(2)客观公正:确保数据来源可靠、处理过程规范,不得篡改、伪造数据,分析结论需基于客观数据事实,不得为迎合特定需求扭曲数据或误导结论,保证分析结果的公正性。(2分)(3)数据安全:严格遵守数据安全管理制度,妥善保管接触到的数据,不得违规泄露、倒卖、共享敏感数据,工作中采取脱敏、权限管控等必要措施防止数据泄露,符合数据分级保护要求。(2分)(4)隐私保护:处理个人信息遵循最小必要原则,仅采集分析必需的最少数据,对敏感个人信息必须进行脱敏处理,不得过度收集或滥用个人信息,尊重自然人隐私权益。(1分)五、实操分析题1.参考答案:(1)SUMIFS函数公式:=SUMIFS(E:E,C:C,"华北",D:D,"电器")(3分,参数顺序错误扣1分,区域引用错误扣1分,条件值错误扣1分)解析:SUMIFS函数语法为SUMIFS(求和区域,条件区域1,条件1,条件区域2,条件2...),本题求和区域为销售额列(E列),第一个条件区域为区域列(C列)、条件为“华北”,第二个条件区域为产品类别列(D列)、条件为“电器”。(2)操作方法(以排序功能为例):①选中“销售额”列任意数据单元格,点击顶部菜单栏“数据”选项卡中的“降序”按钮,将整张表按销售额从高到低排序;②排序后前3行对应的“订单编号”和“销售额”列即为排名前3的订单信息。(3分,回答使用LARGE+INDEX/MATCH函数组合且公式正确的同样得分,步骤不完整酌情扣分)(3)数据透视表操作步骤:①选中“销售表”中任意有数据的单元格,点击“插入”选项卡中的“数据透视表”按钮;②
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 2026中国膜反应器在生物转化过程中的优化设计报告
- 2026全球医疗器械CDMO行业转移趋势与竞争格局分析报告
- 2026低压电缆行业节能减排技术与政策响应报告
- 2026板材企业新媒体营销效果评估与优化报告
- 2026中国液体化工物流行业市场供需平衡与产能调整策略报告
- 2026中国皮肤科用药行业产销数据与渠道分析研究报告
- 2026中国三四线城市饮料消费习惯与广告触达渠道报告
- 2026金融科技监管服务行业市场供需分析及投资前景布局规划分析报告
- 2026中国半导体材料人才培养体系与产业需求匹配度研究
- 农村基础设施建设项目进度调整方案
- 2025~2026学年陕西省西安市滨河学校九年级上学期第一次月考物理试卷
- 长江存储在线测评题库
- 大型展会现场安全管理手册
- T∕ZZB 0446-2018 风力发电用电缆固定头
- 电仪部安全培训内容课件
- 2025年优抚医院招聘面试题集及解析
- 2025至2030年中国陶瓷纤维纸行业市场发展现状及投资方向研究报告
- DB42∕T 1714-2021 湖北省海绵城市规划设计规程
- 履约能力及交货进度保证措施
- 2025年咸阳社区专职工作人员招聘真题
- 《钢结构设计原理》课件 第4章 轴心受力构件
评论
0/150
提交评论