2026年国企BI数据分析试卷(附答案)_第1页
2026年国企BI数据分析试卷(附答案)_第2页
2026年国企BI数据分析试卷(附答案)_第3页
2026年国企BI数据分析试卷(附答案)_第4页
2026年国企BI数据分析试卷(附答案)_第5页
已阅读5页,还剩23页未读 继续免费阅读

付费下载

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

2026年国企BI数据分析试卷(附答案)一、单项选择题(共15题,每题2分,共30分)1.在数据仓库的维度建模中,用于描述业务度量、且通常为数值型、可累加的数据,存储在哪种结构中?A.维度表B.事实表C.中间表D.聚合表答案:B2.某国企销售数据分析中,需要计算“本年累计销售额”,最适合使用以下哪种窗口函数?A.ROW_NUMBER()B.RANK()C.SUM()OVER(ORDERBYdate_column)D.LEAD()答案:C3.在评估分类模型(如客户流失预测)性能时,当正负样本比例极度不平衡(例如流失客户仅占1%),以下哪个指标通常比准确率(Accuracy)更具参考价值?A.精确率(Precision)B.召回率(Recall)C.F1-ScoreD.AUC-ROC值答案:D4.以下关于数据中台与数据仓库的描述,错误的是?A.数据仓库偏向于面向主题的、集成的、稳定的数据存储,用于支持管理决策。B.数据中台的核心目标是构建可复用、共享的数据能力,快速响应前台业务需求。C.数据中台通常包含数据仓库、数据湖等组件,是概念上的升级与整合。D.数据中台建成后,传统的数据仓库将被完全取代,不再需要。答案:D5.使用SQL进行数据分析时,想要找出“2025年每个季度,销售额均超过100万元的部门”,以下哪种方法最有效?A.使用WHERE子句过滤每个季度的销售额>100万,然后GROUPBY部门。B.使用GROUPBY部门、季度,然后HAVING每季度销售额>100万。C.使用GROUPBY部门,然后HAVINGCOUNT(CASEWHEN季度销售额>100万THEN1END)=4。D.为每个季度创建子查询,然后进行多表连接。答案:C6.在PowerBI或Tableau中,要创建一个能够展示不同年份、不同产品类别销售额对比,并支持向下钻取(如从年到季度到月)的可视化图表,最适合的图表类型是?A.饼图B.散点图C.树状图D.折线图与柱状图组合,并启用日期层次结构答案:D7.对于国企中大量的非结构化文本数据(如公文、客户服务记录)进行分析,以提取主题和情感倾向,通常采用哪种技术?A.关联规则挖掘B.自然语言处理(NLP)C.时间序列分析D.聚类分析答案:B8.在数据预处理阶段,发现“员工年龄”字段中存在值为“-1”和“200”的异常记录。从业务逻辑判断,合理年龄范围为18-65岁。处理此类数据的最佳实践是?A.直接删除包含异常值的整条记录。B.将异常值替换为字段的平均值。C.将异常值标记为缺失值(NULL),然后根据情况使用中位数或基于其他字段的预测值进行填充。D.保留异常值,在分析时可能具有特殊意义。答案:C9.线性回归模型y=βA.会提升模型的预测精度。B.会导致模型参数β的标准误减小,t检验更容易显著。C.会导致模型参数β的估计值变得不稳定,难以解释单个变量的影响。D.对模型没有任何实质性影响。答案:C10.在构建客户细分模型时,由于客户特征变量量纲不同(如年龄18-65,年收入5万-200万),直接使用欧氏距离进行K-Means聚类会产生偏差,应首先进行:A.数据归一化(Normalization)或标准化(Standardization)B.数据离散化C.主成分分析(PCA)D.特征组合答案:A11.A/B测试是互联网企业常用方法,在国企数字化转型中,可用于评估新上线的“智慧采购平台”界面效果。为了保证测试有效性,核心原则是?A.仅对年轻员工使用新界面。B.控制组和实验组的用户应随机分配,且在其他条件上尽可能一致。C.测试时间越长越好。D.实验组用户数量应远多于控制组。答案:B12.时间序列分析中,差分(Differencing)的主要目的是?A.提高序列的波动性。B.使非平稳时间序列变得平稳。C.增加数据的维度。D.消除数据的季节性。答案:B13.在数据治理框架中,确保数据在采集、处理、存储、应用全过程中准确、一致、完整,并符合业务规则的要求,属于哪个核心领域?A.数据标准管理B.数据质量管理C.数据安全管理D.元数据管理答案:B14.使用Python的pandas库进行数据分析,已知DataFrame`df`包含‘date’(日期)、‘department’(部门)、‘revenue’(收入)三列。要计算每个部门最近30天的滚动平均收入,正确的代码片段是?A.`df.groupby('department')['revenue'].rolling(window=30).mean()`B.`df.set_index('date').groupby('department')['revenue'].rolling(window='30D').mean()`C.`df['revenue'].rolling(window=30).mean()`D.`df.groupby('department').rolling(window=30,on='date')['revenue'].mean()`答案:B15.在解释决策树模型的结果时,若要评估每个特征对于预测目标变量(如“项目是否超预算”)的重要性,应查看:A.树的深度B.每个节点的样本数C.特征用于分裂节点所带来的不纯度减少的总量(如基尼不纯度或信息增益)D.叶子节点的值答案:C二、多项选择题(共5题,每题4分,共20分。全部选对得满分,少选得部分分,错选不得分)1.以下哪些场景属于典型的描述性分析(DescriptiveAnalytics)在国企BI中的应用?()A.生成上月集团各子公司利润对比仪表盘。B.预测下季度原材料价格走势。C.分析近三年客户投诉的主要原因分布。D.基于历史数据优化库存水平,给出建议采购量。E.报告本年截至目前为止的安全生产事故次数及类型统计。答案:A,C,E2.关于数据湖与数据仓库的区别,以下描述正确的有?()A.数据湖通常存储原始、未加工的数据,包括结构化和非结构化数据;数据仓库存储的是清洗、转换后的结构化数据。B.数据湖采用“写入型模式”(Schema-on-Write);数据仓库采用“读取型模式”(Schema-on-Read)。C.数据湖更适合用于探索性数据分析、机器学习;数据仓库更适合用于固定的商业报表和OLAP分析。D.数据湖的用户主要是数据科学家和工程师;数据仓库的用户主要是业务分析师和决策者。E.两者在技术架构上完全独立,无法共存于一个企业数据平台。答案:A,C,D3.在构建一个预测性维护模型(如预测设备故障)时,可能涉及到的数据挖掘和机器学习方法包括?()A.逻辑回归(用于预测故障概率)B.生存分析(用于预测故障时间)C.关联规则(用于发现故障与工况参数的关联)D.异常检测(用于识别设备运行状态的异常点)E.K近邻算法(用于基于历史相似设备状态进行分类)答案:A,B,C,D,E4.为确保BI报表的数据安全,防止敏感信息泄露(如员工薪酬、未公开财务数据),可以采取的措施有?()A.实施行级权限控制(RLS),使用户只能看到其权限范围内的数据。B.对敏感字段进行数据脱敏或加密存储。C.建立报表访问审计日志,追踪所有数据访问行为。D.所有报表数据都设置为公开可读,以提高透明度。E.在ETL过程中,对敏感数据使用哈希函数进行不可逆加密,但保留关联性。答案:A,B,C,E5.关于SQL优化以提高大数据量查询性能,以下哪些做法通常是有效的?()A.在WHERE子句和JOIN条件涉及的字段上建立合适的索引。B.尽量避免在WHERE子句中对字段进行函数操作(如`WHEREYEAR(date)=2025`)。C.使用`SELECT*`查询所有字段,以避免字段遗漏。D.将大的复杂查询拆分为多个临时表或CTE(公用表表达式),分步处理。E.在多表关联时,优先过滤掉不需要的数据行,再进行连接。答案:A,B,D,E三、填空题(共10空,每空2分,共20分)1.在数据仓库的星型模式中,位于中心的是______表,周围连接的是多个______表。答案:事实;维度2.衡量数据质量的六个核心维度通常包括:准确性、完整性、一致性、______、______和时效性。答案:唯一性;有效性(或“规范性”,顺序可调)3.在假设检验中,我们通常会设定一个显著性水平α(如0.05),它代表了拒绝______假设时可能犯错的概率,即______错误的最大允许概率。答案:原;第一类(或I型)4.主成分分析(PCA)是一种______技术,其目的是在尽可能保留原始数据信息的前提下,将高维数据降维到低维空间,新的变量称为主成分,它们是原始变量的______组合。答案:降维(或特征提取);线性5.在时间序列预测模型ARIMA(p,d,q)中,参数p代表______阶数,d代表______阶数,q代表移动平均阶数。答案:自回归;差分四、简答题(共4题,每题10分,共40分)1.请简述在国企BI项目中,数据治理的主要内容和意义。答案:主要内容包括:(1)数据质量管理:制定数据质量标准,监控、评估和提升数据质量。(2)数据标准管理:定义业务术语、数据模型、编码规则等统一标准。(3)元数据管理:管理描述数据的数据,包括业务元数据、技术元数据、操作元数据,实现数据血缘追踪和影响分析。(4)数据安全管理:制定数据分类分级策略,实施访问控制、加密、脱敏等安全措施。(5)数据生命周期管理:规定数据从创建、存储、使用到归档、销毁的全过程管理策略。意义:确保企业数据的准确性、一致性、安全性和可用性,为BI和分析提供可信的数据基础;降低数据理解和使用的成本;提升数据资产价值,支撑数据驱动的决策和业务创新;满足外部法规(如《数据安全法》)的合规要求。2.现有一个销售数据表`sales`,字段包括:`sale_id`(销售单号),`sale_date`(销售日期),`product_id`(产品ID),`quantity`(销售数量),`unit_price`(单价)。请写出SQL语句,计算“2025年第二季度(4月-6月)每个产品的总销售额,并按总销售额从高到低排序,仅显示前10名”。答案:```sqlSELECTproduct_id,SUM(quantity*unit_price)AStotal_sales_amountFROMsalesWHEREsale_date>='2025-04-01'ANDsale_date<='2025-06-30'GROUPBYproduct_idORDERBYtotal_sales_amountDESCLIMIT10;```(注:日期范围判断也可用`BETWEEN`或`YEAR(sale_date)=2025ANDMONTH(sale_date)IN(4,5,6)`,`LIMIT`在某些数据库中用`TOP`或`ROWNUM`)3.解释什么是过拟合(Overfitting),并列举三种在机器学习模型中防止或减轻过拟合的常用方法。答案:过拟合是指模型在训练数据上表现非常好(误差很小),但在未见过的测试数据或新数据上表现显著下降的现象。模型过于复杂,学习了训练数据中的噪声和偶然规律,导致泛化能力差。防止或减轻过拟合的方法:(1)增加训练数据量。(2)使用正则化技术,如在损失函数中加入L1(Lasso)或L2(Ridge)正则化项,惩罚过大的模型参数。(3)简化模型复杂度,如减少决策树的深度、神经网络的层数或神经元数量。(4)使用交叉验证来评估模型泛化能力并选择合适参数。(5)集成学习方法,如随机森林(通过Bagging减少方差)。(6)对于神经网络,可以使用Dropout技术。(答出任意三种即可)4.在BI可视化设计原则中,“图表垃圾”(Chartjunk)是指什么?请举例说明,并阐述如何避免。答案:“图表垃圾”是指图表中所有非必要、冗余、干扰数据信息传达的视觉元素。它不仅不能提供有效信息,反而会分散读者注意力,增加认知负担,甚至误导解读。举例:(1)过度使用3D效果,使柱状图或饼图难以准确比较。(2)不必要的背景图片、阴影、渐变填充。(3)过于密集和花哨的网格线、边框。(4)滥用爆炸式切片、夸张的动画效果。(5)使用与数据无关的装饰性图标。如何避免:(1)遵循“数据墨水比最大化”原则,即图表中每一滴墨水都应用于传达数据信息。(2)简化设计,移除所有非数据元素和冗余的数据元素。(3)谨慎使用颜色,确保其有明确的信息编码意义(如区分类别、表示数值大小)。(4)选择合适的图表类型,确保能清晰、准确地呈现数据关系和模式。(5)保持视觉一致性,便于读者理解和比较。五、综合应用题(共2题,第1题20分,第2题30分,共50分)1.报表需求分析与SQL实现(20分)背景:某大型国企人力资源部门希望分析员工培训效果。现有三张数据表:`employee`(员工表):`emp_id`(员工编号),`dept_id`(部门编号),`hire_date`(入职日期),`job_level`(职级,1-5级)。`training`(培训课程表):`course_id`(课程ID),`course_name`(课程名称),`hours`(课时),`category`(类别,如‘技术’、‘管理’)。`training_record`(培训记录表):`record_id`(记录ID),`emp_id`,`course_id`,`score`(考核成绩,0-100分),`complete_date`(完成日期)。(1)2025年度,每个部门员工参与培训的平均课时数。(2)2025年度,每个培训类别(category)下,员工考核成绩的平均分及合格率(成绩≥60分为合格)。问题:(1)请根据上述需求,设计并写出计算这两个指标的SQL查询语句。(12分)(2)假设在运行查询时,发现`training_record`表中`complete_date`字段存在少量记录为NULL(表示课程未完成),`score`字段也存在NULL(表示未考核)。你的SQL语句应如何妥善处理这些NULL值,以确保计算结果的准确性?请在你的查询中体现或说明。(8分)答案:(1)SQL查询语句设计:```sql需求(1):2025年度,每个部门员工参与培训的平均课时数假设:平均课时数=该部门员工在2025年完成的所有培训课程总课时/该部门在2025年有培训记录的员工人数(去重)SELECTe.dept_id,SUM(t.hours)AStotal_training_hours,COUNT(DISTINCTe.emp_id)AStrained_employee_count,ROUND(SUM(t.hours)*1.0/COUNT(DISTINCTe.emp_id),2)ASavg_hours_per_employeeFROMtraining_recordtrINNERJOINemployeeeONtr.emp_id=e.emp_idINNERJOINtrainingtONtr.course_id=t.course_idWHEREtrplete_dateISNOTNULL--仅考虑已完成的培训ANDYEAR(trplete_date)=2025GROUPBYe.dept_idORDERBYe.dept_id;需求(2):2025年度,每个培训类别下,员工考核成绩的平均分及合格率SELECTt.category,COUNT(tr.record_id)AStotal_records,--总考核记录数AVG(tr.score)ASavg_score,--平均成绩(自动忽略NULL)SUM(CASEWHENtr.score>=60THEN1ELSE0END)ASpass_count,ROUND(SUM(CASEWHENtr.score>=60THEN1ELSE0END)*100.0/COUNT(tr.score),2)ASpass_rate_percentage--合格率,基于有成绩的记录计算FROMtraining_recordtrINNERJOINtrainingtONtr.course_id=t.course_idWHEREtrplete_dateISNOTNULLANDYEAR(trplete_date)=2025ANDtr.scoreISNOTNULL--仅统计有考核成绩的记录GROUPBYt.categoryORDERBYt.category;```(2)NULL值处理说明:对于需求(1)“平均课时数”:`training_recordplete_date`为NULL的记录表示培训未完成,不应计入培训效果统计。因此在WHERE子句中明确添加`trplete_dateISNOTNULL`条件进行过滤。`score`字段在此需求中无关。对于需求(2)“平均分及合格率”:除了需要`complete_date`不为NULL,还需要`score`不为NULL,因为NULL成绩无法参与平均分计算,也无法判断是否合格。因此在WHERE子句中添加`tr.scoreISNOTNULL`。在计算合格率时,分母使用`COUNT(tr.score)`而非`COUNT(*)`,确保分母与分子(通过CASEWHEN计算)的统计口径一致,都是针对有成绩的记录。`AVG()`函数会自动忽略NULL值。2.业务场景建模与数据分析(30分)背景:某能源国企拥有多个大型发电厂,计划构建一个BI分析系统,用于监控和优化发电厂的运营效率。其中一个核心分析主题是“设备能效分析与预测”。数据:已收集到某电厂一台关键发电机组过去一年的运行数据,采样频率为每小时一次。主要字段包括:`timestamp`(时间戳)`power_output`(实际发电功率,MW)`fuel_input`(燃料消耗量,吨标准煤/小时)`steam_pressure`(主蒸汽压力,MPa)`cooling_water_temp`(冷却水温度,℃)`ambient_temp`(环境温度,℃)`equipment_status`(设备状态,如‘正常运行’,‘降负荷运行’,‘停机检修’)业务目标:1.能效评估:计算并监控发电机组的“发电煤耗率”(每发一度电消耗的标准煤克数),这是衡量能效的核心指标。公式:发电煤耗率g/kWh=燃料消耗量2.能效预测与因素分析:管理者希望了解哪些运行参数(如主蒸汽压力、冷却水温度、环境温度)对发电煤耗率有显著影响,并希望能基于这些参数预测未来的煤耗率,从而进行运行优化。问题:(1)指标计算与可视化(10分):请根据上述数据与公式,写出计算每小时“发电煤耗率”的具体步骤或SQL/Python伪代码。为了直观展示能效变化,你会选择哪种类型的时间序列图表来展示“发电煤耗率”随时间的变化趋势?并说明理由。(2)预测模型构建(12分):为了分析运行参数对煤耗率的影响并进行预测,你计划建立一个回归模型。a.你会选择哪种或哪几种回归模型?请说明理由。b.在构建模型前,需要对数据和变量进行哪些必要的预处理和检查?c.如何评估你所构建的回归模型的预测性能?请列出至少两个评估指标并解释其含义。(3)深度分析与建议(8分):假设你的回归模型结果显示,“环境温度”和“冷却水温度”与“发电煤耗率”呈显著的负相关(即温度越高,煤耗率越低),而“主蒸汽压力”与煤耗率呈正相关。从发电厂热力学的物理原理角度,尝试解释“环境温度”呈负相关可能的原因。基于你的分析,可以向电厂运营人员提出哪些具体的优化建议?答案:(1)指标计算与可视化:计算步骤/SQL伪代码:```sql假设原始数据表为plant_operationSELECTtimestamp,power_output,--MWfuel_input,--吨标准煤/小时计算发电煤耗率(g/kWh)(fuel_input*1000000)/(power_output*1000*1)AScoal_consumption_rate_g_per_kwh燃料消耗量(克)=fuel_input*10^6发电量(kWh)=功率(MW)*1000(转换为kW)*时间(1小时)FROMplant_operationWHEREequipment_status='正常运行';--通常只分析正常运行状态下的能效```Python(pandas)伪代码:```pythondf['coal_rate']=(df['fuel_input']*1e6)/(df['power_output']*1000)```可视化选择:我会选择折线图来展示“发电煤耗率”随时间的变化趋势。理由:折线图是展示时间序列数据连续变化趋势最直观、最有效的图表类型。它能清晰显示煤耗率随时间(小时点)的波动、周期性(如日周期、季节周期)以及长期趋势(如设备老化导致的能效缓慢下降),便于运营人员快速捕捉异常点(如煤耗率突然飙升)和规律。(2)预测模型构建:a.模型选择及理由:多元线性回归:假设因变量(煤耗率)与多个自变量(蒸汽压力、水温、环境温度等)之间存在线性关系,模型简单、可解释性强,可以明确给出每个运行参数对煤耗率的影响系数(正负和大小)。这是首选的基准模型。岭回归(Ridge)或套索回归(Lasso):如果自变量之间存在较强的多重共线性(如不同温度参数可能相关),使用这些带正则化的线性回归变体可以防止过拟合,提高模型稳定性。Lasso还能进行特征选择。决策树回归或随机森林回归:如果变量间存在复杂的非线性关系,树模型可以自动捕捉这些关系,且

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论