版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
2025年大数据技术与应用(中级)考试试卷考试时间:120分钟总分:100分考试形式:闭卷(实务操作题可采用上机实操考核)一、单项选择题(共20题,每题1分,共20分。每题的备选项中,只有1个最符合题意)1.根据《数据要素×三年行动计划(2024-2026年)》,下列不属于数据要素重点应用领域的是()A.工业制造B.现代农业C.虚拟货币D.商贸流通2.下列关于湖仓一体架构核心特征的描述,错误的是()A.支持结构化、半结构化、非结构化多模数据统一存储与处理B.采用存算紧耦合架构,计算与存储节点绑定部署C.具备ACID事务支持能力,保障数据读写一致性D.提供统一元数据管理层,实现跨引擎元数据互通3.下列数据库产品中,不属于向量数据库的是()A.PineconeB.MilvusC.MongoDBD.Weaviate4.DataOps的核心目标是()A.实现数据存储成本的最小化B.打通数据全链路协作,实现数据价值的敏捷交付C.提升大数据集群的计算性能D.构建企业级数据安全防护体系5.下列场景中,最适合采用纵向联邦学习的是()A.华东地区与西南地区的两家城商行联合构建信贷反欺诈模型B.某电商平台与同生态内的短视频平台联合构建用户价值评估模型C.某制造企业旗下两家分公司联合构建设备故障预测模型D.某省医保局与下属地市医保局联合构建医保骗保识别模型6.Spark3.5版本的自适应查询执行(AQE)特性,不支持的功能是()A.动态合并Shuffle分区B.动态调整连接策略(如SortMergeJoin转BroadcastJoin)C.动态优化数据倾斜的Join操作D.动态调整集群的CPU与内存资源配额7.根据DAMA-DMBOK2数据管理知识体系,下列不属于核心数据管理域的是()A.数据质量B.元数据管理C.数据估值D.数据安全8.以下数据采集方式中,属于非侵入式采集且对业务系统影响最小的是()A.前端代码埋点采集用户行为数据B.基于数据库日志的CDC采集业务变更数据C.业务接口主动上报业务数据D.后台业务逻辑嵌入埋点采集业务流程数据9.云原生大数据存算分离架构的核心优势是()A.计算资源与存储资源可独立弹性扩缩容B.数据计算的网络延迟低于存算耦合架构C.存储节点可承载高密度计算任务D.无需依赖分布式存储系统10.在检索增强生成(RAG)技术体系中,大数据系统的核心作用是()A.训练大模型的基础参数B.构建并检索外部知识库向量,为大模型提供精准上下文C.对大模型进行指令微调D.直接生成自然语言回答11.根据2024年施行的《网络数据安全管理条例》,下列属于重要数据的是()A.某互联网企业的员工考勤数据B.某连锁超市的会员消费明细数据C.关键信息基础设施的运行日志数据D.某餐饮企业的门店营收数据12.下列关于维度建模星型模型与雪花模型的描述,正确的是()A.星型模型维度表存在冗余,查询性能更高B.雪花模型维度表冗余度更高,存储成本更高C.星型模型更适合复杂层级维度的深度分析D.雪花模型的查询效率高于星型模型13.Flink流处理中水位线(Watermark)的核心作用是()A.标记数据的处理时间戳B.衡量事件时间的进度,处理乱序流的窗口计算C.控制数据流的传输速率,实现流量控制D.实现状态数据的持久化备份14.下列指标中,不属于数据质量核心评估维度的是()A.完整性B.一致性C.时效性D.稀缺性15.下列NoSQL数据库中,属于宽列存储类型的是()A.RedisB.HBaseC.Neo4jD.Elasticsearch16.下列组件中,不属于大数据任务调度系统核心组件的是()A.DAG定义模块B.调度器C.执行器D.NameNode17.下列元数据类型中,属于业务元数据的是()A.数据表的字段类型与长度B.数据的血缘关系链路C.核心业务指标的口径定义D.数据文件的存储路径18.下列关于HDFS纠删码(ErasureCoding)技术的描述,正确的是()A.纠删码的存储冗余度高于三副本策略B.纠删码的读写性能优于三副本策略C.纠删码更适合存储访问频率较低的冷数据D.纠删码不具备数据容错能力19.下列可视化图表中,最适合展示数据分布的离散程度与异常值的是()A.折线图B.箱线图C.饼图D.柱状图20.大数据应用开发的瀑布模型中,需求调研完成后的第一个核心开发环节是()A.部署上线B.架构设计C.数据采集D.测试验证二、多项选择题(共10题,每题2分,共20分。每题的备选项中,有2个或2个以上符合题意,至少有1个错项。错选、多选、少选均不得分)1.《数据要素×三年行动计划(2024-2026年)》明确提出的重点行动领域包括()A.工业制造B.现代农业C.金融服务D.虚拟经济2.湖仓一体架构的核心技术特征包括()A.统一多模存储底座B.全局统一元数据管理C.强事务一致性支持D.存算分离弹性架构3.向量数据库的典型应用场景包括()A.大模型RAG知识库检索B.图像/视频相似度匹配C.推荐系统召回阶段D.金融核心交易记账4.下列属于隐私计算主流技术路径的有()A.联邦学习B.多方安全计算C.差分隐私D.可信执行环境5.Flink批流一体架构的核心优势包括()A.统一的API接口,批流开发逻辑复用B.同一执行引擎支持批数据与流数据处理C.统一的状态管理机制D.仅支持事件时间语义6.企业级数据治理的核心目标包括()A.提升数据质量,保障数据可信B.强化数据安全,实现合规使用C.打通数据孤岛,释放数据价值D.增加数据存储规模7.大数据采集中的个人信息保护合规要求包括()A.采集前获得用户明确同意B.采集范围与用户授权范围一致C.可随意采集用户的敏感个人信息D.采取加密等安全措施保护采集的数据8.Spark自适应查询执行(AQE)能够解决的性能问题包括()A.Shuffle分区数设置不合理导致的小文件或资源浪费问题B.连接策略选择不当导致的性能下降问题C.数据倾斜导致的任务运行缓慢问题D.集群资源不足导致的任务排队问题9.元数据管理的核心价值体现在()A.支撑数据血缘追踪,快速定位数据问题根源B.统一数据口径,避免业务指标歧义C.构建数据资产目录,提升数据检索效率D.直接提升数据计算的执行速度10.与大模型直接生成回答相比,RAG技术的优势包括()A.降低大模型幻觉,提升回答准确性B.知识更新灵活,无需重新训练大模型C.适配企业私有知识场景,降低部署成本D.完全不需要大模型参与三、判断题(共10题,每题1分,共10分。请将答案填写在题后的括号内,正确填“√”,错误填“×”)1.数据要素作为新型生产要素,仅指结构化的业务经营数据。()2.湖仓一体架构中,数据湖用于存储冷数据,数据仓库用于存储热数据,二者相互独立。()3.向量数据库的相似度检索性能与所采用的向量索引算法直接相关。()4.横向联邦学习适用于参与方用户重叠度高、特征重叠度低的业务场景。()5.Flink流处理中,水位线设置的延迟越长,乱序数据的处理准确性越高,但整体计算延迟也越高。()6.数据治理是一次性项目,完成全部治理任务后即可结项停止。()7.DAMA-DMBOK2数据管理知识体系中,元数据管理是核心数据管理域之一。()8.HDFS纠删码技术的存储利用率高于三副本策略,因此适合存储高频访问的热数据。()9.大模型参数微调所需的数据集规模远小于预训练阶段的数据集规模。()10.数据质量的一致性维度,是指同一数据实体在不同业务系统、不同统计口径下的取值保持统一。()四、简答题(共4题,每题5分,共20分)1.请简述湖仓一体架构相较于传统“数据湖+独立数据仓库”架构的核心优势。2.请简述检索增强生成(RAG)技术的核心工作流程。3.请列出数据质量评估的5个核心维度,并简要说明各维度的含义。4.请简述DataOps的核心理念及3项关键实践。五、实务操作题(共2题,每题15分,共30分)1.某电商企业计划搭建实时用户行为分析系统,用于实时监控页面浏览量(PV)、独立访客数(UV)、商品点击量、订单转化率等核心运营指标。已知数据来源为APP端用户行为埋点日志,单条日志大小约1KB,峰值每秒写入数据量达10万条,要求实时指标延迟不超过5秒,同时支持30天内的明细数据回溯查询。请结合大数据技术栈回答以下问题:(1)请设计该系统的整体技术架构,说明各层级的核心组件及主要作用。(8分)(2)请说明海量用户场景下实时UV统计的优化方案,兼顾统计精度与性能开销。(7分)2.某制造企业拥有生产设备运行数据、供应链采购数据、产品销售数据等多源异构数据,分散在MES、ERP、CRM等不同业务系统中,存在数据口径不统一、数据质量参差不齐、跨部门数据共享困难等问题。该企业计划构建企业级数据治理体系,并在此基础上结合大模型搭建智能数据问答系统,降低业务人员的数据分析门槛。请回答以下问题:(1)请设计该企业的数据治理体系框架,说明各组成模块的核心职能。(9分)(2)请说明数据治理能力对智能问答系统中RAG技术落地的支撑作用。(6分)参考答案及评分标准一、单项选择题(每题1分,共20分)1.C2.B3.C4.B5.B6.D7.C8.B9.A10.B11.C12.A13.B14.D15.B16.D17.C18.C19.B20.B二、多项选择题(每题2分,共20分)1.ABC2.ABCD3.ABC4.ABCD5.ABC6.ABC7.ABD8.ABC9.ABC10.ABC三、判断题(每题1分,共10分)1.×2.×3.√4.×5.√6.×7.√8.×9.√10.√四、简答题(每题5分,共20分)1.参考答案要点:(1)统一存储底座:避免数据在数据湖与数仓之间重复存储和迁移,降低存储成本,减少数据不一致风险;(1分)(2)统一元数据管理:实现跨引擎、跨系统的元数据互通,统一数据口径,消除数据孤岛;(1分)(3)多模数据支持:支持结构化、半结构化、非结构化数据的统一存储与分析,适配更多业务场景;(1分)(4)事务一致性保障:提供ACID事务支持,保障数据读写的可靠性与一致性,解决数据湖缺乏事务支持的问题;(1分)(5)存算分离架构:计算资源与存储资源可独立弹性扩缩容,提升资源利用率,降低运维成本;(0.5分)(6)统一计算接口:支持同一套API处理批流、多模数据,降低开发人员学习成本,提升开发效率。(0.5分)评分说明:答对5点及以上得满分,表述合理可酌情给分。2.参考答案要点:RAG的核心工作流程分为知识库构建和问答生成两个阶段,具体如下:(1)知识库构建阶段:①数据预处理:对外部文档、业务数据等进行清洗、去重、格式统一;②文本切片:将长文本按语义拆分为合适长度的知识片段;③向量化:通过嵌入模型将知识片段转化为向量表示;④向量存储:将向量与对应的原始文本存入向量数据库,建立索引。(2分)(2)问答生成阶段:①问题向量化:将用户提问通过同一嵌入模型转化为向量;②相似度检索:在向量数据库中检索与问题向量最相似的TopN个知识片段;③Prompt构建:将检索到的知识片段与用户问题整合为结构化Prompt;④生成回答:将Prompt输入大模型,由大模型基于检索到的知识生成准确回答。(3分)评分说明:流程逻辑清晰,覆盖核心环节得满分,表述合理可酌情给分。3.参考答案要点:(1)完整性:指数据的记录、字段是否完整,是否存在缺失情况,是数据可用性的基础;(1分)(2)准确性:指数据是否真实反映业务实际情况,是否存在错误值、异常值;(1分)(3)一致性:指同一数据实体在不同系统、不同表、不同场景下的取值是否统一,是否存在矛盾;(1分)(4)时效性:指数据是否能及时更新并提供给业务使用,是否满足业务的时间要求;(1分)(5)唯一性:指数据是否存在重复记录,是否符合唯一约束规则。(1分)评分说明:每个维度名称+含义各0.5分,答对5个得满分,表述合理可酌情给分。4.参考答案要点:核心理念:DataOps是将敏捷开发、DevOps理念引入数据领域的方法论,以数据为中心,打通数据开发、运维、业务等跨团队的协作壁垒,实现数据全生命周期的自动化、标准化管理,最终达成数据价值的敏捷、持续交付。(2分)关键实践(答出3项即可):(1)数据流水线自动化:构建覆盖数据采集、清洗、转换、部署、监控的全链路自动化流水线,减少人工操作,提升交付效率;(1分)(2)版本控制管理:对数据开发代码、元数据、配置规则、调度任务等进行版本管理,支持回溯与审计;(1分)(3)数据质量左移:在数据流水线各节点嵌入质量校验规则,实现质量问题的提前发现与预警,避免问题数据向下游流转;(1分)(4)统一协作平台:构建统一的数据开发、管理、服务平台,实现跨团队的信息共享与协同工作;(5)持续度量优化:建立数据交付效率、质量、成本的度量指标体系,持续迭代优化数据流程。评分说明:核心理念表述准确得2分,关键实践答出3项得3分,表述合理可酌情给分。五、实务操作题(每题15分,共30分)1.参考答案要点:(1)整体技术架构分为5个核心层级,具体如下:①数据采集层:采用轻量客户端埋点SDK+边缘采集Agent的架构。SDK负责APP端用户行为数据的采集、本地缓存与批量上报,支持断点续传,保证数据不丢失;Agent负责接收上报数据并进行初步过滤、格式化,降低下游处理压力。(1.5分)②消息缓冲层:采用Kafka集群作为消息队列,承接采集层上报的高并发日志数据,实现削峰填谷与上下游解耦。配置多副本保障数据可靠性,按峰值吞吐量配置12个以上分区(单分区吞吐约1万条/秒),满足10万条/秒的峰值写入需求。(1.5分)③实时计算层:采用Flink作为核心计算引擎,基于事件时间语义处理流数据,通过Watermark机制处理乱序日志,实现PV、UV、转化率等指标的实时计算;采用RocksDB状态后端+Checkpoint机制,保障大状态下的性能与可靠性,满足端到端延迟不超过5秒的要求。(2分)④数据存储层:采用多存储组件适配不同场景:实时指标结果写入Redis集群,提供毫秒级查询性能;明细数据与维度分析数据写入ClickHouse,支持30天内的多维回溯查询;原始日志写入对象存储(如OSS、S3),用于离线分析与数据归档,降低存储成本。(2分)⑤应用服务层:构建统一的指标API服务,对接可视化平台(如Grafana、Superset)实现实时指标的大屏展示、告警通知,支撑运营决策。(1分)评分说明:架构层级清晰,组件选型合理,作用说明准确得8分,表述合理可酌情给分。(2)海量用户场景下的实时UV统计优化方案,需兼顾精度与性能,具体如下:①核心问题:传统基于HashSet的去重方案在用户量达到千万级以上时,内存开销会指数级增长,无法支持大规模场景,需要采用更高效的去重算法。(1分)②方案选型:若业务允许一定误差(如误差率1%以内),可采用布隆过滤器(BloomFilter)实现去重:通过多个哈希函数将用户ID映射到位图中,内存开销极低(1亿用户仅需约12MB内存),但存在少量误判率(仅会将未访问的用户误判为已访问,不会漏算),适用于对精度要求不高的快速统计场景。(2分)若业务要求100%统计精度,可采用RoaringBitmap(压缩位图)实现去重:将用户ID映射为32位整数,通过分桶压缩的方式存储位图,相比普通位图压缩率可达90%以上,既保证去重精度,又大幅降低内存开销,是工业界的主流方案。(2分)③多维UV优化:对于按渠道、地区、商品等多维度拆分的UV统计,采用FlinkKeyedState,每个维度组合对应一个独立的RoaringBitmap,结合状态TTL机制清理过期状态,进一步降低内存开销。(1分)④容错保障:通过FlinkCheckpoint机制定期对状态数据做快照,故障时可从最近的Checkpoint恢复,保证数据仅计算一次的一致性语义。(1分)评分说明:方案逻辑清晰,算法选型合理,兼顾精度与性能得7分,表述合理可酌情给分。2.参考答案要点:(1)该企业的数据治理体系框架可分为决策层、执行层、应用层与保障体系四部分,具体职能如下:①治理决策层:由企业高层、各业务部门负责人组成的数据治理委员会作为最高决策机构,下设数据Owner(业务部门负责人)、数据管家(技术/业务专员)。核心职能是制定数据治理战略目标、数据标准规范、考核激励机制,协调跨部门资源,推动治理项目落地。(2分)②治理执行层:是数据治理的核心落地模块,包含6个核心子模块:数据标准管理:制定企业统一的数据命名规范、字段格式、编码规则、指标口径,作为全链路数据处理的依据;(1分)元数据管理:采集全链路技术元数据、业务元数据、操作元数据,构建数据资产目录与数据地图,支撑数据血缘追踪、影响分析;(1分)数据质量管理:制定完整性、准确性、一致性等维度的质量校验规则,构建质量监控、告警、整改的闭环流程,持续提升数据质量;(1分)数据安全管理:对数据进行分级分类,落实细粒度权限控制、敏感数据脱敏、审计日志、隐私计算等安全措施,保障数据合规使用;(1分)主数据管理:统一管理企业核心主数据(如物料主数据、设备主数据、客户主数据),实现
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 2026年注册验船师资格考试(A级船舶检验专业能力)经典试题及答案二
- 2026年养老护理员(高级)专业试题考试试卷及答案
- 2026年05月招商银行总行同业客户部招考笔试历年参考题库附带答案
- 2026无糖茶饮市场发展现状与产品创新方向预测报告
- 2025年甘肃省政府采购评审专家考试测试题及答案
- 2025年儿科医生执业资格考试试题及答案解析
- 2025年电子设备装接工岗位职业技能资格知识考试题库(附含答案)
- 2025年VTE防治护理管理制度及相关知识考核试题及答案
- 2024放射医学正高级职称考试题库
- 【2025年】广东省惠州市【辅警协警】笔试真题(含答案)
- 35KV变电站施工方案
- 弱电集成项目部奖惩制度
- 【答案】《智能采矿》(河南理工大学)章节作业慕课答案
- 元气森林市场行业分析报告
- 西餐烹调基础-课件全套 重大版 项目1-7 西餐烹调基础知识 -西式快餐制作
- 2024年山东大学校长开学讲话稿8000字
- 标准制定立项汇报
- 2025年秋招:平安银行笔试真题及答案
- (2025)医院招聘护士考试题库(附参考答案)
- 水库大坝降等与报废评估导则
- 简易委托支付协议
评论
0/150
提交评论