2026年大数据概论试题附答案_第1页
2026年大数据概论试题附答案_第2页
2026年大数据概论试题附答案_第3页
2026年大数据概论试题附答案_第4页
2026年大数据概论试题附答案_第5页
已阅读5页,还剩16页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

2026年大数据概论试题附答案一、单项选择题(每题2分,共30分)1.当前业界普遍认可的大数据核心特征4V模型中,用来描述大数据产生、传输和处理速度快的特征是()A.VolumeB.VelocityC.VarietyD.Value2.在大数据分布式存储架构中,专门面向大文件分布式存储、支持高可扩展性、开源的非结构化数据存储系统是()A.MySQLB.HDFSC.OracleD.Redis3.数据预处理环节中,以下哪种方法不属于常用的缺失值处理方案()A.删除含缺失值的样本B.同属性均值/中位数填充C.特征离散化D.基于机器学习模型预测填充4.以下机器学习算法中,属于无监督学习算法的是()A.逻辑回归B.K-MeansC.随机森林D.XGBoost5.生成式大模型时代,训练大数据的哪项属性直接决定了大模型输出内容的事实准确性和可信度()A.数据规模B.数据一致性C.数据真实性D.数据多样性6.下列选项中,属于Hadoop原生生态系统中分布式并行计算框架的是()A.YARNB.MapReduceC.HBaseD.ZooKeeper7.企业开展数据治理的核心目标不包括以下哪项()A.提升全链路数据质量B.保障数据安全合规C.直接降低所有业务的硬件投入成本D.打通数据孤岛释放数据要素价值8.以下选项中,属于半结构化数据的是()A.手机拍摄的人像图片B.无格式标注的纯文本文档C.JSON格式的网络接口返回数据D.网络平台发布的短视频文件9.用户画像构建过程中,对用户行为标签进行权重分配时,最常用的关键词权重计算方法是()A.TF-IDFB.逻辑回归C.线性回归D.K近邻算法10.根据我国《数据安全法》相关规定,核心重要数据的处理者应当按照规定至少多久开展一次数据安全风险评估,并将评估报告报送相关主管部门()A.每半年B.每年C.每两年D.每三年11.流大数据处理与批大数据处理最核心的区别是()A.可处理的数据总规模不同B.数据处理的时间窗口和触发机制不同C.数据存储介质不同D.使用的计算框架不同12.特征工程操作中,将不同取值范围的特征缩放到统一区间,以此加快模型训练收敛速度、提升模型精度的操作是()A.特征选择B.特征编码C.特征缩放D.特征降维13.以下技术中,属于当前大数据领域主流隐私计算技术的是()A.联邦学习B.深度学习C.迁移学习D.强化学习14.智慧城市实时道路拥堵预测场景中,核心依赖哪种大数据处理模式()A.离线批处理B.实时流处理C.批量数据挖掘D.数据仓库聚合查询15.数仓建模的分层架构中,用来存储采集到的原始业务数据、保持数据原貌的层级是()A.ODS层B.DWD层C.DWM层D.DWS层二、多项选择题(每题3分,共30分)1.大数据技术的典型落地场景包括以下哪些领域()A.互联网精准营销B.公共卫生疾病预测预警C.自动驾驶模型训练D.智慧城市算力调度2.完整的数据预处理环节主要包括以下哪些核心步骤()A.数据清洗B.数据集成C.数据变换D.数据归约3.当前主流隐私计算的核心技术路线包括()A.联邦学习B.安全多方计算C.差分隐私D.同态加密4.以下选项中,属于典型非结构化数据的有()A.社交媒体平台的用户上传图片B.智能客服的用户语音通话录音C.企业ERP系统中的结构化业务表格D.短视频平台的用户上传内容5.Hadoop大数据生态的核心基础组件包括()A.HDFS分布式文件系统B.MapReduce计算框架C.YARN资源调度器D.HBase分布式数据库6.数据质量评估的核心维度包括以下哪几项()A.准确性B.完整性C.一致性D.及时性7.生成式AI大模型训练数据治理过程中,需要重点解决的核心问题包括()A.训练数据的知识产权权属问题B.低质量噪声数据的过滤清洗C.训练数据中敏感个人信息的脱敏D.消除训练数据中的算法偏见8.以下机器学习算法中,属于监督学习算法的有()A.决策树B.支持向量机C.K-Means聚类D.朴素贝叶斯9.我国数据安全合规管理中,处理个人信息和重要数据应当遵循的基本原则包括()A.数据最小化B.目的明确化C.知情同意D.公开透明10.以下计算框架中,属于主流实时流大数据处理框架的有()A.SparkStreamingB.FlinkC.StormD.Hive三、判断题(每题1分,共10分)1.大数据分析只需要挖掘数据的相关性,完全不需要研究因果关系。()2.非结构化数据不存在结构规律,无法转化为结构化或半结构化数据进行分析。()3.横向联邦学习可以实现多个参与机构在不共享原始数据的前提下,联合训练机器学习模型。()4.数据仓库体系中的ODS层主要存放面向主题分析、已经清洗整合完成的数据。()5.Redis属于内存型NoSQL数据库,在大数据架构中常用来存储高频访问的热点数据,降低后端存储压力。()6.数据脱敏的核心目的是降低数据规模,减少企业存储成本投入。()7.K-Means聚类算法的聚类结果不会受到初始聚类中心选择的影响,具有很强的稳定性。()8.实时流处理系统的核心设计目标是低延迟,能够对到达的数据进行即时处理输出结果。()9.根据我国《个人信息保护法》规定,处理任何个人信息都必须取得个人的明确同意,不存在其他合法处理情形。()10.特征降维操作不仅可以减少特征维度降低计算量,还可以过滤数据噪声,提升模型的泛化能力。()四、简答题(每题8分,共40分)1.简述大数据4V特征的具体含义,结合生成式大模型的发展,说明4V内涵有什么新的延伸。2.请简述数据治理的核心定义,说明数据治理对当前人工智能产业发展的核心价值。3.请简述数据预处理的主要内容,说明为什么大数据分析项目中预处理环节的工作量占比通常超过60%。4.请简述隐私计算的核心概念,并列举3个典型的行业应用场景。5.对比离线批处理和实时流处理的核心技术特点,分别举例说明二者的适用场景。五、综合分析题(共40分)某头部网约车平台计划联合当地交通管理部门,构建城市核心区域实时拥堵预测系统,用于提前15-30分钟发布拥堵预警,引导市民错峰出行,优化区域交通管控方案。该项目可调用的数据资源包括:平台过去3年积累的120亿条历史订单GPS轨迹数据、城市交通卡口的实时摄像头识别数据、当地气象部门的实时天气数据、地铁公交等公共交通的实时运营数据、近3年的节假日出行规律数据、区域重大活动预告数据。请结合大数据概论的相关知识,回答以下问题:(1)该项目核心需要采用哪种类型的大数据处理架构?请说明理由。(10分)(2)请梳理该项目从数据接入到预测结果输出的全流程核心环节。(15分)(3)该项目涉及大量个人位置信息和公共交通数据,说明项目落地过程中需要注意哪些数据安全合规问题。(15分)参考答案一、单项选择题1.B2.B3.C4.B5.C6.B7.C8.C9.A10.B11.B12.C13.A14.B15.A二、多项选择题1.ABCD2.ABCD3.ABCD4.ABD5.ABCD6.ABCD7.ABCD8.ABD9.ABCD10.ABC三、判断题1.错误2.错误3.正确4.错误5.正确6.错误7.错误8.正确9.错误10.正确四、简答题1.参考答案:大数据4V特征的具体含义分别为:(1)Volume(规模性):指大数据的数据规模远超过传统数据处理系统的承载能力,通常从TB级跃升到PB甚至EB级;(2)Velocity(高速性):指大数据的产生速度快,对处理速度的要求高,尤其是实时数据流要求低延迟处理;(3)Variety(多样性):指大数据包含结构化、半结构化、非结构化等多种类型的数据,多源异构特征明显;(4)Value(价值性):指大数据整体价值密度低,只有通过深度挖掘才能提取出高价值的信息,海量数据中往往只存在少量极有价值的内容。结合生成式大模型的发展,4V内涵的新延伸主要体现在三个方面:第一,Value的重要性进一步提升,大模型训练不再单纯追求数据规模,更注重训练数据的质量价值,低质量噪声数据反而会拉低模型性能,价值密度和数据质量成为比规模更核心的指标;第二,Variety的延伸,大模型需要多模态数据的融合训练,文本、图像、音频、视频等多模态数据的整合处理成为常态,数据多样性的内涵从多类型扩展到多模态;第三,新的特征维度逐渐被业界认可,部分研究提出增加Veracity(真实性)作为第五个核心特征,这一点在大模型时代尤为重要,训练数据的真实性直接决定了大模型输出的可信度,也是解决大模型幻觉问题的核心基础。2.参考答案:数据治理是指组织通过建立完善的数据管理体系、制定相关制度规范,对全生命周期的数据进行管控,提升数据质量、打通数据孤岛、保障数据安全合规,充分释放数据要素价值的一系列管理和技术活动,数据治理覆盖数据从采集、存储、处理、流通到销毁的全流程。数据治理对人工智能产业发展的核心价值体现在四个方面:第一,保障训练数据质量,高质量的训练数据是高性能AI模型的基础,通过数据治理解决数据缺失、错误、噪声、偏见等问题,可以从源头提升模型的精度和可信度,缓解大模型的幻觉问题;第二,保障AI产业的合规发展,当前各国对数据安全、个人信息保护的要求越来越严格,完善的数据治理可以帮助AI企业规避数据合规风险,避免因数据使用不当引发的法律处罚和品牌危机;第三,打通数据孤岛,实现数据价值合法共享,不同机构之间的数据孤岛限制了AI产业的发展,数据治理通过建立统一数据标准、确权规则,可以推动数据要素的合法流通,为AI模型训练提供更丰富的数据资源;第四,保障数据安全和用户隐私,AI训练往往需要大量个人信息,数据治理中的脱敏、隐私保护机制可以避免敏感数据泄露,保护用户合法权益,推动AI产业健康可持续发展。3.参考答案:数据预处理是指在正式进行数据分析和挖掘之前,对原始数据进行一系列整理加工的环节,主要内容包括:数据清洗,处理原始数据中的缺失值、异常值、重复值,修正错误数据;数据集成,将来自多个数据源的多源异构数据整合到统一的存储平台中,解决数据格式、编码规则不一致的问题;数据变换,对数据进行格式转换、归一化、离散化、编码转换等处理,使其符合后续分析模型的输入要求;数据归约,对数据进行特征选择、降维、抽样,减少冗余特征和数据规模,降低后续计算开销。大数据分析中预处理环节工作量占比最高的原因主要有三点:第一,原始大数据本身多源异构,质量参差不齐,实际业务中采集到的原始数据往往来自不同业务系统,存在大量缺失、错误、冗余、格式不统一等问题,直接用来分析会导致结果偏差甚至模型训练失败,必须通过预处理修正这些问题;第二,多源数据的标准不统一,不同业务场景、不同机构产生的数据往往有不同的编码规则和存储格式,必须通过预处理整合统一,消除数据冲突,才能进行后续的关联分析和建模;第三,大数据维度多、规模大,大量冗余特征不仅会增加计算开销,还会导致模型过拟合,通过预处理进行特征选择、降维归约,可以大幅提升后续分析挖掘的效率和结果精度,因此预处理是大数据分析必不可少的核心前置环节,工作量占比自然远高于其他环节。4.参考答案:隐私计算是指在保障数据提供方不泄露原始敏感数据的前提下,对数据进行分析计算、实现数据价值挖掘的一类技术的统称,核心目标是实现“数据可用不可见”,解决数据跨机构流通共享中的隐私安全和合规问题。典型应用场景包括:第一,金融行业的联合风控,银行、消费金融等多个机构可以在不共享用户原始借贷、行为数据的前提下,联合训练信用风控模型,提升对用户信用风险评估的精度,同时不违反个人信息保护的相关规定;第二,医疗行业的联合科研,不同医院的患者病历数据涉及患者隐私,无法直接共享,通过隐私计算可以联合训练癌症、心脑血管疾病的预测模型,提升模型精度,推动医学科研发展,同时保护患者隐私;第三,互联网行业的联合精准营销,不同互联网平台拥有不同维度的用户行为数据,通过隐私计算可以联合构建完整用户画像,开展跨平台精准营销,不需要互相共享原始用户数据,有效规避合规风险。5.参考答案:离线批处理和实时流处理的核心技术差异主要体现在四个方面:第一,数据输入方式不同,批处理是将一段时间内积累的全部批量数据一次性加载处理,数据是静态有限的;流处理是数据连续不断到达,数据是动态无限的,需要逐个或者按极小批次即时处理;第二,延迟要求不同,批处理对延迟要求低,通常处理周期从几分钟到几小时甚至天级不等,流处理要求低延迟,通常延迟控制在秒级甚至毫秒级;第三,计算资源调度方式不同,批处理通常全量占用计算资源处理完所有数据后释放资源,流处理需要持续占用资源,随数据流量弹性调度;第四,处理目标不同,批处理通常用于对历史全量数据的深度分析挖掘,流处理用于对实时数据的即时分析输出结果。适用场景举例:批处理适用于对时效性要求不高的全量数据分析场景,例如互联网企业每日凌晨处理前一天的全量用户行为数据,统计日活、留存、转化率等核心业务指标,企业月度经营数据分析,大模型批量预训练,历史数据的挖掘建模等,都是典型的批处理应用;流处理适用于对时效性要求高的实时场景,例如实时道路拥堵预测,电商实时交易欺诈风控,内容平台实时推荐,实时流量监控预警,直播平台实时弹幕审核等,都是典型的流处理应用。五、综合分析题参考答案:(1)该项目需要采用“离线批处理+实时流处理”融合的Lambda架构,核心原因如下:第一,该项目需要先基于3年的全量历史数据训练拥堵预测模型,这部分数据规模大,对时效性要求低,适合用离线批处理完成数据预处理、特征提取和模型训练,批量处理历史轨迹数据、历史出行规律数据,能够充分利用全量数据提升模型训练的精度;第二,项目上线后需要实时接入最新的订单GPS数据、卡口识别数据、天气数据、公共交通运营数据,做实时特征计算,输入训练好的模型输出提前15-30分钟的预测结果,对延迟要求高,必须用流处理框架完成实时数据的处理;第三,Lambda架构融合了批处理和流处理的优势,批处理保证全量历史数据训练模型的精度,流处理保证实时预测结果的低延迟输出,能够完全满足项目“提前15-30分钟输出高精度拥堵预测”的需求,因此适合该项目采用。(2)该项目从数据接入到预测输出的全流程核心环节如下:①数据采集接入环节:对接多源数据,批量接入历史订单GPS数据、历史天气数据、节假日出行规律、重大活动历史记录等离线静态数据,同时搭建实时数据通道,动态接入实时更新的订单GPS数据、卡口车辆识别数据、实时天气数据、公共交通运营数据,离线数据存储到数据仓库,实时数据写入消息队列缓存等待处理;②数据预处理环节:对离线历史数据进行批量预处理,清洗缺失、异常的GPS轨迹点,去除重复数据,整合多源数据的格式标准,按区域、时间段提取流量特征,分层存储到数据仓库中;对实时接入的数据进行实时清洗,去除异常坐标、错误识别结果,完成格式转换;③特征工程与模型训练环节:基于离线预处理后的历史数据,提取时间属性、天气属性、区域功能属性、历史流量、重大活动标签等特征,完成特征选择、归一化等处理,训练拥堵预测机器学习模型,通过测试集验证模型精

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论