2026年新公需科目大数据考试题库(含答案)_第1页
2026年新公需科目大数据考试题库(含答案)_第2页
2026年新公需科目大数据考试题库(含答案)_第3页
2026年新公需科目大数据考试题库(含答案)_第4页
2026年新公需科目大数据考试题库(含答案)_第5页
已阅读5页,还剩20页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

2026年新公需科目大数据考试题库(含答案)一、单项选择题(每题2分,共40分)1.以下哪项不属于大数据的“4V”特征?A.大量(Volume)B.高速(Velocity)C.多样(Variety)D.精确(Veracity)答案:D(注:大数据的“4V”特征为Volume、Velocity、Variety、Value,Veracity是部分扩展定义中的“真实性”,但非核心4V)2.分布式文件系统HDFS的默认块大小是?A.32MBB.64MBC.128MBD.256MB答案:C(HDFS默认块大小为128MB,设计目的是减少元数据管理开销,适合大文件存储)3.以下哪种技术属于实时流计算框架?A.HiveB.SparkSQLC.FlinkD.HBase答案:C(Flink是典型的流计算框架,支持毫秒级延迟处理;Hive是数据仓库工具,SparkSQL侧重批处理与交互式查询,HBase是分布式数据库)4.数据挖掘中的“关联规则分析”典型应用场景是?A.客户流失预测B.商品推荐(如“啤酒与尿布”)C.用户分群D.销量趋势预测答案:B(关联规则分析关注数据项之间的关联关系,“啤酒与尿布”是经典案例;流失预测和趋势预测属于分类与回归,用户分群是聚类)5.以下哪类数据属于非结构化数据?A.关系型数据库中的订单表B.传感器实时采集的温度数值C.微信聊天记录的文本D.财务系统中的资产负债表答案:C(非结构化数据无固定格式,如文本、图片、音视频;A、B、D均为结构化或半结构化数据)6.大数据平台中,用于存储海量结构化数据的常用技术是?A.HDFSB.HBaseC.RedisD.MySQL答案:B(HBase是基于HDFS的列式数据库,适合海量结构化数据存储;HDFS是文件系统,Redis是内存数据库,MySQL是传统关系型数据库,无法处理超大规模数据)7.隐私计算中的“联邦学习”主要解决什么问题?A.提升数据计算速度B.跨机构数据协作时保护隐私C.降低数据存储成本D.增强数据可视化效果答案:B(联邦学习通过交换模型参数而非原始数据,实现不同机构间的协作建模,避免数据泄露)8.以下哪项不属于数据清洗的主要任务?A.处理缺失值B.去除重复数据C.转换数据格式D.增加数据维度答案:D(数据清洗关注数据质量提升,包括缺失值填补、异常值修正、重复数据删除、格式统一等;增加维度属于特征工程)9.衡量大数据处理系统“吞吐量”的指标是?A.每秒处理的数据量B.数据处理的延迟时间C.系统可扩展的节点数D.数据存储的冗余比例答案:A(吞吐量指单位时间内处理的数据量,延迟是处理时间,扩展性是节点规模,冗余是存储可靠性)10.以下哪种技术属于非关系型数据库(NoSQL)?A.PostgreSQLB.MongoDBC.OracleD.SQLServer答案:B(MongoDB是文档型NoSQL数据库;其余选项均为关系型数据库)11.大数据分析中,“离线处理”与“实时处理”的主要区别是?A.数据来源不同B.对延迟的要求不同C.存储介质不同D.分析目标不同答案:B(离线处理允许较高延迟(如小时级),实时处理要求低延迟(秒级或毫秒级))12.以下哪项是大数据价值密度低的典型表现?A.监控视频中仅几秒有用画面B.电商平台用户点击流数据量大C.传感器数据频率高D.社交媒体文本格式多样答案:A(价值密度低指海量数据中有效信息占比小,如监控视频大部分是冗余画面)13.Spark的核心组件RDD(弹性分布式数据集)的主要特性是?A.不可变、可分区、支持容错B.实时更新、单副本存储C.仅支持内存计算D.依赖关系复杂,难以恢复答案:A(RDD是Spark的核心抽象,具有不可变性、分区存储、通过血统(Lineage)实现容错等特性)14.数据脱敏技术中,“k-匿名”的目标是?A.确保至少k个记录无法被区分B.对数据进行k次加密C.隐藏k个敏感属性D.限制数据访问权限为k级答案:A(k-匿名要求数据集中任意一条记录的准标识符(如年龄、性别)组合在至少k条记录中出现,防止个体被识别)15.以下哪项属于大数据采集的常见工具?A.FlumeB.KafkaC.HiveD.Sqoop答案:A(Flume是日志采集工具;Kafka是消息队列,用于数据传输;Hive是数据仓库工具;Sqoop用于关系型数据库与Hadoop间的数据迁移)16.大数据分析中的“分类”任务属于?A.监督学习B.无监督学习C.强化学习D.半监督学习答案:A(分类需要训练数据包含标签(如“是/否”),属于监督学习;聚类是无监督学习)17.以下哪项不属于Hadoop生态系统组件?A.ZookeeperB.SparkC.HiveD.Flink答案:D(Hadoop生态包括HDFS、MapReduce、Hive、HBase、Zookeeper等;Flink是独立的流计算框架)18.数据湖(DataLake)与数据仓库(DataWarehouse)的主要区别是?A.数据湖存储结构化数据,数据仓库存储非结构化数据B.数据湖在存储时不定义模式(Schema-on-Read),数据仓库提前定义模式(Schema-on-Write)C.数据湖仅用于离线分析,数据仓库支持实时查询D.数据湖成本更高,数据仓库成本更低答案:B(数据湖采用读时模式,适合存储原始数据;数据仓库采用写时模式,需提前清洗、结构化)19.以下哪种场景最适合使用实时大数据处理?A.季度销售报表提供B.电商大促期间的实时库存监控C.用户年度消费行为分析D.历史气象数据建模答案:B(实时处理需低延迟,如库存监控需及时反馈;季度报表、年度分析、历史建模属于离线处理)20.大数据伦理中,“数据主权”主要指?A.数据产生者对数据的所有权和控制权B.企业对用户数据的使用权C.政府对公共数据的管理权D.技术平台对数据的存储权答案:A(数据主权强调数据主体(如个人、机构)对自身产生数据的支配权利)二、多项选择题(每题3分,共30分,少选、错选均不得分)1.大数据的关键技术体系包括以下哪些环节?A.数据采集B.数据存储C.数据处理D.数据可视化答案:ABCD(完整技术体系涵盖采集、存储、处理、分析、可视化等环节)2.以下属于分布式计算框架的有?A.MapReduceB.SparkC.HBaseD.Flink答案:ABD(HBase是数据库,非计算框架;MapReduce、Spark、Flink均为分布式计算引擎)3.数据清洗的常见方法包括?A.删除缺失值超过阈值的记录B.用均值填补数值型缺失值C.识别并修正异常值(如“年龄200岁”)D.对文本数据进行分词处理答案:ABC(分词属于自然语言处理,非数据清洗;清洗关注数据质量问题)4.隐私保护技术包括以下哪些?A.差分隐私(DifferentialPrivacy)B.同态加密(HomomorphicEncryption)C.联邦学习(FederatedLearning)D.数据脱敏(DataMasking)答案:ABCD(均为常见隐私保护技术)5.大数据在智慧城市中的应用场景包括?A.交通拥堵预测与调度B.智能电网负荷优化C.垃圾清运路线规划D.个人健康档案管理答案:ABC(健康档案管理属于医疗领域;智慧城市侧重城市公共服务)6.以下哪些是NoSQL数据库的特点?A.支持ACID事务B.灵活的模式(Schema-Free)C.横向扩展(ScaleOut)D.适合结构化数据存储答案:BC(NoSQL通常不严格支持ACID,适合非结构化/半结构化数据,支持横向扩展)7.大数据分析中,常用的机器学习算法包括?A.决策树(DecisionTree)B.K-means聚类C.线性回归(LinearRegression)D.PageRank答案:ABC(PageRank是图算法,用于网页排名;A、B、C均为机器学习算法)8.以下哪些属于大数据存储技术?A.HDFSB.列式存储(如HBase)C.对象存储(如AWSS3)D.内存数据库(如Redis)答案:ABCD(均为不同场景下的存储技术)9.数据可视化的常用工具包括?A.TableauB.PowerBIC.Python的MatplotlibD.Hadoop答案:ABC(Hadoop是计算框架,非可视化工具)10.大数据伦理风险主要包括?A.隐私泄露B.算法歧视(如推荐系统偏见)C.数据垄断(平台过度集中数据)D.数据准确性不足导致决策失误答案:ABCD(均为大数据应用中的伦理与风险问题)三、判断题(每题1分,共10分,正确填“√”,错误填“×”)1.大数据的核心是“数据量大”,因此只需关注存储能力。(×)(核心是通过分析挖掘数据价值,存储是基础能力之一)2.Hadoop的MapReduce适合处理实时流数据。(×)(MapReduce是批处理框架,延迟较高,不适合实时处理)3.数据挖掘等同于机器学习。(×)(数据挖掘是过程,包含数据清洗、特征工程、机器学习等步骤)4.NoSQL数据库完全替代了关系型数据库。(×)(两者适用场景不同,关系型数据库适合强事务场景,NoSQL适合海量非结构化数据)5.数据匿名化后可以完全防止隐私泄露。(×)(存在再识别风险,如通过准标识符关联外部数据)6.实时计算框架Flink支持事件时间(EventTime)处理。(√)(Flink支持事件时间、处理时间等多种时间语义)7.大数据分析中,样本量越大,分析结果一定越准确。(×)(需考虑数据质量、噪声等因素,大样本可能放大偏差)8.数据湖只能存储非结构化数据。(×)(数据湖可存储结构化、半结构化、非结构化等多种类型数据)9.隐私计算允许在不共享原始数据的情况下完成联合建模。(√)(如联邦学习通过交换模型参数实现协作)10.大数据技术不会对就业市场产生影响。(×)(会推动数据分析师、算法工程师等新岗位需求,同时可能替代部分传统岗位)四、简答题(每题6分,共30分)1.简述大数据的“4V”特征及其含义。答案:①大量(Volume):数据规模巨大,从TB级到EB级;②高速(Velocity):数据产生和处理速度快,需实时或近实时分析;③多样(Variety):数据类型复杂,包括结构化、半结构化、非结构化数据;④价值(Value):数据价值密度低,但通过分析可挖掘高价值信息。2.比较Hadoop(MapReduce)与Spark的主要区别。答案:①计算模型:Hadoop基于磁盘(Disk-based),Spark基于内存(In-memory);②延迟:Spark处理迭代计算(如机器学习)延迟更低(秒级),Hadoop(分钟级);③适用场景:Hadoop适合离线批处理,Spark适合实时处理、迭代计算、交互式查询;④编程接口:Spark支持更丰富的API(如SparkSQL、MLlib),Hadoop以MapReduce为主。3.数据清洗的主要步骤有哪些?答案:①识别问题数据:检测缺失值、异常值、重复数据;②处理缺失值:删除、填补(均值/中位数/众数)、插值法;③处理异常值:修正(如检查测量错误)、删除(如离群点)、保留(如真实极端值);④去除重复数据:通过唯一标识(如ID)去重;⑤验证清洗结果:检查数据质量是否提升(如缺失率下降)。4.列举三种隐私计算技术,并说明其核心原理。答案:①联邦学习:不同机构在本地训练模型,仅交换模型参数(如梯度),不共享原始数据;②安全多方计算(MPC):通过加密协议实现多方协作计算,确保任意一方无法获取其他方数据;③同态加密:允许在加密数据上直接进行计算,结果解密后与明文计算一致,保护数据隐私。5.大数据在医疗领域的应用有哪些典型场景?答案:①电子病历分析:挖掘疾病关联因素,辅助临床决策;②疾病预测:基于患者历史数据和流行病学数据预测发病风险;③药物研发:分析生物数据(如基因、蛋白)加速候选药物筛选;④流行病监测:通过社交媒体、就诊记录实时追踪传染病传播趋势。五、案例分析题(20分)某电商平台计划利用大数据优化用户购物体验,需分析用户浏览、点击、加购、支付等行为数据。假设你是该平台的数据工程师,请回答以下问题:(1)该场景需要采集哪些类型的数据?请列举至少4类。(2)若需实时分析用户行为(如“用户浏览某商品后5分钟内是否购买”),应

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论