《大数据概论》2026期末考试题_第1页
《大数据概论》2026期末考试题_第2页
《大数据概论》2026期末考试题_第3页
《大数据概论》2026期末考试题_第4页
全文预览已结束

付费下载

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

《大数据概论》2026期末考试题说明:模拟高校通用期末试卷,含完整参考答案,适用于大专/本科大数据概论课程复习。一、单项选择题(每题2分,共20分)不属于大数据4V特征的是()

A.Volume(大量)B.Velocity(高速)C.Virtual(虚拟)D.Veracity(真实性)HDFS默认的数据副本数量是()

A.1B.2C.3D.4Hadoop中负责集群资源调度管理的组件是()

A.HDFSB.YARNC.MapReduceD.Hive图片、视频、日志这类没有固定格式的数据称为()

A.结构化数据B.半结构化数据C.非结构化数据D.元数据下列哪一项属于NoSQL数据库()

A.MySQLB.OracleC.MongoDBD.SQLServerMapReduce中,Map阶段输出的数据格式是()

A.Key‑Value键值对B.表格C.XMLD.JSON以下属于实时流计算框架的是()

A.HiveB.FlinkC.HBaseD.HDFS数据预处理不包含下面哪一步()

A.数据清洗B.数据集成C.数据加密D.数据规约K‑means算法属于()

A.聚类(无监督)B.分类C.回归D.关联规则下面哪一个不是Spark的核心抽象()

A.RDDB.DataFrameC.DatasetD.NameNode单选答案:

1.C 2.C 3.B 4.C 5.C 6.A 7.B 8.C 9.A 10.D二、多项选择题(每题3分,共15分,多选少选均不得分)Hadoop生态系统主要包含()

A.HDFSB.YARNC.MapReduceD.Hive数据预处理主要步骤()

A.清洗B.集成C.变换D.规约属于大数据可视化工具的有()

A.TableauB.PowerBIC.MatplotlibD.D3.js大数据典型应用场景()

A.电商个性化推荐B.金融风控C.智慧城市交通D.医疗健康分析大数据面临的安全挑战()

A.数据泄露B.数据篡改C.隐私泄露D.DDoS攻击多选答案:

1.ABCD 2.ABCD 3.ABCD 4.ABCD 5.ABCD三、判断题(每题1分,共10分,对打√,错打×)MapReduce是分布式存储技术()HDFS采用主从Master‑Slave架构()Hive可以把SQL转化为MapReduce任务执行()聚类算法需要事先提供训练标签()数据仓库主要面向离线分析,数据库面向业务联机读写()YARN负责分布式文件存储()数据脱敏目的是保护用户敏感隐私信息()Spark基于内存计算,速度快于MapReduce()结构化数据包含文本、图片、音频()大数据强调相关关系,不完全等同于因果关系()判断答案:

1.× 2.√ 3.√ 4.× 5.√ 6.× 7.√ 8.√ 9.× 10.√四、简答题(每题7分,共35分)简述大数据4V特征。

参考答案:Volume(大量):数据规模巨大,TB‑PB‑EB级别,传统软件难以处理。Velocity(高速):数据产生、流转速度快,要求快速甚至实时处理。Variety(多样):包含结构化、半结构化、非结构化多种数据类型。Veracity(真实性):数据来源复杂,存在噪声、异常,需要保证数据可信。简述HDFS中NameNode与DataNode各自作用。

参考答案:NameNode(主节点):管理文件系统元数据,保存文件名、目录、文件块位置;不存储实际业务数据。DataNode(从节点):存储真实数据块;保存数据副本;接收NameNode指令,读写数据。数据湖和数据仓库的区别。

参考答案:

①数据湖:存储原始原始数据,格式不限,结构化、非结构化都可以存入,灵活性高,适合探索分析。

②数据仓库:主要存储经过清洗转换后的结构化数据;面向业务分析;schema预先定义,适合报表、BI分析。简述大数据完整处理流程。

参考答案:

1)数据采集:传感器、日志、爬虫、业务数据库多源采集;

2)数据预处理:清洗、集成、变换、规约,去除噪声、缺失值;

3)数据存储:HDFS、NoSQL、数据仓库保存海量数据;

4)数据分析挖掘:统计、机器学习、算法挖掘潜在价值;

5)数据可视化:图表、仪表盘展示结果,支撑业务决策。什么是NoSQL数据库,NoSQL有哪些主要分类?

参考答案:

NoSQL泛指非关系型数据库,不使用传统关系表结构,适配海量、高并发场景。

主要四类:键值数据库、文档数据库、列族数据库、图数据库。五、综合应用题(20分)某电商平台,拥有用户浏览、点击、收藏、购买海量行为日志,请结合大数据知识,回答:

1)需要做哪些数据预处理工作;(10分)

2)简单描述如何用大数据技术实现商品个性化推荐。(10分)参考答案

1)预处理:

①数据清洗:过滤无效日志、去除重复记录,处理缺失值、异常数据;

②数据集成:把来自web、APP、小程序多端用户行为数据合并;

③数据变换:统一时间格式,特征提取,如用户浏览时长、点击频次;

④数据规约:过滤无用字段,减少数据量,提升计算效率。2)个性化推荐实现:

①采集用户浏览、点击、收藏、购买等行为日志;

②Spark做离线计算,采

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

最新文档

评论

0/150

提交评论