2026年大数据分析基础测试题(附答案)_第1页
2026年大数据分析基础测试题(附答案)_第2页
2026年大数据分析基础测试题(附答案)_第3页
2026年大数据分析基础测试题(附答案)_第4页
2026年大数据分析基础测试题(附答案)_第5页
已阅读5页,还剩11页未读 继续免费阅读

付费下载

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

2026年大数据分析基础测试题(附答案)一、单项选择题(每题2分,共30分)1.以下哪项不属于数据清洗的主要目标?A.纠正数据中的错误值B.填充缺失的字段数据C.合并重复的记录D.增加数据维度以丰富信息答案:D2.分布式文件系统HDFS中,默认的块大小是?A.32MBB.64MBC.128MBD.256MB答案:C3.以下哪种数据库更适合处理实时写入的海量结构化数据?A.MySQL(关系型数据库)B.HBase(列式数据库)C.Redis(键值存储)D.MongoDB(文档数据库)答案:B4.在数据标准化处理中,将数据转换为均值为0、标准差为1的分布,这种方法称为?A.归一化(Min-MaxScaling)B.标准化(Z-ScoreNormalization)C.离散化(Discretization)D.正则化(Regularization)答案:B5.以下哪项不是SparkCore的核心抽象?A.RDD(弹性分布式数据集)B.DataFrame(结构化数据集合)C.DStream(离散化数据流)D.Dataset(类型化的DataFrame)答案:C(DStream属于SparkStreaming组件)6.数据仓库(DataWarehouse)的典型特征不包括?A.面向事务处理B.面向主题C.非易失性D.随时间变化答案:A7.在机器学习中,若模型在训练集上表现很好,但在测试集上表现较差,可能的原因是?A.欠拟合(Underfitting)B.过拟合(Overfitting)C.数据不平衡(ImbalancedData)D.特征缺失(FeatureMissing)答案:B8.以下哪种技术用于解决分布式系统中的“数据倾斜”问题?A.增加Reducer数量B.对倾斜键添加随机前缀C.降低数据分区大小D.使用内存计算替代磁盘存储答案:B9.实时数据处理框架Flink中,时间语义不包括?A.事件时间(EventTime)B.摄入时间(IngestionTime)C.处理时间(ProcessingTime)D.窗口时间(WindowTime)答案:D10.以下哪项属于非结构化数据?A.电商订单表(二维表格)B.监控摄像头的视频文件C.用户年龄分段统计结果(JSON)D.传感器采集的温度数值(CSV)答案:B11.在Hive中,以下哪种语句用于创建外部表(ExternalTable)?A.CREATETABLEB.CREATEEXTERNALTABLEC.CREATEMANAGEDTABLED.CREATEVIRTUALTABLE答案:B12.数据可视化中,用于展示两个变量之间相关性的最佳图表类型是?A.柱状图(BarChart)B.折线图(LineChart)C.散点图(ScatterPlot)D.热力图(HeatMap)答案:C13.以下哪项是Kafka的核心功能?A.分布式日志存储与消息队列B.内存计算框架C.列式存储数据库D.实时查询引擎答案:A14.在数据预处理中,处理类别型特征(如“性别”)的常用方法是?A.标准化(Z-Score)B.独热编码(One-HotEncoding)C.对数变换(LogTransformation)D.主成分分析(PCA)答案:B15.以下哪项不属于大数据的“4V”特征?A.大量(Volume)B.高速(Velocity)C.多样(Variety)D.价值(Value)E.准确(Veracity)答案:E(注:部分定义包含Veracity,但传统“4V”不包括)二、填空题(每空2分,共20分)1.Hadoop生态中,负责资源管理和任务调度的组件是________。答案:YARN(YetAnotherResourceNegotiator)2.Spark中,RDD的两个核心操作是________和________。答案:转换(Transformation)、行动(Action)3.数据仓库的分层架构通常包括ODS(操作数据存储)层、________层、DWD(明细数据)层、DWS(汇总数据)层和ADS(应用数据)层。答案:CDM(公共维度模型)4.机器学习中,评估分类模型性能的常用指标包括准确率(Accuracy)、精确率(Precision)、召回率(Recall)和________。答案:F1分数(或F1-Score)5.实时数据处理中,________是指从事件发生到数据被处理的时间延迟。答案:端到端延迟(End-to-EndLatency)6.NoSQL数据库的四大类型包括键值存储、列式存储、文档存储和________。答案:图存储(GraphStorage)7.数据湖(DataLake)与数据仓库的核心区别在于数据湖存储________数据,而数据仓库存储________数据。答案:原始(或未加工)、结构化(或已处理)8.在Kafka中,消息的持久化存储单元称为________,其内部按________顺序存储。答案:主题(Topic)、分区(Partition)三、简答题(每题8分,共40分)1.简述数据清洗的主要步骤及常见方法。答案:数据清洗主要包括以下步骤:(1)识别缺失值:通过统计各字段缺失率定位问题;(2)处理缺失值:可采用删除记录、均值/中位数填充、插值法或模型预测填充;(3)纠正错误值:通过业务规则校验(如年龄>150)或统计方法(如3σ原则)识别异常值,修正或标记;(4)去除重复值:通过唯一标识(如用户ID+时间戳)检测并合并重复记录;(5)格式标准化:统一日期格式、单位(如将“1米”转为“100厘米”)等。2.对比HDFS与传统文件系统(如NTFS)的主要差异。答案:(1)设计目标:HDFS为海量数据存储优化,支持PB级数据;传统文件系统适用于本地小文件。(2)容错机制:HDFS通过多副本(默认3副本)实现容错;传统文件系统依赖RAID或备份。(3)写入方式:HDFS仅支持一次写入多次读取(追加写);传统文件系统支持随机读写。(4)块大小:HDFS块大小默认128MB(减少元数据管理开销);传统文件系统块大小通常4KB-64KB。(5)节点规模:HDFS可扩展至数千节点;传统文件系统节点数有限。3.说明SparkRDD的“弹性”体现在哪些方面。答案:RDD的弹性体现在:(1)存储弹性:数据可在内存或磁盘间自动切换(内存不足时持久化到磁盘);(2)容错弹性:通过血统(Lineage)记录依赖关系,部分分区丢失时可通过重算父RDD恢复;(3)分区弹性:RDD可根据计算需求动态调整分区数量(如repartition操作);(4)类型弹性:支持多种数据类型(结构化/非结构化)和计算操作(转换/行动)。4.简述特征工程的主要流程及关键任务。答案:特征工程流程包括:(1)特征理解:分析特征的分布(如直方图)、相关性(如皮尔逊系数)和业务含义;(2)特征清洗:处理缺失值、异常值,纠正格式错误;(3)特征构造:通过组合(如“消费金额/订单数”)、变换(如对数转换)、时间特征提取(如“星期几”)提供新特征;(4)特征选择:使用过滤法(如卡方检验)、包装法(如递归特征消除)或嵌入法(如L1正则化)筛选关键特征;(5)特征标准化:对数值型特征进行归一化或标准化,对类别型特征进行独热编码或目标编码。5.解释“离线计算”与“实时计算”的区别,并举例说明应用场景。答案:(1)处理延迟:离线计算通常处理T+1数据(如凌晨处理前一日日志),延迟数小时;实时计算处理秒级或毫秒级数据(如实时监控用户点击流)。(2)数据时效性:离线计算关注历史趋势分析(如月度销售报表);实时计算关注即时反馈(如秒杀活动库存预警)。(3)技术框架:离线计算常用HadoopMapReduce、SparkCore;实时计算常用Flink、KafkaStreams。(4)资源消耗:离线计算资源需求大(批量处理);实时计算资源需求相对稳定(流式处理)。示例:电商大促期间,离线计算用于次日提供用户消费排行榜,实时计算用于实时更新商品库存和推荐系统。四、应用题(共10分)某电商平台需分析用户“加购-下单”转化漏斗,要求设计数据采集方案、数据处理流程及核心分析指标,并说明可视化呈现方式。答案:1.数据采集方案:埋点采集:在商品详情页(加购按钮点击事件)、购物车页(删除商品事件)、订单提交页(下单按钮点击事件)部署前端埋点,记录事件类型(event_type)、用户ID(user_id)、商品ID(item_id)、时间戳(timestamp)、页面来源(referrer)等字段。日志采集:服务器端记录用户行为日志(如Nginx访问日志),通过Flume或Logstash收集至Kafka消息队列,确保数据实时传输。2.数据处理流程:实时清洗:使用Flink对Kafka中的数据流进行过滤(去除测试账号)、去重(根据user_id+item_id+event_type+timestamp去重)、补全(通过用户中心接口补充用户属性如性别、年龄)。离线存储:清洗后的数据写入HDFS(原始日志)和Hive数据仓库(结构化表,按日期分区),用于离线分析;同时写入ClickHouse(列式数据库)支持实时查询。漏斗计算:实时计算:Flink使用窗口(如1小时滚动窗口)统计各阶段用户数(加购用户数、下单用户数),计算转化率(下单用户数/加购用户数)。离线计算:HiveSQL按天分组,通过子查询或窗口函数统计每日各阶段用户数及转化率。3.核心分析指标:加购用户数:一定时间内点击“加入购物车”的独立用户数。下单用户数:加购后完成订单提交的独立用户数。加购-下单转化率:(下单用户数/加购用

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

最新文档

评论

0/150

提交评论