2026年广州大数据分析技术试题(附答案)_第1页
2026年广州大数据分析技术试题(附答案)_第2页
2026年广州大数据分析技术试题(附答案)_第3页
2026年广州大数据分析技术试题(附答案)_第4页
2026年广州大数据分析技术试题(附答案)_第5页
已阅读5页,还剩13页未读 继续免费阅读

付费下载

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

2026年广州大数据分析技术试题(附答案)一、单项选择题(每题2分,共20分)1.以下哪个选项不属于大数据的“5V”特征?A.Volume(大量)B.Velocity(高速)C.Variability(多变性)D.Value(价值密度低)答案:C(注:标准“5V”为Volume、Velocity、Variety、Veracity、Value,Variability是部分扩展描述,非核心特征)2.某电商平台需实时处理用户点击流数据(每秒10万条),要求延迟低于100ms,最适合的计算框架是?A.HadoopMapReduceB.SparkBatchC.FlinkD.Hive答案:C(Flink是流处理框架,支持毫秒级延迟,适合实时场景)3.关于HBase的存储模型,以下描述正确的是?A.基于行存储,按RowKey排序B.基于列族存储,同一列族数据连续存放C.支持SQL查询,通过Phoenix接口D.数据版本默认保留3个答案:B(HBase是列族存储,同一列族数据物理连续;RowKey排序是行键特性,但非存储模型核心;Phoenix提供SQL支持,但非存储模型本身;默认版本数为1)4.数据清洗中处理“缺失值”时,若某字段缺失率达70%且无业务意义,最合理的处理方式是?A.用均值填充B.用中位数填充C.删除该字段D.用随机值填充答案:C(缺失率过高且无业务价值时,删除字段是最优选择)5.以下哪个工具属于分布式内存计算框架?A.HDFSB.SparkC.KafkaD.HBase答案:B(Spark基于RDD实现内存计算,减少磁盘IO)6.在Spark中,RDD的“持久化”操作默认存储级别是?A.MEMORY_ONLYB.MEMORY_AND_DISKC.DISK_ONLYD.MEMORY_ONLY_SER答案:A(未指定时默认MEMORY_ONLY,即仅内存存储未序列化数据)7.某数据集包含“用户ID、访问时间、页面停留时长、转化标志(0/1)”,需分析“页面停留时长”对转化的影响,应采用的分析方法是?A.聚类分析B.关联规则C.逻辑回归D.主成分分析答案:C(转化标志是二分类变量,逻辑回归适用于二分类因变量与连续自变量的关系分析)8.关于Kafka的分区(Partition)机制,以下说法错误的是?A.分区数决定了消费者组中消费者的最大并行数B.同一分区内消息按顺序存储C.分区数越多,吞吐量一定越高D.分区分布在不同Broker上实现负载均衡答案:C(分区数过多会增加集群管理开销,可能导致吞吐量下降)9.数据湖(DataLake)与数据仓库(DataWarehouse)的核心区别是?A.数据湖存储结构化数据,数据仓库存储非结构化数据B.数据湖在存储时定义模式(Schema-on-Write),数据仓库在分析时定义模式(Schema-on-Read)C.数据湖支持多类型数据存储,数据仓库强调结构化数据整合D.数据湖仅用于离线分析,数据仓库支持实时分析答案:C(数据湖支持结构化、半结构化、非结构化数据;数据仓库以结构化数据为主,强调一致性)10.某企业需构建用户画像系统,需整合用户基本信息、消费记录、社交行为数据,关键技术不包括?A.数据集成(ETL)B.自然语言处理(NLP)C.实时流计算D.关联规则挖掘答案:C(用户画像通常基于批量数据构建,实时流计算非必需,但需根据场景判断;本题中“关键技术不包括”选C)二、填空题(每空2分,共20分)1.HDFS默认块大小为________MB,设计目的是减少________开销。答案:128;元数据管理2.Flink中用于定义时间窗口的时间类型包括事件时间(EventTime)、处理时间(ProcessingTime)和________。答案:摄入时间(IngestionTime)3.数据可视化中,展示“不同地区年度销售额占比”最适合的图表是________,展示“用户月活跃数趋势”最适合的图表是________。答案:饼图(或环形图);折线图4.SparkSQL中,用于将DataFrame注册为临时视图的方法是________。答案:createOrReplaceTempView()5.机器学习中,解决过拟合问题的常用方法包括________、________(任意两个即可)。答案:正则化(L1/L2);增加训练数据;早停法(EarlyStopping);dropout(任填两个)6.Kafka中,消费者通过________参数指定从哪个偏移量开始消费消息。答案:auto.offset.reset7.数据倾斜的典型表现是________,常见解决方法包括________(任意一个即可)。答案:任务执行时间差异大(或部分节点负载过高);加盐分组(或调整并行度、聚合前预聚合)三、简答题(每题8分,共40分)1.简述Hadoop生态中HDFS、YARN、MapReduce的分工与协作流程。答案:HDFS负责分布式存储,YARN负责资源管理(任务调度与容器分配),MapReduce是计算框架(将任务拆分为Map和Reduce阶段)。协作流程:用户提交作业→YARN的ResourceManager分配资源→NodeManager启动Container→Map任务读取HDFS数据并处理→中间结果写入本地磁盘→Reduce任务拉取Map输出并合并→最终结果写入HDFS。2.对比SparkRDD与DataFrame的优缺点,说明各自适用场景。答案:RDD是低阶API,支持任意类型数据,提供丰富的转换操作(如map、filter),但缺乏结构化信息,执行效率依赖开发者优化;DataFrame是高阶API,基于列存储,带有Schema信息,支持Catalyst优化器,执行效率更高,但仅适用于结构化/半结构化数据。适用场景:RDD用于复杂非结构化数据处理(如日志解析);DataFrame用于结构化数据分析(如SQL查询、统计报表)。3.设计一个电商用户行为数据清洗流程,需处理的问题包括:重复记录、时间格式混乱、用户ID缺失、异常值(如“页面停留时长”为-5秒)。答案:①去重:通过用户ID、访问时间、页面ID作为唯一标识,使用dropDuplicates方法删除重复记录;②时间格式统一:用正则表达式或日期函数(如to_timestamp)将“2026-03-1512:30”“15/03/202612.30”等格式转换为标准时间戳;③处理用户ID缺失:若缺失率低,通过订单ID或设备ID关联补全;若缺失率高且无法关联,删除对应记录;④处理异常值:将“页面停留时长”为负数的记录过滤(或替换为0,需结合业务判断),对超过合理范围的值(如>24小时)标记为异常并人工核查。4.说明实时数据处理(如Flink)中“水印(Watermark)”的作用及提供策略。答案:作用:水印是时间进度的标识,用于解决事件时间乱序问题,告知系统“当前时间已处理到T,后续不会有早于T的事件”,触发窗口计算。提供策略:①周期性水印(Periodic):按固定间隔(如100ms)提供,根据最大事件时间减去延迟时间(如maxEventTime-5s);②标点水印(Punctuated):在特定事件(如接收到特殊标记)时提供,适用于事件时间严格递增场景。5.某银行需分析“客户流失”的关键因素,现有数据包括客户基本信息(年龄、职业)、交易记录(月均交易额、交易频率)、客服交互记录(投诉次数、问题类型),请设计分析流程并说明用到的大数据技术。答案:流程:①数据采集:通过Kafka收集交易系统、客服系统的实时/离线数据;②数据存储:结构化数据存Hive/ClickHouse,非结构化客服文本存HDFS;③数据清洗:处理缺失值(如填充职业缺失为“未知”)、异常值(如月均交易额为负数则修正);④特征工程:构造“近30天投诉次数”“交易频率波动系数”等衍生特征,对文本数据用TF-IDF提取关键词;⑤模型训练:用随机森林或XGBoost训练分类模型(流失=1/未流失=0),评估特征重要性;⑥结果验证:通过混淆矩阵、AUC-ROC评估模型效果;⑦业务应用:输出高流失风险客户清单及关键因素(如“投诉次数>3次”“月均交易额<1000元”)。技术:Kafka(数据采集)、Hive(存储)、SparkMLlib(模型训练)、NLP(文本处理)。四、应用题(每题10分,共20分)1.某智慧交通平台需分析“早高峰(7:00-9:00)主干道拥堵原因”,可用数据包括:交通传感器数据:路段ID、时间戳、车流量(辆/分钟)、平均车速(km/h)、车道占有率(%)天气数据:时间戳、降雨量(mm)、能见度(m)事件数据:时间戳、路段ID、事故类型(碰撞/抛锚)、施工状态(0/1)要求:设计分析步骤,说明每一步使用的技术工具,并给出关键分析指标。答案:分析步骤及技术工具:①数据接入与整合:通过Flink实时接入交通传感器、天气、事件数据,用Kafka作为消息队列缓冲,确保低延迟;②数据清洗:用SparkSQL处理缺失值(如车流量为0可能是传感器故障,用前后5分钟均值填充),过滤异常值(如平均车速>120km/h不符合城市道路规则);③时间窗口对齐:按5分钟滑动窗口聚合数据(FlinkWindow),关联同一时间段、同一路段的交通、天气、事件数据;④特征关联分析:相关性分析:用Pandas或SparkML计算车流量与平均车速的皮尔逊相关系数(负相关说明车流量越大越拥堵);因果推断:通过逻辑回归分析“事故发生”“施工状态=1”“降雨量>5mm”对拥堵(定义为平均车速<20km/h)的影响;聚类分析:用K-means对路段按“车流量+车道占有率+能见度”聚类,识别易拥堵路段类型;⑤可视化与结论:用Tableau绘制“拥堵路段热力图”“事故/施工对车速的影响趋势图”,输出关键指标:拥堵发生时的平均车流量阈值(如>800辆/分钟);事故导致车速下降的平均幅度(如事故发生后5分钟内车速下降30%);降雨强度与拥堵概率的关系(如降雨量每增加1mm,拥堵概率上升2%)。2.某企业计划搭建大数据分析平台,需求如下:处理类型:离线批处理(日增量100GB)、实时流处理(每秒5万条);数据类型:用户行为日志(JSON,非结构化)、业务数据库(MySQL,结构化);分析需求:用户画像(标签计算)、实时推荐(毫秒级响应)、离线报表(T+1)。请设计技术架构图(文字描述即可),并说明各组件的作用。答案:技术架构分层描述:①数据采集层:日志采集:用Flume从应用服务器收集用户行为日志,发送至Kafka;数据库同步:用Canal监听MySQLbinlog,实时同步变更数据至Kafka;②数据存储层:实时数据:Kafka作为消息队列缓冲实时流数据(保留7天);原始数据:HDFS存储全量日志与数据库备份(冷数据),DeltaLake管理版本(支持ACID);结构化数据:Hive数据仓库存储清洗后的离线数据(按日期分区),ClickHouse作为实时分析数据库(支持高并发查询);③数据处理层:离线处理:SparkBatch每天凌晨处理HDFS数据,提供用户标签(如“高价值用户”“活跃周期”),写入Hive;实时处理:Flink消费Kafka流数据,计算实时指标(如“当前页面点击量”),写入ClickHouse;机器学习:用SparkMLlib训练推荐模型(协同过滤或深度学习),模型部署至TensorFlowServing;④数

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论