版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
2025年大数据分析师职业技能测试卷及答案一、单项选择题(每题1分,共30分。每题只有一个正确答案,请将正确选项字母填在括号内)1.在Hadoop生态中,负责资源管理与任务调度的组件是()A.HDFS B.YARN C.MapReduce D.Hive答案:B2.某电商公司用户行为日志量每日新增200TB,若采用列式存储格式,下列选项中最适合的是()A.Avro B.Parquet C.SequenceFile D.ORC答案:B3.使用SparkSQL执行以下语句:SELECTcity,COUNT()AScntFROMuserWHEREdtBETWEEN'20250501'AND'20250507'GROUPBYcityHAVINGcnt>1000;若dt为分区字段,则优化器可自动下推的操作为()A.谓词下推 B.列裁剪 C.常量折叠 D.聚合下推答案:A4.在Flink流处理中,实现ExactlyOnce语义的核心机制是()A.Checkpoint B.Savepoint C.Watermark D.StateTTL答案:A5.某时序数据库写入QPS峰值达500万,要求读写延迟<5ms,下列存储引擎最合适的是()A.LSMTree B.B+Tree C.Hash D.Bitmap答案:A6.使用Python的pandas读取一个10GBCSV文件时,为避免内存溢出,最佳实践是()A.使用read_csv()并设置dtype=strB.使用read_csv()并设置chunksize=106C.先压缩为gzip再读取D.转换为Excel再读取答案:B7.在Hive中,以下哪种分桶策略能最大程度避免数据倾斜()A.随机分桶 B.基于hash(user_id)分桶 C.基于range分桶 D.基于日期分桶答案:B8.某机器学习模型在训练集AUC=0.98,验证集AUC=0.72,其最可能的问题是()A.欠拟合 B.过拟合 C.特征泄露 D.标签不平衡答案:B9.在Kafka中,以下参数可控制消息在Topic中保留的最长时间()A.retention.ms B.segment.ms C.erval.ms D.request.timeout.ms答案:A10.使用SQL计算用户留存率时,最常用的连接方式是()A.LEFTJOIN B.INNERJOIN C.RIGHTJOIN D.FULLOUTERJOIN答案:A11.在数据仓库分层架构中,DWD层的主要职责是()A.原始数据备份 B.明细数据清洗与规范化 C.汇总指标计算 D.维度建模答案:B12.以下关于数据倾斜的描述,错误的是()A.大表与大表join时,空值集中会导致倾斜B.使用mapsidejoin可完全消除倾斜C.加盐(salt)可缓解reduce端热点D.动态分区过多可能触发倾斜答案:B13.在Airflow中,任务依赖通过以下哪个字段声明()A.depends_on_past B.upstream_tasks C.downstream_tasks D.retries答案:B14.使用XGBoost时,控制过拟合效果最显著的参数是()A.max_depth B.subsample C.learning_rate D.gamma答案:A15.某业务要求实时大屏延迟≤1s,技术选型应优先考虑()A.SparkStreaming B.FlinkCEP C.Storm D.Flume答案:B16.在数据治理中,衡量数据唯一性的指标是()A.Completeness B.Consistency C.Uniqueness D.Timeliness答案:C17.使用Elasticsearch进行聚合分析时,为避免分片误差,应设置的参数是()A.size=0 B.shard_size C.timeout D.search_type=dfs_query_then_fetch答案:D18.在ScalaSpark中,以下代码输出结果为()valrdd=sc.parallelize(1to4)valres=rdd.aggregate(0)(_+_,_+_)A.10 B.20 C.0 D.程序报错答案:A19.数据资产目录中,最重要的元数据是()A.业务描述 B.字段类型 C.存储大小 D.创建人答案:A20.在Tableau中,将度量转化为维度应使用的功能是()A.分组 B.数据桶 C.转换为维度 D.快速表计算答案:C21.以下关于数据湖的说法正确的是()A.仅支持结构化数据 B.Schemaonread C.不支持事务 D.必须基于HDFS答案:B22.在Python中,使用multiprocessing模块时,进程间共享大数据对象应选用()A.Queue B.Pipe C.shared_memory D.Manager答案:C23.某SQL执行计划出现BroadcastHashJoin,其触发条件为()A.小表<10MB且开启auto.broadcast.join.thresholdB.两表均大于1GBC.使用了sortmergehintD.使用了bucketjoin答案:A24.在数据安全分类分级中,PII是指()A.PublicInternetInformation B.PersonallyIdentifiableInformationC.PrivateInternalIndex D.ProtectedIPInformation答案:B25.使用Git进行大文件存储,应启用的扩展是()A.submodule B.lfs C.rebase D.cherrypick答案:B26.在ClickHouse中,最适合做高基数去重的函数是()A.uniq B.uniqCombined C.uniqExact D.uniqHLL12答案:B27.以下关于数据血缘的描述,错误的是()A.可追踪字段级依赖 B.可自动解析SQLC.无法跨平台采集 D.可用于影响分析答案:C28.在Python中,使用asyncio实现并发,其底层基于()A.多线程 B.多进程 C.事件循环 D.协程池答案:C29.某模型采用L1正则,其效果是()A.权重稀疏化 B.权重平滑 C.提高截距 D.降低方差答案:A30.在数据质量管理平台中,规则引擎最常用的执行模式是()A.离线调度 B.实时流式 C.手动触发 D.事件驱动答案:A二、多项选择题(每题2分,共20分。每题有两个或两个以上正确答案,多选、少选、错选均不得分)31.以下属于NoSQL数据库的是()A.HBase B.MongoDB C.Redis D.PostgreSQL答案:ABC32.在特征工程中,可用于处理长尾分布的方法有()A.Log变换 B.BoxCox变换 C.分桶离散化 D.Zscore标准化答案:ABC33.以下哪些组件支持SQLonHadoop()A.Impala B.Presto C.Drill D.Sqoop答案:ABC34.在Kafka中,提高吞吐量的调优手段包括()A.增加batch.size B.增大linger.ms C.启用压缩 D.减少partition数答案:ABC35.以下属于数据治理关键活动的是()A.数据标准制定 B.元数据采集 C.数据质量评估 D.数据备份答案:ABC36.在Spark中,会导致Shuffle的操作有()A.reduceByKey B.groupByKey C.distinct D.map答案:ABC37.以下关于FlinkStateBackend的描述正确的有()A.MemoryStateBackend适用于大状态 B.RocksDBStateBackend支持增量CheckpointC.FsStateBackend基于文件系统 D.可在作业运行时切换Backend答案:BC38.在数据可视化中,适合展示占比关系的图表有()A.饼图 B.堆叠柱状图 C.树图 D.雷达图答案:ABC39.以下属于数据倾斜监控指标的有()A.Task执行时间方差 B.ShuffleReadSize C.GC时间 D.记录数分布答案:ABD40.在Python中,可加速pandas运算的工具有()A.swifter B.modin C.dask D.numba答案:ABCD三、判断题(每题1分,共10分。正确打“√”,错误打“×”)41.HDFS的NameNode内存大小与文件块数量无关。()答案:×42.在Spark中,使用cache()默认存储级别为MEMORY_ONLY。()答案:√43.数据湖与数据仓库不能共存于同一集群。()答案:×44.XGBoost支持类别型特征直接输入,无需独热编码。()答案:√45.在ClickHouse中,MergeTree表引擎支持主键更新。()答案:×46.数据血缘解析必须依赖静态代码分析。()答案:×47.在Kafka中,consumergroup可实现消息的广播模式。()答案:×48.使用Airflow时,池(pool)可用于限制并发任务数。()答案:√49.在Elasticsearch中,text类型字段默认启用doc_values。()答案:×50.数据质量规则一旦定义,生命周期内不可更改。()答案:×四、填空题(每空2分,共20分)51.在Hive中,设置动态分区模式为严格模式的命令是sethive.exec.dynamic.partition.mode=________。答案:strict52.SparkSQL中,将DataFrame注册为临时视图的函数是________。答案:createOrReplaceTempView53.在Flink的时间语义中,________时间可提供最确定的计算结果。答案:Event54.使用Python的sklearn,进行特征标准化的类是________。答案:StandardScaler55.在Linux中,查看磁盘I/O性能的常用命令是________。答案:iostat56.数据治理成熟度模型DAMADMBOK将能力分为________个核心领域。答案:1157.在PostgreSQL中,实现行级安全的机制简称________。答案:RLS58.使用Grafana配置告警通道时,常用的通知方式之一是________。答案:Webhook59.在Scala中,不可变映射的类名为________。答案:Map60.数据资产估值方法中,基于收益的模型简称________法。答案:DCF五、简答题(每题10分,共30分)61.描述一次完整的数据倾斜定位与优化过程,要求包含监控、诊断、验证三个环节,并给出具体命令或代码示例。答案:1.监控:在SparkHistoryServer中查看Stage详情,发现Task执行时间方差>10倍;使用SparkUI的SQLTab查看ShuffleReadSize,发现某分区数据量达3.1GB,其余平均180MB。2.诊断:下载事件日志,执行grep“Task37”|jq.,确认该Task处理key=“null”记录数占总量62%;通过采样代码:df.sample(0.01).groupBy("user_id").count().orderBy(desc("count")).show(20)发现空值倾斜。3.优化:a.过滤空值:df.filter("user_idisnotnull")b.加盐打散:valsalted=df.withColumn("salt",(rand()50).cast("int"))valagg=salted.groupBy("salt","user_id").count()valfinal=agg.groupBy("user_id").sum("count")4.验证:重新提交作业,Task最大耗时由4min降至45s,数据倾斜消除,业务方确认指标无差异。62.说明如何在Flink中实现CUMULATE窗口计算“近30分钟累计UV”,并保证ExactlyOnce语义,给出核心代码与Checkpoint配置。答案:环境:Flink1.17,RocksDBStateBackend,Kafka2.8核心代码:StreamExecutionEnvironmentenv=StreamExecutionEnvironment.getExecutionEnvironment();env.enableCheckpointing(30000);env.getCheckpointConfig().setCheckpointingMode(CheckpointingMode.EXACTLY_ONCE);env.setStateBackend(newEmbeddedRocksDBStateBackend());env.getCheckpointConfig().setCheckpointStorage("hdfs://ns/flink/checkpoints");DataStream<UserEvent>source=env.addSource(newFlinkKafkaConsumer<>("user_topic",schema,props));DataStream<String>uv=source.keyBy(UserEvent::getDeviceId).window(Cumulate.of(Time.minutes(1),Time.minutes(30))).aggregate(newDistinctCountAggregate(),newOutputAllWindow());uv.addSink(newFlinkKafkaProducer<>("uv_topic",serializer,props));env.execute();验证:使用Kafkaconsoleconsumer查看每1分钟输出,30分钟时UV等于全量去重值,Checkpoint成功且可恢复。63.阐述数据质量规则引擎的自动化闭环设计,包含规则定义、探测、告警、整改、评估五个子系统,并给出表结构示例。答案:1.规则定义:表dq_rulerule_idbigint,rule_namevarchar,check_typevarchar,sql_texttext,threshold_jsonjson,ownervarchar,statustinyint2.探测:调度器每日调用Spark作业,执行sql_text,结果写入dq_result表dq_resultrule_idbigint,exec_datedate,actual_valuedouble,passtinyint3.告警:若pass=0,调用AlertAPI,写入dingtalk_msg表,同时发邮件。4.整改:工单系统创建JIRA,关联rule_id,责任人处理后可回填dq_fix_log表dq_fix_logfix_idbigint,rule_idbigint,actionvarchar,finish_datedatetime5.评估:月度汇总dq_result,计算规则通过率、平均修复时长,写入dq_kpi,供CIO例会评审。六、综合应用题(共40分)64.某短视频公司2025年Q2日活DAU目标1.2亿,现需构建实时DAU大屏,数据源为APP埋点日志Kafkatopic:app_log,格式为JSON,字段:user_id(string),event_time(long),event_type(string)。要求:(1)计算每日零点后到当前时间的去重DAU;(2)延迟≤3s;(3)支持历史回溯重放;(4)输出到Redis,Key格式为"dau:20250625",Value为Long型;(5)提供完整Flink作业代码、RedisDDL、容错与监控方案。答案:1.RedisDDL:CLUSTERSETSLOT5461IMPORTING...CONFIGSETmaxmemory8gbKey采用"dau:yyyyMMdd",Value使用HyperLogLog,PFADD去重,PFCOUNT读取。2.Flink作业:publicclassRealtimeDauJob{publicstaticvoidmain(String[]args)throwsException{StreamExecutionEnvironmentenv=StreamExecutionEnvironment.getExecutionEnvironment();env.enableCheckpointing(5000);env.setStateBackend(newEmbeddedRocksDBStateBackend());env.getCheckpointConfig().setCheckpointStorage("hdfs://ns/flink/dau_ck");env.setParallelism(192);Propertieskprop=newProperties();kprop.setProperty("bootstrap.servers","kafka1:9092,kafka2:9092");kprop.setProperty("group.id","dau_group");FlinkKafkaConsumer<String>consumer=newFlinkKafkaConsumer<>("app_log",newSimpleStringSchema(),kprop);consumer.setStartFromGroupOffsets();consumer.setCommitOffsetsOnCheckpoints(true);DataStream<Event>stream=env.addSource(consumer).map(str>JSON.parseObject(str,Event.class)).filter(e>"play".equals(e.getEventType())).assignTimestampsAndWatermarks(WatermarkStrategy.<Event>forBoundedOutOfOrderness(Duration.ofSeconds(3)).withTimestampAssigner((e,t)>e.getEventTime()));DataStream<Tuple2<String,Long>>dailyDau=stream.keyBy(Event::getUserId).window(TumblingEventTimeWindows.of(Time.days(1),Time.hours(8))).trigger(ContinuousEventTimeTrigger.of(Time.seconds(1))).aggregate(newCountDistinctHyperLogLog(),newOutputDailyDau());dailyDau.addSink(newRedisSink<>(newFlinkJedisPoolConfig.Builder().setHost("redis1").setPort(6
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 2026正高面审答辩-正高050面审答辩妇产科护理历年题库含答案详解
- 2026本港海船船员考试《轮机专业(船舶辅机·轮机员)》历年参考题库含答案详解
- 2026教师职称-广西-广西教师职称(基础知识、综合素质、高中历史)历年参考题库含答案详解3套试卷
- 在线教育平台用户分群分析课程设计
- 保护牙齿微课程设计
- 初中作文暑期课程设计
- 交互式数据新闻可视化平台研究课程设计
- UWB功耗管理课程设计
- 名包回收鉴定技师考试试卷及答案
- 美术编辑岗位设计考试试卷及答案
- 数据中心运维管理SOP文件
- 8D报告培训教材
- 2026年医院抗菌药物临床应用管理试题
- 防范鼠疫应急预案(3篇)
- 五年(2021-2025)中考数学真题分类汇编(新疆专用)18:圆(学生版)
- 2026年一级建造师(港口与航道工程)模拟考试题及答案
- 抗日战争胜利纪念日
- 2024年黎明职业大学辅导员考试笔试真题汇编附答案
- 医药代表培训考核制度
- 车间吸烟管制安全培训课件
- 整机装联工艺与技术
评论
0/150
提交评论