版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
2026年数据科学与大数据考试卷及答案一、单项选择题(本大题共20小题,每小题2分,共40分。每小题只有一个正确选项)1.在Hadoop生态系统中,负责资源管理和调度的组件是()。A.HDFSB.MapReduceC.YARND.ZooKeeper2.下列关于HDFS中Block(数据块)的描述,错误的是()。A.块是文件存储的最小逻辑单位B.默认块大小在Hadoop2.x中通常为128MBC.块的大小设置越大越好,可以减少NameNode的内存消耗D.为了数据容错,每个块默认会有3个副本3.SparkRDD的核心特性是()。A.可变性、实时性B.不可变性、分区性、容错性C.关系型、事务性D.动态流式、强一致性4.在关系型数据库理论中,若一个关系模式R属于2NF,但不属于3NF,则是因为存在()。A.非主属性对码的传递依赖B.非主属性对码的部分依赖C.主属性对码的部分依赖D.主属性对码的传递依赖5.下列Python库中,主要用于数据可视化的是()。A.NumPyB.PandasC.MatplotlibD.Scikit-learn6.在数据挖掘中,Apriori算法主要用于解决()问题。A.分类B.聚类C.关联规则挖掘D.回归7.下列关于NoSQL数据库的描述,不符合CAP定理的是()。A.CA系统:保证一致性和可用性,通常牺牲分区容错性B.CP系统:保证一致性和分区容错性,通常牺牲可用性C.AP系统:保证可用性和分区容错性,通常牺牲一致性D.在分布式系统中,CAP三个属性可以同时被完美满足8.在SparkSQL中,要将DataFrame注册为临时视图以便使用SQL查询,应使用的方法是()。A.createTempViewB.registerTempTableC.createOrReplaceTempViewD.saveAsTable9.下列哪种情况适合使用K-Means聚类算法?()A.数据集密度不均匀B.数据集为非凸形状C.数据集大小适中,且簇呈现球形分布D.数据集中包含大量噪声点10.MapReduce计算模型中,主要负责数据汇总处理的是()阶段。A.SplitB.MapC.ShuffleD.Reduce11.在Python的Pandas库中,用于处理缺失值的方法中,删除包含缺失值的行的是()。A.fillna()B.dropna()C.isnull()D.notnull()12.数据仓库的四个基本特征是()。A.面向主题的、集成的、相对稳定的、反映历史变化B.面向应用的、分散的、经常更新的、反映当前状态C.面向对象的、集成的、易变的、实时反映变化D.面向过程的、分布的、静态的、预测未来趋势13.下列关于Flume和Kafka的描述,正确的是()。A.Flume是消息队列,Kafka是日志收集系统B.Flume适合数据传输,Kafka适合数据缓存和分发C.Flume和Kafka功能完全相同,可以任意替换D.Flume不支持自定义拦截器14.在分类算法中,决策树算法使用()准则来选择最优分裂特征。A.欧氏距离B.信息增益或基尼系数C.梯度下降D.余弦相似度15.下列关于数据标准化的描述,正确的是()。A.Min-Max标准化将数据转换到均值为0,方差为1的分布B.Z-Score标准化将数据转换到[0,1]区间C.Min-Max标准化对异常值敏感D.Z-Score标准化受数据量纲影响较大16.在HBase中,RowKey的设计至关重要,下列关于RowKey的设计原则,错误的是()。A.RowKey长度应尽量简短B.RowKey最好是散列的,避免热点问题C.RowKey应按照业务逻辑进行字典序排序存储D.RowKey可以包含任意字符,且越长越便于区分17.支持向量机(SVM)中,核函数的主要作用是()。A.增加数据集的样本数量B.将低维非线性可分数据映射到高维空间,使其线性可分C.加速模型的收敛速度D.处理缺失值18.在流式计算框架Storm中,核心的计算单元被称为()。A.BoltB.SpoutC.TopologyD.Tuple19.评估回归模型性能时,用于衡量预测值与真实值之间差异平方和的平均值的指标是()。A.MAE(平均绝对误差)B.MSE(均方误差)C.RMSE(均方根误差)D.R-Squared(决定系数)20.下列关于DataFrame和RDD的区别,说法正确的是()。A.DataFrame是弱类型的,RDD是强类型的B.DataFrame底层就是RDD,但带有Schema信息C.RDD不支持SQL查询,DataFrame也不支持D.DataFrame的执行效率一定比RDD低,因为多了Schema解析开销二、多项选择题(本大题共10小题,每小题3分,共30分。每小题有两个或两个以上正确选项,少选得1分,错选不得分)1.下列属于HadoopHDFS核心守护进程的有()。A.NameNodeB.DataNodeC.SecondaryNameNodeD.ResourceManager2.SparkRDD的算子中,属于Action(行动)算子的有()。A.mapB.reduceC.collectD.count3.在进行特征工程时,常见的特征选择方法包括()。A.过滤法B.包装法C.嵌入法D.聚类法4.维度建模中,常见的星型模式包含的表类型有()。A.事实表B.维度表C.宽表D.快照表5.下列关于Python中NumPy数组的描述,正确的有()。A.数组中的所有元素必须是相同类型B.数组的大小在创建后是固定的C.数组运算向量化,比Python列表循环更快D.数组支持广播机制6.机器学习中的正则化技术主要用于解决()问题。A.欠拟合B.过拟合C.数据缺失D.特征共线性7.Kafka作为分布式消息队列,其主要特点包括()。A.高吞吐量B.低延迟C.持久化存储D.强一致性(指传统数据库意义上的强一致性,而非最终一致性)8.在数据清洗过程中,常见的异常值处理方法有()。A.删除B.视为缺失值处理C.盖帽法D.对数变换9.下列属于Elasticsearch特点的有()。A.基于Lucene开发B.分布式实时搜索和分析引擎C.支持复杂的多字段查询D.不支持水平扩展10.在逻辑回归算法中,使用的激活函数通常是()。A.SigmoidB.ReLUC.TanhD.Softmax三、填空题(本大题共15小题,每小题2分,共30分)1.在大数据的4V特征中,Volume指数据量,Velocity指处理速度,Variety指数据类型,Value指________。2.HDFS文件系统中,为了保证数据可靠性,默认情况下每个数据块会有________个副本。3.SparkRDD的依赖关系分为窄依赖和________依赖。4.在Python中,使用Pandas读取CSV文件的方法是________。5.决策树算法中,用于防止模型过拟合的常见参数剪枝策略包括预剪枝和________。6.在SQL语句中,用于分组聚合的关键字是________。7.Redis数据库中,支持简单的消息队列的列表数据结构对应的命令是LPUSH和________。8.在推荐系统中,基于内容的推荐和协同过滤是两大主流技术,其中协同过滤又分为基于用户和基于________的协同过滤。9.主成分分析(PCA)是一种常用的________降维算法。10.在HadoopMapReduce中,Map函数输出的中间结果会经过________阶段传输给Reduce函数。11.Python的Scikit-learn库中,用于将数据集划分为训练集和测试集的函数是________。12.在时间序列分析中,ARIMA模型中的AR代表自回归,MA代表________,I代表差分。13.HBase是建立在HDFS之上的面向________的分布式数据库。14.在深度学习框架TensorFlow中,计算图的基本单元是________。15.数据可视化工具Superset是开源的,由________公司开发。四、判断题(本大题共10小题,每小题1分,共10分。正确的打“√”,错误的打“×”)1.NameNode是HDFS的主节点,它负责存储文件的实际数据块。()2.Spark是基于内存的分布式计算框架,因此在迭代计算场景下通常比MapReduce快。()3.在Python中,列表是可变对象,元组是不可变对象。()4.K-Means算法需要预先指定聚类中心的数量K。()5.数据清洗必须在数据探索和分析之前完成,不能穿插进行。()6.MongoDB是关系型数据库,支持复杂的SQL查询和事务。()7.逻辑回归虽然名字里有“回归”,但实际上是一种分类算法。()8.在Hive中,内部表被删除时,HDFS上对应的元数据和数据都会被删除。()9.梯度下降算法中,学习率越大,模型收敛速度越快,因此应设置得尽可能大。()10.深度学习神经网络中的Dropout层主要用于在训练时随机丢弃神经元,以防止过拟合。()五、简答题(本大题共5小题,每小题6分,共30分)1.简述HDFS的读写流程(以读流程为例)。2.请对比说明RDBMS(关系型数据库)与NoSQL数据库的主要区别。3.简述MapReduce的工作原理及其主要阶段。4.在数据预处理中,为什么要进行数据标准化?列举两种常见的数据标准化方法。5.解释什么是过拟合,以及有哪些常用的防止过拟合的方法。六、应用与分析题(本大题共3小题,共40分)1.(本题15分)某电商平台拥有用户行为日志数据,字段包括:user_id(用户ID)、item_id(商品ID)、action_type(行为类型:点击、收藏、加购、购买)、timestamp(时间戳)。(1)请设计一个MapReduce程序思路,统计每个商品的总购买次数。(5分)(2)如果使用SparkSQL实现该需求,请写出关键的SQL语句(假设表名为user_logs)。(5分)(3)若要进一步分析“点击但未购买”的用户特征,你会如何设计数据分析思路?(5分)2.(本题15分)给定如下Python代码片段(使用Pandas和Scikit-learn),请阅读代码并回答问题。```pythonimportpandasaspdfromsklearn.model_selectionimporttrain_test_splitfromsklearn.linear_modelimportLogisticRegressionfromsklearn.metricsimportaccuracy_scoredata=pd.read_csv('customer_data.csv')data=data.dropna()X=data[['age','income','spending_score']]y=data['is_churn']#1表示流失,0表示未流失X_train,X_test,y_train,y_test=train_test_split(X,y,test_size=0.3,random_state=42)model=LogisticRegression()model.fit(X_train,y_train)y_pred=model.predict(X_test)print(accuracy_score(y_test,y_pred))```(1)解释代码中`train_test_split`函数的作用及其参数含义。(4分)(2)该代码构建的是什么类型的模型?模型的目标变量是什么?(4分)(3)如果模型在训练集上准确率很高,但在测试集上准确率很低,这是什么现象?请给出两种可能的改进方案。(7分)3.(本题10分)在设计一个基于Lambda架构的实时大数据处理系统时,系统包含批处理层、加速层和服务层。(1)请简述这三层各自的主要功能。(6分)(2)为什么Lambda架构要维护批处理层和加速层两条数据通路?这带来了什么优缺点?(4分)参考答案及详细解析一、单项选择题1.【答案】C【解析】YARN(YetAnotherResourceNegotiator)是Hadoop2.0引入的资源管理系统,负责集群资源的统一管理和调度。HDFS负责存储,MapReduce是计算模型(运行在YARN上),ZooKeeper是协调服务。2.【答案】C【解析】块大小设置并非越大越好。虽然大块能减少寻址时间和NameNode元数据大小,但过大会导致MapReduce任务并行度降低,且数据传输失败时恢复时间变长。需要根据硬件和业务特性权衡。3.【答案】B【解析】RDD(ResilientDistributedDataset)是Spark的核心抽象,具有不可变性、分区性、容错性等特性。它本质上是一个只读的记录分区集合。4.【答案】A【解析】3NF要求非主属性既不部分依赖于码,也不传递依赖于码。若属于2NF但不属于3NF,说明消除了部分依赖,但仍存在传递依赖。5.【答案】C【解析】NumPy用于科学计算,Pandas用于数据处理与分析,Matplotlib用于绘图,Scikit-learn用于机器学习。6.【答案】C【解析】Apriori算法是最经典的关联规则挖掘算法,用于发现数据集中频繁出现的项集。7.【答案】D【解析】CAP定理指出,在一个分布式系统中,一致性、可用性、分区容错性三者不可兼得,最多只能同时满足两项。8.【答案】C【解析】在Spark2.x+中,推荐使用`createOrReplaceTempView`创建或替换临时视图,以便使用SparkSQL查询。`registerTempTable`是旧版本API。9.【答案】C【解析】K-Means基于欧氏距离,假设簇是凸形和球形的,且对密度不敏感。对于非凸形状或密度不均匀的数据,效果较差。10.【答案】D【解析】Map阶段负责数据的分片和映射,Reduce阶段负责对Map输出的结果进行汇总处理。Shuffle是中间过程,负责数据分发。11.【答案】B【解析】`dropna()`用于删除缺失值;`fillna()`用于填充缺失值;`isnull()`用于检测缺失值。12.【答案】A【解析】数据仓库是面向主题的、集成的、相对稳定的(非易失的)、反映历史变化的数据集合,用于支持管理决策。13.【答案】B【解析】Flume是Cloudera提供的分布式日志收集系统,侧重于数据的传输和采集;Kafka是LinkedIn开源的分布式消息队列,侧重于高吞吐量的数据缓存和分发。14.【答案】B【解析】决策树通过计算信息增益(ID3/C4.5)或基尼系数来选择最优的分裂特征,以最大化地减少数据的不纯度。15.【答案】C【解析】Min-Max标准化对最大值和最小值敏感,容易受异常值影响。Z-Score标准化受数据量纲影响较小,将数据转换为标准正态分布。16.【答案】D【解析】RowKey设计应简短以节省存储,且应散列以避免RegionServer热点。虽然RowKey是按字典序排序的,但并不是越长越好,太长会影响存储和检索效率。17.【答案】B【解析】核函数通过将低维空间的非线性数据映射到高维特征空间,使得在高维空间中可以线性可分,从而解决线性不可分问题。18.【答案】A【解析】在Storm中,Spout是数据源,负责发射数据;Bolt是处理单元,负责数据处理;Topology是拓扑结构,是Spout和Bolt组成的图。19.【答案】B【解析】MSE(MeanSquaredError)是均方误差,即预测值与真实值差值的平方和的平均值。MAE是平均绝对误差,RMSE是均方根误差。20.【答案】B【解析】DataFrame是SparkSQL的核心抽象,它是一种带有Schema(元数据结构)信息的分布式Row集合,底层本质上是RDD。DataFrame支持SQL查询,且由于Catalyst优化器的存在,执行效率通常比原生RDD高。二、多项选择题1.【答案】ABC【解析】HDFS核心守护进程包括NameNode(元数据管理)、DataNode(数据存储)、SecondaryNameNode(辅助NameNode合并镜像)。ResourceManager属于YARN。2.【答案】BCD【解析】`reduce`、`collect`、`count`都会触发作业提交并返回结果,属于Action算子。`map`只是转换逻辑,属于Transformation算子。3.【答案】ABC【解析】特征选择方法主要分为过滤法、包装法和嵌入法。聚类法属于无监督学习,不属于特征选择方法范畴。4.【答案】AB【解析】星型模式由一个大的中心事实表和多个小的维度表组成。5.【答案】ABCD【解析】NumPy数组要求元素类型一致,大小固定,支持向量化运算(速度快)和广播机制。6.【答案】BD【解析】正则化(如L1,L2)通过在损失函数中加入惩罚项,限制模型复杂度,主要用于解决过拟合问题,同时也能在一定程度上缓解特征共线性。7.【答案】ABC【解析】Kafka具有高吞吐量、低延迟、持久化存储的特点。在分布式系统中,为了保证可用性和分区容错(AP),Kafka通常只保证最终一致性或分区内的顺序性,而非传统意义上的强一致性(CA)。8.【答案】ABCD【解析】异常值处理方法多样,包括直接删除、视为缺失值填充、盖帽法(Winsorization,用分位数替换)以及对数变换(压缩偏态分布)。9.【答案】ABC【解析】Elasticsearch基于Lucene,是分布式、支持RESTful接口的实时搜索引擎,支持水平扩展。10.【答案】AD【解析】逻辑回归通常使用Sigmoid函数处理二分类问题,使用Softmax函数处理多分类问题。ReLU通常用于深度学习隐藏层。三、填空题1.【答案】价值密度低(或价值)2.【答案】33.【答案】宽4.【答案】pd.read_csv()5.【答案】后剪枝6.【答案】GROUPBY7.【答案】RPOP8.【答案】物品9.【答案】线性10.【答案】Shuffle11.【答案】train_test_split12.【答案】移动平均13.【答案】列14.【答案】张量15.【答案】Airbnb四、判断题1.【答案】×【解析】NameNode存储元数据(命名空间、块映射信息),实际数据块存储在DataNode中。2.【答案】√【解析】Spark将中间结果存储在内存中,减少了磁盘I/O,因此在迭代算法(如机器学习)中比MapReduce快很多。3.【答案】√【解析】Python列表是可变序列,元组是不可变序列。4.【答案】√【解析】K-Means算法是聚类算法,必须预先指定聚类簇的数量K。5.【答案】×【解析】数据清洗是一个迭代过程,可以在数据探索发现问题后随时进行,不必严格限制在分析之前一次性完成。6.【答案】×【解析】MongoDB是NoSQL文档数据库,不支持标准SQL,且早期版本对事务支持较弱(虽然新版本已支持多文档事务)。7.【答案】√【解析】逻辑回归利用Sigmoid函数将结果映射到[0,1]区间,用于概率预测和分类,尽管名字叫回归。8.【答案】√【解析】Hive内部表由Hive管理生命周期,删除表时元数据和HDFS上的实际数据都会被删除。外部表则只删除元数据。9.【答案】×【解析】学习率过大可能导致无法收敛(震荡),甚至发散。需要选择合适的学习率。10.【答案】√【解析】Dropout是深度学习中常用的正则化手段,训练时随机让部分神经元失活,防止神经元过度依赖特定特征,从而抑制过拟合。五、简答题1.【答案】HDFS读文件流程如下:(1)客户端调用DistributedFileSystem.open()方法,向NameNode发起请求。(2)NameNode返回文件的部分或全部Block列表(对于大文件返回部分),以及这些Block所在的DataNode地址。(3)客户端选择距离最近的DataNode建立连接,读取数据。(4)读取完一个Block后,客户端会继续寻找下一个Block并读取,直到文件结束。(5)读取过程中如果遇到DataNode故障,客户端会尝试连接其他副本DataNode,并向NameNode报告故障。2.【答案】主要区别:(1)数据模型:RDBMS基于关系模型,存储结构化数据(表);NoSQL种类丰富,包括文档、键值对、列族、图等,适合半结构化/非结构化数据。(2)扩展性:RDBMS通常是垂直扩展(增强单机性能);NoSQL设计之初就支持水平扩展(分布式集群)。(3)事务一致性:RDBMS严格遵循ACID原则;NoSQL通常遵循BASE理论,保证最终一致性,牺牲部分强一致性换取高性能。(4)查询方式:RDBMS使用标准SQL;NoSQL通常使用API或非标准查询语言。3.【答案】MapReduce工作原理:采用“分而治之”思想,将大任务拆分为小任务并行执行。主要阶段:(1)Split阶段:输入数据被切分为多个Split,每个Split对应一个Map任务。(2)Map阶段:用户定义的Map函数处理输入键值对,输出中间键值对。(3)Shuffle阶段:系统自动执行,包括Partition(分区)、Sort(排序)、Group(分组),将Map输出的数据按照Key分发并排序传递给Reduce。(4)Reduce阶段:用户定义的Reduce函数对具有相同Key的一组Value进行汇总处理,输出最终结果。4.【答案】原因:不同特征的量纲(单位)和数量级差异很大,会导致数值大的特征在距离计算(如KNN、K-Means)或梯度下降中占据主导地位,影响模型精度和收敛速度。常见方法:(1)Min-Max标准化:将数据线性变换到[0,1]区间。公式:=。(2)Z-Score标准化:将数据转换为均值为0,标准差为1的分布。公式:=。5.【答案】过拟合:模型在训练数据上表现很好,但在未知测试数据上表现较差。原因是模型过于复杂,学习到了训练数据中的噪声和细节,而非一般规律。防止方法:(1)获取更多训练数据。(2)使用正则化方法(L1,L2)。(3)减少特征数量(特征选择)。(4)降维(如PCA)。(5)交叉验证评估模型。(6)早停法(EarlyStopping)。(7)集成学习方法(如Bagging)。六、应用与分析题1.【答案】(1)MapReduce程序思路:Map阶段:读取日志行,解析出item_id和action_type。如果action_type为“购买”,输出键值对。Shuffle阶段:系统自动按item_id分组。R
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 2026年高中秋季开学节约粮食光盘行动德育教育
- 2027届江苏省南京市下关区三年级数学第一学期期末达标检测模拟试题含解析
- 2026届专业技能考试(机电+健康器材)测试卷及答案
- 宿州市2027届数学四年级第一学期期末综合测试试题含解析
- Java线程池基础教程
- 2027届江西省萍乡市莲花县三年级数学第一学期期末监测试题含解析
- 2025-2026学年广西壮族自治区北海市高三一诊考试生物试卷含解析
- 2025-2026学年青岛市高考生物必刷试卷含解析
- 2026欧洲农产品精深加工技术效率研究报告
- 2026人工智能客服机器人开发与应用商业案例研究报告
- 小红书种草营销师模拟题及答案
- 2025至2030中国工业磁控管行业市场深度研究与战略咨询分析报告
- 工程造价咨询企业服务清单
- 三方协议包车合同范本
- DB65∕T 4747-2024 地表水自压滴灌工程设计规范
- 光伏电站日常维护与运行规范
- 抗菌药物分级管理培训
- (正式版)DB65∕T 4450-2021 《农村供水工程自动化监控及信息化管理系统设计导则》
- 纸箱设计平面图制作规范
- 人教八年级英语上册Unit 7《Section A》课件
- 牙关紧闭抽搐的急救护理措施
评论
0/150
提交评论