大数据开发基础(习题卷32)_第1页
大数据开发基础(习题卷32)_第2页
大数据开发基础(习题卷32)_第3页
大数据开发基础(习题卷32)_第4页
大数据开发基础(习题卷32)_第5页
已阅读5页,还剩19页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

试卷科目:大数据开发基础大数据开发基础(习题卷32)PAGE"pagenumber"pagenumber/SECTIONPAGES"numberofpages"numberofpages大数据开发基础第1部分:单项选择题,共57题,每题只有一个正确答案,多选或少选均不得分。[单选题]1.以下哪个框架可以同时满足实时分析、离线分析、实时检索的功能A)ApacheHadoopB)FusionInsightHDC)ApacheHBaseD)以上全都正确答案:B解析:[单选题]2.()不属于C盯模型对于HMM和MEMM模型的优势A)特征灵活B)速度快C)可容纳较多上下文信息D)全局最优答案:B解析:[单选题]3.对于文本行?hellohadoophelloworld?,经过WordCount的Reduce函数处理后的结果是()。A)<"hello",<1,1>><"hadoop",1><"world",1>B)<"hello",1><"hello",1><"hadoop",1><"world",1>C)<"hello",1,1><"hadoop",1><"world",1>D)<"hello",2><"hadoop",1><"world",1>答案:D解析:[单选题]4.TaskScheduler是以()为单元来调度任务。A)TaskSetB)TaskSetManagerC)ExecutorD)Stage答案:B解析:[单选题]5.下面关于NewSQL数据库的描述,错误的是:()A)NewSQL数据库保持了传统数据库支持ACID和SQL等特性B)不同的NewSQL数据库的内部结构基本相同C)都支持关系数据模型D)都使用SQL作为其主要的接口答案:B解析:[单选题]6.数据故事话的'情景'不包括()。A)还原情景B)统计情景C)移植情景D)虚构情景答案:B解析:数据的故事化描述(Storytelling)是指为了提升数据的可理解性、可记忆性及可体验性,将"数据"还原成关联至特定的"情景"的过程。由此可见,数据故事化也是数据转换的表现形式之一,其本质是以"故事讲述"的方式展现"数据的内容"。数据故事化中的"情景",可以是:①还原情景;还原数据所计量和记录信息时的"原始情景";②移植情景;并非对应信息的原始情景,而是将数据移植到另一个真实发生的情景(如目标用户比较熟悉的情景)之中;③虚构情景:数据的故事化描述中所选择的情景并非为真实存在的情景,而是根据讲述人的想象力设计出来的"虚构情景"。[单选题]7.()对应于决策树结果,其他节点对应于()。A)叶节点,属性测试B)根结点,学习测试C)内部节点,学习测试D)叶节点,分类测试答案:A解析:决簧树包含一个根节点、若子内部节点和若干叶节点。叶节点对应于决策结果,其他每个节点则对应于一个属性测试。[单选题]8.下列关于hadoop的描述哪个是正确的:A)Hadoop的图标是一个黄色小鸭子;B)Hadoop是由韩国人研发的;C)CDH是hadoop的其中一个发行版本;D)所有的Hadoop发行版本都是免费的。答案:C解析:[单选题]9.下面的循环会打印多少次?ILovePython??foriin5:print('ILovePython')A)1B)6C)5D)会报错答案:D解析:[单选题]10.()是Scikit-Learn中的支持向量机模块。A)MinBatchKMeansB)SVCC)LinearRegressionD)Regression答案:B解析:SVM是Sklearn中的支持向量机模块,包括分类SVC和回归SVR。[单选题]11.在Hadoop的分区阶段,默认的Partitioner是()A)RangePartitionerB)PartitionerC)HashPartitionerD)用户自定义的Partitioner答案:C解析:[单选题]12.Hive中的外部表数据只是表对()上的某一个目录的引用A)HDFS文件系统B)服务器系统C)数据库系统D)以上都不正确答案:A解析:[单选题]13.执行以下代码段age=12ifage<4:print("Youradmissioncostis$0.")elifage<18:print("Youradmissioncostis$5.")else:print("Youradmissioncostis$10.")时,输出为()。A)Youradmissioncostis$0.B)Youradmissioncostis$5.C)Youradmissioncostis$10.D)以上都不对答案:B解析:[单选题]14.在概率图模型中,(__)模型是一种判别式无向图模型。A)马尔可夫随机场B)隐马尔可夫模型C)条件随机场D)逆误差传播答案:C解析:[单选题]15.下列关于连接数组的描述不正确的是()。A)concatenate()连接沿现有轴的数组序列B)stack()沿着新的轴加入一系列数组C)vstack()水平堆叠序列中的数组(列方向)D)hstack()3D堆叠序列中的数组(行方向)答案:D解析:hstack()为数组水平拼接。[单选题]16.Spark框架standalone运行模式是?A)简单模式B)单机模式C)本地模式D)集群模式答案:D解析:[单选题]17.在HBase中,删除整个表结构的命令是()A)truncateB)dropC)deleteD)以上都不正确答案:B解析:[单选题]18.执行"a"+"bc"语句时输出是()。A)aB)bcC)bcaD)abc答案:D解析:[单选题]19.新兴数据管理如R主要包括NoSQL技术、NewSQL技术和()。A)数据仓库B)关系云C)数据库系统D)文件系统答案:B解析:[单选题]20.关于RDD,下列说法错误的是哪一项?A)RDD具有血统机制(Lineage)。B)RDD默认存储在磁盘。C)RDD是一个只读的,可分区的分布式数据集。D)RDD是Spark对基础数据的抽象。答案:B解析:[单选题]21.以等可能性为基础的概率是()。A)古典概率B)经验概率C)试验概率D)主观概率答案:A解析:古典概率是以这样的假设为基础的,即随机现象所能发生的事件是有限的、互不相容的,而且每个基本事件发生的可能性相等。根据大量的、重复的统计试验结果计算随机事件中各种可能发生结果的概率,称为试验概率或频率概率。主观概率,是指建立在过去的经验与判断的基础上,根据对未来事态发展的预测和历史统计资料的研究确定的概率,反映的只是一种主观可能性。[单选题]22.有如下程序:defcube(x):returnx*x*xx=cube(3)print(x)程序的输出结果是()。A)3B)9C)27D)81答案:C解析:[单选题]23.下面不属于数据加工的有(__)。A)数据脱敏B)数据脱质C)数据规约D)数据标注答案:B解析:[单选题]24.当需要在字符串中使用特殊字符时,Python使用()作为转义字符。A)\B)/C)#D)%245答案:A解析:转义字符为反斜线\。[单选题]25.下列方法中属于映射数据到新的空间的是()。A)傅里叶变换B)特征加权C)渐进抽样D)维归约答案:A解析:傅里叶变换是将时间域映射到频率域。[单选题]26.np.dot([[1,2,3],[1,2,3],[1,2,3]],[[2,1,1],[2,1,1],[2,1,1]])的输出结果是()。A)[[1,2,6,6],[12,6,6],[12,6,6]]B)[[2,2,3],[2,2,3],[2,2,3]]C)[[1,2,3],[1,2,3],[1,2,3]]D)[[2,1,1,],[2,1,1],[2,1,1]]答案:A解析:矩阵乘法运算,此处算第一个数就可以排除其他选项。[单选题]27.将关系型数据库中的数据导入到Hadoop平台的工具是()。A)importB)exportC)overwriteD)drop答案:A解析:[单选题]28.在文本分析中,我们使用哪一种技术手段挖掘文本中隐含的语义信息()A)TF-IDFB)主题分析C)情感分析D)以上都不对答案:B解析:[单选题]29.在FuisonInsightHD中,创建Loader作业的进行数据转换的正确步骤是?A)输入设置,转换,输出B)抽取,转换,输出C)加载,转换,输出D)加载,转换,抽取答案:A解析:[单选题]30.()数据库使用图形理论来存储实体之间的关系信息。A)列存储B)文档型C)图形D)key-value答案:C解析:[单选题]31.使用sklearn库进行预测结果的交叉验证,需要导入一下哪个包()。A)sklearn.linear_modelB)sklearn.model_selectionC)sklearn.naive_bayesD)sklearn.ensemble答案:B解析:[单选题]32.以下()不是MaxcomputeMR的必须组成阶段。A)MapB)ShuffleC)ReduceD)Combiner答案:D解析:[单选题]33.在专家系统的开发过程中使用的专家系统工具一般分为专家系统的()与通用专家系统工具两类。A)模型工具B)外壳C)知识库工具D)专用工具答案:B解析:[单选题]34.机器学习是对于一个计算机程序给定一个()和一个(),如果在()的影响下,P对T的测量结果得到了改进,则可以认为程序在E中学习了。A)经验E、性能测量方法P、任务TB)任务T、性能测量方法P、经验EC)任务T、经验E、性能测量方法PD)性能测量方法P、经验E、任务T答案:B解析:[单选题]35.()是指给目标用户产生的错误或不准确的视觉感知,而这种感知与数据可视化者的意图或数据本身的真实情况不一致。A)视觉假象B)视觉认知C)视觉感知D)数据可视答案:A解析:视觉假象(VisualIlusion)是数据可视化工作中不可忽略的特殊问题。视觉假象是指给目标用户产生的错误或不准确的视觉感知,而这种感知与数据可视化者的意图或数据本身的真实情况不一致。[单选题]36.HDFS配置数据文件存储路径(dfs.datanode.data.dir)的文件是哪一个?A)hadoop-env.shB)core-site.xmlC)hdfs-site.xmlD)yarn-site.xml答案:C解析:[单选题]37.()是指数据减去一个总括统计量或模型拟合值时的残余部分A)极值B)标准值C)平均值D)残值答案:D解析:[单选题]38.图灵奖获得者吉姆·格雷提出的科学研究的第四范式-数据密集型科学发现(D、A、tA、-intensiveSC、ientifiC、D、isC、overy)描述了数据科学的()。A)、三世界原则B)、三要素原则C)、数据复杂性原则D)、从简原则答案:A解析:[单选题]39.having,where,groupby的正确执行顺序是()。A)having,where,groupbyB)where,groupby,havingC)where,having,groupbyD)groupby,having,where答案:B解析:[单选题]40.涉及《网络安全法》等法律法规的相关事项不包括()。A)落实公司关键信息基础设施数据安全保护要求B)禁止公网传输相关数据。C)履行网络运营者的数据安全责任与义务D)落实国家大数据安全保护要求。答案:B解析:[单选题]41.删除数据表用以下哪一项()A)DROPB)UPDATEC)DELETED)DELETED答案:A解析:[单选题]42.银行进行客户购买力分析.首先获取客户历史账单,确定其中各项商品的计算权重,得出每位客户的购买力评分并存储记录。最后将结果以图表显示。请问该过程对应于以下哪个项目数据流程设计。A)数据可视化->数据源->数据落地->数据处理B)数据源->数据落地->数据处理->数据可视化C)数据源->数据处理->数据落地->数据可视化D)数据可视化->数据源->数据处理>数据荷地答案:C解析:[单选题]43.现有一张score表,我想要实现先按照班级class_name进行分桶,再按照学生学号stu_id进行升序排序,下列语句书写正确的是()A)SELECTFROMscoreCLUSTERBYclass_name,stu_id;B)SELECTFROMscoreCLUSTERBYclass_namesortbystu_idasc;C)SELECTFROMscoreDISTRIBUTEBYclass_nameSORTBYstu_id;D)SELECTFROMscoreDISTRIBUTEDBYclass_nameSORTBYstu_idasc;答案:C解析:[单选题]44.下面关于MapReduce模型中Map函数与Reduce函数的描述正确的是()A)一个Map函数就是对一部分原始数据进行指定的操作。B)一个Map操作就是对每个Reduce所产生的一部分中间结果进行合并操作。C)Map与Map之间不是相互独立的。D)Reducee与Reduce之间不是相互独立的。答案:A解析:[单选题]45.假设在卷积神经网络的第一层中有5个卷积核,每个卷积核尺寸为7×7,具有零填充且步幅为1,该层的输入图片的维度是224×224×3,那么该层输出的维度是()。A)217×217×3B)217×217×8C)218×218×5D)220×220×7答案:C解析:如果原始图片尺寸为n×n,filter尺寸为f×f,则卷积后的图片尺寸为(n-f+1)×(n-f+1),f一般为奇数。若考虑存在填充和步幅,用s表示stride长度,p表示padding长度,如果原始图片尺寸为n×n,filter尺寸为f×f,则卷积后的图片尺寸为[(n+2p-f)/s+1]×[(n+2p-f)/s+1](中括号内向下取整)。此例中,n=224,p=0,f=7,s=1,因此,该层输出的尺寸为218×218.输出的第三个维度由滤波器的个数决定,即为5。[单选题]46.()主要代表的是数据的形态是否符合计算与算法要求。A)规整数据B)干净数据C)算法数据D)抽样数据答案:A解析:[单选题]47.下面关于机器学习相关描述不正确的有(__)。A)机器学习的主要议题是如何实现和优化机器的自我学习B)机器学习的基本思路是以训练集为输入,通过机器学习算法让机器学习到能够处理更多数据的能力C)AlphaGo的核心技术是深度学习与增强学习D)机器学习的只能是预定义的答案:D解析:[单选题]48.使用同态滤波方法进行图像增强时,不包含以下哪个过程A)通过对图像取对数,将图像模型中的入射分量与反射分量的乘积项分开B)将对数图像通过傅里叶变换变到频域,在频域选择合适的滤波函数,进行减弱低频和加强高频的滤波C)计算图像中各个灰度值的累计分布概率D)对滤波结果进行傅里叶逆变换和对数逆运算答案:C解析:[单选题]49.下列语句在Python中非法的是()。A)x=y=z=1B)x=(y=z+1)C)x,y=y,xD)x+=y答案:B解析:赋值语句不能用于赋值。[单选题]50.Hive中的外部表相关描述正确的有()A)定义和数据的生命周期互相约束,当删除表定义的时候,其表中的数据依然是存在的B)定义和数据的生命周期互相不约束,当删除表定义的时候,其表中的数据依然是存在的C)定义和数据的生命周期互相约束,当删除表定义的时候,其表中的数据会被删除D)定义和数据的生命周期互相不约束,当删除表定义的时候,其表中的数据会被删除答案:B解析:[单选题]51.()进程运行在源端和目标端,用于启动、监控、重启GoldenGate的其他进程。A)ManagerB)ExtractC)PumpD)Replicat答案:A解析:[单选题]52.在Hive中,以下那一个查询语句可以将2个或多个表集合进行合并()A)unionfullB)unionallC)unionforD)unionon答案:B解析:[单选题]53.习近平总书记在2016年()月主持召开了网络安全和信息化工作座谈会A)4月B)2月C)3月D)5月答案:A解析:[单选题]54.关于抽象类,下列说法错误的是()。A)抽象类中只能有抽象方法B)抽象类能被实例化C)抽象类既包括函数属性又包括数据属性D)抽象类同时具备普通类和接口类的部分特性答案:B解析:第2部分:多项选择题,共23题,每题至少两个正确答案,多选或少选均不得分。[多选题]55.在数据库系统中,有哪几种数据模型?()A)实体联系模型B)关系模型C)网状模型D)层次模型答案:BCD解析:[多选题]56.项目空间保护打开后(setsecurity.ProjectProtection=True)以下()操作会被禁止。A)从非trustproject中读项目空间中的数据B)把项目空间中的数据写到非trustproject中C)读非trustproject中的数据D)从trustproject写数据到项目空间答案:AB解析:[多选题]57.关于神经网络,下列说法正确的是()。A)增加网络层数,可能会增加测试集分类错误率B)增加网络层数,一定会增加训练集分类错误率C)减少网络层数,可能会减少测试集分类错误率D)减少网络层数,一定会减少训练集分类错误率答案:AC解析:增加网络层数可能造成训练误差和测试误差减小,但神经网络层数过多容易造成过拟合,训练误差小,但是测试误差很大。[多选题]58.下面关于外键约束描述正确的是()。--A)可防止非法数据的插入B)会带来额外的开销C)删除主表的数据时,需要先删除从表的数据D)以上说法都不正确答案:ABC解析:[多选题]59.以下说法正确的是()。A)条件独立性假设不成立时,朴素贝叶斯分类器仍有可能产生最优贝叶斯分类器B)在估计概率值时使用的拉普拉斯修正避免了因训练集样本不充分而导致概率估值为零的问题C)由于马尔可夫链通常很快就能趋于平稳分布,因此吉布斯采样算法的收敛速度很快D)二分类任务中两类数据满足高斯分布且方差相同时,线性判别分析产生贝叶斯最优分类器答案:ABD解析:由于马尔可夫链通常需要很长时间才能趋于平稳分布,因此吉布斯采样算法的收敛速度较慢。[多选题]60.下列哪些类型是数值型的数据()A)setB)doubleC)mediumintD)float答案:BCD解析:[多选题]61.HiveQL的查询语句中排序可以使用()【选两项】A)orderbyB)sortbyC)distributebyD)countby答案:AB解析:[多选题]62.下列关于Zookeeper的描述正确的有()。A)Zookeeper维护着一个树形的层次结构B)Zookeeper的数据访问具有原子性C)Zookeeper被设计用来实现协调服务D)Zookeeper被设计用来实现大容量数据存储答案:ABC解析:Zookeeper无法用来存储数据。[多选题]63.加强数据安全技术保护可从以下几个环节展开()。A)数据采集与传输环节B)数据存储环节C)数据使用环节D)数据销毁环节答案:ABCD解析:[多选题]64.下列关于RNN、LSTM、GRU说法正确的是()A)RNNI入了循环的概念B)LSTM可以防止梯度消失或者爆炸C)GRU是LSTM的变体D)RNN、LSTM、GRU是同一神经网络的不同说法没有区别答案:ABC解析:[多选题]65.图像分割中常使用的领域有()。A)0邻域B)4邻域C)8邻域D)24邻域答案:BC解析:[多选题]66.Flume的特点包括(A)分布式)。B)高可靠C)高容错D)易于定制和扩展答案:ABCD解析:Flume的特点包括分布式、高可靠、高容错、易于定制和扩展。[多选题]67.下列关于错误率和精度描述有误的是(__)。A)错误率是分类错误的样本占样本总数的比例B)精度是指分类正确的样本数占样本总数的比例C)精度表示统计分类器预测出来的结果与真实结果不相同的个数,然后除以总的样例集D的个数D)错误率表示用统计分类正确的样本数,除以总的样例集D的个数答案:CD解析:[多选题]68.从形式语言表达能力而言,规则可分为两类:(__)和(__)。A)命题规则B)一阶规则C)原子命题D)逻辑连接词答案:AB解析:[多选题]69.plt.axhline(y=0.0,c="r",ls="--",lw=2),下列关于该代码的说法正确的有()。A)在0.0处添加竖直参考线B)添加水平参考线C)参考线是虚线形式D)网格线是红色的答案:BC解析:该代码添加的是红色水平参考线、虚线线型。[多选题]70.关于学习器结合的描述,正确的是()A)避免羊学习器可能因误选而导致泛化性能不佳B)降低陷入局部极小点的风险C)假设空间扩大,有可能学得更好的近似D)多学习器结合有可能冲突答案:ABC解析:[多选题]71.网站个性化推荐的背后,可以使用哪些类型的数据实现A)半结构化B)结构化C)非结构化D)无结构化答案:ABC解析:[多选题]72.分类模型的误差包括(___)。A)训练误差B)泛化误差C)再代入误差D)表现误差答案:ABC解析:[多选题]73.有关实时检索引擎中各组件的联系与定位,以下描述中正确的有哪些项?A)HBaseoElasticSearch的组合满足了大部分的用户实时检索诉求B)ElasticSearch存储数据性价比低,但是其能够满足场景中多级索引的实时查询需求,同时还能够对文档分词建立索引C)与HBase相比,ElasticSearch在海量数据的情景下存储性能不如HBase,故选择HBase作为海量数据存储的基石D)图数据库可以完美的解决复杂多级关系查询分析,选用GES来解决图数据的实时查询需求答案:ABCD解析:[多选题]74.云计算能够给我们带来什么?A)弹性配给B)按需自主服务C)进行资源汇集D)按需硬性服务答案:ABC解析:[多选题]75.数据安全不仅包括数据保密性,还包括()。A)完整性B)可用性C)不可否认性D)可审计性答案:ABCD解析:数据安全不等同于数据保密。通常,除了数据保密--数据的机密性(Confidentiality)之外,数据安全还包括完整性(Integrity)、可用性(Availability)、不可否认性(Non-repudiation)、鉴别(Authentication)、可审计性(Accountability)和可靠性(Reliability)等多个维度[多选题]76.在实际应用中,大数据处理主要包括以下哪三个类型?()A)复杂的批量数据处理:通常时间跨度在数十分钟到数小时之间B)基于历史数据的交互式查询:通常时间跨度在数十秒到数分钟之间C)基于实时数据流的数据处理:通常时间跨度在数十秒到数分钟之间D)基于实时数据流的数据处理:通常时间跨度在数百毫秒到数秒之间答案:ABD解析:[多选题]77.下列对MapReduce中的公平调度器描述正确的是()。A)公平调度器的目标是让每个用户公平共享集群能力B)作业都放在作业池中,在默认情况下,每个用户都有自己的作业池C)公平调度器支持抢占机制D)公平调度器不支持抢占机制答案:ABC解析:第3部分:判断题,共16题,请判断题目是否正确。[判断题]78.回归分析中,只包括一个自变量和一个因变量,且二者的关系可用一条直线近似表示,这种回归分析称为一元线性回归分析。()A)正确B)错误答案:错解析:[判断题]79.大数据平台安全管理系统的功能为:从各系统获取日志,同时为各系统提供安全控制策略。A)正确B)错误答案:对解析:[判断题]80.?from模块名import*?语句与?import模块名?都能导入指定模块的全部内容,相比之下,from…import*导入的内容无须指定模块名,可直接调用,使用更加方便,因此更推荐在程序中此种方式导入指定模块的全部内容。()A)正确B)错误答案:错解析:[判断题]81.Python关键字不可以作为变量名。A)正确B)错误答案:对解析:[判断题]82.kafka中的Broker在收到新消息后会立到存入磁盘?A)正确B)错误答案:错解析:[判断题]83.Flume的数据流可以根据headers的信息发送到不同的Channel中。A)正确B)错误答案:对解析:[判断题]84.Partition()函数/分区函数:MapReduce对map()函数的输出的中间key值使用分区函数来对数据进行分区处理,为每个Reduce任务创建一个分区。A)正确B)错误答案:对解析:[判断题]85.Kafka适用于实时性要求不高的场景。()A)正确B)错误答案:错解析:[判断题]86.假设有列表a=['name','age','sex']和b=['Dong',38,'Male'],请使用一个语句将这两个列表的内容转换为字典,并且以列表a中的元素为?键?,以列表b中的元素为?值?,这个语句可以写为c

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论