版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
试卷科目:大数据开发基础大数据开发基础(习题卷84)PAGE"pagenumber"pagenumber/SECTIONPAGES"numberofpages"numberofpages大数据开发基础第1部分:单项选择题,共54题,每题只有一个正确答案,多选或少选均不得分。[单选题]1.RegionServer打开一个Region的时候会创建一个相应的()对象A)RegionB)HRegionC)RegionServerD)Server答案:B解析:[单选题]2.下面对范数规则化描述错误的是(__)。A)L0是指向量中0的元素的个数B)L1范数是指向量中各个元素绝对值之和C)L2范数向量元素绝对值的平方和再开平方D)L0是指向量中非0的元素的个数答案:A解析:[单选题]3.()的主要目标是提供可扩展的机器学习算法及其实现,旨在帮助开发人员更加方便快捷地创建智能应用程序。A)MahoutB)FlumeC)SqoopD)HBase答案:A解析:Mahout是ApacheSoftwareFoundation(ASF)旗下的一个开源项目,提供一些可扩展的机器学习领域经典算法的实现,旨在帮助开发人员更加方便快捷地创建智能应用程序。Mahout包含许多实现,如聚类、分类、推荐过滤、频繁子项挖掘等。[单选题]4.Spark中引入RDD概念的目的是()。A)数据存储B)数据查重C)提升容错能力D)增强数据一致性答案:C解析:在Spark中引入RDD概念的目的是实现Spark的并行操作和灵活的容错能力。[单选题]5.下面插入数据操作错误的是()。--A)INSERT数据表名VALUE(值列表)B)INSERTINTO数据表名VALUES(值列表)C)INSERT数据表名VALUES(值列表)D)INSERT数据表名(值列表)答案:D解析:[单选题]6.常用的数据收集工具不包括以下哪个选项?A)LoaderB)SqoopC)KettleD)Spark答案:D解析:[单选题]7.开发Maxcompute的用户自定义标量函数,主要是实现其中的()方法。A)evaluateB)mainC)iterateD)process答案:A解析:[单选题]8.下列哪个不是词语情感分析的方法?A)基于网络的分析方法B)基于词向量的分析方法C)基于词典的分析方法D)基于语料库的分析方法答案:B解析:[单选题]9.输人图片大小为37x37,经过第一层卷积t(henumberoffilters=25,kernelsize=5川,padding=valid,stride=l)与池化层maxpooling(kemelsize=3x3,padding=valid),输出特征图大小为()A)10x10B)11x11C)12x12D)13x13答案:B解析:[单选题]10.以下哪些不属于数据产品的特点A)具有概率的准确性B)自适应性C)严格性D)闭环性答案:C解析:[单选题]11.S市A,B共有两个区,人口比例为3:5,据历史统计A的犯罪率为0.01%,B区为0.015%,现有一起新案件发生在S市,那么案件发生在A区的可能性有多大?(___)A)0.375B)0.268C)0.286D)0.261答案:C解析:[单选题]12.OGG软件是一种基于()的结构化数据复制软件。A)数据流B)配置文件C)交互D)日志答案:D解析:[单选题]13.以下哪项不属于大数据在零售领域的应用:()A)大数据征信B)发现关联购物行为C)客户群体D)供应链管理答案:A解析:[单选题]14.下列关于MPI叙述不正确的一项是()。A)MPI是一个信息传递应用程序的接口B)MPI程序经常在共享内存的机器上使用C)MPI并行计算增加高层并行编程模型D)MPI缺少统一的计算框架支持答案:C解析:[单选题]15.下列选项中,不属于Python数据类型的是()A)boolB)dictC)stringD)set答案:C解析:[单选题]16.关于Spark中RDD的描述不准确的是A)ROD可以从HDFS输入创建,或从与Hadoop兼容的其他存储系统中输入创建。B)Spark的所有Transforn操作都是基于RDD来实现的。C)ROD是只读和可分区的。要想对RDD进行操作,只能重新生成一个新的RDD.D)当前RDO默认是存储于内存,当内存不足时,RDD也不会溢出到磁盘中。答案:D解析:[单选题]17.以下()属于NoSQL数据库中Key-Value的缺点。A)不记录结构信息B)查询性能不高,缺乏统一查询语法C)功能相对有限D)功能相对有限,不易于做分布式集群答案:A解析:Key-Value型数据通常Key与Value之间采用某种方法(如哈希表)建立Key-Value映射,其缺点是不记录结构信息,无法建立索引。[单选题]18.若a=np.array([[1,2,3],[4,5,6]]),则print(np.cumsum(a,1))的输出结果是(__)。A)[[136][4915]]B)[136101521]C)[[123][579]]D)[615]答案:A解析:[单选题]19.用户数据归档,即存储冷数据(不经常访问的数据),适合选用哪种产品()A)对象存储B)云备份C)云存储网关D)以上都不是答案:B解析:[单选题]20.在支持向量机中,软间隔支持向量机的目标函数比硬间隔支持向量机多了一个()。A)偏置项bB)系数C)松弛变量D)两种情况的目标函数相同答案:C解析:[单选题]21.(__)是指为最小化总体风险,只需在每个样本上选择能使特定条件风险最小的类别标记。A)支持向量机B)间隔最大化C)线性分类器D)贝叶斯判定准则答案:D解析:[单选题]22.output.py文件和test.py文件内容如下,且output.py和test.py位于同一文件夹中,那么运行test.py的输出结果是()。#output.pydefshow():print(__name__)#test.pyimportoutputif__name__=='__main__':output.show()A)outputB)__name__C)testD)__main_答案:A解析:[单选题]23.下列哪个应用领域不属于深度学习算法应用()A)人脸识别B)机器翻译C)肿瘤诊断D)自动控制答案:D解析:[单选题]24.下列语句中不能创建一个字典的是()。A)dict1={}B)dict2={3∶5}C)dict3={[1,2,3]∶"uestc"}D)dict4={(1,2,3)∶"uestc"}答案:C解析:字典key不可以是可变类型,C选项中列表为可变类型。246[单选题]25.一幅512*512的图像,若灰度级数为16,则该图像大小为()。A)32KBB)128KBC)1MBD)2MB答案:B解析:[单选题]26.下列关于RDD说法,描述有误的是?A)一个RDD就是一个分布式对象集合,本质上是一个只读的分区记录集合B)每个RDD可分成多个分区,每个分区就是一个数据集片段C)RDD是可以直接修改的D)RDD提供了一种高度受限的共享内存模型答案:C解析:[单选题]27.()向用户提供办公软件、工作流等服务,使软件提供商从软件产品的生产者转变成服务的运营者A)IaasB)PaasC)SaasD)Daas答案:C解析:[单选题]28.HBase是分布式列式存储系统,记录按什么集中存放。A)列族B)列C)行D)不确定答案:B解析:[单选题]29.在进行回归模型运行操作前,需要进行哪一步转换操作?()A)数值组装B)数值预测C)模型训练D)求绝对值答案:A解析:[单选题]30.执行以下代码段defbuild_profile(first,last,**user_info):profile={}profile['first_name']=firstprofile['last_name']=lastforkey,valueinuser_info.items():profile[key]=valuereturnprofileuser_profile=build_profile('albert','einstein',location='princeton',field='physics')print(user_profile)时,输出为()。A){'first_name':'albert','last_name':'einstein'}B){'first_name':'albert','last_name':'einstein','princeton':'physics'}C){'first_name':'albert','last_name':'einstein','location':'princeton','field':'physics'}D){'first_name':'albert','last_name':'einstein','location':'field'}答案:C解析:[单选题]31.小米的智能音响属于物联网架构中的哪一层?A)感知层B)网络层C)处理层D)应用层答案:D解析:[单选题]32.下列SQL语句中,修改表结构的是A)ALTERB)CREATEC)UPDATED)INSERT答案:A解析:[单选题]33.在Apriori算法中,候选项集划分为不同的桶,存放在()中A)字典B)集合C)Hash树D)列表答案:C解析:[单选题]34.在Flink技术架构中,以下哪项是流处理和批处理的计算引擎?A)StandaloneB)RuntimeC)FlinkCoreD)DataSteam答案:B解析:[单选题]35.在IBMPASS中,聚类算法分为分层聚类、Kohonennetwork、K均值聚类和()四种。A)系统聚类B)两步聚类C)模型聚类D)其他聚类答案:B解析:[单选题]36.下列是数学模块的是()A)mathB)randomC)reD)sax答案:A解析:[单选题]37.(__)中基学习器的多样性不仅来自样本扰动,还来自属性扰动。A)AdaBoostB)RFC)BaggingD)传统决策树答案:B解析:[单选题]38.()是在云计算环境中部署和虚拟化的关系数据库,进而使传统关系数据库具备云计算的主要优势。A)NoSQLB)NewSQLC)关系云D)SQL数据库答案:C解析:[单选题]39.数据仓库所存储的数据,通常具有一定特点,下列哪些不属于其特点的()。A)面向特定主题B)数据大都反应历史C)数据来源多样D)经常修改数据项的值答案:D解析:[单选题]40.特殊贡献奖考核内容为成功对接外部数据,当月兑现()考核款;外部数据正式接入落地,当月兑现剩余()考核款。A)60%、40%B)50%、50%C)70%、30%D)40%、60%答案:A解析:[单选题]41.分词中的正向最大匹配算法是(__)扫描字符串。A)从左到右B)从右到左C)两边同时进行D)从一个指定的字符发散答案:A解析:[单选题]42.以下描述不正确的是(__)。A)耐抗性是指对于数据局部不良反应的非敏感性B)残差是指一个总括统计量或模型拟合值减去数据C)重新表达是指找到合适的尺度或数据表达方式进行一定的转换,使得有利于数据分析D)启示是指通过探索性分析,发现新的瑰丽,问题和启迪,进而满足数据加工和数据分析的需要答案:B解析:[单选题]43.BI工具中,追加/替换数据中可新增字段的操作在哪一步中?()A)上传文件B)预览数据C)数据集设置D)字段匹配答案:D解析:[单选题]44.回归的评价标准不包括()A)平均绝对误差B)决定系数C)Rand指数D)均方误差答案:C解析:[单选题]45.下面关于基础理论相关描述正确的有(__)。A)基础理论等于理论基础B)基础理论在数据科学研究边界之外C)理论基础在数据科学研究边界之内D)基础理论包含理念、理论、方法、技术等答案:D解析:[单选题]46.Hadoop中,()执行文件系统命名空间操作。A)DataNodeB)NameNodeC)JobTrackerD)TaskTracker答案:C解析:[单选题]47.使用梯度下降算法的步骤是什么?()_x000b_1.计算实际值与预测值之间的误差_x000b_2.重申,直到你找到最好的网络权重_x000b_3.通过网络传递输入并从输出层获取值_x000b_4.初始化随机权重和偏差_x000b_5.通过梯度下降loss函数计算方法更新权重和偏差A)4,2,3,1,5B)4,5,3,2,1C)4,2,1,5,3D)4,3,1,5,2答案:D解析:[单选题]48.在HBase系统架构中,HRegionServer主要负责相应用户I/O请求,向()文件系统中读写数据A)HAFSB)HBFSC)HCFSD)HDFS答案:D解析:[单选题]49.交叉验证的目的是()。A)提高分类准确率B)得到更稳定的模型C)验证结果的准确性D)增大分类的误差答案:B解析:[单选题]50.hadoop集群不可以在()进行。A)联机模式B)单机模式C)虚拟分布模式D)完全分布模式答案:A解析:[单选题]51.以()为指导,结合业务数据资产需求和数据资产管理现状,编制专业数据资产发展规划,统筹编制公司数据资产发展规划。A)公司战略B)公司数据安全战略C)公司管理制度D)公司数据资产发展战略答案:D解析:[单选题]52.下面哪个组件为Hadoop提供数据存储能力()A)HDFSB)MapReduceC)YarnD)Zookeeper答案:A解析:[单选题]53.Python代码中mpl.rcParams['font.sans-serif']=['SimHei']的作用是()。A)设置图表中文显示的字体B)设置图表图例的位置C)设置图表标题的颜色D)设置图表标题的位置答案:A解析:设置图表字体以正确显示中文。[单选题]54.()是表现数据分布对称性的指标。A)斜率B)偏斜度C)偏度D)偏离度答案:B解析:偏斜度是对统计数据分布偏斜方向及程度的度量。在偏态分布中,当偏斜度为正值时,分布正偏,即众数位于算术平均数的左侧;当偏斜度为负值时,分布负偏,即众数位于算术平均数的右侧。第2部分:多项选择题,共23题,每题至少两个正确答案,多选或少选均不得分。[多选题]55.以下哪些软件可以对HBase进行性能监视?A)Master-status(自带)B)GangliaC)OpenTSDBD)Ambari答案:ABCD解析:[多选题]56.以下属于数据挖掘与分析工具的有()。A)TableauB)PythonC)SPSSD)Alteyx答案:ABCD解析:常用的数据挖掘工具有RapidMiner、IBMSPSSModeler、OracleDataMining、Teradata、Python。常用的数据分析工具有Tableau、Alteyx、R&Python语言、FineReport、PowerBI。[多选题]57.下列有关索引的描述正确的是()。A)索引的目的是为了增加数据操作的速度B)索引是数据库内部使用的对象C)索引建立的过多会降低数据更新的速度D)只能为一个字段建立索引答案:BC解析:[多选题]58.Google发布的三篇论文是哪些?A)GFSB)HDFSC)MapReduceD)BigTable答案:ACD解析:[多选题]59.SQL语言集几个功能模块为一体,其中包括()A)C.DCLB)DMLC)D.DNLD)A.DDL答案:ABD解析:[多选题]60.Kafka中删除消息的阈值有哪几种?A)数据产生的时间B)数据使用的频率C)硬盘总空间大小D)分区总日志大小答案:AD解析:[多选题]61.下列关于Spark与Hadoop的说法正确的是()。A)Hadoop和Spark都是并行计算B)Hadoop和Spark两者都是用MR模型进行计算C)Spark中提供了文件管理系统D)Spark中没有提供文件管理系统答案:ABD解析:[多选题]62.根据训练数据是否拥有标记信息,学习任务可大致分为(___)和(___)。A)监督学习B)训练集C)无监督学习D)测试集答案:AC解析:[多选题]63.假设检验中,首先需要提出零假设和备择假设,下列关于零假设和备择假设的描述正确的有()。A)零假设是只有出现的概率大于阈值才会被拒绝的;备择假设是只有零假设出现的概率大于阈值才会被承认的B)零假设是希望推翻的结论;备择假设是希望证明的结论C)零假设是只有出现的概率小于阈值才会被拒绝的;备择假设是只有零假设出现的概率小于阈值才会被承认的D)零假设是希望证明的结论;备择假设是希望推翻的结论答案:BC解析:略[多选题]64.下列属于统计分析的算法是()A)标准差B)百分位C)相关系数D)聚类答案:ABC解析:[多选题]65.做一个二分类预测问题,先设定阈值为0.5,概率不小于0.5的样本归入正例类(即1),小于0.5的样本归入反例类(即0)。然后,用阈值n(n>0.5)重新划分样本到正例类和反例类,下面说法正确的是()。A)增加阈值不会提高召回率B)增加阈值会提高召回率C)增加阈值不会降低查准率D)增加阈值会降低查准率答案:AC解析:召回率=TP/TP+FN,查准率=TP/TP+FP。当概率阈值增加时,TP、FP减少或者持平,TP+FN不变,所以召回率不会增加。[多选题]66.()类型的字段可以作为MaxCompute的分区键。A)stringB)datetimeC)bigintD)double答案:AC解析:[多选题]67.常见的聚类性能度量外部指标有()。A)Jaccard系数B)DB指数C)FM指数D)以上答案都正确答案:AC解析:聚类常用的外部指标包括Jaccard系数、FM指数、Rand指数。[多选题]68.以下()方法可以支持Maxcompute中受保护项目空间的数据流出。A)使用owner通过policy授权B)设置例外(ExceptionPolicy)C)使用owner通过ACL授权D)设置项目互信(TrustedProject)答案:BD解析:[多选题]69.交易数据的来源主要包括哪些:()A)政府公开数据B)企业内部数据C)数据供应方数据D)网页爬虫数据答案:ABCD解析:[多选题]70.下列关于Explain的关键字描述正确的是()?A)Explain通过指定option选项参数FORMAT来指定输出格式,默认是text格式。B)在Explain的基础上,通过添加Analyze同时显示该语句执行时每个算子的实际开销(单位为毫秒)和行数信息,对于判断优化器的估算准确提供依据。C)在Explain的基础上,添加Performance显示出计划的额外详细信息,包括每个算子的输出列,重分布算子的分布列等。D)在Explain的基础上,添加Verbose显示出计划的额外详细信息,包括每个算子的输出列,重分布算子的分布列等。答案:BD解析:[多选题]71.观察样本次数如何影响过拟合()?注意:所有情况的参数都保持一致。A)观察次数少,容易发生过拟合B)观察次数少,不容易发生过拟合C)观察次数多,容易发生过拟合D)观察次数多,不容易发生过拟合答案:AD解析:[多选题]72.在云生态环境中,用户需求相当于(),云数据中心相当于(),云服务相当于()。A)降水B)水滴C)水库D)阳光答案:BCD解析:[多选题]73.(__)属于图像平滑的滤波。A)盒式滤波B)双边滤波C)导向滤波D)贝叶斯变换答案:ABC解析:[多选题]74.为TIME类型字段添加(),其插入数据库中的时间为48:20:50。--A)'482050'B)482050C)'200:20:50'D)以上答案都不正确答案:ABC解析:[多选题]75.下列是MYSQL比较运算符的是()A)!=B)<>C)==D)>=答案:ABD解析:[多选题]76.以下说法正确的是()A)二项分布的方差为p*(1-p)B)PDF是连续变量特有的C)伯努利分布分布的期望为npD)PMF是连续随机变量特有的答案:BC解析:[多选题]77.可视分析学是一门以可视交互为基础,综合运用()等技术等多个学科领域的知识,以实现人机协同完成可视化任务为主要目的的分析推理学科。A)物理学B)图形学C)数据挖掘D)人机交互答案:BCD解析:第3部分:判断题,共19题,请判断题目是否正确。[判断题]78.用线性代数的方式描述函数或者方程的好处之一是书写方便A)正确B)错误答案:对解析:[判断题]79.Hadoop自身具有严格的权限管理和安全措施保障集群正常运行。A)正确B)错误答案:错解析:hadoop自身并不能保证,否则本来也不会引入zookeeper进行ha了[判断题]80.元组支持增加、删除和修改元素的操作。()A)正确B)错误答案:错解析:[判断题]81.回归分析通常用于挖掘关联规则A)正确B)错误答案:错解析:[判断题]82.转义字符r?\n?的含义是回车换行。A)正确B)错误答案:对解析:[判断题]83.高线批处理,通常是指对海量数据进分析和处理,形成结果数据,供下一步数据应用使用,离线处理对处理时间要求不高。A)正确B)错误答案:对解析:[判断题]84.已知a=[1,2,3]和b=[1,2,4],那么id(a[1])==id(b[1])的执行结果为False。A)正确B)错误答案:错解析:[判断题]85.函数可以提高代码的复用性。()A)正确B)错误答案:对解析:[判断题]86.已知函数定义defdemo(x,y,op):returneval(str(x)+op+str(y)),那么表达式demo(3,5,'*')的值为8。A)正确B)错误答案:错解析:[判断题]87.HLL类型的存储长度是固定的。A)正确B)错误答案:对解析:[判断题]88.Spark是基于内存的计算引擎,
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 2026年双鸭山市宝山区公务员人员招聘考试参考试题及答案详解
- 2026年池州市贵池区事业单位人员招聘笔试备考题库及答案详解
- 2026年吴忠市利通区事业单位人员招聘笔试参考题库及答案详解
- 2025-2026学年pep小学英语四下说课稿
- 2025-2026学年和风一起玩说课稿
- 2026年无锡市北塘区事业单位人员招聘笔试参考题库及答案详解
- 2025-2026学年动物手工活动说课稿
- 2025-2026学年初一语文说课稿第一课
- 2026年葫芦岛市连山区公务员人员招聘考试模拟试题及答案详解
- 2026年通辽市科尔沁区公务员人员招聘笔试参考试题及答案详解
- 高三化学一轮复习“钠及其化合物”教学设计
- 修订一单一库质量手册和程序文件参考文件
- DB15-T 3583-2024 黄河灌区轻中度盐碱耕地建设高标准农田技术规程
- 2026中国小儿助消化药行业竞争态势与盈利趋势预测报告
- 智慧水务系统智能调度优化方案
- 2025年小米电动汽车购车合同
- 美剧口语9000句课件
- 常压储罐呼吸阀培训课件
- 海洋智能装备研发重点
- 【MOOC】数据结构与算法-北京大学 中国大学慕课MOOC答案
- DL∕T 246-2015 化学监督导则
评论
0/150
提交评论