版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
PAGEPAGE144(更新版)大数据应用技能竞赛考试题库大全-下(多选、判断550题)多选题1.Web内容挖掘实现技术()。A、文本总结B、文本分类C、文本机器学习D、关联规则答案:ABCD2.下列哪些指标可以用来评估线性回归模型(多选)()A、R-SquaredB、AdjustedR-SquaredC、FStatisticsD、RMSE/MSE/MAE答案:ABCD3.下面属于范数规则化的作用的是()和()。A、保证模型尽可能的简单,避免过拟合B、约束模型特征C、最小化问题D、最大化问题答案:AB4.Python的优点有()。A、变量不用预定义类型B、数据结构功能强大C、语言可解释性强D、变量类型固定答案:ABC5.下列哪些是传统RDBMS的缺点()A、表结构schema扩展不方便B、全文搜索功能较弱C、大数据场景下I/O较高D、存储和处理复杂关系型数据功能较弱答案:ABCD6.下列属于CNN关键层的是(__)。A、输入层B、卷积层C、激活层D、池化层答案:ABCD7.常见的核函数主要包括()。A、多项式核B、高斯核C、线性核D、拉普拉斯核E、Sigmoid核答案:ABCDE8.关于现阶段大数据技术体系,说法正确的是()。A、基础设施提供数据计算、数据存储、数据加工(DataWrangling或DataMunging)等服务B、流处理、统计工具、日志分析都属于常用的开源工具C、数据资源代表的是生成数据的机构D、数据源与APP为数据科学和大数据产业生态系统提供数据内容答案:ABCD9.Analytics1.0的主要特点有()。A、分析活动滞后于数据的生成B、重视结构化数据的分析C、以对历史数据的理解为主要目的D、注重描述性分析答案:ABCD10.字符串的格式化可以使用()。A、%B、formatC、inputD、+答案:AB11.下列对字符串函数或方法说法正确的有()。A、istitle()如果字符串是标题化的(见title())则返回True,否则返回FalseB、max(str)返回字符串str中最大的字母。C、replace(old,new,max)把将字符串中的str1替换成str2,如果max指定,则替换不超过max次D、upper()转换字符串中所有大写字符为小写答案:ABC12.Python中jieba库的基本实现原理是什么()。A、利用中文词库,分析汉字与汉字之间的关联几率B、还有分析汉字词组的关联几率C、还可以根据用户自定义的词组进行分析D、还可以分析汉字与英文之间关联几率答案:ABC13.以下关于Pig说法正确的是()。A、弥补MapReduce编程复杂性B、封装MapReduce处理过程C、PigLatin是一种数据分析语言D、适用于并行处理答案:ABCD14.对于决策树的优点描述正确的是()。A、可读性强B、分类速度快C、只用于回归问题D、是无监督学习答案:AB15.可作为决策树选择划分属性的参数是()。A、信息增益B、增益率C、基尼指数D、密度函数答案:ABC16.下列哪些是面向对象技术的特征()。A、封装B、继承C、多态D、分布性答案:ABC17.Spark中的Scheduler模块可以分为以下哪几个部分()。A、DAGScheduler;B、ResourceScheduler;C、TaskScheduler;D、JobScheduler;答案:AC18.卷积神经网络中常用的池化函数包括()。A、最大池化函数B、L2范数C、相邻矩形区域内的平均值D、基于据中心像素距离的加权平均函数答案:ABCD19.可视化高维展示技术在展示数据之间的关系以及数据分析结果方面作()。A、能够直观反映成对数据之间的空间关系B、能够直观反映多维数据之间的空间关系C、能够静态演化事物的变化及变化的规律D、能够动态演化事物的变化及变化的规律E、提供高性能并行计算技术的强力支撑答案:BD20.预剪枝使得决策树的很多分子都没有展开,会导致()。A、显著减少训练时间开销B、显著减少测试时间开销C、降低过拟合风险D、提高欠拟合风险答案:ABCD21.可视分析学是一门以可视交互为基础,综合运用()等技术等多个学科领域的知识,以实现人机协同完成可视化任务为主要目的分析推理学科。A、物理学B、图形学C、数据挖掘D、人机交互答案:BCD22.Numpy中计算数组的标准差和方差的函数是()。A、std()B、diff()C、exp()D、var()答案:AD23.常见的原型聚类算法包括()。A、k均值算法B、学习向量量化C、高斯混合聚类D、密度聚类答案:ABC24.语音识别的方法包括()。A、声道模型方法B、模板匹配的方法C、利用仍神经网络的方法D、语音知识方法答案:ABCD25.关于Dropout说法正确的是:(__)。A、Dropout背后的思想其实就是把DNN当做一个集成模型来训练,之后取所有值的平均值,而不只是训练单个DNNB、DNN网络将Dropout率设置为p,也就是说,一个神经元被保留的概率是1-p。当一个神经元被丢弃时,无论输入或者相关的参数是什么,它的输出值就会被设置为0C、丢弃的神经元在训练阶段,对BP算法的前向和后向阶段都没有贡献。因为这个原因,所以每一次训练,它都像是在训练一个新的网络D、Dropout方法通常和L2正则化或者其他参数约束技术(比如MaxNorm)一起使用,来防止神经网络的过拟合答案:ABCD26.我们想要减少数据集中的特征数,即降维.选择以下适合的方案:()。A、使用前向特征选择方法B、使用后向特征排除方法C、我们先把所有特征都使用,去训练一个模型,得到测试集上的表现.然后我们去掉一个特征,再去训练,用交叉验证看看测试集上的表现.如果表现比原来还要好,我们可以去除这个特征D、查看相关性表,去除相关性最高的一些特征答案:ABCD27.下面哪些是基于核的机器学习算法(__)。A、最大期望算法B、径向基核函数C、线性判别分析法D、支持向量机答案:BCD28.关于卷积神经网络的叙述中正确的是()。A、可用于处理时间序列数据B、可用于处理图像数据C、卷积网络中使用的卷积运算就是数学中的卷积计算D、至少在网络的一层中使用卷积答案:ABD29.我们想要训练一个ML模型,样本数量有100万个,特征维度是5000,面对如此大数据,如何有效地训练模型()A、对训练集随机采样,在随机采样的数据上建立模型B、尝试使用在线机器学习算法C、使用PCA算法减少特征维度答案:ABC30.下面哪些是Spark的组件()。A、SparkStreamingB、MLibC、GraphXD、SparkR答案:ABC31.下面是Numpy支持的统计函数有()。A、minB、maxC、medianD、mean答案:ABCD32.以下属于自然语言处理范畴的是()。A、情感倾向分析B、评论观点抽取C、文章分类D、新闻摘要抽取答案:ABCD33.常见的图像降噪方式包括()。A、中值滤波B、均值滤波C、平均滤波D、加权平均滤波答案:ABCD34.SparkRDD的依赖机制包括()。A、宽依赖B、深度依赖C、广度依赖D、窄依赖答案:AD35.Spark支持的计算模型有()。A、批处理;B、实时计算;C、机器学习模型;D、交互式查询;答案:ABCD36.如将A、B、C三个分类器的PR曲线画在一个图中,其中A、B的PR曲线可以完全包含住C的PR曲线,A与B的PR曲线有交点,A、B、C的平衡点分别为0.79、0.66、0.58,以下说法中正确的是()。A、学习器A的性能优于学习器CB、学习器A的性能优于学习器BC、学习器B的性能优于学习器CD、学习器C的性能优于学习器B答案:ABC37.下列哪些是情感分析的应用场景()。A、数据挖掘B、信息检索C、文本分词D、市场营销答案:ABD38.以下四个选项中,()是Python关键字。A、asB、globalC、intD、not答案:ABD39.下面不是Python关键字的是()。A、noB、NoneC、noneD、null答案:ACD40.HadoopMapReduce是MapReduce的具体实现之一。HadoopMapReduce数据处理过程涉及四个独立的实体,包括()。A、ClientB、JobTrackerC、TaskTrackerD、HDFS答案:ABCD41.Hadoop组件Zookeeper的设计目标和主要特点包括()。A、简单性B、自我复制C、顺序访问D、高速读取答案:ABCD42.以下可用于处理由于光照不均带来的影响的图像处理方法有()。A、同态滤波B、顶帽变换C、基于移动平均的局部阈值处理D、拉普拉斯算子答案:ABC43.ETL包含下列哪些过程()A、数据抽取B、数据转换C、数据加载D、数据展现答案:ABC44.HighBias(高偏差)解决方案:()。A、BoostingB、复杂模型(非线性模型、增加神经网络中的层)C、更多特征答案:ABC45.大数据平台的计算组件主要有哪几个()。A、StormB、SparkC、MapreduceD、Sqoop答案:ABC46.下面对LDA判别分析的思想描述正确的是()。A、同类样例的投影点尽可能近B、异类样例的投影点尽可能远C、同类样例的投影点尽可能远D、异类样例的投影点尽可能近答案:AB47.Spark2.0提供的应用库包括()。A、SparkSQLB、SparkStreamingC、MLibD、GraphX答案:ABCD48.下列关于极大似然估计(MaximumLikelihoodEstimate,MLE),说法正确的是(__)。A、MLE可能并不存在B、MLE总是存在C、如果MLE存在,那么它的解可能不是唯一的D、如果MLE存在,那么它的解一定是唯一的答案:AC49.下列属于数值优化算法的是()。A、梯度下降法B、牛顿法C、极大似然法D、逻辑回归答案:AB50.下列关于探索型数据分析常用图表的说法,正确的有:A、绝大部分情况下使用饼图代替条形图能更加直观地展示数据之间的特征和对比B、探索型数据分析常用的图表包括条形图、直方图、饼图、折线图、散点图、箱型图等C、在探索型数据分析时应该尽量避免使用饼图,然而在数据报告中可以使用饼图达到更加美观的效果D、直方图和箱型图都可以用来展示数据的分布情况答案:BCD51.name=np.array(['Liu','Wang','Zhu','Wang','Zhu','Wang','Zhu']),则下列可以的到['Liu','Wang','Zhu']的代码是()。A、np.unique(name)B、sorted(set(name))C、np.sort(name)D、name答案:AB52.下面哪些是spark比Mapreduce计算快的原因()。A、基于内存的计算;B、基于DAG的调度框架;C、基于Lineage的容错机制;D、基于分布式计算的框架;答案:ABC53.下面哪些是有效的类构造函数()。A、def_Init_(self):B、def_init_(self,var=0):C、def_init_():D、def_init_(self,a,b,c):答案:ABD54.常用的数据审计方法可以分为()。A、预定义审计B、自定义审计C、可视化审计D、结构化审计答案:ABC55.MapReduce中运行程序副本程序的机器为()。A、Map服务器B、Master服务器C、Worker服务器D、Reduce服务器答案:BC56.下列关于PCA说法正确的是()。A、在使用PCA之前,我们必须标准化数据B、应该选择具有最大方差的主成分C、应该选择具有最小方差的主成分D、可以使用PCA在低维空间中可视化数据答案:ABD57.以下哪几项属于汉语未登录词的类型()。A、存在于词典但出现频率较少的词B、新出现的普通词汇C、专有名词D、专业名词和研究领域名称答案:BCD58.以下方法中可用于图像分割的有()。A、霍夫曼编码B、分水岭算法C、K-meansD、区域增长法答案:BCD59.若b=np.array([True,False,False]),以下能输出[FalseTrueTrue]的是()。A、print(b-1)B、print(~b)C、print(np.logical_not(b))D、print(>>b)答案:BC60.数据科学以数据尤其是大数据为研究对象,主要研究内容包括()。A、数据加工(DataWrangling或DataMunging)B、数据管理C、数据计算D、数据产品研发答案:ABCD61.关于Python分隔代码块描述错误的是()。A、内嵌代码的每一行,都比外面的if语句的缩进更多B、代码以“begin”开头,“end”结尾C、每行代码的缩进都一致D、代码块被封装在花括号中答案:BCD62.实时计算类应用主要通过()来实现。A、流计算组件B、内存计算组件C、MPP数据库D、Hadoop的后台定时分析计算任务答案:AB63.Python中,字典的内置方法包括()。A、radiansdictkeys()B、radiansdictsetdefault(key,default=None)C、radiansdictupdate(dict2)D、radiansdictvalues()答案:ABCD64.在数据缺失严重时,会对分析结果造成较大的影响,因此剔除的异常值和缺失值,要采用合理的方法进行填补,常用的方法有()。A、平均值填充B、K最近邻距离法C、回归法D、极大似然估计E、多重插补法答案:ABCDE65.以下属于图像分割的算法的是:()。A、阈值分割方法(thresholdsegmentationmethod)B、区域增长细分(regionalgrowthsegmentation)C、边缘检测分割方法(edgedetectionsegmentationmethod)D、基于聚类的分割(segmentationbasedonclustering)E、基于CNN中弱监督学习的分割答案:ABCDE66.字典的遍历正确的有()。A、forin变量i,字典:使用i遍历所有的键,有键就可以通过变量访问其值B、for变量iin字典:使用i遍历所有的键,有键就可以通过变量访问其值C、for变量i,变量jin字典items():使用变量i遍历所有键,通过变量j遍历所有值D、forin变量i,变量j字典items():使用变量i遍历所有键,通过变量j遍历所有值答案:BC67.特征向量的缺失值处理:缺失值较多,直接将该特征舍弃掉,否则可能反倒会带入较大的noise,对结果造成不良影响;缺失值较少,其余的特征缺失值都在10%以内,我们可以采取很多的方式来处理:()。A、把NaN直接作为一个特征,假设用0表示B、用均值填充C、用随机森林等算法预测填充D、以上答案都不正确答案:ABC68.在假设检验中,当原假设为“伪”,但数据分析人员没有拒绝它时犯的错误叫()。A、α错误B、β错误C、取伪错误D、弃真错误答案:BC69.直方图修正法包括()。A、直方图统计B、直方图均衡C、直方图过滤D、直方图规定化;答案:BD70.统计模式分类问题中,当先验概率未知时,可以使用()。A、最小最大损失准则B、最小误判概率准则C、最小损失准则D、N-P判决答案:AD71.使用Python操作目录以下哪些符合()。A、mkdir:用于以数字权限模式创建目录B、getcwd:用于返回当前工作目录C、chdir:用于改变当前工作目录到指定的路径D、rmdir:用于删除指定路径的目录。仅当这文件夹是空的才可以,否则,抛出OSError。答案:ABCD72.空间域滤波是直接以图像中的像素操作为基础的滤波,空间滤波器有时也可称为()。A、空间掩模B、核C、模板D、窗口答案:ABCD73.以下算法中可以应用于图像分割的是()。A、边缘检测技术B、阈值分割技术C、基于区域的分割技术D、区域生长方法答案:ABCD74.下面关于连续型随机变量以及连续型概率密度函数的说法,正确的是。A、“一个客服一天可能接听到多少个电话”是一个连续型随机变量B、正态分布是一种连续型随机变量的概率分布C、可以使用概率密度函数来描述连续型随机变量的概率分布D、连续型概率密度函数曲线下方的面积之和为1答案:BCD75.类的特点有()。A、封装B、继承C、多态D、重复答案:ABC76.数据可视化中,从数据到知识的转换途径()。A、可视化分析B、自动化建模C、用户交互D、参数优化答案:AB77."噪声"是指测量变量中的随机错误或偏差,噪声数据的主要表现有那几种形式()A、错误数据B、假数据C、异常数据D、僵尸数据答案:ABC78.下列哪些是词语情感分析的方法()。A、基于网络的分析方法B、基于word-embedding的分析方法C、基于词典的分析方法D、基于词频的分析方法答案:AC79.pandas中主要的数据结构是()。A、DataB、DataFrameC、FrameD、Series答案:BD80.在Windows系统中通过Geany编写Python程序,运行Python程序的常用步骤是()。A、菜单Build>ExecuteB、菜单Execute>BuildC、按F5D、按F10答案:AC81.下列哪些是RDBMS中事务遵循的原则()A、原子性(Atomicity)B、一致性(Connsistency)C、隔离性(Isolation)D、持久性(Durability)答案:ABCD82.算法“歧视”现象可能出现在()。A、算法设计B、算法实现C、算法投入使用D、算法验证答案:ABC83.下面关于Python中的列表和字典说法正确的是()。A、字典和列表都可以通过“[]”操作符访问元素的值B、列表的索引必须是整型数或者切片C、字典不过是列表的另一个名字。二者没有区别D、字典的长度是动态的,而列表的长度是固定的答案:AB84.下面关于JSON数据格式,哪些说法是正确的()。A、jsonloads载入json格式数据后会用类似数组的方式把数据转换成数据表B、具有数据结构紧凑可读性强的优点C、Python中可以使用JSON模块把Json格式字符串解码转换成Python对象D、网络中交换数据最常见的格式之一答案:BCD85.Hadoop中map输出结果说法正确的是()。A、<key,value>键值对B、输出中间临时结果C、输出最终计算结果D、输出结果永久保留答案:AB86.聚类性能度量外部指标包括()。A、Jaccard系数B、FM指数C、Dunn指数D、Rand指数答案:ABD87.以下关于MapReduce1.0版本说法正确的是()。A、扩展性差B、可靠性差C、资源利用率低D、无法支持多种计算框架答案:ABCD88.Hadoop组件Flume三层架构包括()。A、AgentB、GossipC、CollectorD、Storage答案:ACD89.做一个二分类预测问题,先设定阈值为0.5,概率大于等于0.5的样本归入正例类(即1),小于0.5的样本归入反例类(即0)。然后,用阈值n(n>0.5)重新划分样本到正例类和反例类,下面哪一种说法正确()。A、增加阈值不会提高召回率B、增加阈值会提高召回率C、增加阈值不会降低查准率D、增加阈值会降低查准率答案:AC90.神经网络的拓扑结构可以分为()和随机型网络等。A、前向型B、后向型C、反馈型D、自组织竞争型答案:ACD91.下列在Python中描述正确的是()。A、pass语句不会执行任何操作,一般作为占位符或者创建占位程序B、sorted可以对列表进行排序,如:i=[5,1,2,3,4]i=sorted(i)C、内建的数据类型丰富,除了字典和列表外,还有集合(set)元组(tuple)等类型D、分号在Python中是无用途答案:ABC92.下面有关HTML叙述正确的是()。A、一个HTML文件可以用记事本来编辑B、HTML的意思是超文本标记语言C、一个HTML文件必须是一个以htm或html为扩展名的文件D、HTML区分大小写,如<b>写成<B>是错误的答案:ABC93.可视分析学的几个特点包含()A、强调数据到知识的转换过程B、强调可视化分析与自动化建模之间的相互作用C、强调数据映射和数据挖掘的重要性D、强调数据加工工作的必要性E、强调人机交互的重要性答案:ABCDE94.长短时记忆神经网络三个门是哪些()A、进化门B、输出门C、输入门D、遗忘门答案:BCD95.处理图像平滑处理的滤波有()。A、盒式滤波B、均值滤波C、高斯滤波D、中值滤波答案:ABCD96.噪声数据的产生原因主要有()。A、数据采集设备有问题B、在数据录入过程中发生了人为或计算机错误C、数据传输过程中发生错误D、由于命名规则或数据代码不同而引起的不一致答案:ABCD97.RNN在NLP领域的应用包括(__)。A、语言模型与文本生成B、机器翻译C、语音识别D、图像描述生成答案:ABCD98.一个监督观测值集合会被划分为()。A、训练集B、验证集C、测试集D、预处理集答案:ABC99.常见的图像分割算法有()。A、基于区域的分割方法B、基于人工勾画的分割方法C、基于边缘的分割方法D、基于阈值的分割方法答案:ACD100.下面属于词袋模型的缺点的是()。A、词汇表的词汇需要经过精心设计B、表示具有稀疏性C、丢失词序忽略了上下文D、模型复杂,不利于实施;答案:ABC101.图像处理中的去噪算法有()。A、中值滤波B、均值滤波C、峰值滤波D、高值滤波答案:AB102.下列哪个是Hadoop运行的模式()。A、单机版B、伪分布式C、分布式D、全分布式答案:ABC103.Apriori算法的计算复杂度受()影响。A、支持度阀值B、项数(维度)C、事务数D、事务平均宽度答案:ABCD104.Spark容错性的方式有哪些()。A、数据检查点;B、存储原始数据;C、记录数据的更新;D、自建数据版本;答案:AC105.Spark提交工作的方式()。A、lientB、lusterC、tandaloneD、arn答案:AB106.以下()函数是累积函数。A、cumsumB、argminC、cumprodD、argmax答案:AC107.以下跟图像处理相关的是()。A、图像识别B、人脸识别C、视频分析D、nlp答案:ABCD108.以下网络结构中可以应用于图像识别任务的是()。A、LeNet-5B、AlexNetC、CNND、VGG-net答案:ABCD109.影响聚类算法效果的主要原因有:()A、特征选取B、模式相似性测度C、分类准则D、已知类别的样本质量答案:ABC110.数据科学基本原则中,三世界原则指的是()A、我们的世界B、数据世界C、物理世界D、数字世界答案:ABC111.以下选项中,属于MapReduce特征的有()。A、以主从结构的形式运行B、容错机制的复杂性C、任务备份机制的必要性D、数据存储位置固定答案:ABC112.Spark的技术架构可以分为哪几层()。A、资源管理层;B、Spark核心层;C、应用层;D、服务层;答案:ABD113.以下对模型性能提高有帮助的是()。A、数据预处理B、特征工程C、机器学习算法D、模型集成答案:ABCD114.Hadoop的HDFS是一种分布式文件系统,适合以下哪种场景的数据存储和管理()。A、大量小文件存储B、高容错、高吞吐量C、低延迟读取D、流式数据访问答案:BD115.Hadoop的优点包括()。A、可靠的B、高效的C、可伸缩的D、低成本答案:ABCD116.在词袋模型中使用单个的单词来构建词向量这样的序列被称为()。A、1元组(1-gram))B、单元组(unigram)模型C、列表D、字典答案:AB117.下列关于集合操作结果正确的有()。A、name={‘d’,‘s’}nameadd(‘sd’)name值为:{‘sd’,‘d’,‘s’}B、name={‘sd’,d’,‘s’}nameremove(‘s’)name值为:{‘sd’,‘d’}C、name={‘sd’,d’,‘s’}nameclear()name值为:{}D、name={‘sd’,d’,‘s’}nameupdate(‘df’)name值为:{‘sd’,’d’,‘f’,’s’,’j’}答案:ABC118.按照涉及自变量的多少,可以将回归分析分为()。A、线性回归分析B、非线性回归分析C、一元回归分析D、多元回归分析E、综合回归分析答案:CD119.关于数据组织的维度,以下选项中描述正确的是()。A、数据组织存在维度,字典类型用于表示一维和二维数据B、高维数据有键值对类型的数据构成,采用对象方式组织C、二维数据采用表格方式组织,对应于数学中的矩阵D、一维数据采用线性方式组织,对应于数学中的数组和集合等概念答案:BCD120.CNN相比于全连接的DNN有哪些优势()A、参数更少B、泛化更好C、训练更快D、更容易搭建;答案:ABC121.以下哪种说法是正确的()。A、网站服务器可以识别你使用的访问软件,因为在发送访问请求中有特定位置的字符串和软件类型相关B、低级别的代理服务器十分容易被识别C、可以通过修改opener的proxy来模拟浏览器访问D、爬取图片的流程被中断时,之前所有爬取的信息都将被自动删除答案:AB122.以下有关特征数据归一化的说法正确的是()。A、特征数据归一化加速梯度下降优化的速度B、特征数据归一化有可能提高模型的精度C、线性归一化适用于特征数值分化比较大的情况D、概率模型不需要做归一化处理答案:ABD123.下面关于机器学习的理解正确的是()。A、非监督学习的样本数据是要求带标签的B、监督学习和非监督学习的区别在于是否要求样本数据带标签C、强化学习以输入数据作为对模型的反馈D、卷积神经网络一般用于图像处理等局部特征相关的数据答案:BCD124.下面关于单样本Z检验的说法,正确的是()。A、在Python中,单样本Z检验可以使用scipy.stats.ttest_1samp()实现B、单样本Z检验适用于样本量较大的情况C、单样本Z检验假设要检验的统计量(近似)满足正态分布D、单样本Z检验常用于检验总体平均值是否等于某个常量答案:BCD125.下列哪种服务可以用于存储数据()。A、MapReduceB、YARNC、HBaseD、HDFS答案:CD126.使用极大似然估计的前提条件有()。A、数据服从某种已知的特定数据分布型B、已经得到了一部分数据集C、提前已知某先验概率D、数据集各个属性相对独立答案:AB127.以下选项中,不是Python语言保留字的是()。A、doB、passC、exceptD、until答案:AD128.下列哪些属于TF-IDF的应用()。A、搜索引擎B、关键词提取C、文本相似性D、数据降维答案:ABC129.数据增值存在于哪些过程中()。A、数据对象的封装B、数据系统的研发C、数据的集成应用D、基于数据的创新答案:ABCD130.对于不同场景内容,一般数字图像可以分为()。A、二值图像B、灰度图像C、彩色图像D、深度图像答案:ABC131.K均值聚类和层次聚类在一些方面有重大差异。以下哪些说法是正确的()A、在K均值聚类中,必须在运行算法前选定想要的簇的个数B、在k均值聚类中,可以在运行算法后选定想要的簇的个数C、在层次聚类中,可以在运行算法后选定想要的簇的个数D、k均值聚类算法所需的计算量比层次聚类算法小得多答案:ACD132.在Spark中,弹性分布式数据集的特点包括()。A、可分区B、可序列化C、可直接修改D、可持久化答案:ABD133.Python逻辑表达式()会导致逻辑短路,即不会继续向下推算而直接返回结果。A、False开头的and语句B、False开头的or语句C、True开头的and语句D、True开头的or语句答案:AD134.ApacheFlume主要解决的是日志数据的收集和处理问题。Flume的主要设计目的和特征是()。A、高可靠性B、可拓展C、管理复杂D、不支持用户自定义答案:AB135.属于特征选择的优点有()。A、解决模型自身的缺陷B、减少过拟合C、提升模型的性能D、增强模型的泛化能力答案:BCD136.数据来源和目标用户已定的情况下,不同视觉通道的表现力不同。视觉通道的表现力的评价指标包括()。A、精确性B、可辨认性C、可分离性D、视觉突出性答案:ABCD137.已定义级(DefinedLevel)的主要特点包括()。A、组织机构已明确给出了关键过程的“标准定义”,并定期对其进行改进。B、已提供了关键过程的测量与预测方法。C、关键过程的执行过程并不是简单或死板地执行组织机构给出的“标准定义”,而是根据具体业务进行了一定的“裁剪”工作。D、数据的重要性已成为组织机构层次的共识,将数据当作成功实现组织机构使命的关键因素之一答案:ABCD138.Client端上传文件的时候下列哪项正确()。A、数据经过NameNode传递给DataNodeB、Client端将文件切分为Block,依次上传C、Client只上传数据到一台DataNode,然后由NameNode负责Block复制D、Client如果上传的时候没有上传成功指定的副本数,则整次上传不成功答案:BD139.()是通过对无标记训练样本的学习来进行分类的。A、密度估计B、异常检测C、线性回归D、聚类分析答案:ABD140.Python中jieba库支持哪几种模式()。A、精准模式B、匹配模式C、全模式D、搜索引擎模式答案:ACD141.关于降维说法正确的是()。A、PA是根据方差这一属性降维的B、降维可以防止模型过拟合C、降维降低了数据集特征的维度D、降维方法有PLA等答案:ACD142.下列哪些是TF-IDF的缺点()。A、字词的重要性随它在文件中出现的次数成正比B、将一些生僻字误当作文档关键词C、只考虑特征词和文本之间的关系,忽略了一个特征项在不同类别间的分布情况D、没有考虑特征词的位置因素对文本的区分度答案:BCD143.以下关于API爬虫哪些说法是错误的()。A、基于API返回的结果通常会比较干净B、基于API的爬虫任务中,速度一般较慢C、基于API的爬虫爬取的好处是没有次数的限制D、基于API的爬取能够覆盖网站所有信息答案:BCD144.以下关于降维方法,叙述正确的是()。A、主成分分析是一种常用的非线性降维方法B、核化线性降维是一种常用的线性降维方法C、流形学习是一种借鉴拓扑流形概念的降维方法D、度量学习绕过降维的过程,将学习目标转化为对距离度量计算的权重矩阵的学习答案:CD145.下面哪些是循环神经网络的输出模式(__)。A、多输出B、单输出C、同步多输出D、异步多输出答案:ABD146.下列方法中,可以用于特征降维的方法包括()。A、主成分分析PCAB、线性判别分析LDAC、深度学习SparseAutoEncoderD、矩阵奇异值分解SVD答案:ABD147.Spark的部署模式包括()。A、本地模式B、standalone模式C、SparkonyarnD、mesos模式答案:ABCD148.Scikit-Learn中可以实现()算法。A、分类B、聚类C、回归D、降维答案:ABCD149.关于学习器结合的描述正确的选项是()。A、避免单学习器可能因误选而导致泛化性能不佳B、降低陷入局部极小点的风险C、假设空间扩大,有可能学得更好的近似D、多学习器结合有可能冲突答案:ABC150.在网络爬虫的爬行策略中,应用最为常见的是()。A、深度优先遍历策略B、广度优先遍历策略C、高度优先遍历策略D、反向链接策略E、大站优先策略答案:AB151.关于分析学习和归纳学习的比较,说法正确的是()。A、归纳学习拟合数据假设,分析学习拟合领域理论的假设B、归纳学习论证方式为统计推理,分析学习为演绎推理C、归纳学习不需要隐式的先验知识D、训练数据不足时归纳学习可能会失败答案:ABCD152.下列关于EM算法描述正确的是(__)。A、EM算法是常用的估计参数隐变量的利器B、EM算法即是期望最大化算法C、EM算法常被用来学习高斯混合模型的参数D、EM算法是一种迭代式的方法答案:ABCD153.假设检验中,首先需要提出零假设和备择假设,零假设是(),备择假设是()。A、只有出现的概率大于阈值才会被拒绝的,只有零假设出现的概率大于阈值才会被承认的B、希望推翻的结论,希望证明的结论C、只有出现的概率小于阈值才会被拒绝的,只有零假设出现的概率小于阈值才会被承认的D、希望证明的结论,希望推翻的结论答案:BC154.HIS表色系的三属性包含:()。A、色调B、色饱和度C、亮度D、色度答案:ABC155.列式数据库(如BigTable和HBase)以表的形式存储数据,表结构包括()等元素A、行键B、时间戳C、列簇D、数据类型答案:ABC156.下列关于Ridge回归,说法正确的是()A、若λ=0,则等价于一般的线性回归B、若λ=0,则不等价于一般的线性回归C、若λ=+∞,则得到的权重系数很小,接近于零D、若λ=+∞,则得到的权重系数很大,接近与无穷大答案:AC157.大数据偏见包括()A、数据源的选择偏见B、算法与模型偏见C、结果解读方法的偏见D、数据呈现方式的偏见答案:ABCD158.以下哪些选项可以用于实现爬虫功能()。A、BeautifulSoup库B、re模块C、Scrapy框架D、urllibrequest库答案:ACD159.以下属于关键词提取算法的有()。A、TF-IDF算法B、TextRank算法C、LSA(潜在语义分析)D、LDA答案:ABCD160.可视分析学的几个特点包含()A、强调数据到知识的转换过程B、强调可视化分析与自动化建模之间的相互作用C、强调数据映射和数据挖掘的重要性D、强调数据加工(DataWrangling或DataMunging)工作的必要性E、强调人机交互的重要性答案:ABCDE161.已测量级(MeasuredLevel)的主要特点包括()。A、已构建了关键过程矩阵。B、已定义了变革管理的正式流程。C、已实现用定量化方式计算关键过程的质量和效率。D、关键过程的质量和效率的管理涉及整个生命周期答案:ABCD162.关于神经网络,下列说法正确的是()A、增加网络层数,可能会增加测试集分类错误率B、增加网络层数,一定会增加训练集分类错误率C、减少网络层数,可能会减少测试集分类错误率D、减少网络层数,一定会减少训练集分类错误率答案:AC163.下列属于字符串匹配的分词方法的是()。A、正向最大匹配法(由左到右的方向)B、逆向最大匹配法(由右到左的方向)C、最少切分(使每一句中切出的词数最小)D、双向最大匹配法(进行由左到右、由右到左两次扫描)答案:ABCD164.以下关于数据维度的描述,正确的是()。A、采用列表表示一维数据,不同数据类型的元素是可以的B、JSON格式可以表示比二维数据还复杂的高维数据C、二维数据可以看成是一维数据的组合形式D、字典不可以表示二维以上的高维数据答案:ABC165.下面关于reduce函数功能描述正确的是()。A、合并value值,形成较小集合B、采用迭代器将中间值提供给reduce函数C、map()函数处理后结果才会传输给reduce()D、内存中不会存储大量的value值答案:ABCD166.下列说法正确的是()。A、cookielib库提供可存储cookie的对象,以便于与urllirequest库配合使用来进行访问B、过于频繁的爬虫不会带给网站额外的压力C、使用split()可以进行字符串的拆分D、正则表达式可以实现对爬取信息的快速过滤答案:ACD167.Python逻辑表达式()的结果是False。A、not(TrueorFalse)B、not(FalseandFalse)C、1!=0D、1==0答案:AD168.一个回归模型存在多重共线问题。在不损失过多信息的情况下,可如何处理()A、剔除所有的共线性变量B、剔除共线性变量中的一个C、通过计算方差膨胀因子(VarianceInflationFactor,VIF)来检查共线性程度,并采取相应措施D、删除相关变量可能会有信息损失,我们可以不删除相关变量,而使用一些正则化方法来解决多重共线性问题,例如Ridge或Lasso回归答案:BCD169.假设目标遍历的类别非常不平衡,即主要类别占据了训练数据的99%,现在你的模型在训练集上表现为99%的准确度,那么下面说法正确的是:()。A、准确度并不适合衡量不平衡类别问题B、准确度适合衡量不平衡类别问题C、精确度和召回率适合于衡量不平衡类别问题D、精确度和召回率不适合衡量不平衡类别问题答案:AC170.以下函数中()属于二元通用函数(Binaryuniversalfunctions)。A、addB、substractC、multiplyD、power答案:ABCD171.在Spark的基本流程中,主要涉及()。A、DriverProgramB、usterManagerC、WorkerNodeD、Executor答案:ABCD172.关于HadoopMapReduce,以下描述中正确的是()。A、reduce()函数的输入是value集B、reduce()函数将最终结果写到HDFS系统中C、用户可以自己定义reduce()函数D、reduce()函数的输入数据是经过map()函数处理之后的数据答案:BCD173.以下关于集成学习的说法正确的是:()。A、随机森林是减少模型的方差,而GBDT是减少模型的偏差B、组成随机森林的树可以并行生成,而GBDT是串行生成C、随机森林的结果是多数表决表决的,而GBDT则是多棵树累加之和答案:ABC174.下列关于情感分析的说法正确的是()。A、简单而言,是对带有情感色彩的主观性文本进行分析、处理、归纳和推理的过程B、情感分析的发展得益于社交媒体的兴起C、按照处理文本的粒度不同,情感分析大致可分为词语级,句子级、篇章级三个D、情感分析可以应用于文本挖掘答案:ABCD175.python中,字符串格式化的方式()。A、%B、formatC、inD、input答案:AB176.ETL技术主要涉及()操作。A、抽取B、转换C、加载D、分析答案:ABC177.NoSQL数据库常用的数据模型包括()。A、Key-ValueB、Key-DocumentC、Key-ColumnD、图存储答案:ABCD178.决策树()情况下会导致递归返回。A、当前节点包含的样本全属于同一类B、当前属性集为空C、当前节点包含的样本集合为空D、所有样本在所有属性上取值相同答案:ABCD179.数据科学项目主要涉及的活动包括()。A、模式/模型的应用及维护B、模式/模型的洞见C、结果的可视化与文档化D、模式/模型的验证和优化答案:ABCD180.以下属于频率域图像滤波的方法有()。A、中值滤波B、均值滤波C、布特沃斯滤波D、高斯滤波答案:CD181.下面是文件基本操作的函数()。A、closeB、readC、renameD、remove答案:ABCD182.以下关于神经网络模型描述正确的是(__)。A、神经网络模型是许多逻辑单元按照不同层级组织起来的网络,每一层的输出变量都是下一层的输入变量B、神经网络模型建立在多神经元之上C、神经网络模型中,无中间层的神经元模型的计算可用来表示逻辑运算D、神经网络模型一定可以解决所有分类问题答案:ABC183.从可视化处理视角看,可以将数据分为四个类型()并采用不同的视觉映射方法。A、定类数据B、定序数据C、定距离数据D、定比暑假答案:ABCD184.关于Hive的说法正确的是()。A、Hive是基于Hadoop的数据仓库工具B、Hive可以将结构化的数据文件映射为一张数据库表C、最初,Hive由Google开源,用于解决海量结构化日志数据统计问题D、Hive的主要应用场景是离线分析答案:ABD185.Hadoop框架的缺陷有()。A、MR编程框架的限制;B、过多的磁盘操作,缺乏对分布式内存的支持;C、无法高效支持迭代式计算;D、不支持多用户写入并任意修改文件;答案:ABCD186.任何函数都可以修改,所以尽量少用全局变量,主要原因包括()。A、不够安全B、一直占用内存C、容易失效D、一直占用字符答案:AB187.以下属于规则的分词方法的是()。A、正向最大匹配法B、逆向最大匹配法C、双向最大匹配法D、条件随机场答案:ABC188.下列属于描述gensim库的特性的是()。A、训练语料的预处理B、主题向量的变换C、文档相似度的计算D、文章切分词语统计计算答案:ABC189.关于HDFS集群中的DataNode的描述不正确的是()。A、DataNode之间都是独立的,相互之间不会有通信B、存储客户端上传的数据的数据块C、一个DataNode上存储的所有数据块可以有相同的D、响应客户端的所有读写数据请求,为客户端的存储和读取数据提供支撑答案:AC190.以下关于CSV文件的描述,正确的选项是()。A、CSV文件可用于不同工具间进行数据交换B、CSV文件格式是一种通用的,相对简单的文件格式,应用于程序之间转移表格数据。CC、SV文件通过多种编码表示字符D、CSV文件的每一行是一维数据,可以使用Python中的列表类型表示答案:ABD191.下列模型属于机器学习生成式模型的是()。A、朴素贝叶斯B、隐马尔科夫模型C、线性回归模型D、深度信念网络答案:ABD192.特征选择的目的:()。A、减少特征数量、降维B、使模型泛化能力更强C、增强模型拟合能力D、减少过拟合。答案:ABD193.a=np.array([1,2,3,4,5,6,7,8])以下()命令可以使输出结果为([5,6,7])。A、a[4:7]B、a[5:8]C、a[4:-1]D、a[5:]答案:AC194.相关与线性关系,下列说法正确的是()A、相关不一定是线性关系,可能是非线性关系B、相关一定是线性关系,不可能是非线性关系C、相关时若有相关系数r为0,说明两个变量之间不存在线性关系,仍可能存在非线性关系D、相关系数为0是两个变量独立的必要不充分条件答案:ACD195.关于Python语言的特点,以下选项描述不正确的是()。A、Python语言不支持面向对象B、Python语言是解释型语言C、Python语言是编译型语言D、Python语言是非跨平台语言答案:ACD196.以下描述中正确的是()。A、统计学是数据科学的理论基础之一B、Python语言是统计学家发明的语言C、机器学习是数据科学的理论基础之一D、数据科学是统计学的一个分支领域(子学科)答案:AC197.哪些项不属于使用池化层相比于相同步长的卷积层的优势()A、参数更少B、可以获得更大下采样C、速度更快D、有助于提升精度答案:BCD198.以下()是scipy中的模块。A、clusterB、constantsC、integrateD、io答案:ABCD199.Python支持运行的平台有()。A、WindowsB、MacOSC、CentOSD、Ubuntu答案:ABCD200.特征选择在子集生成与搜索方面引入了()人工智能搜索和评价方法。A、分支界限法B、浮动搜索法C、信息熵D、AIC答案:ABCD201.以下哪层是卷积神经网络的组成部分。A、卷积层B、中间层C、池化层D、全连接层答案:ACD202.数据可视化涉及到()等多个领域,成为研究数据表示、数据处理、决策分析等一系列问题的综合技术。A、计算机图形学B、图像处理C、计算机视觉D、计算机辅助设计答案:ABCD203.相对于HadoopMapReduce,Spark有什么好处()。A、通用性;B、易用性;C、速度快;D、容错性;答案:ABC204.plt.axhline(y=0.0,c="r",ls="--",lw=2),对这句代码说法正确的是()。A、在0.0处添加竖直参考线B、添加水平参考线C、参考线是虚线形式D、网格线是红色的答案:BC205.循环神经网络主要被应用于哪些场景(__)。A、语音识别B、语音建模C、机器翻译D、图像识别答案:ABC206.传统关系数据库的优点包括()。A、数据一致性高B、数据冗余度低C、简单处理的效率高D、产品成熟度高答案:ABD207.常用的爬虫技巧有以下哪些()。A、更改header,伪装成浏览器进行爬取B、设置爬取的时间间隔C、应用神经网络算法识别网站验证码D、通过代理服务器进行爬取答案:ABCD208.下面定义函数正确的是()。A、defcalc(*numbers):sum=0forninnumbers:sum=sum+n*nreturnsumB、defcalc(**numbers):sum=0forninnumbers:sum=sum+n*nreturnsumC、defcalc(**numbers,n):sum=0forninnumbers:sum=sum+n*nreturnsumD、defcalc(**numbers,n=0):sum=0forninnumbers:sum=sum+n*nreturnsum答案:AB209.下面哪些属于可视化高维数据技术()。A、矩阵B、平行坐标系C、星形坐标D、Chernoff脸答案:ABCD210.下列关于AUC面积描述正确的是()。A、AUC被定义为ROC曲线下与坐标轴围成的面积B、AUC面积的值大于1C、AUC等于0.5时,则真实性最低,无应用价值D、AUC越接近1.0,检测方法真实性越高答案:ACD211.下列哪些是特征选择方法()。A、AIC赤池信息准则B、LARS嵌入式特征选择方法C、LVW包裹式特征选择方法D、Relief过滤式特征选择方法答案:BCD212.决策树的划分选择有()。A、增益系数B、信息增益C、增益率D、基尼系数E、信息增益量答案:BCD213.在python中查看关键字,需要在Python解释器中执行()和()。这两条命令。A、listkeywordB、importkeywordC、keywordD、import.kwlist答案:BC214.在数据安全领域常用的P2DR模型中,P、D和R代表的是()。A、策略B、防护C、检测D、响应答案:ABCD215.以下说法正确的是()。A、负梯度方向是使函数值下降最快的方向B、当目标函数是凸函数时,梯度下降法的解是全局最优解C、梯度下降法比牛顿法收敛速度快D、拟牛顿法不需要计算Hesse矩阵答案:ABD216.下列关于特征的稀疏性说法正确的是()。A、稀疏性指的是矩阵中有许多列与当前学习任务无关B、稀疏样本可减少学习任务的计算开销C、学习任务难度可能有所降低D、稀疏矩阵没有高效的存储方法答案:ABC217.MapReduce与HBase的关系,哪些描述是正确的()。A、两者不可或缺,MapReduce是HBse可以正常运行的保证B、两者不是强关联关系,没有MapReduce,HBase可以正常运行C、MapReduce可以直接访问HbaseD、它们之间没有任何关系答案:BC218.()等都是Scikit-Learn中包含的算法。A、SVMB、随机森林C、Lasso回归D、密度聚类答案:ABCD219.下面关于随机变量及其概率分布的说法,正确的是()。A、随机变量可以分为离散型随机变量和连续型随机变量B、随机变量的概率分布指的是一个随机变量所有取值的可能性C、扔5次硬币,正面朝上次数的可能取值是0,1,2,3,4,5,其中正面朝上次数为0与正面朝上次数为5的概率是一样的D、扔5次硬币,正面朝上次数的可能取值是0,1,2,3,4,5,其中正面朝上次数为5的概率是最大的答案:ABC220.异常值的检测方法有()A、直接通过数据可视化进行观察B、通过统计分布进行判断C、通过相对距离进行度量D、通过相对密度进行度量答案:ABCD221.关于TF-IDF模型描述正确的有()。A、TF意思是词频B、IDF是逆文本频率C、该模型基于统计方法D、在信息检索中应用较少答案:ABC222.关于CAP理论说法正确的是()。A、一个分布式系统不能同时满足一致性、可用性和分区容错性等需求B、一致性主要指强一致性C、一致性、可用性和分区容错性中的任何两个特征的保证(争取)可能导致另一个特征的损失(放弃)D、可用性指每个操作总是在“给定时间”之内得到返回“所需要的结果”。答案:ABCD223.以下()是一元通用函数。A、np.add()B、np.maximum()C、np.exp()D、np.sqrt()答案:CD224.下面是Python注释语句的是()。A、hello'B、'''hello'''C、helloD、#答案:BD225.当我们构造线性模型时,我们注意变量间的相关性。在相关矩阵中搜索相关系数时,如果我们发现3对变量的相关系数是(Var1和Var2,Var2和Var3,Var3和Var1)是-0.98,0.45,1.23.我们可以得出什么结论:()。A、Var1和Var2是非常相关的B、因为Va1r和Var2是非常相关的,我们可以去除其中一个C、Var3和Var1的1.23相关系数是不可能的答案:ABC226.集成学习中多样性的增强有哪些()A、数据样本扰动B、输入属性扰动C、输出表示扰动D、算法参数扰动答案:ABCD227.完整性约束通常包括()A、实体完整性B、域完整性C、参照完整性D、用户定义完整性答案:ABCD228.图像数字化应该包括哪些过程()。A、采样B、模糊C、量化D、统计答案:AC229.区块链是()等计算机技术的新型应用模式。A、分布式数据存储B、点对点传输C、共识机制D、加密算法答案:ABCD230.回归分析有很多种类,常见的有()。A、线性回归B、系数回归C、逻辑回归D、曲线回归答案:ACD231.下面对于超链接的说法,正确的是()。A、语句<ahref=”formhtml”>FillOurForm</a>指向的是同一服务器同一目录下的formhtmlB、语句<ahref=”stuff/cathtml”>Catalog</a>指向的是同一服务器子目录stuff下的cathtmlC、语句<ahref=”/parenthtml”>Parent</a>指向的是同一服务器父目录下的parenthtmlD、语句<ahref=”devbgorg”target=”_blank”>BASD</a>指向的是内部的网站答案:ABC232.Spark的关键技术包括以下哪几个()。A、RDD;B、Scheduler;C、Storage;D、Shuffle;答案:ABCD233.(__)可以帮助解决训练集在特征空间中线性不可分的问题。A、硬间隔B、软间隔C、核函数D、拉格朗日乘子法答案:BC234.下面哪些属于可视化高维数据技术()。A、矩阵B、.平行坐标系C、星形坐标D、散布图答案:ABC235.下面关于函数的递归调用描述正确的是()。A、必须有一个明确的结束条件B、每次进入更深一层递归时,问题规模相比上次递归都应有所减少C、递归调用效率不高,递归层次过多会导致栈溢出(在计算机中,函数调用是通过栈(stack)这种数据结构实现的,每当进入一个函数调用,栈就会加一层栈帧,每当函数返回,栈就会减一层栈帧D、由于栈的大小不是无限的,所以,递归调用的次数过多,会导致栈溢出)答案:ABCD236.请选择所有匹配项:下面哪些literal拥有数值数据类型(即哪些可用于算术表达式)()。A、0xffB、99C、122D、1002答案:ABC237.以下哪些方法是tf-idf的变种()。A、TFCB、EWCC、ITCD、IG答案:AC238.机器学习的三个关键组成要素是()。A、任务TB、性能指标PC、目标函数VD、经验来源E答案:ABD239.关于总体和样本的说法,正确的是:A、总体也就是研究对象的全体B、如果总体是某一条生产线上生产的全部产品,那么样本可以是每间隔10秒抽取的产品C、样本是从总体的随机抽样D、如果总体是某一小学的1000名学生,那么样本可以是一年级的100名学生答案:ABC240.数据从产生到终结共有()环节。A、数据产生环节B、数据传输环节C、数据使用环节D、数据共享环节E、数据销毁环节答案:ABCDE241.在Hive架构中支持对数据的操作有()。A、插入B、查询C、删除D、分析;答案:BD242.特征向量的归一化方法有哪些()A、线性函数转换B、对数函数转换C、反余切函数转换D、减去均值,除以方差答案:ABCD243.下列关于自然语言处理中的关键词提取的说法正确的是()。A、关键词提取是指用人工方法提取文章关键词的方法B、TF-IDF模型是关键词提取的经典方法C、文本中出现次数最多的词最能代表文本的主题D、这个问题设计数据挖掘,文本处理,信息检索等领域答案:BD244.大数据的参考架构分为哪三个层次()A、角色B、活动C、逻辑构件D、功能组件答案:ABD245.以下哪些滤波器能在卷积窗口的边界上使卷积掩膜中心像素和它的4-邻接点的系数降至0附近()。A、同态滤波B、高斯滤波C、巴特沃斯滤波D、中值滤波答案:BC246.交叉检验模型评估较差可能是由于()原因导致的。A、模型过拟合B、模型欠拟合C、模型过度复杂D、模型过度简单答案:ABCD247.建立线性模型时,我们看变量之间的相关性。在寻找相关矩阵中的相关系数时,如果发现3对变量(Var1和Var2、Var2和Var3、Var3和Var1)之间的相关性分别为-0.98、0.45和1.23。我们能从中推断出什么呢()A、Var1和Var2具有很高的相关性B、Var1和Var2存在多重共线性,模型可以去掉其中一个特征C、Var3和Var1相关系数为1.23是不可能的D、以上答案都不正确答案:ABC248.下列不属于聚类性能度量内部指标的是()。A、DB指数B、Dunn指数C、Jaccard系数D、FM系数答案:CD249.深度学习的实质及其与浅层学习的说法正确的是(__)。A、DL强调模型深度B、DL突出特征学习的重要性.特征变换+非人工C、没有区别D、以上答案都不正确答案:AB250.数据挖掘的挖掘方法包括()。A、聚类分析B、回归分析C、神经网络D、决策树算法答案:ABCD251.参数估计可以分为()。A、点估计B、一致估计C、区间估计D、无偏估计答案:AC252.数据安全不仅包括数据保密性,还包括()。A、完整性B、可用性C、不可否认性D、可审计性答案:ABCD253.下列哪些是常用分词方法()。A、基于Binarytree的分词方法B、基于HMM的分词方法C、基于CRF的分词方法D、基于Kmeans的分词方法答案:BC254.下列说法中,对Python中的for语句描述正确的是()。A、Python中for语句只有一种写法:“forin”B、for语句可以用break终止当前循环,重新进入循环&C、continue语句可以跳过循环的当前一步D、for语句可以有else部分答案:ACD255.Yarn的调度机制有哪几种是__。A、FIFOB、CapacityC、FairD、Line答案:ABC256.下列既可以用于分类,又可以用于回归的机器学习算法有:A、k近邻B、逻辑回归C、决策树D、线性回归答案:AC257.与自然语言处理相关的工具包Jieba,Gensim,NLTK,Scikit-Learn的区别是()。A、Jieba专注于中文分词操作B、NLTK主要用于一般自然语言处理任务(标记化,POS标记,解析等)C、Gensim主要用于题和向量空间建模、文档集合相似性等D、Scikit-learn为机器学习提供了一个大型库,其中包含了用于文本预处理的工具,例如词频-逆文档频率特征提取(TfidfVectorizer)等。答案:ABCD258.图像压缩是建立在图像存在()几种冗余之上。A、编程冗余B、像素间冗余C、心理视觉冗余D、计算资源冗余答案:ABC259.关于神经元的叙述,哪些是正确的()A、每个神经元可以有一个输入和一个输出B、每个神经元可以有多个输入和一个输出C、每个神经元可以有多个输入和多个输出D、每个神经元可以有多个输出和一个输入答案:ABCD260.某单位运用随机森林算法思想建立抢修热点模型。该模型主要预测下期台区工单数量,构建抢修热点。以下模型算法构建步骤中合理的顺序是:()。A、将历史数据进行随机自助法重抽样,生成N个训练样本集B、将N个训练样本集分别做决策树,生成N棵决策树C、将N棵决策树随机构成随机森林D、未来根据预测样本气候环境、设备属性、设备工况进行随机森林决策投票,得出针对该预测样本最优的决策树进行运算,并计算出最终结果。答案:ABCD261.针对维数灾难,我们主要采用的降维方法有哪些()。A、多维缩放B、主成分分析C、核化线性降维D、流形学习E、度量学习答案:ABCDE262.下面关于中心极限定理的说法,正确的是:A、中心极限定理说明,对于大量相互独立的随机变量,其均值的分布以正态分布为极限B、中心极限定理说明,对于大量相互独立的随机变量,其均值的分布以t分布为极限C、中心极限定理为Z检验提供了理论支持D、中心极限定理是数理统计学和误差分析的基础答案:ACD263.Flume特点包括()。A、分布式B、高可靠C、高容错D、易于定制和扩展答案:ABCD264.下列关于密度聚类说法错误的是(__)。A、DBSCAN是一种著名的密度聚类算法B、密度聚类从样本数量的角度来考察样本之间的可连接性C、密度聚类基于不可连接样本不断扩展聚类簇易获得最终的聚类结果D、密度直达关系通常满足对称性答案:BCD265.MapReduce对map()函数的返回值处理后才传给reduce()函数,其中涉及哪些操作()。A、合并B、排序C、分区D、抽样答案:ABC266.对以下代码说法正确的是()。X=np.linspace(0.05,10,1000)【换行】Y=np.sin(x)【换行】Plt.plot(x,y,ls="-.",l=2,c="c",label="plotfigure")【换行】Plt.legend()【换行】Plt.grid(linestyle=":",color="r")【换行】Plt.show()A、该图表是一个蓝绿色的散点图B、图表中有红色实线的网格线C、图表中有图例D、该图画的是sin曲线;答案:CD267.以下说法正确的是()。A、条件独立性假设不成立时,朴素贝叶斯分类器仍有可能产生最优贝叶斯分类器B、在估计概率值时使用的拉普拉斯修正避免了因训练集样本不充分而导致概率估值为零的问题C、由于马尔可夫链通常很快就能趋于平稳分布,因此吉布斯采样算法的收敛速度很快D、二分类任务中两类数据满足高斯分布且方差相同时,线性判别分析产生贝叶斯最优分类器答案:ABD268.以下()属于数据统计分析工具。A、WekaB、SASC、SPSSD、Matlab答案:ABCD269.神经网络模型(NeuralNetwork)因受人类大脑的启发而得名。神经网络由许多神经元(Neuron)组成,每个神经元接受一个输入,对输入进行处理后给出一个输出。请问下列关于神经元的描述中,哪一项是正确的(__)。A、每个神经元有一个输入和一个输出B、每个神经元有多个输入和一个输出C、每个神经元有一个输入和多个输出D、每个神经元有多个输入和多个输出答案:ABCD270.以下图像技术中属于图像处理技术的是()。A、图像编码B、图像合成C、图像增强D、图像分类答案:AC271.线性模型的基本形式有()。A、线性回归B、对数几率回归(二分类问题)C、线性判别分析(Fisher判别分析)D、多分类学习答案:ABCD272.Spark有哪些缺陷()。A、于内存的计算B、持Schema信息C、支持增量迭代计算D、支持细粒度更新操作答案:CD273.分布式列式存储的功能有()。A、支持在线快速读写B、支持线性扩展C、具备节点监控管理D、数据同源不压缩答案:ABC274.LSTM应用场景应用场景有哪些()A、翻译语言B、语音识别C、图像识别D、股票预测答案:ABD275.请问下面哪些是离散型变量()。A、示波器B、心电图及脑动电图扫描器对脑电波的测量C、过去数月的总销售额D、公司每年的红利答案:CD276.在Python中,以下导入模块方式正确的是()。A、import模块名B、import模块名as模块的别名C、from模块名import函数名D、from模块名import函数名A,函数名B答案:ABCD277.决策树递归停止的条件为()。A、训练数据集使用完B、所有的类标签完全相同C、特征用完D、遇到丢失值答案:BC278.在建立模型时,需要用到()。A、训练数据B、测试数据C、原始数据D、验证数据答案:ABD279.Numpy数组中将一个数组分割成多个小数组数组分割函数包括()。A、hsplitB、vsplitC、splitD、dsplit答案:ABCD280.关于Pig的说法正确的是()。A、Pig的主要目的是弥补MapReduce编程的复杂性B、Pig的核心是一种数据分析语言C、Pig程序的结构适合于串行处理D、Pig主要包含PigLatin和Pig执行环境两部分答案:ABD281.下面是python标准库的是()。A、osB、sysC、numpyD、re答案:ABD282.许多功能更为强大的非线性模型可在线性模型基础上通过引入()和()而得。A、层级结构B、高维映射C、降维D、分类答案:AB283.在支持向量机中,参数的选取会影响拟合的结果,如果出现过拟合的现象,则导致该结果的原因有可能是(__)。A、其他参数保持不变,C值过大B、其他参数保持不变,λ值较少C、其他参数保持不变,σ较大D、其他参数保持不变,σ较小答案:ABD284.卷积神经网络通过哪些措施来保证图像对位移、缩放、扭曲的鲁棒性(__)。A、局部感受野B、共享权值C、池采样D、正则化答案:ABC285.Python函数包括下述哪些内容()。A、函数名称B、参数C、执行语句D、返回值答案:ABCD286.数据挖掘算法的组件包括()。A、模型或模型结构B、评分函数C、优化和搜索方法D、数据管理策略答案:ABCD287.最常见的分词算法可以分为哪三大类()。A、基于字符串匹配的分词方法B、基于理解的分词方法C、基于统计的分词方法D、基于阅读的分词方法答案:ABC288.下面导入模块正确的是()。A、importnumpyB、importnumpyasnpC、frommatplotlibimportpyplotD、frommatplotlibimportpyplotasplt答案:ABCD289.以下关于HTML标签嵌套规则的说法,正确的是()。A、块元素可以包含内联元素或某些块元素,但内联元素也可以包含块元素B、HTML标签包括块级元素和内嵌元素C、内嵌元素一般用在网站内容之中的某些细节或部位,用以“强调区分样式上标下标锚点”等,通常包括:aabbrbbrfontiimginputkbdlabelqsselectsmallspansubttuvar等D、其中块级元素一般用来搭建网络架构布局承载内容,通常包括的标签有:addressdirdivdldtddformh1~h6hrisindexmenunoframesnoscriptolppretableul等答案:BCD290.特征工程一般需要做哪些工作()。A、正则化B、标准化C、特征处理D、特征选择答案:CD291.下列有关MapReduce计算框架的描述正确的是()。A、MapReduce可以计算任务的划分和调度;B、MapReduce可完成数据的分布存储和划分;C、MapReduce可以实现处理系统节点出错检测和失效恢复;D、MapReduce可实现处理数据与计算任务的同步;答案:ABCD292.DGI定义的数据治理任务包括()。A、数据质量的评估B、主动定义或序化规则C、为数据利益相关者提供持续跨职能的保护与服务D、应对并解决因不遵守规则而产生的问题答案:BCD293.变量名可以包含()。A、字母B、数字C、下划线D、空格答案:ABC294.下列属于文本处理流程的是()。A、NormalizationB、TokenizationStopwordsC、Part-of-speechTaggingD、NamedEntityRecognition答案:ABCD295.关于数据流转和应用,以下说法正确的是()。A、数据流转和应用过程中应确保可追溯、可复查B、前序环节应保证数据的真实、完整C、前序环节应及时传递到后序环节D、前后环节数据应保持衔接一致答案:ABCD296.下面对范数规则化描述正确的是()。A、L0是指向量中0的元素的个数B、L1范数是指向量中各个元素绝对值之和C、L2范数向量元素绝对值的平方和再开平方D、L0是指向量中非0的元素的个数答案:BCD297.下列关于词袋模型说法正确的是()。A、词袋模型可以忽略每
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 2026中国金属基复合材料航空航天领域渗透率提升研究报告
- 2026疫苗生产设备智能化升级与数字化工厂建设指南
- 2026消费电子行业技术变革与市场格局重塑报告
- 2026中国茶咖混饮口味测试与核心用户画像分析报告
- 2026中国新能源电池材料市场增长潜力与投资价值分析
- 2026酒精饮品品牌营销创新与技术工艺革新应用前景研究报告
- 2026当代茶空间设计中实木元素应用趋势与商业价值
- 2026电烤炉行业市场现状供需格局及投资战略研究报告
- 2026饮料行业KOL营销效果监测与ROI测算模型报告
- 2026电气装备电线电缆行业产品差异化与竞争策略分析报告
- 2026年传染病控制副高真题及答案
- 中国电信湖南校招笔试题
- 托育食品安全课件
- 人工智能与未来 课件 8.2 计算机视觉概述
- 2025 初中一年级语文下册《台阶》细节描写作用课件
- 彩票合伙合同协议书
- 企业管理-采购腹腔镜训练器的申请报告
- T-CICC 35007-2025 金属材料 疲劳试验小样本数据统计分析方法
- HJ 169-2018建设项目环境风险评价技术导则
- 机械表维护知识培训课件
- GJB1406A-2021产品质量保证大纲要求
评论
0/150
提交评论