2026年大数据应用技能竞赛理论考试题库-含答案_第1页
2026年大数据应用技能竞赛理论考试题库-含答案_第2页
2026年大数据应用技能竞赛理论考试题库-含答案_第3页
2026年大数据应用技能竞赛理论考试题库-含答案_第4页
2026年大数据应用技能竞赛理论考试题库-含答案_第5页
已阅读5页,还剩185页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

PAGEPAGE1一、单选题1.我们建立一个5000个特征,100万数据的机器学习模型.我们怎么有效地应对这样的大数据训练()。A、我们随机抽取一些样本,在这些少量样本之上训练B、我们可以试用在线机器学习算法C、我们应用PCA算法降维,减少特征数D、以上答案都正确答案:D2.下列哪项技术可用于防止敏感数据泄露?A、数据备份B、数据脱敏C、数据压缩D、数据缓存答案:B3.HBase适用于哪种类型的数据访问模式?A、全表扫描B、高频写入低频读取C、随机读写D、事务一致性强答案:C4.采用幂次变换进行灰度变换时,当幂次取大于1时,该变换是针对如下哪一类图像进行增强()。A、图像整体偏暗B、图像整体偏亮C、图像细节淹没在暗背景中D、图像同事存在过亮和过暗背景;答案:B5.数据仓库是随着时间变化的,下面的描述不正确的是()。A、数据仓库随时间的变化不断增加新的数据内容B、捕捉到的新数据会覆盖原来的快照C、数据仓库随事件变化不断删去旧的数据内容D、数据仓库中包含大量的综合数据,这些综合数据会随着时间的变化不断地进行重新综合答案:C6.“for”是一种常用的循环语句。下列语句运行后,变量sum的值为()。Sum=0Foriinrange(10):Sum=sum+iA、55B、10C、11D、45答案:D7.数据资产维护是指为保证数据质量,对数据进行()等处理的过程。A、更正B、删除C、补充录入D、以上答案都正确答案:D8.当在卷积神经网络中加入池化层(poolinglayer)时,变换的不变性会被保留,是吗()A、不知道B、看情况C、是D、否答案:C9.下列策略()可在保证训练精度的情况下降低模型的复杂度。A、正则化系数无穷大B、正则化系数几乎为0C、选择合适的正则化参数D、以上答案都不正确答案:C10.下列不属于action操作的是()A、collectB、filterC、reduceD、count答案:B11.数据的可用性取决于()。A、数据分析B、数据集采C、数据质量D、数据需求答案:C12.如果我们现有一个安装2.6.5版本的hadoop集群,在不修改默认配置的情况下存储200个每个200M的文本文件,请问最终会在集群中产生多少个数据块(包括副本)()A、200B、2009/07/06C、400D、1200答案:D13.为了提高系统性能,Spark采取“惰性计算模式”,具体为()。A、执行Transformation操作时不会提交,只有执行Action操作时才会被提交到集群中开始被执行B、执行Action操作时不会提交,只有执行Transformation操作时才会被提交到集群中开始被执行C、只有执行完Action操作和Transformation操作时,所有操作才会被提交到集群中开始被执行D、执行完Action操作或Transformation操作时都不会提交到集群答案:A14.a=1,b=2,c=3,以下表达式值为True的是()。A、a;>;=B、or(C+5)%3==1C、not(a==1anD、b!=E、notF、anG、b==cH、aan答案:D15.下列哪些不是目前机器学习所面临的问题是()。A、测试集的规模B、维度灾难C、特征工程D、过拟合答案:A16.Sigmoid函数作为神经元激活函数的特点是()。A、连续但不光滑B、不连续但光滑C、连续且光滑D、不连续且不光滑答案:C17.离散程度的测度值愈大,则()。A、映变量值愈分散,算术平均数代表性愈差B、映变量值愈集中,算术平均数代表性愈差C、映变量值愈分散,算术平均数代表性愈好D、映变量值愈集中,算术平均数代表性愈好答案:A18.下列哪项属于促进绿色低碳转型的创新业务?A、行业级电力看能耗B、企业碳管理C、电力看环保D、以电折水分析答案:B19.一幅512*512的图像,若灰度级数为16,则该图像大小为()。A、32KBB、128KBC、1MBD、2MB答案:B20.大数据应用成果审核的主要依据是什么?A、技术可行性B、商业价值C、法规合规性D、用户满意度答案:C21.MaxComputeSpark是MaxCompute提供的兼容开源的Spark计算服务,目前MaxComputeSpark支持以下使用场景()?A、读写VPC环境下的服务,如RDS、Redis、ECS上部署的服务等B、Streaming场景C、交互式类需求,Spark-Shell、Spark-SQL-Shell、PySpark-Shell等D、Java/Scala所有离线场景,GraphX、MlliE、RDF、Spark-SQL、PySpark等答案:A22.过滤式特征选择与学习器(),包裹式特征选择与学习器()。A、相关相关B、相关不相关C、不相关相关D、不相关不相关答案:C23.在k近邻学习算法中,随着k的增加,上界将逐渐降低,当k区域无穷大时,上界和下界碰到一起,k近邻法就达到了()。A、贝叶斯错误率B、渐进错误率C、最优值D、上界答案:A24.导入模块的方式错误的是()。A、importmoB、frommoimport*;C、importmoasmD、importmfrommo答案:D25.关于缺失值填补,不正确的说法是()。A、填补数据可以用中位数或者众数等B、pandas.dropna可以用来填补缺失值C、用平均值填补会引入相关性D、哑变量填补是将缺失值当做一类新特征处理答案:B26.若希望在DataWorks中对API进行权限控制,应使用哪种机制?A、IP白名单B、Token认证C、Cookie验证D、HTTPBasiE、Auth答案:A27.已知一组数据的协方差矩阵P,下面关于主分量说法错误的是()。A、主分量分析的最佳准则是对一组数据进行按一组正交基分解,在只取相同数量分量的条件下,以均方误差计算截尾误差最小B、在经主分量分解后,协方差矩阵成为对角矩阵C、主分量分析就是K-L变换D、主分量是通过求协方差矩阵的特征值得到答案:C28.关于Python布尔值,下列选项描述正确的是()。A、整型的0不可以表示FalseB、浮点型的0不可以表示FalseC、0+0j可以表示FalseD、布尔值不可以进行算术运算答案:C29.Adapter模块在微调后,是否会影响原始预训练模型的通用性?()A、会,使原始模型只能用于特定任务B、不会,原始模型仍可用于其他任务C、会,导致原始模型无法使用D、不确定,取决于Adapter模块的大小答案:B30.下列属于小波去噪步骤的是()。A、对图象信号进行小波分解B、对经过层次分解后的高频系数进行阈值量化C、利用二维小波重构图象信号D、以上答案都正确答案:D31.DataWorks中,任务实例的“状态”不包括以下哪项?A、成功B、失败C、已取消D、正在编译答案:D32.在模型部署过程中,对模型进行性能测试的主要目的是()A、检查模型是否过拟合B、评估模型在实际环境中的运行效率和准确性C、确定模型的最优超参数D、查看模型的训练损失是否收敛答案:B33.文档摘要中“信息冗余度”过高可能是因为:A、未使用抽取式摘要技术B、过度保留原文细节C、模型温度参数设置过低D、输入文档存在格式错误答案:B34.下列关于MapReduce说法不正确的是()。A、MapReduce是一种计算框架B、MapReduce来源于google的学术论文C、MapReduce程序只能用java语言编写D、MapReduce隐藏了并行计算的细节,方便使用答案:C35.a=np.array([[1,2,3],[4,5,6]]),以下操作会改变数组本身形状的是()。A、a.TB、a.reshape(2,3)C、a.ravel()D、a.resize()答案:D36.使用JDBC连接MySQL数据库时,正确的驱动类名是?A、com.mysql.DriverB、com.mysql.jdbC、DriverD、orE、postgresql.DriverF、javG、sql.MySQLDriver答案:B37.如果自变量X和因变量Y之间存在高度的非线性和复杂关系,那么树模型很可能优于经典回归方法()。A、正确B、错误C、无法确定D、模型效果差别不大答案:A38.以下关于DNN说法不正确的是()。A、层数多B、抽象能力强C、模拟更复杂模型D、广义上包含CNN,DBN,SVM等答案:D39.()算法是决策树学习的基本算法,其他多数决策树学习方法都是它的变体。A、Find-S算法B、KNN算法C、概念算法D、ID3算法答案:D40.data=Numpy.array([[[1,2,3],[4,5,6]],[[7,8,9],[10,11,12]]]),data的形状(shape)为()。A、(2,2,3)B、(2,3,2)C、(3,2,3)D、(3,2,2)答案:A41.在阿里云API网关中,创建API的两种主要方式是?A、向导模式和代码模式B、向导模式和脚本模式C、图形界面和命令行D、手动部署和自动部署答案:B42.@app.route的作用为()。A、程序代码的规范,没什么作用B、类似装饰器,返回本地网络测试地址C、返回127005000D、以上答案都不正确答案:B43.查看变量内存地址的Python内置函数是()。A、memery()B、id()C、localof()D、help()答案:B44.在Python中,函数()。A、不可以嵌套定义B、不可以嵌套调用C、不可以递归调用D、以上答案都不正确答案:D45.在机器学习中,不属于常用的冲突消解策略是()。A、投票法B、排序法C、元规则法D、加权法答案:D46.基于数据中台建设的场景时,接入源端数据,存储在数据中台的()。A、贴源层B、交换区C、分析层D、共享层答案:A47.执行以下代码段Motorcycles=['honda','yamaha','suzuki']Motorcycles.append('ducati')Motorcycles.pop(1)Print(motorcycles)时,输出为()。A、['honda','yamaha','suzuki']B、['yamaha','suzuki','ducati']C、['honda','yamaha','suzuki','ducati']D、['honda','suzuki','ducati']答案:D48.数据安全不只是技术问题,还涉及到()。A、人员问题B、管理问题C、行政问题D、领导问题答案:B49.ggplot2的核心理念是()。A、绘图与数据分离B、结构与数据分离C、绘图与结构分离D、绘图与数据和结构分离答案:A50.通常来说,下面哪种方法能够用来预测连续因变量()A、线性回归B、逻辑回归C、线性回归和逻辑回归D、以上答案都不正确答案:A51.光明大模型支持的文档摘要类型不包括:A、抽取式摘要B、生成式摘要C、评论式摘要D、多文档摘要答案:C52.Hive支持以下哪种类型的查询?A、SQL查询B、NoSQL查询C、图查询D、时间序列查询答案:A53.有两个样本点,第一个点为正样本,它的特征向量是(0,-1);第二个点为负样本,它的特征向量是(2,3),从这两个样本点组成的训练集构建一个线性SVM分类器的分类面方程是()。A、2x+y=4B、x+2y=5C、x+2y=3D、2x-y=0答案:C54.参加奥运会前,需要对运动员模拟比赛的成绩进行统计分析,判断运动员成绩是否稳定,因此需要知道运动员模拟比赛的()A、平均数或中位数B、方差或频率C、频数或众数D、方差或极差答案:D55.对于神经网络的说法,下面正确的是:(__)。1.增加神经网络层数,可能会增加测试数据集的分类错误率2.减少神经网络层数,总是能减小测试数据集的分类错误率3.增加神经网络层数,总是能减小训练数据集的分类错误率A、1B、1、3C、1、2D、2答案:A56.在选择神经网络的深度时,下面那些参数需要考虑()1神经网络的类型(如MLP,CNN)2输入数据3计算能力(硬件和软件能力决定)4学习速率5映射的输出函数A、1,2,4,5B、2,3,4,5C、都需要考虑D、1,3,4,5答案:C57.下面与Zookeeper类似的框架是()。A、ProtobufB、JavaC、KafkaD、Chubby答案:D58.Hadoop中,Reducer的三个阶段是__。A、ShufflB、-Sort-ReduceC、ShufflD、-ReducE、-SortF、ReducG、-ShufflH、-Sort答案:A59.在情感分析任务中,其目的是将无结构化的情感文本转化成计算机容易识别和处理的结构化文本,进而供情感分析上层的研究和应用服务的是()。A、情感信息检索B、情感信息抽取C、情感信息分类D、情感信息归纳答案:B60.对于神经网络的说法,下面正确的是()。A、增加神经网络层数,可能会增加测试数据集的分类错误率B、减少神经网络层数,总是能减小测试数据集的分类错误率C、增加神经网络层数,总是能减小训练数据集的分类错误率D、1、2都对答案:A61.以下哪项不属于图像分割的内容()。A、把不同类标分开B、提取不同区域的特征C、识别图像内容,或对图像进行分类D、对未处理图像进行平滑答案:D62.下列方法中,用于向文件中写内容的是()。A、openB、writeC、closeD、read答案:B63.从复杂度及价值高低两个维度,可以将数据分析分为()。A、描述性分析、诊断性分析、预测性分析、探索性分析B、探索性分析、诊断性分析、预测性分析、规范性分析C、探索性分析、描述性分析、预测性分析、规范性分析D、描述性分析、诊断性分析、预测性分析、规范性分析答案:D64.以下不属于有监督的词义消歧方法的是()。A、Flip-Flop算法B、贝叶斯分类器C、最大熵消歧D、基于词典的消歧答案:D65.Relief是为()问题设计的。A、二分类B、多分类C、回归D、降维答案:A66.下列关于线性回归分析中的残差说法正确的是()。A、残差均值总是为零B、残差均值总是约等于零C、残差均值总是大于零D、以上答案都不正确答案:A67.数据科学中,人们开始注意到传统数据处理方式中普遍存在的“信息丢失”现象,进而数据处理范式从()转向()。A、产品在先,数据在后范式;数据在先,产品在后范式或无模式B、模式在先,产品在后范式;产品在先,模式在后范式或无模式C、数据在先,模式在后范式或无模式;模式在先,数据在后范式D、模式在先,数据在后范式;数据在先,模式在后范式或无模式答案:D68.Scipy的stats包中提供了产生连续性分布的函数,其中用于均匀分布的函数是()。A、normB、uniformC、betaD、geom答案:B69.成果共享过程中,哪一项是必须严格遵守的要求?A、数据加密B、访问控制C、安全防护要求D、数据清洗答案:C70.当读取HBase表时,只要求返回C1的列值,使用下列哪个选项可以实现该功能?A、ValueFilteB、ColumnFilterC、RowFilterD、QualifierFilter答案:D71.以下哪个领域不属于人工智能的典型应用领域?A、医疗影像诊断B、手工编织C、智能交通调度D、语音助手答案:B72.以下关于新旧MapReduceAPI的描述错误的是()A、新API放在orB、apachC、hadoop.mapreduce包中,而旧API则是放在orD、apachE、hadoop.mapred中F、新API倾向于使用接口方式,而旧API倾向于使用抽象类G、新API使用Configuration,而旧API使用JobConf来传递配置信息H、新API可以使用Job对象来提交作业答案:B73.关于抛出异常的说法中,描述错误的是()。A、当raise指定异常的类名时,会隐式地创建异常类的实例B、显式地创建异常类实例,可以使用raise直接引发C、不带参数的raise语句,只能引发刚刚发生过的异常D、使用raise抛出异常时,无法指定描述信息答案:D74.下列表命名规范哪个编码是按照日增量更新?A、MINIB、MFC、DID、WF答案:C75.Hbase依靠()提供强大的计算能力。A、ZoopkeeperB、ChubbyC、RPCD、MapReduce答案:D76.哪种聚类方法采用概率模型来表达聚类()。A、K-meansB、LVQC、DBSCAND、高斯混合聚类答案:D77.下列不属于数据科学跨平台基础设施和分析工具的是()。A、微软AzureB、Google云平台C、阿里云D、AdobE、photoshop答案:D78.大数据环境下的隐私担忧,主要表现为()A、人信息的被识别与暴露B、用户画像的生成C、恶意广告的推送D、病毒入侵答案:A79.将Python中的.py文件转换为.pyc文件的组件为()。A、编辑器B、编译器C、虚拟机D、解释器答案:B80.下列选项中,()是唯一不在运行时发生的异常。A、ZeroDivisionErrorB、NameErrorC、SyntaxErrorD、KeyError答案:C81.下列关于脚本模式的说法正确的是?A、不支持复杂的逻辑处理B、只能用于HTTP后端C、支持对请求参数进行格式转换D、必须搭配数据库使用答案:C82.对于一个分类任务,如果开始时神经网络的权重不是随机赋值的,而是都设成0,下面哪个叙述是正确的()A、其他选项都不对B、没啥问题,神经网络会正常开始训练C、神经网络可以训练,但是所有的神经元最后都会变成识别同样的东西D、神经网络不会开始训练,因为没有梯度改变答案:C83.有数组n=np.arange(24).reshape(2,-1,2,2),np.shape的返回结果是()。A、(2,3,2,2)B、(2,2,2,2)C、(2,4,2,2)D、(2,6,2,2)答案:A84.sklearn.naive_bayes模块实现了朴素贝叶斯算法,基于贝叶斯定理和特征独立性假设的监督学习方法,下列哪个模型不是朴素贝叶斯分类器的模型()。A、BernoulliNB()B、GaussianN()C、NeighborsNB()D、MultinomialNB()答案:C85.关于层次聚类算法:(1)不断重复直达达到预设的聚类簇数(2)不断合并距离最近的聚类簇(3)对初始聚类簇和相应的距离矩阵初始化(4)对合并得到的聚类簇进行更新。正确的执行顺序为()。A、1234B、1324C、3241D、3412答案:C86.可用信息增益来进行决策树的()。A、树高B、叶子结点数C、总结点数D、划分属性选择答案:D87.以下代码的输出结果为()。ImportnumpyasnpA=np.arange(9)B=np.split(a,3)Print(b)A、[012345678]B、[array([0,1,2]),array([3,4,5]),array([6,7,8])]C、[array([0,1,2,3]),array([4,5,6]),array([7,8])]D、没有正确答案答案:B88.a=np.arange(10),a[2:4]截取到的数组为()。A、[1,2,3]B、[2,3,4]C、[2,3]D、[1,2]答案:C89.下列关于IPython的说法,错误的是()。A、IPython集成了交互式Python的很多优点;B、IPython的性能远远优于标准的Python的shell;C、IPython支持变量自动补全,自动收缩;D、与标准的Python相比,IPython缺少内置的功能和函数;答案:D90.在阿里云API网关中,用于限制特定IP地址访问API的功能是?A、流量控制B、日志分析C、IP访问控制D、跨域设置答案:C91.Python中定义私有属性的方法是()。A、使用private关键字B、使用public关键字C、使用__XX__定义属性名D、使用__XX定义属性名答案:D92.当需要在字符串中使用特殊字符时,python使用()作为转义字符。A、\\\\\\\\\\\\B、/C、%答案:A93.BERT模型的下一句预测(NextSentencePrediction)预训练任务的主要目的是?()A、学习句子间的逻辑关系B、学习句子内部的语法结构C、提高模型对单个句子的理解能力D、增加模型训练速度答案:A94.下列选项中,用于触发异常的是()。A、tryB、catchC、raiseD、except答案:C95.以下关于异常处理的描述,正确的是()。A、try语句中有except子句就不能有finally子句B、Python中,可以用异常处理捕获程序中的所有错误C、引发一个不存在索引的列表元素会引发NameError错误D、Python中允许利用raisE、语句由程序主动引发异常答案:D96.在API开发中,连接数据库通常使用哪种协议?A、HTTPB、JDBCC、FTPD、SMTP答案:B97.以下关于pandas中groupby方法说法正确的是()。A、groupby能够实现分组聚合B、groupby方法的结果能够直接查看C、groupby是pandas提供的一个用来分组的方法D、groupby方法是pandas提供的一个用来聚合的方法答案:C98.多分类学习中,最经典的三种拆分策略不包括()。A、一对一B、一对其余C、一对多D、多对多答案:C99.以下属于考虑词语位置关系的模型有()。A、词向量模型B、词袋模型C、词的分布式表示D、TE、-IDF答案:A100.MapReduce中,Shuffle操作的作用是()。A、合并B、排序C、降维D、分区答案:B101.DataHub同步功能异常,需要排查哪个负责同步模块的服务()?A、FrontendB、DataHub/XStreamServicexC、DataHub/CoordinatorServicexD、DataHub/ShipperServicex答案:D102.对于PCA(主成分分析)转化过的特征,朴素贝叶斯的不依赖假设总是成立,因为所有主要成分是正交的,这个说法是:().A、正确的B、错误的答案:B103.以下哪种方法不属于特征选择的标准方法:()。A、嵌入B、过滤C、包装D、抽样答案:D104.基于N-最短路径分词算法,其最后的粗分结果集合大小()N。A、大于B、大于等于C、小于D、小于等于答案:B105.DataWorks中,通过数据开发面板的任务开发,可以创建节点任务,也可以创建工作流任务,而工作流任务内部又可以创建工作流节点,关于节点任务和工作流节点的说法中错误的是()?A、节点任务依赖属性的上游任务可以是工作流任务,也可以是某个工作流节点B、节点任务依赖属性的上游任务可以是工作流任务,工作流节点无法单独配置依赖属性C、同个工作流的工作流节点之间可以配置依赖关系D、节点任务可以配置调度周期,工作流节点不能单独配置调度周期答案:A106.下列哪个不属于常用的文本分类的特征选择算法()。A、卡方检验值B、互信息C、信息增益D、主成分分析答案:D107.下面有关分类算法的准确率,召回率,F1值的描述,错误的是()。A、准确率是检索出相关文档数与检索出的文档总数的比率,衡量的是检索系统的查准率B、召回率是指检索出的相关文档数和文档库中所有的相关文档数的比率,衡量的是检索系统的查全率C、正确率、召回率取值取值都在0和1之间,数值越接近0,查准率或查全率就越高D、为了解决准确率和召回率冲突问题,引入了F1分数答案:C108.发布API时需要进行哪些配置?A、设置限流策略B、绑定域名C、设置缓存D、以上都是答案:D109.多分类LDA将样本投影到N-1维空间,N-1通常远小于数据原有的属性数,可通过这个投影来减小样本点的维数,且投影过程中使用了类别信息,因此LDA也常被视为一种经典的()技术。A、无监督特征选择B、无监督降维C、监督特征选择D、监督降维答案:D110.当try子句中没有任何错误时,一定不会执行()语句。A、tryB、slseC、exceptD、finally答案:C111.关于欠拟合(under-fitting),()是正确的。A、训练误差较大,测试误差较小B、训练误差较小,测试误差较大C、训练误差较大,测试误差较大D、训练误差较小,测试误差较小答案:C112.下列关于关键词提取的说法错误的是()A、关键词提取是指借用自然语言处理方法提取文章关键词B、TC、-IDF模型是关键词提取的经典方法D、文本中出现次数最多的词最能代表文本的主题E、这个问题设计数据挖掘,文本处理,信息检索等领域;答案:C113.运行下面的代码,输出结果是()。D={-2,-1,0,1,2,3}N=dpop()Print(n)A、-2B、2C、不确定D、3答案:C114.在HDFS中()是文件系统的工作节点。A、DataNodeB、ClientC、NameNodeD、Flume答案:A115.关于脏数据和乱数据的区分,以下哪种不属于脏数据()。A、含有缺失数据B、冗余数据C、噪声数据D、不规则形态数据答案:D116.下列描述python注释正确的有()。A、多行注释可以在每行开头添加;<;号,也可以在代码块前后加三个单引号.B、注释不可以在语句或表达式行末;C、python中多行注释使用只可以使用三个单引号(‘’’);D、python中多行注释使用只可以使用三个双引号(\\\\\"\\\");\"答案:A117.以下代码的输出结果为()。ImportnumpyasnpA=np.array([-1.7,1.5,-0.2,0.6,10])Print(np.ceil(a))A、[-1.71.5-0.20.610.]B、[-2.1.-1.0.10.]C、[-1.71.5-0.20.610.]D、[-1.2.-0.1.10.]答案:D118.下列程序段执行后,输出结果是()。n=1s=1whilen;<;5:s=s*nn=n+1Print(s)A、24B、10C、120D、15答案:A119.以下统计量中表示数据分布是否为对称性的是()。A、方差B、中位数C、偏态D、峰态答案:C120.与生成方法、半监督SVM、图半监督学习等基于单学习机器利用未标记数据不同,基于分歧的方法(disagreement-basedmethods)使用多学习器,而学习器之间的分歧(disagreement)对未标记数据的利用至关重要。()是此类方法的重要代表。A、协同训练B、组合训练C、配合训练D、陪同训练答案:A121.文本信息往往包含客观事实和主观情感,对于文本的情感分析主要是识别文章中的主观类词语,其中()不适用于情感分析。A、表达观点的关键词B、表达程度的关键词C、表达情绪的关键词D、表达客观事实的关键词答案:D122.卷积神经网络中每层卷积层(Convolutionallayer)由若干卷积单元组成,每个卷积单元的参数都是通过反向传播算法最佳化得到,其作用是(__)。A、增强图像B、简化图像C、特征提取D、图像处理答案:C123.以下属于深度学习框架的是(__)。A、TensorflowB、CaffeC、PyTorchD、以上答案都正确答案:D124.在DGC中,查看任务日志可以通过哪种方式?A、控制台直接查看B、FTP下载C、SSH连接D、API获取答案:A125.提示词中使用\"<<<ResponseFormat:JSON\"属于哪种工程技巧?A、任务描述B、输入示例C、输出格式约束D、性能优化指令答案:C126.以下哪一项不是数据可视化的顺序模型的内容()。A、数据分析B、过滤C、映射D、绘图答案:D127.()是实现数据战略的重要保障。A、数据管理B、数据分析C、数据治理D、数据规划答案:C128.图像平滑会造成()。A、图像边缘模糊化B、图像边缘清晰化C、无影响D、以上答案都不正确答案:A129.公司统一的数据共享负面清单原则上每年发布多少次?A、1次B、2次C、3次D、不定期发布答案:A130.下面哪个不是python合法标识符()。A、int32B、40XLC、_selfD、name答案:B131.下列关于数据科学流程与方法的描述中,错误的是()。A、数据科学的基本流程包括数据化、数据加工(DatB、WranglinC、或DatD、MunginE、数据规整化、探索性分析、数据分析与洞见、结果展现以及数据产品的提供F、对于数据形态不符合要求的乱数据,要通过清洗成为规整数据G、数据分析包括描述性分析、诊断性分析、预测性分析和规范性分析H、数据可视化会遇到视觉假象问题,人眼对亮度和颜色的相对判断容易造成视觉假象答案:B132.()和假设检验又可归结为统计推断的范畴,即对总体的数量特征做出具有一定可靠程度的估计和判断.A、参数估计B、逻辑分析C、方差分析D、回归分析答案:A133.在集成学习中,对于数据型输出,最常见的结合策略是()。A、平均法B、投票法C、学习法D、以上答案都正确答案:A134.光明电力大模型在电网运维中的应用,设备故障诊断时间由原来的一周缩短至多少?A、1天B、1小时C、1分钟D、1秒答案:B135.Spark的集群管理模式不包含()。A、Standalone模式B、Message模式C、YARN模式D、Mesos模式答案:B136.在页面中看不见的表单元素是那种()。A、;<;inputtype=\\\\\\\\password\\\\\\\\\\\\\\;>;;<;/input;>;\\\"\"B、;<;inputtype=\\\\\\\\radio\\\\\\\\\\\\\\;>;;<;/input;>;\\\"\"C、;<;inputtype=\\\\\\\\hidden\\\\\\\\\\\\\\;>;;<;/input;>;\\\"\"D、;<;inputtype=\\\\\\\\reset\\\\\\\\\\\\\\;>;;<;/input;>;\\\"\"答案:C137.a=[[1.,2.,1.],[1.,2.,1.]],a+3的值为()。A、[[1,2,1],[4,5,4]]B、[[4,5,4],[4,5,4]]C、[[4,5,4],[1,2,1]]D、以上答案都不正确答案:D138.matplotlib中的step函数绘制的是什么图()。A、阶梯图B、直方图C、间断条形图D、堆积折线图答案:A139.在阿里云MaxCompute中,用于判断X和Y两个整型不相等,可以使用的操作符是()?A、X==YB、X!=YC、X;<;;>;YD、XlikE、B答案:C140.在MapReduce中,哪个组件是用户不指定也不会有默认的()A、CombinerB、OutputFormatC、PartitionerD、InputFormat答案:A141.如下哪些不是最近邻分类器的特点()。A、它使用具体的训练实例进行预测,不必维护源自数据的模型B、分类一个测试样例开销很大C、最近邻分类器基于全局信息进行预测D、可以生产任意形状的决策边界答案:C142.在抽样方法中,当合适的样本容量很难确定时,可以使用的抽样方法是:()。A、有放回的简单随机抽样B、无放回的简单随机抽样C、分层抽样D、渐进抽样答案:D143.以下关于连接数组不正确的是()。A、concatenatB、连接沿现有轴的数组序列C、stack沿着新的轴加入一系列数组.D、vstack水平堆叠序列中的数组(列方向)E、hstack3D堆叠序列中的数组(行方向)答案:D144.以下哪项属于提示词工程中的“约束条件”设计?A、"请用简洁的语言回答"B、"假设你是一名医生"C、"输出结果不超过3个选项"D、"参考以下历史对话..."答案:C145.当构建一个神经网络进行图片的语义分割时,通常采用下面哪种顺序()。A、先用卷积神经网络处理输入,再用反卷积神经网络得到输出B、先用反卷积神经网络处理输入,再用卷积神经网络得到输出C、不能确定答案:A146.下面的语句哪个会无限循环下去()。A、forB、inrange(10):\\ntimesleep(10)C、while1;<;10:timesleep(10)D、whileTruE、break25F、a=[3,-1,',']foriina[:]:ifnotG、break答案:B147.Numpy包中meshgrid函数实现的功能是()。A、数组拆分B、数组乘法C、数组除法D、数组融合答案:D148.绝对多数投票法的基本思想是()。A、对于若干和弱学习器的输出进行平均得到最终的预测输出B、少数服从多数,数量最多的类别为最终的分类类别C、不光要求获得最高票,还要求票过半数D、将训练集弱学习器的学习结果作为输入,将训练集的输出作为输出,重新训练一个学习器来得到最终结果答案:C149.多模态协同训练的主要目的是?A、提高单一模态模型性能B、让不同模态模型相互学习,提升整体性能C、增加模型参数数量D、减少训练时间答案:B150.LSTM中,()的作用是确定哪些新的信息留在细胞状态中,并更新细胞状态。A、输入门B、遗忘门C、输出门D、更新门答案:A151.Windows系统下安装Matplotlib的命令是()。A、pythonpipinstallmatplotlibB、python-mpipinstallmatplotlibC、sudoapt-getinstallpython-matplotlibD、sudopython-mpipinstallmatplotlib答案:B152.下列缩进格式描述不正确的是()。A、缩进指在代码行前面添加空格或Tab;B、在Python程序中,缩进不是任意的;C、缩进可以使程序更有层次感、更有结构感,从而是程序更易读.D、平级的语句行(代码块)的缩进可以不相同.答案:D153.如何在DataWorks中查看某天所有任务实例的运行情况?A、使用SQL查询日志表B、在运维中心选择对应日期并查看实例列表C、导出资源包进行分析D、查看项目空间基本信息答案:B154.下列哪项方法不属于图像分割方法()。A、边缘检测法B、阈值分割法C、区域分割法D、特征提取法答案:D155.数据中台共享层模型表按照数据业务领域划分为人员、财务、物资、项目等十大域,模型表命名以()开头A、ODSB、DWDC、UND、BUF答案:B156.考虑这么一种情况:一个对象碰巧与另一个对象相对接近,但属于不同的类,因为这两个对象一般不会共享许多近邻,所以应该选择()的相似度计算方法。A、平方欧几里德距离B、余弦距离C、直接相似度D、共享最近邻答案:D157.创建API时,必须指定哪个字段?A、请求方法B、请求路径C、返回格式D、认证方式答案:B158.如果只写open(filename),那就是用()模式打开。A、rB、wC、aD、b答案:C159.所有预测模型在广义上都可称为一个或一组()。A、公式B、逻辑C、命题D、规则答案:D160.下列哪个不是RDD的缓存方法()A、persist()B、cache()C、Memory()D、以上答案都正确答案:C161.情感信息抽取不包括以下哪些方法()。A、基于命名实体识别的抽取方法B、基于重复段落的识别方法C、基于语义角色标注的抽取方法D、基于监督学习抽取的学习方法答案:B162.国家电网有限公司运营监测大厅的归口管理部门是?A、互联网部B、后勤部门C、信通公司D、大数据中心答案:A163.对组织机构的数据管理成熟度等级划分中的已执行级的描述错误的是()。A、在具体项目中,DMM关键过程域(KP)中给出的关键过程已被执行,但随意性和临时性较大B、DMM关键过程的执行不仅仅局限于特定业务范畴,存在跨越不同业务领域的关键过程C、缺少针对DMM关键过程的反馈与优化D、虽然有可能在特定业务过程中进行了基础性改进,但没有进行持续跟进,也未拓展到整个组织机构答案:B164.a=np.arange(1,13,1).reshape(3,4),np.mean(a,axis=0)的输出结果是()。A、[[1,2,3,4],[5,6,7,8],[9,10,11,12]]B、6.5C、[5,6,7,8]D、[2.5,6.5,10.5]答案:C165.下列关于数据交易市场的说法中,错误的是()。A、数据交易市场是大数据产业发展到一定程度的产物B、商业化的数据交易活动催生了多方参与的第三方数据交易市场C、数据交易市场通过生产数据、研发和分析数据,为数据交易提供帮助D、数据交易市场是大数据资源化的必然产物答案:C166.以下关于图像的平滑处理错误的说法是()。A、图像的平滑处理是指在尽量保留原有信息的情况下,过滤掉图像内部的噪音B、图像平滑处理会对图像中与周围像素点的像素值差异较大的像素点进行处理,将其值调整为周围像素点像素值的近似值C、讲过平滑处理后图像质量会下降D、以上答案都正确答案:C167.下列关于大数据的分析理念的说法中,错误的是()。A、在数据基础上倾向于全体数据而不是抽样数据B、在分析方法上更注重相关分析而不是因果分析C、在分析效果上更追求效率而不是绝对精确D、在数据规模上强调相对数据而不是绝对数据答案:D168.关于基本数据的元数据是指()。A、基本元数据与数据源,数据仓库,数据集市和应用程序等结构相关的信息B、基本元数据包括与企业相关的管理方面的数据和信息C、基本元数据包括日志文件和简历执行处理的时序调度信息D、基本元数据包括关于装载和更新处理,分析处理以及管理方面的信息答案:D169.下列不是数据科学项目的主要角色()。A、项目发起人B、项目经理C、操作人员D、验收人员答案:D170.以下关于模块说法错误的是()。A、一个xx.py就是一个模块;B、任何一个普通的xx.py文件可以作为模块导入;C、模块文件的扩展名不一定是.py;D、运行时会从制定的目录搜索导入的模块,如果没有,会报错异常答案:C171.scipy中模块signal的作用是()。A、信号处理B、程序输入输出C、程序输入输出D、计算积分答案:A172.数组拼接的函数不包括一下哪种()。A、append()B、insert()C、vstack()D、where()答案:D173.逻辑回归将输出概率限定在[0,1]之间。下列哪个函数起到这样的作用()。A、Sigmoid函数B、tanh函数C、ReLU函数D、LeakyReLU函数答案:A174.关于数据分析,下列说法正确的是()。A、描述性分析和预测性分析是对诊断性分析的基础B、断性分析分析是对规范性分析的进一步理解C、预测性分析是规范性分析的基础D、规范性分析是数据分析的最高阶段,可以直接产生产业价值答案:C175.以下可以作为文本分类准则的是()。A、预测准确率B、鲁棒性C、可扩展性D、以上答案都正确答案:D176.以下哪项训练评估指标可以综合衡量模型的查准率和查全率?()A、均方误差B、准确率C、召回率D、F1值答案:D177.下列哪一种方法的系数没有封闭形式(closed-form)的解()。A、Ridge回归B、LassoC、Ridge回归和LassoD、以上答案都不正确答案:B178.Python解释器的提示符为()。A、;>;B、;>;;>;C、;>;;>;;>;答案:C179.人工智能发展历程中,被誉为“人工智能元年”的是哪一年?A、1954年B、1956年C、1960年D、1965年答案:B180.Python内置函数()可以返回列表、元组、字典、集合、字符串以及range对象中元素个数。A、len()B、lengthC、sizeof()D、max()答案:A181.数据科学处于哪三大领域的重叠之处()。A、数学与统计知识、黑客精神与技能、领域实务知识B、数据挖掘、黑客精神与技能、领域实务知识C、数学与统计知识、数据挖掘、领域实务知识D、数学与统计知识、黑客精神与技能、数据挖掘答案:A182.在MapReduce中,以下描述错误的有()。A、Worker故障和Master故障的处理方法不相同B、Map和Reduce的处理结果都存储在本地文件系统C、一个Worker发生故障时,该节点上执行完的Map任务需要再次执行D、MapReduce具有很强的容错机制答案:B183.DWS是一种什么类型的数据库?A、文档型数据库B、分布式关系型数据库C、内存数据库D、图数据库答案:B184.大数据的4V特性不包括()。A、Volume(大量)B、Velocity(高速)C、Visual(可视)D、Variety(多样)答案:C185.关于OLAP的特性,下面正确的是:(1)快速性(2)可分析性(3)多维性(4)信息性(5)共享性()A、(1)(2)(3)B、(2)(3)(4)C、(1)(2)(3)(4)D、(1)(2)(3)(4)(5)答案:D186.在Hadoop生态系统中,()建立在MapReduce之上,主要用来弥补MapReduce编程的复杂性。A、HbaseB、FlumeC、PigD、Sqoop答案:C187.HBase是基于以下哪个系统的分布式数据库?A、HDFSB、YARNC、ZookeeperD、Spark答案:A188.关于L1、L2正则化下列说法正确的是()A、L2正则化能防止过拟合,提升模型的泛化能力,但L1做不到这点B、L2正则化技术又称为LassoRegularizationC、L1正则化得到的解更加稀疏D、L2正则化得到的解更加稀疏答案:C189.Scikit-Learn中()可以实现整数分类值转化为独热向量。A、OridinalEncoderB、OneHotEncoderC、LableEncoderD、AutoEncoder答案:B190.以下哪种不是Hive支持的数据类型()A、StructB、IntC、MapD、Long答案:D191.以下哪项不是大模型的特点?A、参数量巨大B、泛化能力弱C、能处理多种任务D、学习能力强答案:B192.彩色图像增强时,()处理可以采用RGB。A、直方图均衡化B、同态滤波C、均值滤波D、中值滤波答案:C193.事务对数据对象加锁后拥有何种控制权是由封锁的()决定的。A、状态B、类型C、数量D、属性答案:B194.对于影响参观接待的重要设备,应按照什么策略配置?A、N+1B、N-1C、2ND、N/2答案:B195.大数据平台核心分布式存储与计算组件采用Hadoop技术体系中分布式存储、分布式计算框架,及Spark等开源产品和技术,实现对数据的安全控制和管理功能,其中分布式存储不包括()。A、HDFSB、PostgresqlC、HiveD、HBase答案:B196.sklearn.cluster模块实现了哪个功能()。A、集群B、降维C、回归D、聚类答案:D197.关于以下深度学习框架描述正确的是(__)。A、Tensorflow是一款使用C++语言开发的开源数学计算软件B、Caffe对于卷积网络的支持特别好,同时提供的C++接口,也提供了matlab接口和python接口C、PyTorch的前身便是Torch,其底层和Torch框架一样,但是使用Python重新写了很多内容D、以上答案都正确答案:D198.变量的不确定性越大,相对应信息熵有什么变化()。A、熵变小B、熵变大C、不变D、以上答案都不正确答案:B199.基于数据中台建设的场景时,分析结果数据,存储在数据中台的()。A、贴源层B、交换区C、分析层D、共享层答案:C200.结构化数组不能使用以下哪种数据类型创建()。A、元组列表B、字符串C、字典D、整数答案:D201.MapReduce任务map输出结果将被写入()。A、HDFS文件系统B、新的记录文件C、磁盘(Linux文件系统)D、主数据库答案:C202.sklearn.decomposition.PCA()方法的作用是()。A、因子分析B、主成分分析C、稀疏编码D、唯一编码答案:B203.阿里云TSDB最适合用于哪种场景?A、实时交易处理B、时间序列数据分析C、图像识别D、文本分析答案:B204.讨论变量之间的关系,主要有三个方法:()、方差分析和回归分析A、参数分析B、逻辑分析C、假设分析D、相关分析答案:D205.下列关于BP网络说法不正确的是()。A、标准BP算法每次仅针对一个训练样例更新连接权和阈值B、BP神经网络经常遭遇过拟合C、早停策略可用来缓解BP网络的过拟合问题D、晚停策略可用来缓解BP网络的欠拟合问题答案:D206.多层前馈神经网络描述错误的是:(__)。A、输出层与输入层之间包含隐含层,且隐含层和输出层都拥有激活函数的神经元B、神经元之间存在同层连接以及跨层连接C、输入层仅仅是接收输入,不进行函数处理D、每层神经元上一层与下一层全互连答案:B207.执行如下代码:ImporttimePrint(time.time())以下选项中描述错误的是()。A、timB、库是Python的标准库;C、可使用timD、ctime(),显示为更可读的形式;E、timF、sleep(5)推迟调用线程的运行,单位为毫秒;G、输出自1970年1月1日00:00:00AM以来的秒数;答案:C208.下列哪项不属于能源大数据应用的主要产品类型?A、数据可视化工具B、数据挖掘模型C、数据清洗脚本D、数据湖架构答案:D209.MapReduce默认的分区函数是()。A、hashB、diskC、reduceD、map答案:A210.列表对象的sort()方法用来对列表元素进行原地排序,该函数返回值为()。A、FalseB、;<;选项内容缺失;>;C、TrueD、报错答案:B211.下列关于特征编码的叙述中,不正确的是()。A、特征编码是将非数值型特征转换成数值型特征的方法;B、数字编码与特征的排序无关;C、OnD、-Hot编码中,原始特征有n种取值,转换后就会产生n列新特征;E、哑变量编码解决了OnF、-Hot编码中存在线性关系的问题;答案:B212.在DataWorks数据同步任务(云数据库RDS数据同步至MaxCompute)中,需要根据源表中的时间戳字段实现数据的增量抽取,用户应该配置()?A、作业速率上限B、容错纪录条数C、数据过滤条件D、源表切分主键答案:C213.以下关于Python模块理解错误的有()。A、模块是包含函数和变量的Python文件B、不可以使用.操作符访问模块中的函数和变量C、可以导入模块中的所有类D、可以在一个模块中导入另一个模块答案:B214.MapReduce使用()来记录不同事件的发生次数。A、日志B、事件触发器C、状态列表D、计数器答案:D215.下面与HDFS类似的框架是()A、NTFSB、FAT32C、GFSD、EXT3答案:C216.如果我使用数据集的全部特征并且能够达到100%的准确率,但在测试集上仅能达到70%左右,这说明:()。A、欠拟合B、模型很棒C、过拟合D、以上答案都不正确答案:C217.以下for语句结构中,()不能完成1~10的累加功能()。A、Foriinrange(10,0):total+=iB、Foriinrange(1,11):total+=iC、ForIinrange(10,0,-1):total+=iD、ForIinrange(10,9,8,7,6,5,4,3,2,1):total+=i答案:A218.下面()属于SVM应用。A、文本和超文本分类B、图像分类C、新文章聚类D、以上均是答案:D219.在阿里云数据保护伞服务中,下列哪种方式不是常见的敏感数据脱敏手段?A、替换为固定值B、数据加密C、部分遮掩D、数据混淆答案:B220.设置图的标题的命令是()。A、plt.text('标题')B、plt.legend('标题')C、plt.xticks('标题')D、plt.title('标题')答案:D221.绘图是如何为项目设置matplotlib参数()。A、rc()B、sci()C、axes()D、sca()答案:A222.当任务实例处于“等待资源”状态时,最可能的原因是?A、SQL语法错误B、调度周期未到C、MaxCompute配额不足D、数据源连接失败答案:C223.()用于将非线性引入神经网络。它会将值缩小到较小的范围内。A、损失函数B、优化函数C、激活函数D、目标函数答案:C224.下列哪种去噪方法能较好的保持图像边缘()。A、中值滤波B、双边滤波C、均值滤波D、高斯滤波答案:A225.任何一个核函数都隐式地定义了一个()空间。A、希尔伯特空间B、再生希尔伯特空间C、再生核希尔伯特空间D、欧式空间答案:C226.能源大数据应用支撑平台的核心定位是?A、提供数据采集服务B、构建统一的数据资源池C、支撑能源行业数据分析与应用研发D、实现设备远程控制答案:C227.诊断性分析主要采取的分析方法是()和()。A、关联分析和因果分析法B、关联分析和分类分析法C、关联分析和运筹学D、因果分析和分类分析法答案:A228.Scipy中,线性模块是以下哪个模块()。A、fftpackB、signalC、linalgD、ndimage答案:C229.假设您已在数据集上拟合了一个复杂的回归模型。现在,您正在使用Ridge回归,并调整参数λ以减少其复杂性。选择下面的描述,哪个表达了偏差和方差与λ的关系()。A、在λ非常小的情况下,偏差低,方差低B、在λ非常小的情况下,偏差低,方差高C、在λ非常小的情况下,偏差高,方差低D、在λ非常小的情况下,偏差低,方差低答案:B230.执行一个job,如果这个job的输出路径已经存在,那么程序会()A、覆盖这个输出路径B、抛出警告,但是能够继续执行C、抛出一个异常,然后退出D、创建一个新的输出路径答案:C231.()开展多模式电力交易数据分析,提供电力交易市场化配置和风险预警数据应用服务,实现电力现货市场大规模数据灵活处理和高性能清分结算,提高交易辅助决策和资源优化配置能力。A、提高电力交易风险预警能力B、服务电力资源市场化配置C、提升电力交易保障水平D、支撑新兴市场化交易模式答案:B232.有关异常说法正确的是()。A、程序中抛出异常终止程序B、程序中抛出异常不一定终止程序C、拼写错误会导致程序终止D、缩进错误会导致程序终止答案:B233.关于降维算法中的主成分分析,()是错误的。A、有监督算法B、可以指定降维的维度C、基于方差来计算D、根据特征值大小来筛选特征答案:A234.假设在庞大的数据集上使用Logistic回归模型,可能遇到一个问题,Logistic回归需要很长时间才能训练,如果对相同的数据进行逻辑回归,如何花费更少的时间,并给出比较相似的精度()。A、降低学习率,减少迭代次数B、降低学习率,增加迭代次数C、提高学习率,增加迭代次数D、增加学习率,减少迭代次数答案:D235.有关MapReduce的输入输出,说法错误的是()A、链接多个MapReduce作业时,序列文件是首选格式B、FileInputFormat中实现的getSplits()可以把输入数据划分为分片,分片数目和大小任意定义C、想完全禁止输出,可以使用NullOutputFormatD、每个reduce需将它的输出写入自己的文件中,输出无需分片答案:B236.下列关于数据重组的说法中,错误的是()。A、数据重组是数据的重新生产和重新采集B、数据重组能够使数据焕发新的光芒C、数据重组实现的关键在于多源数据融合和数据集成D、数据重组有利于实现新颖的数据模式创新答案:A237.对MapReduce计算框架中生成的键值对的说法正确的是(__)。A、可以有相同的键,值必须唯一;B、可以有相同的值,键必须唯一;C、可以有相同的键,也可以有相同的值;D、键和值都必须唯一;答案:C238.以下关于pandas数据读写说法错误的是()。A、read_csv能够读取数据库的数据B、read_sql能够读取数据库的数据C、to_csv函数能够将结构化数据写入csv文件D、to_excel函数能够将结构化数据写入Excel文件答案:A239.Python代码中mpl.rcParams['font.sans-serif']=['SimHei']的作用是()。A、设置图表中文显示的字体B、设置图表图例的位置C、设置图表标题的颜色D、设置图表标题的位置答案:A240.大数据参考架构的水平轴和垂直轴分别为()。A、信息(活动)价值链和信息技术价值链B、信息技术价值链和信息(活动)价值链C、信息交互价值链和信息技术价值链D、信息(活动)价值链和信息交互价值链答案:A241.长短时记忆网络属于一种()。A、全连接神经网络B、门控RNNC、BP神经网络D、双向RNN答案:B242.Hadoop中combiner()函数的功能是()。A、数据排序B、数据标记C、数据分析D、数据合并答案:D243.关于Python包,以下说法正确的是()。A、利用pip包管理器更新已安装包的代码是:pipupdatB、包名C、单独导入包名即可导入包中所包含的所有子模块D、下载安装、更新、查看、移除包等行为可以在命令行中进行,但不可以在Jupyternotebook中进行E、下载安装、更新、查看、移除包等行为既可以用pip工具,也可以用conda工具答案:D244.Flume的高级组件不包含以下哪个?A、SinkProcessorB、ChannelInterceptorC、ChannelSelectorD、SourcE、Interceptor答案:B245.Adaboost的核心思想是()。A、给定一个弱学习算法和一个训练集,将该学习算法使用多次,得出预测函数序列,进行投票B、针对同一个训练集训练不同的弱分类器集合起来,构成一个强分类器C、利用多棵树对样本进行训练并预测的一种分类器D、基于前向策略的加法模型,每阶段使用一个基模型去拟合上一阶段基模型的残差答案:B246.数组允许批量计算而无须任何for循环,这种特性叫()。A、矩阵化;B、便捷化;C、批量化;D、失量化;答案:D247.知识图谱构建方法中,“自顶向下”的构建方式是指?A、先收集数据再定义模式B、先定义模式再填充数据C、从数据中自动提取模式D、仅依赖人工标注数据答案:B248.常用的数据归约方法可以分为()。A、维归约数据压缩B、维归约参数归约C、维归约值归约D、数据压缩值归约答案:C249.数据销毁需遵循的原则是?A、分级分类销毁B、无需审批流程C、部分销毁即可D、不保留销毁记录答案:A250.在阿里云DataWorks中,若要创建一个新的MaxCompute表,应通过哪个模块进行?A、数据开发B、数据集成C、数据服务D、数据治理答案:A251.在数据科学项目的活动流程中,()主要回答的是“我们用什么方式记录和展现数据结果”。A、数据的获得与管理B、模式/模型的验证和优化C、结果的可视化与文档化D、模式/模型的应用及维护答案:C252.在python中可以通过调用random库来产生随机数。a=random.randint(1,99),并赋值给变量a。A、随机产生一个1~99的小数;B、随机产生一个1~99的整数;C、产生一个值为99的整数;D、随机产生一个1~99的无理数;答案:B253.下列哪项不是大数据应用成果申报的必要材料?A、成果简介B、技术方案C、用户反馈D、法律声明答案:D254.plt.scatter()函数中的参数c表示的含义是()。A、x轴上的数值B、y轴上的数值C、散点图中的标记颜色D、标记图形内容的标签文件答案:C255.下列关于LSTM说法错误的是(__)。A、LSTM中存在sigmoid函数B、LSTM中存在tanh函数C、LSTM又称长短时记忆网络D、RNN是LSTM的变种答案:D256.以下不属于基于区域的图像分割方法的是()。A、区域生长法B、分水岭算法C、大津算法D、基于图论的分割算法答案:C257.针对一线员工的数据分析服务产品应具备哪些特点?A、易于使用B、功能复杂C、数据量大D、实时性答案:A258.当训练集特征非常多,而实例非常少的时候,可以采用()。A、核的支持向量机B、不带核的支持向量机C、高斯核的支持向量机D、多项式核的支持向量机答案:B259.当我们需要在一张图表中特意指出某个特殊点,并加上标注达到醒目的目的时,需要用到()函数。A、plt.axvspan()B、plt.axhspan()C、plt.annotate()D、plt.text()答案:C260.LORA方法主要是通过对预训练模型的哪些部分进行低秩分解来实现高效微调的?()A、输入层B、输出层C、全连接层D、所有可训练权重答案:D261.当特征值大致相等时会发生什么()A、PCA将表现出色B、PCA将表现不佳C、不知道D、以上都没有答案:B262.()是一个观测值,它与其它观测值的差别如此之大,以至于怀疑它是由不同的机制产生的。A、边界点B、质心C、离群点D、核心点答案:C263.()是利用样本的实际资料计算统计量的取值,并以引来检验事先对总体某些数量特征的假设是否可信作为决策取舍依据的一种统计分析方法A、假设检验B、逻辑分析C、方差分析D、回归分析答案:A264.输入图像为32x32,经过步长为1,不进行padding,卷积核为5x5的卷积层后,得到的特征图尺寸是多少()A、28x28B、27x27C、29x29D、32x32;答案:A265.在Apriori算法中,候选项集划分为不同的桶,存放在()中。A、字典B、集合C、Hash树D、列表答案:C266.Python运算符中用来计算集合并集的是()。A、|B、;&;C、||D、+答案:A267.量化技术(INT8/FP16)主要影响模型的哪方面?()A、模型的训练速度B、模型的参数量C、模型的数据表示精度和计算效率D、模型的训练准确率答案:C268.下面代码运行结果()。A=1Try:A+=1Except:A+=1Else:A+=1Finally:A+=1Print(a)A、2B、3C、4D、5答案:C269.以下哪项关于决策树的说法是错误的()。A、冗余属性不会对决策树的准确率造成不利的影响B、子树可能在决策树中重复多次C、决策树算法对于噪声的干扰非常敏感D、寻找最佳决策树是NP完全问题答案:C270.()不仅可用于多层前馈神经网络,还可用于其他类型的神经网络。A、感知机B、神经元C、神经系统D、误差逆传播答案:D271.Scikit-Learn中()可以实现计算模型准确率。A、accuracy_scoreB、accuracyC、f1_scoreD、f2_score答案:A272.MapReduce的Shuffle过程中哪个操作是最后做的()A、溢写B、分区C、排序D、合并答案:D273.gensim库中()是指一组电子文档的集合,这个集合是gensim的输入。A、结构B、主题C、文档流D、语料答案:D274.ADB中,对批量导入的表,哪种分区模式是可取的()?A、list+listB、list+hashC、hash+hashD、hash+list答案:D275.在Python中,导入random包后random.random()可能的运行结果为()。A、1B、4.06364700016475C、0.0965639318571762D、-0.885155622826353答案:C276.下列方法中,用于获取当前目录的是()。A、openB、writeC、GetcwdD、read答案:C277.统计描述的种类主要包括均值、百分位数、中位数、众数、全距和方差等,()是指如果将一组数据从小到大排序,并计算相应的累计百分位,则某一百分位所对应数据的值。A、均值B、百分位数C、中位数D、众数答案:B278.参观接待需求部门原则上至少提前几个工作日通知互联网部?A、1个工作日B、2个工作日C、3个工作日D、5个工作日答案:C279.Flume中一个ChannelSelector的作用是什么?A、设置多个channel发往多个sink的策略B、设置一个source发往多个channel的策略C、设置多个source发往多个channel的策略D、设置一个channel发往多个sink的策略角答案:B280.P-tuning方法与PrefixTuning方法的主要区别在于()A、P-tuninB、只优化提示,PrefixTuninC、优化前缀向量D、P-tuninE、是模型压缩方法,PrefixTuninF、是微调方法G、P-tuninH、用于图像任务,PrefixTunin答案:A281.一个分布式应用程序协调服务,分布式应用程序可以基于它实现同步服务,配置维护和命名服务等的工具是()。A、FlumeB、ZookeeperC、StormD、Sparkstreaming答案:B282.在linux下预装了Python2,Python3且默认Python版本为Python3,下列描述可以正确启动Python有()。A、在linux应用程序Terminal,打开一个终端窗口.输入whicB、PythonC、在linux应用程序Terminal,打开一个终端窗口.输入Python2或Python3D、在linux应用程序Terminal,打开一个终端窗口.输入whicE、Python3F、在linux应用程序Terminal,打开一个终端窗口.输入whicG、Python2答案:B283.以下代码的输出结果为()。ImportnumpyasnpA=np.array([[1,2],[3,4],[5,6]])Print(np.insert(a,3,[11,12]))A、[[12][34][56]]B、[1231112456]C、[[12][1111][34][56]]D、[[1112][3114][5116]]答案:B284.TF-IDF中的TF是指()。A、某个词在文档中出现的次数B、文章的总次数C、某个词在文档中出现的次数/文章的总次数D、以上答案都不正确答案:C285.以下不属于Python内置模块的是()。A、sysB、jsonC、osD、image答案:D286.如果两个变量相关,那么它们一定是线性关系吗()A、是B、不是答案:B287.Numpy中对数组进行转置的函数是哪个()。A、transpose()B、rollaxis()C、swapaxes()D、tan()答案:A288.以下四个选项中,()是Spark的核心数据结构。A、弹性分布式数据集B、列表C、元组D、字典答案:A289.()是指数据减去一个总括统计量或模型拟合值时的残余部分A、极值B、标准值C、平均值D、残值答案:D290.2003年,Tableau在斯坦福大学诞生,它起源于一种改变数据使用方式的新技术()。A、VizQL语言B、SQL语言C、XSQL语言D、NewSQL语言答案:A291.数据导入到Hive表时,是否需要指定分隔符?A、是B、否C、只需指定文件路径D、只需指定表名答案:A292.type(1e6)的结果为()。A、;<;class'int';>;B、;<;class'float';>;C、;<;class‘complex’;>;D、;<;class'bool';>;答案:B293.关于二维数据CSV存储问题,以下选项中描述错误的是()。A、CSV文件的每一行表示一个具体的一维数据B、CSV文件的每行采用逗号分隔多个元素C、CSV文件不是存储二维数据的唯一方式D、CSV文件不能包含二维数据的表头信息答案:D294.RAG技术中,检索模块的主要依据是?A、用户问题与知识库内容的相关性B、语言模型的生成能力C、答案的长度D、用户的提问语气答案:A295.数据工场DataWorks中,通过

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论