大数据与人工智能-fy_第1页
大数据与人工智能-fy_第2页
大数据与人工智能-fy_第3页
大数据与人工智能-fy_第4页
大数据与人工智能-fy_第5页
已阅读5页,还剩19页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

大数据与人工智能-fylHadoop目前最新的版本是[单选题]TOC\o"1-5"\h\z1.02.03.0(正确答案)4.02以下哪个系统可以为计算机CPU分配资源[单选题]分布式文件存储系统(HDFS)分布式计算框架(MapReduce)分布式资源调度系统(Yarn)(正确答案)数据处理方法(DPW)以下哪个组成不属于Yarn[单选题]ResourceManagerNodeManagerApplicationManagerSpark(正确答案)Hive针对内部表和外部表的区别是[单选题]创建内部表的同时,会将数据挪到数据仓库指定的位置(正确答案)删除内部表时只删除源数据创建内部表时,只记录数据指定的路径删除外部表时删除表中数据和源数据以下属于引入ZooKeeper的理由是[单选题]分布式系统需要统一管理(正确答案)MapReduce代码开发效率低下使用SQL进行数据分析效率更高大数据50%为报表类业务,需要仓库类大数据工具下列关于ZooKeeper集群原理的介绍,不正确的是[单选题]由多个ZooKeeperSEVER组成的集群环境包含一个Leader和多个Follower每个sever保存一个数据副本、全局数据一致不采用分布式读写机制(正确答案)以下关于Hbase的说法正确的是[单选题]Hbase是分布式场景中可以实时读写数据的分布式数据库(正确答案)包含一个Leader和多个Follower创建内部表时,只记录数据指定的路径比较适合存储视频文件关于Redis说法不正确的是[单选题]Redis没有字段的概念,所以在数据查询上功能比较弱,支持的特性比较简单。这点是不如MongoDB的Redis单个value的最大容量可达1GB,不支持单个Value比较大的情况内存依赖比较高。由于Redis本质上是一个内存数据库,所以内存硬件的容量大小直接决定了Redis可用的数据库空间比较适合存储视频文件(正确答案)关于Redis说法不正确的是[单选题]使用C语言编写(正确答案)比较适用于计数场景所有数据都在内存中,高速读写支持存储的value类型相对更多,包括string(字符串)、list(链表)、set(集合)、zset(sortedset--有序集合)和hash(哈希类型)答案解析:使用开源C语言编写以下哪个不属于Redis三大架构[单选题]主从复制架构Sentinel架构集群架构实时数据计算架构(正确答案)关于HDFS的说法不正确的是[单选题]是JAVA实现的、分布式的、可横向扩展的文件系统支持数据切块,目的是提升文件的读取效率数据切块后默认大小为256M(正确答案)有副本机制答案解析:为128MYarn是从Hadoop的哪个版本出现的[单选题]TOC\o"1-5"\h\z1.02.0(正确答案)3.04.0下列哪项不属于引入Hive的原因[单选题]MapReduce代码开发效率低下使用SQL进行数据分析效率更高大数据50%为报表类业务,需要仓库类大数据工具Hive更简单(正确答案)关于Hive和RDBMS说法不正确的是[单选题]Hive使用HQL查询语言Hive使用HDFS进行数据存储RDBS数据规模较大(正确答案)Hive硬件配置要求一般,RDBMS要求较高答案解析:规模较小关于ZooKeeper的说法不正确是[单选题]A•采用层次化的数据结构B•采用类似于LINUX命令进行数据访问具备临时节点和永久节点永久节点会随客户端会话的结束而结束其生命周期(正确答案)答案解析:临时节点关于Hbase说法不正确的是[单选题]Table中包含多个regionregion会随着数据的增大而分裂region分裂时,数据不能访问行的一次读写不是原子操作(正确答案)答案解析:是原子操作以下哪种大数据计算模型的核心是大事化小,最后再合并结果[单选题]TezMapRuduce(正确答案)SparkKafka从经济和商业等多个维度阐述大数据发展潜力的研究成果,对大数据的概念进行了描述,列举了大数据相关的核心技术,分析了大数据在各行业的应用,真正让大数据成为互联网信息时代科技热词的文献是[单选题]阿尔文•托夫勒的《第三次浪潮》《Nature》杂志的《BigData》专栏C•麦肯锡研究院的《大数据,下一个时代,竞争和生产力前沿》报告(正确答案)D.Google2003年发布的《FileSystem》论文以下不属于大数据的4个特征之一的是[单选题]数据多样化处理速度快(正确答案)处理能力强价值密度低答案解析:应该大量化大数据在高频交易、社交情绪分析、信贷风险分析三大领域发挥重大作用。[单选题]金融行业(正确答案)互联网行业电信行业安全领域对用户的个性化推荐属于大数据应用中的哪个领域?[单选题]A•数据管理B•数据分析数据挖掘(正确答案)数据可视化以下哪个不是大数据和普通数据库的区别[单选题]技术工具不同,大数据使用Hadoop生态体系技术B•管理的数据量不同,大数据通常管理TB、PB级数据C•管理的服务器的数量不同,大数据通常为100+台以上的服务器D•对系统的性能要求不同,大数据要求实时流计算技术的高性能系统(正确答案)答案解析:对人员对技能要求不同,要求java、Scala、python等语言,熟悉Linux系统、Hadoop等大数据组件从大数据体系的构建角度来讲需要同时进行3方面的建设,但是一般建设的先后顺序为[单选题]数据资源管理->大数据治理->数据服务数据资源管理->数据服务->大数据治理C•大数据治理->数据服务->数据资源管理D•大数据治理->数据资源管理->数据服务(正确答案)关于分布式列存储数据库HBase,以下说法不正确的是:[单选题]HBase是针对结构化数据的,可伸缩高可靠高性能分布式和面向列的静态模式数据库。(正确答案)HBase和传统的关系型数据库不同,采用的是Bigtable的数据模型,增强了稀疏排序映射表其中“键”由行关键字、列关键字和时间戳构成,提供了对大规模实时数据的读写访问Hbase中保存的数据可以使用MapRuduce来处理,将数据存储和并行计算完美的结合在一起答案解析:是动态模式数据库关于Hive,以下说法不正确的是:[单选题]Hive是基于Hadoop的一个数据仓库,由Facebook开源,最初是用于解决海量结构化的日志数据统计问题。Hive定义了一种类似SQL的查询语言HQ,将SQL转化为MapRuduce任务,在Hadoop上执行目前Hive支持MapRuduce、Tez的计算模型。Hive的表更新采用的是插入的方式(正确答案)答案解析:采用的是覆盖的方式以下哪个是支持Dag(有向无环图)作业的计算框架:[单选题]Tez(正确答案)flumeMapRuduceKafka关于大数据和云计算,以下说法不正确的是?[单选题]云计算是大数据的基石大数据技术可以部署在云的环境中大数据技术作为IAAS层的计算服务对外输出(正确答案)云计算侧重于硬件资源的虚拟化答案解析:大数据技术作为PAAS层的计算服务对外输出关于容器,以下说法不正确的是?[单选题]其英文名称为Linuxcontainers,直译为集装箱容器技术解决了PAAS层的技术实现问题每个虚拟机都需要运行一个完成的操作系统,以及其中的应用程序(正确答案)D•容器虚拟化是一种内核轻量级的资源共享方式容器技术的应用场景中,不正确的是?[单选题]容器可提高现有应用的安全性和可移植性,但使用成本较高(正确答案)持续集成和持续部署(CI/CD)通过容器技术加速应用管道自动化和应用部署微服务构建基础组件,加速架构现代化的进程IT基础设施优化答案解析:成本较低关于docker以下说法不正确的是?[单选题]docker是一个开源的应用容器引擎B•开发者可以打包他们的应用以及依赖包到一个可移植的容器中只能发布在特定的Linux机器上,可以实现虚拟化(正确答案)主要应用于企业的PAAS平台答案解析:任何流星的Linux系统均可关于kubernetes以下说法不正确的是?[单选题]A•用于管理云平台中多个主机上的容器化的应用目标是让部署容器化的应用简单并且高效C•提供了应用部署、规划、更新、维护的一种机制应用的生存周期都与当前系统绑定(正确答案)答案解析:是传统的应用部署方式基于容器技术的部署大数据环境[单选题]A•把容器当做一个虚拟机,部署主要在容器中进行在容器中安装各种组件、组网进行配置把容器打包成一种镜像,创建多个实例进行组网D•使用基于容器搭建的大数据平台和使用物理机的方法不同(正确答案)答案解析:使用方法一致Spark最核心的东西是什么?[单选题]RDD(正确答案)SDDROMRAMRDD是什么?[单选题]数组链表数据集合(正确答案)键值对Spark任务调度过程是什么?[单选题]RDDObject->ADGScheduler->TaskScheduler->Worker(正确答案)ADGScheduler->RDDObject->TaskScheduler->WorkerRDDObject->TaskScheduler->ADGScheduler->WorkerWorker->ADGScheduler->TaskScheduler->RDDObjectSpark使用什么语言编写的?[单选题]JavaScala(正确答案)PythonC语言^ArtificialIntelligence^这一术语在哪一年被提出?[单选题]1953195419551956(正确答案)下列哪一项不是深度学习开发框架?[单选题]Mahout(正确答案)TensorflowCaffePytorch机器学习不涉及下列哪门学科?[单选题]概率论统计学数值计算(正确答案)凸分析RDD支持元素根据()来分区,保存到多个节点上。[单选题]SlotKey(正确答案)ValueField下列哪个算子不会产生窄依赖[单选题]sortByKey(正确答案)mapfilterunion大数据不需要掌握的技术是[单选题]Java(正确答案)HadoopsparkMPP数据库下列不是深度学习主要应用的领域是[单选题]图像处理计算机视觉自然语言处理人脸支付(正确答案)Spark最重要的抽象是[单选题]RDD(正确答案)SDDROMRAMRDD是Spark的最基本抽象,是对分布式()的抽象使用[单选题]队列内存(正确答案)C•数据事务对于并发性而言,尤其是处理海量数据的情况,哪种语言处理高并发多线程问题时拥有巨大优势。[单选题]JavaC++Scala(正确答案)TOC\o"1-5"\h\zGoSpark应用可以用什么语言开发?[单选题]JavaC++GoScala(正确答案)提出人工智能术语的专家是[单选题]JohnMcCarthy(正确答案)M.MinskyN.WienerS.Papert哪项不属于人工智能产业包含的内容[单选题]软件制造B硬件制造培训机器人制造(正确答案)hadoop框架的最核心设计包含哪些组成部分分布式文件存储系统(HDFS)(正确答案)分布式计算框架(MapReduce)(正确答案)分布式资源调度系统(Yarn)(正确答案)数据处理方法(DPW)hadoopMapReduce包含Map(正确答案)Shuffle(正确答案)Reduce(正确答案)BigTableYarn的优点有大大减少Hadoop集群中的资源消耗(正确答案)分布式监控每一个子任务的程序(正确答案)用户可编写模型Yarn架构的基本组成为ResourceManager(正确答案)NodeManager(正确答案)ApplicationManagerContainer(正确答案)答案解析:ApplicationMasterHadoop常用组件有Hive(正确答案)Zookeeper(正确答案)Hbase(正确答案)MongoDB(正确答案)Redis、Kafka(正确答案)Hive的接口包括用户接口(正确答案)命令行接口(正确答案)JDBCnoSQL关于ZooKeeper的说法描述正确的是A•是一个分布式应用程序协调服务(正确答案)Google的Chubby—个开源实现(正确答案)是Hadoop的重要组件(正确答案)D•提供的服务包括配置维护、域名服务、分布式同步、组服务(正确答案)ZooKeeper提供的服务包括配置维护(正确答案)域名服务(正确答案)分布式同步(正确答案)组服务(正确答案)以下属于ZooKeeper集群角色的是Observer(正确答案)Leader(正确答案)Follower(正确答案)ContainerHBase的特点线性拓展(正确答案)数据存在在HDFS上,备份机制健全(正确答案)大数据的负面影响有:大量手机用户信息,用户无隐私(正确答案)因客定价,商家可动态调整商品价格,最大化榨取用户价值(正确答案)c.出行购物更方便智能推荐头条信息大数据作为一类新技术,涉及到以下哪些方面数据采集(正确答案)数据存取(正确答案)统计分析(正确答案)数据挖掘(正确答案)模型预测(正确答案)采用大数据技术的好处在于增强企业竞争力(正确答案)通过数据指导经营策略(正确答案)C•通过数据仓库使数据资产变现(正确答案)商家借助大数据营销客户(正确答案)大数据对银行业的价值市场渠道分析,运营和产品优化(正确答案)B完成客户画像,提高客户体验(正确答案)精准营销,盈利能力提升(正确答案)风险管控提升,实时欺诈交易分析(正确答案)目前企业数据分析处理面临的问题有缺少数据全方位分析方法(正确答案)ERP软件没有普及使用海量数据处理效率低(正确答案)实时数据分析能力差(正确答案)答案解析:ERP软件处理能力差业务用户对于大数据等运算速度要求越来越高,实时流计算技术逐渐提高,主要包括Kafka(正确答案)Spark(正确答案)Flink(正确答案)Tez以下关于Hadoop技术生态体系中基础组件的说法正确的有:HDFS是Hadoop技术体系中数据管理的基础,是一个高容错的系统,能检测和应对硬件故障(正确答案)Sqoop数据同步工具,它是SQLTOHadoop的缩写,主要用于关系型数据库和Hadoop之间的数据传输(正确答案)Sqoop数据导入和导出本质上还是一个MapRuduce程序,充分利用了MapRuduce的并行化和容错性。(正确答案)Kafka主要用于处理活跃的流式数据,在web网站上非常常见,包括网站的pageview(正确答案)以下关于MapRuduce说法正确的有:MapRuduce分布式计算模型,用于处理大数据量的计算,包含map和reduce两个阶段(正确答案)Map阶段对数据集上的独立元素进行指定操作,生成键值对形式的中间结果(正确答案)reduce阶段对中间结果中的键和所有的值进行规约,以得到最终的结果(正确答案)Map和Ruduce两个操作还有进一步的细分,分解后的原操作可以进一步进行灵活的组合。答案解析:D描述的是Tez计算模型以下关于大数据资源调度器,说法正确的有:常用的大数据资源调度器有Yarn和Mesos,Yarn用的比较多一些。(正确答案)基于数据密集型应用的计算框架不断出现,互联网公司中,同时并存了多种计算框架。(正确答案)资源调度帮助互联网公司从数据结构上分析应该使用的计算框架。资源调度帮助在同一个公共集群中的所有的框架共享集群中的资源。(正确答案)以下关于flume日志收集工具,说法正确的有:flume是cloud开源的日志收集系统,具有分布式、高可靠、高容错、易于定制和扩展的特点(正确答案)flume将数据从产生、传输、处理,并写入目标路径的过程抽象为数据流(正确答案)C•在具体的数据流中,数据源在支持flume中定制数据发送方,从而支持收集各种不同的协议数据(正确答案)D.为了保证配置数据的一致性,Flume引入了ZooKeeper,用于保存配置数据。(正确答案)Spark组件包括什么?SparkSQL(正确答案)SparkStreaming(正确答案)SparkMLlib(正确答案)Graphx(正确答案)人工智能第三次浪潮的标志是A•海量的数据(正确答案)不断提升的算法能力(正确答案)计算机运算能力(正确答案)高复杂度的算法Spark可以使用的数据源包括?数据库数据(正确答案)文件数据(正确答案)hadoop数据(正确答案)Hbase数据Spark算子有哪些?输入算子(正确答案)转换算子(正确答案)输出算子缓存算子(正确答案)Spark主要应用场景有哪些?离线分析场景(正确答案)机器学习场景(正确答案)流处理场景(正确答案)图像识别场景人工智能第二次浪潮出现了哪些应用?语音识别(正确答案)语音翻译(正确答案)目标识别(正确答案)图像诊断(正确答案)机器学习设计以下哪些学科?概率论(正确答案)统计学(正确答案)逼近论(正确答案)凸分析(正确答案)以下属于语义识别的应用是?智能客服(正确答案)舆情分析(正确答案)文献筛选(正确答案)计算机写诗(正确答案)计算机春联、客户投诉意见分析(正确答案)Kafka具有以下哪些特性?通过自有的数据结构,提供消息的持久化(正确答案)高吞吐量(正确答案)通过Kafka服务器和消费集群来区分消息(正确答案)支持并行数据加载(正确答案)典型的Kafka架构具有哪些角色?leader(正确答案)follower(

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

最新文档

评论

0/150

提交评论