《大数据技术导论》习题及答案_第1页
《大数据技术导论》习题及答案_第2页
《大数据技术导论》习题及答案_第3页
《大数据技术导论》习题及答案_第4页
《大数据技术导论》习题及答案_第5页
已阅读5页,还剩14页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

项目11、单选题(1)以下哪个是大数据的特点()。A.数据体量巨大B.数据类型单一C.价值密度高D.数据变化慢(2)无法在一定时间范围内用常规软件工具进行捕捉、管理和处理的数据集合称为()。A.大数据B.数据库C.数据仓库D.非结构化数据(3)以下不属于非结构化数据的是()A.数字B.语音C.图像D.文本(4)以下属于结构化数据的数据是()A.PDFB.OWLC.网页D.数据库(5)数据度量单位从小到大的正确顺序是()。A.EB、GB、PB、TBB.GB、TB、PB、EBC.EB、TB、PB、GBD.TB、PB、GB、EB(6)()不是大数据价值的关键词。A.额外收入B.减少支出C.降低风险D.体量大(7)大数据产业链不包括()。A.综合应用B.基础支撑C.数据服务D.数据可视化(8)感知式系统的广泛使用,导致了大量数据产生,这一阶段的数据产生方式属于(A)式的。A.自动B.被动C.主动D.手动(9)大数据思维不包括()。A.整体思维B.相关思维C.容错思维D.形象思维(10)我们只需要知道是什么,不需要知道为什么,这种思维属于()。A.整体思维B.相关思维C.容错思维D.形象思维2、填空题(1)()思维就是根据全部样本中得到的结论。(2)大数据时代出现了与“目标驱动型决策”思维不同的另一种思维模式,即()驱动型决策。(3)在大数据时代,数据不仅是一种“资源”,而更是一种重要的()。(4)从企业角度看,价值来自三个方面:增加额外收入、减少支出和()。3、判断题(1)有价值的数据一定会带来收入。(2)如果一个客户流失预警模型,准确度为75%,说明模型很差。(3)数据思维比科学思维形成得更早。(4)容错思维让我们可以利用95%的非结构化数据,帮助我们进一步接近事实的真相。(5)一个数据产品能否帮助客户带来收入是判断数据价值的金标准。(6)判断数据价值的标准之一,一个数据产品即使没有现在的收入,那也得有未来可预期的收入。(7)收入的增加往往具有很强的不确定性,但是成本的控制相对而言却可以做到非常准确。4、简单题(1)什么是数据要素?答:“数据要素”就是决定数据是否有价值、如何定价、怎样流通的一套规则体系。(2)大数据与小数据的本质区别是什么?小数据是抽样、静态、有目的采集的数据,存在信息不对称;大数据是全样本、动态、自动产生的数据,强调数据间的相关关系而非因果关系,数据成为重要资产。项目21、单选题(1)查看主机IP的Linux命令是()。A.pwdB.jpsC.ifconfigD.ls(2)解压.tar.gz结尾的HBase压缩包使用的Linux命令是()。A.tar-zxvfB.tar-zxfvC.tar-zfxvD.tar-xzvf(3)在Linux中,如果要查看当前目录可以使用()命令。A.pwdB.ifconfigC.viD.jps(4)Linux下使用tar命令解压*.gz文件,一般需要指定参数()。A.-xzvfB.-zxfvC.-zxvfD.-vzxf(5)用户查看某一文件的权限为660,则该用户对此文件有()权限。A.可读、可写、可执行B.可读、不可写、不可执行C.不可读、可写、可执行D.可读、可写、不可执行(6)()不是Windows环境下Linux仿真工具。A.CentOSB.VMwareWorkstationC.SecureCRTD.SecureFX(7)Linux操作系统的关机指令为()。A.rebootB.shutdownC.quitD.exit(8)在CentOS7中,可以使用()命令查看隐藏目录或文件。A.ls-aB.ls-lC.ls-bD.ls-C(9)在CentOS7中,如果要查看本机的IP地址,可以使用()命令。A.ipcatB.ifconfigC.IPD.ping2、填空题(1)编辑文件hosts.txt的Linux命令为()。(2)在Linux下用vi编辑文件后保存退出的命令为()。(3)将文件hosts.txt改名为hosts.xml的Linux命令为()。(4)查看文件hosts.txt的Linux命令为()。(5)查看当前目录的Linux命令为()。(6)查看进程的Linux命令为()。(7)复制文件hosts.txt到/usr的Linux命令为()。(8)显示当前目录下信息的Linux命令为()。(9)建立test目录的Linux命令为()。(10)返回根目录的Linux命令为()。3、判断题1.CentOS是RHEL的社区免费克隆版。√原文:“CentOS(RHEL的社区复制版本,免费版本)”。2.FedoraCore的稳定性优于RHEL,因此更适合做服务器系统。×原文明确说“FedoraCore的稳定性较差,最好只用于桌面应用”,而RHEL/CentOS“稳定性非常好,适合服务器”。3.国产COSIX系统基于Linux内核开发。×原文说COSIX是“基于Unix的中文开放式操作系统”,并未采用Linux内核。4.微软黑屏事件是指盗版Windows用户桌面每小时被换成纯黑背景。√原文描述“每一小时就会出现一次纯黑背景”,俗称“黑屏事件”。5.银河麒麟在2006年发布的首个版本即采用Linux作为内核。×原文指出2006年银河麒麟“整合了mach、FreeBSD、Linux、Windows四种系统优势”,直到2009年的3.0版才“开始使用Linux作为内核”。6.统信UOS与Deepin的关系是:UOS面向商业,Deepin面向社区,二者同源。√原文:“武汉深之度继续发行Deepin社区版本,面向社区用户,而统信UOS则面向商业用户,相当于Deepin的商业版”。4、简答题1.简述RedHat系列与Debian系列在包管理上的核心差异。答:RedHat用RPM包与YUM/DNF二进制安装;Debian用DEB包与APT,可在线获取源码或二进制,依赖解析更精细,APT被YUM借鉴。2.CCDOS在国产系统史上的两大贡献是什么?答:首次让PC显示汉字并兼容MS-DOS;公开源码,为后续UCDOS等中文系统提供模板,推动个人电脑在国内普及。3.统信UOS如何解决应用生态不足?答:自建商店上架800+原生应用,Wine兼容层运行Windows软件,同时适配六大CPU架构,联合厂商做迁移适配,缩短生态差距。项目31、单选题(1)()不是VMware的网络连接模式。A.桥接模式B.NAT模式C.仅主机模式D.本机模式(2)虚拟机和真实物理机在同一网段,属于()模式。A.桥接模式B.NAT模式C.仅主机模式D.对等模式(3)()不是网络连接模式。A.桥接模式B.NAT模式C.仅主机模式D.对等模式(4)使用虚拟交换机的属于()网络连接模式。A.桥接模式B.NAT模式C.仅主机模式D.对等模式(5)桥接模式的网络配置在()位置。A.VMNet1B.VMNet2C.VMNet4D.VMNet8(6)命令systemctldisablechronyd的作用是禁止启用()。A.同步时钟B.防火墙C.网络D.路由(7)命令chkconfigntpdon的作用是启用()。A.同步时钟B.防火墙C.网络D.路由(8)命令servicenetworkrestart的作用是启用()。A.同步时钟B.防火墙C.网络D.路由(9)NTP服务是()。A.上网模式B.防火墙C.时钟同步D.免密(10)页面丢失状态码是()。A.301B.403C.404D.500(11)服务器错误状态码是()。A.301B.403C.404D.500(12)配置同步ntp-server时间的文件是()A.ntpB.ifcfg-eth0C.ntp-serverD.ntp.conf(13)配置网络的文件是()。A.networkB.ifcfg-eth0C.hostsD.ntp.conf(14)密钥存放位置()。A./usrB./root/.ssC./rootD./etc(15)生成的密钥有()种。A.1B.2C.3D.4(16)通过SSH访问客户端,默认端口为()。A.10B.11C.20D.22(17)配置Hadoop时,JAVA_HOME包含在()配置文件中。A.mapred-site.xmlB.hadoop-env.shC.core-site.xmlD.hdfs-site.xml(18)一般情况下,启动Hadoop组件的脚本存放在组件安装路径的()下。A.confB.binC.sbinD.sys(19)Hadoop是用()语言开发的。A.pythonB.javaC.CD.C#(20)分布式调度器组件名称是()。A.YARNB.ZookeeperC.HBaseD.Hive(21)数据仓库组件是()。A.YARNB.ZookeeperC.HBaseD.Hive(22)分布式的海量日志采集组件名称是()。A.YARNB.ZookeeperC.HBaseD.Flume(23)非关系型的列式数据库组件名称是()。A.YARNB.ZookeeperC.HBaseD.Hive(24)以下关于HDFS特性叙述中错误的是()。A.兼容廉价的硬件设备B.关注横向扩展。C.适应大文件访问D.适应动态数据访问。(25)以下关于HDFS特性叙述中错误的是()。A.兼容廉价的硬件设备B.关注纵向扩展。C.适应大文件访问D.适应静态数据访问。2、填空题(1)CentOS7中,在root用户下查看firewalld防火墙状态,使用的命令是systemctl()。(2)时钟同步组件相关组件()。(3)网络配置文件所在的目录是/etc/sysconfig/()。(4)在CentOS7中,root用户下查看firewalld防火墙状态,使用的命令是systemctl()firewalld。(5)HTTPS是由SSL+()构建的可进行加密传输、身份认证的网络协议,比HTTP安全。(6)免密测试命令关键词()。(7)在配置SSH密钥时,在.ssh目录下()文件为公钥,id_dsa文件为私钥。(1)搭建完Hadoop集群后,在()节点上进行格式化集群。提示:格式化集群:haddopnamenode-format(在主节点上进行)。(2)启动Hadoop集群时,在Hadoop的安装目录下使用sbin/()启动所有集群。(3)启动Hadoop集群的命令在Hadoop的安装目录下的()目录下。(4)搭建完Hadoop集群后,在主节点上使用命令haddopnamenode-()进行格式化集群。3、判断题(1)桥接模式上网需要地址转换器NAT。()(2)生产环境上网使用NAT模式。()(3)HTTPS需要到CA申请证书,一般免费证书很少,需要交费。()(4)生成私钥需要发给自己。()(5)生成公钥需要发给其他节点。()(6)SSH可在不安全的网络中为网络服务提供安全的传输环境。()4、简答题(1)Google“三驾马车”对应Hadoop生态的哪三大核心组件?答:GFS→HDFS负责分布式存储;MapReduce→HadoopMapReduce负责分布式计算;BigTable→HBase提供列式非关系数据库,三者构成Hadoop最初雏形。(2)Hadoop设计目标里为何强调“横向扩展”而非“纵向扩展”?答:横向扩展通过增加廉价商用节点即可线性提升存储与计算能力,成本低且避免单点瓶颈;纵向扩展需高价小型机,容量与性能上限固定,不符合海量GB-TB级数据低成本处理需求。(3)集群与分布式计算在同一套Hadoop平台如何互补?答:分布式把采集/存储/计算模块解耦到不同节点,提升开发效率;集群让多节点承担同一模块,实现负载均衡与容错。二者叠加既解耦又冗余,兼顾高吞吐与高可用。(4)批处理与流式计算在数据特征上有何根本差异?答:批处理面向“有界、持久、大量”静态数据集,一次装入后离线计算;流式计算面对“无界、实时”数据,每到来一条记录即刻处理并持续输出结果,强调低延迟。(5)Zookeeper的Observer角色相比Follower有何特殊之处?答:Observer同样接收客户端读请求并转发写请求给Leader,但不参与投票,不决定事务提交与Leader选举,仅用于水平扩展读性能,避免增加投票节点影响写吞吐量。项目41、单选题(1)下列关于Flume可靠性的描述,错误的是()。A.当节点出现故障时,日志能够被传送到其他节点上而不丢失B.收到数据的Agent,首先将Even写到磁盘上,当数据传送成功后,再删除;如果数据发送失败,可以重新发送C.当数据接收方崩溃时,将数据写到本地,待恢复后,继续发送D.数据发送到接收方后,还要进行确认,如果没接收成功还会再次发送(2)下列关于Flume组件中Channel的描述,错误的是()。A.Channel是连接Suorce和Sink的组件,是位于Suorce和Sink之间的数据缓冲区B.Channel数据的写入是靠Source来完成的,数据的读取是靠Sink来完成的C.Channel是非线程安全的,同一时刻只能处理一个Source的写入操作和Sink的读取操作D.当Source接收到一个Event时,Source会把这个Event存储在一个或多个Channel中(3)Hadoop生态中的Flume属于()组件。A.分布式存储B.数据仓库C.内存计算D.数据采集(4)高可用的、高可靠的、分布式的海量日志采集、聚合和传输的系统模块名称是()。A.YARNB.ZookeeperC.HBaseD.Flume130大数据运维图解教程(5)监控指定目录内数据变化的Source类型是()。A.AvroB.ThiftC.SpoolingDerictoryD.exec(6)采集UNIX的command在标准输出设备上的数据,使用的Source类型是()。A.AvroB.ThiftC.SpoolingDerictoryD.exec(7)数据采集工具不包括()。A.FlumeB.KafkaC.HBaseD.Sqoop2、填空题(1)Sink负责持久化日志或者把事件推向另一个()。(2)Flume可靠性保障最弱方案是()。3、判断题(1)一个Agent就是一个JVM。()(2)为了保证输送一定成功,在送到目的地之前,会先缓存数据到Channel,待数据真正到达目的地后,删除自己缓存的数据。()(3)拦截器的位置在Channel和Sink之间。4、简答题(1)如何区分维度与度量?答:可参与求和、平均等聚合的数值型字段为度量(如订单金额);仅用于分组或筛选的字段为维度(如地区、年龄)。同一字段可按分析需求角色互换。(2)为何说“裸数据→专家数据”是采集环节最耗时步骤?答:裸数据常含缺失、异常、多源异构;需结合业务理解做清洗、补全、归一,才能得到高质量专家数据,整个过程依赖人工规则与反复验证。(3)Sqoop底层用MapReduce而非普通JDBC批量导数据的好处?答:MR天然并行切片,容错高;可把大表按主键范围拆到多节点并发导入/导出,充分利用集群带宽,避免单机瓶颈,且失败可自动重试。(4)Kafka相比Flume在日志场景的核心优势?答:Kafka以分布式日志结构持久化多副本,支持海量Topic并行写入与回溯消费;能解耦生产速率与消费速率,实现实时流式处理,而Flume侧重单次采集转发。项目51、单选题(1)HBase来源于哪篇博文()?ATheGoogleFileSystemBMapReduceCBigTableDChubby(2)下面()不是HBase的特性?A

高可靠性B

高性能C

面向列D预先定义模式(3)以下有关NoSQL叙述中,错误的是()。A.不需要事先定义数据模式,预定义表结构。B.数据中的每条记录都可能有不同的属性和格式。C.当插入数据时,并不需要预先定义它们的模式。D.所有数据存储到网络中服务器上。(4)以下()是键值对数据库产品。A.RedisB.Neo4jC.HBaseD.MongoDb(5)以下()是列式数据库产品。A.RedisB.Neo4jC.HBaseD.MongoDb(6)以下()是图数据库产品。A.RedisB.Neo4jC.HBaseD.MongoDb(7)以下()是文档数据库产品。A.RedisB.Neo4jC.HBaseD.MongoDb(8)为了在HBase中确定一个单元格,需要()参数。A.1B.2C.3D.4(9)下列不属于HBase基本元素的一项是()。 A.表  B.记录  C.行键  D.单元格(10)HDFS的是基于流数据模式访问和处理超大文件的需求而开发的,具有高容错、高可靠性、高可扩展性、高吞吐率等特征,适合的读写任务是()。A.一次写入,少次读写B.多次写入,少次读写C.一次写入,多次读写D.多次写入,多次读写(11)不参与投票的节点是()。A.ObserverB.LeaderC.FollowerD.Looking(12)HDFS由NameNode、DataNode、secondaryNameNode组成,其中,DataNode的个数为()。A.1B.2C.3D.不限(13)HDFS由NameNode、DataNode、secondaryNameNode组成,其中,NameNode的个数为()。A.1B.2C.3D.不限(14)HDFS由NameNode、DataNode、secondaryNameNode组成,其中secondaryNameNode是NameNode的()。A.同步备份B.备份C.热备份D.冷备份(15)以下关于HDFS设计理念叙述中错误的是()。A.兼容廉价的硬件设备B.关注横向扩展。C.适应大文件访问D.适应动态数据访问。(16)以下关于HDFS设计理念叙述中错误的是()。A.兼容廉价的硬件设备B.关注纵向扩展。C.适应大文件访问D.适应静态数据访问。(17)以下关于NameNode节点叙述中错误的是()。A.存储元数据:文件、块与DataNode之间的映射;B.元数据保存在HDFS;C.NameNode由FsImage、EditLog两个文件组成。FsImage保存文件、块的目录结构、EditLog保存对文件、块的操作,如:创建、删除等;D.在NameNode统一调度下进行数据块的创建、删除和复制等操作。(18)在HDFS中,元数据保存在();A.NameNodeB.DataNodeC.从节点D.slave(19)以下关于HDFS存放数据策略的叙述中错误的是()。A.第一个副本放置在一台磁盘不太满、CPU不太忙的节点上。B.第二个副本放置在与第一个副本不同的机架的节点上。C.第三个副本与第一个副本相同机架的其他节点上。D.更多副本随机节点。2、填空题(3)Hadoop的核心模块HDFS的中文含义是()。(4)在HDFS中,文件、块与DataNode之间的映射称为()。(5)NameNode由FsImage和()两个文件组成。(6)SecondaryNameNode称为从元数据节点,是名称节点的()。(7)HDFS存放数据的基本单位是()。(8)一个数据块通常要备份()份。(9)DataNode定时向()发送状态信息(心跳,Heartbeats)。(10)NoSQL中的复制,往往是基于()的异步复制。(11)()谷歌BigTable的开源实现。(12)HBase中“四维坐标”,指[行键,列族,列限定符,()]。(13)HBase包含()个Master主服务器。(14)HBase包含()个Region服务器。(15)HBase存储的最小单位是()。3、判断题(1)Hadoop安装完成后,需要在所有结点格式化集群命令:haddopnamenode–format。(3)HDFS支持数据的随机读写。(4)写文件时,数据经过NameNode传递给DataNode。(5)HDFS的NameNode保存了一个文件包括哪些数据块,分布在哪些数据节点上,这些信息也存储在硬盘上。

(6)HDFS操作的路径可以是绝对路径,也可以是相对路径。(7)大数据时代下,数据管理需要NoSQL技术。()(8)管理的粒度比操作系统要细,基本操作是对文件名的增、删、改、查。()(9)传统关系型数据库是基于行式存储的。()(10)成功的NoSQL必然会取代传统的SQL。()4、简答题(1)HDFS把块大小设为128MB的主要动机是什么?答:远大于传统文件系统,最小化寻址开销,使传输时间远大于定位时间,提高顺序读写吞吐量,适合大文件顺序批处理。(2)SecondaryNameNode的“冷备份”能否直接顶替故障NameNode?答:不能。它仅定期合并fsimage与edits减小日志体积,不接收实时写;需人工把合并后的fsimage拷回NameNode才能恢复,无法秒级切换。(3)HBase的四维坐标指哪四个元素?答:[行键,列族,列限定符,时间戳],唯一定义一个单元格,支持多版本存储与快速列式检索。(4)NoSQL的“无共享架构”相比传统集中式数据库有何优势?答:数据分散在本地节点,无需共享存储,避免单点瓶颈;可在线弹性扩容缩容,故障影响范围小,并行度高,适应海量高并发场景。(5)列式存储为何比行式更适合OLAP分析?答:同一列数据连续存放,压缩比高;仅读取查询涉及列,减少I/O;便于向量化计算与聚合,提高批量分析性能,而行存需整行读取开销大。项目61、单选题(1)下面关于MapReduce的描述,正确的是()。A.MapReduce程序必须包含Mapper和ReducerB.MapReduce程序的MapTask可以任意指定C.MapReduce程序的ReduceTask可以任意指定D.MapReduce程序的默认数据读取组件是TextInputFormat(2)在MapReduce中,()组件是用户不指定也不会有默认的。A.CombinerB.TextOutputFormatC.PartitionerD.InputFormat(3)下列关于MapReduce工作流程的描述,正确的是()。A.所有的数据交换都是通过MapReduce框架自身去实现的B.不同的Map任务之间会进行通信C.不同的Reduce任务之间可以发生信息交换D.用户可以显式地从一台机器向另一台机器发送消息(4)()不是MapReduce体系结构的主要部分。A.ClientB.JobTrackerC.TaskTracker以及TaskD.Job(5)下列关于MapReduce体系结构的描述,错误的是()。A.用户可通过Client提供的一些接口查看作业运行状态B.用户编写的MapReduce程序通过Client提交到JobTracker端C.JobTracker负责资源监控和作业调度D.JobTracker会跟踪任务的执行进度、资源使用量等信息,并将这些信息告诉任务调度器(TaskScheduler)(6)下列关于MapReduce体系结构的描述,错误的是()。A.Task分为MapTask和ReduceTask两种,分别由JobTracker和TaskTracker启动B.slot分为Mapslot和Reduceslot两种,分别供MapTask和ReduceTask使用C.TaskTracker使用slot等量划分本节点上的资源量(CPU、内存等)D.TaskTracker会周期性接收JobTracker发送过来的命令并执行相应的操作(如启动新任务、杀死任务等)(7)下列说法有误的是()。A.MapReduce是Google三驾马车之一B.MapReduce具有非共享式、容错性好特点C.MapReduce适用批处理、实时处理D.MapReduce采用“分而治之”策略(8)一个作业的Map个数是由()确定的。A.属性mapred.map.tasks的设定B.JobTracker计算得出C.Inputsplit分片个数D.partition提示:一般情况下,在输入源是文件的时候,一个task的Map数量由splitSize来决定一个task的Reduce数量由partition来决定。(9)在MapReduce体系结构中,JobTracker的主要任务是()。A.负责资源监控和作业调度,监控所有TaskTracker与Job的健康状况B.使用slot等量划分本节点上的资源量(CPU、内存等)C.会周期性地通过“心跳”将本节点上资源的使用情况和任务的运行进度汇报给TaskTrackerD.会跟踪任务的执行进度、资源使用量等信息,并将这些信息告诉TaskScheduler(10)MapReduce全过程会产生()组键-值对。A.1B.2C.3D.4(11)MapReduce的Map函数产生很多的()。A.keyB.valueC.<key,value>D.Hash(12)在MapReduce计算架构中,()组件运行在NameNode节点上,提供集群资源的分配和工作调度管理。A.ClientB.JobTrackerC.TaskTrackerD.Task(13)在MapReduce计算架构中,()组件运行在DataNode上,具体管理本节点计算任务的执行。A.ClientB.JobTrackerC.TaskTrackerD.Task(14)下列关于JobTracker叙述不正确的一项为()。A.MapReduce框架的使用者B.协调MapReduce作业C.分配任务D.监控任务(15)下列关于Map/Reduce计算流程叙述不正确的一项为()。A.Mapper读取分派给它的输出split,并生成相应的本地缓存B.Mapper执行计算处理任务,将中间结果输出保存到本地缓存C.ApplicationMaster调度Reducer读取Mapper的中间输出文件,执行Reduce任务D.Reducer将最后结果写入输出文件,保存到HDFS(16)MapReduce流程有()个阶段。A.3B.2C.4D.5(17)在MapReduce中,()阶段,Mapper执行TaskMap,将输出结果写入中间文件。A.ShuffleB.MapC.ReduceD.Sort(18)MapReduce的Shuffle过程中,()操作是最后做的。A.溢写B.分区C.排序D.合并提示:在MapReduce的Shuffle阶段,溢写阶段分为两类:①环形缓冲区的数据到达80%时,会溢写到本地磁盘,当再次达到80%时,会再次溢写到磁盘,直到最后一次,不管环形缓冲区还有多少数据,都会溢写到磁盘。然后会对这多次溢写到磁盘的多个小文件进行合并,从而减少Reduce阶段的网络传输。②如果没有达到80%,Map阶段就结束了,则直接把环形缓冲区的数据写到磁盘上,供下一步合并使用。(19)MapReduce编程模型中,以下组件()是最后执行的。A.MapperB.PartitionerC.ReducerD.shufle2、填空题(1)一个输入split就是一个由单个()来处理的输入块。(2)每一个Map只处理一个()。(3)每个Job申请资源以()为单位。(4)当某个Job要开始执行时,先向()申请slot。102大数据运维图解教程。(5)Hadoop的资源单位为()。(6)Hadoop利用()来管理分配节点的资源。(7)Hadoop里有两种slot,即mapslot和()。(8)每个tasktracker会包含()个slot。(9)Job的一个task均对应于tasktracker中的一个()。(10)每个任务向()申请资源。(11)MapReduce采用“()”的策略。(12)Map的输入数据来自()。(13)Combiner没有默认的实现,需要显式地设置在()中才有作用。(14)分片大小范围可以在()中设置。3、判断题(1)split存储的是数据本身。()(2)InputFormat负责创建InputSplit并将它们分割成记录(键-值对)。()(3)输入分片split其实是对数据的引用。()(4)Map任务之间会进行通信。()(5)Reduce任务之间会进行通信。()(6)MapTask与Mapslot一一对应。()(7)区分Mapslot和Reduceslot,容易导致某一种资源紧张,而另一个资源却有空闲。()(8)Shuffle数据来自HDFS。()(9)Map的输出数据就是Reduce的输入数据。()(10)每个TaskTracker节点必须包含Map过程。()(11)每个TaskTracker节点必须包含Reduce过程。()(12)每个TaskTracker节点的Map过程数大于Reduce过程数。()(13)Combiner的输出是Map的Merge操作过程。()(14)所有的Job都适用Combiner。()(15)一般来说,Combiner和Reducer进行同样的操作。()(16)*MapReduce的inputsplit一定是一个block。()(17)Hadoop是Java开发的,所以MapReduce只支持Java语言编写。()(18)每个Map槽就是一个线程。()(19)Mapreduce的inputsplit就是一个block。()4、简答题(1)什么是数据治理答:数据治理是一项全面的数据资产管理行为。(2)数据治理的主要目的答:数据治理的核心目的是提升数据价值,支持决策,制定同时降低数据风险和成本。

项目71、单选题(1)观察离散数据分布的常用方法是()。A.直方图B.饼图C.密度图D.箱线图(2)交叉分析是基于()横向地组合交叉。A.同一维度B.不同维度C.同一方向D.以上都不是(3)()不是常用对比分析方法。A.定基比B.同比C.环比D.纵横比(4)()是指对数据在不同维度进行交叉展现,进行多角度结合分析的方法,弥补了“各自为政”分析方法所带来的偏差。A.相关分析B.交叉分析C.主成分分析D.因子分子(5)()不属于监督学习的数据模型。A.分类B.回归分析C.聚类D.KNN(6)()不属于无监督学习的数据模型。A.关联分析B.回归分析C.聚类D.K-均值(7)Spark生态圈不包含()。A.SparkCoreB.HBaseC.MLLibD.GraphX(8)Spark生态圈的核心是()。A.SparkCoreB.SparkStreaminC.MLLibD.GraphX(9)Spark生态圈中的MLLib功能是()。A.批量计算B.图计算C.流式计算D.机器学习(10)以下有关Hive叙述中,错误的是()。A.Hive是建立在Hadoop上的数据仓库基础构架。B.Hive提供了一系列的工具,可以用来进行数据进行ETL。C.Hive定义了简单的类SQL查询语言,称为HQL。D.Hive不直接使用存储在Hadoop文件系统中的数据。2、判断题(1)细分的方法更多的是基于同一维度的纵深展开,也就是OLAP中的钻取,比如从省份的数据细分查看省份中各城市的数据,是基于地域维的下钻。()(2)交叉分析涉及多维度的组合,通常以图表为主进行展现。()(3)一般来说,环比可以与环比相比较,也可以与同比相比较。()(4)对比分析最关键的是A/B两组只保持单一变量,其他条件保持一致。()(5)同比就是今年第n月与第n-1月或第n+1月比。()(6)环比就是今年第n月与去年第n月比。()(7)交叉分析基于多维模型,数据的维度越丰富,所能实现的交叉也越丰富和灵活,通过各种交叉分析能够更加有效地发现问题,因此,对基层模型也没有要求。()(8)对比分析中,对比的参照物不同,得到的判断结论也就不同。()(9)数据细分时,可以按维度细分,有多少维度,就可以有多少种细分的方向,细分一步即可。()(10)考查两个变量是否具有线性相关关系的最直观的方法是直接绘制散点图。()(11)需要同时考查多个变量间的相关关系时,可利用散点图矩阵同时绘制各变量间的散点图。()(12)细分策略中,分渠道用来分析不同时间段数据是否有变化。()(13)交叉分析不再局限于一个维度,就像数据立方体与OLAP中的立方体,是基于不同维度的交叉,时间维、地域维和产品维交叉在一起分析每个小立方的数据表现,可以通过OLAP的切片(Slice)和切块(Dice)操作查看。()(14)为了更加准确地描述变量之间的线性相关程度,可以通过计算相关系数来进行相关分析。()(15)交叉分析是基于不同维度横向地组合交叉。()3、填空题(1)Spark使用()语言编程。(2)Spark把中间数据放到()中,迭代运算效率高。(3)Hive提供了类似于关系数据库SQL语言的查询语言()。(4)Hive大部分的查询、计算由()完成。(5)Hive驱动模块(Driver)含编译器、()、执行器等。(6)Spark灵魂是()。(7)在Spark中,Stage划分的标准是()依赖。(8)Spark操作构建了RDD之间的关系,整个计算过程形成了一个由RDD和关系构成的()。(9)RDD的操作分为Transformation操作和()操作。4、简答题(1)大数据分析与狭义数据分析在策略上的三点转变是什么?答:①用全体数据而非抽样;②重效率而非绝对精度;③关注相关性而非因果性。(2)何为“业务理解”中因变量Y与自变量X?答:Y是待解决的业务结果(如流失与否),X是可能影响Y的特征集合(如性别、消费),清晰定义Y、X才算把业务问题转译为数据可分析问题。(3)描述性分析常用的五类统计描述是什么?答:频数分布、集中趋势(均值等)、离散程度(方差等)、分布形态(偏度峰度)、统计图形,用于快速刻画数据基本特征与异常。(4)RDD的三大特性是什么?答:一组分片、一个计算函数、依赖关系;分片决定并行度,函数描述计算逻辑,依赖形成lineage用于容错与调度。(5)Hive将HQL转为MapReduce作业时需经过哪三大模块?答:用户接口接收HQL→驱动模块(编译器、优化器、执行器)生成并优化MR计划→元数据存储提供表结构信息,最终提交集群运行。项目81、单选题1.情感分析在零售中的核心价值是_____________。A.降低物流成本B.发现客户真实态度并指导战略C.提高库存周转D.减少人力开支【答案】B2.农夫山泉要求业务员每日拍摄门店照片的主要目的是_____________。A.考核考勤B.监测陈列与销量关系C.培训摄影D.收集竞品价格【答案】B3.交通信号配时中“绿波速度”主要解决_________。A.路口事故B.连续路口停车等待C.尾气排放D.行人过街【答案】B4.高德地图实时路况图最关键的数据来源是_____________。A.交警摄像头B.用户回传GPS轨迹C.气象站D.公交IC卡【答案】B5.智能停车系统通过________技术感知车位状态?A.RFIDB.地磁/超声波传感器C.红外遥控D.卫星遥感【答案】B6.谷歌预测流感疫情的核心数据是_____________。A.医院挂号量B.用户搜索关键词C.药品销量D.微博文本【答案】B7.12306提供密切接触者信息主要依赖:A.实名制票务大数据B.手机信令C.车载GPSD.社区登记【答案】A8.基因测序实现精准治癌的前提是_____________。A.建立大规模基因-疾病数据库B.提高测序仪转速C.降低血液采样量D.增加医院数量【答案】A9.农业大数据中用于指导灌溉的核心传感器数据是_____________。A.风速B.土壤湿度C.光照强度D.空气温度【答案】B10.智慧大棚中无土栽培营养液监测最重要的指标是_____________。A.酸碱度与电导率B.颜色C.气味D.浊度【答案】A11.水产养殖IoT最优先采集的水质参数是_____________。A.溶解氧B.盐度C.氨氮浓度D.水位【答案】A12.精准扶贫中,大数据画像最核心的输出是_____________。A.贫困户致贫原因与帮扶措施建议B.贫困村GDPC.财政拨款总额D.农产品价格【答案】A13.税收大数据发现主播薇娅偷逃税的主要方法是_____________。A.票据OCRB.多源数据比对与模型预警C.问卷调查D.随机抽查【答案】B14.安全生产大数据模型的首要作用是_____________。A.事故后追责B.事前隐患预警C.设备维修D.工资核算【答案】B15.公安大数据将治理流程由“事后”转向________。A.事中应急B.事前预测C.随机抽查D.人工审批【答案】B16.舆情监测中“用数据说话”最强调________。A.可视化呈现事件全貌B.删除负面帖C.关闭评论D.增加水军【答案】A2、填空题(1)公安大数据将公共安全决策由“事后”转向________。【答案】事前预测(2)农夫山泉让业务员每日拍照回传,用________数据研究陈列对销量的影响。【答案】图片(3)交通“绿波速度”建议司机按________行驶,以减少红灯停车。【答案】提示车速(4)高德实时路况按________原理聚合用户轨迹计算路段速度。【答案】大数据(5)谷歌利用________记录预测流感疫情爆发区域。【答案】搜索关键词(6)12306凭________数据快速定位确诊旅客同车厢密切接触者。【案】实名票务(7)农业传感器监测________值实现自动灌溉与施肥。【答案】土壤湿度(8)教育大数据把“集体教育”推向________学习新模式。【答案】个性化(9)税收大数据通过________比对锁定主播偷逃税风险。【答案】多源数据3、判断题(1)沃尔玛购物篮分析发现婴儿护肤礼品主要是“新手妈妈”购买。×理由:原文明确70%为“商务卡客户”买来送人,而非妈妈自用。(2)情感分析可帮助零售商在战略层面洞察客户真实态度。√(3)“绿波速度”旨在减少路口停车次数,提高通行效率。√(4)高德实时路况图主要依赖交警摄像头而非用户回传数据。×理由:原文强调利用用户回传GPS轨迹大数据计算路段速度。(5)12306提供密切接触者信息的核心依据是实名制票务数据。√(6)农业中土壤湿度传感器数据是精准灌溉决策的关键。√(7)智慧大棚无土栽培营养液监测最重要的是颜

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论