《Hadoop技术与应用》习题答案 魏迎_第1页
《Hadoop技术与应用》习题答案 魏迎_第2页
《Hadoop技术与应用》习题答案 魏迎_第3页
《Hadoop技术与应用》习题答案 魏迎_第4页
《Hadoop技术与应用》习题答案 魏迎_第5页
已阅读5页,还剩8页未读 继续免费阅读

付费下载

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

参考答案

项目1大数据平台部署前的环境准备

自我测试

一、选择题

1、A2、ABCD3、AD4、C5、D6、A

课后习题

一、填空题

1、存储计算HDFSMapReduce

2,GFSMapReduceBigTable

3、Notch

4、HDFSMapreduce

5、YARN

6、240

二、简答题

1、答:

大数据•(BigData),指无法在一定时间范围内使用常规软件工具进行捕捉、管理和处理

的数据集合,是需要新处理模式才能具有更强的决策力、河察发现力和流程优化能力的海量、

高增长率和多样化的信息费产。

2、答:

大数据具有“5V”特征,即Volume(大量)、Velocily(高速)、Variety(多样)、Veracily(真实

性)和Value(价值),其核心在于对这些含有意义的数据进行专业化处理。

拓展练习

1、答:

大数据侧重于海量数据的存储、处理与分析,从海量数据中发现价值,服务于生产和

生活;云计算本质上旨在整合和优化各种IT资源,并通过网络以服务的方式廉价提供给用

户;物联网的发展目标是实现物物相连,应用创新是物联网发展的核心。

2、答:

从整体上看,大数据、云计算和物联网这三者是相辅相成的。大数据根植于云计算,大

数据分析的很多技术都来自于云计算,云计算的分布式和数据存储和管理系统(包括分布式

文件系统和分布式数据库系统)提供了海量数据的存储和管理能力,分布式并行处理框架

M叩Reduce提供了海晟数据分析能力,没有这些云计算技术作为支撑,大数据分析就无从谈

起。反之,大数据为云计算提供了“用武之地”,没有大数据这个“练兵场”,云计算技术再先

进,也不能发挥它的应用价值。

物联网的传感器源源不断产生的大量数据,构成了大数据的重要来源,没有物联网的飞

速发展,就不会带来数据产生方式的变革,即由人工产生阶段向自动产生阶段,大数据时代

也不会这么快就到来。同时,物联网需要借助于云计算和大数据技术、实现物联网大数据的

存储、分析和处理。

云计算、大数据和物联网,三者会继续相互促进、相互影响,更好地服务于社会生产和

生活的各个领域。

项目2部署Hadoop集群

自我测试

一、选择题

1、C2、B3、C4、A5、C6、D

课后习题

一、填空题

1、core-site.xml

2、SecondaryNameNode

3、ResourceManagcrNodcManager

二、简答题

1、答:

(1)hostnamectlset-hostnamepseudo-distributed

(2)sshpseudo-distributed

(3)jps

(4)netstat-an|grep22

拓展练习

答:

①措施1:全部关闭集群,重新启动。

在任意节点执行stop-dfs.sh

在yarn的主节点执行stop-yarn.sh

重新启动:

在任意节点执行start-dfs.sh

在yarn的主节点执行start-yam.sh

②措施2:单独启动某些进程

单独启动hdfs的相关进程:采用hadoop-daenion.shstarthdfs进程

如:hadoop-daemon.shstartdatanode

单独启动yam的相关进程:yarn-daemon.shstartyam的相关进程

yarn-dacnion.shstartNodcManager

项目3采集数据到HDFS

自我测试

一、选择题

1、B2、D3、A4、C5、C6、C7>B8、D

二、判断题

1、T2、x3、x4、x5^x6、x

课后习题

一、填空题

1、主从NameNodeDataNode

2、hdfsdfs-put

3、hdfsdfs-copyToLocal

二、简答题

K

答:

②hdfsdfs-nikdirtest

③hdfsdfs-putfiletest或hdfsdfs-copyFromLocalfiletest。

④hdfsdfs-appendToFilefllel/test/fileQ

⑤hdfsdfs-Istesto

hdfsdfs-getfiletest或hdfsdfs-copyToLocalfiletesto

2、

答:

①NameNode:集群的核心,是整个文件系统的管理节点.维护着文件系统的文件FI

录结构和元数据信息以及文件与数据块列表的对应关系.

②DalaNode:存放具体数据块的节点,主要负责数据的读写,定期向NameNode发

送心跳

③SecondaryNameNode:辅助节点,同步NameNcde中的元数据信息,辅助

NameNode对fsimage和editsLog进行合并。

3、答:

Datanode以数据块作为容错单位通常一个数据块会备份到三个datanode±.,如果

一个datanode出错,则会去其他备份数据块的daianode上读取,并且会把这个datanode

上的数据块再复制一份以达到备份的效果。

拓展练习

1、答:

区别:

①NameNode负责管理整个文件系统的元数据,以及每一个路径(文件)所对应的

数据块信息

②SccondaryNamcNodc主要用于定期合并命名空间镜像和命名空间镜像的编辑口

志。

联系:

①SecondaryNameNode中保存了一份和NameNode一致的镜像文件(fsimage)和日

志文件(edits)。

②在主NameNode发生故障时,可以从SecondaryNameNode恢复数据,但是

SecondaryNameNode不能完全替代NameNode(.

2、答:

hadoopfs:使用范围比较广,可以用于其他文件系统,不止是hdfs文件系统内。

hadoopdfs:专门针对hdfs分布式文件系统,已经被弃用。

hdfsdfs:和上面的命令作用相同,当使用hadoopdfs时内部会被转为hdfsdfs命令,

推荐使用。

项目4部署HDFS的HA集群

自我测试

一、选择题

1、B2、D3、D4、C5、D6、A7、B

二、判断题

1、42、43、44、x5、x6、V7、4

课后习题

一、填空题

1、单机集群

2、I

3、LeaderFollower

4、Zab协议

5、单点故障

二、简答题

1、答:

分布式的、开源的分布式应用程序协调服务,原本是Hadoop、HBase的一个重要组

件。它为分布式应用提供一致性服务的软件,包括:配置维护、域名服务、分布式同步、

组服务等。

2、答:

HA即为HighAvailability,用于解决NameNode单点故障问题,该特性通过热备的方

式为主NameNode提供一个备用者,一旦主NameNode出现故障,可以迅速切换至备

NameNode,从而实现不间断对外提供服务。

3、答:

Federation即为“联邦”,该特性允许一个HDFS集群中存在多个NameNode同时对外提

供服务,这些NameNode分管一部分目录(水平切分),彼此之间相互隔离,但共享底层

的DataNode存储资源。

拓展练习

1、答:

不,对于指定的NameNode,可以在其之前或者之后启动ZKFC均可以,ZKFC只是调

度Namenode的存活状态,如果不启动ZKFC,此NameNode将无法参与自动failover过程。

2、答:

不是。官方声明:一个Walch事件是一个一次性的触发器,当被设置了Watch的数据发

生了改变的时候,则服务器将这个改变发送给设置了watch的客户端,以便通知它们。

项目5部署YARN的HA集群

自我测试

一、选择题

1、A2、C3、C4、D5、B

二、判断题

1、72、43、44、45、Y6、Y

课后习题

一、填空题

1、YetAnotherResourceNegotiator

2^RMSialeStore

3、ResourceManager应用程序管理器(ApplicationsManager,ASM)

4、8088

5、ApplicationMaster

二、简答题

答:YARN主要由Container、ResourceManager^NodeManager>ApplicationMaster5

部分组成。

(1)Container

Container是YARN中对计算机计算资源的抽象,它封装了某个节点上的多维资源,如

CPU、内存、磁盘、网络等。

(2)ResourceManager(RM)

RM是•个Global(全局)的资源管理器,负责整个系统的资源管理、调度和分配。

(3)NodeManager(NM)

NM是每个节点上的资源和任务管理器,负责该节点程序的运行,以及该节点资源的

管理和使用。

(4)ApplicationMaster(AM)

结合从ResourceManager获得的资源和NodeManager协同工作来运行和监控任务。

拓展练习

答:

ResourccManagcr:存在单点故障,基于ZooKeepcr实现HA避免单点故障。

NodeManager:失败后,RM将失败任务告诉对应的AM,AM决定如何处理失败的任

务。

ApplicationMaster:失败后,由RM负责重启,AM需要处理内部任务的容错问题,AM

会保存已经运行完成的Task,重启后无需重新运行。

面对YARN主节点ResourceManager单点故障,如何解决?

通过ZooKeeper可以实现YARN的HA,从而避免单点故障。ResourceManager由一对

分别处于Active和Standby状态的ResourceManager组成,它使用基于Zookccpcr的选举算

法来决定ResourceManager的状态,如当Active节点无法正常工作(如机器宕机或重启)

时,处于Standby的就会通过竞争选举产生新的Active节点。

项FI6MapReduce应用

自我测试

一、选择题

1、B2、ABCD3、BCD4、ACD

二、填空题

1、分而治之

2、Shuffle

3、Writable

课后习题

一、简答题

1、答:

Map和Reduce函数都是以一组〈key,value)键值对作为输入,按照一定的映射规则转

换为另一组<key,value〉键值对输出。Map函数的输入来自HDFS中的数据块,数据格式

可以是任意的,<key,value〉键值对的类型也是任意的。Reduce函数的任务就是将输入的

一系列具有相同键的键值进行处理,输出结果通常会合并成一个文件。

2、答:分别继承Mapper类和Reducer类,并重写map函数。

3、答:

(1)MapReduce框架使用InputFomiat模块做M叩前的预处理,然后将输入文件切分

为多个Splil(即分片),Splil是M叩Reduce对文件进行处理和运算的输入单位,只是一个

逻辑概念,每个分片并没有对文件进行实际切割,只是记录了要处理的数据的位置和长

度。默认情况下,以HDFS的一个Block的大小(一般为128MB)为一个分片,每个Map

任务处理一个分片。

(2)Map任务会根据函数定义的映射规则,对输入的键值对进行处理,生成新的

<key,value〉作为中间结果。

(3)为了让Reduce可以并行处理Map的结果,需要对M叩输出进行一定的分区

(Partition)>排序(Sort)、合并(Combine)%归并(Merge)等操作,得到〈key,value-

list>形式的中间结果,再交给对应的Reduce进行处理,这个过程成为Shuffle。Shuffle可

以说是MapReduce整个工作流程的核心环节,它的职责就是把Map端的输出结果有效地

传送到Reduce端。

(4)Reduce任务以一系列〈key,value-lisl>中间结果作为输入,执行用户定义的

reduce函数,输出结果交给OutputFoirnat模块。OutputFormat模块会验证输出H录是否存

在以及输出结果类型是否符合配置文件中规定的类型,如果都满足,就将Reduce最终输出

结果存入HDFS中。

4、答:

不一定,根据用户需求可以编写只需要M叩过程的M叩Reduce程序,或者只需要

Reduce过程的m叩Reduce程序。

5、答:

Combiner可以减少Map端需要溢写到磁盘的数据量。并非所有场合都可以使用

Combiner,因为Combiner的输出是Reduce任务的数据,Combiner绝不能改变Reduce任

务的最终计算结果,一般而言,求累加和、最大值等操作可以使用Combiner。

项目7部署开源数据库HBase

自我测试

一、选择题

1、C2、B3、A4、D5、CD6、BCD

二、填空题

1、Region

2、TimeStamp

3、disable,drop

课后习题

一、简答题

1、答:

(1)HBase基于列模式存储,而关系数据库是基于行模式存储的。

(2)关系数据库采用的关系模型具有丰富的数据类型,而HBase采用了更加简单的

数据模型,它把所有数据都存储为未经解释的字符串,用户可以把不同格式的结构化数

据、半结构化数据以及非结构化数据都序列化成字符串保存到HBase中。

(3)关系数据库中的许多操作,如插入、删除、更新、查泡等,会涉及到复杂的多表

连接,通常是依靠多个表之间的主外键关联来实现的。而HBase中不存在多表连接,通常

只采用单表的主键查询。

(4)在关系数据库中执行更新操作时会用新值替换旧值,旧值被覆盖后就不会存在。

在HBase中执行更新操作时,并不会删除旧的数据版本,而是生成一个新的数据版本,IR

的版本依然保留。

(5)关系数据库很难实现横向扩展,纵向扩展的空间也非常有限。与之相反,HBase

这类分布式数据库就是为了实现灵活的水平扩展而开发的,因此能用轻易地通过在集群中

增加或减少节点数量来实现性能的伸缩。

2、答:

行键:每个HBase表都有若干行组成,表中的数据按照行键的字典序排序存储。每个

行由行键来标识,行键也是表的主键。

列族:一个HBase表可以说是一个或多个列族的集合,它是基本的访问控制单元。存

储在一个列族中的所有数据通常都属于同一种数据类型,这就意味着具有更高的压缩率。

表中的每个列都归属于某个列族,数据在被存放到某个列之前,必须先创建列所属的列

族,列名都以列族作为前缀。在HBase中,访问控制、磁盘和内存的使用统计都是在列族

层面进行的。

列限定符:列族里的数据通过列限定符来定位,列限定符不用事先定义,也不需要在

不同行之间保持一致。

时间戳:每个单元格都保存着同一份数据的多个版本,这些版本采用时间戳进行索

引,每次数据操作(新建、修改、删除)时,HBase都会隐式地自动生成并存储一个时间

戳,也可以由用户自己生成时间戳。HBase中的时间戳可以看作是数据的版本号。

3、答:

HBase的实现包括三个主要的功能组件:

库函数:负责链接到每个客户端。

Region服务器:是HBase中最核心的模块,负责存储和维护分配给自己的Region,处

理来自客户端的读写请求,切分在运行过程中变得过大的Region。HBase一般采用HDFS

作为底层存储文件系统,因此Region服务器需要向HDFS文件系统中读写数据。HBase自

身并不具备数据复制和维护数据副本的功能,而HDFS可以提供这些支持,为HBase提供

可靠稳定的数据存储。

主服务器Master:负责管理和维护HBase表的分区信息,比如管理用户对表的增、

删、改、查等操作,还有维护Region服务器列表,分配Region,比如一个表被分成了哪些

Region,每个Region被存放在哪台Region服务器上。Master也会确保整个集群内部不同

Region服务器之间的负载均衡:在Region分裂或合并后,负责调整Region的分布;当某

个Region服务器出现故障而失效时,Master会把该故障服务器上存储的Reg沁n重新分配

给其他可用的Region服务器。

4、答:

层次名称作用

第一层Zookeeper记录-ROOT・表的位置信息

记录.META.表的Region位置信息。

第二层-ROOT-表

-ROOT-表中只有一个Region,因此通过该表就能访问

到.META.表中的所有信息

记录用户数据表的Region位置信息。

第二层.MF.TA.表

.META.表可以有多个Region,保存了HBase中所有用尸数据表

的Region位置信息

5、答:

客户端访问用户数据需要先访问Zookeeper服务器,获取-ROOT-表的位置信息,然后

访问-ROOT-表,获得.META.表的信息,接着访问.META.表,找到存放所需数据的Region

位于哪个Region服务器上,最后到该Region服务器中读取数据。即通过“三级寻址”找到

用书数据表所在的Region服务器,不需要连接主服务器Master,这样可以减轻主服务器的

负载。

6、答:

当用户写数据时,会被分配到相应的Region服务器去执行操作。用户数据苜先被写入

到MemStore和HLog中。只有当操作写入HLog之后,commit。调用才会将其返回给客户

端;当用户读数据时,Region服务器会首先访问MemSiore缓存,如果找不到,再去破盘

上的StoreFile中寻找。

7、答:

HBase为每个Region服务器配置了一个HLog文件,它是一种预写式日志,即用户封

信数据必须被记入口志后才能写入MemStore缓存。Zookccpcr会实时监测每个Region服

务器的状态,当某个Region服务器发生故障时,Zookeeper会通知Master,Masler随即处

理故障Region服务器上的HLog文件,由于一个Region服务器上可能会维护多个Region

对象,这些Region对象共用一个HLog文件,因此这个HLog文件中包含了多个Region对

象的日志记录。系统会根据每条日志记录所属的Region对象堆HLog数据进行拆分,分别

放到相应Region对象的目录下,然后再将失效的Region和对应的HLog日志记录重新分

配到可用的Region服务器中,Region服务器会重新做一遍该日志记录中的各种操作,把日

志记录中的数据写入MemStorc缓存,缓存满后再刷新到磁盘的StoreFile文件中,完成数

据恢复。

项目8部署数据仓库具Hive

自我测试

一、选择题

1、B2、A3、D4、C5、ABC6、ABCD

二、填空题

1、嵌入模式、木地模式、远程模式

2、MapReduce

课后习题

一、简答题

1、答:

Hive是架构在整个Iladoop体系结构的顶层,它是建立在Iladoop平台之上的数据仓

库,基于底层的HDFS、HBase和MapReduce等组件。图中还有一个组件Pig,Pig在某种

程度上跟Hive提供的数据仓库功能有些类似,区别是Pig相对于Hive而言是一种轻量级

分析工具,Pig主要是用于数据仓库的ETL环节,Hive主要用于数据仓库海量数据的批处

理环节。我们在上个项目中还学习了HBase数据库,HBase是可以支持实时交互式查询分

析,而Hive的时延比较高,这样HBase和Hive形成了一种互补的关系。

2、答:

Hive体系架构中包含了三个核心模块:第一个模块是用户接口模块,使外部的用户和

应用程序能够访问;第二个模块是驱动模块,包含了编译器、优化器和执行器,负责把

HiveQL语句转换成一系列M叩Reduce作业;第三个模块是元数据存储模块,用来存储数

据仓库中的元数据,包括哪些表、表中有哪些列、列的名称等,以及里面相关的分区信

息。

3、答:

Hive提供的对外访问接口有四类:CLI命令行工具、HWI(HiveWebInterface,Hive

的Web接口)、JDBC和ODBC(开放的数据库连接访问接口,支持很多应用开发)、

ThriftServer(基于Thrift架构开发的接口,允许外界通过这个接口实现对Hive数据仓

库的RPC调用)。

4、答:

Hive架构中的元数据是被存放在一个独立的关系型数据库中,这个独立的关系型数据

库可以是它自带的数据库产品Derby,也可以是其他的关系型数据库,如MySQL。

5、答:

(1)由Hive驱动模块中的编译器对用户输入的SQL语言进行词法和语法解析,将

SQL语句转化为抽象语法树的形式;

(2)抽象语法树的结构仍很复杂,不方便直接翻译为M叩Reduce算法程序,因此把

抽象语法数转化为查询块;

(3)把查询块转换成逻辑查询计划,里面包含了许多逻辑操作符;

(4)重写逻辑查询计划,进行优化,合并多余操作,减少M叩Reduce任务数量;

(5)将逻辑操作符转换成需要执行的具体M叩Reduce任务;

(6)对生成的M叩Reduce任务进行优化,生成最终的M叩Reduce任务执行计划;

(7)由Hive驱动模块中的执行器,对最终的MapReduce任务进行执行输出。

6、答:

Hive支持整型、浮点型、双精度、布尔型、字符型、时间戳和字符数组等基本数据类

型,此外还提供了一些集合数据类型,包括array、map、struct

项目9利用Flume监听数据

自我测试

一、选择题

1、A2、C3、B4、B5、D

课后习题

一、填空题

1、Source,Channel,Sink

2、netcatsource、Execsource、Avrosource

3、al.sinks.kl.type

4、Channel,Sink

5、MemoryChannel

二、简答题

1、答:

Flumeagent是一个(JVM)进程,承载了三大组件Source、ChanneRSink,事件通过

这些组件从外部源流到下一个目标。FlumeSource是负责接收数据到FlumeAgent的组

件,接收外部源(如Web服务器)传递给它的事件,外部源以H标FlumeSource可以识别

的格式将事件发送到FlumeSourceoFlume将数据表示为事件,事件是非常简单的数据结

构,具有一个主体和一个报头集合,事件的主体是一个字节数组,报头被标记为一个

map,其中有字符串key和字符串value。报头只是为了路由和标记事件的优先级。报头也

可以用来给事件增加ID或者UUID。每个事件本质上必须是一个独立的记录,而不是记录

的一部分,这也就要求每个事件要适应FlumeAgentJVM的内存。

2、答:

a1.sources=rl

al.sources.rl.type=netcat

al.sources.rl.bind=localhost

al.sources,rl.port=6666

aI.sources.r1.channels=c1

3、答:

FlumeChannel是被动存储,负责临时缓冲FlumeSource已经接收但还未写入到另一个

Agent或存储系统的数据。FlumeSource将数据写入到Channel,Sink从Channel读取数

据,Channel负责连接Source和Sinko一个Sink只能从一个Channel读取数据,多个Sink

也可以从相同的Channel读取数据。Channel支持多种类型,如JDBC、文件系统、内存等

拓展练习

1、答:

FileChannel将event写入磁盘文件,与MemoryChannel相比存储容量大,无数据

丢失风险。FileChannel数据存储路径可以配置多磁盘文件路径,通过磁盘并行写入提高

FileChannel性能。Flume将Event顺序写入到FileChannel文件的末尾。可以在配置文

件中通过设置maxFileSize参数配置数据文件大小,当被写入的文件大小达到上限的时

候,Flume会重新创建新的文件存储写入Evento当一个已经关闭的只读数据文件的

Event被读取完成,并且Sink已经提交读取完成的事务,则Flume把存储该数据的文件

删除。

2、答:

source:

(1)增加source个数,可以增大source读取能力。

(2)具体做法:如果一个目录下生成的文件过多,可以将它拆分成多个目录。每

个目录都配置一个source»

(3)增大batchSize:可以增大一次性批处理的event条数,适当调大这个参数,

可以调高source搬运数据到channel的性能。

channel:

(1)memory:性能好,但是,如果发生意外,可能丢失数据。

(2)使用filechannel时,dataDirs配置多个不同盘下的目录可以提高性能。

(3)transactioncapacity需要大于source和sink的batchSize参数

项目10Sqoop数据传输应用

自我测试

一、选择题

1、C2、C3、D4、C5、D

课后习题

一、填空题

1sqoopversion

2、table

3、dropdatabaseifexists'school';

4、hadoopfs-cat文件路径

5、list-databases

二、简答题

1、答:

Sqoop是一款开源的数据传输工具,一个在关系型数据库(Mysql、Oracle)和Hadoop

之间进行批展数据传输的工具,可以通过sqoop把数据从关系数据库(比如mysqLoracle)

导入到在Hadoop中;也可以把数据从在Hadoop中导出到关系型数据库中。Sqoop底层用

MapReduce程序实现数据的抽取、转换、加载,MapReduce天生的特性保证了并行化和高

容错率,MapReduce任务在Hadoop集群上运行,减少了对服务器资源的浪费情况,在性

能方面有很大的提升。

2、答:

sqoop使用list-tables命令查看指定数据库下所有的数据表,在使用该命名时需要指定

username、password、connect等参数,例如:sqooplist-:ables-usernameroot-password

123456—connectjdbc:mysql://localhost:3306/schooloFlumeChannel是被动存储,负责临时

缓冲FlumeSource已经接收但还未写入到另■个Agent或存储系统的数据。FlumeSource

将数据写入到Channel,Sink从Channel读取数据,Channel负责连接Source和Sink。一个

Sink只能从,个Channel读取数据,多个Sink也可以从相同的Channel读取数据。Channel

支持多种类型,如JDBC、文件系统、内存等

3、答:

在数据传输之前,我们首先需要在关系数据库Mysql中新建数据表为接收从HDFS传

输过来的数据做准备。其次,需用使用Sqoop的export命令以及具体的命令参数实现数据

从HDFS导出到Mysql指定的数据表中。最后,我们需要用Sql查询命令查看新建的数据

中是否正确导入HDFS文件中的数据并确保导入数据正确性和完整性。

拓展练习

1、答:

Sqoop将数据从HDFS导出到关系数据库Mysql时,为避免出现乱,可以在Sqoop

expor【命令中指定connect参数时,在数据库后面强制加上编码的方式并指定为UTF-8,

及添加characterEncoding=UTF-g。若想将HDFS文件中的null值替换为Mysql数据表中的

空字符串,可以在Sqoopexporl命令中指定-inpul-null-siring参数,并将其参数值设置为

Mysql中的空串值。

2、答:

Sqoop是一款开源的数据传输工具,主要用于在Hadoop与传统的关系数据库(mysql、

Oracle等)间进行数据的传递,Kettle是一款国165外开源的ETL工具,纯java编写,可

以在回Window、Linux.Unix上运行,数据抽取高效稳定。两者的主要区别表示为下表:

SQOOP与传统ETL工具的比较

1SqoopJm工具]

Sqoop是一个用来将Had。”和关系盘数据库ETL负费将合布的、导构戮据规中的第据知关

中的引据相互传浴的开源工具,可以将一个系数据、平面数据文件等抽取到临时卬间层

关系型数娓库(例皿/SQL,Oracle等)中后进行潘洪、转换、集成,鼠后加教到数娓

的鼓拼导入到Hadoop的HDFS中,也可以将仓库或勃抵集市中,成为股机分析处理、«

HDFSf)数据导入到关系型数据库中。窕挖掘的星础。

ETL工具经以多年的发展,已经形成了多个相

王要是通过和关系数据库进行交对成熟的产品体系,股务对象主更是传烧

1数星抽取的制5Q8PJDBCK

互。理论上支持JDBC的database都可以使的数据仓15体系,ETL工身的的型代表有:

!比较用sqoop和HadoopiS行数据交互.nfornatica、Datastage、01B»微软DTS等

o

♦Sqoop工具届于Hadoop体系中的一个子项ETL工具属于外部工具,如臬雷曼将数据抽取

J与Hadoop体系的埃1目,整台了Hadoop&WS、HIVE和Hbase至Hadoop的HDFS、HIVE和Hbase卬,则需要

香,摘取的劭据可以宜接传输至HDFS、进行相应的技术开发工作,开发与HDFS、

HIVE汨Hbase等,且无需俄复杂的开发编程HIVE和Hba,e的相关接口,以打ii数据传辐工

写工传,作,

[数据抽取容错对干找据抽取过程中产生的镭误或者部据透对于传统的M据仓库来说,ETL工具经过多年

[漏,可以通过捕获错误日志来遂行错误收集的发假已经比较成熟,人机交互的可操作性

和分析,人机操作界面相比没有ETL工具的和可视性较高,对于数据抽取过程中出现的

可操倨性和可视性高,育娈技术人员编程进错误可以比较直接的2[右,不需要太多的编

1而实现日志分析.程开发,

产品的价格匕厘于开源项目,不需要软件的许可费用,企

/MMM1/|3**A企业需要4年交纳ETL产品相关的许可费用

业可以免号使用

项目11利用Ambari部署Hadoop集群

自我测试

一、选择题

1、A2、D3、D

课后习题

一、填空题

1、AmbariServerAmbariAgent

2、AmbariWebRestAPIAmbariShell

3、消息队列操作队列

4^AmbariClouderaManger

项目12大数据的未来

一、选择题

1、B2、B3、C4、A5、D

课后习题

一、填空题

1、医疗智慧城市教育

2..疾病治疗和预防年老者精确医疗救助语音识别指定医疗方案

3、通过数据汇集加速信息资源

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论