智慧园博园大数据集成平台设计方案(完整版)_第1页
智慧园博园大数据集成平台设计方案(完整版)_第2页
智慧园博园大数据集成平台设计方案(完整版)_第3页
智慧园博园大数据集成平台设计方案(完整版)_第4页
智慧园博园大数据集成平台设计方案(完整版)_第5页
已阅读5页,还剩31页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

智慧园博园大数据集成平台设计方案目录TOC\o"1-5"\h\z\o"CurrentDocument"第1章 大数据集成平台设计方案 4\o"CurrentDocument"大数据集成平台概述 4\o"CurrentDocument"建设背景 4\o"CurrentDocument"大数据云平台现状 4\o"CurrentDocument"平台指导思想 6\o"CurrentDocument"平台设计的指导思想 6\o"CurrentDocument"平台选择的指导思想 7\o"CurrentDocument"平台应用的指导思想 7\o"CurrentDocument"总体解决方案 7\o"CurrentDocument"总平台旅游大数据的存储解决方案 9\o"CurrentDocument"总平台旅游大数据的计算解决方案 10\o"CurrentDocument"总平台旅游大数据的文件传输解决方案 12\o"CurrentDocument"平台总体设计 13\o"CurrentDocument"Hadoop云平台的总设计原则 13\o"CurrentDocument"Hadoop云平台架构 14\o"CurrentDocument"平台的基础架构设计 15\o"CurrentDocument"高用性设计 18\o"CurrentDocument"业务分析平台 19\o"CurrentDocument"数据管理平台 21\o"CurrentDocument"数据访问平台 24\o"CurrentDocument"数据管制和集成平台 28\o"CurrentDocument"运营平台 30\o"CurrentDocument"平台功能 31\o"CurrentDocument"总体要求 31\o"CurrentDocument"平台业务功能 31\o"CurrentDocument"旅游企业的基础信息分析统计 32\o"CurrentDocument"旅游从业人员统计 32\o"CurrentDocument"综合经营收入统计 32\o"CurrentDocument"综合游客接待情况统计 32\o"CurrentDocument"景区流量统计 32\o"CurrentDocument"饭店出租率统计 33\o"CurrentDocument"自驾游车辆统计 33\o"CurrentDocument"节庆期间专项统计 33\o"CurrentDocument"客源地统计 33\o"CurrentDocument"1.5.12游客行为监测统计 33\o"CurrentDocument"1.5.13旅游景区峰值预警 34第1章大数据集成平台设计方案1.1大数据集成平台概述1.1.1建设背景旅游大数据的产生:众所周知,随着信息社会的快速发展,信息量以爆发式的速度增长。这些数据的特征表现为数据量大,一般为TB级或PB级甚至更大。数据类型多,可以是结构化的表单、半结构化的文本、视频、图像、语音、及非结构话的文件。而全国旅游数据也是异常巨大,形成了旅游大数据,而面对庞大而复杂的信息体系,我们把整个大数据分成了两个层次,第一个层次是基础数据,包括所有的景区信息、地图、POI、景区周边环境信息等等。第二个层次就是应用和交易数据.以游客所产生的数据为主。目前的大数据应用主要是从第二个层次做延伸,也仅仅体现在在线旅游中,包括做得比较好的旅游数据预测系统与蚂蜂窝游客点评数据等等,它们大都从监管和营销的角度岀发。但是我认为目前市场上没有一种产品能真正满足游客的游中体验,而其实游客才是真正实现智彗园博的核心价值。而且从游客体验的吃、住、行、游、购、娱六大要素来看,中国人的旅游方式是以景区为原点延伸的,景区基础数据的应用应该是游客体验中最重要的一环,但是目前所有的导航服务系统都是针对陆路交通的,景区内基础信息是一个盲点,更谈不上基于此基础数据的景区内导航、语音播报、LBS定点等产品的研发了。旅游大数据的挑战:如何对这些数据进行高效存储,如何对这些数据进行分析和处理,以获取更多有价值的信息。旅游大数据集成平台应运而生。因此,通过整合智彗园博平台相关数据,并结合旅游管理和目的地促销活动中产生的所有数据形成智彗园博大数据集成平台。通过对数据筛选、分析,提供如旅游行业发展动态、服务模式、旅游者偏好等的数据分析报告,为智彗园博决策提供数据支挥。1.1.2大数据云平台现状目前,随着云计算的高速发展,Hadoop及Hadoop的生态圈逐渐壮大,但真正商用且成熟的Hadoop云平台架构却非常少。本方案结合国内的大数据应用巨头百度、阿里巴巴、腾讯,即“BAT”的Hadoop云平台同时,也结合并学习国外的大数据巨头Hadoop应用发布商Cloudera,Hortonworks,MapR,即"CHM"的Hadoop商用云平台,利用ApacheHadoop开源的力量,推出一套稳定、商用、高效、成熟、开源、易开发,易扩展的大规模hadoop云平台 HDP(HadoopDataPlatform),以满足全国的旅游数据的采集、存储、分析和发掘和应用。分析层语炯OLAP引擎城访问层NoSQLSQL/GBase.MonetDB!/HBase,Cassandra,MongoDB缓存/Redis.Memcached .内存计算

/spark+shark姻仓库/HNe数据挖掘

/R,Mahout结构化数据1MDG:

DrillImpala分布式计算框架/YARN流计算

/Storm文件系统/*ph,HDFS非的化数据实时流

数据1.2平台指导思想建设稳定、商用、成熟、高效、节能统一的大数据Hadoop云平台。不仅满足大数据的大规模的采集、存储、分析计算和应用,也为其它平台和系统提供性能需求、系统稳定性、服务满意率高技术支挥和大数据支挥。性能需求指网站性能需求,主要指作业响应时间方面的要求,作业响应时间指完成目标系统中的交互或批量处理所需的响应时间。网站响应时间较短,具有良好的用户体验。这对大数据的实时性、准确性和有用性提出很高的要求,这需要我们设计并使用Hadoop的大数据实时处理的系统架构,充分利用storm、spark等技术。系统稳定性主要包括系统运营完好、系统故障处理及时率两个指标。系统运营完好,有优异的灾备机制,具有保障系统运营的优异管理机制。系统故障处理及时率是系统发生故障时处理的效率。具有良好的系统故障应急机制,能够快速及时的处理系统故障。这对Hadoop平台的高可靠性提出高的要求,这需要设计Hadoop云架构时,考虑HA的优化和设计。服务满意率主要考核供应商在服务期限内服务内外部客户的满意度。包括投诉接通率、报告及时性两个方面。投诉接通率是公共服务可信的重要保障。投诉接通率是投诉接通次数(包括电话、网站响应)/投诉总次数。报告及时性是对智彗园博要求的相关服务的响应时间,计算方法为报告按时提交次数/报告总次数。这需要投诉方面的大数据有快速的分析和处理.需要设计Hadoop云架构中的storm、hbase、hive的应用和优化。下面主要从平台的设计、选择和应用来进行思想指导。1.2.1平台设计的指导思想因为大数据是由分布存储在集群节点中多个单节点的磁盘空间中,能被进行分布式处理的数据构成的一个数据总体。大数据的规模可以随点节点数量的不断增加而不断扩大。旅游大数据集成平台的设计目标:♦可以存储海量数据♦可以进行高速处理♦可以快速开发出并行服务♦可以运行在廉价机器搭建的集群上所以,建议采用选择Hadoop。因为Hadoop是一个能够分布式存储大数据,并且能对大数据进行分布式处理的软件框架。主要由HDFS和MapReduce组成。它主要有以下几个优点:高可乘性:Hadoop按位存储和处理数据的能力值得人们信赖。高扩展性:Hadoop是在可用的计算机集簇间分配数据并完成计算任务的,这些集簇可以方便地扩展到数以千计的节点中。高效性:Hadoop能在各节点之间动态地移动数据,并保证各个节点的动态平衡,因为其处理速度非常快。高容错性:Hadoop能够保存数据的多个副本,并且能够自动将失败的任务重新分配匚低成本:Hadoop可以运行在廉价服务器上管理海量数据,降低了成本。由Apache基金会所开发,纯Java编写的开源系统。1.2.2平台选择的指导思想为什么选择HDP?HDP是企业级的Hadoop,其核心是提供线性扩展存储并跨广范围访问方法(从批量到实时、搜索和流媒体)计算。它在管制、集成、安全性和运营上具有一套完善的功能。1.2.3平台应用的指导思想智彗园博是旅游业发展到现阶段岀现的一种旅游新形态,是旅游业与科技创新融合发展的典范,是旅游业未来发展的趋势。智彗园博发展的直接受益者将是旅游者,它将使旅游者享受到更多的智彗园博服务。比如游客通过手机、IPAD等工具,到网上查询观光信息、网上订票,还可以订制私人旅游线路,合理安排个人日程,最大化地利用旅游时间。3总体解决方案总体的解决方案是采用成熟、商用、稳定的Hadoop云平台一HDP,核心技术主要是Hadoop与其生态系统的整个云技术家族。本平台架构包括数据访问、数据管制与集成和数据监控模块,平台提供了丰富的大数据接口,为智彗园博各大平台提供大数据的支挥,比如:旅游公共信息发布及资讯平台,中国旅游产业运行监管平台,全国各景区门票预约与客流预警平台,多语种的旅游形象推广平台等。详细如下如所示:;xlbJl..wefsY的朋斛秋■*MX.JWU..NvsartHsCtiiit3c(fBiisikvunutiSftfTIlEm 血於—一^E21・ILOIjLZJ*LH3jlFLiiFLjSianttAxKTm.*:!・eSS£RAmMri/ition.碱卄DtUPrtrtceionAnte•Wii»Im分«/«xia严化wwaj:SQUAPI分«/«xia严化wwaj:SQUAPI智彗园博数据最重要的是数据分析,通过HDP,可以得到如下的分析:数据及分析可视化和数据探索.•面◎用户的基于web的分析和可视化・熟悉的矣似电子表桔的畀面•左义和直理长期运行的数抿收宴作业数据分析结果快速形成图表:任何协议内部/外部核心系统可靠的文件传输I具安全性任诃协议任何协议内部/外部核心系统可靠的文件传输I具安全性任诃协议旅游大数据分析平台需要从各个景点的系统传输大量的非结构化数据文件,我们的文件传输解决方案是:景区大数据分析平台景区管理及可视性1.3.1总平台旅游大数据的存储解决方案旅游大数据不断增长造成单机系统性能不断下降,即使不断提升硬件配置也难以跟上数据的增长速度。然而,当今主流的计算机硬件比较便宜而且可以扩展.现在购置八台8内核、128GB内存的机器比购置一台64内核、TB级别内存的服务器划算得多,而且还可以增加或减少机器来应对将来的变化。因此选择Hadoop云平台的大数据存储方案。存储方案核心技术其存储的核心技术解决方案是:•高性能分布式存储系统:

HBASE(数据库的首选技术)-高度容错性分布式文件系统:HDFS(文件存储首选技术)方案核心技术介绍HDFS:HadoopDistributedFileSystem,简称HDFS,是一个分布式文件系统.HDFS有着高容错性(fault-tolerant)的特点,并且设计用来部署在低廉的(low-cost)硬件上。而且它提供高吞吐量(highthroughput)来访问应用程序的数据,适合那些有着超大数据集(largedataset)的应用程序。HBASE:HBase-HadoopDatabase,是一个高可乘性、高性能、面向列、可伸缩的分布式存储系统,利用HBase技术可在廉价PCServer上搭建起大规模结构化存储集群。方案设计图卄……Pig析)Hive(如分析)平台管理层洪1E分忻启编程摸里层数据存储层文件存储层1数据集成屋JavaNIO传输HDFS(文陆储)」ad3卄……Pig析)Hive(如分析)平台管理层洪1E分忻启编程摸里层数据存储层文件存储层1数据集成屋JavaNIO传输HDFS(文陆储)」ad3①MoozMapKeduce/Yarn

(编惶模型)HCatalogHbaseRedis(元数据管理)(数据存储〕(数据钿Samza/storm(编程模型)*疗1.3.2总平台旅游大数据的计算解决方案其分析的核心技术解决方案是:高性能并行计算引擎高性能并行计算引擎:MapReduce2.0(离线)、Spark(内存)、Storm(实时)、Tez(底层)MapReduce2.0的介绍MapReduce2.0或者MRv2具有与MRvl相同的编程模型,唯一不同的是运行时环境。MRv2是在MRvl基础上经加工之后,运行于资源管理框架YARN之上的MRvl,它不再由JobTracker和TaskTracker组成,而是变为一个作业控制进程ApplicationMaster,且ApplicationMaster仅负责一个作业的管理至于资源的管理.则由YARN完成。简而言之,MRvl是一个独立的离线计算框架,而MRv2则是运行于YARN之上的MRvl。Spark的介绍Spark基于mapreduce算法实现的分布式计算,拥有Hadoop、MapReduce所具有的优点;但不同于MapReduce的是Job中间输出和结果可以保存在内存中,从而不再需要读写HDFS,因此Spark能更好地适用于数据挖掘与机器学习等需要迭代的map.reduce的算法。Stonn的介绍Storm是一个免费开源、分布式、高容错的实时计算系统。Storm令持续不断的流计算变得容易,弥补了Hadoop批处理所不能满足的实时要求。Storm经常用于在实时分析、在线机器学习、持续计算、分布式远程调用和ETL等领域。Storm的部署管理非常简单.而且,在同类的流式计算工具,Storm的性能也是非常出众的。Tez的介绍Tez是基于HadoopYarn之上的DAG(有向无环图,DirectedAcyclicGraph)计算框架。它把Map/Reduce过程拆分成若干个子过程,同时可以把多个Map/Reduce任务组合成—个较大的DAG任务,减少了Map/Reduce之间的文件存储。同时合理组合其子过程,也可以减少任务的运行时间。方案设计图总的来说,各核心技术各有所长,比如,MapReduce:是一种离线计算框架,将一个算法抽象成Map和Reduce两个阶段进行处理,非常适合数据密集型计算。而Spark则是一种内存计算框架,它将数据尽可能放到内存中以提高迭代应用和交互式应用的计算效率。Storm:MapReduce也不适合进行流式计算、实时分析,比如广告点击计算等,而Storm则更擅长这种计算、它在实时性要远远好于MapReduce计算框架。Te乙运行在YARN之上支持DAG作业的计算框架,并且更底层,对pig,hive等的支持比较高。

半台管球焙±s应用IfPig(施分析)Hive(数IE分析)IE(監即)

ueqEV(曲歿肝風隠血片)

gej^ooz半台管球焙±s应用IfPig(施分析)Hive(数IE分析)IE(監即)

ueqEV(曲歿肝風隠血片)

gej^oozHCatalog(兀如筲坤)Hbase(数鹅存储Redis(数话存储)Samza/storm(编悝樓型)»■■■■4F■■■♦■■■■■■■.■■■■■■■■猪I?樓理底HDFS(文件存储)Ii91B»y2J5JavaNKM5輸1.3.3总平台旅游大数据的文件传输解决方案旅游大数据平台收集的非机构化数据来自不同的景区,通过广域网远距离行传输。而且非机构化数据一般较大,例如音频,视频,图片等,文件大小500M以上,甚至几G几十Go如果通过FTP工具传输,面临传输速度低,出错概率大等困难.从而造成数据到应用的延误。而且FTP不能提供详尽、易读的传输日志信息,故障诊断和修复的时间会大大增加。文件传输解决方案“数据通"(FastFileTransfer:FFT)提供文件网关,核心传输工具,安全认证,传输监控等功能,为园博园提供一个统一,安全,高效的传输平台。方案功能介绍FFT的核心传输工具采用一种全新的技术,克服了传统数据传输软件,例如FTP,HTTP以及WindowsCIFS中的固有瓶颈,实现了在各种共拿和私有网络环境中传输速度的最大化。这种技术可以获得完美的传输效率,不为网络延迟和丢包所限制。并且用户拿有对传输速度以及不同传输流之间带宽共享的无以伦比的控制。不管网络距离和动态性能如何,即便是在最困难的网络条件下(例如卫星,无线和洲际远程链接),文件传输时间仍然可以得到保障。FFT具有内置的完整安全性功能,包括连接节点安全验证,传输中数据加密以及数据完整性验证。FFT具有出色的带宽控制功能,提供了有保障的传输时间,充分利用了可用带宽,同时让其他网络流量可公平使用带宽。FFT拥有灵活开放的架构,支持在所有主要的操作系统直接的跨平台传输,提供开放的可扩展的软件开发包,API接口,能够方便的将“数据通”的技术和产品无缝集成到现有的应用程序和工作流程管理平台中。FFT提供了一个统一的监控管理平台,方便用户监控当前各个“数据通"节点的健康状态,管理传输节点的用户和服务器配置,Console还可以实时管理各节点的传输,同时可对各个节点进行传输统计。

133.2传输架构设计各地方景点都会用FFTP2PServer将各地数据上传到旅游大数据平台,FFTConsole监控所FFT服务器的运行。此外还可以考虑HA架构保证服务的不间断性。"FEnierprise y旅游大I"FEnierprise y旅游大I越据平台FPTConsole—>1.4平台总体设计1.4.1Hadoop云平台的总设计原则Hadoop云平台作为大数据的分布式的计算平台,必须具备分布式系统设计的重要且必须的设计原则,本平台严格根据以下分布式系统的设计原则进行设计:HighReliability高可靠性HighScalabilty高可扩展性HighRobustness高鲁棒性HighAvailabity高可用性高可靠性硬件错误是常态而不是异常。HDFS可能由成百上千的服务器所构成,每个服务器上存储着文件系统的部分数据。我们面对的现实是构成系统的组件数目是巨大的,而且任一组件都有可能失效,这意味着总是有一部分HDFS的组件是不工作的。因此错误检测和快速、自动的恢复是HDFS最核心的架构目标。高可扩展性运行在HDFS上的应用具有很大的数据集。HDFS上的一个典型文件大小一般都在G字节至T字节。因此,HDFS被调节以支持大文件存储,它应该能提供整体上高的数据传输带宽,能在一个集群里扩展到数百个节点。一个单一的HDFS实例应该能支挥数以千万计的文件。141.3高鲁棒性引入Federation的最主要原因是简单,其简单性是与真正的分布式Namenode相比而言的。Federation能够快速的解决了大部分单NamenodeHDFS的问题°Federation是简单鲁棒的设计,由于联盟中各个Namenode之间是相互独立的。大部分改变是在DatanodexConfig和Tools,而Namenode本身的改动非常少,这样Namenode原先的鲁棒性不会受到影响。比分布式的Namenode简单,虽然这种实现的扩展性比起真正的分布式的Namenode要小些,但是可以迅速满足需求。另外一个原因是Federation良好的向后兼容性,已有的单Namenode的部署配置不需要任何改变就可以继续工作。因此Federation(联盟)是未来可选的方案之一。在Federation架构中可以无缝的支持目前单Namenode架构中的配置。141.4高可用性hadoop2.0的HA机制有两个namenode,—个是activenamenode,状态是active;另外一个是standbynamenode,状态是standby。两者的状态是可以切换的,但不能同时两个都是active状态,最多只有1个是active状态。只有activenamenode提供对外的服务,standbynamenode是不对外服务的。activenamenode和standbynamenode之间通过NFS或者JN(journalnode,QJM方式)来同步数据。1.4.2Hadoop云平台架构竝工储、空期F现砂FS

NFSF网“曲SOL竝工储、空期F现砂FS

NFSF网“曲SOLJ^a5c..I^SOL8$fi#st.以【5)二訂-S«:汕)B>;n^■3]lPjProwiK31」lFLYARN.孵斷絲Autk^fcasfeft.MiOfrz^n.Ariif&

陽Proiedoin

蘇;•钏

ti=f;m

犢应;Ch帥二:,字;HDFSH血cp时武対錢1.4.3平台的基础架构设计云计算基础架构为了快速构建以上各种平台以满足业务功能的建设,运营和扩张,更好的支挥智彗园博业务的经营,需要高等级基础架构平台进行支挥。根据旅游行业的特点,我们建议采用云化的基础架构进行支挥。同时,采用双活/多活架构来满足业务连续性和客户体验的要求。旅游产业自身是综合性服务产业,同时旅游产业与其他产业的正在不断的深度融合,这就要求要求智彗园博的基础架构平台要能与未来城市与社会服务的对接能力要能够支撑未来570年的发展需求,根据最佳实践,按需建设的业务需要云化的基础架构。旅游行业具有季节性、周期性,作为行业平台,需要按需扩展的计算能力进行支挥,这就必须采用先进的云化建设模式来满足业务高峰期的处理能力。旅游行业的客户体验具有跨地域特点,同时考虑途体验和地域体验,需要平台能够为整个过程提供一致的漫游体验。因此,需要考虑在全国进行业务能力的建设,初期计划使用双活的数据中心设计来满足南北大区客户的需求。同时,我们也应充分考虑未来旅游业务模式的不断创新的必然性。核心基础架构整体设计智彗园博基础架构平台的整体架构设计:

*智意旅遊运疔中心-*5■——InternetJ— _ 丄在初期建设中,采用南■北双活的数据中心结构来满足整个中国的业务需求:*智意旅遊运疔中心-*5■——InternetJ— _ 丄在初期建设中,采用南■北双活的数据中心结构来满足整个中国的业务需求:*询•集中监控模块将各数据中心的运行状态进行汇总并实现部分自动化操作-负载均衡模块将交易、浏览请求发送至正确的处理节点并将结果送回客户端•数据复制模块在数据中心间维持数据的一致性

•数据中心间软硬件、网络配置一致.同时通过软件分发机制及工具维持版本管理・ 跨中心的变更管理、问题管理流程和工具支持技术构架模式上,采用以POD为建设单位的标准化建设机制:数据中心站点内的部署结构多活数据中心的整体网络架构实现:DMZ区DMZ区在数据中心的内部,根据业务要求,需要划分如下逻辑区域:♦测试区♦核心生产区域♦DMZ区域♦管理区域♦存储区域合理的逻辑分区保证了业务的有序开展数据中心外的部署结构CDN内容加速网络的建设也是保证海量客户体验的基础,拟在初期建设阶段完成后,在后续阶段完成国内CDN节点的部署。CDN节点CDN节点CDN节点0KPIDNSCDN节点CDN节点CDN节点0KPIDNSQ3CP1WAhICP2Web!CP2DNSi9^K9^CDN服务以多媒体视频为例:推流服务器第二次罡铉第一次定位取昌素引文件1rlTrsntiS»Ci~1推流服务器第二次罡铉第一次定位取昌素引文件1rlTrsntiS»Ci~111请康传備案引文沖II1111111,•.站 n•itaterie[文件IfnawcoaBIi111111—1111Li>2te^xiKnxMFAP定位索引文件1.4.4高用性设计HDFS的HA功能通过配置Active/Standby两个NameNodes实现在集群中对NameNode的热备来解决单点故障问题,HDFSHA的解决方案可谓百花齐放,LinuxHA,VMwareFT,sharedNAS+NFS,BookKeeper,QJM/QuorumJournalManager,BackupNode等等。目前普遍采用的是sharedNAS+NFS,因为简单易用,但是需要提供一个HA的共享存储设备。而社区版已经把基于QJM/QuorumJournalManager的方案merge到trunk了。高可扩展性是来自于hadoop的存储方案HDFS,现在急需大规模的部署和应用的商用方案。在大规模部署中,熟练使用cM和Ambari是必须且首要的选择。而在CM与Ambari中只有Ambari是Apache的顶级开源项目,所以选择Ambari来管理并设计。♦UE♦UE4和»mt• •• * «i口•2/20y.戲各rMtaiQonO-.xna■■■0W• W■■■■0”忖03岀2"eurrtr£35-irrii922Ahr■Ua・ ••nfrr.iM*mW・r«WWm忤钏屮evWW0.20ms■ BA"IifW・4c22.0hr业务分析平台作为业务分析和决策支持的手段分为四种:标准报表、主题分析、在线分析、数据挖掘。1、 标准报表标准报表是决策支持平台的核心功能,可以综合日常医疗卫生报表序列。2、 主题分析主题是在较高层次上将组织信息系统中的数据进行综合、归类和分析利用的一个抽象概念,每一个主题基本对应一个宏观的分析领域。在逻辑意义上,它是对应组织中某一宏观分析领域所涉及的分析对象。面向主题的数据组织方式,就是在较高层次上对分析对象数据的一个完整并且一致的描述,能刻画各个分析对象所涉及的园博园各项数据,以及数据之间的联系。所谓较高层次是相对面向应用的数据组织方式而言的,是指按照主题进行数据组织的方式具有更高的数据抽象级别。与传统数据库面向应用进行数据组织的特点相对应,数据仓库中的数据是面向主题进行组织的。3、 联机分析联机分析处理(OLAP)是使分析人员、管理人员或执行人员能够从多角度对信息进行快速、一致、交互地存取,从而获得对数据的更深入了解的一类软件技术。OLAP的目标是满足决策支持或者满足在多维环境下特定的查询和报表需求,它的技术核心是“维''这个概念。"维'■是人们观察客观世界的角度,是一种高层次的类型划分。“维”一般包含着层次关系,这种层次关系有时会相当复杂。通过把一个实体的多项重要的属性定义为多个维,使用户能对不同维度上的数据进行比较。因此OLAP也可以说是多维数据分析工具的集合。OLAP的基本多维分析操作有钻取、切片和切块、以及旋转等。钻取是改变维的层次,变换分析的粒度。它包括向上钻取和向下钻取。向上钻取是在某一维上将低层次的细节数据概括到高层次的汇总数据,或者减少维数;而向下钻取则相反,它从汇总数据深入到细节数据进行观察或增加新维。切片和切块是在一部分维上选定值后,关心度量数据在剩余维上的分布。如果剩余的维只有两个,则是切片;如果有三个,则是切块。旋转是变换维的方向,即在表格中重新安排维的放置(例如行列互换)oOLAP有多种实现方法,根据存储数据的方式不同可以分为关系OLAP(ROLAP)、多维OLAP(MOLAP)、混合OLAP(HOLAP)oROLAP表示基于关系数据库的OLAP实现。以关系数据库为核心,以关系型结构进行多维数据的表示和存储。ROLAP将多维数据库的多维结构划分为两类表:一类是事实表,用来存储数据和维关键宇;另—类是维表,即对每个维至少使用一个表来存放维的层次、成员类别等维的描述信息。维表和事实表通过主关键字和外关键宇联系在一起,形成了“星型模式S对于层次复杂的维,为避免冗余数据占用过大的存储空间,可以使用多个表来描述,这种星型模式的扩展称为雪花模式"。MOLAP表示基于多维数据组织的OLAP实现(MultidimensionalOLAP)o以多维数据组织方式为核心,也就是说.MOLAP使用多维数组存储数据。多维数据在存储中将形成''立方块(Cube)"的结构,在MOLAP中对”立方块”的”旋转“、”切块”、”切片”是产生多维数据报表的主要技术。HOLAP表示基于混合数据组织的OLAP实现(HybridOLAP)。如低层是关系型的,高层是多维矩阵型的。这种方式具有更好的灵活性。4、数据挖掘数据挖掘是根据园博园的既定业务目标和存在的问题,对大量的业务数据进行探索,揭示隐藏其中的规律,并将其模型化,指导并应用于实际的园博园经营中「数据挖掘与OLAP分析、预定义报表和即席查询等有很大的区别。后三者通常是用户对所关心的业务指标,按照已知的角度进行分析;而前者则是在业务问题和目标明确,但考察的角度不清楚时,对数据进行探索,揭示隐藏其中的规律性,进而将其模型化。不同的实际问题所采用的数据挖掘方法有所不同,有的问题甚至需要结合多种方法共同进行解决。数据挖掘的方法一般分为预测型和描述型。具体而言,本系统要求数据挖掘应用能支持以下各类方法:预测型(Predictive)方法通常包含以下几种:♦分类(Class辻ication)/决策树算法(DecisionTree)♦回归分析(Regression)♦时间序列分析(TimeSeries)描述型(Descriptive)方法通常包含以下几种:♦关联分析(AssociationAnalysis)♦序列关联分析(SequentialAnalysis)♦聚类分析(Clustering)1.4.6数据管理平台主要的组件是HDFS和YARN。HDFS的介绍Hadoop分布式文件系统(HDFS)是运行在通用硬件上的分布式文件系统。HDFS提供了一个高度容错性和高吞吐量的海量数据存储解决方案。HDFS已经在各种大型在线服务和大型存储系统中得到广泛应用,已经成为海量数据存储的事实标准。随着信息系统的快速发展,海量的信息需要可靠存储的同时,还能被大量的使用者快速地访问。传统的存储方案已经从构架上越来越难以适应近几年来的信息系统业务的飞速发展,成为了业务发展的瓶颈和障碍。HDFS通过一个高效的分布式算法,将数据的访问和存储分布在大量服务器之中,在可乘地多备份存储的同时还能将访问分布在集群中的各个服务器之上,是传统存储构架的—个颠覆性的发展。HDFS可以提供以下特性:•可自我修复的分布式文件存储系统•高可扩展性,无需停机动态扩容•高可靠性,数据自动检测和复制•高吞吐量访问,消除访问瓶颈•使用低成本存储和服务器构建YARN的介绍YARN是下一代MapReduce,即MRv2,是在第一代MapReduce基础上演变而来的,主要是为了解决原始Hadoop扩展性较差,不支持多计算框架而提出的。它完全不同于HadoopMapReduce,所有代码全部重写而成。整个平台由ResourceManager(master,功能是资源分配)和NodeManager组成(slave,功能是节点管理)。较于HadoopMapReduce,其最大特点是将JobTracker拆分成ResourceManager和ApplicationMaster,其中ResourceManager是全局的资源管理器,仅负责资源分配(由于ResourceManager功能简单,所以不会严重制约系统的扩展性),而ApplicationMaster对应一个具体的application(如Hadoopjob,SparkJob等),主要负责application的资源申请,启动各个任务和运行状态监控(没有调度功能)。所以YARN,作为资源统一管理和调度平台,具有以下的特点•支持多种计算框架资源统一管理和调度平台应该提供一个全局的资源管理器。所有接入的框架要先向该全局资源管理器申请资源,申请成功之后,再由框架自身的调度器决定资源交由哪个任务使用,也就是说,整个大的系统是个双层调度器,第一层是统一管理和调度平台提供的,另外一层是框架自身的调度器。资源统一管理和调度平台应该提供资源隔离。不同的框架中的不同任务往往需要的资源(内存,CPU,网络10等)不同,它们运行在同一个集群中,会相互干扰,为此应该提供一种资源隔离机制避免任务之间由资源争用导致效率下降。•扩展性好现有的分布式计算框架都会将系统扩展性作为一个非常重要的设计目标,比如Hadoop,好的扩展性意味着系统能够随着业务的扩展线性扩展。资源统一管理和调度平台融入多种计算框架后,不应该破坏这种特性,也就是说,统一管理和调度平台不应该成为制约框架进行水平扩展。•容错性同扩展性类似,容错性也是当前分布式计算框架的一个重要设计目标,统一管理和调度平台在保持原有框架的容错特性基础上,自己本身也应具有良好的容错性。•高资源利用率如果采用静态资源分配,也就是每个计算框架分配一个集群,往往由于作业自身的特点或者作业提交频率等原因,集群利用率很低。当将各种框架部署到同一个大的集群中,进行统一管理和调度后,由于各种作业交错且作业提交频率大幅度升高,则为资源利用率的提升增加了机会。非结构化大数据管理及内容分析平台非结构化大数据管理及分析平台由以下几个主要功能模块组成:统一的非结构化数据管理模块,内容分析模块,报表/BI的连接及数据导出模块。外部的非结构化数据,包括文档,图片,音频,视频等形式的非结构化数据,通过上传,保存,归档等功能,保存在非结构化统一的内容管理平台中,内容管理由传统的数据库和HBase作为适用于不同类型业务的索引信息及元数据管理。小文件(主要包括文档,图片等)保存在传统的存储设备,比较大的文件,则保存在HDFS的分布式文件存储中。存储的管理.由内容管理模块中的存储设备管理和存储策略管理功能实现自动化。在传统存储中的小文件,由于生命周期等触发条件,可以由内容管理模块中的内容归档系统,打包保存到HDFS中。非结构化内容管理模块景点非结构化数据的快速管理。分别针对各个景点的资料,可以对接收景点大数据信息的进行模版化的快速创建。通过模版创建的分类管理,可以针对不同爭点,旅游局不同业务部门,快速建立对应的团队管理空间。

带有索引信息的非结构化数据的管理。保存非结构化数据的时候,保留适当的元数据索引信息,方便信息的快速查询。针对视频资料的管理,除了在原始文件的管理基础上,还利用大数据平台,进行各种编码的转换,适应在不同的终端上,景点的宣传播放。内容管理平台内置的详细的安全权限管理,达到不同景点,不同的部门间权限可控。ex所制修改廉性査送目录厘INK性||■醱✓✓O////□//✓✓口统一的内容管理平台具备不同存储设备的管理功能。如下,针对传统的存储,和HDFS的分布式存储,可以通过存储策略直接进行管理。StorageAreaFkedContentDevweFileSystemRDBMSji7HDFS *jStorageAreaFkedContentDevweFileSystemRDBMSji7HDFS *jExternalStorageDevices内容分析功能大数据内容分析功能模块,主要区分文本内容和音视频内容两类。针对文本内容,可以通过针对外部网站的爬虫,和内部非结构化统一管理平台爬虫,进行数据的统一爬取,同时进行统一的分析。分析的结果,不但可以直接通过分析界面进行展示,更可以导出到报表系统中,结合数据仓库的结构化数据,进行统一的报表和业务价值挖掘:内容分析可以从时间序列的维度进行总结,如下图:在不同的时间段,同样的内容是不一样的。例如通过分析各个旅游景点照片网上的发帖量,旅游攻略的阅读量等信息,通过以下的图片,可以直观的得到哪些月份会是游客高峰。还可以根据相应的参数,制定一些数据共识,对数据分析结果进行数学偏差的纠正。对各纬度信息的趋势进行评估。通过自动识别的地理位置信息,进行分析。热点抽取,可以根据某个景点的所有非结构化数据,进行大数据分析,得到景点的各种环境信息。通过各种大数据的集中,可以分析某个景点的游客的消费喜好。在景点的门票销售,促销方案,就可以在这些网站上进行推广。1.4.7数据访问平台主要的组件是Hive|Tez|Pig|Storm|Spark|HBase|Accumulo|SolrHive的介绍Hive是一种建立在Hadoop之上的数据仓库架构。它提供了:•—套方便的实施数据抽取(ETL)的工具。•—种让用户对数据描述其结构的机制。•支持用户对存储在Hadoop中的海量数据进行查询和分析的能力。Hive的基本特点是它采用HDFS进行数据存储并利用Map/Reduce框架进行数据操作。所以从本质上来说,Hive就是个编译器,它把用户的操作(查询或者ETL)变换成Map/Reduce任务,利用Map/Reduce框架执行这些任务以对HDFS上的海量数据进行处理。Hive被设计成一种批处理系统。它利用Map/Reduce框架来处理数据。因此,它在Map/Reduce任务提交和调度上有比较高的开销。即使对于小数据集(几百兆)来说,延迟也是分钟级的。但其最大的优点是延迟相对于数据集大小是线性增加的。Hive定义了一种简单的类SQL查询语言HiveQL,让熟悉SQL的用户可以非常容易的进行查询。与此同时,HiveQL也允许熟悉Map/Reduce框架的程序员在查询中插入自定义的mapper和reducer脚本以扩展Hive内嵌的功能,完成更复杂的分析。Tez的介绍Tez是Apache最新开源的支持DAG作业的计算框架,它直接源于MapReduce框架,核心思想是将Map和Reduce两个操作进一步拆分,即Map被拆分成Input、ProcessorsSort、Merge和0utput,Reduce被拆分成Input、ShufflesSort、Merge、Processor和Output等,这样,这些分解后的元操作可以任竟灵活组合,产生新的操作,这些操作经过一些控制程序组装后,可形成一个大的DAG作业。总结起来,Tez有以下特点•Apache二级开源项目(源代码今天发布的)•运行在YARN之上•适用于DAG(有向图)应用(同Impala、Dremel和Drill—样,可用于替换Hive/Pig等)Pig的介绍Pig的介绍Pig是一个基于Hadoop的大规模数据分析平台,它提供的SQL-LIKE语言叫PigLatin,该语言的编译器会把类SQL的数据分析请求转换为一系列经过优化处理的MapReduce运算。Pig为复杂的海量数据并行计算提供了一个简单的操作和编程接口。Pig自己实现的一套框架对输入、输出的人机交互部分的实现,就是PigLatinoZebra是Pig与HDFS/Hadoop的中间层、Zebra是MapReduce作业编写的客户端,Zerbra用结构化的语言实现了对hadoop物理存储元数据的管理也是对Hadoop的数据抽象层,在Zebra中有2个核心的类TableStore(写)/TableLoad(读)对Hadoop上的数据进行操作。Pig中的Streaming主要分为4个组件:l.PigLatin2.逻辑层(LogicalLayer)3.物理层(PhysicalLayer)4.Strearning具体实现(Implementation),Streaming会创建一个Map/Reduce作业,并把它发送给合适的集群,同时监视这个作业的在集群环境中的整个执行过程。MapReduce在每台机器上进行分布式计算的框架(算法)°HDFS最终存储数据的部分。Stonn的介绍Storm是一个开源的分布式实时计算系统,可以简单、可靠的处理大量的数据流。Storm有很多使用场景:如实时分析,在线机器学习,持续计算,分布式RPC,ETL等等。Storm支持水平扩展,具有高容错性,保证每个消息都会得到处理,而且处理速度很快(在一个小集群中,每个结点每秒可以处理数以百万计的消息)oStorm的部署和运维都很便捷,而且更为重要的是可以使用任意编程语言来开发应用。Storm有如下特点:•编程模型简单在大数据处理方面相信大家对hadoop已经耳熟能详,基于GoogleMap/Reduce来实现的Hadoop为开发者提供了map.reduce原语,使并行批处理程序变得非常地简单和优美。同样,Storm也为大数据的实时计算提供了一些简单优美的原语,这大大降低了开发并行实时处理的任务的复杂性,帮助你快速、高效的开发应用。•可扩展在Storm集群中真正运行topology的主要有三个实体:工作进程、线程和任务。Storm集群中的每台机器上都可以运行多个工作进程,每个工作进程又可创建多个线程,每个线程可以执行多个任务,任务是真正进行数据处理的实体,我们开发的spout、bolt就是作为一个或者多个任务的方式执行的。因此,计算任务在多个线程、进程和服务器之间并行进行,Spark的介绍支持灵活的水平扩展。•高可乘性Storm可以保证spout发出的每条消息都能被“完全处理:这也是直接区别于其他实时系统的地方,如S4。请注意,spout发出的消息后续可能会触发产生成千上万条消息,可以形象的理解为—棵消息树,其中spout发出的消息为树根,Storm会跟踪这棵消息树的处理情况,只有当这棵消息树中的所有消息都被处理了,Storm才会认为spout发出的这个消息已经被“完全处理”。如果这棵消息树中的任何一个消息处理失败了,或者整棵消息树在限定的时间内没有°完全处理”,那么spout发出的消息就会重发。考虑到尽可能减少对内存的消耗,Storm并不会跟踪消息树中的每个消息,而是采用了一些特殊的策略,它把消息树当作一个整体来跟踪,对消息树中所有消息的唯一id进行异或计算,通过是否为零来判定spout发岀的消息是否被“完全处理:这极大的节约了内存和简化了判定逻辑,后面会对这种机制进行详细介绍。这种模式,每发送一个消息,都会同步发送一个ack/fail,对于网络的带宽会有一定的消耗,如果对于可靠性要求不高,可通过使用不同的emit接口关闭该模式。上面所说的,Storm保证了每个消息至少被处理一次,但是对于有些计算场合,会严格要求每个消息只被处理一次,幸而Storm的070引入了事务性拓扑,解决了这个问题,后面会有详述。•高容错性如果在消息处理过程中岀了一些异常,Storm会重新安排这个出问题的处理单元。Storm保证一个处理单元永远运行(除非你显式杀掉这个处理单元)。当然,如果处理单元中存储了中间状态,那么当处理单元重新被Storm启动的时候,需要应用自己处理中间状态的恢复。•支持多种编程语言除了用java实现spout和bolt,你还可以使用任何你熟悉的编程语言来完成这项工作,这一切得益于Storm所谓的多语言协议。多语言协议是Storm内部的一种特殊协议,允许spout或者bolt使用标准输入和标准输出来进行消息传递,传递的消息为单行文本或者是json编码的多行。Storm支持多语言编程主要是通过ShellBolt.ShellSpout和ShellProcess这些类来实现的,这些类都实现了IBolt和ISpout接口,以及让shell通过java的ProcessBuilder类来执行脚本或者程序的协议。可以看到,采用这种方式,每个tuple在处理的时候都需要进行json的编解码,因此在吞吐量上会有较大影响。•支持本地模式Storm有一种“本地模式",也就是在进程中模拟一个Storm集群的所有功能,以本地模式运行topology跟在集群上运行topology类似,这对于我们开发和测试来说非常有用。•高效用ZeroMQ作为底层消息队列,保证消息能快速被处理Spark是一个基于内存计算的开源集群计算系统,目的是更快速的进行数据分析。Spark由加州伯克利大学AMP实验室Matei为主的小团队使用Scala开发开发,其核心部分的代码只有63个Scala文件,非常轻量级。Spark提供了与Hadoop相似的开源集群计算环境,但基于内存和迭代优化的设计,Spark在某些工作负载表现更优秀。在2014上半年,Spark开源生态系统得到了大幅增长,已成为大数据领域最活跃的开源项目之一,当下已活跃在HortonworkSxIBM、Cloudera、MapR和Pivotal等众多知名大数据公司。那么Spark究竟以什么吸引了如此多的关注,这里我们看向Dzone上的6个总结。1•轻量级快速处理。着眼大数据处理,速度往往被置于第一位,我们经常寻找能尽快处理我们数据的工具。Spark允许Hadoop集群中的应用程序在内存中以100倍的速度运行,即使在磁盘上运行也能快10倍。Spark通过减少磁盘10来达到性能提升,它们将中间处理数据全部放到了内存中。Spark使用了RDD(ResilientDistributedDataset)的理念,这允许它可以透明的内存中存储数据,只在需要时才持久化到磁盘。这种做法大大的减少了数据处理过程中磁盘的读写,大幅度的降低了所需时间。2•易于使用,Spark支持多语言。Spark允许Java、Scala及Python,这允许开发者在自己熟悉的语言环境下进行工作。它自带了80多个高等级操作符,允许在shell中进行交互式查询。3•支持复杂查询。在简单的“map”及-reduce”操作之外,Spark还支持SQL查询、流式查询及复杂查询,比如开箱即用的机器学习机图算法。同时,用户可以在同一个工作流中无缝的搭配这些能力。4•实时的流处理,对比MapReduce只能处理离线数据,Spark支持实时的流计算。Spark依赖SparkStreaming对数据进行实时的处理,当然在YARN之后Hadoop也可以借助其他的工具进行流式计算。对于SparkStreaming,Cloudera的评价是:简单:轻量级且具备功能强大的API,SparksStreaming允许你快速开发流应用程序°容错:不像其他的流解决方案,比如Storm,无需额外的代码和配置,SparkStreaming就可以做大量的恢复和交付工作。集成:为流处理和批处理重用了同样的代码,甚至可以将流数据保存到历史数据中。5.可以与Hadoop和已存Hadoop数据整合。Spark可以独立的运行,除了可以运行在当下的YARN集群管理之外,它还可以读取已有的任何Hadoop数据。这是个非常大的优势,它可以运行在任何Hadoop数据源上,比如HBase、HDFS等。这个特性让用户可以轻易迁移已有Hadoop应甩如果合适的话。6•活跃和无限壮大的社区。Spark起源于2009年,当下已有超过50个机构250个工程师贡献过代码,和去年六月相比,代码行数几乎扩大三倍,这是个令人艳羡的増长。Hbase的介绍HBase是一个构建在HDFS上的分布式列存储系统;是基于GoogleBigTable模型开发的,典型的key/value系统;是ApacheHadoop生态系统中的重要一员,主要用于海量结构化数据存储;从逻辑上讲,HBase将数据按照表、行和列进行存储。与hadoop一样,Hbase目标主要依免横向扩展,通过不断增加廉价的商用服务器,来增加计算和存储能力。Hbase表的特点•大:一个表可以有数十亿行,上百万列;•无模式:每行都有一个可排序的主键和任意多的列,列可以根据需要动态的増加,同一张表中不同的行可以有截然不同的列;•面向列:面向列(族)的存储和权限控制,列(族)独立检索;•稀疏:空(null)列并不占用存储空间,表可以设计的非常稀疏;•数据多版本:每个单元中的数据可以有多个版本,默认情况下版本号自动分配,是单元格插入时的时间戳;•数据类型单一:Hbase中的数据都是字符串,没有类型。Accumulo的介绍ApacheAccumulo是一个可靠的、可伸缩的、高性能的排序分布式的Key-Value存储解决方案,基于单元访问控制以及可定制的服务器端处理。使用GoogleBigTable设计思路,基于ApacheHadoop、Zookeeper和Thrift构建。Solr的介绍Solr是一个拥有象WebService—样接口的独立运行的搜索服务器。你将能够通过HTTP协议以XML格式将文档放入捜索服务器(这个过程叫做索引),你能够通过HTTP协议的GET来查询捜索服务器并且得到XML格式的结果。Solr的特性包括:•高级的全文捜索功能•专为高通量的网络流量进行的优化•基于开放接口(XML和HTTP)的标准•综合的HTML管理界面•可伸缩性-能够有效地复制到另外一个Solr搜索服务器•使用XML配置达到灵活性和适配性•可扩展的插件体系1.4.8数据管制和集成平台Falcon的介绍Falcon的介绍Falcon提供了一个用于治理和编排Hadoop内部和周边数据流的数据处理框架。该框架为获取和处理数据集、复制与保留数据集、重新定向位于非Hadoop扩展中的数据集、维护审核跟踪与沿袭提供了关键性的管控框架。Sqoop的介绍Sqoop是一个用来将Hadoop和关系型数据库中的数据相互转移的工具,可以将一个关系型数据库(例如:MySQL,Oracle,Postgres等)中的数据导进到Hadoop的HDFS中,也可以将HDFS的数据导进到关系型数据库中。Oozie的介绍Oozie是一个基于工作流引華的开源框架,是由Cloudera公司贡献给Apache的,它能够提供对HadoopMapReduce和PigJobs的任务调度与协调。Oozie需要部署到JavaServlet容器中运行。Oozie工作流定义,同JBossjBPM提供的jPDL—样,也提供了类似的流程定义语言hPDL,通过XML文件格式来实现流程的定义。对于工作流系统,一般都会有很多不同功能的节点,比如分支、并发、汇合等等,Oozie也有类似的一些概念。Oozie定义了控制流节点(ControlFlowNodes)和动作节点(ActionNodes),其中控制流节点定义了流程的开始和结束,以及控制流程的执行路径(ExecutionPath),如decision、fork、join等;而动作节点包括Hadoopmap-reducerHadoop文件系统、Pig、SSH、HTTP、eMail和Oozie子流程。Flume的介绍Flume是Cloudera公司的一款高性能、高可能的分布式日志收集系统。支持在系统中定制各类数据发送方,用于收集数据;同时,Flume提供对数据进行简单处理,并写到各种数据接受方(可定制)的能力。具有以下特性:(1)可靠性当节点出现故障时,日志能够被传送到其他节点上而不会丢失。Flume提供了三种级别的可靠性保障,从强到弱依次分别为:end-to-end(收到数据agent首先将event写到磁盘上,当数据传送成功后,再删除;如果数据发送失败,可以重新发送°),Storeonfailure(这也是scnbe采用的策略,当数据接收方crash时,将数据写到本地,待恢复后,继续发送),Besteffort(数据发送到接收方后,不会进行确认)。⑵可扩展性Flume采用了三层架构,分别为agent,collector和storage,每一层均可以水平扩展。其中,所有agent和collector由master统一管理这使得系统容易监控和维护,且master允许有多个(使用ZooKeeper进行管理和负载均衡),这就避免了单点故障问题。可管理性所有agent和colletor由master统一管理,这使得系统便于维护。多master情况,Flume利用ZooKeeper和gossip,保证动态配置数据的一致性。用户可以在master上查看各个数据源或者数据流执行情况,且可以对各个数据源配置和动态加载。Flume提供了web和shellscriptcommand两种形式对数据流进行管理。功能可扩展性用户可以根据需要添加自己的agent,collector或者storage。此夕卜,Flume自带了很多组件,包括各种agent(file,syslog等),collector和storage(file,HDFS等)1.4.9运营平台运营平台主要的组件是Ambari和ZookeeperAmbari的介绍ApacheAmbari是一种基于Web的工具,支持ApacheHadoop集群的供应、管理和监控oAmbari目前已支持大多数Hadoop组件,包括HDFS、MapReduce、Hive、Pig、Hbase、Zookeper、Sqoop和Hcatalog等。ApacheAmbari支持HDFS、MapReduce^Hive、Pig、Hbase、Zookeper、Sqoop和Hcatalog等的集中管理。也是5个顶级hadoop管理工具之一。Ambari主要取得了以下成绩:通过一步一步的安装向导简化了集群供应。预先配置好关键的运维指标(metrics),可以直接查看HadoopCore(HDFS和MapReduce)及相关项目(如HBase、Hive和HCatalog)是否健康。支持作业与任务执行的可视化与分析,能够更好地查看依赖和性能。通过一个完整的RESTfulAPI把监控信息暴露出来,集成了现有的运维工具。用户界面非常直观,用户可以轻松有效地查看信息并控制集群。Ambari使用Ganglia收集度量指标,用Nagios支持系统报警,当需要引起管理员的关注时(比如,节点停机或磁盘剩余空间不足等问题),系统将向其发送邮件。此外,Ambari能够安装安全的(基于Kerberos)Hadoop集群,以此实现了对Hadoop安全的支持,提供了基于角色的用户认证、授权和审计功能,并为用户管理集成了LDAP和ActiveDirectory

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论