数据科学导论 课件 第12章 大数据平台与云计算_第1页
数据科学导论 课件 第12章 大数据平台与云计算_第2页
数据科学导论 课件 第12章 大数据平台与云计算_第3页
数据科学导论 课件 第12章 大数据平台与云计算_第4页
数据科学导论 课件 第12章 大数据平台与云计算_第5页
已阅读5页,还剩11页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

第12章大数据平台与云计算12.1Hadoop生态系统Hadoop的原则对Hadoop的理解可以是一种哲学、一场运动,是管理和分析数据的现代化体系结构的发展。“Hadoop哲学”始终遵循以下原则:(1)转向分解软件堆栈,将每一层(存储、计算平台、批处理/实时/SQL计算框架等)构建为可组合的“乐高积木”,而不是单一且不灵活的软件栈,这从本质上不同于以垂直方式整合、具有定制存储格式、解析器、执行引擎等传统数据库。(2)转向用于大型分布式系统的商品硬件,而不再是专有/单片硬件+软件堆栈的架构,具有充分的可替代性和广泛的可获得性,成为“分而治之”得以实现的基础。(3)转向利用开放数据标准和开源技术,而不是专有的、供应商控制的技术。(4)转向灵活多变的技术生态系统,从而便于在每一层都能实现创新。Hadoop生态系统

经过时间的累积,Hadoop已经从最开始的两三个组件发展成一个拥有20多个部件的生态系统。俗话说“需求是发明之母”,Hadoop生态系统大家族的各个组件分别都是根据需求逐步加入的,这些得益于Hadoop的开源理念及许多大公司的贡献。Hadoop生态系统

整个Hadoop架构中除HDFS、MapReduce、HBase外,其他主要组件作用简单总结如下:Hive:由Facebook开源的数据仓库工具。Pig:由Yahoo开源的大规模数据分析工具,它提供的类似SQL的脚本语言PigLatin。Sqoop:数据ETL传递工具,主要用于在Hadoop、Hive与传统的数据库间进行数据的传递。Mahout:一个可扩展的机器学习和数据挖掘库。Flume:由Cloudera开源的分布式海量日志采集、聚合和传输的系统。Kafka:由Linkedin开源的分布式发布订阅消息系统,主要用于处理活跃的流式数据。Flink:大数据内存计算框架,用于实时计算的场景。Storm:用于实时计算,对数据流做连续查询,在计算时就将结果以流的形式输出。Oozie:管理Hadoop作业任务的工作流程调度管理系统。ZooKeeper:高效的可扩展的资源协调系统,提供不同Hadoop系统角色之间的工作协调。Ambari:Hadoop管理工具,可以快捷地监控、部署、管理集群。Spark内存计算框架

Spark内存计算框架的引入使得大数据生态圈更加完善。Spark的特色在于它首先为大数据应用提供了一个统一的平台,整合了主要的数据处理模式,并能够很好地与现在主流的大数据平台Hadoop集成,这样的一种统一平台带来的优势非常明显。技术洞察12.2:推荐系统的Hadoop实现

推荐策略中的两个关键问题分别是“召回”和“排序”。“召回”是指从全量信息中触发尽可能多的正确结果,并将正确结果返回给“排序”。主要的3种召回方法包括基于内容的召回、协同过滤、基于深度神经网络的方法等。这些算法及策略的实施都是通过底层的Hadoop框架来实现的。Hadoop与实时数据仓库

基于Hadoop的大数据分析与RDBMS共存的方案得到业界的共识,数据仓库和Hadoop平台互为补充,立足于满足客户在不同使用场景下的业务需求。百度流批一体整体方案应用案例12.1:基于阿里云的实时数据仓库基于阿里云的典型的数据仓库总体架构主要分为四层:操作数据层:存储原始数据,可能数据规整,需要进行ETL操作。数据明细层:数据比较原始的,但格式比较规范,可对外提供查询。数据汇总层:配合SparkSQL聚合数据(离线数据仓库)。应用数据层:业务应用服务层。第12章大数据平台与云计算12.2云计算与云服务云计算与云服务云计算是分布式计算的一种,通过网络“云”将巨大的数据计算处理程序分解成无数个小程序,然后,通过多部服务器组成的系统进行处理和分析,再将得到结果并返回给用户。云计算提供三类分层服务:(1)基础设施即服务IaaS(2)平台即服务PaaS(3)软件即服务SaaS面向分析的云服务

分析即服务AaaS(AnalyticsasaService)是一个可扩展的分析平台,使用基于交付模式,平台覆盖了从物理设备收集数据到数据可视化的所有功能。AaaS为企业提供了一个报告和分析的敏捷模型,使其可以专注于自己最擅长的事情,如各种BI和数据分析工具。百度深度学习开源云平台百度研发的面向企业级深度学习开源开放云平台“飞桨(PaddlePaddle)”是以百度多年的深度学习技术研究和业务应用为基础,集深度学习核心训练和推理框架、基础模型库、端到端开发套件、丰富工具组件于一体,是中国首个自主研发、功能丰富、开源开放的产业级深度学习平台。业务中台“中台”是由阿里在2015年提出的“大前台、小中台”战略中延申出来的概念,业务中台的设置可以将各业务部门重复建设的资源共享,相同业务的资源复用。数据中台所谓数据中台,就是通过数据技术对海量数据进行采集、计算及存储,同时进行统一标准和口径的处理。数据中台可以把数据统一之后形成了标准的大数据资产,进而为企业所有业务在线客户提供高效、一致的服务。AI中台(算法中台)“AI中台”其实是数据中台的一种全新的架构升级。首先,AI中台是数据中台智能化的一种衍生,为企业需要的算法模型提供了分步构建和全生命周期管理的服务,让企业可以将自己的业务不断沉淀为一个个算法模型,以达到复用、组合创新、规模化构建智能服务的目的。AI中台的核心其实就是机器学习算法平台。从数据中台到AI中台,正是体现了企业在推动业务数据化、流程自动化以及智能化的发展方向,与“中台”本身所暗含的“标准化、可复用”的理念是一脉相承的,但对于企业而言如何选择合适自己的“中台”架构和战略呢?中台并没有一个固定的模式,也没有一个可以照搬的成功样本。每一个企业的中台建设,都要根据企业自身的业务特点和组织架构的形态来进行顶层设计。阿里数加大数据

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论