大数据基础知识讲义_第1页
大数据基础知识讲义_第2页
大数据基础知识讲义_第3页
大数据基础知识讲义_第4页
大数据基础知识讲义_第5页
已阅读5页,还剩1页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

大数据基础知识讲义一、大数据及大数据技术的相关概念大数据(BigData)的定义众说纷纭,从技术上讲它通常具备数据量大(volume)、数据类型多(variety)和数据处理和响应速度快(velocity)的特征。麦肯锡定义大数据为超过了常规数据库软件所能搜集、存储、管理和分析的规模的数据集。大数据技术可以认为是处理大数据以便从中获取价值的技术。大数据及其技术正在影响着IT产业,混合利用多种大数据技术并搭建能力开放的大数据平台是业界趋势。二、从经营分析系统发展为企业大数据平台随着信令数据、互联网数据等新型数据源的引入以及分析需求对分析深度和广度的增加,经营分析系统越来越具备大数据平台的特征。主要包括如下:(一)数据规模方面:GPRS流量话单的条数和数据量已经超过了语音话单,而位置信令、Gn信令、客服语音、互联网外部数据等规模更大,且还处在不断增长的趋势;(二)数据类型方面:逐步从OLTP系统中获得的结构化数据,过渡到结构化数据和互联网网页、上网日志等非结构化数据和半结构化数据共存;(三)对数据的使用方面:不仅有批量的数据加工和前台界面的访问,临时统计、数据挖掘、与生产系统实时互动等访问需求也逐步增多。为了进一步发挥大数据对内和对外的价值,公司基于经分分析系统发展建设了企业大数据平台,整合更多的数据、丰富更强大的技术能力、提供更开放的应用环境。三、企业大数据平台基础知识(一)大数据平台定位及目标企业级大数据平台是企业级大数据运营和管理平台,整合了公司各专业的结构化、半结构化、非结构化的海量数据,通过能力开放服务企业各级单位的业务需求,辅助企业各种经营决策,推进公司的业务发展。企业级大数据平台的建设目标包括三方面:1、搭平台:按照“统一架构、统一采集、统一存储、统一管理、统一服务”的原则,建设“一个平台、多个物理节点”的企业级大数据平台,实现体系架构的“逻辑集中”。2、治数据:整合全公司的各种数据资产,制定标准化数据模型,丰富元数据管理、数据质量功能,强化数据安全管理,构建完整的数据治理体系。建立标准的开发、维护规范,明确数据质量管理职责,支撑面向内部应用和外部服务的数据管理应用,实现数据资产的“可视、可管、可控”,加强数据资产运营管理能力。3、做服务:企业级大数据平台提供企业级决策支持能力,为内外部客户提供灵活的服务。服务的方式包括:软件即服务(SaaS)、平台即服务(PaaS)、数据即服务(DaaS)等。逐步建立基于企业级大数据平台的生产、消费、创新的多方参与“生态圈”,满足未来信息运营的需求。(二)大数据平台核心能力企业级大数据平台需要提供数据基础处理能力、系统平台管理能力、数据资产管理能力和应用共享开放能力四方面的核心能力:1、数据基础处理能力企业级大数据平台的数据基础处理能力包括:数据采集、数据存储、数据计算和数据交互。数据采集的数据源包括BSS、OSS、MSS三域的基础数据、DPI数据、业务平台数据以及第三方数据等,支持实时和非实时采集;数据存储和数据计算可支持不同种类的大数据处理技术,支持异构存储和运算;数据交互可支持不同类型的数据存储平台间的数据交互。2、系统平台管理能力企业级大数据平台的系统平台管理包括:支持“混搭架构”系统协同管理,满足“透明访问”需求;支持软硬件资源管理,诸如资源管理、负载管理、配额管理以及计量管理等;支持系统监控管理,包括:性能监控、设备告警等。3、数据资产管理能力企业级大数据平台的数据资产管理包括:梳理、规范、评估和治理企业数据资产,辅助数据价值挖掘,促进数据能力开放。数据资产管理通过元数据管理、数据质量管理、数据安全管理,梳理数据标准,评估数据价值,构建数据治理知识库,进行跨租户、跨时间、跨平台、跨任务的数据质量监控与管理。4、应用共享开放能力企业级大数据平台的应用共享开放包括:开发者管理门户、统一开发平台等功能。通过开发者管理门户实现注册认证、资源申请、数据申请、开发上线等功能的管理。统一开发平台借助图形化的开发界面,通过统一封装的函数库提供类SQL的开发语言,屏蔽底层差异性,降低开发门槛,实现快速的业务开发。(三)大数据平台技术架构企业级大数据平台的技术架构可包含Hadoop、MPP、DW和流处理等技术,各技术使用定位如下:1、Hadoop利用Hadoop技术实现企业级大数据平台中数据的并行ETL功能;实现清单等结构化数据、网络信令等非结构化数据的基础处理;提供海量数据的个性化应用环境,实现企业级大数据平台“沙盒”功能。2、MPP用于数据集市与数据挖掘,适用于多表联合复杂查询,面向个性化数据处理与服务支撑。3、DW用于企业级大数据平台的核心计算,面向企业级高性能数据处理,进行复杂汇总分析运算。4、流处理用于企业级大数据平台准实时、实时数据流的处理计算,面向企业级海量数据实时分析,实现实时营销等应用场景。(四)大数据平台功能架构企业级大数据平台各节点按照能力需求划分为数据源层、资源池层、数据采集/分发层、数据计算和存储层、能力开放层、数据运维和管理层、数据应用层,如图所示:1、数据源层数据源包括企业内部BSS、OSS、MSS三域各系统的明细级和汇总级数据,各业务平台数据,DPI数据以及企业外部的数据等。2、资源池层采用云计算等技术,整合计算、存储和网络等硬件资源向上层应用提供服务。3、数据采集和分发层以离线抽取和在线实时抽取的方式从数据源系统采集数据,将采集的数据(含DPI数据)按照数据种类分发至负责计算和存储的各类处理技术平台,并协调各平台之间的数据同步。4、数据计算和存储层采用传统数据仓库及多种不同类型的集群以适应各类海量结构化、非结构化数据存储和计算的要求,包括批处理的Hadoop集群、文件存储和查询的Hadoop集群、流处理集群、MPP集群、内存数据库集群。各集群及传统数据仓库之间可支持数据交互与透明访问,支持资源的多租户调用。5、能力开放层以透明数据层、OPENAPI、工具等三个层次对外提供服务。透明数据层屏蔽各计算和存储集群的复杂性。OPENAPI提供接口方式供各类应用调用。工具层提供自助报表、OLAP工具、数据挖掘、集成开发环境(IDE)等工具类服务。6、运维和管理层承担企业级大数据平台整体的管理和运维,包含数据质量管理、元数据管理、统一调度管理、多租户管理、资源池管理、权限管理、安全管理、系统运维管理等。7、数据应用层数据应用层提供的应用包括市场经营类应用、网络管理类应用和企业管理分析及对外服务类应用,构建于企业级大数据平台之上的公司各部门应用通过能力开放层使用数据。(五)大数据平台的服务提供模式企业级大数据平台提供服务的模式分为三种:SaaS、PaaS和DaaS。1、SaaS(SoftwareasaService,软件即服务)是按需求进行应用开发,提供指标、报表或专题分析,以应用的方式提供给需求方使用。SaaS使用者通常为无自行开发能力的需求方。2、PaaS(PlatformasaService,平台即服务)提供将使用者开发的应用,部署到云基础设施上的能力。这些应用是使用者通过使用平台提供的编程语言和提供的开发工具创建的,应用通过使用平台支持的接口实现数据的调用和交互。PaaS使用者可控制应用环境的配置,不必关注底层云基础设施(包括网络,服务器,操作系统或存储),只需关注所部署的应用。3、DaaS(DataasaService,数据即服务)是对各种数据进行不同程度“数据封装”,通过多种服务方式向不同应用提供数据服务,满足企业内外部用户的多样性数据请求。DaaS使用者通过标准化的访问接口建立数据服务请求,提升与内外部系统的互动和信息共享能力。(六)大数据平台Hadoop简介Hadoop的核心为HDFS(分布式文件系统)和MapReduce(离线计算框架)。简单来说,HDFS就是将要储存的文件分散在不同的硬盘上,并记录他们的位置,而MapReduce就是将计算任务分配给多个计算单元。1、HDFSHDFS已经成为现在大数据的储存标准,他适合储存一次写入,多次读取的数据,并且他有自动检错、快速回复数据的功能,能够避免数据因为硬盘损坏而丢失的危险。HDFS是由DataNode和NameNode组成的,DataNode负责储存数据,而NameNode负责管理数据,一个NameNode对应多个DataNode,NameNode记录着每个DataNode储存的数据内容,并曝露给上层系统调用,也会根据上层的指令对DataNode进行增、删、复制。2、MapReduceMapReduce是将计算任务分配给数据就近的处理节点,进行完运算后再合并导入结果,能很好的去进行大量数据的调取,但是延时较高,不适合处理实时流数据。它将复杂的、运行于大规模集群上的并行计算过程高度地抽象到了两个函数一一Map和Reduce上,并且允许用户在不了解分布式系统底层细节的情况下开发并行应用程序,并将其运行于廉价计算机集群上,完成海量数据的处理。通俗地说MapReduce的核心思想就是“分而治之”。MapReduce可以分为Map和Reduce两个处理步骤。首先Map将用户输入的指令解析出一个个的Key/Value,然后再将转化成一组新的KV值,将原本的任务拆解成小的而且是临近数据的,并且确保这些运算任务彼此不会影响。而Reduce则是将这些运算的结果汇总起来,将结果写入。3、YARN:资源管理框架,用来管理和调度CPU、内存的资源,避免所有的计算资源被某些任务大量占用,有点像是云管理平台可以创造不同的容器和虚拟机,并将这些硬件资源按用户的意愿分配给计算任务。4、Zookeeper:集用来做群管理,跟微服务里的功能相似,可以在集群里面选出一个leader,并保证集群里面服务器的一致性、可靠性和实时性。5、HiveHive是将Hadoop包装成使用简单的软件,用户可以用比较熟悉的SQL语言来调取数据,也就是说,Hive其实就是将Hadoop包装成MySQL。Hive适合使用在对实时性要求不高的结构化数据处理。像是每天、每周用户的登录次数、登录时间统计;每周用户增长比例之类的BI应用。6、HBaseHBase是用来储存和查询非结构化和半结构化数据的工具,利用rowkey的方式来访问数据。HBase适合处理大量的非结构化数据,例如图片、音频、视频等,在训练机器学习时,可以快速的透过标签将相对应的数据全部调出。7、Storm前面两个都是用来处理非实时的数据,对于某些讲求高实时性(毫秒级)的应用,就需要使用Storm。Storm也是具有容错和分布式计算的特性,架构为master-slave,可横向扩充多节点进行处理,每个节点每秒可以处理上百万条记录。可用在金融领域的风控上。8、AmbariAmbari是一种基于Web的工具,支持ApacheHadoop集群的安装、部署、配置和管理。Ambari目前已支持大多数Hadoop组件,包括HDFS、MapReduce、Hive、Pig、HBase、Zookeeper、Sqoop等。四、从企业大数据平台到企业数据中台中台是企业级能力复用平台,通过对企业信息化系统的架构解耦、服务组件化、能力平台化,实现对于细粒度能力的识别与平台化沉淀,实现企业能力的柔性复用,服务前台规模化创新,进而更好的响应服务引领用户,使企业真正做到自身能力与用户需求的持续对接。企业级能力中台以平台为支撑、数据为驱动,形成“数据-信息-决策-执行”的数据智能流动闭环,通过业务中台牵引容器化平台、数据中台、AI中台的共同演进实现能力联动,推进数据互通、能力共享,为网络、市场、服务、安全、管理全流程、全环节注智,实现网络运维智能化、业务营销智能化、用户服务智能化、运营管理智能化。并通过流程优化和管理完善,不断提升运营水平,提升经营效率,持续改进客户体验和价值创造,打造新的竞争优势。能力中台的建设不是另

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论