版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
第3章大数据关键技术与应用3.1大数据技术总体框架3.2大数据存储技术3.3大数据处理技术3.4大数据分析技术重点:大数据存储技术大数据处理技术大数据分析技术本章重点云计算是新的商业模式。大数据的本质是应需求驱动的,大数据的应用最终使云计算模式落地。大数据来源于互联网、企业系统和物联网等信息系统,经过大数据处理系统的分析挖掘,产生新的知识用以支撑决策或业务的自动智能化运转。大数据对数据存储、处理和分析三个环节影响较大,需要对技术架构和算法进行重构,是当前和未来一段时间大数据技术创新的焦点。3.1大数据技术总体框架3.1.1总体目标
业务环节业务需求技术实现产生大数据操作数据容量:每18个月翻一番数据类型:多于80%的数据来自于非机构化数据数据速度:数据来源不断变化,数据快速流通采用一个统一的大数据处理方法,使得企业用户能够快速处理和加载海量数据,能够在统一平台上对不同类型的数据进行处理和存储聚集管理大数据的复杂性,需要分类、同步、聚合、集成、共享、转换、剖析、迁移、压缩、备份、保护、恢复、清洗、淘汰各种类型数据一个数据集成和管理平台,集成各种工具和服务来管理异构存储环境下的各类数据分析当前数据仓库和数据挖掘擅长分析结构化的事后数据,在大数据环境下要求能够分析非结构化数据,包括流文件,并能进行实时分析和预测建立一个实时预测分析解决方案,整合结构化的数据仓库和非结构化的分析工具利用满足不同的用户对大数据的实时的多种访问方式任何时间、任何地点、任何设备上的集中共享和协同需要理解大数据怎样影响业务,怎样转化为行动对大数据影响业务和战略进行建模,并利用技术来实现这些模型3.1.2架构设计原则
3.1.3总体架构的特点大数据技术架构具备集成性、架构先进性和实时性等特点。1.统一、开发、集成的大数据平台可基于开源软件实现Hadoop基础工具的整合;能与关系型数据库、数据仓库通过JDBC/ODBC连接器进行连接;能支持地理分布的在线用户和程序,并行执行从查询到战略分析的请求;用户友好的管理平台,包括HDFS浏览器和类SQL查询语言等;提供服务、存储、调度和高级安全等企业级应用的功能。2.低成本的可扩展性支持大规模可扩展性,到PB级数据源;支持极大的混合工具负载,各种数据类型包括任意层次的数据结构、图像、日志等;节点间无共享(sharing-nothing)的集群数据库体系结构;可编程和可扩展的应用服务器;简单的配置、开发和管理;以线性成本扩展并提供一致的性能;标准的普通硬件。3.实时地分析执行在声明或发现数据结构之前装载数据;能以数据全载入的速度来准确更新数据;可调度和执行复杂的几百个节点的工作流;在刚装载的数据上,可实时执行流分析查询;能以大于每秒1GB的速率来分析数据。4.可靠性当处理节点失效时,自动恢复并保持流程连续,不需要中断操作。3.2.1大数据如何存储3.2大数据存储技术按照数据的结构不同,数据可以被分为结构化的大数据、非结构化的大数据和半结构化的大数据。1、结构化数据存储结构化数据通常是人们所熟悉的数据库中的数据,它本身就是一种对现实已发生事项的关键要素进行抽取的有价信息。数据库中积累的结构化数据越来越多,一些问题显现出来,这些问题可以分为四类:1)历史数据和当前数据都存在一个数据库中,导致系统处理速度越来越慢;2)历史数据与当前数据的期限如何界定;3)历史数据应如何存储;4)历史数据的二次增值如何解决。3.2.1大数据如何存储分布式数据库系统是数据库技术和网络技术相结合的产物。它通常使用体积较小的计算机系统,每台计算机可单独放在一个地方,每台计算机中都有DBMS的一份完整的副本,并具有自己局部的数据库。位于不同地点的许多计算机通过网络互相连接,共同组成一个完整的。全局的大型数据库。分布式数据库系统具有以下主要特点:1)物理分布性:数据不是存储在一个场地上,而是存储在计算机网络的多个场地上;2)逻辑整体性:数据物理分布在各个场地上,但逻辑上是一个整体,它们被所有的用户(全局用户)共享,并由一个主节点统一管理;3)具有灵活的体系结构,适应分布式的管理和控制机构;4)适当增加数据冗余度,系统的可靠性高,可用性好;5)可扩展性好,易于集成现有的系统。3.2.1大数据如何存储2、非结构化数据存储常见的非结构化数据包括文件、图片、视频、语音、邮件和聊天记录等,和结构化数据相比,这些数据是未被抽象出有价值信息的数据,需要经过二次加工才能得到其有价值信息。由于非结构化数据的生产不受格式约束、不受主题约束,人人随时都可以根据自己的视角和观点进行创作生产,所以数据量比结构化数据大。3.2.1大数据如何存储由于非结构化数据具有形式多样、体量大、来源广、维度多、有价内容密度低、分析意义大等特点,所以要为了分析而存储,而不是为了存储而存储,即存储工作是分析的前置工作。当前针对非结构化数据的特点均采用分布式文件系统方式来存储这些数据。分布式文件系统将数据存储在物理上分散的多个存储节点上,对这些节点的资源进行统一管理和分配,并向用户提供文件系统访问接口,主要解决本地文件系统在文件大小、文件数量、打开文件数等的限制问题。3.2.1大数据如何存储分布式文件系统的数据存储解决方案归根结底是将大问题划分为小问题。大量的文件均分布到多个数据服务器上后,每个数据库服务器存储的文件数量就少了。此外,还能将单个服务器桑存储的文件数降到单机能解决的规模;对于很大的文件,可以将大文件划分成多个相对较小的片段,存储在多个数据服务器上。3.2.1大数据如何存储3.2.1大数据如何存储3.半结构化数据存储半结构化数据是指数据中既有结构化数据,也有非结构化数据,比如,摄像头回转给后端的数据中有位置、时间等结构化数据,还有图片等非结构化数据。这些数据是以数据流的形式传递的,所以半结构化数据也叫流数据。对流数据进行处理的系统叫做数据流系统。数据流的特点是数据不是永久存储在数据库中的静态数据,而是瞬时处理的源源不断的连续数据流。在大量的数据流应用系统中,数据流来自于地理上不同位置的数据源,非常适合分布式查询处理。(2)知名标准化组织和协会积极开展云计算标准研制(3)新兴标准化组织和协会有序推动云计算标准研制3.2.1大数据如何存储大数据存储对底层硬件架构和文件系统在性价比上的要求要大大高于传统技术,同时要求能够弹性扩展存储容量。但以往网络附着存储系统(NAS)和存储区域网络(SAN)等体系,存储和计算的物理设备分离,它们之间要通过网络接口连接,这导致在进行数据密集型计算时I/O容易成为瓶颈。3.2.2大数据存储问题对于大数据存储,以下问题不能忽视。容量问题延迟问题安全问题成本问题数据的积累灵活性应用感知针对小用户3.2.2大数据存储问题3.3大数据处理技术3.3.1storm平台Storm是由BackType开发的实时处理系统,BackType现在已在Twitter麾下。Storm为分布式实时计算提供了一组通用原语,可被用于“流处理”之中,实时处理消息并更新数据库。这是管理队列及工作者集群的另一种方式。Storm也可被用于“连续计算”。在计算时就将结果以流的形式输出给用户。它还可被用于“分布式RPC”,以并行的方式运行昂贵的运算。Storm可以方便地在一个计算机集群中编写与扩展复杂的实时计算,Storm保证每个消息都会得到处理,而且速度很快,在一个小集群中,每秒可以处理数以百万计的消息。
Storm的主要特点简单的编程模型可以使用各种编程语言容错性水平扩展可靠的消息处理快速本地模式Storm的集群架构
Storm集群由一个主节点和多个工作节点组成:master节点和worker节点。master节点运行一个守护进程,叫Nimbus,类似Hadoop中的JobTracker。Nimbus负责在集群中分发代码,分配任务,以及故障检测。每个worker节点运行一个守护进程,叫Supervisor。Supervisor监听分配到该服务器的任务,开始和结束工作进程。每个worker进程执行topology的一个子集;一个运行中的topology由许多分布在多台机器上的worker进程组成。Nimbus和Supervisors之间是通过Zookeeper协调。此外,Nimbus和Supervisor是能快速失败(fail-fast)和无状态的(stateless);所有的状态都保存在Zookeeper或者在本地磁盘中。当Nimbus或者Supervisors出现问题重启后会自动恢复,好像什么也没发生过。这项设计使得Storm集群变得非常稳定健壮。
Storm集群架构
Storm的缺点
1)编程门槛对普通用户来说较高2)框架本身不提供持久化存储3)框架不提供消息接入模块4)StormUI功能过于简单5)Bolt复用困难6)存在Nimbus单点失效问题7)Topology不支持动态部署3.4.1“大数据”分析特点及技术路线3.3大数据分析技术大数据分析具有五个特点:1)大数据分析应是可视化分析2)大数据分析的理论核心是数据挖掘算法3)大数据分析最重要的应用领域之一就是预测性分析4)大数据分析广泛应用于网络数据挖掘5)大数据分析离不开数据质量和数据管理2.大数据分析技术路线目前的大数据分析主要有两条技术路线,一是凭借先验知识人工建立数学模型来分析数据,二是通过建立人工智能系统,使用大量样本数据进行训练,让机器代替人工获得从数据中提取知识的能力。3.4.2“大数据”分析过程数据分析过程的主要活动由识别信息需求、收集数据、分析数据、评价并改进数据分析的有效性组成。3.4.3“大数据”分析方法数据分析是指用适当的统计分析方法对收集来的大量数据进行分析,将它们加以汇总和理解并消化,以求最大化地开发数据的功能,发挥数据的作用。数据分析是为了提取有用信息和形成结论而对数据加以详细研究和概括总结的过程。数据也称观测值,是实验、测量、观察、调查等的结果。数据分析中所处理的数据分为定性数据和定量数据。大数据分析的研究对象是大数据,它侧重于在海量数据中的分析挖掘出有用的信息。对应于大数据分析的两条技术路线其分析方法可分为两类:一是统计分析方法,另一个是数据挖掘方法。1.统计分析方法1)描述性统计分析2)回归分析3)因子分析4)方差分析2.数据挖掘方法1)分类和预测2)关联规则3)聚类3.统计分析和数据挖掘的联系与区别1)统计分析和数据挖掘的联系从两者的理论来源来看,它们都源于统计理论基础理论,因此它们的许多方法在很多情况下都是同根同源的。比如,概率论和随机事件是统计学的核心理论之一,统计分析中的抽样估计需要应用该理论,而在数据挖掘技术的贝叶斯分类中,就是这些统计理论的发展和延伸。2)统计分析和数据挖掘的区别统计分析的基础之一是概率论,在对数据进行统计分析时,分析人员常常需要对数据分布和变量间的关系做假设,确定用什么概率函数来描述变量间的关系,以及如何检验参数的统计显著性;但是在数据挖掘的应用中,分析人员不需要对数据分布做任何假设,数据挖掘的算法会自动寻找变量间的关系。因此,相对于海量、杂乱的数据,数据挖掘技术有明显的应用优势。3.5全球大数据公司盘点
IBM网址:/上线时间:2011年5月公司建址:美国纽约州阿蒙克市业务方向:主要面向大企业等市场亚马逊网址:/上线时间:2009年公司地址:美国华盛顿州西雅图业务方向:主要面向大企业等市场3.5全球大数据公司盘点
甲骨文网址:/上线时间:2010年公司地址:美国加利福尼亚州红木滩业务方向:主要面向大企业等市场3.5全球大数据公司盘点
谷歌网址:/上线时间:2011年公司地址:美国加利福尼亚州山景城融资状况:谷歌业务业务方向:面向各类企业市场3.5全球大数据公司盘点
微软网址:/上线时间:2011年公司地址:美国华盛顿州雷德蒙市业务方向:面向各类企业3.5全球大数据公司盘点
EMC网址:/上线时间:不详公司地址::美国马萨诸塞州Hopkinton市业务方向:面向各类企业市场3.5全球大数据公司盘点
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 智能物流车项目运营管理方案
- 数控铣床年度维保工作计划方案
- 康复护理服务定价扩容调整方案
- 功能性饮料生产线项目商业计划书
- 2025年沈阳市东陵区(中小学、幼儿园)教师招聘考试试题及答案详解
- 私域社群运营与转化实操手册
- 老旧小区改造绿色建材应用方案
- 2026年涪陵区(中小学、幼儿园)教师招聘笔试参考题库及答案详解
- 住宅厨卫给水管试压冲洗方案
- 预制构件生产能耗管控作业规范
- 老年高血压合并前列腺增生症多病共存降压方案
- 超声波培训课件
- 中国科学技术大学研究生学位论文撰写规范
- 中心静脉导管冲管及封管专家共识解读2025
- 神经内科科室宣传课件
- 病历书写基本规范2025年版
- 高价值专利培训课件
- 中国心房颤动管理指南2025解读
- 急诊专科护士成果汇报
- 妊娠合并泌尿系感染临床处理指南
- 2024年高考全国甲卷理综物理真题【解析版】
评论
0/150
提交评论