版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
大数据时代
班级:电信111大数据简介数据正在迅速膨胀并变大,它决定着企业的未来发展,虽然很多企业可能并没有意识到数据爆炸性增长带来问题的隐患,但是随着时间的推移,人们将越来越多的意识到数据对企业的重要性。哈佛大学社会学教授加里·金说:“这是一场革命,庞大的数据资源使得各个领域开始了量化进程,无论学术界、商界还是政府,所有领域都将开始这种进程。”大数据简介随着云时代的来临,大数据(Bigdata)也吸引了越来越多的关注。大数据分析常和云计算联系到一起,因为实时的大型数据集分析需要像MapReduce(分布式计算)一样的框架来向数十、数百或甚至数千的电脑分配工作。大数据到底有多大?一组名为“互联网上一天”的数据告诉我们,一天之中,互联网产生的全部内容可以刻满1.68亿张DVD;发出的邮件有2940亿封之多(相当于美国两年的纸质信件数量);发出的社区帖子达200万个(相当于《时代》杂志770年的文字量);卖出的手机为37.8万台……这样的趋势会持续下去。我们现在还处于所谓“物联网”的最初级阶段,而随着技术成熟,我们的设备、交通工具和迅速发展的“可穿戴”科技将能互相连接与沟通。科技的进步已经使创造、捕捉和管理信息的成本降至2005年的六分之一,而从2005年起,用在硬件、软件、人才及服务之上的商业投资也增长了整整50%,达到了4000亿美元。四个特征数据量大(Volume)第一个特征是数据量大。大数据的起始计量单位至少是P(1000个T)、E(100万个T)或Z(10亿个T)。类型繁多(Variety)第二个特征是数据类型繁多。包括网络日志、音频、视频、图片、地理位置信息等等,多类型的数据对数据的处理能力提出了更高的要求。价值密度低(Value)第三个特征是数据价值密度相对较低。如随着物联网的广泛应用,信息感知无处不在,信息海量,但价值密度较低,如何通过强大的机器算法更迅速地完成数据的价值“提纯”,是大数据时代亟待解决的难题。速度快时效高(Velocity)第四个特征是处理速度快,时效性要求高。这是大数据区分于传统数据挖掘最显著的特征。大数据分析与处理方法介绍众所周知,大数据已经不简简单单是数据大的事实了,而最重要的现实是对大数据进行分析,只有通过分析才能获取很多智能的,深入的,有价值的信息。那么越来越多的应用涉及到大数据,而这些大数据的属性,包括数量,速度,多样性等等都是呈现了大数据不断增长的复杂性,所以大数据的分析方法在大数据领域就显得尤为重要,可以说是决定最终信息是否有价值的决定性因素。大数据分析的五个基本方面1.AnalyticVisualizations(可视化分析)不管是对数据分析专家还是普通用户,数据可视化是数据分析工具最基本的要求。可视化可以直观的展示数据,让数据自己说话,让观众听到结果。2.DataMiningAlgorithms(数据挖掘算法)可视化是给人看的,数据挖掘就是给机器看的。集群、分割、孤立点分析还有其他的算法让我们深入数据内部,挖掘价值。这些算法不仅要处理大数据的量,也要处理大数据的速度。3.PredictiveAnalyticCapabilities(预测性分析能力)数据挖掘可以让分析员更好的理解数据,而预测性分析可以让分析员根据可视化分析和数据挖掘的结果做出一些预测性的判断。大数据分析的五个基本方面4.SemanticEngines(语义引擎)我们知道由于非结构化数据的多样性带来了数据分析的新的挑战,我们需要一系列的工具去解析,提取,分析数据。语义引擎需要被设计成能够从“文档”中智能提取信息。5.DataQualityandMasterDataManagement(数据质量和数据管理)数据质量和数据管理是一些管理方面的最佳实践。通过标准化的流程和工具对数据进行处理,可以保证一个预先定义好的高质量的分析结果。大数据处理周涛博士说:大数据处理数据时代理念的三大转变:要全体不要抽样,要效率不要绝对精确,要相关不要因果。具体的大数据处理方法其实有很多,但是根据长时间的实践,此处总结了一个基本的大数据处理流程。整个处理流程可以概括为四步,分别是采集、导入和预处理、统计和分析,以及挖掘。采集:大数据的采集是指利用多个数据库来接收发自客户端(Web、App或者传感器形式等)的数据,并且用户可以通过这些数据库来进行简单的查询和处理工作。比如,电商会使用传统的关系型数据库MySQL和Oracle等来存储每一笔事务数据,除此之外,Redis和MongoDB这样的NoSQL数据库也常用于数据的采集。在大数据的采集过程中,其主要特点和挑战是并发数高,因为同时有可能会有成千上万的用户来进行访问和操作,比如火车票售票网站和淘宝,它们并发的访问量在峰值时达到上百万,所以需要在采集端部署大量数据库才能支撑。并且如何在这些数据库之间进行负载均衡和分片的确是需要深入的思考和设计。大数据处理导入/预处理:虽然采集端本身会有很多数据库,但是如果要对这些海量数据进行有效的分析,还是应该将这些来自前端的数据导入到一个集中的大型分布式数据库,或者分布式存储集群,并且可以在导入基础上做一些简单的清洗和预处理工作。导入与预处理过程的特点和挑战主要是导入的数据量大,每秒钟的导入量经常会达到百兆,甚至千兆级别。统计/分析:统计与分析主要利用分布式数据库,或者分布式计算集群来对存储于其内的海量数据进行普通的分析和分类汇总等,以满足大多数常见的分析需求,在这方面,一些实时性需求会用到EMC的GreenPlum、Oracle的Exadata,以及基于MySQL的列式存储Infobright等,而一些批处理,或者基于半结构化数据的需求可以使用Hadoop。统计与分析这部分的主要特点和挑战是分析涉及的数据量大,其对系统资源,特别是I/O会有极大的占用。大数据处理挖掘:与前面统计和分析过程不同的是,数据挖掘一般没有什么预先设定好的主题,主要是在现有数据上面进行基于各种算法的计算,从而起到预测(Predict)的效果,从而实现一些高级别数据分析的需求。比较典型算法有用于聚类的K-Means、用于统计学习的SVM和用于分类的NaiveBayes,主要使用的工具有Hadoop的Mahout等。该过程的特点和挑战主要是用于挖掘的算法很复杂,并且计算涉及的数据量和计算量都很大,还有,常用数据挖掘算法都以单线程为主。处理理和和分分析析工工具具用于于分分析析大大数数据据的的工工具具主主要要有有开开源源与与商商用用两两个个生生态态圈圈。。开源源大大数数据据生生态态圈圈::1、、HadoopHDFS、、HadoopMapReduce,HBase、、Hive渐渐次次诞诞生生,,早早期期Hadoop生生态态圈圈逐逐步步形形成成。。2、、.Hypertable是是另另类类。。它它存存在在于于Hadoop生生态态圈圈之之外外,,但但也也曾曾经经有有一一些些用用户户。。3、、NoSQL,,membase、、MongoDB商用用大大数数据据生生态态圈圈::1、、一一体体机机数数据据库库/数数据据仓仓库库::IBMPureData(Netezza),OracleExadata,SAPHana等等等等。。2、、数数据据仓仓库库::TeradataAsterData,EMCGreenPlum,HPVertica等等等等。。3、、数数据据集集市市::QlikView、、Tableau、、以以及及国国内内的的YonghongDataMart。。处理理和和分分析析工工具具Hadoop据IDC的预预测测,,全全球球大大数数据据市市场场2015年将将达达170亿美美元元规规模模,,市市场场发发展展前前景景很很大大。。而而Hadoop作为为新一一代代的的架架构构和和技技术术,,因因为为有有利利于于并并行行分分布布处处理理““大大数数据据””而而备备受受重重视视。。ApacheHadoop是一一个个用用java语言言实实现现的的软软件件框框架架,,在在由由大大量量计计算算机机组组成成的的集集群群中中运运行行海海量量数数据据的的分分布布式式计计算算,,它它可可以以让让应应用用程程序序支支持持上上千千个个节节点点和和PB级别别的的数数据据。。Hadoop是项项目目的的总总称称,,主主要要是是由由分分布布式式存存储储((HDFS)、、分分布布式式计计算算((MapReduce)等等组组成成。。优点点::可扩扩展展::不论论是是存存储储的的可可扩扩展展还还是是计计算算的的可可扩扩展展都都是是Hadoop的设设计计根根本本。。经济济::框架架可可以以运运行行在在任任何何普普通通的的PC上。。可靠靠::分布布式式文文件件系系统统的的备备份份恢恢复复机机制制以以及及MapReduce的任任务务监监控控保保证证了了分分布布式式处处理理的的可可靠靠性性。。高效效::分布布式式文文件件系系统统的的高高效效数数据据交交互互实实现现以以及及MapReduce结合合LocalData处理理的的模模式式,,为为高高效效处处理理海海量量的的信信息息作作了了基基础础准准备备。。处理理和和分分析析工工具具HadoopHadoop原原本本来来自自于于谷谷歌歌一一款款名名为为MapReduce的的编编程程模模型型包包。。谷谷歌歌的的MapReduce框框架架可可以以把把一一个个应应用用程程序序分分解解为为许许多多并并行行计计算算指指令令,,跨跨大大量量的的计计算算节节点点运运行行非非常常巨巨大大的的数数据据集集。。使使用用该该框框架架的的一一个个典典型型例例子子就就是是在在网网络络数数据据上上运运行行的的搜搜索索算算法法。。Hadoop实实现了一一个分布布式文件件系统((HadoopDistributedFileSystem),简简称HDFS。。HDFS有高高容错性性的特点点,并且且设计用用来部署署在低廉廉的(low-cost)硬硬件上;;而且它它提供高高吞吐量量(highthroughput)来来访问应应用程序序的数据据,适合合那些有有着超大大数据集集(largedataset)的应应用程序序。HDFS放放宽了((relax))POSIX的的要求,,可以以以流的形形式访问问(streamingaccess))文件系系统中的的数据。。Hadoop的的框架最最核心的的设计就就是:HDFS和MapReduce.HDFS为海量量的数据据提供了了存储,,则MapReduce为海海量的数数据提供供了计算算。MapReduceHDFSHBasePigChuKwaHiveZooKeeperHadoop体系架构构Pig是一个基基于Hadoop的大规模模数据分分析平台台,Pig为复杂的的海量数数据并行行计算提提供了一一个简易易的操作作和编程程接口Chukwa是基于Hadoop的集群监监控系统统,由yahoo贡献hive是基于Hadoop的一个工工具,提提供完整整的sql查询功能能,可以以将sql语句转换换为MapReduce任务进行行运行ZooKeeper:高效的的,可扩扩展的协协调系统统,存储和协协调关键键共享状状态HBase是一个开开源的,,基于列列存储模模型的分分布式数数据库HDFS是一个分分布式文文件系统统。有着着高容错错性的特特点,并并且设计计用来部部署在低低廉的硬硬件上,,适合那那些有着着超大数数据集的的应用程程序MapReduce是一种编编程模型型,用于于大规模模数据集集(大于于1TB)的并行行运算HDFS——分布式文文件系统统NameNode可以看作作是分布布式文件件系统中中的管理理者,存存储文件件系统的的meta-data,主要负负责管理理文件系系统的命命名空间间,集群群配置信信息,存存储块的的复制。。DataNode是文件存存储的基基本单元元。它存存储文件件块在本本地文件件系统中中,保存存了文件件块的meta-data,同时周周期性的的发送所所有存在在的文件件块的报报告给NameNode。Client就是需要要获取分分布式文文件系统统文件的的应用程程序。HDFS是一个高高度容错错性的分分布式文文件系统统,能提提供高吞吞吐量的的数据访访问,非非常适合合大规模模数据集集上的应应用。MapReduceMap:任务的的分解Reduce:结果的的汇总两大核心心设计HDFSNameNode:文件管管理DataNode:文件存存储Client:文件获获取Hadoop核心设计计HDFS具体操操作文件写入入:1.Client向向NameNode发发起文件件写入的的请求2.NameNode根据据文件大大小和文文件块配配置情况况,返回回给Client它所所管理部部分DataNode的信息息。3.Client将将文件划划分为多多个文件件块,根根据DataNode的地址址信息,,按顺序序写入到到每一个个DataNode块块中。文件读取取:1.Client向向NameNode发发起文件件读取的的请求2.NameNode返回回文件存存储的DataNode的信信息。3.Client读读取文件件信息。。MapReduce———映射、化化简编程程模型1.根据输入入数据的的大小和和参数的的设置把把数据分分成splits,每个split对于一个个map线程。2.Split中的数据据作为Map的输入,,Map的输出一一定在Map端。3.Map的输出到到Reduce的输入的的过程(shuffle过程):第一阶段段:在map端完成内内存->排序->写入磁盘盘->复制第二阶段段:在reduce端完成映映射到reduce端分区->合并->排序4.Reduce的输入到到Reduce的输出最后排好好序的key/value作为Reduce的输入,,输出不不一定是是在reduce端。MapReduce是一种编编程模型型,用于于大规模模数据集集的并行行运算。。Map(映射))和Reduce(化简)),采用用分而治治之思想想,先把把任务分分发到集集群多个个节点上上,并行行计算,,然后再再把计算算结果合合并,从从而得到到最终计计算结果果。多节节点计算算,所涉涉及的任任务调度度、负载载均衡、、容错处处理等,,都由MapReduce框架完成成,不需需要编程程人员关关心这些些内容。。HBASE———分布式数据存储储HBase––HadoopDatabase,是一个个高可靠靠性、高高性能、、面向列列、可伸伸缩的分分布式存存储系统统;HBase位于结构构化存储储层,HDFS为HBase提供了高高可靠性性的底层层存储支支持,MapReduce为HBase提供了高高性能的的计算能能力,Zookeeper为HBase提供了稳稳定服务务和failover机制;Pig和Hive还为HBase提供了高高层语言言支持,,使得在在HBase上进行数数据统计计处理变变的简单单。大数据行行业应用用金融行业业互联网医疗行业业能源行业业电信行业业政府行业业
随着互联网和移动互联网的发展,运营商的网络将会更加繁忙,用于
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 会计年度个人述职报告范文(20篇)
- 酒店疫情防控知识测试题及答案
- 2025-2026学年惠安县四年级数学第二学期期中达标检测试题(含答案)
- 眼钝挫伤相关试题及参考答案
- 单招语文会考试题及答案全解析
- 2025-2026学年山东省烟台市莱州市数学四年级下学期期中达标检测试题含答案
- 网络管理员专项试题及答案探讨
- 福建轻纺招聘试题及答案详情
- 净化师面试常考问题及详细答案
- 亚朵sop测试题及答案大全
- ICU患者血管活性药物应用
- 王牧犯罪学课件
- 长沙市机动车驾驶培训服务合同(2025年修订)
- 2025年企业财务咨询合同模板
- 物业项目经理培训课件
- 桃树的种植与管理
- 项目沟通培训课件模板
- 纸制品包装行业知识培训课件
- 红十字会初级救护员理论考试试题(附答案)
- 医院危险化学品培训知识课件
- 2025年中国银行招聘考试试题及答案
评论
0/150
提交评论