《Hadoop核心技术与大数据平台搭建》课件 单元1 大数据与Hadoop概述_第1页
《Hadoop核心技术与大数据平台搭建》课件 单元1 大数据与Hadoop概述_第2页
《Hadoop核心技术与大数据平台搭建》课件 单元1 大数据与Hadoop概述_第3页
《Hadoop核心技术与大数据平台搭建》课件 单元1 大数据与Hadoop概述_第4页
《Hadoop核心技术与大数据平台搭建》课件 单元1 大数据与Hadoop概述_第5页
已阅读5页,还剩69页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

单元1

大数据与Hadoop概述学习目标知识目标技能目标1.了解大数据相关概念及发展情况2.熟悉大数据关键技术3.了解Hadoop生态圈及常用组件4.了解大数据的应用领域及面临的挑战1.了解大数据的数据采集、存储、分析和结果呈现等基本处理流程2.掌握Hadoop基础三大核心组件相关功能,熟悉其他组件功能单元任务任务1.1认识大数据任务1.2大数据关键技术任务1.3大数据处理架构Hadoop任务1.4大数据产业技术和应用领域任务1.1认识大数据大数据定义大数据特征及存储换算大数据发展现状及助力因素通过本任务的学习,了解大数据技术的起源,掌握大数据定义、5V特征、大数据存储单位及其之间的换算关系。了解大数据发展现状及助力要素等。【关键步骤】【任务描述】维基百科:大数据是指利用常用软件工具捕获、管理和处理数据所耗时间超过可容忍时间的数据集。百度百科:大数据是指无法在一定时间范围内用常规软件工具进行捕捉、管理和处理的数据集合,是需要新处理模式才能具有更强的决策力、洞察发现力和流程优化能力的海量、高增长率和多样化的信息。MBA智库百科:是指无法在一定时间内用常规软件工具对其内容进行抓取、管理和处理的数据集合。大数据技术,是指从各种各样类型的数据中,快速获得有价值信息的能力。适用于大数据的技术,包括大规模并行处理(MPP)数据库,数据挖掘流程,分布式文件系统,分布式数据库,云计算平台,互联网,和可扩展的存储系统。Oracle:大数据指越来越庞大、越来越复杂的数据集,特别是来自全新数据源的数据集,其规模之大令传统数据处理软件束手无策,却能帮助我们解决以往非常棘手的业务难题。1.1.1大数据是什么4V+1V:体量巨大(Volume)--业界处理速度(Velocity)

--业界类型繁多(Variety)--业界价值密度低(Value)

--业界真实性(Veracity)-----IBM1.1.2大数据特征大数据的5V特点

大数据的5V特征随着当前时代的高速发展和互联网技术的普及,数据“大爆炸”时代已经来临,数据级从原先的TB级跃迁到PB、EB、ZB甚至更高。1)体量巨大Volume(容量大)存储单位之间换算关系:1Byte=8Bit1KB=1,024Bytes1MB=1,024KB=1,048,576Bytes1GB=1,024MB=1,048,576KB=1,073,741,824Bytes1TB=1,024GB=1,048,576MB=1,073,741,824KB=1,099,511,627,776Bytes1PB=1,024TB=1,048,576GB=1,125,899,906,842,624Bytes1EB=1,024PB=1,048,576TB=1,152,921,504,606,846,976Bytes1ZB=1,024EB=1,180,591,620,717.411,303,424Bytes1YB=1,024ZB=1,208,925,819,614,629,174,706,176Bytes1.1.2大数据特征

大数据的5V特征根据国际数据公司(IDC)的预测报告,全球数据量在2024年达到159.2ZB,预计到2028年将增至384.6ZB,年复合增长率为24.4%。数据的处理速度要快。价值是分子,那么时间就是分母,只有分母越小,单位价值就越大。2)处理速度Velocity(速度快)1.1.2大数据特征

大数据的5V特征2)处理速度Velocity(速度快)1.1.2大数据特征大容量数据来源主要有社交数据和机器数据

大数据的5V特征3)类型繁多Variety(种类多)大数据的数据种类从原先单一的文本数据,发展到如今的文档数据(txt、ppt、word、pdf等)、音频、照片、视频、震谱图等。从单一的结构化数据转变到结构化(10%)+非结构化数据(90%),数据的种类多种多样,复杂性高。1.1.2大数据特征

大数据的5V特征大数据的信息由于数据的庞大和种类繁多,但是实际所需要的信息却比较少,价值密度低。4)价值密度低Value1.1.2大数据特征

大数据的5V特征大数据的信息由于数据的庞大和种类繁多,但是实际所需要的信息却比较少,价值密度低。5)数据准确和可信赖Veracity1.1.2大数据特征

大数据的5V特征1.1.2大数据特征

大数据与数据库处理数据的对比比较项目数据库大数据数据规模小(以MB)为处理单位大(以GB、TB、PB为处理单位)数据类型单一(结构化为主)繁多(结构化、半结构化、非结构化)模式和数据的关系现有模式后有数据先有数据后有模式,模式随数据增多不断演变处理对象数据(池塘中的鱼)(“鱼”,通过某些“鱼”判断其他种类的“鱼”是否存在)处理工具OnesizefitsallNosizefitsall时代背景1.1.3大数据的发展助力从大的背景来看,第三次信息化浪潮涌动,催生了大数据时代全面到来。信息科技1.1.3大数据的发展助力信息科技的发展为大数据时代的到来提供了技术支撑新的生产技术和制造工艺使得硬件生产效率提高,生产成本降低物联网、云计算和各种AI人工智能等行业技术的发展存储设备容量不断增加,CPU处理能力大幅提升,网络带宽不断增加1.1.3.3理论引导1.1.3大数据的发展助力谷歌的三驾马车:2003年发表《Google文件系统》2004年发表《MapReduce:超大集群的简单数据处理》2006年发表《BigTable:结构化数据的分布式存储系统》这三篇论文奠定了大数据,称为大数据的始祖。1.1.3.4生态繁荣1.1.3大数据的发展助力由谷歌的三篇论文诞生了Hadoop,Hadoop是一个由Apache基金会所开发的开源的分布式系统基础架构,最初只有HDFS和MapReduce两个开源项目HDFS是受到了GFS的启发,成为Hadoop生态系统中的基石Hadoop的MapReduce框架是对谷歌的MapReduce模型的实现Hadoop的HBase是基于谷歌Bigtable的概念构建的,是一个面向列的分布式的可扩展的NoSQL数据库1.1.3.5国家战略1.1.3大数据的发展助力助推大数据发展还有一个重要因素,就是各个国家都很重视支持大数据的应用,并将大数据确立为国家战略:2012年,欧盟正式推出《数据价值链战略计划》,用大数据改造传统治理模式,降低公共部门成本,并促进经济增长和就业增长。2013年6月,美、英、法、德、意、加、日、俄在北爱尔兰召开G8峰会,发布了《开放数据宪章》,提出要加快推动数据开放和利用。2013年6月,日本安倍内阁发布了《创建最尖端IT国家宣言》,以开放大数据为核心的IT国家战略。2013年11月,英国政府发布《英国数据能力发展战略规划》,旨在利用数据产生商业价值、提振经济增长,承诺开放交通、天气、医疗方面的核心数据库。2015年10月,我国提出实施国家大数据战略,加快建设数字中国。党的十八届五中全会提出实施国家大数据发展战略,明确把大数据作为基础性战略资源,全面实施促进大数据发展行动,加快推动数据资源共享开放和开发应用,助力产业转型。任务1.2大数据关键技术大数据处理流程结构化、半结构化和非结构化数据理解常用大数据技术,大数据的数据类型和计算模式,了解大数据相关产业技术。【关键步骤】【任务描述】1.2.1大数据处理流程大数据处理流程功能数据采集与预处理利用ETL工具将分布的、异构数据源中的数据如关系数据、平面数据文件等,抽取到临时中间层后进行清洗、转换、集成,最后加载到数据仓库或数据集市中,成为联机分析处理、数据挖掘的基础;或者也可以把实时采集的数据作为流计算系统的输入,进行实时处理分析。数据存储和管理利用分布式文件系统、数据仓库、关系数据库、NoSQL数据库、云数据库等,实现对结构化、半结构化和非结构化海量数据的存储和管理。数据分析与结果呈现利用分布式并行编程模型和计算框架,结合机器学习和数据挖掘算法,实现对海量数据的处理和分析;对分析结果进行可视化呈现,帮助人们更好地理解数据、分析数据。数据安全和隐私保护在从大数据中挖掘潜在的巨大商业价值和学术价值的同时,构建数据安全体系和隐私数据保护体系,有效保护数据安全和个人隐私。大数据流程及功能数据采集数据预处理数据存储与管理数据分析结果呈现结构化、半结构化和非结构化数据1.2.2数据类型(1)结构化数据。结构化的数据是指可以使用关系型数据库表示和存储,表现为二维形式的数据。(2)半结构化数据。半结构化数据是结构化数据的一种形式,虽不符合关系型数据库或其他数据表的形式关联起来的数据模型结构,但包含相关标记,用来分隔语义元素以及对记录和字段进行分层。(3)非结构化数据。非结构化数据是数据结构不规则或不完整,没有预定义的数据模型,不方便用数据库二维表来表现的数据。序号姓名性别电话地址1张一女051783858300江苏省淮安市开发区枚乘东路8号2王二男051783858200江苏省淮安市清江浦区和平路2号3李三女051783858201江苏省淮安市淮安区翔宇大道80号<person>

<name>A</name>

<age>13</age>

<gender>female</gender></person>常见的非结构化数据包括视频、音频、图片、图像、文档、文本等。任务1.3大数据处理架构Hadoop

Hadoop平台。Hadoop生态系统及部分组件功能。Hadoop计算模式了解Hadoop生态系统构成,重点掌握基础三大组件相关原理功能。通过对其他组件功能的了解,尝试初步理解Hadoop的架构。【关键步骤】【任务描述】Hadoop是什么1.3.1Hadoop简介Hadoop是一个由Apache基金会所开发的分布式系统基础架构。它包含一个分布式计算框架MapRedeuce和分布式文件系统HDFS,Hadoop2.0版核心还包含一个分布式资源管理系统YARN。Hadoop是什么1.3.1Hadoop简介HadoopApache的开源分布式计算平台,底层细节对用户透明,是分布式基础架构基于Java语言开发,跨平台特性好,可部署在廉价计算机集群中核心是分布式文件系统HDFS、MapReduce和YARN

行业大数据标准开源软件,提供分布式海量数据处理能力主流厂商都围绕Hadoop提供开发工具、开源软件、商业化工具和技术服务,如谷歌、雅虎、微软、思科、淘宝、百度、网易、华为Hadoop特性1.3.2Hadoop特性支持多种语言高可靠性高效性高容错性高可扩展性低成本Linux平台Hadoop的特性Hadoop是能够对大量数据进行分布式处理的软件框架进行处理方式可靠、高效、可伸缩Hadoop版本演变1.3.3Hadoop版本ApacheHadoop版本分为两代,第一代Hadoop称为Hadoop1.0,第二代Hadoop称为Hadoop2.0第一代Hadoop包含三个大版本,分别是0.20.x,0.21.x和0.22.x,其中,0.20.x最后演化成1.0.x,变成了稳定版,而0.21.x和0.22.x则增加了NameNodeHA等新的重大特性第二代Hadoop包含两个版本,分别是0.23.x和2.x,它们完全不同于Hadoop1.0,是一套全新的架构,均包含HDFSFederation和YARN两个系统,相比于0.23.x,2.x增加了NameNodeHA和Wire-compatibility两个重大特性Hadoop版本1.3.3Hadoop版本Hadoop版本演变Hadoop版本1.3.3Hadoop版本Hadoop版本演变Hadoop版本1.3.3Hadoop版本Hadoop版本演变Hadoop2.0是基于JDK1.7开发的,而JDK1.7在2015年4月已停止更新,于是Hadoop社区基于JDK1.8重新发布了一个新的Hadoop版本,也就是Hadoop3.0。Hadoop3.0以后,JDK版本的最低依赖从1.7变成了1.8。Hadoop3.0中引入了一些重要的功能和优化,包括HDFS可擦除编码、多名称节点支持、任务级别的MapReduce本地优化、基于cgroup(controlgroups)的内存和磁盘IO隔离等。Hadoop其它版本1.3.3Hadoop版本主流厂商都围绕Hadoop提供开发工具、开源软件、商业化工具和技术服务1.3.3Hadoop版本Hadoop其它版本Cloudera:2008由来自Facebook、谷歌、雅虎、甲骨文4个工程师及高管创建.在Hadoop生态系统中,规模最大、知名度最高的公司则是ClouderaClouderaCDH:ClouderaDistributionHadoop1.3.3Hadoop版本Hadoop其它版本MapRMapR是MapRTechnologiesInc的一个产品,号称下一代Hadoop,使Hadoop速度更快、可靠性更高、更易于管理、使用更加方便,性能不断提高。2019年8月6日,被惠普企业收购1.3.3Hadoop版本Hadoop其它版本Hortonworks(/)基于Hadoop提供大数据服务致力于开发Hadoop框架内软件提升大数据的处理能力2011年7月由雅虎与VC机构合资组建。1.3.3Hadoop版本Hadoop其它版本FusionInsightFusionInsight是平台是华为开发是与Hadoop兼容的开源平台FusionInsightHD是一个融合的大数据平台,满足各种用户需求同时混合负载、开放应用1.3.3Hadoop版本选择Hadoop版本考虑因素选择Hadoop版本考虑因素是否开源(即是否免费)1是否有稳定版2是否经实践检验3是否有强大的社区支持21.3.3Hadoop版本Hadoop各种版本比较1.3.3Hadoop版本Hadoop其它版本Hadoop生态系统1.3.4Hadoop生态系统Hadoop的项目结构不断丰富发展,已经形成一个丰富的Hadoop生态系统。Hadoop包含多个子项目:HDFS、MapReduce、YARN、HBase、Hive、Pig、Mahout、Zookeeper、Flume、Sqoop、Ambari等。Hadoop2.0中新增HDFSHA和YARN。1)HDFS1.3.4Hadoop生态系统HDFS是Hadoop项目的三大核心之一,具有处理超大数据、流式处理、可以运行在廉价商用服务器上等优点。HDFS基于Google发布的GFS论文设计开发,其除具备其他分布式文件系统相同特性外,还有自己特有的特性:(1)高容错。认为硬件总是不可靠的。(2)高吞吐量。为有大量数据访问的应用提供高吞吐量支持。(3)大文件存储。支持存储TB-PB级别的数据。HDFS适合大文件存储和流式数据访问,不适合大量小文件处理、随机写入和低延迟读写等场景。2)MapReduce1.3.4Hadoop生态系统HadoopMapReduce也是Hadoop核心组件的三元组之一。用于大规模数据集(大于1TB)的并行运算,它将复杂的、运行于大规模集群上的并行计算过程高度抽象到了两个函数——Map和Reduce上,允许用户在不了解分布式文件系统底层细节的情况下开发并行应用程序,并将其运行于廉价计算机集群上,完成海量数据的处理。分布式并行编程模型,基于磁盘MapReduce把输入的数据集切分为若干独立的数据块,分发给一个主节点管理下的各个分节点来共同并行完成;最后,通过整合各个节点的中中间结果得到最后结果。HadoopMapReduce特性:(1)易于编程(2)良好的扩展性(3)高容错性(4)能对PB级以上海量数据进行离线处理3)YARN1.3.4Hadoop生态系统YARN也是Hadoop核心组件的三元组之一,用于作业调度和集群资源管理,为运行于Hadoop上的程序提供服务器运算资源。YARN框架是从Hadoop2.0版本引入的,弥补了Hadoop1.x版本中MapReduce框架的不足,解决了Hadoop1.x中JobTracker单点故障的问题,支持多种分布式运算框架,如Storm、Spark等可以在YARN上运行。YARN是一个通用资源管理系统,可为上层应用提供统一的资源管理和调度,它的引入为集群在利用率、资源统一管理和数据共享等方面带来了巨大好处。4)HBase1.3.4Hadoop生态系统HBase是一个提供高可靠性、高性能、可伸缩、实时读写、分布式的列式数据库,一般采用HDFS作为其底层数据存储。HBase与传统关系数据库的一个重要区别是,前者采用基于列的存储,而后者采用基于行的存储。HBase具有良好的横向扩展能力,可以通过不断增加廉价的商用服务器来增加存储能力。5)Hive1.3.4Hadoop生态系统Hive是一个基于Hadoop的数据仓库工具,可以用于对Hadoop文件中的数据集进行数据整理、特殊查询和分析存储。Hive的学习门槛较低,因为它提供了类似于关系数据库SQL语言的查询语言一HiveQL,可以通过HiveQL语句快速实现简单的MapReduce统计,Hive自身可以将HiveQL语句转换为MapReduce任务进行运行,而不必开发专门的MapReduce应用,适合数据仓库的统计分析。Hadoop上的数据仓库6)Mahout1.3.4Hadoop生态系统Mahout提供一些可扩展的机器学习领域经典算法实现,旨在帮助开发人员更加方便快捷地创建智能应用程序。Mahout包含聚类、分类、推荐过滤、频繁子项挖掘等许多实现,也可通过使用ApacheHadoop库,将Mahout有效扩展到云中。7)Zookeeper1.3.4Hadoop生态系统Zookeeper是一个高效和可靠的协同工作系统,提供分布式锁之类的基本服务,用于构建分布式应用,减轻分布式应用程序所承担的协调任务。Zookeeper使用Java编写,很容易编程接入,它使用了一个和文件树结构相似的数据模型,可以使用Java或者C来进行编程接入。提供分布式协调一致性服务8)Flume1.3.4Hadoop生态系统Flume是一个高可用的、高可靠的、分布式的海量日志采集、聚合和传输的系统。Flume支持在日志系统中定制各类数据发送方,用于收集数据;同时,Flume提供对数据进行简单处理并写到各种数据接受方的能力。9)Sqoop1.3.4Hadoop生态系统Sqoop是SQL-to-Hadoop的缩写,主要用来在Hadoop和关系数据库之间交换数据,可以改进数据的互操作性。通过Sqoop可以方便地将数据从MySQL、Oracle、PostgreSQL等关系数据库中导入Hadoop(可以导人HDFS、HBase或Hive),或者将数据从Hadoop导出到关系数据库,使得传统关系数据库和Hadoop之间的数据迁移变得非常方便。Sqoop主要通过JDBC(JavaDataBaseConnectivity)和关系数据库进行交互,理论上,支持JDBC的关系数据库都可以使Sqoop和Hadoop进行数据交互。Sqoop是专门为大数据集设计的,支持增量更新,可以将新记录添加到最近一次导出的数据源上,或者指定上次修改的时间戳。在Hadoop与传统数据库之间进行数据传递10)Ambari1.3.4Hadoop生态系统ApacheAmbari是由Apache软件基金会维护的开源项目。ApacheAmbari是一个开源的工具,专为简化Hadoop集群的部署、管理和监控而设计。它由Apache软件基金会维护,并在大数据生态系统中占据核心地位,尤其是在HDP(HortonworksDataPlatform)中。Ambari是一种基于Web的工具,支持Hadoop集群的安装、部署、配置和管理。Ambari目前已支持大多数Hadoop组件,包括HDFS、MapReduce、Hive、Pig、HBase、ZooKeeper、Sqoop等。离线批处理1.3.5Hadoop计算模式离线批处理是指对海量历史数据进行处理和分析,生成结果数据,供下一步业务应用使用的过程。批处理计算主要解决针对大规模数据的批量处理问题,是数据分析工作中常见的一类数据处理需求。MapReduce是具有代表性和影响力的大数据批处理技术,可以并行执行大规模数据处理任务,用于大规模数据集(大于1TB)的并行运算。Spark是一个针对超大数据集合的低延迟的集群分布式计算系统,比MapReduce的处理速度快许多。实时流处理1.3.5Hadoop计算模式实时流处理,是指对实时数据进行快速分析,迅速触发下一步动作的场景。实时数据对分析处理速度要求极高,数据处理规模巨大,对CPU和内存要求很高,但是通常数据不落地,对存储能力要求不高。流数据(或数据流)是指在时间分布和数量上无限的一系列动态数据集合体,数据的价值随着时间的流逝而降低,必须采用实时计算的方式给出秒级响应。流式计算可以实时处理来自不同数据源的、连续到达的流数据,经过实时分析处理,给出有价值的分析结果。交互式查询1.3.5Hadoop计算模式交互式查询,是指对数据进行交互式分析和查询的过程,查询响应要求较高,能够实现人机之间的交互,查询通常比较复杂。交互式查询的数据通常已经被预处理过,按照适合交互式查询的数据模型进行组织。交互式查询的数据量巨大,对CPU和内存要求很高,对存储要求也很高。谷歌公司开发的Dremel是一种可扩展的、交互式的实时查询系统,用于只读嵌套数据的分析。通过结合多级树状执行过程和列式数据结构,它能在几秒内完成对万亿张表的聚合查询。实时检索1.3.5Hadoop计算模式实时检索就是根据关键词对系统内的一些信息进行快速搜索,实现即搜即得的效果,强调的是实时、低延迟实时检索能够方便人们快速获得搜索的结果,而这些结果往往才是人们真正关心的、可用的数据。实时检索通常对实时写入的海量数据基于索引主键进行实时查询,对查询响应要求较高,查询条件相对比较简单。任务1.4大数据产业技术和应用领域大数据产业技术。大数据的应用案例大数据时代企业面临的挑战。了解大数据在各行各业中的具体应用;理解大数据在蓬勃发展的同时企业所面临的各种挑战。【关键步骤】【任务描述】大数据产业链1.4.1大数据产业技术产业链环节包含内容IT基础设施层包括提供硬件、软件、网络等基础设施以及提供咨询、规划和系统集成服务的企业,比如,提供数据中心解决方案的IBM、惠普和戴尔等,提供存储解决方案的EMC,提供虚拟化管理软件的微软、思杰、SUN、RedHat等数据源层包括但不限于交易数据、传感器数据、社交媒体数据、互联网数据、传统数据和地理空间数据等。交易数据如POS机数据、信用卡刷卡数据等;传感器采集的温度、湿度、压力等数据;社交媒体平台(如微博、微信、Facebook等)每天产生海量的数据,包括用户发布的文字、图片、视频等内容;互联网的网页、博客、论坛等可以用于分析用户行为、推荐系统等;传统数据(如企业数据库、政府数据等)规模庞大、多样化;GPS定位数据、卫星遥感数据等地理空间数据。数据管理层包括数据抽取、转换、存储和管理等服务的各类企业或产品,比如分布式文件系统(如Hadoop的HDFS和谷歌的GFS)、ETL工具(Informatica、Datastage、Kettle等)、数据库和数据仓库(Oracle、MySQL、SQLServer、HBase、GreenPlum等)数据分析层包括提供分布式计算、数据挖掘、统计分析等服务的各类企业或产品,比如,分布式计算框架MapReduce、统计分析软件SPSS和SAS、数据挖掘工具Weka、数据可视化工具Tableau、BI工具(MicroStrategy、Cognos、BO)等数据平台层包括提供数据分享平台、数据分析平台、数据租售平台等服务的企业或产品,比如阿里巴巴、谷歌、中国电信、百度等数据应用层包括提供智能交通、智慧医疗、智能物流、智能电网等行业应用的企业、机构或政府部门,比如交通主管部门、各大医疗机构、菜鸟网络、国家电网等大数据产业范围1.4.1大数据产业技术大数据在政治选举中的应用1.4.2大数据应用案例大数据心理学分析帮助特朗普赢得美国大选●特朗普聘用CA公司对美国选民进行性格和需求分析,掌握了2.2亿美国人的个性。●利用选民在Facebook上的点赞行为,分析出他的性格特征及政治取向,将选民分为三类:共和党支持者、民主党支持者、摇摆者,重点拉拢摇摆不定的选民。●特朗普以前从没发过电子邮件,甚至在参加总统选举后才第一次购买智能手机,并迷上了发推特,而且他发出的每一条推特都是数据驱动的。针对不同的选民,都会有不同的微调版本。●针对非洲裔美国人,他们可以看到希拉里把黑人称为捕食者的视频,从而远离希拉里的投票箱,这些黑暗的帖子都是只有特定用户可见。大数据在金融领域的应用1.4.2大数据应用案例大数据在金融领域的应用已覆盖风险管理、智能营销、信用评估、智能交易等多个核心场景典型案例包括工商银行智能对话交易系统、淘宝信用贷款精准授信、IBM股价预测模型等。淘宝的千人千面系统1.4.2大数据应用案例淘宝系统中储存的数据量是巨大的,淘宝的千人千面系统满足了不同用户在淘宝上购物时的不同需求,它将用户进行画像和分类,以精准的人群标签来区分每个用户,并为这些用户推荐符合其喜好的商品,极大地提升了用户的购物体验。正是靠着大数据的魔力,淘宝才能开发出千人千面系统,为用户提供更好的购物体验。大数据在滴滴出行车辆调度系统中应用1.4.2大数据应用案例滴滴的后台数据库中储存着数千万条车辆信息,能够从海量车辆信息中迅速找到距离用户最近的车辆,并结合周边路况和路程的远近,筛选出最佳选择。被选中的滴滴司机能够及时看到订单需求,快速接单并抵达用户所在位置,这大大缩短了用户的等待时间,提升了乘车体验。依托于用户、司机、车辆信息以及周边路况和路程等大数据,滴滴才能为用户提供更为出色的乘车服务。

01前沿趋势大数据前沿趋势及挑战1.4.3

01前沿趋势大数据前沿趋势及挑战AI时代GoogleBrain(谷歌大脑项目),始于2011年,专注最先进的深度学习技术,以拓展感知和语言理解可能性的边界。谷歌研发的AI智能机器人(AlphaGo)通过人机大战,获得了巨大的品牌效应,也大大推动了AI进程。1.4.3

01前沿趋势大数据前沿趋势及挑战大数据云将云计算和大数据结合在一-起,将大数据的存储和分析处理全部迁移到云上,让大数据分析更任性。2017年双11又创造了新纪录,全天,交易额1682亿,交易峰值32.5万笔/秒,支付峰值25.6W笔/秒。1.4.3

02企业面临的挑战大数据前沿趋势及挑战挑战一业务部门无清晰的大数据需求很多企业业务部门不了大数据,也不了解大数据的应用场景和价值,因此难以提出大数据的准确需求。由于业务部]需求不清晰,大数据部门又是非盈利部门,企业决策层担心投入产出比不高,在搭建大数据部门]时犹豫不决,甚至由于暂时没有应用场景,删除了很多有价值的历史数据。1.4.3

02企业面临的挑战大数据前沿趋势及挑战挑战二企业内部数据孤岛严重企业启动大数据最重要的挑战就是数据的碎片化。在大型企业中,不同类型的数据常常散落在不同部门],使得同一企业内部数据无法共享,无法发挥大数据的价值。1.4.3

02企业面临的挑战大数据前沿趋势及挑战挑战三

数据可用性低,质量差很多大中型企业每天会产生大量的数据,但很多企业在大数据的预处理阶段很不重视,导致数据处理很不规范。大数据预处理阶段需要抽取数据把数据转化为方便处理的数据类型,对数据进行清洗和去噪,以提取有效的数据等操作。Sybase的数据表明,高质量的数据可用性提高10%,企业效益提高10%以上。。1.4.3

02企业面临的挑战大数据前沿趋势及挑战挑战四

数据相关管理技术和架构传统的数据库部署不能处理TB级别的数据。传统的数据库没有考虑数据的多样性,尤其对结构化数据,半结构化数据和非结构化数据的兼容。传统的数据库对数据处理时间要求不高,而大数据需要实时处理数据

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论