大数据处理-第1章 大数据处理基础_第1页
大数据处理-第1章 大数据处理基础_第2页
大数据处理-第1章 大数据处理基础_第3页
大数据处理-第1章 大数据处理基础_第4页
大数据处理-第1章 大数据处理基础_第5页
已阅读5页,还剩91页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

大数据处理

2025春#1:大数据处理基础课程简介教材:《大数据处理》,金海,石宣化课程性质选修、理论课+实践课24+16学时/2.5学分成绩构成平时成绩:40%实验考核成绩:60%互联网应用数据急剧增长

互联网用户数量巨大,日益活跃

互联网用户在微博、论坛、电子商务

等网站上日复一日地生成数据淘宝网每天新增数据40TB以上百度每天处理10PB量级的数据,总数据量达1000PB应用背景•

随着信息化的推进,国民经济、国家安全等领域数据不断增长

物联网、移动通信电话、手机微信、语音数据、遥感、公共安全、医疗、交通、情报等很多领域

高分辨率卫星(影像)、城市监控摄像头(视频)、…

据报道,武汉监控摄像头已超过25万个,如采用1080P高清摄

像头(一个摄像头一天产生数据量40GB以上),整个城市每天新增监控数据10PB以上应用背景•

科学实验数据规模巨大,增长迅猛生物工程气候监测高能物理天文观测生态环境

….气候研究华大基因测序目前每天产生数据约15TB,一年超过5PB

一欧洲CERN对撞机每年产生的数据量超过15

PB基因测序应用背景IDC报告预测:未来十年,全球数据量迅速增长Amount

of

digital

informationcreated

and

replicated

in

a

year––––年均增长率超过40%2009年0.8ZB2020年35ZB1ZB~106PB月球用容量4GB的DVD光盘存储,DVD可从地球排至月球G-T-P-E-Z-Y应用背景应用背景新兴大数据应用的涌现新兴的大数据应用需要高时效地处理!AI大模型推理商务智能电子商务多媒介人机交互(智能驾驶)城市计算图计算(金融欺诈分析)大数据处理亟待计算模式的革新据IDC《Data

Age

2025》报告。2020年全球数据量44ZB左右,2025年全球数据量将达到175ZB数据规模高速增长,对当前的大数据处理系统带来巨大挑战中国数据量预计2025增长到68.6ZB,全球占比将达到39.2%,平均每年的增长速度比全球快3%目标能力增长模式数据处理能力增长

(线性)时间数据资源膨胀

(指数)2010201520202030数据处理需求44ZB(IDC数据)2500ZB(IDC数据)1.2ZB(IDC数据)•

大数据技术对经济社会和科研都在产生重要影响

–经济社会大数据的影响智能制造智能生态农业智能物流智能交通大数据+传统产业医疗健康•

大数据技术对经济社会和科研都在产生重要影响

科学研究

三种科研模式:理论、实验、计算第四模式:数据密集型的科学发现图灵奖获得者JimGray2007年提出专辑:Nature(2008.9):”Big

Data”,Science(2011.2):”Dealing

with

data”大数据的影响目录1.1大数据特征1.2大数据存储模式1.3大数据处理模式1.4大数据编程模式1.5大数据处理体系结构目录1.1大数据特征1.2大数据存储模式1.3大数据处理模式1.4大数据编程模式1.5大数据处理体系结构1.1大数据特征大数据的产生及概念什么是大数据?海量数据本身+处理方法大数据特征:5V特征Volume-大容量Velocity-快速性

Value-价值低Veracity-准确性Variety-多样性数据量巨大全球在2010年正式进入ZB时代IDC:到2020年,全球将总共拥有40ZB的数据量数据准确性、可信赖度全球在2010年正式进入ZB时代IDC预计到2020年,全球将总共拥有40ZB的数据量结构化数据、半结构化数据和非结构化数据数据类型早已不是单一的文本形式,订单、日志、音频,能力提出了更高的要求沙里淘金,价值密度低数小时的视频,可能有用的数据仅仅只有一两秒。如何迅速“提纯”是大数据的难题实时获取信息大数据区分于传统数据最显著的特征。如今已是ZB时代,在如此海量的数据面前,处理数据的效率就是企业的生命大数据模型姓名性别邮件电话住址张三男a@x.x137xx武汉小红女b@x.x138xx上海小明男c@x.x139xx广州姓名张三小红小明性别男女男邮件a@x.xb@x.xc@x.x电话137xx138xx139xx住址武汉上海广州行式数据列式数据键值对文档数据图数据KeyValueKeyValueKeyValueKeyValue目录1.1大数据特征1.2大数据存储模式1.3大数据处理模式1.4大数据编程模式1.5大数据处理体系结构1.2大数据存储模式大数据种类繁多,需要存储半结构化、非结构化数据具备扩展存储的能力文本数据社交数据语音数据视频数据日志数据分布式存储集中存储大数据存储模式分布式文件系统分布式文件系统(DistributedFileSystem)是指文件系统管理的物理存储资源不一定直接连接在本地节点上,而是通过计算机网络与节点相连。分布式文件系统的设计基于客户机/服务器模式。一个典型的网络可能包括多个供多用户访问的服务器。最著名大数据处理文件系统:HadoopHDFSGoogleGFS大数据文件系统一:HadoopHDFSHDFS是一个基于JAVA的支持数据密集型分布式应用的分布式文件系统。能够保证应用可以在上千个低成本商用硬件存储结点上处理PB级的数据。HDFS整体架构Master/Workers主/从NameNode命名节点Master:onesingleFilenamespaceDirectoriesandfilesMetadataInmemoryMappingfilename->blocksblocks->datanodeDataNodes数据节点Workers:manyA"block"serverStoreblocksinlocalFSStoremetadataofblocksServedatatoclientsNamenodeMetadataopsMetadata(Name,replicas,...):/home/foo/data,3,...ClientBlockopsReadDatanodesDatanodesReplicationRack1ClientWriteRack2BlocksHDFS组件主服务器主服务器,即命名节点,管理文件系统命名空间和客户端访问,具体文件系统命名空间操作包括'打开'、'关闭'、'重命名'等,并负责数据块到数据节点之间的映射;HDFS将文件系统命名空间呈现给客户端,并将用户数据存放到数据节点上。从内部构造看,每个文件被分成一个或多个数据块,从而这些数据块被存放到一组数据节点上;数据节点会根据命名节点的指示执行数据块创建、删除和复制操作。数据节点DataNode负责管理存储结点上的存储空间和来自客户的读写请求DataNode也执行块创建、删除和来自NameNode的复制命令HDFS特有策略高度容错的,可运行在廉价硬件上;HDFS能为应用程序提供高吞吐率的数据访问,适用于大数据集的应用中;HDFS在POSIX规范进行了修改,使之能对文件系统数据进行流式访问,从而适用于批量数据的处理。HDFS为文件采用一种"一次写多次读"的访问模型,从而简化了数据一致性问题,使高吞吐率数据访问成为可能,一些Map/Reduce应用和网页抓取程序在这种访问模型下表现完美。大数据文件系统一:GoogleGFS谷歌文件系统(GoogleFileSystem,GoogleFS)是为了满足快速增长的数据处理需要而设计的。在开发实现GoogleFS之前,设计人员首先对Google应用程序负载和应用环境进行了深入探讨和分析,它能运行在不可靠硬件设备上进行海量的数据处理,处理来自多个用户的并发访问。文件系统中存放的数据绝大部分采用追加新数据而非覆盖现有数据的方式进行写操作。除了考虑到这些需要和技术特点后,GoogleFS也考虑了分布式文件系统的共性设计目标:性能、可扩展性、可靠性和可用性。GFS特征及适用场景针对Google自身特点设计,超大规模;已经广泛的在Google内部进行部署,是处理整个WEB范围内难题的一个重要工具。GFS架构GFS将整个系统分为三类角色:Client

(客户端)、Master(主服务器)、ChunkServer(数据块服务器)大数据存储形式键值对存储模型广泛应用于Redis、MongoDB、memcached、BerkeleyDB、KyotoCabinet及LevelDBKeyValue123123MainSt.126(805)477-3900<Key=CustomerID><Value=Object>CustomerBillingAddressOrdersOrderShippingAddressProductItem大数据存储形式键值对索引技术:哈希表通过维护一个映射表,形成可以根据键值而直接访问的数据结构数据插入与查询非常快大数据存储形式键值对索引技术:顺序表按照特定的排序规则进行组织实现形式:B树、B+树和排序表35●●●12●●●34●●●567●●●KeyValued1d2d6d5d7d4d3大数据存储实例——BigTableBigTable用于谷歌存储万维网索引、谷歌地球、谷歌财经数据Bigtable是一个键值(key-value)映射Bigtable的键有三维,分别是行键(rowkey)、列键(columnkey)和时间戳(timestamp),行键和列键都是字节串,时间戳是64位整型;而值是一个字节串

(row:string,column:string,time:int64)→String(cellcontents)BigTable采用类似B+树三级层次化的方式来存储位置信息BigTable结构图此文件属于Chubby服务的一部分,它保存着roottablet的位置,以保证主服务器唯一。为了保证树的深度不变,roottablet从不分裂。元数据片,它和roottablet一起组成完整的元数据表。每个元数据片都包含了许多用户片的位置信息。TPUv2(45TFLOPS)TPUv3(123TFLOPS)A100(312TFLOPS)H100(1979TFLOPS)AI催生出爆炸式的算力和内存需求:近四年,算力需求增长100倍,而内存需求增大5000倍内存容量和带宽的不足都会严重制约算力的发挥当内存容量小于工作集大小时,应用性能下降可达95%[1]带宽不足时,应用仅能发挥5%

GPU算力[2]

算力需求FLOPS

(log-scale)(2019,

1e+22FLOPS)(2023,

1e+24FLOPS)GPU内存TPUv2(16GB)TPUv3(32GB)A100(40GB)A100(80GB)H100(80GB)(2019,

1B)(2023,

5000B)100x5000x算力需求GPU算力内存系统是计算机系统性能瓶颈[1]GuJ,etal.EfficientmemorydisaggregationwithInfiniswap,NSDI’17[2]Xie,etal.MPU:TowardsBandwidth-abundantSIMTProcessorviaNear-bankComputing,2023.算力发展速度内存墙限制内存和互连发展速度大数据和AI加剧了内存墙性能瓶颈存力、传力远远滞后于算力的发展,内存墙始终是计算机系统的核心挑战ChatGPT:万亿参数大模型700GB模型、570GB文本训练数据开源数据集CommonCrawl:90TB大模型推荐系统工业级嵌入式表规模:~100TB级TB级内存需求TB级内存需求向量数据库新兴应用需要大容量、高性能的内存系统支持!数据量级:10~100亿规模维度:100~1000TB级内存需求32传统内存技术面临扩展性难题DRAM内存计算系统面临的扩展性挑战DRAM存储密度低:单芯片存储密度达上限周期性刷新操作:降低带宽,增加功耗8%46%15%47%传统DRAM内存受限于存储密度和功耗,难以实现容量扩展2DDRAM单chip容量不可扩展未来的3DX-DRAM2DDRAMNeoSemiconductor预测DRAM技术的未来集成电路工艺已接近物理极限,摩尔定律即将失效传统冯·诺依曼计算机系统面临的主要挑战:性能墙:存储器速度(带宽、延迟)和CPU速度差距巨大功耗墙:数据移动带来超过系统50%的功耗内存墙冯·诺依曼架构“内存墙”是制约性能扩展的瓶颈问题1:数据搬运慢数据搬运速度是运算的瓶颈SRAM:10-100TB/sDRAM:40GB-1TB/sSSD(NVMe):3.9GB/s数据搬运速度差异达4个数量级问题2:搬运能耗大存储器和处理器间壁垒高64-bit从DRAM搬运数据5

nJ64-bit从SRAM搬运数据30

pJ8-bit计算功耗:1

pJ数据搬运是计算功耗的1000倍内存墙分布式内存扩展HDDSSDCacheDDR内存RegCXL-内存~0.2ns~1-40ns~80-140ns~170-250ns~300-400ns~2-4μs~10-40μs~10ms持久内存RDMA/CXL网络内存内存扩展的途径:持久内存和网络互连内存持久内存和网络互连内存填补了内外存之间巨大的性能鸿沟Intel傲腾RDMA内存池CXL扩展内存卡单节点内存扩展CXL内存池比DDR更大的内存容量比SSD更快的持久数据访问内存语义的数据持久化能力填补了DDR和SSD之间巨大的性能鸿沟更简洁的软硬件接口持久内存(PM)、非易失内存(NVM)、存储级内存(SCM)尽管Intel傲腾停产,国内外仍在积极探索下一代非易失内存设备持久内存已经得到广泛商用RAMCloud:DRAM内存池Grappa:软件实现的DSM系统InfiniSwap:基于页交换的内存池Clover:基于持久内存的内存池RDMA网络较高的访存延迟是其得到广泛应用的最大障碍内核旁路零拷贝远端CPU不参与R/WRDMA特性网络互连内存:RDMA内存池化技术相对成熟目录1.1大数据特征1.2大数据存储模式1.3大数据处理模式1.4大数据编程模式1.5大数据处理体系结构1.3大数据处理模式:并行处理并行处理同时对多条指令、多个任务或多个数据进行处理的一种计算技术并行处理分类(Flynn分类法)多指令单数据流(MISD)单指令单数据流(SISD)多指令多数据流(MIMD)单指令多数据流(SIMD)指令流数据流少多多PPCIDDPPCIDDPPCIDDCIa)SIMDb)MIMDc)MISD1.3大数据处理模式:并行处理并行随机存储器PRAM模型PRAM(parallelrandomaccessmachine)并行随机存储器共享内存访问结构,共享存储SIMD同步模型一种抽象化的并行计算模型,该模型假定有一个容量无限大的共享存储器,有任意多个功能相同的处理器,且这些处理器均具有简单的算术运算和逻辑判断功能,在任何时刻各处理器都可以通过共享存储器相互交换数据分类:不允许同时读和写模型,PRAW-EREW允许同时读但不允许同时写,PRAM-CREW不允许同时读但允许同时写,PRAM-ERCW允许同时读和同时写,PRAM-CRCWP1共享内存P2P3Pn…1.3大数据处理模式:分布式处理分布式处理一个分布式系统可以描述为由一组基本自治的处理器组成,处理器之间通过通信网络进行通信分布系统特征没有共同的物理时钟没有共享内存地理分散自治与异构分布式系统ApplicationProcess-01Server1PeerSourceApplicationProcess-02Server2ApplicationProcess-03Server3网络网络网络服务用户挂载1.3大数据处理模式:分布式处理分布式存储访问模型分布式处理采用分布式存储访问结构,即每个处理器都有自己独立的存储,可以使用指令发送和接收有限长度的消息与共享存储并行计算模型不同,分布式处理器没有连接到公共内存处理器通过交换消息进行通信分布式存储模型:大同步并行BSP(bulksynchronousparallel)模型LogP模型:

一种面向分布式存储器、点对点

通信的多计算机系统的并行计算模型P1互连(通信媒介)P3P4Pn-1…P2P4P6Pn…1.3大数据处理模式:分布式处理BSP模型BSP计算由一系列超级步组成。每个超级步中,每个处理器都被分配一个任务超级步三个阶段本地计算阶段通信阶段路障阶段BSP算法时间复杂度:所有超级步的时间开销和BSP模型属于分布式存储的MIMD处理器和路由器分开,即计算和通信分开硬件实现的全局同步在可控的粗粒度范围内用PRAM模型设计的算法全局通信路障同步局部计算各种处理程序1.3大数据处理模式:分布式处理LogP模型LogP是由大卫·卡勒等人提出的,它使用了L,O,G,P四个参数来描述这个模型。LogP模型是一种面向分布式存储器、点对点通信的多计算机系统的并行计算模型L(Latency):表示信息从源到目的地所需的时间;O(Overhead):表示处理器接受或发送一条消息所需额外开销,并且在此期间处理器不能做作任何操作;G(Gap):表示处理器连续进行两次发送或接收消息之间必须有的时间间隔;P(Processor):表示处理器的数目。LogP模型一方面充分讨论了网络的通信特性,另一方面却放弃了对网络拓扑的讨论。在LogP中没有出现超级步的概念,这是因为LogP中是消息同步的,也就是说,一旦消息到达了处理器我们就可以使用,而不必要等到下一个超级步。LogP模型下,网络的容量是有限度的,在任何时刻的网上,从任何处理器发出或向任何处理器发去的消息个数不得超过[L/g]个,否则便会发生阻塞。LogP是个异步模型,通信与计算可以重叠,并完全采用消息传递的方式进行通信和同步。LogP模型以相当简明的参数刻划MPP,更准确的说,刻划的是MPP通信网络的性能。在LogP模型下,只要做到网络轻载且只有小消息,便可以充分发挥四个参数所赋予的精确性,进行周密的算法设计,以充分利用处理机和网络带宽。1.3大数据处理模式:分布式处理常见网络拓扑结构一维网格和二维环面r维超立方体r维立方连接环r维混洗交换网络一维网格二维环面r维超立方体r维立方连接环r维混洗交换网络1.3大数据处理模式:分布式处理

1.3大数据处理模式:分布式处理控制流的处理控制流的一个基本模型是控制流图(controlflowgraph,CFG),表示程序部件间的控制关系用户通过显示地编写控制流完成对程序数据流的操作和计算控制流图基本特征:CFG是有向图在典型的控制流程序中,所有计算操作线性地存储在CFG中CFG中有且仅有一条计算操作可以在同一时刻被调度和执行startv=a%2ifv=0b=0jumpb=1endN控制流图示例1.3大数据处理模式:分布式处理数据流的处理控制流模式中,数据通过存储器的读写和跨多个线程的同步影响执行效率不通过硬件控制数据流的程序,而通过写一个配置硬件的程序。当数据进入其输入端口时,只通过配置的硬件快速执行,产生结果的速度快两三个数量级数据流的基本模型是数据流图(dataflowgraph,DFG)数据流图基本特征:DFG是有向图DFG的一个节点通过动态地接收来自其输入的一个或多个数据项,执行计算操作,并将结果数据项传送到其输出从而发挥作用输入数据准备好会触发节点的操作数据流图示例abc×2××4×-+/目录1.1大数据特征1.2大数据存储模式1.3大数据处理模式1.4大数据编程模式1.5大数据处理体系结构1.4大数据编程模式批处理对一批数据采用相同方式进行批量的处理批量数据特征:数据体量巨大;数据精确度高;数据价值密度低流处理流式数据是一个无穷的数据序列,序列中的每一个元素来源各异、格式复杂,序列往往包含时序特征流数据特征:时序,但是要求响应极快交互式数据处理系统与操作人员以人机对话的方式一问一答,数据以对话方式输入交互数据特征:处理灵活、直观、便于控制图处理图可以很好的表示事物之间的关系图数据特征:节点之间关联性;种类繁多;图数据计算的强耦合性目录1.1大数据特征1.2大数据存储模式1.3大数据处理模式1.4大数据编程模式1.5大数据处理体系结构1.5大数据处理体系结构数据中心数据中心(datacenter,DC)是当前大数据处理体系结构的主要实现平台。包括计算机系统、与之配套的通信和存储系统、冗余通信连接、环境控制设备、监控设备及安全装置数据中心系统的外壳实际上是一个建筑,与大型仓库通常难以区分,我们将这样基础设施当作一个巨大计算机整体,叫仓库规模计算机(warehousescalecomputer,WSC)1.5大数据处理体系结构数据中心体系结构服务器硬件存储网络数据中心的电力和能耗数据中心的冷却系统1.5大数据处理体系结构数据中心体系结构服务器硬件服务器通常为低端服务器vs数据中心高性能计算机小型计算任务可分解为子任务例如数据检索大型复杂问题不可分解为子任务例如天气预测1.5大数据处理体系结构数据中心体系结构服务器硬件服务器通常为低端服务器存储依靠本地磁盘WSC通常使用桌面级磁盘而不是企业级地盘WSC存储结构L1L1...L2cache处理机处理机...L1L1...L2cache处理机处理机本地DRAM硬盘/闪存机架交换机硬盘/闪存DRAM硬盘/闪存DRAM数据中心机架交换机......单台服务器:DRAM:16GB,100ns,20GB/s硬盘:2TB,10ms,200MB/s内存:128GB,100μs,1GB/s局部机架(80台服务器):DRAM:1TB,300μs,100MB/s硬盘:160TB,11ms,100MB/s内存:20TB,400μs,100MB/s集群(30个机架):DRAM:30TB,500μs,10MB/s硬盘:4.8PB,12ms,10MB/s内存:600TB,600μs,10MB/s1.5大数据处理体系结构数据中心体系结构服务器硬件服务器通常为低端服务器存储依靠本地磁盘WSC通常使用桌面级磁盘而不是企业级地盘网络高性能交换机数据中心两层机架结构1.5大数据处理体系结构数据中心体系结构服务器硬件服务器通常为低端服务器存储依靠本地磁盘WSC通常使用桌面级磁盘而不是企业级地盘网络高性能交换机数据中心的电力和能耗服务器供电和制冷数据中心评价重要指标:功能率利用率PUE

1.5大数据处理体系结构数据中心体系结构服务器硬件服务器通常为低端服务器存储依靠本地磁盘WSC通常使用桌面级磁盘而不是企业级地盘网络高性能交换机数据中心的电力和能耗服务器供电和制冷数据中心评价重要指标:功能率利用率PUE数据中心的冷却系统开放循环系统、封闭循环系统、三路循环系统三层冷却循环系统结构图冷却池冷却塔鼓风机自然空气水水泵水水泵数据中心水水1.5大数据处理体系结构数据中心的网络拓扑结构以交换机为核心的数据中心以交换机为核心的拓扑结构依靠交换机实现互联和转发,数据中心常用的拓扑结构则可分为树形结构和非树形结构树状交换结构(Fat-Tree)分为三层底层接入层中间的聚合层顶层的核心层交换机服务器pod0pod3pod2pod1Fat-Tree拓扑结构网络示意图1.5大数据处理体系结构数据中心的网络拓扑结构以交换机为核心的数据中心以服务器为中心的数据中心服务器具有良好开放性,为数据中心功能灵活性和创新性提供便利服务器有多个网络端口,有利于网络扩展硬件交换机只能交换,不能路由,容错能力差采用递归方式构造数据中心:Bcube模型使用交换机进行层次化扩展,通过若干个交换机将多个低层BCube网络互联起来,其中每个高层交换机与每个低层BCube网络都相连。采用3DTorus拓扑结构构造数据中心:CamCube通过共生路由(SymbioticRouting),以3DTorus拓扑结构为基础,每台服务器直接连接少数几台邻居服务器,不需要路由器或交换机,并给网络中每个节点赋予一个三维坐标用于表征他在网络中的位置。CamCube特别之处在于“外部服务”有权访问服务器空间坐标,而服务器有权对数据包进行窃听和修改,因此,外部服务器便能通过服务器实现自己定制的路由协议。1.5大数据处理体系结构数据中心的网络拓扑结构以交换机为核心的数据中心以服务器为核心的数据中心模块化数据中心网络拓扑结构模块化具有配置时间短、移动性好优点MDCube是一个多维的拓扑结构,能容纳的集装箱个数等于所有维度上能容纳的集装箱个数的乘积集装箱02集装箱01集装箱02集装箱01集装箱10集装箱00集装箱20集装箱22集装箱21MDCube拓扑结构图交换机服务器1.5大数据处理体系结构数据中心的网络拓扑结构以交换机为核心的数据中心以服务器为核心的数据中心模块化数据中心网络拓扑结构随机型数据中心网络拓扑结构随机型数据中心把互联网中的交换机构成了一张随机图,从而换得更短的平均路径长度,并潜在地减少网络耗费.Jellyfish模型:在交换机层上构建随机图,把每个交换机的部分端口用于和其他交换机连接,剩下的用于连接服务器)

优点:突破了规则的限定,增加了构建灵活性缺点:带来维护、修理等弊端Jellyfish网络拓扑1.5大数据处理体系结构数据中心的网络拓扑结构以交换机为核心的数据中心以服务器为核心的数据中心模块化数据中心网络拓扑结构随机型数据中心网络拓扑结构无线互联数据中心拓扑结构无线互联解决了布线成本问题,同时增强网络结构的灵活性Cayley和3DBeamforming无线数据中心采用60GHz无线通信技术互联特点:频谱丰富、极高速传输率、抗干扰强、高安全性Cayley基于Cayley图构建,通过在服务器前后两端加入发射/接收器直接实现互联3DBeamforming以机架为基本单元,通过增加反射面实现远距离单跳传输典型的大数据应用实例英国同名小说《纸牌屋》KevinSpaceyDavidFincher风靡全球的美剧《纸牌屋》大数据分析美国著名的在线流媒体服务商Netflix通过分析用户需求,指导拍摄了风靡全球的美剧《纸牌屋》。《纸牌屋》的数据库包含了3000万用户的收视选择、400万条评论、300万次主题搜索。最终,拍什么、谁来拍、谁来演、怎么播,都由数千万观众的客观喜好(如何观看电影和观影过程,观影过程中暂停的次数,会在看到几分钟的时候关闭视频等等)统计决定。典型的大数据应用实例季节性流感是一个重要的公共卫生问题:WHO估计,全球每年25万至50万人因此死亡,因此需要及时监测疾病传播情况,尽快采取应对措施2008年,Google通过处理网络搜索日志中的几千亿查询数据,训练建立流感疾病监测的数学模型,比美国疾病控制和预防中心提前1-2周给出流感的传播情况论文发表在Nature(2009.2):DetectingInfluenza

EpidemicsusingSearchEngineQueryData新冠肺炎疫情防控:利用大数据技术梳理感染者的生活轨迹,追踪人群接触史,成功锁定感染源及密切接触人群,在位置数据方面,除了交通部门统计的出行数据外,三大电信运营商能够有效定位用户的手机位置。大数据助力精准防疫有序复工•

传统技术难以应对大数据的规模当前较快硬盘的传输速度6Gbps,线性扫描10PB数据,需约19天,而百度、Google等互联网公司每天处理的数据量超过10PB大数据带来的挑战(

•很多大数据应用对响应时间要求高(低于微秒级):

规模大、响应快:对存储和处理提出了很大挑战

例如,Facebook总数据量15TB(2007年前),目前Facebook每天新增加的数据约

70TB,而响应时间需要在秒级

传统并行数据库扩展性受限,节点规模很少超过100,且价格昂贵•如何设计高可扩展、低成本、快速响应的大数据存储和处理系统?大数据存储与处理的可扩展难题(1)

可扩展是大规模分布式系统面临的基础性问题Jim

Gray(图灵奖获得者)将可扩展问题列为信息技术领域需解决的16个长远问题之首Jim

Gray.

What

Next?

A

Few

Remaining

Problems

in

Information

Technology.

ACM

Turing

Award

Lecture

(1999).数据种类多,需求多样,关联复杂

–文本、图像、图形、视频、位置信息、

手机呼叫、邮件、链接信息等

–在线流数据、离线批处理等如何建模、存储、查询、分析和理解多样化的复杂数据,挖掘数据价值?

大数据中垃圾和珍宝并存,需要大海捞针

–去伪存真

–需要计算机专家和领域专家的配合….大数据面临的挑战(2)结构化数据半结构化/非结构化数据大数据是多种数据类型的融合以视频为例,连续不间断监控过程中,可能有用的数据仅仅有一两秒,但是具有很高价值收集的部分数据可能与分析目标相背离,比如战场上敌方散布的误导信息传统算法在大数据时代可能不再有效

多项式时间算法O(Nk),N太大

需要计算复杂性和算法设计理论上的变革

需要大数据计算思维上的变化

例如,从确定性计算到非精确性计算

商品在线推荐:只需要计算出前10名相关的结果,有

一点不准确也没有关系传统算法结论在大数据时代需要重新评估

简单方法+大数据集可能取得很好的结果大数据面临的挑战(2)(3)•2007年,Google公司的Brants等人研究了机

器翻译领域中基于单词训练数据集的语言模型

比较了当时最先进的KN算法

与其提出的一个简单算法SB

研究表明,简单算法在小数

据集时效果不佳,但在大数

据集时,简单算法却产生了

更好的效果

T.Brants,A.C.Popat,etal..

ProceedingsoftheJointConferenceonEmpiricalMethodsinNatural

LanguageProcessingandComputationalNaturalLanguageLearning,2007.16传统算法结论需要重新评估181.

数据为中心的计算架构挖掘和利用数据之间并行度减少数据访问开销……2.化繁为简放松传统数据处理技术中约束如一致性等高可扩展高吞吐率高可靠性……主要内容18应对大数据的处理平台设计思维•

典型的数据并行处理平台:MapReduce为实现数据并行,数据首先按键值划分,然后交由多个任务在Map阶段进行并行处理,这里Map阶段的各任务处理的数据不存在相互依赖,而各数据只有在Map到Reduce的shuffle阶段才进行信息交流,接着Reduce阶段中各任务处理的数据也不存在相互依赖,因此可扩展性好。

输出数据输入数据1.

数据为中心的计算架构•

数据一致性关系数据库:强一致性Atomicity

Consistency

Isolation

Durability(ACID)保证写操作完成后,任何后续读操作将得到正确值•

分布式环境下,强一致性的代价昂贵,很多应用也无需强一致性弱化数据一致性,提升可扩展性和可靠性2.

化繁为简

为什么牺牲数据一致性?

牺牲可用性对互联网上的大数据

应用来说难以容忍牺牲一致性的代价可以接受大数据应用大都具有弹性,可以在一定程度上忽略计算过程的错误或近似结果,例如,图像处理和网页排名,视频推荐等。只要保证弱(最终)一致性弱化数据一致性“精确”结果真的是必要的吗?基于精确计算的过滤结果基于近似计算的过滤结果•

聚焦领域应用需求,简(优)化系统设计•

例如NoSQL

数据库

很多领域应用只需要对数据进行简单的读写

放弃数据库的结构化存储,采用key/value存储

不需要复杂的SQL操作,如skyline查询、多表join等

全能选手

Vs.

特长生大数据带来的四种思维方式的转变处理的数据从单一样本数据变成全量数据由于是海量数据和全样本数据,人们不得不接受数据的混杂性,而放弃对精确性的追求通过对大数据的处理,放弃对因果关系的渴求,转而关注相关性关系从自然思维转向智能思维存储和计算架构如何应对大数据5V特性的挑战?77大数据存储趋势1-存储器件异构化非易失内存SCM设备涌现(2017-2019年)NVDIMM(DRAM+NAND,2017)Intel傲腾非易失内存(2019)2017Ceph支持块、对象和文件的统一存储,支持软件定义存储,支持NVM。2014Linux支持NVMe,HDFS2.4发布,支持异构存储设备2013SNIA国际组织发布NVMe1.0存储接口标准基于Flash的传统SSD仍占据主导地位,并向高密度化、低延迟化发展新型SCM介质(Intel3DXpoint,三星MRAM)不断走向成熟,内存和外存间的边界逐渐模糊化存储系统趋向异构化、多层级化、软件定义化极低延迟SSD(2018年,三星Z-SSD延迟20us)3DNANDFlash存储介质/器件成为主流(2013年)3D堆叠(2021年,三星最新V-NAND达176层,容量30TB)

三星MRAM

(2017)、

支持CXL协议的内存模块(2021)2013年,三星3DNANDflash出现2018年,NVMe接口SSD带宽高达6GB/s多级异构存储系统(2017-至今)OceanStorOpenStack支持的开源分布式存储velocityvolume大数据存储趋势2-存储资源池化DDR内存资源池化(2011年)异构内存资源池化

(2015年-至今)Stanford

RAMCloud,2011,首个开源的基于DRAM的分布式存储系统U-WashingtonGrappa,2015,软件实现的分布式共享内存池系统HPTheMachineBerkeleyFireboxU-MichiganInfiniswap,Octopus,2017,RDMA技术开始在分布式存储系统中应用UCSDClover,2020,存算分离资源池化架构内存资源网络化、存算分离的数据中心架构或成为未来趋势ATC’15最佳论文RDMA将成为存储资源池化的主流2015年左右,以NVM为中心的异构内存池架构开始涌现

2017年,DEEP项目提出网络附加内存设计方案,获欧盟FP7,H2020计划,及EuroHPC等组织支持异构加速器片上内存资源池化(2016年-至今)CPU和加速器(如GPU、FPGA)间实现高速、低延迟互连的协议不断涌现,以实现内存在加速器间共享,并保证内存一致性异构算例间通讯和内存共享协议成为工业界竞争的焦点,学术界研究的热点CPUGPUFPGACCIX缓存一致互联协议,2016年Intel开放式互连标准,2019年内存语义网络互联协议,2018年开放一致性加速器接口,2017年,IBMPower9服务器应用CAPI协议velocityvolume大数据存储趋势3-多模态数据融合管理2015年数据湖概念出现,进一步推进了多模态数据融合分布式文件系统与数据库之间的界限模糊化MPP数据库+Hadoop集群+传统数据仓库“混搭”成为常见配置大数据中非结构化数据占比高达80%分布式存储与数据库的存储管理融合开始走向萌芽早期出现了Hbase、Cassandra等产品非结构化数据应用需求增长带来多种专用非结构化数据专用数据库发展,如OrientDB、ARangoDB等文档数据、图数据管理系统涌现传统数据库产品增加非结构化支持,如Oracle。云化产品涌现,如Cosmos

DBvariety大数据存储趋势4

-存储智能化2018年,MIT提出learned-index,替代传统B+树索引2018年,DARPA出资2亿美元资助JUMP成立智能存储和内存处理研究中心CRISP。6所高校参与,ARM、IBM、Intel、三星等公司参与。2019年,DELL推出具有AI赋能的第五代存储产品PowerMax。Google、IBM、华为等也相继开展智能存储系统研究。AI技术快速发展,基于AI技术手段增强存储系统能力获得业界关注。大数据处理7个趋势图-流融合:图数据和实时数据的爆发增长推动图流处理模式的融合随着AI、语义计算等技术被广泛应用,图数据与处理技术正在成为主流;全球图数据库的市场总额年复合增长率超过20%随着5G和物联网等技术发展,全球数据圈规模逐渐增大,其中实时数据的比例到2025年预计将达到30%大数据处理趋势1-多计算模式融合variety图-流融合:图数据和实时数据的爆发增长推动图流处理模式的融合大数据处理趋势1-多计算模式融合2017年,美国DARPA资助8000万美元研发快速流图处理系统,Intel和佐治亚理工大学等五家机构参与了该项目;美国NFS近年密集资助了图流处理的相关项目国际主流的开源流处理平台与图数据库均逐渐向图-流融合的方向发展批-流融合:一体化处理提供高吞吐低延迟数据处理大数据处理趋势1-多计算模式融合2010201320162012201620152013201220152006201320082012批流融合系统及发展趋势批处理流处理批流一体variety批-流融合:一体化处理提供高吞吐低延迟数据处理大数据处理趋势1-多计算模式融合2015年谷歌的TylerAkidau提出Dataflow模型融合批流模式2015年基于Dataflow模型设计的Flink公布亚马逊云的RajeevSrinivasan分享通过批流融合提升性能谷歌发布批流统一编程模型Beam大数据处理趋势2–从通用到专用TPU2014开始,2021发展了4代产品Hadoop

Yarn的出现使得扩展性问题得到有效解决,万级规模节点成为可能,Hadoop进入2.0时代领域专用系统快速发展,专用硬件、专用软件涌现加速器和大数据处理软件平台的融合2019,GPU加速的Python库,相比GPU加速50-100倍早期大数据处理系统重点解决扩展性问题,随着节点规模增长,效率与成本成为关键因素。Micro

2016,图加速器2017

DARPA

Hive2012,图计算专用系统软件2013,图计算专用系统软件Spark增加GPU支持GPU加速流数据处理初创公司velocity大数据处理趋势3-近数据处理分布式计算模式的转变(2015年左右)近数据计算:存储上移(2015年左右)2016年,英伟达TeslaP100GPGPUHBM集成到CPU/GPU/FPGA/ASIC等片上,提供高达96GB的容量,460GB/s的访存带宽,但数据移动造成的功耗高,近端内存管理复杂,编程难度大2016年,赛灵思VirtexUltraScaleFPGA2018年,GoogleTPU3.0加速器集成HBM2016年,IntelXeonPhiKnightsLanding近数据处理:算力下沉(2017年左右)DRAMdie上集成计算单元(HMC)智能网卡上集成ARM核和FPGA智能SSD上集成FPGA云边端融合云计算2015年,AMD首次在显卡中集成HBM数据处理卸载到存储和网络,大幅减少数据的移动开销,近数据处理成为未来I/O智能设备的发展趋势云计算模式趋向云边端融合,减少数据在分布式环境的传输开销,降低处理延迟。velocityvolume基于ReRAM的存内计算,消除“冯·诺依曼”瓶颈数据存储:DRAM替代品,通过电导存储信息计算功能:通过位线上的电流累加提供模拟计算计算特点:计算模式:定点数据的矩阵向量乘法,模拟计算高并行性:单周期完成阵列级矩阵向量乘法低功耗:原位计算,无需数据移动,降低能耗大数据处理趋势4:存算一体velocityDARPA电子复兴计划:FRANC项目项目目标:

开发数据驱动的存算一体的新型计算范

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论