计算机科学概论(微课版)· 第8章 大数据 · 教学课件_第1页
计算机科学概论(微课版)· 第8章 大数据 · 教学课件_第2页
计算机科学概论(微课版)· 第8章 大数据 · 教学课件_第3页
计算机科学概论(微课版)· 第8章 大数据 · 教学课件_第4页
计算机科学概论(微课版)· 第8章 大数据 · 教学课件_第5页
已阅读5页,还剩21页未读 继续免费阅读

付费下载

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

高等学校计算机专业核心课程精品系列教材计算机科学概论(微课版)第8章大数据概述·采集·存储·分析·处理为什么有的广告让你忍不住想买?本章沿大数据处理周期逐一拆解:从5V特征与三类数据源,到HDFS、HBase,再到数据挖掘、可视化与MapReduce。图8-82022年《政府工作报告》标签云(教材第145页)LEARNINGGOALS学习目标与知识导图第8章知识导图(教材第129页)本章学习目标❶理解大数据究竟"大"在哪里,掌握5V特征;❷了解大数据的发展历程:萌芽、成熟、应用三阶段;❸按处理流程掌握核心技术:采集、存储、分析、处理;❹掌握HDFS、HBase等分布式存储的核心概念;❺了解大数据在工业、农业、政府、体育等领域的应用方式。能力落点:理解大数据基本技术,为使用大数据解决实际问题打基础。计算机科学概论(微课版)|第8章大数据02CONTENTS本章目录8.1大数据概述从数据到大数据|核心技术|应用8.2大数据采集数据源|ETL|网络爬虫8.3大数据存储分布式文件系统|分布式数据库8.4大数据分析理解与预处理|数据挖掘|数据可视化8.5大数据处理大数据计算框架|MapReduce章末8.6小结|8.7拓展知识|8.8课后习题计算机科学概论(微课版)|第8章大数据038.1大数据概述·从数据到大数据什么是大数据数据(data)是事实或观察所得的结果,是对客观事物的逻辑归纳、未经加工的初始素材:连续的(音频、图像)称模拟数据,离散的(符号、文字)称数字数据。关于"大数据",目前尚无统一定义——《大数据时代》舍恩伯格、库克耶不用随机分析法(抽样调查)这样的捷径,而是对所有数据进行分析处理。美国国家科学基金委员会由科学仪器、传感器、网上交易、电子邮件、视频、点击流等数字源生成的大规模、多样、复杂、分布式的数据集。麦肯锡全球研究所规模大到在获取、存储、管理、分析方面远超传统数据库软件能力的数据集合。综合定义用传统数据处理工具无法在可容忍时间内获取、管理和处理分析的海量数据,需要特殊的体系架构支撑。描述大数据的特征,业界通用"5V"模型——下一页详解。计算机科学概论(微课版)|第8章大数据048.1大数据概述·特征大数据的5V特征Volume数据量大大数据通常达PB级及以上。2011年全球数据总量1.87ZB,刻成光盘排开可绕地球约20圈;1986—2010年间增长100倍。Velocity处理速度快生成与变化都极快:2023年Google每日响应85亿次搜索、处理超20PB;Dremel几秒内完成亿级表的聚合查询。Variety数据多样由单一结构化转向以非结构化、半结构化为主:网络日志、图片、社交信息、地理位置;物流、医疗、金融等领域数据爆发式增长。Value价值密度低经获取、清洗、挖掘后,有效数据不足20%。一天的监控视频中,有价值的或许只有几秒——如何低成本"沙里淘金"是关键。Veracity真实性强内容与真实世界事件紧密相连,但也存在偏差与错误——必须保证采集与清洗后留存的数据准确可信,才能支撑解释与预测。计算机科学概论(微课版)|第8章大数据058.1大数据概述·发展历程大数据发展的三个阶段萌芽阶段20世纪80年代—90年代个人计算机普及、互联网出现,数据量爆炸式增长。·1980托夫勒《第三次浪潮》赞其为"华彩乐章"·1997首篇使用"大数据"术语的论文发表·1999IEEE首设大数据专题讨论存储靠胶卷、光盘、磁盘,离线集中处理。成熟阶段21世纪初—2010年Web2.0迅猛发展,非结构化数据大量产生,传统方法难以应对。·2003/2004谷歌发表GFS、MapReduce两篇论文·2005奥莱利:"数据将是下一项技术核心"形成并行计算与分布式系统两大核心技术,Hadoop等开源架构盛行。应用阶段2010年至今从技术研究转向应用研究,渗透商业、医疗、政府、教育等各领域。·2011《大数据时代》出版·2012美国启动"大数据发展计划"·2013《中国大数据技术与产业发展白皮书》·2015国务院《促进大数据发展行动纲要》·2017工信部《大数据产业发展规划》计算机科学概论(微课版)|第8章大数据068.1大数据概述·核心技术大数据处理周期与核心技术图8-1大数据处理周期及核心技术(教材第131页)①采集与预处理RFID、传感器、社交网络等获取海量数据;抽取、清洗"去噪",转为易处理形式。→8.2节②存储与管理分布式文件系统(DFS)+关系型/NoSQL数据库,解决存储、表示、可靠性与传输。→8.3节③分析与挖掘从噪声数据中提取潜在有用的信息与知识;文本/图形可视化辅助洞察。→8.4节④安全保障透明加解密、分布式访问控制、数据审计、隐私保护与推理控制、完整性验证。计算机科学概论(微课版)|第8章大数据078.1大数据概述·应用大数据在各行业的应用工业:福特汽车400万辆汽车装配车载传感器;FusionEnergi单车74个传感器,每小时回传约25GB数据,用于改进油耗与安全设计、制定个性化充电计划。农业:大豆产量预测中国农科院用东北、黄淮两大产区173个县域气象站、34年单日气象数据与分县产量数据建模,建立高精度大豆单产预测模型,支撑供需平衡监测预警。政府:用数据说话分析社会、经济、人文规律,为宏观调控与产业布局提供依据;提升公共服务水平;城市管理由粗放式向精细化转变。体育:德国队的"第十二人"2014年巴西世界杯,德国队用大数据分析己方球员特点、优化团队配置,并研究对手技术数据制定战术——大数据被称为夺冠的"秘密武器"。回扣开篇:精准广告=从海量非结构化用户数据中分析特征与偏好,把"对的广告"投给"对的人"计算机科学概论(微课版)|第8章大数据088.2大数据采集·数据源五类主要数据源开篇问题:智能家电厂商如何收集用户体验数据?先看清数据从哪里来——①传感器数据压力、温度、流量、声音、电参数等各类传感器感知环境并转为电信号输出;DV录像、手机拍照也属此类,适应恶劣环境。②互联网数据门户新闻、社交资讯、电商购买记录与评价、论文网站观点等;多为结构化数据、价值密度高,常借助网络爬虫采集。③日志文件业务平台每日产生的操作记录:网络流量管理、股票记账、Web访问行为、设备状态上报等,可挖掘出支撑决策与性能评估的信息。④企业业务系统数据沃尔玛每小时收集2.5PB销售数据(存量为美国国会图书馆的167倍),借购物行为分析优化商品陈列;Amazon靠Kindle阅读标记做图书推荐。⑤政府数据财政、税务、海关、医疗等部门业务系统数据:真实性、权威性、实时性、指向性强,是重要的采集来源。计算机科学概论(微课版)|第8章大数据098.2大数据采集·ETLETL:抽取·转换·装载ETL=Extract(抽取)+Transform(转换)+Load(装载):把企业内部分散、零乱、标准不统一的数据整合格式化,供后续分析处理。主流工具:DataPipeline、Kettle、Talend、Informatica、Datax、OracleGoldengate。图8-2ETL体系结构(教材第135页)①数据抽取全量抽取:整库照搬,直观简便但有冗余、效率低;增量抽取:靠日志对比、时间戳只抽新增/修改的数据。②转换和加工抽取的数据未必符合目的库需求——格式不符、输入有误、数据不完整,须在ETL引擎中或抽取过程中同步清洗转换。③数据装载最后环节。两种方式:SQL语句插入/更新/删除(有日志、可恢复);批量装载(bcp、bulk等,大数据量时效率高)。计算机科学概论(微课版)|第8章大数据108.2大数据采集·网络爬虫网络爬虫的工作原理网络爬虫:从指定的链接入口(种子URL)出发,按照某种策略,从互联网中自动获取有用信息的程序——搜索引擎正是靠它抓取网页、建立索引。图8-3通用的爬虫框架流程(教材第136页)抓取流程(循环直至待爬队列为空)①指定入口URL,加入种子URL队列;②种子队列并入待抓取URL队列;③依次读取URL,经DNS解析后下载网页,存入下载网页库;④从网页中抽取新的链接加入待爬队列,已完成的转入已抓取队列;⑤循环③④,直到待爬队列为空,爬虫停止。回扣开篇:ETL整合家电传感器与日志数据,爬虫抓取论坛评论——厂商由此全面掌握用户体验计算机科学概论(微课版)|第8章大数据118.3大数据存储·分布式文件系统分布式文件系统与HDFS2021年Facebook日活29.1亿、每天产生约4PB数据——单磁盘必然读写慢、可靠性差。分布式文件系统(DFS)把文件系统从单一节点扩展到网络中的众多节点,用户像用本地文件系统一样使用它。常见实现:GFS、HDFS、Lustre、Ceph等;HDFS是GFS思想的开源实现。核心概念①数据块BlockHDFS以块为独立存储单元,默认64MB(磁盘块通常512B):大块降低寻址开销;任意大的文件都能切块存到多块磁盘;不足一块的文件不占整块空间。核心概念②容错每个块默认三副本存放在不同机器上,部分节点故障也能恢复数据;对访问频繁的文件做块缓存提升读性能。namenode(管理者)掌控文件系统命名空间:维护文件系统树(镜像文件+编辑日志持久保存),记录各块所在的datanode;集群中仅一个。datanode(工作者)按需存储并检索数据块(受客户端或namenode调度),定期向namenode上报所存块的列表;集群中有多个。计算机科学概论(微课版)|第8章大数据128.3大数据存储·分布式文件系统HDFS体系结构:一次读操作图8-4客户端读取HDFS中数据的流程(教材第138页)读流程六步①客户端open请求打开文件②namenode返回起始块位置等元数据③客户端获得输入流,调用read④从距离最近的datanode读第一块⑤重复读取后续每个块⑥读完调用close结束namenode容错:①元数据同时写入本地磁盘与远程NFS;②辅助namenode定期合并镜像(监测点),故障时接管恢复。计算机科学概论(微课版)|第8章大数据138.3大数据存储·分布式数据库HBase:为什么需要它淘宝、京东要应付"双十一"级别的高并发随机读写,传统关系数据库在并发性、可扩展性、可用性上暴露出弱点,完备的事务机制反成负担。HBase:高可靠、高性能、面向列、可伸缩的分布式存储系统,可在廉价PCServer上搭建大规模集群。图8-5HBase与HDFS和MapReduce的关系(教材第139页)海量数据关系库在亿字节级查询愈发迟缓;HBase对TB、PB级数据依然高效。无模式每行一个可排序主键+任意数量的列,列可动态增加,同行不同列亦可;数据皆为字符串,无类型之分。高并发支持高并发读写;按行键(RowKey)查询极快,支撑每天上亿字节级访问。计算机科学概论(微课版)|第8章大数据148.3大数据存储·分布式数据库HBase的逻辑模型与物理模型逻辑模型:本质是键值(Key-Value)数据库列必须归属于列族(ColumnFamily),由列修饰符(Qualifier)标识;一行=行键+若干列及值。Key=RowKey+ColumnFamily+ColumnQualifier+TimeStamp+KeyType。修改数据=新增一个时间戳版本;读取时按版本排序,取最近一次修改,保障读写高性能;特别适合稀疏记录。图8-6HBase的逻辑模型(教材第139页)物理模型:面向列族存储每个列族在磁盘上拥有自己的HFile集合(二进制文件,按列族隔离管理);HBase不存空记录(NULL不写盘),读取时只读用到的列族——稀疏数据因此存得省、读得快。一行中列族的数据在物理上存放在一起,按行键范围划分存储到不同的Region——Region是数据的逻辑与管理单元。计算机科学概论(微课版)|第8章大数据158.3大数据存储·分布式数据库HBase体系结构与NoSQL家族图8-7HBase架构图(教材第140页)四大组件(主从架构)Client:访问接口,缓存元数据加速访问。ZooKeeper:协调服务,保障Master高可用、监控RegionServer、保存元数据入口。Master:Region分配、DDL操作、故障恢复。RegionServer:处理读写,管理Region;内存分MemStore(写)与BlockCache(读)。写入流程:Client经ZooKeeper找到RegionServer→定位Region与列族→先写MemStore,达阈值后溢写(Flush)为StoreFile(HFile)。NoSQL家族(NotonlySQL):列式HBase、键值Redis、文档MongoDB、图Neo4j——以灵活扩展、灵活数据模式、与云计算紧密融合而迅速发展。计算机科学概论(微课版)|第8章大数据168.4大数据分析·理解与预处理淘沙之前:数据理解与预处理采集存储后的数据犹如河滩淘来的沙,须经"淘沙提炼"才见黄金——理解与预处理是分析的第一步。数据多样性(四个方面)①格式多样:数值、文本、图形、图像、音频、视频等异构类型;②组织方式多样:属性-值型(如成绩表)与链接型(如社交关系图);③时序性:以时间为下标的数据序列,需时序挖掘、流数据分析等专门方法;④交互性:被观察对象会"有意加工"自己产生的数据,数据与对象相互耦合。数据规范化(Normalization)按比例缩放数据到较小特定区间,去除度量单位限制,便于比较与加权;含同趋化与无量纲化两方面。·最小-最大规范化:线性映射到[0,1]·Z分数规范化:按均值与标准差转为正态分布特征工程用领域知识从原始数据中提取可用特征:·特征表示:原始数据→可计算的特征向量·特征提取:重构新特征Y=f(X),降维去噪·特征选择:选出最优特征子集(筛选器/封装器评价)计算机科学概论(微课版)|第8章大数据178.4大数据分析·数据挖掘关联分析与数据分类关联分析:啤酒与尿布1993年安格沃尔提出关联规则,源于超市购物篮分析。沃尔玛发现"啤酒"与"尿布"常同现——年轻父亲买尿布时顺便买啤酒,于是把两者同区陈列,销量大增。Apriori算法核心=先验原理:项集频繁⇒其所有子集必频繁;项集非频繁⇒其所有超集必非频繁。借此"连接—剪枝—验证"逐层找出频繁项集。数据分类:有监督的三步用带标签数据构建分类模型,预测未分类样本的类别(如垃圾邮件识别)。①训练集构建模型;②测试集评估优化;③实际应用:对真实数据实时分类预测。常用分类算法简要描述(教材表8-1,第143页)决策树按树状结构把数据分成若干分支,每个分支体现类别归属共性K-近邻最经典简单的有监督方法,依据K个最近邻样本类别决定对象类别朴素贝叶斯基于贝叶斯定理与特征条件独立假设的概率分类方法SVM在样本空间中寻找超平面,把不同类别的样本分开神经网络模拟人脑神经元,调整连接权重与阈值,经激活函数产生输出计算机科学概论(微课版)|第8章大数据188.4大数据分析·数据挖掘数据回归与数据聚类数据回归:预测性建模研究因变量与自变量的关联,用于预测分析、时间序列与因果探寻(如疲劳驾驶与事故数量的关系)。①建立定量关系式,最小二乘法估参;②检验关系式的可信度;③判别影响显著的自变量,纳入模型、剔除不显著者;④用关系式进行预测或控制。数据聚类:无监督的"物以类聚"对无标签数据按相似性度量分组:类内相似度高、类间相似度低;分几类、各归哪类事先均未知。应用:生物信息学中聚类动植物特征认知种群结构;商业中按客户数据聚类辅助选址与营销。常用聚类算法简要描述(教材表8-2,第144页)K-means以平均值为类中心的分割聚类,把n个对象分成K个簇,最经典PAM/CLARA对K-means的改进:削弱离群点敏感度;抽样寻代表对象提升效率DBSCAN基于高密度连通区域,把"类"定义为高密度相连点的最大集合OPTICS克服DBSCAN不足,生成增广簇排序并据此提取类簇谱聚类基于图论,可在任意形状样本空间聚类并收敛于全局最优计算机科学概论(微课版)|第8章大数据198.4大数据分析·数据可视化四类常见数据可视化①文本数据可视化标签云按词频排序布局,字号代表重要性,快速识别主题热度——如2022年《政府工作报告》标签云。图8-8(教材第145页)②关系数据可视化以节点与连接呈现网络中隐匿的关联——某篇论文与其他论文的引用关系一目了然。图8-9(教材第145页)③时空数据可视化融合地理制图与可视化:美国任一地点到最近麦当劳的距离图,越亮越近;流式地图、时空立方体进一步发展。图8-10(教材第146页)④统计数据可视化运用最早:饼图、直方图、散点图、柱形图等,是PPT、报表、新闻中最常见的沟通方式。计算机科学概论(微课版)|第8章大数据208.5大数据处理·计算框架批处理·流处理·内存计算批处理(离线计算)先把数据存到硬盘,再对静态数据集中计算。Hadoop是典型架构:HDFS存储+MapReduce分配计算到各数据节点。用于电影渲染、生物数据分析、金融保险分析等。图8-11(教材第147页)流处理(在线计算)数据到来即算,及时反馈,不等全部到齐——在数据有效期内获取价值。架构:多源采集→Kafka消费(日志清洗)→Flink/Spark处理计算。用于金融服务、网络监控、传感监测、微博热搜等。图8-12(教材第147页)内存计算把数据载入内存处理以避免I/O,是提升时效性的重要途径。Spark把中间结果弹性分布式数据集(RDD)尽可能放入内存,迭代与多查询都快得多。图8-13(教材第148页)选择口诀:数据齐了再算选批处理;来了就要算选流处理;反复迭代要快选内存计算计算机科学概论(微课版)|第8章大数据218.5大数据处理·MapReduceMapReduce:分而治之的并行模型Google于2003—2004年发表论文提出MapReduce,初衷是解决搜索引擎大规模网页数据的并行化;思想源自函数式语言(Lisp)的map/reduce原语。2004年DougCutting受启发开发出开源的Hadoop,成为Apache最重要的项目之一。图8-14MapReduce模型(教材第149页)Map阶段读入分片转为键值对→map函数逐一处理→按键分区、排序、分组,相同键的值聚合。Reduce阶段Shuffle:复制本分区结果→合并排序后调用reduce函数→输出保存到文件(HDFS副本)。计算机科学概论(微课版)|第8章大数据228.5大数据处理·MapReduce实例:Wordcount词频统计#Wordcount伪代码#key:字符串偏移量#value:文件中一行内容map(key,value){words=splitIntoToken(value)for(eachwordinwords){set(word,1)#(单词,1)}}

#key:单词;values:次数列表reduce(key,values){intresultfor(eachvalueinvalues){result+=value}write(key,result)}图8-15Wordcount任务执行流程(教材第150页)输入切分为若干Split,每个交给一个Map;结果按Reduce个数分区;Reduce把同Key数据聚集求和——"HelloWorld/HelloBigData"最终输出Hello,2World,1Big,1Data,1。回扣开篇:微博热搜=流处理实时清洗分析搜索记录;搜索引擎用MapReduce实现PageRank排序计算机科学概论(微课版)|第8章大数据23章末·本章小结第8章小结:大数据❶概述——大数据是传统工具无法在可容忍时间内处理的海量数据,特征是5V:量大、速度快、多样、价值密度低、真实性强;发展历经萌芽、成熟、应用三阶段。❷采集——五类数据源(传感器、互联网、日志、企业业务、政府);两大方法:ETL(抽取—转换—装载)与网络爬虫(种子URL出发循环抓取)。❸存储——HDFS:64MB数据块+三副本,namenode管命名空间、datanode存块;HBase:面向列的键值数据库,RowKey高并发,Region管理,属NoSQL家族。❹分析——先预处理(规范化、特征工程);再挖掘:关联(Apriori)、分类(有监督)、回归(最小二乘)、聚类(K-means等);最后用文本/关系/时空/统计四类可视化呈现。❺处理

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论