第6章大数据技术_第1页
第6章大数据技术_第2页
第6章大数据技术_第3页
第6章大数据技术_第4页
第6章大数据技术_第5页
已阅读5页,还剩1页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

ADDINCNKISM.UserStyle教案首页课序第次学时周次第教学周教学题目大数据技术教学目标知识了解和理解大数据存储技术和大数据计算技术;熟练掌握大数据采集及预处理、大数据存储技术、大数据计算技术和数据挖掘与可视化分析。能力熟练掌握大数据采集及预处理、大数据存储技术、大数据计算技术和数据挖掘与可视化分析。情感通过学习让学生进一步理解科学技术就是生产力,掌握用科技力量来助力社会发展,让数据说话。教学重点掌握从大数据采集与预处理到大数据可视化整个流程及需要的相应技术。教学难点大数据采集及预处理、大数据存储技术、大数据计算技术。教学方法手段采用课堂互动讲解+研讨分析,线下提供学习资源多媒体+课后作业教学组织方式1.讲解2.互动3.练习4.课后作业5.预习课后反思(课后手写)教学环节课程引入新课讲解课堂讨论每课小结布置作业时间分配(以分钟计算)575532教学设计【教学进程安排】课程引入:1.总计回顾上节课内容2.提问大数据基本处理流程?3.大数据每个阶段的技术?一、大数据处理过程大数据处理过程可以概括为从数据产生开始,经历采集、管理、计算分析,最后将结果呈现出来的过程。二、大数据采集与预处理1.数据采集数据采集,又称“数据获取”,指通过各种技术手段采集外部各种数据源产生的实时或非实时的数据。互联网数据采集、业务数据采集、日志数据采集2.数据预处理数据预处理包括数据清洗、数据转换、数据集成、数据脱敏、数据归约和数据标注等。三、大数据存储技术1.HDFSHDFS是Hadoop的核心技术之一。HDFS为大数据平台的其他所有组件提供了基本的存储功能,其高容错、高可靠、高可扩展、高吞吐率等特征,为大数据存储和处理提供了强大的底层存储架构。HDFS是大数据平台的基础。2.NoSQL数据库大数据时代要求数据库系统必须具有高并发读写、海量数据的高效存储和管理、高可扩展性和高可用性。NoSQL数据库特点:易扩展、高性能、高灵活性、高可用性、开源、成本低。NoSQL数据库类型:,典型的NoSQL数据库通常包括键值数据库、列族数据库、文档数据库和图数据库。3.HbaseHBase是一款高可靠、高性能和可伸缩的NoSQL数据库,主要用来存储非结构化和半结构化的松散数据。HBase已经成功应用于互联网服务领域和传统行业的众多在线数据分析处理系统。HBase是一个稀疏、多维度、排序的映射表,这张表的索引是行键、列族、列限定符和时间戳。四、大数据计算技术大数据计算主要是面对大规模的海量数据进行的并行处理、分析和挖掘,以满足相应的业务需求。针对不同的业务场景,大数据计算主要有批处理计算、流计算、查询分析计算和图计算这4种类型。1.批处理在业务处理中常见的大数据批处理计算框架有MapReduce和Spark,其中,MapReduce的影响力更大。MapReduce和Spark都是用于处理海量数据的,但是在处理方式和处理速度上存在着差异,MapReduce是基于磁盘处理数据的,Spark处理数据是基于内存的。MapReduce将中间结果保存到磁盘中,减少了内存占用,牺牲了计算性能;Spark将计算的中间结果保存到内存中,可以反复利用中间结果,提高了处理数据的性能。MapReduce工作流程:MapReduce工作流程中的5个执行阶段:统计出文本单词的出现频率:2.流计算流计算通过实时获取来自不同数据源的海量数据,经过实时分析处理,获得有价值的信息。流计算与批处理计算有如下不同:流计算处理的是实时的数据,而批处理计算处理的是预先存储好的静态数据;流计算用户通过流处理系统获取的是实时结果,而通过批处理系统获取的是过去某一时刻的结果。Storm是一个免费、开源的流计算系统,Storm可以简单、高效、可靠地处理流数据,并支持多种编程语言,Storm框架可以方便地与数据库系统进行整合,从而开发出强大的流计算系统。Storm集群架构:Storm的工作流程:3.查询分析计算针对大数据的存储管理和查询分析计算场景,需要提供实时响应或准实时响应。OLAP就是典型的查询分析计算的应用场景。Hive、Dremel、Cassandra、Impala等都是在这方面具有代表性的引擎。Hive的系统架构:4.图计算针对大型图的计算,目前通用的图计算软件主要包括两种:第一种主要是基于遍历算法的、实时的图数据库,如Neo4j、OrientDB、DEX和InfiniteGraph;第二种则是以图顶点为中心的、基于消息传递批处理的并行引擎,如GoldenOrb、Giraph、Pregel和Hama等。五、数据挖掘与可视化分析1.数据挖掘数据挖掘是指从大量数据中揭示出隐含的、先前未知的并有潜在价值的信息的过程。数据挖掘的任务有关联分析、聚类分析、分类分析、异常分析、特征群组分析和演变分析等。2.可视化分析通过数据挖掘,能够快速找出数据中隐藏的信息规律和真相。数据可视化能通过简洁直观的点、线、面组成的图形直观地展示这些数据信息,可以帮助人们快速捕获和保存信息。数据可视化是大数据处理的最后一个环节。七、总结:六、作业:1)HDFS中NameNode和DataNode的作用。2)大数据有几种计算类型,分别解决什么问题。3)Hive与关系数据库的区别。思考题(案例

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论