大数据分析技术应用- 课件 第二章Flink实时数据分析_第1页
大数据分析技术应用- 课件 第二章Flink实时数据分析_第2页
大数据分析技术应用- 课件 第二章Flink实时数据分析_第3页
大数据分析技术应用- 课件 第二章Flink实时数据分析_第4页
大数据分析技术应用- 课件 第二章Flink实时数据分析_第5页
已阅读5页,还剩11页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

Flink流处理简介学习目标什么是Flink为什么要用FlinkFlink的主要特点132知识思政技能流处理的发展和演变吃苦耐劳科学探索精神技术前提Centos7.0Hadoop生态圈什么是Flink?Flink是分布式实时和离线计算引擎,用于在无界数据流和有界数据流上进行有状态的计算,能在常见集群环境中运行,并能以内存速度和任意规模进行计算。为什么要用Flink?强大的数据流处理能力:Flink是一个高性能分布式的流处理框架。滚动窗口与水位线配置:Flink提供了滚动窗口和水位线的配置,确保相同类型的数据能够得到统一的处理。与数据库交互简单:与MySQL、ClickHouse和Redis都有良好的交互性。稳定性和容错性:Flink被广大开发者认可为稳定且容错的框架。Flink应用场景应用场景包括:实时数据计算、实时数据仓库和ETL、事件驱动型场景,如告警、监控;此外,随着Flink对机器学习的支持越来越完善,还可以被用作机器学习和人工智能。流处理的发展和演变流处理:对于具体应用来说,有些场景数据是一个一个来的,是一组有序的数据序列,我们把它叫作“数据流”;容易想到,处理数据流,当然应该“来一个就处理一个”,这种数据处理模式就叫作流处理。批处理:有些场景的数据,本身就是一批同时到来,是一个有限的数据集,这就是批量数据(有时也直接叫数据集)。处理批量数据自然就应该一批读入,一起计算,这种方式就叫作批处理,也叫作离线处理。流处理的发展和演变传统数据处理架构:系统所处理的连续不断的事件,其实就是一个数据流。传统的事务处理,就是最基本的流处理架构。流处理的发展和演变有状态的流处理:把需要的额外数据保存成一个“状态”,然后针对这条数据进行处理,并且更新状态。流处理的发展和演变lambda架构:用两套系统,同时保证低延迟和结果准确。流处理的发展和演变第三代流处理器:这一代系统做到了精确一次(exactly-once)的一致性保障,是第一个具有一致性和准确结果的开源流处理器。另外,先前的流处理器仅能在高吞吐和低延迟中二选一,而新一代系统能够同时提供这两个特性。Flink是第三代分布式流处理器,它的功能丰富而强大。Flink主要特点事件驱动(Event-driven)Flink主要特点基于流的世界观:在Flink的世界观中,一切都是由流组成的,离线数据是有界的流;实时数据是一个没有界限的流:这就是所谓的有界流和无界流。Flink主要特点分层API:越顶层越抽象,表达含义越简明,使用越方便;越底层越具体,表达能力越丰富,使用越灵活FlinkorSparkStreaming?数据模型:spark采用RDD模型,sparkstreaming的DStream实际上也就是一组组小批数据RDD的集合。flink基本数据模型是数据流,以及事件(Event)序列。运行时架构:

spark是批计算,将DAG划分为不同

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论