Spark大数据分析实战课件_第1页
Spark大数据分析实战课件_第2页
Spark大数据分析实战课件_第3页
Spark大数据分析实战课件_第4页
Spark大数据分析实战课件_第5页
已阅读5页,还剩75页未读, 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

1、Spark大数据分析演讲人2020-12-0201Spark简介Spark简介DSpark架构ERDDASpark执行特点BSpark优势CSpark生态系统BDASSpark简介Spark执行特点数据格式和内存布局使用RDD0204任务调度使用事件驱动AKKA,避免使用线程池中间结果无需输出到HDFS03执行策略不同Stage需要shuffle01Spark简介Spark优势01打造全栈多计算凡是的高效数据流水线03易于使用,支持多语言05社区活跃度高02轻量级快速处理04ExternalDataSource多数据支持打造全栈多计算凡是的高效数据流水线支持MR, SQL查询, 流式计算, 机

2、器学习和图算法, 用户可以在一个工作流无缝搭配这些计算范式轻量级快速处理Scala简化了代码利用了第三方组件基于内存计算,减少了磁盘IO易于使用,支持多语言支持Scala,Java,Python自带80多个算子Spark简介Spark生态系统BDAS数据分析栈组件组件Spark组件Spark SQLSpark Streaming流式计算吞吐量超过Strom组件GraphX经行大规模同步全局的图计算组件分布式机器学习算法库分类, 回归, 聚类 ,协同过滤 , 梯度下降优化MLlibSpark简介Spark架构Spark组件运行逻辑Spark组件DirverClientWorkerExecutor

3、SparkConextRDDSpark组件Task Scheduler02DAG schedule01SparkEnv03Dirver创建SparkContext的main函数Spark组件Client用户提交作业的客户端Spark组件Worker集群中任何可以运行Application代码的节点, 运行一个或多个Executor进程Spark组件Executor运行Worker的Task执行器Spark组件SparkConext应用的上下文, 控制应用的声明周期Spark组件RDDSpark组件Spark的基本计算单元, 一组RDD形成执行的有向无环图DAG scheduleSpark组件根

4、据Job构建基于Stage的DAG工作流, 并提交Stage给TaskSchedulerTask SchedulerTask分发给Executor执行Spark组件SparkEnv线程级别的上下文Spark组件运行逻辑作业提交 Client-Master- Worker-Driver-Master-RDD-Stage DAG - TaskScheduler- Executor作业执行 ShuffleSpark简介RDDRDD的重要内部属性Spark计算工作流弹性分布式数据集RDD创建方式RDD的两种操作算子RDD创建方式011. HDFS输入创建022. 父RDD转换033. parallei

5、ze或makeRDD将单机数据创建为分布式RDDRDD的两种操作算子转换(Transformation) 延迟计算map, flatMap, mapPartitions.行动(Action) 触发提交作业Jobforeach, saveAsTextFile.RDD的重要内部属性对父RDD的依赖列表对key-value pair数据类型RDD的分区器, 控制分片策略和分区数计算每个分片的函数每个数据分区的地址列表分区列表02BDASBDASSQL on Spark(替代Hive)A1. Catalyst架构及执行流程2. SparkSql优化策略BSpark Streaming(替代Storm)

6、优势与特点 1. 多范式数据分析管道2. 扩展性, 可运行在100个节点以上的集群3. 容错性4. 吞吐量大(超过Storm)5. 实时性比Storm略低(batch size选取为0.52S, storm为100ms)Spark Stream架构BDASGraphX(替代GraphLab)BDASMLlib(替代Mahout)03Lamda架构日志分析流水线Lamda架构日志分析流水线日志分析指标PV01UV02留存率05漏斗模型与转化率04PVUV03Lamda架构日志分析流水线Lamda架构010203速度层(Speed Layer)批处理层(Batch Layer)服务层(Servin

7、g Layer)实时日志分析流水线架构Flume NG数据采集0102Flume 汇总到Kafka数据汇总和转发Spark Streaming数据处理0304Flask结果呈现离线日志分析流水线架构Flume转储到HDFS数据存储Spark SQL数据处理Flask结果呈现04基于云平台和用户日志的推荐系统基于云平台和用户日志的推荐系统系统架构 数据收集聚合数据处理结果输出离线训练 Spark MLlib中的ALS模型05分布式的搜索引擎分布式的搜索引擎计算网页的PageRank值06微博情感分析微博情感分析数据收集热点微博分析Spark SQL进行离线分析系统架构数据预处理和Cassandr

8、a存储在线情感分析微博情感分析微博可视化热点新闻分析系统微博情感分析系统架构Spark分析模块03Spark Streaming 微博收集与分析模块01Mysql结果存储模块04Cassandra持久化存储模块02系统架构提供可视化数据Mysql结果存储模块04情感分析Spark分析模块03 Cassandra持久化存储模块02实时聚类和热点分析Spark Streaming 微博收集与分析模块01数据收集微博数据收集微博情感分析数据收集微博数据收集数据预处理和Cassandra存储作为存储引擎进行数据分析微博情感分析数据预处理和Cassandra存储作为存储引擎进行数据分析热点微博分析Spa

9、rk Stream 滑动窗口API微博情感分析热点微博分析Spark Stream 滑动窗口API在线情感分析使用递归神经网路RNN经行微博情感分析在线情感分析使用递归神经网路RNN经行微博可视化D3, Echarts, HightCharts.微博情感分析微博可视化D3, Echarts, HightCharts.微博情感分析热点新闻分析系统01系统架构02爬虫抓取网络信息03新闻文本数据预处理04新闻聚类05Spark Elastic Search 构建全文检索引擎系统架构新闻抓取模块01Scrapy抓取Kafka传输Mongo存储实时新闻分析模块02Spark Streaming实时处理

10、离线新闻分析模块03Spark定时从MongoDB中批量处理,离线热点分析可视化呈现界面04 热点新闻分析系统爬虫抓取网络信息热点新闻分析系统新闻文本数据预处理新闻聚类文本聚类分析 1. 使用向量空间模型进行数据转换2. 通过K-Means进行聚类数据准换为向量 向量空间模型热点新闻分析系统Spark Elastic Search 构建全文检索引擎07热点新闻分析系统系统架构新闻抓取模块01Scrapy抓取Kafka传输Mongo存储实时新闻分析模块02Spark Streaming实时处理离线新闻分析模块03Spark定时从MongoDB中批量处理,离线热点分析可视化呈现界面04 热点新闻分析系统爬虫抓取网络信息热点新闻分析系统新闻文本数据预处理新闻聚类文本聚类分析 1. 使用向量空间模型进行数据转换2. 通过K-Means进行聚类数据准换为向量 向量空间模型热点新闻分析系统Spark Elastic Search 构建全文检索引擎08个性化推荐算法协同过滤推荐算法基

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论