版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
第三章Spark安装与配置学习目标Spark的定义Spark与Hadoop的区别Spark核心模块及运行架构132知识思政技能Spark安装与配置吃苦耐劳科学探索精神技术前提Centos7.0Hadoop生态圈Spark定义Spark是一种基于内存的快速、通用、可扩展的大数据分析计算引擎。Spark的设计旨在提高大数据处理的效率,它通过在内存中存储和处理数据,减少了磁盘IO和数据落地操作,从而提高了计算速度。对于数据源而言,Spark支持从HDFS、HBase、Hive及Kafka等多种途径获取,数据。Spark与Hadoop区别Hadoop的MR框架和Spark框架都是数据处理框架。HadoopMapReduce由于其设计初衷并不是为了满足循环迭代式数据流处理,因此在多并行运行的数据可复用场景(如:机器学习、图挖掘算法、交互式数据挖掘算法)中存在诸多计算效率等问题。Spark就是在传统的MapReduce计算框架的基础上,对其计算过程进行优化,从而大大加快了数据分析、挖掘的运行和读写速度,并将计算单元缩小到更适合并行计算和重复使用的RDD计算模型。Spark和Hadoop的根本差异是多个作业之间的数据通信问题:Spark多个作业之间数据通信是基于内存,而Hadoop是基于磁盘。Spark核心模块Spark框架主要有SparkCore、SparkSQL、SparkStreaming、SparkMllib和SparkGraphX组成。Spark运行架构Spark框架的核心是一个计算引擎,整体来说,它采用了标准master-slave的结构。图形中的Driver表示master,负责管理整个集群中的作业任务调度。图形中的Executor则是slave,负责实际执行任务。Spark安装部署Spark作为一个数据处理框架和计算引擎,主要有要本地运行模式(Local模式)、独立运行模式(Standalone模式)和YARN,在国内工作中主流的环境为Yarn。接下来,我们就分别看看不同环境下Spark的安装与部署。Spark本地模式(Local)安装安装步骤:(1)将spark-3.0.3-bin-hadoop3.2.tgz文件上传到Linux并解压缩,放置在指定位置,路径中不要包含空格。具体命令:tar-zxvfspark-3.0.0-bin-hadoop3.2.tgz-C/opt/module(2)修改spark-3.0.3-bin-hadoop3.2名称为spark-local,具体命令:
mvspark-3.0.3-bin-hadoop3.2spark-local启动SparkLocal环境启动步骤:(1)进入安装目录后的路径,执行如下指令:
bin/spark-shell(2)启动成功后,可以输入网址进行WebUI监控页面访问http://虚拟机地址:4040bin/spark-submit\--classorg.apache.spark.examples.SparkPi\--masterlocal[2]\./examples/jars/spark-examples_2.12-3.0.3.jar\101)--class表示要执行程序的主类,此处可以更换为咱们自己写的应用程序2)--masterlocal[2]部署模式,默认为本地模式,数字表示分配的虚拟CPU核数量3)spark-examples_2.12-3.0.0.jar运行的应用类所在的jar包,实际使用时,可以设定为咱们自己打的jar包4)数字10表示程序的入口参数,用于设定当前应用的任务数量启动SparkLocal提交应用Spark独立运行模式(Standalone)安装本地模式(Local)只是用来进行练习演示的,真实工作中还是要将应用提交到对应的集群中去执行,Standalone模式使用Spark自身节点运行的集群模式,体现了经典的master-slave模式。安装之前要进行集群规划:HostNameHadoop01Hadoop02Hadoop03SparkWorkerMasterWorkerWorker安装步骤:(1)将spark-3.0.3-bin-hadoop3.2.tgz文件上传到Linux并解压缩,放置在指定位置,路径中不要包含空格,修改文件名为spark-standalone。(2)进入解压缩后路径的conf目录,修改slaves.template文件名为slaves,添加work节点,具体命令:mvslaves.templateslavesvi
slaves
在文件添加如下内容:Hadoop01Hadoop02hadoop03Spark独立运行模式(Standalone)安装安装步骤:(3)修改spark-env.sh.template文件名为spark-env.sh,具体命令:
mvspark-env.sh.templatespark-env.sh(4)修改spark-env.sh文件,添加JAVA_HOME环境变量和集群对应的master节点,并指定master的端口号,具体命令:vi
spark-env.sh
添加如下内容:exportJAVA_HOME=/export/servers/jdkSPARK_MASTER_HOST=hadoop01SPARK_MASTER_PORT=7077Spark独立运行模式(Standalone)安装安装步骤:(5)分发spark-standalone目录scp-r/opt/module/spark-standalonehadoop02://opt/modulescp-r/opt/module/spark-standalonehadoop03://opt/moduleSpark独立运行模式(Standalone)安装启动集群(1)在Hadoop01中进行安装目录,如输入如下命令:sbin/start-all.sh(2)查看三台服务器运行进程Spark独立运行模式(Standalone)安装启动集群(3)查看Master资源监控WebUI界面:http://hadoop01:8080Spark独立运行模式(Standalone)安装提交应用bin/spark-submit\--classorg.apache.spark.examples.SparkPi\--masterspark://hadoop01:7077\./examples/jars/spark-examples_2.12-3.0.3.jar\101)--class表示要执行程序的主类2)--masterspark://linux1:7077独立部署模式,连接到Spark集群3)spark-examples_2.12-3.0.3.jar4)数字10表示程序的入口参数,用于设定当前应用的任务数量Spark独立运行模式(Standalone)安装在任务执行时查看每台计算机,Java进进程执行任务时,默认采用服务器集群节点的总核数,每个节点内存1024M。Spark独立运行模式(Standalone)安装SparkYarn模式安装独立部署(Standalone)模式由Spark自身提供计算资源,无需其他框架提供资源。这种方式降低了和其他第三方资源框架的耦合性,独立性非常强。但要注意的是,Spark主要是计算框架,而不是资源调度框架,所以本身提供的资源调度并不是它的强项,利用其他专业的资源调度框架集成会更靠谱。Yarn就是专业的资源高度框架,用他管理Spark计算资源,数据处理效率会有很大的提高。安装步骤:(1)将spark-3.0.3-bin-hadoop3.2.tgz文件上传到Linux并解压缩,放置在指定位置,路径中不要包含空格,修改文件名为spark-yarn。(2)由于Hadoop运行环境中,默认会启用一个线程检查每个任务正使用的物理内存量和虚拟内存,当超出分配值,则会关闭,会影响到Spark资源的调度。SparkYarn模式安装<property><name>yarn.nodemanager.pmem-check-enabled</name><value>false</value></property><property><name>yarn.nodemanager.vmem-check-enabled</name><value>false</value></property>安装步骤:(3)修改conf/spark-env.sh文件,添加JAVA_HOME和YARN_CONF_DIR配置,具体命令:vi
spark-env.sh
添加如下内容:exportJAVA_HOME=/export/servers/jdkYARN_CONF_DIR=/opt/module/hadoop/etc/hadoopSparkYarn模式安装安装步骤:(4)启动HDFS以及YARN集群SparkYarn模式安装(5)提交应用bin/spark-submit\--class
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 内容创作者内容产出与用户满意度绩效衡量表
- 专题1.1 反比例函数的概念(举一反三)(试题版)
- 小学主题班会课件-学习古诗词,弘扬中华文化
- 汽车电子技术及其应用案例分析
- 产品安全事故处理告知函3篇
- 制造业智能生产流程优化方案
- 警惕网络诈骗筑牢财产安全防线小学主题班会课件
- 关键业绩指标设定及执行情况考核表
- 小学主题班会课件:体验生活百态提升社会责任感
- 时间管理与效率优化绩效评定表
- 2026年广告设计师全国统一考试大纲解析试题及真题
- 毛选介绍教学课件
- 成人住院患者跌倒风险评估及预防模板
- 平房灭火救援授课课件
- 2025年高频考点国企《人力资源管理岗》专业知识考试卷(含解析)及答案
- GB/T 26952-2025焊缝无损检测磁粉检测验收等级
- 化学安全和防护知识培训课件
- 工业产品批生产记录标准模板
- 兴文县竹纤维环保餐具生产项目环评报告
- 2024年淮北市濉溪县事业单位笔试真题(附答案)
- 动物疫病检疫培训课件
评论
0/150
提交评论