《大数据平台部署与应用》 项目实施课件 项目9 部署与应用Spark_第1页
《大数据平台部署与应用》 项目实施课件 项目9 部署与应用Spark_第2页
《大数据平台部署与应用》 项目实施课件 项目9 部署与应用Spark_第3页
《大数据平台部署与应用》 项目实施课件 项目9 部署与应用Spark_第4页
《大数据平台部署与应用》 项目实施课件 项目9 部署与应用Spark_第5页
已阅读5页,还剩30页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

部署完全分布式Spark集群任务描述在使用Spark分析水稻信息数据之前,需要先在平台上部署Spark集群,在本任务中,小数将基于项目2部署的Hadoop集群,进一步部署完全分布式Spark集群。任务环境已部署Hadoop集群的3台CentOS7操作系统的虚拟机。任务描述与任务环境目录1解压Spark下载Spark2修改配置文件3从Spark官网下载Spark安装包“spark-3.1.1-bin-without-hadoop.tgz”。使用Xftp8远程传输工具将Spark安装包传输至master虚拟机/opt/software目录下。下载Spark目录1解压Spark下载Spark2修改配置文件3在master虚拟机解压安装包spark-3.1.1-bin-without-hadoop.tgz至/opt/module目录下。解压操作完成后查看解压目录,结果中能够看到“spark-3.1.1-bin-without-hadoop”,说明文件已解压成功。修改spark-3.1.1-bin-without-hadoop的名称为spark-3.1.1。解压Spark目录1解压Spark下载Spark2修改配置文件3执行“vim/etc/profile”命令进入/etc/profile文件中配置环境变量,进入文件后在文件末尾添加Spark环境变量并保存退出。执行“source/etc/profile”命令使环境变量立即生效。修改配置文件在$SPARK_HOME/conf目录下将spark-env.sh.template复制并重命名为spark-env.sh。修改配置文件在Linux中,“$”符号常见的含义如下:变量替换:在“$”符号后跟随变量名,可以用来获取该变量的值。命令替换:使用“$(command)”结构,可以执行括号内的“command”并将输出结果替换到当前位置。参数替换:在脚本或函数中,“$1”~“$9”分别代表脚本或函数的第1个~第9个参数。提示符:在命令行界面中,“$”通常用作普通用户(非root用户)的默认提示符,而“#”用作root用户的提示符。使用“vimspark-env.sh”命令打开spark-env.sh文件并在文件末尾添加配置内容。修改配置文件在$SPARK_HOME/conf目录下将workers.template复制并重命名为workers。打开workers文件,删除文件末行的“localhost”,并在文件中配置Spark集群中的工作节点。修改配置文件目录4启动Spark集群分发Spark至其他节点5验证集群是否部署成功6将在master上配置好的Spark相关配置文件分发给其他节点。分发Spark至其他节点目录4启动Spark集群分发Spark至其他节点5验证集群是否部署成功6在master节点启动Spark集群。启动Spark集群在$SPARK_HOME/sbin目录中,start-all.sh脚本负责启动Spark集群的Master和Worker服务。该脚本允许用户一键启动整个Spark集群,提供了便捷的集群管理功能。然而,需要注意的是,如果在同一台Linux系统上安装了Hadoop和Spark,并且两者都在/etc/profile文件中添加了sbin目录到PATH环境变量,那么由于Hadoop的sbin目录通常会排在Spark之前,直接在命令行中执行“start-all.sh”命令可能会启动Hadoop集群而不是Spark集群。为了避免这种混淆,建议先进入$SPARK_HOME/sbin命令,再执行“start-all.sh”命令启动Spark集群。这样可以确保正确地启动Spark集群,避免对Hadoop集群的误操作。目录4启动Spark集群分发Spark至其他节点5验证集群是否部署成功6使用“jps”命令查看进程,master节点有“Master”进程,slave1和slave2节点有“Worker”进程。验证集群是否部署成功通过浏览器登录“master:8080”端口可查看Spark监控界面。可以看到2个Worker工作节点的信息,工作节点地址分别为31和32,即slave1和slave2。验证集群是否部署成功通过“$SPARK_HOME/bin/spark-shell”命令进入SparkShell命令行界面,在该界面中可以使用Scala语言进行数据读取、处理等操作。验证集群是否部署成功使用Spark实现水稻信息数据分析任务描述部署好完全分布式Spark集群后,便可以通过Scala语言在Spark中实现水稻信息数据分析了。在本任务中,小数将读取水稻信息数据并对其进行简单分析,以测试Spark集群的部分功能。任务环境已部署Hadoop集群和Spark集群的3台CentOS7操作系统的虚拟机。任务描述与任务环境目录1分析水稻数量情况读取水稻基本信息数据2水稻是全球最重要的粮食作物之一,水稻审定数据可以为农业科技创新提供重要的参考和依据,可以帮助选择高产、优质、抗逆性强的水稻品种,促进绿色、可持续的农业生产方式,有助于推动农业的可持续发展。对水稻审定信息进行数据处理是对其进行分析之前的不可或缺的步骤。读取水稻基本信息数据本任务采用的数据是经过数据预处理的水稻数据,可直接用于分析,部分水稻数据如下表。读取水稻基本信息数据序号品种名称亲本来源("×"前为母本)类型原产地/选育单位审定编号省份/部门1滇禾优801H479A×南801粳型三系杂交稻云南农业大学稻作研究所等国审稻20234003农业部2旱两优8208沪旱82S×旱恢808籼型两系杂交稻上海市农业生物基因中心国审稻20234002农业部3西子3号黄华占×珞红4A/IR28籼型常规稻湖南杂交水稻研究中心国审稻20234001农业部4中龙粳13号哈07-021×龙盘5号粳型常规稻黑龙江省农业科学院生物技术研究所国审稻20233271农业部5泰荣1号L6A×L100R粳型三系杂交稻国家粳稻工程技术研究中心等国审稻20233270农业部首先通过Xftp工具将rice.csv文件上传至master虚拟机的/opt/data/目录下。使用“$HADOOP_HOME/sbin/start-all.sh”命令启动Hadoop集群,并上传水稻信息数据至HDFS的/user/root中。使用“$SPARK_HOME/sbin/start-all.sh”命令启动Spark集群。使用“spark-shell”命令进入SparkShell界面。读取水稻基本信息数据调用系统自动初始化的SparkSession对象“spark”读取rice.csv文件的数据,并以DataFrame形式打印数据,通过spark中的read()方法中的option()设置首行为表头、编码格式为gbk、自动推断数据类型,再计算数据记录数。读取水稻基本信息数据在spark-shell默认的交互式命令行界面中,不会自动识别未完成的多行输入,这可能会导致在输入长语句或复杂表达式时出现错误。若想在spark-shell中能换行输出,可以输入“:paste”进入多行编辑模式,在编辑好代码后,键盘输入“Ctrl”+“D”,退出编辑模式并运行代码。目录1分析水稻数量情况读取水稻基本信息数据2深入探究农产品数量状况,是洞察农产品市场全局的关键。这一分析不仅对农业生产规划和供应链优化至关重要,而且是制定精准营销策略的基石。通过对市场现状的全面了解,相关方可确保农产品的生产与市场需求相匹配,进而提升产品质量,增强市场竞争力,为农业的可持续发展注入活力。水稻信息情况分析流程如下。分析水稻数量情况用groupBy()方法对“省份/部门”列进行分组,使用count()方法计算每个“省份/部门”水稻数量,最后使用sort()方法按数量降序排列对水稻数据进行处理和分析,统计“省份/部门”的数量。统计省级以上部门审定的水稻数量展示统计结果。“省份/部门”的一共有29个,其中审定数量前10的分别为农业部、广西、广东、湖南、黑龙江、江西、安徽、四川、湖北、福建。统计省级以上部门审定的水稻数量展示统计结果。结合统计结果可以看到农业部、广西和广东等数量最多,且均在平均值以上,水稻在中国的主要产区分布广泛,涵盖了南方、中部和东北部分地区,这些地区多为水资源丰富的地区,包括江河湖泊等水体,提供了充足的灌溉水源,有利于水稻的种

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论