版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
Spark:一个高效的分布式计算系统Spark具有的特点Spark集群搭建Spark工作流程SparkSQLSpark:一个高效的分布式计算系统Spark具有的特点1DLUT轻量级快速处理。Spark允许Hadoop集群中的应用程序在内存中以100倍的速度运行,即使在磁盘上运行也能快10倍。Spark通过减少磁盘IO来达到性能提升,它将中间处理的数据全部放到了内存中。Spark具有的特点DLUT轻量级快速处理。Spark允许Hadoop集群中的应2DLUT易于使用,Spark支持多语言。Spark支持Java、Scala及Python,这允许开发者在自己熟悉的语言环境下进行工作。支持复杂查询。在简单的“map”及”reduce”操作之外,Spark还支持SQL查询、流式查询及复杂查询。实时的流处理。对比MapReduce只能处理离线数据,Spark支持实时的流计算。可以与Hadoop和已存Hadoop数据整合。支持mysql数据库和HBase数据库。DLUT易于使用,Spark支持多语言。Spark支持Jav3DLUTSpark集群有多种部署方式,这里我们采用在Yarn上部署Spark集群。由于Yarn是Hadoop的第二代MapReduce,所以我们需要先部署Hadoop集群。一、Linux下Hadoop2.x完全分布式配置需要的软件包:javaJDK:jdk-8u20-linux-i586.tar.gzHadoop安装包:hadoop-2.4.1.tar.gz1.由于Hadoop需要javaJDK的支持所以要先安装javaJDK1.1解压下载的JDK,并放到目录/usr/lib/java中1.2修改环境变量,修改~/.bashrc或/etc/profile文件,在尾部添加如下信息:Spark集群搭建DLUTSpark集群有多种部署方式,这里我们采用在Yarn4DLUTexportJAVA_HOME=/usr/lib/java/jdk1.8.0_20exportJRE_HOME=${JAVA_HOME}/jreexportCLASSPATH=.:${JAVA_HOME}/lib:${JRE_HOME}/libexportPATH=${JAVA_HOME}/bin:$PATH1.3使配置文件生效source~/.bashrc或source/etc/profile1.4测试是否安装成功,在终端输入java–version如果出现java的版本信息则配置成功。2.安装ssh,Hadoop是采用ssh进行通信的,为了免去每次通信时都输入密码,设置免密码登陆。2.1在终端输入apt-getinstallssh命令安装ssh,完成后用命令/etc/init.d/sshstart启动服务。输入命令ps–e|grepssh验证服务是否正常启动2.2设置免密码登陆,生成私钥和公钥。输入命令以下命令:
ssh-keygen–trsa–P“”DLUTexportJAVA_HOME=/usr/lib/5DLUT在~/.ssh中将公钥id_rsa.pub追加到authorized_keys中,authorized_keys用于保存所有允许以当前用户身份登录到ssh客户端用户的公钥内容,命令如下:cat~/.ssh/id_rsa.pub>>~/.ssh/authorized_keys2.3测试是否可以免密码登陆:sshlocalhost退出登录用exit命令3.安装hadoop3.1把下载下来的hadoop解压到/usr/local/hadoop中3.2在hadoop-env.sh中配置java安装信息,设置java路径。3.3在/etc/profile中添加hadoop的配置信息如下:exportHADOOP=/usr/local/hadoop/hadoop-2.4.1exportPATH=${JAVA_HOME}/bin:${HADOOP}/bin:$PATH
使配置生效:source/etc/profile3.4用命令hadoopversion查看是否显示版本,显示则成功。3.5更改/etc/hosts文件如下:DLUT在~/.ssh中将公钥id_rsa.pub追加到au6DLUT localhost54 node264 node3这里可以改hostname文件,也可以不改。如果要改,那么就先改hostname,再改hosts,将里面原来的主机名改为新的名字。3.6配置文件slaves,作如下配置node2node33.7配置文件core-site.xmlDLUT localhost7DLUT<configuration> <property> <name></name> <value>hdfs://node2:9000</value> </property> <property> <name>hadoop.tmp.dir</name> <value>/usr/local/hadoop/hadoop-2.4.1/tmp</value> </property></configuration>DLUT<configuration>8DLUT3.8配置hdfs-site.xml<configuration> <property> <name>dfs.replication</name> <value>2</value> </property> <property> <name>.dir</name> <value>/usr/local/hadoop/hadoop-2.4.1/hdfs/name</value> </property> <property> <name>dfs.data.dir</name> <value>/usr/local/hadoop/hadoop-2.4.1/hdfs/data</value> </property></configuration>DLUT3.8配置hdfs-site.xml9DLUT3.9配置mapred-site.xml<configuration><property> <name></name> <value>yarn</value></property></configuration>3.10配置yarn-site.xmlDLUT3.9配置mapred-site.xml10DLUT<configuration><!--SitespecificYARNconfigurationproperties--><property><name>yarn.nodemanager.aux-services</name><value>mapreduce_shuffle</value><description>shuffleservicethatneedstobesetforMapReducetorun</description></property></configuration>3.11安装软件并把相应的配置信息复制到其它结点上,并通过ssh把所有结点的公钥集中到~/.ssh/authorized_keys中,并在每个结点都保留一份,实现结点间的免密码登陆。至此hadoop集群部署完毕,格式化并启动集群进行验证。DLUT<configuration>11DLUT$hdfsnamenode–format$cd$HADOOP$sbin/start-all.sh用jps命令验证进程是否启动。主结点:namenode,secondarynamenode,resourcemanager,datanode,jps,nodemanager其它结点:datanode,jps,nodemanager3.12web查看页面:http://node2:50070/DLUT$hdfsnamenode–format12DLUT二、部署Spark集群需要的软件包为:scala-2.10.4.tgzspark-1.1.0-bin-hadoop2.4.tgz1.安装Scala,把下载的安装包解压到/usr/lib/scala并修改环境变量,修改配置文件/etc/profile添加如下信息:exportSCALA_HOME=/usr/lib/scala/scala-2.10.4exportPATH=${SCALA_HOME}/bin:${JAVA_HOME}/bin:${HADOOP}/bin:$PATH使配置文件生效:source/etc/profile验证scala是否安装成功:scala–version显示版本则安装成功。DLUT二、部署Spark集群13DLUT2.安装Spark2.1将下载的安装包解压到/usr/local/spark配置环境变量,修改配置文件/etc/profile如下:exportSPARK_HOME=/usr/local/spark/spark-1.1.0-bin-hadoop2.4exportPATH=${SPARK_HOME}/bin:${SCALA_HOME}/bin:${JAVA_HOME}/bin:${HADOOP}/bin:$PATH使配置文件生效:source/etc/profile2.2配置Spark2.2.1修改Spark的conf下文件spark-env.sh添加如下内容:
DLUT2.安装Spark14DLUTexportJAVA_HOME=/usr/lib/java/jdk1.8.0_20exportSCALA_HOME=/usr/lib/scala/scala-2.10.4exportSPARK_MASTER_IP=54exportSPARK_WORKER_MEMORY=2gexportHADOOP_CONF_DIR=/usr/local/hadoop/hadoop-2.4.1/etc/hadoop2.2.2修改slaves文件,把worker节点都添加进去:node2node33.在其它节点上作相同的配置,至此Spark集群部署完毕。启动测试,先启动hadoop集群,然后在Spark的目录下运行sbin/start-all.sh,用jps命令查看是否启动成功。配置成功主节点多出两个:master,worker副节点多出一个:worker要进入Spark的shell界面运行命令:bin/spark-shellWeb查看页面:http://node2:8080http://node2:4040/stages/DLUTexportJAVA_HOME=/usr/lib/15DLUT1.在Sparkshell里运行的Spark实例把Spark安装目录下的README.md拷贝到HDFS系统上,然后统计里面单词Spark出现的次数,命令如下:hadoopdfs-mkdir/userhadoopdfs-copyFromLocalREADME.md/user/scala>valfile=sc.textFile(“hdfs://node2:9000/user/README.md”)scala>valsparks=file.filter(line=>line.contains(“Spark”))scala>sparks.count和ubuntu自带的wc命令作对比,在Spark目录下执行:grepSparkREADME.md|wcSpark工作流程DLUT1.在Sparkshell里运行的Spark实例16DLUT2.Spark工作流程sc
=
newSparkContextfile=sc.textFile(“…”)
sparks=file.filter(…)
sparks.count()
...YourprogramSparkclient
(appmaster)SparkworkerHDFS,HBase,…BlockmanagerTaskthreadsRDDgraphSchedulerBlocktrackerShuffletrackerCluster
managerDLUTYourprogramSparkclient
(17RDDGraphHadoopRDD
path=hdfs://...FilteredRDD
func=_.contains(…)
shouldCache=truefile:sparks:Partition-levelview:Dataset-levelview:Task1Task2...DLUTRDDGraphHadoopRDD
path=hdfs18Scheduling
Processrdd1.join(rdd2)
.groupBy(…).filter(…)RDDObjectsbuildoperatorDAGagnostictooperators!doesn’tknowaboutstagesDAGSchedulersplitgraphintostagesoftaskssubmiteachstageasreadyDAGTaskSchedulerTaskSetlaunchtasksviaclustermanagerretryfailedorstragglingtasksCluster
managerWorkerexecute
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 刀剪制作工安全实操测试考核试卷含答案
- 草食家畜饲养工核心能力强化考核试卷含答案
- 煤矿智能开采员岗前操作规范考核试卷含答案
- 瘢痕疙瘩护理查房
- 梅毒护理查房
- 2026年污水处理知识培训考试试题及答案
- 工程施工既有线保护综合应急预案
- 深基坑施工工艺
- 园林绿化建设坍塌事故专项应急预案
- 应急物资运输管理保证措施
- 医疗机构过敏性疾病门诊建设规范
- GB/T 32741-2025肥料、土壤调理剂和有益物质分类
- 公路工程交工验收汇报
- CAAC理论考试系统组成(黄金题型)
- 江苏省安全生产许可证实施细则
- 幼儿园体能知识培训课件
- 大连的介绍课件
- 九上物理暑假预习早背晚默 67天
- 《工程造价专业英语》课程简介与教学大纲
- 高一新生入学家长会校长讲话:携手启航新篇章共育英才向未来
- 医院志愿者岗前培训课件
评论
0/150
提交评论