版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
1.Hadoop伪分布式集群环境的搭建目录01回顾Hadoop核心02部署方式03安装JDK04安装Hadoop第二部分部署方式Hadoop部署方式单机模式伪分布模式完全分布式模式模式单机模式即本地模式是Hadoop的默认模式。当首次解压Hadoop的源码包时,Hadoop无法了解硬件安装环境,便保守地选择了最小配置。在这种默认模式下所有3个XML文件均为空。当配置文件为空时,Hadoop会完全运行在本地。因为不需要与其他节点交互,单机模式就不使用HDFS,也不加载任何Hadoop的守护进程。该模式主要用于开发调试MapReduce程序的应用逻辑。伪分布模式是在一台机器上模拟分布式部署,方便学习和调试。完全分布式即集群模式,是在多个机器上配置hadoop,是真正的“分布式”。安装前准备软件必备软件:VitualVox或vmwarecentosjdk-6u24-linux-xxx.binhadoop-2.7.2.tar.gz其他软件:Xfp4(上传文件)Xshell(连接两台子机)创建虚拟机,安装linux创建虚拟机,安装linux创建虚拟机,安装linux创建虚拟机,安装linuxHadoop内部含有多个核心架构,架构的运行需要内存的支持,所以如果运行内存过小(最小也都4g)会导致hadoop平台启动失败。创建虚拟机,安装linux点击使用ISO映像文件,找到你下载好的centos6.8系统,确定即可创建虚拟机,安装linux跳出以上弹窗是询问我们是否需要检查光盘,我们按右箭头,选择skip选项(即不用检测),Enter创建虚拟机,安装linux一路回车操作直到提示我们是否保留数据选择是,忽略所有数据然后下一步密码的设计一般使用简单的,方便我们以后做完全分布式搭建时好配置免密。创建虚拟机,安装linuxDesktop为桌面我们在操作过程中习惯使用界面化的操作所以在最后一步中,我们将默认的基本服务器(BasicServer)修改为桌面(Desktop)然后再点击下一步必须要选择桌面版的创建虚拟机,安装linux设置虚拟机的网络、修改ip对虚拟机网络进行配置,以便于远程登录到虚拟机,方便文件的传输。VMWare提供了三种工作模式,它们是bridged(桥接模式)、NAT(网络地址转换模式)和host-only(主机模式)设置虚拟机的网络、修改ip在电脑左下角中运行cmd在cmd中输入ipconfig/all查看你的Ipv4子网掩码网关DNS服务器设置虚拟机的网络、修改ip设置虚拟机的网络、修改ip点击编辑连接之后点击编辑然后在IPv4设置中把方法设置成手动,添加输入你刚才在cmd中看到的地址后面两位加70,为了防止学生之间IP重复把子网掩码、网管、DNS服务器添加进去然后应用即可修改完成之后在终端中执行ifconfigeth设置虚拟机的网络、修改ip在终端中输入ifconfig查看你的机器eth是多少,如果是1就执行ifconfigeth:1你设置的地址netmask如果是0就执行ifconfigeth:0你设置的地址netmask修改hostname1、修改/etc/hosts文件(root用户操作),添加:
ip主机名称5oracle2、更改主机名编辑/etc/sysconfig/network把主机名改为oracle第六步:SSH互信配置
rsa加密方法,公钥和私钥1、生成公钥和私钥在命令行执行ssh-keygen,然后回车,然后会提示输入内容,什么都不用写,一路回车在oracle用户根目录下,有一个.ssh目录id_rsa 私钥id_rsa.pub公钥known_hosts 通过SSH链接到本主机,都会在这里有记录第六步:SSH互信配置
2、把公钥给信任的主机(本机)先在命令行中执行ssh命令在命令行输入ssh-copy-id
主机名称(命令不存在解决方法:
(ssh-copy-idoracle)拷贝完成之后之行exit退出你的本地复制的过程中需要输入信任主机的密码3、验证,在命令行输入:ssh信任主机名称sshoracle如果没有提示输入密码,则配置成功第六步:SSH互信总结第一步生成,执行命令ssh-keygen,然后一直回车第二部执行命令ssh第三步拷贝,ssh-copy-id主机名称第四步推出本地,执行exit注意:拷贝到的主机包括你这台本机。2.Hadoop伪分布式集群环境的搭建回顾思考:什么是免密服务,怎么设置免密服务?Ssh的原理目录01回顾Hadoop核心02部署方式03安装JDK04安装HadoopHadoop部署方式单机模式伪分布模式完全分布式模式模式单机模式即本地模式是Hadoop的默认模式。当首次解压Hadoop的源码包时,Hadoop无法了解硬件安装环境,便保守地选择了最小配置。在这种默认模式下所有3个XML文件均为空。当配置文件为空时,Hadoop会完全运行在本地。因为不需要与其他节点交互,单机模式就不使用HDFS,也不加载任何Hadoop的守护进程。该模式主要用于开发调试MapReduce程序的应用逻辑。伪分布模式是在一台机器上模拟分布式部署,方便学习和调试。完全分布式即集群模式,是在多个机器上配置hadoop,是真正的“分布式”。安装前准备软件必备软件:VitualVox
或vmwarecentosjdk-6u24-linux-xxx.binhadoop-2.7.2.tar.gz其他软件:Xfp4(上传文件)Xshell(连接两台子机)第三部分安装jdk第七步:安装jdk把文件jdk-8u65-linux-x64.tar.gz上传在oracle用户的根目录,Jdk解压,(oracle用户操作)tar-zxvfjdk-8u65-linux-x64.tar.gz(-C指定到解压到路径)z代表gzip的压缩包;x代表解压;v代表显示过程信息;f代表后面接的是文件解压完成后,在oracle用户的根目录有一个jdk1.8.0_65目录注意安装路径,提示路径不对,看权限,一般是解压到usr/local下第七步:安装jdk配置环境变量,需要修改/etc/profile文件(root用户操作)切到root用户,输入su命令vi/etc/profile(Vi是Unix世界里极为普遍的全屏幕文本编辑器,其命令可参考资料,包括游标控制、内容编辑、文件操作三类命令)
进去编辑器后,输入i,进入vi编辑器的插入模式 在profile文件最后添加JAVA_HOME=/home/oracle/jdk1.8.0_65exportPATH=$PATH:$JAVA_HOME/bin (export功能说明:设置或显示环境变量)编辑完成后,按下esc退出插入模式 输入:,这时在左下角有一个冒号的标识
q退出不保存
wq保存退出
q!强制退出第七步:安装jdk把修改的环境变量生效(oracle用户操作)执行source/etc/profilesource命令用法:sourceFileName作用:在当前bash环境下读取并执行FileName中的命令。查看java版本命令:java–version第四部分安装Hadoop第八步:安装hadoop1、上传hadoop-2.6.0.tar.gz文件2、在oracle用户的根目录,解压(oracle用户操作)tar-zxvfhadoop-2.6.0.tar.gz解压完成在oracle用户的根目录下有一个hadoop-2.6.0目录第八步:安装hadoop3、修改配置文件hadoop-2.6.0/etc/hadoop/hadoop-env.sh(oracle用户操作)配置文件1:hadoop-env.sh该文件是hadoop运行基本环境的配置,需要修改的为java虚拟机的位置。故在该文件中修改JAVA_HOME值为本机jdk安装位置:exportJAVA_HOME=/home/oracle/jdk1.8.0_65第八步:安装hadoop4、修改配置文件hadoop-2.6.0/etc/hadoop/core-site.xml,添加(oracle用户操作)<configuration><property><name>hadoop.tmp.dir</name><value>/home/hadoop/tmp</value><description>hadoop的运行临时文件的主目录</description></property><property><name></name><value>hdfs://oracle:9000</value><description>HDFS的访问路径</description></property></configuration>fs.default配置了hadoop的HDFS系统的命名,位置为主机的9000端口;第八步:安装hadoop5、修改配置文件hadoop-2.6.0/etc/hadoop/hdfs-site.xml,添加(oracle用户操作)<configuration><property><name>dfs.replication</name><value>1</value><description>存储副本数</description></property></configuration>这个是hdfs的配置文件,dfs.http.address配置了hdfs的http的访问位置;dfs.replication配置了文件块的副本数,一般不大于从机的个数。第八步:安装hadoop6、修改修改配置文件hadoop-2.6.0/etc/hadoop/mapred-site.xml(oracle用户操作)这个是mapreduce任务的配置,由于hadoop2.x使用了yarn框架,所以要实现分布式部署,必须在属性下配置为yarn这个文件没有,需要复制一份cpetc/hadoop/mapred-site.xml.templateetc/hadoop/mapred-site.xml添加<configuration><property><name>mapred.job.tracker</name><value>oracle:9001</value><description>JobTracker的访问路径</description></property><property><name></name><value>yarn</value></property></configuration>第八步:安装hadoop7、修改配置文件hadoop-2.6.0/etc/hadoop/yarn-site.xml,添加(oracle用户操作)该文件为yarn框架的配置,主要是一些任务的启动位置<configuration><property><name>yarn.nodemanager.aux-services</name><value>mapreduce_shuffle</value></property></configuration>第八步:安装hadoop格式化HDFS,在hadoop解压目录下,执行如下命令:bin/hdfsnamenode–format注意:格式化只能操作一次,如果因为某种原因,集群不能用,需要再次格式化,需要把上一次格式化的信息删除,在/tmp目录(第一步配置的目录)里执行rm–rf*第八步:安装hadoop启动集群,在hadoop解压目录下,执行如下命令:启动集群:sbin/start-all.sh需要输入四次当前用户的密码(通过配置ssh互信解决)
启动后,在命令行输入jps有以下输出[oracle@oraclehadoop-2.6.0]$jps32033Jps31718SecondaryNameNode31528DataNode31852ResourceManager31437NameNode31949NodeManager关闭集群:sbin/stop-all.sh需要输入四次当前用户的密码(通过配置ssh互信解决)启动hadoop然后再执行start-all.sh浏览hadoop
课堂小结1、熟悉基本的命令操作2、掌握Hadoop集群环境的搭建及配置:
(1)免密服务配置
(2)克隆虚拟机
(3)防火墙设置
(4)集群配置3.Hadoop完成分布式集群环境搭建回顾u思考:伪分布式环境4个重要
配置文件?回顾思考:伪分布式环境4个重要
配置文件?Hadoop到底是什么东西小问题:90年代的数据量相当于10个零件,一个小朋友1分钟走一趟搬1个零件,花10分钟就可以搬走这些零件;90年代以后的数据量相当于10000个零件,这个小朋友也长大了,他1分钟走1趟可以办4个零件,那么要搬走这些零件要花多长时间呢?数据的读取技术发展完全跟不上数据量的增长速度,于是就用到了分布式-Hadoop的整个核心小问题:什么是分布式?我们完全没有必要去培养一个1分钟就能搬100个人零件的壮汉,那样太不现实了。1个人搬零件搬的太慢,我们可以请10个人,再不行请100人,1000人,这就是所谓的分布式。两个核心-HDFS和MapReduceHDFS怎么运作的?某零件厂的老板(客户Client)手里有一大批零件要存放。然而一个单独的仓库根本无法存放如此之多的零件。于是老板想到了建立一个仓库集群(HDFS),把自己的零件分批存放在不同的仓库(主机host)里,再建立一个覆盖所有仓库的管理系统两个核心-HDFS和MapReduce老板现将这批零件分装成小包,每个小包都可以放进任意一个仓库,小包的存放信息会被包工头记录下来。
包工头(NameNode)是整个仓库的监视者也是分配者,他监视这仓库集群里所有的仓库和仓库里的奴隶(DataNode)。当他收到老板的命令之后,他会现将老板提供的所有小包的信息和存放位置记录下来,然后看一眼哪些仓库里有空闲的奴隶(DataNode)可以去保管。包工头一直监视着各个仓房的状态和奴隶们的状态,他通过感受奴隶们是否还有心跳(heartbeat)来判断奴隶是否还活着。一旦某个看管货物的奴隶死了,包工头就会命令同仓房一个空闲的活着的奴隶去顶替他的位置。两个核心-HDFS和MapReduce两个核心-HDFS和MapReduce存好,就开始进行利用数据,挖掘数据的潜在价值。依旧还是那个零件厂老板,一天他突然要求,将他所有的零件全部按种类统计数量。老板采取了以下措施:1.雇佣管理员和大量的清点员。2.管理员指挥清点员去把每个小包都拆开然后清点每个小包中包含的零件和个数,例如:清点员1清点小包1:零件A,1个;零件B,2个;零件C,1个;零件D,2个。清点员2清点小包2:零件A……(这就是Map)两个核心-HDFS和MapReduce依旧还是那个零件厂老板,一天他突然要求,将他所有的零件全部按种类统计数量。老板采取了以下措施:1.雇佣管理员和大量的清点员。2.管理员指挥清点员去把每个小包都拆开然后清点每个小包中包含的零件和个数,例如:清点员1清点小包1:零件A,1个;零件B,2个;零件C,1个;零件D,2个。清点员2清点小包2:零件A……(这就是Map)两个核心-HDFS和MapReduce3.雇佣整理员整理员1只负责整理零件A和零件B的数量整理员2只负责整理零件C和零件D的数量……4.清点员们向整理员汇报。例如:清点员1向整理员1汇报小包1里有A,1个;B,2个向整理员2汇报小包1里有C,1个;D,2个然后清点员2汇报……5.整理员把自己收到的信息汇总,例如:整理员1总共有A,n个,总共有B,m个;整理员2说……(Reduce)u学习目标1、理解完全分布式配置的配置文件2、掌握搭建Hadoop完全分布式集群环境1安装Java目录安装配置虚拟机2搭建Hadoop完全分布式集群3Hadoop安装与配置
新建虚拟机4台,分别命名master、slave1、slave2、slave3;
每台虚拟机设置固定IP;每台虚拟机安装必要软件;准备工作:Hadoop安装与配置准备工作:master:1.5G~2G内存、20G硬盘、NAT、1~2核
;slave1~slave3:1G内存、20G硬盘、NAT、1核Hadoop安装与配置
新建虚拟机master,配置固定IP,关闭防火墙,安装必要软件;克隆master到salve1、slave2、slave3;修改slave1~slave3的IP,改为固定IP;具体做法:Hadoop安装与配置master30NameNode/JobHistoryServerResourceManager/SecodaryNameNodeslave1slave2slave331DataNode/NodeManager32DataNode/NodeManager33DataNode/NodeManagerHadoop安装与配置
上传、解压缩;修改配置文件;配置ssh无密码登录;配置ntp,统一时间;安装文件拷贝到子节点;格式化,并启动集群Hadoop安装与配置
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 医院感染管理述职报告
- 电工基础技术 6
- 2026年农林技术考试试题及答案
- 山西幼儿园教师模拟考试试题及答案
- 2026年福建电子信息集团招聘试题及答案
- 2026年测试工程师校招面试题及答案
- 农村养老护理学模拟考试试题及答案
- 2026年湖南单招文化考试试题及答案
- 医生年底个人工作总结
- 城市绿化工程效益评价考试
- 2026年秋季学期新交际英语(新版)一年级上册教学计划及进度表
- 2026广东珠海市轨道交通局招聘2人笔试参考题库及答案详解
- 浙江省金华市婺城区2025-2026学年八年级下学期期末考试数学试题(含答案)
- 2026年宿迁市城区招商发展有限公司招聘工作人员4人考试备考试题及答案详解
- 2026年数字安徽有限责任公司所属企业安徽数安系统集成有限公司第1批次社会招聘18人笔试备考试题及答案详解
- 临床常见实验室检查指标的解读
- 1.1 数说祖国 课件 (共18张) 北师大版数学四年级上册
- 2026宁夏农垦集团部分所属企业招聘27人笔试题库及参考答案详解(夺分金卷)
- 2026年重症医学科西院区机械通气培训试题及答案
- 2026年内蒙古自治区中考语文试题【含答案】
- 2026年新疆维吾尔自治区初中学业水平考试生物试卷真题(含答案详解)
评论
0/150
提交评论