《大数据平台部署与应用》 项目实施课件 项目2 部署Hadoop分布式平台_第1页
《大数据平台部署与应用》 项目实施课件 项目2 部署Hadoop分布式平台_第2页
《大数据平台部署与应用》 项目实施课件 项目2 部署Hadoop分布式平台_第3页
《大数据平台部署与应用》 项目实施课件 项目2 部署Hadoop分布式平台_第4页
《大数据平台部署与应用》 项目实施课件 项目2 部署Hadoop分布式平台_第5页
已阅读5页,还剩50页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

部署完全分布式Hadoop集群任务描述部署完全分布式Hadoop集群不仅能够为企业提供一个可扩展的基础架构,还可以为后续集成Hadoop生态系统中的其他工具和应用奠定坚实基础。在本任务中,小数将在项目1中创建的3台虚拟机上部署完全分布式Hadoop集群。任务环境3台CentOS7操作系统的虚拟机,且所有虚拟机已安装好1.8版本的JDK,并配置SSH免密登录与时间同步服务。任务描述与任务环境目录1解压Hadoop下载Hadoop2修改配置文件3分发Hadoop至其他节点4从Hadoop官网下载Hadoop安装包“hadoop-3.1.3.tar.gz”。使用Xftp8远程传输工具将Hadoop安装包传输至master虚拟机的/opt/software目录下。下载Hadoop目录1解压Hadoop下载Hadoop2修改配置文件3分发Hadoop至其他节点4在master虚拟机解压安装包hadoop-3.1.3.tar.gz至/opt/module目录下。解压操作完成后查看解压目录,若结果中能够看到“hadoop-3.1.3”,则说明文件已解压成功。解压Hadoop目录1解压Hadoop下载Hadoop2修改配置文件3分发Hadoop至其他节点4执行“vim/etc/profile”命令进入/etc/profile文件中配置环境变量,在文件末尾添加Hadoop环境变量并保存退出。执行“source/etc/profile”命令使环境变量立即生效。修改配置文件执行“cd$HADOOP_HOME/etc/hadoop/”命令进入到存储Hadoop配置文件的文件夹中。执行“vimhadoop-env.sh”命令打开hadoop-env.sh文件,找到“#exportJAVA_HOME=”一行添加JDK路径并保存退出。修改配置文件core-site.xml文件是Hadoop的核心配置文件,用于配置Hadoop的基础属性。core-site.xml文件中的参数说明如下表。修改配置文件参数参数说明fs.defaultFS指定HDFS的通信地址hadoop.tmp.dir指定Hadoop临时目录,即Hadoop运行时产生文件的存储路径执行“vimcore-site.xml”命令打开core-site.xml配置文件,修改文件中的<configuration>和</configuration>之间的内容并保存退出。修改配置文件hdfs-site.xml配置文件用于配置Hadoop分布式文件系统的属性。hdfs-site.xml配置文件中的参数说明如下表。修改配置文件参数参数说明node.http-address指定NameNode的http访问地址和端口号node.secondary.http-address指定SecondaryNameNode的http访问地址和端口号dfs.replication指定HDFS副本数量.dir指定NameNode存放的路径dfs.datanode.data.dir指定DataNode存放的路径执行“vimhdfs-site.xml”命令打开hdfs-site.xml配置文件,修改文件中的<configuration>和</configuration>之间的内容并保存退出。修改配置文件yarn-site.xml配置文件用于配置Hadoop的作业调度和集群资源管理器YARN的属性。yarn-site.xml配置文件中的参数说明如下表。修改配置文件参数参数说明yarn.resourcemanager.hostname指定ResourceManager运行节点yarn.resourcemanager.webapp.address指定ResourceManager服务器的Web地址和端口yarn.nodemanager.aux-services指定NodeManager上运行的MapReduce辅助服务列表yarn.nodemanager.aux-services.mapreduce.shuffle.class指定NodeManager上运行的MapReduce辅助服务的Shuffle类yarn.resourcemanager.scheduler.address指定ResourceManager的Scheduler组件的访问地址和端口号yarn.resourcemanager.resource-tracker.address指定ResourceManager的ResourceTracker组件的访问地址和端口号yarn.resourcemanager.address指定ResourceManager的客户端的访问地址和端口号yarn.resourcemanager.admin.address指定ResourceManager的管理员的访问地址和端口号修改配置文件参数参数说明yarn.log-aggregation-enable指定是否启用日志聚合功能yarn.nodemanager.remote-app-log-dir指定日志聚合目录yarn.log-aggregation.retain-seconds指定聚合的日志在HDFS上保存的最长时间yarn.nodemanager.vmem-check-enabled指定NodeManager是否检查每个容器的虚拟内存使用量yarn.nodemanager.resource.memory-mb指定每个节点上可用于YARN容器的总物理内存(单位MB)yarn.scheduler.minimum-allocation-mb指定可以分配给单个容器的最小物理内存(单位MB)yarn.scheduler.maximum-allocation-mb指定可以分配给单个容器的最大物理内存(单位MB)mapreduce.map.memory.mb指定单个Map任务请求的内存大小(单位MB)mapreduce.reduce.memory.mb指定单个Reduce任务请求的内存大小(单位MB)yarn.application.classpath指定MapReduce任务运行时需要用到的Hadoop依赖jar包,可通过在Shell命令行中使用“hadoopclasspath”命令进行查询执行“vimyarn-site.xml”命令打开yarn-site.xml配置文件,修改文件中的<configuration>和</configuration>之间的内容并保存退出。修改配置文件修改配置文件修改配置文件修改配置文件mapred-site.xml配置文件用于配置MapReduce作业运行时的环境。mapred-site.xml配置文件中的参数说明如下表。修改配置文件参数参数说明指定MapReduce框架运行时使用的框架mapreduce.jobhistory.address指定MapReduce的历史服务器的地址及端口mapreduce.jobhistory.webapp.address指定历史服务器的web页面地址和端口ermediate-done-dir指定存放日志文件的临时目录mapreduce.jobhistory.done-dir指定存放运行日志文件的最终目录执行“vimmapred-site.xml”命令打开mapred-site.xml配置文件,修改文件中的<configuration>和</configuration>之间的内容并保存退出。修改配置文件workers配置文件用于指定集群中运行DataNode进程的节点。执行“vimworkers”打开workers文件,将文件原有内容删除,添加三台虚拟机的主机名并保存退出。修改配置文件执行“cd$HADOOP_HOME/sbin/”命令进入到存储脚本文件的文件夹中。start-dfs.sh和stop-dfs.sh脚本分别用于启动和关闭HDFS服务。执行“vimstart-dfs.sh”和“vimstop-dfs.sh”分别打开start-dfs.sh和stop-dfs.sh脚本文件,在文件开头第二行添加指定运行HDFS服务的用户并保存退出。修改配置文件start-yarn.sh和stop-yarn.sh脚本分别用于启动和关闭YARN服务。执行“vimstart-yarn.sh”和“vimstop-yarn.sh”分别打开start-yarn.sh和stop-yarn.sh脚本文件,在文件开头第二行添加指定运行YARN服务的用户并保存退出。修改配置文件目录1解压Hadoop下载Hadoop2修改配置文件3分发Hadoop至其他节点4启动slave1和slave2虚拟机。在master虚拟机上将配置好的Hadoop分发给slave1和slave2虚拟机。分发Hadoop至其他节点目录5启动Hadoop集群格式化NameNode6验证集群是否启动成功7在master虚拟机上执行“hdfsnamenode-format”命令对NameNode进行格式化。若出现“namehasbeensuccessfullyformatted”,则说明格式化成功。格式化NameNode目录5启动Hadoop集群格式化NameNode6验证集群是否启动成功7在master虚拟机上启动Hadoop集群,需要启动Hadoop内部包含的HDFS集群和YARN集群。执行“start-dfs.sh”启动HDFS服务进程。执行“start-yarn.sh”启动YARN服务进程。启动Hadoop集群启动Hadoop集群,也可以使用“start-all.sh”命令,这个脚本会启动包括HDFS和YARN在内的整个Hadoop集群服务,简化了集群的启动过程。关闭Hadoop集群,只需将启动命令中的“start”换为“stop”即可。目录5启动Hadoop集群格式化NameNode6验证集群是否启动成功7使用“jps”命令查看进程,各节点进程如下。验证集群是否启动成功集群启动成功后各节点中一共出现了5种进程,各进程说明如下。验证集群是否启动成功进程名称说明NameNode管理整个文件系统的元数据DataNode负责存储本地数据块NodeManager负责本地资源的管理和任务执行ResourceManager协调资源的分配和任务的执行SecondaryNameNode负责定期合并HDFS的编辑日志和镜像文件,以减少NameNode的启动时间通过Web端访问Hadoop的监控端口,在访问之前,需要先在本地Windows机的“hosts”文件中添加映射(IP主机名)。打开“C:\Windows\System32\drivers\etc\hosts”,在文件末尾添加映射。验证集群是否启动成功添加完IP/主机名映射后在浏览器登录“http://master:9870”查看HDFS的监控界面。验证集群是否启动成功在浏览器中登录“http://master:8088”查看YARN的监控界面。注意:若没有提前在本地添加IP映射,则需使用30:9870和30:8088端口查看。验证集群是否启动成功测试Hadoop平台任务描述在部署好Hadoop分布式平台后,小数还需要对其进行测试,以确保部署的完整性。MapReduce作为Hadoop的核心组件,可用于测试Hadoop平台的运行状况。本任务将通过向Hadoop集群提交MapReduce任务并观察其结果,以此来验证Hadoop的功能是否正常。任务环境已部署完全分布式Hadoop集群的3台CentOS7操作系统的虚拟机。任务描述与任务环境目录1运行MapReduce任务上传日志文件至HDFS2查看集群状态3现有一份某社交网站在2024年某一天的原始日志文件email_log.txt,共800万行记录,部分数据如下。上传日志文件至HDFSMan_Cl@org.lyjo_rosa@BoarderMailerotica.husha.dono@com.twrobisloa@PeopleWebpro.aem_em@Carl_Hen@HotepMailweb.lkAxelHubbard@LoadMaillevanger.noda_foster@co.jp上传日志文件email_log.txt至HDFS的流程如下。上传日志文件至HDFS使用Xftp8远程传输工具将本地计算机中的用户日志文件email_log.txt上传至master虚拟机的/opt/data目录。注意:若master虚拟机不存在/opt/data/目录,则需先通过“mkdir-p/opt/data/”命令创建。上传日志文件至Linux在master虚拟机启动Hadoop集群。执行HDFS命令,创建/dfstest目录,用于存放日志文件。创建/dfstest目录在master虚拟机上传日志文件至HDFS的/dfstest目录。上传日志文件至HDFS通过浏览器登录“http://master:9870”查看HDFS的监控界面,单击网页中的“Utilities”,在下拉菜单中选择“Browsethefilesystem”。查看HDFS上的数据在跳转后的“BrowseDirectory”页面中,依次选择“dfstest”→“email_log.txt”→“Headthefile(first32K)”,查看HDFS的/dfstest目录下email_log.txt文件的内容。查看HDFS上的数据目录1运行MapReduce任务上传日志文件至HDFS2查看集群状态3使用“hadoopjar”命令对email_log.txt日志文件中的数据进行登录次数的统计。运行MapReduce任务使用的“hadoopjar”命

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论