大数据平台部署与运维4_第1页
大数据平台部署与运维4_第2页
大数据平台部署与运维4_第3页
大数据平台部署与运维4_第4页
大数据平台部署与运维4_第5页
已阅读5页,还剩33页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

北京出版社大数据平台部署与运维项目四HDFS的使用任务一HDFS的认知任务二使用HDFS的Web界面任务三使用Shell管理HDFS文件与目录目录/CONTENTS目标知识目标»

理解HDFS(Hadoop分布式文件系统)的基本原理。»

了解HDFS的特点,如高容错性、适合大文件存储等。能力目标»

能在HDFS上完成读写文件的基本流程。»

能启动HDFS服务,并通过Web界面进行文件系统的管理和监控。»

能使用HDFSShell命令进行文件和目录操作。素养目标»

注重操作的准确性,注意细节,确保文件系统的稳定性和安全性。»

保持对新技术的持续学习,不断提升自己的操作和管理能力,以适应不断变化的需求和环境。01HDFS的认知任务导入HDFS是高度可扩展的分布式文件系统,常用于处理大数据的存储和计算。它能够存储大量数据,并允许在集群中的多台机器上并行处理这些数据。由于其强大的可扩展性和可靠性,HDFS已成为大数据处理领域中的主流文件系统。HDFS的原理、特点及它不适合的应用场景都有哪些呢?分而治之策略,将大文件分布存储,提升大规模数据集处理效率。HDFS设计哲学NameNode维护文件系统命名空间,支持分层文件组织,提供传统文件系统操作。HDFS命名空间管理保留特定路径如/.reserved和.snapshot,支持透明加密和快照等高级特性。HDFS保留路径功能主从架构,包括NameNode、DataNode和SecondaryNameNode,确保数据高可用性。HDFS体系结构文件副本数由NameNode存储,用户可自定义复制因子,增强数据容错性。HDFS数据冗余与保护提供类似传统文件系统的CRUD操作,简化大数据存储管理。HDFS用户视角一、HDFS的原理(1)NameNode:HDFS的守护进程,用来管理文件系统的命名空间和客户端对文件的访问。它负责记录文件是如何被分割成数据块的,以及数据块被存储到哪些DataNode中。(2)DataNode:负责存储和提取数据块,读写请求可能来自NameNode,也可能直接来自客户端。数据节点周期性地向NameNode汇报自己节点上存储的数据块相关信息。一、HDFS的原理HDFS通过创建检查点合并namespaceimage和editlog,以防NameNode崩溃时恢复数据。HDFS存储与恢复机制客户端与NameNode获取文件元数据,直接与DataNode进行文件I/O操作。HDFS将文件存储为数据块,通过复制实现容错,适用于大型集群存储大文件。HDFS客户端与存储方式HDFS中文件块大小和复制数可配置,文件块默认全等,最后一个块可变长,支持append和hsync操作。HDFS数据块管理HDFS采用一次性写入、多副本策略提升性能和数据安全,主要分为3种复制策略。HDFS写入策略优化(3)SecondaryNameNode一、HDFS的原理数据块副本策略为提升HDFS可靠性,创建多个副本并放置在不同服务器上。读取请求优先考虑最近、同机架或本地数据中心的副本,以节省带宽和降低延迟。副本读取优化HDFS尝试从最接近读取器的副本进行读取,优先同机架内副本,然后是本地数据中心副本,以减少全局带宽消耗和延迟。1.副本选择策略一、HDFS的原理HDFS的副本放置策略HDFS副本策略:一个副本在写入者同节点或同机架,另一副本在不同机架的节点,最后一副本在远程机架的另一节点。此策略优化写入性能0102策略影响数据可靠性该策略不影响数据的可靠性和可用性,但可能导致块的副本分布不均,且仍需相同网络带宽读取数据03策略对读写性能的影响此策略可在不影响数据可靠性或读取性能的情况下提高写入性能。2.数据块放置策略一、HDFS的原理当复制因子大于3时,策略随机选择第4个副本位置,确保每个机架的副本不超过上限((replicas-1)/racks+2)。简化输出:复制因子超过3时,采取随机冗余策略,限制单个机架上的副本数量。复制因子大于3的放置策略01HDFS最大副本数受限于DataNode总数,NameNode不允许DataNode有重复副本。HDFS的副本数量限制02存储类型和策略影响副本放置,NameNode会优先考虑机架感知和存储需求。存储策略对副本放置影响03一、HDFS的原理2.数据块放置策略HDFS的副本放置策略旨在提高数据可靠性、可用性和网络带宽利用率,是区分HDFS与其他分布式文件系统的关键。HDFS的副本放置策略01大型HDFS实例跨多机架运行,同机架通信更快。网络带宽:同一机架>不同机架。HDFS网络架构02NameNode通过特定过程识别DataNode的机架ID,以确保数据安全和多机架的带宽利用。NameNode机架ID确定03均匀分布副本可平衡负载,但会增加写入成本。副本放置策略的优缺点043.机架感知策略一、HDFS的原理010203HDFS架构与功能NameNode负责块复制决策,DataNode定期发送心跳与块报告。HDFS文件分割与存储大文件被分割,每个小文件冗余备份,分散存储确保高可靠性。HDFS读写操作客户端请求读写,NameNode分配DataNode,实现文件操作。二、HDFS读写文件的流程HDFS客户端通过RPC向NameNode请求创建文件,NameNode检查文件的唯一性和创建者的权限。如果检查通过,则在文件系统中创建新文件的记录;否则,将抛出异常。写入HDFS流程启动开发库将数据流式写入DataNode,经多个节点传递并返回ackpacket,确认写入成功,客户端再移除packet。数据流式写入与确认客户端将文件切分成多块,通过NameNode申请存储块,获取DataNode列表,列表大小由NameNode的replication设定。数据包管理与申请当DataNode故障,pipeline会关闭,NameNode会移除故障节点并分配新的DataNode保持复制数量。客户端在数据写入完成后关闭数据流,写入复本数达到目标即表示成功。故障处理与数据流关闭二、HDFS读写文件的流程(一)客户端架构数据写入HDFS的流程HDFS数据读取流程数据读取的校验与错误处理下一批block获取客户端读取block流程客户端通过RPC向NameNode请求数据,NameNode则返回包含DataNode地址的block列表。客户端读取block时优先选择最近的DataNode,读完一个后会断开连接寻找下一个。读完当前block列表,客户端向NameNode请求下一批block。数据读取后进行checksum校验,若出错则通知NameNode,然后从下一个DataNode继续读取。二、HDFS读写文件的流程(二)客户端读取HDFS中的数据的流程硬件故障常态化的现象,HDFS通过副本、纠删码和错误恢复策略确保集群稳定性。硬件故障是常态01HDFS适用于批处理大数据,强调高吞吐量而非低延迟访问,且不完全遵循POSIX语义以优化性能。流数据访问02HDFS适用于存储大规模数据集,可实现高性能、高吞吐量的并发访问,支持千万级别大文件。大数据集03HDFS采用“一次写入、多次读取”模型,不支持文件修改,仅追加内容,简化一致性问题,适合MapReduce和网络爬虫。简单的一致性模型04移动计算到数据附近更高效,减少数据传输损耗,尤其适合大数据处理。移动计算比移动数据更划算05HDFS设计考虑了跨平台可移植性,便于在不同硬件和软件环境中推广大规模数据应用。跨平台可移植性06三、HDFS的特点及其不适合的应用场景(一)HDFS的特点HDFS不适用于低延时需求,因其设计侧重于高吞吐,而非快速数据访问。HDFS低延时访问局限01HDFS不适用于大量小文件存储,因为元数据会占用NameNode大量内存,限制文件数量。HDFS不适用:小文件存储02HDFS不支持文件的任意修改和多写入,表现为追加写入且无法在任意位置更新数据。HDFS限制:单读少改03三、HDFS的特点及其不适合的应用场景(二)HDFS不适合的应用场景海量数据怎么存?02使用HDFS的Web界面任务导入某公司的客户张某想通过可视化的界面查看分布式文件系统HDFS的各项信息以及文件夹的目录结构,公司刘经理让公司工程师杜工为客户张某演示。杜工接到任务后,积极准备方案。那么,杜工该如何做呢?一、启动HDFS使用hadoop用户启动HDFS。$start-dfs.sh运行jps检查HDFS是否正常启动,如图4-3所示。$jps当看到namenode、datanode、secondarynamenode,说明HDFS已正常启动。如果发现缺少某一个进程,可按以下步骤进行:(1)尝试重启HDFS。(2)在HDFS上没有重要文件的前提下,可以尝试格式化HDFS:①

停止HDFS;②

删除/usr/local/hadoop/tmp文件;③

格式化HDFS;④

启动HDFS。二、进入HDFSWeb界面

(一)打开HDFSWeb界面打开浏览器,在地址栏输入HDFSWeb地址,就可以看到HDFS的Web管理界面,如图4-4所示。二、进入HDFSWeb界面

(二)查看总览HDFS的Web界面中的总览内容如图4-5所示。本任务需要在桌面环境中进行。如果没有桌面环境,可以登录root用户使用指令安装:#yumgroupinstall-y″GNOMEDesktop″安装完成后,使用指令打开桌面环境。#init5如果操作系统还没有安装浏览器,可登录root用户,使用指令安装firefox浏览器。$su-root#yuminstall-yfirefox在Hadoop2.x版本中,NameNode的默认访问端口为50070。从Hadoop3.x版本起,端口改为9870。用同样的方式,可以访问伪分布模式Hadoop的HDFSWeb界面。二、进入HDFSWeb界面

(三)查看数据节点信息单击Datanodes,查看数据节点信息,如图4-6所示。二、进入HDFSWeb界面

(四)查看目录与文件单击utilities→Browsethefilesystem,查看目录与文件,如图4-7所示。如果在刚完成初始化后进入该页面,会发现该页面没有任何文件。我们可以在后续任务过程中再进来查看。03使用Shell管理HDFS文件与目录任务导入某公司的客户公司里有一位略懂技术的工作人员,客户公司希望日常能简单地自行维护分布式文件系统HDFS上的文件,希望杜工对其做常用指令的指导。杜工依次向其演示查看目录、创建目录、删除目录、本地文件上传至HDFS、HDFS文件下载至本地、移动与复制HDFS文件。这些流程具体是怎么操作的呢?一、启动HDFS使用hadoop用户启动HDFS。$start-dfs.sh运行jps检查HDFS是否正常启动,如图4-8所示。$jps当看到namenode、datanode、secondarynamenode,说明HDFS已正常启动。如果发现缺少某一个节点类型,重启HDFS或格式化HDFS。二、目录操作本任务采用hadoop用户实现对HDFS文件系统的操作,因此需要在HDFS中为hadoop用户创建一个用户目录,如图4-9所示。$hdfsdfs-mkdir-p/user/hadoop(一)创建用户目录二、目录操作使用相对路径查看用户目录下的内容,如图4-10所示。$hdfsdfs-ls.使用绝对路径查看HDFS的所有目录,如图4-11所示。$hdfsdfs-ls/(二)查看目录二、目录操作在用户目录下创建一个input文件夹并查看,如图4-12所示。$hdfsdfs-mkdirinput$hdfsdfs-ls.(三)创建目录二、目录操作删除用户目录下的input文件夹,如图4-14所示。$hdfsdfs-rm-rinput在HDFS上进行文件操作时,默认当前路径“.”为当前目录。注意,如果系统中不存在用户目录,则会出现错误提示。与Linux文件系统相似,在HDFS文件系统中,注意区分相对路径与绝对路径。在HDFS中,所有相对路径表示形式都是相对用户目录(如/user/hadoop)路径而言的。(四)删除目录三、文件操作

(一)创建文件在HDFS上创建文件,如图4-15所示。$hdfsdfs-touchzMyHDFSFile.txt三、文件操作

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论