2022年大数据平台用户操作手册(模板)_第1页
2022年大数据平台用户操作手册(模板)_第2页
2022年大数据平台用户操作手册(模板)_第3页
2022年大数据平台用户操作手册(模板)_第4页
2022年大数据平台用户操作手册(模板)_第5页
已阅读5页,还剩95页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

大数据平台用户操作手册大数据平台用户操作手册(此文档为word格式,下载后您可任意修改编辑!)TOC\o"1-5"\h\z\o"CurrentDocument"概述 41」 犬数据简介 4\o"CurrentDocument"某某大数据平台简介 4\o"CurrentDocument"基本坏境配置 52」 配置主机名 6\o"CurrentDocument"修改hosts文件 6\o"CurrentDocument"修改yum源 6\o"CurrentDocument"配置ntp 7\o"CurrentDocument"配置SSH 8\o"CurrentDocument"禁用TransparentHugePages 9\o"CurrentDocument"安装配置JDK 9\o"CurrentDocument"配置ambari-server 10\o"CurrentDocument"3」 安装MariaDB数据库 10\o"CurrentDocument"安装配置ambari-server 11\o"CurrentDocument"配置ambari-agent 13\o"CurrentDocument"部署管理Hadoop集群 14\o"CurrentDocument"部署Hadoop集群 14HDFS运维管理 20\o"CurrentDocument"MapReduce 31\o"CurrentDocument"部署Hive数据仓库 33\o"CurrentDocument"6」 部署Hive 33\o"CurrentDocument"6」 Hive用户指南 36\o"CurrentDocument"部署Hbase分布式列数据库 51\o"CurrentDocument"7」 部署HBase 51\o"CurrentDocument"测试验证 53\o"CurrentDocument"HBase用户指南 53\o"CurrentDocument"部署Mahout数据挖据工具 61

&1部署&1部署Mahout 61错误!未定义书签。8.2测试验证错误!未定义书签。TOC\o"1-5"\h\z\o"CurrentDocument"9部署Pig数据分析平台 669」 部署Pig 66\o"CurrentDocument"Pig简介 67\o"CurrentDocument"运行案例 701概述1.1大数据简介'‘大数据”是一个体量特别大,数据类别特别庞杂的数据集合,并且这样的数据集无法用传统数据库工具或常规软件工具抓取、管理和处理其内容。大数据技术是指从各种各样类型的庞杂数据中,快速的获取有价值的信息的能力。适用于大数据的技术包括大规模并行处理数据库,数据挖掘电网,分布式文件系统,分布式数据库,云计算平台和可扩展的存储系统。Apache的Hadoop项目是可靠的、可扩展的、开源的、分布式计算软件。Apache的Hadoop软件库是允许通过相对简单的程序模型构建计算集群为庞大的数据集进行分布式计算的框架。Hadoop的设计思想可以将计算模式从单节点服务器扩展为数以千计的计算集群,每一个单独的服务器都提供自主的本地计算及存储能力。对于高可用指标而言,Hadoop软件库自身可以通过检测和故障调试从应用层来实现高可用而不需要关心硬件底层的高可用性。所以提供一个计算集群上层的高可用服务对于集群故障修复而言就显得至关重要。1.2某某大数据平台简介某某大数据平台是基于Ambari进行二次开发的Hadoop分布式集群配置管理工具,该平台通过安装向导来进行集群的搭建,简化了集群供应。同时,他还有一个监控组件,叫做Ambari-Metrics,可以提前配置好关键的运维指标(metrics),然后收集集群的中服务、主机等运行状态等信息,通过WEB的方式显示出来。我们可以直接查看HadoopCore(HDFS和MapReduce)及相关项目(如HBase、Hive和HCatalog)是否健康。它的用户界面非常直观,用户可以轻松有效地查看信息并控制集群。某某大数据平台支持作业与任务执行的可视化与分析,能够更好地查看依赖和性能。通过一个完整的RESTfulAPI把监控信息暴露出来,集成了现有的运维工具。平台使用Ganglia收集度量指标,用Nagios支持系统报警。

图1.1Ambari结构图其中Ambari是一个分布式架构的软件,主要由两部分组成:AmbariServer和AmbariAgent,如图1・1所示。AmbariServer会读取Stack和Service的配置文件。当用Ambari创建集群的时候,AmbariServer传送Stack和Service的配置文件以及Service生命周期的控制脚本到AmbariAgentoAgent拿到配置文件后,会下载安装公共源里软件包(Redhat,就是使用yum服务)。安装完成后,AmbariServer会通知Agent去启动Serviceo之后AmbariServer会定期发送命令到Agent检查Service的状态,Agent上报给Server,并呈现在Ambari的GUI上,方便用户了解到集群的各种状态,并进行相应的维护。图1-1Ambari架构图下载软件包心跳连接图1-1Ambari架构图下载软件包心跳连接2基本环境配置以两台节点为例来组件Hadoop分布式集群,这里采用的系统版本为Centos7,如下表所示:主机名内存硬盘IP地址角色master8192M100G31Ambari-ServerBslaverl4096MB100G33Ambari-Agent2.1配置主机名masterhostnamectlset-hostnamemasterhostnamemasterslaver1hostnamectlset-hostnameslaverlhostnameslaverl2.2修改hosts文件#master&slaverl#vi/etc/hosts31master33slaverl2.3修改yum源#master将XianDian-BigData-v2.0.2-BASE.iso挂在到/mnt目录下,将其中的ambari解压到/opt目录下,并在master节点配置ftp服务。注意:因为安装大数据相关软件包时,可能会用到相关依赖软件包,所以需要配置Centos7Yum源,这里可以采用IAAS中的Centos7Yum源。#master&slaverlcd/etc/yum.repos.d/rm-vf*配置Yum源viambari.repo[centos7]baseurl=ftp://l92」68.2.10/centos7/(注:具体的yum源根据真实环境配置,本次为实验室测试环境)gpgcheck=Oenabled=Iname=centos[ambari]name=ambaribaseurl=1/ambari(注:具体的yum源根据真实环境配置,本次为实验室测试环境)enabled=Igpgcheck=Omasteryum・yinstallhttpd将/mnt/文件夹中HDP・2.4・BASE和HDP・UTILS-1」.0.20两个文件夹拷贝到/var/www/html/目录下。启动httpd服务。systemctlenablehttpd.servicesystemctlstatushttpd.service2.4配置ntpmaster#yum・yinstallntpvi/etc/ntp.conf注释或者删除以下四行serverO.iburstserver1.iburstserver2.iburstserver3.iburst添加以下两行serverfudgestratum1()#systemctlenablentpd#systemctlstartntpdslaver1yum・yinstallntpdatentpdatemastersystemctlenablentpdate2.5配置SSHmaster&slaverl检查2个节点是否可以通过无密钥相互访问,如果未配置,则进行SSH无密码公钥认证配置。如下:yuminstallopenssh-clientsssh-keygenssh-copy-idmaste匚hadoopssh-copy-idslaverl.hadoopssh登录远程主机查看是否成功sshmaste匚hadoopexit#sshslaverl.hadoop#exit2.6禁用TransparentHugePages操作系统后台有一个叫做khugepaged的进程,它会一直扫描所有进程占用的内存,在可能的情况下会把4kpage交换为HugePages,在这个过程中,对于操作的内存的各种分配活动都需要各种内存锁,直接影响程序的内存访问性能,并且,这个过程对于应用是透明的,在应用层面不可控制,对于专门为4kpage优化的程序来说,可能会造成随机的性能下降现象。master&slaverlcat/sys/kernel/mm/transparent_hugepage/enabled[always]madviseneverechonever>/sys/kemel/mm/transparent_hugepage/enabledechonever>/sys/kemel/mm/transparent_hugepage/defragcat/sys/kernel/mm/transparent_hugepage/enabledalwaysmadvise[never]重启后失效,需要再次执行2.7安装配置JDKmastermkdir/usr/jdk64/mount-oloopXianDian-BigData-v2.0.2-BASE.iso/mnt/cd/mnt/tar-zxvfjdk-8u77-linux-x64.tar.gz-C/usr/jdk64/vi/etc/profileexportJAVA_HOME=/usr/jdk64/jdkI,8.0_77exportPATH=$JAVA_HOME/bin:$PATHsource/etc/profile#java-versionjavaversionT.8.0_77”Java(TM)SERuntimeEnvironment(build1.8.0_77-b()3)JavaHotSpot(TM)64-BitServerVM(build25.77-b()3,mixedmode)slaver1#mkdir/usr/jdk64/#scp()6:〃mnt/jdk・8u77・linux・x64.tar.gz.tar-zxvfjdk-8u77-linux-x64.tar.gz-C/usi7jdk64/vi/etc/profileexportJAVA_HOME=/usi7jdk64/jdk1.&0_77exportPATH=$JAVA_HOME/bin:$PATHsource/etc/profile#java-versionjavaversionT.8.0_77”Java(TM)SERuntimeEnvironment(build1.&()_77・b()3)JavaHotSpot(TM)64-BitServerVM(build25.77-b()3,mixedmode)3配置ambari-servermasteryum-yinstallambari-server3.1安装MariaDB数据库masteryuminstallmariadbmariadb-servermysql-connector-java启动服务systemctlenablemariadbsystemctlstartmariadb配置MySQL#mysql_secure_installation按enter确认后设置数据库root密码,我们这里设置为“bigdata”Removeanonymoususers?[Y/n]yDisallowrootloginremotely?[Y/n]nRemovetestdatabaseandaccesstoit?[Y/n]yReloadprivilegetablesnow?[Y/n]y创建ambari数据库mysql-uroot-pbigdataMariaDB[(none)]>createdatabaseambari;MariaDB[(none)]>grantallprivilegesonambari.*to'ambari'@'localhosl,identifiedby'bigdata*;MariaDB[(none)]>grantallprivilegesonambari.*to'ambari'@'%'identifiedby'bigdata*;MariaDB[(none)]>useambari;MariaDB[ambari]>source/var/lib/ambari-server/resources/Ambari-DDL-MySQL-CREATE.sqlMariaDB[ambari]>Bye3.2安装配置ambari-server#masterambari-serversetupWARNING:SELinuxissetto'permissive'modeandtemporarilydisabled.OKtocontinue[y/n](y)?Customizeuseraccountforambari-serverdaemon[y/n](n)?nCheckingJDK...OracleJDK1.8+JavaCryptographyExtension(JCE)PolicyFiles8OracleJDK1.7+JavaCryptographyExtension(JCE)PolicyFiles7CustomJDKEnterchoice(1):3PathtoJAVA_HOME:/usr/jdk64/jdkl.&0_77ValidatingJDKonAmbariServer...done.Completingsetup...Configuringdatabase...Enteradvanceddatabaseconfiguration[y/n](n)?yConfiguringdatabase...Chooseoneofthefollowingoptions:[1]-PostgreSQL(Embedded)⑵.Oracle・MySQL・PostgreSQL⑸・MicrosoftSQLServer(TechPreview)[6]・SQLAnywhereEnterchoice(1):3Hostname(localhost):Port(3306):Databasename(ambari):Username(ambari):EnterDatabasePassword(bigdata):Proceedwithconfiguringremotedatabaseconnectionproperties[y/n](y)?AmbariServer'setup*completedsuccessfully.启动ambari-server服务#ambari-serverstart登陆界面http://192」68.2()().131:8080/登录用户名密码为admin:admin登录誉看*用三方工■加轨CUS自的皿I・4配置ambari-agent#master&slaverlyum-yinstallambari-agentvi/etc/ambari-agent/conl7ambari-agent.ini[server]hostname=masterambari-agentrestarttail-f/var/log/ambari-agent/ambari-agent.logINFO2017-01-1209:44:20,919Controller.py:265-Heartbeatresponsereceived(id=1340)INFO2017-01-1209:44:30,820Heartbeat.py:78-BuildingHeartbeat:{responseld=1340,timestamp=1484214270820,commandsInProgress=False,componentsMapped=True)

5部署管理Hadoop集群5.1部署Hadoop集群登陆界面http://{IPAddress):8080/,用户名密码为admin:admin。接下来就可以启动安装向导,创建集群,安装服务。SASSASJL用户ffiP欢迎使用先电大数据平台e过里,个平台*思用户.的乂一个集髀便用安衆pi髓t?砂;《邮:8测》■■■开始部署首先•给1FW?个济TtTR#HOPHHApacftdEinifm^.»V20«f»wwEHia^x54・u.aftarraai・«a «a 选择安装栈■送狂冊安鉴gopjwYa場枝•心24OMDP23•-HDP224)®StovnKlCiHmesN”wm曲开恰井借厅序泳・虹56柬禅观itdasxjMutTtttMfffs.an王机相上九舷%■一彳・mhi壬讥诫mssuw处环理績饴反时・ 在删t出的圭斑时««8*・轴且“交件.QdetM«n7QMMM^re<ff»!T0«uwi1HOP2lHDP^JTXS-11020HOP?4MOP-UDL^11020MDP-24MOP-UTM.S-11020HOP-24M0P5211.020MMtnflp.*>puMc-<Qpo«inoftonwodoco«aTiDPHMan7/2jpupmev?4Onnpi>pcjt>k-repo-lhortonwortocom.TCP-uniS-11aRtepovoOW"puMc^Whirwtonmco(TVHDP»ren»tWwvpoaiev24OntJp/4M*-<epo-ihortonwodawcwWOP-uniS-110ZEpowOnnpjima«e(/HDP-24-^seimpmaiiw/HDPUTiLS-1102Qnnp/TpuDfecrepo-1hortonwortscomiHOP^use11sp3QcvgMeFOnnpiMonwodacomHOPAHUS-Y1omepowO0先电大數播干台ISA-:*r,*CWtrMqR*241曲理MH安装选项WPJW王!HP协.鞅却鞅却AJWftHSmmumSJM«MBBim•A王眦名1t碌金舷Hlg(F8N〉・每忏一个王口名・PatternExpressionsmasttfyavetiIVUtJMKft•- 王fib««*pnv«Ttre>SSHRPWF 哦•断手曲甥zn,不佚用ssh・跡心坊4跡心坊4正左始■王ineawaw.确认主机心!4w10)i5©i■■mlai«i 遴用 状空 ftffOniattet 期 CMqsewi MQ) BOtt开询r选择服务•U三机tt*■述1出诃斗€K)FS2?124ApxheZgp兮布式文佟砲€yarn•MapReOuce227124AoxneHdtloopiB二代MapAeoucc(YARN)iCtenhQTez07024说8PWI处it皮耐序BW分右式如亍.口Hve111Z4姻匕&羽统ft科点刈旬2也&MtSMK础据禾H侨&有暮・<•劳G«MC11224I淡务SW布IE1W•加上moeno・AW&3用的霸fWJSQUK・W9口E01502A加i析大血Muwnu床平台□SqoopWTApKheeoocpiaa恂化tm令刚d茨幫mmNiw次懊■工貝DOOZie42024ftiiApecneHdooop|ot>sKI^^IW«B.色jSSMOcaeweossofe细疾.它制1“us逵IlZG将舎KExus.♦Zootteeper34624可・的対柘式幼un■申式■芬0Ftlcon001140Slorm010024i_?Flmne1^224离鸟砌,富鸟■的.分布日科■・歎宕和他的爲纯匚Accumulo17054■册筑可tr®«・富性5»旳布式鋤吃w・电AmoanMetncs010-*WFMl*»r)W«.谬*1蜩佻从■»中蠟W的存蔽Ogg力关于XianDian-BigData的软件包进行了分开打包。XianDian-BigData-v2.0.2-BASE.iso软件包包含HDFS、MapReduce2>YARN、Tez、Hive、HBase、Pig、Sqoop、Zookeeper、Storm、Flume、AmbariMetrics、KerberosMahou>Spark等服务组件。XianDian-BigData-v2.0.2-EXT.iso软件包包含了accumulo、atlas、falcon、kafka、knox、oozie、rangerslider等服务组件。这里如果需要这些服务组件,则需要添加一个yum配置文件,如下:#viHDP-EXTEND.repo2929[HDP-2.4-EXTEND]name=HDP-2.4EXTENDbaseurl=http://master/HDP-2.4-EXTENDenabled=1gpgcheck=()分配MasterABWIH■认王机SNamef^xSesttvert(39GafS)ABWIH■认王机SNamef^xSesttvert(39GafS)mwtef<76GBIff)MwneMooemasser(76681MigocySetve*slaveri09G8IB>AppTwnemeSetverslawl(39G619)R9$ourx*Mvidg«rtlavert(99G81BF)a«Mi1(39GB.IfglZooKetperSefverslaverlQ9G81f5>ZooKeepefSe<v«rmaslet(/6GB1R)MetricsCotector masier(76GS1M)GrMna maMec(76G81••© 堀平台分配Slaves和Clientsawwioc»onugiPHswenim.PteM*处斑HDFScaenc.MapReouce2Ci,yarnCtenttQZocKceperOem倔MMe«4jftSIMSioClemsirwwter.*DaUNodeu-NFSGalewav疗ModeMan^ger无DsiaNotieNF9Gateway迂.NodeMarager♦caent无Caent@七电大雜站台 @七电大雜站台 TH•u王机MKMMter>)£S»YMndentsRS•u王机MKMMter>)£S»YMndentsRS义”W^nsfUfta,n9GraTdnAAdfnnPassword|繃a.W•辰 ~~|[羸!曲•人耶 ~~]Thearequireo门定义服务ttmff 7mw«b・抵弦休Bg・Q飙aaw合amam・tt・HDFSLUpAeAKe2YARNZooKeepeAnbanMetres(>Mac•§Dera■⑵ •G«rwiraiQ▲…r-"竇吸▲…r-"竇吸9斤砂Ia»wmsum4HUMU10HttSkivesiaCMBm»畤Q23(m.gi■*!!;」•drumi込血inMmaster13% 苇惦装AwNodeSUWft13% ■MWtAopTrntmeSe(vc<BT.» ▼ 1-2-t.M>b・♦■nA{MiirEfiT»*«S£-4B这里要设置GrafanaAdmin的密码。0化电大赠辛台安装开始并进行测试■财象您iffP・■«心轉恂・■ 3■题0先电大册军台安装开始并进行测试■烁簞鮒中・MvVH・too%?w■2血I■色| ISlQ主《lnustef100%sUverl100%■丹注Bf.MWn;2% •114-.MM- N♦4N■昜安HZOWI・«n?篁五才斤左n冷二sirti♦用的萌三芳工息'占・・uj?.fia<3a・部署成功后,便可成功进入界面。在主界面中,可以查看集群状态监控信息。@先电大咖F白HOP■■■■王輯1•务 王01 8VAdmen建控舸SU!历史£1?如• 1J<7•DauNodtsm2/2OW?Na@先电大咖F白HOP■■■■王輯1•务 王01 8VAdmen建控舸SU!历史£1?如• 1J<7•DauNodtsm2/2OW?NataOrtweOHBMeOZooKrepmOAneanMetnaaM4lbOU!HDFS0IBid—

teccmlatv

XMNnOv・•z_RHamtNo^RFCMV^ttManwNodtHeap23.0min<%NanwNod*CFUWO0.17msa»H8*MAV»CMHBawM3SUr«W^22.2min在HadoopMaster的终端执行jps命令,在打印结果中会看到master上运行的进程,这些进程表示主节点进程启动成功。[root^master~]#jps17360NameNode17120QuorumPeerMain23412―processinformafionunavailable18917App1icationHistoryserver12310Ambariserver20263NodeManager18889HMaster18106HMaster18620HRegionserver29870Jps16831DataNode在HadoopSlave的终端执行jps命令,也会看到相应的进程:Slaver1:[root@slaverl~]#jps12801ApplicationHistoryServer10065DataNode15586HRegionServer10419SecondaryNameNode16790RunJar11542JobHistoryServer13414ResourceManager13080NodeManager18220RunJar18956RunJar17565Jps7565QuorumPeerMain5.2HDFS运维管理5.2.1HDFS命令手册1.概述切换到hdfs用户,可以通过“hadoopfs■”命令来查看HDFS文件系统的帮助命令,通过提示的命令来对文件系统进行管理。命令如下:$hadoopfs・执行结果如下:Usage:hadoopfs(genericoptions]i-appcndToFile<localsrc>・・・<dst>]-cat[-ignoreCrc]<sro・・・][-checksum<src>・・・][-chgrp[-R]GROUPPATH..[■Chfliod[-R]<MODG[.MODE)...IOCTALMODE>PATH・•・][-chown[-R][OWNERH:[GROUP]]PATH..f-copyFromLocal[-fl[-p][-1J<localsrc>•・•<dst>]r-copyTolocal[-□)(-ignoreCrc)[-crc]<src>・・・<locald$t>]f-count[-a][-hj(-v)(-t[<storagctypo]]<path>・・・]l-cp('fjL-pI-pltopax]]<src>・・・<dst>J[-crcatcSnapshot<snapshotDir>[<snapshotName>]]E-deleteSnapshot<snapshotDir><snapshotName>][-df[-h][<path>...]][-du[-s][-h]<path>…][-expunge]f-find<path> <expression>・・・]get[-p][-ignoreCrc][・crc]<$rc>・・・<localdst>](-getfaei[-R]<path>)l-gctfattr[R]{-nnameI・d)[-een)<path>]getmerge[-nl]<src><localdst>][-help[emd...]][-Is[・d][-h][-R][<path>・••]][-mkdir[-p]<oath>...][-moverromLocal<localsrc>...<dst>]「moveTolocal<$rc><localdst>]L-mv<src>—L-put[-f][-p][-1]<localsrc>・•・<dst>][rcnamcSnapshot<snapshotOir><oldNamc><ncwKamc>][-rm[-rI-R][-skipTrash][-safely]<src>・•・)rmdir[・・ignore-fail・on・non-empty]<dir>・・・][-setfacl[-R][{-b|-k}{-ml-x<aci_spec>}<path>]I[■-set<acl_spec><path>]][-setfattr{-nname[-vvalue]Iname}<path>]F-setrep[・R]F-w]<rep><path>...]L-$tat[formatj<path>・・•)[-tailf-f][-test-[defsz)<path>][-text[-ignoreCrcJ<src>・・・][-touch?<path>•・・][-truncate[・w]<length><path>・•・][-usage[c・d•・・]]Genericoptionssupportedare-conf<configurationf<le>specifyanapplicationconfigurationfile-0<property*value> usevaIucforgivenproperty<local|namcnodc:port>specifyanamcnodc<localIresourcemanager:port>specifyaRcsourceManagcr・files<commaseparatedlistoffiles>specifycommaseparatedfilestobecopiedtothemapreducecluster・libiars<commaseparatedlistofjars>specifycomoaaseparatedjarfilestoincludeintheclasspath・・archives<commaseparatedlistofarchives>specifycommaseparatedarchivestobeunarchivedonthecomputemachines・Thegeneralcomandlinesyntaxis所有的hadoop命令均由bin/hadoop脚本引发。不指定参数运行hadoop脚本会打卬所有命令的描述。用法:hadoop[-configconfdir][COMMAND][GENERIC_OPTIONS][COMMAND_OPTIONS]Hadoop有一个选项解析框架用于解析一般的选项和运行类。命令选项描述—configconfdir覆盖缺省配置目录。缺省是${HADOOP_HOME}/confGENERIC_OPTIONS多个命令都支持的通用选项COMMAND命令选项S各种各样的命令和它们的选项会在下面提到。这些命令被分为用户命令管理命令两组。权限管理在Hadoop集群中,只有hdfs用户才有对HDFS文件系统的管理权限,当其它用户对文件系统进行操作,需要给其赋予相应的权限,这里为了方便操作,将所有用户的读写执行权限全部放开,命令如下:#suhdfs$hadoopfs-chmod-R7力/[root@master[hdfs饷asterFound8iternsdrwxrwxrwxdrwxr-xr-xdrwxr-xr-xdrwxr-xr-xdrwxr-xr-xdrwxrwxrwxdrwxrwxrwxdrwxr-xr-x[hdfs(&master[hdfs(&masterFound8iternsdrwxrwxrwxdrwxrwxrwxdrwxrwxrwxdrwxrwxrwxdrwxrwxrwxdrwxrwxrwxdrwxrwxrwxdrwxrwxrwx[hdfs@master3・常规选项hadoop-mapreducej#hadoop-mapreduce]$suhdfshadoopfsyarnhadoophdfshdfsyarnhdfshadoophdfsmapredhdfsmapredhadoophdfshdfs[root@master[hdfs饷asterFound8iternsdrwxrwxrwxdrwxr-xr-xdrwxr-xr-xdrwxr-xr-xdrwxr-xr-xdrwxrwxrwxdrwxrwxrwxdrwxr-xr-x[hdfs(&master[hdfs(&masterFound8iternsdrwxrwxrwxdrwxrwxrwxdrwxrwxrwxdrwxrwxrwxdrwxrwxrwxdrwxrwxrwxdrwxrwxrwxdrwxrwxrwx[hdfs@master3・常规选项hadoop-mapreducej#hadoop-mapreduce]$suhdfshadoopfsyarnhadoophdfshdfsyarnhdfshadoophdfsmapredhdfsmapredhadoophdfshdfshdfshdfsnadoop-mapreduce]$hadoopnadoop-mapreduce]$hadoopyarnhdfsyarnhdfsmapredmapredhdfshdfshadoophdfshadoophdfshdfshadoophdfshdfshadoop-mapreduce]$exitoooooooooooooooo7777777711111111oooooooo222222227777777711111111oooooooo22222222ololololololololmo/01010101010101011206:451208:371206:421206:421206:421206:421208:171208:14-R7771206:451208:371206:421206:421206:421206:421208:171208:14/app-logs/apps/ats/hdp/mapred/mr-history/tmp/user/app-logs/apps/ats/hdp/mapred/mr-history/tmp/userGENERIC_OPTION描述・confConfigurationfile>指定应用程序的配置文件。-D<property=value>为指定property指定值value。-fs<local|namenode:port>指定namenodeo-jt<Iocal|jobtracker:port>指定jobtrackero只适用于job。・files<逗号分隔的文件列表〉指定要拷贝到mapreduce集群的文件的逗号分隔的列表。只适用于job。-libjarsv逗号分隔的jar列表〉指定要包含到classpath中的jar文件的逗号分隔的列表。只适用于job。-archivesv逗号分隔的archive列表〉指定要被解压到计算节点上的档案文件的逗号分割的列表。只适用于job。下面的选项被dfsadmin,fs,fsck和job支持。应用程序要实现Tool来支持常规选项。4.用户命令hadoop集群用户的常用命令。archive创建一个hadoop档案文件。参考HadoopArchives.用法:hadooparchive・archiveNameNAME・pvparenlpath〉<src>*<dest>命令选项描述-archiveNameNAME要创建的档案的名字。-p<parentpath>父路径,格式与正则表达式一致。src父路径下面需要创建档案的文件名(可多个)dest保存档案文件的目标目录。distcp递归地拷贝文件或目录。参考DistCp指南以获取等多信息。用法:hadoopdistcp<srcurl><desturl>命令选项描述srcurl源Urldesturl目的Urlfs用法:hadoopfs[GENERIC_OPTIONS][COMMAND_OPTIONS]运行一个常规的文件系统客户端。fsck运行HDFS文件系统检查工具。参考FsckT解更多。用法:hadoopfsck[GENERIC_OPTIONS]<path>[-move|-delete|-openforwrite][-files[-blocks[-locations|-racks]]]

命令选项描述<path>检查的起始目录。-move移动受损文件到/lost+found-delete删除受损文件。・openforwrite打印出写打开的文件。-files打印出正被检查的文件。-blocks打印出块信息报告。-locations打印出每个块的位置信息。-racks打印出data-node的网络拓扑结构。jar运行jar文件。用户可以把他们的MapReduce代码捆绑到jar文件中,使用这个命令执行。用法:hadoopjar<jar>[mainClass]args...job用于和MapReduce作业交互和命令。用法:hadoopjob[GENERIC_OPTIONS][-submit<job-file>]|[-status<job-id>]|[-counter<job-id><group-name><counter-name>]|[-kill<job-id>]|[-events<job-id><from-event-#><#-of-events>]|[-history[all]<jobOutputDir>]|[-list[all]]|[-kill-task<task-id>]|[-fail-task<task-id>]命令选项描述・submit<job-file>提交作业-status<job-id>打印map和reduce完成百分比和所有计数器。

・counter<job-id><group-name〉<counter-name>打印计数器的值。-kill<job-id>杀死指定作业。・events<job-id><from-event-#><#-of-events>打印给定范围内jobtracker接收至!)的事件细节。-history[all]<jobOutputDir>-history<jobOutputDir>打印作业的细节、失败及被杀死原因的细节。更多的关于一个作业的细节比如成功的任务,做过的任务尝试等信息可以通过指定[all]选项查看。・list[all]-listall显示所有作业。-list只显示将要完成的作业。-kill-task<task-id>杀死任务。被杀死的任务不会不利于失败尝试。-fail-task<task-id>使任务失败。被失败的任务会对失败尝试不利。pipes运行pipes作业。用法:hadooppipes[-conf<path>][-jobconf<key=value>,<key=value>,...][-input<path>][-output<path>][-jar<jarfilo][-inputformat<class>][-map<class>][-partitioner<class>][-reduce<class>][-writer<class>][-program<executable>][-reduces<num>]命令选项描述■conf<path>作业的配置-jobconf<key二value〉,<key=value>,.增加/覆盖作业的配置项

■input<path>输入目录-output<path>输岀目录-jar<jarfile〉Jar•文件名■inputformat<class>InputFormat类・map<class>JavaMap类-partitioner<class>JavaPartitioner-reduce<class>JavaReduce类・writer<class>JavaRecordWriter-program<executable>可执行程序的URI-reducesvnum>reduce个数version打印版本信息。用法:hadoopversionCLASSNAMEhadoop脚本可用于调调用任何类。用法:hadoopCLASSNAME运行名字为CLASSNAME的类。5.管理命令hadoop集群管理员常用的命令。balancer运行集群平衡工具。管理员可以简单的按Ctrl-C来停止平衡过程。参考Rebalancer

了解更多。用法:hadoopbalancer[-threshold<threshold>]命令选项描述-threshold<threshold>磁盘容量的百分比。这会覆盖缺省的阀值。daemonlog获取或设置每个守护进程的口志级别。用法:hadoopdaemonlog-getlevel<host:port><classname>用法:hadoopdaemonlog-setlevel<host:port><classname><level>命令选项描述-getlevel<host:port><classname>打印运行在<host:port>的守护进程的日志级别。这个命令内部会连接http://<host:port>/logLevel?log=<name>-setlevel<host:port><classname><level>设置运行在Vhoscpon>的守护进程的日志级别。这个命令内部会连接http://<host:port>/logLevel?log=<name>datanode运行一个HDFS的datanodeo用法:hadoopdatanode[-rollback]命令选项描述-report报告文件系统的基本信息和统计信息。-safemodeenter|leave|get|wait安全模式维护命令。安全模式是Namcnodc的一个状态,这种状态下,Namenode不接受对名字空间的更改(只读)不复制或删除块Namenode会在启动时自动进入安全模式,当配置的块最小百分比数满足最小的副本数条件时,会自动离开安全模式。安全模式可以手动进入,但是这样的话也必须手动关闭安全模式。-refreshNodes重新读取hosts和exclude文件,更新允许连到Namenode的或

那些需要退出或入编的Datanode的集合。-finalizeUpgrade终结HDFS的升级操作。Datanode删除前一个版本的工作目录,之后Namenode也这样做。这个操作完结整个升级过程。-upgradeProgressstatus|details|force请求当前系统的升级状态,状态的细节,或者强制升级操作进行。-metasavefilename保存Namenode的主要数据结构到hadoop.log.dir属性指定的目录下的<filename>文件。对于下面的每一项,vfilenamc>中都会一行内容与之对应Namenode收到的Datanode的心跳信号等待被复制的块正在被复制的块等待被删除的块-setQuota <quota><dimame>...<dirname>为每个目录<dirname>设定配额<quota>o目录配额是一个长整型整数,强制限定了目录树下的名字个数。命令会在这个目录上工作良好,以下情况会报错:N不是一个正整数,或者用户不是管理员,或者这个目录不存在或是文件,或者目录会马上超出新设定的配额。・clrQuota<dimame>...<dirname>为每一个目录<dirname>清除配额设定。命令会在这个目录上工作良好,以下情况会报错:这个目录不存在或是文件,或者用户不是管理员。如果目录原来没有配额不会报错。-help[cmd]显示给定命令的帮助信息,如果没有给定命令,则显示所有命令的帮助信息。secondarynamenode运行HDFS的secondarynamenode□用)去:hadoopsecondarynamenode[-checkpoint[force]]|[-geteditsize]命令选项描述-checkpoint[force]如果EditLog的人小>=fs.checkpoint.size,启动Secondarynamenode的检查点过程。如果使用了-force,将不考虑EditLog的大小。-geteditsize打印EditLog大小。5.2.2进程管理查看当前系统中启动的进程命令如下:jps执行结果如下:1445AmbariServer13606RunJar22313HMaster27226Jps21483Historyserver22334ApplicationHistoryServer13871DataNode28431NameNode重启NameNode和DateNode进程hadoop-daemon.sh脚本是启动和停止hadoop后台程序,“—config"参数指定启动程序时用到的配置文件目录。命令如下:/usr/hdp/current/hadoop-client/sbin/hadoop-daemon.sh--config/usr/hdp/current/hadoop-client/confstop{namenode/datenode)/usr/hdp/current/hadoop-client/sbin/hadoop-daemon.sh—config/usr/hdp/current/hadoop-client/confstart{namenode/datenode}5.2.3可靠性管理Hadoop集群中的主机在某些情况下会出现宕机或者系统损坏的问题,•旦遇到这些问题,HDFS文件系统中的数据文件难免会产生损坏或者丢失,为了保证HDFS文件系统的可靠性,可以采取以下策略:1.冗余副本策略更改集群冗余副本的复制因子为5,从而避免某台节点主机损坏导致数据丢失的情况,这里我们有两种方式来设置复制因子。第一种是通过WEB界面,进入到HDFS配置中修改Blockreplication的参数值。■GeneralWebHDFSenabted &Ac第:种方式是在Shell命令行模式下,修改hdfs-site.xml配置文件,将"dfs.replication”的值设置为5,然后重启NameNode和DataNode进程。#vi/etc/hadoop/-379仏)/hdfs-site.xml<property><name>dfs.replication</name〉<value>5</value></property>2.安全模式当在进行系统维护或者集群维护时,不希望用户进行再去操作HDFS文件系统中文件,这时候需要手动将NameNode设置成安全模式的状态。该操作需要HDFS管理用户来进行实现,即hdfs用户。命令如下:$hadoopdfsadmin・safemodeenter$hadoopdfsadmin-safemodeget执行结果如下:

SafemodeisON3.回收站设置HDFS文件系统回收站中的文件彻底删除的时间间隔为7天。进入到HDFS配置中修改“erval”的值为1(X)&)(分钟)。注:当该值为0时,表示禁用回收站的功能。高级core-sitefs.derauitFSh(ns//master.hadoop:8020 aoCfstrashinterval110080 aoOC4.快照管理为HDFS文件系统中“/ldaoyun”目录创建快照,首先需要设置该目录可进行快照功能,然后再进行创建快照。[root^masterT#hadoopfs-Is/ldaoyunFound1items-rw-rw-r-- 3hdfshdfs 152016-11-0919:09/ldaoyun/bigdata.txt[root@masterT#hadoopdfsadmin-allowsnapshot/ldaoyunDEPRECATED:Useofthisscripttoexecutehdfscommandisdeprecated.Insteadusethehdfscommandforit.Allowingsnaphot[root@masterT#on/ldaoyunsucceededAllowingsnaphot[root@masterT#hadoopfs-createSnapshot/ldaoyunsOCreatedsnapshot/ldaoyun/.snapshot/sO[root©master创建完成后,创建一个恢复文件夹,通过cp命令可以恢复快照,如下:[rootCmasterhadoopfs-Is/ldaoyun/.snapshotFound1itemsdrwxrwxr-x-hdfshdfs(root0masterdrwxrwxr-x-hdfshdfs(root0master〜]#hadoopfs(root^master-]#hadoopfs[root@master~]#hadoopfsFound1items-rw-r——r-- 3roothdfs-mkdir/ldaoyun/recover-cp/ldaoyun/.snapshot/sO/bigdata.txt/ldaoyun/recover-Is/ldaoyun/recover/152016-11-1408:52/ldaoyun/recover/bigdata.txt5.3MapReduce5.3.1运行案例进入/usr/hdp/-227/hadoop-mapreduce/目录中,存在一个hadoop-mapreduce-exampIes-.4.3.0-227.jar的案例JAR包,其所自带的案例如下:

[root®masterhadoop-mapreduce]#hadoopjarhadoop-mapreduce-examples-2・7・l・2・4・3・0-227.jarWARNING:Use"yarnjartolaunchYARNapplications・Anexampleprogrammustbegivenasthefirstargument・Validprogramnamesare:aggregatewordcount:AnAggregatebasedmap/reduceprogramthatcountsthewordsintheinputfiles・aggregatewordhist:AnAggregatebasedmap/reduceprogramthatcomputesthehistogramofthewordsintheinputfiles.bbp:Amap/reduceprogramthatuses8ailey・Borwein-P1ouffetocomputeexactdigitsofPi・dbcount:Anexamplejobthatcountthepageviewcountsfromadatabase・distbbp:Amap/reduceprogramthatusesaBBP-typeformulatocomputeexactbitsofPi・grep:Amap/reduceprogramthatcountsthematchesofaregexintheinput・join:Ajobthateffectsajoinoversorted,equallypartitioneddatasetsmultifilewc:Ajobthatcountswordsfromseveralfiles・pentomino:Amap/reducetile1ayingprogramtofindsolutionstopentominoproblems・pi:Amap/reduccprogramthatestimatesPiusingaquasi-MonteCarlomethod・randomtextwriter:Amap/reduceprogramthatwrites10GBofrandomtextualdatapernode,randomwriter:Amap/reduceprogramthatwrites10GBofrandomdatapernode・secondarysort:Anexampledefiningasecondarysorttothereduce・sort:Amap/reduceprogramthatsortsthedatawrittenbytherandomwriter.sudoku:Asudokusolver・teragen:Generatedatafortheterasortterasort:Runtheterasortteravalidate:Checkingresultsofterasortwordcount:Amap/reduceprogramthatcountsthewordsintheinputfiles・wordmean:Amap/reduceprogramthatcountstheaverage1engthofthewordsintheinputfiles・wordmedian:Amap/reduceprogramthatcountsthemedianlengthofthewordsintheinputfiles・wordstandarddeviation:Amap/reduceprogramthatcountsthestandarddeviationofthelengthofthewordsintheinputfiles・这里,我们以运行一个圆周率的计算为例:#cd/usr/hdp/-227/hadoop-mapreduce/#hadoopjarhadoop-mapreduce-examples-2.7」.・227.jarpi55[luifs€slaverlhadoop・ntapr€du"]$haEARNING:Use"yarnjar**tolaunchYNumberofMaps■5Samplesper八 ’WroteinputWroteinputWroteinputWroteinputwroteinputStartina''16/10/3116/10/3116/10/3116/10/3116/10/3116/10/3116/10/3138_OOO1/16/10/3116/10/3116/10/3116/10/3116/10/3116/10/3116/10/3116/10/3116/10/31Map=5forMap#0forMap#1forMapforMap#3forMap#4Job03:13:4103:13:4103:13:4603:13:4903:13:5003:13:5203:13:52INFOIKFOINFOIKFOINFOINFOINFOhadoop-mapreduce-examples・2・7・1.・2・3.6・0-3796・jarpi55ications.impl.TiiBelineClicntlwp):Timcl-ineserviceaddress:http://s1aver1.hadoop:8188/ws/vl/fi»elinc/client.RMProxy:ConnectingtoRcsourceManagerats1averl.hadoop/82:8050input.FilelnputFormat:Totalinputpathstoprocess:5mapreduce・JooSubeitter:numberofsplit$:5miiprcducc.JobSub«ittcr:Submittingtokensforjob:iob-1477853518438_OOOiimpl.YarnClientlwpl:SubmittedapplicationappIicat100^1477853518438.0001mapreduce.Job:_'亠一・J-•••一八、・・・ — •- "一__ ^plicationapplication.1477853518438.0001Theurltotrackthejob:http://slaverl.hadoop:8088/proxy/applicatiot\.1^778535184L03:13:52L03:14:13L03:14:13L03:14:35L03:15:18L03:15:43L03:16:00 L03:16:01INFOL03:16:02INFOFileSystemFILE:FILE:FILE:FILE:FILE:HOPS:HOPS:MDFS:HOPS:HOPS:JobCountersLaunchedmaptasks=5Launchedreducetasks»lDatamaptasks«5Total・ 'TotalTotalTotalTotalTotalTotal亠Total_Map・ReduceFrameworkMapinputrecords=5Mapoutputrecords・10Mapoutputbytes=90Mapoutputmaterializedbytes=140Runningjob:iob-1477853518438„0001Jobjoo_i477853518438.0001runninginuberMode:falsemap0%reduce0%■ap4OXreduce0%wap80%reduceOXmap100%

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论