hadoop安装概论和快速入门_第1页
hadoop安装概论和快速入门_第2页
hadoop安装概论和快速入门_第3页
hadoop安装概论和快速入门_第4页
hadoop安装概论和快速入门_第5页
已阅读5页,还剩35页未读 继续免费阅读

付费下载

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

北京传智播客教育Hadoop

概论和快速入门讲师:童小军Hadoop

安装和配置Hadoop

集群安装和配置名词解释Hadoop,Apache开源的分布式框架。源自GoogleGFS,BigTable,MapReduce

论文。==

HDFS

==HDFS

(Hadoop

Distributed

File

System),Hadoop

分布式文件系统。NameNode,HDFS命名服务器,负责与DataNode文件元信息保存。DataNode,HDFS数据节点,负责存储数据存储并汇报给NameNode。SecondaryNamenode,NameNode的镜像备份节点

==Map

Reduce==JobTracker,hadoop的Map/Reduce调度器,负责与TackTracker通信分配计算任务并跟踪任务进度。TaskTracker,启动和管理Map和Reduce子任务的节点。Hadoop简易版本总体组件架构Hadoop

单机部署(Hadoop

Pseudo-Distributed

Mode)-----

配置系统环境------Step

0:

配置ip和用户,hostname,本地DNS服务/etc/hostsStep

1:配置ssh无密钥登陆(Setup

SSH

key

exchange)Step

2.安装JDK,配置环境变量(InstallJDK)------配置hadoop

环境-----Step

3:

下载软件(Download

Hadoop

Source

Package)Step

4:

配置hadoop

环境变量(Configurehadoop-env.s) –exportJAVA_HOME=/usr/java/jdk1.6.0_21/Step5:配置Hadoop配置(Configure

core-site.xmlhdfs-site.xml)Set

Namenode

to

hdfs://master:9000Set

Jobtracker

to

master:9001Hadoop

单机部署(Hadoop

Pseudo-Distributed

Mode)Step

6:

Format

HDFS格式化文件系统bin/hadoop

namenode-formatStep

7:

Start

Hadoop------启动Hadoop集群----

–bin/start-all.shStep

8:检查Hadoop状态检查任务检查任务测试:hadoop

jar

hadoop-*-examples.jar

pi

10

100Hadoop分布式安装Hadoop

集群部署-练习启动命名节点/opt/hadoop/bin/hadoop-daemon.sh

start

namenode启动第二命名节点/opt/hadoop/bin/hadoop-daemon.sh

startsecondarynamenode启动数据节点/opt/hadoop/bin/hadoop-daemon.sh

start

datanode启动任务子节点/opt/hadoop/bin/hadoop-daemon.sh

start

jobtracker启动任务子节点/opt/hadoop/bin/hadoop-daemon.sh

start

tasktracker检查挂载健康情况jps注意启动和关闭集群顺序使用Hadoop计算pi蒙地卡罗算法()蒙特卡罗方法(MonteCarlomethod),也称统计模拟方法,是二十世纪四十年代中期由于科学技术的发展和电子计算机的发明,而被提出的一种以概率统计理论为指导的一类非常重要的数值计算方法。是指使用随机数(或更常见的伪随机数)来解决很多计算问题的方法。20世纪40年代,在John

von

Neumann,Stanislaw

Ulam和NicholasMetropolis在洛斯阿拉莫斯国家实验室为核武器计划工作时,发明了蒙特卡罗方法。因为Ulam的叔叔经常在蒙特卡罗赌场输钱得名,而蒙特卡罗方法正是以概率为基础的方法。与它对应的是确定性算法。蒙特卡罗方法在金融工程学宏观经济学生物医学计算物理运行一个MapReduce程序运行PI计算程序hadoop

jar

hadoop-*-examples.jar

pi10

100那些公司在招聘Hadoop人才?世界Alexa

网站排名前几百位都需要Hadoop

来处理大数据问题。国内外企业用Hadoop做什么?数据仓库,商业智能(facebook,twitter,淘宝,京东,暴风,新浪,58同城....,移动大云)互联网广告计算(亿赞普,科捷,各类大互联网企业)大搜索引擎项目

(Yahoo,国产盘古,人民搜索)站内搜索引擎项目(Ebay,支付宝)内容推荐引擎(人人,新浪微博,优酷)病毒分析,垃圾邮件识别(Yahoo,趋势科技,360)云计算服务项目(亚马逊云,阿里云)地图项目(月球表面探测地图)科研项目(欧洲量子对撞机)金融项目(股票分析,阿里金融)Hadoop工程师工资水平?思考为何Hadoop工程师工资会更高?所在行业?行业价值?技术水平?稀缺性?希望同学们赶上大数据,云计算,物联网的这个浪潮!Hadoop在淘宝每日新增数据20T累积数据14P2000+服务器的云计算平台每天处理100,000+作业任务,包括100+新增作业任务每天处理1P+数据,包括0.5%新增数据Gateway

ServersOracle备库MySQL备库日志系统

Log

ServerHadoopGateway

ServersDBSync爬虫数据MapReduceJava

JobsStreamingJobsHive

JobsTimeTunnelDataX数据流向主站服务(淘宝,B2B,广告,搜索,BOSS)HbaseHbaseMysqlOracleDataXMyfox

LoaderLzLoaderOther

System数据产品Adhoc报表(淘数据,Business

Preview)回流主站应用流式计算其它数据开发平台——数据技术架构实时计算平台OLAPserver北京传智播客教育Hadoop

概论Hadoop

培训大纲Hadoop

源起和概论思考:Hadoop的核心思想Hadoop

简介:缘起与术语练习一:Hadoop

单机安装HDFS

理念与命令解说练习二:HDFS

操作实务MapReduce

简介:练习三:MapReduce

范例操作Hadoop

培训大纲Hadoop

集群安装配置:练习四:Hadoop

集群安装实战Hadoop

相关应用(1)-Hadoop

Streaming练习五:Hadoop

Streaming

操作练习Hadoop

相关应用(3)-Hive练习七:PhpHiveAdmin

数据仓库练习八:ComETL

快速数据转换为何需要MapReduce|HDFS诉求:海量数据需要及时分析和处理。[速度]海量数据需要深入分析和挖掘。[深度]数据需要长期保存

[数据资产]Data

processed

by

Google

every

month: 400

PB

in

2007问题:磁盘IO成为一种瓶颈,而非CPU资源。网络带宽是一种稀缺资源硬件故障成为影响稳定的一大因素传统分布式编程模型[MPI],需要处理大量异常问题。MapReduce|HDFS

如何解决?MapReduce+HDFS思想:尽可能移动计算到数据端,而非移动数据到计算端。硬件和组件的故障是一种常态。为何需要MapReduce|HDFSMapReduce

思想:分而治之,化整为零排序优化,降低内存为何需要MapReduce|HDFSHDFS思想:文件单次写入,并多次读取。文件副本,分片保存(64M一个块/分3份保存)顺序写入,流式顺序读取面向大文件存储,而非小文件系统吞吐量比反应时间更重要Hadoop

诞生于大搜索应用Doug

CuttingMapReduce

|GFS

|

BigTableHadoop生态系统社区:Apache

基金会核心:HDFS

MapReduce

Hbase

Zookeeper外围:Scribe,flume,Sqoop,PhpHiveAdmin,oozie应用:Hive

Pig

Nutch

Mahout基础供应商:Cloudera

MapR,华为服务供应商:IBM

Oracle

Microsoft云服务提供商:亚马逊,阿里云Hadoop-EcosystemHadoop生态系统社区:Apache

基金会核心:HDFS

MapReduce

Hbase

Zookeeper外围:Scribe,flume,Sqoop,PhpHiveAdmin,oozie应用:Hive

Pig

Nutch

Mahout基础供应商:Cloudera

MapR,华为服务供应商:IBM

Oracle

Microsoft云服务提供商:亚马逊,阿里云开发更多有趣的开源项目北京传智播客教育Hadoop

快速入门(mapreduce+hdfs)MapReduce基本流程思考10TB

级别sort

算法实现?MapReduce基本流程MapReduce基本流程思考MapReduce

基本算法理解Mapreducewhere实现理解Mapreduce

group

by

实现理解MapReduce

Join

实现MapReduce基本流程思考100TB

级别数据如何存储?HDFS:开发动机高效:提供高稳定,高效的存储方案。廉价:使用廉价服务器,构建整体的海量存储方案。可扩展整体存储能力和硬件新增弹性扩展HDFS是Google

File

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论