大数据技术基础及应用(微课版)课件 (曹雪梅) 第1-4章 大数据理论基础 - HBase分布式数据库_第1页
大数据技术基础及应用(微课版)课件 (曹雪梅) 第1-4章 大数据理论基础 - HBase分布式数据库_第2页
大数据技术基础及应用(微课版)课件 (曹雪梅) 第1-4章 大数据理论基础 - HBase分布式数据库_第3页
大数据技术基础及应用(微课版)课件 (曹雪梅) 第1-4章 大数据理论基础 - HBase分布式数据库_第4页
大数据技术基础及应用(微课版)课件 (曹雪梅) 第1-4章 大数据理论基础 - HBase分布式数据库_第5页
已阅读5页,还剩294页未读, 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

配色色系表RGB255/187/87RGB250/211/187RGB254/238/193RGB226/243/252RGB190/233/238RGB

153/54/54RGB

242/137/68RGB

253/211/81RGB

129/193/95RGB

86/196/210RGB

127/0/1RGB

237/109/0RGB

52/200/0RGB

98/178/48RGB

48/181/197RGB137/137/137RGB255/255/255RGB89/87/87RGB221/221/221RGB

35/24/21RGB181/181/181大数据技术

授课教师:曹雪梅

大数据技术已经深刻融入我们的日常生活,从个人消费到公共服务,几乎无处不在。一、个性化推荐电商平台:案例:淘宝、京东的“猜你喜欢”。亚马逊的个性化商品推荐。视频与音乐平台:案例:抖音、快手的短视频推荐。网易云音乐的每日推荐歌单。新闻与阅读平台:案例:今日头条的新闻推荐。微信读书的书籍推荐。利用大数据技术,对用户的信息进行收集与分析,为用户推送感兴趣的产品,刺激用户消费。传媒领域抖音、快手等新媒体通过收集和分析用户的信息,进行分类筛选,实现对用户需求的准确定位,追踪用户的浏览习惯,不断推送用户感兴趣的内容。二、智能交通与导航实时路况与导航:案例:高德地图、百度地图的实时路况功能。GoogleMaps的路线规划。共享出行:案例:滴滴出行的智能派单系统。共享单车(如摩拜、哈啰)的车辆调度。智能交通管理:案例:智慧城市中的交通信号灯自适应系统。城市交通拥堵预测与疏导。三、健康与医疗智能穿戴设备:案例:苹果手表(AppleWatch)的心率监测与预警。小米手环的睡眠分析。疾病预测与诊断:案例:IBMWatson的癌症诊断辅助系统。基于大数据的流行病预测模型(如流感预测)。个性化健康管理:案例:Keep的运动计划推荐。薄荷健康的饮食管理。大数据是AI的基础,AI是以大数据作为机器学习的训练集,从而训练出拥有一定决策能力的人工智能。例:Deepseek:算法的改进和优化,节省了算力和数据量;OpenAI公司的ChatGPT;百度的文心一言;字节跳动的豆包。人工智能教育学习智能家居金融服务娱乐社交智慧城市其它应用引例怎么能最快速统计出咱们所在城市居民的男女比例?抽样统计:大数据技术:从样本数据统计发展到全量数据统计,这就是一个大数据应用的简单例子。课程考核本课程教学时数56学时本课程为考查课总评成绩:考勤:10%课堂成绩(课堂提问及随堂实验等):20%课后作业:10%期末随堂测试成绩:60%

不要迟到,旷课,早退(迟到一次扣1分,旷课一次扣3分,早退一次扣2分)带齐教材、笔、本子课堂禁用手机

课堂纪律参考教材:[1]黄史浩.大数据原理与技术[M].北京:人民邮电出版社,

2018.[2]朱洁,罗华霖.

大数据架构详解:从数据获取到深度学习[M]北京:电子工业出版社,2016.[3][美]TomWhite著王海,华东,刘喻,吕粤海译.Hadoop权威指南:大数据的存储与分析(第4版)[M].北京:清华大学出版社,2017.课程概述课程讲授内容第一章大数据理论基础第二章大数据软件相关基础第三章大数据采集组件第四章大数据存储组件第五章

大数据计算和处理组件第六章大数据增强与协调组件第七章大数据综合案例课程目标:培养学生具备大数据平台的规划设计、部署实施、运维管理能力。工作岗位:大数据技术助理工程师、大数据开发者、大数据平台管理员等。总体学习思路

理论+

实战第一章大数据理论基础

本章主要讲述大数据的基本定义原理、处理流程、Hadoop和FusionInsightHD等相关内容大数据的相关基础知识大数据的定义大数据的处理流程大数据行业的挑战大数据的行业应用与基础大数据的框架结构大数据基础大数据定义大数据处理流程2.大数据行业发展3.大数据框架大数据时代背景21世纪是数据信息大发展的时代,移动互联、社交网络、电子商务等极大地扩展了互联网的边界和应用范围。各种数据正在迅速膨胀并增大。互联网如社交、搜索、电商,移动互联网如微信、微博,物联网如传感器、智慧地球,车联网,GPS,安全监控,金融等都在疯狂产生数据。为什么2010年后数据量出现陡增?智能手机+社交媒体+云计算

无法在一定时间范围内用常规软件工具进行捕捉、管理和处理的数据集合,是需要新处理模式才能具有更强的决策力、洞察发现力和流程优化能力的海量、高增长率和多样化的信息资产。什么是大数据?

大数据的基本定义大数据(bigdata),或称巨量资料,指的是所涉及的资料量规模巨大到无法透过目前主流软件工具,在合理时间内达到撷取、管理、处理、并整理成为帮助企业经营决策更积极目的的资讯。——百度百科大数据(BigData),即为当人们处理某数据集所需要的时间超过了人们所能容忍的时间范围时,则称该数据集为大数据。——维基百科大数据的4v定义Volume:大数据的第一个核心特点就是需要保证的就是有足够多的数据,数据的体量在分析时所需要的时间是超过常规所能容忍的限度的。Variety:大数据的第二个核心的特点就是数据类型繁多,从结构化数据到非结构化数据,大数据可以说基本囊括了当前所有的类型的数据。Velocity:大数据的第三个特点就是数据处理速度快,虽然大数据引擎体量巨大,类型繁多,但是我们仍然需要保证快速的完成计算和反馈的任务。(1s定律)Value:大数据的第四个特点就是价值密度较低的,例如,监控视频每天会产生大量的数据,但是,最终有意义的视频只有当出现事故或者其他情况的时候产生的数据。所以,大数据本身的高价值性,是需要从海量数据中找寻到有价值的这部分数据而定义的。大数据的4v定义大数据基础大数据定义大数据处理流程大数据与云计算、物联网2.大数据行业发展3.大数据框架大数据处理流程

数据获取数据获取:作为大数据引擎,如果需要对数据进行操作,首先要有一个稳定的数据源提供数据,所以数据的来源与获取就成为了最初的大数据的相关需求。数据获取主要负责从数据源进行数据的采集工作,将外部数据采集到本地。数据获取主要由Flume日志采集系统和Kafka消息订阅系统实现。Flume主要对小规模的日志数据进行采集,Kafka是对大规模的对数据时间顺序要求比较高的数据和应用进行数据采集。数据存储数据存储:主要负责对数据进行存储管理和维护。经过数据获取拉取到大数据本地的数据,首先需要做的就是将数据进行存储维护;此时根据数据的不同,可以将存储分为文件存储和数据库存储,文件存储需要由HDFS分布式文件系统进行维护,数据库存储需要由HBase分布式数据库以及Hive分布式数据仓库维护。数据分析数据分析:数据存储并维护好之后,在本阶段就进入到应用阶段,对海量数据的主要应用操作会体现在数据分析上,分析主要是指在数据统计(count、select)层面的角度上,对数据进行规律的发现和找寻。数据挖掘数据挖掘:数据挖掘是大数据中的深度分析操作,通过数据挖掘用户可以构建一个分析模型,通过对数据进行算法挖掘操作,直接得到判断的规律,并且将其封装在一个模型中,最终使用该模型进行数据的预测。大数据基础大数据定义大数据处理流程2.大数据行业发展3.大数据框架大数据基础2.大数据行业发展大数据行业的挑战大数据的行业应用与基础3.大数据框架大数据发展趋势大数据经过多年的发展,逐渐走向产业化、规模化。国内骨干企业已经具备了自主开发建设和运维超大规模大数据平台的能力,一批大数据以及智慧城市方面的独角兽企业快速崛起,大数据领域的专利申请数量逐年增加。我国大数据创新市场竞争主体多样,创新主体主要包括企业、院校/研究所、个人和政府机构等类型。进一步研究发现,企业和科研院所是大数据创新的主力军,数据显示,2019年,两者合计贡献了9504项专利,占到了全年新增数量的96.8%,推动着中国经济社会发展和创新市场竞争。大数据行业发展趋势随着产学研用地协同攻关,围绕数据分析的关键算法和共性基础技术研发,以及大规模数据仓库、非关系型数据库、数据存储、数据清洗、数据分析挖掘、数据可视化、信息安全与大数据条件下隐私保护等核心技术研发创新,将逐渐形成以应用需求为牵引的跨学科、跨领域交叉融合的创新方向。数据来源∶2020年大数据产业生态联盟问卷调查,赛迪顾问整理,2020.8大数据技术发展趋势机器学习、数据采集、数据存储、分布式等均为大数据专利技术领域的热门词汇,我国大数据技术创新不断取得突破,这些热门技术分支下的专利申请都是几乎均呈直线上升的状态,以数据分析服务技术为主要代表的大数据技术可以应用在各领域,并呈现全面发展的态势。数据来源∶2020年大数据产业生态联盟问卷调查,赛迪顾问整理,2020.8大数据在社会中的应用从社会领域来说,未来大数据将会更多的和5G以及AI技术相结合,应用在智慧城市和个人生活中。在金融领域中,智能风控、智能监督、智能理赔将会逐渐完善,保证资金投入的回报以及止损。2020年年初,新冠肺炎疫情爆发,给我国带来了社会经济挑战,大数据企业同样面临多重困难,从疫情后大数据细分领域未来机会点与业务预测方面来看,随着大数据技术与人工智能、物联网、5G等新一代信息技术深度融合,大数据在政务、应急管理、交通运输、健康医疗、社会保障等领域应用场景不断丰富。大数据基础2.大数据行业发展大数据行业的挑战大数据的行业应用与基础3.大数据框架大数据国家政策近年来,国家大力倡导“新型智慧城市”建设,其内容涵盖无处不在的惠民服务、透明高效的在线政府、精细精准的城市治理,以及安全可控的运行体系等,这些都与大数据技术和产品紧密相关。国家信息中心发布的《新型智慧城市发展报告2018-2019》明确指出:“我国大量城市已经从新型智慧城市建设的准备期向起步期和成长期过渡,处于起步期和成长期城市从两年前的占比57.7%增长到80%,而处于准备期的城市占比则从42.3%下降到11.6%,许多城市已经开展了大量工作并取得良好成效,工作重心从整体规划向全面落地过渡,新技术应用驱动新发展和新变革,数据关键要素作用初步显现,多规融合应用逐渐普及,惠民服务从“能用”到“好用”不断升级。大数据国家政策从2016年开始,国家发改委、工信部、农业部、水利部等部门,以及地方各级政府都相继推出了促进大数据产业发展的意见和方案,产业整体发展环境持续优化。2016-2017年是大数据相关政策文件出台的高峰期。2020年,工信部发布《关于工业大数据发展的指导意见》,着力打造工业大数据生态。当前,大数据与人工智能、数字经济、智慧城市、数字治理等融合速度加快,推动经济社会数字化转型。数据来源∶2020年大数据产业生态联盟问卷调查,赛迪顾问整理,2020.8大数据的应用领域大数据目前已经广泛应用于社会中的各个行业,在每一个领域都给人们带来便利与帮助,大数据的应用领域具体总结如下。电商领域:淘宝、京东等电商平台利用大数据技术,对用户的信息进行收集与分析,为用户不断推送感兴趣的产品,从而刺激用户的消费行为。政府领域:通过大数据,政府部门可以快速得到和预测社会的发展和变化需求,从而更加科学的、精准的、合理的为市民提供相应的公共服务以及资源配置,实现“智慧城市”在多地的实行。医疗领域:通过大数据对临床数据的对比、实时的数据分析和预测、远程为病人进行就诊等,辅助医生进行临床决策,规范诊疗路径,提高工作效率。大数据的应用领域传媒领域:抖音、快手等新媒体通过收集和分析用户的信息,进行分类筛选,实现对用户需求的准确定位,追踪用户的浏览习惯,不断推送用户感兴趣的内容。安防领域:通过大数据可以实现视频和图像的模糊查询、快速检索、精准定位,能够进一步挖掘视频监控数据背后的价值信息,及时反馈信息辅助用户决策判断。金融领域:通过大数据,银行可以根据用户的年龄、资产规模、理财偏好等,对用户进行精准定位,分析出用户潜在的金融服务需求。电信领域:电信行业本身就拥有庞大的数据,通过大数据技术可以更加快速的进行网络管理、客户关系管理、企业运营管理等。大数据的应用领域教育领域:通过大数据对用户的学习能力分析,为用户建设一个个性化课程,针对用户的学习习惯、知识点掌握程度精准定位。交通领域:通过大数据技术可以预测未来一段时间之内的交通情况,为改善交通状况提供方案,有助于交管部门提高对道路交通的把控能力,缓解或提前预防交通拥堵,为用户提供更加人性化的服务。作业点评1、20人提交,23人未交2、

安装时电脑蓝屏原因:VMware版本问题3、

解决方法:/u013669912/article/details/1404521351.大数据基础2.大数据行业发展3.大数据框架大数据基本架构Hadoop概述Hadoop生态系统华为大数据FusionInsight架构概述数据存储介质的发展1946年世界上第一台计算机ENIAC面世,本质上就是为了替代人力对数据进行计算,数据也就此第一次出现在历史中。1951年—1956年,为了保证数据可以被电子化的存储,磁带+卡片作为第一代存储介质面世,受限于当时的技术,数据被存储之后使用的更多是人力管理的模式。1956年—1961年,磁盘被发明,对于数据的管理也正式进入到了文件管理时代。早期的数据与应用是紧密捆绑在文件中,不分彼此的。数据库技术的发展随着1960年代,IT系统规模和复杂度增大,数据与应用分离的需求开始产生,数据库技术开始萌芽并且蓬勃发展,1990年数据库后逐步统一到以关系型数据库为主导的模式。在1961年到1991年的30年间。GE公司发明了第一个网络模型数据库,但是仅限于GE自己的主机,之后随着数据库技术的市场需求和发展,SQL语言、Oracle关系型数据库和数据仓库也在30年间依次登上历史舞台。分布式计算的发展2001年之后互联网迅速发展,数据量成倍激增,量变引发了质变,并开始对数据关系提出了越来越多的要求。从2003年开始,Google发布了论文第一次介绍了分布式计算,当时的分布式计算主要是为了实现对搜索引擎的功能助力,提升搜索性能。即为Hadoop最早起源的Nutch。Nutch的设计目标是构建一个大型的全网搜索引擎,包括网页抓取、索引、查询等功能,但随着抓取网页数量的增加,遇到了严重的可扩展性问题——如何解决数十亿网页的存储和索引问题。Hadoop的出现2003年、2004年Google发表的三篇论文为该问题提供了可行的解决方案。分布式文件系统(GFS),可用于处理海量网页的存储;分布式计算框架MapReduce,可用于处理海量网页的索引计算问题;分布式的结构化数据存储系统Bigtable,用来处理海量结构化数据。DougCutting基于这三篇论文完成了相应的开源,实现了HDFS和MapReduce,并从Nutch中剥离成为独立项目Hadoop,到2008年1月,Hadoop成为Apache顶级项目(同年,Cloudera公司成立),迎来了它的快速发展期。1.大数据基础2.大数据行业发展3.大数据框架大数据基本架构Hadoop概述Hadoop生态系统华为大数据FusionInsight架构概述4.大数据相关名词与概念解释Hadoop框架组件目前在Hadoop框架中,核心组件共有11个。11个组件从功能上,可以划分为数据获取、数据存储、数据分析与计算三个部分。Hadoop框架组件HDFS:分布式文件系统,主要用于存储和维护文件。HBase:分布式数据库,主要用于存储数据库表格类型数据。MapReduce:分布式离线计算引擎,主要负责对海量数据进行离线长时间计算。Streaming:实时流处理计算技术,主要负责进行实时性低延迟计算。Kafka:消息订阅系统,负责从大数据系统外部引入海量数据。Yarn:分布式资源协调组件,负责为所有的计算引擎分配数据分析和数据挖掘所需的CPU和内存资源。Hadoop框架组件Spark:基于内存的分布式计算引擎,用于对海量数据进行快速低延迟的计算。Hive:分布式数据仓库,主要用于存储历史性的数据,进行基于数据仓库的数据分析或进行历史性数据的归档和查询。Flink:流计算处理和批处理平台,Flink兼备了实时计算和离线计算两种引擎的功能,是目前最常用的大数据计算平台之一。Flume:海量日志聚合平台,在采集日志数据或者数量级较小的数据时使用。ZooKeeper:集群分布式协调服务,在集群出现数据丢失、节点损坏、数据不一致等情况时,Zookeeper负责对集群的一致性和安全性进行保护与协调。1.大数据基础2.大数据行业发展3.大数据框架大数据基本架构Hadoop概述Hadoop生态系统华为大数据FusionInsight架构概述4.大数据相关名词与概念解释FusionInsight产品族概述华为大数据软件系统FusionInsight由以下子产品构成华为大数据平台(FusionInsightHD)华为数据仓库平台(FusionInsightLibrA)(已独立并更新为GaussDB系列产品)华为数据挖掘平台(FusionInsightMiner)华为大数据二次开发平台(FusionInsightFarmer)华为大数据操作运维系统(FusionInsightManager)FusionInsight产品介绍FusionInsightHD:企业级的大数据处理环境,是一个分布式数据处理系统,对外提供大容量的数据存储、分析查询和实时流式数据处理分析能力。是基于Hadoop开源框架的二次开发优化产品。FusionInsightLibrA:企业级的大规模并行处理关系型数据库。(现已独立为华为GaussDB)FusionInsightLibrA采用MPP(MassiveParallelProcessing)架构,支持行存储和列存储,提供PB(Petabyte,2的50次方字节)级别数据量的处理能力。FusionInsight产品介绍FusionInsightMiner:企业级的数据分析平台,基于华为FusionInsightHD的分布式存储和并行计算技术,提供从海量数据中挖掘出价值信息的平台。FusionInsightFarmer:企业级的大数据应用容器,为企业业务提供统一开发、运行和管理的平台。FusionInsightManager:企业级大数据的操作运维系统,提供高可靠、安全、容错、易用的集群管理能力,支持大规模集群的安装部署、监控、告警、用户管理、权限管理、审计、服务管理、健康检查、问题定位、升级和补丁等功能。FusionInsight产品介绍目前的FusionInsight分为以上介绍的几大平台,简洁来说,Miner负责数据分析,搭建在HD之上。HD是底层平台,集成了hadoop生态圈的各大组件,提供了存储和分布式计算的功能。LibrA提供的是并行分布式关系型数据库,做到了数据仓库的功能。Farmer提供的是三方软件开发平台。Manager提供的是对各大组件的管理功能,并且集成在各个组件之中。这几个组件从数据的收集到整合存储再到最后的数据分析,参与了所有的相关工作,后边也会有其他组件参与工作,共同进行协同计算。大数据其他相关概念结构化数据:数据能够以二维表格表示的数据。比如表格数据和文本数据。非结构化数据:数据无法以二维表格表示的数据。比如视频、音频等相关数据。半结构化数据:数据具有一定的结构化特征,但是又不能全部按照结构化数据去表示的数据,比如xml后缀的数据或者网页数据。集群:多台设备在逻辑上整合为一台设备向外提供服务。分布式:将一个业务拆分成多个部分分给多台设备运行讲解了大数据的定义讲解了大数据的处理流程讲解了大数据行业的挑战讲解了大数据的行业应用与基础讲解了大数据的框架结构1.以下哪个不是大数据的4v定义?速度快巨量化价值低价值密度低2.(多选)大数据处理的基础流程包括哪些?A. 数据获取B. 数据存储C. 数据分析D. 数据挖掘

学习推荐华为在线学习:/cn/华为认证-华为人才在线:/cn/talent/#/cert参考资料华为大数据认证:/cn/talent/#/cert/product-details?certifiedProductId=327&authenticationLevel=CTYPE_CARE_HCIA&technicalField=PSC&version=3.0百度百科:/item/谢谢66配色色系表RGB255/187/87RGB250/211/187RGB254/238/193RGB226/243/252RGB190/233/238RGB

153/54/54RGB

242/137/68RGB

253/211/81RGB

129/193/95RGB

86/196/210RGB

127/0/1RGB

237/109/0RGB

52/200/0RGB

98/178/48RGB

48/181/197RGB137/137/137RGB255/255/255RGB89/87/87RGB221/221/221RGB

35/24/21RGB181/181/181大数据软件基础Linux操作系统基础本章主要讲述大数据相关的Linux的基本技术原理通过学习本节将能够学习Linux技术原理。通过本节学习可以掌握:熟悉Linux操作系统的基本操作用户:1.能够登陆操作系统2.不同的用户不同的身份,可以进行很好控制组:方便管理用户,权限分配方面将想要具备相同权限的用户,加入一个组,再给组设置权限

本地用户和组组的分类:基本组附加组(从属组)Linux中一个用户必须至少属于一个组基本组:创建新用户时由linux创建而成并加入,与用户名同名本地用户和组语法格式:useradd选项用户名常用选项:-u自定义用户uiduseradd-uuid用户名示例:创建用户管理员root的uid:永远为0普通用户uid:默认从1000起始系统程序用户UID范围:1-999创建用户-d指定家目录路径(不指定则默认放到/home)useradd-d家目录用户名示例:创建用户-s登录Shell(登录解释器程序,不指定则默认/bin/bash)useradd-s/解释器路径用户名示例:创建用户-G指定附加组(新建用户默认是没有附加组的)useradd-G附加组用户名 #新建用户并加入指定附加组[root@server0~]#useradd-Gstudenttest03创建用户查看用户信息id用户名临时切换用户su-用户名管理用户所有用户基本信息存放在/etc/passwd文件每一个用户占用,一行信息root:x:0:0:root:/root:/bin/bash用户名:密码占位符:UID:基本组的GID:用户的描述信息(可以为空):用户的家目录:解释器所有用户密码存放在/etc/shadowroot:$6$UiGI4Tc2$htsXfYUfS/vBn2JgtdsMjyquqvKAmf1:16261:0:99999:7:::用户名:密码加密字符串:上一次修改密码的时间戳(自1970-1-1到上一次修改密码的时间经过的天数)管理用户交互式密码设置root设置密码passwd用户名普通用户设置密码passwd管理用户非交互式密码设置echo密码|passwd--stdin用户名示例:管理用户usermod选项用户名常用选项-u

用户uid-d

用户家目录,//只会修改/etc/passwd文件中的家目录对应字段,不会

创建相应文件夹作为家目录-s

登录Shell设置用户属性删除用户userdel[选项]用户名选项-r

连同家目录一并删除设置用户属性新建组groupadd[选项]组名示例:groupaddtestgroup管理组/etc/group文件用于存放组信息testgroup:x:1004:test03组名:组的密码占位符:组的gid标识:组的成员列表(可以为空)选项-g

指定组id管理组组管理gpasswd-a用户名组名

#添加用户到组gpasswd-d用户名组名

#从组删除用户删除组groupdel组名示例:groupdeltestgroup管理组ls格式用法:ls[选项][文档路径]作用:列出文档的信息常用选项:-l 以长格式显示,显示详细属性-h 与-l一起用,用易读的单位显示-d 与-l一起用,显示目录本身(而不是内容的)详细属性-A 显示目录的所有的内容,包括以.开头的隐藏文件文档管理常用命令cd格式用法:cd[目录路径]作用:用于切换工作路径常用用法:cd- 命令返回到上一次所处的目录cd.. 命令进入上级目录,以及使用cd~ 命令切换到当前用户的家目录文档管理常用命令. 当前目录.. 父目录(上一层目录)cp格式用法:cp[选项]/源文档路径/目标路径作用:复制文档到目标路径常用命令选项-r:递归,复制目录时必须要有这个选项文档管理常用命令cp命令常见问题及用法:1.

解决复制时询问是否覆盖:示例:文档管理常用命令2.

复制可以支持两个以上的参数永远把最后一个参数作为目标,其他的所有参数都做为源文档示例:(把/etc/fstab和/etc/shadow复制到/opt/)文档管理常用命令3.复制与.连用示例:(将/mnt复制到当前路径下)文档管理常用命令4.复制时可以重新命名cp/etc/redhat-release/opt/abc示例:(将/etc/redhat-release复制到/opt并重命名为abc)文档管理常用命令mv格式用法:mv原文件路径目标路径作用:移动(windows-剪切)常见用法重命名:路径不变的移动示例:文档管理常用命令rm格式用法:rm[选项]文档路径作用:删除文件或目录常用命令选项-r 递归删除(含目录) //递归:目录本身以及目录下所有-f 强制删除(不出现提示,直接删除)注意:删除多级目录时会出现多次提示,可用rm-rf强制删除文档管理常用命令cat格式用法:cat[选项][文件]作用:查看文本内容比较少的文件常用选项-n 给文本加上行序号文档管理常用命令touch格式用法:touch[文件名]作用:创建空白文件示例:文档管理常用命令mkdir格式用法:mkdir[目录名]作用:创建空白的目录常用选项-p 递归创建子文件夹//文档:代表目录和文件文档管理常用命令find格式用法:find搜索路径条件1选项条件2...作用:根据预设的条件递归查找对应的文件常用选项:-a:查找条件为条件1和条件2(多个条件情况下省略默认为-a)-o:查找条件为条件1或条件2(多个条件情况下省略默认为-a)文档管理常用命令-type按类型查找(f文本文件,d目录,l快捷方式)格式:find/路径/目录-typef或d或l-name或-iname(-iname忽略大小写)按名字查找:支持通配符格式:find/路径/目录-name或-iname"文档名"-size按大小查找(+大于,-小于单位kMG)格式:find/路径/目录-szie+或-Nk或M或G##N代表数量文档管理常用命令-user按文档的所有者查找格式:find/路径/目录-user用户名-group按文档的所属组查找格式:find/路径/目录-group所属组-maxdepth限制find的查找深度(最大层数)格式:find......-maxdepth层数文档管理常用命令-exec对查找结果进行处理格式:find......-exec处理命令{}\##{}代表find的每一个查询结果,遇到\;结束示例:文档管理常用命令-mtime按文件修改时间查找-mtime+N 查找N天之前-mtime-N 查找最近N天之内格式:find/路径/目录-mtime+N或-N或N4|<-->|-4+4 |---------------------------><-------------|<------|------|------|------|------|------|------|654321现在文档管理常用命令基本权限的类别访问方式(权限)读取r------read:允许查看内容写入w------write:允许修改内容可执行x----execute:允许运行和切换权限使用对象所有者u------user:拥有此文件/目录的用户所属组g------group:拥有此文件/目录的组其他用户o----other:除所有者,所有组以外的用户文档的权限对于文本文件: r----catlessheadtail w---vim>>> x----Shell脚本可以运行 对于目录:r----ls浏览目录内容w---rm,mv,cp,mkdir,touch等更改目录内容(不包括更改目录本身属性)x----cd切换到此目录文档的权限若对父目录无权限,对子目录及子文件有权限也无意义Linux中如何判断用户权限:第一步:判断用户的角色判断优先级:所有者>所属组>其他用户遵循'匹配及停止'原则(一旦匹配到了即停止,不会再判断低优先级的角色关系)文档的权限第二步:判断文档的权限归属关系[root@server0~]#ls-ld/testdir/d---r--rwx.2studentroot238月711:11/testdir/#student为所有者,权限为---,反而其他用户权限更高为rwx第二步:查看相应权限位置的权限设置文档的权限所有普通用户无法运行chmod命令只有管理员root才能运行设置基本权限格式:chmod归属关系+或-或=权限类别/文档chmodo+w/test #为其他用户o添加写入权限wchmodu-w/test #为所有者u删除写入权限wchmodg=---/test #把所属组g权限设置为无---chmodu=r/test #把所有者u权限设置为只读rchmodugo=rwx/test #把ugo权限都设置为rwxchmodu-x,g-x,o-x/test #为所有者u所属组g其他用户o删除可执行权限chmodugo-x/test #为所有者u所属组g其他用户o删除可执行权限chmodu=rwx,g=rx,o=-/test #设置文档权限为rwxr-x---文档的权限常用选项-R

递归设置(包含目录本身及目录下所有文档一起设置权限)示例:文档的权限chown所有者/文档 #更改文档所有者chown:所属组/文档 #更改文档所属组chown所有者:所属组/文档 #同时更改文档所有者及所属组选项-R:递归设置(包含目录本身及目录下所有文档一起设置文档归属)文档的权限管理员root的拷贝cp会把拷贝的复制品文档所有者及所属组变为root使用vim创建或修改文件vim文本编辑器格式:vim/目录/文件名若目标文件不存在,则新建空文件并编辑若目标文件已存在,则打开此文件并编辑vim模式:命令模式,输入模式(插入模式或编辑模式),末行模式VIM编辑工具的使用[root@localhost/]#vim/root/test.txti键命--------------------->输入模式(按Esc键回到命令模式)令模式--------------------->末行模式(按Esc键回到命令模式):键VIM编辑工具的使用末行模式:wq 保存并退出末行模式:q! 强制不保存并退出查看:VIM编辑工具的使用<命令模式>1.移动光标:键盘上下左右键、Home键、End键2.行间跳转:到全文的第一行(1G或gg)、到全文的最后一行(G)、到全文的第10行(10G)3.复制、粘贴:复制1行(yy)、复制3行(3yy)粘贴到光标之后(小写p)粘贴到光标之后(大写P)VIM编辑器高级使用技巧4.删除(实际为剪切):删除单个字符(x或Delete)删除到行首(d^)、删除到行尾(d$)删除1行(dd)、删除3行(3dd)5.查找关键词:搜索(/word)切换结果(n、N)6.撤销操作:撤销最近的一次操作(u)取消前一次撤销操作Ctrl+rVIM编辑器高级使用技巧命令模式进入插入模式几种不同的快捷键:C(大写) 可以删除光标之后,并且进入插入模式i 跳到光标所在字符前进入插入模式a 跳到光标所在字符后进入插入模式s 删除光标所在字符并进入插入模式o 跳到光标所在行的后一行并进入插入模式VIM编辑器高级使用技巧<末行模式>1.保存/退出文件操作:保存当前文件(:w),放弃编辑并退出(:q!),保存并退出(:wq)2.字符串替换:替换当前行第一个'old'(:s/old/new)替换当前行所有的'old'(:s/old/new/g)替换第n-m行所有的'old'(:n,ms/old/new/g)替换全文所有的'old'(:%s/old/new/g)VIM编辑器高级使用技巧3.开关参数的控制:显示行号(:setnu)关闭显示行号(:setnonu)VIM编辑器高级使用技巧讲解了Linux操作系统的基本操作学习推荐华为在线学习:/cn/华为认证-华为人才在线:/cn/talent/#/cert参考资料华为大数据认证:/cn/talent/#/cert/product-details?certifiedProductId=327&authenticationLevel=CTYPE_CARE_HCIA&technicalField=PSC&version=3.0百度百科:/item/谢谢122配色色系表RGB255/187/87RGB250/211/187RGB254/238/193RGB226/243/252RGB190/233/238RGB

153/54/54RGB

242/137/68RGB

253/211/81RGB

129/193/95RGB

86/196/210RGB

127/0/1RGB

237/109/0RGB

52/200/0RGB

98/178/48RGB

48/181/197RGB137/137/137RGB255/255/255RGB89/87/87RGB221/221/221RGB

35/24/21RGB181/181/181第3章Flume轻量日志采集工具本章主要讲述Flume的基本技术原理通过学习本节将能够学习Flume轻量日志采集组件的架构原理。通过本节学习可以:Flume定义和概述Flume组件原理Flume高级特性Flume定义和概述Flume组件原理Flume高级特性Flume是什么?Flume是流式日志采集工具,Flume提供对数据进行简单处理并且写到各种数据接受方(可定制)的能力,Flume提供从本地文件(spooldirectorysource)、实时日志(taildir、exec)、REST消息、Thrift、Avro、Syslog、Kafka等数据源上收集数据的能力。Flume适用环境Flume适用于应用系统产生的日志采集,采集后的数据供上层应用分析。Flume不适用于大量数据的实时数据采集(要求低延迟、高吞吐率)。与其他开源日志收集工具scribe比较而言,Flume几乎不用用户开发,scribe需要用户另外开发client,而Flume每一种数据源均有相应的source去读取或者接收数据。Flume适用环境适用环境:提供从固定目录下采集日志信息到目的地(HDFS,HBase,Kafka)能力。提供实时采集日志信息(taildir)到目的地的能力。Flume支持级联(多个Flume对接起来),合并数据的能力。同时支持按照用户定制采集数据的能力。Flume定义和概述Flume组件原理Flume高级特性Flume的外部结构数据发生器(如:facebook,twitter)产生的数据被单个的运行在数据发生器所在服务器上的agent所收集,之后数据收容器从各个agent(客户端,数据的实际产生单位)上汇集数据并将采集到的数据存入到HDFS或者HBase中Flume事件事件(event)作为Flume内部数据传输的最基本单元.它是由一个转载数据的字节数组和一个可选头部构成。典型的Flume事件如下面结构所示:event将传输的数据进行封装,如果是文本文件,通常是一行记录,event也是事务的基本单位。FlumeAgentFlume内部有一个或者多个Agent,然而对于每一个Agent来说,它就是一独立的守护进程(JVM)。它从客户端接收、收集数据,或者从其他的Agent接收数据,然后迅速的将获取的数据传给下一个目的节点sink或者其他下游agent。Agent主要由三部分构成:Source、Channel和Sink,如图所示:FlumeSourceSource负责接收events或通过特殊机制产生events,并将events批量放到一个或多个Channels。有驱动和轮询2种类型的Source。驱动型source:是外部主动发送数据给Flume,驱动Flume接受数据。轮询source:是Flume周期性主动去获取数据。Source必须至少和一个channel关联。FlumeChannelChannel位于Source和Sink之间,Channel的作用类似队列,用于临时缓存进来的events,当Sink成功地将events发送到下一跳的channel或最终目的,events从Channel移除。不同的Channel提供的持久化水平也是不一样的:MemoryChannel:不会持久化。FileChannel:基于WAL(预写式日志Write-AheadLog)实现。JDBCChannel:基于嵌入式Database实现。Sink负责将events传输到下一跳或最终目的,成功完成后将events从channel移除。Sink必须作用于一个确切的channel。Sink

Flume定义和概述Flume组件原理Flume高级特性Flume支持采集日志文件Flume支持将集群外的日志文件采集并归档到HDFS、HBase、Kafka上,供上层应用对数据分析、清洗数据使用。Flume支持多级级联和多路复制Flume支持将多个Flume级联起来,同时级联节点内部支持数据复制。Flume级联消息压缩加密Flume级联节点之间的数据传输支持压缩和加密,提升数据传输效率和安全性。Flume数据监控Flumesource接受数据量、channel缓存数据量、sink写入数据量,通过Manager图形化呈现监控指标。支持Channel缓存、数据发送、接收失败告警。Flume传输可靠性Flume在传输数据过程中,采用事务管理方式,保证传输过程中数据不会丢失,增强了数据传输的可靠性,同时缓存在channel中的数据如果采用filechannel,进程或者节点重启数据不会丢失。请简述Flume的适用场景?请简述Flume的数据处理流程?讲解了Flume的相关高级特性

(多选)以下哪些选项是Flume支持的监控指标?数据量channel缓存数据量sink写入数据量总处理数据量2.以下哪个选项不是Flume的channel类型?A. MemoryChannelB. JDBCChannelC. HDFSChannelFileChannel描述了Flume定义和概述介绍了Flume组件原理讲解了Flume高级特性学习推荐华为在线学习:/cn/华为认证-华为人才在线:/cn/talent/#/cert参考资料华为大数据认证:/cn/talent/#/cert/product-details?certifiedProductId=327&authenticationLevel=CTYPE_CARE_HCIA&technicalField=PSC&version=3.0百度百科:/item/谢谢148配色色系表RGB255/187/87RGB250/211/187RGB254/238/193RGB226/243/252RGB190/233/238RGB

153/54/54RGB

242/137/68RGB

253/211/81RGB

129/193/95RGB

86/196/210RGB

127/0/1RGB

237/109/0RGB

52/200/0RGB

98/178/48RGB

48/181/197RGB137/137/137RGB255/255/255RGB89/87/87RGB221/221/221RGB

35/24/21RGB181/181/181第3章Kafka消息订阅系统本章主要讲述Kafka消息订阅系统的基本技术原理通过学习本节将能够学习Kafka消息订阅系统的架构原理。通过本节学习可以:Kafka的定义和特点Kafka核心组件与特性Kafka高级功能概述Kafka简介Kafka核心组件与特性Kafka高级功能概述Kafka是一个高吞吐、分布式、基于发布订阅的消息系统,利用Kafka技术可在廉价PCServer上搭建起大规模消息系统。Kafka和其他组件比较,具有消息持久化、高吞吐、分布式、多客户端支持、实时等特性,适用于离线和在线的消息消费,如常规的消息收集、网站活性跟踪、聚合统计系统运营数据(监控数据)、日志收集等大量数据的互联网服务的数据收集场景。Kafka介绍消费者组(Consumergroup):各个consumer可以组成一个组,每个消息只能被组中的一个consumer消费,如果一个消息可以被多个consumer消费的话,那么这些consumer必须在不同的组。消息状态:在Kafka中,消息的状态被保存在consumer中,broker不会关心哪个消息被消费了被谁消费了,只记录一个offset值(指向partition中下一个要被消费的消息位置),这就意味着如果consumer处理不好的话,broker上的一个消息可能会被消费多次。消息持久化:Kafka中会把消息持久化到本地文件系统中,并且保持极高的效率。Kafka设计思想消息有效期:Kafka会长久保留其中的消息,以便consumer可以多次消费,当然其中很多细节是可配置的。批量发送:Kafka支持以消息集合为单位进行批量发送,以提高push效率。数据推送与抽取(push-and-pull):Kafka中的Producer和consumer采用的是push-and-pull模式,即Producer只管向brokerpush消息,consumer只管从brokerpull消息,两者对消息的生产和消费是异步的。Kafka设计思想

Kafka应用场景简介Kafka和其他组件比较,具有消息持久化、高吞吐、分布式、多客户端支持、实时等特性,适用于离线和在线的消息消费,如常规的消息收集、网站活性跟踪、聚合统计系统运营数据(监控数据)、日志收集等大量数据的互联网服务的数据收集场景。Kafka特点Kafka简介Kafka核心组件与特性Kafka高级功能概述Broker:Kafka集群包含一个或多个服务实例,这些服务实例被称为Broker。Topic:每条发布到Kafka集群的消息都有一个类别,这个类别被称为Topic。Partition:Kafka将Topic分成一个或者多个Partition,每个Partition在物理上对应一个文件夹,该文件夹下存储这个Partition的所有消息。Producer:负责发布消息到KafkaBroker。Consumer:消息消费者,从KafkaBroker读取消息的客户端。ConsumerGroup:每个Consumer属于一个特定的ConsumerGroupKafka基本概念Kafka拓扑图每条发布到Kafka的消息都有一个类别,这个类别被称为Topic,也可以理解为一个存储消息的队列。KafkaTopics每个Topic都有一个或者多个Partitions构成。每个Partition都是有序且不可变的消息队列。引入Partition机制,保证了Kafka的高吞吐能力。KafkaPartitionTopic的Partition数量可以在创建时配置。Partition数量决定了每个Consumergroup中并发消费者的最大数量。ConsumergroupA有两个消费者来读取4个Partition中数据;ConsumergroupB有四个消费者来读取4个partition中数据。KafkaPartition任何发布到此Partition的消息都会被直接追加到log文件的尾部。每条消息在文件中的位置称为offset(偏移量),offset是一个long型数字,它唯一标记一条消息。消费者通过(offset、partition、topic)跟踪记录。KafkaPartitionoffset副本以分区为单位。每个分区都有各自的主副本和从副本。主副本叫做Leader,从副本叫做Follower,处于同步状态的副本叫做In-SyncReplicas(ISR)。Follower通过拉取的方式从Leader中同步数据。消费者和生产者都是从Leader中读写数据,不与Follower交互。KafkaPartitionReplicasKafka简介Kafka核心组件与特性Kafka高级功能概述为了使得Kafka的吞吐率可以线性提高,Kafka物理上把Topic分成一个或多个Partition,每个Partition在物理上对应一个文件夹,该文件夹下存储这个Partition的所有消息和索引文件。Kafka把Topic中一个Parition大文件分成多个小文件段,通过多个小文件段,就容易定期清除或删除已经消费完文件,减少磁盘占用。Kafka-logs写数据总体流程:Producer连接任意存活的Broker,请求制定Topic、Partition的Leader元数据信息,然后直接与对应的Broker直接连接,发布数据。开放分区接口。用户可以制定分区函数,使得消息可以根据Key,发送到特定Partition。Kafka写数据Consumer连接指定TopicPartition所在的LeaderBroker,用主动获取方式从Kafka中获取消息。Kafka读数据KafkaClusterMirroring是Kafka跨集群数据同步方案,通过Kafka内置的MirrorMaker工具来实现。源集群向目标集群同步数据,需要目标集群建立一个MirrorMaster进程,该进程中有两个子进程,分别为consumer和producer,其中consumer从源集群中进行数据的读取工作,然后再通过producer进程将数据转存到目标集群的Broker进程中进行存储。相当于有一个同步进程来进行一个数据的转入转出的操作,那么转入转出还是使用的原本的Kafka进程中的读取和写出进程。KafkaClusterMirroring请简述Kafka的适用场景?请简述Topic、Partation、Message的关系?请简述Offset的作用?请简述Kafka日志的作用?

以下那个选项不是Kafka的特点?造价昂贵高吞吐分布式基于发布订阅2.(多选)TopicPartition在Kafka中是并发单元,通过设置Partition数量,Kafka提供高吞吐量,以下描述正确的是:()A. Partition越多,吞吐量越高桶策略B. Partition越多,打开的文件句柄越多C. Partition越多,不可用性增加D. Partition越多,端到端时延可能增加E. Partition越多,客户端内存需要越多

描述了Kafka的定义和特点讲解了Kafka核心组件与特性讲解了Kafka高级功能概述学习推荐华为在线学习:/cn/华为认证-华为人才在线:/cn/talent/#/cert参考资料华为大数据认证:/cn/talent/#/cert/product-details?certifiedProductId=327&authenticationLevel=CTYPE_CARE_HCIA&technicalField=PSC&version=3.0百度百科:/item/谢谢175第4章HDFS分布式文件系统前言本章主要讲述HDFS分布式文件系统的基本技术原理单击此处添加标题通过学习本节将能够学习HDFS分布式文件系统架构原理。01本节概述HDFS技术介绍HDFS架构设计HDFS数据保护机制熟悉华为云服务中OBS产品HDFS数据组织HDFS数据存储策略02学习目标目录01HDFS技术介绍02HDFS架构设计03HDFS数据保护机制04HDFS数据组织05HDFS数据存储策略文件系统相关介绍文件名:在文件系统中,文件名是用于定位存储位置。0201文件系统定义:文件系统是一种存储和组织计算机数据的方法,它使得对数据访问和查找变得容易。数据块(Block):存储文件的最小单元。对存储介质划分了固定的区域,使用时按这些区域分配使用。0403元数据(Metadata):保存文件属性的数据,如文件名,文件长度,文件所属用户组,文件存储位置等。元数据(补充)1.文件和目录自身的属性信息,

例如文件名、目录名、父目录信息、文件大小、创建时间、修改时间等。2.记录文件内容存储相关信息,

例如文件分块情况、副本个数、每个副本所在的DataNode信息等。3.用于记录HDFS中所有DataNode的信息,

实现对DataNode的管理。从类型上讲,元数据有三类重要信息:1.NameNode的本地磁盘文件:元数据镜像文件(fsimage):保存文件系统的完整元数据快照。元数据操作日志文件(edits):记录所有对文件系统的修改操作。2.DataNode的上报信息:DataNode定期向NameNode汇报自身存储的block信息及状态。从来源上讲,元数据主要来源于以下两部分:文件系统相关介绍文件系统相关介绍分布式文件系统分布式文件系统把文件分布存储到多个计算机节点上,成千上万的计算机节点构成计算机集群。目前的分布式文件系统所采用的计算机集群都是普通硬件构成,这大大降低了硬件开销。定义:分布式文件系统(DistributedFileSystem)是一种通过网络实现文件在多台主机上进行分布式存储的文件系统。HDFS简介HDFS(HadoopDistributedFileSystem)是运行在通用硬件(所谓通用硬件就是指软件对于底层的硬件平台的配置和设备没有需求,可以随意搭建并且兼容)上的分布式文件系统。HDFS简介

流式数据:

又称为流数据,是一组

顺序、大量、快速、连续到

达的数据序列。HDFS支持的主要是大文件流数据,对于离散的小文件支持性较弱,尤其是对延迟比较敏感的应用,由于HDFS要支持高吞吐量,所以势必要以牺牲延迟作为代价。HDFS适合做什么?

大文件存储、流式数据访问HDFS不适合做什么?

大量小文件、随机写入、低延迟读取问题:HDFS简介系统设计目标1HDFS简介系统设计目标2作业点评1、30人提交,14人未交2、本地机向虚拟机传送软件,放置目录不对/root,应该为/opt。3

、网络配置问题。4、对mkdir,cd,ls,vi等命令使用不熟悉,命令与路径之间要空格5、很多同学没有安装完成Hadoop软件。HDFS应用场景HDFS是Hadoop技术框架中的分布式文件系统,对部署在多台独立物理机器上的文件进行管理。HDFS可应用于以下几种场景:公安、政府部门、事业单位数据网站用户行为数据存储气象数据存储目录01HDFS技术介绍02HDFS架构设计03HDFS数据保护机制04HDFS数据组织05HDFS数据存储策略HDFS组件构成——HDFS在FusionInsight产品的位置HDFS组件构成

在大数据的组件架构中,HDFS提供的是整个结构最底层的文件存储功能,它组织了文件形式,将数据切分为数据块存储起来,并且记载和维护元数据。HDFS分为三个组件:Namenode,Datanode,ClientNameNodeNamenode用于存储生成元数据。

该进程是由HDFS调入到内存中运行的。NameNode作为元数据的维护进程,为了能够提升整体读取的效率,将元数据的维护进程搭载在内存中进行运行,但是内存中的数据是易失的,只能用于元数据的使用,所以元数据还是需要在DataNode中进行存储。

当系统启动之后,服务器会拉起HDFS进程,然后NameNode加载到内存中,然后NameNode会加载元数据镜像文件到自身内存中。

Datanode用于存储实际的数据,每个Datanode会将自己维护的数据块信息上报到Namenode,运行多个实例。

HDFS默认最小的存储空间为block,每个block默认的大小为128MB。DataNode除了需要维护数据之外,还需要留有一部分的空间用于存储元数据镜像文件Fsimage。

如果NameNode和DataNode是部署在一起的,那么Fsimage就在DataNode上,其实相当于是在服务器的存储介质上。

如果NameNode和DataNode是分开部署的,那么就相当于Fsimage是存储在部署NameNode的服务器上的。如图所示:DataNodeClient

支持业务访问HDFS,并从Namenode和Datanode中获取数据,返回给用户。多个业务和实例一起运行。

这里所说的Client并不是指实际的用户应用,而是HDFS本身自带的进程,通过该进程可以访问HDFS。相当于HDFS是一间房,Client提供了进入的门,Client提供的接口主要有JDBC和ODBC接口。HDFS技术介绍HDFS架构设计HDFS数据保护机制HDFS数据组织HDFS数据存储策略HDFS的高可靠性(HA)架构在基本架构上增加了以下组件:ZooKeeper分布式协调,主要用来存储HA下的状态文件,主备信息。ZK个数建议3个及以上且为奇数个。NameNode主备NameNode主备模式,主提供服务,备合并元数据并作为主的热备。ZKFCZKFC(ZooKeeperFailoverController)用于控制NameNode节点的主备状态。JNJN(JournalNode)用于共享存储NameNode生成的Editlog。HDFS高可靠性(HA)HDFS高可靠性(HA)第四周作业点评1、30人提交,13人未交2、提交的同学有一部分同学是没做完的数据副本机制第一个副本在本地机器第二个副本在远端机架的节点第三个选择和第一个副本相同机架的不同节点第四个及以上,随机选择副本存放位置。副本放置策略:Distance(Rack1/D1,Rack1/D1)=0同一台服务器的距离为0Distance(Rack1/D1,Rack1/D3)=2同一机架不同的服务器距离为2Distance(Rack1/D1,Rack2/D1)=4不同机架的服务器距离为4副本距离计算公式:元数据持久化元数据持久化健壮机制HDFS技术介绍HDFS架构设计HDFS数据保护机制HDFS数据组织HDFS数据存储策略HDFS数据写流程HDFS数据写流程HDFS数据写流程HDFS数据读流程HDFS数据读流程HDFS数据读流程提交情况:34人提交,10人未交,满分7人未做完要求的所有实验部分指令不熟悉部分同学态度不端正存在问题:第五周课后

作业点评HDFS技术介绍HDFS架构设计HDFS数据保护机制HDFS数据组织HDFS数据存储策略配置HDFS数据存储策略01默认情况下,HDFSNameNode自动选择DataNode保存数据的副本。02DataNode上存在不同的存储设备,

数据需要选择一个合适的存储设备分级存储数据。DataNode不同目录中的数据重要程度不同,数据需要根据目录标签选择一个合适的DataNode节点保存DataNode集群使用了异构服务器,关键数据需要保存在具有高度可靠性的节点组中。在实际业务中,存在以下场景:一、配置HDFS数据存储策略-分级存储HDFS的异构分级存储框架提供以下四种存储介质RAM_DISK(内存虚拟硬盘)DISK(机械硬盘)ARCHIVE(高密度低成本存储介质)SSD(固态硬盘)四种存储类型的存储设备配置DataNode使用分级存储:01配置HDFS数据存储策略-分级存储策略ID名称Block放置位置(副本数)备选存储策略副本的备选存储策略15LAZY_PERSISTRAM_DISK:1,DISK:n-1DISKDISK12All_SSDSSD:nDISKDISK

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

最新文档

评论

0/150

提交评论