大数据存储技术课标教案_第1页
大数据存储技术课标教案_第2页
大数据存储技术课标教案_第3页
大数据存储技术课标教案_第4页
大数据存储技术课标教案_第5页
已阅读5页,还剩169页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

《大数据存储技术》课程标准所属专业(教研组):大数据技术执笔人:专业(教研组)审核:二级学院(部)审核:制订日期:2025年9月10日修订日期:教务处(实训中心)制二〇二四年九月

《大数据存储技术》课程标准一、课程信息表1课程信息表课程名称大数据存储技术开课学院人工智能学院课程代码701220100考核性质必修/考试前导课程Hadoop应用基础后续课程大数据分析总学时48课程类型1理实一体化适用专业大数据技术推荐教材注1:课程类型包括(理论课、实践课、理实一体化)表2课程标准开发团队名单2序号姓名单位职称/职务1234注2:指参与课程标准制订的主要成员,包括校外专家。二、课程性质本课程是大数据技术专业开设的一门专业核心课,是在学习Linux操作系统,数据库相关课程的基础上,开设的一门理实一体化的课程,其功能是对接专业人才培养目标,面向大数据应用开发工程师、大数据采集处理工程师工作岗位,培养学生的学习能力以及掌握Hadoop、HDFS、Mapreduce、数据仓库Hive、分布式数据库Hbase、Sqoop,为后续课程学习衔接过渡的专业核心课程。三、课程功能表3课程功能定位分析对接的工作岗位对接培养的职业岗位能力大数据应用与维护人员、大数据技术服务人员1、具有大型数据库的应用和维护能力;2、具有大数据系统的运维能力;3、具有数据分析与处理能力;4、具有一定的客户交流和沟通能力;5、熟悉分布式存储和数据库技术;6、熟悉Linux操作系统大数据采集处理人员1、熟悉使用Kettel、informatic等主流ETL工具;2、掌握大数据采集工具(Flume等);3、握爬虫系统技术架构设计、重构、优化,不断增强爬虫系统的性能和功能,解决反爬问题;四、课程目标1.课程总目标围绕学校职业类人才培养目标,本课程以“工学结合”为核心教学理念,聚焦Hadoop生态核心技术(包括HDFS、MapReduce、Hive、HBase、Sqoop等)开展教学,搭配章节练习、课后实操与电商会员分析等综合案例,帮助学生掌握大数据存储、处理与分析的关键知识和实用能力,同时培养学生的实践操作、问题调试及协作沟通能力,为后续大数据相关职业岗位应用奠定基础。2.课程具体目标本课程具体目标涵盖三方面:知识层面,学生需理解Hadoop生态组件原理,明晰Hive数据表类型、HBase数据模型,掌握HiveQL、Sqoop数据迁移的理论逻辑;技能层面,学生需能独立搭建Linux虚拟机及Hadoop、Hive等环境,熟练操作HDFS、编写MapReduce程序,用HiveQL、Sqoop处理数据,完成电商会员分析项目;素质层面,培养学生严谨实操习惯、问题排查能力与协作意识,树立“学以致用”的职业素养,适配大数据岗位需求。表4课程教学目标序号毕业能力要求知识目标技能目标素质目标1能够熟练掌握大数据基础架构平台及相关生态框架掌握大数据特征和常见大数据平台理论知识能够进行大数据工具下载安装具备寻找素材能力2能够熟练掌握主流数据库的安装及配置了解主流数据库的基础知识,熟悉SQL语句编写相关知识能够进行主流数据库的安装及配置能够分析学习中的问题并解决问题3能够熟悉大数据周边相关的数据库系统,关系型数据库MYSQL和NoSQL熟悉了解MYSQL、Hbase的使用相关知识能够安装卸载MYSQL数据库、能够进行常见的DDL、DML、SQL操作以及Hbase的数据存储和操作能够分析学习中的问题并解决问题4能够熟悉分布式系统开发,数据仓库技术掌握分布式系统HDFS和Hive的使用方法具备HDFSSHELL和HDFSAPI操作、Hive数据操作及调优技能具有追寻源码并分析的意识5能够进行数据仓库数据流监控、故障自动化定位及运维熟练掌握数据仓库Hive的数据原理相关知识能够进行数据的导入导出、数据模型操作等技能能够分析问题、解决问题,具有团队协作意识五、课程内容表5课程教学内容序号模块(项目)3知识内容及要求技能内容及要求学时1项目一大数据存储技术1.数据仓库介绍2.NoSQL数据库介绍1.能够理解数据仓库的基本概念,掌握数据仓库的应用场景2.能够理解NoSQL数据库的基本概念,掌握NoSQL数据库的应用场景42项目二Hadoop基础介绍1.Hadoop介绍2.创建Linux虚拟机3.Hadoop伪分布式环境的搭建1.能够通过VMware创建Linux虚拟机以满足项目基础环境需求。2.能够搭建Hadoop伪分布式环境43项目三HDFS操作与MapReduce基础HDFS分布式文件系统Mapreduce分布式计算框架HDFS操作MapReduce编程1.能够通过HDFS的操作命令完成项目需求2.能够编写基本的MapReduce程序,并对程序出现的简单错误进行调试44项目四Hive基础介绍Hive介绍Hive安装Hive数据库表的操作1.能够独立完成Hive环境准备及Hive的安装2.能够通过HiveQL语句实现对数据库表的操作45项目五Hive数据类型Hive原始数据类型Hive复杂数据类型能够灵活掌握Hive不同数据类型的操作46项目六Hive表操作内部表外部表分区表分桶表1.能够通过HiveQL语句实现内部表与外部表的操作2.能够通过HiveQL语句实现分区表与分桶表的操作47项目七Hive数据操作1.数据操作2.数据导出3.数据导入1.能够实现Hive数据表的数据导入2.能够实现Hive数据表的数据导出48项目八HiveQL语句1.Hive的QL语句2.HiveQL函数3.掌握HiveJDBC操作1.能够灵活使用HiveQL语句2.能够通过JDBC操作Hive表49项目九HBase基础介绍1.HBase简介2.HBase数据模型3.HBase的安装与配置1.能够独立完成HBase环境的安装与启动2.能够配置HBase关键文件并验证其有效3.能够使用HBaseShell执行基本操作410项目十HBase操作1.HBase基本操作2.HBaseShell3.HBaseJavaAPI1.能够熟练运用HBaseShell常见命令进行操作2.能够通过JavaAPI方式操作HBase411项目十一Sqoop基础介绍Sqoop介绍Sqoop安装3.Sqoop操作1.能够安装Sqoop并进行环境配置2.能够通过Sqoop命令实现数据转换412项目十二综合应用——电商会员分析1.Sqoop在项目中的应用2.Hive在项目中的应用1.能够独立完成使用Sqoop获取数据的过程2.能够通过HiveQL语句进行业务分析4六、课程实施1.理论教学要求本课程理论学时为20,要求学生理解数据仓库、NoSQL数据库及Hadoop生态核心概念,掌握HDFS、MapReduce工作机制,熟悉Hive、HBase、Sqoop的核心原理与应用逻辑,明晰各类数据类型、表类型特性及相关操作的理论基础,为实践应用奠定理论支撑,培养学生大数据技术和应用的知识与素养。2.实践教学要求表6实践教学内容安排序号实训项目相关内容培养能力要求学时1实验1:基于VMware创建CentOS7虚拟机使用VMware创建CentOS7虚拟机,配置网络掌握虚拟机创建及系统初始化能力22实验2:Hadoop环境搭建配置环境变量与核心文件具备Hadoop环境搭建与调试能力23实验3:HDFS的操作命令学习HDFS常用命令,进行文件上传、下载等操作掌握HDFS文件系统管理能力14实验4:第一个MapReduce程序WordCount编写、运行WordCount程序,理解MapReduce原理具备MapReduce程序开发基础能力25实验5:Hive安装在Hadoop环境下安装配置Hive及MySQLmetastore掌握Hive部署与环境配置能力16实验6:Hive数据库操作通过HiveShell创建、删除数据库及设置属性具备Hive数据库管理操作能力0.57实验7:Hive数据表操作在Hive中创建、修改、删除数据表及管理表结构掌握Hive数据表定义与维护能力0.58实验8:Hive原始数据类型应用应用Hive原始数据类型设计表并插入查询数据具备Hive基础数据类型使用能力19实验9:Hive复杂数据类型应用使用Hive数组、映射等复杂类型处理数据掌握Hive复杂数据类型应用能力110实验10:Hive内部表与外部表创建Hive内部表与外部表,比较两者特性差异具备区分及使用两种表的能力111实验11:Hive分区表创建Hive分区表,实现数据按分区查询与管理掌握分区表设计与操作能力112实验12:Hive分桶表配置Hive分桶表,实现数据哈希分桶与抽样具备分桶表创建与应用能力113实验13:Hive数据操作在Hive中进行数据加载、插入、更新、删除操作掌握Hive数据操纵能力114实验14:HiveQL语句编写HiveQL查询语句,实现数据统计与分析具备HiveSQL查询开发能力115实验15:HiveJDBC操作通过JDBC连接Hive,编写Java程序操作数据具备HiveJDBC编程能力216实验16:HBase安装在集群环境中安装配置HBase,设置相关参数掌握HBase分布式部署能力217实验17:HBaseShell操作使用HBaseShell命令管理表与增删改查数据具备HBaseShell操作能力118实验18:HBaseJavaAPI编写Java程序调用HBaseAPI操作数据具备HBaseJava编程开发能力119实验19:Sqoop安装安装配置Sqoop,测试与Hadoop、关系库连接掌握Sqoop环境搭建能力120实验20:Sqoop应用使用Sqoop实现HDFS与关系数据库数据互导具备Sqoop数据迁移应用能力121实验21:Sqoop会员数据采集通过Sqoop采集会员数据到Hadoop生态系统具备业务数据采集实战能力222实验22:会员信息分析基于采集的会员数据进行多维度统计分析具备大数据分析与解读能力2表7校内实训条件要求实训室名称大数据综合实训室面积要求至少100平方序号核心设备数量要求备注1PC机502教师机13课程平台和软件环境50+1表8校外实训条件要求序号校外实习基地名称合作企业名称用途合作深度要求12注4:指认知实践、顶岗实习、毕业实习等3.考核评价要求本课程的考核采用线上和线下、过程性评价与终结性评价相结合的多元化课程评价体系。以课程学习过程中的作业情况、操作完成以及课堂学习情况结合期末上机实操考试给予综合评定。课程考核采用过程性考核和终结性考试相结合。最终成绩=考勤(10%)+课堂表现(10%)+作业(40%)+期末考试(40%)。七、其他1.课程思政要求本课程主要介绍数据仓库相关大数据存储知识,学生在掌握课程任务的基础上,可以继续深入,系统的梳理数据库、大数据周边数据库以及数据仓库相关理论知识,系统全面的了解数据存储,除此之外可以尝试考取阿里云、华为等大数据相关资格认证,拓宽就业面,为大数据技术专业培养“互联网+”时代“数字工匠”奠定基础。2.信息化教学要求本课程为西普大数据教学平台课程,为全国几百家高校大数据专业或方向提供的配套课程,学习过程按周次划分,充分利用课程平台开展“互联网+”教学,详细记录每一个学习者的每一个学习过程,并作为考核依据。

大数据存储技术课程教案一、核心要素章节名称项目一大数据存储教学课时授课班级授课时间授课地点教学目标知识目标了解大数据存储的基本特点。掌握数据仓库的基本概念。掌握NoSQL数据库的基本概念。能力目标能够理解数据仓库的基本概念,掌握数据仓库的应用场景。能够理解NoSQL数据库的基本概念,掌握NoSQL数据库的应用场景。素质目标培养学生良好的学习态度和学习习惯。培养学生的团队合作精神和精益求精的专业精神。培养学生的敬业、精益、专注、创新等方面的“工匠精神”。教学内容主要内容围绕大数据存储展开,先介绍项目背景(含大数据存储与传统数据库对比、大数据存储技术路线及分布式存储等方式)与项目目标,再详细讲解数据仓库(概念、构建、特点、与数据库区别及应用场景)和NoSQL数据库(概念、优缺点、基本原理、常见存储结构类型、适用场景及关键技术)重点1.清晰区分大数据存储与传统数据库的差异,掌握大数据存储的主要方式2.理解数据仓库的概念、架构分层、核心特点,以及其与数据库的本质区别3.掌握NoSQL数据库的概念、优缺点、常见存储结构类型及适用场景难点准确把握NoSQL数据库“无关系性”的本质,以及不同存储结构类型(如列存储、文档存储)的适用场景差异。教法改革教学方法采用“讲解+提问互动”结合的方法,教师通过系统讲解核心知识搭建框架,穿插提问引发学生思考,同时结合表格对比(如大数据存储与传统数据库、数据库与数据仓库)帮助学生梳理知识,强化理解教学手段(1)通过课堂讨论提出问题和相关视频学习,活跃课堂气氛并激发学生的学习兴趣;(2)教材、电子课件、超星信息化教学。教学反思需关注学生对数据仓库架构分层、NoSQL数据库不同存储类型适用场景的理解程度,后续可增加简单案例分析或小组讨论环节,让学生主动应用知识,进一步检验学习效果;同时,可通过课后小测,针对难点内容(如数据仓库分层逻辑)强化巩固,提升教学针对性。二、教学设计教学步骤教学内容与情境设计教师活动学生活动时间分配导入新课随着信息时代的发展,数据呈现爆炸式增长,而如何最大化地发挥数据的作用,从庞大的数据中发现其规律、价值等成为各个企业关注点,通过数据可视化提高了数据效益,提高了洞察力。【观看视频】以一小段大数的视频引入课堂,带大家了解大数据感受大数据魅力。【互动】请学生自行搜索大数据工程师的薪资水平及其招聘岗位需求,讲解为什么学习这门课,激发学生的学习兴趣。教师提问引起学生学习积极性10分钟项目背景1.项目背景在当今信息化时代,数据不仅是技术发展的核心驱动力,更是国家战略资源的重要组成部分。数据就像现代社会的“粮草”,是驱动创新、决策和发展的核心资源,缺了它,前行的步伐就会停滞。数据库是存放数据的地方,正是因为有了数据库,我们才可以直接查找数据、使用数据。数据库可以存放大量的数据,允许很多人同时使用里面的数据。例如:高考后在网上查询的个人成绩、在学校官方网站浏览的新闻内容,都是取自数据库。在当下数据爆发的大数据时代,传统数据库已经不能满足用户需求,就需要一种新的数据存储方式—大数据存储。“大数据”通常指的是那些数量巨大,难以收集、处理、分析的数据集,亦指那些在传统基础设施中长期保存的数据。大数据存储可以将这些数据集或数据持久化到计算机中。大数据存储是大数据技术不可缺少的部分,用来完成大数据管理过程中不同阶段的数据存储任务,实现数据在分析阶段和存储阶段的数据存储功能。面对海量的结构复杂、种类繁多的数据,如何进行管理是一个挑战。面对数据量的猛烈增长,传统的数据存储方式已不能满足需求,需要通过大数据存储实现海量数据、多结构数据、多种类数据的高效管理。大数据存储与传统数据库的对比如表1-1所示。表1-1大数据存储与传统数据库的对比大数据存储传统数据库数据量海量有限数据结构关系数据、非关系数据关系数据扩展性高低吞吐量高低容错性高低大数据的存储采用不同的技术路线,大致可以分为3类。第1类主要面对的是大规模的结构化数据。第2类主要面对的是半结构化和非结构化数据。第3类面对的是结构化数据和非结构化数据混合的大数据。大数据存储的扩展性如图1-1所示。图1-1大数据存储的扩展性大数据的存储方式有以下几种。分布式存储:分布式存储可以解决大数据存储的问题,为大数据的存储提供解决方案。分布式存储的定义包括两个方面:第一个方面是关于硬件的,硬件本身是独立的;第二个方面是关于软件的,对于用户而言,就像跟单个系统打交道。分布式存储是大数据存储的基础环节。分布式存储方式如图1-2所示。图1-2分布式存储方式NoSQL数据库:泛指非关系数据库。NoSQL数据库的产生就是为了解决大规模数据集和web-scale的应用难题。得益于它的无关系性,NoSQL数据库的结构简单,具有非常高的读写性能,尤其在数据量很大时。数据仓库:数据仓库是一个很大的数据存储集合,将各种应用系统集成在一起,为统一的历史数据分析提供坚实的平台,通过数据分析与报表模块的查询和分析工具OLAP(联机分析处理)、决策分析、数据挖掘完成对信息的提取,以满足决策的需要。数据仓库系统通常是指一个数据库环境,而不是指一件产品。数据仓库的体系结构分为源数据层、数据存储与管理层、OLAP服务器层和前端分析工具层。云存储:云存储是伴随着云计算技术的发展而衍生出来的一种新兴的网络存储技术,它是云计算的重要组成部分,也是云计算的重要应用之一。它不仅是数据信息存储的新技术、新设备模型,也是一种服务的创新模型。讲解、提问提问,引起学生学习积极性10分钟数据仓库介绍数据仓库概念数据仓库(简称数仓或DW),是一个用于存储、分析、报告的数据系统。数据仓库的目的是构建面向分析的集成化数据环境,为企业提供决策支持。数据仓库通常包含大量的历史数据,但其本身并不“生产”数据,其数据来源于不同的外部系统;同时数据仓库自身也不需要“消费”任何数据,其结果开放给各外部应用使用,这也是它叫作“数据仓库”而不叫作“数据工厂”的原因。数据仓库是一个集中式存储库,用于存储结构化数据(数据库表、Excel工作表)和半结构化数据(xml文件、网页),以便进行分析。数据从各种源(外部系统)流入,通常会在到达数据仓库之前进行清理和标准化。由于数据仓库可以存储大量信息,因此用户可以轻松访问大量历史数据,这些数据可用于数据挖掘、数据可视化和其他形式的商业智能报告。数据仓库结构如图1-3所示。图1-3数据仓库结构数据仓库的本质就是整合多个数据源的历史数据进行细粒度的、多维的分析,帮助高层管理者或者业务分析人员做出商业战略决策或商业报表。数据仓库的构建一个精心设计的数据仓库支持高速查询功能,具备高数据吞吐量,能够凭借出色的灵活性帮助用户细分数据或降低数据量,进而执行更加细致的数据检查,满足高层级和精细化数据管理等各种需求。同时,它还能为中间件BI环境(报告、可视化界面)提供一个坚实的功能性基础。按照数据流入流出的过程,数据仓库架构可分为三层——源数据、数据仓库、数据应用。数据仓库包含来源于不同的源数据的数据,并提供多样的数据应用,数据自下而上流入数据仓库后向上层开放应用,而数据仓库只是中间集成化数据管理的一个平台。(1)源数据层(ODS):此层数据无任何更改,直接沿用外围系统的数据结构和数据,不对外开放;为临时存储层,是接口数据的临时存储区域,为数据处理做准备。(2)数据仓库层(DW):又称细节层,DW层的数据应该是一致的、准确的、干净的数据,即对源数据进行清洗(去除杂质)后的数据。(3)数据应用层(DA或APP):前端应用直接读取的数据源,是根据报表、专题分析需求计算生成的数据。进入大数据时代之后,基于Hadoop基础架构,Hive作为分布式数据仓库被大家熟知。Hive是基于Hadoop的数据仓库软件,可以查询和管理PB级别的分布式数据。数据仓库软件使用SQL读取、写入和管理分布式存储系统中的大型数据集。可以将表结构投影到存储的数据上,并提供命令行工具和DBC驱动程序以将用户连接到Hive。数据仓库的主要特点数据仓库是具有主题性、集成性、稳定性和动态性特点的数据集合,用于支持管理决策。1.主题性数据仓库一般从用户实际需求出发,将不同平台的数据源按设定主题进行划分整合,与传统的面向事务的操作型数据库不同,具有较高的抽象性。面向主题的数据组织方式,就是在较高层次对分析对象数据的一个完整、统一且一致的描述,能完整且统一地刻画各个分析对象所涉及的有关企业的各项数据及数据之间的联系。2.集成性数据仓库中存储的数据大部分来源于传统的数据库,但并不是将原有数据简单地直接导入,而是需要进行预处理。这是因为事务型数据库中的数据一般都是有噪声的、不完整的和数据形式不统一的。这些“脏数据”的直接导入将对在数据仓库基础上进行的数据挖掘造成混乱。“脏数据”在进入数据仓库之前必须经过抽取、清洗、转换才能从面向事务的数据集合变为面向主题的数据集合。数据集成是数据仓库建设中最重要也是最为复杂的一步。3.稳定性数据仓库中的数据主要为决策者的分析提供数据依据。决策依据的数据是不允许进行修改的。即数据保存到数据仓库后,用户仅能通过分析工具进行查询和分析,而不能修改。数据的更新升级主要在数据集成环节完成,过期的数据将在数据仓库中直接筛除。4.动态性数据仓库中的数据会随时间变化而定期更新,不可更新是针对应用而言,即用户分析处理时不更新数据。每隔一段固定的时间,数据仓库会抽取数据库系统运行时产生的数据,转换后集成到数据仓库中。随着时间的变化,数据以更高的综合层次被不断综合,以适应趋势分析的要求。当数据超过数据仓库的存储期限,或对分析无用时,数据仓库会将这些数据删除。数据仓库和数据库的区别数据仓库是升级后数据库。从逻辑上理解,数据库和数据仓库没有区别,都是通过数据库软件实现数据的存放,只不过从数据量来说,数据仓库要比数据库庞大得多。数据仓库主要用于数据挖掘和数据分析,辅助领导做出决策。它们的区别主要有以下几点。(1)数据库只存放当前值,数据仓库存放历史值。(2)数据库中的数据是动态变化的,只要有业务发生,数据就会被更新,而数据仓库存储的是静态的历史数据,只能定期添加、刷新。(3)数据库中的数据结构比较复杂,有各种结构以适合业务处理系统的需要,而数据仓库中的数据结构相对简单。(4)数据库中数据的访问频率较高,但访问量较少,而数据仓库的访问频率低,访问量却很大。(5)数据库中的数据是面向业务处理人员的,为业务处理人员提供信息处理的支持,而数据仓库是面向高层管理人员的,为其提供决策支持。(6)在访问数据时,数据库响应速度快,其响应时间一般在几秒内,而数据仓库的响应时间可长达数小时。数据库与数据仓库的主要区别如表1-2所示。表1-2数据库与数据仓库的主要区别数据库数据仓库数据特点当前的、最新的历史的、跨时间的数据变化动态变化的,随业务更新静态历史数据,定期添加、刷新数据结构复杂相对简单访问频率和访问量访问频率高,访问量小访问频率低,访问量大目的业务操作数据分析挖掘响应速度快,毫秒级、秒级慢,秒级以上操作读、写、更新大多为读数据规模从GB级到TB级TB级及以上数据仓库应用场景随着大数据产业快速起步,越来越多企业在探索自身数字化转型,政务、金融等各行业都在不断进行数字化产业升级,对数据仓库的要求越来越高。电商行业应用场景:电商数仓需要收集各类业务日志、用户行为日志及商品实体表等信息,按照实际业务需求设计模型,根据数据仓库数据进行数据挖掘,采用智能推荐算法进行商品推荐。金融行业应用场景:金融行业的数据量非常庞大,且金融企业的业务部门繁杂,数据量大,通过数据仓库将各业务部门数据统一进行加工与存储,并进行数据分类、建模、汇总,根据业务部门需求建设相应的数据集市,助力经营决策制订、风险管理、客户管理、运营管理等。在反欺诈、风险预警方面尤为显著。数据仓库作为先进的数据存储与分析平台,不仅可以加速各行业的数字化转型进程,还可以通过高效整合与管理海量数据资源,为企业的决策支持与业务优化提供坚实的数据基础,从宏观层面助力国家数字经济战略的稳健前行。在国务院发布的《“十四五”数字经济发展规划》的指引下,数据仓库的建设与应用被赋予了新的使命,它不仅是数字基础设施不可或缺的组成部分,更是推动数据要素市场化配置、加速数字经济与实体经济深度融合的关键一环,为构建智慧社会、实现高质量发展目标贡献重要力量。教师讲解,提问学生听课,回答教师问题20分钟NoSQL数据库NoSQL数据库介绍1.2.1NoSQL数据库概念NoSQL数据库泛指非关系数据库,是对不同于传统的关系数据库的数据库管理系统的统称。NoSQL数据库的产生就是为了解决大规模数据集和多重数据种类带来的挑战,用于超大规模数据的存储。这些类型的数据存储不需要固定的模式,无须多余操作就可以横向扩展。NoSQL数据库有以下几个优点:一是易扩展,NoSQL数据库种类繁多,它们有一个共同的特点,即去掉了关系数据库的关系型特性。二是数据之间无关系,使拓展变得非常容易。无形之间也在架构层面上增加了可扩展的能力。三是高性能,NoSQL数据库具有非常高的读写性能,尤其是在大数据量时,同样表现优秀。这得益于它的无关系性和简单的数据库结构。NoSQL数据库的优缺点如表1-3所示。表1-3NoSQL数据库优缺点优点易扩展分布式计算低成本架构灵活,存储半结构化数据没有复杂的关系高性能缺点没有标准化有限的查询功能1.2.2NoSQL数据库的基本原理数据库技术是研究数据库的结构、存储、设计、管理和使用的一门科学。数据库系统的基本概念:数据库系统是采用数据库技术的计算机系统,由计算机硬件、软件和数据资源组成,能实现有组织地、动态地存储大量关联数据,并方便多用户访问。数据库系统在逻辑层面由用户、数据库应用程序、数据库管理系统(DBMS)、数据库(DB)组成。NoSQL数据库的特点如下。(1)灵活的数据模型:可以在不修改表的情况下存储数据。只需增加更多的列,无须进行数据的迁移。(2)可伸缩性强:NoSQL数据库是分布式的、横向扩展的。(3)自动分片:由于关系数据库存储的是结构化的数据,通常采用纵向扩展方式,代价很高,因此NoSQL数据库使用横向扩展方式,通过添加服务器来满足扩展需求。(4)自动复制:在NoSQL分布式集群中,服务器会自动对数据进行备份,即将一份数据复制存储在各台服务器上。分布式数据处理使用“分而治之”的方法解决大规模数据管理问题。在分布式系统中,虽然数据存储在计算机网络的多台服务器上,但逻辑上是一个整体,被所有用户共享,并由一个DBMS统一管理。分布式存储的优点如下。可靠性(容错):一台服务器崩溃并不影响其余的服务器。可扩展性:可以根据需要增加更多的机器。灵活性:非常灵活,很容易安装、实施和调试。更高的吞吐量:分布式存储使一个系统可以有多台计算机的吞吐能力,比其他系统有更快的处理速度。开放系统:由于它是开放的系统,本地或者远程都可以访问到该服务。更高的性能:相较于传统的存储,分布式存储可以提供更高的性能(及更好的性价比)。1.2.3NoSQL数据库的常见存储结构类型NoSQL数据库的常见存储结构类型如表1-4所示。表1-4NoSQL数据库的常见存储结构类型类型部分代表特点列存储HbaseCasandraHypertable按列存储数据。列存储的最大特点是方便存储结构化和半结构化数据,便于进行数据压缩,并且在针对某一列或者某几列进行查询时,有非常大的I/O优势文档存储MongoDBCouchDB文档存储一般用类似json的格式存储数据,存储的内容是文档型的。这样即可对某些字段建立索引,实现关系数据库的某些功能Key-Value存储TokyoMemcacheDBRedis可以通过key快速查询到其他value图存储Neo4jFlockDB图形关系数据的最佳存储模式。使用传统关系数据库存储图形关系数据时,不仅性能低下,而且使用不方便对象存储db4oVersant通过类似面向对象语言的语法操作数据库,通过对象的方式存储数据XML数据库BaseX高效地存储XML数据,并支持XML的内部查询语法1.2.4NoSQL数据库适用场景NoSQL数据库适用以下的这几种情况。(1)数据模型比较简单。(2)对数据库性能要求较高。(3)不需要高度的数据一致性。(4)对于给定key,比较容易映射复杂值。1.2.5NoSQL数据库的关键技术HBase是一种分布式的、面向列的NoSQL开源数据库,是Hadoop开源项目下的一个子项目,是一个构建在HDFS之上、支持分布式存储数据,具有水平扩展和数据多版本等特性的NoSQL数据库。现广泛应用于大数据的存储和查询场景。MongoDB是一个基于分布式文件存储技术的数据库,旨在为Web应用提供可扩展的高性能数据存储解决方案。它在具备非关系型数据库核心特性的同时,吸收了一些关系型数据库的设计理念。由于它支持的数据结构非常松散,是类似json的bson格式,因此可以存储比较复杂的数据类型。教师讲解学生听课25分钟总结课堂小结,分析存在的问题教师引导讨论分小组进行操作15分钟大数据存储技术课程教案一、核心要素章节名称项目二Hadoop基础介绍教学课时授课班级授课时间授课地点教学目标知识目标理解Hadoop的核心优势4V特性体现、架构组成及4种运行模式的特点与适用场景掌握VMware软件的安装步骤及关键设置掌握CentOS7虚拟机的创建流程,包括硬件配置、网络类型设置及镜像文件加载方法能力目标能独立完成VMware软件的正确安装能区分Hadoop不同运行模式的差异,为后续Hadoop部署选择合适的运行模式。素质目标培养严谨的操作习惯,在软件安装与虚拟机配置中注重细节,提升数据安全意识;通过小组讨论解决多系统运行痛点,增强协作沟通能力与问题分析能力;​建立“理论-工具-实践”的关联思维,理解虚拟机技术在大数据工具部署中的支撑作用,提升技术应用素养。教学内容主要内容介绍Hadoop架构组成及运行模式VMware软件的安装步骤CentOS7虚拟机的创建全流程重点Hadoop核心架构的功能分工及运行模式的适用场景VMware安装中的关键设置CentOS7虚拟机的硬件配置与NAT网络类型设置难点理解Hadoop伪分布式模式与完全分布式模式的本质区别理解NAT网络模式下“宿主机代理转发”的原理,确保虚拟机正常访问外部网络教法改革教学方法情境教学法:通过“Windows装Hadoop兼容性问题”的场景,引导学生理解虚拟机的必要性;​演示法:分步演示VMware安装与CentOS7虚拟机创建过程,强调关键步骤操作;​互动讨论法:组织小组讨论“双系统痛点”“虚拟机硬件来源”,激发学生思考;​任务驱动法:布置“独立安装VMware并创建CentOS7虚拟机”的实践任务,巩固所学。教学手段实物演示:教师通过屏幕共享实时操作VMware安装与虚拟机创建,直观呈现操作细节实践设备:学生使用个人计算机进行同步操作,教师巡回指导,及时解决操作问题教学反思在VMware安装中是否普遍存在“安装路径误选系统盘”“PATH配置遗漏”等问题,后续教学是否需强化前置检查(如查看磁盘空间、强调配置勾选),​CentOS7虚拟机创建中“镜像加载”“网络设置”环节的讲解是否清晰,是否需增加“常见问题排查指南”(如镜像文件路径错误、NAT模式无网络的解决方法),Hadoop理论部分与虚拟机实践部分的衔接是否自然,是否需增加“虚拟机与Hadoop部署关联”的过渡讲解,帮助学生建立知识联系。二、教学设计教学步骤教学内容与情境设计教师活动学生活动时间分配导入新课一、场景联想,激活兴趣师:同学们,上节课我们已经知道Hadoop是处理海量数据的重要系统,那大家有没有想过,我们该在什么环境里安装和运行Hadoop呢?平时大家用的电脑大多是Windows系统,直接在Windows上装Hadoop会遇到不少兼容性问题,比如一些命令无法正常执行、服务启动报错等。师:再想想,如果你想同时用Windows系统写文档,又想用另一个系统来安装Hadoop做实验,有没有办法不用频繁重启电脑就能实现?大家可以结合自己使用电脑的经历,说说你的想法。​二、互动提问,逐步引导提问1:多系统运行的痛点​师:有同学可能会说,我可以给电脑装双系统,一个Windows一个Linux。那大家想想,双系统在使用时会有什么不方便的地方?比如我正在Windows上查资料,突然要切换到Linux去操作Hadoop,需要做什么?​(等待学生回答,引导学生说出“需要重启电脑”“切换麻烦”“不能同时运行两个系统”等答案)​师:没错,双系统的切换成本太高了,而且不能满足我们同时操作两个系统的需求。那如果有一种工具,能让我们在Windows系统上“虚拟”出另一台电脑,这台虚拟电脑可以装Linux系统,还能和Windows同时运行,大家觉得这个工具有用吗?它能解决我们刚才说的哪些问题?​(邀请1-2名学生发言,引导学生认识到“无需重启”“可同时运行”“方便实验”等优势)​提问2:虚拟机的核心作用​师:这种能“虚拟”出电脑的工具,就是我们今天要学的VMware。大家再思考一下,既然是“虚拟”的电脑,它的硬件(比如硬盘、内存)是从哪里来的?会不会影响我们真实电脑的数据?比如我在虚拟电脑的Linux系统里存文件、装软件,真实电脑的文件会被改动吗?​(组织学生小组讨论30秒,让小组代表分享观点,引导学生理解“虚拟机硬件来自真实电脑的分配”“虚拟机数据独立,不影响真实电脑”等特点)​师:大家说得很有道理。VMware不仅能让我们在Windows上运行Linux,还能保护真实电脑的数据,而且后续我们安装Hadoop、Hive这些软件,都要依赖它创建的Linux虚拟机。那接下来,我们就先学习怎么安装VMware,再用它创建能装Hadoop的CentOS7虚拟机。​三、导入新课师:首先,我们得清楚安装VMware需要注意什么,比如安装路径不能选系统盘,还有哪些关键设置要勾选。安装完VMware后,怎么创建CentOS7虚拟机?比如虚拟机的内存、磁盘容量该怎么分配,怎么加载CentOS7的镜像文件。接下来,我们就一步步学习这些操作,为后续安装Hadoop做好准备。教师提问学生讨论与教师互动10分钟项目背景Hadoop是一个能够对大量数据进行分布式处理的软件框架,主要用于解决海量数据的存储和分析计算问题,是大数据技术的基石,是目前主流的离线大数据处理技术之一。相比传统关系型数据分析框架,Hadoop更适应当前的大数据环境。Hadoop在处理大数据时具备以下优势(4高)。(1)高可靠性:因为Hadoop底层维护多个数据副本,所以即使某个Hadoop计算元素或存储出现故障,也不会导致数据的丢失。(2)高扩展性:Hadoop能够在集群间分配任务数据,还能轻松扩展数以千计的节点,从而处理PB级数据。(3)高效性:在MapReduce的思想下,Hadoop通过并行工作来加快任务处理速度。(4)高容错性:能够自动将失败的任务重新分配。Hadoop以一种可靠、高效、可伸缩的方式进行数据处理,用户可以在不了解分布式技术底层细节的情况下开发分布式程序。Hadoop易于架构和使用,用户可以轻松地在Hadoop上开发和运行处理海量数据的应用程序。而且,由于Hadoop依赖社区服务,因此它的成本比较低,任何人都可以使用。大数据具有4V特性:1.Volume(体量大);2.Velocity(速度快);3.Variety(样式多);4.Value(价值高)。Hadoop对大数据4V特性的体现如下。体量大:Hadoop能够处理PB级数据。速度快:Hadoop分布式计算能够快速完成数据处理。样式多:Hadoop使用分布式存储,便于管理多样化的文件。价值高:Hadoop批处理能力优异,擅长从海量数据提取高价值信息。Hadoop的诸多优点使得Hadoop一出现就受到众多大公司的青睐,同时也引起了研究界的普遍关注。到目前为止,Hadoop技术在大数据相关领域已经得到了广泛的运用。被公认是一套行业大数据标准开源软件,在分布式环境下提供了海量数据的处理能力。几乎所有主流厂商都围绕Hadoop开发工具、开源软件、商业化工具和提供技术服务。广义上来说,Hadoop通常是指一个更广泛的概念—Hadoop生态圈。Hadoop生态圈内容如图2-1所示。图2-1Hadoop生态圈内容1)Hadoop的架构组成Hadoop框架包括HDFS、MapReduce、YARN3个核心模块,分别为分布式文件系统、分布式计算框架和资源调度框架。Hadoop2.x核心模块如图2-2所示。图2-2Hadoop2.x核心模块HDFS是一个采用主从式架构的分布式文件系统,负责数据的管理与存储。MapReduce是分布式计算框架,负责运算,用来解决大规模集群的协同运算问题。YARN负责统一的资源管理和调度,管理应用程序的资源分配,如内存、CPU、磁盘、网络等。2)Hadoop的运行模式(1)单机(非分布式)模式:这种模式在单机上运行,没有分布式文件系统,而是直接读写本地操作系统的文件,一般仅用于本地MapReduce程序的调试。(2)伪分布式模式:这种模式也是在单机上运行的,与单机模式不同的是,它用Java进程模仿完全分布式模式中的各类节点,如NameNode、DataNode、SecondaryNameNode(若启动了YARN,则完全分布式模式中的节点为NameNode、DataNode、SecondaryNameNode、ResourceManager、NodeManager)。与完全分布式模式的区别是,伪分布式模式的所有节点都部署在一台机器上,通过开启多个进程来模拟完全分布式模式,但是并没有真正提高程序执行的效率,故称为“伪分布式”,是理论学习和程序开发时的主要运行模式。(3)完全分布式模式:真正的完全分布式模式在3个及以上实体机或虚拟机组建的集群上运行。Hadoop进程部署在多台机器上,充分发挥执行效率。(4)HA高可用模式:搭建HA高可用模式的分布式环境至少需要3台机器,并在不同的机器上部署相应的应用。相比伪分布式模式的部署更加复杂,能够实现NameNode与ResourceManager的热备。该模式适用于生产环境,能够稳定高效地提供大数据服务。讲解、提问学生听课、与教师互动10分钟虚拟机介绍及安装2.1.1VMware软件安装VMware可以在个人本地计算机上同时运行2个或更多的Windows、DOS、Linux系统。与“多启动”系统相比,VMWare采用了完全不同的概念。“多启动”系统在同一时刻只能运行一个系统,并且在系统切换时需要重新启动计算机。而VMWare是真正的“同时”运行,在主系统的平台上运行着多个操作系统,它们可以像标准Windows应用程序那样切换。此外,每个操作系统都可以进行虚拟的分区、配置并且不影响真实硬盘的数据,甚至可以通过网卡将几台虚拟机连接为一个局域网,极其方便。后续的Hadoop、Hive、HBase等软件将会安装在Linux系统的虚拟机上,需要的文件如下。虚拟机安装软件:VMware-workstation-full-17.0.0-20800274.exe。具体安装步骤如下。(1)双击“VMware-workstation-full-17.0.0-20800274.exe”,在打开的界面中单击“下一步”按钮,进入后续步骤,如图2-3所示。(2)在“最终用户许可协议”界面中勾选“我接受许可协议中的条款”复选框,单击“下一步”按钮,如图2-4所示。 图2-3单击“下一步”按钮 图2-4“最终用户许可协议”界面

(3)在“自定义安装”界面单击“更改”按钮,选择软件安装位置,不要选择系统盘,要选择剩余空间较大的其他盘,勾选“将VMwareWorkstation控制台工具添加到系统PATH”复选框,单击“下一步”按钮,如图2-5所示。(4)在“用户体验设置”界面中勾选“启动时检查产品更新”复选框和“加入VMware客户体验提升计划”复选框,单击“下一步”按钮,如图2-6所示。 图2-5“自定义安装”界面 图2-6“用户体验设置”界面(5)在“快捷方式”界面中勾选“桌面”复选框和“开始菜单程序文件夹”复选框,单击“下一步”按钮,如图2-7所示。(6)在“已准备好安装VMwareWorksationPro”界面中单击“安装”按钮进行安装,如图2-8所示。 图2-7“快捷方式”界面 图2-8单击“安装”按钮(7)安装完成后,单击“完成”按钮结束安装,如图2-9所示。(8)结束安装后,桌面会出现VMware图标,如图2-10所示。 图2-9结束安装 图2-10VMware图标教师讲解与实操学生跟随操作20分钟虚拟机创建2.1.2创建CentOS7虚拟机我们使用CentOS7作为操作系统创建虚拟机,CentOS7是一个稳定且广泛使用的Linux发行版,而且Hadoop及其相关工具对Linux系统的支持更好。在CentOS7上安装和运行Hadoop,可以避免在Windows系统上可能遇到的兼容性问题。创建CentOS7虚拟机需要以下文件。CentOS7操作系统的镜像文件:CentOS-7-x86_64-DVD-2009.iso。具体创建步骤如下。(1)创建虚拟机。在VMware使用界面(主页)中单击“创建新的虚拟机”按钮,如图2-11所示。图2-11单击“创建新的虚拟机”按钮(2)在打开的对话框中选中“自定义(高级)”单选按钮,单击“下一步”按钮,如图2-12所示。(3)打开“选择虚拟机硬件兼容性”对话框,在“硬件兼容性”下拉列表中选择“Workstation17.x”选项,单击“下一步”按钮,如图2-13所示。(4)在“安装客户机操作系统”对话框中选中“稍后安装操作系统”单选按钮,单击“下一步”按钮,如图2-14所示。(5)打开“选择客户机操作系统”对话框,在“客户机操作系统”选区中选中“Linux”单选按钮,单击“下一步”按钮,如图2-15所示。 图2-12选中“自定义(高级)”单选按钮 图2-13“选择虚拟机硬件兼容性”对话框 图2-14“安装客户机操作系统”对话框 图2-15“选择客户机操作系统”对话框(6)打开“命名虚拟机”对话框,设置虚拟机名称,并选择虚拟机存放路径,文件夹名称尽量和虚拟机名称一致,单击“下一步”按钮,如图2-16所示。(7)打开“处理器配置”对话框,根据计算机配置设置虚拟机的处理器数量和每个处理器的内核数量,单击“下一步”按钮,如图2-17所示。(8)打开“此虚拟机的内存”对话框,根据计算机配置设置虚拟机的内存,单击“下一步”按钮,如图2-18所示。(9)打开“网络类型”对话框,选中“使用网络地址转换(NAT)”单选按钮,单击“下一步”按钮,如图2-19所示。 图2-16“命名虚拟机”对话框 图2-17“处理器配置”对话框 图2-18“此虚拟机的内存”对话框 图2-19“网络类型”对话框通过该设置,虚拟机可以通过宿主机的网络来访问外部网络(如互联网),而外部网络无法直接访问虚拟机。当虚拟机向外部网络发出请求时,宿主机会将这些请求“代理”出去,并将外部网络的响应转发给虚拟机。(10)打开“选择I/O控制器类型”对话框,选中“LSILogic”单选按钮,单击“下一步”按钮,如图2-20所示。(11)打开“选择磁盘类型”对话框,选中“SCSC”单选按钮,单击“下一步”按钮,如图2-21所示。 图2-20“选择I/O控制器类型”对话框 图2-21“选择磁盘类型”对话框(12)打开“选择磁盘”对话框,选中“创建新虚拟磁盘”单选按钮,单击“下一步”按钮,如图2-22所示。(13)打开“磁盘容量”对话框,在“最大磁盘大小(GB)”数值框中输入“60.0”,选中“将虚拟磁盘存储为单个文件”单选按钮,单击“下一步”按钮,如图2-23所示。 图2-22“选择磁盘”对话框 图2-23“指定磁盘容量”对话框(14)打开“指定磁盘文件”对话框,单击“浏览”按钮选择此虚拟机的磁盘文件hadoop01.vmdk,单击“下一步”按钮,如图2-24所示。(15)在“已准备好创建虚拟机”对话框中确认虚拟机的所有配置,勾选“创建后开启此虚拟机”复选框,单击“完成”按钮,如图2-25所示。 图2-24“指定磁盘文件”对话框 图2-25“已准备好创建虚拟机”对话框(16)在打开的界面中单击“编辑虚拟机设置”按钮,如图2-26所示。图2-26单击“编辑虚拟机设置”按钮(17)打开“虚拟机设置”对话框,在“硬件”选项卡中选择“CD/DVD”选项,选中右侧的“使用ISO映像文件”单选按钮,接着单击“浏览”按钮,在弹出的窗口中选择自己计算机中的镜像文件,完成后单击“确定”按钮,如图2-27所示。图2-27“虚拟机设置”对话框(18)等待虚拟机安装,如图2-28所示。图2-28等待虚拟机安装(19)在打开的界面中选择“USERCREATION”选项创建用户,如图2-29所示。图2-29创建用户(1)(20)在打开的界面中输入用户名,勾选“Requireapasswordtousethisaccount”复选框,并配置密码,接着单击左上角的“Done”按钮完成设置。需要注意的是,当设置密码时,如果输入类似于123456这样的简单密码,那么会提示该密码过于简单,此时需要单击2次“Done”按钮才能完成设置,之后等待安装完成即可,如图2-30所示。图2-30创建用户(2)教师讲解与实操学生跟随操作25分钟总结课堂小结,分析存在的问题教师引导讨论分小组进行操作15分钟大数据存储技术课程教案一、核心要素章节名称项目二Hadoop基础介绍教学课时授课班级授课时间授课地点教学目标知识目标掌握CentOS7虚拟机网络配置核心参数、Java环境配置步骤,理解Hadoop伪分布式环境搭建原理知晓Hadoop核心配置文件的作用及关键配置项含义,明确SSH免密登录的实现逻辑与Hadoop组件通信的关联了解HDFS格式化的目的、jps命令检查进程的意义,区分伪分布式与完全分布式环境的差异能力目标能独立完成虚拟机网络配置、Java环境搭建,熟练执行Hadoop安装包解压、环境变量配置及核心配置文件修改操作具备实现SSH免密登录、完成HDFS格式化与Hadoop启动的能力,能通过jps命令判断Hadoop进程是否正常启动,排查配置中的常见错误初步形成解读Hadoop配置文件参数、调整配置以适配伪分布式环境的能力素质目标培养严谨的实操习惯,在修改Hadoop配置文件、执行格式化命令时注重细节,避免因参数错误或重复格式化导致环境异常通过自主探索Hadoop进程启动与检查流程,提升自主学习与问题解决能力,增强面对复杂技术操作的耐心与毅力强化团队协作意识,在小组讨论配置难题时,能清晰表达思路、借鉴他人经验,共同完成环境搭建任务教学内容主要内容本节课涵盖CentOS7虚拟机网络配置、Java环境配置,以及Hadoop伪分布式环境搭建,通过回顾旧知与互动提问导入,逐步构建Hadoop运行的完整环境重点Hadoop核心配置文件关键参数的正确配置,确保适配伪分布式环境。​SSH免密登录的成功实现与HDFS格式化操作难点理解Hadoop各配置文件间的关联关系,避免因某一配置文件参数错误导致整个环境搭建失败​排查Hadoop启动后进程缺失的问题分析SSH免密登录失败的原因教法改革教学方法采用“回顾导入+问题驱动+分步演示+小组协作探究”的方法,先通过旧知衔接引出新课,再以“组件如何通信”“配置文件有何作用”等问题引导思考,教师分步演示关键操作,最后组织小组协作排查配置错误,深化理解。教学手段借助CentOS7虚拟机实操环境、多媒体课件(展示全流程截图,含Hadoop配置文件修改、进程检查界面)、终端命令实时演示,结合思维导图梳理Hadoop组件关系,利用小组讨论白板工具共享配置思路与错误排查方法。教学反思部分学生对Hadoop核心配置文件参数理解困难,后续可通过类比生活场景(如HDFS比作“文件仓库”)简化概念,或提供配置参数说明手册辅助学习。​SSH免密登录中文件权限设置易被忽视,导致登录失败,下次教学可重点强调权限命令的使用,增加实操练习次数HDFS格式化后重复操作会导致DataNode无法启动,需提前明确“仅首次配置执行”的要求,可在课件中用醒目标注提醒,同时准备异常解决方案供学生参考。学生对jps命令检查进程的理解较浅,后续可补充进程对应组件功能的讲解,帮助学生理解“进程正常”与“环境可用”的关联。二、教学设计教学步骤教学内容与情境设计教师活动学生活动时间分配导入新课一、回顾旧知,搭建衔接桥梁​师:上节课我们成功创建了CentOS7虚拟机,大家都顺利完成安装了吗?(等待学生回应,确认学习基础)现在我们有了Linux虚拟机这个“空房子”,但要让它能运行Hadoop,就像给房子通水电、配家具一样,还需要做哪些准备呢?大家可以先思考一下,平时我们用电脑上网、装软件,都需要什么基础条件?​二、互动提问,聚焦网络配置需求​提问1:虚拟机的“网络难题”​师:如果虚拟机没办法连接网络,会影响我们后续操作吗?比如我们要给虚拟机装Java环境、传Hadoop安装包,没网络能实现吗?(邀请学生举手回答,引导说出“无法下载文件”“无法传输安装包”等问题)那大家觉得,该怎么让虚拟机拥有网络连接能力?它的网络配置和我们真实电脑的网络设置有什么区别吗?​(组织学生同桌讨论1分钟,之后请1-2组代表分享想法,教师适时补充,引出“虚拟机网络配置”的概念)​提问2:Hadoop的“运行基石”​师:我们知道Hadoop是用Java编写的,那如果虚拟机里没装Java环境,直接装Hadoop能成功吗?就像我们要运行一个手机APP,得先有对应的操作系统一样,Hadoop运行也需要“基础支撑”。大家猜猜这个“基础支撑”是什么?(引导学生说出“Java环境/JDK”)那除了Java环境,Hadoop伪分布式模式下,还需要解决什么问题?比如Hadoop各组件之间要通信,总不能每次都输密码吧?​(引导学生思考“组件通信”需求,为SSH免密登录做铺垫,同时强调环境配置的连贯性)​三、明确目标,导入新课内容​师:看来大家都意识到了,要让Hadoop在虚拟机上跑起来,第一步得先让虚拟机“连上网”,也就是我们今天要学的“虚拟机网络配置”;第二步要给它装“运行引擎”——Java环境;第三步还要做好Hadoop组件间的“沟通准备”,比如SSH免密登录和各种配置文件设置。接下来,我们就一步步解决这些问题,把虚拟机打造成能稳定运行Hadoop的“专属环境”,大家有信心吗?教师提问学生讨论与教师互动10分钟虚拟机网络配置2.1.3虚拟机网络配置(1)虚拟机的操作系统安装完成后会进入用户登录界面,单击“Notlisted?”链接,选择其他用户登录,如图2-31所示。图2-31用户登录(1)(2)使用root用户登录,因为root用户权限高,方便后续修改网络配置文件,在“Username”文本框中输入“root”后,单击“Next”按钮,如图2-32所示。图2-32用户登录(2)(3)在“Password”文本框中输入密码,单击“SignIn”按钮,如图2-33所示,进入CentOS7操作系统界面。(4)在桌面空白处右击,在弹出的快捷菜单中选择“OpenTerminal”命令打开终端,如图2-34所示。图2-33用户登录(3)图2-34打开终端(5)在终端中执行以下命令打开网络配置文件,。vim/etc/sysconfig/network-scripts/ifcfg-ens33(6)按I键,进入编辑模式,如图2-35所示。图2-35进入编辑模式(7)选择“编辑”→“虚拟网络编辑器”命令,如图2-36所示。图2-36网络配置(1)(8)单击类型为“NAT模式”的VMnet,注意,其名称不一定是VMnet2,接着单击“NAT设置”按钮,查看子网IP地址和网关IP地址,如图2-37所示。(9)修改网络配置文件中的核心参数,如图2-38所示。(10)按Esc键返回普通模式,输入“:wq”命令保存文件并退出编辑状态,如图2-39所示。图2-37网络配置(2)图2-38网络配置(3)图2-39网络配置(4)(11)输入图2-40所示命令,重启网络配置,使网络配置文件生效。图2-40网络配置(5)(12)查看IP地址,可以看到IP地址修改成功,如图2-41所示。图2-41网络配置(6)(13)使用ping命令检查网络的连通性,如图2-42所示。(14)输入vim/etc/hostname命令修改主机名,如图2-43所示。(15)将主机名修改为master后保存并退出,重启虚拟机,如图2-44所示。图2-42网络配置(7)图2-43修改主机名(1)图2-44修改主机名(2)(16)重启后以root用户登录,进入终端后,发现主机名已修改为master,如图2-45所示。图2-45修改主机名(3)讲解、提问学生听课、与教师互动20分钟Java环境配置任务2Hadoop环境搭建2.2.1Java环境配置由于Hadoop是用Java编写的一个分布式计算框架,而Java环境(JDK)提供了Hadoop运行所需的基础架构和库,使得Hadoop能够在Java虚拟机(JVM)上运行,因此需要安装Java环境,这样才能确保Hadoop的各个组件和服务能够正常启动和运行,后续项目还可以编写、编译和执行与Hadoop交互的Java程序,完成数据处理和分析任务。Java环境配置需要以下文件。64位Java8安装包:jdk-8u144-linux-x64.tar.gz。具体环境配置步骤如下。(1)将准备的文件上传至虚拟机,解压安装包jdk-8u144-linux-x64.tar.gz,如图2-46所示。图2-46解压安装包(2)打开Java环境变量配置文件,有vi~/.bashrc和vi/etc/profile两种命令。其中,~/.bashrc是针对单个用户的配置文件,影响该用户的交互式非登录Shell,常用于设置用户专属的环境变量;而/etc/profile是系统级的配置文件,影响所有用户的登录Shell,通常用于设置全局的环境变量和配置。这里使用vi~/.bashrc命令,具体命令如下。#进入家目录cd~/#打开环境变量配置文件vi~/.bashrc(3)按I键进入编辑模式,在.bashrc文件末尾添加Java环境变量,内容如图2-29所示。编辑完成后,按Esc键退出编辑模式,输入:wq命令保存并退出文件,如图2-47所示。图2-47添加Java环境变量(4)执行source命令重新加载环境变量配置文件.bashrc,使Java环境变量生效,命令如下。source~/.bashrc(5)查看Java版本,检验Java环境是否配置成功,如图2-48所示。图2-48查看Java版本教师讲解与实操学生跟随操作10分钟Hadoop伪分布式环境搭建2.2.2Hadoop伪分布式环境搭建伪分布式环境是在单机上模拟分布式架构,简化了配置和管理,便于我们快速上手和理解Hadoop,尽管是单机运行,但是由于伪分布式模式具备Hadoop集群的所有核心功能,如HDFS和MapReduce,因此依然可以像完全分布式模式那样进行操作和管理,Hadoop伪分布式环境搭建需要以下文件。Hadoop安装包:hadoop-2.7.7.tar.gz。具体环境配置步骤如下。(1)解压Hadoop安装包,编辑Hadoop环境变量。在终端中执行解压和配置环境变量的命令,命令如下。#进入Hadoop安装包所在的目录cd~/下载#解压Hadoop安装包tar-xfhadoop-2.7.7.tar.gz-C~/#打开环境变量配置文件vi~/.bashrc(2)在“.bashrc”文件末尾添加Hadoop环境变量,内容如图2-49所示。编辑完成后,按Esc键退出编辑模式,输入:wq命令保存并退出文件。图2-49添加Hadoop环境变量(3)首先执行命令使Hadoop环境变量生效,然后打开hostname文件,修改虚拟机主机名,命令如下。在打开文件后,删除原有内容,并写入内容“master”。#使环境变量生效source~/.bashrc#打开hostname文件vi/etc/hostname(4)在修改主机名后,执行cat命令查看hostname文件内容,发现内容为master,但是主机名依然为localhost,如图2-50所示。图2-50主机名依然为localhost(5)图2-51主机名更改为master(6)SSH免密登录是一种通过公钥和私钥对实现的无密码远程登录方式,它允许用户在不输入密码的情况下安全地访问远程服务器。在Hadoop伪分布式环境中,尽管所有的节点(NameNode和DataNode)都在同一台计算机上,Hadoop仍需通过SSH在这些节点之间进行无缝通信和任务分配。设置SSH免密登录可以简化节点之间的连接过程,提高集群管理效率,避免频繁输入密码,从而确保Hadoop各组件能够自动化地执行任务和进行数据处理。在终端中输入ssh-keygen-trsa命令后,一直按Enter键直至命令结束,如图2-52所示。图2-52设置SSH免密登录(7)进入.ssh文件夹,将公钥复制到authorized_keys中,并修改文件权限,如图2-53所示。图2-53修改文件权限(8)进入/root/hadoop/etc/hadoop目录下,配置Hadoop全局配置文件core-site.xml。在<configuration>和</configuration>之间添加配置,设置数据存储位置hadoop.tmp.dir为/root/data/hadoop-${},设置文件系统的地址fs.defaultFS为hdfs://master:9000。hdfs表示使用的是Hadoop分布式文件系统;master是主节点(NameNode)的主机名;9000是HDFSNameNode监听的端口号,命令如下。<property><name>hadoop.tmp.dir</name><value>/root/data/hadoop-${}</value></property><property><name>fs.defaultFS</name><value>hdfs://master:9000</value></property>(9)接下来配置Hadoop,配置HDFS配置文件hdfs-site.xml。在<configuration>和</configuration>之间添加配置,设置文件副本数(默认是3,由于伪分布式只有一个节点所以设置为1),设置NameNode元数据存储路径为file:/root/data/hadoop/dfs/name,设置DataNode数据块存储路径为file:/root/data/hadoop/dfs/data,设置HDFS文件系统Web端访问的端口号为9870,命令如下。<property><name>dfs.replication</name><value>1</value></property><property><name>.dir</name><value>file:/root/data/hadoop/dfs/name</value></property><property><name>dfs.datanode.data.dir</name><value>file:/root/data/hadoop/dfs/data</value></property><property><name>node.http-address</name><value>localhost:9870</value></property>(10)复制出一个mapred-site.xml.template文件,并将其命名为mapred-site.xml,接着配置文件mapred-site.xml,在<configuration>和</configuration>之间添加配置,yarn表示使用YARN作为资源调度系统,如代码2-8所示。代码2-8配置mapred-site.xml<property><name></name><value>yarn</value></property>(11)配置文件yarn-site.xml,在<configuration>和</configuration>之间添加配置,指定resourcemanager启动节点为master,使用mapreduce_shuffle服务,这样可以确保在运行MapReduce作业时,Shuffle阶段的数据传输能够顺利进行,从而支持MapReduce框架的核心功能,命令如下。<property><name>yarn.resourcemanager.hostname</name><value>master</value></property><property><name>yarn.nodemanager.aux-services</name><value>mapreduce_shuffle</value></property>(12)Hadoop配置完成,此时需要格式化HDFS(只需要在第一次配置完成后进行,之后的使用过程中无须再格式化)。在执行格式化命令后,若出现“Storagedirectory/root/data/hadoop/dfs/namehasbeensuccessfullyformatted.”提示则说明格式化成功,接着启动Hadoop,如代码2-10所示。#格式化HDFShdfsnamenode-format#启动Hadoopstart-all.sh(13)执行jps命令检查启动进程,Hadoop分布式文件系统(HDFS)和作业调度平台(YARN)的关键进程如下。NameNode:管理文件系统的命名空间和数据块的映射。它维护着HDFS文件系统中所有文件和目录的元数据。SecondaryNameNode:辅助NameNode,定期合并fsimage和editslog,减少NameNode启动时的负载。DataNode:存储实际数据,并且处理来自其他节点的读写请求。ResourceManager:管理整个集群的资源和作业调度。NodeManager:管理单个节点上的资源和任务。Hadoop伪分布式模式应该包含的五个进程如图2-54所示。图2-54Hadoop伪分布式系统应该包含的五个进程教师讲解与实操学生跟随操作25分钟总结课堂小结,分析存在的问题教师引导讨论分小组进行操作15分钟大数据存储技术课程教案一、核心要素章节名称项目二Hadoop基础介绍教学课时授课班级授课时间授课地点教学目标知识目标掌握Hadoop安装包下载、上传与解压的操作流程理解环境变量配置与软连接创建的作用及原理知晓核心配置文件参数含义明确workers文件配置与集群节点管理的关联能力目标能通过FinalShell上传Hadoop安装包并完成解压具备配置Hadoop环境变量并验证版本的能力可独立修改Hadoop核心配置文件与workers文件能通过命令检查环境变量与配置文件设置效果素质目标培养实操中关注命令路径与参数准确性的习惯提升面对配置错误时自主排查的能力增强对完全分布式集群搭建的系统规划意识教学内容主要内容本部分围绕Hadoop完全分布式环境搭建展开,首先介绍从官网下载指定版本Hadoop安装包的方法,解压安装包编辑环境变量,详细讲解切换到Hadoop配置文件目录,依次修改核心配置文件的参数,以及编辑workers文件指定hadoop01、hadoop02、hadoop03节点的操作,全程结合图示辅助理解每一步流程重点Hadoop安装包正确解压与软连接创建核心配置文件关键参数的准确设置workers文件中集群节点的正确配置难点理解核心配置文件间参数的关联关系排查环境变量配置后版本验证失败的原因​掌握配置文件参数与集群节点的适配逻辑教法改革教学方法采用“分步演示+实时讲解+问题引导”的教学方法教学手段借助FinalShell实操演示、终端命令展示与步骤截图辅助教学教学反思教学中发现部分学生在解压安装包时易出错,多因路径输入错误,后续需强调路径核对;配置环境变量时,部分学生忘记执行source命令导致验

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

最新文档

评论

0/150

提交评论