版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
《Hadoop3.x大数据应用开发实践》教学大纲一、基本信息课程名称:Hadoop3.x大数据应用实践英文名称:Hadoop3.xBigDataApplicationPractice课程编码:学时学分:总72学时,授课48学时、上机实验24学时、综合实训16学时;总学分:3分适用专业:计算机科学与技术、大数据技术、软件工程、人工智能等理工类本科专业先修课程:C语言程序设计、计算机网络、数据库原理、数据结构配套主教材:马卫花、杨恩宁、王文明、杨清永、张文胜.《Hadoop3.x大数据应用实践》,2026参考书目[1]董西成.《Hadoop3权威指南》,机械工业出版社[2]王松.《Hadoop实战》,人民邮电出版社[3]GoogleGFS、MapReduce、BigTable论文中英译本[4]《Hive编程指南》,人民邮电出版社[5]《HBase权威指南》,O’Reilly出版社二、课程定位与课程目标1.课程定位Hadoop3.x大数据应用实践是大数据专业核心前置必修课,是Spark、Flink、数据仓库、大数据平台开发课程的底层支撑。课程采用理论授课+上机实操+行业综合项目三位一体教学模式,以企业主流Hadoop3.1.2版本为核心,完整覆盖HDFS、YARN、MapReduce三大核心框架,配套ZooKeeper、Hive、HBase、Sqoop全套生态组件。依托教材5套真实行业数据集(拉勾招聘、城市空气质量、地铁客流、医保、天猫母婴)开展离线大数据项目实训,打通数据采集-存储-清洗-多维度分析-入库可视化完整业务链路,构建分布式系统思维,为大数据开发实习、就业夯实底层技术基础。2.分层教学目标1)理论知识目标掌握大数据4V特征、Google三大论文(GFS/MapReduce/BigTable)核心设计思想;区分Hadoop1.x/2.x/3.x架构、端口、存储机制差异;吃透HDFS、YARN、MapReduce、ZooKeeper、Hive、HBase组件架构、运行流程、组件协同逻辑;掌握分布式副本容错、任务资源调度、元数据管理、分区排序、列式存储底层原理;掌握5套行业数据集业务逻辑、离线数据分析分层开发标准流程。2)实操环境目标熟练基于CentOS7.9搭建三节点Hadoop集群,掌握JDK1.8、ZooKeeper3.4.5、Hadoop3.1.2、Hive3.1.2、MySQL8.0、HBase2.2.5、Sqoop全套环境一键部署;掌握集群启停、jps进程校验、端口/权限/格式化/副本类故障定位与修复方案。3)分布式存储开发目标熟练使用全套HDFSShell指令;基于Maven搭建HDFSJavaAPI项目,实现目录创建、文件上传下载、读写、遍历、存在性校验;理解128MB数据块、三副本机架策略、FSImage+EditLog、SecondaryNameNode检查点、HDFS读写Pipeline流水线完整机制。4)MapReduce分布式计算开发目标掌握分而治之MapReduce编程范式、Writable序列化机制;独立开发Mapper/Reducer/自定义Partitioner/分组比较器;完成教材6大经典案例:词频统计、均值计算、TopN、二次排序、多表JOIN、倒排索引;精通YARN四层组件(RM/NM/AM/Container)、作业完整生命周期、资源分配逻辑。5)生态工具实操目标Hive:MySQL外置元库部署、内外/分区表创建、HQL聚合查询、JDBC连接Hive;HBase:列存储模型、Shell增删改查、JavaAPI读写、ZooKeeper联动配置;Sqoop:MySQL↔HDFS双向数据导入导出、大批量分片、字段异常处理。6.)综合项目开发目标独立完成教材5套行业离线大数据项目:原始数据HDFS存储→MapReduce多轮清洗→多维度指标统计→结果写入MySQL→SpringBoot+ECharts可视化大屏;掌握需求拆解、编码调试、项目打包、集群部署、数据分析报告全流程。7)职业素养目标熟悉电商、政务、医疗、交通、互联网大数据业务需求;养成分布式标准化编码、日志排错习惯,具备集群、代码独立故障排查能力。三、课程核心教学内容上篇Hadoop基础篇第1章绪论(授课4学时,上机实践2学时)1.数字化海量数据产生背景,大数据4V核心特征,电商/金融/医疗/交通/政务行业落地场景;单机存储计算性能瓶颈;2.GoogleGFS、MapReduce、BigTable三篇论文核心设计思路,分布式分治思想;3.Hadoop1.x/2.x/3.x架构、端口、容错、存储开销版本差异;4.HDFS/MapReduce/YARN三大核心组件分工,ZooKeeper/Hive/HBase/Sqoop生态组件作用;5.企业标准数据分析六步法:定义目标→数据收集→处理→分析→可视化→报告;重点:大数据行业场景、Hadoop3.x新特性、三大组件分工、标准数据分析流程。难点:GFS与HDFS对应关系、分布式思维建立。第2章Hadoop3.x集群与生态组件环境搭建(授课6学时,实践4学时)1.Hadoop发行版本分类,三节点集群硬件/网络规划,CentOS7.9基础命令,配套软件适配版本;2.Hadoop主从架构(NameNode/RM主、DataNode/NM从)、各守护进程职责;Derby内置元数据库单用户缺陷;3.三节点IP/主机名全局规划;JDK、Hadoop五大核心配置文件(core/hdfs/yarn/mapred/hadoop-env)参数详解;HDFS格式化、集群启停、jps校验;4.ZooKeeper集群部署、myid配置、启停命令;MySQL8.0卸载MariaDB、初始化、远程权限;5.Hive关联MySQL元库完整配置;HBase独立ZooKeeper联动配置;Sqoop驱动导入、环境配置;6.集群端口、进程丢失、权限类故障排查;重点:三节点完整集群部署、五大配置文件、ZooKeeper、Hive元库配置难点:多节点批量分发、HBase与ZK联动、集群启动异常修复中篇Hadoop核心篇第3章HDFS分布式文件系统(授课6学时,实践4学时)1.HDFS设计目标、适用/不适用场景;本地磁盘块与128MBHDFS块区别,三副本机架存放策略;2.HDFS主从架构:NameNode/DataNode/SecondaryNameNode分工;3.FSImage镜像+EditLog编辑日志,检查点合并完整流程;4.HDFS文件读取、写入Pipeline流水线、三副本容错机制;5.HDFS全套Shell命令(mkdir/ls/put/get/cat/rm/du/chmod)实操;6.Maven项目搭建,HDFSJavaAPI:目录、文件上传下载、读写、遍历、存在校验代码开发、集群打包运行;重点:HDFS读写流程、三副本、Shell与JavaAPI开发难点:SecondaryNameNode日志合并、写入流水线机制第4章MapReduce分布式计算框架(授课10学时,实践4学时)1.MapReduce论文背景、MRV1单点故障缺陷、YARN诞生意义;MapReduce适用场景与局限;Writable序列化作用;2.键值对编程范式,Map→Shuffle→Reduce完整数据流;YARN四层组件职责、MR作业完整生命周期;分区、排序、分组底层逻辑;3.Writable/WritableComparable接口、Mapper/Reducer生命周期(setup/map/cleanup)、自定义Partitioner、分组比较器;4.6大核心案例完整编码:①单词频次统计WordCount②数据集均值计算③TopN内存排序(TreeMap实现)④二次排序(自定义比较器)⑤多表JOIN关联⑥文档倒排索引(搜索引擎底层)5.Maven打包、集群提交、日志故障排查;重点:MR完整执行流程、YARN架构、六大经典案例编码难点:Shuffle底层排序分组、二次排序、TopN内存实现下篇Hadoop应用篇第5章Hive数据仓库工具(授课4学时,实践2学时)1.Hive定位、与传统数据库差异,HQL与SQL异同,自动转MapReduce任务机制;2.Hive三层架构,元数据存储;内部表/外部表、分区表存储差异;3.Hive客户端操作,库/内外表建表、本地/HDFS数据加载、聚合4.HQL;JDBC连接Hive;Sqoop+Hive联合数据导入;重点:MySQL外置元库、建表与聚合查询难点:内外表存储区别、HQL转MR执行流程第6章HBase分布式列数据库(授课6学时,实践2学时)1.HBase源自BigTable,海量结构化/半结构化存储场景;Hive与HBase场景区分,时间戳版本机制;2.HBase数据模型:行键、列族、单元格;HMaster/HRegionServer/ZK协同、Region分片负载均衡;3.HBaseShell增删改查、JavaAPI集群连接与CRUD;HBase与HDFS存储关联配置;重点:列存储模型、Shell基础操作难点:Region分片、ZK元数据管理第7章Sqoop数据迁移工具(授课2学时,实践2学时)1.Sqoop定位,关系库与HDFS互通业务场景,Sqoop1版本区别;2.import导入、export导出完整工作流,MySQL驱动依赖作用;3.Sqoop环境配置,MySQL↔HDFS双向迁移命令,大批量分片、字段类型异常处理;重点:导入导出核心命令、双向数据迁移实操难点:大批量分片、字段不匹配问题处理第8章大数据综合实战行业项目(授课8学时,实践4学时(可开设综合实训16学时))1.项目1:拉勾招聘岗位数据分析(主案例)原始CSV脏数据清洗→薪资字段拆分→多维度MR统计(城市薪资Top10、工作经验分布、学历薪资、企业招聘Top10、月度岗位趋势)→结果入库MySQL→SpringBoot+ECharts可视化大屏;2.项目2:城市空气质量数据分析PM2.5无效脏数据过滤→分时段AQI均值统计→城市空气质量指标入库可视化;3.拓展选学项目:地铁客流数据分析、临沂市医保数据分析、天猫婴幼儿用品销售数据分析;重点:大数据项目全链路、链式MR清洗统计、结果可视化对接难点:文本脏数据清洗、多MR作业串联、前后端图表接口对接第9章课程复习与综合考核(授课2学时)1.全书知识体系梳理,理论/实操/项目考核标准;2.全组件协同完整离线业务链路复盘;集群快速部署、MR代码速写、综合项目拆解实操模拟;重点:全书核心原理、集群与编程实操训练难点:多组件联动综合故障排查四、八大核心配套实验实验一CentOS+JDK基础环境部署实验实验二三节点Hadoop完整集群搭建与故障排查实验实验三ZooKeeper+HiveMySQL元库部署实操实验四HDFSShe
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 2025江苏淮安市清江浦力合产业投资发展有限公司招聘笔试笔试历年参考题库附带答案详解
- 2025广西南宁威宁集团第三季度招聘16人笔试历年参考题库附带答案详解
- 2025下半年江西九江市国信项目管理咨询有限责任公司人员招聘笔试历年参考题库附带答案详解
- 2026年保安公司市场营销计划书
- 2026年主题党日活动观影报告
- 2026年学科融入党史教学案例分享
- 智研咨询发布:中国高速公路服务区行业市场发展环境及前景研究报告
- 永新县两山食品有限公司面向社会公开招聘4名工作人员笔试备考题库及答案详解
- 2026年职业病危害现状调查技术报告
- 2026年幼儿园中秋系列活动方案设计
- 2026湖南娄底市双峰县事业单位集中招聘37人参考题库及参考答案详解(巩固)
- 甘孜州交通运输综合行政执法支队公开招聘行政执法辅助人员的(8人)考试备考试题及答案详解
- 2026年化工生产安全操作规范
- 九江市液化石油气公司九江经营分公司2026年面向社会公开招聘工作人员【13人】考试备考题库及答案详解
- 定点印刷服务采购项目方案投标文件(技术标)
- 公司安全风险管理情况汇报
- 校长专业水平测精彩试题
- 2026年河北考试物理试卷及答案
- 2026海南天然橡胶产业集团股份有限公司二级企业正副职储备人员招聘笔试参考题库及答案详解
- (正式版)T∕IAMAC 001-2025 保险资产管理行业数据分类分级指南
- 2026农作物植保员学习备考复习题库(新版)
评论
0/150
提交评论