版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
《大数据技术导论》课程教学大纲一、课程基本信息-课程名称:大数据技术导论(项目式)-课程代码:-学分/课时:2学分/32课时(理论16课时+实验16课时)-适用专业:数据科学与大数据技术、计算机科学与技术、人工智能、软件工程及相关专业-先修课程:计算机基础、程序设计基础-后续课程:Hadoop应用开发、Spark大数据处理、数据挖掘与分析-参考教材:《大数据技术导论(项目式)》二、课程目标1.知识目标(1)理解大数据基本概念、特征及产业生态,建立数据思维;(2)掌握Linux基础操作与虚拟机部署方法;(3)掌握Hadoop生态体系(HDFS、MapReduce、YARN)及集群部署;(4)掌握Flume数据采集、HBase数据存储、Spark/Hive数据分析等组件原理与应用;(5)了解大数据安全体系及行业应用方案设计方法。2.能力目标(1)具备搭建伪分布式/全分布式Hadoop集群的能力;(2)具备使用Flume采集日志数据、HBase存储海量数据、MapReduce/Spark进行数据处理的能力;(3)具备设计大数据应用解决方案的初步能力;(4)具备备考"大数据运维师"(1+X初级)证书的基础能力。3.素质目标(1)培养数据敏感性、数据伦理意识与数据治理思维;(2)培养团队协作精神与工程实践能力;(3)培养自主学习能力与技术前沿追踪意识。三、教学内容与课时分配课程教学安排表周次项目/内容课时教学形式重点与难点1项目1:数据素养认知2讲授+讨论大数据思维、数据价值认知、1+X证书制度2项目2:准备Linux环境2讲授+实验VMware部署、Linux基本命令3项目3:Hadoop集群部署(基础)2讲授+实验集群规划、网络配置、时钟同步4项目3:Hadoop集群部署(核心)2实验SSH免密、JDK部署、Hadoop安装配置5项目3:Hadoop集群部署(高可用)
项目4:数据采集Flume(入门)2实验+讲授Zookeeper集群、Flume架构原理6项目4:数据采集Flume(应用)4实验Flume采集文件/端口数据到HDFS7项目5:数据存储HDFS/HBase(HDFS)4讲授+实验HDFS架构、Shell操作、数据块机制8项目6:数据预处理MapReduce(实战)4实验WordCount、数据清洗与转换9项目7:大数据分析Spark/Hive4讲授+实验Spark部署、RDD编程、内存计算10项目8:大数据应用创意方案设计4项目实训行业案例剖析、360°创意方案设计11项目9:大数据安全体系
总复习2讲授+研讨安全挑战、区块链技术、1+X考证要点课时小计:32课时四、各项目教学内容详述项目1:数据素养认知(2课时)1.理论内容:-大数据产生的历史背景与必然性(摩尔定律、数据爆炸)-大数据4V/5V特征与小数据的区别-大数据、物联网、人工智能的关系-数据要素市场化配置与数据伦理-大数据产业岗位体系(开发、运维、分析、治理)-1+X证书制度与课证融通路径2.实践任务:-任务1.1:数据价值认知案例分析(如"啤酒与尿布")-任务1.2:数据敏感度测试(观察生活场景中的数据)-任务1.3:数据分析师职业素养研讨3.思政融入:结合国产大数据平台发展(如阿里云MaxCompute、华为FusionInsight)培养家国情怀。项目2:准备Linux环境(2课时)1.理论内容:-Linux操作系统概述与发行版(CentOS/Ubuntu)-国产操作系统发展(麒麟、统信UOS、欧拉)-虚拟化技术原理与VMware架构2.实验内容:-任务2.1:VMware虚拟机创建(CentOS7.x推荐)-任务2.2:Linux基本操作(文件系统、vi/vim、用户权限、网络配置)-任务2.3:Xshell/Xftp远程连接与文件传输3.考核要点:能独立完成虚拟机克隆、IP静态配置、防火墙设置。项目3:Hadoop集群部署(6课时)1.理论内容:-大数据平台架构(Lambda架构、Kappa架构)-Hadoop生态体系(HDFS、MapReduce、YARN、Common)-分布式计算原理与CAP理论-Zookeeper协调服务机制(ZAB协议、选举机制、监听机制)2.实验内容:-任务3.1:集群规划(3节点:master/slave1/slave2)-任务3.2:网络配置(静态IP、hostname、hosts映射)-任务3.3:时钟同步(NTP服务配置)-任务3.4:SSH免密登录配置-任务3.5:JDK1.8部署与环境变量-任务3.6:Hadoop3.x全分布式安装(core-site、hdfs-site、mapred-site、yarn-site)-任务3.7:Zookeeper3节点集群部署-任务3.8:集群启动与大数据处理验证(pi计算或wordcount)3.重难点:配置文件参数调优、集群启动顺序、日志排查(hadoop/logs/)。项目4:数据采集组件Flume(4课时)1.理论内容:-数据分类(结构化/半结构化/非结构化)-数据采集技术体系(Sqoop、Flume、Kafka、Logstash)-Flume架构(Agent、Source、Channel、Sink、Interceptor)-Flume事务机制与可靠性保障2.实验内容:-任务4.1:Flume单机安装与配置文件编写-任务4.2:监控本地文件实时采集(execsource→filerollsink)-任务4.3:采集数据添加时间戳拦截器-任务4.4:采集端口数据(netcatsource→loggersink)-任务4.5:采集数据保存到HDFS(需配合Hadoop启动)3.重难点:Channel类型选择(MemoryvsFile)、Sink组负载均衡。项目5:数据存储组件HDFS/HBase(4课时)1.理论内容:-数据管理技术演进(关系型→NoSQL→NewSQL)-HDFS架构(NameNode、DataNode、SecondaryNameNode、Block机制、副本策略)-NoSQL数据库分类(KV型、列式、文档型、图型)-HBase架构(RegionServer、Region、StoreFile、MemStore、HLog)-HBase数据模型(Namespace、Table、RowKey、ColumnFamily、Cell)2.实验内容:-任务5.1:HDFSShell基本操作(hdfsdfs-ls/-put/-get/-mkdir/-rm)-任务5.2:HBase伪分布式/全分布式部署(hbase-site.xml配置)-任务5.3:HBaseShell操作(create、put、get、scan、delete、drop)-任务5.4:HBase应用案例(如学生成绩表、电商用户行为表设计)3.重难点:HDFS读写流程、HBaseRowKey设计原则(散列性、唯一性、长度短)。项目6:数据预处理MapReduce(4课时)1.理论内容:-MapReduce编程模型(Split、Map、Shuffle、Reduce阶段)-数据治理框架(DAMA-DMBOK)-数据清洗(缺失值、异常值、重复值处理)-数据变换(归一化、标准化、离散化、特征编码)2.实验内容:-任务6.1:WordCount词频统计(理解MapReduce流程)-任务6.2:数据清洗实战(使用Excel或MapReduce清洗日志数据)-任务6.3:数据去重与排序(SecondarySort机制简介)3.教学建议:鉴于学生编程基础差异,可提供Python或Excel作为MapReduce逻辑的模拟实现,降低门槛。项目7:大数据分析Spark/Hive(4课时)1.理论内容:-数据分析类型(描述性、诊断性、预测性、规范性)-业务理解方法(5W2H、思维导图)-数据分析指标设计(绝对数、相对数、平均数、变异指标)-Spark内存计算原理(RDD、DAG、Lineage、Lazy计算)-Hive数据仓库架构(Metastore、Driver、Compiler、ExecutionEngine)-Hive与传统数据库对比2.实验内容:-任务7.1:SparkLocal/Standalone模式部署-任务7.2:SparkShell/RDD编程实战(wordcount、filter、map操作)-任务7.3:SparkSQL与DataFrame操作-任务7.4:Hive部署(内嵌/本地/远程Metastore模式)-任务7.5:Hive实战(DDL/DML操作、分区表、桶表、JOIN查询)-任务7.6:Hive与Spark整合(SparkSQL访问Hive)3.重难点:SparkShuffle机制、Hive分区与分桶策略、HQL优化。项目8:大数据应用创意方案设计(4课时)1.理论内容:-行业大数据应用场景:-零售大数据(用户画像、精准营销、供应链优化)-交通大数据(智能调度、拥堵预测、自动驾驶)-医疗大数据(辅助诊断、疫情监测、医保控费)-农业大数据(精准种植、产量预测、溯源体系)-环保大数据(污染监测、碳排放管理)-教育大数据(个性化学习、学业预警)2.实训任务:-任务8.1:分组完成"智慧校园/智慧农业/智慧文旅"等360°创意方案-要求包含:数据来源、技术架构(采集-存储-分析-展示)、预期效益3.成果形式:PPT汇报+方案文档,培养团队协作与方案设计能力。项目9:大数据安全体系(2课时)-大数据六大安全挑战(隐私泄露、数据孤岛、算法偏见等)-大数据安全技术(脱敏、加密、访问控制、审计、区块链)-区块链技术原理(分布式账本、共识机制、智能合约)及其在大数据溯源中的应用-数据伦理与法律法规(《数据安全法》《个人信息保护法》)五、考核方式与评价标准1.成绩构成(建议)(1)平时成绩(30%):出勤、课堂表现、Linux/Hadoop实验报告(2)项目实训(40%):Flume+HBase+Spark综合实验(占比20%)+创意方案设计(占比20%)(3)期末考核(30%):1+X考证样卷笔试或综合项目答辩2.1+X课证融通教学进度与"大数据运维师"(初级)考纲对接,重点覆盖:(1)Hadoop集群部署与配置(30%)。(2)HDFS与Hive操作(25%)。(3)数据采集与处理(20%)。(4)系统监控与故障处理(15%)。(5)数据安全与备份(10%)。六、教学资源与建议1.实验环境配置(1)硬件:建议机房配置Inteli5以上、内存16GB以上(可支持VMware运行3台虚拟机)(2)软件:VMwareWorkstation16+、CentOS7.9、Hadoop3.3.x、Hive3.1.x、Spark3.3.x(3)替代方案:若硬件资源不足,可采用章鱼大数据云平台(教材配套)。2.教学方法建议(1)项目驱动:每个项目按"目标
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 变更服务协议内容确认函4篇
- 酒店预订系统维护暂停服务公告(7篇)范文
- 2025年辽宁锦州文旅有限公司招聘笔试真题
- 汉中市第一医院招聘考试真题2025
- 销售渠道拓展战略会议邀请函3篇
- 员工培训体系构建能力提升创业手册
- DB3207-T 2017-2024 自贸试验区特种设备安全积分管理规范
- 报告制作快速上手指导书
- 试用期产品使用通知7篇
- 回复明确合同违约金计算标准说明函6篇
- 农作物收割协议合同书
- 《中国金融学》课件 第1章 中国金融体系与改革开放伟大实践 -课件
- 2026年高考英语专项复习:必背近10高考英语高频词汇表
- 单位食堂食材供应及配送服务(肉类)服务方案投标文件(技术方案)
- 铝锭联营合同与合作协议
- DB22∕T 5102-2016 外墙复合保温工程技术规程
- T/CADBM 3-2018竹木纤维集成墙面
- 数控机床装调维修工综合知识理论考试题库
- 布鲁菌病课件
- (正式版)QC∕T 1207-2024 燃料电池发动机用空气压缩机
- 2024年越南自动X射线检测(AXI)行业现状及前景分析2024-2030
评论
0/150
提交评论