《大数据技术导论》课程标准_第1页
《大数据技术导论》课程标准_第2页
《大数据技术导论》课程标准_第3页
《大数据技术导论》课程标准_第4页
《大数据技术导论》课程标准_第5页
已阅读5页,还剩6页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

《大数据技术导论》课程标准一、课程基本信息项目内容课程名称大数据技术导论(项目式)课程代码课程类型□公共基础课□专业基础课☑专业核心课□专业拓展课适用专业数据科学与大数据技术、计算机科学与技术、人工智能、软件工程及相关专业学分/学时2学分/32学时(理论16学时+实践16学时)开设学期第1学期或第2学期(建议具备计算机基础后开设)先修课程计算机导论、程序设计基础后续课程Hadoop应用开发、Spark大数据处理、数据挖掘与机器学习、大数据综合实训参考教材《大数据技术导论(项目式)》制定依据高等职业教育专科/本科专业教学标准、"大数据运维师"职业技能等级标准(1+X初级)二、课程性质与任务(一)课程性质本课程是数据科学与大数据技术专业的专业核心课程,是连接计算机基础与大数据专业技术的桥梁课程。课程秉持"项目导向、思维引领"理念,以九大真实项目为载体,覆盖大数据全流程技术栈,培养学生的大数据思维、基础技术能力与职业素养。(二)课程任务1.知识传授:建立大数据技术体系认知,理解Hadoop生态核心组件原理;2.技能培养:具备Linux环境配置、Hadoop集群部署、数据采集存储与分析的实操能力;3.思维塑造:培养数据敏感性、数据治理意识与数据伦理素养;4.课证融通:对接"大数据运维师"(1+X初级)证书标准,提升就业竞争力。三、课程目标与要求(一)总体目标通过本课程学习,学生能够完成从"数据素养认知"到"大数据安全体系"的完整知识建构,具备搭建伪分布式Hadoop集群、使用Flume采集数据、利用HBase存储数据、运用MapReduce/Spark处理数据的基础能力,形成数据思维与工程实践素养,为后续专业课程学习与职业发展奠定基础。(二)具体目标目标维度具体要求知识目标1.阐述大数据4V/5V特征、数据要素概念及产业生态;

2.说明Linux操作系统基础命令与国产操作系统发展现状;

3.描述Hadoop架构(HDFS、MapReduce、YARN)及集群部署流程;

4.解释Flume、HBase、Spark、Hive等组件的工作原理与适用场景;

5.概述大数据安全挑战、技术体系及区块链技术应用。能力目标1.能独立完成VMware虚拟机部署与Linux基础环境配置;

2.能规划并部署3节点Hadoop全分布式集群(含Zookeeper);

3.能配置Flume实现日志数据采集并写入HDFS;

4.能使用HBaseShell完成数据定义与操作;

5.能编写MapReduce程序或SparkRDD程序完成基础数据处理;

6.能使用HiveSQL完成数据查询与分析;

7.能设计简单的大数据应用解决方案。素质目标1.具备数据敏感性,能从生活场景中识别数据价值;

2.具备数据伦理意识,理解数据隐私保护与社会责任;

3.具备团队协作精神,能在项目中承担角色并配合完成目标;

4.具备自主学习能力,能追踪大数据技术前沿动态;

5.具备家国情怀,认同国产大数据平台发展战略。四、课程内容与学时安排(一)课程内容结构本课程采用项目化课程设计,围绕9大项目展开,每个项目包含"目标-描述-分析-准备-实施-总结-考核-评价"完整闭环。序号项目名称学时对应1+X证书能力模块项目1数据素养认知2职业素养与法律法规项目2准备Linux环境2操作系统基础项目3Hadoop集群部署6Hadoop集群规划与部署项目4数据采集组件Flume部署及应用4数据采集与传输项目5数据存储组件HDFS/HBase部署及应用4分布式存储管理项目6数据预处理组件MapReduce部署及应用4批处理计算项目7大数据分析组件Spark/Hive部署及应用4内存计算与数据仓库项目8大数据应用创意方案设计4综合应用与方案设计项目9大数据安全体系2数据安全与治理合计-32-(二)详细教学内容与学时分配项目1:数据素养认知(4学时)模块教学内容学时教学要求理论1.1无处不在的大数据(生活、商业、政务场景)

1.2大数据产生的历史必然(技术驱动、数据爆炸)

1.3大数据概念与4V/5V特征

1.4大数据与小数据的区别与联系

1.5大数据时代带来的变革(思维变革、商业模式创新)

1.6大数据处理目标(Volume、Velocity、Variety、Value)

1.7大数据产业生态与岗位体系(开发、运维、分析、治理)

1.8大数据、物联网、人工智能的关系

1.9数据要素市场化配置与数据伦理1能阐述大数据特征;能区分大数据与小数据;能列举3个以上大数据岗位;理解数据作为生产要素的意义实践任务1.1数据价值认知(案例分析:啤酒与尿布、谷歌流感预测)

任务1.2数据敏感认知(校园场景数据识别)

任务1.3数据分析师基本技能与素养研讨1能分析案例中的数据思维;能识别身边的数据资源;能制定个人大数据学习规划思政融入点:结合国家大数据战略、国产数据库发展历程(如华为GaussDB、阿里OceanBase),培养科技自信与家国情怀。项目2:准备Linux环境(4学时)模块教学内容学时教学要求理论2.1Linux操作系统概述(发展史、发行版、开源精神)

2.2国产操作系统(麒麟、统信UOS、欧拉、龙蜥)1了解Linux内核与发行版关系;知晓国产操作系统发展现状实践任务2.1Linux基本操作(文件系统、目录结构、vi/vim、用户权限)

任务2.2VMware虚拟机部署(创建、克隆、快照、网络配置)1能熟练使用20个以上Linux命令;能独立完成虚拟机安装与网络配置(静态IP、hostname、防火墙)教学条件:机房需安装VMwareWorkstation16+,建议配置CentOS7.9镜像。项目3:Hadoop集群部署(12学时)模块教学内容学时教学要求理论3.1大数据平台架构(Lambda、Kappa架构)

3.2Hadoop概述(发展史、版本演进、核心组件)

3.3Hadoop生态(Hive、HBase、Spark、Flume等)

3.4Hadoop应用场景

3.5集群概念与类型(单机、伪分布、全分布、高可用)

3.6分布式计算原理(分而治之、CAP理论)

3.7Hadoop集群架构(NameNode、DataNode、ResourceManager、NodeManager)

3.8Zookeeper集群(选举机制、监听机制、应用场景)2能绘制Hadoop生态图谱;能解释HDFS读写流程;能理解Zookeeper在HA中的作用实践任务3.1集群规划(3节点:master/slave1/slave2角色分配)

任务3.2网络配置与时钟同步(静态IP、hosts映射、NTP服务)

任务3.3通信免密(SSH密钥生成与分发)

任务3.4JDK部署(安装、环境变量配置)

任务3.5Hadoop安装与部署(解压、配置文件编写、格式化、启动)

任务3.6部署Zookeeper(zoo.cfg配置、myid设置、集群启动)

任务3.7集群处理大数据(运行PI计算或WordCount验证)4能独立完成3节点全分布式集群部署;能排查常见启动故障;能使用WebUI监控集群状态重难点:配置文件参数(core-site.xml、hdfs-site.xml、mapred-site.xml、yarn-site.xml)的理解与调优;集群启动顺序与日志排查。项目4:数据采集组件Flume部署及应用(6学时)模块教学内容学时教学要求理论4.1数据分类(结构化、半结构化、非结构化)

4.2数据采集技术(Sqoop、Flume、Kafka、Logstash、Scribe)

4.3Flume架构(Agent、Source、Channel、Sink、Interceptor、ChannelSelector、SinkProcessor)

4.4Flume可靠性机制(事务、复制/多路复用)2能区分不同采集工具适用场景;能绘制FlumeAgent内部数据流图实践任务4.1采集文件数据保存到日志(ExecSource+FileRollSink)

任务4.2采集文件数据保存到HDFS(SpoolingDirSource+HDFSSink)

任务4.3对采集数据添加时间戳拦截器

任务4.4采集端口数据保存到日志(NetCatSource+LoggerSink)2能编写Flume配置文件;能启动Agent并监控采集过程;能验证HDFS中数据写入结果教学条件:需提前启动Hadoop集群,确保HDFS可正常写入。项目5:数据存储组件HDFS/HBase部署及应用(8学时)模块教学内容学时教学要求理论5.1数据管理技术演进(关系型→NoSQL→NewSQL)

5.2HDFS架构(NameNode、DataNode、SecondaryNameNode、Block、副本机制、机架感知)

5.3非关系型数据库(KV型、列式、文档型、图型数据库对比)

5.4HBase架构(RegionServer、Region、Store、MemStore、StoreFile、HLog、Zookeeper协调)

5.5HBase数据模型(Namespace、Table、RowKey、ColumnFamily、ColumnQualifier、Cell、Timestamp)2能解释HDFS副本放置策略;能对比行式存储与列式存储优劣;能设计合理的HBase表结构实践任务5.1HDFS基本操作(Shell命令:ls、mkdir、put、get、rm、cat、tail)

任务5.2HBase部署(解压、配置hbase-site.xml、与Zookeeper/HDFS整合)

任务5.3HBaseShell基本操作(create、list、describe、put、get、scan、delete、drop)

任务5.4HBaseShell应用案例(学生信息表、电商订单表设计)2能熟练使用HDFSShell管理文件;能独立完成HBase部署;能使用Shell完成CRUD操作;能设计合理的RowKey重难点:HBaseRowKey设计原则(散列性、唯一性、长度短、查询模式匹配);HDFS小文件问题与解决方案。项目6:数据预处理组件MapReduce部署及应用(6学时)模块教学内容学时教学要求理论6.1MapReduce逻辑结构(InputFormat、Mapper、Partitioner、Shuffle、Sort、Reducer、OutputFormat)

6.2数据治理(DAMA-DMBOK框架、数据标准、数据质量、元数据管理)

6.3数据清洗(缺失值处理、异常值检测、重复值删除、格式标准化)

6.4数据变换(归一化、标准化、离散化、特征编码、主成分分析)2能描述MapReduce完整执行流程;能列举5种以上数据清洗方法;能理解数据治理体系框架实践任务6.1统计词频(WordCount:Map阶段分割+Reduce阶段汇总)

任务6.2数据清洗(使用MapReduce或Excel完成日志数据清洗)2能理解WordCount程序逻辑;能使用HadoopStreaming或Python完成简单MapReduce任务;能完成实际数据集清洗教学建议:鉴于学生编程基础差异,可提供Python版MapReduce程序或Excel模拟实现,降低编程门槛。项目7:大数据分析组件Spark/Hive部署及应用(10学时)模块教学内容学时教学要求理论7.1数据分析概述(类型:描述性、诊断性、预测性、规范性;流程:业务理解→数据认知→数据准备→建模→评估→部署)

7.2业务理解方法(5W2H、思维导图、利益相关者分析)

7.3数据认知(数据探索、统计量计算、可视化)

7.4分析指标设计(绝对数、相对数、平均数、变异指标、指数)

7.5数据建模(回归、分类、聚类、关联规则简介)

7.6Spark内存计算引擎(RDD概念、Transformation/Action操作、DAG调度、Lineage容错、Shuffle机制、SparkSQL)

7.7数据仓库Hive(架构、Metastore、HQL语法、分区/分桶、优化策略)2能描述数据分析完整流程;能设计业务分析指标体系;能解释Spark与MapReduce性能差异原因;能区分Hive与传统数据库实践任务7.1Spark部署(Local模式、Standalone模式、配置Spark环境变量)

任务7.2Spark实战(SparkShell使用、RDD编程:wordcount、filter、map、reduceByKey;SparkSQL操作)

任务7.3Hive部署(内嵌模式、本地模式、远程模式Metastore配置)

任务7.4Hive实战(DDL:创建数据库/表/分区;DML:加载数据/查询/多表JOIN;视图与索引)2能独立完成SparkStandalone部署;能编写RDD程序完成基础数据处理;能使用SparkSQL进行数据分析;能部署Hive并编写HQL完成复杂查询重难点:SparkRDD惰性求值与缓存机制;Hive分区与分桶策略选择;HQL执行计划优化。项目8:大数据应用创意方案设计(4学时)模块教学内容学时教学要求理论8.1零售大数据(用户画像、精准营销、供应链优化、推荐系统)

8.2交通大数据(智能调度、拥堵预测、路径规划、自动驾驶)

8.3医疗大数据(辅助诊断、药物研发、疫情监测、医保控费)

8.4农业大数据(精准种植、产量预测、病虫害预警、溯源体系)

8.5环保大数据(污染监测、碳排放管理、生态修复)

8.6教育大数据(个性化学习、学业预警、就业预测)

8.7政府大数据(智慧城市、政务公开、应急指挥)2能分析至少2个行业的大数据应用场景;能识别场景中的数据来源与价值点实践任务8.1智慧生活360°创意方案设计(分组完成:智慧校园/智慧农业/智慧文旅/智慧社区等方案)2能完成包含数据源、技术架构、组件选型、预期效益的完整方案;能进行PPT汇报与答辩成果要求:方案需包含数据流程图(采集→存储→处理→分析→展示)、技术选型说明、可行性分析。项目9:大数据安全体系(4学时)模块教学内容学时教学要求理论9.1大数据应用面临的六大挑战(隐私泄露、数据孤岛、算法偏见、安全漏洞、伦理风险、人才短缺)

9.2大数据带来的机遇(产业升级、治理现代化、科学研究范式变革)

9.3大数据安全(安全体系框架:物理层、网络层、系统层、数据层、应用层、管理层)

9.4大数据安全技术(身份认证、访问控制、数据加密、数据脱敏、安全审计、隐私计算)

9.5区块链技术(分布式账本、哈希链、共识机制、智能合约、在大数据溯源中的应用)1能列举大数据安全威胁;能描述数据脱敏与加密原理;能理解区块链不可篡改特性实践任务9.1建设大数据安全体系方案设计(针对某行业场景设计安全策略)1能识别场景安全风险;能设计包含技术与管理措施的安全方案思政融入点:结合《数据安全法》《个人信息保护法》,强调数据安全法律责任与职业道德。(三)学时分配汇总表项目理论学时实践学时小计占比项目1数据素养认知2026.25%项目2准备Linux环境1126.25%项目3Hadoop集群部署24618.75%项目4数据采集Flume2249.4%项目5数据存储HDFS/HBase22412.5%项目6数据预处理MapReduce22412.5%项目7大数据分析Spark/Hive22412.5%项目8应用创意方案设计22412.5%项目9大数据安全体系1126.25%合计161632100.0%*注:机动学时用于国庆/中秋等假期调休、阶段性复习或1+X考证辅导。*五、教学实施建议(一)教学条件项目具体要求师资要求主讲教师应具备大数据相关领域企业工作经历或1+X证书培训讲师资格;熟悉Hadoop生态组件部署与调优;具备数据治理或数据分析项目经验实训环境1.硬件:机房PC配置Inteli5以上CPU、16GB以上内存、100GB以上硬盘(支持同时运行3台虚拟机)

2.软件:VMwareWorkstation16+、CentOS7.9、Hadoop3.3.x、Zookeeper3.7.x、Flume1.11.x、HBase2.4.x、Spark3.3.x、Hive3.1.x

3.替代方案:章鱼大数据云平台(教材配套,支持浏览器访问,降低硬件要求)教学资源教材配套资源:微课视频、PPT课件、实验指导书、数据集、配置文件模板、1+X考证样卷(二)教学方法与手段1.项目驱动教学法:每个项目按"目标-描述-分析-准备-实施-总结-考核-评价"七环节组织实施,强化"做中学";2.案例教学法:引入"啤酒与尿布"、谷歌流感预测、Netflix推荐系统等经典案例阐释数据思维;3.可视化教学:使用动画演示HDFS写流程、MapReduceShuffle过程、SparkDAG调度等抽象机制;4.分层教学:基础薄弱学生先用Excel完成数据分析任务,再过渡到HiveSQL;编程能力强学生可尝试Java/Python编写MapReduce/Spark程序;5.线上线下混合:利用教材配套微课视频支持课前预习与课后复习,课堂聚焦实操指导与问题排查;6.企业专家讲座:邀请大数据平台运维工程师或数据分析师开展1-2次行业前沿讲座。(三)教材与参考资料1.主教材:大数据技术导论(项目式)2.参考教材:3.在线资源:六、课程考核与评价(一)考核方式采用过程性评价与终结性评价相结合的方式,注重实践能力考核与1+X证书融通。课程考核信息表考核项目权重考核内容评价标准平时成绩20.0%出勤、课堂表现、课后作业全勤10分,课堂互动5分,作业质量5分项目实训40.0%Linux/Hadoop实验报告(10%)

Flume+HBase综合实验(15%)

Spark/Hive综合实验(15%)按实验完成度、报告规范性、故障排查能力评分项目设计20.0%大数据应用创意方案(项目8)方案完整性(40%)、技术可行性(30%)、汇报表现(30%)期末考核20.0%1+X考证样卷笔试或综合项目答辩按1+X初级标准或答辩评分表评定(二)1+X课证融通实施-融通内容:课程项目3-7直接覆盖"大数据运维师"(初级)80%以上考点;-融通方式:学生完成课程学习后,可直接参加1+X证书考试;-成绩认定:获得1+X证

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论