高中信息技术选择性必修1第20课大数据时代数据的组织教学设计_第1页
高中信息技术选择性必修1第20课大数据时代数据的组织教学设计_第2页
高中信息技术选择性必修1第20课大数据时代数据的组织教学设计_第3页
高中信息技术选择性必修1第20课大数据时代数据的组织教学设计_第4页
高中信息技术选择性必修1第20课大数据时代数据的组织教学设计_第5页
已阅读5页,还剩4页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

高中信息技术选择性必修1第20课大数据时代数据的组织教学设计一、教材与学情分析本课选自浙教版2019高中信息技术选择性必修1《数据与数据结构》,是"大数据时代"单元中承上启下的一课。学生在此前已经掌握了线性表、树、图等基本数据结构,理解了算法效率的度量方法,但所处理的数据规模始终停留在课堂可模拟的"小数据"层面。本课要解决的核心问题是:当数据量从千级、万级跃迁到亿级、百亿级时,原有的组织方式为何会失效,工程界又是如何通过分布式文件系统、分布式数据库和并行计算框架重新组织数据的。高二学生的抽象思维能力已经能够支撑"分而治之""副本容错"这类工程思想的理解,但他们对"集群""节点""分片"等概念毫无直观经验,容易把分布式存储误解为"把硬盘做大"。因此,本课的关键不在于灌输术语,而在于制造认知冲突:先让学生亲手体验单机处理大数据的失败,再引导他们自己"发明"拆分与协作的方案,最后与HDFS、HBase的真实设计对照,体会工程智慧从何而来。二、教学目标信息意识方面,学生能够意识到数据规模是推动数据组织方式变革的根本动力,能判断一个数据处理场景是否属于大数据场景,并能说出大数据"4V"特征中"量大"和"速度快"对存储组织的具体压力。计算思维方面,学生能够运用分解与抽象的方法,把"存储一个超大文件"的问题分解为"切块、分发、定位、容错"四个子问题;能够用键值对的视角看待非结构化数据的索引方式;能够通过对比实验估算哈希取模分片的均衡性。数字化学习与创新方面,学生能够使用Python模拟一个微型的三节点分布式存储系统,完成文件切块、分发、元数据登记和单节点故障后的数据恢复,在动手过程中理解NameNode与DataNode的职责划分。信息社会责任方面,学生能够认识数据中心能耗、数据安全与隐私保护在大数据组织设计中的约束作用,初步形成"技术方案必须同时回答效率问题与责任问题"的工程伦理意识。三、教学重难点教学重点是分布式文件系统的基本架构思想,即主从结构、数据分块、副本机制三者如何协同解决海量数据的可靠存储问题。教学难点有两处。其一,元数据与数据分离的设计动机,学生很难理解"为什么查地址比存数据更重要",需要通过快递员只记驿站地址不记包裹内容的类比来打通。其二,副本机制中的成本与可靠性权衡,学生容易走向"副本越多越好"的直觉误区,需要通过故障概率的量化估算来矫正。四、教学准备硬件方面,机房学生机四十台,教师机一台,局域网畅通,投影仪一套。软件方面,每台学生机预装Python3.x环境及课堂教学辅助包,包内含三个脚本:切块分发模拟器split_store.py、元数据查询模拟器locate.py、故障恢复模拟器recover.py。教师另备一个约1.2GB的测试视频文件和一段约五百万行的模拟日志文本,用于课堂演示单机处理的瓶颈。五、教学过程(一)情境导入:一次"读不出来"的实验上课伊始,教师不讲课,只做一件事:在教师机上当场用Python的read()方法一次性读入那个1.2GB的视频文件,再尝试读入一个教师课前合成的8GB文件。前者耗时明显,后者直接抛出MemoryError。投影上的红色报错停在屏幕上,教室里安静了几秒。教师提问:"我的程序没有写错,为什么读不了?"学生很快能答出"内存不够"。教师追问:"内存不够,加内存行不行?加到多大才够?如果明天文件变成800GB呢?"这一连串追问把学生的思路从"硬件不够"逼向"方法错了"。教师板书一句话:当数据大到一台机器装不下、算不动的时候,问题就不再是数据问题,而是组织问题。这句话就是本课的课题——大数据时代数据的组织。设计意图是用一次真实的失败制造认知冲突。报错信息比任何讲解都更能让学生信服:小数据时代"读进来再处理"的默认做法,在大数据面前是行不通的。(二)探究一:如果让你来设计——把大问题拆开教师布置任务:假设学校要为全市高考监控系统存储一年份的视频,总量约2PB,单机硬盘最大20TB,请你和同桌用五分钟时间在纸上画出你的存储方案草图。要求回答四个问题:文件怎么切、切完的块放哪、怎么记住每块放在哪、某台机器坏了怎么办。五分钟后,教师选取三份典型的学生方案投影讲评。第一类方案是"买一台超级大的机器",教师用价格和单机故障风险两点否决,并指出这正是工程界二十年前放弃垂直扩展、转向水平扩展的原因。第二类方案是"把文件切成小块分开存",教师给予充分肯定,这就是分块思想的雏形。第三类方案中有学生画出"把每块多存一份",教师当场表扬:你们在没有学过任何理论的情况下,独立发明了副本机制。教师顺势把学生的零散想法整理成四个关键词写在黑板上:切块、分发、定位、容错。随后揭示:真实工业界的HDFS,做的正是这四件事。架构中的NameNode负责回答"每块在哪",DataNode负责真正存块,默认块大小128MB,默认副本数为三。此处安排一个细节对比:为什么块这么大,不是4KB也不是4GB?教师引导学生推理:块太小则元数据爆炸,NameNode记录一亿个块的位置本身就是灾难;块太大则并行度不够,坏一块重传成本极高。128MB是元数据开销与并行效率之间的平衡点。学生由此体会工程设计中"没有最优、只有权衡"的思维方式。(三)探究二:动手模拟微型分布式存储学生两人一组,打开split_store.py。脚本模拟三个数据节点D1、D2、D3,输入任意文本文件后,程序按固定大小切块,用哈希取模的方式决定每块的去向,同时生成一个元数据清单,记录"块编号—所在节点"的对应关系。第一步,学生用程序自带的样例日志文件运行一次,观察三个节点各自收到的块数。教师巡视中提示学生记录数据,为下一步的均衡性讨论留证据。第二步,学生修改脚本中的副本参数,从1改为2,重新运行,观察磁盘占用和元数据量的变化。学生会发现磁盘占用翻倍,这正是副本机制的代价。第三步,运行recover.py,模拟D2节点宕机。当副本数为1时,存储在D2上的块永久丢失,系统报错;当副本数为2时,系统自动从其他节点的副本中恢复D2上的数据,并成功补齐新的副本。学生在两次运行的强烈反差中,亲眼看到"冗余即可靠"这四个字的分量。动手环节约十五分钟。教师在每个小组间穿行,重点关注两类学生:一类是只点运行不看输出的,要求他们大声读出元数据清单中的三行记录;另一类是提前完成的小组,布置思考题:如果节点从三个变成十个,哈希取模的公式要改吗?改了之后原来存好的块会怎样?这一问题为后续介绍一致性哈希埋下伏笔,但不要求当堂解决。(四)探究三:从文件到数据——HBase与键值组织教师抛出新情境:文件存好了,但业务要回答的问题是"用户张三过去三十天点击过哪些商品",这还能靠切文件解决吗?学生讨论后会意识到:文件系统只管"把大块存好",不管"快速查一条记录"。教师由此引入分布式数据库的概念:数据不再以"文件"为单位组织,而是以"键—值"为单位组织。行键负责定位,列族负责归类,同一张逻辑表被水平切分成多个Region分散在不同节点上。教师用班级通讯录作类比:传统方式是把全班名单印在一页纸上,一个人保管;大数据方式是把名单按姓氏拆成二十六册,分给二十六个人保管,另有一个总索引记着"李"字册在谁手上。查"李四"时,先问总索引,再直接找对应保管人,绝不翻遍全班。为加深理解,教师组织一个一分钟的快问快答:全国快递单号查询适合用单台数据库存储吗?为什么?学生应能从数据量、并发量、可用性三个角度给出"不适合"的理由。(五)探究四:算得快——并行计算的组织思想存储解决"放得下",计算解决"算得动"。教师投影一行式思想:把计算搬到数据旁边去,而不是把数据搬到计算旁边来。教师用"统计全年二十亿条日志中每个词出现的次数"为例,拆解MapReduce的两个阶段:Map阶段,每台机器只处理自己硬盘上那一块日志,各自输出中间结果;Reduce阶段,按照键把中间结果归类汇总。教师强调一个反直觉的要点:整个过程中没有一台机器读过全部数据,但最终答案精确无误。这正是"分而治之"在大数据时代的完整形态。随后学生完成一个纸面小练习:给定四台机器和一份按行切块的词频统计任务,各自写出Map输出的样例键值对,再描述Reduce如何聚合。通过手写一两个键值对,抽象框架落到了纸面上。(六)权衡与责任:好方案的另一副面孔教师展示两组数字:一个中型数据中心一年的耗电量相当于数万户家庭;副本数为三意味着每存一份真实数据要付出三倍的硬件与电力成本。教师提问:副本能不能减到二?什么数据可以少存副本,什么数据一份都不能丢?学生讨论后应能给出分层的答案:可再生的中间结果可以低副本,原始数据和涉及人身财产的数据必须高副本加异地容灾。教师再补一问:数据分散在一百台机器上,权限怎么管?删一条涉及个人隐私的记录意味着什么?学生由此意识到,数据的组织方式同时也是数据安全与隐私保护的第一道闸门。技术能力越强,越需要制度与伦理兜底。(七)课堂小结教师带领学生回顾黑板上的主线:一次读文件的失败,逼出切块、分发、定位、容错四个动作;四个动作落地为HDFS的主从架构;按记录快速查询的需求催生了键值式分布式数据库;算不动的压力催生了"移动计算而非移动数据"的并行框架。整条线索只有一句话:数据组织的每一次变革,都是数据规模逼出来的,而每一种方案都在效率、成本、可靠性之间做取舍。学生用一句话完成课堂出门条,写在便签上交给教师:如果数据规模再扩大一千倍,你认为今天学的哪种设计会最先撑不住?教师回收后快速浏览,以此诊断本课目标的达成度,也作为下节课的导入素材。六、板书设计主板书居中指一条主线:装不下——切块;找不到——元数据;会坏掉——副本;算不动——移动计算。左侧副板书列四个核心词:切块、分发、定位、容错。右侧副板书留一小块区域,记录课堂演示中的两组数据:副本数与磁盘占用的对应关系、节点数与单节点负载的对应关系。七、作业布置基础作业:绘制HDFS写一份300MB文件的完整流程图,标注块的划分数量、每个副本的存放节点策略以及客户端与NameNode的两次交互。拓展作业:调查一种真实的大数据组织技术(如对象存储、列式存储或分布式搜索引擎),用三百字说明它解决的核心问题与本课所学的哪一条思想相通。挑战作业:修改split_store.py,让节点数从三变为四时,统计需

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

最新文档

评论

0/150

提交评论