版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
高中信息技术必修1项目九第二课时机器学习中的数据采集与预处理教学设计一、教材与学情分析1.教材地位本课选自沪科版高中信息技术必修1《数据与计算》项目九,是"了解机器学习"单元的第二课时。前一课时学生已经通过体验活动建立了对机器学习基本概念、基本流程的感性认识,知道机器可以从数据中"学习"规律并完成分类、预测等任务。本课时承接这一认识,深入到机器学习链条中最基础、最容易被忽视却决定成败的环节——数据的采集与预处理。教材以"如何让机器识别手写数字"为项目主线,本课时承担"给机器备好粮"的任务:获取数据、清洗数据、规范数据,为下一课时的模型训练与评估铺设地基。课程标准在"数据与计算"模块中明确提出,学生应"认识数据在信息社会中的重要价值,掌握数据采集、整理与分析的基本方法"。机器学习作为数据科学的高阶应用,其数据需求量、数据质量要求远超一般统计任务,恰好为落实这一要求提供了真实而有张力的情境。教学中不把数据采集讲成泛泛的"上网找资料",而是聚焦机器学习语境下的三个特质:数据规模决定学习深度,数据质量决定模型上限,数据规范性决定机器能否读懂。2.学情研判授课对象为高一年级学生。经过必修1前三个单元的学习,学生已具备Python基础语法、列表与文件操作的基本能力,能用pandas或表格软件查看一个结构规整的数据文件。但三个短板同样明显:其一,学生普遍认为"数据拿来就能用",缺少对脏数据、缺失值、异常值的感知经验;其二,对"机器眼中的数据"缺乏认识,不理解为什么图像要变成矩阵、文字要变成数字;其三,部分学生此前接触过"爬取数据""数据集"等词汇,但停留在听说层面,不能区分训练集与测试集,更不能解释为何要做归一化。基于以上学情,本课设计的核心策略是"让学生在数据上栽一个看得见的跟头":先用一组未经处理的脏数据直接训练一个简易分类器,让模型表现糟糕,制造认知冲突,再倒推预处理的每个环节,学生的技术学习便有了真实的内在动机。二、教学目标1.信息意识结合手写数字识别项目情境,说出机器学习对数据的三个基本要求(数量、质量、规范性),能列举图像、文本、数值型数据在采集后的常见处理形态,认识数据是算法价值实现的前提。2.计算思维理解数据集划分(训练集与测试集)的必要性,能用流程图描述"采集—清洗—转换—划分"的预处理链条;针对具体数据问题(缺失、异常、量纲不一、格式混乱)选择对应的处理方法,并说明选择理由。3.数字化学习与创新在教师提供的半成品代码框架上,补齐填充缺失值、剔除异常样本、归一化三个环节的关键语句,运行并对比处理前后简易模型的识别效果,体验预处理带来的性能变化。4.信息社会责任讨论数据采集中的授权、隐私与数据来源合法性问题,树立"拿数据前先问来源、用数据前先想边界"的伦理意识。三、教学重点与难点重点:机器学习数据预处理的核心环节——数据清洗、数据转换(归一化与编码)、数据集划分。难点:理解"为什么机器读不懂原始数据",即原始数据到机器可用数据之间的形态转换逻辑;理解归一化对模型收敛速度与效果的影响。四、教学准备硬件与环境:机房一人一机,预装Python3.x、numpy、pandas、matplotlib,安装并测试scikitlearn离线包;准备MNIST格式的手写数字示例图片集(100张,其中混入5张模糊图、3张尺寸不一的图)、一份含刻意污染的"鸢尾花"数据表(缺失值6处、异常值4处、单位混杂1列)、微学案与任务单、课堂学习平台账号。素材巧思:脏数据是教师课前人工"埋雷"的,每处问题都对应一个预处理知识点,学生"排雷"的过程就是完整走一遍预处理流程。五、教学过程(一)情境导入:一次失败的机器认字(约6分钟)播放40秒短视频:快递分拣中心的扫码设备对着一张褶皱、污损的快递面单月复一月地识别错误,包裹被投递到错误线路。教师提问:机器的模型没变,为什么识别会错?错误出在哪一环?学生快速讨论后,教师展示课前准备好的反面案例:用原始未处理的混杂手写图片集直接训练一个简单分类器,现场运行,准确率仅30%左右,且过程报错(图像尺寸不一致导致程序中断)。教室出现真实的"翻车"现场。教师顺势点题:机器学习的上限往往不是算法决定的,而是喂给它的数据决定的。好模型遇到坏数据,照样寸步难行。今天我们就来追问:机器吃进数据之前,数据要经过怎样的一番"料理"?设计意图:用真实可见的失败代替概念灌输,制造强烈认知冲突,让"预处理"三个字在学生心里先立起来,再谈怎么做。(二)环节一:认识机器学习数据来源与采集方式(约8分钟)1.数据从哪儿来教师抛出开放问题:如果要训练一个"识别校园植物"的程序,数据可以怎么得到?学生发言后,师生共同归纳四条路径:路径一,人工标注与实地录入,如拍摄校园植物照片并人工标注学名;路径二,传感器自动采集,如智能手环记录的心率数据;路径三,网络公开数据集,如本课使用的鸢尾花数据集、手写数字数据集;路径四,业务系统数据导出,如学校食堂刷卡记录。2.采集的底线问题教师补充追问:能不能随便爬一个网站的用户照片来用?组织学生用一分钟阅读学案中两则简短视频脚本(某App未经授权抓取人脸照片被处罚),明确三条底线:数据来源合法、获取获得授权、使用限定用途。教师强调:技术越方便,越要用规则管住手。设计意图:把"采集"从纯技术操作拉回"技术+伦理"的双重视角,为信息社会责任目标埋点,避免课堂只教手艺不教规矩。(三)环节二:动手排雷——数据清洗(约12分钟)1.任务发布每组领取"被污染"的鸢尾花数据表(iris_dirty.csv),任务单给出三段引导:任务一:用pandas读出数据并用info()和describe()查看,找出这张表里"不对劲"的地方;任务二:把发现的问题填入任务单问题登记表,注明列名、行号、问题类型;任务三:尝试用学过的代码或表格软件处理其中一个问题。2.探究过程与教师巡视要点学生通常能逐步发现四类问题:第一类,缺失值(某些花的花瓣宽度为空);第二类,异常值(某行花萼长度记录为15或500,明显违背常识);第三类,单位混杂(同一列中既有厘米又有毫米);第四类,重复记录与无关字段。教师巡视时重点引导两组典型分歧:缺失值是"删掉那一行"还是"用平均数填补"?异常值是"机器出错就改"还是"先查原因再处理"?3.集中点拨教师结合学生的处理方案讲解清洗策略的选择逻辑:缺失样本占比很小、对总体影响轻微时,删除缺失行是经济的做法;若该样本本身珍贵(如罕见病例数据),则优先考虑用均值、中位数或众数填充。异常值不能一刀切删除,要先判断是录入错误还是真实存在,真实异常有时恰恰是研究价值所在。学生在代码框架上完成补缺(使用fillna)、剔除异常(条件筛选)两段关键代码,运行对比处理前后的数据概况。设计意图:让学生在真实脏数据里"踩雷—排雷",把清洗从教师嘴里的名词变成学生手里解决过的问题。方法选择逻辑的追问,把操作层面的"会做"提升到思维层面的"会选"。(四)环节三:让机器"看得懂"——数据转换(约10分钟)1.机器眼中的世界投影展示一张0~9相同数字的手写图片与其对应的像素矩阵并排显示。教师讲解:机器不认识"这是一条曲线"这种描述,它只认识数字。一张灰度手写图片在机器眼中就是一个矩阵,每个格子是一个0到255之间的像素值。采集图像数据的本质,是把视觉信息数字化。2.归一化的必要性教师抛出问题链:问题一:鸢尾花数据里花萼长度单位是厘米(约5左右),花瓣重量的量纲如果换成毫克,数值会到几百上千,两个特征数值悬殊,会发生什么?问题二:如果一个算法依据数值大小分配"权重",数值天然巨大的特征会怎样?学生思考后,教师用一个直观例子说明:在一个衡量"学生综合素质"的模型里,身高数值180和学习习惯评分5,若不加处理直接参与运算,身高一项就把习惯评分"淹没"了。引出归一化概念:把不同量纲、不同范围的数值压缩到统一区间(如0到1),消除量纲影响,保证各特征公平参与建模。演示最常用的最小—最大归一化思想:新值等于(原值减最小值)除以(最大值减最小值)的差。现场运行两行示例代码,学生直观看到一列悬殊数据被规整到0到1区间。3.类别编码扫盲教师再抛一问:鸢尾花三个品种是文字标签(山鸢尾、变色鸢尾、维吉尼亚鸢尾),机器能直接"读"文字吗?引出标签编码:给每个类别映射一个数字。强调这并不是给品种排大小,仅仅是给机器一个可计算的代号。设计意图:"机器看不懂"是全课最抽象也最核心的认知门槛,用像素矩阵和悬殊量纲两个可视化例子把抽象道理砸实,避免归一化沦为背下来的公式。(五)环节四:训练集与测试集划分(约6分钟)教师提问:留给一块田种麦子,秋收时用这块田的产量评定种植水平,可信吗?学生立刻能答出"自己教自己考不算数"。教师顺势类比:机器学习的训练集就是"练习题",测试集就是"期末卷",若用练习原题测试,成绩虚高,说明不了真实水平。讲解划分要点:通常按约7:3或8:2随机拆分;划分要在预处理完成后进行,且要保证同一批数据来源的民族案同时只进入训练或测试一方,防止"泄题"。学生在代码框架中调用train_test_split完成划分,打印出训练集与测试集的行数,直观看见数据被一分为二。(六)环节五:综合验证——预处理前后的模型对决(约5分钟)1.接续开课的悬念教师回到开课失败的场景:刚才我们用手给坏数据"动了手术",现在机器的表现怎样?运行处理后的完整流程(清洗—归一化—划分—训练简易模型),准确率从30%跃升至95%以上,学生亲眼见证预处理的价值。2.小组归纳各组用半分钟在任务单上完成本课流程图填空:采集数据→数据清洗(处理缺失与异常)→数据转换(归一化、编码)→数据集划分→模型训练。每组派代表用一句话总结:我组认为预处理中最关键的环节是什么,理由何在。(七)课堂小结与作业延伸(约3分钟)师生共同提炼三句话:数据是机器学习的地基,地基不牢,模型再精巧也是危房;预处理不是锦上添花,而是必要工序;拿数据要合法,用数据要克制。分层作业:基础层:校园气象站一周温度数据(教师提供),完成清洗与归一化并提交处理前后的对比截图;提升层:在校园中寻找一个适合用机器学习解决的小问题,写出数据采集方案,必须说明数据来源、采集方式、预计规模与合规性说明。六、板书设计主板书依流程纵向展开:机器认字失败(导入)故障排查:采集:来源合法、方式得当清洗:缺失值、异常值、量纲混杂、重复记录转换:数值化、归一化、编码划分:训练集、测试集结论:好数据成就好模型副板书留白处用于即时记录学生提出的观点与代码片段,体现课堂生成。七、教学评价设计本课采用过程性评价与结果性评价结合。过程性评价依托任务单:问题登记表完成情况评估信息意识;流程图填空与代码补全质量评估计算思维;小组合作参与状态观察评估协作能力。结果性评价看两项硬指标:预处理代码能否独立运行通过;处理前后模型准确率的对比是否显著。同时设置开放性加分项:学生能否对清洗策略(删与补)做出合理辩护,辩护理由的合理性反映的是深层的思维品质而非操作熟练度。自评与互评通过学习平台提交,教师结合课堂观察给出反馈,重点关注"会做的学生"与"会问的学生"的差异,把评价的注意力从熟练操作引导到真实思考。八、教学反思预设本课最大的风险点是代码环节耗时失控。一旦学生在语法细节上卡
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 声纹识别门禁系统课程设计
- 初中语文美育课程设计
- 毕业课程设计中要
- 五年级道德与法治下册 第三单元 百年追梦 复兴中华 9 中国有了共产党教案1 新人教版
- 全国冀教版信息技术三年级下册新授课 十八“龟兔赛跑”卡通画 教学设计
- 小学科学教科版四年级下册1.油菜花开了教案
- 沪教牛津版(六三制一起)六下Module4Unit11《Weaternfestivals》Period1+单元教案
- 山东省郯城第三中学高一物理必修二教学设计+同步练习+单元测试
- 六年级品德与社会下册 我为祖国绘蓝图 1教学设计 科教版
- 高中语文 第二单元 一 王好战请以战喻教学设计6 新人教版选修《先秦诸子选读》
- 《AI通识》学习资料-题库-温州市继续教育-一般公需课
- 2025-2026学年湖北省武汉市武昌区人教版三年级下册期末考试数学试题 含答案
- 云南省2026年普通高等学校面向中等职业学校毕业生招生考试答案
- 六年级上册人教版道德与法治学科教学计划
- 山东省2025山东中国海洋大学财务处会计人员招聘5人笔试历年参考题库典型考点附带答案详解
- 人保培训制度
- 山河童声二声部合唱简谱
- GB/Z 36271.3-2026交流1 kV及直流1.5 kV以上电力设施第3部分:高压设施的设计和安装原则高压设施的安全
- 工业管道年度检查报告(2026新标准)
- AI驱动下个性化学习路径的自适应生成与效果评估
- 2025年教科版三年级科学上册第一单元《天气》知识清单
评论
0/150
提交评论