高中信息技术选修3人工智能初步3.2对数据进行学习模式挖掘教案_第1页
高中信息技术选修3人工智能初步3.2对数据进行学习模式挖掘教案_第2页
高中信息技术选修3人工智能初步3.2对数据进行学习模式挖掘教案_第3页
高中信息技术选修3人工智能初步3.2对数据进行学习模式挖掘教案_第4页
高中信息技术选修3人工智能初步3.2对数据进行学习模式挖掘教案_第5页
已阅读5页,还剩3页未读 继续免费阅读

付费下载

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

高中信息技术选修3人工智能初步3.2对数据进行学习模式挖掘教案本课面向高中选修人工智能初步的学生,核心任务不是记住几个算法名词,而是经历一次从原始数据到可用模式、再到问题解释的完整思维旅程。学生将在贴近校园生活的情境中理解“学习模式挖掘”的含义:数据不是答案本身,模型也不是黑箱魔法,二者之间需要问题定义、特征观察、训练验证、误差反思与伦理约束共同连接。课堂以“让机器从样本中发现规律”为主线,把监督学习中的分类思想作为抓手,适当关联聚类与关联规则,帮助学生建立可迁移的人工智能基础观念。教学目标设定为四层。知识层面,学生能说出样本、特征、标签、训练集、测试集、模型、准确率等概念,能区分“记忆数据”与“泛化规律”。能力层面,学生能围绕一个真实任务完成数据整理、简单特征构造、模型训练、结果评价与改进建议。思维层面,学生能把“看起来像规律”的现象放回数据证据中检验,识别过拟合、样本偏差与评价失真。价值层面,学生形成对数据权属、隐私保护、算法公平与责任边界的敏感,知道技术越强,越需要克制。教学重点落在三个关节:一是把生活问题转写成可计算问题,二是理解训练与测试必须分离,三是用证据评价模型而不是用感觉粉饰模型。教学难点在于抽离“算法神秘感”:学生容易把模型结果当成天然正确,也容易把单次高准确率当成可靠结论。破解办法是让学生亲手制造一次失败,例如训练集表现极好而测试集明显下滑,再追问原因,使过拟合从名词变成经验。课前准备强调轻量与真实。教师准备三份材料:一份匿名化校园运动与作息小样本,字段包含睡眠时长、运动时长、屏幕使用时长、次日专注自评;一份已标注的垃圾分类图片小集;一份故意设计的“有偏样本包”,其中晴天照片远多于雨天,用以诱发误判。机房环境只需离线表格工具与入门级可视化平台即可,不追求复杂框架。评价量规提前公开,包含问题清晰度、数据质量、方法匹配、解释合理、伦理意识五项。课堂导入不用宏大叙事,而从一张“反常”的体测统计图切入。教师呈现某班连续四周睡眠时长与课堂专注自评的散点,学生先凭直觉猜测二者关系,再发现个别高睡眠低专注、低睡眠高专注的散点让简单结论失效。此时抛出本课问题:如果只能依据过去的数据,怎样让计算机推测一个新同学次日专注状态较高还是较低。学生立刻意识到,这不是查表,而是让程序从历史样本中学到某种稳定倾向。概念建构采用“从操作到命名”的顺序。学生先把每一行记录称为一个样本,把用来判断的列称为特征,把要预测的结论称为标签;再把数据切成两份,一份参与学习,一份只在最终出现。教师不急着给定义,而让学生在平台中拖动字段、观察正确率变化,等到学生表达出“拿没见过的数据试试才放心”时,再明确训练集用于形成参数或规则,测试集用于估计泛化能力。准确率写作:准确率=预测正确的样本数÷参与预测的样本总数。公式不追求推导深,而要求每个符号都能回到表格中的具体格子。新授第一部分聚焦分类。以垃圾图片识别为例,教师展示特征并非只有“像素”,还可以是人工观察得到的颜色比例、边缘密度、纹理粗细、是否含瓶状轮廓。学生讨论为什么同是可回收物,易拉罐与纸箱外观差异很大;为什么透明塑料瓶在强光下会被误当玻璃。此处点明模式挖掘的前提是可表征:现实对象被转成可比较的数字或类别后,算法才有工作面。若表征漏掉关键差异,再复杂的流程也会把偏见同时学进去。新授第二部分用极简决策思路解释学习。教师不展开高深数学,而用“连续提问”的树形过程作比:屏幕使用是否超过三小时,睡眠是否少于七小时,运动是否达到二十分钟。每问一次,样本被分成更纯的小组;分到一定程度,给叶结点贴上“专注较高”或“专注偏低”。学生在纸上对十条样本手动划分,体会分裂标准会影响结果。随后引出评价冲突:若一直细分到每个训练样本都被单独记住,训练准确率可能接近满分,却无法面对新同学。这里给出板书式表达:训练误差低+测试误差高≈记住了噪声,未学到规律。新授第三部分拓展模式挖掘的家族面孔。分类回答“属于哪一类”,聚类回答“天然分成几群”,关联规则回答“常一起出现什么”。教师用图书馆借阅记录说明:不预告类别时,可把阅读兴趣相近的学生聚成若干组;已知“选修人工智能的学生也常借科幻与数学科普”,则是一条可讨论的关联线索。强调三者目标不同,不能混用评价标准。聚类没有现成标签时,不能说“准确率多少”,要看簇内是否相近、簇间是否可分、业务上是否讲得通。教学过程第一环节为情境定题,用时约八分钟。四人小组领取同一批作息数据,各自写出想预测的问题。要求问题必须满足三点:对象明确,结论可检验,变量与本组数据有关。学生常见写法是“预测学习好不好”,教师指导其改成“依据近一周睡眠、运动与屏幕时长,预测次日专注自评是否达到四级以上”。改写动作看似语言训练,实质是把价值判断转成测量任务,防止模型背负它无法证明的宏大命题。第二环节为数据体检,用时约十二分钟。小组检查缺失值、异常值、单位混用与重复记录。针对“睡眠时长”出现九点五小时与9:30两种写法,学生必须统一口径;针对运动时长出现一百八十分钟的极端值,不得直接删除,要追问是录入错误还是马拉松训练日。教师提供处理原则:能更正则更正,不能更正才标记;每次改动都留痕,写明理由。此环节评价不看谁做得快,而看谁有证据意识,因为模式挖掘最怕垃圾数据被包装成精密结论。第三环节为特征构造,用时约十五分钟。学生把原始字段加工为更有判别力的新变量,例如把睡眠时长短于七小时设为作息风险,把运动超过三十分钟设为身体激活,把屏幕时长减去运动时长得到静态净时长。教师提醒特征不是越多越好,相关但重复的变量会制造虚假稳定;与结论无关却与性别、家庭背景暗中绑定的变量可能引入不公平。学生写出三个候选特征,并说明每个特征为什么可能有效、可能伤害谁。该要求把技术选择与伦理预判放在同一张纸上完成。第四环节为训练与对峙,用时约二十分钟。各组把数据按七比三切开,先只用训练部分生成规则或调用平台内置分类器,再冻结模型,用测试部分只评一次。教师巡视时禁止学生反复调换拆分方式刷高分数,明确“测试集不能参与任何回头修改”。当某组训练正确率九成、测试不到六成时,课堂刻意停顿,让该组展示差异,其他组提出三种解释:样本太少,特征掺入答案泄露,模型过度贴合个别噪声。随后全班复现“答案泄露”案例,检验把专注自评的同义字段误当特征后结果虚高的过程。第五环节为误差解剖,用时约十五分钟。学生不用混淆矩阵术语也能完成分析:把错例分成“该高判低”和“该低判高”两类,分别观察代价。若结果用于给同学提供作息提醒,误判为偏低或许只是多一次提示;若用于评优或处分,误判会立即伤害权利。由此引出评价不能只看总分,还要看错在哪里、错向谁。教师要求学生给出一句面向非技术听众的解释,例如“本模型更像早筛提醒,不适合作为惩罚依据”,训练把概率性结论说成负责任的话。第六环节为对比聚类,用时约十分钟。去掉专注标签后,平台依据特征把学生样本聚成三堆。学生发现其中一堆对应睡眠不足且屏幕偏高,一堆对应运动充足且睡眠稳定,还有一堆混杂难名。教师追问:没有标签时,怎样知道分得合理。学生提出看组内作息是否相似、组间习惯是否拉开、能否对应到可执行建议。此处形成关键判断:聚类输出的是候选结构,不是行政身份;给群体贴标签前必须回到个体情境。第七环节为伦理复盘,用时约八分钟。围绕校园数据讨论三问:谁有权收集,收集到哪一步停止,模型出错谁负责。学生签订简化版使用约定:不预测心理诊断,不涉及家庭收入,不公开可识别个体,不把一次算法结果转成永久评价。教师强调最小够用与目的限定:能回答课堂问题的字段就到课堂为止,超出问题的数据再方便也不拿来训练。把克制写进流程,比课后再讲大道理更能进入学生行为。第八环节为成果发布,用时约十二分钟。小组用三句话汇报:我们预测什么,证据来自哪里,结果不能说明什么。优秀汇报explicitly包含限制条件,例如“样本来自单一班级、周期只有四周,所以不能推广到全校考试能力”。评价采用同伴贴签与教师复核并行,签条只写具体依据,不写“很好”“不错”。教师将常见误区集中上墙:把相关当因果,把准确率当公平,把一次拆分当结论,把模型输出当人的价值。课堂练习设计为三层。基础层给出字段,要求学生辨认样本、特征、标签并划分训练与测试;提高层给出一段虚高结果,要求找出至少两处流程漏洞;挑战层提供一份含敏感字段的数据,要求删改并说明是否仍可完成原定目标。三层都能回到同一标准:结论必须能被数据路径追踪。作业不布置大型编程,而要求拍摄家中可回收物十张,记录亮度、角度、背景,分析哪些拍摄条件会让识别变差,把课堂上的数据质量意识延伸到生活采集。板书结构突出一条链:现实问题→可测任务→干净样本→有效特征→训练生成→独立测试→误差归因→限度发布。链条下方写三句警示:没见过才是检验;高分别急着相信;能预测不等于该使用。学生在课后只需凭这条链复述,就能把握本节不是软件操作课,而是用数据作证的思维课。教学评价坚持过程性证据。量规中问题清晰度占两成,看研究对象可否复现;数据质量占两成,看处理是否留痕;方法匹配占两成,看分类、聚类、关联是否各就其位;解释合理占两成,看能否讲清为什么有效与何时失效;伦理意识占两成,看是否主动降权敏感信息。综合评定不以平台分数封顶,凡发现测试集回流训练,整组进入修正面谈,因为违背的是科学信任底线。对学有余力的学生,设置开放追问:当样本持续增长,昨日的规律会不会漂移;当学校作息制度调整,旧模型是否需要退役;当少数群体样本不足,平均准确率漂亮是否仍可能掩盖弱势误判。此类问题不追求标准答案,而促使学生看到模式挖掘不是一次性工程,而是数据、制度与人不断变化的协商。能提出退役条件的学生,已经触摸到工程责任。对学习暂时吃力学生,支架放在可触摸的类比。把训练集比作习题册,把测试集比作从未做过的月考卷,把过拟合比作背下答案却不会换数字。允许其先用纸笔完成十条样本的分类,再回到平台观察同样逻辑。评价时承认手工推算的价值,避免界面熟练度掩盖概念理解。信息技术课的公平,恰恰体现为不让设备条件替代思维表现。本课可能的生成性资源来自失败样本。若某组得到完全相反结论,教师不急于统一口径,而让全组核对拆分随机性、特征单位、标签阈值是否一致。若分歧仍存,保留为班级“未决案例”,下周引入新批次数据再裁决。学生由此理解科学态度不是课堂即时圆满,而是允许证据延期到位。教师也要准备承认示例数据本身的局限,示范如何说“目前只能支持到这一步”。与课程标准相应,本课把计算思维落在问题抽象与自动化求解之间,把数字化学习与创新落在工具选择与批判使用之间,把信息社会责任落在数据边界与后果预估之间。学科育人并不靠口号叠加,而靠每一次拆分数据时的诚实、每一次汇报限制时的清醒、每一次面对弱势样本时的停顿共同完成。课后延伸设计跨学科微项目。与体育组合作,用匿名心率与睡眠数据讨论运动恢复;与生物组合作,观察光照、水分对植物状态的简单分类;与

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论