高中信息技术选修3教学设计-基于真实数据集的学习模式挖掘实践_第1页
高中信息技术选修3教学设计-基于真实数据集的学习模式挖掘实践_第2页
高中信息技术选修3教学设计-基于真实数据集的学习模式挖掘实践_第3页
高中信息技术选修3教学设计-基于真实数据集的学习模式挖掘实践_第4页
高中信息技术选修3教学设计-基于真实数据集的学习模式挖掘实践_第5页
已阅读5页,还剩4页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

高中信息技术选修3教学设计——基于真实数据集的学习模式挖掘实践一、教学分析本课选自浙教版2019版高中信息技术选择性必修3《人工智能初步》第三章第二节,标题为"对数据进行学习模式挖掘"。学生此前已完成人工智能基本概念、数据采集与预处理的学习,具备Python基础语法与pandas库的初步使用经验,但对"机器如何从数据中发现规律"这一核心命题仍停留在概念记忆层面。本课承担着从"会使用工具"到"理解智能本质"的桥梁作用,是落实计算思维与数字化学习与创新两大核心素养的关键课例。本班为高二选修人工智能方向的学生,共42人,思维能力分化明显。约三分之一的学生有信息学竞赛或课外编程经历,能快速上手代码实现;多数学生中等水平,能跟随模板完成任务;少数学生对抽象算法存在畏难情绪。因此本课采用分层任务与协作小组相结合的方式组织教学。二、教学目标1.信息意识:能识别真实情境中可被挖掘的数据模式,判断哪些业务问题适合用聚类、分类或回归方式求解,形成"数据背后有规律、规律可以被学习"的基本认知。2.计算思维:理解监督学习与无监督学习的区别,掌握聚类算法(以KMeans为例)的基本思想与工作流程,能用流程图和伪代码描述"初始化—分配—更新—迭代"的循环过程。3.数字化学习与创新:能基于scikitlearn库对真实数据集完成一次完整的模式挖掘实践,包括数据读取、特征选择、建模、结果可视化与解释,并对模型效果作出合理评价。4.信息社会责任:通过对用户画像、行为预测等案例的讨论,认识数据挖掘可能带来的隐私风险与算法偏见,形成审慎使用挖掘结论的态度。三、教学重难点教学重点:聚类与分类两类典型模式挖掘任务的思想差异;KMeans算法的执行流程及其可视化呈现。教学难点:理解"距离"作为模式相似性度量的意义;对挖掘结果(如簇中心、轮廓系数)进行业务层面的解释,而非停留在程序输出层面。四、教学准备机房环境安装Python3.10及以上版本,预装numpy、pandas、matplotlib、scikitlearn。教师准备三个数据集:某电商平台脱敏后的用户消费行为数据(含消费频次、客单价、浏览时长等字段)、鸢尾花经典数据集、学生体质测试成绩表。另备学习单,内含任务阶梯、伪代码填空区与结果解释引导语。广播教学系统用于投屏演示,学情反馈通过机房巡视与即时问卷收集。五、教学过程(一)情境导入:让数据自己"站队"(约7分钟)上课伊始,教师不打开任何代码,先在屏幕展示一张散点图:某校高一年级120名学生的"每周运动时长"与"体质测试总分"两个维度构成的点云。教师提问:"如果把这120名同学分成三类体育锻炼群体,你会怎么分?凭眼睛看,边界在哪里?"学生用直尺在纸质图上画分界,很快出现分歧:有人分三区,有人主张两区,边界位置也不一致。教师顺势追问:"人手画线靠的是直觉,如果有12000名学生、20个指标呢?我们能不能让计算机用一套明确的规则来做这件事?"这一环节的设计意图在于制造认知冲突。学生发现"分组"这件事人能做但说不清规则,从而自然引出"模式挖掘"的定义:从大量数据中自动发现隐含规律的过程。教师板书提炼两个核心词——模式、挖掘,并指出今天这节课的主线任务:让机器代替我们的眼睛,从真实数据中发现结构。(二)概念建构:两类截然不同的挖掘(约8分钟)教师通过对比案例建立监督与无监督的分类框架。案例一:垃圾邮件过滤器。系统事先学习过成千上万封标记为"垃圾"或"正常"的邮件,然后对新邮件做判断。这是有答案可对的任务。案例二:商户把顾客按消费习惯分成若干群体,事先并不知道存在几类、每类叫什么,只是让数据自己显现结构。这是没有标准答案的任务。学生归纳两者的区别后,教师给出准确表述:给定"带标签的数据"让模型学习输入与输出的映射,属于监督学习,典型任务是分类与回归;数据没有标签,让模型自行发现内在结构,属于无监督学习,聚类是其代表。教师强调本课聚焦聚类,因为它是"模式挖掘"这一概念最直观的体现——没有老师告诉机器答案,机器自己从数据的几何结构中悟出了规律。为检验理解,教师抛出三个快速判断题:预测明天气温、给新闻自动归类到预设主题、把脸书中的用户按兴趣聚合。学生举牌回答并说明理由,教师即时纠正"凡分组皆聚类"的常见误区——新闻归类因为有预设主题标签,属于分类而非聚类。(三)算法剖析:解剖KMeans的工作心脏(约15分钟)这是本课的思维核心区,教师采用"手工模拟先于代码实现"的策略。第一步,实物模拟。教师在磁性白板上贴出6个数据点与2个初始中心(用两枚不同颜色的磁铁代表)。请一名学生担任"算法执行者",按明确规则操作:测量每个点到两个中心的距离,把点划归较近的中心,用该颜色便签标记;全部归完组后,计算每组点的平均位置,把中心磁铁移到新位置。重复一轮,学生亲眼看到:第二次分组时有两个点改变了归属,中心再次移动;第三轮时没有任何点改变归属——算法收敛了。第二步,抽象成流程。师生共同把刚才的操作提炼为四步循环:随机选取K个初始中心;计算每个样本到各中心的距离,归入最近的一簇;重新计算每簇的均值作为新中心;若中心不再变化或变化量小于阈值则停止,否则回到分配步骤。学生在学习单的流程图框架中补全缺失环节,包括判断分支的方向箭头。第三步,理解距离与均值。教师引导学生思考:为什么用"欧氏距离"度量相似?公式上,二维空间中两点(x₁,y₁)与(x₂,y₂)的距离为坐标的平方差,即d=√[(x₁−x₂)²+(y₁−y₂)²]。这个概念不新,勾股定理早已学过,让学生意识到算法并非神秘黑箱,其零部件都源自既有知识。新中心坐标即簇内各点坐标的算术平均:x̄=(x₁+x₂+…+xₙ)/n,ȳ同理。第四步,思考K的选择与局限。教师展示同一数据在K取2、3、4时的聚类动画,提出问题:"哪个K好?算法自己能知道吗?"学生讨论后认识到:K需预设,是算法的局限之一;可借助"肘部法则"或轮廓系数等指标辅助判断,这些内容引导学生课后拓展。教师同时提及另一局限——初始中心不同可能导致不同结果,为后续实验中的多次运行埋下伏笔。(四)实践探究:对真实消费数据动手挖掘(约25分钟)任务情境:某电商平台希望对2000名活跃用户进行精细化运营,数据已脱敏,每条记录包含月消费频次、平均客单价、月均浏览时长三个特征。学生的使命是挖掘出用户群体结构,并为每一类用户起一个有业务含义的名字。任务按三层阶梯设计。基础层任务(全体必做):运行教师提供的半成品代码框架,补全三处关键语句——读取数据、调用KMeans模型并指定K值、输出簇标签。核心代码逻辑如下:先用pandas的read_csv读入数据,选取三个特征列构成特征矩阵X;再从sklearn.cluster导入KMeans,设定n_clusters取3,调用fit方法完成训练;最后通过labels_属性获得每个样本的簇编号,用matplotlib绘制按簇着色的三维或两两特征散点图。学生运行后调整K值重复观察。提高层任务(多数学生完成):尝试不同的K值(2至5),记录每次的簇内平方和(inertia_属性),绘制"K值—误差"折线图,用肘部法则为自己的K值选择给出证据说明。拓展层任务(学有余力):将其中一个特征做标准化处理(减去均值再除以标准差)后重新聚类,对比结果差异,思考"为什么量纲会影响距离计算"。教师巡视中重点关注三类典型问题:其一,部分学生直接把字符串形式的用户编号列掺入特征矩阵,导致报错,借此强调特征必须是可参与距离计算的数值;其二,有学生发现客单价数值远大于浏览时长,聚类结果几乎被客单价单一特征主导,这正是标准化必要性的活教材;其三,少数小组把K取得很大导致每簇只剩一两个人,教师引导他们思考"过度细分等于没有发现模式"。各小组将聚类结果截图粘贴到共享文档,并用一句话描述每一类用户的特征画像,例如"高频次低单价——可能以年轻学生群体为主,适合推送小额优惠活动"。教师强调:聚类输出的只是编号0、1、2,把编号翻译成业务语言,是人的工作,这正是人机协同中人的不可替代之处。(五)展示评议与伦理讨论(约10分钟)选取三个小组上台汇报。评议维度提前公布:代码是否正确运行、K值选择是否有依据、群体命名是否忠于数据特征、对局限性的认识是否到位。台下学生依据学习单上的评价量规打分,指出一处亮点和一处可改进处。教师总结时话锋一转,提出伦理议题:"平台知道了你是'深夜高频浏览但从不下单'的用户,接下来会发生什么?"学生联想到精准推送、价格歧视、信息茧房等真实经历。教师点明:模式挖掘是中性的工具,但挖掘结论的使用必须有边界——数据采集需告知与授权,画像结论不应成为歧视性定价的依据,模型决策对个体的影响应当可解释、可申诉。这既是法律要求,也是技术从业者的职业操守。(六)课堂小结与作业布置(约5分钟)师生共同回顾本课主线:从"人眼看分组"的困境出发,到认识监督与无监督学习的分野,再到解剖KMeans的四步循环,最终以一次完整的真实数据挖掘实践收尾。教师用一句话收束思想内核:所谓机器学习中的"学习",就是让参数在迭代中逐步逼近数据的真实结构。分层作业如下。基础作业:完成学习单上的流程图补全与三道辨析题。实践作业:对鸢尾花数据集独立完成一次聚类流程,提交代码与结果截图,适合全体学生巩固。挑战作业:调查生活中一个模式挖掘的应用实例(如音乐推荐、交通预测),撰写三百字分析,说明其数据来源、可能的算法类型与潜在的伦理问题。六、板书设计主板书分三栏。左栏:模式的挖掘——监督学习(有标签:分类、回归)与无监督学习(无标签:聚类)。中栏:KMeans四步循环(选中心→按距离分组→求均值移中心→收敛判断),配以距离与均值两个核心公式。右栏:实践锦囊——特征须数值化、量纲要统一、K值讲证据、结论要解释、使用守边界。副板书区域留给课堂生成内容,如学生的精彩提问与典型错误。七、教学评价设计过程性评价依托学习单四件套:概念辨析答题区、算法流程图补全区、实验记录表、小组互评量规,随堂回收按等级登记。结果性评价看实践任务的四个观测点:程序能否跑出结果、特征处理是否合理、K的选择是否有论证、画像解释是否贴合数据。评价主体多元,自评陈述思路、互评指出盲点、教师评价把握方向,三条通道的反馈在下一节课前以批注形式返还学生。八、教学反思预设本设计最大的风险点在于实践环节的时间控制与机房环境的不确定性。为此

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论