版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
高中信息技术选择性必修《使用K均值算法进行聚类》教学设计一、教材与学情分析本节内容选自人教中图版(2019)高中信息技术选择性必修4《人工智能初步》第二章"机器学习初步"的第四节。教材在前面三节中分别介绍了人工智能的基本概念、机器学习的基本流程以及监督学习中的分类方法,学生已经初步建立了"数据—模型—预测"这一机器学习的基本认知框架。K均值算法是学生接触的第一个无监督学习算法,它不需要人工标注的类别标签,而是让数据"自己说话",通过迭代计算把相似的数据对象聚合为一类。这一节承担着承前启后的任务:向前,它是对"有标签学习"认知的突破;向后,它为后续学习神经网络、深度学习中的特征提取奠定思想基础。授课对象为高二年级选修人工智能模块的学生。从知识储备看,学生已经掌握Python的基本语法,能够使用NumPy数组进行简单运算,多数学生借助图形化界面操作过分类任务,对"训练集""测试集"等术语不陌生。从认知特点看,高二学生的抽象逻辑思维迅速发展,但对"迭代收敛"这类动态过程的理解仍需要直观支撑;他们对聚类存在朴素的经验认识,比如知道"物以类聚"、超市货架按品类摆放,却很难把这种经验上升为可计算的算法描述。从困难点预测来看,学生容易在三处遇到障碍:一是"距离"的数学化表达,即为何用欧氏距离度量数据对象的相似程度;二是"迭代"的机制,即簇中心为何会"移动"并最终稳定;三是初始中心选择的随机性对聚类结果的影响,即同一算法为何可能产生不同结果。基于以上分析,本课的教学设计取向是:以真实问题情境驱动,以可视化手段化解抽象,以试错探究替代结论灌输,让学生在"做算法、改算法、评算法"的过程中形成对K均值的完整认识。二、教学目标1.信息意识:能够识别生活中真实存在的聚类问题,如用户分群、图像分割、新闻主题归类,理解"无监督"意味着数据没有现成答案,算法的价值在于发现数据的内在结构。2.计算思维:能够用自己的语言描述K均值算法的步骤——随机选定K个初始中心、计算每个数据对象到各中心的距离、归入最近的一类、更新簇中心为均值、重复直至收敛;能够把这一流程转化为伪代码乃至简单程序;能够分析算法中初始中心、K值、距离度量三个要素对结果的影响。3.数字化学习与创新:能够使用Python(或图形化机器学习工具)对一组标准化数据执行聚类,将结果以散点图形式可视化,并借助轮廓系数或组内平方和原则对聚类质量作出初步评价。4.信息社会责任:通过讨论"用户画像与隐私边界""聚类结果可能带来的标签化与偏见"等议题,认识算法应用中的人文维度,树立负责任地使用智能算法的态度。三、教学重难点教学重点:K均值算法的基本流程;距离度量与均值更新的含义;用简单的数据集完整"手工走一遍"算法过程。教学难点:迭代收敛机制的理解;初始中心随机性导致结果不确定这一现象的解释;"如何确定合理的K值"这一开放性问题。四、教学策略与方法本课采用"问题链+探究任务"双轮驱动的设计。问题链保证思维的阶梯性,探究任务保证认知的具身性。具体教法包括:情境导入法(用校园真实问题引出课题)、直观演示法(用动态散点图演示簇中心的移动轨迹)、小组合作探究法(发放纸质数据卡,学生手工执行两轮聚类)、对比实验法(固定数据改变初始中心,对比结果差异)、讨论评议法(围绕K值选择与算法伦理展开发言)。教学用具包括多媒体一体机、预装了Python与scikitlearn环境的机房电脑、磁贴坐标板或印有网格坐标纸的数据卡、簇中心标记片若干。课前教师将本课所需的代码包与数据文件推送至各班学习平台,并对Lesson文件做了逐步注释化处理,保证不同基础的学生均有切入点。五、教学过程(一)创设情境,提出问题(约6分钟)上课伊始,教师在大屏幕上展示一组真实但不泄露个人信息的数据:来自学校篮球社团报名表的五十名同学的"百米成绩(秒)"与"立定跳远成绩(米)"。教师讲述背景:"体育组王老师要把这五十名同学分成三个训练梯队,分别为速度型、力量型与综合型。王老师没有给任何人贴标签,他只有这两列数据,他希望'分得公平、分得客观'。同学们,如果你是王老师,你会怎么分?"学生自然会回答:"看两个项目综合成绩""把成绩相近的放一组""先跑个平均数再上下分"等。教师顺势追问:"什么叫'相近'?两个人的数据摆在一起,是成绩越像越该在一组吗?如果我们有一百名同学、一万名同学呢?手分还行吗?"一连串追问把学生推向认知边缘,他们意识到:自己凭直觉在做的正是"聚类",但直觉做法缺乏可操作、可推广的步骤。此时教师板书课题:使用K均值算法进行聚类——让数据自己找到同伴。设计意图:问题来源于学生熟悉的校园场景,无标签、量化、需要分组的三个特征精准对应无监督聚类的本质;问题链的"相近—客观—规模"三级追问制造认知冲突,激发学习动机。(二)经验重构,理解核心概念(约7分钟)教师引导学生在坐标纸上标出五十个数据点(简化版只取前二十个)。学生观察散点分布后很快发现图形上大约有三个"团"。教师抓住这一发现提问:"这里没有出现任何'第几梯队'的标签,我们凭什么说它们是一类?"学生答:"因为它们之间离得近。"教师追问:"什么叫近?怎么把'近'写成一个数?"由此师生共同得到距离的想法:把每个同学看作平面上的一个点(x,y),任意两点之间的远近用直线距离来表示。教师指出数学家把这种度量称为欧氏距离,距离越小代表两人两项成绩越接近,越应该分在同一组。随后教师引出"中心"的概念:"如果每个梯队都有一个'标准模板'——可能是虚拟的、不存在的选手,每个同学都会去'投奔'离自己最近的那个模板,这个模板就用这一组所有人两项成绩的平均值来表示。这个平均值所在的位置,就叫这个簇的中心。"板书三个关键词:距离、中心、均值。至此,算法的三个核心概念在学生的经验土壤里完成了播种。设计意图:用"标点—观形—问近—求数"四步让学生自主逼近距离度量的思想,避免直接给出公式造成的脱域感;"投奔最近模板"的比喻为后续"分配"步骤埋下伏笔。(三)手工聚类,亲历算法流程(约12分钟)这是本课的核心探究环节。全班分成八个小组,每组领取一张印有网格坐标的简化数据卡(含十个数据点)和三枚不同颜色的可移动中心标记片。教师在屏幕上展示任务单。任务一:把三枚中心片任选位置放上坐标纸,作为初始中心。任务二:测量或估算每个数据点到三个中心片的大致距离,把点归入最近中心所属的那一类,用彩笔描点作记号。任务三:分别计算每一类中所有点的两个坐标的平均值,把中心片移动到这个新的位置。任务四:重复任务二与任务三,直到中心片"不再移动"或移动幅度极小时停下来,数出此时每个簇中有几个点。各组操作时,教师巡视并相机提问。在某个中心片被移来移去的小组,教师问:"中心为什么动?"学生答:"因为成员换了。"教师再问:"成员为什么换?"学生答:"因为中心换了。"教师点评:"这就是迭代——中心决定分组,分组又反过来决定中心,二者像两个互相拉扯的舞伴,跳到最后达到平衡,我们就说算法收敛了。"在另一个刻意把三个中心片挤放在左上角的小组,教师引导他们记录最终分组,并留下悬念,为后续对比实验做准备。小组汇报环节,教师请两到三组展示他们的最终结果图,学生惊讶地发现:同样的十个点、同样的算法,不同的组却得到了不尽相同的划分。教师暂不解释,将这份"疑惑"保留到下一个环节。设计意图:把抽象算法降维成可动手操作的棋类游戏,让学生"身体先行地"经历分配—更新—收敛的完整迭代;故意引导若干组使用偏移较大的初始中心,为下一环节的对比实验埋设认知钩子;"舞伴"比喻把迭代收敛机制具象化。(四)对比实验,剖析算法特性(约8分钟)教师请学生回到遍布中心的电子平台,打开课前下发的交互式演示程序。该程序在同一个数据集上运行K均值,并分别以四种不同的初始中心组合重跑,结果用不同颜色实时绘出。学生观察发现:大多数情况下聚类结果相同且合理,但偶尔会出现"两个中心抢同一团、另一个团被强行拆开"的糟糕情况。教师组织讨论:"大家都说算法是精确的、确定的,为什么我们的K均值有时给出不同答案?"引导学生归纳:算法的每一步计算都是确定的,但起点——初始中心——是随机挑选的,糟糕的起点可能让算法陷入并不理想的最终状态,术语叫做"局部最优"。教师补充工程实践中的一种常用对策:多次随机取初始中心、多次运行取效果好的一次,或者采用改进的初始化方法让初始中心彼此尽量离得远,教材提到的K均值加加(kmeans++)正是这一思想的产物。紧接着教师抛出K值的问题:"王老师的五十名学生,到底分成几组才合适?三组还是四组?"学生意见不一。教师演示同一份数据在K取2、3、4时的聚类图,并展示组内平方和随K变化的折线:随着K增大,每个点离自己中心的平均距离总是越来越小,但下降幅度在某个拐点之后明显放缓,这个拐点是常被参考的选择点。教师强调:"这条折线只提供参考,真正的答案常要结合实际场景。篮球场上有几个教练,就只能带几个梯队——技术的答案经人使用才有意义。"设计意图:让算法自己"暴露缺点",比教师口头陈述"K均值有随机性"更有说服力;通过对比归纳建立"局部最优"概念;通过K值讨论破除"算法存在唯一标准答案"的迷思,渗透工程权衡意识。(五)代码实现,从原理走向实践(约8分钟)教师在大屏幕上分段展示用Python调用机器学习库完成聚类的代码,每一段都对应手工操作的某个步骤,帮助学生在两种语言之间建立映射。第一段:读入数据,构成二维数组——对应学生摆到坐标纸上的那些点。第二段:创建聚类模型,指定簇的个数K=3——对应拿出三枚中心片。第三段:调用拟合方法——对应反复"挪中心、重分组"直至收敛。第四段:读取每个点所属簇编号与簇中心坐标——对应汇报结果。第五段:用散点图把不同簇画成不同颜色,并用星号标出簇中心——对应结果展示。随后学生在自己的电脑上运行教师提供的半成品代码,完成三项填空式任务:读取数据文件;把K设定为3并查看着色结果;把K改成4再运行一次,截图对比与同伴讨论哪一种划分更合理。学有余力的学生尝试把聚类对象换成鸢尾花数据集中的两列特征,或把两个特征换成自己编的小数据,观察可视化效果。教师提醒学生关注运行后命令行中簇中心的数值是否与图上星号位置吻合,强化"程序结果与算法原理一一对应"的意识。设计意图:代码呈现遵循"步骤映射原则",每一行代码都能在人体可感的操作中找到对应物,防止学生把库函数当成黑盒咒语;分层任务保底又拔尖;替换数据的挑战任务为能力较强的学生打开探究空间。(六)拓展应用,审视算法价值(约3分钟)教师展示聚类技术的三个应用剪影:电商平台把消费者按购买习惯分群以推荐商品;医学影像把像素按灰度与空间位置聚类以勾画病灶轮廓;城市管理部门把共享单车骑行记录聚类以找出潮汐通勤热点。同时抛出一个值得警惕的问题:"当平台把你'聚'进某一类之后,你看到的世界会不会也被限定在这一类里?聚类带来的标签化可能造成什么后果?"学生简短发表看法,教师总结立场:"聚类是认识世界的工具,不是定义人的标尺。作为未来的算法设计者,你们要写好代码,更要守住边界。"设计意图:从课堂小数据走向社会大应用,同时埋设伦理思考,回应课程育人要求。(七)归纳小结,布置分层作业(约1分钟)教师用思维导图师生共同回顾:目的是把无标签数据按相似性分组;核心是"距离定归属、均值定中心";机制是分配与更新交替迭代直至收敛;注意点是初始中心影响结果、K值需要依情境选择。板书最终整理为一张算法流程图。六、作业设计基础题:用自己的话写出K均值算法的五个步骤,并说明"均值"一词体现在哪里。进阶题:手工完成一份含8个二维点的两轮聚类,标出每轮簇中心的坐标。探究题:选做——搜集生活中一个可以建模为聚类问题的场景,写出数据来源、特征选择和你猜测的K值,有条件的同学用程序跑一遍并附结果截图。七、板书设计课题居中:使用K均值算法进行聚类。主板书自上而下为五格流程:选K个初始中心→按距离分配→按均值更新中心→是否收敛→输出分组,末步画箭头回连第二格表示迭代。副板书左侧列三个关键词:距离、中心、均值;右侧列两
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 2026年粉尘爆炸事故专项应急预案
- 校园网络安全教育完整版课件
- 合规转利润:降本增效全指南(2026)《GBT 39372-2020皮革 物理和机械试验 伸长率的测定》
- 景观照明安装施工方案
- 电力设备新能源行业市场前景及投资研究报告:AIDC机架母线(Busbar)铜排液冷、高压直流
- 2026年浙江省人教版初中语文八年级上册第12单元文言文阅读测试卷
- 辽宁省鞍山市海城市高级中学2026-2027学年高二上学期开学物理试题(含答案)
- 河南省濮阳清丰县实验初级中学2025-2026学年八年级上学期第三次月考物理试卷(有答案)
- 妇科护理特色及专科新进展
- 老年痴呆家庭护理论文答辩
- 出版从业考试财务知识点及答案解析
- 耳鼻喉科感染预防综合措施
- 喷漆设备租借合同范本
- 2025年斗轮机司机题库及答案(可下载)
- 食品生产车间三级安全培训课件
- (2024版)人教版 小学体育与健康 一年级全一册 教学设计
- 2024版2025秋季新人教版三年级上册数学全册核心素养教案教学设计
- 红细胞计数课件
- 二手手机回收协议合同
- 重症凝血病标准化评估中国专家共识(2025版)
- 《俗世奇人》整本书导读课件
评论
0/150
提交评论