高中信息技术人工智能初步K-均值聚类算法教学设计_第1页
高中信息技术人工智能初步K-均值聚类算法教学设计_第2页
高中信息技术人工智能初步K-均值聚类算法教学设计_第3页
高中信息技术人工智能初步K-均值聚类算法教学设计_第4页
高中信息技术人工智能初步K-均值聚类算法教学设计_第5页
已阅读5页,还剩6页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

高中信息技术人工智能初步K-均值聚类算法教学设计本教学设计面向高中信息技术课程"人工智能初步"模块,聚焦"使用K-均值算法进行聚类"这一核心内容,依据课程标准中"通过对典型人工智能算法的分析,了解其基本思想,并能动手实现或体验简单的智能应用"的要求设计,适用于一个课时四十五分钟,亦可拓展为两课时连排的项目探究课。一、教学背景分析(一)教材地位与内容结构本节课位于第二章"人工智能技术基本原理"的第四节。此前学生已经学习了人工智能的基本概念、知识表示与推理的基本思路,对"机器如何获得智能"有了初步认识。本章此前内容偏重符号主义路线的思路,而从本节开始,课程的重心转向数据驱动的方法。聚类是无监督学习的入门内容,K-均值算法又是聚类中最经典、最直观、数学门槛最低的算法,它既是理解后续分类(监督学习)内容的对照参照,也是学生第一次完整地经历"给定数据、机器自己发现规律"的全过程,具有承上启下的关键地位。教材在本节安排了生活化的聚类情境、K-均值算法的步骤描述以及基于编程工具的实践活动。教师在处理教材时需要注意:教材对算法步骤的描述是"静态陈述式"的,学生容易背诵而难以理解;真正要让学生获得的是"为什么这样迭代会收敛到合理的分组"这一动态直觉,这就需要教学设计把算法"演"出来。(二)学情分析授课对象为高中二年级学生。知识准备方面,学生已在数学课程中掌握了平面直角坐标系、两点间距离公式,能够计算平均值(质心本质上就是多维均值),数学工具的门槛已经扫清。在信息技术学科内部,学生已经修完必修模块,具备Python基础语法能力,能够读懂循环与列表操作,部分学生接触过NumPy与Matplotlib。认知困难方面,主要来自三点。其一,无监督学习的思想与学生的日常经验有距离。学生熟悉的"学习"都是有标准答案的,而聚类没有标签,学生容易追问"机器怎么知道分得对不对",这既是难点也是教学最有价值的切入点。其二,算法的迭代过程是动态收敛的,静态的文字描述难以在头脑中形成运动图景,需要借助可视化手段逐帧呈现。其三,K值的选取缺乏唯一正确答案,这与学生习惯的"题目有标准解"的思维定式冲突,需要教师引导学生接受"按需求与数据特征权衡"的工程思维。(三)课程标准对应本节课落实信息技术学科核心素养的四个方面:在信息意识层面,体会数据中蕴藏的分组结构,认识聚类在用户画像、图像压缩、异常检测中的价值;在计算思维层面,经历把"把相似的东西归为一类"这一模糊的自然语言需求,逐步精确化、算法化、程序化的全过程,体会距离度量、迭代优化、目标函数等思想;在数字化学习与创新层面,能够使用Python工具实现简版K-均值,并调整参数观察结果变化;在信息社会责任层面,讨论聚类技术在精准推送中可能带来的"信息茧房"与标签化问题。二、教学目标第一,通过校园消费数据的聚类任务,能用自己的语言解释聚类与分类的本质区别,说明无监督学习的基本特征。第二,能够口述并板书K-均值算法的完整流程:随机选取初始中心、计算每个样本到各中心的距离、按距离最近原则分组、重新计算各组均值作为新中心、重复直至中心不再变化;能够在坐标纸上手工推演一轮迭代。第三,能够在教师提供的代码框架基础上补全关键语句,运行程序观察不同K值与不同初始中心对聚类结果的影响,并用几何直观解释"组内平方误差和"这一评价线索。第四,通过分析算法可能陷入局部最优的现象,理解算法结果对初始条件的敏感性,形成对人工智能结果审慎评估的态度。三、教学重点与难点教学重点是K-均值算法的迭代思想及其"分配—更新"两步循环系统。突破策略是把算法过程设计成全班参与的身体模拟游戏,再过渡到坐标纸上的纸笔演算,最后上升到程序运行,经历"身体—图形—代码"三级抽象。教学难点是理解迭代为何会收敛以及K值选取的经验性。突破策略是引入组内平方误差和(即每个样本到所属中心距离的平方之和)作为每次更新的度量,让学生在可视化曲线中直观看到该数值随迭代单调不增,从而理解收敛的实质;对于K值,通过对比K等于2、3、4时同一数据集的分组效果,引导学生提出"肘部"判断思路。四、教学准备硬件方面,机房保证一人一机,配备能运行Python3环境的计算机,教师机连接投影与广播教学软件。软件方面,预装NumPy与Matplotlib库,准备三份资源:一份是教学用的可视化演示网页(逐帧播放迭代过程),一份是留有代码空缺的kmeans_lab.py半成品程序,一份是模拟生成的学生消费行为数据集(含40条二维数据,字段为"月均消费金额"与"月食堂就餐次数")。学具方面,为每组准备一张印有散点分布的坐标纸与三支彩色记号笔,供纸笔推演使用。五、教学过程(一)情境导入:一次没有标准答案的分组环节用时约八分钟。教师展示投影:"学校后勤处想了解同学们的消费结构,以便合理设置食堂窗口与超市品类。我们拿到了40名同学近一学期的两条数据:月均消费金额、月就餐次数。现在请你把这40名同学分成若干组,每组内同学情况尽量相似。这里没有老师给你的标签,也没有参考答案,你会怎么分?"学生二人一组观察屏幕上的散点图,口头提出方案。预期的学生回答大致有三类:凭眼睛看哪几个点聚在一起就归为一组;先画几条线把平面分开;或者在图上"猜"几个中心点,然后看每个点离哪个中心近。教师不评判对错,只追问两个问题:"你的分组依据是什么?如果换一位同学来分,结果会和你一样吗?"教师顺势揭示冲突:人眼分组依赖经验且不可复现,两台机器或两个人按主观感觉分的结果可能不同。机器需要一个毫不含糊的、可以写成步骤的规则。教师板书课题——K-均值聚类,并指出今天的任务就是把"相似的归为一组"这句话翻译成机器听得懂的算法。教师在此点明聚类与分类的区别:之前接触的智能系统大多是"先有教师、后有学习",图片标注了猫和狗,机器照着学;而今天面对的是没有标签的数据,机器要自己发现数据内部的结构。这一对照直接回答学生心中"机器怎么知道分得对不对"的疑问——它不追求命中某个预设答案,它追求的是组内越紧凑越好、组间越分离越好,好坏可以用一个具体的数值来衡量,而这个衡量标准就是本节课后半段要出现的组内平方误差和。(二)新知建构:算法思想的层层剥开环节用时约十二分钟。第一层,距离是"相似"的度量。教师设问:什么叫两个同学"消费行为相似"?学生回答:两个数据都接近。教师追问:两条数据如何在数学上合成一个点?答:看成平面直角坐标系中的一个点。两个点"接近"如何量化?答:计算两点间距离。学生齐说公式。教师板书距离公式的坐标表达:两点横坐标之差、纵坐标之差分别平方后求和再开方。教师强调,把生活语义"相似"翻译成数学语言"距离小",是人工智能数据处理的第一步,也是计算思维中抽象与形式化的体现。第二层,让算法在教室里"跑"一遍。教师组织身体模拟活动:课桌不动,学生在过道中按自己的实际月消费金额与就餐次数在教师划定的"坐标系"(教室地面贴上横纵轴胶带)中找到位置站好,全班40个"数据点"。教师任意指定三名学生举起红、黄、蓝三色牌子充当初始"聚类中心"。第一轮:每个"数据点"目测自己与三个牌子的距离,走到最近的牌子后面站队;站定后,教师请每队成员商量本队的"平均位置",持牌人移动到该平均位置。第二轮重复上述过程。教师请旁观者观察:每一轮之后人数是否变化?牌子是否移动?移动幅度比上一轮大还是小?学生亲眼看到大约三四轮后队伍与牌子位置基本稳定,教师宣布:算法收敛。活动结束后教师用极少量的语言提炼出算法的四步骨架并板书:选中心、按最近距离分配、重算均值当新中心、重复直到中心不再移动。教师特别点明两个细节:其一,新中心不一定落在任何一个真实数据点上,它是组内各维取算术平均得到的,这正是"均值"一词的由来;其二,整个算法只有两步在循环——"分配"与"更新",看似简单的两步循环却能让混乱的散点自发地涌现结构,这是迭代思想的力量。第三层,纸笔推演一轮迭代。各组拿到坐标纸,上面预印8个数据点与2个初始中心A、B。组内分工:一人量取或估算各点到A、B的距离并填表,一人核对分组结果,一人计算两组各自的均值坐标,一人用彩笔标出新中心位置,全组判断新中心与旧中心是否有可察觉的移动,从而决定是否需要继续迭代。教师巡视,重点观察学生求均值时是否分维分别计算、是否混淆"中心"与"样本点"。完成后请一组用实物投影汇报,其他组对照订正。教师在此环节中借助一组算错的数据强调:均值必须横坐标对横坐标、纵坐标对纵坐标分别计算,这与向量求平均的思想一致,为后续理解高维聚类埋下伏笔。(三)探究实践:让程序替我们迭代一百次环节用时约十五分钟。教师说明:手工推演一轮尚且费时,真实数据往往有成千上万个点、几十个维度,必须交给程序。学生打开kmeans_lab.py,教师先广播讲解代码结构:数据读入与绘图部分已写好,核心函数kmeans中有三处空缺,分别是"计算每个样本到各中心的距离并找到最近中心的编号""按分组结果重算每个中心的坐标""判断中心是否仍在移动以决定是否继续循环"。学生补全代码并运行,程序输出聚类结果的彩色散点图与每次迭代后组内平方误差和的数值列表。教师给出三个递进的探究任务,学生自主完成并即时在任务单上记录现象。任务一:固定K等于3,连续运行程序五次。观察每次最终的分组是否完全相同。学生会发现,由于初始中心是随机选取的,五次中可能有一次分组明显不同——两个本该属于同一大簇的点被劈开,而另一个簇里"挤进"了远点。教师借此引出局部最优概念:算法每一步都在让组内平方误差和变小,但它目光短浅,只顾低头爬坡,可能停在一个"小坑"里而错过更深的"谷底"。教师提问缓解办法,学生讨论后给出可行的办法是多次随机初始化、选误差和最小的一组结果,这正是工程实践中K-均值常用策略,教师补充介绍改进初始化思路的存在(如让初始中心彼此尽量远离的思路),但不展开。任务二:分别令K等于2、3、4、5运行,记录各次收敛后的组内平方误差和。学生发现误差和随K增大而减小,且从3降到4的降幅明显不如从2降到3的降幅大。教师引导观察"下降幅度由陡变缓的拐点",指出这就是实践中常用的肘部判断法:拐点对应的K往往就是数据内在簇数的一个有力候选。教师强调这不是定理而是经验线索,K的最终确定要结合业务需求——如果后勤处只想区分"高消费群体"与"普通群体"两类来安排窗口,那么即使数据内在有三簇,取K等于2也是合理选择。任务三:观察误差和数值列表,验证它是否单调不增。学生确认列表中后一项恒不大于前一项后,教师给出解释:"分配"这一步,每个样本都被划归到离它最近的中心,这本身不会增大误差和;"更新"这一步,把中心移到组内均值位置,数学上可以证明均值点恰好是使该组误差和最小的点,所以这一步同样不会让误差和上升。两步都让评价指标不增,而指标有下界(不会小于零),因此迭代必然收敛。教师指出,这段论证中没有用到任何超出高中范围的数学,靠的是"每步不亏、总量有限、必有终点"的朴素逻辑,这正是算法分析的思维方式。(四)迁移提升:聚类思维走向真实世界环节用时约五分钟。问题一:如果要对全校学生的文本借阅记录聚类,"距离"应该如何定义?学生意识到必须先把图书类别、借阅频次等转化为数值向量,距离才可能计算,从而体会到数据预处理与特征工程无处不在。问题二:电商平台用聚类给用户分群并定向推送,可能带来什么影响?学生讨论后指出两面性:便利与效率的提升是真实的,但长期只收到同类信息会收窄视野,人被标签固化后还可能遭遇差别定价。教师总结:算法是中性的工具,结果的公平与善意取决于使用者的设计与监管,技术越强大,越需要从业者保持清醒。(五)课堂小结与分层作业环节用时约五分钟。教师用三句话收束全课:聚类是无监督地学习数据内在结构;K-均值用"分配—更新"两步循环,以距离为度量、以均值为纽带,让分组自发涌现;算法收敛有保证,结果优劣取决于K值与初始化,需结合评价指标与业务需求审慎确定。随后请一名学生不看板书复述算法四步,全班补充完善。作业分为必做与选做。必做:在教材配套数据集上以K等于3完成一次完整聚类,截图保存迭代过程中第1轮、第3轮与收敛轮的中心位置变化,并用三句话描述中心移动轨迹与收敛含义。选做:把鸢尾花数据集的前两个特征(花萼长与宽)取出,用本课程序聚类,对比聚类结果与该数据集自带的三类标签,计算两者的一致程度,思考"无监督分组"与"真实物种分类"重合与偏离的原因,下节课抽两分钟请完成的同学分享。六、板书设计主板书居中呈现课题"K-均值聚类"。其下分三栏。左栏写思想线索:相似转化为距离,分组目标转化为组内平方误差和最小。中栏写算法四步的循环框图:随机选K个中心,箭头指向"按最近距离分组",再指向"重算组均值作为新中心",再回路到"中心是否变化",变化则回到分组一步,不变则输出结果。右栏写实践发现的三条结论:多次初始化防局部最优;看误差和降幅拐点估计K;误差和单调不增故必收敛。副板书区保留课堂生成内容,如学生在身体模拟活动中发现的"牌子移动量一轮比一轮小"等观察记录,体现课堂是师生共同建构的过程。七、教学评价设计本课采用过程性评价与表现性评价结合的方式。纸笔推演环节依据四人小组量规评价:距离计算正确、均值分维计算、收敛判断有据、组内分工真实,四项各占一档。程序探究环节依据任务单上三条记录(多次运行的差异现象、不同K的误差和序列、误差和是否单调)评定探究质量,重点关注学生是否如实记录"不理想"的运行结果而不是凑出"漂亮"答案——如实呈现算法的偶然失手恰恰是科学态度的体现。课后作业的评价标准突出"用自己的话解释",凡是照抄教材定义而无个人化表述的,判为理解未到位,要求重写。八、教学反思预设本课设计最值得坚持的做法是把抽象的迭代过程转译为身体可感知的活动,四级表征(教室站队、纸笔推演、可视化动画、程序运行

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论