高中信息技术选择性必修《决策树-从信息熵到可解释智能》教学设计_第1页
高中信息技术选择性必修《决策树-从信息熵到可解释智能》教学设计_第2页
高中信息技术选择性必修《决策树-从信息熵到可解释智能》教学设计_第3页
高中信息技术选择性必修《决策树-从信息熵到可解释智能》教学设计_第4页
高中信息技术选择性必修《决策树-从信息熵到可解释智能》教学设计_第5页
已阅读5页,还剩3页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

高中信息技术选择性必修《决策树——从信息熵到可解释智能》教学设计【设计理念】决策树是浙教版《人工智能初步》第二章的核心内容,它上承数据的整理与表示,下启神经网络与深度学习,是学生从"用规则编程"走向"用数据归纳"思维转变的关键一站。本设计以"校园二手书籍智能定价"为贯穿情境,让学生亲手计算信息增益、亲手剪枝、亲手反思算法的局限,使学生不仅知道决策树"是什么、怎么长出来",更能讲清"它为什么选择这个特征先劈叉"。课堂拒绝灌输公式,全部推导由学生在真实数据的驱动下完成。一、教材分析与学情研判教材将决策树安排在系统学习数据表示与搜索技术之后,要求学生理解监督学习的基本框架,掌握ID3算法的信息增益思想,能够用文字、图示和代码三种方式表示一棵决策树,并能初步评价模型的泛化能力。授课对象为高中二年级选修人工智能的学生。他们已完成必修模块的Python基础训练,会读写CSV文件,能绘制简单图表;数学上刚学完对数运算与概率统计基础,这是信息熵公式能落地的现实条件。但学生的困难同样明显:一是对"用数学度量不确定性"缺乏直觉;二是容易把决策树望文生义地理解为程序里的ifelse嵌套;三是对"过拟合"没有经验支撑,往往迷信"训练集上百分百准确就是好模型"。因此,本课的教学定位不是教会一个算法步骤,而是建立一种思维:让数据自己决定规则,让数学替代直觉做出选择。二、教学目标1.信息意识与计算思维:能将"判断二手书能否卖出"这类模糊问题拆解为特征与标签的结构化表达,体会特征工程对模型成败的决定作用。2.数字化学习与创新:能动手完成从数据到决策树的完整流程,理解信息增益的计算逻辑,能借助scikitlearn训练并可视化一棵决策树,并对照手工计算结果验证算法。3.信息社会责任:通过讨论决策树的可解释性及其在信贷、招聘等场景中的应用,形成对算法公平性的初步警觉,理解"可解释"是负责任智能的前提。三、教学重点与难点教学重点:信息增益的数学含义与计算方法;决策树的生成过程;用样本内与样本外准确率区分拟合与泛化。教学难点:对数公式背后的直觉(为何信息量与概率负相关、为何期望要加权);过拟合现象的成因与剪枝策略。四、教学过程第一环节:情境入题,冲突中提出问题(约8分钟)教师展示课前收集的真实数据集"校园书市":200条二手教辅交易记录,字段包括原价、成色(全新/九成/七成/较旧)、是否绝版、距出版年限、是否成交(是/否)。投影上随机打出十条记录,请学生凭生活经验快速判断每条是否成交,并说说自己依据了哪个字段。学生的答案高度分散:有人死死盯住"成色",有人坚持"原价决定一切",分歧立刻出现。教师顺势抛出问题链:你们每人都有自己偏好的特征,可如果要把你的判断逻辑写成程序教给机器,你到底先看哪个字段?凭什么?你的"凭感觉"能不能变成一个可计算、可比较、可验证的数字?教师板书课题:决策树——让数据自己长出规则。明确本节课终点任务:训练一棵能向学弟学妹解释清楚的自动定价决策树,并检验它遇到新数据时的真实表现。设计意图:用真实分歧替代虚假导入,让学生意识到"特征选择的优先级"正是本课要解决的真问题,为信息增益的出场埋下认知缺口。第二环节:温故搭桥,把对数变成直觉(约7分钟)教师不直接抛出熵公式,而是设计"猜特征"小游戏:教师心里选定一个字段(如"是否绝版"),学生用是/否问题猜,统计平均需要几个比特的问题能锁定答案。学生发现:事件越出人意料(概率越小),当它发生时携带的信息量越大;事件发生越频繁,信息量越平淡。教师引导学生从"信息量与概率成反比、且多个事件信息量可相加"两条性质出发,自主归纳出单个事件信息量应满足的形式:log₂(1/p)。再追问:一个字段整体的不确定性,不就是它各种取值信息量的加权平均吗?学生在学案上写出熵的表达式H=−Σpᵢ·log₂pᵢ,并用计算器完成第一个数值实例:成交与未成交各占一半时,整个表的不确定性恰好是1比特;若九成记录都成交,熵降到约0.47比特。教师小结只说一句:熵就是"一团数据的混乱程度",越纯越低,越乱越高。设计意图:用信息论经典思想实验重建公式,避免灌输;同时复用必修数学的对数与期望知识,体现学科融合。第三环节:核心攻坚,信息增益如何替我们选特征(约15分钟)这是全课重心。教师发放简化版数据集(16条记录,只保留"成色"和"是否绝版"两个候选特征),小组任务明确:分别计算按"成色"划分、按"是否绝版"划分后,子集的加权平均熵,与划分前总熵相减,差值即信息增益,谁大谁先劈。学生分组演算,教师巡视时重点纠偏三类常见错误:一是漏乘子集占比权重;二是对数底数混用;三是把"条件熵低"误读为"该特征取值好"而非"划分效果好"。各组报出结果:按"是否绝版"划分的信息增益约0.32,按"成色"划分约0.20,于是根节点选择"是否绝版"。教师同步在黑板上画出第一层树,并宣布:接下来每个分支重复同样的计算,直到子集纯净或无可再分——这就是ID3算法的全貌:贪心、递归、每一步都选当下分裂收益最大的特征。随后进入验证环节:学生打开预置的Jupyter环境,运行代码调用sklearn.tree构建决策树,调节criterion="entropy",屏幕上渲染出的树结构与黑板手算结果逐节点对照。当机器画的树与自己的计算完全一致时,教室里出现的不是对工具的惊叹,而是"我算的就是算法干的"这一认知确认。教师追问升华:sklearn一行fit()背后,就是你们刚才的每一分计算。工具封装了过程,但封装不了理解。设计意图:先手算后上机,用机器验证人、而不是用机器替代人;计算量控制在课堂可承受范围,把精力留给概念理解。第四环节:反转认知,过拟合的真实一课(约10分钟)教师布置第二轮任务:用完整200条数据训练,特别注意——把数据随机切成训练集160条、测试集40条。学生发现一棵深度不加限制的树,在训练集上准确率可达98%,测试集却只有71%。教师让学生在黑板画出两条曲线:训练准确率随树深度一路上扬,测试准确率在中段见顶后下滑。两线背离之处,教师点睛:树把训练数据里的偶然细节(比如"出版年限为7年的那两本恰好都成交了")当成了规律写进了叶子,这叫过拟合——记住了噪音,忘记了规律。学生随即调节max_depth参数从1到8逐档实验,找到测试集准确率峰值对应的深度(约4层),理解剪枝的本质:主动放弃训练集上的一部分完美,换取未知数据上的稳定。教师补充对比两种方式:预剪枝(设深度、设最小样本数)与后剪枝(先长后裁),并让学生用一句话总结泛化的含义——写给没见过的数据看的规则,才算合格。设计意图:亲手制造一次"高分假象"再亲手戳破,学生对过拟合的记忆远比听十遍定义深刻;同时在操作中渗透机器学习"训练/测试分离"的基本规范。第五环节:价值拓展,可解释性的温度(约5分钟)教师切换应用视角:同样是分类问题,银行拒贷、招聘初筛、医疗辅诊,为什么决策树仍被偏爱?学生讨论得出:它的每一条判断路径都能被人读出来、质问、审计——从一个样本到根节点的路径,就是一份天然的理由书。相比之下,深度网络的高明往往沉默不语。教师乘势追问另一面:若历史数据里藏着偏见(比如某类卖家的书被系统性地压低成交概率),树会原样学进去并理直气壮地执行。可解释不等于公平,但可解释是纠正不公平的起点。学生在学案上写下一句话作为本课的态度沉淀。设计意图:落实信息社会责任目标,避免技术课沦为纯工具训练,让学生带着伦理敏感度离开教室。第六环节:小结与分层作业(约5分钟)师生共同以思维导图收束本课三句话:熵度量混乱,增益选择特征,剪枝对抗自欺。分层作业:基础层——手工完成一份8条记录数据集的两层建树计算;实践层——选定一个校园真实问题(如"社团招新匹配"),采集不少于50条数据,训练并剪枝一棵决策树,提交测试集准确率与一页说明;挑战层——查阅资料比较ID3、C4.5、CART在划分标准上的差异(信息增益/增益率/基尼系数),用200字说明各自适用场景。五、板书设计主板书三区:左区"问题—特征—标签"结构化链条;中区核心推导区,熵公式、信息增益=划分前熵−加权划分后熵,配手算数值;右区生成算法四步(算增益、选最大、递归分、适时剪)与两线背离的过拟合示意曲线。六、教学反思预设本课最大的风险在于计算节奏:手算

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论