高中信息技术高二选择性必修4使用决策树进行分类教学设计_第1页
高中信息技术高二选择性必修4使用决策树进行分类教学设计_第2页
高中信息技术高二选择性必修4使用决策树进行分类教学设计_第3页
高中信息技术高二选择性必修4使用决策树进行分类教学设计_第4页
高中信息技术高二选择性必修4使用决策树进行分类教学设计_第5页
已阅读5页,还剩11页未读 继续免费阅读

付费下载

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

高中信息技术高二选择性必修4使用决策树进行分类教学设计一、教学定位与育人价值本课面向高中二年级学生,对应高中信息技术选择性必修4中“使用决策树进行分类”的学习任务。学生在此前已经接触过数据、算法、信息系统与初步的机器学习观念,知道计算机可以从样本中寻找规律,却容易把“智能”理解为神秘能力,把分类结果当成天然正确。本课的核心价值不在于让学生背出决策树定义,而在于让他们经历从原始样本到可解释规则、再到新样本判断的完整推理过程,理解分类模型为什么这样判断、在什么条件下会失效、如何评价一棵树是否真正可靠。决策树适合作为高中阶段进入机器学习解释性教学的入口。它把抽象概率、信息增益、划分纯度与日常选择经验连接起来,学生能够看见每一个分支背后的依据。天气是否适合户外运动、是否通过实验考核、邮件是否疑似垃圾信息,这些问题都能转化为特征、类别与分裂条件。教师应把课堂重心放在“怎样选出好的划分问题”上,而不是急于展示成品模型。学生只有亲手比较几个候选划分,才会理解信息增益并非口号,而是一种消除不确定性的度量。本模块还承担科学态度与责任教育。分类树一旦进入校园管理、医疗辅助或信用评估,就可能影响真实个体。课堂需要让学生意识到,特征选择体现价值判断,样本偏差会复制不公,过深的树可能只是记住噪声。高水平的信息技术教学不能停留在“跑通程序”,而要引导学生追问数据从哪里来、标签由谁标注、错误由谁承担。这种追问是数字时代公民基本素养,也是本课超越技能训练的意义所在。二、课标依据与教材理解普通高中信息技术课程强调数据意识、计算思维、数字化学习与创新、信息社会责任。本课将四者落实到可观察行为:面对一个小数据集,学生能提出可测试的划分问题;能用计数、比例和不确定性变化解释为何不随机切分;能画出不超过三层的树并说明每个叶节点的类别依据;能把同一棵树迁移到新样例并记录错误;最后能讨论模型适用边界。这样的目标设计既符合选择性必修对算法与智能系统的要求,也避免把大学课程中的复杂推导直接下移到高中课堂。教材以“使用决策树进行分类”为题,关键词是“使用”而非“发明”。这提示教学不能陷入纯理论证明,也不能变成软件按钮操作。合理路径是先人工构造小树,再借助程序复现分裂过程,最后回到人工解释。学生在比较人工选择特征与程序自动选择特征时,会发现二者并不总一致。造成差异的原因包括样本量过小、特征取值粗糙、连续变量被硬性阈值切开、评价指标只看重当前一步。这个发现本身就是高质量学习成果,比记住某段代码更重要。本课所在单元通常承接“认识机器学习”与后续“朴素贝叶斯、神经网络或智能系统伦理”。因此应埋下三条暗线:其一,分类是预测而非证明;其二,模型优劣依赖训练数据与测试场景的匹配;其三,可解释性强不等于公平可靠。这三条暗线在本节课只需生成初步经验,却会影响学生后续面对更复杂算法时的判断力。三、学情分析高二学生具备函数、比例、对数直觉的数学基础,但对“熵”这一概念容易产生距离感。若直接抛出公式,部分学生会把它当作成年人才懂的符号;若完全回避熵,又会失去理解信息增益的钥匙。对策是采用“混乱程度”作为直觉入口,用摸球、猜牌、班级投票等经验连接到纯度变化,再给出可视化表达:当某一节点全部属于同一类别时,不确定性为0;当两类各占一半时,不确定性最大,记作1;中间情形按曲线平滑变化。学生不需要完整推导对数性质,只需知道划分后混乱程度下降越多,分裂越有贡献。学生在程序能力上差异明显。有的能熟练使用列表、字典与条件语句,有的仍停留在图形化编程经验。教学设计需设置双通道:基础通道用表格手工计数完成建树,进阶通道用简短代码读取同一数据集并输出分裂结果。两通道在课堂中段汇合,共同讨论“哪一步是机器替人完成的,哪一步仍需要人判断”。这样既保护计算基础较弱学生的参与权,也不削弱能力较强学生的挑战。常见迷思包括:把准确率当成唯一目标;认为树越深越聪明;把相关当成因果;默认数据天然客观;把训练集表现等同于真实世界表现。教师应通过反例制造冲突,例如用“学号尾数”预测是否喜欢篮球,训练集上偶然有效,换班测试立即崩塌;再如用含极端值的成绩数据划分及格与否,单一切点看似干净,实则漏掉努力过程。冲突要短促、具体、可重复验证,才能转化为稳定认识。四、教学目标学生能够用自己的语言说明分类任务由样本、特征、标签与预测规则构成,并能区分训练、验证与测试在高中课堂尺度上的意义。给出不超过六个特征、三十条样本的小数据集,学生能独立计算两个候选划分的类别分布,比较划分前后不确定性变化,选择更有解释力的特征。学生能够绘制并解读一棵深度不超过三层的决策树,标出根节点、内部节点、分支条件与叶节点类别,能沿路径完成新样本判定,并说明每一层判断所依赖的证据。面对连续数值特征,学生能提出至少两个候选阈值,理解阈值选择会改变树形与误判对象。学生能够用准确率、误判样本清单和简单混淆矩阵评价小模型,发现“整体正确”可能掩盖某类群体大量出错。学生能够指出过拟合、样本偏差、特征泄露中的至少两类风险,并结合校园情境说明后果。学生形成把算法放回现实约束中审视的习惯。在讨论是否用决策树辅助推荐社团、筛查体质风险或判断作业异常时,能主动询问数据来源、标注规则、纠错机制与申诉通道,而不是只问程序准不准。五、教学重点与难点教学重点是理解好划分的标准:同一节点内类别越一致,节点越“纯”;一次分裂让子节点整体更纯,才值得保留。学生应能在表格中数清每类数量,比较两种划分,而非凭感觉选择看着顺眼的特征。教学难点有三处。第一处是把“减少不确定性”从口号变成可量化比较。解决策略是固定小样本,让所有计算都可回查。第二处是处理连续特征阈值,学生容易认为存在唯一正确切点。解决策略是比较19.5、20.5、21.5三个阈值在训练样本上的分裂差异,观察边界附近样本如何改变归属。第三处是认识小数树上偶然性强。解决策略是交换一半样本重训,观察根节点是否保持不变,引出稳定性概念。六、教学准备与资源设计```text数据集A:校园户外运动适宜性,字段包括天气=晴/阴/雨,温度℃,风力级,湿度%,空气质量,是否适合户外运动。数据集B:实验操作通过性,字段包括预习完成=是/否,器材识别得分0—10,安全规范答题0—10,小组协作=低/中/高,是否通过。工具:纸质节点卡、磁性分支条、计算器、电子表格、可选Python环境。评价单:树形规范检查表、误判追踪表、伦理风险三问卡。```数据集不宜真实采集敏感信息,所有姓名以代号替代,健康与家庭背景类字段不进入课堂样例。空气质量与体质数据只做模拟,避免学生把课堂模型用于同伴评价。教师提前准备三套诱导性错误样本:根节点偶然有效样本集、类别极不均衡样本集、含泄露特征的样本集。每组数据控制在16至32条,保证手工计算可行。七、教学过程环节一:情境入境——不是要机器更聪明,而是要判断可解释教师出示学校运动会延期争议:体育组依据“明天气温接近三十度”倾向照常举行,医务室关注湿度与空气质量,学生会担心突发降雨。在黑板上写出四条历史记录,只保留最关键四项:天气、温度折档、风力、空气质量,以及当天是否顺利完成户外项目。学生先凭经验预测新一天是否适合运动,并写下依据。不同小组给出不同结论,教师不裁决,只追问:如果让你把依据教给一台不会变通的机器,你先检查哪一项?为什么这一项排第一?此问把生活争执转化为根节点竞争。学生可能选天气,也可能选空气质量。教师顺势明确任务:今天不争论谁更有生活经验,而让数据告诉我们哪一个特征能把“适合”和“不适合”分得更开。此时板书本课核心句式:好问题让同类聚在一起,让不同类离开彼此。环节二:从计数到纯度——看见混乱程度下降每组领取16条模拟样本。先在表格中统计根节点类别:适合9条,不适合7条。教师说明此时节点并不纯净,若把新样本直接猜成多数类,最多有7条会错。接着分别按“天气是否等于晴”和“空气质量是否为良以上”两种方案分裂,填写左右子节点类别计数。```text根节点:适合=9,不适合=7,猜测多数类将错7条。方案甲按天气=晴:晴分支适合7不适合1;非晴分支适合2不适合6。合计误判1+2=3。方案乙按空气良以上:良以上适合6不适合5;非良以上适合3不适合2。合计误判5+2=7。```学生立刻看到甲方案让子节点更接近单一类别,乙方案几乎保留原来的混杂。教师引入“不确定性下降”的语言,但不急于堆公式。用一句话锚定:拆分前大约要用7次猜错兜底,拆分后甲方案最多暴露3处危险,乙方案仍像没拆。对于愿意挑战的学生,给出可视化熵标尺:全纯为0,五五开为1,节点越接近五五开,混乱越接近顶端。信息增益就是拆分前的混乱减去拆分后平均混乱。```text节点混乱感:全同类→0;一类略多→中低;两类持平→1。信息增益=父节点混乱程度−左子混乱程度×左占比−右子混乱程度×右占比。```教师强调,本公式在课堂中不要求背系数,只要求会解释趋势:左右子节点越不平均、越纯净,收益越大;拆出的子节点仍五五开,则收益接近零。学生重新检验甲乙两案,确认计数与直觉一致。环节三:遭遇连续量——阈值不是天赐的把温度从“高、中、低”还原成摄氏值:18、21、24、26、27、29、31、33等。原来按天气分裂很快完成,现在学生提出用温度。教师要求每组必须设三个候选阈值:23.5、26.5、29.5,分别统计两侧误判。结果常见现象是,某个阈值热分支几乎全是不适合,冷分支仍混杂;另一个阈值两边都半对。学生由此发现,连续特征的分裂质量取决于切点落在哪里,切点只是人根据样本画出的临时边界。教师追问边界样本:气温26.4被判到高温组,26.6若四舍五入可能改判,现实身体感受真有质的变化吗?学生认识到阈值是为了计算方便而制造的简化,不能把它自然化。这里安排两分钟静默改写:每组给气温阈值写一句“谨慎说明”,例如“本校春季样本显示26℃附近失误增多,但个体耐热差异未纳入”。把模型语言改成有限证据语言,是防止算法傲慢的关键动作。环节四:人工建树——三层以内,每一步都要还账学生用节点卡建立数据集A的树。规则:最多三层;每个分裂必须写出计数依据;每个叶节点必须给出类别与置信倾向,不允许只写“大概可以”。教师巡视时盯住三类常见病:一是重复追问已经纯净的子节点,制造无意义深枝;二是在只有两条样本的子节点上继续切,造成偶然规则;三是把标签本身相关字段当特征,例如“当天是否延期的公告”混入运动是否适合,形成泄露。展示两组不同树。甲组根用天气,第二层用空气质量,第三层在少数非晴节点上试探风力;乙组根用温度阈值,第二层才看天气。请全班沿同一新样本走两棵树,得到不同结论。教师不评判谁对谁错,而要求双方互指对方“最脆的节点”。甲组被指出非晴且空气良样本太少,乙组被指出26.5阈值受一条异常样本支配。学生开始理解,建树不是寻找唯一圣地,而是公开可质疑的证据链。环节五:程序复现——机器快在什么地方,慢在什么地方有能力小组打开简化代码,读取同一份逗号分隔数据,输出候选特征分裂后的误判数或增益近似。教师强调读程序不读语法细节,只定位三行:分别统计父节点类别、循环每个特征、计算子节点加权错误。基础组用电子表格完成相同循环。两条路径汇到同一张对照表:人工选择与程序选择是否一致;若不一致,差别来自四舍五入、字段类型、缺失值还是评分口径。```text伪逻辑:读入样本计算当前节点多数类错误对每个特征:按可能取值或候选阈值分组汇总每组错误,按样本数加权记录加权错误最小的特征若收益太小或样本太少,停止;否则继续```学生观察到机器不会疲倦,却也不懂天气为何重要;它能迅速试遍所有阈值,也会把噪声切成看似整齐的薄片。教师在此明确分工隐喻:算法负责搜索,人负责界定问题、审查数据、承担后果。把这句话写进学习单顶部,后续评价均回到它。环节六:评价不止准确率——看谁被错怪给出32条测试模拟结果,总体准确率百分之八十七点五,看似漂亮。让学生画二乘二表:真实适合且预测适合、真实适合但预测不适合、真实不适合但预测适合、真实不适合且预测不适合。随后把“真实不适合却预测适合”单独涂色。学生发现,若这是户外运动安全情境,把高风险日误判成适合比取消一次活动更严重;若是实验安全情境,两类错误代价也不对称。准确率把不同错误压平,现实不会。学生用误判追踪表挑三条错例,回填到原树路径,回答三个问题:错在哪一层;该层依据什么字段;改进应靠补样本、换阈值还是换特征而非盲目加深。有人提出把湿度加入,有人提出删除风力,因为它在本校平原样本中区分度低。教师肯定两种方向都可能成立,但要求各自说明新风险:加湿度可能引入测量不准,删风力可能损失突发阵风场景。理由先于改动生效。环节七:反例冲击——偶然有效与看似聪明教师投放含“记录编号尾数为偶”的人造字段。训练集中偶数编号恰好多数“适合”,程序可能把它选成高收益特征,学生初看惊讶,继而用换批数据验证根节点崩塌。这个反例解释何为过拟合与虚假相关:树抓住了抽样巧合,而非稳定结构。再投放类别十五比一的样本,全部猜多数类准确率仍高,却完全漏掉少数关键风险,学生理解不均衡数据中空有高分毫无意义。本环节要控制在八分钟内,目的在于戳破幻觉而非展示更多技巧。教师收束为一句课堂约定:任何高分都要回答三个词——换数据还灵吗,错了伤到谁,规则能解释吗。学生把这三词写在树右上角,作为作品的“防伪标签”。八、板书设计```text使用决策树进行分类分类四件套:样本特征标签规则好划分:父乱→子纯;收益=父乱−加权子乱连续特征:阈值是假设,不是事实树:根问最关键,叶给结论与限度评价:准确率+误判成本+换样本稳定性红线:数据从哪来,错误谁承担,结论能复核吗```板书不追求花哨,保留可擦写区记录各班实时算出的两个候选特征误判数。最好的板书应当像法庭记录:每个分支旁边能看见票数、反例与修正时间。九、作业设计基础作业为完成数据集B的手工分裂。学生从预习完成、器材识别得分、安全规范答题三个字段中任选两个候选根,计算分裂前后误判数,画出两层树并写清选择理由。评价不看树是否像标准答案,而看计数是否准确、叶节点是否注明样本少时结论偏弱。提升作业要求处理连续字段器材识别得分。学生设置5.5、7.5、8.5三个阈值,比较哪个阈值在模拟数据上更少误判,并说明若用于真实实验考核,为什么不能只凭一次训练决定补考名单。提示学生关注“安全规范答题”与“器材识别”可能同受教师前期培训影响,高相关不等于可替代公平程序。挑战作业以小组为单位设计一份“不采用决策树”的声明。面对校园情绪识别、家庭经济推测、同伴关系评分等敏感场景,学生说明为何主动放弃自动化判断,或应增设哪些人工复核与同意程序。该作业评分重点是边界意识,而非技术炫技。优秀答案应能写出:某些问题不是算得不够准,而是不该由这个系统裁定。十、课堂评价量规```text维度一证据计数:分裂前后数量清楚,能复查;错误为基础提醒,错误成链需重做。维度二解释质量:每个分支能说明为何选此特征而非彼特征,允许保留不确定。维度三迁移稳定:换批样本后能报告根节点是否变化,不把偶然当规律。维度四风险判断:能区分两类错误代价,能识别泄露、偏差、过深三类问题。维度五表达责任:结论带适用范围,少用绝对词,主动给出复核路径。```评价采用学生自评、组间互查、教师复核三层。互查时不打印象分,只执行“能否沿树复现预测”“能否找到至少一条反例”“能否读出叶节点证据”三项硬指标。教师复核聚焦未被发现的高危错误,例如把测试样本偷渡进训练,或用无法获得的未来信息预测现在。十一、教学实施建议时间可按一课时九十分钟或两课时连排展开。单课时完成情境、纯度比较、人工小树与反例冲击;程序复现压缩为教师演示加学生定位关键三行。双课时节奏更理想:第一课时建立从计数到建树,第二课时完成程序对照、误判成本与伦理收束。若机房条件有限,程序环节可改为电子表格透视汇总,思维目标不减。分组采用异质四人:记录员负责计数,质疑员专找反例,绘图员负责树形规范,汇报员负责把技术语言转成班级能懂的话。角色中途轮换一次,防止擅长表达者垄断结论,也防止沉默者只抄表。教师巡回时不直接告诉根节点答案,只问三类问题:这一刀切完两边还乱吗;少拿两条样本结论还站稳吗;这条规则放到隔壁班会伤人吗。对学有余力者,可提示增益率与剪枝名称,但不展开推导。更适宜的加餐是让他们解释为何“每层都拿当下最好”不保证整棵树最好,理解贪心策略的局限。对暂时困难学生,坚持只要求一比:分裂前多数类会错几条,分裂后合计错几条。只要能稳定完成这一步,决策树核心就已入门。十二、常见困境与对策学生热衷提高准确率而忽视可解释时,展示一棵深到按个位数样本分裂的“满分树”,换样本迅速失败,再对比一棵略低分但稳定的小树,让体验自己说话。学生把程序

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论