版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
高中信息技术选修四《2.4决策树》教学设计一、教材定位与内容重构浙教版高中信息技术选修四《人工智能初步》模块作为新课标“计算思维”核心素养落地的关键载体,其第2章“机器学习基础”承担着从规则驱动向数据驱动范式转换的教学使命。第2.4节“决策树”位于章节中段,前承K近邻、朴素贝叶斯等实例学习与概率图模型,后启随机森林、梯度提升树等集成学习思想,是连接浅层分类器与深度集成模型的枢纽课。教材以“西瓜数据集”贯穿始终,通过信息熵、信息增益、基尼指数三大分裂准则的推导与对比,构建了决策树“生成—剪枝—预测”的完整技术链条。鉴于选修四学分制选课班级学生基础参差不齐,且课时仅安排2学时(含1学时机房实践),必须对教材进行“去繁就简、保留骨架、深化核心”的重构:剔除ID3、C4.5、CART算法细节的纯数学证明,保留信息增益率修正多取值偏好、基尼指数计算效率优势等工程化认知点;将剪枝策略聚焦为“预剪枝防过拟合、后剪枝提泛化”两大决策逻辑,弱化损失函数α推导;引入可视化工具与Pythonsklearn库调用,将抽象树结构转化为可观测、可调参、可迁移的建模经验。二、学情精准画像与分层预设选课学生多为高二理科强班与文科实验班混编,普遍具备Python基础语法、列表字典操作及matplotlib绘图能力,但缺乏机器学习项目完整流程体验。经入学摸底问卷与上节课“朴素贝叶斯”作业分析,学生呈现三层梯度:第一梯度约30%,数学基础扎实,能理解熵的度量本质,渴望算法原理深度推导;第二梯度约50%,编程动手能力强,倾向“调包侠”路径,对参数调优有直觉但缺乏理论支撑;第三梯度约20%,逻辑抽象困难,需具象化类比与脚手架支撑。针对性预设:为第一梯度准备“信息增益率推导拓展卡”与“剪枝损失函数手算题”;为第二梯度设计“超参数网格搜索挑战赛”与“决策边界可视化微项目”;为第三梯度制作“西瓜数据集决策路径追踪表”与“树结构拼图教具”。分层不分流,同堂异构,以“西瓜甜度预测”真实任务为总牵引,确保每位学习者最近发展区均被触达。三、核心素养导向的教学目标体系1.信息觉悟:能结合西瓜挑选生活经验,解释决策树“以测度不确定性为核心、递归分裂特征空间”的数据驱动思想,辨析经验风险最小化与结构风险最小化在模型复杂度上的博弈,建立“数据质量决定模型上限、算法逼近模型下限”的工程认知。2.计算思维:掌握信息熵$H(Y)=\sump(y)\log_2p(y)$、信息增益$Gain(D,a)=H(D)H(D|a)$、信息增益率$Gain\_ratio(D,a)=\frac{Gain(D,a)}{IV(a)}$、基尼指数$Gini(D)=1\sump_k^2$四大核心指标计算逻辑,能手算小规模数据集最优分裂属性;理解预剪枝“叶节点纯度阈值、样本量下限、增益下限”与后剪枝“子树提升、损失函数下降”两大剪枝机制差异,会用sklearn中`max_depth`、`min_samples_split`、`ccp_alpha`控制模型复杂度。3.数字化学习与创新:在JupyterLab环境下独立完成从CSV加载、特征编码、训练集测试集分层采样、决策树训练、Graphviz可视化导出、混淆矩阵评估、超参数网格搜索的完整建模闭环;针对“泰坦尼克号生存预测”迁移任务,能自主完成缺失值填补、独热编码、特征重要性排序分析,输出可复现的建模报告。4.社会责任:通过“信贷审批决策树案例”讨论,识别模型中“性别、种族、邮编”等敏感特征引发的算法偏见风险,阐述“可解释性”与“公平性”在高风险决策场景的优先级,树立技术向善的伦理底线。四、教学重难点破解路径重点:信息增益与信息增益率的计算与选属性差异、CART分类树基尼指数分裂机制、预剪枝与后剪枝的超参数工程化调控。难点:信息论度量与分类纯度的本质统一性、剪枝过程中“验证集准确率下降但测试集上升”的反直觉现象解释、高维稀疏数据下决策树易过拟合的几何本质(轴平行分割超矩形区域)。破解策略:引入“二十个问题游戏”类比熵的降低过程;用“切西瓜”动画演示特征空间递归二分;设计“手算微数据集→可视化验证→代码复现”三级递进认知链;设置“剪枝前后决策边界动态对比”可视化实验,直观呈现过拟合与欠拟合临界态。五、教学策略与环境配置采用“项目式学习(PBL)+混合式探究”复合策略。物理空间:常态化教室配备投屏互动大屏、学生分组岛式桌椅;机房配备Anaconda预装环境、Graphviz渲染引擎、预置数据集与骨架代码的共享网盘。数字化平台:雨课堂承载课前预习视频(自制B站风格知识点短视频3条)、课中实时弹幕提问与投票、课后作业提交与同伴互评。教具准备:西瓜实物3个(好瓜/坏瓜标签贴)、属性卡片套装(色泽、根蒂、敲声、纹理、脐部、触感共6组)、大号坐标系地毯(用于学生扮演特征点站位演示分裂)。评价工具体系:过程性评价量表(占40%,含协作沟通、代码规范、实验记录)、产出性评价量表(占40%,含模型准确率、可视化质量、报告逻辑)、迁移创新评价(占20%,含泰坦尼克任务创新特征工程、伦理讨论深度)。六、教学过程详细设计(一)情境导入:西瓜摊前的算法思考(8分钟)教师手持西瓜实物走上讲台:“同学们,老张西瓜摊挑瓜有三绝:看色泽乌黑、听敲声浊响、按触感硬滑。这三招背后,藏着怎样的决策逻辑?”播放15秒短视频:老张熟练敲击西瓜、翻看底部、掂量重量,动作行云流水。停帧提问:“如果让你们写程序模拟老张挑瓜,用ifelse硬编码规则行不行?”学生讨论30秒,回应:规则固化、新品种失效、边界模糊难量化。教师抛出核心驱动问题:“能不能让机器从历史挑瓜记录中,自动学出一棵‘挑瓜决策树’?”点击雨课堂推送“西瓜数据集3.0.xlsx”至学生端,含17个样本、6个离散属性、1个二分类标签。任务单发放:“请用笔在草稿纸上,尝试画出一棵能完美分类这17个西瓜的树,根节点选哪个属性?为什么?”为第三梯度学生发放“属性值频次统计表”脚手架,引导其计算各属性下好瓜坏瓜占比。教师巡视观察:第一梯度已尝试计算信息增益,第二梯度在按直觉选“纹理清晰”或“色泽乌黑”,第三梯度在填表统计。教师不评价对错,收齐草稿,引出:“人的直觉往往不可靠,我们需要一个数学度量,来量化‘分裂后不确定性下降了多少’——这就是信息熵与信息增益。”(二)核心概念建模:从不确定性度量到最优分裂(22分钟)1.信息熵的物理隐喻与数学定义教师在黑板左侧书写:$H(Y)=\sum_{k=1}^np_k\log_2p_k$。不直接讲公式,而是组织“二十个问题”微游戏:教师想一个班级同学名字,全班只能问是非题猜人。记录提问轮数。轮到第2轮时提问“是男生吗?”,第3轮问“姓王吗?”,对比不同提问策略缩小范围的效率。引导学生总结:最好的问题,是让“是”与“否”两拨人数量最接近、各自内部最纯净。此时引入熵的物理意义——系统混乱程度的度量。演示Python交互式计算:`importmath;p=0.5;print(pmath.log2(p)(1p)math.log2(1p))`输出1.0;`p=0.9`输出0.469。学生直观看到:分布越均匀熵越大,越倾斜熵越小。教师强调:$\log_2$单位是比特,熵代表“消除不确定性所需的平均编码长度”,这是香农信息论赋予决策树的理论基因。2.条件熵与信息增益的手算演练投屏展示西瓜数据集3.0完整表格。教师示范以“色泽”为例手算条件熵$H(D|色泽)$:色泽=乌黑:8个样本,好瓜4坏瓜4,熵=1.0色泽=青绿:6个样本,好瓜3坏瓜3,熵=1.0色泽=浅白:3个样本,好瓜1坏瓜2,熵=0.918条件熵=$(8/17)1.0+(6/17)1.0+(3/17)0.918=0.983$父节点熵$H(D)=0.998$(现场计算展示)信息增益$Gain=0.9980.983=0.015$学生分组接力手算“根蒂”、“敲声”、“纹理”、“脐部”、“触感”五属性增益,每组派代表上台填写汇总表。教师随机抽查计算过程,纠正“忘记加权平均”“对数底数混用”等高频错误。汇总结果显示:“纹理清晰”增益最大(0.162),“色泽乌黑”最小(0.015)。教师追问:“为什么纹理清晰分裂效果最好?”引导学生观察:纹理=清晰下好瓜占比8/9,纹理=稍糊下全坏瓜,纹理=模糊下全好瓜,分支纯度极高。此时自然过渡:信息增益偏好取值多的属性(如“编号”每个值唯一,增益极大但无意义),如何修正?引入固有值$IV(a)=\sum\frac{|D^v|}{|D|}\log_2\frac{|D^v|}{|D|}$,定义信息增益率。现场演算“编号”属性IV值远大于“纹理”,增益率反而极低。结论落地:C4.5算法采用增益率,但先用增益筛选高于平均值的候选属性,再比率,避免低增益高比率陷阱。3.基尼指数与CART的工程选择教师不再展开推导,直接给出基尼指数公式$Gini(D)=1\sump_k^2$与信息熵曲线对比图(Python绘制同屏)。指引学生观察:两曲线形状极度相似,均在$p=0.5$处取极大值,对称性一致。区别在于:基尼指数无对数运算,计算速度快;信息熵源于编码理论,可解释性强。sklearn默认`criterion='gini'`。补充说明:回归树用均方误差MSE,分类树用基尼或熵,本质都是“纯度提升最大化”。快速投票:“如果数据集有100万行、500个特征,你选熵还是基尼?”90%学生举手选基尼,教师确认:工程落地首选基尼,科研分析常用熵。(三)算法流程演练:递归构建与停止条件(15分钟)教师切换至PPT动画演示ID3/C4.5/CART统一框架伪代码:```函数生成树(数据集D,属性集A):若D中样本同类:返回叶节点(该类)若A为空或D中样本在A上取值相同:返回叶节点(多数类)选最优分裂属性a(按增益/增益率/基尼)若分裂增益<阈值:返回叶节点(多数类)预剪枝点1为a每个值v创建子节点令Dv=D中a=v的样本若Dv为空:子节点标记多数类否则:子节点=生成树(Dv,A{a})返回树```重点讲解三个停止条件的工程含义:同类停止是理想态;属性耗尽或样本在属性上同值导致无法继续分裂,必须多数表决;预剪枝阈值`min_impurity_decrease`对应增益下限,防止噪声数据生成深层分支。教师现场演示“手动模拟递归”:在黑板上逐层画出西瓜决策树前三层,根节点“纹理”,第二层“色泽”“根蒂”,第三层“触感”。邀请三名学生上台扮演“递归调用栈”,分别持有当前数据集、可用属性集、父节点指针,演示函数调用与返回过程,使抽象递归具象化为物理动作。(四)剪枝策略深度对决:预剪枝与后剪枝的工程博弈(18分钟)4.过拟合可视化直击教师运行预准备的JupyterNotebook单元格:加载西瓜数据集,故意添加3个噪声样本(好瓜标记为坏瓜),训练`max_depth=None`的决策树,用`export_graphviz`导出DOT文件,Graphviz渲染生成巨大PNG投屏。树深度达7层,叶节点仅含12样本,决策边界呈锯齿状包裹噪声点。教师提问:“这棵树在训练集准确率100%,但在新西瓜上靠谱吗?”学生齐答“不靠谱”。教师划重点:训练集完美拟合≠泛化能力强,奥卡姆剃刀原则要求“如无必要,勿增实体”,剪枝就是剃刀。5.预剪枝:贪心的局部最优演示`DecisionTreeClassifier(max_depth=3,min_samples_split=5,min_samples_leaf=2,min_impurity_decrease=0.01)`参数含义。现场调参实验:固定其他参数,仅调`max_depth`从1到7,绘制训练集/验证集准确率曲线。学生观察到:深度=3时验证集峰值0.88,深度>4验证集下降,训练集持续上升至1.0。教师讲解:预剪枝基于“乐观估计”,若当前分裂增益不足阈值则停止,优点是训练快、防过拟合早;缺点是“近视眼效应”——当前增益小但后续分裂可能带来大增益(如异或问题),导致欠拟合。分组讨论3分钟:“如何缓解预剪枝的欠拟合风险?”学生回答:降低阈值、引入验证集评估、改用后剪枝。教师肯定并补充:工程上常结合交叉验证网格搜索最优预剪枝参数组合。6.后剪枝:回溯的全局最优引入CCP(CostplexityPruning)代价复杂度剪枝算法核心思想:定义损失函数$R_\alpha(T)=R(T)+\alpha|T|$,其中$R(T)$为经验风险(误分类率),$|T|$为叶节点数,$\alpha$为复杂度参数。从全树$T_0$开始,自底向上计算每个内部节点“剪掉后形成的子树”带来的$\alpha_{eff}=\frac{R(T_t)R(T)}{|T||T_t|}$,即单位复杂度下降换取的风险上升。最小$\alpha_{eff}$对应节点最先被剪。生成剪枝序列$T_0\succT_1\succ...\succT_k$(仅根节点)。教师演示sklearn`cost_plexity_pruning_path`获取有效$\alpha$列表,配合`GridSearchCV`在验证集选最优$\alpha$。对比图显示:后剪枝树深度4,验证集准确率0.91,优于预剪枝0.88。总结:后剪枝保留了“后续可能有大增益”的分支,泛化通常更优,但训练耗时较长(需先生成全树)。工程建议:样本量<10万用后剪枝,>10万用预剪枝或LightGBM/XGBoost内置剪枝。(五)机房实战:从零构建可解释的挑瓜模型(40分钟)学生移步机房,登录JupyterLab打开预置Notebook`DecisionTree_Watermelon.ipynb`。教师全程屏幕广播关键步骤,学生同步操作,遇到报错举手或弹幕求助。任务1数据加载与探索(5分钟)```pythonimportpandasaspddf=pd.read_csv('watermelon_3.0.csv')print(df.head())print(())print(df['好瓜'].value_counts())```引导学生发现:属性均为中文离散文本,标签“是/否”。教师强调:机器学习只认数字,必须编码。任务2特征工程:标签编码与独热编码抉择(8分钟)教师演示两种编码:```pythonfromsklearn.preprocessingimportLabelEncoder,OneHotEncoder树模型对有序无序不敏感,但LabelEncoder引入虚假序关系推荐OneHot或OrdinalEncoder指定categoriesle=LabelEncoder()forcolindf.columns[:1]:df[col]=le.fit_transform(df[col])df['好瓜']=df['好瓜'].map({'是':1,'否':0})```学生实操后,教师追问:“若某属性取值100个,OneHot后维度爆炸怎么办?”引出:高基数离散特征可用TargetEncoding、HashingTrick,或直接用LightGBM原生支持类别特征。本课数据集低基数,LabelEncoder教学演示无碍。任务3分层采样与基线模型训练(7分钟)```pythonfromsklearn.model_selectionimporttrain_test_splitfromsklearn.treeimportDecisionTreeClassifierX=df.drop('好瓜',axis=1)y=df['好瓜']X_train,X_test,y_train,y_test=train_test_split(X,y,test_size=0.3,stratify=y,random_state=42)clf=DecisionTreeClassifier(criterion='entropy',random_state=42)clf.fit(X_train,y_train)print('训练集准确率:',clf.score(X_train,y_train))print('测试集准确率:',clf.score(X_test,y_test))```学生普遍得到训练1.0、测试0.70.8波动。教师引导观察:小数据集分层采样随机种子影响大,需多次实验取平均。任务4树结构可视化与决策路径解读(10分钟)```pythonfromsklearn.treeimportexport_graphvizimportgraphvizdot_data=export_graphviz(clf,out_file=None,feature_names=X.columns,class_names=['坏瓜','好瓜'],filled=True,rounded=True,special_characters=True)graph=graphviz.Source(dot_data)graph.render('watermelon_tree')生成PDFgraph.view()```学生电脑弹出PDF决策树图。教师指导解读:节点颜色深浅代表基尼不纯度,样本数`value=[好瓜数,坏瓜数]`,判断条件如`纹理<=0.5`对应LabelEncoder映射后的数值。要求学生在报告中标注:根节点纹理、第二层色泽与根蒂、叶节点纯度。挑战任务:用`clf.decision_path(X_test[0])`追踪单个测试样本通过的节点序列,手写决策路径解释:“该西瓜纹理=清晰→色泽=乌黑→根蒂=蜷缩→判定为好瓜”。任务5超参数网格搜索与模型优化(10分钟)```pythonfromsklearn.model_selectionimportGridSearchCVparam_grid={'max_depth':[2,3,4,5,None],'min_samples_split':[2,3,5],'min_samples_leaf':[1,2],'ccp_alpha':[0,0.001,0.01,0.1]}gs=GridSearchCV(DecisionTreeClassifier(criterion='entropy',random_state=42),param_grid,cv=5,scoring='accuracy',n_jobs=1)gs.fit(X_train,y_train)print('最优参数:',gs.best_params_)print('最优CV得分:',gs.best_score_)print('测试集得分:',gs.score(X_test,y_test))```学生运行等待约30秒。教师巡视:第一梯度尝试添加`max_leaf_nodes`、`class_weight`;第二梯代码跑通并记录最优参数;第三梯度在教师协助下修复缩进错误、导入缺失。汇总全班最优参数多为`max_depth=3,min_samples_split=3,ccp_alpha=0.001`,测试集准确率稳定在0.850.90。教师点评:网格搜索虽暴力但有效,实际项目中可用贝叶斯优化减少搜索空间。(六)迁移拓展与伦理辩论:泰坦尼克生存预测与算法偏见(15分钟)课堂回常态教室,启动迁移任务“泰坦尼克号乘客生存预测”。教师分发`titanic.csv`(含Pclass,Sex,Age,Fare,Embarked,SibSp,Parch等特征),布置微项目:利用课余2小时完成缺失值处理(Age中位数填补、Embarked众数、Cabin缺失过多直接丢弃)、特征工程(Sex/Embarked独热、FamilySize=SibSp+Parch+1、IsAlone衍生)、决策树建模与可视化、特征重要性条形图绘制、混淆矩阵热力图分析、超参数优化、撰写300字建模日志。设置“创新特征工程奖”“最美可视化树奖”“伦理洞察奖”三大奖项,下周评选展示。伦理辩论环节:投屏“某银行信贷决策树案例”,树中根节点为“邮编”,分支隐含种族隔离区划;第二层“性别”,女性拒贷率高。引用《欧盟人工智能法案》高风险AI系统要求。辩题:“决策树因可解释性强,是否应强制用于信贷、招聘、司量刑等高风险场景,替代黑盒深度学习?”正方:可解释=可审计=可问责,树结构天然支持人工干预剪枝偏见分支。反方:浅层树拟合能力弱,强制用树会牺牲准确率导致更多误判;偏见源于数据而非模型,深度学习配合SHAP/LIME同样可解释。教师不设标准答案,要求学生在作业中写入“立场声明+技术支撑论据”,培养技术治理素养。(七)本课小结与元认知复盘(5分钟)教师引导学生合上电脑,静默思考1分钟,在学习手册“离场券”栏完成三项:1.用一句话定义决策树的本质(关键词:递归分裂、纯度最大化、轴平行超矩形)。2.画出预剪枝与后剪枝在“模型复杂度泛化误差”坐标系下的轨迹差异草图。3.写下一个你仍困惑的问题(如:连续值分裂点如何选?缺失值如何流向?随机森林如何聚合?)。教师现场抽取5张离场券投屏点评,针对连续值分裂点承诺下节课“CART回归树与连续属性处理”专讲,缺失值引入“代理分裂”与“加权流向”,随机森林作为下下节“集成学习”引入。七、板书设计(双栏对照式)左栏“核心知识脉络”右栏“工程落地锚点”决策树=递归+纯度度量+剪枝├─熵/基尼:度量不确定性/不纯度sklearn:criterion='entropy'/'gini'├─信息增益/增益率/基尼增益:选最优属性手算微数据集验证分裂选择├─ID3(增益)→C4.5(增益率)→CART(基尼)理解演进逻辑,工程首选CART├─预剪枝:生长前阈值判断max_depth,min_samples_split,min_impurity_decrease└─后剪枝(CCP):生长后代价复杂度回溯ccp_alpha+GridSearchCV可视化:export_graphviz→Graphviz→PDF必看:feature_names,class_names,filled=True伦理:可解释性≠公平性,数据偏见需源头治理作业:泰坦尼克建模+立场声明八、分层作业设计与评价量表基础必做(全员):1.完成机房Notebook所有代码单元格运行无误,导出决策树PDF嵌入Word,标注根节点、叶节点纯度、测试集准确率。2.手算附件“微数据集”(6样本、3属性)的信息增益、增益率、基尼指数,判定根节点属性。3.阅读sklearn文档`DecisionTreeClassifier`参数表,用自己话解释`min_weight_fraction_leaf`与`max_features`作用场景。进阶选做(二梯度以上):4.泰坦尼克微项目完整报告(含特征工程代码、可视化树、混淆矩阵、特征重要性Top5解读、GridSearchCV最优参数、5折CV得分)。5.编写Python函数`manual_id3(df,target)`从零实现ID3算法(仅处理离散属性),对比sklearn结果一致性。6.搜集“决策树处理连续属性二分法”与“缺失值C4.5加权流向”资料,制作3页PPT下周汇报。拓展挑战(一梯度):7.实现简化版CCP后剪枝算
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 临床诊疗方法论专家讲座
- 慢性心衰治疗与护理
- 重难点-胃十二指肠疾病病人的护理
- 临床易混淆的概念及诊治技巧-十八-真性球麻痹与假性球麻痹的鉴别-胡明
- 中医药治疗帕金森病研究进展
- 2026小学道法教资面试易错题题库及解析
- 2026初中道法教资面试易错题题库及答案
- 高中体育教资面试高频考题题库及答案
- 护理突然停水应急预案与处理程
- 广东省佛山市2026年九年级下学期模拟考试化学试卷附答案
- 喜来登酒店弱电系统设计方案
- 造价人员廉洁自律教育课
- 小鸡创意绘画课件
- 排泄照护为老年人更换尿布纸尿裤养老护理员课件
- 食品微生物学-第九章-微生物与发酵食品
- 2025年大学英语四级词汇表(乱序版)
- 冷镦机培训资料
- 2024-2025学年高二数学复习:直线与圆的方程(压轴题专练)(原卷版)
- 2024年中考物理试题分类汇编:滑轮
- 环境安全资金投入表
- 滴滴标准服务流程
评论
0/150
提交评论