版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
高中信息技术选修3人工智能初步教学设计——用回归分析让数据开口说话一、教学背景与教材分析本课选自浙教版(2019)高中信息技术选择性必修3《人工智能初步》第二章"数据、算法与问题解决"中的第5节"回归分析"。前两章内容已经帮助学生建立了数据、信息、知识与智能之间关系的初步认识,学生也掌握了用Python读写文件、处理列表与字典的基本技能。回归分析是学生第一次真正意义上"让机器从数据中学习规律"的内容,它是连接统计学思想与机器学习思想的桥梁,也是后续理解线性模型、损失函数、梯度下降等概念的源头。从教材编排看,本节内容包含三个层次:回归的含义与回归分析的基本流程、线性回归模型的建立与评价、以及回归分析在实际问题中的应用。教材给出的案例贴近生活,例如身高与体重、气温与用电量等,但停留在"看一看、算一算"的层面。要让学生真正理解"模型是对现实世界的近似刻画"这一核心思想,必须让学生亲手完成一次从原始数据到预测模型的完整旅程,并在旅程中经历困惑、尝试、验证与反思。本课定位为高阶思维培养课,课时安排为2课时(每课时45分钟),并辅以课后1小时的机房开放练习。教学环境为机房,每生一台计算机,预装Python3.x及numpy、matplotlib库,同时为学生准备了可直接导入的CSV数据集若干。二、学情分析授课对象为高二选修本模块的学生。他们已经在数学必修课程中学过用样本估计总体、散点图、直线拟合等统计学知识,对"用一条直线描述两个变量的关系"有直观印象,但对"这条直线是怎么找到的""凭什么说这条直线最好"缺乏深层理解。在信息技术学科方面,学生学过必修1的数据与计算,具备最基本的Python编程能力,但多数学生的代码能力停留在模仿阶段,独立调试能力较弱。从认知特点看,高二学生抽象逻辑思维趋于成熟,喜欢质疑和挑战,对"AI如何预测"这类话题有天然的好奇心。但同时,他们对纯理论推导容易失去耐心,公式一多就会产生畏难情绪。因此,教学中必须贯彻"直觉先行、公式殿后、代码落地"的策略:先用眼睛看见规律,再用手算体会最小化的含义,最后用代码完成批量计算,让三种表征方式相互印证。学习困难预判主要有三处:其一,学生容易把"相关"等同于"因果",需要刻意设计反例加以澄清;其二,理解"预测值与真实值之差的平方和最小"这一准则时,平方的作用容易被忽视;其三,在编程环节,数组运算与循环的混用容易出错,需要预置脚手架代码。三、教学目标1.信息意识:面对"通过前八次月考成绩预测高考适应性考试成绩""通过房屋面积估计租金"等真实问题,能主动意识到可以利用历史数据建立模型进行定量预测,并能审慎评估预测结果的可信范围,知道数据规模、数据质量与预测可靠性之间的关系。2.计算思维:能把"找一条最合适的直线"这一模糊的自然语言问题,逐步抽象为"确定斜率和截距两个参数,使预测误差平方和最小"的形式化问题;能将批量数据运算分解为可执行的步骤并用Python实现;能通过改变参数观察误差变化,体验优化求解的过程性。3.数字化学习与创新:能使用numpy进行向量化计算,用matplotlib绘制散点图与拟合直线,并能对现有代码进行迁移改造,解决新的回归任务;能利用网络资源查阅方法说明,具备初步的自主探究能力。4.信息社会责任:认识到回归模型可能放大训练数据中的偏差,在使用模型做涉及人的判断时(如成绩预测、信用评估)要保持审慎,理解"模型帮助人决策,而不是代替人负责"的边界。四、教学重点与难点教学重点:线性回归的建模思想,即通过最小化误差平方和来确定模型参数;运用Python完成"读数据—看数据—建模型—做预测—评模型"的完整流程。教学难点:对最小二乘思想的深层理解——为什么要用平方,参数最优意味着什么;模型过拟合与数据代表性的初步感知。五、教学方法与策略本课采用"问题链驱动+动手实验+对比反思"的混合式教学策略。以一条贯穿始终的问题链牵引课堂:数据里有规律吗——规律用什么刻画——什么样的刻画算好——机器如何找到最好的——找到之后敢不敢用。每个问题都先让学生凭直觉作答,再用实验验证或推翻,制造适度的认知冲突。具体方法上,概念建构环节采用生活情境类比与可视化演示;原理解析环节采用"三人小组手算小样本"的方式,让最小二乘思想可触摸;编程实践环节采用分层任务单,基础任务提供半成代码补全,进阶任务开放自主实现;思辨环节采用微型辩论的形式讨论模型使用的边界。六、教学准备教师准备:多媒体课件;matplotlib实时绘图演示脚本;两份数据集(数据集A为10个样本的"学习时长—成绩"小数据,供手算;数据集B为200条某小区"面积—月租金"数据,含少量异常值,供编程);分层任务单与评价量表;板书设计。学生准备:复习Python列表与循环;课前完成问卷"你认为考试成绩能否被预测",课上引用其结果制造话题。七、教学过程第一课时从散点到直线:让规律现形环节一:情境导入——一场关于"预测"的争论(约7分钟)上课伊始,教师公布课前问卷结果:约六成学生认为成绩可以被预测,三成认为完全不能,其余表示不确定。教师顺势抛出一个具体情境:某同学前八次月考的数学成绩依次为82、85、83、88、90、87、91、93分,临近期末,他想知道自己大概能考多少分,也好决定要不要把更多时间分给薄弱科目。教室里随即出现两种声音,一种说"看趋势在涨,估计九十五左右",另一种说"考试变数大,说不准"。教师不急于评判,而是追问:"两种说法谁更有道理?如果让你给这位同学一个有理有据的回答,你还需要什么?"学生在讨论中意识到,单看一列成绩数字还不够,如果能知道每次成绩与备考投入之间的关系,预测会更可靠。由此引出本课主题:当两个变量之间存在某种关联时,我们可以利用已有的成对数据去发现这种关联并用它做预测,这就是回归分析。设计意图:用学生自己的问卷分歧制造认知张力,让"为什么要学"先于"学什么"出现。同时埋下伏笔:直觉判断与数据驱动的判断之间的差距,正是本课要弥合的。环节二:新知建构——什么是回归(约10分钟)教师在大屏幕上演示:将数据集A的十个样本(每周学习时长x与对应测验成绩y)画成散点图。学生肉眼可见点大体沿从左下到右上的方向分布。教师讲解三个基本概念:当两个变量之间存在不确定的数量依赖关系时,称为相关关系;用一个函数(最简单的是直线方程y=wx+b)去逼近这种关系的过程,称为回归;w称为回归系数(斜率),b称为截距,w的正负表明相关的方向,绝对值大小表明联动的强度。随后教师用动态演示软件画出三条不同的直线穿过同一片散点:一条明显偏上,一条明显偏下,一条穿行其中。请学生投票哪条"最合适"。大多数学生凭眼睛能选对第三条。教师追问:"眼睛说第三条好,可计算机没有眼睛,它怎么判断?"学生陷入短暂沉默——这正是引出量化标准的好时机。设计意图:把"回归"从名词还原为动作,把"拟合优度"从抽象概念还原为学生刚刚亲手做过的选择题,为最小二乘的出场铺平道路。环节三:核心突破——最小二乘思想的手算体验(约18分钟)教师给出极小样本:三个点(1,2)、(2,3)、(3,5)。第一步,假设直线为y=x(即w=1,b=0),请各小组计算每个点的"残差"——预测值与真实值之差,得到0、0、1。第二步,改用假设直线y=1.5x-1,再算残差,得到预测值0.5、2、3.5,对应残差为1.5、1、1.5。第三步,比较两条直线哪个"总误差"更小。课堂上立刻出现争议:如果把残差直接相加,第二种情况得到4.0,第一种得到1.0,似乎第一条好。但有学生指出第一条的残差是0、0、1,第三条直线明显从点(3,5)下方穿过,直觉上歪斜得厉害。教师抓住这个冲突点提问:"直接相加会有什么隐患?"学生经过讨论发现一正一负的残差会相互抵消,可能让一条糟糕的直线获得虚假的"好成绩"。有人提议取绝对值,教师肯定其合理性,然后指出数学与计算上的便利选择了另一条路:把每个残差平方后再求和。平方既消除了负号,又放大了大误差的惩罚,使得整条直线不会被个别点的"便宜"所收买。各小组重新计算两种方案的误差平方和:方案一为0+0+1=1,方案二为2.25+1+2.25=5.5。方案一胜。教师再请一组尝试方案三y=1.2x+0.2,看看能不能比1更小。学生在尝试中体会到:误差平方和是一个关于w和b的数值,可以让它尽可能小;使这个值最小的w和b,就是最优参数。教师板书点题:这种方法叫最小二乘法,它的求解有现成的公式(对三个点可列出方程组求解),而在计算机中,我们可以通过参数迭代或直接调用公式让机器完成这件事。为化解学生对公式的畏难,教师强调:本课不要求手推公式,要求的是理解"为什么要最小化误差的平方和",以及会观察误差随参数变化的曲线。教师展示一张误差平方和随斜率w变化的曲线图,指出整张曲线呈碗状,机器做的就是找到碗底。设计意图:用三个点的"穷举式"小实验,让最小二乘从一行令人生畏的公式变成学生亲手验证过的结论;借残差相加的冲突自然引出平方的必要性,而不是教师宣布结论。曲线图的呈现为第二课时的算法实现埋下伏笔。环节四:拓展示例与相关、因果之辨(约8分钟)教师展示两个趣味案例:某城市过去十年冰淇淋销量与溺水事故数量的散点图呈现高度正相关;某地区核电站数量与癌症患者数量也呈明显正相关。提问:要禁止吃冰淇淋来防溺水吗?要拆掉核电站来治病吗?学生在笑声中给出否定答案。教师引导归纳:回归揭示的是变量间的共变关系,相关不等于因果。冰淇淋与溺水背后藏着共同的第三变量——夏季高温;核电站与癌症背后藏着共同变量——人口密集的大城市。使用回归模型做决策时,必须警惕被虚假关联误导。随后布置课后思考:请每人从生活中找一对可能"假相关"的变量,并说明可能被忽略的第三变量。小结与过渡:教师用三句话收束第一课时——我们发现数据里藏着规律,用直线去逼近规律,用误差平方和最小来定义最好的逼近。下一课时,我们让计算机替我们完成这件事,并回答一个更刺激的问题:模型给出的数字,我们敢信吗?第二课时让机器学规律:编程实现与模型评价环节五:复习激活与任务发布(约5分钟)教师用一张思维导图快速回顾上一课时的关键词:散点图、相关关系、回归直线、残差、误差平方和、最小二乘。随后发布本课主任务:利用数据集B(某小区200套房源的面积与月租金),用Python建立一元线性回归模型,预测一套85平方米的房屋月租金,并评估这个预测的可信程度。教师特别提示:数据不是干净的,里面混进了几套"天价豪宅"和一条录入错误的记录(面积为0),希望学生在过程中自己发现它们。这一预设使任务带有探案色彩。环节六:编程实践一——读数据、看数据(约12分钟)学生打开分层任务单。基础层提供如下脚手架代码:```importnumpyasnpimportmatplotlib.pyplotaspltdata=np.loadtxt('rent.csv',delimiter=',',skiprows=1)x=data[:,0]面积y=data[:,1]月租金plt.scatter(x,y,s=10)plt.xlabel('area')plt.ylabel('rent')plt.show()```学生运行后立即看到散点图,同时发现右上方有几个离群点、左下角有一个点在坐标轴附近趴着。教师组织简短交流:这些点是什么?要不要删掉?讨论后形成共识——面积为0的那条是录入错误,应删除;天价的别墅与目标房屋(普通住宅85平方米)不属于同一群体,保留会拖拽直线,本任务中可以剔除,但要在报告中说明剔除的理由。学生使用布尔索引完成清洗,例如`mask=(x>10)&(x<150)`后进行筛选。教师巡视,重点指导把筛选条件写反、忘记同时筛选x和y两类高频错误。进阶层任务:尝试不删离群点先画图保存,与清洗后的图并排展示,为后面的对比讨论积累素材。设计意图:真实世界的数据从不干净,让学生在"踩刹车"中体会数据质量对模型的决定性影响,这是任何教科书例题都给不了的体验。环节七:编程实践二——求参数、做预测(约15分钟)教师引导学生回忆:"最小二乘告诉我们目标是什么——让误差平方和最小。好在数学家有现成结论,斜率等于x与y的协变程度除以x自身的离散程度。"给出可直接使用的两行核心代码:```w=((xx.mean())(yy.mean())).sum()/((xx.mean())2).sum()b=y.mean()wx.mean()```教师逐行解释:分子衡量x偏离均值时y如何同向或反向变化,分母衡量x自身的波动范围;二者相除,得到"x每多一平方米,租金平均变化多少元"的估计。截距b则保证直线穿过数据中心点。学生运行得到w约为一个正值、b为某个常数后,完成任务单的三个子任务:第一,画出拟合直线叠加在散点图上:```plt.scatter(x,y,s=10)plt.plot(x,wx+b,color='red')plt.show()```第二,预测85平方米房屋的租金:```x_new=85y_pred=wx_new+bprint(y_pred)```第三,计算并输出整个数据集的误差平方和,以及平均每个点偏差多少(误差平方和除以样本数后开平方,得到平均意义上的偏差量级)。学有余力的学生挑战进阶任务:不调用上述公式两行,改用"试错法"——让w在一个范围内以固定步长扫描,记录每个w对应的最优b与误差平方和,画出"误差随w变化"的曲线,验证碗状曲线的最低点是否与公式结果一致。这一任务把第一课时的几何图像落到代码上,完成理解的闭环。教师巡视过程中收集两类典型问题当堂讲评:一是把numpy数组当普通列表用循环逐个处理,虽然结果正确但效率低,借此机会展示向量化运算的简洁;二是绘图时忘记先画散点再画线导致图层被遮盖的讨论,顺带提及可视化的基本规范。环节八:模型评价——这个数字可信吗(约10分钟)全班的预测值大致收敛后,教师请几位学生报出他们的预测租金与直线参数,发现各组数字相近但不完全相同——因为各组清洗数据的标准略有差异。教师抓住这一现象提问:"同样是两百条数据,为什么答案不完全一样?哪一个是对的?"学生意识到:模型结论依赖于数据的选择与处理,预测值本身就带着不确定性。教师引入辅助判断的三个视角,全部由学生在图表上亲手验证而非空讲:一看直线是否穿过了点的"主体",把离群点剔除前后的两条直线画在一起比较斜率变化;二看预测点落在数据范围内还是范围外——数据集中面积最小30平方米、最大140平方米,预测85平方米属于内插,相对可靠,若预测300平方米就属于外推,风险大增;三看点围绕直线的"松紧程度",误差平方和越大,说明租金除了面积还受别的因素影响,单靠面积的刻画力有限。教师顺势点拨:房屋租金还受楼层、朝向、装修、地段影响,只用一个变量是简化世界;将来可以用多个变量建立更精细的模型。这一句话既回答了"误差从哪来",也为后续课程埋下接口。设计意图:评价环节不停留在"学会了真好"的表层,而是让学生在互相矛盾的预测值面前亲历模型不确定性的存在,这是对信息意识与社会责任目标最有力的落实。环节九:思辨与升华——模型的边界(约7分钟)组织微型辩论。辩题:"如果有一套系统能根据历次成绩预测高考分数,学校应不应该把预测结果告诉学生?"正反双方各三名学生限时发言。正方可能提到帮助学生定位、合理分配复习时间;反方可能提到标签效应、模型放大偶然失误、给学生制造焦虑。教师总结时强调两点:第一,模型是参考,不是判决书,预测依赖过去的数据,而人的未来并非过去的简单延长线;第二,模型的使用涉及对人的影响时,技术可行性之上还有伦理的门槛。教师进一步指出:今天写的十几行代码,与新闻中看到的各种智能预测系统,底层思想是一致的,都是从数据中学习规律。掌握了思想,就握住了理解人工智能的第一把钥匙。环节十:课堂小结与作业布置(约3分钟)师生共同完成知识结构化:回归分析回答"变量间有没有数量关系";最小二乘回答"哪条直线最好";编程实现回答"机器如何替你算";模型评价回答"结果敢不敢用"。四个回答串成本课的完整逻辑链。分层作业:基础作业为完成机房下发的第二个数据集(周平均气温与班级用电量)的完整回归流程并提交实验报告,报告中必须包含数据清洗说明、参数、预测值与可信性分析;拓展作业为选做——收集自己近十次运动时长与次日主观疲劳感的自评数据,尝试建立个人化的回归模型,并写下一次预测失败的反思。八、板书设计主板书采用左右对照的双栏结构。左栏为思想线:问题→散点图→假设直线→残差→误差平方和→最小化→最优参数。右栏为操作线:读数据→看数据(清洗)→算参数
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 乡镇出具的现实表现材料
- 论杜威的技术探究对教育研究的启示
- 机械加工厂成本控制办法
- 义眼台植入术后的护理
- 小脑出血平衡功能康复
- 中医内科学头痛病因病机
- 建筑工地环境保护准则
- 某玻璃厂薪酬制度
- 2027届辽宁省丹东市第18中学九年级化学第一学期期末质量检测试题含解析
- 2027届湖北省武汉市青山区九年级化学第一学期期末考试模拟试题含解析
- 2024-2025学年广东广州番禺区七年级(下)期末数学试卷及答案
- 水果农药安全间隔期执行手册
- 软包墙面施工方案及技术措施
- 急诊科护理人员的血气分析解读
- 2025年闽侯县公安局招聘警务辅助人员真题
- 2025年安徽省《保密知识竞赛必刷100题》考试题库及答案详解【有一套】
- 2025年度新疆新星国有资本投资集团有限公司校园招聘5人笔试参考题库附带答案详解
- 销售心态培训课件
- 正反转电路培训课件
- 贵州省农业发展集团有限责任公司招聘笔试题库2026
- 《男生和女生》课件
评论
0/150
提交评论