高中一年级信息技术第五章数据处理与可视化表达单元复习教学设计_第1页
高中一年级信息技术第五章数据处理与可视化表达单元复习教学设计_第2页
高中一年级信息技术第五章数据处理与可视化表达单元复习教学设计_第3页
高中一年级信息技术第五章数据处理与可视化表达单元复习教学设计_第4页
高中一年级信息技术第五章数据处理与可视化表达单元复习教学设计_第5页
已阅读5页,还剩7页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

高中一年级信息技术第五章数据处理与可视化表达单元复习教学设计一、教学依据与教材分析本课对应粤教版(2019)高中信息技术必修一《数据与计算》第五章“数据处理与可视化表达”。本章位于全书的收束位置,前承第一章数据与信息、第四章程序设计基础,后接第六章人工智能及其应用,是学生从“会编写程序处理简单问题”走向“用数据思维解决真实问题”的关键节点。本章内容涵盖认识大数据、数据采集、数据预处理(含数据清洗)、数据分析、数据可视化表达五大板块,每一条主线都指向计算思维与数字化学习与创新两大核心素养。从课程标准的要求看,学生在完成本章学习后,应当能够针对具体问题选用恰当的工具和方法完成数据的采集、分析与呈现,能够从图表中读取信息并作出合理判断,能够在数据分析实践中体会数据背后隐藏的规律与价值。复习课的任务不是把新授课内容压缩重讲一遍,而是帮助学生把分散的知识点编织成结构化的网络,把零碎的程序语句整合成可迁移的问题解决能力。二、学情分析授课对象为高一年级学生。经过前面章节的学习,班级学生已经掌握了Python基本语法,包括变量、数据类型、选择结构、循环结构以及列表操作,多数学生在教师带领下运行过pandas、numpy、matplotlib相关的示例代码。但从平时作业与单元测验反馈看,学生存在三类典型问题。其一,概念易混,例如把“数据采集”与“数据分析”混为一谈,把“数据清洗”简单理解为“删除空值”。其二,程序会抄不会写,离开范例代码后无法独立调用库函数,对函数参数的含义一知半解。其三,图表选择随意,画得出图却说不清为什么选这种图,更谈不上从图中提炼结论。高一学生正处于抽象逻辑思维快速发展的阶段,对贴近生活的真实数据有天然的兴趣,例如班级成绩、运动步数、消费记录、天气数据。复习课应充分利用这一特点,以真实情境驱动知识重构,让学生在做中回顾、在用中巩固。三、教学目标信息意识方面:学生能够从生活场景中识别数据问题,判断需要采集什么数据、用什么方式采集,认识到数据质量直接影响分析结论的可靠性。计算思维方面:学生能够完整复述并应用“采集—预处理—分析—可视化”的数据处理流程,能够针对具体问题选择合适的分析方法和图表类型,能够读懂并修改基于pandas与matplotlib的典型代码。数字化学习与创新方面:学生能够综合调用网络工具、电子表格软件与Python编程环境完成一次完整的小型数据分析任务,能够评价自己与他人可视化作品的表达效果。信息社会责任方面:学生能够在采集与使用数据时自觉保护个人隐私,认识到大数据应用中的伦理边界,不篡改数据、不歪曲图表以迎合预设结论。四、教学重点与难点教学重点是数据处理完整流程的建构,即让学生形成从问题出发、以结论收束的完整思维链条,同时掌握采集、清洗、分析、可视化各环节的核心方法与对应工具。教学难点有两处。一是数据预处理的判断与决策,学生需要理解缺失值、重复值、异常值的成因与处理策略的差异,而不是机械记忆函数名称。二是可视化图表类型的选择依据,即比较关系用条形图或柱状图、趋势变化用折线图、占比结构用饼图或环形图、分布特征用直方图、两变量相关关系用散点图,这种选择背后的逻辑是本节课要捅破的窗户纸。五、教学方法与资源准备教学方法采用任务驱动法与问题导向教学法为主,辅以小组协作学习和对比评价法。课前通过问卷星发布五道前测小题,掌握班级对核心概念的遗忘程度,据此微调课堂讲评的侧重。硬件环境为机房,保证每生一机。软件环境安装好Python3.x解释器及pandas、numpy、matplotlib第三方库,备用表格以应对个别机器运行故障。教师提前准备两份数据文件:一份是某市一周内逐日气温与空气质量的真实数据,一份是刻意埋入缺失值、重复值和明显异常值的班级体测数据(已做脱敏处理,姓名以学号替代)。另准备学案一份,内含知识结构填空图、代码改错区与小组任务单。六、教学过程(一)情境导入,引出复习主线(约5分钟)教师在大屏上展示两张图。第一张是某电商平台给用户的年度消费报告截图,第二张是气象台发布的台风路径预测图。教师提问:这两张图风格迥异、来源不同,但它们背后经历着同一条流水线,这条流水线由哪几道工序组成?学生根据已有认知回答,教师将关键词写在黑板左侧:采集、处理、分析、可视化。教师顺势明确本课任务:今天我们不做新知识的学习,而是要给这条流水线做一次全面检修,要求每一个人下课后都能独立完成一次从头到尾的小型数据分析。随后公布本节课的任务主线——用一份真实的班级体测数据,回答三个问题:我们班的体质状况整体处于什么水平?班级内部差异大不大?哪几个项目最需要加强锻炼?设计意图在于用学生熟悉的可视化产品唤醒旧知,把第五章的四大板块一次性悬挂到情境主线上,避免逐节复述带来的枯燥感,同时让学生明确本节复习课的产出标准。(二)环节一:认识大数据与数据采集的知识重构(约8分钟)教师组织学生用两分钟时间回忆大数据的四个特征,由学生抢答,教师板书并逐一点评。体量大指数据规模达到传统工具难以处理的程度;类型多指数据涵盖文本、图片、音频、视频、日志等多种形态;速度快指数据产生和更新迅猛,要求实时或近实时处理;价值密度低指海量数据中有价值的信息占比很小,如同沙里淘金。教师补充强调:这四个特征不是背诵条目,而是解释现象的工具,比如为什么刷短视频时推荐越来越懂你,因为平台在高速处理体量大、类型杂的行为数据,从中提炼出对你有价值的信息。随后进入数据采集环节的梳理。教师提问:任务单中的体测数据可以用哪些方式获取?学生归纳出人工记录录入、传感器自动采集(如体质测试仪器)、问卷收集、网络爬虫抓取公开数据等途径。教师归纳采集的三个基本要素:明确采集对象、选择采集方法与工具、落实存储位置与格式。特别强调采集的合法合规:只采集完成任务所必需的数据,涉及个人信息的必须脱敏,未经许可不得抓取设置访问限制的网站数据。学生在学案的知识结构图上补全“大数据四特征”和“采集三要素”两处空白,同桌互查。(三)环节二:数据预处理,在脏数据中做真判断(约12分钟)这是本节课的第一个重心。教师将埋有问题的体测数据文件通过机房广播系统推送到每名学生桌面,要求用两种方式打开观察:先用电子表格软件肉眼排查,再思考用程序批量排查的思路。学生很快发现问题。第三行引体向上成绩为空;第七行某位同学的体重记录为560千克,明显异常;第十五行与第九行完全是同一条记录的重复;还有若干单元格填了“缺考”这样的文字,无法参与数值计算。教师组织全班讨论三类问题的处理策略,并把结论板书。缺失值的处理要看比例与用途:占比很小可以直接删除该行,关键数据缺失应退回重新采集,数值型字段也可以用均值或中位数填充,但要意识到填充会引入偏差。重复值一般直接删除,但要先确认不是合理的重复记录。异常值不能一概删除,首先要甄别是录入错误还是真实极端值:录入错误应修正或剔除,真实极端值反而可能是分析中最有价值的信息。接着教师带领学生回顾用pandas完成数据清洗的核心代码,采取“教师写一半、学生接一半”的互动方式。导入库:importpandasaspd读取数据:df=pd.read_csv("体测数据.csv",encoding="utf8")查看前五行:print(df.head())检测缺失:print(df.isnull().sum())删除缺失行:df.dropna(inplace=True)删除重复行:df.drop_duplicates(inplace=True)条件筛选剔除异常:df=df[df["体重"]<200]教师逐行追问每个参数的作用:inplace=True意味着什么?(在原数据框上直接修改,不生成新副本)方括号里的布尔表达式是如何起筛选作用的?学生回答的过程就是把程序读透的过程。教师强调一条经验:清洗后的每一步操作都要打印行数确认,数据从85行变成81行,要知道消失的4行分别死于哪道工序。本环节结束前两分钟,教师让学生在学案上写下一句话总结:为什么说数据清洗占据数据分析工作的大半时间?理想答案是真实数据必然脏,且清洗质量决定后续一切结论的可靠性,垃圾进垃圾出。(四)环节三:数据分析,用方法回答三个问题(约10分钟)教师把情境任务拆解到方法层面。问题一“总体处于什么水平”对应集中趋势分析,主要指标是平均数、中位数、众数;问题二“内部差异大不大”对应离散程度分析,主要指标是最大值、最小值、极差、方差与标准差;问题三“哪些项目薄弱”需要先定义达标线,再统计各项目达标率并排序。学生在小组内讨论每一个问题应该计算的统计量,教师巡视指导,然后由各组派代表板演Python实现思路。教师给出关键语句框架:均值:df["体测总分"].mean()中位数:df["体测总分"].median()标准差:df["体测总分"].std()最大最小:df["体测总分"].max()与df["体测总分"].min()达标人数统计:df[df["体测总分"]>=60]["学号"].count()教师追问一个辨析题:全班平均82分,能否说明大家水平整齐?学生回答不能,因为平均数掩盖了分布信息,必须配合标准差看;如果标准差达到15分,说明两极分化严重。这个辨析直击学情中“只算平均数”的思维惯性。教师顺势拓展numpy的角色:它提供高效的数组运算能力,pandas底层就建立在numpy之上,日常处理中两个库搭配使用,例如用numpy的np.mean()、np.std()对数值数组快速计算。点到为止,不展开语法细节,避免冲淡主线。(五)环节四:数据可视化表达,让图表替数据说话(约15分钟)这是本节课第二个重心,也是完整任务的收口环节。教师先组织一轮“图表连连看”:学案左侧列出五种分析意图,右侧列出五种图表,学生独立连线后全班订正。比较多个项目的达标率高低——条形图或柱状图。展示某指标随时间的变化趋势——折线图。呈现各部分占总体的比例——饼图。观察一个变量的取值分布——直方图。探索两个变量是否相关——散点图。教师强调选择逻辑:先想清楚你的数据要回答什么关系,关系决定图形,而不是先选图形再凑数据。为强化这一观念,教师展示一张用饼图绘制三十个城市气温的反面案例,让学生指出其荒谬之处——饼图的扇形表达不出城市间的对比精度,切片过多后彻底失去可读性。随后进入matplotlib的代码回顾。教师带领学生逐段重建一张完整的成绩分布直方图:导入绘图库:importmatplotlib.pyplotasplt解决中文乱码:plt.rcParams["font.sansserif"]=["SimHei"]解决负号显示异常:plt.rcParams["axes.unicode_minus"]=False绘制直方图:plt.hist(df["体测总分"],bins=10,color="steelblue",edgecolor="black")添加标题:plt.title("班级体测总分分布直方图")添加横轴标签:plt.xlabel("总分")添加纵轴标签:plt.ylabel("人数")显示图形:plt.show()教师逐句追问参数含义:bins控制区间的切分数量,切得粗看趋势、切得细看细节;edgecolor给柱体描边是为了让相邻区间界限清晰;标题与轴标签缺一不可,一张没有坐标说明的图等于一篇没有主语的作文。学生在自己的电脑上运行这段代码,要求把bins从10改成5再改成20,观察图形变化,体会参数对表达效果的影响。然后布置小组综合任务:每组选择情境任务三个问题中的一个,用今天梳理的完整流程——读取、清洗、计算、绘图——生成一张配有结论文本的可视化作品,十五分钟完成。教师巡视,对进度慢的小组提供半成品代码支架,对进度快的小组追加挑战:尝试用scatter绘制“体重与50米跑成绩”的散点图观察相关性,或用分组条形图对比男女生各项目均值。成果展示阶段,挑选三组作品投屏。互评用量规四问:图表类型与分析意图是否匹配?标题坐标是否完整?数据处理过程是否交代清楚?结论是否有数据支撑、有无夸大?学生互评后教师点评,并示范如何把结论写得克制而有力,例如“全班体测总分均值为78.6,标准差为11.2,整体处于良好区间但个体差异明显;耐力跑达标率仅为61%,是各项目中短板,建议列入下一阶段锻炼重点”,对比“大家都跑得不行”这种结论的差距一目了然。(六)课堂小结与作业布置(约5分钟)教师引导学生用一分钟在学案的知识结构图上回填全章主干:一条流程主线——采集、预处理、分析、可视化;两组工具——pandas与numpy负责计算,matplotlib负责呈现;三处判断——缺失重复异常怎么处理、统计量怎么选、图表类型怎么配。结构图完成即板书同步收拢成一张简明的思维导图。分层作业如下。必做题:从教材配套资源或日常生活中自选一份不少于三十条记录的数据,完成从采集说明、清洗记录、两项统计分析到一张规范图表的完整小报告,下节课开展互评。选做题:尝试用pandas的groupby按性别或锻炼频率分组统计均值,观察分组变量的影响;有余力的同学可以查阅seaborn库,对比它

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论