高一信息技术必修1编程处理大数据-以pandas分析校园消费数据为例教学设计_第1页
高一信息技术必修1编程处理大数据-以pandas分析校园消费数据为例教学设计_第2页
高一信息技术必修1编程处理大数据-以pandas分析校园消费数据为例教学设计_第3页
高一信息技术必修1编程处理大数据-以pandas分析校园消费数据为例教学设计_第4页
高一信息技术必修1编程处理大数据-以pandas分析校园消费数据为例教学设计_第5页
已阅读5页,还剩5页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

高一信息技术必修1编程处理大数据——以pandas分析校园消费数据为例教学设计一、教学背景与课程定位本课选自浙教版高中《信息技术》必修1《数据与计算》第四章第二节“大数据处理:编程处理数据”。处在教材链条中,本节前承数据采集与编码、数据管理与安全,后启数据可视化与人工智能初步,是“用计算思维解决真实问题”的关键落点。课程标准对本模块的要求十分明确:学生应能够借助恰当的计算工具,对真实情境中的数据进行加工、分析与表达,体会算法与程序在数据处理中的价值。本节教材给出的技术路径是Python语言结合pandas库完成数据的读入、清洗、筛选、统计与分组聚合,这正是当前数据分析岗位与科学研究中最基础的技能骨架。高一学生已经具备Python基础语法:变量、列表、字典、循环与条件结构,多数学生在第四章第一节中完成了用matplotlib绘制折线图的任务。但学生对“库”的理解停留在调用经验的层面,对DataFrame这种二维结构化数据对象缺乏直观认识,更不理解为何处理上万行数据时不能依赖Excel手工操作。本课的教学价值,正在于打通“语法会写”与“问题能解”之间的最后一公里。二、学情分析授课对象为高一年级两个平行班,每班45人,机房一人一机,预装Python3.10与Anaconda环境。通过课前问卷与上一单元作业抽样,学情呈现三个层次。第一层约占四分之一,能独立编写字典与循环嵌套程序,学有余力,可承担小组内的“代码讲解员”角色。第二层约占六成,语法知识零散,能模仿改写代码但迁移困难。第三层约占一成半,对编程有畏难情绪,需要支架式任务与即时反馈。学生的共同弱项有三。其一,面对CSV原始文件时不知道先观察字段与数据类型,习惯上来就写代码。其二,对“清洗数据”缺乏问题意识,认为机器读出来的数据天然正确。其三,混淆方法调用与属性访问,写作df.mean()与df.shape时极易出错。据此,本课采用“真实数据集驱动、阶梯任务推进、同伴讲解互促”的策略,将抽象概念锚定在食堂消费这一学生每天经历的情境上。三、教学目标1.信息意识:面对一份包含两万条记录的校园消费数据,能主动判断其中可能存在的缺失值、异常值与冗余字段,形成“原始数据不等于可用数据”的批判性认识。2.计算思维:能把“分析各年级人均午餐消费是否随月份变化”这一自然语言问题,分解为读入数据、按条件筛选、分组聚合、结果呈现四个可编程步骤,理解结构化思维对问题求解的支撑作用。3.数字化学习与创新:能独立调用pandas库的read_csv、dropna、groupby、mean等核心函数完成数据处理,并对处理流程进行个性化改写,增加新的统计维度。4.信息社会责任:在讨论数据脱敏的过程中,认识到个人消费数据涉及隐私,处理与传播须遵循匿名化与最小化原则。四、教学重难点重点:使用pandas完成结构化数据的读入、筛选与分组统计,理解DataFrame的行列索引结构。难点:groupby分组聚合的思维逻辑——把一个整体的表按某列拆分、对各子表分别计算、再合并为结果。这一“拆分—应用—合并”模式与学生已有的逐行循环思维有本质差异,是本课最需要突破的认知关口。五、教学方法与资源准备教学方法:情境驱动法、任务驱动法、小组协作与错例对比教学。资源准备:脱敏后的校园消费数据集canteen.csv,含字段:日期、时段、年级、性别、窗口编号、消费金额,共20000条,其中有意植入87条缺失值、12条金额为负的异常记录。教师机安装VSCode并录制两段微课备用;为第三层学生准备“填空式”代码脚手架canteen_template.py;为学优生准备拓展数据集library.csv(图书馆借阅数据)。环境预检清单:上课前一晚逐台机器运行一条测试脚本,确认pandas与matplotlib可正常导入,中文字体寄存器设置为SimHei,避免图表标题乱码。六、教学过程(一)情境导入:食堂经理的求助,用时约6分钟上课伊始,投影呈现一封虚拟但有真实质感的“食堂经理来信”:学校食堂计划下个学期调整窗口布局,需要知道三个问题的答案。问题一,哪个年级的学生平均每餐花钱最多。问题二,早餐、午餐、晚餐三个时段,哪个时段消费人次最集中。问题三,消费最少的10%学生,是吃得少还是窗口定价偏低所致,需要剔除异常数据后才能判定。信中给出的原始材料正是canteen.csv。教师现场用Excel打开该文件,学生亲眼看到滚动条缩成一小截、筛选两万行需要等待的情况。教师追问:如果数据不是两万条,而是两百万条,Excel会怎样。学生在哄笑中意识到手工处理的边界。教师顺势点题:数据一旦越过某个量级与复杂度,编程从“可选项”变成“必选项”,今天我们要用程序替食堂经理算出答案。此环节的设计意图在于用认知冲突替代空泛的重要性宣讲。两万条这个数字经过测算:足够大到Excel卡顿,又不至于让机房电脑运行脚本超过三秒,是课堂体验的“甜点区间”。(二)认识pandas与DataFrame,用时约8分钟教师在黑板上画出一个六行三列的表格示意,讲解三个要点。第一,pandas是第三方库,用importpandasaspd引入,pd是社区通行的别名,写代码约定俗成。第二,DataFrame可以理解为“程序内存里的Excel工作表”,有行索引与列名两套坐标。列名像语文里的主语,df[′金额′]表示取下这一整列;行条件像筛选器,df[df[′年级′]==′高一′]表示挑出满足条件的所有行。第三,Series与DataFrame的关系:一列是一个Series,多个Series拼成一张表。学生在练习本上完成一个“指哪儿写哪儿”的即时练习:教师在示意图上随手圈出“三年级且金额大于15的行”,学生口头说出对应的筛选表达式写法。全部答对后才允许动键盘,这一步的口琴式检查把最常见的方括号与引号错误消灭在动手之前。(三)任务一:读入数据并体检,用时约8分钟任务卡片写明四句代码的目标:读入文件、查看前五行、查看行列规模、按列统计缺失数量。学生参照教师板书,独立完成:df=pd.read_csv(′canteen.csv′)print(df.head())print(df.shape)print(df.isnull().sum())学生运行后立即看到结果:shape返回(20000,6),isnull统计显示金额列缺失87个值。教师抓住这个真实发现提问:这87个空洞是从哪里来的。引导学生推测刷卡机断网、记录上传失败等原因,进而提出处理策略的两个选项——整行删除dropna(),或用均值填补fillna(df[′金额′].mean())。教师引导学生讨论两种策略的适用条件:缺失比例小于百分之一时删除几乎不影响结论;若缺失集中在某一年级,盲目删除会造成系统性偏差。此处不灌输标准答案,而是让学生把“数据处理每一步都是有代价的决策”这句话写进学习单的思维栏。(四)任务二:筛选与排序,回答前两个问题,用时约10分钟小组领取任务卡。A组面向“人次最多时段”:df[′时段′].value_counts();B组面向“各年级人均消费”:先删除异常再进行分组统计。教师故意让B组先遇到负金额造成的荒谬结果——直接分组算出的某年级均值被拉到异常低位。当B组汇报结果时,教师不急于纠错,邀请全班用“挑刺法”审查:这个数字符合常识吗?学生意识到50元的消费不可能是真实用餐,于是补充一句过滤代码:df=df[df[′金额′]>0]再在干净数据上执行分组聚合:df.groupby(′年级′)[′金额′].mean()教师在投影上同步画出“拆分—应用—合并”示意图:一张表先按年级切成三块,每块各自求均值,三块结果拼回一张小表。配合类比:体育老师按班级测身高,分队列、各算平均、汇总公布。学生的眼神变化是这一环节最重要的课堂证据——groupby的抽象逻辑被一个生活动作锚定。(五)任务三:可视化呈现与结论表达,用时约8分钟各组把聚合结果绘制成柱状图,教师提供代码骨架:result=df.groupby(′年级′)[′金额′].mean()result.plot(kind=′bar′,title=′各年级午餐人均消费′)plt.show()教师强调可视化的三要素:标题说明变量关系、坐标轴含单位、图例不遮挡图形。每组派代表用两句话汇报:一句说数据事实,一句说据此给食堂经理的建议。例如“高三人均午餐消费14.6元,居三个年级之首,建议高三楼附近增设高价位窗口以减少排队”。教师即时点评:好的数据分析结论必须“有数字、有比较、有行动建议”,缺一则不完整。(六)拓展分层:一行之差的天梯,用时约5分钟学优生领取library.csv,尝试分析“哪个月份借阅量最高,哪类书最受欢迎”,需要把月份从日期字段中提取出来,用到df[′月份′]=pd.to_datetime(df[′日期′]).dt.month,这是对日期类型处理的直接延伸。中间层学生把本课脚本里的“年级”改成“性别”重新分析,体验维度切换的低成本。基础层学生在脚手架文件的四个空格里补齐函数名,确保人人得到一份能跑通的完整程序带回家。(七)课堂小结与责任教育,用时约5分钟教师带领学生用思维导图回看整节课的知识链:读入→体检→清洗→筛选→分组→可视化→表达,并指出链条上任一环偷懒,最后的结论都会被污染。随后话锋一转:如果这份消费记录没有脱敏,我们能从数据里看出某位同学每顿只吃五块钱,这意味着什么。学生发言中提到“贫困生隐私”。教师确认:数据分析能力越强,越要守住两条底线——原始数据不外传,结论发布要匿名。信息技术课教程序,也教克制。七、板书设计主板书为三栏结构。左栏:问题链——数据从哪来、干净吗、怎么算、怎么说。中栏:代码链——read_csv→isnull→dropna→df[条件]→groupby→plot。右栏:方法论——拆分·应用·合并,事实·比较·建议。副板书记录教学中即时生成的错例与订正,保留一节课的思维痕迹。八、作业设计基础作业:用本课数据集回答“工作日与周末的人均消费有何差异”,提交可运行的py文件与一张图。进阶作业:自选一个班级共同关心的话题(如体测成绩、图书借阅),设计三个可回答的问题并说明所需字段,下节课进行“数据集共建”讨论。作业评价采用三维量规:代码可运行40%、结论有依据40%、表达清晰规范20%。九、教学评价设计过程性评价嵌入三个节点:口头筛选表达式的全员过关、B组异常数据的课堂辩论、各组汇报的同伴互评。互评使用“两颗星一个建议”的句式,迫使学生先肯定再改进。终结性评价依托作业量规与下节课的单元小测,小测中设置一道groupby填空题与一道开放的分析设计题,分别检测技能与迁移。十、教学反思预设预设风险一:部分机房机器pandas版本差异导致plot中文乱码或警告刷屏

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论