高一信息技术校本选修《数据驱动决策:Python数据分析入门》教案_第1页
高一信息技术校本选修《数据驱动决策:Python数据分析入门》教案_第2页
高一信息技术校本选修《数据驱动决策:Python数据分析入门》教案_第3页
高一信息技术校本选修《数据驱动决策:Python数据分析入门》教案_第4页
高一信息技术校本选修《数据驱动决策:Python数据分析入门》教案_第5页
已阅读5页,还剩7页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

高一信息技术校本选修《数据驱动决策:Python数据分析入门》教案一、课程基本信息学科:普通高中信息技术年级:高一课程性质:校本选修课课时:第1课时(共8课时)授课主题:初识数据分析流程与Python生态环境适用教材:校本教材《数据科学与决策导论》第一单元执教时间:2027학년도第1学期二、核心素养导向的教学目标信息意识:通过真实场景中的数据洞察体验,建立“数据是客观世界数字化表征、蕴含规律可供挖掘”的认知,形成以数据说话、用证据推理的思维习惯。计算思维:掌握数据分析“获取—清洗—探索—建模—可视化—解读”全流程的计算逻辑,理解Python生态中Pandas、NumPy、Matplotlib库的功能定位与协作机制,能将现实问题转化为结构化的计算任务。数字化学习与创新:熟练配置Anaconda发行版与JupyterLab开发环境,掌握Conda虚拟环境管理与包依赖解决策略,具备自主搭建可复现计算环境的工程化素养。信息社会责任:明确数据采集与使用的法律边界与伦理规范,理解《数据安全法》《个人信息保护法》对校园数据项目的约束,树立合规用数、护佑隐私的责任意识。三、学情分析与教学对策本班学生已完成必修1《数据与计算》模块,具备Python基础语法、基本数据结构与程序控制结构能力,但缺乏面向数据处理的库级开发经验。问卷显示:85%学生未接触过虚拟环境管理,90%学生对数据清洗、探索性分析(EDA)概念模糊,仅15%学生能独立完成从CSV读取到绘图的完整代码链路。针对性对策:一是设计“环境配置闯关赛”,将抽象的依赖管理具象化为可视化任务卡,降低工程化门槛;二是引入“脏数据样本包”,让学生在真实报错中体会清洗必要性,驱动库函数学习;三是采用“结对编程+代码复盘”模式,利用同伴互助弥补个体代码能力差距,同步培养代码规范与注释习惯。四、教学重难点剖析重点:Conda虚拟环境的创建、激活、导出与迁移;JupyterLab界面交互与Markdown/Code单元混合编程范式;Pandas核心数据结构Series与DataFrame的构建、索引、切片及基础统计描述方法。难点:理解“环境隔离”在依赖冲突解决中的本质作用,灵活运用`loc`与`iloc`定位器处理标签与位置索引的差异,建立从异构数据源到整洁数据框的标准化映射思维。五、教学策略与资源准备策略组合:情境导入法(校园午餐满意度调查真实数据)→任务驱动法(四大闯关任务)→结对协作法(驾驶员导航员轮换)→可视化思维外显法(流程图绘制与代码注释强制规范)。资源清单:1.教师机预装Anaconda32024.10,镜像源预配置为清华源。2.学生机统一部署便携版Anaconda(U盘分发),规避校园网安装慢、权限受限问题。3.数据集:`lunch_survey_raw.csv`(含缺失值、异常值、编码混乱、列名非规范等典型问题),`lunch_survey_clean.csv`(标准对照组)。4.任务卡:环境配置卡、数据加载卡、清洗探索卡、可视化卡,每卡含目标、核心API提示、预期产出、常见报错对策。5.在线协作平台:部署在校内服务器的JupyterHub集中展示终端,支持实时拉取学生Notebook进行讲评。六、教学过程设计环节一情境激发:从“直觉决策”走向“数据决策”(8分钟)播放一段校园食堂档口排队的45秒延时摄影视频,画面定格在学生犹豫选择的瞬间。抛出问题:“如果你是食堂主管,如何决定明天增加哪个档口的供应量?凭经验?凭心情?还是凭数据?”展示去年某校因盲目扩充“网红奶茶”档口导致日均浪费餐食120kg、损失3.2万元的反面案例。引导学生提取关键信息:决策依据的缺失导致资源错配。自然过渡至本课核心任务——基于真实的“校园午餐满意度调查”数据,构建首个数据分析流程,为食堂运营提供科学建议。此环节旨在建立问题情境,激发解决真实问题的内驱力,确立“数据服务决策”的课程主线。环节二工程基石:可复现计算环境的构建与验证(18分钟)教师演示AnacondaNavigator启动失败的典型场景(Base环境污染导致TensorFlow与NumPy版本冲突),现场拆解报错堆栈,指出`condalist`显示的版本地狱现象。讲解Conda核心机制:通道、索引、求解器、事务。演示标准化建环指令链:condacreateneda310python=3.10ycondaactivateeda310condaconfigenvaddchannels/anaconda/pkgs/main/condaconfigenvaddchannels/anaconda/pkgs/free/condainstallpandasnumpymatplotlibjupyterlaby重点解析`n`命名规范、`python=3.10`版本锁定、通道优先级对速度的决定性影响。学生分组执行“环境配置闯关卡”:关卡一:在终端完成上述建环全过程,截图终端显示`(eda310)`前缀作为通关凭证。关卡二:运行`condalistexplicit>specfile.txt`导出精确规格文件,理解其在跨机器复现中的作用。关卡三:启动`jupyterlab`,在浏览器创建Notebook,重命名为`姓名_学号_第一课_环境验证.ipynb`,在首个Markdown单元记录环境版本信息,在Code单元执行导入测试代码:importsysimportpandasaspdimportnumpyasnpimportmatplotlibprint(f"Python:{sys.version.split()[0]}")print(f"Pandas:{pd.__version__}")print(f"NumPy:{np.__version__}")print(f"Matplotlib:{matplotlib.__version__}")教师巡查终端输出,重点排查`ModuleNotFoundError`、`SSL证书验证失败`、`端口占用`三类高频故障,现场演示`condainstallccondaforgecertifi`修复证书、`jupyterlabport=8889`指定端口等应急方案。此环节强化工程化规范,将环境视为项目资产而非一次性配置。环节三数据初遇:异构脏数据的加载与首轮诊断(22分钟)分发`lunch_survey_raw.csv`,要求学生用文本编辑器(VSCode或Notepad++)而非Excel打开,观察原貌:首行非标题、GBK编码导致中文乱码、分隔符混用逗号与分号、数值列夹杂“未填”“N/A”“”等非标准缺失标记、评分列出现11分、5分等业务逻辑异常值。结对编程启动,驾驶员编码,导航员查阅文档、提问质疑,每10分钟交换角色。任务卡核心代码骨架:importpandasaspd1.编码尝试与分隔符推断df_raw=pd.read_csv('lunch_survey_raw.csv',encoding='gbk',sep=None,engine='python',header=None)print("原始形状:",df_raw.shape)print(df_raw.head(10))2.重设表头:假设第3行为真实表头(索引2)new_header=df_raw.iloc[2].astype(str).str.strip()df=df_raw.iloc[3:].copy()df.columns=new_headerdf.reset_index(drop=True,inplace=True)print("重设表头后:",df.shape)print(df.dtypes)3.统一缺失值标记na_values=['未填','N/A','NA','null','NULL','','','']df.replace(na_values,pd.NA,inplace=True)4.关键列类型强转与异常值标记score_cols=['口味评分','环境评分','服务评分','性价比评分']forcolinscore_cols:df[col]=pd.to_numeric(df[col],errors='coerce')标记越界值df[f'{col}_异常']=~df[col].between(1,10)5.首轮概貌print(())print(df[score_cols].describe())print("各列缺失量:\n",df.isna().sum())教学重点指引:讲解`sep=None,engine='python'`自动嗅探分隔符原理;`iloc[2]`与`iloc[3:]`配合实现表头行提取与数据体分离的索引运算;`pd.to_numeric(errors='coerce')`将非数值静默转为NaN的容错机制;`between(1,10)`生成布尔掩码定位业务异常值的向量化思想。学生完成代码运行,在Notebook中用Markdown记录:数据量规模、字段语义、缺失模式、异常值分布、初步清洗策略。教师随机抽取3组Notebook投屏,聚焦“为何选第3行为表头”“为何不用dropna直接删行”“异常标记列的后续利用价值”三个追问,倒逼学生外显思维路径。环节四探索性分析:从单变量分布到多变量关联(25分钟)基于清洗后的DataFrame`df_clean`(教师提前分发标准版对照组,确保进度同步),开展结构化EDA。任务卡分四层递进:第一层单变量画像。绘制评分列直方图与箱线图组合,识别偏态分布与离群点。importmatplotlib.pyplotaspltplt.rcParams['font.sansserif']=['SimHei']plt.rcParams['axes.unicode_minus']=Falsefig,axes=plt.subplots(2,4,figsize=(16,8))fori,colinenumerate(score_cols):ax_hist=axes[0,i]ax_box=axes[1,i]df_clean[col].plot.hist(bins=20,edgecolor='black',alpha=0.7,ax=ax_hist)ax_hist.set_title(f'{col}分布')ax_hist.axvline(df_clean[col].mean(),color='red',linestyle='',label=f'均值:{df_clean[col].mean():.2f}')ax_hist.axvline(df_clean[col].median(),color='blue',linestyle=':',label=f'中位数:{df_clean[col].median():.2f}')ax_hist.legend(fontsize=8)df_clean.boxplot(column=col,ax=ax_box,vert=False,showfliers=True)ax_box.set_title(f'{col}箱线图')plt.tight_layout()plt.show()第二层分组对比。按“就餐时段”“性别”“年级”分组,计算评分均值与置信区间,绘制分组条形图与小提琴图。grouped=df_clean.groupby('就餐时段')[score_cols].mean()grouped.plot.bar(figsize=(10,6),colormap='Set2')plt.title('不同时段维度平均评分对比')plt.ylabel('平均分')plt.xticks(rotation=0)plt.legend(bbox_to_anchor=(1.05,1),loc='upperleft')plt.tight_layout()plt.show()第三层相关性洞察。计算皮尔逊相关系数矩阵,绘制热力图,解读评分维度间的共线性与业务含义。corr_matrix=df_clean[score_cols].corr()importseabornassnsplt.figure(figsize=(8,6))sns.heatmap(corr_matrix,annot=True,cmap='RdBu_r',center=0,vmin=1,vmax=1,fmt='.2f')plt.title('评分维度相关性热力图')plt.show()第四层文本型字段简易分析。对“改进建议”列缺失值填充为“无”,基于jieba分词提取高频名词,生成词云(选做,面向有余力小组)。教师巡场重点:检查Matplotlib中文配置是否生效;`subplots`坐标轴对象传递是否正确;`groupby`聚合后索引重置对绘图的影响;相关系数矩阵对角线为1的数学必然性与业务解读的区分。要求每组在Notebook末尾撰写“三大发现、两个疑问、一个建议”,作为课堂产出提交至JupyterHub。环节五成果沉淀与迁移:可复现报告生成与课后挑战(7分钟)演示Notebook导出为HTML与PDF(需预装TeXLive或使用`jupyternbconverttopdfTemplateExporter.exclude_input=True`隐藏代码仅保留图表与结论),讲解`@title`、`@markdown`魔法命令构建交互式参数面板的初步认知。布置课后挑战任务:1.完善当前Notebook:补全Markdown叙事,添加目录导航,修正图表中文乱码,生成最终报告`Final_Report_姓名.html`上传平台。2.迁移任务:获取学校图书馆过去一年借阅记录(CS

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论