高中信息技术 必修1 数据与数据的结构化 教学设计之特征探索与数据建模_第1页
高中信息技术 必修1 数据与数据的结构化 教学设计之特征探索与数据建模_第2页
高中信息技术 必修1 数据与数据的结构化 教学设计之特征探索与数据建模_第3页
高中信息技术 必修1 数据与数据的结构化 教学设计之特征探索与数据建模_第4页
高中信息技术 必修1 数据与数据的结构化 教学设计之特征探索与数据建模_第5页
已阅读5页,还剩8页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

高中信息技术必修1数据与数据的结构化教学设计之特征探索与数据建模一、教材定位与内容重组粤教版(2019)高中信息技术必修1《数据与计算》模块中,第5章“数据的结构化”是连接数据认知与计算思维的关键桥梁。第5.3节“特征探索”作为本章的核心课时,承担着从“数据收集整理”向“数据建模分析”跨越的教学重任。教材以“某中学学生体质健康数据”为核心情境,引导学生通过特征提取、特征选择、特征构建三个层面,完成对原始数据的深度加工。然而,教材呈现的线性流程掩盖了特征工程在真实数据科学项目中的迭代本质,且对“领域知识驱动特征构建”的强调不足。本教学设计将单课时重组为双课时教学模块:首课时聚焦“特征提取与选择的统计学逻辑”,次课时深入“领域驱动的特征构建与模型评估”,并贯穿一条“体质健康干预方案生成”的完整项目主线,使学生在真实问题解决中内化数据建模的核心思想。二、核心素养导向的教学目标1.信息意识:能敏锐识别原始数据中与问题相关的潜在信号,理解特征作为数据与模型间“翻译层”的本质作用,建立“数据质量决定模型上限”的工程认知。2.计算思维:掌握基于统计量(相关系数、互信息、方差阈值)的特征筛选方法,能运用Python实现特征标准化、多项式扩展、交叉组合等构建操作,理解特征工程对模型泛化能力的决定性影响。3.数字化学习与创新:能结合体育卫生领域知识(如BMI指数、体脂率估算公式、心肺功能指标),将专家经验转化为可计算的特征表达式,设计并迭代优化“学生体质健康风险预警模型”。4.信息社会责任:严守学生隐私数据保护规范,理解特征选择中可能引入的群体偏见风险,在模型部署环节嵌入公平性约束与可解释性要求。三、学情分析与教学策略学生已完成Python基础语法、Pandas数据清洗、Matplotlib可视化及第5.1、5.2节的数据采集与清洗学习,具备DataFrame操作与基础统计分析能力。但普遍存在三个认知盲区:一是将特征工程等同于单纯的列选取,忽视构建过程;二是缺乏领域知识迁移经验,难以从体质测试指标中推导出复合特征;三是对“特征泄露”“数据窥视”等工程陷阱毫无概念。针对性采取“脚手架式建模”“领域知识可视化迁移”“对抗性案例教学”三大策略,通过预置不完整代码框架、引入体育专家访谈视频、设计故意泄露标签的陷阱数据集,分层化解难点。四、教学资源与环境配置硬件:每组4人配置一台安装Anaconda环境的高性能笔记本电脑(i7/16GB/SSD),投影仪支持无线投屏。软件:JupyterLab作为主开发环境,预装pandas、numpy、scikitlearn、seaborn、shap、category_encoders库。数据集:脱敏处理后的《国家学生体质健康标准》测试数据(含3000条记录,32个原始字段,覆盖身高、体重、肺活量、50米跑、立定跳远、坐位体前屈、引体向上/仰卧起坐、血压等),按7:3分层抽样划分训练集与测试集。辅助材料:《中国学龄儿童青少年体质健康评价手册》电子版、特征工程代码模板库(GitHubClassroom分发)、在线协作白板。五、教学过程设计(一)首课时:特征提取与选择——从统计显著到业务可用1.情境激活与问题具象化(10分钟)投影展示某中学体测数据看板:总体优良率62%,但女生耐力跑不合格率高达38%,男生上肢力量薄弱。抛出核心任务:“校医院需在下学期体测前两个月,精准识别高风险学生并生成个性化干预建议。现有32项原始指标,哪些是关键特征?如何组合它们?”学生分组讨论3分钟,在白板标记直觉判断的“核心指标Top5”。教师收集结果,揭示直觉与数据的偏差:多数组选中身高体重,忽略脉搏血压;无人想到构建“功率指数”“体脂估算值”等复合指标。2.特征提取:统计视角的系统化拆解(20分钟)教师演示完整提取流程,学生同步操作。首先加载数据,分离数值型与类别型特征:importpandasaspdimportnumpyasnpdf=pd.read_csv('physical_fitness_train.csv')num_cols=df.select_dtypes(include=[np.number]).columns.tolist()cat_cols=df.select_dtypes(exclude=[np.number]).columns.tolist()print(f'数值型特征{len(num_cols)}个:{num_cols}')print(f'类别型特征{len(cat_cols)}个:{cat_cols}')针对数值型特征,引导学生从分布形态、集中趋势、离散程度、异常值四维度刻画。重点讲解偏度与峰度对线性模型假设的违背,演示BoxCox变换恢复正态性:fromscipy.statsimportboxcoxfromscipy.specialimportinv_boxcoxskewed_feats=df[num_cols].apply(lambdax:x.skew()).abs()high_skew=skewed_feats[skewed_feats>0.75].indexforfeatinhigh_skew:if(df[feat]>0).all():df[feat],_=boxcox(df[feat]+1e6)类别型特征采用目标编码替代独热编码,防止维度爆炸。教师现场编码对比独热编码与目标编码在高基数特征(如“运动习惯”12个类别)下的维度差异,并强调目标编码需在K折交叉验证内部拟合以防泄露:fromcategory_encodersimportTargetEncoderte=TargetEncoder(smoothing=10)df[cat_cols]=te.fit_transform(df[cat_cols],df['risk_level'])学生动手完成:对训练集所有特征执行上述提取与编码,输出处理后的特征矩阵X_train,并在白板记录处理决策日志(如“肺活量做了BoxCox,λ=0.3”)。3.特征选择:多维度筛选策略的工程落地(25分钟)构建“过滤法包裹法嵌入法”三阶段筛选管道。过滤法阶段,计算方差阈值剔除准常数特征,计算皮尔逊相关系数矩阵剔除多重共线性特征(|r|>0.9保留业务含义更强者),计算互信息捕捉非线性依赖:fromsklearn.feature_selectionimportVarianceThreshold,mutual_info_classifselector_var=VarianceThreshold(threshold=0.01)X_var=selector_var.fit_transform(X_train)corr_matrix=pd.DataFrame(X_var).corr().abs()upper=corr_matrix.where(np.triu(np.ones(corr_matrix.shape),k=1).astype(bool))to_drop=[columnforcolumninupper.columnsifany(upper[column]>0.9)]mi_scores=mutual_info_classif(X_var,y_train,random_state=42)mi_series=pd.Series(mi_scores,index=X_var.columns).sort_values(ascending=False)包裹法阶段,采用递归特征消除配合随机森林,搜索最优特征子集:fromsklearn.ensembleimportRandomForestClassifierfromsklearn.feature_selectionimportRFECVrf=RandomForestClassifier(n_estimators=200,random_state=42,n_jobs=1)rfecv=RFECV(estimator=rf,step=1,cv=5,scoring='f1_macro',n_jobs=1)rfecv.fit(X_var.drop(columns=to_drop),y_train)selected_feats=X_var.drop(columns=to_drop).columns[rfecv.support_]嵌入法阶段,利用L1正则化逻辑回归与XGBoost特征重要性取交集,形成最终候选集:fromsklearn.linear_modelimportLogisticRegressionfromxgboostimportXGBClassifierlr_l1=LogisticRegression(penalty='l1',solver='saga',C=0.1,max_iter=1000,random_state=42)lr_l1.fit(X_var[selected_feats],y_train)lr_mask=lr_l1.coef_.ravel()!=0xgb=XGBClassifier(n_estimators=200,random_state=42,n_jobs=1)xgb.fit(X_var[selected_feats],y_train)xgb_imp=pd.Series(xgb.feature_importances_,index=selected_feats)final_feats=selected_feats[lr_mask&(xgb_imp>xgb_imp.median())]全程穿插“陷阱数据集”演示:教师分发含有“下学期体测结果”列的错误训练集,引导学生发现特征重要性异常飙升,现场复盘特征泄露成因,建立“时间维度切分”铁律。4.阶段性成果产出与评价(5分钟)各组提交特征选择报告单:列出保留的12个核心特征,附带统计量证据(方差、MI分数、RFECV排名、L1系数、XGBoost重要性)与业务解释。教师现场抽查,重点追问“为何保留收缩压却剔除舒张压”“互信息为何能捕捉BMI与风险的非线性关系”。(二)次课时:领域驱动的特征构建与模型闭环5.专家知识显性化与特征构思(15分钟)播放体育学教授访谈短片(3分钟),重点阐述:①BMI局限性——无法区分肌肉与脂肪,需引入体脂率估算公式;②功率指数——Lewis公式估算无氧功率,解释立定跳远与体重的物理关系;③心肺功能代偿指标——静息心率与血压乘积(RatePressureProduct)反映心肌耗氧量。学生分组将专家语言转化为可计算表达式,在白板协作完成“领域知识特征映射表”:专家概念物理/生理公式所需原始字段构建代码草稿体脂率估算1.2×BMI+0.23×年龄10.8×性别5.4身高、体重、年龄、性别df['body_fat']=1.2df['bmi']+0.23df['age']10.8df['gender']5.4无氧功率√(4.9×体重×√跳远距离)体重、立定跳远df['anaerobic_power']=np.sqrt(4.9df['weight']np.sqrt(df['standing_long_jump']))心肌耗氧指数收缩压×静息心率/100收缩压、脉搏df['rpp']=df['systolic_bp']df['pulse']/1006.交互特征与多项式扩展的系统化构建(20分钟)引入领域无关的通用构建技术。演示双变量交互项生成:选取前6个重要特征两两组合,创建乘积、商、差、和四类交互,共60个候选项。利用梯度提升树自动筛选高阶交互,对比人工构建与自动发现的差异:fromitertoolsimportbinationstop6=final_feats[:6].tolist()interactions=[]fora,binbinations(top6,2):df[f'{a}_mul_{b}']=df[a]df[b]df[f'{a}_div_{b}']=df[a]/(df[b]+1e6)interactions.extend([f'{a}_mul_{b}',f'{a}_div_{b}'])多项式扩展针对连续型核心特征(BMI、体脂率、RPP)生成二次项,捕捉U型风险曲线(过瘦与过胖均增加风险):fromsklearn.preprocessingimportPolynomialFeaturespoly=PolynomialFeatures(degree=2,include_bias=False,interaction_only=False)poly_feats=poly.fit_transform(df[['bmi','body_fat','rpp']])poly_names=poly.get_feature_names_out(['bmi','body_fat','rpp'])df_poly=pd.DataFrame(poly_feats,columns=poly_names,index=df.index)df=pd.concat([df,df_poly.iloc[:,3:]],axis=1)跳过原始一阶项学生实操:在代码模板中填充构建逻辑,运行后观察特征矩阵从12维扩展至87维,讨论维度灾难风险与后续选择必要性。7.模型训练、解释与迭代优化(25分钟)建立基线模型与增强模型对比实验。基线:仅用原始12特征训练LightGBM;增强:融合领域构建特征与筛选后的交互项。采用分层5折交叉验证,关注宏平均F1、AUC、召回率(漏报高风险学生代价高):importlightgbmaslgbfromsklearn.model_selectionimportStratifiedKFold,cross_validatecv=StratifiedKFold(n_splits=5,shuffle=True,random_state=42)params={'objective':'multiclass','num_class':3,'metric':'multi_logloss','verbosity':1,'random_state':42}base_scores=cross_validate(lgb.LGBMClassifier(params),X_train[final_feats],y_train,cv=cv,scoring=['f1_macro','roc_auc_ovr','recall_macro'])enh_scores=cross_validate(lgb.LGBMClassifier(params),X_train_enhanced,y_train,cv=cv,scoring=['f1_macro','roc_auc_ovr','recall_macro'])引入SHAP值进行模型级与样本级解释。展示蜂群图揭示体脂率呈U型影响、RPP正相关风险、功率指数负相关风险。针对误分析案例(如肌肉型男生被误判高风险),引导学生构建“肌肉修正因子”特征:握力/体重比,重新训练验证召回率提升2.3个百分点。8.部署合规性与工程化交付(10分钟)讲解模型导出为ONNX格式,嵌入校医

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论