版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
高中信息技术必修一《文本数据处理》教学设计一、教材与学情分析浙教版高中信息技术必修一第四章第二节第三课时“文本数据处理”位于“数据与信息”模块核心位置,承接前两节“数据的数字化”“结构化数据处理”所建立的数据认知,引领学生从离散数值向非结构化文本跨越。教材以“诗词数据挖掘”为大单元情境,贯穿文本获取、清洗、分析、可视化全流程,直指新课标“数据意识、计算思维、信息社会责任”三大核心素养。单元任务要求学生完成唐诗宋词高频意象提取、情感倾向分析、诗人群体画像构建三个子任务,技术路线覆盖正则表达式、分词算法、词频统计、情感词典匹配、词云生成等关键知识点。学情调研显示:高一学生已具备Python基础语法与pandas库结构化数据处理经验,但对非结构化文本特性认知模糊,正则表达式元字符记忆混乱,jieba分词模式选择盲目,情感分析原理停留在“正负词计数”浅层。认知冲突主要集中在:文本清洗规则如何制定、分词粒度如何权衡、领域情感词典如何构建三个层面。教学设计需以“诗词数据挖掘”真实任务为牵引,搭建“规则构建—工具选型—参数调优—结果解释”完整认知链条。二、核心素养与教学目标(一)数据意识:能识别文本数据非结构化、高维稀疏、语义歧义特征,判断文本清洗必要性,建立“数据质量决定分析上限”质量观。(二)计算思维:掌握正则表达式模式构建方法,理解分词算法原理差异,会用词频统计、TFIDF、情感词典三种技术路线解决文本特征提取问题,具备从现象到本质的抽象建模能力。(三)信息社会责任:遵守robots协议与版权规范获取公开诗词数据,辨析算法偏见对文化解读的影响,树立技术向善的伦理自觉。(四)具体目标:1.知识与技能:熟练编写匹配朝代、作者、标题、正文四字段的正则表达式;对比精确模式/全模式/搜索引擎模式分词效果,自主选择最优模式;基于自建领域情感词典实现诗词情感极性分类,准确率达85%以上。2.过程与方法:经历“观察原始文本—制定清洗规则—代码实现—异常排查—规则迭代”工程化循环,形成文本预处理标准作业程序。3.情感态度价值观:在“李白豪放vs杜甫沉郁”算法验证中体会量化分析局限,敬畏文化复杂性,拒绝技术决定论简化人文精神。三、重难点突破策略重点:正则表达式分组捕获与非贪婪匹配机制、jieba分词三种模式适用场景判别、自定义词典与停用词表动态维护机制。难点:古诗词领域情感词典构建中的“语境反讽”识别(如“白日依山尽”表达壮阔非消极)、分词粒度与语义完整性博弈(如“长安”拆分为“长/安”丢失地名实体)、TFIDF在短文本中的稀疏性失效问题。突破路径:引入“规则调试可视化工具”实时高亮匹配区间,用“分词对比表格”量化三模式差异,设计“情感词典迭代版本库”记录每轮增删词条及准确率变化,将隐性思维显性化、可视化、可追踪。四、教学资源与环境准备硬件环境:机房配备Python3.10+、JupyterLab、Anaconda环境,预装jieba、wordcloud、matplotlib、snownlp、pkuseg库。网络通畅访问“中华诗词数据库”“G”开放接口。软件资源:自研“正则表达式可视化调试器”(RegexVis),支持实时高亮、分组编号、回溯步数统计;“分词效果对比看板”(Segpare),同屏展示三模式切分结果、词性标注、OOV率;“情感分析误差分析仪表盘”,自动标注假阳性/假阴性样本并关联原文语境。教学素材:精选唐诗三百首、宋词三百首JSON语料(含朝代、作者、标题、正文、体裁、韵部字段),人工标注情感极性测试集200首(平衡正/负/中性),领域种子情感词典(含古汉语特有褒贬词400对)。五、教学过程设计(六课时)课时一:文本特征洞察与正则表达式规则构建(2学时)情境导入:投屏展示从G爬取的原始HTML片段,包含`<divclass="cont">`嵌套结构、全角/半角标点混用、注脚夹杂正文、缺失字段等典型噪声。提问:“若直接分词会发生什么?”学生运行预置代码,观察词云中出现“div、class、cont、span、br”等标签噪声与“、。?!”标点高频,直观感受“脏数据进,垃圾出”原则。概念建模:引导学生从三个维度拆解文本结构——物理结构(HTML标签层级)、逻辑结构(四字段语义边界)、字符层面(编码统一、空白规范)。建立“文本清洗三步法”:结构解析提取目标节点→字符规范化(全半角转换、Unicode规范化)→规则过滤去除非文本噪声。正则表达式建构工作坊:分组协作完成四张“规则设计卡”:卡1朝代字段:`<spanclass="dynasty">(.?)</span>`讲解非贪婪匹配防止跨行吞噬。卡2作者字段:`<divclass="author">.?<a.?>(.?)</a>`演示.?与[^<]效率差异,引入“排除字符类”优化思路。卡3标题字段:`<h1>(.?)</h1>`讨论标题中可能包含HTML实体编码(如` `)的预处理。卡4正文字段:`<divclass="contson".?>([\s\S]?)</div>`重点攻克`[\s\S]?`跨行匹配原理,对比`re.DOTALL`标志位区别。每张卡片需填写:正则表达式、匹配样例、边界测试用例(空字段、嵌套标签、特殊字符)、预期失败场景。组间轮换评议,使用RegexVis实时验证,教师巡回指导关注“贪婪陷阱”“转义遗漏”“分组索引错位”三类高频错误。代码落地:学生在JupyterLab完成`PoemCleaner`类编写,核心方法`extract_fields(html:str)>dict`返回结构化字典。要求添加类型注解、文档字符串、异常处理(字段缺失抛出`FieldMissingError`自定义异常)。单元测试覆盖正常诗、只有标题无正文、正文含图片标签三类用例。课时二:中文分词算法原理与模式选择决策(2学时)认知冲突制造:展示同一句“春风又绿江南岸”在三种模式下的切分结果:精确模式:春风/又/绿/江南/岸全模式:春风/风/又/绿/江南/南/岸搜索引擎模式:春风/又/绿/江南/岸/江/南提问:“哪种结果最适合词频统计?哪种适合检索召回?为何‘江南’在全模式下被拆分?”引出分词本质是“字典查找+路径搜索”的图论问题。算法透视:用有向无环图(DAG)可视化演示“春风又绿江南岸”所有可能切分路径,讲解最大概率路径(Viterbi算法)、全路径枚举、启发式搜索三种策略对应三种模式。引入“未登录词(OOV)识别”基于HMM的字标注体系(B/M/E/S),演示“秦观”“李清照”等人名识别过程。实证决策训练:分组设计“分词质量评估实验”,自变量为三种模式,因变量为:词汇量、OOV率、实体完整率(自定义词典覆盖)、运行时间。实验语料为全唐诗5万首,要求输出对比雷达图。关键发现预设:精确模式实体完整率最高(92%)但词汇量最大(噪声多);搜索引擎模式平衡召回与精度,适合词云展示;全模式仅用于全文检索倒排索引构建。工程化迁移:指导学生封装`PoemSegmentor`类,核心参数`mode:Literal["accurate","all","search"]`、自定义词典路径、停用词表路径、HMM开关。实现`segment(text:str)>List[str]`与`segment_with_pos(text:str)>List[Tuple[str,str]]`双接口。引入`jieba.suggest_freq("江南",True)`动态调整词频案例,演示如何通过“临时提词”解决特定语境下合并切分需求。进阶挑战:对比jieba与pkuseg(北大分词)在古诗词语料上的F1值差异,分析pkuseg基于BiLSTM+CRF序列标注对“零代词”“倒装句”鲁棒性更强,但推理延迟高3倍。引导学生完成“场景算法选型决策表”:实时交互→jieba精确模式;离线高精度语料构建→pkuseg;全文检索→jieba搜索引擎模式。课时三:文本特征提取与情感分析建模(2学时)特征工程三板斧:1.词频统计(TF)基线:演示`Counter`统计高频词,引入停用词过滤(通用停用词+古诗词虚词“之乎者也”)。展示词云可视化代码,参数`font_path="SimHei.ttf"`、`mask=china_map.png`实现中国地图形状词云。2.TFIDF权重校正:推导公式$w_{i,j}=tf_{i,j}\times\log\frac{N}{df_i}$,讲解IDF惩罚高频通用词(如“山水风月”)提升特色意象(如“黄鹤楼”“西湖”)权重。实操中发现单文档过短导致IDF失效,引入“伪文档”策略:将同一诗人作品合并为一文档计算IDF,再映射回单首诗。3.情感词典构建迭代:这是本课时核心攻坚。情感词典构建全流程:步骤一种子词典扩展:提供种子词典(正面:豪放、旷达、壮阔…;负面:凄凉、愁苦、漂泊…)。学生利用Word2Vec训练古诗词词向量(窗口5、维度100、负采样5),计算种子词余弦相似度扩展候选词,人工筛选加入。步骤二语境规则增强:针对“否定词+情感词”翻转、“程度副词”加权、“转折词”后段主导三类规则,编写`ContextualScorer`类。示例:“不觉澜沧江水寒”中“不觉”非否定,需结合依存句法分析(引入LTP或HanLP轻量版)判断修饰关系。步骤三版本化管理:建立`sentiment_dict_v{版本号}.json`,每轮迭代记录:新增词条、删除词条、修正极性、验证集准确率变化。要求至少完成三轮迭代,最终版本在测试集F1≥0.85。模型训练与评估:使用`sklearn`管道:`TfidfVectorizer(tokenizer=jieba.lcut)→LinearSVC(C=1.2)`基线模型,对比SnowNLP预训练模型、自建词典规则模型三者性能。混淆矩阵热力图分析误分类样本,典型错误案例研讨:案例A:“白日依山尽,黄河入海流”被判负面(山尽、流走触发消极词)。案例B:“世间安得双全法,不负如来不负卿”被判正面(不负重复触发双重否定=肯定逻辑失效)。引导学生从“词袋模型忽略句法结构”“古汉语语法现象(倒装、省略、一词多词性)未建模”反思,为选修模块“自然语言处理进阶”埋伏笔。六、评价体系设计过程性评价(60%):1.规则设计卡完整性与迭代记录(15%):四张卡片边界测试用例覆盖度、RegexVis调试截图、版本迭代日志。2.分词实证报告(15%):实验设计合理性、雷达图解读深度、决策表场景覆盖面。3.情感词典迭代仓库(15%):三轮以上版本、每轮准确率变化曲线、误差分析仪表盘导出报告。4.代码规范与文档(15%):PEP8合规、类型注解覆盖率≥90%、单测覆盖率≥80%、README包含安装依赖、快速开始、API文档。终结性评价(40%):项目答辩“诗词群体画像构建”:小组(34人)自选切入点(如“晚唐诗派意象演变”“苏轼全词情感轨迹”“女性词人视角词云对比”),完成数据获取→清洗→分词→特征提取→可视化→解读报告全链路。答辩评分维度:技术路线合理性(30%)、代码工程化程度(20%)、可视化设计美感与信息密度(20%)、人文解读深度与反思(30%)。七、分层教学与拓展延伸基础层(C级目标):完成教材预置语料清洗、精确模式分词、基础词频词云、调用SnowNLP情感分析,撰写规范实验报告。提高层(B级目标):自主爬取扩充语料(遵守robots)、构建自定义词典/停用词表、实现TFIDF伪文档策略、规则增强情感分析三轮迭代F1≥0.8。拓展层(A级目标):引入pkuseg/BERTancientchinese微调、实现方面级情感分析(针对“山水”“离别”“爱国”细粒度意象)、部署Streamlit交互式Web演示系统、撰写可投稿CCFC会议的技术报告。延伸阅读:《自然语言处理入门》(JacobEisenstein)第3、4章、《Python自然语言处理实战》(陈云清)第5章、ACL2023论文《AncientChinesePoetryUnderstandingwithPretrainedModels》、数字人文季刊专辑《计算诗学:方法与争鸣》。八、教学反思与迭代计划本设计首次实施于2025年春季学期,三个行政班126名学生完成。主要反思点:1.正则表达式教学仍偏重语法记忆,后续引入“正则表达式自动生成器”(基于正负样本的遗传算法)降低门槛,聚焦“规则鲁棒性评估”高阶思维。2.情感词典构建人工筛选负担重,计划接入主动学习循环:模型预测低置信
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 高中英语 Unit 2 Integrated skills教案 牛津译林版选择性必修第二册
- 高中学生综合素质自我陈述报告800字(17篇)
- 施工实习报告合集(3篇)
- 营销实训报告的心得体会(15篇)
- 2025-2026学年调色动作教学设计英语
- 2025-2026学年母鸡课后反思教案
- 2026年大兴区卫生健康委事业单位招聘护理岗模拟试题(含答案)
- 2026年医学免疫学学模拟试题及答案详解
- 2026年中国冷热净水机行业市场竞争格局及投资趋势研判报告
- 2026年中药师模拟试题及答案详解
- 2026广东肇庆市高校毕业生基层公共就业创业服务岗位招募68人笔试参考题库及答案详解
- 浙江省安全生产全覆盖检查标准体系(2026版)
- ICU病房患者走失应急演练脚本及演练记录
- 王祖浩化学教学实践问题探索
- 医疗器械相关法律法规解读
- 2025年四川省书法测试题及答案
- 检验科血常规解读指南
- 店铺分股合同协议书模板
- 铁路信号系统设备概述铁道信号与通信课件
- 【MOOC】研究生英语科技论文写作-北京科技大学 中国大学慕课MOOC答案
- 航天禁(限)用工艺目录(2021版)-发文稿(公开)
评论
0/150
提交评论