高中信息技术必修一《大数据处理-文本数据处理》教学设计_第1页
高中信息技术必修一《大数据处理-文本数据处理》教学设计_第2页
高中信息技术必修一《大数据处理-文本数据处理》教学设计_第3页
高中信息技术必修一《大数据处理-文本数据处理》教学设计_第4页
高中信息技术必修一《大数据处理-文本数据处理》教学设计_第5页
已阅读5页,还剩6页未读 继续免费阅读

付费下载

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

高中信息技术必修一《大数据处理——文本数据处理》教学设计一、教学背景分析本课选自浙教版(2019)高中信息技术必修1《数据与计算》第四章第二节第三课时。大数据处理是本章的核心内容,学生此前已经学习了数据采集、数据整理与数据可视化,具备了用Python读取文件、操作字符串的基础能力,但面对真实的、海量的非结构化文本数据时,仍普遍停留在"逐段人工阅读"的思维惯性中。本课的任务就是帮助学生在认知上完成一次跃迁:文本也是数据,且文本数据经过编码、分词、统计、建模之后,可以像数值数据一样被计算、被挖掘、被预测。高一学生的抽象逻辑思维正在形成,对网络热点、社交媒体评论、图书推荐等真实情境有天然的兴趣。他们熟悉弹幕、热搜、词云图,但并不清楚词云背后的统计逻辑。这种"知其然不知其所以然"的状态,恰恰是本课教学最有价值的生长点。教学中宜从学生熟悉的生活案例切入,以问题链驱动,让学生亲历"原始文本→清洗分词→特征提取→分析呈现"的完整处理流程,逐步形成用计算思维处理文本数据的能力。二、课标与教材解读《普通高中信息技术课程标准(2017年版2020年修订)》在必修模块1中明确要求学生"了解大数据的概念和基本特征,认识大数据对社会发展的影响,体验用程序处理数据的一般过程"。本课是落实该要求的关键节点。教材沿着"大数据的特征—大数据处理的基本思想—文本数据处理—数据挖掘"的线索编排,文本数据处理是大数据特征(体量大、类型多、价值密度低)在真实情境中的集中体现,也是后续学习数据挖掘与智能处理的前置基础。教材以电商评论分析为主要范例,涉及分词、词频统计、词云呈现等操作。教学中应对教材内容进行适度拓展:一是补充语义情感分析的初步认识,让学生意识到词频统计仅是文本处理的起点而非终点;二是引入停用词、噪声数据等概念,帮助学生理解"数据质量决定分析质量"这一朴素却深刻的道理。三、学情分析授课对象为高一年级学生,通过一个学期的学习,多数学生能够编写简单的Python程序,掌握for循环、列表与字典的基本操作,个别学生已有词云库、jieba分词库的使用经验。存在的困难主要有三方面:其一,对"分词"缺乏直观理解,容易将其与语文的断句混为一谈;其二,代码调试能力薄弱,遇到编码错误、路径错误容易陷入恐慌;其三,对分析结果的解读停留在表面,不善于从词频数据中提炼有价值的信息。针对这些问题,教学设计采用"小步快走"的任务分解策略,每个任务配脚手架代码,同时设置梯度拓展任务,照顾学有余力的学生。四、教学目标信息意识:能从电商评论、新闻语料等真实文本中察觉可挖掘的信息价值,认识到非结构化文本数据蕴含的大数据分析潜力。计算思维:掌握文本数据处理的基本流程,理解分词、去停用词、词频统计的算法思想,能将"统计高频词"这类问题分解为可编程实现的步骤。数字化学习与创新:能借助Python及jieba、wordcloud等库完成一项小型文本分析任务,并在分析中提出自己的观测角度与结论。信息社会责任:通过讨论评论数据刷分、热搜操纵等现象,形成对数据真实性与算法滥用问题的初步判断,树立负责任地使用数据的意识。五、教学重点与难点教学重点:文本数据处理的一般流程;中文分词与词频统计的原理与编程实现。教学难点:理解"分词结果的质量决定统计结论的可信度";能根据统计结果进行有依据的归因分析与表达。六、教学策略与方法采用情境驱动与任务驱动相结合的教学策略,以"一家奶茶店的好评风暴之谜"作为贯穿全课的主线情境。综合运用讲授法、探究学习法、小组协作法与对比实验法。课前教师将1000条模拟评论数据、半成品程序、停用词表打包下发至学习平台;课中利用机房广播与控制软件实现演示与巡视;以小组为单位(3至4人)完成分析与汇报。七、教学准备教师准备:模拟电商评论数据集两份(数据A为真实模拟评论,数据B混入刷评内容)、演示用Jupyter脚本、词云示例图、导学案。学生准备:复习Python字典与循环结构,预习教材相应章节,完成课前问卷"你看过商品评价吗?评价会影响你的购买决定吗?"八、教学过程(一)创设情境,提出问题(约6分钟)教师展示两张奶茶店页面截图:甲店4.9分、3000条好评,乙店4.6分、200条好评。提问:"如果只能选一家,你选哪家?依据是什么?"学生普遍倾向选择甲店。教师随即播放一段揭示"刷单炒信"的短新闻,提出本课核心问题:量大的好评一定可信吗?我们能否用程序代替人工,让上万条评论自己"开口说话",揭示它背后的真相?设计意图:以认知冲突切入,让学生意识到人工逐条阅读在面对海量文本时的无力,从而产生用计算方法处理文本的内在需求。此处的提问不急于给出答案,而是将其悬置为全课的探究目标,使后续每一项技术操作都指向这个真实问题。(二)初探数据,感知特征(约7分钟)学生打开数据文件,浏览原始评论。教师引导观察:评论里有什么?学生会发现错别字、表情符号、无意义的"哈哈哈哈"、广告链接、重复内容等。教师顺势板书文本数据的典型特征:非结构化、含噪声、需要预处理。并追问:"如果直接对原始文本统计词频,结果会怎样?"学生推测:标点符号、"的""了"这类虚词会霸榜,真正有用的词被淹没。教师给出文本数据处理的一般流程框架:数据采集→文本清洗→分词→去除停用词→特征统计→结果呈现与解读。强调这个流程并非本课独创,而是工业界处理文本的通用范式,搜索引擎、翻译软件、智能客服的背后都是这条流水线。设计意图:先让学生"撞墙",再给"梯子",使流程的每一步都有明确的存在理由,避免把流程当作死记硬背的条文。(三)任务一:分词——让机器读懂汉语(约10分钟)教师演示:对句子"我觉得这家奶茶的珍珠特别软糯"进行分词,运行结果为"我/觉得/这家/奶茶/的/珍珠/特别/软糯"。讲解中文与英文的本质差异:英文以空格天然分隔单词,中文词与词之间没有显式边界,因此中文文本处理的第一道工序就是分词。学生完成任务一:调用jieba库对数据A的前50条评论分词,观察输出结果。脚手架代码已给出读取文件的框架,学生只需补充分词与输出部分。教师巡视中发现两类典型问题:一是文件编码报错,提醒学生注意open函数中encoding参数的取值应为"utf8";二是自定义词未被正确切分,如"杨枝甘露"被切成"杨枝/甘露"。借此讲解自定义词典的作用——jieba.add_word()可以让专业词汇不被误切,这正体现了工具与领域知识结合的必要性。一个值得记录的教学瞬间:有学生问"机器是怎么知道哪里该切开的?"教师简要说明分词算法大致基于词典匹配与统计模型两类思路,并用"南京市长江大桥"这一经典歧义句现场演示两种切法(南京市/长江大桥与南京/市长/江大桥),学生恍然大悟。这个细节虽非考点,却点燃了学生对自然语言处理的好奇心。设计意图:分词是全课的技术基石。通过可视化对比与歧义句演示,将抽象算法具象化;通过典型报错的现场解决,训练学生的调试素养。(四)任务二:去噪——把"垃圾词"请出统计现场(约8分钟)学生观察任务一的输出,发现"的""了""我""也"等词高频出现却无实际意义。教师引入停用词概念,并指出标点、表情符号、纯数字同样属于待清理的噪声。学生完成任务二:加载停用词表,在循环中增加判断——若词语在停用词表中或长度小于2,则跳过不计入统计。此处涉及"字典计数"这一关键编程模式:词作为键,出现次数作为值,每遇到一次计数加一。教师以5条样例数据手工模拟一遍计数过程,先让学生在黑板上走查算法,再落为代码。设计意图:字典计数是本课计算思维含量最高的环节。先人工模拟、再编程实现的双通道设计,让算法从纸面走进程序,契合"先理解再编码"的教学规律。(五)任务三:统计与呈现——让数据自己说话(约8分钟)学生完成任务三:对清洗后的词频字典按值降序排序,输出前20个高频词。教师提问:"从这20个词里,你读出了什么?"学生发现数据A的高频词为"好喝""珍珠""排队""新鲜"等,围绕口味体验展开,较为分散自然。教师演示将词频结果传入wordcloud生成词云图。学生观察词云并讨论:字号大小反映什么?词云的优缺点分别是什么?教师小结:词云是快速概览的利器,但会丢失词语的语境与搭配关系,属于"粗粒度"呈现,精确结论仍需回到数据本身。设计意图:强调"呈现服务于解读",防止学生沉迷于炫酷的可视化效果而忽略分析本身。词云的局限性讨论为后续情感分析埋下伏笔。(六)任务四:破案——用数据识别刷评(约9分钟,本课高潮)各小组领取数据B,独立完成"清洗→分词→高频词统计"全流程,与数据A的结果对比。小组汇报中出现精彩的发现:数据B的高频词高度雷同,"强烈推荐""五星好评""物超所值"密集出现;进一步统计发现约六成评论长度几乎一致、用词模式相同。学生得出结论:数据B存在大规模模板化刷评痕迹。教师追问:"如果你是平台审核员,还能从哪些维度验证?"学生提出:同一账号的评论频率、评论时间分布、用词重复率、是否集中提及店铺全名等。教师肯定这些思路,指出这正是电商平台反刷评算法中"文本特征+行为特征"联合识别的雏形,课堂所学与产业实践在此刻实现对接。设计意图:让学生做的不是练习题而是侦探工作。真实的问题、开放的路径、可检验的结论,使知识在应用中完成内化,也使信息道德教育自然生长——讨论刷单不是灌输,而是学生在数据面前自己得出的判断。(七)拓展延伸:从词频到情感(约5分钟)教师展示进阶案例:通过情感词典或机器学习模型,可以判断每条评论的情感倾向(正面、负面、中性),进而绘制一家店铺近半年的口碑变化曲线。演示一条看似正面的评论"这奶茶真是'好喝'到让人难忘啊"被初级模型误判为正面的案例,引出反讽识别、上下文理解等自然语言处理的深层挑战。教师指出:词频统计是文本处理的入口,后面还有文本分类、主题发现、智能问答等广阔天地,这些都将在选择性必修课程及未来学习中渐次展开。设计意图:以"答错一例"展示技术的边界,既保持科学化教学的严谨性,又为学生的后续学习留下接口和想象空间。(八)总结升华与作业布置(约5分钟)学生用一句话总结本课收获,教师按流程图复盘:清洗保证纯度,分词解决理解,统计揭示规律,呈现辅助决策,整个流程环环相扣,任何一步失守,结论都可能失真。教师最后升华:"大数据时代,数据不会说谎,但说谎的人会制造数据。希望你们既拥有让数据说话的技术,也拥有识别数据真伪的智慧,更拥有不制造虚假数据的底线。"分层作业:基础作业为完善课内程序,对自己的某品牌商品200条真实评论(或教师提供的语料)完成高频词分析;拓展作业为尝试用情感词典统计正负面评论占比;挑战作业为对比两家同类店铺的评论画像,写一份300字的分析报告。九、板书设计主板书以流程图呈现文本数据处理的一般路径:原始文本→清洗去噪→分词→去停用词→词频统计→可视化与解读。副板书右侧记录课堂生成性问题:编码utf8、自定义词典、字典计数模式;左侧保留核心问题"好评可信吗?",待任务四破案后在其下方写下师生共同得出的结论"文本特征+行为特征=识别刷评"。十、教学评价设计本课采用过程性评价与结果性评价相结合的方式。过程性评价依托任务单逐项记录:分词结果正确、去噪逻辑完整、统计代码可运行、解读有依据,每项设达成与未达成两档,由组内互评与教师抽检共同完成。结果性评价聚焦小组汇报的数据分析质量,评价维度包括流程完整性、结论证据链、表达清晰度。同时引入即时反馈机制:每个任务完成后,学生在做题端提交运行截图,系统自动统计全班完成进度,教师据此动态调整教学节奏。课后作业实行分层评定,鼓励学生在真实语料上迁移所学。十一、教学反思本课以"奶茶店好评之谜"贯通始终,情

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论