高中信息技术必修一 《5.2 数据的采集》 教学设计_第1页
高中信息技术必修一 《5.2 数据的采集》 教学设计_第2页
高中信息技术必修一 《5.2 数据的采集》 教学设计_第3页
高中信息技术必修一 《5.2 数据的采集》 教学设计_第4页
高中信息技术必修一 《5.2 数据的采集》 教学设计_第5页
已阅读5页,还剩8页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

高中信息技术必修一《5.2数据的采集》教学设计一、教材分析与课程定位《数据与计算》模块是高中信息技术必修一课程的核心支撑,而“数据的采集”作为模块内的第二节课,承担着“数据从何而来”的源头性教学任务。粤教版(2019)教材将本节内容编排在数据编码之后、数据处理与分析之前,意图明显:让学生在理解数据数字化表征的基础上,掌握获取原始数据的技术手段与方法论,为后续的清洗、分析、可视化奠定真实素材基础。教材结构呈现“三类来源、两种范式、一套规范”的逻辑:既有传感器自动采集、网络爬虫获取、问卷访谈调查三类典型来源,又区分了结构化与非结构化两种数据形态,更嵌入了隐私保护、伦理合规、数据质量评估的规范要求。这种编排体现了课程标准中“信息意识、计算思维、数字化学习与创新、信息社会责任”四大核心素养的融合导向,要求教学不能停留在工具操作层面,而必须上升到数据获取策略设计与伦理决策的高度。二、学情分析与教学对象教学对象为高一年级学生,已完成初中信息技术模块化学习,具备基本的计算机操作能力、Python基础语法掌握及互联网基础认知。但普遍存在三个认知断层:一是“数据现成论”惯性,习惯直接使用现成数据集,缺乏从物理世界或网络空间主动获取数据的实战经验;二是“工具决定论”倾向,面对Requests、BeautifulSoup、Selenium等工具库易陷入API调用堆砌,忽视HTTP协议、HTML结构、反爬机制等底层原理;三是“合规盲区”风险,对《数据安全法》《个人信息保护法》及网站Robots协议理解浅薄,实操中极易触发法律红线。本节教学需以“问题情境”打破惯性,以“原理穿透”对抗工具依赖,以“合规红线”筑牢责任底线。三、教学目标与核心素养落点1.信息意识:能辨析不同业务场景下的数据源特征,判断数据采集的必要性、可行性与时效性,建立“数据源头决定分析上限”的质量观。2.计算思维:掌握HTTP请求响应模型、HTMLDOM树解析、JSON数据结构映射等核心原理;能设计包含异常处理、频率控制、增量采集的爬虫逻辑流程图;能针对动态渲染、反爬验证码等复杂场景制定技术对策。3.数字化学习与创新:完成从“单页静态数据提取”到“多页分页遍历、动态AJAX接口逆向、传感器串口实时流读取”的三级进阶实战,产出可复用的采集脚本工程。4.信息社会责任:内化Robots协议遵守、请求频率限制、敏感字段脱敏、数据存储加密等合规操作规范,能撰写采集合规性自查报告。四、教学重难点与破解策略重点:HTTP协议交互细节与Requests库高级用法;XPath/CSSSelector/正则表达式三大解析技术的选型依据;结构化数据存储(CSV/SQLite/Redis)的工程化落地。难点:动态网页AJAX接口逆向分析与参数签名破解;反爬机制(IP封禁、UserAgent检测、JS混淆、验证码)的综合绕过策略;多源异构数据融合时的字段对齐与清洗预处理。破解策略:采用“原理讲透、工具链全、实战真、合规严”四字方针。引入ChromeDevToolsNetwork面板作为“显微镜”,让不可见的网络交互可视化;构建“请求解析存储调度”四层解耦架构模板,降低认知负荷;选取真实电商评论、气象站API、校园环境传感器三个差异化真实场景,拒绝玩具数据;全流程嵌入合规检查清单,将法律条文转化为代码注释与断言。五、教学资源与环境准备硬件环境:配备Python3.10+、Anaconda发行版的机房计算机;树莓派4B+DHT11温湿度传感器+BMP280气压传感器套件6套;路由器组建的隔离局域网环境(模拟目标站点部署DVWA靶场)。软件资源:PyCharmEdu社区版;Chrome浏览器及插件;自研“采集合规检测平台”内网部署版,集成Robots.txt解析、请求频率监控、敏感词扫描功能。数字资源:教材配套数字教材交互页面;精选知乎热榜、某东商品评论、国家气象局开放API文档、校园气象站历史数据集;法律法规条文速查卡电子版。六、教学过程设计(核心环节)环节一:情境导入·追溯源头(8分钟)课伊始,不讲目录,直抛三组“失控案例”:某学生爬取招聘网30万简历被判刑、某团队高频请求导致校园服务器宕机、某实验直接使用未清洗脏数据导致结论偏离。学生分组讨论:数据从哪来?为何失控?核心在哪?教师汇总板书关键词:来源、手段、规范、质量。自然引出本节核心问题——“如何合法、高效、优质地获取分析所需数据?”。此环节旨在打破“数据现成论”,建立风险敬畏与问题导向。环节二:原理穿透·协议与结构(15分钟)1.HTTP协议深度解剖。不背定义,抓包实战。教师演示ChromeDevToolsNetwork面板,捕获一次完整知乎热榜请求。重点拆解:RequestLine(方法、路径、版本)、RequestHeaders(Host、UserAgent、Cookie、Referer、AcceptEncoding)、RequestBody(POST参数)。对应Response:StatusCode(200/301/403/429/500)、ResponseHeaders(ContentType、SetCookie、ContentEncoding)、ResponseBody(HTML/JSON/二进制流)。学生同步操作,修改UserAgent为“Pythonurllib/3.10”观察403响应,修改为浏览器UA恢复200,体会Header字段的“通关密语”作用。2.数据结构映射。对比两种响应体:知乎热榜HTML文档树与气象局API返回JSON。前者需构建DOM树遍历,后者直接键值映射。引导学生总结:结构化程度决定解析复杂度。现场编写Python字典与JSON互转代码,验证`json.loads(response.text)`与`response.json()`等价性。引出核心结论:采集本质是“协议交互+结构映射+存储持久化”。环节三:工具链构建·静态页面采集实战(20分钟)任务驱动:采集“某东”指定商品前5页评论数据(商品ID、用户昵称、评分、内容、时间、点赞数),存入SQLite数据库,要求含去重、异常重试、随机延时。步骤1:目标站点侦察。学生分组使用DevTools定位评论加载方式。发现:首页HTML内嵌首屏评论,翻页通过AJAX请求`/ment/getList?productId=xxx&page=2`返回JSON。确认“首页解析HTML+翻页解析JSON”双策略。步骤2:架构搭建。教师发放骨架代码,包含`Config`配置类、`Requester`请求层、`Parser`解析层、`Storage`存储层、`Scheduler`调度层五大类。学生补全核心方法:```pythonclassRequester:def__init__(self):self.session=requests.Session()self.session.headers.update(DEFAULT_HEADERS)self.retry=Retry(total=3,backoff_factor=0.5,status_forcelist=[429,500,502,503,504])self.adapter=HTTPAdapter(max_retries=self.retry)self.session.mount('http://',self.adapter)self.session.mount('https://',self.adapter)defget(self,url,kwargs):time.sleep(random.uniform(1.5,3.0))合规延时resp=self.session.get(url,timeout=10,kwargs)resp.raise_for_status()returnresp```步骤3:解析逻辑实现。HTML解析用`lxml.etree.HTML`配合XPath`//div[@class='mentitem']`;JSON解析直接`data['ments']`遍历。统一输出标准化字典`{'pid':...,'uid':...,'score':...,'content':...,'ts':...,'votes':...}`。步骤4:存储与去重。SQLite建表含`UNIQUE(pid,uid,ts)`约束,插入用`INSERTORIGNORE`实现主键级去重。教师巡场重点检查:是否处理`json.decoder.JSONDecodeError`、是否捕获`requests.exceptions.ChunkedEncodingError`、是否记录失败URL至错误日志队列。步骤5:合规自查。运行自研检测平台扫描脚本,输出报告:Robots.txt允许性、平均QPS、Cookie敏感字段、SQL注入风险。学生根据报告修改代码,直至“全绿通过”。环节四:难点攻坚·动态渲染与反爬对抗(20分钟)场景升级:目标改为“知乎问题下所有回答”,特点:无限下拉加载、回答内容由JS渲染、含反爬签名参数`d_c0`、登录态Cookie失效快。攻关路径演示:1.寻找数据源:Network面板筛选XHR/Fetch,定位`/api/v4/questions/xxxx/answers`接口。发现参数`offset`、`limit`、`order_by`,响应为标准JSON。2.参数签名逆向:观察请求Header中`xzse96:2.0_xxx`,搜索关键词定位到混淆JS文件。教师演示AST还原与Hook关键函数`window._get_signature`,或采用Selenium/Playwright无头浏览器直接获取渲染后DOM/接口响应。对比两种方案:逆向维护成本高但效率极致;浏览器自动化通用性强但资源消耗大、易被指纹识别。指导学生根据项目周期与数据量级做技术选型。3.登录态维护:演示手动登录导出Cookie至YAML,脚本启动时加载,请求前检测`is_login`字段,失效则触发扫码登录回调(配合`qrcode`库生成终端二维码)。4.分布式雏形:引入`Redis`队列存储待采集URL,`RedisSet`存储已采集ID指纹,多进程`multiprocessing.Pool`消费队列,实现断点续爬与横向扩展。学生在隔离局域网DVWA靶场部署练习,体会并发控制与去重核心逻辑。环节五:物理世界·传感器实时数据采集(12分钟)跨域迁移:从网络空间转向物理空间。分组领取树莓派传感器套件,任务:搭建校园微型气象站,采集温湿度、气压、光照强度,每10秒上报一次至本地MQTTBroker(Mosquitto),Python客户端订阅持久化至TimescaleDB时序数据库。关键技术点:5.硬件接线与驱动:I2C总线通信原理,`smbus2`库读取寄存器原始值,查阅数据手册转换物理单位(如温度公式`T=45+175raw/65535`)。6.通信协议选型:对比HTTP轮询、WebSocket、MQTT。实测MQTTQoS1级别在弱网下不丢包、不重复,最适合物联网遥测。7.边缘预处理:树莓派端完成异常值剔除(如温度>80℃或<40℃)、滑动窗口平滑、数据打包压缩(MessagePack),再上传,减轻云端压力。8.时间同步:NTP校时与RTC硬件时钟双保险,确保多节点数据时间戳一致性,为后续空间插值分析铺垫。学生现场调试串口打印乱码、I2C地址冲突、MQTT连接心跳超时等真实工程问题,体会“软硬协同”的工程质感。环节六:问卷与访谈·非结构化数据采集设计(10分钟)场景设定:配合学校“课后服务满意度”调研,设计问卷采集方案。教学聚焦:9.测量量表设计:李克特五级量表、语义差异法、NPS净推荐值指标体系构建,避免引导性提问、双重否定、双管齐下题项。10.抽样策略:分层随机抽样(年级×性别×是否走读),样本量计算公式`n=(Z^2p(1p))/E^2`现场推导,置信度95%、容差5%、预估比例0.5,得出最小样本量385份,考虑回收率发放500份。11.工具落地:腾讯文档/问卷星API自动导出,或自建LimeSurvey开源平台,配置跳转逻辑、必填校验、IP限制一票制。12.质量控制:植入反向题项、作答时长阈值(<120秒剔除)、直线答题检测、IP地址聚类分析,生成数据质量报告。13.伦理合规:知情同意书电子签名、最小化采集原则(不收集姓名学号,仅收集脱敏维度)、数据销毁承诺书。学生现场撰写《采集方案合规性评估表》。环节七:数据质量评估与融合预处理(10分钟)融合挑战:将前三环节产出的电商评论(文本)、气象数据(数值时序)、问卷数据(分类有序)汇聚至统一数据湖(MinIO+HiveMetastore)。核心操作:14.画像报告生成:使用`ydataprofiling`(原pandasprofiling)一键输出各表完整率、唯一值率、分位数分布、相关性矩阵、缺失模式热力图。15.字段对齐:统一时间字段为UTCISO8601格式`YYYYMMDDTHH:MM:SSZ`;地理字段统一为GeoJSONPoint;文本字段统一UTF8编码、全半角归一化、繁简转换。16.实体链接:电商评论中的“送货快”映射至物流实体表;气象站点ID映射至行政区划编码;问卷学校代码映射至教育部标准代码。17.隐私计算预演:对手机号、身份证字段演示格式保持加密(FPE)与差分隐私噪声注入(拉普拉斯机制`Laplace(0,Δf/ε)`),让学生直观感知“可用不可见”技术路线。环节八:总结提升·方法论内化(5分钟)全班共建《数据采集方法论知识图谱》思维导图,四大分支:源头识别(开放数据、API服务、爬虫采集、传感器、日志埋点、问卷访谈、合成数据)技术范式(请求构建、反爬对抗、动态渲染、协议逆向、分布式调度、流批一体)工程规范(配置分离、日志审计、监控告警、幂等设计、版本控制、CI/CD流水线)合规伦理(法律法规、Robots协议、最小化原则、脱敏加密、知情同意、数据销毁)学生口头复述各分支关键节点,教师补全盲区,强调“采集是分析的前提,合规是生存的底线,质量是价值的保证”。七、作业设计与分层评价基础级(必做):补全课堂电商评论采集脚本的“评论回复”二级抓取功能,要求处理嵌套JSON结构,入库表设计自行扩展,提交代码仓库链接及运行截图。进阶级(选做):选取一个有反爬机制的公开站点(如豆瓣电影Top250、B站视频弹幕),完成从逆向分析到入

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论