版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
高中信息技术必修一数据的采集教学设计一、教材定位与内容重组粤教版(2019)必修1《数据与计算》模块中,“5.2数据的采集”承上启下。上一节“数据的编码”解决了数据在计算机内部“如何表示”的问题,本节聚焦数据“从哪里来、怎么获取”,为后续“数据的清洗、分析与可视化”提供原料。教材编排遵循“认知规律与学科逻辑双线并进”原则,将采集过程拆解为“确定需求、选择来源、实施采集、存储管理”四个环节,并穿插网络爬虫、传感器采集、问卷设计三种典型技术路径。备课组经研讨认为,原教材案例偏向演示,缺乏学生动手实践与计算思维显性化训练。本设计将教材重组为“三大任务群”:一是“溯源”,建立数据全生命周期起点意识;二是“实战”,通过Python爬虫与表单设计双线操作,体验结构化与非结构化数据获取差异;三是“省思”,在真实场景中内化法律伦理红线。如此处理,使课堂从“学会采集”转向“会采集、懂规范、能决策”。二、核心素养导向的教学目标1.信息意识:能识别问题情境中的数据需求,判断数据来源可靠性与时效性,主动规避单一数据源偏差风险。2.计算思维:能将采集过程抽象为“输入处理输出”模型,设计爬虫逻辑与表单字段,理解异常处理与反爬机制背后的算法博弈。3.数字化学习与创新:熟练运用Requests、BeautifulSoup库及在线表单工具,完成从网页解析到结构化存储的完整链路,尝试多源数据融合初步探索。4.信息社会责任:严守《数据安全法》《个人信息保护法》底线,在爬虫设置延时、表单匿名化处理中践行“隐私计算”理念,形成合规采集肌肉记忆。三、学情诊断与教学策略高一学生已完成Python基础语法、网页基础HTML/CSS结构认知,但缺乏HTTP协议深度理解,对动态渲染、AJAX异步加载、反爬策略认知为零。问卷设计经验停留在纸质问卷层面,不懂跳转逻辑、必填校验、选项随机化等电子化技巧。针对差异,采取“分层支架+结对编程”策略:基础薄弱组提供完整代码框架,重点攻克选择器定位与数据清洗;进阶组挑战动态网页Selenium实战与表单复杂逻辑跳转;全员混编结对,强制代码审查环节,以教促学。课前推送微课预习HTTP报文结构、CSS选择器语法,腾出课堂时间攻坚核心难点。四、教学过程设计(一)情境导入:一张“缺失拼图”的决策困境投屏展示某连锁奶茶店选址决策案例:老板仅凭直觉选址三家分店,两家亏损。提供三组数据源——商圈热力图开放API、竞品门店POI数据、周边居民消费偏好问卷。提问:“若你是数据分析师,如何在两周内获取这三类数据?各自面临什么技术与合规挑战?”学生分组讨论三分钟,记录在协作文档。教师汇总关键词:API调用频率限制、POI数据版权、问卷回收率低、样本偏差。点拨:“数据采集不是简单的‘复制粘贴’,是技术手段与法律边界、成本效益的动态平衡。今天我们就要破解这三个硬骨头。”此环节5分钟,直击痛点,确立“带着问题学”基调。(二)任务一:拆解采集全流程,建立标准化作业单1.概念建模。投影教材图521“数据采集流程图”,去除箭头标注,要求学生用便利贴补全关键动作词:明确指标、评估来源、编写脚本/设计问卷、运行监控、异常处理、入库校验。全班巡视,发现多数组遗漏“运行监控”与“入库校验”。讲解:生产环境采集常因网络抖动、源站结构变更中断,无监控即盲飞;入库前必做字段类型、空值率、唯一性校验,否则脏数据污染下游分析。2.标准化作业单落地。分发《数据采集作业单V1.0》电子模板,含九字段:采集编号、业务目标、目标字段定义、数据源类型(开放API/网页/传感器/问卷/日志)、工具选型、反爬/合规评估、预计数据量、存储方案、验收标准。以奶茶店选址为例现场演示填写第一行:编号DJ202410001,目标获取半径3km内竞品门店经纬度/品牌/营业时间,源类型高德地图开放平台POI检索API,工具PythonRequests+JSON解析,合规评估遵守API调用协议不高频并发,存储SQLite本地库,验收字段完整率>98%、坐标偏移<50米。学生独立完成其余两行,教师抽查点评,强制修正模糊表述如“爬网上数据”改为“解析目标站点HTML结构提取可见文本”。此环节20分钟,倒逼学生从“想做什么”转向“怎么做、怎么评估”。(三)任务二:网络爬虫实战——从静态页面到动态渲染的阶梯攀登3.静态页面解剖实验。打开某图书评分网站“Top250”榜单页,按F12打开开发者工具,切换Network面板筛选Doc类型,观察首包HTML包含完整列表数据。演示CSS选择器定位:`>div.hd>a>span:nthchild(1)`提取书名,`div.star>span.rating_num`提取评分,`p.pl`提取出版信息。学生在JupyterNotebook中敲入代码:```pythonimportrequestsfrombs4importBeautifulSoupimportpandasaspdimporttime,randomheaders={'UserAgent':'Mozilla/5.0(WindowsNT10.0;Win64;x64)AppleWebKit/537.36'}data=[]forstartinrange(0,250,25):url=f'https://book.douban/top250?start={start}'resp=requests.get(url,headers=headers,timeout=10)resp.raise_for_status()soup=BeautifulSoup(resp.text,'lxml')items=soup.select('div.item')foriteminitems:title=item.select_one('div.hdaspan').get_text(strip=True)rating=item.select_one('span.rating_num').get_text(strip=True)pub_info=item.select_one('p.pl').get_text(strip=True)data.append([title,rating,pub_info])time.sleep(random.uniform(1,3))礼貌延时df=pd.DataFrame(data,columns=['书名','评分','出版信息'])df.to_csv('douban_top250.csv',index=False,encoding='utf8sig')```重点讲解三个细节:`headers`伪装浏览器身份绕过基础反爬;`raise_for_status()`主动抛出HTTP错误码,配合tryexcept实现重试机制;`random.uniform`随机延时模拟人类浏览间隔。学生运行代码,对比CSV行数与网页总数,发现缺失3条,引导排查:原网页含广告位`div.item`结构不同,需增加条件判断`ifitem.select_one('div.hd')`过滤。此过程体现“防御性编程”思想。4.动态渲染攻坚。切换某短视频平台热榜页,Network面板显示HTML仅含骨架,数据藏在XHR返回的JSON中。演示抓包分析:找到`aweme/list/`接口,观察QueryString参数`cursor=0&count=20`,推断翻页规律。讲解`requests`无法执行JS,引入Selenium+ChromeDriver方案:```pythonfromseleniumimportwebdriverfromselenium.webdrivermon.byimportByfromselenium.webdriver.support.uiimportWebDriverWaitfromselenium.webdriver.supportimportexpected_conditionsasECimportjsonoptions=webdriver.ChromeOptions()options.add_argument('headless')options.add_argument('disablegpu')driver=webdriver.Chrome(options=options)driver.get('https://.example/hot')wait=WebDriverWait(driver,10)wait.until(EC.presence_of_element_located((By.CSS_SELECTOR,'div.videoitem')))模拟滚动触发懒加载for_inrange(3):driver.execute_script('window.scrollTo(0,document.body.scrollHeight);')time.sleep(2)items=driver.find_elements(By.CSS_SELECTOR,'div.videoitem')foriteminitems:print(item.get_attribute('datajson'))假设数据内嵌属性中driver.quit()```强调`WebDriverExplicitWait`替代强制睡眠,提升稳定性;`headless`模式部署服务器无界面环境。进阶组挑战:破解某电商商品评价页字体反爬(CSS自定义字体映射数字),提示利用FontTools库解析WOFF映射表,或直接调用OCR识别渲染后图片。基础组完成静态页面全量采集并入库SQLite,建立`books`表含`id,title,rating,pub_info,crawl_time`字段,执行`INSERTORIGNORE`去重。全程结对编程,驾驭键盘者轮换每15分钟,观察者负责读文档、查报错、记日志。此环节45分钟,代码即文档,过程即评价。(四)任务三:电子问卷设计——从题目编排到逻辑跳转的精细打磨1.问卷架构重构。展示两份问卷对比:A版20题平铺直叙,含“请描述您最近一次购买奶茶的完整过程”开放题;B版12题,引入显性逻辑——Q1单选“近一个月购买频次”,选“0次”跳转致谢页,选“13次”显示Q2Q5偏好题,选“3次以上”额外显示Q6Q9忠诚度量表。学生体验填写,记录耗时与放弃节点。结论显而易见:B版平均耗时缩短40%,有效回收率提升27%。讲解问卷设计“三原则”:目标导向(每题服务一个分析假设)、认知减负(单选<7选项、矩阵题<5行)、路由精准(跳转逻辑减少无效作答)。2.问卷星/金山表单高级功能实操。学生登录账号,按作业单字段要求制作《奶茶消费偏好调研问卷》:——题目类型选择:单选(频次)、多选(偏好口味)、矩阵量表(李克特5级评价口感/价格/环境/服务)、填空(人均消费金额,设置数值校验正则`^\d+(\.\d{1,2})?$`)、上传题(小票照片,限制2MB/JPG)。——逻辑跳转设置:Q1选“从未购买”→结束页;Q4“价格敏感度”选“非常敏感”→显示Q4a“可接受价格区间”。——选项随机化:除品牌认知题外,全部开启选项乱序,抵消首选偏差。——防刷配置:开启“限制同一IP/微信ID答题一次”、验证码、最短作答时间120秒。——预填链接生成:利用URL参数`q1=2&q2=3`实现渠道追踪,区分校内/社区/商圈三个投放渠道。3.试填与数据导出检验。组内互填20份,导出Excel,用Python`openpyxl`读取检查:必填项是否为空、跳转逻辑是否生效(未显示题目列应全空)、多选题分列存储是否拆分为多列0/1哑变量。教师现场抽查一份数据,演示透视表快速出频数统计图,直观展示“采集质量决定分析上限”。此环节35分钟,工具操作与统计思维同步渗透。(五)任务四:合规边界沙盘推演——在灰度地带确立红线意识设置四个“灰度场景”卡片,分组辩论后全班表决,教师补全法律条文:场景A:爬取某招聘网站所有公开简历(姓名、手机、邮箱、工作经历)构建人才库商业变现。场景B:在商场入口部署WiFi探针采集MAC地址分析顾客流向,未告知、未授权。场景C:购买第三方“数据包”含500万用户画像标签,供精准推送广告。场景D:课题组采集校园食堂刷卡记录脱敏后分析就餐高峰,未经过伦理审查。学生激烈争论“公开即可取”“脱敏即安全”等误区。教师抛出核心判据:《个保法》第13条“公开披露个人信息仍需在合理范围内处理”、第28条“自动化决策不得不合理差别对待”、网信部《网络数据安全管理条例》征求意见稿第21条“重要数据出境安全评估”、GB/T352732020附录A“去标识化与匿名化技术规范”。结合《刑法》第253条“侵犯公民个人信息罪”量刑标准,现场演示如何编写爬虫`robots.txt`合规检查函数,如何在问卷首页嵌入《知情同意书》弹窗并记录点击日志。最终形成《本组采集合规清单》张贴实验室墙面,作为后续所有项目准入门槛。此环节20分钟,法理入脑入心。(六)课堂总结与分层作业设计梳理知识图谱:采集流程四阶段、三大技术路径选型决策树、合规四红线。布置三级作业:基础级(必做):完善爬虫代码,增加断点续爬功能(记录`start`参数至本地文件),采集完整Top250并生成评分分布直方图。进阶级(选做):使用Selenium采集某动态加载电商前50商品“价格销量评价数”三维数据,绘制气泡图探究相关性。挑战级(探究):设计“校园共享单车骑行热力图”采集方案,对比“申请校方导出日志数据”“部署蓝牙信标”“学生自愿上传轨迹”三种路径的技术可行性、数据粒度、隐私风险、实施成本,撰写不超过800字可行性分析报告。作业提交至班级GitHubClassroom,PullRequest流程模拟代码评审,教师Inlineme
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 2026年永昌县带编教师招聘考试备考题库及答案解析
- 年产8万吨新型环保透水砖项目可行性研究报告
- 2026年若羌县带编教师招聘考试备考题库及答案解析
- 2026年双湖县带编教师招聘笔试模拟试题及答案解析
- 净菜加工中心建设项目可行性研究报告
- 《老旧小区排水管网工程安全管理方案》
- 《鱼骨图分析法》课件
- 2026年砚山县带编教师招聘考试备考试题及答案解析
- 2026年中医养生保健师职业资格考试中医基础理论模拟试卷
- 石英砂矿开采加工项目水资源论证报告书
- 某机械制造厂安全生产规范
- 2025年通信工程师中级通信专业实务(终端与业务)考试真题及答案
- 《电力重大事故隐患判定标准及治理监督管理规定》国家能源局解读课件
- 2026年秋季学期小学统编版语文六年级上册(新教材)教学计划附教学进度表
- 工伤保险条例练习题及完整答案
- 26秋四年级上册数学第一单元提优卷《北师大版》
- 2026教科版六年级科学上册第一单元《健康生活》全部教案
- 班级值日班长轮值制度及一日工作流程表(中学适用)
- 钢结构凉亭施工方案
- 上海绿色施工方案格式文本(2026版)
- 2026年四史知识竞赛(改革开放史篇)考试题库及答案
评论
0/150
提交评论