《网络爬虫技术与应用》课程教学大纲_第1页
《网络爬虫技术与应用》课程教学大纲_第2页
《网络爬虫技术与应用》课程教学大纲_第3页
《网络爬虫技术与应用》课程教学大纲_第4页
全文预览已结束

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

《网络爬虫技术与应用》课程教学大纲一、课程基本信息课程编号:12188课程名称:网络爬虫技术与应用英文名称:WebcrawlertechnologyandApplication课程类型:专业课课程要求:选修学时/学分:48/3(讲课学时:32实验学时:16)先修课程:Python语言程序设计、面向对象程序设计(Java)、云计算与大数据后继课程:大数据项目综合实践适用专业:数据科学与大数据技术二、课程描述《网络爬虫技术与应用》是数据科学与大数据技术专业的选修课,主要讲授网络爬虫技术的原理、开发方法和开发工具,包括Python爬虫程序的编写、Java的Jsoup等开源框架、互联网数据抓取实战等。通过本课程的学习,使学生能够了解网络爬虫技术的应用领域,了解Python爬虫程序和Java爬虫程序的基本原理、技术和流程,以及基于第三方数据聚合平台的使用,掌握主流的爬虫程序技术,并能够应用其对互联网数据的搜索和采集,为今后大数据领域的数据采集和大数据开发打下坚实的理论和技术基础。三、课程教学目标1.了解网络爬虫技术的基本概念、方法和技术,并能够运用到复杂的综合数据采集中,解决数据的采集和解析问题。(支持毕业能力要求3)2.熟悉网络爬虫技术的开发流程,掌握主流的Python和Java两大语言的爬虫技术,综合运用数据获取、HTML内容解析、数据存储等技术,进行数据采集和分析,进而分析综合得到结论。(支持毕业能力要求5)3.能够正确选择和恰当使用网络爬虫技术,满足特定需求,并在设计中培养学生的创新态度和意识。(支持毕业能力要求3、5)四、教学内容、安排及与教学目标的对应关系单元教学内容单元教学目标学时教学方式对应课程教学目标1一、Python爬虫入门1.1什么是网络爬虫1.2网络爬虫的目的1.3网络爬虫技术解决的实际问题(1)了解本课程研究的对象、内容,明确本课程的地位;(2)能够阐述网络爬虫技术的概念、目标和作用。4讲授12二、Python爬虫基础2.1Python爬虫开发环境配置2.2Urllib库的基本使用2.3URLError异常处理(1)了解Python爬虫工作原理,能够针对数据采集进行合理的分析与评价;(2)能够根据具体需求,配置Python爬虫开发环境。4讲授23三、Python爬虫进阶3.1Urllib库的高级用法3.2Cookie的使用3.3正则表达式的使用(1)了解Urllib库的高级用法,核心API调用,针对实际问题,能够调用合理的API类库;(2)能够借助Urllib库发出请求响应,设置Cookie模拟登陆。4讲授24四、Python爬虫数据采集示例4.1采集猫眼电影信息4.2采集淘宝商品图片4.3采集百度贴吧帖子(1)了解数据采集以及分析的实现;(2)能够进行单页面和多页面的数据采集;(3)能够对检索的结果进行过滤;(4)理解Python爬虫数据的指导思路和原则,针对实际问题,给出合理有效的解决方案。4讲授25实验1:Python爬虫程序进行互联网数据采集借助Python爬虫程序实现互联网数据的信息采集,数据解析以及数据存储,将解析的结果显示在web网页中。8实验2、36五、基于Scrapy框架的大数据采集5.1Scrapy框架运行平台及相关辅助工具5.2基于Scrapy框架的爬虫程序5.3Scrapy模拟登陆(1)了解于Scrapy框架的大数据采集特点;(2)了解如何安装部署Scrapy框架环境,实现基于Scrapy框架的爬虫程序。4讲授27六、第三方数据集合平台使用6.1阿凡达数据平台使用6.2阿凡达数据平台接口API6.3基于阿凡达数据平台的数据解析(1)熟悉阿凡达数据平台使用;(2)了解阿凡达数据各个数据接口的API调用。4讲授28七、基于Java的爬虫程序7.1搭建Java开发环境7.2HttpClient请求和响应7.3Jsoup类库的使用(1)了解HttpClient请求和响应的基本原理;(2)了解通过Jsoup类库对html内容进行解析和过滤。4讲授29八、基于Java的爬虫程序进阶8.1RSS新闻数据爬取8.2多线程爬虫程序8.3采集数据的存储(1)熟悉RSS规范;(2)了解基于多线程机制的爬虫程序开发;(3)了解数据采集的存储机制。4讲授210实验2:基于Java的互联网商品信息采集(1)基于CentOS搭建Java爬虫服务器;(2)掌握利用Java实现的互联网商品信息采集。8实验2、3五、其他教学环节(课外教学环节、要求、目标)1.实验(课外16学时)(1)Python爬虫技术的熟练使用。(6学时)(2)基于Scrapy框架开发爬虫程序。(6学时)(3)爬虫服务器在CentOS平台下的搭建。(2学时)(4)Java爬虫技术的实现。(2学时)2.大作业(课外8学时)基于网络爬虫技术,完成一个不同于课内实验的某一类型的网络爬虫系统的设计开发,熟悉网络爬虫的开发流程,掌握网络爬虫的设计方法,并撰写开发文档。六、教学方法本课程采用课堂教学、实验教学并重的教学组织方式,结合课内作业、课外实验、基于网络爬虫技术的项目设计与开发大作业等教学手段和形式完成课程教学任务。基于案例开展课堂教学,通过讲授、提问、讨论、演示等教学方法和手段让学生理解网络爬虫技术的基本概念和理论。在课内外实验环节,通过演示性、设计性、综合性实验使学生掌握网络爬虫技术的开发技术。在大作业教学环节,通过实际项目的开发,使学生掌握网络爬虫系统的设计和实现方法,并在设计中充分发挥学生的主观能动性,培养学生的自主学习能力和创新能力。七、学习评量最终成绩由平时作业成绩、平时实验成绩、期末成绩和大作业成绩等组合而成。各部分考核内容、所占比例如下:平时作业成绩:10%。主要考核重要知识点的复习、理解和掌握程度。平时实验成绩:30%。主要考核学生的课内实践项目的完成情况。大作业成绩:10%。主要考核课外大作业的完成情况。要求学生演示、讲解所完成的网络爬虫系统,提交软件设计文档,综合演示、答辩、软件文档评定大作业成绩。期末考试成绩:50%。主要考核应用基本概念和方法分析和解决问题的能力和程度。书面考试形式。题型为选择题、填空题、问答题、分析题、综合设计题等。八、教学资源1.教材[1]

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

最新文档

评论

0/150

提交评论