版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
《Python爬虫与网络数据采集案例实战(微课视频版)》试题库目录TOC\o"1-1"\h\u14134《Python爬虫与网络数据采集案例实战(微课视频版)》试卷(一) 《Python爬虫与网络数据采集案例实战(微课视频版)》试卷(一)专业年级班姓名学号题号一二三四五总分得分(说明:本试卷共五题,共4页)一、单项选择题(共15小题,每小题2分,共30分)1.大数据处理技术和传统的数据挖掘技术最大的区别是()。A.处理速度快(秒级定律) B.算法种类更多C.精度更高 D.更加智能化2.从大量数据中提取知识的过程通常称为()。A.数据挖掘 B.人工智能 C.数据清洗 D.数据仓库3.下列采集方式中,不属于人工采集方法的是()。A.使用搜索引擎采集信息 B.利用专业网站查找C.搜索重要主题性邮件列表 D.使用采集器抓取4.基本的Python内置函数eval(x)的作用是()。A.计算字符串x作为Python语句的值B.将整数x转换为十六进制字符串C.将x转换成浮点数D.去掉字符串x最外侧引号,当作Python表达式评估返回其值5.以下数据中,非结构化数据不包括()。A.音频 B.图片 C.图像 D.日志文件6.在python的open()函数中,()模式字符可以在原本的文件上追加内容。A.w B.r C.b D.a7.下列不属于聚焦网络爬虫的常用策略的是()。A.基于深度优先的爬取策略 B.基于内容评价的爬取策略C.基于链接结构评价的爬取策略 D.基于语境图的爬取策略8.要使用Google搜索以“大海”为主题的Flash文件,应该输入的查询语法是()。A.大海filetype:pdf B.大海intitle:pdfC.大海filetype:swf D.大海intitle:swf9.关于lambda函数,以下选项中描述错误的是()。A.lambda不是Python的保留字B.定义了一种特殊的函数C.lambda函数也称为匿名函数D.lambda函数将函数名作为函数结果返回10.以下不属于数据采集工具的是()。A.Flume B.八爪鱼采集器C.MySQL D.Filebeat11.()是HTML的一个重要部分,主要用于采集和提交用户输入的信息。A.图像 B.列表菜单 C.表单 D.文件12.表单登录需要使用的请求方法为()。A.POST B.GET C.PUT D.DELETE13.NumPy中计算元素个数的方法是()。A.np.sqrt()B.np.size()C.np.length()D.np.identity()14.以下哪种方式不能获取到动态网页的内容()。 A.使用Selenium模拟浏览器打开网页获取内容 B.逆向AJAX的内容来模拟JavaSrcipt请求获取内容 C.直接下载HTML文件来获取内容 D.以上都可以获取到动态网页的内容15.以下哪种不是反爬虫机制()。A.检测Headers B.修改Robots.txt文件C.使用AJAX技术 D.通过CSS混淆页面内容二、判断题(共10小题,每小题1分,共10分)1.Python是一款服务器端解释性开源非编译脚本语言。()2.数据采集又称数据获取,是利用设备或技术手段从现实环境及网络获取数据并放入系统内部进行使用。()3.避免产生错误的方法就是在符号之前加上一个斜杠,构成转义字符。()4.xpath中,使用/表示从头开始提取。()5.JavaScript语言不区分大小写。()6.OCR技术现在已经可以百分百识别验证码。()7.在Python中,使用==进行严格相等的判断。()8.Scrapy可以爬取任何类型的数据。()9.AJAX可以通过在后台与服务器进行少量数据交换,可以重新加载整个网页。()10.空值是指缺失或不知道具体的值,可能是一条记录中的某个属性缺失,也可能是整条记录都丢失。()三、填空题(共6小题,共10个空,每空1分,共10分)1.大数据的数据类型分为结构化数据、、。2.数据的存储有、、。3.当配置好任务,进行数据采集是,
即用自己的本地电脑进行数据采集。4.登录采集分
登录采集和
登录采集。5.
是构成网页的基本元素。6.在百度中,可以实现精确匹配的搜索语法格式是双引号(””)和。四、简答题(共2小题,每小题各5分,共10分)1.请简述数据分析的基本步骤。2.请简述网络爬虫的工作流程。五、应用题(共2小题,每小题20分,共40分)。1.请用BeautifulSoup库进行爬取酷狗榜单中酷狗TOP500的音乐信息。【需求说明】(1)请求主页:/yy/rank/home/1-8888.html?from=rank(2)爬取的内容为酷狗榜单中酷狗TOP500的音乐信息:排名、歌名、歌手、时长。(3)采集的数据存储在D:\music.csv文件中。【爬虫代码截图】【爬虫运行结果截图】2.使用Selenium插件在“人民邮电出版社”网站里实现模拟搜索“python”为关键字的图书,并获取图书的书名、作者、价格、ISBM号、出版日期。【需求说明】(1)请求主页:/shopping/index(2)使用Selenium插件中的driver启动第二个弹窗。(3)分析当前网页的数据是静态还是动态加载,使用对应的方式发送请求。(4)将爬虫的数据写入到mongoDB服务器中mydb数据库中的book集合中。【爬虫代码截图】【爬虫运行结果截图】
《Python爬虫与网络数据采集案例实战(微课视频版)》试卷(二)专业年级班姓名学号题号一二三四五总分得分(说明:本试卷共五题,共4页)一、单项选择题(共15小题,每小题2分,共30分)1.网络爬虫的主要功能是什么()?A.发送电子邮件B.自动访问网页并收集数据C.进行在线购物D.玩网络游戏2.以下哪种语言通常用于编写网络爬虫()?A.PythonB.HTMLC.PhotoshopD.Excel3.爬虫在抓取网页时,可以通过哪种方式识别页面中的数据()?A.通过网页的颜色B.通过网页的标题C.通过网页的URLD.通过网页的字体大小4.爬虫在抓取网页时,可能会遇到哪些问题()?A.网页加载速度过快B.网页内容过于简单C.网页结构复杂D.网页没有图片5.爬虫在抓取网页时,应该注意哪些道德问题()?A.不要过度频繁地访问同一网站B.可以随意使用网站上的数据C.可以随意更改网站上的内容D.不需要尊重网站的robots.txt文件6.下列选项中,关于网络爬虫描述错误的是()。A.聚焦网络爬虫可以抓取指定网站的数据B.通用网络爬虫是可以访问全互联网资源的网络爬虫C.增量式网络爬虫只能抓取新产生的网页或内容发生变化的网页D.聚焦网络爬虫通常用于实现搜索引擎7.通常使用()工具来模拟浏览器操作?A.SeleniumB.ChromeC.ChromeDriverD.WebDriver8.关于浏览器加载网页的过程,下列描述错误的是()。A.浏览器通过DNS服务器查找被访问服务器对应的IP地址B.浏览器向DNS服务器解析的IP地址发送http请求C.web服务器将响应的html页面返回给DNS服务器D.浏览器会对html页面进行渲染并呈现给用户9.下列选取节点的表达式中,代表着从根节点开始选取的是()。A./B.//C.nameD.@10.如果需要在页面上模拟一些鼠标操作,可以通过使用()类来实现。A.WebDriverB.ActionChainsC.SelectD.Ajax11.阅读下面一段示例程序:forhandleindriver.window_handles:driver.switch_to_window(handle)上述程序可以用作()操作。A.填充表单B.弹窗处理C.页面切换D.获取页面的Cookie12.在scrapy.Item的子集中,可以添加()类型的属性来表示爬虫项目的实体数据。A.scrapy.ItemB.scrapy.SpiderC.scrapy.FieldD.scrapy.Pipeline13.一个Scrapy项目中可以有多个爬虫,每个爬虫在执行时可以按照()属性来区分。A.allowed_domainsB.nameC.start_urlsD.parse14.下列设置项中,能够控制爬取网站使用的用户代理的是()。A.PROXIESB.ITEM_PIPELINESC.USER_AGENTD.COOKIES_ENABLED15.下列方法中,用于对传递的URL进行编码和解码的是()。A.urldecode,urlencodeB.unquote,urlencodeC.urlencode,urldecodeD.urlencode,unquote二、判断题(共10小题,每小题1分,共10分)1.robots.txt文件没有实际的约束力。()2.爬虫爬取网页的行为都很正当,不会受到网站的任何限制。()3.针对采用了防爬虫措施的网站,爬虫是无计可施的。()4.一旦服务器端出现错误,返回的状态码为403。()5.GET请求是指向指定资源提交数据进行处理请求,数据被包含在请求体中。()6.服务器可以根据请求报头中的Accept进行判断,以返回适当的文件格式给浏览器。()7.如果访问某网站的频率太高,则这个网站可能会禁止访问。()8.urlopen()是一个特殊的opener,支持设置代理IP。()9.如果路径表达式以“/"开始,那么该路径就代表着到达某个节点的绝对路径。()10.创建BeautifulSoup类实例时,如果没有明确指定解析器,那么该实例肯定会选择Python标准库。()三、填空题(共6小题,共10个空,每空1分,共10分)1.如果要获取类中字符串形式的响应内容,可以访问属性获取。2.结构化数据又称作行数据,是由二维表结构来逻辑表达和实现的数据,严格地遵循数据格式与长度规范,主要通过关系型数据库进行存储和管理,包括、和。3.selenium库的有点儿像加载网站的浏览器,它不仅可以查找页面元素,而且可以与页面上的元素进行交互。4.是Scrapy提供的爬虫基类,创建的爬虫类需要从该类该类继承。5.和是基于HTML/XML文档的层次结构来确定到达指定节点的路径,所以它们更适合处理层级比较明显的数据。6.是一种信息抽取类库,用于从JSON文档中抽取指定信息。四、简答题(共2小题,每小题各5分,共10分)1.请简述网络爬虫的分类。2.请简述实现模拟登录的方式有哪些。五、应用题(共2小题,每小题20分,共40分)。1.请用正则表达式库进行爬取的内容为斗破苍穹小说网全文小说。【需求说明】(1)爬取所有章节的信息,以下为前3章的网址:/doupocangqiong/1.html/doupocangqiong/2.html/doupocangqiong/3.html(2)爬取的内容为全文文字信息。(3)运用Python对文件的操作,把爬取的信息存储在本地的txt文本中。【爬虫代码截图】【爬虫运行结果截图】2.使用Selenium插件爬取pexels网页上搜索flower的图片。【需求说明】(1)请求主页:。(2)打开第一个加载文件,在Headers部分可以看到请求的URL,。(3)分析当前网页的数据是静态还是动态加载,使用对应的方式发送请求。(4)在pexels主页的搜索框中输入flower关键字,单击回车返回所有花的图片。(5)下载的图片保存在D:\photos文件夹中。【爬虫代码截图】【爬虫运行结果截图】
《Python爬虫与网络数据采集案例实战(微课视频版)》试卷(三)专业年级班姓名学号题号一二三四五总分得分(说明:本试卷共五题,共4页)一、单项选择题(共15小题,每小题2分,共30分)1.网络爬虫又被称为什么?A.搜索引擎B.数据抓取器C.网页解析器D.A、B和C都是2.下列哪个库不是Python中常用的网络爬虫库?A.BeautifulSoupB.ScrapyC.RequestsD.Pandas3.HTTP状态码200表示什么?A.服务器错误B.请求已成功处理C.资源未找到D.请求被拒绝4.在网络爬虫中,下列哪项不属于HTTP请求方法?A.GETB.POSTC.PUTD.DELETE5.CSS选择器`#myId`是用来选择:A.类名为'myId'的元素B.id为'myId'的元素C.所有元素D.标签名为'myId'的元素6.以下哪个选项不是BeautifulSoup库中的方法?A.find_all()B.find()C.select()D.create()7.XPath是什么?A.一种编程语言B.一种数据格式C.一种用于定位XML文档中部分的语言D.一种数据库查询语言8.在网络爬虫中,IP被封锁的常见原因是什么?A.发送过多的请求B.访问了禁止爬取的网站C.使用了错误的用户名和密码D.所有的选项都正确9.以下哪种方式不能有效地防止IP被封?A.使用代理IPB.限制爬取速度C.使用cookie池D.使用明文存储密码10.PhantomJS主要用于解决什么问题?A.跨域问题B.JavaScript渲染问题C.Cookie管理问题D.IP被封锁问题11.在网络爬虫中,CAPTCHA的主要作用是什么?A.提高网站加载速度B.防止机器人自动提交表单C.提供更好的用户体验D.增加网站的功能12.SeleniumWebDriver的主要用途是什么?A.进行单元测试B.进行UI测试C.进行网络爬虫D.进行数据库操作13.下列哪个选项不是Requests库中的方法?A.get()B.post()C.put()D.delete()14.在网络爬虫中,User-Agent的作用是什么?A.存储用户信息B.标识用户身份C.控制用户权限D.提供用户界面15.下列哪一项不属于网络爬虫的法律风险?A.侵犯版权B.侵犯隐私权C.违反使用协D.网络攻击二、判断题(共10小题,每小题1分,共10分)1.Python是一种通用的、解释型的、高级编程语言。()2.BeautifulSoup库可以解析HTML和XML文档。()3.Requests库是Python中唯一可以用来发送HTTP请求的库。()4.SeleniumWebDriver不支持无头浏览器模式。()5.User-Agent是用来标识用户身份的字符串。()6.PhantomJS是一个无头的浏览器,它可以被用来处理JavaScript渲染的页面。()7.网络爬虫不需要遵守网站的使用协议和法律法规。()8.在进行网络爬虫时,频繁地发送请求可能会被网站封锁IP。()9.Pandas库不能用于处理和分析爬取到的数据。()10.通用爬虫用于将互联网上的网页下载到本地,形成一个互联网内容的镜像备份。()三、填空题(共6小题,共10个空,每空1分,共10分)1.在Python中,我们通常使用__________库来发送HTTP请求。2.客户端发送的请求消息由__________、__________、__________以及__________4部分组成。3.在Python的网络爬虫中,我们常常使用__________来处理JavaScript渲染的页面。4.在网络爬虫中,为了防止IP被封,我们可以使用__________来更换IP地址。5.在Python的网络爬虫中,我们常常使用__________来管理和切换多个Cookie。6.Scrapy常应用在包括__________,__________或存储历史数据等一系列的程序中。四、简答题(共2小题,每小题各5分,共10分)1.什么是动态网页。2.正则表达式、xpath、BeautifulSoup和JSONPath有什么区别。五、应用题(共2小题,每小题20分,共40分)。1.请用爬取豆瓣电影top250。【需求说明】(1)由于详细页的信息更为丰富,本次在详细页中采集电影信息,故先需爬取进入详细页的网址链接,再进入详细页采集电影信息。爬取豆瓣电影top250的10页信息,通过手动浏览,以下为前4页的网址:/top250/top250?start=25/top250?start=50/top250?start=75(2)需要采集详细页电影字段信息有:电影名称、导演、主演、类型、制片国家、上映时间、片长,和评分和评价。(3)运用Python中的json、pymongo、pymysql库,将采集的电影信息分别存储为MySQL数据库的doubamovie表中、doubanmovie.json、MongoDB数据库中myMongo的doubanmovie集合。【爬虫代码截图】【爬虫运行结果截图】2.使用Selenium插件爬取QQ空间好友说说。【需求说明】QQ空间好友说说的链接为:/{好友QQ号}/311。首次打开QQ空间,需要登录,使用Selenium和Chrome模拟账号登录。爬取的内容为好友说说:好友QQ号、发表时间、发表内容。把爬取数据存储到MongoDB数据库中。【爬虫代码截图】【爬虫运行结果截图】
《Python爬虫与网络数据采集案例实战(微课视频版)》试卷(四)专业年级班姓名学号题号一二三四五总分得分(说明:本试卷共五题,共5页)一、单项选择题(共15小题,每小题2分,共30分)网络爬虫在抓取网页时,通常使用哪种协议?()A.FTPB.HTTPC.SSHD.SMTP以下哪个状态码表示请求成功?A.200B.301C.404D.500在HTTP协议中,POST方法通常用于什么?()获取资源信息B.提交表单数据C.删除服务器上的资源D.在服务器上创建新资源Python中,哪个库可以用于解析HTML内容?()numpyB.pandasC.bs4(BeautifulSoup)D.matplotlib哪个Python库可以用来发送HTTP请求?()A.osB.sysC.requestsD.mathXPath表达式中,用来定位任意元素位置的符号是?()A.@B.//C..D.#CSS选择器中,用来选择具有特定ID的元素的是?().classnameB.#idnameC.element[attribute=value]D.element在Python中,哪个模块可以用来处理JSON数据?()jsonB.xml.etree.ElementTreeC.html.parserD.bs4在Python中,如何将字典转换为JSON格式的字符串?()A.str()B.dict()C.json.dumps()D.json.loads()在Python中,如何将JSON格式的字符串转换为字典?()A.str()B.dict()C.json.dumps()D.json.loads()在Python中,如何将JSON格式的数据写入文件?()A.open()B.write()C.json.dump()D.json.load()在Python中,如何将文件中的JSON格式的数据读入内存?()A.open()B.write()C.json.dump()D.json.load()在编写网络爬虫时,为了避免对目标网站造成过大压力,应该遵循的原则是?()尽可能快地爬取数据B.设置合理的爬取间隔时间C.只爬取首页D.使用尽可能多的线程在Python中,如何使用正则表达式匹配文本?()re.match()B.re.search()C.re.findall()D.pile()在Python中,哪个函数可以用来将字符串转换为日期?()datetime.strptime()B.datetime.strftime()C.str()D.int()二、判断题(共10小题,每小题1分,共10分)1.如果要创建一个爬虫文件,只能通过使用命令的方式来完成。()2.Scrapy爬虫文件中,需要使用start_urls属性确定爬取的起始URL元组或列表。()3.如果Scrapy爬虫文件中规定了爬虫的约束区域,那么不在这个区域的URL会被忽略。()4.如果路径表达式以“/"开始,那么该路径就代表着到达某个节点的绝对路径。()5.创建BeautifulSoup类实例时,如果没有明确指定解析器,那么该实例肯定会选择Python标准库。()6.在使用bs4库调用find()方法查找节点时,只能将字符串作为参数。()7.路径表达式是唯一的,只能从根节点开始搜索。()8.若提交表单后,网站的页面不需要重新刷新,则当前访问的网站用的是AJAX技术。()9.selenium支持浏览器的功能,可以直接被用来执行指令。()10.如果Scrapy爬虫文件中规定了爬虫的约束区域,那么不在这个区域的URL会被忽略。()三、填空题(共6小题,共10个空,每空1分,共10分)网络爬虫主要用于搜索引擎________和内容________。网络爬虫工作原理是________、________和________。网络爬虫遵守的主要规则包括________文件。网络爬虫采集速度应该________。网络爬虫解析网页常用的方法包括________和________。以下可以用来限制网络爬虫采集速度的是________。四、简答题(共2小题,每小题各5分,共10分)1.简单描述一下scrapy框架的运作流程。2.请举出一些针对防爬虫的应对策略。五、应用题(共2小题,每小题20分,共40分)。1.请用scrapy框架爬取简书热门专题信息。【需求说明】(1)爬取的内容为简书热门专题的信息(/recommendations/collections?order_by=hot)(2)简书热门专题分页也采用了异步加载的技术,打开开发者工具,通过手动单击“加载更多”翻页,查看URL变化情况,如图所示,可以看出是通过改变page后的数字进行翻页,把第一页的URL改为/recommendations/collections?page=2&order_by=hot,也可以正常访问以此构造爬虫的全部URL。(3)需要爬取的信息有:专题名称、专题介绍、收录文章和关注人数。(4)采用Scrapy框架进行爬取,通过Feedexports功能把采集的数据存储到CSV文件中。【爬虫代码截图】【爬虫运行结果截图】2.采集当当网的图书信息。【需求说明】(1)利用Requests和Lxml第三方库,爬取当当网中关键字为“机器学习”的图书信息,如图下图所示,并将采集的图书信息存储到machineLearningBook.csv文件中。(2)采集的图书信息有:书名、折扣价、定价、作者、出版时间、出版社、评论数、简介。【爬虫代码截图】【爬虫运行结果截图】
《Python爬虫与网络数据采集案例实战(微课视频版)》试卷(五)专业年级班姓名学号题号一二三四五总分得分(说明:本试卷共五题,共5页)一、单项选择题(共15小题,每小题2分,共30分)1.以下正则表达式中,属于非贪婪匹配,且允许出现0次的是:()A、.B、.*C、.*?D、.+?2.正则表达式R[0-9]{3},能匹配出以下哪个字符串:()A、R3B、R03C、R09D、R0933.在Selenium中,如何定位页面上的一个元素?A.find_element_by_idB.find_element_by_nameC.find_element_by_xpathD.所有上述选项4.网络爬虫抓取网页时,应该注意哪些内容?A.网页内容的版权B.网页的加载速度C.网页的外链数量D.网页的排名5.网络爬虫的深度优先搜索是指?A.从根节点出发,尽可能快速抓取B.从根节点出发,逐层抓取C.从叶节点出发,逐层抓取D.从叶节点出发,尽可能快速抓取6.网络爬虫的广度优先搜索是指?A.从根节点出发,尽可能快速抓取B.从根节点出发,逐层抓取C.从叶节点出发,逐层抓取D.从叶节点出发,尽可能快速抓取7.在Selenium中,如何隐式等待?A.driver.implicitly_wait()B.driver.wait()C.driver.explicitly_wait()D.driver.wait_for_element()8.网络爬虫的抓取深度应该如何确定?A.固定深度抓取B.根据网站结构确定C.随意抓取D.不需要确定9.在Scrapy中,如何定义一个Item?A.在settings.py中注册ItemB.在pipelines.py中定义类并实现方法C.在items.py中定义类并设置字段D.在middlewares.py中添加处理逻辑10.BeautifulSoup4(BS4)中,如何获取指定属性值?A.tag['attribute_name']B.tag.attribute_nameC.tag.get('attribute_name')D.tag.get('attribute_name','default_value')11.正则表达式中,用于匹配任意字符的是哪一个符号?A.*B.+C.?D.{}12.在Scrapy中,用于从响应中提取数据的方法是哪一个?A.parse()B.extract()C.fetch()D.callback()13.使用BeautifulSoup4(BS4)时,如何获取某个标签的文本内容?A.tag.textB.tag['text']C.tag.get_text()D.tag.contents14.在Scrapy项目中,哪个文件包含了爬虫的起始URL?A.items.pyB.pipelines.pyC.settings.pyD.spiders/your_spider.py15.在Selenium中,如何处理下拉菜单?A.click()方法点击下拉菜单B.select_by_visible_text()方法选择可见文本C.send_keys()方法输入文本D.all_of_the_above二、判断题(共10小题,每小题1分,共10分)1.Scrapy中的Spider类负责解析响应并提取结构化数据。()2.在模拟登录过程中,Selenium可以用来处理JavaScript渲染的页面。()3.SeleniumWebDriver不支持无头模式运行。()4.正则表达式中的.*?表示懒惰匹配,尽可能少地匹配字符。()5.在BeautifulSoup中,find_all方法不能递归查找所有匹配的元素。()6.正则表达式中的\d表示匹配任意数字字符。()7.一旦服务器端出现错误,返回的状态码为403。()8.GET请求是指向指定资源提交数据进行处理请求,数据被包含在请求体中。()9.服务器可以根据请求报头中的Accept进行判断,以返回适当的文件格式给浏览器。()10.正则表达式无法用于匹配HTML标签中的内容。()三、填空题(共6小题,共10个空,每空1分,共10分)1.爬虫技术的应用可以分为两大类:______、______。2.根据web页面组成结构中的信息内容的生成方式不同,可以将web页面分为______、______、以及______三大类。3.使用Scrapy框架时,用于定义项目的配置文件名是settings.py,用于定义爬虫的文件名通常以______和______结尾。4.在BeautifulSoup对象中,可以使用.find_all()方法来查找文档中的所有符合条件的元素,该方法返回一个包含所有匹配元素的______。5.为了在Selenium中输入文本,可以使用______方法。6.Selenium中,处理frame(内嵌框架)可以使用______方法来切换到指定的frame。四、简答题(共2小题,每小题各5分,共10分)1.Requests发送请求时携带headers参数及作用(至少写3点)。2.Bs4对定位到的标签如何获取其直接文本,子孙节点文本和属性。五、应用题(共2小题,每小题20分,共40分)。1.请用Scrapy框架爬取了虎扑体育网的新闻信息。【需求说明】爬取的内容为虎扑体育网中足球的新闻信息,如下图所示:(2)网页为动态网页,则需要获取从网页响应中由JavaScript动态加载生成的信息。(3)需要爬取的信息有:标题,发布在的平台,发布时间,发布地点,评论人数,浏览人数,高光次数,推荐人数。【爬虫代码截图】【爬虫运行结果截图】2.利用Selenium插件爬取鱼泡网招聘信息。【需求说明】采集的网站:鱼泡网中的“找活干”页(/zhaogong/a2_gczzy_c599/)(2)用Xpath定位信息,爬取鱼泡网“找活干”中的招聘信息以下内容:标题(title),联系人(name),发布时间(date),招工详情(detail),工作地点(address),工资(money),工种(type),特点(feature)(3)获取招聘相关信息将其输出控制台,并写入csv文件。【爬虫代码截图】【爬虫运行结果截图】
《Python爬虫与网络数据采集案例实战(微课视频版)》试卷(六)专业年级班姓名学号题号一二三四五总分得分(说明:本试卷共五题,共4页)一、单项选择题(共15小题,每小题2分,共30分)1.在网络爬虫技术中,以下哪个库常用于发送HTTP请求和处理响应?()A.BeautifulSoup B.ScrapyC.requests D.Selenium2.在网络爬虫中,robots.txt文件的作用是什么?()A.限制搜索引擎爬虫访问网站B.限制所有网络爬虫访问网站C.限制特定网络爬虫访问网站D.没有作用,是过时的技术3.以下哪种不是常见的反爬虫技术?()A.数据加密 B.用户代理检测C.验证码 D.IP封锁4.在网络爬虫中,以下哪个方法可以用于处理动态页面?()A.BeautifulSoup B.ScrapyC.requests D.Selenium5.在网络爬虫中,以下哪个方法可以用于模拟用户行为?()A.BeautifulSoupB.ScrapyC.requestsD.Selenium在网络爬虫中,以下哪种不是常见的数据存储格式?()CSV B.JSONC.XML D.HTML7.在网络爬虫中,以下哪个方法可以用于限制爬取速度?()A.robots.txtB.IP封锁C.请求头中的延迟参数D.验证码8.在网络爬虫中,以下哪个方法可以用于处理登录后的数据采集?()A.BeautifulSoupB.ScrapyC.requestsD.Selenium在网络爬虫中,以下哪个方法可以用于处理网页解析?()A.BeautifulSoupB.ScrapyC.requestsD.Selenium10.在网络爬虫中,以下哪种不是常见的反爬虫策略?()A.频繁更换User-Agent B.频繁更换IP地址C.设置长时间延迟 D.使用多线程加快爬取速度11.在网络爬虫中,以下哪个方法可以用于处理网页链接提取?()A.BeautifulSoupB.ScrapyC.requestsD.Selenium在网络爬虫中,以下哪个方法可以用于处理数据清洗?()BeautifulSoup B.ScrapyC.requests D.数据清洗不是网络爬虫的功能13.在网络爬虫中,以下哪个方法可以用于处理反爬虫机制?()A.BeautifulSoup B.Scrapy C.Selenium D.requests在网络爬虫中,以下哪个方法可以用于处理动态加载的数据?()A.BeautifulSoup B.Scrapy C.requests D.Selenium在网络爬虫中,以下哪个方法可以用于处理JavaScript渲染的页面?()Selenium B.Scrapy C.requestsD.BeautifulSoup二、判断题(共10小题,每小题1分,共10分)1.Python是用于网络爬虫的主要编程语言之一。()2.爬虫的基本原理是模拟浏览器的行为,发送请求并获取响应。()3.编写Python爬虫需要掌握HTML和CSS的知识。()4.使用Python的requests库可以发送HTTP请求。()5.Python的BeautifulSoup库用于解析HTML和XML文档。()6.大数据指的是数据量极大,无法在单一设备上存储和分析的数据集。()7.大数据采集通常使用批处理模式,即将数据分成小块进行处理。()8.使用Python的Scrapy框架可以高效地采集大量数据。()9.数据采集速度主要取决于网络带宽。()10.大数据采集过程中需要考虑数据的安全性和隐私保护。()三、填空题(共6小题,共10个空,每空1分,共10分)1、为了给Web网站提供灵活的控制方式来决定页面是否能够被爬虫采集。2、目前有多种HTML解析器的开源框架如BeautifulSoup等,大都集成了的解析。3、HTTP状态码(HTTPStatusCode)是用来表示网页服务器HTTP响应状态的。状码包含了五种类别,即、成功、、和。4、在浏览器中打开网站后,在网站首页的地址后面添加“”,如果两站设置了访问许可,按回车就可以看到网站的robots协议,即robotstxt文件内容。5、一般情况下ajax返回的数据是以形式封装的。6、Web页面它具有一定的结构,即。四、简答题(共2小题,每小题各5分,共10分)1.请简述Lxml库的作用。2.简述Python实现网络爬虫的流程。五、应用题(共2小题,每小题20分,共40分)。1.请用BeautifulSoup库进行爬取豆瓣电影Top250的电影信息。【需求说明】(1)请求主页:/top250?start=1(2)爬取的内容为豆瓣电影Top250的电影信息:电影名称、导演、演员、评分等。(3)采集的数据存储在D:\movie.csv文件中。【爬虫代码截图】【爬虫运行结果截图】2.使用re模块和xpath爬取链家网站的广州二手房的信息。【需求说明】(1)请求主页:/ershoufang/(2)爬取的内容为链家网站的广州二手房的信息:房源名称、户型、面积等(3)将爬虫的数据写入到mongoDB服务器中mydb数据库中的集合中。【爬虫代码截图】【爬虫运行结果截图】
《Python爬虫与网络数据采集案例实战(微课视频版)》试卷(七)专业年级班姓名学号题号一二三四五总分得分(说明:本试卷共五题,共4页)一、单项选择题(共15小题,每小题2分,共30分)1.XPath中的'//’和'/有什么不同?()A.'//选择当前节点,/选择根节点B、'/选择文档中的节点,'//选择直接子节点C、‘//选择文档中任意位置的节点,’/选择直接子节点D、没有区别2.在网络爬虫中,以下哪个方法可以用于处理网页的动态内容?()A.BeautifulSoup B.ScrapyC.Requests D.Selenium3.在网络爬虫中,以下哪个方法可以用于处理网页的结构化数据提取?()A.BeautifulSoup B.ScrapyC.Requests D.Selenium4.在Xpath中,选择所有名为'title'的元素的XPath表达式是什么?()A.*title B.//titleC.Title D.title5.在网络爬虫中,以下哪个方法可以用于处理数据存储到数据库?()A.BeautifulSoup B.ScrapyC.Requests D.Selenium6.网络爬虫如何理解网页上的内容?()A、通过执行网页的JavaScript代码 B、通过解析网页的HTML代码C、通过电子邮件 D、通过询问网站管理员7.网络爬虫是用于什么目的?()A、收集、提取和存储网络数据B、收集和分析网络流量C、加速网络连接速度D、进行网络安全测试8.如何用XPath选择所有带有'id'属性的'book'节点?()A、//book[id]B、//book[id]C.book[id]D.book/id9.XPath的应用场景包括:()A、网页抓取和内容提取 B、图像处理和识别C.聊天机器人开发 D、数据挖据和分析10.如果要遍历字典中的所有键,应该使用哪种循环?()A、while循环 B、for-in循环C、do-mhile循环D、switch-case循环11.网页的基础框架是什么语言?()A、Sql B、HTMLC、WNL D、VRML下列哪个HTTP方法通常用于获取网页数据?()A、Fetch B、getC、Put D、delete13.BeautifulSoup库中的find_all方法的作用是什么?()A、查找第一个匹配的标签B、查找文档中所有标签C、查找文档中所有文本D、查找文档中的所有链接14.在爬虫的工作中,什么是URL?()A、一种用于发送电子邮件的格式 B、一种用于创建图像文件的文件扩展名C、一种用于编码文本消息的方法 D、一种用于定位网页的地址15.要解析HTML文档,我们通常使用哪个Python库?()A、BeautifulSoup B、FlaskC、Pygame D、TensorFlow二、判断题(共10小题,每小题1分,共10分)1.数据存储和处理是大数据采集与挖掘过程中的重要环节。()2.大数据处理通常使用分布式存储系统,如Hadoop的HDFS。()3.数据挖掘是大数据分析的核心,不能可以通过挖掘出有价值的信息来支持决策。()4.关联规则学习可以发现数据集中项之间的有趣关系。()5.时间序列分析不是一种用于预测未来事件的方法。()6.使用Python的Pandas库可以进行高效的数据分析和处理。()7.数据预处理包括数据清洗、特征提取和数据转换等步骤。()8.分类算法是一种常见的数据挖掘算法,用于预测离散的目标变量。()9.聚类算法可以将相似的对象分组,但是不能识别出不同的群组。()10.数据可视化是数据分析的重要手段,可以使用Python的Matplotlib库实现。()三、填空题(共6小题,共10个空,每空1分,共10分)1.DNS缓存用于。2、PageRank算法是一种根据计算页面级别的方法。在计算Web页面的重要性、社交网络中的重要人物识别、文本中的关键词提取方面有重要应用。3、动态页面的交互是指浏览器和web服务器之间的命今参数传递方式。按照命令参数的不同提供方式,主要有和两种方式。原创力文档4、URL的发送有通过和两种。5、标准ASCII码使用表示,编码范围为0-1276、提供了正则表达式匹配所需要的功能。匹配和搜索、分割字符串、匹配和普换最常用的函数是。函数返回结果为一个。四、简答题(共2小题,每小题各5分,共10分)1.正则表达式的基本符号有哪几个?分别表示什么含义?如何将爬虫代码伪成浏览器发起请求?如何查看请求返回的状态码?五、应用题(共2小题,每小题20分,共40分)。1.请用lxml库和正则表达式进行爬取1905电影网的电影信息。【需求说明】(1)请求主页:/mdb/film/list/o1d0p1.html(2)爬取的内容为1905电影网的电影信息:电影名称、导演、主演、类型、国家、上映时间、片长、评分八个字段信息。(3)采集的数据存储在D:\movie.csv文件中。【爬虫代码截图】【爬虫运行结果截图】2.使用Selenium插件获取集信达平台的短信服务日志信息,采集所有检索到的短信服务日志信息:序号、创建时间、通道名称、签名名称、模板名称、应用、手机号、耗时等字段:【需求说明】(1)请求主页:/#/login(2)使用Selenium插件中的driver启动第二个弹窗。(3)分析当前网页的数据是静态还是动态加载,使用对应的方式发送请求,登录成功后选择“短信服务”->“服务日志”选项,选择“发送日志”,并在“签名名称”文本框中输入“学成在线”,单击“搜索”按钮,然后(4)将爬取的数据写入到mongodb服务器中mydb数据下的message集合中。【爬虫代码截图】【爬虫运行结果截图】
《Python爬虫与网络数据采集案例实战(微课视频版)》试卷(八)专业年级班姓名学号题号一二三四五总分得分(说明:本试卷共五题,共4页)一、单项选择题(共15小题,每小题2分,共30分)1.在Python爬虫中,用于保存数据到CSV文件的Python标准库是哪一个?()A.Json B.csvC.os D.sys2.XPath使用路径表达式来选取XML文档中的节点或者节点集,以下哪一种用来选取属性?()A.$ B.%C.@ D.*3.在Python爬虫中,为了防止对目标网站造成过大负担,我们应该采取哪种措施?()A、增加请求次数B、减少请求间隔C、频繁请求D、设置合理的请求间隔,减少压力4.在requests.get('https://.baidu.')中,requests.get代表什么?()A、发送一个POST请求B、打开一个网页C、发送一个GET请求D、保存一个文件5.爬虫程序与浏览器的主要区别是什么?()A、浏览器不能显示数据B、爬虫程序不能发送请求C、爬虫程序不会解析响应内容以显示给用户D、浏览器不发送请求6."requests“库主要用途是什么?()A、发送电子邮件B、发送短信消息C、发送文件到云存储D、发送HTTP请求与Web服务通信7.在Python中,用于循环遍历列表元素的关键字是什么?()A.ForB.whileC.loopD.foreach8.使用PythonRequests库时,哪个方法用于添加请求头?()A.requests.post('url',json=['key':'value'])B.requests.get('url',data={'key':'value'})C.requests.get('url',headers=['key':'value'])D.requests.put('url',params={'key':'value'})9.当使用Web爬虫机取网页时,为什么要分析HTNL结构?()A、为了获取网页的字体和颜色信息B、为了计算网页的大小C、为了提取所需的数据和链接D、为了确定网页的语言10.HTNL中的标签是由什么字符包围的?()A、{} B、[]C、<> D.()11.爬虫技术是用来做什么的?()A、防止网站被授索引擎索引B、帮助网站增加流量C、从网页中提取数据D、增加网站的广告收入12.Python虫中通常使用哪种方法来避免被网站检測到是爬虫?()A、更改操作系统B、修改Python版本C、更换IP地址D、设置请求头User-Agent13.在Python爬虫中,通常用字典来存储什么类型的数据?()A、视频文件B、图片文件C、文本内容D、音频文件14.爬虫可以帮助我们获取有用的信息,但也可能会对目标网站造成压力和损失。以下哪项不是开发爬虫程序时需要遵守的道德规范?()A、遵守相关法律法规B、造守网站的使用规定C、尽量减少对目标网站的负面影响D、可以随意爬取网站上的数据,无需征求网站的许可15.以下哪个标签用于定义页面的标题?()A.<title>B.<header>C.<head>D.<h1>二、判断题(共10小题,每小题1分,共10分)1.数据清洗是去除重复、无效或错误数据的过程。()2.缺失值处理是数据清洗的重要环节,不可以通过填充缺失值或删除含有缺失值的记录来实现。()3.数据预处理可以提高数据的质量和可分析性。()4.通过模拟浏览器行为可以避免被反爬虫策略检测到。()5.对于需要登录才能访问的网站,可以使用第三方登录服务来获取访问权限。()6.网站可以通过设置robots.txt文件来限制爬虫访问。()7.特征工程是数据预处理的一个重要步骤,包括特征选择、特征提取和特征转换等。()8.数据去重无法通过比较记录的唯一标识符来实现。()9.使用代理服务器可以隐藏爬虫的真实IP地址,但容易受到IP被封禁的限制。()10.反爬虫策略包括限制访问频率、检测异常行为和验证码验证等手段。()三、填空题(共6小题,共10个空,每空1分,共10分)1.
代表“NOTFOUND”,认为网页已经失效:
代表“ServiceUnavailable”,认为网页临时不可访问:
代表“Forbidden”,认为网页目前禁止访问。2.html标签很多,从闭合的角度可以分为闭合标签与
。3.Tag标签为a时属性为
。Tag标签为资源名称时,例如img、audio,属性为
。4.页面采集层用于对
的处理。5. Web信息提取包含
和
两大部分6.当页面JS脚本比较复杂、AJAX交互较多或存在不同页面之间大量数据交换的情况下,使用
来模拟测览器进行页面内容采集就是比较合适的选择了。四、简答题(共2小题,每小题各5分,共10分)1.网络爬虫分为哪几类?分别适合什么场景?2.分别阐述通用网络爬虫和聚焦网络爬虫的工作原理。五、应用题(共2小题,每小题20分,共40分)。1.请用BeautifulSoup库进行爬取Q房网中深圳宝安二手房的信息。【需求说明】(1)请求主页:/rent/baoan/(2)爬取的内容为Q房网中深圳宝安二手房的信息:标题、特点、地址、租金(3)采集的数据存储在D:\zufang.csv文件中。【爬虫代码截图】【爬虫运行结果截图】2.利用requests和正则表达式方法,爬取Mtime时光网主页“榜单”栏目中的电影信息【需求说明】请求主页:(/listIndex)(2)爬取的内容为Mtime时光网主页“榜单”栏目中的电影信息:排名、电影名称、导演、主演、上映时间、评分、片长、评论数、获奖次数和剧情简介(3)采集的数据存储在MtimeMovie.csv文件中。【爬虫代码截图】【爬虫运行结果截图】
《Python爬虫与网络数据采集案例实战(微课视频版)》试卷(九)专业年级班姓名学号题号一二三四五总分得分(说明:本试卷共五题,共4页)单项选择题(共15小题,每小题2分,共30分)1.在网络爬虫中,以下哪个方法可以用于处理网页的静态内容?()A.BeautifulSoup B.ScrapyC.Requests D.Selenium2.下列哪个不是Python网络爬虫的合法用途?()A、数据分析B、数据采集C、黑客攻击D、搜索引擎优化3.在Python中,如何向列表的末尾添加一个元素?()A、使用append()方法B、使用insert()方法C、使用extend()方法D、使用add()方法4.在BeautifulSoup中,soup.title.text的作用是什么?()A、改变网页的结构B、打印所有属性C、获取网页标题的文本D、查找所有的链接5.在网络爬虫中,以下哪个方法可以用于处理大规模数据采集?()A、BeautifulSoup B、ScrapyC、Requests D、Selenium6.哪个XPath表达式选中文档中所有的节点?()A、nodeB、//*C、/descendantD、*7.Request的get请求通常用于什么目的?()A、发送大量数据B、抓取网页数据C、上传文件D、加密信息8.在网络爬虫中,以下哪个方法可以用于处理数据存储到文件?()A、BeautifulSoup B、ScrapyC、Requests D、Selenium9.在Python爬虫中,如果要连续爬取多个页面,通常使用哪种技术?()A、循环B、条件判断C、异常处理D、类和对象10.下面哪个语句导入了requests库?()A、importreq B、importreqsC、importrequests D、importpython11.在Python中使用BeautifulSoup解析网页时,需要先导入哪个库?()A、Pandas B、numpyC、Requests D、matplotlib12.在Python爬虫中,“反爬虫”是什么意思?()A、提高爬虫速度B、优化爬虫代码C、网站的防抓取措施D、删除爬虫程序13.如何访问列表中的第一个元素?()A、list.first()B、list[0]C、list.get(2)D、list.front()14.爬虫程序存储数据的用途是什么?()A、加快服务器的处理速度B、供以后使用和分析C、减少服务器的压力D、提高数据的质量15.在BeautifulSoup库中,如何获取标签的文本内容?()A、使用arrt()属性B、使用text属性C、使用content方法D、使用get(方法二、判断题(共10小题,每小题1分,共10分)1.在定义函数时,某个参数名字前面带有两个*符号表示可变长度参数,可以接收任意多个关键参数并将其存放于一个字典之中()2.调用带有默认值参数的函数时,不能为默认值参数传递任何值,必须使用函数定义时设置的默认值。()3.已知x是个列表对象,那么执行语句y=x[:]之后,对y所做的任何操作都会同样作用到x上。()4.可以使用del删除集合中的部分元素()5.Python不允许使用关键字作为变量名,允许使用内置函数名作为变量名,但这会改变函数名的含义。()6.Python字符串方法replace_对字符串进行原地修改()7.在Python中,变量不直接存储值,而是存储值的引用,也就是值在内存中的地址()8.在Python3.x中,使用内置函数input_接收用户输入时,不论用户输入的什么格式,一律按字符串进行返回()9.同一个列表对象中所有元素必须为相同类型()10.包含yield语句的函数一般成为生成器函数,可以用来创建生成器对象()三、填空题(共6小题,共10个空,每空1分,共10分)1.页面可以通过和方式来向服务器发送请求的动态参数。2.宽度优先的策略使用作为存储结构。3.深度优先的策略,需要采用作为存储结构。4.按照链接的形式不同,可以分为、和书签。5.关于如何进行节点的定位,lxml提供了两种方式:和。6、在爬虫中实现基于Cookie的动态交互过程可分为两个环节和。四、简答题(共2小题,每小题各5分,共10分)1.数据采集分为哪几种?2.简述Python实现网络爬虫的流程。五、应用题(共2小题,每小题20分,共40分)。1.利用Requests和BeautifulSoup第三方库,爬取咪咕音乐“榜单”的信息【需求说明】(1)请求主页:/v3/music/top/jianjiao_newsong(2)爬取的内容为咪咕音乐“榜单”的音乐信息:排名、歌手、歌曲名称和歌曲时长。(3)采集的数据存储在D:\music.csv文件中。【爬虫代码截图】【爬虫运行结果截图】2.使用scrapy爬虫框架在塔读文学男频专题爬取书籍中的小说名称(names)、作者(author)、题材(theme)、字数(word_count)、最新章节(section)、小说链接(book_hrefs)、更新状态(status)、小说简介(introduction)共八个字段:【需求说明】(1)请求主页:/store/98-a-2-15-a-20-p-1-98(2)在cmd命令符界面进入自己指定的文件夹下输入scrapystartprojecttaduxiaoshuo,利用scrapy框架创建taduxiaoshuo文件。(3)切换到项目taduxiaoshuo的根目录,输入命令:scrapygenspidertaduxiaoshuoSpider‘/’(爬虫起始地址)创建脚本文件,用于编写采集规则。(4)将爬虫的数据存储在D:\xiaoshuo.csv文件中。【爬虫代码截图】【爬虫运行结果截图】
《Python爬虫与网络数据采集案例实战(微课视频版)》试卷(十)专业年级班姓名学号题号一二三四五总分得分(说明:本试卷共五题,共4页)一、单项选择题(共15小题,每小题2分,共30分)1.()是指对客观事件记录的符号,是对客观事物的性质、状态及相互关系等进行记载的物理符号或这些物理符号的组合。A.数据B.字段C.记录D.大数据2.哪种不是数据采集器()A.Python爬虫 B.八爪鱼采集器C.火车头采集器D.后羿采集器3.某用户在使用支付宝绑定银行卡时,网站要求验证用户的真实姓名和身份证号码。这时要求采集的数据必须有()A.准确性 B.完整性C.一致性D.相关性4.以下哪些是非结构化数据()。A.班级分数统计表B.一篇文章C.一个HTML页面D.一个音频文件5.下列关于Python爬虫库的功能,描述不正确的是()。A.通用爬虫库-urllib3 B.通用爬虫库-RequestsC.爬虫框架-Scrapy D.HTML/XML解析器pycurl6.下列关于Chrome开发者工具描述错误的是()。A.元素面板可查看元素在页面的对应位置B.源代码面板可查看HTML源码C.网络面板无法查看HTML源码D.网络面板可查看HTTP头部信息7.下列关于BeautifulSoup中对象类型描述错误的是()。A.name方法可以获取及修改Tag对象名称B.attrs方法可获取Tag对象的HTML属性,返回值为列表形式C.string方法可获取Tag对象中的文本字符串内容D.NavigableString对象无法被编辑,但可以进行替换8.以下正则表达式哪个不能匹配字母、数字、下划线。()A.\w
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 感恩教育主题班会课件下载
- 2026生物制药行业创新技术分析及市场拓展投资评估规划报告
- 2026中国原材料进出口行业市场现状供求分析及行业发展趋势研究评估报告
- 2026乔布斯苹果公司产品创新行业市场现状及规划
- 2026汽配行业现状供需分析及投资发展方向研判报告
- 2026中国青少年体能训练防护装备适龄化设计指南
- 2026中国稀土永磁材料在风电领域应用拓展与供需预测报告
- 新版2026春苏教版二年级下册科学第2单元教案合集
- 2026中国医药保健品市场运营趋势研究及经济可行性及发展空间报告
- 2026中国物流行业市场供需情况分析及投资风险评估规划文件
- 服装公司售后管理制度
- GB/T 4948-2025铝合金牺牲阳极
- 备用电自投装置安装与调试-备自投安装接线
- 精神障碍病人的家庭护理
- 品管圈PDCA获奖案例-提高保护性约束使用的规范率医院品质管理成果汇报
- GB/T 44876-2024外科植入物骨科植入物的清洁度通用要求
- 高一物理必修一前三章试卷
- 股骨远端骨折-3
- 2024年陕西国防工业职业技术学院单招职业技能测试题库附答案
- 葡萄酒wset二级复习题及葡萄酒考试题-初级
- 《国有企业采购操作规范》【2023修订版】
评论
0/150
提交评论