版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
任务5.2浅尝数据爬虫信息技术基础“信息技术基础”课程组知识要点:大数据的基本概念、核心技术及产业融合发展5.2.1任务描述小王喜爱读书,经常去图书馆借书看,并且对新书非常感兴趣。有一天他突发奇想,可以通过什么方法快速获得图书馆的新书书目名单呢?需要用到什么技术呢?他需要系统地学习大数据的概念、数据分析、数据爬虫等知识,真正了解大数据,便可以用大数据爬虫技术将所需要的书目挖掘出来。5.2.1任务描述5.2.2任务分析任务5.2的思维导图如图所示。5.2.2任务分析5.2.3知识准备5.2.3知识准备01大数据03数据爬虫02大数据的核心技术大数据是指那些规模巨大到无法通过传统数据库软件工具,
在合理的时间内达到抓取、管理、处理并整合成能够帮助人们进行决策的资讯。这些数据集合通常具有极高的复杂度,包括结构化、半结构化和非结构化数据,且数据生成速度极快,要求处理系统具有高速的处理能力。1.大数据5.2.3知识准备(1)大数据的定义①Volume(大量):是指数据集的规模,即数据量的大小。大数据的数据量往往
超出传统数据库管理系统(DBMS)的处理能力,可能达到
PB
、EB甚至
ZB级别。5.2.3知识准备1.大数据(2)大数据的特征具体来说,大数据具有以下几个关键特征(这些特征通常被概括为“4V
”)。②Velocity(高速):是指数据生成和处理的速度。在大数据环境中,数据是实时生成的,需要被迅速处理和分析,以便在第一时间获得洞察和决策支持。③Variety(多样):是指数据类型的多样性。大数据不仅包括传统的结构化数据(如关系数据库中的表格数据),还包括半结构化数据(如
XML
、JSON等)和非结构
化数据(如文本、图像、视频、音频等)。5.2.3知识准备④Value(价值):尽管大数据具有海量和复杂等特性,但其真正价值在于通过高级分析技术从中提取的具有洞察力和智能化的高价值信息。这些信息可以为企业带来竞争优势、提高运营效率以及创造新的商业模式等。大数据采集是指从各种来源中收集、整合和存储大量数据的过程,该过程包括数据清洗、数据转换、数据加载等步骤,以确保数据的质量和准确性。采集的主要来源包括传感器、社交媒体、网站、移动设备、企业内部系统等。这些来源产生的数据类型包括结构化数据、半结构化数据和非结构化数据。采集还需要使用各种技术和工具,如数据挖掘、机器学习、自然语言处理、数据仓库等。同时,还需要考虑数据安全和隐私保护等问题,确保采集的数据符合相关法规和标准。2.大数据的核心技术5.2.3知识准备(1)大数据采集大数据预处理是指在进行数据分析之前,对采集到的原始数据所进行的一系列操作,其主要目的是提高数据质量,为后期分析工作奠定基础。预处理过程包括数据清洗、数据集成、数据转换和数据规约等步骤。大数据预处理是一个多步骤的过程,旨在确保数据质量、一致性和适用性,为后续的数据分析和建模提供可靠的基础。通过预处理,可以消除原始数据中的噪声、错误和不一致。大数据预处理还包括特征选择、数据集划分和数据可视化等步骤,这些步骤有助于进一步减少数据维度和冗余信息,划分出用于模型训练和评估的数据集,并通过可视化工具对数据进行探索性分析,发现数据之间的关系和规律。2.大数据的核心技术5.2.3知识准备(2)大数据预处理大数据存储主要关注如何有效、安全地保存和管理海量的、复杂多样的数据集合。这些数据集合可能包括结构化数据(如数据库中的表格)、半结构化数据(如XML、JSON等格式的数据)以及非结构化数据(如文本、图像、音频、视频等)。大数据存储具有高效存储大量数据、高度扩展性、高可靠性、高安全性等特点。大数据存储是确保大数据价值得以实现的基础,它要求存储解决方案不仅要有巨大的存储容量,还要有高效的数据处理能力和智能的数据管理功能。此外,大数据存储还需要考虑数据的安全性、隐私保护和合规性等问题。在存储数据时,需要采用加密、访问控制等手段保护数据安全;同时,还需要遵守相关的数据保护和隐私法规,确保数据的合法使用。2.大数据的核心技术5.2.3知识准备(3)大数据存储大数据挖掘是指从大规模数据集中发现有用信息的过程,它涉及对数据的清洗、整合、探索、建模和预测等步骤,以发现数据中的模式、关联、异常和趋势。大数据挖掘需要借助一些高级的算法和技术,如机器学习、数据挖掘、人工智能等,以处理海量、高维度和多样性的数据。大数据挖掘在商业、科学、医疗、金融等领域都有广泛的应用,可以帮助企业、组织和机构更好地理解数据、优化决策和创造价值。2.大数据的核心技术5.2.3知识准备(4)大数据分析挖掘数据爬虫是一种自动化程序,主要用于从互联网上收集并提取数据。它通过访问网站的源代码并解析HTML文档来实现数据的抓取和提取。这种技术可以在短时间内获取大量数据,并且可以自动化地处理这些数据。数据爬虫的工作原理可以简单地描述为模拟浏览器发送请求,下载网页代码,然后只提取有用的数据,并将其存放于数据库或文件中。如果把互联网比作一张大的蜘蛛网,那么计算机上的数据就是蜘蛛网上的猎物,而爬虫程序就是一只小蜘蛛,沿着蜘蛛网抓取自己想要的猎物(数据)。3.数据爬虫5.2.3知识准备①确定目标:明确需要爬取的数据类型、来源网站以及爬取的频率等。②发送请求:爬虫程序模拟浏览器向目标网站发送HTTP请求,获取网页的HTML代码。③解析网页:使用HTML解析器对获取的网页代码进行解析,提取出所需的数据。这通常涉及对 HTML标签、CSS选择器或XPath表达式的使用。④存储数据:将解析出的数据存储到本地文件、数据库或云存储等地方,以便后续分析和使用。⑤处理异常:在爬取过程中,爬虫需要能够处理各种异常情况,如网络错误、页面结构变化等。3.数据爬虫5.2.3知识准备数据爬虫的工作流程通常包括以下几个步骤。根据不同的目的和功能,数据爬虫可以分为多种类型。例如,聚焦网络爬虫是“面向特定主题需求”的一种爬虫程序;通用网络爬虫则是搜索引擎抓取系统的重要组成部分,其主要目的是将互联网上的网页下载到本地,形成一个互联网内容的镜像备份。5.2.3知识准备数据爬虫在许多领域都有广泛的应用,包括数据挖掘、网站监测、舆情分析等。例如,在电商行业中,数据爬虫可以用于抓取商品价格、销量等信息来进行竞品分析和市场调研;在社交媒体平台上,数据爬虫可以抓取用户数据来进行用户画像分析;此外,数据爬虫还可以实时监测网站的变化,以及快速获取各类社交媒体平台上的用户评论等信息,并进行情感分析。5.2.4任务实现郑州职业技术学院图书馆是郑州职业技术学院官网教辅机构板块的一部分,用户可以通过其检索书目,也能获得图书馆相关的最新信息。图书馆推出的新书推荐功能致力于为用户提供最新出版的书籍信息,帮助读者快速了解市面上的新书动态,也便于读者及时获取感兴趣的书籍。因此,对于喜欢读书的人来说,获取每月最新的书目并从中挑选自己喜欢的书很重要。以下将使用简单的爬虫技术实现对书目的获取(书名、作者名、封面),以便快速得到新书信息。5.2.4任务实现1.确定所要爬取的对象使用浏览器打开郑州职业技术学院官网,如图所示。5.2.4任务实现在主页中选择“教辅机构”→“图书馆”,进入如图
5-2-3所示的图书馆主页面,向下滚动页面找到要爬取的新书信息,如图
5-2-4所示,将使用
Python来对这些数据进行爬取。图
5-2-3郑州职业技术学院图书馆主页面图
5-2-4查看所要获取的新书信息5.2.4任务实现1.确定所要爬取的对象2.获取网页源代码①在图5-2-4的空白页面处右击,在弹出的快捷菜单中选择“检查”命令,如图5-2-5所示,查看网页源代码。图
5-2-5
查看网页源代码5.2.4任务实现2.获取网页源代码②通过查看源代码发现该网站是异步加载的网站,选“Network”→“Fatch/XHR”选项卡,然后单击网页左上角的按钮进行页面的刷新,得到如图5-2-6所示界面。图5-2-6查看Network中的内容5.2.4任务实现③通过查找发现,只有图5-2-7中才有要获取的内容,因此将位于Headers中的RequestURL和User-Agent内容获取到Python中(该网站每天都会更新,需要用到当天最新的RequestURL和User-Agent)。图
5-2-7 进入相应的页面5.2.4任务实现2.获取网页源代码④将参数
RequestURL和
User-Agent后面的内容复制到
Python
中,如图
5-2-8
所示。图5-2-8将信息复制到Python中5.2.4任务实现2.获取网页源代码⑤编写请求函数对网站发请求,以获取网页源码,如图
5-2-9所示。图5-2-9利用函数向网页发请求5.2.4任务实现2.获取网页源代码使用
Ctrl+F
组合键查看所获取的数据源码,其中含有很多“\
”,如图
5-2-10所示。图5-2-10初步获取的源码5.2.4任务实现2.获取网页源代码⑥利用
Python
命令去除数据里的“\
”,增加数据的可读性。
BeautifulSoup中的
lxml解析器是一个高效的
HTML和
XML
的解析器,下面将运用该解析器来解析内容,
如图
5-2-11所示。图
5-2-11使用
lxml解析内容5.2.4任务实现2.获取网页源代码3.编写解析函数①通过查看6本书的源代码发现,其共同具有的标签<liclass="clear"data-index="0">在第一本书中的data-index为0,依次增加到5,即6本书的信息都存在于这6个标签里。下面根据每个标签的独有特征从中依次获取图片、书名、作者名信息。以获取第
1本书为例,书写代码。②在第3行末的标签<liclass="clear"data-index="0">中发现图片在img标签中,因此可以通过其特殊值img-class="lazy"取到该标签,然后获取其内容。之后利用书名、作者名所在标签的特殊值来进行内容的获取,如图5-2-12所示。图
5-2-12查看第
1本书所在的位置5.2.4任务实现③利用for循环语句遍历6本书各自所在的标签,并在循环末尾调用保存函数,依次保存获取的信息。利用for循环语句遍历6本书各自所在的超链接,并获取相应的内容,于是将图5-2-13中代码放在循环里,并添加一些代码使输出的内容更加美观,如图5-2-14所示。图
5-2-13获取书本内容图
5-2-14编写完整的解析函数5.2.4任务实现3.编写解析函数将图片、作者名、书名保存在文件名为db.text、编码为utf-8的文件里。对图片发送二进制请求以后,创建名为BOOK的文件夹,每张图片以书名来命名,如图5-2-15所示。图5-2-15保存获取的内容5.2.4任务实现4.编写保存函数5.编写调用函数最后用
main
函数调用以上函数,即完成对本页图书信息的获取,如图
5-2-16
所示。图
5-2-16调用以上函数5.2.4任务实现6.展示爬虫数据程序运行结束后可以发现,目录里多了一个BOOK文件夹和一个名为db.text的文件,可以在计算机本地找到BOOK文件夹中的图片,如图5-2-17所示。图
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 初级内审师考试试题与答案
- 结构力学试题与答案全解析
- 2026年跨境电商选品AI多语种沟通
- ISO 6622-12021 内燃机 - 活塞环 - 第1部分铸铁制成的矩形环标准立项发展报告
- 生产退料考试题目及详细答案
- 2026年小学六年级语文第二学期期末考试卷及答案(共十六套)
- 2026年低压电工复审模拟考试题及答案题库
- 2026年10月自考《13683管理学原理(中级)》考前押题预测题和答案复习题
- 2025~2026特种作业煤矿安全作业考试题库及答案
- 河南青桐鸣2026届高三下学期学情调研(二)物理试卷+答案
- Q-SY 01074-2024 陆上节点地震数据采集质量控制规范
- 第四届福建省水产技术推广职业技能竞赛-水生物病害防治员备赛题库(含答案)
- 特种设备重大事故隐患判定准则
- 2024年北京人力资源市场工资指导价位
- 汕尾市市区教育设施布局专项规划(2018-2035年)
- 合伙人协议合同
- 太阳能平板式集热器
- (高清版)WST 227-2024 临床检验项目标准操作程序编写要求
- 形成性评价在消化内科住院医师规范化培训中的意义初探
- 《基因编辑CRISPR技术原理及应用课件》
- HSE管理体系文件
评论
0/150
提交评论